AI 학습 허브

로컬 AI 모듈 목차

Air-Gapped Engineering Standard
Air-Gapped Engineering Standard

로컬 AI 통합 마스터 포털 (Master Hub)

외부 유료 클라우드 의존성 0% · 100% 비(非)중국산 무검열(Uncensored) 오픈소스 모델 · 데스크톱부터 모바일, 임베디드 엣지 디바이스까지 아우르는 크로스 플랫폼 독립 생태계

본부(HQ): Windows 11 (RTX 3060 12GB / 64GB RAM)
엣지 확장: Android · Linux · Raspberry Pi · Arduino
LLM 엔진: Ollama & llama.cpp (GGUF 규격)
비주얼 허브: ComfyUI Portable (FLUX & LTX)
지식 증류: 선생(8B) → 모바일/엣지용 학생(1B~3B/TinyML)

🌐 데스크톱을 넘어 전 기기로: '진정한 완전 오프라인 AI 제국'의 확장

우리가 구축하는 AI 아키텍처는 고사양 윈도우 PC 한 대에 머무르지 않습니다. 내 책상의 RTX 3060 워크스테이션이 거대한 지식을 정제하고 경량화하는 'AI 파운드리(주조 공장)' 역할을 수행하고, 여기서 단련된 초경량 지능(GGUF / ONNX / TFLite)은 내 주머니 속 스마트폰(Android), 24시간 켜두는 서버(Linux), 거실 구석의 작은 미니 컴퓨터(Raspberry Pi), 심지어 1만 원짜리 센서 칩셋(Arduino / ESP32)까지 자유롭게 이식됩니다.

인터넷 회선이 완전히 차단된 비행기 안, 깊은 산속, 혹은 전파 방해 상황에서도 모든 디바이스가 각자의 자리에서 독립된 인공지능으로 살아 숨쉬는 크로스 플랫폼 배포 지도를 펼칩니다.

🖥️ Windows 11 (본부 HQ) AI 주조 공장 & 고화질 렌더링

12GB VRAM과 64GB RAM을 바탕으로 1,000페이지 문서를 파싱하고, QLoRA 지식 증류 학습을 거쳐 경량 GGUF를 생산하며 FLUX/LTX 비주얼을 총괄합니다.

🐧 Native Linux (서버/WSL2) 24/7 무중단 백본 & vLLM 서빙

오버헤드 없는 네이티브 CUDA 커널과 systemd 데몬을 통해 로컬 네트워크 전체에 지연 시간 0초의 초고속 REST API 엔드포인트를 상시 공급합니다.

📱 Android (모바일 엣지) 주머니 속 100% 오프라인 비서

비행기 탑승 모드에서도 Termux + llama.cpp 또는 MLC-LLM을 통해 1B~3B 학생 모델을 NPU/CPU로 초당 25토큰 이상 부드럽게 구동합니다.

🍓 Raspberry Pi 4/5 (SBC) 상시 대기 스마트홈 음성 두뇌

ARM NEON 가속 기반 llama.cppWhisper.cpp를 결합하여 소비전력 5W로 가족 구성원의 음성 명령을 로컬에서 실시간 판독·제어합니다.

⚡ Arduino / ESP32 (MCU) 극초저전력 TinyML 감각 신경

TensorFlow Lite Micro를 활용하여 밀리와트(mW) 전력으로 항시 음성 웨이크워드(호출어)와 센서 이상 징후를 감지해 상위 기기를 기동합니다.

Module 00

기본 개념 & 비유적 레이어 가이드

독립 AI 공장 비유로 풀어낸 4대 계층 구조와 오프라인 LLM, RAG, 증류학습, 엣지 이식 원리 등 11대 핵심 부품 완벽 해설.

  • 4대 레이어 비유 (인프라 → 기억 → 두뇌 → 창작)
  • 오프라인 LLM, 텍스트 추출기, 무검열 페르소나의 정의
  • RAG 오픈북 시험 비유 및 선생-학생 증류학습 메커니즘
  • 모바일/MCU 엣지 기기로의 양자화 가중치 다운사이징 원리
모듈 00 열기 →
Module 01

기반 인프라 & 무검열 모델

스마트 앱 컨트롤 해제, Defender 3대 폴더 예외, 가상환경 영구 보존 절대 수칙, 비중국산 무검열 모델 3단계 라인업.

  • Windows Defender 3대 폴더(workspace/env/comfy) 예외 등록
  • 가상환경 절대 수칙 (venv 최초 1회 생성 vs 매회 활성화)
  • 비(非)중국산 라인업 (Hermes-3, Codestral, StarCoder2)
  • CUDA 12.1 강제 재설치 및 torchao 0.7.0 버전 고정 패치
모듈 01 열기 →
Module 02

지식 처리 & RAG · 지식 증류

리눅스마스터 1급 기본서 3대 대상 선별 추출부터 IBM Docling 구조화 파싱, ChromaDB 하이브리드 RAG, QLoRA 증류.

  • 리눅스마스터 1급 기본서 3대 대상(필기/실기/이론) 선별 추출
  • IBM Docling 비전 파서 (2단 분리 및 TableFormer 표 복원)
  • ChromaDB + Nomic Embed + Cross-Encoder MiniLM RAG
  • Unsloth QLoRA 파인튜닝 & GGUF 변환 & Ollama/모바일 배포
모듈 02 열기 →
Module 03

멀티미디어 생성 서브시스템

CPU 단독 0.1초 음성 STT/TTS 파이프라인과 12GB VRAM 독점 FLUX GGUF 이미지 및 LTX-Video 동영상 워크플로.

  • Kokoro-82M ONNX(voices.bin) TTS & Faster-Whisper STT (CPU 전용)
  • ComfyUI Portable 설치 & 내장 환경(gguf, kornia 0.8.2) 패치
  • FLUX.1-dev Q4_0 GGUF 노드 연결 (CFG 1.0 고정 규칙)
  • LTX-Video 0.9.1 고해상도 DiT 비디오 생성 파이프라인
모듈 03 열기 →
Module 04

고급 비주얼 편집 & 툴 비교

내 사진/인물 반영 3대 기술, 인페인팅 마스킹 제어, 의상 소재 변환(시스루 제거 vs 완전 투명), SD WebUI 비교 분석.

  • 인물 반영 3대 방식 (Img2Img vs ReActor vs 전신 20장 LoRA)
  • 인페인팅 마스킹 요령 & VAEEncodeForInpaint 경계 확장
  • 시스루 제거(불투명 원단 교체) vs 완전 투명(클리어 비닐) 구현
  • SD WebUI vs ComfyUI 아키텍처 비교 및 모델 경로 공유
모듈 04 열기 →
Module 05

실전 장애 해결 런북 (16대 항목)

venv 재초기화 복구, docling 모듈 누락, GGUF magic invalid, kornia 패치, int1 에러 등 전 항목 1줄 즉각 해결 조치 매뉴얼.

  • venv 재실행 패키지 증발 복구 및 python 실행 표준
  • ComfyUI VAE 헤더 손상 및 404 GGUF 0바이트 파일 교체
  • LTX-Video kornia pad 임포트 실패 및 Kokoro voices 피클 에러
  • Ollama 400 Bad Request 상대경로 수정 및 SAC 차단 해제
모듈 05 열기 →
Module 06

통합 관제 대시보드 & 올인원 웹 UI

검은 터미널을 벗어나 브라우저에서 VRAM 12GB/RAM 64GB를 실시간 모니터링하고 모델 프로세스를 제어하는 웹 대시보드.

  • 실시간 하드웨어 텔레메트리 게이지 (VRAM, RAM, CPU)
  • Ollama / ComfyUI / Docling 워커 원클릭 시작·종료 컨트롤러
  • 실시간 시스템 이벤트 콘솔 로그 뷰어
  • FastAPI 기반 1초 구동 초경량 로컬 백엔드 서버 연동
모듈 06 열기 →

로컬 AI 하드웨어 사양 종합 가이드 (세대별·성능별 티어 분석)

로컬 AI 시스템 구축 시 가장 중요한 4대 핵심 컴포넌트(GPU, RAM, CPU, SSD)의 세대별 진화와 성능 티어를 분석합니다.

1. 4대 핵심 부품 세대별 / 성능별 티어 매트릭스

부품군 성능 티어 대표 세대 및 모델 예시 주요 기술 사양 로컬 AI 관점 핵심 역할 및 실전 영향
GPU (VRAM) 엔트리 RTX 2060 6GB / 3050 8GB GDDR6, 128~192bit 3B 경량 LLM 및 SD 1.5 저해상도 가능. FLUX 구동 불가.
스탠다드 RTX 3060 12GB / 4060 Ti 16GB GDDR6, 192bit (360 GB/s) 최고 가성비. 8B~14B LLM, Unsloth QLoRA, FLUX Q4_0, LTX 100% 포괄.
퍼포먼스 RTX 4070 Ti Super 16GB GDDR6X, 256bit 초당 50토큰 이상 추론 속도. 16GB VRAM으로 14B Q5 및 고화질 FLUX 네이티브 렌더링.
플래그십 RTX 3090 / 4090 24GB GDDR6X, 384bit 32B~70B 대형 LLM 양자화 구동 가능. 4K 영상 생성의 종착역.
RAM (시스템) 16GB DDR4-3200 ~25 GB/s 윈도우 + Ollama 7B 로드 시 스왑 발생. 1,000p 파싱 시 다운 위험.
32GB DDR4-3200 / DDR5-4800 ~50~76 GB/s RAG 벡터 DB, 수백 페이지 문서 파싱, 오디오 상시 대기 쾌적.
64GB+ DDR4-3200 64GB 50~96 GB/s 완벽한 무중단 환경. 1,000p 백그라운드 파싱 중에도 일상 업무 병행.
CPU 4~6코어 i5 8~10세대 / 라이젠 3000 AVX2 지원 Docling 표 복원 및 Whisper 전사 속도가 다소 느림.
6~8코어 i5 12~14세대 / 라이젠 5600~7700 AVX2, VNNI 균형 구성. Whisper 8스레드 할당 시 1시간 음성을 1~2분 만에 전사 완료.
멀티코어 i7/i9 14세대 / 라이젠 7900X+ AVX-512, AMX CPU 단독 LLM 추론도 초당 15토큰 달성.
SSD SATA3 2.5인치 SATA SSD ~550 MB/s 10GB 모델 로드에 20초 소요.
PCIe 4.0 M.2 NVMe (1TB~2TB) 3,500~7,000 MB/s 표준 권장. 10GB 가중치를 1.5초 만에 VRAM/RAM으로 직렬 적재.
PCIe 5.0 PCIe 5.0 M.2 NVMe 10,000+ MB/s 70B 가중치 오프로딩 속도 극대화.

2. 실전 운용 목적별 권장 사양 프리셋

구분 최소 진입 (Budget) 표준 실무 (Sweet Spot) 하이엔드 (Pro Lab)
타겟 워크로드 3B 경량 챗봇, SD 1.5 8B~14B LLM, 1,000p Docling RAG, FLUX GGUF, LTX 비디오 32B~70B LLM 상시 서빙, 실시간 멀티모달
GPU RTX 3050 8GB NVIDIA RTX 3060 12GB RTX 4090 24GB 또는 Dual 3090
시스템 RAM 16GB DDR4 64GB DDR4 / DDR5 128GB DDR5 ECC
CPU i5 10세대 (6코어) i5 12~14세대 / 라이젠 5600X+ i9 14900K / 라이젠 7950X
스토리지 500GB SSD 1TB~2TB PCIe 4.0 NVMe 4TB PCIe 4.0 NVMe + NAS
파워 500W~600W 650W~750W 80PLUS 1000W~1300W 80PLUS
💡 RTX 3060 12GB + 64GB RAM 조합이 스위트스팟인 이유

RTX 4060 8GB는 버스가 128-bit로 축소되어 대형 모델 로드 시 OOM이 빈발합니다. 반면 RTX 3060 12GB는 192-bit 버스와 12GB VRAM으로 FLUX Q4_0 GGUF(6.8GB)와 LTX-Video(5.5GB)를 무리 없이 구동합니다. 여기에 64GB RAM이 결합되면 VRAM 한계 초과 시 시스템 메모리로 안전하게 오프로딩됩니다.

하드웨어 자원 분배 원칙 (12GB VRAM OOM 원천 방지)

구분 64GB 시스템 RAM (CPU 연산) 12GB GPU VRAM (CUDA 연산)
작동 모드 상시 대기 / 무제한 동시 적재 단일 프로세스 독점 / 배타적 실행
배치 역할 • IBM Docling 문서 파싱 & 표 복원
• Nomic Embed & ChromaDB 영구 벡터 DB
• Cross-Encoder MiniLM 리랭커
• Faster-Whisper 음성 전사 (CPU 8스레드)
• Kokoro-82M 음성 합성 (CPU 단독 0.1초)
• 20B 이상 대형 LLM 계층 오프로딩
작업 A: 메인 LLM 추론 (Hermes-3-8B, ~5.5GB)
작업 B: 지식 증류 학습 (Unsloth QLoRA, ~6.5GB)
작업 C: 고화질 이미지 렌더링 (FLUX GGUF, ~10GB)
작업 D: 고해상도 비디오 생성 (LTX-Video, ~10.5GB)
⚠️ 자원 관리 2대 핵심 수칙
  1. 작업 전환 전 VRAM 즉각 반환: ComfyUI를 켜거나 학습을 시작하기 전, 터미널에서 ollama stop hermes3:8b 또는 ollama stop student를 실행하여 VRAM을 반환합니다.
  2. 가상환경 재초기화 금지: py -3.10 -m venv ai_env최초 1회만 실행하며, 일상 구동 시에는 .\ai_env\Scripts\activate만 실행합니다.

기기별(Cross-Platform) 엣지 배포 엔지니어링 표준 규격

타겟 플랫폼 권장 하드웨어 실행 엔진 권장 모델 규격 핵심 구동 명령어 / 프로토콜
Windows 11 (HQ) RTX 3060 12GB + 64GB RAM Ollama, ComfyUI, PyTorch Hermes-3 8B, FLUX GGUF, LTX ollama run hermes3:8b
Linux (Server/WSL) Ubuntu 22.04+, CUDA / CPU Ollama, vLLM, Docker Codestral 22B, Hermes-3 8B curl -fsSL https://ollama.com/install.sh | sh
Android Snapdragon 8 Gen 2+, 8GB+ RAM Termux (llama.cpp) / MLC-LLM Llama-3.2-1B/3B (Q4_K_M GGUF) ./llama-cli -m model.gguf -p "질의" -n 256
Raspberry Pi Raspberry Pi 5 (8GB RAM) llama.cpp (ARM NEON) / Ollama 증류 학생 모델 3B, SmolLM 1.7B ./llama-server -m student.gguf --port 8080 -c 2048
Arduino / ESP32 ESP32-S3 (8MB PSRAM) TensorFlow Lite Micro Wake-word STT, Anomaly Detection C++ 펌웨어 플래싱 (I2S 마이크 직접 연동)

작업 시작 퀵 루틴 (Daily Routine) & 원클릭 진단

컴퓨터를 켜고 AI 작업 환경에 진입할 때 실행하는 2줄 표준 루틴입니다.

Set-Location "C:\ai_workspace"
.\ai_env\Scripts\activate

시스템 무결성 점검 스크립트 (가상환경 진입 상태에서 실행):

python -c "import torch; print('GPU:', torch.cuda.get_device_name(0), '| VRAM:', round(torch.cuda.get_device_properties(0).total_memory / (1024**3), 2), 'GB'); import docling; print('IBM Docling: 정상'); import chromadb; print('ChromaDB: 정상')"