AI 학습 허브

로컬 AI 모듈 목차

Air-Gapped Engineering Standard
Module 00

로컬 AI 아키텍처 기초 & 비유적 개념 가이드

Windows 11 초기 환경 구축의 필연적 이유부터 도구 5총사 비유, 터미널 구분 원리, 가상환경 격리 메커니즘 및 11대 핵심 부품 분해

1. 초기 셋업 시각화: 왜 C드라이브 루트(`C:\ai_workspace`)에 짓는가?

대부분의 초보자가 겪는 AI 설치 오류의 90%는 코드가 틀려서가 아니라, Windows 파일 시스템의 고질적 한계(공백, 한글 경로, 260자 길이 제한)를 건드려 발생합니다.

[ 나쁜 예: 전형적인 윈도우 기본 경로 ]
C:\Users\홍길동\OneDrive - MyCompany\바탕 화면\새 폴더 (2)\my_ai_project\...
  ▲         ▲                     ▲            ▲
  한글 경로  띄어쓰기 공백         특수문자     경로 길이 260자 초과 (Path Too Long)
  ==> C++ 빌더, 파이토치 C-커널, CUDA 컴파일러가 파일 경로를 인식하지 못하고 즉각 크래시!

[ 올바른 예: 엔지니어링 표준 루트 레이아웃 ]
C:\ai_workspace\
  ├── ai_env\               <-- [클린룸] 독립된 파이썬 가상환경
  ├── chroma_db\            <-- [서고] 벡터 데이터베이스 영구 저장소
  ├── dataset\              <-- [원자재] 리눅스마스터 마크다운 및 QA 데이터
  └── models\               <-- [완제품] 증류된 학생 GGUF 모델 보관함
  ==> 공백 0개, 한글 0자, 최단 경로 보장으로 어떤 AI 컴파일러도 오류 없이 100% 직통 적재!
🏗️ 부지 선정 비유: 대형 트럭(AI 모델)이 통행할 '초광역 고속도로' 닦기

10GB가 넘는 대형 AI 모델 파일과 수만 줄의 C++ 기계어 라이브러리는 수십 톤짜리 '초대형 트럭'과 같습니다. 구불구불하고 좁은 골목길(C:\Users\사용자명\AppData...)로 트럭을 몰고 들어가면 길목에 걸려 차가 전복되지만, C드라이브 바로 아래에 C:\ai_workspace라는 8차선 고속도로를 닦아두면 어떤 거대 가중치 파일도 나노초 단위로 막힘없이 통과합니다.

기초 셋업 도구 5총사의 역할과 포지션 비유

01. Python 3.10 (파이썬)

💡 비유: 공장의 현장 총괄 감독관

엔지니어(사용자)가 내린 지시를 이해하고, 메모리와 GPU, 각종 파일 도구들에 작업을 지시하는 공용 업무 언어입니다. 3.10 버전은 최신 AI 라이브러리들과 C++ 확장 모듈이 가장 안정적으로 호환되는 표준 규격입니다.

역할: 전체 AI 파이프라인 제어 및 스크립트 오케스트레이션

02. Git for Windows (깃)

💡 비유: 글로벌 부품 조달용 크레인 & 타임머신

전 세계 오픈소스 공방(GitHub)에 올라온 최신 AI 설계도(ComfyUI 노드, Docling 소스)를 단 한 줄의 명령어로 내 컴퓨터에 복사해 오고, 코드가 꼬였을 때 과거의 멀쩡한 상태로 되돌려줍니다.

역할: 오픈소스 커스텀 노드 클론 및 버전 동기화

03. MSVC C++ 런타임 (C++ 빌드 툴)

💡 비유: 고속 부품을 깎아내는 정밀 선반·밀링 기계

파이썬은 사람이 쓰기 편하지만 연산 속도가 느립니다. 4-bit 양자화(bitsandbytes)나 오디오 전사(faster-whisper)처럼 극도로 빠른 처리가 필요한 핵심 부품을 윈도우 상에서 네이티브 기계어로 직접 깎아내어 결합해 주는 필수 가공소입니다.

역할: C++ 확장 가속 DLL 컴파일 및 런타임 바인딩

04. NVIDIA CUDA Toolkit & Driver

💡 비유: GPU 3,584개 코어로 통하는 초고압 직류 전력망

CPU의 지시를 RTX 3060 그래픽카드의 3,584개 쿠다 코어가 동시에 이해할 수 있는 전기 신호(텐서 행렬 연산)로 변환해 주는 전용 신경망 고속도로입니다. 이게 없으면 GPU는 1초에 단 한 글자도 계산하지 못합니다.

역할: 텐서 코어 병렬 연산 가속 및 VRAM 직접 입출력

05. Ollama / Alpaca / llama.cpp

💡 비유: 가공된 가중치 원석을 돌리는 V12 트윈터보 엔진

Hugging Face에서 다운로드한 수 기가바이트의 거대한 숫자 덩어리(GGUF 가중치)를 메모리에 올리고, 사용자 질문을 집어넣으면 초당 80토큰의 문장으로 폭풍처럼 뿜어내 주는 완성형 연소 기관입니다.

역할: 무검열 LLM 가중치 로드, 양자화 연산 및 REST API 서빙

2. 환경 격리의 핵심: PowerShell vs CMD 구분 이유 & 가상환경(venv) 클린룸

[1] PowerShell vs CMD(명령 프롬프트): 도대체 왜 구분해서 써야 하는가?

비교 항목 CMD (명령 프롬프트 - 구형 수동 타자기) PowerShell (현대적 디지털 제어 콘솔 - 권장)
역사 및 본질 1980년대 MS-DOS 기반의 단순 텍스트 쉘 .NET 프레임워크 기반의 강력한 객체 지향(Object) 자동화 쉘
데이터 전달 방식 단순 텍스트 스트림 (글자가 줄바꿈되면 파싱 깨짐) 구조화된 객체(Object)로 데이터 전달 (속성, 배열 완벽 보존)
보안 및 권한 제어 권한 우회 취약, 정밀한 실행 보안 제어 불가 ExecutionPolicy 기반의 정밀 서명 및 차단 제어 가능
최신 네트워크/다운로드 curl이나 웹 다운로드 시 진행률 제어 및 SSL 예외 처리 번거로움 Invoke-WebRequest, Start-Process 등 무인 자동화 기본 탑재
로컬 AI 파이프라인 규칙 일부 레거시 .bat 파일 실행 시에만 제한적 사용 기본 셋팅, Defender 예외, 가상환경 구동의 100% 표준 쉘

[2] 굳이 귀찮게 가상환경(`venv`)을 만들어서 구동하는 이유

☣️ '의존성 지옥(Dependency Hell)'과 윈도우 오염 방지 비유

가상환경 없이 윈도우 전역에 pip install을 마구 때려 넣는 것은, 수술실, 페인트 공장, 화학 실험실을 거실 한가운데에 한꺼번에 차려놓고 섞어 쓰는 것과 같습니다.

  • 충돌의 참사: 언어 모델 A는 torch==2.5.1을 요구하는데, 비주얼 모델 B는 구버전 torch==2.1.2가 아니면 죽는 상황이 발생합니다. 전역에 설치하면 한쪽을 깔 때 다른 쪽이 박살 나며 영구 불능 상태가 됩니다.
  • 격리 클린룸(Cleanroom): ai_env라는 완전히 밀폐된 유리 실험실을 짓고 그 안에서만 약품을 섞습니다. 실험실 내부가 아무리 엉망이 되어도 윈도우 본체 OS 시스템이나 다른 프로그램에는 단 1%의 영향도 주지 않습니다.
  • 원클릭 폐기 및 재생성: 만약 패키지가 꼬이면? 윈도우를 포맷할 필요 없이 ai_env 폴더만 휴지통에 버리고 30초 만에 새 클린룸을 만들면 끝납니다.

3. 전체 아키텍처 비유: 나만의 '독립 자동화 AI 연구소' (4대 계층)

우리가 구축하는 환경은 외부 클라우드 기업에 종속된 회선을 빌려 쓰는 것이 아니라, 내 컴퓨터 안에서 전력 발전(인프라), 부품 창고(메모리), 수석 연구원(LLM), 설계실(비주얼 툴)을 완벽하게 자체 구동하는 독립 공장입니다.

Layer 01. 하드웨어 인프라 & 전력 공급 레이어 (The Foundation) 공장 부지 & 정밀 조립대

12GB VRAM (GPU): 초고속 로봇 팔이 물건을 즉시 가공하는 '정밀 작업대'. 작업 속도는 나노초 단위로 빠르지만 공간이 한정되어 있어, 한 번에 하나의 대형 프로젝트(LLM 추론, 이미지 렌더링, QLoRA 학습 중 택 1)만 올려야 충돌(OOM)이 발생하지 않습니다.
64GB 시스템 RAM (CPU): 수백 권의 책과 부품을 상시 보관하는 '초대형 자재 창고'. 24시간 가동되며 VRAM 부족분을 든든하게 받쳐주고, 문서 파싱과 오디오 연산을 상시 분담합니다.

Layer 02. 지식 추출 & 기억(Memory) 레이어 (The Knowledge Vault) 고문서 복원가 & 도서관 색인 카드

방대한 1,000페이지 분량의 리눅스 교재에서 글자, 2단 지문, 도표, 쉘 명령어를 해체 및 복원(Docling)하고, 이를 컴퓨터가 이해하는 다차원 좌표(Nomic Embed 벡터)로 변환하여 영구 서고(ChromaDB)에 번호표를 붙여 체계적으로 저장합니다.

Layer 03. 지능(Brain) & 사고(Reasoning) 레이어 (The Core Intelligence) 수석 기술고문 & 특화 수제자

서고에서 찾아낸 책 내용을 읽고 도덕적 훈계나 거절 없이 정밀한 엔지니어링 정답을 도출하는 두뇌(Ollama Hermes-3). 거대한 두뇌를 가진 교수님(8B~22B)의 깊은 사고 지식을 민첩한 학생(3B)에게 1:1로 전수하여, 2.5GB VRAM만 쓰면서도 초당 80토큰으로 즉시 답을 내놓도록 훈련(지식 증류)합니다.

Layer 04. 표현(Expression) & 창작 레이어 (The Creative Studio) 전속 포토그래퍼, 영화감독, 전문 성우

글자로 된 지식을 현실 세계의 매체로 변환하는 표현부입니다. 고해상도 이미지(FLUX GGUF), 부드러운 25fps 동영상(LTX-Video), 0.1초 만에 발화하는 사람 목소리(Kokoro TTS)와 정확한 귀(Whisper STT)를 통해 사용자와 멀티모달 상호작용을 완성합니다.

4. 11대 핵심 부품(Component) 완벽 분해 및 역할

각 부품의 기술적 본질과 일상 비유, 실제 구동되는 오픈소스 도구를 1:1로 매핑한 해설입니다.

01. 오프라인 LLM (Offline LLM)

💡 비유: 인터넷 선이 끊겨도 작동하는 천재 연구원

외부 서버에 질의를 전송하지 않고 내 컴퓨터의 그래픽카드와 CPU만으로 100% 독립 구동되는 거대언어모델. 사내 기밀, 개인 데이터의 외부 유출이 물리적으로 원천 차단됩니다.

구현 도구: Ollama for Windows (Hermes-3, Llama-3.2, Codestral)

02. 텍스트 추출기 (Text Extractor)

💡 비유: 돋보기와 자를 든 고문서 복원가

수험서 특유의 좌/우 2단 배치, 복잡한 명령어 옵션 표, 터미널 블록을 단순 텍스트 긁어오기가 아니라 원본의 공간적 의미를 살려 깔끔한 마크다운(.md) 구조로 재건축합니다.

구현 도구: IBM Docling (DocLayNet + TableFormer 신경망)

03. 오프라인 채팅 페르소나 (Persona)

💡 비유: 도덕적 설교 없이 지시를 완수하는 직속 보좌관

"위험할 수 있으니 알려줄 수 없습니다"라는 식의 가드레일 간섭 없이, 사용자가 부여한 정체성(시스템 프롬프트)에 따라 순수 엔지니어링 팩트와 침투 진단 코드를 즉각 도출합니다.

구현 도구: Hermes-3-8B (Uncensored / Abliterated Weights)

04. RAG 구현 (검색 증강 생성)

💡 비유: 시험장에 두꺼운 전공 기본서를 들고 들어가는 오픈북 시험

AI가 모르는 최신 리눅스 기출문제나 사내 매뉴얼을 벡터 DB에 넣어두고, 질문이 들어왔을 때 가장 연관성이 높은 단락 3개를 찾아 LLM의 프롬프트 앞에 붙여 읽게 한 뒤 답변시키는 기법입니다.

구현 도구: ChromaDB + Nomic Embed + Cross-Encoder MiniLM Reranker

05. 나만의 증류학습(Distillation) 모델

💡 비유: 명의(선생)의 비법 노트를 물려받은 초고속 수제자

무겁고 느린 대형 모델이 깊이 생각해서 작성한 고밀도 QA 데이터를 수집한 뒤, 3B 크기의 초경량 모델에 집중 주입(QLoRA)하여 VRAM은 2.5GB만 쓰면서 똑똑하게 작동하도록 가공합니다.

구현 도구: Unsloth QLoRA → llama.cpp GGUF → Ollama 배포

06. 필수 지식 오프라인 데이터셋

💡 비유: 연구소 금고에 보관된 최상급 백과사전 원본

리눅스마스터 1급 기본서의 기출 필기, 실기, 이론처럼 엄격히 검증된 도메인 텍스트. AI가 사실과 다른 그럴듯한 거짓말(할루시네이션)을 하지 못하도록 붙잡아주는 앵커 역할을 합니다.

구현 도구: dataset/linux_master_extracted.md (순수 마크다운)

07. 이미지 생성 (Image Generation)

💡 비유: 말 한마디로 사진을 찍어내는 전속 포토그래퍼

순수 노이즈 상태에서 텍스트 프롬프트의 지시를 따라 한 단계씩 잡음을 깎아내며 고화질 실사 이미지를 현상합니다. FLUX는 정교한 영문 텍스트 타이포그래피까지 완벽히 그려냅니다.

구현 도구: FLUX.1-dev Q4_0 GGUF (CFG 1.0 규칙 엄수)

08. 이미지 인물 검색 및 반영 (Face & Person)

💡 비유: 인물의 뼈대와 이목구비를 1초 만에 식별하는 생체 스캐너

내 사진의 얼굴 이목구비 랜드마크를 추출해 생성된 가상 신체에 1:1로 이식(ReActor)하거나, 20장의 다각도 사진을 학습시켜 체형, 얼굴, 옆모습 전체를 360도 완벽 복제(LoRA)합니다.

구현 도구: InsightFace (ReActor) & 전신 20장 LoRA 파인튜닝

09. 오디오 생성 및 음성 인식 (STT & TTS)

💡 비유: AI 연구원의 '귀(Ear)'와 '입(Mouth)'

STT (듣기): 내가 말한 음성이나 강의 파일을 텍스트로 즉시 전사.
TTS (말하기): AI가 출력한 텍스트 답변을 0.1초 만에 원어민 발음의 자연스러운 사람 음성으로 낭독.

구현 도구: Faster-Whisper large-v3-turbo (귀) & Kokoro-82M ONNX (입)

10. 동영상 생성 (Video Generation)

💡 비유: 정지된 사진에 시간과 카메라 앵글을 부여하는 영사기

정지된 1장의 이미지나 텍스트 묘사로부터 프레임 간의 물리적 연속성과 카메라 무빙(Pan, Zoom)을 계산하여 부드러운 25fps 고해상도 영상 클립(약 2.6초)을 렌더링합니다.

구현 도구: LTX-Video 0.9.1 (DiT 트랜스포머 아키텍처)

11. 멀티모달 구현 (Multimodal Pipeline)

💡 비유: 시각, 청각, 뇌가 신경망으로 이어진 유기체

단일 텍스트 작업을 넘어, 이미지를 보고 구조를 파악하고, 말소리를 듣고 정답을 생각하며, 그 결과를 다시 새로운 이미지나 음성으로 뱉어내는 크로스-미디어 통합 지능망입니다.

구현 도구: Docling(시각) → Hermes-3(두뇌) → Kokoro(청각) → ComfyUI(표현)

5. 오프라인 요새 인트라넷 비유 (성벽, 관문, 금고, 지하 비밀통로)

완전 분리 독립형 인트라넷의 네트워크 보안 메커니즘을 중세 난공불락의 요새로 비유하여 직관적으로 풀어냅니다.

01. 하드웨어 방화벽 (OPNsense / pfSense)

💡 비유: 외부 통신을 100% 차단하는 거대한 철통 성벽

WAN 외부로 나가는 모든 문을 굳게 닫고(Outbound ALL DROP), 성 내부에서 허가받지 않은 어떤 전파나 비둘기(텔레메트리/비인가 패킷)도 성 밖으로 날아가지 못하게 완벽 통제합니다.

02. DMZ 완충 검역소 (Quarantine DMZ)

💡 비유: 외부 보급품의 독극물을 검사하는 성문 앞 검문소

외부 USB나 반입 파일이 내부 핵심 기밀 구역으로 들어오기 전, 격리된 공간에서 PickleScan과 백신으로 악성 페이로드 유무를 현미경 검사하여 안전이 입증된 것만 통과시킵니다.

03. TrueNAS ZFS 보안 스토리지

💡 비유: 지하 암반에 구축된 무적의 왕실 보물 금고

화재나 디스크 고장이 발생해도 데이터가 유실되지 않도록 ZFS RAID-Z2 미러링으로 보호되며, AI 연산 호스트 외에는 그 어떤 사용자 단말도 함부로 손댈 수 없도록 접근이 엄격히 통제됩니다.

04. WireGuard VPN 암호화 터널

💡 비유: 아군만 통행하는 암호화된 비밀 지하통로

노트북이나 스마트폰이 성 내부의 AI 서버에 접속할 때, 사전에 교환된 비밀 열쇠(mTLS 키)를 가진 아군만 통과할 수 있는 강력한 암호화 터널을 뚫어 내부 도청을 원천 차단합니다.

6. 하드웨어 자원과 소프트웨어 컴포넌트 1:1 배치 매트릭스

64GB 시스템 메모리와 12GB VRAM을 효율적으로 나누어 OOM을 원천 차단하는 물리적 매핑 규칙입니다.

부품 명칭 실행 주체 점유 자원 동시 실행 가능 여부
Docling 텍스트 추출기 CPU (멀티스레드) 시스템 RAM ~4GB / VRAM 0MB 상시 백그라운드 구동 가능
ChromaDB & 임베딩/리랭커 CPU (int8/fp32) 시스템 RAM ~2GB / VRAM 0MB 상시 대기 가능
Faster-Whisper STT & Kokoro TTS CPU (8 스레드 / ONNX) 시스템 RAM ~3.5GB / VRAM 0MB 상시 호출 가능
Ollama 메인 LLM (Hermes-3 8B) CUDA GPU VRAM ~5.5GB 단독 실행 권장 (대기 1분 후 자동 반환)
Unsloth QLoRA 학생 모델 학습 CUDA GPU VRAM ~6.5GB (12GB 내 안전) 배타적 독점 실행 (LLM/ComfyUI 종료 필수)
ComfyUI FLUX.1-dev Q4_0 GGUF CUDA GPU (lowvram) VRAM ~10GB / RAM ~16GB 오프로드 배타적 독점 실행 (Ollama 언로드 필수)
ComfyUI LTX-Video 0.9.1 CUDA GPU (lowvram) VRAM ~10.5GB 배타적 독점 실행 (Ollama 언로드 필수)