강의 자료 PDF를 학습시켜, 질문에 답하는 로컬 AI 챗봇을 만든 파인튜닝 프로젝트
Hugging Face(재료) → Unsloth(학습) → Ollama(실행) 구조로 이어집니다.
| 도구 | 역할 | 선택 이유 |
|---|---|---|
| Unsloth | LoRA 파인튜닝 엔진 | 8GB급 GPU에서도 빠르고 가볍게 학습 가능하도록 최적화 |
| Hugging Face | base 모델 저장소 | 오픈소스 사전학습 모델(Llama-3.2)을 무료로 제공 |
| bitsandbytes | 4bit 양자화 | 3B 모델을 8GB VRAM 안에 압축해서 로드 |
| PyMuPDF | PDF 텍스트 추출 | 한글 PDF 파싱이 안정적이고 속도가 빠름 |
| Ollama | 로컬 LLM 실행/서빙 | 데이터 자동생성 + 최종 모델 서빙까지 하나로 처리 |
| Gradio | 웹 채팅 UI | 몇 줄만으로 ChatGPT 스타일 대화 화면 제작 |
| 모델 | 출처 | 역할 |
|---|---|---|
| Qwen2.5:7b알리바바 · Ollama | Ollama Hub | PDF 원문을 읽고 Q&A 347개로 재작성해준 데이터 가공용 보조 모델 |
| Llama-3.2-3B-Instruct메타(Meta) · 4bit | Hugging Face | 실제로 파인튜닝한 진짜 본체. 원래 유니티를 전혀 모르던 범용 모델 |
| unity-tutor최종 결과물 | 로컬 제작 | Llama-3.2-3B에 유니티 지식을 학습시켜 완성한 모델 |
Loss 변화 (3.66 → 1.2대)
Unsloth 설치 후 GPU가 인식되지 않음 (CUDA available: False)
자동 설치된 PyTorch가 CUDA 13.0용인데, 당시 드라이버는 CUDA 12.5까지만 지원
PyTorch 버전을 낮추자 이번엔 다른 라이브러리(xformers)가 최신 버전을 요구하며 재충돌
버전을 억지로 맞추는 대신 GPU 드라이버 자체를 최신으로 업데이트 → 근본 해결
지금은 ollama run, 파이썬 import ollama, Gradio 웹 채팅창까지 세 가지 방법으로 사용 가능합니다.