[기술검토] 로컬 LLM 도입 — Ollama 및 모델(Qwen3 14B) 선정
Mac mini(M4, 24GB)에 로컬 LLM을 올려 단순 AI 작업을 무료 처리하는 방안 검토. 런타임 Ollama·모델 Qwen3 14B 선정 이유, 후보 비교, Claude 자동 폴백 구조를 비전공자도 이해할 수 있게 정리.
[기술검토] 로컬 LLM 도입 — Ollama 및 모델 선정
Mac mini(M4, 24GB) 한 대에 로컬 LLM을 올려, 자체 구축 멀티에이전트 하네스(이하 "AI 개발 파이프라인")의 단순·반복 AI 작업을 무료로 처리하는 방안을 검토했습니다. 결론: 런타임은 Ollama, 모델은 Qwen3 14B(예비 EXAONE 3.5 7.8B), 실패 시 Claude 자동 폴백.
1. 한 줄 요약
Mac mini(M4, 24GB) 한 대에 "우리만 쓰는 작은 AI"를 설치해서, 파이프라인의 단순·반복적인 AI 작업을 무료로 처리하고, 유료 Claude API 비용을 줄인다.
- 실행 프로그램(런타임): Ollama 선정
- AI 모델: Qwen3 14B (1순위) / EXAONE 3.5 7.8B (예비)
- 첫 적용 대상: Meeting-to-Spec (회의록 → 업무 항목 자동 추출)
- 안전장치: 로컬 AI가 실패하면 자동으로 기존 Claude로 전환 (사용자는 차이를 못 느낌)
2. 배경 — 왜 이걸 하나요?
AI 개발 파이프라인은 여러 곳에서 AI를 사용합니다. 예를 들어:
- 회의록을 주면 → 업무 항목 목록을 뽑아주는 기능 (Meeting-to-Spec)
- 업무 내용을 보고 → 분류 태그를 붙여주는 기능 (업무 자동 분류)
- 폼 내용을 자동으로 채워주는 기능 (AI Form)
지금은 이 모든 작업을 Claude(유료 클라우드 AI) 가 처리합니다. 그런데 잘 보면 이 작업들은 "긴 글을 읽고 → 정해진 형식으로 정리"하는 단순 작업이라, 최고급 AI까지는 필요 없습니다.
💡 비유하자면 — 간단한 동네 심부름까지 매번 퀵서비스(유료)를 부르는 상황입니다. 사무실에 자전거(로컬 AI) 한 대를 두면, 가까운 심부름은 공짜로 해결됩니다. 멀고 어려운 배달만 퀵서비스를 부르면 됩니다.
기대 효과
| 항목 | 내용 |
|---|---|
| 비용 | 단순 AI 작업의 API 호출 비용 → 0원 (전기료만 발생) |
| 보안 | 회의록 등 내부 데이터가 외부로 나가지 않음 (내부 장비 안에서만 처리) |
| 독립성 | 외부 AI 서비스 장애·요금 정책 변경에 덜 휘둘림 |
3. 장비 — Mac mini (M4, 24GB) 로 가능한가?
| 사양 | 값 | 의미 |
|---|---|---|
| 칩 | Apple M4 | AI 계산에 강한 최신 애플 칩 (GPU + 뉴럴엔진 내장) |
| 메모리 | 24GB | AI 모델을 "올려놓는 책상"의 크기. 클수록 큰 모델 가능 |
| 특징 | 통합 메모리 | 일반 PC와 달리 CPU/GPU가 메모리를 함께 써서 AI 실행에 유리 |
결론: 가능합니다. 단, 24GB라는 책상 위에 ① AI 모델 ② 파이프라인 서비스(Docker)가 같이 올라가야 하므로, AI 모델은 약 10GB 안팎의 "중간 크기"가 적당합니다. 이 제약이 아래 모델 선정의 핵심 기준이 됩니다.
4. 로컬 LLM이란? (쉬운 설명)
- LLM = ChatGPT나 Claude 같은 "글을 읽고 쓰는 AI"의 정식 명칭 (대규모 언어 모델)
- 로컬 LLM = 그 AI를 인터넷 너머 회사 서버가 아니라 내 컴퓨터에 직접 설치해서 쓰는 것
| 클라우드 AI (Claude 등) | 로컬 AI (이번 도입) | |
|---|---|---|
| 위치 | 외국 회사 서버 | 사무실 Mac mini |
| 비용 | 쓸 때마다 과금 | 무료 (장비는 이미 있음) |
| 성능 | 매우 똑똑함 | 적당히 똑똑함 (단순 작업엔 충분) |
| 데이터 | 외부 전송 필요 | 외부로 안 나감 |
| 인터넷 | 필수 | 불필요 |
핵심 전략은 "적재적소" 입니다. 어려운 일은 계속 Claude가, 쉬운 반복 작업은 로컬 AI가 맡습니다.
5. 실행 프로그램(런타임) 비교 — 왜 Ollama인가?
AI 모델은 파일 덩어리일 뿐이라, 그것을 실행해 주는 프로그램이 필요합니다. (음악 파일에 음악 플레이어가 필요한 것과 같습니다.) 후보는 4가지였습니다.
| 후보 | 한 줄 평 | 장점 | 단점 | 판정 |
|---|---|---|---|---|
| Ollama | "AI계의 앱스토어" | 설치·모델 받기·실행이 명령어 한 줄. 서버 기능 내장. 무료·오픈소스 | 미세 튜닝 옵션은 적은 편 | ✅ 선정 |
| LM Studio | 예쁜 GUI 데스크톱 앱 | 마우스 클릭으로 조작, 초보자 친화 | 사람이 화면을 봐야 하는 앱 — 서버에서 24시간 자동 운영엔 부적합 | ❌ |
| llama.cpp | 모든 것의 원조 엔진 | 가장 가볍고 세밀한 제어 가능 | 컴파일·옵션 등 전문가용. 운영 부담 큼 | ❌ |
| vLLM | 대규모 서비스용 | 동시 사용자 수백 명 처리 | NVIDIA GPU 서버용 — Mac에선 제 성능이 안 나옴. 이 규모엔 과함 | ❌ |
Ollama를 선택한 이유 (상세)
- 압도적으로 쉬움 — 설치부터 실행까지 딱 세 줄:
brew install ollama # 설치 brew services start ollama # 항상 켜두기 (부팅 시 자동 시작) ollama pull qwen3:14b # 모델 내려받기 (앱스토어에서 앱 받듯이) - API 서버 내장 — 켜두기만 하면 다른 프로그램(파이프라인 백엔드)이 HTTP로 질문을 보내고 답을 받을 수 있습니다. 별도 서버 개발이 필요 없습니다.
- Apple 칩 최적화 — 최신 버전(0.19+)부터 Apple 전용 가속 기술(MLX 엔진)을 사용해, Mac에서 글 읽는 속도 +57%, 답변 생성 속도 +93% 빨라졌습니다. Mac mini와 궁합이 가장 좋은 선택지입니다.
- 자동 메모리 관리 — 모델을 쓸 때만 메모리에 올리고, 안 쓰면 내려서 파이프라인(Docker)과 24GB를 사이좋게 나눠 씁니다.
- 모델 교체가 자유로움 — 나중에 더 좋은 모델이 나오면
ollama pull 새모델한 줄로 교체 끝. 코드 수정 없이 환경설정 값 하나만 바꾸면 됩니다. - 완전 무료 + 거대 커뮤니티 — 오픈소스이고 사용자가 가장 많아 자료·문제 해결 정보가 풍부합니다. 계정 가입이나 API 키도 필요 없습니다.
6. AI 모델(LLM) 후보 비교
모델 선정 기준은 3가지입니다: ① 한국어 실력 (회의록이 한국어) ② 24GB 메모리에서 Docker와 공존 가능 ③ 정해진 형식(JSON)으로 깔끔하게 출력.
💡 용어: "14B"는 매개변수 140억 개라는 뜻으로, 숫자가 클수록 똑똑하지만 메모리를 많이 먹습니다. "Q4"는 품질을 거의 유지하면서 파일을 1/4로 압축하는 기술입니다.
| 모델 | 크기(메모리) | 한국어 | 장점 | 단점 | 판정 |
|---|---|---|---|---|---|
| Qwen3 14B | 약 9GB | ★★★★★ | 오픈소스 중 한국어 자연스러움 최상위권. JSON 추출 등 지시 이행 우수. Docker와 공존 가능 | 중국 알리바바산이라는 심리적 거부감(오프라인 실행이라 데이터 유출은 없음) | ✅ 1순위 |
| EXAONE 3.5 7.8B | 약 5GB | ★★★★☆ | LG가 만든 한국어 특화 모델. 작고 빨라 메모리 여유 큼 | 14B보다 복잡한 추론은 다소 약함 | ✅ 예비 (메모리 부담 시 교체) |
| Qwen3 32B / EXAONE 32B | 약 19~20GB | ★★★★★ | 가장 똑똑함 | 모델만으로 24GB를 거의 다 차지 → 파이프라인과 공존 불가 | ❌ 제외 |
| Gemma 3 / Llama 3.x (소형) | 5~9GB | ★★★☆☆ | 구글/메타산, 영어 성능 우수 | 한국어 자연스러움이 위 두 모델보다 떨어짐 | ❌ 제외 |
선정 결과
- 1순위: Qwen3 14B — "한국어 실력"과 "메모리 공존"을 동시에 만족하는 최적점. 9GB만 쓰므로 파이프라인 운영에 지장이 없습니다.
- 예비: EXAONE 3.5 7.8B — 운영 중 메모리가 빠듯해지면 즉시 교체할 수 있는 가벼운 한국어 특화 카드.
7. 어떻게 연결되나? (구조 요약)
- 기능 이름 기반 허용 목록 방식: "이 기능은 로컬 AI 사용"이라고 환경설정에 적어두면 그 기능만 로컬로 갑니다. 처음엔 Meeting-to-Spec 하나만 허용하고, 품질이 검증되면 하나씩 늘립니다.
- 기본값 OFF: 설정을 켜기 전까지는 지금과 100% 동일하게 동작합니다. 위험 부담 없이 도입 가능합니다.
안전장치 (이중 보험)
| 상황 | 동작 |
|---|---|
| Ollama가 꺼져 있음 / 응답 없음 / 오류 | 경고 기록 후 자동으로 Claude가 대신 처리 |
| 로컬 AI 답변의 형식이 잘못됨 | 재시도하되, 두 번째는 Claude로 승격 |
| 입력 글이 너무 김 (로컬 AI 한계 초과) | 처음부터 Claude로 보냄 |
→ 어떤 경우에도 기능이 멈추지 않습니다. 최악의 경우 = 지금과 동일(Claude 사용)일 뿐입니다.
8. 리스크와 대응
| 리스크 | 설명 | 대응 |
|---|---|---|
| 답변 품질 | 로컬 AI가 Claude보다 덜 똑똑함 | 단순 작업만 맡기고, 같은 회의록으로 로컬 vs Claude 결과를 비교 검증 후 확대 |
| 메모리 부족 | AI(9GB) + Docker가 24GB 안에서 경쟁 | ollama ps로 상시 모니터링, 부담 시 EXAONE 7.8B(5GB)로 교체 |
| 모델의 "혼잣말" 출력 | Qwen3가 생각 과정을 답에 섞는 습성 | 생각 기능 끄기 옵션 + 코드에서 방어적 제거 (이중 방어) |
| 장비 단일 장애점 | Mac mini가 꺼지면 로컬 AI 불가 | 자동 Claude 전환으로 서비스 영향 없음 |
9. 결론
| 결정 사항 | 선택 | 핵심 이유 |
|---|---|---|
| 실행 프로그램 | Ollama | 가장 쉽고, Mac에 최적화(MLX +93%), API 서버 내장, 무료, 24시간 자동 운영 적합 |
| AI 모델 | Qwen3 14B (예비 EXAONE 3.5 7.8B) | 한국어 최상위권 + 9GB로 Docker와 공존 가능 |
| 첫 적용 | Meeting-to-Spec | 가장 단순·반복적이고 형식이 정해진 작업이라 검증에 최적 |
| 도입 방식 | 기본 OFF + 기능별 허용 목록 + Claude 자동 폴백 | 실패해도 잃을 게 없는 구조 |
비용은 줄이고, 내부 데이터는 밖으로 안 내보내고, 실패하면 자동으로 원래 방식으로 돌아가는 — 부담 없는 도입입니다. Meeting-to-Spec에서 품질이 검증되면 업무 자동 분류, AI Form 등으로 단계적으로 확대할 계획입니다.
댓글
아직 댓글이 없어요. 첫 댓글을 남겨보세요!
★이 강의 후기
후기 남기기아직 이 강의에 대한 후기가 없어요.