Codium Lab
All materials
MaterialsJul 3, 2026Free1

[기술검토] 로컬 LLM 도입 — Ollama 및 모델(Qwen3 14B) 선정

Mac mini(M4, 24GB)에 로컬 LLM을 올려 단순 AI 작업을 무료 처리하는 방안 검토. 런타임 Ollama·모델 Qwen3 14B 선정 이유, 후보 비교, Claude 자동 폴백 구조를 비전공자도 이해할 수 있게 정리.

#Ollama#로컬LLM#Qwen3#EXAONE#비용절감

[기술검토] 로컬 LLM 도입 — Ollama 및 모델 선정

Mac mini(M4, 24GB) 한 대에 로컬 LLM을 올려, 자체 구축 멀티에이전트 하네스(이하 "AI 개발 파이프라인")의 단순·반복 AI 작업을 무료로 처리하는 방안을 검토했습니다. 결론: 런타임은 Ollama, 모델은 Qwen3 14B(예비 EXAONE 3.5 7.8B), 실패 시 Claude 자동 폴백.

1. 한 줄 요약

Mac mini(M4, 24GB) 한 대에 "우리만 쓰는 작은 AI"를 설치해서, 파이프라인의 단순·반복적인 AI 작업을 무료로 처리하고, 유료 Claude API 비용을 줄인다.

  • 실행 프로그램(런타임): Ollama 선정
  • AI 모델: Qwen3 14B (1순위) / EXAONE 3.5 7.8B (예비)
  • 첫 적용 대상: Meeting-to-Spec (회의록 → 업무 항목 자동 추출)
  • 안전장치: 로컬 AI가 실패하면 자동으로 기존 Claude로 전환 (사용자는 차이를 못 느낌)

2. 배경 — 왜 이걸 하나요?

AI 개발 파이프라인은 여러 곳에서 AI를 사용합니다. 예를 들어:

  • 회의록을 주면 → 업무 항목 목록을 뽑아주는 기능 (Meeting-to-Spec)
  • 업무 내용을 보고 → 분류 태그를 붙여주는 기능 (업무 자동 분류)
  • 폼 내용을 자동으로 채워주는 기능 (AI Form)

지금은 이 모든 작업을 Claude(유료 클라우드 AI) 가 처리합니다. 그런데 잘 보면 이 작업들은 "긴 글을 읽고 → 정해진 형식으로 정리"하는 단순 작업이라, 최고급 AI까지는 필요 없습니다.

💡 비유하자면 — 간단한 동네 심부름까지 매번 퀵서비스(유료)를 부르는 상황입니다. 사무실에 자전거(로컬 AI) 한 대를 두면, 가까운 심부름은 공짜로 해결됩니다. 멀고 어려운 배달만 퀵서비스를 부르면 됩니다.

기대 효과

항목내용
비용단순 AI 작업의 API 호출 비용 → 0원 (전기료만 발생)
보안회의록 등 내부 데이터가 외부로 나가지 않음 (내부 장비 안에서만 처리)
독립성외부 AI 서비스 장애·요금 정책 변경에 덜 휘둘림

3. 장비 — Mac mini (M4, 24GB) 로 가능한가?

사양의미
Apple M4AI 계산에 강한 최신 애플 칩 (GPU + 뉴럴엔진 내장)
메모리24GBAI 모델을 "올려놓는 책상"의 크기. 클수록 큰 모델 가능
특징통합 메모리일반 PC와 달리 CPU/GPU가 메모리를 함께 써서 AI 실행에 유리

결론: 가능합니다. 단, 24GB라는 책상 위에 ① AI 모델 ② 파이프라인 서비스(Docker)가 같이 올라가야 하므로, AI 모델은 약 10GB 안팎의 "중간 크기"가 적당합니다. 이 제약이 아래 모델 선정의 핵심 기준이 됩니다.


4. 로컬 LLM이란? (쉬운 설명)

  • LLM = ChatGPT나 Claude 같은 "글을 읽고 쓰는 AI"의 정식 명칭 (대규모 언어 모델)
  • 로컬 LLM = 그 AI를 인터넷 너머 회사 서버가 아니라 내 컴퓨터에 직접 설치해서 쓰는 것
클라우드 AI (Claude 등)로컬 AI (이번 도입)
위치외국 회사 서버사무실 Mac mini
비용쓸 때마다 과금무료 (장비는 이미 있음)
성능매우 똑똑함적당히 똑똑함 (단순 작업엔 충분)
데이터외부 전송 필요외부로 안 나감
인터넷필수불필요

핵심 전략은 "적재적소" 입니다. 어려운 일은 계속 Claude가, 쉬운 반복 작업은 로컬 AI가 맡습니다.


5. 실행 프로그램(런타임) 비교 — 왜 Ollama인가?

AI 모델은 파일 덩어리일 뿐이라, 그것을 실행해 주는 프로그램이 필요합니다. (음악 파일에 음악 플레이어가 필요한 것과 같습니다.) 후보는 4가지였습니다.

후보한 줄 평장점단점판정
Ollama"AI계의 앱스토어"설치·모델 받기·실행이 명령어 한 줄. 서버 기능 내장. 무료·오픈소스미세 튜닝 옵션은 적은 편선정
LM Studio예쁜 GUI 데스크톱 앱마우스 클릭으로 조작, 초보자 친화사람이 화면을 봐야 하는 앱 — 서버에서 24시간 자동 운영엔 부적합
llama.cpp모든 것의 원조 엔진가장 가볍고 세밀한 제어 가능컴파일·옵션 등 전문가용. 운영 부담 큼
vLLM대규모 서비스용동시 사용자 수백 명 처리NVIDIA GPU 서버용 — Mac에선 제 성능이 안 나옴. 이 규모엔 과함

Ollama를 선택한 이유 (상세)

  1. 압도적으로 쉬움 — 설치부터 실행까지 딱 세 줄:
    brew install ollama          # 설치
    brew services start ollama   # 항상 켜두기 (부팅 시 자동 시작)
    ollama pull qwen3:14b        # 모델 내려받기 (앱스토어에서 앱 받듯이)
    
  2. API 서버 내장 — 켜두기만 하면 다른 프로그램(파이프라인 백엔드)이 HTTP로 질문을 보내고 답을 받을 수 있습니다. 별도 서버 개발이 필요 없습니다.
  3. Apple 칩 최적화 — 최신 버전(0.19+)부터 Apple 전용 가속 기술(MLX 엔진)을 사용해, Mac에서 글 읽는 속도 +57%, 답변 생성 속도 +93% 빨라졌습니다. Mac mini와 궁합이 가장 좋은 선택지입니다.
  4. 자동 메모리 관리 — 모델을 쓸 때만 메모리에 올리고, 안 쓰면 내려서 파이프라인(Docker)과 24GB를 사이좋게 나눠 씁니다.
  5. 모델 교체가 자유로움 — 나중에 더 좋은 모델이 나오면 ollama pull 새모델 한 줄로 교체 끝. 코드 수정 없이 환경설정 값 하나만 바꾸면 됩니다.
  6. 완전 무료 + 거대 커뮤니티 — 오픈소스이고 사용자가 가장 많아 자료·문제 해결 정보가 풍부합니다. 계정 가입이나 API 키도 필요 없습니다.

6. AI 모델(LLM) 후보 비교

모델 선정 기준은 3가지입니다: ① 한국어 실력 (회의록이 한국어) ② 24GB 메모리에서 Docker와 공존 가능정해진 형식(JSON)으로 깔끔하게 출력.

💡 용어: "14B"는 매개변수 140억 개라는 뜻으로, 숫자가 클수록 똑똑하지만 메모리를 많이 먹습니다. "Q4"는 품질을 거의 유지하면서 파일을 1/4로 압축하는 기술입니다.

모델크기(메모리)한국어장점단점판정
Qwen3 14B약 9GB★★★★★오픈소스 중 한국어 자연스러움 최상위권. JSON 추출 등 지시 이행 우수. Docker와 공존 가능중국 알리바바산이라는 심리적 거부감(오프라인 실행이라 데이터 유출은 없음)1순위
EXAONE 3.5 7.8B약 5GB★★★★☆LG가 만든 한국어 특화 모델. 작고 빨라 메모리 여유 큼14B보다 복잡한 추론은 다소 약함예비 (메모리 부담 시 교체)
Qwen3 32B / EXAONE 32B약 19~20GB★★★★★가장 똑똑함모델만으로 24GB를 거의 다 차지 → 파이프라인과 공존 불가❌ 제외
Gemma 3 / Llama 3.x (소형)5~9GB★★★☆☆구글/메타산, 영어 성능 우수한국어 자연스러움이 위 두 모델보다 떨어짐❌ 제외

선정 결과

  • 1순위: Qwen3 14B — "한국어 실력"과 "메모리 공존"을 동시에 만족하는 최적점. 9GB만 쓰므로 파이프라인 운영에 지장이 없습니다.
  • 예비: EXAONE 3.5 7.8B — 운영 중 메모리가 빠듯해지면 즉시 교체할 수 있는 가벼운 한국어 특화 카드.

7. 어떻게 연결되나? (구조 요약)

  • 기능 이름 기반 허용 목록 방식: "이 기능은 로컬 AI 사용"이라고 환경설정에 적어두면 그 기능만 로컬로 갑니다. 처음엔 Meeting-to-Spec 하나만 허용하고, 품질이 검증되면 하나씩 늘립니다.
  • 기본값 OFF: 설정을 켜기 전까지는 지금과 100% 동일하게 동작합니다. 위험 부담 없이 도입 가능합니다.

안전장치 (이중 보험)

상황동작
Ollama가 꺼져 있음 / 응답 없음 / 오류경고 기록 후 자동으로 Claude가 대신 처리
로컬 AI 답변의 형식이 잘못됨재시도하되, 두 번째는 Claude로 승격
입력 글이 너무 김 (로컬 AI 한계 초과)처음부터 Claude로 보냄

어떤 경우에도 기능이 멈추지 않습니다. 최악의 경우 = 지금과 동일(Claude 사용)일 뿐입니다.


8. 리스크와 대응

리스크설명대응
답변 품질로컬 AI가 Claude보다 덜 똑똑함단순 작업만 맡기고, 같은 회의록으로 로컬 vs Claude 결과를 비교 검증 후 확대
메모리 부족AI(9GB) + Docker가 24GB 안에서 경쟁ollama ps로 상시 모니터링, 부담 시 EXAONE 7.8B(5GB)로 교체
모델의 "혼잣말" 출력Qwen3가 생각 과정을 답에 섞는 습성생각 기능 끄기 옵션 + 코드에서 방어적 제거 (이중 방어)
장비 단일 장애점Mac mini가 꺼지면 로컬 AI 불가자동 Claude 전환으로 서비스 영향 없음

9. 결론

결정 사항선택핵심 이유
실행 프로그램Ollama가장 쉽고, Mac에 최적화(MLX +93%), API 서버 내장, 무료, 24시간 자동 운영 적합
AI 모델Qwen3 14B (예비 EXAONE 3.5 7.8B)한국어 최상위권 + 9GB로 Docker와 공존 가능
첫 적용Meeting-to-Spec가장 단순·반복적이고 형식이 정해진 작업이라 검증에 최적
도입 방식기본 OFF + 기능별 허용 목록 + Claude 자동 폴백실패해도 잃을 게 없는 구조

비용은 줄이고, 내부 데이터는 밖으로 안 내보내고, 실패하면 자동으로 원래 방식으로 돌아가는 — 부담 없는 도입입니다. Meeting-to-Spec에서 품질이 검증되면 업무 자동 분류, AI Form 등으로 단계적으로 확대할 계획입니다.

Comments

0/2000

No comments yet. Be the first to comment!

Reviews for this material

Write a review

No reviews for this material yet.