[기술검토] 로컬 LLM 구동 장비 검토 — Mac mini M4 vs MacBook Pro M4 Pro
MacBook Pro(M4 Pro, 24GB)에도 동일하게 Ollama+Qwen3 14B 설치 가능 — 메모리 대역폭 차이(273 vs 120GB/s)로 맥북이 약 2배 빠르지만, 상시 서빙은 Mac mini·개발/테스트는 맥북으로 역할 분담. 환경변수 하나로 머신 전환 가능.
[기술검토] 로컬 LLM 구동 장비 검토 — Mac mini M4 vs MacBook Pro M4 Pro
이 문서는 Ollama + Qwen3 14B 로컬 LLM 을 어느 장비에서 돌릴지 검토한다. 결론: 설치는 두 장비 완전 동일, 속도는 MacBook Pro 가 약 2배 빠르지만, 상시 서빙은 24시간 켜져 있는 Mac mini — 맥북은 개발·테스트용이 적합하다.
1. 한 줄 요약
MacBook Pro(M4 Pro, 24GB)에도 Mac mini와 완전히 동일한 방법으로 Ollama + Qwen3 14B를 설치할 수 있다. 속도는 오히려 맥북이 약 2배 빠르다. 다만 "상시 서빙"은 24시간 켜져 있는 Mac mini가, 맥북은 개발·테스트용이 적합하다.
이 문서는 앞선 검토 "로컬 LLM 도입 — Ollama 및 Qwen3 14B 모델 선정 검토"의 후속으로, 자체 구축 AI 개발 파이프라인에 장비를 추가(맥북)할 때의 비교와 멀티 머신 운영 방안을 다룹니다.
2. 두 장비 사양 비교
| 항목 | Mac mini (2024) | MacBook Pro 14 (2024) |
|---|---|---|
| 칩 | Apple M4 | Apple M4 Pro |
| 메모리 | 24GB | 24GB (동일) |
| GPU 코어 | 10코어 | 16코어 |
| 메모리 대역폭 | 약 120GB/s | 약 273GB/s (2배 이상) |
| 전원 | 항상 콘센트 연결, 24시간 가동 | 배터리, 뚜껑 닫으면 잠자기 |
핵심: AI 속도는 "메모리 대역폭"이 좌우합니다
쉽게 비유하면 — AI가 답변을 만드는 과정은 두꺼운 책(모델)을 처음부터 끝까지 휙휙 넘기며 읽는 것과 같습니다. 글자 한 자(토큰 하나)를 출력할 때마다 9GB짜리 모델 전체를 한 번씩 훑어야 하므로, 책장을 넘기는 속도(메모리 대역폭) 가 빠를수록 답변이 빨리 나옵니다.
- Mac mini(M4): 초당 120GB를 읽음
- MacBook Pro(M4 Pro): 초당 273GB를 읽음 → 답변 생성 속도 체감 약 2배
💡 메모리 용량은 둘 다 24GB로 같으므로, 올릴 수 있는 모델의 크기 제한은 동일합니다. 즉 Qwen3 14B(약 9GB)가 적정선이고 32B급은 양쪽 다 무리입니다 — 맥북이라고 더 큰 모델을 쓸 수 있는 건 아니고, 같은 모델을 더 빨리 돌릴 수 있을 뿐입니다.
3. 설치 방법 — 완전히 동일
칩 세대·OS가 같으므로 Mac mini에서 쓴 명령 세 줄이 맥북에서도 그대로 동작합니다:
brew install ollama # 설치
brew services start ollama # 항상 켜두기 (부팅 시 자동 시작)
ollama pull qwen3:14b # 모델 내려받기 (~9GB)
별도 설정, 계정, API 키 모두 불필요. 설치 후 curl localhost:11434/api/tags로 확인하면 끝입니다.
4. 그럼 어느 장비에 무엇을 맡길까?
| 용도 | 적합 장비 | 이유 |
|---|---|---|
| 파이프라인 상시 서빙 | ✅ Mac mini | 24시간 켜져 있고 자리를 안 옮김. 서버는 "느려도 항상 있는 쪽"이 정답 |
| 개발·테스트·프롬프트 실험 | ✅ MacBook Pro | 2배 빠른 응답으로 시행착오 회전이 빠름. 이동 중에도 사용 가능 |
맥북을 서빙에 쓰지 않는 이유는 성능이 아니라 가용성입니다:
- 뚜껑을 닫거나 잠자기에 들어가면 Ollama가 응답하지 못함
- 들고 외출하면 사내망에서 사라짐
- 배터리 모드에서는 macOS가 성능을 제한할 수 있음
물론 파이프라인에는 Claude 자동 폴백이 있어 맥북이 사라져도 서비스가 멈추지는 않지만, "로컬로 처리해서 비용 0원"이라는 도입 목적이 그 시간 동안 무효가 됩니다.
5. 멀티 머신 운영 — 코드 수정 없이 전환 가능
파이프라인 백엔드는 Ollama 위치를 환경변수 하나로 바라봅니다. 어느 머신의 Ollama를 쓸지는 .env만 바꾸면 됩니다:
# Mac mini 자기 자신의 Ollama (기본값)
LOCAL_LLM_BASE_URL=http://host.docker.internal:11434
# 맥북의 Ollama를 쓰고 싶을 때 (사내망 IP)
LOCAL_LLM_BASE_URL=http://192.168.x.x:11434
활용 시나리오:
- 평상시: Mac mini가 서빙 (기본 구성)
- 속도 비교 실험: 잠깐 맥북 IP로 돌려 같은 회의록 처리 시간 비교 → 다시 원복
- Mac mini 점검/교체 중: 맥북이 임시 대타 (자리에 두고 전원 연결 전제)
어느 경우든 Ollama가 응답하지 않으면 Claude로 자동 폴백되므로 전환 실수의 리스크는 없습니다.
6. 맥북에서 쓸 때 주의사항
| 항목 | 내용 | 대응 |
|---|---|---|
| 메모리 경합 | 개발 도구(IDE, Docker, 브라우저) + 모델 9GB가 24GB 안에서 경쟁 | Ollama는 5분간 미사용 시 모델을 메모리에서 자동으로 내림 → 평소엔 부담 없음. ollama ps로 확인 |
| 발열/배터리 | LLM 추론 중 GPU 풀가동 | ⚠️ 장시간 돌릴 땐 전원 연결 권장 |
| 잠자기 | 뚜껑 닫으면 서빙 중단 | 서빙 용도로 쓸 경우에만 "전원 어댑터 연결 시 잠자기 방지" 설정 |
7. 결론
| 질문 | 답 |
|---|---|
| 맥북에도 동일하게 설치 가능한가? | 예. 같은 명령 세 줄, 같은 모델(Qwen3 14B) |
| 성능 차이는? | 맥북이 약 2배 빠름 (M4 Pro 메모리 대역폭 273GB/s vs 120GB/s) |
| 더 큰 모델을 쓸 수 있나? | 아니오. 메모리가 같은 24GB라 모델 크기 제한은 동일 |
| 역할 분담 | Mac mini = 상시 서빙 / 맥북 = 개발·테스트 (가용성 기준) |
| 전환 방법 | .env의 LOCAL_LLM_BASE_URL만 변경 — 코드 수정 불필요 |
댓글
아직 댓글이 없어요. 첫 댓글을 남겨보세요!
★이 강의 후기
후기 남기기아직 이 강의에 대한 후기가 없어요.