AI음성, 이제 공짜로! 무료 목소리 복제 오픈소스 Voicebox 총정리
ElevenLabs 대안으로 뜬 무료·오픈소스 음성 복제 앱 Voicebox — 30초 샘플로 보이스 클로닝, 한국어 포함 23개 언어, 100% 로컬 구동.
AI로 내 목소리를 복제해 원하는 문장을 읽게 만드는 AI 음성 복제(보이스 클로닝), 다들 한 번쯤 관심 있으셨을 텐데요. 그동안은 ElevenLabs처럼 월 5만원대 구독료를 내야 제대로 쓸 수 있어서 부담스러웠습니다. 그런데 이걸 완전 무료·오픈소스로 대체하는 앱이 나와서 공유드립니다. 이름은 Voicebox(보이스박스) 입니다.
📌 3줄 요약
① 유료가 표준이던 AI 음성 복제를 무료 오픈소스로 대체하는 앱, 깃허브 스타 3.8만 개 돌파 ② 30초 음성 샘플만으로 보이스 클로닝, 한국어 포함 23개 언어·7개 TTS 엔진 지원 ③ 모든 처리가 100% 내 PC 안에서(로컬 구동) → 프라이버시 안전 + 완전 무료
들어가며 — Voicebox란? 무료 AI 음성 스튜디오
Voicebox 는 파일 관리 앱 'Spacedrive'를 만든 개발자 Jamie Pine 이 공개한 로컬 우선(local-first) AI 음성 스튜디오 입니다. 공개되자마자 깃허브 스타 3.8만 개 를 쓸어담으며 지금 전 세계 개발자 커뮤니티에서 가장 화제인 프로젝트가 됐습니다.
쉽게 말해 유료 서비스인 ElevenLabs(음성 복제) 와 WisprFlow(음성 받아쓰기) 를 한 앱에 합쳐 놓은 무료 대안 이라고 보시면 됩니다. 그동안 대부분 유료였던 AI 보이스 시장에 제대로 된 무료 대항마가 등장한 셈이죠.
주요 특징 4가지
1. 30초 샘플로 목소리 복제
가장 놀라운 부분은 복제 속도 입니다. 짧은 음성 샘플 하나만 있으면 끝이에요. 별도로 오래 파인튜닝(학습)시킬 필요 없이, 약 30초 분량의 오디오 샘플만으로 바로 내 목소리가 복제 됩니다. 녹음을 직접 하거나, 기존 음성 파일을 업로드하는 방식 모두 지원합니다.
2. 한국어 포함 23개 언어 · 7개 TTS 엔진
Voicebox는 한국어를 포함한 23개 언어 를 지원합니다. 게다가 상황에 맞게 7개의 TTS(음성 합성) 엔진 을 골라 쓸 수 있어요.
| TTS 엔진 | 비고 |
|---|---|
| Qwen3-TTS | 알리바바 클라우드 Qwen 팀 개발 |
| Qwen CustomVoice | 커스텀 보이스 |
| LuxTTS | — |
| Chatterbox Multilingual / Turbo | 다국어 · 고속 |
| HumeAI TADA | — |
| Kokoro | — |
엔진마다 음색과 표현력, 속도가 달라서 목적에 맞게 조합할 수 있습니다. 여기에 웃음·한숨 같은 감정 태그 까지 넣을 수 있어, 단조로운 기계음이 아니라 훨씬 자연스러운 목소리를 만들 수 있습니다.
3. 받아쓰기 + AI 에이전트 음성까지
단순 음성 복제 툴을 넘어섭니다. 글로벌 핫키(단축키) 를 누르면 아무 텍스트 필드에나 말로 받아쓰기(dictation)를 할 수 있고, MCP 연동 을 통해 내가 만든 AI 에이전트에 원하는 목소리를 입힐 수도 있습니다. 콘텐츠 제작자뿐 아니라 개발자에게도 활용도가 높은 이유입니다.
4. 로컬 구동 = 프라이버시 + 완전 무료
개인적으로 가장 마음에 드는 부분입니다. Voicebox는 모든 처리가 100% 내 PC 안에서 이뤄집니다. 즉, 내 목소리 데이터가 외부 서버로 전송되지 않는다 는 뜻이에요. 민감한 음성 데이터를 클라우드에 올리지 않아도 되니 프라이버시 걱정이 없고, 오픈소스라 구독료·회원가입도 전혀 필요 없습니다.
설치 방법 (Windows · macOS · Linux)
내 운영체제에 맞게 내려받아 바로 설치할 수 있습니다.
- Windows: 64-bit MSI 설치 파일
- macOS: Apple Silicon(M1~) / Intel(x64) 각각 지원
- Linux: 소스에서 직접 빌드
- 공식 저장소: github.com/jamiepine/voicebox
깃허브에서 Voicebox 를 검색하면 바로 나오며, 다운로드 페이지에서 본인 OS 버튼을 누르면 설치가 시작됩니다.
⚠️ 설치 전 참고할 점 (장단점)
완전 무료 오픈소스라 좋긴 하지만, 솔직한 단점도 짚고 넘어갈게요.
⚠️ 주의
- 사양이 필요합니다. 로컬에서 AI 모델을 직접 돌리는 방식이라, 어느 정도 GPU와 PC 사양 이 받쳐줘야 쾌적하게 돌아갑니다.
- 세팅이 상용만큼 자동화돼 있진 않습니다. 유료 서비스처럼 클릭 몇 번으로 끝나는 완성형은 아니라, 초기 설정에 약간의 손이 갈 수 있습니다.
그럼에도 무료 오픈소스로 이 정도 품질과 기능 이면 충분히 써볼 가치가 있다고 봅니다. 특히 목소리 데이터를 외부에 맡기기 꺼려지는 분, 매달 구독료가 아까웠던 분께 강력 추천합니다.
마치며
정리하면 Voicebox는 ① 무료, ② 오픈소스, ③ 로컬 구동(프라이버시), ④ 30초 복제, ⑤ 한국어 지원 까지 갖춘, 지금 시점 가장 주목할 만한 AI 음성 복제 툴입니다. 유튜브 나레이션, 오디오북, 콘텐츠 더빙, 개인 프로젝트 등 활용처도 무궁무진하죠.
관심 있으신 분들은 한번 설치해 보시고 후기 공유 해 주세요! 감정 태그 사용법이나 엔진별 음질 비교 후기도 댓글로 나눠주시면 서로 큰 도움이 될 것 같습니다. 😊
본 글은 정보 공유 목적으로 작성되었으며, 특정 업체로부터 협찬·대가를 받지 않았습니다.
출처
- Voicebox 공식 저장소: https://github.com/jamiepine/voicebox
- Qwen3-TTS: https://github.com/QwenLM/Qwen3-TTS
Comments
No comments yet. Be the first to comment!