← 도구 생태계 음성·오디오 · AI 워크플로

Voicebox

로컬에서 도는 오픈소스 AI 음성 스튜디오. 몇 초 샘플로 목소리를 복제하고, 전역 단축키로 어떤 앱에나 받아쓰기를 꽂고, MCP로 Claude Code 같은 에이전트에 내가 만든 목소리를 달아줍니다. ElevenLabs(출력)와 WisprFlow(입력)를 한 앱에서 대체하는 것이 목표이고, 모델·음성 데이터가 기기 밖으로 나가지 않습니다.

jamiepine MIT · 오픈소스 데스크톱 앱 · MCP 서버 ★ 49.4k ⭐ 별 주기
음성·오디오AI 워크플로

🕘 아직 안 써봤습니다

아직 설치해서 써보지 않은 항목입니다. 저장소·릴리스·문서를 확인하고 남긴 살펴본 메모이지, 사용기가 아닙니다. 실제로 굴려본 뒤 리뷰로 교체합니다 — 왜 이런 표기가 있는지는 선정 기준·공시에 적어뒀습니다. 확인일: 2026-07-30.

Spacedrive를 만든 Jamie Pine의 프로젝트로, 반년 만에 별 47k에 릴리스 누적 다운로드 188만을 찍었습니다. 구조를 보면 음성 입출력을 한 바퀴로 묶은 게 핵심이에요. 출력 쪽은 TTS 엔진 7종(Qwen3-TTS·Qwen CustomVoice·LuxTTS·Chatterbox 2종·HumeAI TADA·Kokoro)에 23개 언어와 제로샷 음성 복제, 입력 쪽은 Whisper 기반 전역 받아쓰기로 macOS에서는 접근성 권한을 받아 포커스된 입력창에 바로 붙여넣습니다(클립보드는 원자적으로 저장·복원). 둘 사이를 내장 Qwen3 LLM이 이어서 '음', '어' 같은 군더더기를 정리하거나 페르소나 말투로 다시 씁니다. 우리 독자에게 제일 값어치 있는 건 내장 MCP 서버예요 — claude mcp add 한 줄이면 voicebox.speak로 에이전트가 내가 복제한 목소리로 말하고, 클라이언트별로 다른 목소리를 물려 어느 에이전트가 말하는지 소리만으로 구분할 수 있습니다. Tauri(Rust)+FastAPI라 Electron이 아니고, Apple Silicon에서는 MLX로 돕니다.솔직히: 아직 설치해서 써보지 않았습니다 — 이건 사용기가 아니라 저장소를 확인한 메모입니다. 그리고 지금 상태에서 걸리는 게 셋 있어요. 최신 릴리스 v0.5.0이 2026-04-25로 3개월째 멈춰 있는데 커밋은 사흘 전까지 활발합니다(개발은 도는데 배포가 안 나오는 상태). 열린 이슈 456개에 대기 중인 PR이 110개로 유지보수 병목 신호가 보입니다. 마지막으로 이 목록에서 설치가 제일 무겁습니다 — DMG 538MB에 모델은 별도 다운로드고, macOS 접근성·입력 모니터링 권한을 내줘야 받아쓰기가 됩니다.

설치하기

아직 개발환경(터미널·Git·Node 등)이 없다면 lazy-starter-kit으로 먼저 준비하고 오세요.

아직 cmore가 써보지 않은 항목입니다(저장소 확인만). macOS Apple Silicon/Intel DMG와 Windows MSI는 있고 Linux는 소스 빌드입니다. 받아쓰기에는 접근성·입력 모니터링 권한이, 생성에는 수 GB 모델 다운로드가 필요합니다.

macOS · Windows (공식 다운로드)
open https://voicebox.sh
에이전트에 목소리 달기 (Claude Code)
claude mcp add voicebox --transport http --url http://127.0.0.1:17493/mcp --header "X-Voicebox-Client-Id: claude-code"
Voicebox은(는) cmore.dev와 무관한 외부 프로젝트입니다. 소개와 리뷰는 "이런 게 있어요" 안내이지 보증이 아니며, 설치·사용에 대한 판단과 책임은 사용자에게 있습니다.