VoiceStudio는 오픈소스 음성 작업 앱이다. 짧은 음성 샘플을 넣어 목소리를 복제하고, 원하는 나이·억양·피치·스타일·전달 방식으로 음성을 설계할 수 있다. 여기에 영상 더빙, 받아쓰기, 전사, 스토리와 오디오북 제작까지 한 흐름으로 묶었다. README가 제시하는 규모는 TTS 엔진 16개, ASR 엔진 11개, 646개 언어 카탈로그다. 다만 646개라는 숫자는 모든 엔진의 동일한 품질을 뜻하지 않는다. 실제 범위와 결과는 선택한 엔진에 따라 달라진다.
이번 저장소를 볼 때 눈에 들어오는 부분은 브라우저 UI와 로컬 처리의 관계다. 개발 모드에서는 `bun run dev`로 브라우저 UI를 띄울 수 있고, 제품은 로컬 REST·SSE·WebSocket API도 제공한다. OpenAI 호환 오디오 API와 MCP 서버까지 있어 다른 도구에서 음성 생성과 전사를 호출할 수 있다. 그러나 화면이 브라우저에 있다고 해서 작업이 자동으로 외부 음성 서비스로 넘어가는 구조는 아니다. README는 음성, 프로젝트, 설정, 결과물이 기본적으로 컴퓨터에 저장되고, 네트워크 기반 기능은 명시적으로 선택하는 로컬 우선 흐름을 설명한다.
이 선택에는 비용이 따른다. VoiceStudio는 계정이나 API 키, 구독, 사용량 미터 없이 쓸 수 있지만, 사용자가 모델을 내려받고 저장 공간과 연산 자원을 준비해야 한다. 기본 로컬 워크플로의 최소 요구사항은 RAM 8GB와 여유 디스크 10GB다. GPU 없이 CPU로도 실행할 수 있지만, CUDA, Apple Silicon MPS/MLX, Linux ROCm을 활용하면 엔진에 따라 처리 환경이 달라진다. 권장 VRAM은 8GB 이상이며, 큰 모델을 추가하면 더 많은 자원이 필요할 수 있다.
원격 워커도 지원한다는 점은 이 구조의 경계를 더 선명하게 만든다. 로컬에서 모든 작업을 끝낼 수도 있고, 필요할 때 다른 장치로 모델 작업을 보낼 수도 있다. 그만큼 어떤 샘플과 결과가 어느 장치에 있는지 확인하는 운영 습관이 필요하다. 로컬 우선은 ‘아무것도 신경 쓰지 않아도 된다’는 뜻이 아니라, 데이터 경로를 사용자가 선택할 수 있다는 뜻에 가깝다.
그래서 VoiceStudio는 클라우드 음성 서비스와 단순히 기능표로 비교할 프로젝트가 아니다. hosted 서비스는 설치와 컴퓨팅 관리를 대신하지만, VoiceStudio는 그 통제권을 사용자에게 돌려준다. 그 대신 모델, 디스크, GPU, 업데이트를 직접 책임져야 한다. 현재는 액티브 베타이므로 안정적인 작업에는 최신 릴리스를 사용하라는 안내도 있다. 브라우저에서 조작하는 AI 도구를 평가할 때, 화면보다 먼저 확인할 질문은 하나다. 내 데이터가 기본적으로 어느 경계를 넘는가?