Clonar a sua voz de graça no seu computador — e a linha da licença que ninguém lê
O VoiceStudio (github.com/debpalash/VoiceStudio, 47 mil estrelas, app sob AGPL-3.0) clona voz, dubla vídeo e transcreve rodando inteiro na sua máquina — sem nuvem, sem assinatura e sem limite de caracteres. Eu instalei no Windows e gerei português do Brasil em 31 segundos numa RTX 4050; o modelo cobre 646 idiomas. O porém que quase ninguém conta: o modelo de voz que vem ligado por padrão (k2-fsa/OmniVoice) tem licença CC-BY-NC, ou seja, NÃO pode ser usado comercialmente — o código é Apache 2.0, os pesos não. Dentro do próprio app há outros 16 motores, e alguns têm licença que libera vender (CosyVoice 3 e MOSS-TTS-Nano em Apache-2.0, GPT-SoVITS em MIT, PocketTTS em CC-BY-4.0). Testei o PocketTTS: ele clona, mas só depois de login no Hugging Face e aceite dos termos, e o português dele sai bem pior. Este material é a conta de quando vale trocar e quando não vale.

O prompt
Instale o VoiceStudio nesta máquina e me entregue funcionando, com um áudio de teste na minha voz. Não me devolva um plano: execute, e me diga o que deu certo e o que falhou.
Antes de começar, verifique e me informe: sistema operacional, se tem placa de vídeo NVIDIA, e quanto de disco livre existe. O instalador mais o ambiente mais o modelo ocupam cerca de 11 GB.
**1. Baixe o instalador oficial.** Consulte a API do GitHub em https://api.github.com/repos/debpalash/VoiceStudio/releases, pegue o release estável mais recente e o anexo chamado `VoiceStudio-Electron-*-win-x64.exe` (no Mac, o `-mac-arm64.zip` ou `-mac-x64.zip`). Confira que o tamanho baixado bate com o tamanho do anexo antes de executar.
**2. Saiba o que esperar.** O instalador NÃO tem assinatura digital — isso é normal em aplicativo Electron de código aberto, e o Windows vai avisar. Instale sem privilégio de administrador; ele vai para a pasta do usuário.
**3. Prepare o ambiente Python.** Na pasta `resources` da instalação existem um `pyproject.toml` e um `uv.lock`. Rode `uv sync` ali com Python 3.12.
ARMADILHA REAL: se o uv falhar com "Failed to update Windows PE resources" num arquivo temporário, é o antivírus bloqueando. Crie uma pasta temporária nova, aponte TEMP, TMP e TMPDIR para ela, defina UV_LINK_MODE=copy e rode de novo. Aqui isso resolveu na primeira tentativa.
**4. Suba o serviço.** Execute o `main.py` que está na pasta `backend`, usando o Python do ambiente que você acabou de criar. Espere até `http://localhost:3900/health` responder status "ok" — leva alguns minutos na primeira vez, porque ele carrega o PyTorch.
Me diga qual dispositivo o health reportou. Se vier CPU numa máquina com placa NVIDIA, pare e investigue antes de seguir.
**5. Instale o modelo de voz.** Liste os modelos em `GET /models`. Instale o `k2-fsa/OmniVoice` por `POST /models/install` com o corpo {"repo_id":"k2-fsa/OmniVoice"} e acompanhe por `GET /models/install/status`. Só considere pronto quando `GET /models` disser installed: true — a fila de jobs esvazia antes de terminar.
**6. Prepare a referência da minha voz.** Me peça um arquivo de áudio com uns 18 segundos da minha voz: fala limpa, sem música e sem outra pessoa. Converta para WAV mono. Antes de usar, transcreva e me mostre o texto, para confirmar que é fala nítida e não um trecho ruim.
**7. Gere o teste.** Chame `POST /generate` como multipart com engine=omnivoice, language=pt, o arquivo em ref_audio e um texto curto meu. Depois transcreva o resultado e compare com o texto original — se as palavras não baterem, a referência estava ruim ou curta demais.
**8. A parte que quase ninguém checa.** Me diga qual motor ficou ativo e qual é a licença do modelo dele. O que vem ligado por padrão (k2-fsa/OmniVoice) é CC-BY-NC: uso NÃO comercial. Se eu disser que vou usar em conteúdo que vende alguma coisa, liste os motores do app com licença permissiva e me avise que alguns exigem login no Hugging Face e aceite de termos antes de clonar.
No fim, me entregue: a versão instalada, o dispositivo em uso, onde ficaram os arquivos, o caminho do áudio de teste, e qualquer passo que você não conseguiu completar — nomeado, não escondido.Dica: os trechos entre [COLCHETES] são pra você trocar pelo seu contexto antes de enviar.
Passo a passo (siga na ordem)
Não pule etapas. Tá escrito do jeito que você só precisa seguir.
- 1
Baixe o instalador oficial em github.com/debpalash/VoiceStudio/releases — o arquivo é VoiceStudio-Electron-<versão>-win-x64.exe, cerca de 214 MB.
- 2
O Windows vai avisar que o programa não tem assinatura digital. É comum em aplicativo Electron de código aberto; o arquivo veio da página de releases do próprio repositório.
- 3
Na primeira execução o app monta o ambiente dele (cerca de 8 GB). Se travar com erro de arquivo temporário, é o antivírus: aponte as variáveis TEMP e TMP para outra pasta e rode de novo.
- 4
Pelo catálogo de modelos do app, instale o modelo de voz (cerca de 2,4 GB).
- 5
Grave uns 18 segundos da sua voz em áudio limpo, sem música e sem outra pessoa falando, e aponte o app para esse arquivo.
- 6
Gere. Na minha RTX 4050 levou 31 segundos para 10 segundos de fala; sem placa de vídeo dedicada também roda, só mais devagar.
- 7
ANTES de usar em qualquer coisa que venda: confira qual motor está ativo. O que vem ligado por padrão é CC-BY-NC, uso não comercial.
Tags
Gostou desse prompt?
Me marca quando publicar no Instagram — adoro ver o que vocês criam. Pedidos de prompt? Manda DM com a palavra prompt.



