ClaudeRecursoIntermediário

Clonar a sua voz de graça no seu computador — e a linha da licença que ninguém lê

O VoiceStudio (github.com/debpalash/VoiceStudio, 47 mil estrelas, app sob AGPL-3.0) clona voz, dubla vídeo e transcreve rodando inteiro na sua máquina — sem nuvem, sem assinatura e sem limite de caracteres. Eu instalei no Windows e gerei português do Brasil em 31 segundos numa RTX 4050; o modelo cobre 646 idiomas. O porém que quase ninguém conta: o modelo de voz que vem ligado por padrão (k2-fsa/OmniVoice) tem licença CC-BY-NC, ou seja, NÃO pode ser usado comercialmente — o código é Apache 2.0, os pesos não. Dentro do próprio app há outros 16 motores, e alguns têm licença que libera vender (CosyVoice 3 e MOSS-TTS-Nano em Apache-2.0, GPT-SoVITS em MIT, PocketTTS em CC-BY-4.0). Testei o PocketTTS: ele clona, mas só depois de login no Hugging Face e aceite dos termos, e o português dele sai bem pior. Este material é a conta de quando vale trocar e quando não vale.

Clonar a sua voz de graça no seu computador — e a linha da licença que ninguém lê

O prompt

Instale o VoiceStudio nesta máquina e me entregue funcionando, com um áudio de teste na minha voz. Não me devolva um plano: execute, e me diga o que deu certo e o que falhou.

Antes de começar, verifique e me informe: sistema operacional, se tem placa de vídeo NVIDIA, e quanto de disco livre existe. O instalador mais o ambiente mais o modelo ocupam cerca de 11 GB.

**1. Baixe o instalador oficial.** Consulte a API do GitHub em https://api.github.com/repos/debpalash/VoiceStudio/releases, pegue o release estável mais recente e o anexo chamado `VoiceStudio-Electron-*-win-x64.exe` (no Mac, o `-mac-arm64.zip` ou `-mac-x64.zip`). Confira que o tamanho baixado bate com o tamanho do anexo antes de executar.

**2. Saiba o que esperar.** O instalador NÃO tem assinatura digital — isso é normal em aplicativo Electron de código aberto, e o Windows vai avisar. Instale sem privilégio de administrador; ele vai para a pasta do usuário.

**3. Prepare o ambiente Python.** Na pasta `resources` da instalação existem um `pyproject.toml` e um `uv.lock`. Rode `uv sync` ali com Python 3.12.

ARMADILHA REAL: se o uv falhar com "Failed to update Windows PE resources" num arquivo temporário, é o antivírus bloqueando. Crie uma pasta temporária nova, aponte TEMP, TMP e TMPDIR para ela, defina UV_LINK_MODE=copy e rode de novo. Aqui isso resolveu na primeira tentativa.

**4. Suba o serviço.** Execute o `main.py` que está na pasta `backend`, usando o Python do ambiente que você acabou de criar. Espere até `http://localhost:3900/health` responder status "ok" — leva alguns minutos na primeira vez, porque ele carrega o PyTorch.

Me diga qual dispositivo o health reportou. Se vier CPU numa máquina com placa NVIDIA, pare e investigue antes de seguir.

**5. Instale o modelo de voz.** Liste os modelos em `GET /models`. Instale o `k2-fsa/OmniVoice` por `POST /models/install` com o corpo {"repo_id":"k2-fsa/OmniVoice"} e acompanhe por `GET /models/install/status`. Só considere pronto quando `GET /models` disser installed: true — a fila de jobs esvazia antes de terminar.

**6. Prepare a referência da minha voz.** Me peça um arquivo de áudio com uns 18 segundos da minha voz: fala limpa, sem música e sem outra pessoa. Converta para WAV mono. Antes de usar, transcreva e me mostre o texto, para confirmar que é fala nítida e não um trecho ruim.

**7. Gere o teste.** Chame `POST /generate` como multipart com engine=omnivoice, language=pt, o arquivo em ref_audio e um texto curto meu. Depois transcreva o resultado e compare com o texto original — se as palavras não baterem, a referência estava ruim ou curta demais.

**8. A parte que quase ninguém checa.** Me diga qual motor ficou ativo e qual é a licença do modelo dele. O que vem ligado por padrão (k2-fsa/OmniVoice) é CC-BY-NC: uso NÃO comercial. Se eu disser que vou usar em conteúdo que vende alguma coisa, liste os motores do app com licença permissiva e me avise que alguns exigem login no Hugging Face e aceite de termos antes de clonar.

No fim, me entregue: a versão instalada, o dispositivo em uso, onde ficaram os arquivos, o caminho do áudio de teste, e qualquer passo que você não conseguiu completar — nomeado, não escondido.

Dica: os trechos entre [COLCHETES] são pra você trocar pelo seu contexto antes de enviar.

Passo a passo (siga na ordem)

Não pule etapas. Tá escrito do jeito que você só precisa seguir.

  1. 1

    Baixe o instalador oficial em github.com/debpalash/VoiceStudio/releases — o arquivo é VoiceStudio-Electron-<versão>-win-x64.exe, cerca de 214 MB.

  2. 2

    O Windows vai avisar que o programa não tem assinatura digital. É comum em aplicativo Electron de código aberto; o arquivo veio da página de releases do próprio repositório.

  3. 3

    Na primeira execução o app monta o ambiente dele (cerca de 8 GB). Se travar com erro de arquivo temporário, é o antivírus: aponte as variáveis TEMP e TMP para outra pasta e rode de novo.

  4. 4

    Pelo catálogo de modelos do app, instale o modelo de voz (cerca de 2,4 GB).

  5. 5

    Grave uns 18 segundos da sua voz em áudio limpo, sem música e sem outra pessoa falando, e aponte o app para esse arquivo.

  6. 6

    Gere. Na minha RTX 4050 levou 31 segundos para 10 segundos de fala; sem placa de vídeo dedicada também roda, só mais devagar.

  7. 7

    ANTES de usar em qualquer coisa que venda: confira qual motor está ativo. O que vem ligado por padrão é CC-BY-NC, uso não comercial.

Tags

#ferramentas#voz#open source#custos#licenças#conteúdo

Gostou desse prompt?

Me marca quando publicar no Instagram — adoro ver o que vocês criam. Pedidos de prompt? Manda DM com a palavra prompt.

Relacionados

Outros prompts que combinam com esse aqui

Trocar de suíte de escritório: a tabela que diz o que dá, o que dá com jeito e o que nem tentar
ClaudeChatGPTGemini

Trocar de suíte de escritório: a tabela que diz o que dá, o que dá com jeito e o que nem tentar

O GenOffice (github.com/genspark-ai/genoffice, licença Apache-2.0) é uma suíte aberta com editor de documento, planilha, apresentação e PDF, com um agente de IA dentro, que gera arquivos .docx, .xlsx e .pptx de verdade e roda no seu computador. São 8.299 estrelas, versão 0.11 e commit do mesmo dia em que escrevi. O porém que quase ninguém conta: o programa é grátis, a IA não — você entra com a sua própria chave e paga o uso. Este material é a tabela de decisão por categoria, para você parar de pagar licença cheia por quem abre o editor duas vezes por mês sem quebrar o que já funciona.

RecursoVer prompt →
O caminho curto pra IA parar de inventar número lendo o seu anexo
ClaudeChatGPTGemini

O caminho curto pra IA parar de inventar número lendo o seu anexo

PDF não guarda tabela: guarda pedaços de texto com coordenada. Quando a IA lê, colunas se misturam, a linha de cima cola na de baixo, o rodapé entra no meio da frase — e ela preenche o buraco com o que parece plausível. O AnyDoc (github.com/firecrawl/anydoc, licença MIT, 22 mil estrelas, escrito em Rust) converte Word, PowerPoint, Excel, PDF, CSV e outros para um texto limpo antes de a IA ver. Aqui vai o caminho mais curto de instalação para quem não é técnico, o que fazer sem instalar nada, e o prompt que se usa depois da conversão.

RecursoVer prompt →
A lista de checagem antes de dar acesso a um agente de IA
ClaudeChatGPTGemini

A lista de checagem antes de dar acesso a um agente de IA

O projeto mais estrelado do GitHub hoje é o OpenClaw — um agente que roda na sua própria máquina e executa tarefas por você. 389.776 estrelas, à frente do Linux e do React, em menos de um ano. E o porém que quase ninguém conta junto: a Cisco testou uma extensão de terceiro e encontrou vazamento de dados e injeção de comando rodando sem o usuário perceber, porque o repositório de extensões não tinha triagem. Agente com permissão total é a chave do caixa na mão de quem você não conhece. Esta lista é o que conferir antes.

RecursoVer prompt →
O mapa de uma entrega: a folha que você preenche hoje e usa com qualquer agente depois
ClaudeChatGPTGemini

O mapa de uma entrega: a folha que você preenche hoje e usa com qualquer agente depois

O OpenWorker é um agente de código aberto (licença MIT, 18.273 estrelas em dois meses) que roda na sua máquina e promete devolver trabalho terminado em vez de conversa — com mais de 25 conexões e a opção de usar modelo local, sem mandar dado pra fora. Só que hoje a instalação exige Python, Node e Rust, o instalador de Windows não é assinado e o projeto se declara em beta aberto. Ou seja: o sinal é ótimo e a ferramenta ainda não é pra quem não tem alguém técnico por perto. Este material é o que dá pra fazer agora sem instalar nada — mapear a entrega que vai ser automatizada assim que ficar fácil.

RecursoVer prompt →