Guia Técnico

Whisper: como funciona o modelo por trás da transcrição local

Um mergulho técnico no Whisper, o modelo de reconhecimento de voz de código aberto da OpenAI: como foi treinado, sua arquitetura, os diferentes tamanhos disponíveis e por que ele torna a transcrição 100% local tecnicamente viável.

O que é o Whisper

Whisper é um modelo de reconhecimento automático de fala (ASR — automatic speech recognition) desenvolvido pela OpenAI e lançado como código aberto em setembro de 2022. Diferente de muitos sistemas de transcrição proprietários que só funcionam via API na nuvem, os pesos do Whisper são públicos — qualquer pessoa pode baixar o modelo e rodá-lo no próprio computador, sem depender dos servidores da OpenAI.

É justamente essa característica — ser aberto e executável localmente — que torna produtos de transcrição 100% local, como o Fato AI, tecnicamente possíveis. Sem um modelo assim, a única alternativa seria depender de uma API na nuvem para cada transcrição.

Como o Whisper foi treinado

O Whisper original foi treinado em 680.000 horas de áudio multilíngue e multitarefa coletado da internet — uma escala muito maior do que a maioria dos modelos de fala da época, o que contribuiu diretamente para sua robustez em sotaques, ruído de fundo e diferentes idiomas.

A versão mais recente, o Whisper large-v3, foi treinada em ainda mais dados: 5 milhões de horas de áudio no total, sendo 1 milhão de horas com rótulos fracos (weakly labeled) e 4 milhões de horas com pseudo-rótulos gerados pelo próprio Whisper large-v2. O modelo tem 1,55 bilhão de parâmetros e é distribuído sob licença permissiva.

Arquitetura: um Transformer encoder-decoder

Por baixo do capô, o Whisper é um Transformer encoder-decoder — a mesma família de arquitetura usada em modelos de linguagem como o GPT. O encoder processa o áudio (convertido em espectrograma) e extrai uma representação numérica do que foi dito; o decoder usa essa representação para gerar o texto, token por token.

Essa abordagem multitarefa significa que o mesmo modelo consegue transcrever, traduzir para o inglês e detectar o idioma falado, tudo com a mesma arquitetura — sem precisar de um modelo separado para cada tarefa.

Tamanhos de modelo e o trade-off velocidade vs. precisão

O Whisper existe em vários tamanhos, cada um com um número diferente de parâmetros:

  • tiny — 39 milhões de parâmetros, o mais rápido, ideal para hardware limitado
  • base — 74 milhões de parâmetros
  • small — 244 milhões de parâmetros
  • medium — 769 milhões de parâmetros
  • large-v3 — 1,55 bilhão de parâmetros, o mais preciso
  • large-v3-turbo — versão otimizada com 809 milhões de parâmetros (os 32 blocos de decodificação do large-v3 foram reduzidos para 4), entregando de 2 a 5 vezes mais velocidade com queda mínima de precisão

Modelos maiores são mais precisos, mas exigem mais poder de processamento e demoram mais para transcrever; modelos menores rodam rápido até em hardware modesto, com alguma perda de qualidade. Escolher o tamanho certo é um equilíbrio entre a precisão necessária e o hardware disponível.

Idiomas suportados e tradução

O Whisper suporta transcrição em 99 idiomas, incluindo o português, com qualidade que varia conforme a quantidade de dados de treinamento disponível para cada idioma — idiomas mais falados na internet tendem a ter melhor desempenho.

Além de transcrever no idioma original, o Whisper também consegue traduzir a fala diretamente para o inglês, uma funcionalidade multitarefa embutida no próprio modelo, sem precisar de uma etapa de tradução separada.

Limitações e cuidados

Nenhum modelo é perfeito, e vale conhecer as limitações do Whisper antes de depender dele:

  • Pode 'alucinar' texto em trechos de silêncio prolongado ou ruído intenso — gerando palavras que não foram realmente ditas.
  • A qualidade cai em áudios com muito ruído de fundo, múltiplas pessoas falando ao mesmo tempo, ou gravações de baixa qualidade.
  • Modelos maiores exigem mais memória e processamento — em hardware muito limitado, pode ser necessário usar um modelo menor, com perda de precisão.
  • Idiomas com menos dados de treinamento disponíveis tendem a ter taxas de erro mais altas do que inglês ou espanhol, por exemplo.

Perguntas frequentes

O Whisper é gratuito?

Sim. O modelo é open source, sob licença permissiva, e pode ser baixado e usado sem custo — inclusive para fins comerciais. O que pode ter custo é a infraestrutura ou o software que empacota o Whisper numa experiência pronta para uso.

Preciso saber programar para usar o Whisper?

Para rodar o Whisper diretamente (via linha de comando ou bibliotecas como whisper.cpp), sim, ajuda ter conhecimento técnico. Para usar sem programar, existem aplicativos prontos que já embutem o Whisper, como o Fato AI.

O Whisper funciona sem internet?

Sim, esse é justamente o ponto — depois de baixado, o modelo roda inteiramente offline. Não é necessário enviar áudio para nenhum servidor durante a transcrição.

Qual a diferença entre o Whisper e ferramentas de transcrição em nuvem?

O Whisper é o modelo em si — a peça de IA que converte fala em texto. Ferramentas de transcrição em nuvem geralmente usam algum modelo de fala (às vezes o próprio Whisper, às vezes um proprietário) rodando nos servidores delas. A diferença central não é o modelo, mas onde ele roda: no seu computador ou no servidor de um terceiro. Veja nosso guia sobre transcrição sem enviar áudio para a nuvem para entender essa diferença em detalhe.

Quer usar o Whisper sem precisar configurar nada?

O Fato AI já vem com o Whisper local pronto para uso, escolha de provedor de IA para os resumos, e plano grátis para começar.

Baixar o Fato AI grátis