Transcrever uma audiência sem mandar o áudio para a nuvem é possível, gratuito e razoavelmente simples em 2026: o Whisper, modelo de reconhecimento de fala publicado pela OpenAI sob licença MIT, roda no seu computador, transcreve em português e não envia nada para fora. É a resposta ao mantra "não mande o áudio sensível pra nuvem" — porque a gravação de uma audiência é, ao mesmo tempo, o documento mais sensível e o mais tentador de jogar num serviço online.
Este guia diz o que o Whisper é, que máquina precisa, qual modelo escolher, quanto demora e — a parte que importa mais que a ferramenta — a regra de uso que evitou o erro do caso de Maceió. Eu não sou advogado; sou de tecnologia, com mais de dez anos no mercado jurídico, e este é o exemplo que uso para mostrar que "local" não é sinônimo de "pronto".
O que é o Whisper (e por que "local" muda a conversa)
O Whisper é um modelo de reconhecimento de fala de uso geral, publicado pela OpenAI, cujo código e pesos estão sob licença MIT — ou seja, livre para uso, inclusive profissional. Ele suporta mais de 99 idiomas, português incluído, e instala com um comando no computador; a partir daí, a transcrição acontece na sua máquina (OpenAI Whisper, README).
O que "local" muda para uma audiência: o áudio contém voz de partes, testemunhas, o juiz, dados de saúde, de família, financeiros. Mandar isso a um serviço online é enviar prova de processo a um terceiro. Com o Whisper local, o arquivo não sai — e a pergunta "para onde vai isso?" tem a resposta que o sigilo exige. O raciocínio é o mesmo da IA local no escritório; aqui, aplicado ao áudio.
Qual modelo escolher (a tabela oficial, traduzida)
O Whisper vem em tamanhos, e o tamanho decide precisão, velocidade e a máquina necessária. A tabela do projeto, em ordem de grandeza:
Modelo | Parâmetros | Memória de vídeo aproximada | Velocidade relativa | Para que serve |
|---|---|---|---|---|
tiny | 39 milhões | ~1 GB | ~10× mais rápido | Teste; precisão baixa em português |
base / small | 74 / 244 milhões | ~1–2 GB | rápido | Rascunho de reunião interna |
medium | 769 milhões | ~5 GB | médio | Bom equilíbrio para audiência em máquina comum |
large / large-v3 | 1,55 bilhão | ~10 GB | 1× (o mais lento) | A melhor precisão; o large-v3 reduziu erros em 10–20% em relação ao anterior |
turbo | — | menor | rápido | Versão otimizada do large para velocidade |
A regra prática: para audiência, medium ou large, conforme a máquina; para reunião interna, small basta. Há ainda variantes treinadas pela comunidade para português brasileiro (publicadas em repositórios abertos), que reportam taxas de erro menores no nosso idioma — são projetos de terceiros, sem garantia, e valem teste antes de adotar.
Que máquina precisa e quanto demora
A máquina que roda o Whisper local com conforto tem placa de vídeo com 5 a 10 GB de memória para os modelos medium e large, ou um Mac com Apple Silicon e 16 GB ou mais. Sem placa dedicada, roda no processador — mais lento, mas roda.
Quanto demora: depende do modelo e do hardware, e a ordem de grandeza honesta é esta — com placa de vídeo, uma audiência de duas horas em modelo large leva da ordem de dezenas de minutos; só no processador, pode levar mais que a própria audiência. É por isso que o modelo medium é o ponto de equilíbrio para a maioria: precisão boa, tempo aceitável.
Duas dicas de fluxo: deixe a transcrição rodando enquanto faz outra coisa (não é tarefa para esperar olhando), e separe os falantes com uma ferramenta de apoio ou manualmente depois — o Whisper transcreve, mas não identifica quem fala.
A regra que o caso de Maceió ensinou
A transcrição automática serve para achar, não para provar. Em 2026, num processo trabalhista em Maceió, a degravação por IA de uma audiência saiu com erro e o juiz fixou valores devidos ao trabalhador com base nela — a correção veio depois, na conferência com o audiovisual, que é e continua sendo o registro oficial do ato. O caso está detalhado no guia de transcrição com IA no jurídico.
Os três pontos em que qualquer transcritor — local ou em nuvem — mais erra numa audiência:
Números falados. Valores, datas, percentuais: "quatorze" vira "quarenta". São exatamente os trechos que decidem.
Vozes sobrepostas. A parte responde por cima do advogado; a transcrição funde ou perde.
Nomes próprios e termos técnicos regionais. O modelo não conhece o nome da testemunha nem o jargão local.
A regra, em uma linha: a transcrição localiza o minuto; a citação vai para a peça depois de você ouvir o trecho no vídeo. Todo número, prazo e nome extraído de uma degravação automática se confere no áudio original antes de virar argumento.
O protocolo do escritório para audiência gravada
Baixe o audiovisual oficial do sistema do tribunal — é a fonte.
Transcreva local (Whisper medium ou large), na máquina dedicada, sem internet.
Marque os trechos que importam na transcrição — é o índice.
Ouça cada trecho marcado no vídeo e copie a citação do que ouviu, com o minuto.
Guarde os dois na pasta do caso: a transcrição (como índice) e a lista de trechos conferidos (como prova).
O passo 4 é o que separa o uso profissional do risco. Sem ele, "local" só significa que você errou em casa — e é a mesma régua que atravessa todo o uso de inteligência artificial no Direito: a IA vale pelo que você confere.




