Blog do transcrevo
Notas técnicas sobre transcrição de áudio, diarização e o que medimos no caminho.
- Integração
Como transcrever áudio por API, do zero ao texto
Três requisições HTTP transformam um arquivo de áudio em texto com timestamps. Sem SDK, sem fila para configurar, sem servidor de GPU.
- Diarização
O que é diarização e quando você precisa dela
Diarização responde "quem falou o quê". É uma tarefa separada da transcrição, cobra à parte e erra em lugares específicos que vale conhecer antes de integrar.
- Preços
Quanto custa transcrever áudio por API
US$ 0,03 por hora de áudio, cobrada por segundo. O que isso significa numa fila de mil horas, e as três armadilhas de preço que aparecem na fatura de quem não leu a letra miúda.
- Qualidade
Como medimos a precisão em português, e por que WER de terceiro não se compara
6,34% de WER em fala espontânea brasileira, medido contra transcrição humana. O número importa menos que o protocolo, e é o protocolo que quase ninguém publica.
- Idiomas
Detecção automática de idioma na transcrição, e quando desligar
São mais de 90 idiomas com detecção automática. O campo language existe porque a detecção erra em áudio curto e com ruído, e o erro dela custa o transcrito inteiro.
- Timestamps
Timestamp por palavra: o que dá para construir com isso
Cada palavra volta com início e fim em segundos decimais, com erro mediano de 69 a 86 ms. Busca dentro do áudio, corte de clipe e destaque sincronizado saem daí.
- Atendimento
Transcrever ligações de atendimento: o que dá certo e o que não dá
Ligação gravada é o áudio mais previsível que existe: duas vozes, um assunto, sempre o mesmo formato. Isso muda o que vale pedir para a API e o que vale conferir no resultado.
- Qualidade
Como corrigir nome próprio errado na transcrição
Nome, marca e jargão são o erro mais comum de qualquer transcrição automática. O campo glossary conserta isso por requisição, e tem limites que vale conhecer antes de montar a lista.
- Infraestrutura
Rodar o modelo de transcrição você mesmo ou usar uma API
A conta do modelo aberto não é o preço da GPU, é o que fica em volta dela. Onde cada caminho ganha, e onde uma API de transcrição não serve.
- Escala
Transcrição em lote: milhares de arquivos sem quebrar a fila
O que muda quando o lote sai de dez arquivos para dez mil: tetos de requisição, saldo reservado, cobrança duplicada e as falhas que valem retentar.
- Integração
Webhook ou polling numa API de transcrição assíncrona
Consultar em laço funciona para um arquivo e vira cem requisições por job em produção. O que muda com webhook, como conferir a assinatura e o que fazer quando o seu servidor estava fora do ar.
- Podcast
Como transcrever podcast por API, do RSS ao acervo inteiro
O enclosure do feed já é uma URL pública, então o podcast é o caso mais fácil de transcrever. O trabalho está no acervo antigo, no nome dos convidados e no que fazer com o texto.
- Reuniões
Como transcrever reunião por API e virar ata com quem falou
Da gravação ao texto separado por falante, com o código que agrupa palavras em turnos. E onde a separação erra em reunião de verdade, que é sempre no mesmo lugar.
- Legendas
Como gerar legenda automática em SRT a partir do áudio
A API devolve cada palavra com início e fim em segundos. Este post mostra o código que transforma isso em SRT e em VTT, e onde a legenda automática costuma sair errada.