Precisão e qualidade
WER de 6,34% em português e DER de 4,6% na separação de falantes, medidos por nós contra transcrição humana, com o protocolo de cada número.
Todo número desta página foi medido por nós, contra transcrição e anotação humanas, com o protocolo declarado. Nenhum vem de model card: a normalização de texto move o WER em vários pontos, e número sem protocolo não se compara com nada.
Resumo
| Medida | Valor | Onde |
|---|---|---|
| WER em português do Brasil | 6,34% | 2.000 trechos de fala espontânea |
| DER de diarização (sem colar) | 4,6% | 19,6 h com anotação humana |
| DER de diarização (colar de 0,25 s) | 2,8% | 216 arquivos |
| Erro mediano do timestamp de palavra | 69 a 86 ms | áudio real, palavras casadas |
WER em português do Brasil
Amostra de 2.000 trechos de fala espontânea brasileira com transcrição humana de referência: entrevista e diálogo real, estratificados por tipo de áudio e sorteados com semente fixa. Não é frase lida em estúdio.
| Sistema | WER |
|---|---|
transcrevo (trv-1) | 6,34% |
| Geração anterior do transcrevo | 21,9% |
Queda de 71% relativo, vencendo em todas as fatias da amostra e cerca de 10x mais rápido no mesmo lote.
Normalização, idêntica para os dois: minúsculas, pontuação removida, dígito
escrito por extenso, hífen vira espaço. O WER é
(substituições + deleções + inserções) / palavras da referência.
Cuidado ao comparar com WER publicado por outros sistemas. Trocar o normalizador move a métrica em vários pontos (o mesmo sistema pode marcar 7,7% normalizado e 11,8% cru no mesmo material), e avaliação em frase lida rende números bem melhores do que fala real. Só compare material igual com normalizador igual.
Diarização
Medido em 216 arquivos, 19,6 horas de fala com anotação humana, pelo protocolo padrão de DER. É verdade humana, não comparação com outro sistema.
| Métrica | Valor |
|---|---|
| DER sem colar | 4,6% |
| DER com colar de 0,25 s | 2,8% |
| JER | 15,4% |
| DER só na fala sobreposta | 14,8% |
| Fala perdida / falso alarme / confusão | 1,55% / 1,72% / 1,37% |
| Contagem exata de locutores | 146 dos 216 arquivos |
DER (diarization error rate) é a soma de fala perdida, falso alarme e confusão de locutor sobre o tempo total de fala. Quanto menor, melhor.
Timestamps de palavra
Cada palavra volta com start e end em segundos decimais. Erro medido contra
referência externa, casando as palavras por texto:
| Medida | Valor |
|---|---|
| Erro mediano (p50) | 69 a 86 ms |
| Palavras com desvio acima de 1 s | 3,1% (vlog com música), 1,8% (podcast) |
É precisão suficiente para legenda e para cortar o áudio no ponto da palavra.
Limites conhecidos
Publicamos o que ainda erra, porque quem integra precisa saber onde conferir:
- Fala sobreposta é o pior lugar do sistema: DER de 14,8% nessa fatia contra 4,6% no geral. Duas pessoas falando ao mesmo tempo recebem um rótulo só.
- Turnos curtos, abaixo de 5 s ("sim", "uhum", uma pergunta rápida): o acerto de locutor cai para a faixa de 59 a 75%, contra 95 a 99% nos turnos acima de 15 s.
- Nome próprio, marca e anglicismo são o erro mais comum do texto. A
correção é o campo
glossaryda requisição, que reescreve os termos daquele áudio. - Música de fundo às vezes vira texto: a letra é transcrita.
- A saída não é determinística. O mesmo arquivo pode voltar com diferenças
pequenas entre execuções. Não existe
seed.
Como melhorar a precisão no seu áudio
- Envie
glossarycom os nomes próprios e jargões do seu domínio:{ "o que ele ouve": "o que escrever" }. - Informe
languagequando você já souber o idioma, em vez de deixar a detecção automática decidir em áudio curto ou com ruído. - Peça
speakerssó quando for usar a separação de falantes: ela muda a tarifa e não melhora o texto.
Preços e limites
US$ 0,03 por hora de áudio, US$ 0,05 com separação de falantes, cobrado ao segundo. Créditos pré-pagos, sem assinatura e US$ 2 na conta nova.
Erros
O envelope de erro da API e a tabela completa de códigos, de validation e invalid_api_key a insufficient_balance, rate_limited e concurrency_limit.