transcrevo docs

Precisão e qualidade

WER de 6,34% em português e DER de 4,6% na separação de falantes, medidos por nós contra transcrição humana, com o protocolo de cada número.

Todo número desta página foi medido por nós, contra transcrição e anotação humanas, com o protocolo declarado. Nenhum vem de model card: a normalização de texto move o WER em vários pontos, e número sem protocolo não se compara com nada.

Resumo

MedidaValorOnde
WER em português do Brasil6,34%2.000 trechos de fala espontânea
DER de diarização (sem colar)4,6%19,6 h com anotação humana
DER de diarização (colar de 0,25 s)2,8%216 arquivos
Erro mediano do timestamp de palavra69 a 86 msáudio real, palavras casadas

WER em português do Brasil

Amostra de 2.000 trechos de fala espontânea brasileira com transcrição humana de referência: entrevista e diálogo real, estratificados por tipo de áudio e sorteados com semente fixa. Não é frase lida em estúdio.

SistemaWER
transcrevo (trv-1)6,34%
Geração anterior do transcrevo21,9%

Queda de 71% relativo, vencendo em todas as fatias da amostra e cerca de 10x mais rápido no mesmo lote.

Normalização, idêntica para os dois: minúsculas, pontuação removida, dígito escrito por extenso, hífen vira espaço. O WER é (substituições + deleções + inserções) / palavras da referência.

Cuidado ao comparar com WER publicado por outros sistemas. Trocar o normalizador move a métrica em vários pontos (o mesmo sistema pode marcar 7,7% normalizado e 11,8% cru no mesmo material), e avaliação em frase lida rende números bem melhores do que fala real. Só compare material igual com normalizador igual.

Diarização

Medido em 216 arquivos, 19,6 horas de fala com anotação humana, pelo protocolo padrão de DER. É verdade humana, não comparação com outro sistema.

MétricaValor
DER sem colar4,6%
DER com colar de 0,25 s2,8%
JER15,4%
DER só na fala sobreposta14,8%
Fala perdida / falso alarme / confusão1,55% / 1,72% / 1,37%
Contagem exata de locutores146 dos 216 arquivos

DER (diarization error rate) é a soma de fala perdida, falso alarme e confusão de locutor sobre o tempo total de fala. Quanto menor, melhor.

Timestamps de palavra

Cada palavra volta com start e end em segundos decimais. Erro medido contra referência externa, casando as palavras por texto:

MedidaValor
Erro mediano (p50)69 a 86 ms
Palavras com desvio acima de 1 s3,1% (vlog com música), 1,8% (podcast)

É precisão suficiente para legenda e para cortar o áudio no ponto da palavra.

Limites conhecidos

Publicamos o que ainda erra, porque quem integra precisa saber onde conferir:

  • Fala sobreposta é o pior lugar do sistema: DER de 14,8% nessa fatia contra 4,6% no geral. Duas pessoas falando ao mesmo tempo recebem um rótulo só.
  • Turnos curtos, abaixo de 5 s ("sim", "uhum", uma pergunta rápida): o acerto de locutor cai para a faixa de 59 a 75%, contra 95 a 99% nos turnos acima de 15 s.
  • Nome próprio, marca e anglicismo são o erro mais comum do texto. A correção é o campo glossary da requisição, que reescreve os termos daquele áudio.
  • Música de fundo às vezes vira texto: a letra é transcrita.
  • A saída não é determinística. O mesmo arquivo pode voltar com diferenças pequenas entre execuções. Não existe seed.

Como melhorar a precisão no seu áudio

  • Envie glossary com os nomes próprios e jargões do seu domínio: { "o que ele ouve": "o que escrever" }.
  • Informe language quando você já souber o idioma, em vez de deixar a detecção automática decidir em áudio curto ou com ruído.
  • Peça speakers só quando for usar a separação de falantes: ela muda a tarifa e não melhora o texto.

On this page