Infraestrutura

Rodar o modelo de transcrição você mesmo ou usar uma API

A conta do modelo aberto não é o preço da GPU, é o que fica em volta dela. Onde cada caminho ganha, e onde uma API de transcrição não serve.

Existe modelo aberto de reconhecimento de fala bom o suficiente para produção, e ele roda numa GPU que você aluga por hora. Então a pergunta é legítima: por que pagar por hora de áudio se dá para pagar por hora de máquina?

A resposta depende de números que só você tem. O que dá para fazer aqui é listar o que entra na conta, porque a comparação que quase todo mundo faz deixa metade de fora.

O que a conta do "eu rodo" costuma esquecer

O preço da GPU por hora é o número fácil, e é o único que aparece na maioria das comparações. Os outros:

Ociosidade. Você aluga por hora de máquina e cobra de si mesmo por hora de áudio. Se a sua fila chega em rajada (e fila de transcrição chega em rajada: reunião termina às 17h, aula sobe à noite, lote de importação entra de madrugada), a GPU fica ligada esperando. Uma placa a 30% de utilização custa três vezes o que a planilha disse.

Escalar e desescalar. Subir uma máquina com o modelo carregado não é instantâneo. Baixar a imagem, carregar os pesos, aquecer. Ou você mantém capacidade parada para a rajada, ou a rajada espera. Os dois custam, um em dinheiro e o outro em latência.

A máquina que falha calada. Este é o custo que ninguém prevê e todo mundo paga uma vez. Uma GPU sem o kernel certo compilado não dá erro: ela entrega transcrito pior. O /health responde 200, a fila anda, e o problema só aparece no ouvido de quem lê o texto, dias depois. Detectar isso exige medição contínua da qualidade, não do uptime.

Retentativa que volta para a mesma máquina. Quando um job falha, o retry ingênuo manda de volta para o mesmo worker, que falha de novo, e o job queima as três tentativas no mesmo lugar. Isso é uma tarde de trabalho para descobrir e outra para consertar.

Manter atualizado. Modelo de fala melhora. Cada troca é uma migração: testar, comparar, garantir que a qualidade subiu no seu material e não só no benchmark de alguém.

Nada disso é impossível. É trabalho de plataforma, e ele tem custo de engenheiro por mês, que é o número mais caro da planilha inteira.

O que a conta da API é

US$ 0,03 por hora de áudio processada, ou US$ 0,05 com separação de falantes, cobrado proporcional ao segundo. Sem assinatura, sem mínimo, sem plano. Acima de 10.000 horas transcritas pela conta, cai para US$ 0,02 automaticamente.

Não se paga por requisição, por armazenamento nem por idioma. Transcrição que falha não é cobrada. A tabela completa está em preços e limites.

Mil horas de áudio por mês são US$ 30. Vinte mil horas são US$ 500. Compare com o que você tem: horas de GPU faturadas, dividido por horas de áudio realmente processadas. Não é o preço da placa por hora: é o preço da placa dividido pelo áudio que ela digeriu, incluindo a ociosidade.

Quando rodar o modelo você mesmo é a escolha certa

Três casos, e eles são reais:

O áudio não pode sair. Requisito de conformidade, contrato com cliente, política interna que não admite processamento por terceiro. Não há preço que resolva isso, e a discussão acaba aí.

A GPU já está lá e ociosa. Se você já mantém uma frota para outra coisa e ela tem folga, o custo marginal de rodar transcrição nela é baixo.

Você precisa de streaming em tempo real. Esta API é assíncrona por construção: você cria a transcrição, ela processa e você recebe o resultado por consulta ou por webhook. Não há endpoint de transcrição ao vivo, palavra por palavra, enquanto alguém fala. Legenda de live e assistente que responde durante a ligação não são casos que ela atende. Se é isso que você precisa, o caminho é outro, e não adianta a gente fingir o contrário.

Quando a API ganha

Volume irregular. Rajada é onde a conta por hora de áudio ganha da conta por hora de máquina, porque a ociosidade não é sua.

Time pequeno. Um engenheiro cuidando de frota de GPU é um engenheiro não cuidando do seu produto. Esse é o custo real, e ele é maior que qualquer diferença de tarifa em volume baixo ou médio.

Você quer o número medido, não o do model card. Este é o ponto sutil. Rodando o modelo você mesmo, a qualidade que você tem é a que a sua configuração produz, e ela não é a mesma que o benchmark publicado: precisão depende de pós-processamento, de normalização, de como o áudio foi segmentado. Medir isso é um projeto por si só.

O que comparar de verdade

Se você está decidindo, o teste que responde não é ler tabela de preço. É rodar o seu áudio nos dois caminhos e comparar o texto com o mesmo normalizador.

Vale saber por quê. O mesmo sistema, no mesmo material, marca 7,7% de WER normalizado e 11,8% cru. Quatro pontos de diferença sem uma linha de código mudar, só pela regra de comparação. Isso quer dizer que WER publicado por um lado não se compara com WER publicado por outro, e a única régua confiável é a que você aplica igual nos dois.

Nossa medição, para você ter um ponto de partida: 6,34% de WER em 2.000 trechos de fala espontânea brasileira, contra transcrição humana de referência, não contra a saída de outro sistema. Fala espontânea, não frase lida em estúdio, que é o material onde todo sistema parece excelente. O protocolo inteiro está em precisão e qualidade e em como medimos a precisão.

A conta nova vem com US$ 2 em crédito, sem cartão, que dá umas 65 horas de áudio. É o suficiente para rodar o seu material real e decidir com o seu número, que é o único que importa nessa escolha.

Todos os posts