Compare transcrições

Uma gravação. Transcrições diferentes.

Demonstração · Os resultados em direto dos fornecedores ainda não estão ligados.

Transcrição de referência

0:08

Salom, bugungi uchrashuvni soat uchga ko‘chirsak sizga qulay bo‘ladimi?

Ha, taklifnomani yangilasangiz bo‘ladi.

Local
Global

Benchmark indicativo

1 de 8 modelos medidos · 5 clips · 0:33 de áudio

Um valor menor é melhor. WER e CER normalizam maiúsculas, pontuação e apóstrofos. E2E mede um pedido completo; RTF é E2E dividido pela duração do áudio. Áudio sintético, conjunto stt-demo-v1.

dataset=stt-demo-v1audio=synthetic_voice · PCM 24kHz · 16bit · mononormalizer=basic-text-v1reference=written_formtiming=client_e2e_single_request · mean_single_run
PosiçãoFornecedor e modeloWER ↓CER ↓Cobertura
24.6%17.6%5/5
0/5
0/5
0/5
0/5
0/5
0/5
0/5

Transcrição

VoiceLab · Modelo não divulgado

Public preview API · 2026-09-02

WER

0.0%

CER

0.0%

E2E

4.09s

RTF

0.54×

mode=batchlang=uztrials=1region=

Salom bugungi uchrashuvni soat uchga ko'chirsak sizga qulay bo'ladimi Ha taklifnomani yangilasangiz bo'ladi.

Transcrição de referênciaTranscrição

edits=0

Resultados por cenário

Cenário de testeWERCER
Fala clara0.0%0.0%
Conversa0.0%0.0%
Nomes e locais · Números e datas33.3%22.7%
Idiomas misturados10.0%2.9%
Pedido de suporte80.0%70.5%