Compare transcrições
Uma gravação. Transcrições diferentes.
Demonstração · Os resultados em direto dos fornecedores ainda não estão ligados.
Transcrição de referência
0:08
Salom, bugungi uchrashuvni soat uchga ko‘chirsak sizga qulay bo‘ladimi?
Ha, taklifnomani yangilasangiz bo‘ladi.
Local
Global
Benchmark indicativo
1 de 8 modelos medidos · 5 clips · 0:33 de áudio
Um valor menor é melhor. WER e CER normalizam maiúsculas, pontuação e apóstrofos. E2E mede um pedido completo; RTF é E2E dividido pela duração do áudio. Áudio sintético, conjunto stt-demo-v1.
dataset=stt-demo-v1audio=synthetic_voice · PCM 24kHz · 16bit · mononormalizer=basic-text-v1reference=written_formtiming=client_e2e_single_request · mean_single_run
| Posição | Fornecedor e modelo | WER ↓ | CER ↓ | Cobertura |
|---|---|---|---|---|
| — | 24.6% | 17.6% | 5/5 | |
| — | — | — | 0/5 | |
| — | — | — | 0/5 | |
| — | — | — | 0/5 | |
| — | — | — | 0/5 | |
| — | — | — | 0/5 | |
| — | — | — | 0/5 | |
| — | — | — | 0/5 |
Transcrição
VoiceLab · Modelo não divulgado
Public preview API · 2026-09-02WER
0.0%
CER
0.0%
E2E
4.09s
RTF
0.54×
mode=batchlang=uztrials=1region=—
Salom bugungi uchrashuvni soat uchga ko'chirsak sizga qulay bo'ladimi Ha taklifnomani yangilasangiz bo'ladi.
Transcrição de referência → Transcrição
edits=0Resultados por cenário
| Cenário de teste | WER | CER |
|---|---|---|
| Fala clara | 0.0% | 0.0% |
| Conversa | 0.0% | 0.0% |
| Nomes e locais · Números e datas | 33.3% | 22.7% |
| Idiomas misturados | 10.0% | 2.9% |
| Pedido de suporte | 80.0% | 70.5% |