Confronta le trascrizioni
Una registrazione. Trascrizioni diverse.
Demo · I risultati in tempo reale dei fornitori non sono ancora collegati.
Trascrizione di riferimento
0:08
Salom, bugungi uchrashuvni soat uchga ko‘chirsak sizga qulay bo‘ladimi?
Ha, taklifnomani yangilasangiz bo‘ladi.
Locale
Globale
Benchmark indicativo
1 modelli misurati su 8 · 5 clip · 0:33 di audio
Un valore più basso è migliore. WER e CER normalizzano maiuscole, punteggiatura e apostrofi. E2E misura una richiesta completa; RTF è E2E diviso per la durata audio. Audio sintetico, dataset stt-demo-v1.
dataset=stt-demo-v1audio=synthetic_voice · PCM 24kHz · 16bit · mononormalizer=basic-text-v1reference=written_formtiming=client_e2e_single_request · mean_single_run
| Posizione | Fornitore e modello | WER ↓ | CER ↓ | Copertura |
|---|---|---|---|---|
| — | 24.6% | 17.6% | 5/5 | |
| — | — | — | 0/5 | |
| — | — | — | 0/5 | |
| — | — | — | 0/5 | |
| — | — | — | 0/5 | |
| — | — | — | 0/5 | |
| — | — | — | 0/5 | |
| — | — | — | 0/5 |
Trascrizione
VoiceLab · Modello non pubblicato
Public preview API · 2026-09-02WER
0.0%
CER
0.0%
E2E
4.09s
RTF
0.54×
mode=batchlang=uztrials=1region=—
Salom bugungi uchrashuvni soat uchga ko'chirsak sizga qulay bo'ladimi Ha taklifnomani yangilasangiz bo'ladi.
Trascrizione di riferimento → Trascrizione
edits=0Risultati per scenario
| Scenario di test | WER | CER |
|---|---|---|
| Parlato chiaro | 0.0% | 0.0% |
| Conversazione | 0.0% | 0.0% |
| Nomi e luoghi · Numeri e date | 33.3% | 22.7% |
| Lingue miste | 10.0% | 2.9% |
| Ordine e assistenza | 80.0% | 70.5% |