Transkriptionen direkt vergleichen

Eine Aufnahme. Verschiedene Transkriptionen.

Demo · Live-Ergebnisse der Anbieter sind noch nicht verbunden.

Referenztranskription

0:08

Salom, bugungi uchrashuvni soat uchga ko‘chirsak sizga qulay bo‘ladimi?

Ha, taklifnomani yangilasangiz bo‘ladi.

Lokal
Global

Beispiel-Benchmark

1 von 8 Modellen gemessen · 5 Clips · 0:33 Audio

Niedriger ist besser. WER und CER normalisieren Großschreibung, Satzzeichen und Apostrophe. E2E umfasst eine vollständige Anfrage; RTF ist E2E geteilt durch die Audiodauer. Synthetisches Audio, Datensatz stt-demo-v1.

dataset=stt-demo-v1audio=synthetic_voice · PCM 24kHz · 16bit · mononormalizer=basic-text-v1reference=written_formtiming=client_e2e_single_request · mean_single_run
RangAnbieter und ModellWER ↓CER ↓Abdeckung
24.6%17.6%5/5
0/5
0/5
0/5
0/5
0/5
0/5
0/5

Transkription

VoiceLab · Modell nicht veröffentlicht

Public preview API · 2026-09-02

WER

0.0%

CER

0.0%

E2E

4.09s

RTF

0.54×

mode=batchlang=uztrials=1region=

Salom bugungi uchrashuvni soat uchga ko'chirsak sizga qulay bo'ladimi Ha taklifnomani yangilasangiz bo'ladi.

ReferenztranskriptionTranskription

edits=0

Ergebnisse nach Szenario

TestszenarioWERCER
Klare Sprache0.0%0.0%
Gespräch0.0%0.0%
Namen und Orte · Zahlen und Daten33.3%22.7%
Sprachmix10.0%2.9%
Support-Anfrage80.0%70.5%