Skip to navigation

East Asian languages

Pulse streaming accuracy on Mandarin, Cantonese, Japanese and Korean.
View as Markdown

East Asian languages - Multi-dataset (Streaming)

WER for the four East Asian languages on the streaming endpoint (US region). Three datasets per language covering read speech (FLEURS), conversational/crowdsourced speech (Common Voice 25), and language-specific corpora (JSUT, Zeroth-Korean, MDCC, AISHELL-1). Compared head-to-head against Deepgram Nova-3. Lower WER is better.

LangDatasetSmallest PulseDeepgram Nova 3
JapaneseCV-2523.84%34.81%
JapaneseFLEURS10.78%17.11%
JapaneseJSUT BASIC500011.47%11.65%
KoreanCV-259.79%9.66%
KoreanFLEURS7.95%10.79%
KoreanZeroth-Korean5.25%6.46%
CantoneseCV-256.16%14.09%
CantoneseFLEURS13.06%15.43%
CantoneseMDCC5.85%12.77%
MandarinCV-2515.99%22.44%
MandarinFLEURS14.25%13.89%
MandarinAISHELL-17.34%8.69%
Average-10.91%15.50%

Pulse averages 10.91% WER vs Deepgram Nova-3’s 15.50% across the four East Asian languages - Pulse leads on 10 of 12 dataset rows, with the largest gains on Japanese CV-25 and Cantonese CV-25.

These four languages stream from wss://api.us.smallest.ai/waves/v1/stt/live?model=pulse only (US region). See the Pulse model card for the region-routing details.