Skip to navigation

Perturbation robustness

Internal English and Hindi perturbation suites: noise, speed, pitch, codecs.
View as Markdown

Internal English Perturbation Benchmark

Not a public dataset. The English audio is sliced by perturbation type (Noise, Silence, Telephony 911, Boundary, Disfluency, Long Audios, Repetition, Entity, Accent, Emotion, Speaker Diversity, Speed, Pitch, Volume, Audio Quality) to isolate model weaknesses. Lower WER is better.

CategoryPulseAssemblyAWSDeepgramScribe
Noise10.9611.9314.1914.5810.05
Silence7.184.228.2213.2810.61
Telephony 91121.0523.9327.8828.4320.29
Boundary2.743.093.183.661.73
Disfluency8.207.819.238.629.29
Long Audios6.608.5811.6611.169.25
Repetition9.109.8210.399.5710.81
Entity6.6910.1313.3511.699.48
Accent8.277.899.5110.427.25
Emotion13.5316.3418.5718.0711.84
Speaker Diversity6.906.728.819.485.95
Speed3.673.634.406.883.74
Pitch2.893.073.214.071.61
Volume2.433.052.413.671.47
Audio Quality2.692.863.034.081.60
Average WER7.538.209.8710.517.66

Internal Hindi Perturbation Benchmark

Not a public dataset. Hindi audio is sliced by perturbation type to isolate model weaknesses. Compared against Sarvam Saaras v3 and Deepgram Nova-3. Most metrics are WER - lower is better. Entity EDR (↑) is higher is better.

CategorySmallest PulseSarvam Saaras v3Deepgram Nova-3
Noise15.76%22.18%21.52%
Silence8.22%11.38%18.40%
Entity8.27%17.36%14.67%
Entity NE-WER13.32%26.72%26.58%
Entity EDR (↑)83.13%76.13%67.80%
Boundary8.03%17.52%17.36%
Long Audios12.00%18.42%19.21%
Speed14.77%21.39%38.21%
Pitch8.14%11.92%19.59%
Audio Quality10.86%11.75%19.51%
Volume7.08%15.25%16.76%
Disfluency10.77%12.06%18.44%
Repetition8.11%11.27%20.40%