Vosk Medium English (Batch)
vosk-medium-en-batch · v1.0.2
batchen-USvoskvosk-model-en-us-0.22
Scoring
Primary metric: wer · Tie-breakers: real_time_factor, energy_wh
Metrics: wer, wer_substitutions, wer_deletions, wer_insertions, cer, cer_substitutions, cer_deletions, cer_insertions, real_time_factor, cpu_pct, ram_mb, energy_wh, temperature_c
Changelog
- v1.0.0 — Initial profile (larger per-language vosk model, alongside the existing small tier).
- v1.0.1 — Declare wer/cer substitution/deletion/insertion breakdown metrics, now that the runner computes them.
- v1.0.2 — Declare model.vad (false -- this adapter never applies it) and model.context_reset (per_utterance -- the adapter constructs a fresh KaldiRecognizer per utterance, no shared decode state to carry across calls in the first place) so a reader never has to infer these from adapter code.
Full definition
{
"id": "vosk-medium-en-batch",
"version": "1.0.2",
"title": "Vosk Medium English (Batch)",
"benchmark_type": "batch",
"language": "en-US",
"runtime": {
"name": "vosk",
"min_version": "0.3.44"
},
"model": {
"name": "vosk-model-en-us-0.22",
"vad": false,
"context_reset": "per_utterance"
},
"configuration": {
"threads": 4
},
"normalization": {
"lowercase": true,
"remove_punctuation": true,
"expand_numbers": true,
"ruleset_id": "goesb-en-v1"
},
"scoring": {
"primary_metric": "wer",
"tie_breakers": [
"real_time_factor",
"energy_wh"
]
},
"metrics": [
"wer",
"wer_substitutions",
"wer_deletions",
"wer_insertions",
"cer",
"cer_substitutions",
"cer_deletions",
"cer_insertions",
"real_time_factor",
"cpu_pct",
"ram_mb",
"energy_wh",
"temperature_c"
],
"changelog": [
{
"version": "1.0.0",
"notes": "Initial profile (larger per-language vosk model, alongside the existing small tier)."
},
{
"version": "1.0.1",
"notes": "Declare wer/cer substitution/deletion/insertion breakdown metrics, now that the runner computes them."
},
{
"version": "1.0.2",
"notes": "Declare model.vad (false -- this adapter never applies it) and model.context_reset (per_utterance -- the adapter constructs a fresh KaldiRecognizer per utterance, no shared decode state to carry across calls in the first place) so a reader never has to infer these from adapter code."
}
]
}