FIX: preset language=zh in whisperx load_model to prevent tokenizer race on long audio (32+ min)

- Bug: long audio (32+ min) batched inference hit NoneType 'sot_sequence' error
- Root cause: faster-whisper tokenizer reset to None between VAD chunks for multilingual inference when preset_language is None
- Fix: load model with language='zh' to set preset_language, avoiding tokenizer reset
- Side effect: slightly faster (no language detection per file)

Tested on F5 Tech Refresh meeting (32:46 audio, 80 segments, 8072 chars)
Previous: failed with AttributeError: 'NoneType' object has no attribute 'sot_sequence'
After: full transcript + summary generated successfully
This commit is contained in:
IT狗
2026-08-10 23:26:26 +08:00
parent f316b9bbbc
commit 3126021d2e
2 changed files with 303 additions and 0 deletions
+1
View File
@@ -30,6 +30,7 @@ def get_model():
"large-v3",
"cpu",
compute_type="int8",
language="zh", # BUGFIX (2026-08-10): preset language → prevents tokenizer race condition crash on long audio (32+ min) where batched inference hits NoneType 'sot_sequence' bug
asr_options={
"beam_size": 1,
"best_of": 1,