用 Codex 实测了一下Qwen3-ASR-1.7B。
**关注指标**
1. 文本和时间戳准确度。
2. 并发能力,转写时间,GPU内存、CPU、内存资源消耗。
3. 对比transformer和vLLM后端性能。
**一些结论:**
1. 中文和英文文本准确度都不错。
2. 中文时间戳比较准,英文很差,其余语种没测试。
3. 用vLLM后端部署需要更多GPU内存,处理更快,批量处理性能更好。
4. Qwen3-ForcedAligner 不支持vLLM,而且会随着音频长度增加,需要GPU内存也会增加,但是处理速度很快。
**部署建议:**
1. Qwen3-ASR-1.7B 和 Qwen3-ForcedAligner-0.6B 单独部署,不要放在同一台机器。
2. Qwen3-ASR-1.7B 使用 vLLM 后端发挥最佳性能。
**代码处理:**
1. 同一个模型实例一次只允许一个线程进入 `model.transcribe。`
2. 可以通过`transcribe 传入批量音频来实现并发。`
3. 使用vLLM部署,长音频需要分割,8到10分钟一个分段比较安全。
**应用场景:**
1. 生成中文字幕(Qwen3-ASR-1.7B + Qwen3-ForcedAligner-0.6B)
2. 生成不带时间戳纯文稿(Qwen3-ASR-1.7B)
3. 多语种实时语音识别 (Qwen3-ASR-1.7B + vLLM)