本地语音识别怎么选:Qwen3-ASR、FireRedASR2 与 CPU 字幕、歌词方案

面向 Windows CPU 本地部署,比较 Qwen3-ASR 0.6B/1.7B 与 FireRedASR2-AED 的准确率、运行方案和字幕接口,说明字词时间戳、完整歌曲识别、人声分离与英文识别的适用条件,并给出可执行的本机选型步骤。

Ha Fung0 阅读

本地语音识别怎么选:Qwen3-ASR、FireRedASR2 与 CPU 字幕、歌词方案

作者:Ha Fung
资料核实日期:2026 年 10 月 7 日

一台 Windows 电脑,仅靠 CPU,也能承担视频转写、字幕制作和歌词识别。实际选型需要同时看三件事:识别文本的质量、本机处理速度,以及时间戳能否顺利进入字幕流程。

中文视频与会议字幕,优先测试 FireRedASR2-AED INT8;英文、多语言和带伴奏歌曲,优先测试 Qwen3-ASR-1.7B INT4;响应速度和内存更紧张时,从 Qwen3-ASR-0.6B 或轻量模型开始。 这套建议依据公开评测与现有部署路径,最终选择由自己的音频和电脑共同决定。

1. Qwen3-ASR 的两个尺寸各自适合什么

Qwen 官方当前公开的 ASR 尺寸为 0.6B 和 1.7B。另一个名字相近的 Qwen3-ForcedAligner-0.6B 负责把文本对齐到音频,形成时间戳。Qwen 官方模型与组件说明

0.6B 适合追求较低资源占用、较快响应的桌面工具;1.7B 适合把识别质量放在更高位置的离线转写。技术报告说明,1.7B 版包含 Qwen3-1.7B、约 300M 参数的音频编码器及投影层,整体约为 2B 级;0.6B 版搭配约 180M 参数的音频编码器。部署资源应按完整网络估算。Qwen3-ASR 技术报告:模型结构

官方报告中的中文识别数据也支持这种分工。CER 是字符错误率,数值越低,转写错误越少。

中文测试集Qwen3-ASR-0.6B CERQwen3-ASR-1.7B CER
WenetSpeech net5.97%4.97%
WenetSpeech meeting6.88%5.88%
AISHELL-23.15%2.71%

这些是报告所列模型的评测成绩。CPU 量化版本的精度还受导出方式、量化算法与解码配置影响。Qwen3-ASR 技术报告:识别评测

2. 中文优先时,FireRedASR2-AED 值得作为主力候选

FireRed 团队在同一套评测中报告了以下结果:

评测范围FireRedASR2-AED 平均 CERQwen3-ASR-1.7B 平均 CER
4 个普通话测试集3.05%3.76%
19 个中文方言、口音测试集11.67%11.85%

普通话平均成绩相差 0.71 个百分点,方言、口音平均成绩相差 0.18 个百分点。FireRedASR2-AED 因此很适合进入中文会议、访谈、课程视频的首轮测试。具体方言的表现还应查看单项结果,并补充自己的录音。FireRedASR2S 官方评测表

两者的用途可以这样分配:

使用场景优先测试选择依据
普通话视频、会议、访谈FireRedASR2-AED官方中文评测与字幕接口值得优先考察
英文、多语言内容Qwen3-ASR-1.7B英文公开评测较充分,语言覆盖广
完整歌曲转歌词Qwen3-ASR-1.7B官方提供带伴奏完整歌曲评测
CPU 响应与内存优先Qwen3-ASR-0.6B小尺寸适合资源受限的桌面部署

这里给出的是按任务安排的测试顺序。公开评测、量化版本和个人素材之间存在条件差异,本机结果决定最终配置。

3. CPU 部署:选定模型之后,还要选运行路径

FireRedASR2-AED:从 sherpa-onnx INT8 开始

sherpa-onnx 提供 sherpa-onnx-fire-red-asr2-zh_en-int8-2026-02-26 模型包。文档列出的编码器约 779M、解码器约 398M,合计约 1.2GB 量级,另有词表。项目还提供文件识别、VAD 长音频切段和麦克风示例。sherpa-onnx FireRed 预训练模型文档

这条路径适合把识别引擎嵌入桌面程序。先用模型包附带音频确认运行,再输入自己的视频录音;制作逐字字幕时,把时间戳输出列为单独验收项。

Qwen3-ASR-1.7B:社区 ONNX INT4 已有 CPU 实测

社区项目 andrewleech/qwen3-asr-onnx 提供导出工具和预导出模型。其推荐配置采用 INT4 解码器;当前推荐包的音频编码器采用 FP32。1.7B 包压缩下载约 2.7GB,展开约 4GB。

该项目记录的 Ryzen AI 7 PRO 350、原生 Windows、ONNX Runtime 2.0 rc12 测试中,1.7B INT4 的短音频 RTF 约为 0.29;LibriSpeech test-other 的 200 条样本 WER 为 4.20%。项目配置与 CPU 测试记录

RTF 的计算方式是“处理时间 ÷ 音频时长”。0.29 相当于每分钟音频约需 17.4 秒计算时间,这是依据该短音频结果的换算。长文件还包含解码、切段、加载、对齐与字幕整理等耗时;实际吞吐要用目标电脑测量。压缩包大小、展开磁盘占用和运行峰值内存,也分别记录。

Qwen3-ASR-0.6B 与 GGUF 路线

0.6B 可以先尝试 sherpa-onnx 提供的 INT8 模型与 CPU 示例,统一运行框架有利于桌面程序维护。sherpa-onnx Qwen3-ASR 文档

偏好本地命令行或 C++ 集成时,可考察社区 asr.cpp。项目基于 llama.cpp/mtmd,列出 Qwen3-ASR 两个尺寸、CPU 构建和 SRT/VTT/LRC 等输出,并要求主 GGUF 与配套 mmproj 文件。asr.cpp 项目说明

选择社区部署包时,固定模型来源、运行时版本、量化配置和命令参数。将识别、切段与对齐组件分别接入程序,后续替换某个模型会更方便。

4. 两个模型都能做字幕,字词时间戳需要逐条核对

字幕制作包含“识别文本”和“确定时间”两个步骤。SRT 需要每句的起止时间;ASS 可以进一步控制样式,并通过卡拉 OK 标签实现逐字、逐词高亮。

FireRedASR2-AED 的官方 Python 接口提供 return_timestamp=True,示例中返回中文字符、英文词的起止时间,以及转写置信度。FireRed 官方 Python 示例

运行路径决定这些字段能否取得。 sherpa-onnx 当前 AED 文档的文件识别示例中,timestamps 与 durations 返回空数组。需要逐字时间时,应检查所用版本的实际结果,再选用官方时间戳路径或另配强制对齐工具。sherpa-onnx AED 示例输出

Qwen 的官方时间戳方案是 Qwen3-ASR + Qwen3-ForcedAligner-0.6B。后者接收音频和文本,返回字词级时间;官方支持范围为 11 种语言、最长约 5 分钟的语音对齐。长文件应分段后处理,对齐组件的 CPU 运行与资源占用也需单独验证。Qwen 强制对齐模型说明

字幕流程可以安排为:

音视频 → 提取音频 → 切段并保存原始时间偏移
      → ASR 识别 → 文本校对、标点和分句
      → 获取或重新生成字词时间 → 导出 SRT / ASS

例如,自拟片段“你好”在切段内对应 你 0.40–0.70 秒、好 0.70–1.00 秒,片段从原文件第 120 秒开始,那么全局时间就是 120.40–120.70 和 120.70–121.00 秒。分段识别后,把偏移加回原时间轴,字幕才能与视频一致。

歌词式 ASS 再把各字持续时间换算为百分之一秒,写入卡拉 OK 标签。生成后抽查句首、句尾、停顿和拖长音;置信度可以帮助安排校对顺序。

5. 歌词识别:先处理原曲,再按效果尝试人声分离

Qwen 官方把语音、歌唱人声和带背景音乐的歌曲都列为支持的音频类型。1.7B 技术报告对完整带伴奏歌曲列出 EntireSongs-en 14.60%、EntireSongs-zh 13.91% 的错误率,表中以 WER 标注。Qwen 歌曲评测

因此,Qwen3-ASR-1.7B 的推荐起点是:直接输入原曲,检查歌词,再决定增强处理。 这组结果支持完整歌曲识别能力,也提示发布歌词前应安排校对。

FireRedASR2-AED 同样支持歌唱转写。FireRed 官方评测表中的 OpenCpop CER 为 1.17%,同表 Qwen3-ASR-1.7B 为 2.57%。OpenCpop 与 EntireSongs 各有自己的素材和评测条件,各自用于判断对应场景。FireRed 歌唱识别评测

对商业歌曲、MV 或现场录音,建议按以下顺序处理:

  1. 用原曲识别,重点检查副歌重复、专有词、拖长音和说唱段落。
  2. 伴奏遮盖、强混响或多声部重叠明显时,尝试人声分离工具,再对相同片段识别。
  3. 对照原曲和分离版本的歌词结果,选错误较少的文本,并校对。
  4. 用最终文本对齐时间轴,抽查合唱、长音和换气处。

人声分离在这里承担增强实验。处理效果受歌曲混音和分离模型影响,应同时检查分离产生的音频伪影。

歌词转写和逐字对齐各自有验收目标。Qwen ForcedAligner 的公开支持说明以语音为主;歌曲里的拖长音、重叠声部和伴奏,需要用真实歌曲验证对齐效果。已有可靠歌词时,可以直接从文本校对和对齐开始。Qwen 对齐模型的音频范围

6. 英文识别:Qwen3-ASR-1.7B 是明确的首轮候选

Qwen 技术报告列出的英文 WER 如下:

英文测试集Qwen3-ASR-1.7BWhisper large-v3
LibriSpeech clean1.63%1.51%
LibriSpeech other3.38%3.97%
GigaSpeech8.45%9.76%
FLEURS-en3.35%4.08%

Qwen 在其中多个测试集表现较好,Whisper 在 clean 项成绩更低。英文视频、播客或多语言内容,可以优先试 Qwen3-ASR-1.7B,并保留现有工作流程作为对照。Qwen 英文公开评测

FireRedASR2 官方也列出英文及中英混说支持。以本篇核实材料为依据,Qwen 的英文多场景评测更便于判断,因此这里的推荐侧重公开证据与使用范围。FireRed 支持范围

英语口音、人名、产品名和多人重叠,均应进入本机测试集。中英混说的录音单列一组,有助于检查语言切换、英文词拼写和字幕分句。

7. 其他模型在本地工具里仍有明确位置

桌面软件可以保留一个轻量引擎完成快速预览,再调用质量优先的引擎生成最终稿。原讨论中的其他候选,按用途保留即可:

  • FireRedASR2-CTC INT8:sherpa-onnx 从 AED 模型提取 CTC 分支,文档列出约 740MB 模型,并强调 CPU 速度。适合重点测试短片段和麦克风分段字幕;该路径按离线模型与模拟流式流程理解。CTC 部署文档
  • SenseVoice-Small:非自回归结构适合低延迟转写,可作为已有中文工具的速度基线;发布检查点覆盖普通话、粤语、英语、日语和韩语。SenseVoice 官方说明
  • Fun-ASR-Nano-2512:中文方言、热词及领域词汇值得测试。模型卡示例提供热词参数,也链接到 CPU/GGUF 运行方案。Fun-ASR-Nano 模型卡
  • Parakeet TDT 0.6B v3 与 Whisper:Parakeet v3 的官方语言范围为 25 种欧洲语言,可进入英文高吞吐候选;已有 Whisper 字幕流程的用户,可保留熟悉的格式和后处理作为评估基线。Parakeet 官方模型卡

FireRedASR2-LLM 也值得关注:官方资料列出 8B+ 参数规模,普通话平均 CER 为 2.89%。较大的资源需求意味着 CPU 桌面部署应优先完成加载、内存与耗时评估。FireRedASR2S 技术报告

8. 用同一批音频决定最终配置

本地部署可以从三个明确选择开始:中文语音字幕测试 FireRedASR2-AED INT8;英文、多语言和歌曲测试 Qwen3-ASR-1.7B INT4;资源受限时测试 Qwen3-ASR-0.6B INT8/INT4。逐字字幕额外验收时间戳与对齐组件。

实际动手时,先准备四组各 1–3 分钟的素材:普通话、嘈杂或远场语音、中英混说、带伴奏歌曲。把现有引擎与候选模型放到同一台电脑,用相同音频、采样率和分段设置比较。

每个方案记录识别错误、加载时间、稳定运行耗时和峰值内存。制作字幕时再抽查字词起止时间;歌曲还要比较原曲与分离版本。完成短片段筛选后,用一段较长录音确认稳定性和总处理时间。

集成桌面工具时,把模型选择保留为可切换配置:中文转写、英文与歌曲、快速预览分别使用测试胜出的引擎,最终统一进入校对、对齐和 SRT/ASS 导出流程。先在自己的素材上跑通一段准确、对时的字幕,再扩展到批量处理。