首页/新闻资讯/正文详情

Qwen3-ASR 全面解析:52 种语言开源语音识别模型如何叫板 GPT-4o?

发布时间:2026/9/26 22:44:52 来源:云帆数科 栏目:资讯中心
Qwen3-ASR 全面解析:52 种语言开源语音识别模型如何叫板 GPT-4o?
Qwen3-ASR 全面解析:52 种语言开源语音识别模型如何叫板 GPT-4o?【免费下载链接】Qwen3-ASRQwen3-ASR is an open-source series of ASR models developed by the Qwen team at Alibaba Cloud, supporting stable multilingual speech/music/song recognition, language detection and timestamp prediction.项目地址: https://gitcode.com/gh_mirrors/qw/Qwen3-ASRQwen3-ASR 是阿里 Qwen 团队开源的语音识别ASR模型家族支持 30 种语言 22 种中文方言共 52 种的语言自动识别与语音转写还能识别唱歌和带背景音乐的歌曲。它由 1.7B 和 0.6B 两个 ASR 模型、一个非自回归强制对齐模型组成官方数据显示 1.7B 版本在多项开源基准上达到开源 ASR 模型 SOTA效果可与 GPT-4o-Transcribe 等顶级商用闭源 API 正面抗衡——而且完全免费、可私有化部署。️为什么 Qwen3-ASR 值得关注相比 Whisper 等老牌开源方案Qwen3-ASR 把一站式做到了极致能力说明覆盖范围语言识别 语音转写无需预先指定语言自动检测30 种语言中文方言转写四川话、粤语、闽南语等22 种方言英文口音多国/地区口音英语16 种口音唱歌/歌曲识别人声演唱、带 BGM 整首歌语音 歌声流式/离线统一单模型同时支持实时与离线转写—时间戳预测字级/词级时间戳需对齐器11 种语言更关键的是工程体验官方开源了完整的qwen-asrPython 推理框架内置 transformers 和 vLLM 双后端0.6B 小模型在 128 并发下吞吐量可达2000 倍实时非常适合生产环境。5 分钟快速上手 Qwen3-ASR 安装指南第一步一键安装 Python 包推荐在干净的 Python 3.12 环境中操作避免依赖冲突conda create -n qwen3-asr python3.12 -y conda activate qwen3-asr # 最小安装transformers 后端 pip install -U qwen-asr # 启用 vLLM 后端更快推理 流式支持 pip install -U qwen-asr[vllm]第二步加载模型做首次转写import torch from qwen_asr import Qwen3ASRModel model Qwen3ASRModel.from_pretrained( Qwen/Qwen3-ASR-1.7B, dtypetorch.bfloat16, device_mapcuda:0, max_new_tokens256, ) results model.transcribe( audioasr_en.wav, # 支持本地路径 / URL / base64 / numpy 数组 languageNone, # None 自动识别语言 ) print(results[0].language) # English print(results[0].text)模型权重会在首次加载时自动下载离线环境可提前用 ModelScope 或 Hugging Face CLI 手动拉取。完整示例见 example_qwen3_asr_transformers.pyvLLM 后端示例见 example_qwen3_asr_vllm.py。 需要开发或魔改源码可克隆仓库后以 editable 模式安装git clone https://gitcode.com/gh_mirrors/qw/Qwen3-ASR cd Qwen3-ASR pip install -e .双后端推理transformers 与 vLLM 怎么选维度transformers 后端vLLM 后端安装pip install qwen-asrpip install qwen-asr[vllm]初始化Qwen3ASRModel.from_pretrained(...)Qwen3ASRModel.LLM(...)速度常规更快支持大批量流式识别❌✅时间戳✅需加载对齐器✅两者共用同一套transcribe()接口切换后端几乎零成本。若追求极限吞吐推荐 vLLM并可通过 qwen_asr/cli/serve.py 提供的qwen-asr-serve命令直接启动 OpenAI 兼容的推理服务qwen-asr-serve Qwen/Qwen3-ASR-1.7B --gpu-memory-utilization 0.8 --port 8000之后用标准 OpenAI Chat Completions 协议发请求即可现有调用代码基本无需改动。流式识别 时间戳一句话生成逐字字幕实时流式转写Qwen3-ASR 是单模型同时支持流式与离线的 ASR流式推理按 2 秒一块增量喂入音频边说边出字适合会议记录、直播字幕等低延迟场景。官方提供了 Flask 版麦克风流式 Demo一条命令即可体验qwen-asr-demo-streaming --asr-model-path Qwen/Qwen3-ASR-1.7B --port 8000浏览器打开http://your-ip:8000即可对着麦克风实时转写。对应代码在 demo_streaming.pyPython 侧流式示例见 example_qwen3_asr_vllm_streaming.py。字级时间戳预测想要哪个字在第几毫秒出现加载官方强制对齐器 Qwen3-ForcedAligner-0.6B 即可支持 11 种语言、最长 5 分钟音频输出字级中文/日韩或词级拉丁语系时间戳from qwen_asr import Qwen3ForcedAligner aligner Qwen3ForcedAligner.from_pretrained( Qwen/Qwen3-ForcedAligner-0.6B, dtypetorch.bfloat16, device_mapcuda:0, ) results aligner.align(audioasr_zh.wav, text甚至出现交易几乎停滞的情况。, languageChinese) print(results[0][0].text, results[0][0].start_time, results[0][0].end_time)在Qwen3ASRModel中传入forced_aligner参数 return_time_stampsTrue一次调用即可同时拿到识别文本和时间戳。实测成绩Qwen3-ASR 如何叫板 GPT-4o官方评测WER 越低越好中最具代表性的一组对比基准测试GPT-4o-TranscribeWhisper-large-v3Qwen3-ASR-1.7BLibrispeech clean | other (EN)1.39| 3.751.51 | 3.971.63 |3.38AISHELL-2-test (ZH)4.245.062.71KeSpeech 中文方言26.8728.795.10WenetSpeech-Chuan 四川话34.81 | 53.9814.35 | 26.8011.99| 21.63唱歌 M4Singer16.7713.585.98带BGM歌曲 EntireSongs-zh34.86N/A13.91几个关键结论方言是杀手锏中文方言上 1.7B 的 WER 比 GPT-4o 低一半以上KeSpeech 5.10 vs 26.87这是闭源 API 普遍做不到的唱歌识别领先带背景音乐整首歌转写1.7B 全面压制 GPT-4o 与 Gemini-2.5-Pro复杂场景抗噪强内部极端噪声、绕口令基准上1.7B 的 WER16.17 / 2.44同样大幅领先 GPT-4o36.11 / 20.87语言识别准确率平均 97.9%优于 Whisper 的 94.1%。强制对齐器方面Qwen3-ForcedAligner 平均绝对误差 42.9ms比 NFA 快约 3 倍在 5 分钟长音频上优势更夸张52.9ms vs WhisperX 的 2708ms。完整评测表见 README.md 的 Evaluation 章节。微调与部署从 Demo 到生产用自己的数据微调官方提供开箱即用的 SFT 脚本 qwen3_asr_sft.py训练数据只需 JSONL每行一个audio路径 text转写文本支持单卡和多卡 torchrun、断点续训python qwen3_asr_sft.py \ --model_path Qwen/Qwen3-ASR-1.7B \ --train_file ./train.jsonl \ --output_dir ./qwen3-asr-finetuning-out \ --batch_size 32 --lr 2e-5 --epochs 1详细的数据格式说明包括language Englishasr_text...语言前缀的写法见 finetuning/README.md。本地 Web Demo 与 Docker 部署不想写代码两条命令启动可视化界面# 普通 Gradio Demo支持时间戳可视化 qwen-asr-demo --asr-checkpoint Qwen/Qwen3-ASR-1.7B --backend vllm --port 8000生产环境推荐官方 Docker 镜像qwenllm/qwen3-asr装好 GPU 驱动后直接运行容器即可Dockerfile 参考 Dockerfile-qwen3-asr-cu128。总结适合哪些人你的场景推荐方案中文/方言/多语种会议转写Qwen3-ASR-1.7B 离线推理直播字幕、语音助手等实时场景1.7B vLLM 流式推理低成本批量转写0.6B精度换速度2000x 吞吐字幕制作、逐字对齐ASR ForcedAligner-0.6B 组合专有领域医疗/法律等官方 SFT 脚本微调Qwen3-ASR 用开源 SOTA 完整工程工具链证明了私有化部署的语音识别已经不必再向 GPT-4o 妥协。核心代码结构也值得了解——推理封装在 qwen_asr/inference/transformers 后端模型实现在 qwen_asr/core/transformers_backend/技术细节可参阅仓库内的 Qwen3_ASR.pdf 技术报告。【免费下载链接】Qwen3-ASRQwen3-ASR is an open-source series of ASR models developed by the Qwen team at Alibaba Cloud, supporting stable multilingual speech/music/song recognition, language detection and timestamp prediction.项目地址: https://gitcode.com/gh_mirrors/qw/Qwen3-ASR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关推荐

如何用wordpress仿站实操对比评测:3步搞定高仿不翻车
如何用wordpress仿站实操对比评测:3步搞定高仿不翻车

如何用wordpress仿站实操对比评测:3步搞定高仿不翻车 模板网站太丑,客户却非要那个感觉?这种纠结我太懂了。很多站长接到需求,第一反应是去下载源码,结果发现版权不清、代码一团糟,上线后SEO权重归零,甚至被黑客植入后门。这时候,与其盲… · 2026/9/26 22:44:39

综合门户网站开发避坑指南:搞定备案与建站报价
综合门户网站开发避坑指南:搞定备案与建站报价

综合门户网站开发避坑指南:搞定备案与建站报价 做综合门户网站,最让人头疼的往往不是代码写不出来,而是备案流程一头雾水。很多客户拿着需求来找我们,第一句话就是:“我想做个像人民网那样的门户,多少钱?”这时候如果直接甩个【建站报价】表过去,客户… · 2026/9/26 22:44:20

查工程项目的网站:新手入门选型指南,拒绝拖慢进度
查工程项目的网站:新手入门选型指南,拒绝拖慢进度

查工程项目的网站:新手入门选型指南,拒绝拖慢进度 改个需求建站公司拖一周?这种憋屈感,每个刚入行搞前端或独立开发的新手都懂。你想改个查询接口的返回字段,或者调整一下项目列表的排序逻辑,对方却以“架构复杂”、“涉及底层”为由,让你再等三天。对… · 2026/9/26 22:44:20

C++ Builder 游戏程序自定义鼠标光标:从资源加载到运行时切换的完整配置
C++ Builder 游戏程序自定义鼠标光标:从资源加载到运行时切换的完整配置

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/27 0:16:37

AI 编程工具面试题(Claude Code、Codex 等)高阶篇(二):TaoToken 统一 Key 配置与排错实战
AI 编程工具面试题(Claude Code、Codex 等)高阶篇(二):TaoToken 统一 Key 配置与排错实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/27 0:16:31

个人网站外贸实战案例:3步搞定高转化站群
个人网站外贸实战案例:3步搞定高转化站群

个人网站外贸实战案例:3步搞定高转化站群 别被那些花里胡哨的模板骗了。说实话,90%的中小外贸企业官网,看起来都像刚学会用HTML的小学生作业。代码堆砌,配色刺眼,加载慢如蜗牛,用户点进去三秒就关掉。这种“模板网站太丑不够用”的窘境,直接导… · 2026/9/27 0:16:31

朱雀仿宋335人问卷数据深度解读:用户如何决定一款字体的下一步方向
朱雀仿宋335人问卷数据深度解读:用户如何决定一款字体的下一步方向

朱雀仿宋335人问卷数据深度解读:用户如何决定一款字体的下一步方向 【免费下载链接】朱雀仿宋 开源仿宋字库计划 项目地址: https://gitcode.com/TrionesType/zhuque 朱雀仿宋是璇玑造字推出的开源正文仿宋字库计划,志在填补开源仿宋字体长期空缺… · 2026/9/27 0:16:12

手机网站建设哪家强?图解步骤拆解避坑指南
手机网站建设哪家强?图解步骤拆解避坑指南

手机网站建设哪家强?图解步骤拆解避坑指南 模板网站太丑,加载还慢,客户一看就划走?别急着换公司,先搞懂手机网站建设哪家强背后的技术逻辑。很多站长和企业主选建站公司,只看报价和案例,忽略了移动端适配的核心指标。今天不聊虚的,直接上图解步骤,拆… · 2026/9/27 0:16:06

商场设计网站搭建避坑指南:保姆级建站教程助你省下30%预算
商场设计网站搭建避坑指南:保姆级建站教程助你省下30%预算

商场设计网站搭建避坑指南:保姆级建站教程助你省下30%预算 找建站公司怕被坑高价,是很多做商业空间、室内设计的老板们的噩梦。报价单上写着“高端定制”,交出来却是套皮模板,后期改个配色还要加钱,这种糟心事我见得太多了。其实,只要搞懂技术底层逻… · 2026/9/27 0:15:59

MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现

简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01

汕头网站建设制作厂家避坑指南:5大注意事项救急
汕头网站建设制作厂家避坑指南:5大注意事项救急

汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01

多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习

简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01

MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现

简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01

汕头网站建设制作厂家避坑指南:5大注意事项救急
汕头网站建设制作厂家避坑指南:5大注意事项救急

汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01

多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习

简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码