首页/新闻资讯/正文详情

Qwen3-ASR 方言识别实战:粤语、四川话等 22 种中文方言转写完整指南

发布时间:2026/9/27 7:51:44 来源:云帆数科 栏目:资讯中心
Qwen3-ASR 方言识别实战:粤语、四川话等 22 种中文方言转写完整指南
Qwen3-ASR 方言识别实战:粤语、四川话等 22 种中文方言转写完整指南【免费下载链接】Qwen3-ASRQwen3-ASR is an open-source series of ASR models developed by the Qwen team at Alibaba Cloud, supporting stable multilingual speech/music/song recognition, language detection and timestamp prediction.项目地址: https://gitcode.com/gh_mirrors/qw/Qwen3-ASRQwen3-ASR 是阿里云 Qwen 团队开源的语音识别(ASR)模型系列,能一句话完成粤语、四川话等 22 种中文方言的语音转写,同时支持 30 种语言识别、歌唱语音识别和时间戳对齐。本文面向新手,带你从零完成环境安装、方言音频转写,再到时间戳、流式识别等进阶玩法。 为什么方言识别难?Qwen3-ASR 强在哪传统语音识别模型遇到方言时,准确率往往会断崖式下跌——粤语识别错误率动辄 20% 以上,四川话更难处理。Qwen3-ASR 基于通义千问 Qwen3-Omni 的基础音频理解能力,用大规模语音数据训练,主打**一个模型全包**:✅All-in-one:同一个模型同时做语言/方言识别 语音转写✅方言覆盖广:30 种语言 22 种中文方言 多国英语口音✅又快又稳:1.7B 版本在开源 ASR 模型中达到 SOTA,0.6B 版本在 128 并发下吞吐量可达 2000 倍✅能听歌:支持纯语音、歌声、带背景音乐(BGM)的歌曲转写✅流式/离线统一:单模型同时支持流式与离线推理,最长可转写 20 分钟音频️ 支持的 22 种中文方言完整清单以下是 Qwen3-ASR-1.7B / 0.6B 支持的 22 种中文方言(完整信息见 README.md):类别支持的方言 18 种省级方言安徽、东北、福建、甘肃、贵州、河北、河南、湖北、湖南、江西、宁夏、山东、陕西、山西、四川、天津、云南、浙江 粤语口音粤语(港式口音)、粤语(广式口音)️ 其他吴语/闽语吴语、闽南语此外还独立支持 30 种语言(含中文、英文、粤语 Cantonese、日文、韩文、阿拉伯文等)。也就是说,粤语既可以作为语言强制指定,也会作为两种口音被覆盖。 快速上手:3 步完成你的第一句方言转写第 1 步:安装环境推荐新建一个干净的 Python 3.12 环境,然后安装qwen-asr包:conda create -n qwen3-asr python3.12 -y conda activate qwen3-asr pip install -U qwen-asr 追求最高推理速度和流式识别,请安装 vLLM 后端:pip install -U qwen-asr[vllm]如果本地开发,可克隆仓库源码安装:git clone https://gitcode.com/gh_mirrors/qw/Qwen3-ASR,然后pip install -e .(详见 pyproject.toml)第 2 步:加载模型import torch from qwen_asr import Qwen3ASRModel model Qwen3ASRModel.from_pretrained( Qwen/Qwen3-ASR-1.7B, dtypetorch.bfloat16, device_mapcuda:0, )模型权重会根据模型名自动下载;国内网络建议用 ModelScope 手动下载到本地目录(命令见 README.md)。第 3 步:转写一段方言音频results model.transcribe(audiocantonese_sample.wav) # 本地路径 / URL / base64 均可 print(results[0].language) # 自动识别出的语言/方言 print(results[0].text) # 转写文本就这 3 步,一段粤语或四川话音频就能变成文字。更多输入形式(URL、base64、内存波形)可参考示例 examples/example_qwen3_asr_transformers.py。 如何指定方言:自动检测 vs 强制语言(重要技巧)新手最容易困惑的一点:能不能把四川话填进language参数?答案是:不能直接填。language参数只接受 30 种受支持的语言名(如Cantonese、Chinese),清单定义在 qwen_asr/inference/utils.py 的SUPPORTED_LANGUAGES中,省级方言(四川话、东北话等)并不在列。正确做法分两种场景:方言音频(如四川话):设languageNone,模型会自动检测并输出识别结果,方言转写能力由模型本身保障粤语:可以直接写languageCantonese强制指定,此时模型输出纯文本(跳过语言检测),速度更快、更稳定# 四川话:自动检测 model.transcribe(audiosichuan.wav, languageNone) # 粤语:强制指定 model.transcribe(audiocantonese.wav, languageCantonese)长音频也无需手动切分:模型会自动按低能量边界切块(默认最长 20 分钟),再无缝拼回完整文本。⏱️ 进阶:给方言转写添加时间戳做字幕、剪视频时,光有文字还不够,还需要每个字/词出现在第几秒。Qwen3-ASR 家族中的Qwen3-ForcedAligner-0.6B专门解决这个非自回归时间戳对齐问题,支持中文、粤语等 11 种语言,对最长 3 分钟语音输出任意粒度的时间戳,精度超越 WhisperX 等主流方案(详见 qwen_asr/inference/qwen3_forced_aligner.py)。用法只需在加载模型时多传两个参数:model Qwen3ASRModel.from_pretrained( Qwen/Qwen3-ASR-1.7B, dtypetorch.bfloat16, device_mapcuda:0, forced_alignerQwen/Qwen3-ForcedAligner-0.6B, forced_aligner_kwargsdict(dtypetorch.bfloat16, device_mapcuda:0), ) results model.transcribe(audiosichuan.wav, return_time_stampsTrue) print(results[0].time_stamps[0].text, results[0].time_stamps[0].start_time)直接调用强制对齐器(给定文本音频求时间戳)的完整示例见 examples/example_qwen3_forced_aligner.py。️ 免代码体验:一键启动本地 Web Demo不想写代码?安装后直接运行两条命令即可:# 普通识别 Web UI(上传方言音频,点一下出结果) qwen-asr-demo --asr-checkpoint Qwen/Qwen3-ASR-1.7B --backend transformers --cuda-visible-devices 0 --ip 0.0.0.0 --port 8000 # 流式识别 Web Demo(麦克风实时粤语/四川话转写,vLLM 后端) qwen-asr-demo-streaming --asr-model-path Qwen/Qwen3-ASR-1.7B --gpu-memory-utilization 0.9 --port 8000然后浏览器打开http://你的IP:8000。加上--aligner-checkpoint Qwen/Qwen3-ForcedAligner-0.6B还能在界面上看到时间戳。命令行参数逻辑可查阅 qwen_asr/cli/demo.py 与 qwen_asr/cli/demo_streaming.py。 方言识别效果:官方基准数据一览官方在公开数据集上对比了 GPT-4o-Transcribe、Gemini-2.5-Pro、Whisper-large-v3 等(完整表格见 README.md),方言相关结果(WER,越低越好):数据集方言类型Whisper-large-v3Qwen3-ASR-1.7BKeSpeech多地方言混合28.795.10Fleurs-yue粤语9.183.98CV-yue粤语16.237.57WenetSpeech-Yue粤语(短/长)32.26 / 46.645.82 / 8.85WenetSpeech-Chuan四川话(易/难)14.35 / 26.8011.99 / 21.63Dialog-Chinese Dialects(内部)22 种方言平均44.5515.94可以看到,在粤语和四川话上,Qwen3-ASR-1.7B 相对 Whisper 有数倍精度优势,在 22 种方言平均错误率上更是从 44.55% 降到 15.94%。 常见问题 FAQQ1:1.7B 和 0.6B 该选哪个?精度优先选 1.7B(SOTA 级);部署并发量大、追求吞吐量选 0.6B(128 并发下可达 2000 倍吞吐量),两者用法完全一致。Q2:支持什么音频格式?最长多长?本地路径、URL、base64、内存波形均可;采样率不限,内部自动重采样到 16kHz。单次最长 20 分钟,自动切块拼接;开时间戳时按 3 分钟一块处理。Q3:没有 GPU 能跑吗?模型默认面向 GPU(bfloat16 推理),显存紧张时可调小max_inference_batch_size;也可以安装 FlashAttention 2 进一步省显存,或使用官方 Docker 镜像(构建文件见 docker/Dockerfile-qwen3-asr-cu128)。Q4:识别效果想再优化,能微调吗?可以。项目内置 SFT 微调脚本,支持 JSONL 音频-文本对、多卡 torchrun 训练,详见 finetuning/README.md 与 finetuning/qwen3_asr_sft.py。Q5:流式识别有什么限制?流式推理目前仅支持 vLLM 后端,且不支持批量推理和时间戳输出(限制逻辑见 qwen_asr/inference/qwen3_asr.py 中init_streaming_state的说明)。 项目资料导航资料说明README.md官方说明:安装、部署、基准评测全在这examples/transformers / vLLM / 流式 / 强制对齐四类示例代码finetuning/微调教程与 SFT 脚本qwen_asr/inference/qwen3_asr.py统一推理封装(转写/流式/时间戳)qwen_asr/cli/Web Demo 与 vLLM 服务命令行入口assets/Qwen3_ASR.pdf技术报告 PDF,想了解模型架构必读⚡ 小结:Qwen3-ASR 用一个模型 两种后端 一个对齐器,把粤语、四川话等 22 种中文方言识别变成了三行代码的事——装包、加载、转写,方言字幕党可以冲了!【免费下载链接】Qwen3-ASRQwen3-ASR is an open-source series of ASR models developed by the Qwen team at Alibaba Cloud, supporting stable multilingual speech/music/song recognition, language detection and timestamp prediction.项目地址: https://gitcode.com/gh_mirrors/qw/Qwen3-ASR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关推荐

Claude Code核心引擎QueryEngine内幕:4.6万行代码如何实现LLM流式工具调用循环
Claude Code核心引擎QueryEngine内幕:4.6万行代码如何实现LLM流式工具调用循环

Claude Code核心引擎QueryEngine内幕:4.6万行代码如何实现LLM流式工具调用循环 【免费下载链接】claude-code Claude Code is an agentic coding tool that lives in your terminal, understands your codebase, and helps you code faster by executing routine ta… · 2026/9/27 7:51:44

关键词林俊杰mp3对比评测
关键词林俊杰mp3对比评测

告别模板丑站:3个维度拆解林俊杰MP3网站建站报价与SEO实战 模板网站太丑不够用,这几乎是每个刚接触建站的朋友都踩过的坑。你看着那些千篇一律的后台,页面卡顿、配色土气,甚至手机端直接崩版,心里只想问一句: 建站报价… · 2026/9/27 7:51:38

《FDE前沿部署工程师实战教程》24 - Enterprise AI Data Plane:数据、知识、Memory与企业上下文统一管理
《FDE前沿部署工程师实战教程》24 - Enterprise AI Data Plane:数据、知识、Memory与企业上下文统一管理

AI真正理解企业,不只是因为它拥有一个更大的模型,而是因为它能够安全、准确、持续地访问企业上下文。在前面的章节中,我们已经逐步构建了Enterprise AI的核心基础设施:LLM↓ RAG↓ Agent↓ Tool↓ Workflow↓ Event Bus↓ Agent R… · 2026/9/27 7:51:38

网站广告动图怎么做的3个坑与注意事项
网站广告动图怎么做的3个坑与注意事项

网站广告动图怎么做的3个坑与注意事项 改个需求建站公司拖一周,这行话估计戳中了不少人的肺管子。昨天客户突然想换首页 Banner… · 2026/9/27 8:26:50

DeepCTR 之 DeepFEFM 模型实战指南:Field-Embedded Factorization Machines 的原理、参数与消融实验
DeepCTR 之 DeepFEFM 模型实战指南:Field-Embedded Factorization Machines 的原理、参数与消融实验

人工智能深度学习机器学习 【免费下载链接】DeepCTR Easy-to-use,Modular and Extendible package of deep-learning based CTR models . 项目地址: https://gitcode.com/gh_mirrors/de/DeepCTR 点击查看 免费下载 导读 DeepFEFM(Field-Embedded Facto… · 2026/9/27 8:26:38

外贸网站推广企业建站多少钱?备案避坑与实操指南
外贸网站推广企业建站多少钱?备案避坑与实操指南

外贸网站推广企业建站多少钱?备案避坑与实操指南 做外贸网站,很多老板一上来就问“多少钱”,但真正卡住脖子的,往往是备案流程一头雾水。你以为注册个域名就能干,结果发现没备案连服务器都连不上,或者备案卡在“主体信息不一致”上,折腾半个月还没影。… · 2026/9/27 8:26:27

[通信与计算Adv]:诺基亚和爱立信警告称,人工智能正在使电信成本更高
[通信与计算Adv]:诺基亚和爱立信警告称,人工智能正在使电信成本更高

诺基亚和爱立信警告称,人工智能正在使电信成本更高 AI is making telecom more expensive, warn Ericsson and Nokia 人工智能(AI)领域的旺盛需求导致了零部件短缺,并推高了网络设备供应商的芯片成本,这些成本最终可能… · 2026/9/27 8:26:08

PX4 CameraTrigger uORB 消息详解:相机触发信号的定义、生成与消费链路
PX4 CameraTrigger uORB 消息详解:相机触发信号的定义、生成与消费链路

嵌入式物联网机器人自动驾驶智能硬件 【免费下载链接】PX4-Autopilot PX4 Autopilot Software 项目地址: https://gitcode.com/gh_mirrors/px/PX4-Autopilot 点击查看 免费下载 CameraTrigger 是 PX4 飞控中用于发布"相机拍摄触发事件"的核心 uORB 主题&… · 2026/9/27 8:26:08

别再把它们搞混了!传统 AI vs Agent:一文讲透本质区别
别再把它们搞混了!传统 AI vs Agent:一文讲透本质区别

前言:一个真实场景,两种截然不同的结局 上周我让 AI 帮我做同一件事:“分析一下我们上季度的销售数据,找出下滑原因,出一份报告。” 传统 AI(ChatGPT 对话框)的结局: 我导出 CSV&… · 2026/9/27 8:25:56

MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现

简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01

汕头网站建设制作厂家避坑指南:5大注意事项救急
汕头网站建设制作厂家避坑指南:5大注意事项救急

汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01

多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习

简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01

MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现

简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01

汕头网站建设制作厂家避坑指南:5大注意事项救急
汕头网站建设制作厂家避坑指南:5大注意事项救急

汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01

多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习

简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码