首页/新闻资讯/正文详情

Audio8 ASR Infinite 架构深度解析:Voxtral 音频塔 + Qwen2.5 解码器的流式设计

发布时间:2026/9/26 18:07:19 来源:云帆数科 栏目:资讯中心
Audio8 ASR Infinite 架构深度解析:Voxtral 音频塔 + Qwen2.5 解码器的流式设计
Audio8 ASR Infinite 架构深度解析Voxtral 音频塔 Qwen2.5 解码器的流式设计【免费下载链接】Audio8-ASR-Infinite项目地址: https://ai.gitcode.com/hf_mirrors/Edge0/Audio8-ASR-InfiniteAudio8 ASR Infinite是一个开源的原生流式语音识别Streaming ASR模型由 Voxtral Realtime 音频塔与 Qwen2.5-3B 文本解码器组合而成配合 Rolling KV Cache可实现不限长度的 24/7 实时转写且内存与延迟保持恒定。它支持 80/120/160 ms 三档可选择的音频时钟、240–560 ms 可配置的转写延迟中英双语输出并内置语义 VAD语音活动检测头。下面用一篇文章带你读懂它的流式架构设计。为什么需要「流式语音识别」传统离线 ASR 需要等音频录完再处理而流式识别一边听一边出字适合会议实时字幕、实时对话、24/7 监控录音等场景。Audio8 ASR Infinite 针对流式场景做了三项关键设计能力说明⚡ 超快响应原生流式架构80 ms 时钟下每秒解码 12.5 次♾️ 不限长度Rolling KV Cache 让内存和延迟在长期运行中保持恒定️ 时钟可选80/120/160 ms 三档音频时钟对应 12.5 / 8.3 / 6.25 次文本决策/秒⏱️ 延迟可调target_delay_ms可在 240–560 ms 之间权衡速度与准确率 语义 VAD区分「思考停顿」「口吃」与「真正的轮次结束」传统声学 VAD 在此容易失效架构总览三部件的流式流水线整个模型是一条单向流水线音频 → 音频塔 → 投影器 → Qwen 解码器 → 文本。各部件的初始权重与训练情况如下见 README.md组件初始权重是否训练Causal Audio Tower音频塔Voxtral Realtime 4B✅Audio Projector投影器随机初始化✅Frame Length Embedding帧长嵌入随机初始化✅Decoder解码器Qwen2.5-3B-Instruct✅LM HeadQwen2.5-3B-Instruct✅具体规格可查 config.json音频塔32 层、hidden 1280、128 mel bins、sliding window 750config.json#L5-L27特征提取器为 16 kHz / 128 mel 的VoxtralRealtimeFeatureExtractorpreprocessor_config.json解码器36 层、hidden 2048、16 个 query 头 / 2 个 KV 头GQA词表 151936config.json#L91-L159投影器max frame len 8 → 投影维度 10240激活函数 geluconfig.json#L64-L65权重文件约 8.17 GB 的 model.safetensorsbfloat16权重分片索引见 model.safetensors.index.json。流式解码器层Voxtral 风格延迟调制与普通 LLM 不同音频塔的每个 decoder 层Qwen2RealtimeV1DecoderLayer/Qwen3RealtimeV1DecoderLayer在 attention 之后、MLP 之前插入了一层AdaRMSNorm 时间调制把「当前延迟了多少个 token」编码成t_cond按层缩放隐状态。这个设计的核心逻辑在 modeling_audio8_asr_infinite.py文件头部注释也点明了机制num_delay_tokens - sinusoidal time embedding - per-layer adaptive MLP - post-attention hidden scaling也就是说模型不是「被动地」知道当前处于流的哪个位置而是每个解码层都显式感知「延迟时间」这正是它能在流中稳定输出、不漂移的关键。帧长嵌入一套权重三档时钟模型同时支持 4/6/8 三种 frame_len对应 80/120/160 ms 时钟。为了让一个共享的投影器同时服务三档时钟configuration_audio8_asr_infinite.py 启用了use_frame_len_embedding用一段可学习嵌入把「当前用了哪档帧长」信息加到时间嵌入上modeling_audio8_asr_infinite.py#L1074-L1089。音频时钟与转写延迟如何选参数这是使用者最关心的一步。frame_len决定时钟档位target_delay_ms决定「牺牲多少延迟换准确率」且delay 必须是时钟的整数倍。各档位的已训练最优组合如下音频时钟frame_len左填充 token 数可选target_delay_ms80 ms418240 / 320 / 480 / 560120 ms612240 / 480160 ms89320 / 480换算关系delay 毫秒 ÷ 时钟毫秒 延迟 token 数直接写在 config.json#L46-L61 的num_delay_tokens_by_frame_len中配置类的参数校验逻辑见 configuration_audio8_asr_infinite.py#L208-L224。新手建议追求低延迟选 80 ms 240 ms delay追求准确率选 80 ms 480 ms delay下文评测即此配置。Rolling KV Cache24/7 转写不漂移该 checkpoint 的原生上下文只有 30 秒但适配版 vLLM 通过Rolling KV Cache 精确 RoPE 重基re-basing让缓存窗口不断滚动从而在连续数小时的音频上保持内存与延迟有界README.md#L189-L191。部署上推荐 Docker Compose 一键启动同一个 socket 还提供网页实时演示和 WebSocket 客户端README.md#L164-L191。语义 VAD不止是「有声音 / 没声音」除了转写本仓库还附带一组独立的语义 VAD 头权重semantic_vad_heads.safetensors。它在文本主干的最终隐状态上挂了 4 个分类器分别预测未来 0.5 / 1.0 / 2.0 / 3.0 秒内会出现多少个语义单元8 分类第 0 类即「轮次结束」配置见 config.json#L66-L72挂载逻辑在 modeling_audio8_asr_infinite.py#L585-L624。相比传统声学 VAD它能区分「用户还在思考的停顿」「口吃」和「真的说完了」对实时对话的产品体验提升很大。评测表现80 ms 时钟 480 ms 延迟下的硬指标在贪心解码、80 ms 时钟、target_delay_ms 480的设置下README.md#L100-L112测试集指标Audio8 ASR InfiniteVoxtral-Mini-4B-Realtimenemotron-3.5-asr-streamingaishell1/testCER1.75016.79512.927 560msaishell4/testCER2.89316.45614.677 560mslibrispeech test.cleanWER3.0422.2103.353 560mslibrispeech test.otherWER6.8085.5527.140 560ms平均3.62310.2539.524中文场景优势非常明显aishell1 CER 从 16.795 降到 1.750英文场景与 Voxtral 各有胜负整体平均分 3.623 显著领先。仓库文件速查文件作用config.json音频塔 / 解码器 / 流式时钟等全部超参configuration_audio8_asr_infinite.py配置类含帧长与 delay 的解析校验modeling_audio8_asr_infinite.py模型主体音频塔 投影器 流式解码层 语义 VADmodel.safetensors合并后的主权重约 8.17 GBbfloat16semantic_vad_heads.safetensors语义 VAD 头权重4 个时间尺度 × 8 类tokenizer_config.jsonQwen2 分词器及[STREAMING_PAD]、[LANGUAGE_ZH]等流式专用 tokenpreprocessor_config.json16 kHz / 128 mel 音频特征提取参数chat_template.jinja对话模板小结Audio8 ASR Infinite 用「Voxtral 因果音频塔 帧长感知投影器 Qwen2.5 解码器」的三件套加上按层感知的延迟时间嵌入和Rolling KV Cache把「实时性、准确率、无限时长」这三件通常难以兼得的事捏在了一起。对新手而言上手只需三步选时钟档位 → 定target_delay_ms→ 用 vLLM 或 Torch 模拟流式解码跑通第一条转写。想深入细节直接读 modeling_audio8_asr_infinite.py 的build_t_cond与forward两个方法即可抓住核心。【免费下载链接】Audio8-ASR-Infinite项目地址: https://ai.gitcode.com/hf_mirrors/Edge0/Audio8-ASR-Infinite创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关推荐

YOLOv8大豆叶病检测实战:环境搭建到模型部署完整链路
YOLOv8大豆叶病检测实战:环境搭建到模型部署完整链路

简介:面向计算机视觉初学者与农业智能化研究者,这份压缩包以YOLOv8实现大豆叶病目标检测,完整展示从数据集构建、模型设计到训练推理的YOLO框架搭建流程。资源共7个文件,包含6个Python脚本和1个Markdown说明,脚本分别覆… · 2026/9/26 18:07:19

UltraEdit/UEStudio 恢复默认窗口设置:TaoToken 配置骨架与验证清单
UltraEdit/UEStudio 恢复默认窗口设置:TaoToken 配置骨架与验证清单

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 18:07:19

CTESP 2026 EI会议投稿指南:通信电子与信号处理方向的选题与避坑策略
CTESP 2026 EI会议投稿指南:通信电子与信号处理方向的选题与避坑策略

不绕弯子,直接聊。搞通信、电子、信号处理方向的研究生和青年学者,这几年手上攒了几篇论文却不知道往哪儿投的情况太常见了。投SCI周期太长,毕业等不起;投水会被学院直接不看;投国内核心吧,部分方向又不太认… · 2026/9/26 18:07:10

View UI Table 与 Page 组件分页实战:前端分页与服务端分页完整指南
View UI Table 与 Page 组件分页实战:前端分页与服务端分页完整指南

1. 分页到底在解决什么问题:先想清楚场景再动手先讲个现象。我见过不少刚接触 View UI(以前叫 iView)的开发者,拿到 Table 和 Page 组件后第一件事就是照着文档抄一遍代码,抄完发现表格能显示数据、页码也能点&#xf… · 2026/9/26 18:38:08

C++算法模板库:从设计到实战的完整指南
C++算法模板库:从设计到实战的完整指南

简介:这是一份面向竞赛编程与算法学习者的C算法模板库,聚焦在有限时间内快速调用经过优化的常用算法与数据结构,解决大规模数据与高性能计算场景下的实现难题。压缩包共127个文件,以123个cpp源码为主体,另含2个md说明、… · 2026/9/26 18:38:08

YOLOv8推理性能benchmark实战指南:构建可归因的FPS坐标系
YOLOv8推理性能benchmark实战指南:构建可归因的FPS坐标系

1. 这不是跑个demo就完事的“FPS测试”:YOLOv8推理速度 benchmark 的真实战场你看到过太多标题写着“YOLOv8 FPS实测:RTX3060跑出120帧!”的文章,点进去一看,代码就三行,测试图是单张19201080的空旷街道&am… · 2026/9/26 18:38:08

YOLOv8 CPU推理FPS工程化优化实战指南
YOLOv8 CPU推理FPS工程化优化实战指南

1. 项目概述:为什么FPS不是数字游戏,而是工程落地的生死线YOLOv8模型推理速度测试——这个标题看起来像实验室里的一次常规性能摸底,但在我过去三年部署过47个工业视觉项目的实操经验里,它从来不是“测一测就完事”的轻量动作。FP… · 2026/9/26 18:38:08

el-table在el-dialog中高度变小?根源与三种解决方案
el-table在el-dialog中高度变小?根源与三种解决方案

前阵子做个后台管理系统的订单弹窗,遇到一个特别诡异的样式问题:同一个el-table,单独放在页面里,height"400"严丝合缝;一旦放进el-dialog里,打开弹窗后表格就跟被人捏扁了似的,高度只… · 2026/9/26 18:38:08

智慧水务Axure高保真原型实战:解压、交互与避坑指南
智慧水务Axure高保真原型实战:解压、交互与避坑指南

简介:智慧水务云平台Axure高保真原型由ilovemockup.club整理,是一套面向产品经理、交互设计师、前端开发者及水务信息化项目团队的高保真交互演示资源,旨在帮助相关人员在系统开发前直观理解平台架构、界面布局、功能模块与操作路径&#xff… · 2026/9/26 18:38:01

数据库课后习题答案别硬背:当测试用例集刷,效率翻倍
数据库课后习题答案别硬背:当测试用例集刷,效率翻倍

简介:万常选版《数据库原理与设计》课后习题答案资源,覆盖第2至6章及第9章,适合正在学习关系模型、数据库建模、关系数据理论与模式求精的本科生、自学者作为复习与自测材料。压缩包共7个文件,含3个doc参考答案、2个sql示例脚本、… · 2026/9/26 0:00:21

OpenClaw 替代品?Hermes Agent 踩坑实录:macOS 飞书接入 TaoToken 配置
OpenClaw 替代品?Hermes Agent 踩坑实录:macOS 飞书接入 TaoToken 配置

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 0:00:40

向下兼容与向上兼容:接口设计中的兼容性策略与工程实践
向下兼容与向上兼容:接口设计中的兼容性策略与工程实践

一次版本升级事故,是很多团队绕不过去的坎。线上环境里,服务端明明已经上线了新版接口,老的移动端还在照着旧文档传参数。请求一到网关,校验直接拒绝,用户操作失败,客服群炸了锅,开发群里开始互… · 2026/9/26 0:00:46

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码