首页/新闻资讯/正文详情

长上下文旗舰同日登场,推理成本战改写产业算力格局|林伽一 · AI科技日报 | 2026年09月23日

发布时间:2026/9/24 17:54:46 来源:云帆数科 栏目:资讯中心
长上下文旗舰同日登场,推理成本战改写产业算力格局|林伽一 · AI科技日报 | 2026年09月23日
今日 AI 产业出现一组相互印证的信号阶跃星辰发布 600B 参数的 Step 5 Preview、xAI 的 Grok 4.6 上线 Amazon Bedrock、阿里巴巴发布 7B 的 Qwen-Image-2.1同日还有 RBS-Attention 提出 20.65 倍的预填充加速方法、AWS 开源 Strands Harness 智能体框架。长上下文、多模态与推理成本的优化在同一天集中落地说明模型竞赛的焦点正从谁能做转向谁做得起。对技术从业者而言这些进展直接关系到推理服务的选型、成本结构与部署方案。技术主题 1长上下文旗舰同日发布MoE 架构与投机解码成为标配阶跃星辰发布面向智能体工作的新旗舰 Step 5 Preview目标负载为软件工程、专业知识工作与金融领域为总参数约 600B、每词元激活约 27B 的稀疏混合专家MoE模型上下文窗口达 100 万词元主要卖点是成本——团队称模型以显著更低的任务成本提供可比的智能水平[① MarkTechPost]。官方模型文档列出的规格包括模型 ID 为 step-5-preview输入支持文本、图像与视频输出为文本推理强度可选低、中、高并支持流式输出、工具调用、JSON 模式、JSON Schema 与提示缓存[① MarkTechPost]。架构上采用窄而深布局堆叠 92 层 Transformer研究团队认为更深堆叠为隐式多跳推理提供更长路径这在智能体搜索、执行代码与读取工具返回的长预填充阶段尤为重要[① MarkTechPost]。技术栈上Step 5 Preview 采用 MTP-3 投机解码、FP8 MoE 与 KV 缓存卸载训练依赖在线策略与长时程强化学习团队报告长时程强化学习端到端加速超过 3 倍[① MarkTechPost]。xAI 的 Grok 4.6 已在 Amazon Bedrock 中可用提供 50 万词元的上下文窗口支持低、中、高与超高四档可配置推理强度定位长时运行智能体、编码与知识工作[② AWS ML Blog]。两家的共同点是把长上下文与推理成本可控绑定设计而非单纯堆窗口长度。对自建推理服务的团队而言MoE 激活参数占比、投机解码深度与 KV 缓存策略正在成为评估长上下文模型可负担性的关键指标。对这类 MoE 长上下文模型的推理配置可作如下示意理解# 以下为根据公开摘要信息对[MoE长上下文模型推理配置]的理解示意 # 具体实现请查阅StepFun官方技术文档 class MoEInferenceConfig: total_params 600B # 总参数规模 active_per_token 27B # 每词元激活参数约4.5% context_window 1M # 100万词元上下文 reasoning_levels [low, medium, high] # 推理强度档位 speculative_decoding MTP-3 # 3步投机解码加速生成 fp8_moe True # FP8混合精度训练与推理对齐 kv_cache_offload True # KV缓存卸载以支撑长上下文⚠️ 以上伪代码为根据公开信息对该技术逻辑的初步理解示意具体实现请以官方文档为准。技术主题 2Qwen-Image-2.17B 统一图像生成与编辑混合粒度注意力提速阿里巴巴 Qwen 团队发布 Qwen-Image-2.1一个统一的文生图生成与图像编辑模型视觉生成部分为 7B 参数、32 层单流 DiT 结构单一检查点即覆盖文生图、多参考编辑、局部编辑与透明 RGBA 输出[① MarkTechPost]。7B 仅指扩散 Transformer流水线还会加载 8B 的 Qwen3-VL 编码器从最初的 20B 模型到 7BQwen-Image-2.1 把生成与编辑两项能力合并到一个约为原来三分之一大小的模型中团队称其为系列中最均衡、最具成本效益的模型[① MarkTechPost]。其速度主要来自注意力掩码设计文本词元使用词元级因果掩码图像词元在每张图像内使用块级双向掩码Qwen 称之为混合粒度注意力条件前缀位于噪声潜变量之前因而从不关注后者其键与值在去噪步骤间保持固定模型只在第一步计算文本与输入图像并在其余每一步复用该前缀 KV 缓存节省量随参考图像数量增加而增大这解释了多图速度主张[① MarkTechPost]。架构方面GitHub 仓库列出 4 个组件32 层 7B 单流 Transformer、Qwen3-VL 8B 文本编码器、64 通道 RGBA 自编码器16 倍空间压缩与原生透明度、Flow Matching 调度器[① MarkTechPost]。多参考编辑流程可示意如下# 以下为根据公开摘要信息对[Qwen-Image-2.1多参考编辑]流程的理解示意 # 具体实现请查阅Qwen官方技术文档 # 混合粒度注意力文本词元词元级因果掩码 图像词元块级双向掩码 # 条件前缀KV在去噪步骤间固定复用 → 多图场景显著提速 def multi_ref_edit(prompt, ref_images): cond_prefix encode_text_and_images(prompt, ref_images) # 仅第一步计算 z sample_noise() for step in denoise_steps: z transformer_block(z, cond_prefix) # 复用前缀KV缓存 return decode_rgba(z) # 原生透明度输出⚠️ 以上伪代码为根据公开信息对该技术逻辑的初步理解示意具体实现请以官方文档为准。技术主题 3RBS-Attention免训练稀疏预填充20.65 倍加速背后的双分支设计长上下文大语言模型推理日益受限于预填充阶段因为生成开始前稠密自注意力需要处理整个提示。arXiv 新论文提出免训练的稀疏预填充方法 RBS-Attention针对块质心把相关词元埋在无关词元之中、作者称为均值稀释的失效模式[③ arXiv cs.AI]。该方法包含两个互补的选择分支质心基分支捕捉平均相关性救援分支利用最大键块半径及其随提示、层与注意力头变化的分布识别存在被低估风险的块对两个分支独立设阈并合并掩码可控制救援块的贡献同时保留常规的块稀疏 FlashAttention 执行[③ arXiv cs.AI]。实测数据方面在 H100 GPU 上RBS-Attention 在 Qwen3-30B-A3B-Instruct-2507-FP8 模型的 128K 长度下实现 20.65 倍单机预填充注意力加速、11.92 倍 vLLM 预填充注意力加速与 5.97 倍端到端首词元时间加速在稠密 Qwen3-32B 模型上取得 88.65 的 RULER 总体准确率而稠密注意力为 89.52[③ arXiv cs.AI]。配套实验测量了实际保留率、在匹配密度下比较选择器并刻画了块大小、阈值与内存行为。对工程团队而言这类免训练方法与既有 FlashAttention 执行路径兼容是低改造成本接入长上下文推理的可行方向。双分支掩码合并逻辑可示意如下# 以下为根据公开摘要信息对[RBS-Attention双分支选择]的理解示意 # 具体实现请查阅arXiv论文 2609.20971 def rbs_prefill_mask(query_blocks, key_blocks, radius): # 质心基分支捕捉平均相关性按块质心相似度设阈 centroid_mask threshold_by_centroid_similarity(query_blocks, key_blocks) # 救援分支利用最大键块半径识别被低估风险的块 rescue_mask threshold_by_key_block_radius(key_blocks, radius) # 两分支独立设阈后合并掩码保留块稀疏FlashAttention执行 return merge_masks(centroid_mask, rescue_mask)⚠️ 以上伪代码为根据公开信息对该技术逻辑的初步理解示意具体实现请以官方文档为准。技术主题 4开源智能体框架与多设备推理工程侧的降本路径AWS 的 Strands Agents 团队发布 Strands Harness一个完整组装、通用型的开源智能体框架可在本地运行或部署到云厂商以 Apache 2.0 许可证提供 Python 与 TypeScript 版本一行代码即可启动[① MarkTechPost]。团队报告称在 6 个基准上运行相同的 Claude 或 GPT 模型时其成本比其他框架低 28%、精度基本相当[① MarkTechPost]。其开箱即用的 create_harness() 返回的智能体可以通过 Amazon Bedrock、Anthropic、OpenAI、Google、Ollama 或 LiteLLM 运行自带 shell、文件读、写、编辑与网页工具把体积庞大的工具结果卸载到文件并缓存重复使用部分跨运行保持长期记忆并依据会话 ID 恢复对话将开放式子任务委派给内置辅助智能体发现 Agent Skills 时自动加载[① MarkTechPost]。NVIDIA 侧则推出 TensorRT 多设备推理单个 TensorRT 网络可在 NCCL 支持的分布式集合通信上跨多张 GPU 执行同时保留 TensorRT 的推理优化自 TensorRT 11.0 起全面支持[④ NVIDIA Blog]。生成式 AI 的计算与内存需求日益超出单张 GPU 所能提供的范围多设备集成让单个模型的推理跨越 GPU 边界面向多 GPU 服务场景提供了新的部署选项[④ NVIDIA Blog]。对工程团队而言Strands Harness 解决智能体框架选型与成本、TensorRT 多设备解决单模型跨 GPU 扩展两条路径分别从软件层与硬件层压缩智能体运行与模型服务的成本。结合二者一个典型的多 GPU 长上下文服务栈可以同时利用稀疏预填充降低首词元延迟、利用 KV 缓存卸载缓解显存压力、利用跨设备集合通信突破单卡容量——这些优化叠加起来正是长上下文进入可负担区间的工程基础[③ arXiv cs.AI][④ NVIDIA Blog]。技术主题 5智能体评估与 DAPO从工具调用到任务完成的可量化进展NVIDIA 提出智能体评估视角当你上线一个 AI 智能体时关键在于它能否在真实环境中跨几十个顺序工具调用执行一整链工作并在某一步失败时恢复仅仅对模型听起来对不对打分几乎无法说明工作是否真正完成正是这一差距促使智能体评估从对单个函数调用打分演进为对整个任务打分[④ NVIDIA Blog]。这一评估框架对智能体工程有直接参考价值——衡量标准应从模型输出质量迁移到端到端任务完成率与失败恢复能力。开源侧DAPO 发布一个用于大规模大语言模型强化学习的系统基于 Qwen2.5-32B 基础模型在 AIME 2024 上取得 50 分完全开源包括算法细节、数据集与基础设施[⑤ TLDR AI]。这类可复现的强化学习基础设施为开发者提供了训练与评估智能体的开源参考实现。趋势判断趋势一长上下文与推理成本绑定设计成为旗舰模型共同主线。Step 5 Preview 以 600B 总参数、27B 激活、100 万上下文主打成本[① MarkTechPost]Grok 4.6 以 50 万上下文加四档推理强度适配长时运行智能体[② AWS ML Blog]RBS-Attention 则从预填充侧把长上下文成本墙下压 20.65 倍[③ arXiv cs.AI]。三个样本从模型设计、平台接入与算法优化三个层面共同指向把长上下文做进可负担成本区间这一主线。趋势二多模态模型走向更小、更统一、更省。Qwen-Image-2.1 把生成与编辑合并进 7B 单流 DiT较 20B 前代压缩约三分之二[① MarkTechPost]混合粒度注意力与条件前缀 KV 复用直接降低多图场景开销[① MarkTechPost]。多模态推理的硬件门槛正在随参数压缩与注意力优化同步下移。趋势三智能体工程从能做转向可评估、可降本。Strands Harness 以 28% 更低 token 成本提供可比精度[① MarkTechPost]NVIDIA 把智能体评估标准从函数调用升级到整个任务完成[④ NVIDIA Blog]DAPO 提供开源强化学习基础设施[⑤ TLDR AI]。智能体开发正进入以可度量、可复现为特征的工程化阶段。对团队而言这意味着选型标准同步变化除了模型能力本身框架的 token 成本、工具链的失败恢复能力、评估基准的覆盖度都将成为部署决策的核心变量。结尾今日的技术主线清晰长上下文旗舰同日登场、7B 图像模型统一生成与编辑、20.65 倍预填充加速、开源智能体框架与多设备推理同步落地。对开发者而言短期最值得跟进的是 Qwen-Image-2.1 的 Day 0 生态接入Diffusers、ComfyUI、vLLM-Omni、SGLang 与 LightX2V与 Strands Harness 的一行启动体验中期则需要关注 MoE 激活参数占比、投机解码与 KV 缓存策略对推理成本的影响以及智能体评估框架从单函数到全任务的迁移。在长上下文×低成本的主线下谁能把能力做进可负担的成本区间谁就更有可能赢得下一轮部署。【资讯来源】本文综合整理自以下公开信息源。 ① MarkTechPost, 2026年09月21日 14:37 北京时间 / 09月20日 23:37 美西时间 ② AWS ML Blog, 2026年09月22日 02:30 北京时间 / 09月21日 11:30 美西时间 ③ arXiv cs.AI, 2026年09月22日 12:00 北京时间 / 09月21日 21:00 美西时间 ④ NVIDIA Blog, 2026年09月22日 05:51 北京时间 / 09月21日 14:51 美西时间 ⑤ TLDR AI, 2026年09月21日 21:56 北京时间 / 2026年09月21日 06:56 美西时间【免责声明】 本日报为AI行业每日公开信息汇总整理仅供读者快速了解行业动态不构成任何投资建议。所有信息均来源于公开渠道本账号不对其准确性、完整性和时效性作出任何保证。AI行业技术与政策变化迅速内容发布后可能发生更新请以官方最新信息为准。据此作出的任何决策全部风险自担。© 2026 林伽一 · AI科技日报#长上下文 #MoE #Qwen-Image-2.1 #RBS-Attention #智能体框架

相关推荐

第一章-导言
第一章-导言

1.1入门 咱们学习一门编程语言&#xff0c;第一个程序当然是打印"hello worlld". #include <stdio.h>int main() {printf("hello world\n");return 0; } 一个C语言程序的运行必须要有main函数&#xff0c;他是函数的入口。printf("hello world… · 2026/9/24 17:54:46

从零开始用 Linux:文件与目录操作
从零开始用 Linux:文件与目录操作

先确认你在哪&#xff1a;看终端的提示符——fjxfjx:~$ → 已经在 Ubuntu 里&#xff0c;直接往下敲C:\Users\72344> → 还是 Windows 的 cmd&#xff0c;先敲 wsl 回车进去第一步&#xff1a;装 g&#xff08;三条命令&#xff0c;依次敲&#xff09;sudo —— 怎么以管理员… · 2026/9/24 17:54:46

技术碎碎念01
技术碎碎念01

一、多智能体系统1.1 受控多智能体 vs 开放式多智能体开放式的多智能体稳定性太难控制&#xff0c;操作不可预期。受控多智能体是一种很好的解决方案&#xff0c;虽然会丢失一些灵活性&#xff0c;但从企业场景的稳定性来看&#xff0c;很值得考虑。先固定再谈论自由&#xff0… · 2026/9/24 17:54:46

AI+IP赋能专业服务者:将思想资产转化为可复利的数字化变现路径
AI+IP赋能专业服务者:将思想资产转化为可复利的数字化变现路径

我这两年跟深圳不少做专业服务的同行打交道&#xff0c;感触特别深——很多人专业能力很强&#xff0c;客户口碑也好&#xff0c;但就是卡在一个地方&#xff1a;忙完一单又一单&#xff0c;时间全花在交付上&#xff0c;人一停下来&#xff0c;收入就归零。与此同时&#xff0… · 2026/9/24 18:30:49

FunClip 基于ASR的视频剪辑实战:2小时多说话人录像按人拆出3段精华
FunClip 基于ASR的视频剪辑实战:2小时多说话人录像按人拆出3段精华

FunClip 基于ASR的视频剪辑实战&#xff1a;2小时多说话人录像按人拆出3段精华 【免费下载链接】FunClip FunASR-powered video transcription, subtitle generation, and LLM-assisted clipping tool with a local Gradio UI. 项目地址: https://gitcode.com/GitHub_Trendin… · 2026/9/24 18:30:42

Java养老管理系统实战:SSM架构、费用计算与避坑指南
Java养老管理系统实战:SSM架构、费用计算与避坑指南

简介&#xff1a;这份源码面向 Java 开发者、养老行业信息化人员及系统设计学习者&#xff0c;以可运行的完整工程呈现中州养老系统的设计与实践。压缩包共 141 个文件&#xff0c;包括 120 个 Java 源文件、17 个 XML 配置文件&#xff0c;以及 YML、JSON、Git 忽略文件和说明… · 2026/9/24 18:30:36

RHEL 9.2虚拟机安装与初始化配置实战:从VMware到yum源
RHEL 9.2虚拟机安装与初始化配置实战:从VMware到yum源

1. 写在开头&#xff1a;为什么又开始折腾RHEL了如果你是个常年跟Linux打交道的人&#xff0c;一定对Red Hat Enterprise Linux这个名字不陌生。我最近又重新把RHEL装了一遍&#xff0c;起因其实挺简单——手头有个测试环境需要模拟生产服务器的运行场景&#xff0c;而生产那边… · 2026/9/24 18:30:36

VMware Workstation 导入 OVF/OVA 虚拟机模板完全指南
VMware Workstation 导入 OVF/OVA 虚拟机模板完全指南

开头如果你跟我一样&#xff0c;是个在 Windows 电脑上用 VMware Workstation 跑虚拟机的人&#xff0c;那你大概率遇到过这种情况&#xff1a;从网上下载了一个现成的虚拟机镜像&#xff0c;结果解压出来不是一整个文件夹&#xff0c;而是一堆扩展名很陌生的文件——.ovf、.vm… · 2026/9/24 18:30:30

IM聊天体验三支柱:消息状态、通知触达与多端同步
IM聊天体验三支柱:消息状态、通知触达与多端同步

1. 为什么“聊天体验”不是UI动效&#xff0c;而是消息、通知、多端三根承重柱做即时通讯源码的人&#xff0c;十有八九栽在同一个认知陷阱里&#xff1a;以为把气泡动画调得丝滑、输入框加个打字提示、消息列表用上虚拟滚动&#xff0c;就算“体验做好了”。我带过7个IM项目团… · 2026/9/24 18:30:30

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程
基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

简介&#xff1a;这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源&#xff0c;围绕YOLOv8实现渔船作业监控系统&#xff0c;可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件&#xff0c;约24.21MB&#xff0c;以70个Python源码文件为… · 2026/9/24 0:00:13

1D-CNN时间序列建模实战:从Conv1d原理到工业落地
1D-CNN时间序列建模实战:从Conv1d原理到工业落地

简介&#xff1a;面向时间序列数据建模的一维卷积神经网络完整实现&#xff0c;适合深度学习入门者及需要快速验证时序模型的研究者&#xff0c;能够从音频、文本、传感器或股价等序列中挖掘局部特征与时间依赖。压缩包体积很小&#xff0c;只有3KB&#xff0c;内含3个Python脚… · 2026/9/24 0:00:26

柔软的L:汉语语流中被忽视的舌肌张力控制
柔软的L:汉语语流中被忽视的舌肌张力控制

1. 这个“L”不是字母表里的L&#xff0c;而是舌尖上的L最近在几个方言群和语音教学社群里&#xff0c;反复看到有人发一句&#xff1a;“也说字母L&#xff1a;柔软的长舌”。初看以为是英语发音课笔记&#xff0c;点开才发现全是方言爱好者、播音系学生、语言康复师甚至戏曲演… · 2026/9/24 0:00:44

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码