Qwen-Planner-Agent把 Agent 开发做成“数据—训练—Harness”闭环公开时间北京时间2026 年 9 月 24 日 22:38机构Alibaba Token Hub / MAI Team状态论文预印本 技术报告核心进展阿里MAI团队发布Qwen-Planner-Agent重点不是单独训练一个更强的手机Agent而是建立一套闭环开发框架AI for Data → AI for Training → AI for Harness其中Data多个 Agent 自动构造任务、采集轨迹、分析失败并据此生成下一轮训练数据Training先做planning-oriented SFT再做hybrid-environment online RLCARE根据模型当前能力动态调整reward / advantage在任务成功率和推理、工具调用成本之间做权衡Harness统一接入Memory、Skills、Tools和sub-agent并把执行失败重新反馈给数据与训练环节。作者报告Qwen-Planner-Agent 27B在自建MobilePA-Bench上达到77.05% Overall相比基座模型提升9.83 个百分点。该结果来自团队自建benchmark仍需独立复现。为什么重要真正值得关注的是Model–Harness co-evolution。过去很多Agent系统是固定模型 人工 Harness Benchmark这里变成执行 → 失败证据 → 数据生成 → RL → Harness 修改 → 再执行也就是说模型训练和 Agent runtime 不再完全分离而是共同迭代。与此前工作的关系这项工作延续了Qwen / MAI在Mobile Agent、GUI Agent上的路线但进一步把重点从“模型本身更强”转向训练数据飞轮 Online RL Memory/Skill/Tool Harness 的联合优化。它更像一种agentic post-training runtime co-design方法而不是新的通用基础模型。具体技术路线这个是Qwen论文中给出的lifecycle图这个图里Qwen提出的核心其实不是一个单一训练流程而是一个持续自我改进的AI-for-AI Lifecycle。它把Agent的开发拆成三个相互连接的闭环AI for Data、AI for Training、AI for Harness再用 AI 诊断和人工审核把三个闭环串起来。可以概括成真实任务执行 → 收集轨迹 → 构造/清洗数据 → 训练 Planner → 在线 RL → 真机执行 → 诊断失败 → 回流数据与训练 → 再迭代第一部分是 AI for Data。系统先自动构造可执行任务然后让 Agent 与环境交互收集成功和失败的 trajectory。收集到的数据不会直接拿去训练而是经过 Clean、Filter、Reweight把高价值轨迹筛出来。这里形成第一个循环Task Construction → Trajectory Collection → Data Composition → 再生成新任务意思是数据集不是一次性固定的而是随着模型暴露出的弱点持续更新。第二部分是 AI for Training。整理好的数据先进入 Planning Cold Start让模型通过监督学习掌握基本 planning pattern。之后进入 Online Agentic RL在真实或近真实环境中继续强化。这里的关键是 CARE schedule根据模型当前能力动态调节训练难度和 reward使训练重点跟着模型的短板变化。训练后再做 Planner Evaluation测模型在哪些任务上成功、在哪些地方失败这些诊断结果又反馈给下一轮 cold start 和 RL。于是形成第二个闭环Planning Cold Start → Online Agentic RL → Planner Evaluation → 再训练第三部分是 AI for Harness。训练好的模型并不是裸奔而是放进一个 Harness 里运行。Harness 包括Context Skills Memory模型负责 Plan → Act → RecoverHarness 则提供上下文、技能调用、记忆和运行时支持。系统随后在真实设备上执行任务执行结果再反馈回来。所以这一部分的闭环是Model → Harness → Real-device Execution → Feedback → Model / Harness这点很重要因为 Qwen 的思路不是只优化模型参数而是同时优化模型和 runtime。整个框架最关键的是底部这条“跨层反馈链”Real-device traces → AI-assisted Diagnosis → Human Review → 版本控制 / 审批 → 回流 Data / Training / HarnessAI 先分析失败轨迹提出修改建议人类负责最终审核、版本控制和批准。也就是说它不是完全自动闭环而是 AI 自动诊断 人类治理。如果压缩成一句话Qwen Planner Agent 的 Lifecycle 本质上是一个“数据飞轮 训练飞轮 Harness 飞轮”的三重闭环真实执行产生失败失败被 AI 诊断诊断结果反过来生成新数据、调整训练策略和改进运行时系统从而让 Agent 持续迭代。相比传统流程Dataset → Train → Deploy它更接近Deploy → Observe → Diagnose → Improve Data / Model / Harness → Redeploy这也是这张图最核心的思想。P.S. 这里 lifecycle 一般指的是一个产品“从创建到持续运行和迭代”的全过程针对上述内容中提到的核心模块可以分成AI for Data数据、‘AI for Training’ 训练、AI for Harness执行框架三个部分而且根据技术文档可以把这三个模块理解成一个很清晰的闭环Data负责发现并补齐能力缺口Training负责把数据转化为能力Harness负责把能力稳定地落到真实执行并把执行反馈重新送回前两层。AI for Data把“失败”转成下一轮训练数据核心目标是不是被动收集数据而是根据模型当前不会什么主动生成它最需要的数据。流程可以压缩成能力需求 / 评测失败 → 构造可执行任务 → 多环境采集 trajectory → 验证与筛选 → 调整采样权重 → 进入训练其中有三个关键动作Task Construction根据能力需求或评测暴露的问题自动构造任务明确目标、工具、初始状态和完成条件。Trajectory Collection让 Agent 在 LLM 模拟环境、Sandbox 和真机上执行收集完整的动作、反馈和结果。Weakness Diagnosis根据训练和评测结果判断哪些能力已经掌握、哪些不稳定、哪些完全缺失然后分别做 down-sample / up-weight / new tasks。所以 Data 模块本质上是一个failure-driven data flywheel不是“数据越多越好”而是让每一轮数据都对应一个明确的能力缺口。AI for Training根据模型能力动态调整学习目标核心目标是模型在不同能力阶段不应该使用完全相同的训练目标和奖励。训练分成两步。第一步是 Planning Cold Start / SFT。先用高质量 trajectory 教模型基本的 planning pattern。对于错误动作可以 mask 掉但保留经过验证的 recovery trajectory让模型不仅学会“正确执行”也学会“出错以后怎么恢复”。第二步是 Online Agentic RL。模型进入模拟环境、Sandbox 和精选真机环境中实际执行再根据结果在线更新。这里最关键的是 CARE。它根据当前模型的 competence 动态切换训练重点不会做时 → 强调 exploration / progress基本会做时 → 强调 accuracy / task completion已经稳定会做时 → 强调 efficiency减少冗余 reasoning 和 tool calls也就是先学会做再学会稳定做最后学会高效做。因此 Training 模块不是固定 reward 的 RL而是 competence-aware curriculum。AI for Harness让模型能力在真实环境中稳定发挥Harness 可以理解成 Agent 的 runtime / execution layer。模型主要负责Reasoning → Planning → 输出 structured actionsHarness 负责理解运行时上下文 → 选择技能/工具 → 路由 action → 管理 memory → 执行 → 验证这里有三个关键部分。Scenario Adapter根据当前任务和可用工具加载合适的 skills、instruction 和操作流程。Memory Manager不是简单保存历史而是保留 evidence / provenance检查信息来源、冲突和过期内容。Real-device Execution Verifier实际在设备上执行并记录成功轨迹和失败结果。这些真实执行证据再进入 AI-assisted Diagnosis系统会分析是模型 planning 错了是 memory/context 有问题是 skill 不合适还是 Harness 的 routing / instruction 有问题然后决定下一轮是更新 Model还是更新 Harness或者两者一起更新。所以 Harness 不是固定工程层而是可以与模型 co-evolve 的。总体 Workflow整个系统可以压缩成这一条链真实执行 → 暴露失败 → AI 诊断能力缺口 → 构造针对性任务 → 收集和整理 trajectory → SFT 冷启动 → Online RL → 更新模型 → Harness 真机执行 → 再收集反馈进一步抽象就是Observe → Diagnose → Generate Data → Train → Deploy → Execute → Observe三个模块分别负责AI for Data决定“下一步应该学什么”AI for Training决定“应该怎么学”AI for Harness决定“学到的能力怎么在真实环境中稳定发挥”因此 Qwen Planner Agent 最核心的思想可以概括为把 Agent 开发从一次性的“数据 → 训练 → 部署”变成由真实执行反馈驱动的 Data–Model–Harness 协同演进闭环。最后如果大家感兴趣的话可以仔细阅读相关链接。相关链接arXivQwen-Planner-Agent官方项目页 / Technical Report官方 GitHubHugging Face Papers
企业数字化 ERP 产品动态
相关推荐
【题解-Acwing】1072. 树的最长路径 题目:1072. 树的最长路径
题目描述
给定一棵树,树中包含 n 个结点(编号1~n)和 n−1 条无向边,每条边都有一个权值。
现在请你找到树中的一条最长路径。
换句话说,要找到一条路径,使得路径两… · 2026/9/27 8:52:00
XMind 用久了会遇到的 5 类问题,和我的进阶用法 写在前面
XMind 是我用得最久的效率工具之一,从读书笔记到项目拆解,几乎每天都在用。用得越久,越发现新手期根本意识不到的一些问题——不是软件坏了,是没摸清它的脾气。这篇把常见问题和几个进阶用法一起写出来,帮你… · 2026/9/27 8:51:54
MongoDB 高可用集群部署 MongoDB 高可用集群部署
一、方案概述
1.1 目标
在 K8s 高可用集群上,部署一套 MongoDB 高可用集群,具备:
高可用:3 数据节点副本集,容忍 1 个节点故障自动故障转移:主节点故障时,从节点自动… · 2026/9/27 8:51:48
网站开发jquery避坑指南:5年老兵教你搞定性能优化 网站开发jquery避坑指南:5年老兵教你搞定性能优化 找建站公司,最怕的就是报价单上一串数字,最后发现钱没花在刀刃上,网站还卡得像PPT。很多老板一听“性能优化”就头大,觉得那是程序员的事,其实不然。我见过太多案例,客户花大几万做的网站,… · 2026/9/27 9:29:02
免费解锁Wand专业版功能:Wand-Enhancer完整上手教程 免费解锁Wand专业版功能:Wand-Enhancer完整上手教程 【免费下载链接】Wand-Enhancer Advanced UX and interoperability extension for Wand (WeMod) app 项目地址: https://gitcode.com/GitHub_Trending/we/Wand-Enhancer
Wand-Enhancer 是一个开源的本地补… · 2026/9/27 9:29:02
isomorphic-git 的 deleteRemote 指南:从配置层面安全移除远端仓库 开发工具 【免费下载链接】isomorphic-git A pure JavaScript implementation of git for node and browsers! 项目地址: https://gitcode.com/gh_mirrors/is/isomorphic-git 点击查看 免费下载 本篇文章围绕 isomorphic-git 公开 API 中的 deleteRemote 命令展开&… · 2026/9/27 9:28:56
做pc端网站行情揭秘:改需求拖一周?这份报价避坑指南必看 做pc端网站行情揭秘:改需求拖一周?这份报价避坑指南必看 改个需求建站公司拖一周,这是多少老板心中的痛?我见过太多湖南中小企业的官网,刚上线时看着挺漂亮,结果后台改个Banner图、调个产品参数,沟通群里的消息发出去,对面已读不回,或者回复… · 2026/9/27 9:28:56
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现 简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01
汕头网站建设制作厂家避坑指南:5大注意事项救急 汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习 简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现 简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01
汕头网站建设制作厂家避坑指南:5大注意事项救急 汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习 简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01