首页/新闻资讯/正文详情

小模型能当裁判吗?一场关于强化学习奖励成本的实验

发布时间:2026/9/25 18:25:27 来源:云帆数科 栏目:资讯中心
小模型能当裁判吗?一场关于强化学习奖励成本的实验
先问你一个问题。如果你要训练一个AI模型写深度研究报告怎么判断它写得好不好数学题有标准答案代码题能跑测试用例可一篇论文该不该给9分还是7分谁说了算过去几年大模型圈子里流行的做法是找一个更聪明的模型来打分。GPT-4o、GPT-5这种量级的裁判模型逐条对照评分标准给出Yes或No的判断再汇总成一个分数当作强化学习的奖励信号。这套流程叫做基于评分标准的强化学习听起来挺优雅问题在于它贵得吓人。想象你在开一家餐厅每做一道菜都要请一位米其林大厨过来试吃打分才能决定这道菜算不算合格。大厨确实专业但请一次的成本够你雇十个学徒。强化学习训练一个模型往往需要成千上万次打分每次打分还要对照好几条评分标准逐一判断这笔开销滚雪球一样越滚越大。纽约大学和耶鲁大学的一组研究者就想搞清楚一件事能不能换一个便宜得多的裁判但打分质量不打折这就是这篇论文要回答的核心问题。评分标准怎么打分一个被忽略的细节先弄清楚一件事。大模型当裁判这件事其实有两种玩法。一种是拿两个回答放在一起比较让裁判说哪个更好这叫成对比较*给模型两份答案裁判只需要选出胜者不用说明每一处具体的好坏。这种方式简单粗暴但有个致命缺陷它把所有评判维度压缩成一个笼统的谁赢了你根本不知道哪个回答在哪些地方做得好哪些地方翻车了。另一种是逐点打分*给定一个问题、一份评分标准rubric里列出的具体条目让裁判针对每一条判断这份回答是否满足要求。评分标准rubric*一份列出多条具体要求及其权重的清单比如是否提到了光合作用需要光能是否说明了二氧化碳和水生成糖类每条要求分配不同权重最后按权重加总算出总分。论文选择研究逐点打分因为强化学习里真正要用的就是这种精细颗粒度的信号。你想训练模型学会某种能力光知道这次输出比上次好是不够的你得知道具体是哪个环节进步了哪个环节还在拖后腿。这就好比健身教练不能只告诉你今天练得不错得告诉你深蹲姿势对了卧推重量还不够这样你才知道下次该往哪使劲。但这里有个尴尬的现实市面上现成的评测数据集压根没有为这种逐点打分场景准备好。研究者翻遍了各种公开资源发现要么有评分标准但没有针对具体回答的逐条标注要么有多个候选回答但缺少权重化的评分规则。没有一个数据集同时具备四个要素明确的评分条目、同一问题下的多个候选回答、每个回答对每条标准的满足标签以及能算出加权总分的规则。于是研究者决定自己动手做两套数据集出来。PointRubric和RaR-Science-Static两套量身定做的测试卷PointRubric改造自一个叫OpenRubrics的开源资源原始数据里的评分标准偏向成对比较缺少逐条标注。研究者挑了3000道带有明确硬性规则的问题把每条原始规则重写成统一格式两条硬性标准加四条软性标准。硬性标准是必须满足的底线要求软性标准衡量回答质量的细腻程度。这个改写过程做得挺谨慎研究者手工抽查了50个转换样本发现47个都保留了原始评分标准的核心意图。剩下3个出问题的案例都是因为压缩过程中漏掉了某个具体要求而不是凭空捏造了新要求。这种一致性检验很重要如果连改写这一步都不可靠后面所有实验都是空中楼阁。为了让每道题都能测出裁判模型的判断力研究者为每个问题生成了四种角色的回答满分回答、低分回答、部分符合评分标准的回答以及完全不看评分标准写出来的回答。这四个角色不是简单地分成四档质量而是刻意制造出分数分布的宽度让满分和低分锚定两端中间两种回答提供更丰富的中间地带变化。最终GPT-4o给这些回答的每一条评分标准都打上Yes或No的标签。PointRubric最终包含1042道题、4168份回答、25008个回答与评分条目的配对标签划分成417道训练题、104道开发题、521道留出测试题。另一套数据集叫RaR-Science-Static脱胎于RaR-Science专门用来匹配后续强化学习实验的科学题目格式。它随机抽取1500道科学题每道题保留原始参考答案再加一份由Qwen3-4B生成的回答一共凑齐3000份候选回答。评分标准数量在6到11条之间浮动平均每题7.52条这比PointRubric的固定六条格式更贴近真实的强化学习训练场景因为真实场景里的评分标准长度本来就参差不齐。判断标签同样由GPT-4o生成。为了严谨起见研究者对这套操作性参考标签做了人工审计抽取100份留出集里的回答进行盲测覆盖600次逐条判断和50次成对比较结果人工标注和GPT-4o的加权一致率达到90.9%成对偏好一致率高达96.0%。分歧主要出现在完整性、具体性这类偏软性的质量维度硬性事实和约束条件几乎不会产生分歧。三种裁判方式谁在小模型身上更靠谱有了测试卷接下来就是找答题人了。研究者选了Qwen3系列的四个尺寸0.6B、1.7B、4B、8B参数量以十亿为单位参数测试了三种从同一个语言模型骨干里提取判断信号的方法。生成式裁判*直接让模型针对每条评分标准生成一个是或否的文字判断解析出结果后汇总。这是最直觉、最贴近人类思路的做法问题在于它依赖模型把内心判断准确表达成规范的文字输出一旦格式解析失败或者表达含糊判断就废了。对数概率裁判*不让模型生成完整文字而是直接读取模型对Yes和No这两个词的下一个词元概率取两者对数概率的差值作为软性打分依据。这种方式绕开了文本解析这道坎理论上应该更稳。探针裁判*把语言模型的参数完全冻结只在模型的某一层隐藏状态之上训练一个轻量级的线性分类器用GPT-4o的标签作为监督信号去预测这条评分标准是否被满足。这三种方法的差异其实反映了一个更根本的问题模型知道一件事和模型能说出这件事是两码事。打个比方你让一个刚学会说话的孩子判断两个苹果哪个更大孩子可能心里清楚答案但让他用完整句子表达因为这个苹果的直径比那个苹果大约多两厘米就困难得多。生成式裁判就相当于要求孩子说出完整的判断句对数概率裁判相当于只让孩子指一指哪个更大而探针裁判则是直接给孩子的大脑接上传感器读取他做判断时的神经活动模式完全不依赖语言表达能力。如果孩子内心的判断是准的但表达渠道有噪声探针这种绕过表达直接读取内部状态的方式就会赢。实验结果印证了这个猜测而且赢得相当悬殊。在PointRubric这个格式统一、控制严格的数据集上生成式裁判随着模型尺寸增长表现稳步提升从0.6B的0.370加权准确率一路涨到8B的0.888。经过监督微调后1.7B的生成式裁判甚至能冲到0.902说明小模型完全能学会这种规范化的判断输出格式。但在更贴近真实场景的RaR-Science-Static上情况完全变了样。同样是1.7B的基础模型生成式裁判和对数概率裁判分别只有0.443和0.449的宏观F1值而探针裁判直接跳到0.835。研究者进一步做了一次逐条判断的对比分析发现在4518个留出集的判断案例里有33.0%的案例只有探针判断对了生成式判断错了反过来只有7.8%的案例是生成式对了探针错了。这个差距说明什么说明1.7B这种量级的小模型隐藏状态里其实藏着比它嘴上说出来的更准确的判断只是生成式和对数概率这两种读取方式没能可靠地把这份信号挖出来。探针裁判在RaR-Science-Static上的所有模型尺寸里都是最强的1.7B探针达到0.8358B探针也只是0.864差距并不悬殊但8B的模型体积却大了将近5倍。这就让1.7B探针成了后续强化学习实验的天然候选够小、够快判断力却没打折扣。研究者还额外测试了在换了回答生成模型Mistral-7B、OLMo2-7B的情况下探针会不会失灵。结果是在这个扩展测试集上探针依然保持0.741的宏观F1生成式和对数概率则跌到0.394和0.424。可见这不是探针只认识特定几种回答风格的偶然表现是一种相对稳健的能力。论文还拿一个专门做成对比较的裁判模型Rubric-RM做了对照。这个模型直接预测两份回答里哪个更好但研究者发现它经常输出无法解析的格式PointRubric上的解析成功率只有62.7%和39.6%对应4B和8B两个版本如果把解析失败算作错误准确率只有0.322和0.228远远比不上探针的0.924。这说明成对比较接口在实际部署中经常翻车逐点打分加上探针这种组合反而更可靠。数据够不够怎么设计探针有了主角还得给探针精细调校一下。研究者做了一系列消融实验测试探针需要多少训练数据才能达到不错的效果。结果显示仅用100道训练题的探针就能拿到0.805的宏观F1用满1000道题也只是涨到0.834边际收益并不高。这意味着训练探针的成本可以压得很低用500个响应大约只需要2.43美元的GPT-4o标注费用。在结构设计上研究者比较了线性分类头和更复杂的多层感知机还比较了取最后一个词元的隐藏状态、取全部词元平均池化、取最后四层平均等不同的特征提取方式。结果是线性分类头加最后一个词元的方案已经足够强复杂结构带来的提升很有限唯独平均池化明显更差从0.834掉到0.761。层数选择也不是靠碰运气找到某个孤立的最优层而是在中后期层里存在一整片表现相近的平台区。这套探针设计的哲学其实和很多机器学习里少即是多的思路是一脉相承的。就像盖房子不一定非要用最贵的钢筋才能稳固关键是找准承重点。这里承重的就是那个最后词元的隐藏状态它已经把判断所需的信息浓缩进去了再叠加复杂结构反而是画蛇添足。裁判上岗强化学习里的真实较量有了裁判接下来是真正的考验这个探针裁判能不能在强化学习训练里实际派上用场而不只是在静态测试集上考高分。研究者用GRPO一种强化学习算法训练同一个Qwen3-4B基础模型在完全相同的训练数据、优化器、响应预算、评分聚合规则下唯一改变的变量就是奖励裁判本身。不训练的基础模型在RaR-Science评分标准下只能拿到0.232分。用1.7B探针作为奖励模型训练之后分数飙升到0.643。作为对照用8B生成式裁判训练出来的策略只有0.594分。也就是说体积小得多的探针裁判训练出来的策略反而比更大的生成式裁判更强。这个结果本身就有点反直觉毕竟静态测试里8B探针的准确率是略微高于1.7B探针的。研究者深挖了一下原因发现更大的探针给策略生成的回答打分时奖励值经常饱和也就是几乎所有回答都能拿到接近满分导致同一组内不同回答之间的奖励差距太小GRPO算法失去了区分优劣的信号。这就好比一场考试如果所有人都能拿99分老师根本没法从分数上判断谁真正学得更好。奖励信号需要有区分度才能引导策略往正确方向优化一味追求高准确率反而可能让信号变得扁平无用。在效率对比上探针的优势更加直观。截至比较检查点8B生成式裁判累计消耗了89912.1秒的裁判计算时间探针只用了8389.9秒节省了10.7倍。在验证阶段生成式裁判要花492秒探针只要31.1秒快了15.8倍。整个强化学习训练的实际耗时生成式裁判需要11小时11分56秒探针只需要8小时51分47秒。这个耗时缩短的比例小于纯裁判时间的比例是因为强化学习流程里还有生成回答、优化参数、保存检查点这些环节不是所有时间都花在打分上。但即便如此探针裁判依然是花更少时间训练出更强策略的那一方。为了确认这个结果不是研究者自说自话团队还做了一次盲测人工审计。100组由基础模型和探针奖励策略生成的对照回答隐藏模型名称随机排序后让人工标注员打分结果72例偏向探针策略只有6例偏向基础模型13例打平9例无法判断。GPT-4o自己的评判结果是80比9偏向探针策略。排除掉人工打平和GPT-4o的完全并列情况后人工判断和GPT-4o判断的一致率达到95.8%。这个跨领域的一致性也延伸到了迁移测试上。研究者把训练好的探针奖励策略拿到GPQA-Diamond这个完全不同的问答基准上测试准确率从基础模型的0.335提升到0.388。另外用RaR-Science的科学类评分标准训练出来的探针直接拿到RaR-Medicine这个医学领域数据集上测试无需重新训练也能拿到0.718的宏观F1虽然比专门用医学数据训练的探针0.782略低但证明这份判断能力不是死记硬背某个领域的表面特征而是学到了某种更通用的评判逻辑。这个结果值得琢磨。训练评分标准判断能力时使用的领域是科学题测试时换成医学题探针依然保留了相当程度的判断力。这说明探针学到的可能不是这道题该怎么答这种具体知识而更像是一份回答有没有把要求的点讲清楚这种更抽象的评判技巧就像一个擅长审稿的编辑换个学科依然能看出论文写得逻辑是否清晰即便他未必精通那个学科的专业知识。写在后面读完这篇论文最让我意外的一点不是探针比生成式裁判省钱而是探针在8B这个尺寸上反而不如1.7B好用的那个发现。按常理想模型越大判断越准用它做奖励应该效果越好但论文里明明白白展示了8B探针会把奖励打得过于饱和导致强化学习的组内区分度消失。这提醒我一件事静态测试集上的高分和实际部署中的有效性中间隔着一层没人默认会关注的鸿沟。一个裁判判断准不准和它给出的分数是否具有足够的区分度来驱动优化是两个完全不同的问题。前者考验的是准确性后者考验的是奖励信号本身的信息量。另外一个细节也值得单独说说。研究者提到用GPT-5生成候选回答的时候经常拒绝写那些故意写得很差的低分回答。这个看似无关紧要的施工细节其实透露出一个有意思的现象越强的模型越难被诱导去故意犯错。这倒是从侧面证明了对齐训练确实在起作用只是这次它给做数据集的研究者添了麻烦。这篇论文没有解决的问题是它的判断标准本质上还是绑定在GPT-4o这一个参考裁判身上。如果GPT-4o自己的判断在某些细分领域存在系统性偏差那小模型学到的也是同一种偏差只是跑得更快而已。省钱和更准确终究是两件不完全绑定的事情这篇论文证明了前者但后者依然需要更多独立的人类评估去校准。QAQ1PointRubric和RaR-Science-Static是什么A这是论文作者自己构建的两套逐点评分标准评测数据集PointRubric改编自OpenRubricsRaR-Science-Static改编自RaR-Science两者都提供明确的评分条目、多个候选回答、每条标准的满足标签以及加权评分规则用来测试小模型裁判的判断能力。Q2探针裁判为什么比生成式裁判和对数概率裁判效果更好A因为探针直接读取语言模型冻结的隐藏状态训练一个轻量分类器去预测判断结果绕开了让模型把内心判断转化成规范文字输出这一步。实验显示小模型隐藏状态里其实藏着比嘴上说出来更准确的判断信号只是生成式和对数概率方式没能可靠地把它挖出来。Q3用1.7B探针做强化学习奖励模型效果怎么样A用它训练Qwen3-4B模型RaR-Science评分从0.232提升到0.643超过了用8B生成式裁判训练出的0.594分同时累计裁判计算时间只有8B生成式裁判的十分之一左右训练出的策略在GPQA-Diamond等迁移测试中也表现更好。

相关推荐

数据闭环分层抽帧策略从 TB 级采集数据中提取高价值帧:三道成本闸门
数据闭环分层抽帧策略从 TB 级采集数据中提取高价值帧:三道成本闸门

上一篇讲完了挖掘平台的架构骨架,从这篇开始填血肉。平台拿到采集数据后做的第一件事是「抽帧」——把视频形态的 clip 变成一张张图片。为什么必须做这一步?因为下游所有能力都是「认图不认视频」的:VLM 推理要喂图片,Embedding … · 2026/9/25 18:25:27

Atlas 300V 24G推理卡实战:从CANN环境搭建到YOLOv5模型部署全流程
Atlas 300V 24G推理卡实战:从CANN环境搭建到YOLOv5模型部署全流程

先给结论:Atlas 300V 24G确实是一张“运算加速卡”,但你要是拿它当普通图形卡用,就完全理解偏了。它是一张面向AI推理场景的加速卡,最近“atlas部署yolo”这么热,主要还是因为这卡性价比够看、国产化适配到位&#xff… · 2026/9/25 18:25:27

把已经跑过的智能体聊天记录,重新变成能用的编程练习场
把已经跑过的智能体聊天记录,重新变成能用的编程练习场

2014 年,语音识别领域有一件让所有人挠头的事:训练一个能听懂人说话的模型,需要成千上万小时的标注音频。可标注音频这东西,贵、慢、还容易出错。十年后,AI 编程智能体(就是那种能在命令行里帮你写代码、修… · 2026/9/25 18:25:27

Rocky linux9下部署redis数据库集群
Rocky linux9下部署redis数据库集群

目录 前言: 一、服务器规划 二、系统优化(所有节点执行 1.关闭透明大页(THP) 2.内存设置 3. 设置文件描述符上限 4. 内核网络与内存优化 三、编译安装 Redis 最新版(所有节点执行) 1.安装编译依赖 … · 2026/9/25 18:52:51

Atlas 300V 24G推理加速卡上部署YOLO模型全流程解析
Atlas 300V 24G推理加速卡上部署YOLO模型全流程解析

“atlas部署yolo”和“atlas 300v 24g 是运算加速卡吗”——这两类问题最近被问得特别密集。一边是大家都在做边缘侧目标检测,手里攒着现成的YOLO模型,想在便宜、低功耗的AI加速卡上跑起来;另一边是华为昇腾的Atlas产品线型号复杂&#xff0c… · 2026/9/25 18:52:32

DMR数字对讲机组网实战:50人工地选型、信道规划与中继部署实用指南
DMR数字对讲机组网实战:50人工地选型、信道规划与中继部署实用指南

本文基于建筑施工现场通信部署经验,从DMR制式原理、信道规划、中继部署到场测验收,讲解中型场景下无线对讲系统的技术落地方法。适合读者:通信集成商、IT运维、项目技术负责人。目录 现场通信的常见问题需求分析:人员架构与环境特… · 2026/9/25 18:52:26

机器人跨区域运行梯控设计:地下车库到大堂任务连续性分析
机器人跨区域运行梯控设计:地下车库到大堂任务连续性分析

摘要: 机器人从地下车库进入大堂等跨区域场景时,需要面对不同网络环境、设备状态和任务流程变化。梯控系统需要保证机器人任务连续,避免区域切换造成运行中断。导语: 单一区域机器人应用通常只需要解决移动和导航问题,… · 2026/9/25 18:52:20

IronClaw Decision Capture 技能实战:在 Agent 会话中自动检测、持久化与追踪决策
IronClaw Decision Capture 技能实战:在 Agent 会话中自动检测、持久化与追踪决策

人工智能AI 应用交互助手AI Agent 【免费下载链接】ironclaw IronClaw is an Agent OS focused on privacy, security and extensibility 项目地址: https://gitcode.com/gh_mirrors/iro/ironclaw 点击查看 免费下载 IronClaw 的 decision-capture 技能是一套面向 … · 2026/9/25 18:52:08

不锈钢精8k精抛加工厂家、不锈钢精8k镜面处理厂家、不锈钢精8k专业厂家发展现状与市场占有率及排名研究分析报告
不锈钢精8k精抛加工厂家、不锈钢精8k镜面处理厂家、不锈钢精8k专业厂家发展现状与市场占有率及排名研究分析报告

当前国内不锈钢装饰与精密制造领域,对高平整度、均匀反光的不锈钢板材需求持续增长,推荐不锈钢精8k厂家、不锈钢精8k加工厂、不锈钢精8k厂家推荐的搜索热度逐年攀升,越来越多工程采购与品牌制造团队正在寻找稳定靠谱的不锈钢精8k精抛加工厂家… · 2026/9/25 18:52:08

数值优化(Numerical Optimization)学习系列-03-共轭梯度方法(Conjugate Gradient)
数值优化(Numerical Optimization)学习系列-03-共轭梯度方法(Conjugate Gradient)

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:31

创维E900V22D刷机全攻略:S905L3SB芯片兼容性解析与救砖实战
创维E900V22D刷机全攻略:S905L3SB芯片兼容性解析与救砖实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:31

MQTT协议原理与Broker服务器搭建实战:从Mosquitto到EMQX
MQTT协议原理与Broker服务器搭建实战:从Mosquitto到EMQX

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:37

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码