【免费下载链接】deepopen非自回归System 1决策引擎专为结构化类型决策场景设计 DeepOpen Multilingual, non-autoregressive System 1 decision engine.项目地址https://gitcode.com/gh_mirrors/de/deepopen点击查看免费下载本文围绕 clinc150/ROUND4_PLAN.md 展开系统讲解 deepopen 项目在 CLINC150 full150 类闭集任务上提出的第四轮实验方案固定第二轮验证选中的rdrop_42作为 top-5 召回器复用原始 Laya DecisionModel 的 encoder、typed head 与候选 marker scorer对五个候选意图做联合判别微调listwise CE。读者可以从中获得一份完整的二阶段意图分类实验设计模板从两条先导路线label / example的超参数清单、训练数据纪律金标注入、检索排除、验证混合概率搜索协议到候选顺序一致性扩展label_consistency与证据冻结流程并可在 clinc150/ROUND4_REPORT.md 中对照实测结果与限制声明。一、实验背景与目标第四轮实验承接前三轮前两轮已经在 15,000 / 3,000 / 4,500 的官方原始划分上完成 CE 基线、SupCon、R-Drop 与成组 SupCon 的候选比较验证选中了第二轮的单模型rdrop_42测试 97.7556%4,399 / 4,500详见 clinc150/README.md 与 clinc150/ROUND2_METHODS.md。第四轮的目标非常明确在 CLINC150 full、150 类闭集测试上测试准确率超过 98%该目标“不是预先保证的结果”达到与否由实测决定已知前三轮测试汇总本轮属于后续开发而非独立盲测只读取 train / val 开发集冻结最终选择后统一测试保持 15,000 / 3,000 / 4,500 原划分不添加外部生成数据不调整测试标签。这一目标设定把“超过 98%”作为研究假设而非承诺若达不到如实报告且不得通过事后选择测试最优种子来声称达标。这种“先冻结、后测试”的协议贯穿整个方案。二、新结构召回器 原生候选判别器的二阶段系统第四轮放弃了前两轮的“单编码器 150 类线性头”固定分类结构回到 Laya 原生的决策结构构建二阶段系统召回器Retriever固定第二轮验证选中的rdrop_42对每条用户句子从 150 个意图中召回 top-5重排器Reranker使用原始 Laya DecisionModel 的 encoder、typed head 和候选 marker scorer联合编码“句子 五个候选意图”微调 listwise CEcross-entropy融合Fusion验证阶段按混合概率将召回器概率与重排器概率加权。关键设计约束在方案中有三处明确声明候选顺序训练时随机置换避免模型学到固定位置偏差它是二阶段系统报告两模型存储和推理开销不称作单编码器改进——即使最终系统只有一个召回器加一个重排器也包含两个编码器前向复用原始 Laya 预训练权重与原生 head与第一轮“文本 → Laya 编码器 → masked mean pooling → 150 类线性头”的专用分类头路线见 clinc150/README.md完全不同二者不能混称。从源码结构看这套联合判别正是 deepopen/common.py 中DecisionModel的原生能力encoder输出双向表示后叠加type_emb3 类问题类型嵌入再经head两层 TransformerEncoderhead_layers2建模候选之间的相互依赖最后用scorerLayerNorm → Linear → GELU → Linear(d,1)对每个候选 marker 位置打分得到各候选的 logits。act_head是原模型用于动作决策的旁路头本轮训练中明确冻结“只训练选择题 CE冻结无关 act_head”。序列构造与 marker 机制重排器的输入遵循 Laya 原生的序列格式由 deepopen/common.py 的build_sequence构造[CLS] type instructions [SEP] [MASK] opt0 [MASK] opt1 ... [SEP] state [SEP]每个候选option前都有一个[MASK]标记markers记录各 mask 在序列中的位置前向时scorer只对 marker 位置的特征打分未覆盖的 marker 位置通过masked_fill(~marker_mask, -1e4)屏蔽。这一机制意味着候选数量、候选文本长度都可以按任务裁剪且候选之间的位置关系由模型端到端感知——这正是“联合判别五个意图”与逐一对每个意图独立打分pointwise的本质区别。三、两条先导路线label 与 example方案同时设计了两条输入构造路线共享同一套训练超参数先各跑一个种子seed 42作为先导再按验证结果决定补训路线。公共超参数所有先导与补训运行统一使用以下配置配置项值种子先导 seed 42胜出路线补训 seeds 13 / 87Epochs6encoder LR1e-5head LR5e-5Batch size16梯度累积4 步优化器AdamWweight decay 0.01学习率调度10% warmup 后线性衰减梯度裁剪1精度BF16初始化完整原始 Laya 权重保留原始 dropout损失仅选择题 CE冻结无关 act_head候选温度由验证集选择对比前两轮8 epochs、batch 64、encoder LR 2e-5、head LR 2e-4见 clinc150/README.md第四轮改为更小的 batch16 累积 4 步 ≈ 有效 64、更低的 encoder LR这是为了在冻结召回器的前提下稳定微调原生 head 结构。路线 1label——纯标签名输入候选仅使用标签名称将下划线替换为空格如play_music→play music最大序列长度 128。这是最小侵入的输入方案只把候选“是什么”告诉重排器重排器必须从标签语义与句子语义的匹配中学到判别能力。路线 2example——近邻示例输入每个候选额外给出一条来自训练集的近邻示例最大序列长度 256特征由固定召回器生成——训练样本的相似度检索使用固定的rdrop_42召回器而不是随训练过程变化的表示训练查询排除自身和规范化文本相同的示例防止检索到“题目本身”造成标签泄漏验证 / 测试的记忆库始终仅含训练集——验证和测试阶段做示例检索时只能从 15,000 条训练样本的记忆库中取近邻绝不使用验证/测试样本自身。example 路线信息量更大代价是序列更长、训练更慢目的在于帮助重排器区分语义接近的意图对。四、训练数据纪律金标注入与特征冻结二阶段训练有一个天然的坑固定召回器召回 top-5 后训练样本的 top-5 中可能不包含金标。方案的处理方式非常明确训练时若 top-5 中缺失金标用金标替换最后一项——仅用于训练让每个样本都有可优化的正例验证和测试时绝不注入金标完全按真实召回结果重排训练示例的相似度example 路线使用固定召回器计算只用于训练数据中的困难候选与示例选择。一句话概括金标可以进入训练集的构造但绝不能进入验证/测试的输入。这是保证评测有效性的底线。补训规则同样受证据纪律约束先导完成后按验证 accuracy / NLL 选择路线再补训 seeds 13 / 87三种子集成固定等权“候选为所有完成运行和选中家族固定三种子等权集成”不搜索任意种子子集——避免“测试后挑选种子”带来的选择偏差。五、验证选择协议混合概率搜索二阶段系统的最终输出不是简单取重排器的 argmax而是验证集上搜索的混合概率P_final (1 - alpha) * P_retriever alpha * P_reranker(sparse)混合系数 alpha ∈ {0, .25, .5, .75, 1}重排器温度 ∈ {.5, 1, 2}按验证 accuracy 优先、验证 NLL 次优选择同时保留纯重排器结果alpha 1 即纯重排器独立记录供归因分析。alpha 0 表示完全退化为召回器概率即第二轮模型本身alpha 1 表示完全采用重排器。搜索这一维度的意义在于重排器可能只对部分样本有增益混合可以在验证集上找到稳定的折中。六、扩展候选顺序一致性先导label_consistency在首两个先导尚在训练、还没有本轮测试结果时方案又增加了一个label_consistency先导seed 42针对候选顺序随机置换可能带来的不稳定沿用 label 输入和训练超参数每条样本独立产生两次候选随机排列和 dropout 前向得到两套 logits将两次 logits 按意图 ID 对齐消除排列差异后加入系数 1 的对称 KLCE 取两次前向的均值编码器 dropout 设为 0.1。这与第二轮 R-Drop 的思路一脉相承见 clinc150/ROUND2_METHODS.mdL mean(CE₁, CE₂) [KL(p₁‖p₂) KL(p₂‖p₁)] / 2但作用对象从 batch 内样本变成了同一输入的两次候选排列。方案诚实地指出了该分支的两点代价与归因限制每更新有两次前向训练成本高于普通 CE候选重排和 R-Drop 一起变化不能独立归因——顺序一致性的收益无法与 dropout 正则的收益分开计数。先导选择随之扩展到三条路线label / example / label_consistency胜出路线仍补训 seeds 13 / 87测试前记录全部选择现有两个先导不重跑——已经启动的实验保持原样不在中途修改协议。七、融合探针几何 vs 算术此外方案记录了一次收敛后的额外探针检查在label_42完成后只对其已选 checkpoint 做了一次验证集算术/几何概率融合对比几何融合没有超过原算术融合。结果保存在fusion_probe.json但不改变主选模或推理规则。这是一个值得借鉴的工程习惯探针实验只用来确认当前选择仍是最优而不是作为反复调参的入口。八、底层实现佐证权重加载与结构校验二阶段重排器本质上就是 Laya 原生的DecisionModel因此仓库的加载路径可以直接复用到本轮 deepopen/agent.py 中的_verify_compatibility严格校验加载的 checkpoint 必须包含encoder.、type_emb.、scorer.、act_head.四组前缀参数并对每个参数的形状逐一比对缺失或形状不匹配都会直接抛错。从源码结构看这正是为了保证“完整原始 Laya 权重严格加载”这一训练前提——任何结构性的偏离都会在加载阶段被发现而不是悄悄带进训练。温度控制方面deepopen/common.py 的temp_bucket按选项数量分桶2/3-5/6-10/11本轮的“候选温度由验证选择”即在候选数为 5top-5这一桶内搜索温度 {.5, 1, 2}。九、验证与证据纪律方案为整轮实验定义了可审计的证据清单这是它作为“研究方案”而非“工程调参”的核心先报告验证 top-5 recall、截断情况和错误类型不读取测试错误来设计方法保存最优 epoch、完整训练曲线、验证搜索表、数据 / 代码 / 权重 SHA256测试前冻结最终选择统一测试家族三个种子和验证选出的集成所有负结果保留——不因结果不佳而删除运行记录若达不到 98%如实报告不能通过事后选择测试最优种子声称达标该方法与原始专用分类头不同预训练原生 head 复用和二阶段结构均需明确说明。这些条款针对的是多轮开发中常见的两类偏差反复看测试集产生的选择偏差以及“挑最好种子报数”的 cherry-picking。十、实测结果方案落地后的如实复盘方案在 clinc150/ROUND4_REPORT.md 中得到了完整执行与公开结果可以用作对方案设计效果的对照方案测试准确率第二轮推荐分类器rdrop_4297.7556%验证选出的单重排器系统97.6000%固定三重排器系统97.6000%最终验证选出的部署系统97.6000%最终选择类型为ensemble单重排器候选为label_consistency_13本轮冻结选择的系统未超过 98%方案目标未完成报告如实声明相对第二轮推荐模型净变化 −0.1556 个百分点修正 6 条、退步 13 条配对 bootstrap 95% 区间 [−0.3556, 0.0222]exact McNemar p 0.167068未校正多重比较——统计上无法拒绝“无差异”选中家族label_consistency 三种子均值 97.5926%样本标准差 0.0339 个百分点召回器测试 top-5 recall 99.6667%验证 99.6%说明重排器只能修正 top-5 之内的排序错误无法挽回召回缺失这也是系统天花板的主要来源两种输入在 3,000 条验证查询中均未截断查询或标签名称示例文本最多保留 24 tokens推理开销单重排器系统前向 p50 20.025 ms三重排器系统 p50 41.201 msL20、batch1、BF16固定预分词候选不含加载、分词、候选构建和检索——与“两模型存储和推理开销必须单独报告”的方案条款一致。报告同时指出检索、重排、候选选择均属已有思路本项目贡献应描述为“Laya 上的具体结构适配及其受控实验”不应把通用方法声称原创基础模型预训练数据不完全公开无法排除上游基准污染。另一条明确增加 DeBERTa 编码器的异构路线Laya 三个 DeBERTa-v3-large达到 98.0222%详见 clinc150/HYBRID_REPORT.md但其成绩不能归到本重排器结构名下。十一、延伸阅读方案原文clinc150/ROUND4_PLAN.md结果与诊断clinc150/ROUND4_REPORT.md整体复现指南环境、数据、前几轮训练与评测命令clinc150/README.md第二轮方法细节R-Drop / SupCon / 权重平均clinc150/ROUND2_METHODS.mdDecisionModel 架构实现deepopen/common.py权重加载与结构校验deepopen/agent.py这套“方案—纪律—如实复盘”的闭环本身比单轮分数更有参考价值二阶段系统能否超过单模型取决于召回质量、重排增益与融合方式的综合作用而实验设计中的金标注入边界、验证选择协议与负结果保留规则正是保证任何结论可复现、可审计的前提。赞分享【免费下载链接】deepopen非自回归System 1决策引擎专为结构化类型决策场景设计 DeepOpen Multilingual, non-autoregressive System 1 decision engine.项目地址https://gitcode.com/gh_mirrors/de/deepopen点击查看免费下载相关推荐Label Studio 安装部署完全指南本地 3 分钟跑通生产配置不踩坑Label Studio 安装部署完全指南本地 3 分钟跑通生产配置不踩坑 Label Studio 是一个开源的数据标注与标注管理平台文本、图像、音频、数据标注人工智能GitHub_Trending/cs/cs-408四科复习时间分配表一轮/二轮/冲刺阶段科学规划GitHub_Trending/cs/cs 408四科复习时间分配表一轮/二轮/冲刺阶段科学规划 你还在为408四科复习时间分配发愁吗一轮基础、二轮强化、文档教育教程整网模块拆解与候选编排派生CANN NPU 多流优化分析阶段实战指南整网模块拆解与候选编排派生CANN NPU 多流优化分析阶段实战指南 本文是 CANN 多流Multi Stream优化方法论中「分析阶段」的技术指南核示例工程人工智能大模型模型推理服务模型优化模型量化CANNAscend创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
企业数字化 ERP 产品动态
相关推荐
STM32 GPIO按键输入链路全解析:从上下拉到施密特触发器 最近接了一块带按键的开发板,把按键一头接到 STM32 的 PA0,另一头接 GND,代码里配置成上拉输入,逻辑上“按下应该是低电平,松开应该是高电平”。结果放上去一试,松开的时候读数正常,按下以后电平… · 2026/9/26 10:44:55
AutoMinds:AI原生软件定义PLC/DCS控制器架构与实战 1. 工业自动化控制软件平台的演进逻辑与AutoMinds的切入点1.1 从封闭硬件到开放软件:PLC/DCS的范式转移工业自动化领域过去几十年一直遵循一个铁律:控制器性能的上限由硬件决定。西门子S7-1500的扫描周期、AB ControlLogix的背板带宽、三菱FX系列的I/O响… · 2026/9/26 10:44:55
鼠标光晕设置全攻略:TaoToken 统一 Key 接入 Windows 截图工具与 Cline 配置骨架 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 11:13:34
中文论文段落写多长读者才不会跟丢?用信息单元数定段长,附可读性自查清单 读自己写的中文论文时,若读到段尾得回头重看一遍才接得上,问题多半不在读者的耐心,而在这一段同时要求对方记住的东西太多。把段落看作装载信息单元的容器,段落长度立刻从模糊的感觉变成可以核对的量。下面给出一套按信息单元数判… · 2026/9/26 11:13:28
文昌钢材采购常见误区盘点:四类核验维度与检测方法 文昌高盐雾环境下采购钢材,防腐性能、资质合规、配送能力、现货库存是四个关键核验维度。本文梳理三类典型踩坑案例,从资质核验方法、镀锌层检测技术、库存核实方式、加工配送评估四个角度展开技术分析,适合工程技术人员、质检人员参考。
一、… · 2026/9/26 11:13:28
各种锁的分类讲解 使用各种锁的过程中,由于种类太多,分不清各种锁到底是什么层面的、底层逻辑有很多很像但是为什么要有这么多种,下面按不同视角进行区分视角 1:【作用域视角】JVM 内锁(进程内锁):同一个 JVM&… · 2026/9/26 11:13:28
联合 查询 为什么要联合查询 ?有时为了查询一个完整的数据, 需要从多个表中同时获取数据数据库是怎么联合查询的 ?在使用联合查询时,数据库获取参与查询的表的笛卡尔积,并把结果汇聚到一个临时表中1. 笛卡尔积笛卡尔积࿱… · 2026/9/26 11:13:28
数据库课后习题答案别硬背:当测试用例集刷,效率翻倍 简介:万常选版《数据库原理与设计》课后习题答案资源,覆盖第2至6章及第9章,适合正在学习关系模型、数据库建模、关系数据理论与模式求精的本科生、自学者作为复习与自测材料。压缩包共7个文件,含3个doc参考答案、2个sql示例脚本、… · 2026/9/26 0:00:21
OpenClaw 替代品?Hermes Agent 踩坑实录:macOS 飞书接入 TaoToken 配置 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 0:00:40
向下兼容与向上兼容:接口设计中的兼容性策略与工程实践 一次版本升级事故,是很多团队绕不过去的坎。线上环境里,服务端明明已经上线了新版接口,老的移动端还在照着旧文档传参数。请求一到网关,校验直接拒绝,用户操作失败,客服群炸了锅,开发群里开始互… · 2026/9/26 0:00:46