首页/新闻资讯/正文详情

AI-Research-SKILLs 中的 ARA Rigor Reviewer:Level 2 语义评审的六维认识论评分锚点与检查清单全解析

发布时间:2026/9/24 23:13:28 来源:云帆数科 栏目:资讯中心
AI-Research-SKILLs 中的 ARA Rigor Reviewer:Level 2 语义评审的六维认识论评分锚点与检查清单全解析
AI 技能人工智能大模型深度学习【免费下载链接】AI-Research-SKILLsComprehensive open-source library of AI research and engineering skills for any AI model. Package the skills and your claude code/codex/gemini agent will be an AI research agent with full horsepower. Maintained by Orchestra Research.项目地址https://gitcode.com/gh_mirrors/ai/AI-Research-SKILLs点击查看免费下载本指南完整解读 rigor-reviewer 技能所依赖的核心评审规范 —— review-dimensions.md即 ARAAgent-Native Research ArtifactSeal Level 2 语义评审的六个认识论质量维度。你将掌握每个维度的检查清单、1–5 分评分锚点、Finding 严重度分级与 Strong Accept→Reject 总体等级映射并能据此对任意 ARA 产出一份构造性、按严重度排序的评审报告level2_report.json。一、评审定位Level 1 结构校验之后的认识论审判在 AI-Research-SKILLs 仓库的22-agent-native-research-artifact/目录下ARA 生态由三个技能构成闭环compiler负责把论文、代码、实验日志编译成结构化 ARAresearch-manager在会话期间持续记录研究过程rigor-reviewer则在发布前对 ARA 做客观的认知质量评审。评审分两级Level 1结构校验由 Seal 校验器完成只检查引用是否解析、必填字段是否存在、YAML 是否能解析、跨层链接是否双向一致具体条目见 validation-checklist.md。Level 2语义评审即本指南主题。它不再复查任何结构问题而是评估 ARA 的内容在认识论上是否站得住证据是否真正支撑论断、论证是否连贯、研究过程是否被诚实记录。Level 2 评审完全通过 Agent 的原生工具Read、Write、Glob、Grep进行不执行代码、不抓取 URL、不咨询外部来源产出一份构造性报告level2_report.json到 ARA 根目录。评审者不是 bug 探测器而是帮助作者改进作品的审稿人。二、七步评审工作流总览Rigor Reviewer 的完整流程在 SKILL.md 中定义共七步读取 ARA按固定顺序读取PAPER.md→logic/claims.md→logic/experiments.md→logic/problem.md→logic/concepts.md→logic/solution/四件套 →logic/related_work.md→trace/exploration_tree.yaml→evidence/README.md若存在→ 抽查 2–3 个evidence/tables/或evidence/figures/文件并把顺序记录为read_order。解析实体从 claims.md 提取每条## C{NN}的 Statement / Status / Falsification criteria / Proof / Dependencies / Tags从 experiments.md 提取每条## E{NN}的 Verifies / Setup / Procedure / Metrics / Expected outcome / Baselines / Dependencies从 heuristics.md 提取Rationale/Sensitivity/Bounds/Code ref从 problem.md 提取 O{N} 与 G{N}从 exploration_tree.yaml 提取所有带类型字段的节点。构建工作映射claim_proof_mapclaim → Proof 中的实验 ID 集合、experiment_verifies_mapexperiment → Verifies 中的 claim ID 集合、claim_dependency_edgesclaim 依赖边、gap_set全部 G{N}、rejected_nodesdead_end或pivot类型节点、decision_nodesdecision类型节点。这些映射是后续语义分析的输入。逐维度评估对 D1–D6 分别做语义推理边评边记录 strengths、weaknesses、suggestions。汇总 Finding为每条问题分配finding_idF01, F02…、dimension、severity、target_file、target_entity、evidence_span、observation、reasoning、suggestion按严重度排序critical → major → minor → suggestion。计算总体等级对六个维度分求均值套用等级映射。写报告输出level2_report.json。下文 review-dimensions.md 即 Step 4 的核心依据它为每个维度给出了检查清单Checks与评分锚点Scoring Anchors。三、D1 Evidence Relevance证据相关性评审问题被引用的证据是否在实质层面支撑每条论断而不仅仅是形式上挂了个引用检查清单检查项验证内容Finding 严重度Relevance相关性实验的 Setup/Procedure 是否真正对应论断所断言的内容majorType-aware entailment类型感知蕴含实验设计是否匹配论断类型因果→消融、泛化→异质条件、改进→基线对比、描述性→代表性采样、边界划定→边界声明majorEvidence sufficiency证据充分性单个实验是否足以支撑该论断还是需要多个实验suggestion评分锚点分数描述5每条论断都有类型恰当、相关的证据需要时有多实验支撑4所有论断的证据都相关存在轻微类型错配3大多数论断—实验对相关存在 1–2 个弱匹配2多条论断引用的实验并未实质性回应其断言1多数论断引用的实验与其陈述无关实操要点类型感知蕴含这是 D1 中最精细的推理环节。从 SKILL.md 的 D1 小节可以提取出五种论断类型及其匹配的实验设计因果类论断出现 causes、leads to、enables→ 需要能隔离机制的消融实验泛化类论断出现 generalizes、robust、across→ 需要异质测试条件改进类论断出现 outperforms、better、improves→ 需要基线对比描述类论断出现 accounts for、distribution、pattern→ 需要代表性采样边界划定类论断出现 when、under conditions、limited to→ 需要声明的边界。典型反面案例一条因果论断只引用了相关性研究correlation-only evidence在评分上至多对应 4 分档的轻微类型错配若普遍如此则落入 2–1 分。四、D2 Falsifiability Quality可证伪性质量评审问题论断是否具备真正可证伪、且有意义的可操作判据检查清单检查项验证内容Finding 严重度Actionability可操作性独立研究者能否执行该判据是否指明测什么、失败阈值是什么、在什么条件下majorNon-triviality非平凡性判据是否只是同义反复如果方法不 work即平凡判据majorScope match范围匹配判据是否覆盖与 Statement 相同的范围majorIndependence独立性能否在不依赖作者专有数据或系统的前提下测试minor评分锚点分数描述5每条论断都有具体、可操作、可独立测试且与论断范围匹配的判据4大多数判据强健1–2 条含糊或难以操作化3质量参差部分可操作部分平凡或范围错配2大多数判据平凡、同义反复或范围错配1判据在跨论断层面毫无意义实操要点平凡判据与可操作判据的判别SKILL.md 给出了正反两个例子帮助校准平凡判据badIf the method doesnt work如果方法不 work—— 这是同义反复永远无法构成有意义的失败条件可操作判据goodRe-evaluation on the same 77-paper set where GPT-5 is not the top model —— 明确指定了数据集合、测试条件与失败判据。范围匹配的典型失败论断声称覆盖 all datasets而证伪判据只提到单一数据集即为范围错配。五、D3 Scope Calibration范围校准评审问题论断是否恰好断言了其证据所能支撑的范围——不多不少检查清单检查项验证内容Finding 严重度Over-claiming过度声称Statement 使用全称范围而证据只覆盖狭窄条件极端为 critical中等为 majorUnder-claiming声称不足存在未被任何论断捕获的证据文件或实验结果minorAssumption explicitness假设显式化关键假设是否在 problem.md 或 constraints.md 中声明未声明的假设影响有效性时为 majorGeneralization boundaries泛化边界ARA 是否说明论断不适用于什么minorQualifier consistency限定词一致性措辞上的对冲hedging是否与证据强度一致minor评分锚点分数描述5所有论断与证据范围精确匹配假设显式限制明确4范围校准良好假设文档化有轻微缺口3部分论断轻微过度/不足延伸假设部分声明2多处过度声称或存在重大未文档化假设1论断与证据之间普遍范围错配实操要点检查 over-claiming 时留意全称范围标记词all models、any dataset、state-of-the-art across all并要求差距必须是实质性的。Under-claiming 是反向问题evidence/ 里明明有重要实验结果却没有对应论断去捕获它。另外当论断使用 tends to、in most cases 等对冲语时要核对对冲程度是否与证据强度相称。六、D4 Argument Coherence论证连贯性评审问题论证是否从问题到方案再到证据走通了一条连贯路径检查清单检查项验证内容Finding 严重度Observation → Gap derivationGaps 是否从 observations 逻辑推导而来majorGap → Insight connection关键 insight 是否回应了识别出的 gapsmajorInsight → Solution alignment解决方案架构是否实现了关键 insightmajorSolution → Claims coverage论断是否覆盖了方案的主要贡献minorCross-layer consistency论断、探索树与证据是否讲述同一个故事majorNarrative completeness动机性问题是否得到回答或被显式搁置minorGap coverage每个 gap 是否至少被一条论断实质性回应major评分锚点分数描述5清晰的弧线observations → gaps → insight → solution → claims → evidence所有 gaps 被回应4流畅但存在轻微逻辑缺口或一个未回应的 gap3大体有流程但层与层之间存在脱节2问题与论断之间显著错位或存在未解决矛盾1无连贯逻辑流各层讲述不同故事实操要点D4 本质上是沿着 ara-schema.md 定义的 ARA 认知层结构做链路审计problem.md 的 Observations带数字的实证事实→ Gaps缺失或破损之处→ Key Insight精确陈述的创造性跃迁→ claims.md 的可证伪论断 → experiments.md 的验证计划 → evidence/ 的实证文件。评审者要逐环核对是否存在断裂比如 gap 是被断言出来的而非从 observation 推出的或者 insight 与 solution architecture 对不上号。七、D5 Exploration Integrity探索完整性评审问题探索树是否忠实记录了真实的研究旅程而非事后合理化检查清单检查项验证内容Finding 严重度Dead-end specificityfailure_mode 是否具体lesson 是否可迁移majorDecision rationale qualityRationale 是否解释为何选中方案优于真实备选方案majorRebutted-branch consistency是否有一条论断在推崇被标记为 dead_end 或 pivot 的方案criticalExploration breadth主要设计选择是否有 ≥2 个文档化备选方案minorHonesty signal树是否记录了真实负面结果而非事后辩护suggestion评分锚点分数描述5丰富且文档完备的探索树具体的失败模式、可操作的教训、详尽的决策理由、真实的负面结果4好树但 dead-end 或决策文档有轻微缺口3树存在但 dead-end 缺乏具体性或决策缺乏备选方案2样板式文档dead-end 与决策读起来公式化1树与论断矛盾或整体读起来像事后合理化实操要点结合探索树规范评审 D5 时需要参照 exploration-tree-spec.md 的五种节点类型及其必填字段dead_end必填hypothesis、failure_mode、lesson无子节点叶子节点是对下游 Agent 最有价值的节点类型decision必填choice、alternativespivot必填from、to、triggerquestion/experiment各自承担根驱动与验证角色。SKILL.md 给出好坏示例failure_mode 写 Didnt work 是坏的Divergence after 1000 steps due to gradient explosion 才是具体可操作的。Rebutted-branch consistency 是 critical 级问题如果某条论断在推崇一个被探索树标记为 dead_end 或 pivot 的方案这是直接逻辑矛盾。此外一棵没有任何 dead-end 或只有琐碎失败的探索树是可疑的honesty signal。八、D6 Methodological Rigor方法论严谨性评审问题实验设计是否良好基线与报告是否充分检查清单检查项验证内容Finding 严重度Baseline adequacy是否比较了正确对象基线是否新近且相关majorAblation coverage多组件论断是否有实验隔离单个组件的贡献majorStatistical reporting是否提及方差、置信区间、运行次数或统计检验定量论断为 majorMetric-claim alignment指标是否衡量了论断所断言的内容majorReproducibility signalsSetup 是否足以独立复现模型、数据集、硬件、超参minor评分锚点分数描述5全面基线、规范消融、统计严谨、指标与论断精确对齐4方法论强健有轻微缺口3合格但缺少部分基线或统计细节2显著缺口比较性论断缺基线或没有消融1无基线、无消融、指标与论断不匹配实操要点基线充分性对比较类论断comparative claims标记no baseline统计报告定量论断只有单次运行single-run结果要标记指标—论断对齐一个关于generalization的论断若只用单测试集上的 accuracy 衡量即为错配可复现信号Setup 是否给出模型名、数据集、硬件、超参等足以独立复现的细节。九、Finding 严重度定义所有维度产出的问题统一按以下四级严重度标注来自 review-dimensions.md 末尾的定义表严重度含义示例critical根本性认识论缺陷论断或论证无法按原文成立因果论断仅由相关性支撑论断推崇一个 dead-end 方案major显著弱点削弱某条论断或某个维度比较类论断无基线平凡证伪判据指标与论断不匹配minor可察觉问题但不使工作失效缺少泛化边界对冲与证据不一致suggestion建设性改进机会而非缺陷为上下文增加检索基线文档化探索广度十、总体等级映射Overall Grade Mapping评审者先计算六个维度得分的均值再按下表映射为从 Strong Accept 到 Reject 的五档建议等级条件Strong Acceptmean ≥ 4.5 且无任何维度 3Acceptmean ≥ 3.8 且无任何维度 2Weak Acceptmean ≥ 3.0 且无任何维度 2Weak Rejectmean ≥ 2.0 且mean 3.0 或存在维度 2Rejectmean 2.0 或存在维度 1注意该映射是双条件约束均值达标但某个维度击穿底线 2 或 1时等级会整体下调。例如六个维度为 [4, 4, 4, 3, 3, 4] 时 mean 3.67落入 Weak Accept若其中一维为 1则直接 Reject。十一、评审报告的 JSON 结构与关键规则level2_report.json的完整骨架字段格式见 SKILL.md Step 7包含元信息artifact、artifact_dir、review_version当前为 3.0.0、prerequisiteLevel 1 passedoverallgrade、mean_score、one_line_summary、strengths_summary、weaknesses_summarydimensions每个维度含score1–5、strengths、weaknesses、suggestionsfindings每条含finding_id、dimension、severity、target_file、target_entityC{NN}/E{NN}/H{NN}/G{N} 或节点 ID、evidence_span必须是从 ARA 原文逐字截取的子串针对缺失类问题可省略、observation事实、reasoning为何重要、suggestion如何改进questions_for_authors留给作者的待澄清问题清单read_orderStep 1 的实际读取顺序。七条关键规则逐字 evidence_span针对内容存在的问题必须引用 ARA 中的精确子串缺失类问题缺基线、范围错配可省略构造性语气每条弱点都必须配建议是帮作者改进而非惩罚校准评分多数合格 ARA 应落在 3–4 分区间5 分代表真正优秀而非没发现问题1 分代表根本性问题而非还能更好杜绝虚假依据支撑必须经由 Proof → experiments.md → evidence/ 流动proseproblem.md、architecture.md中的口头共识不能替代实验证据仅限 ARA 内部不抓取外部 URL、不执行代码、不咨询外部来源对 ARA 报告的证据按面值采信平衡评审主动寻找优点而非只列缺点只罗列问题的评审没有价值不重查结构不复核引用解析、字段存在性、YAML 解析或跨链一致性——这些已由 Level 1 保证。十二、与 ARA 生态的联动关系要正确运用这套评审维度需要理解 ARA 各层文件的语义约定详见 ara-schema.mdclaims.md每条论断必须含 Statement、Status、Falsification criteria、Proof引用 E{NN} 实验 ID、Evidence basis、Interpretation 等字段且 Statement 应保持在证据直接支持的最强水平更宽泛的综合留给 Interpretation —— 这正是 D1/D3 评审的对象experiments.md声明式实验计划非脚本Expected outcome 只能写方向性/相对性结论精确数值一律进 evidence/ —— 这是 D6 的评审前提trace/exploration_tree.yaml带support_level: explicit|inferred的研究 DAG要求 ≥8 节点、至少 1 个 dead_end 和 1 个 decision —— 这是 D5 的评审对象evidence/原始表与派生子集必须命名区分、**Source**字段必须与文件名标识一致 —— 支撑 D1 的证据溯源。整个流程与 compiler 的 4 阶段认知链语义解构→认知映射→物理桩代码→探索图提取及 research-manager 的会话期实时记录互为表里Compiler 保证 ARA 的结构完整Research Manager 保证探索过程被如实记录Rigor Reviewer 则用本文的六维框架把证据是否支撑论断、过程是否诚实、论证是否连贯变成可量化、可审计的评分与建议。三者共同把研究输出变成可证伪、可被 Agent 遍历、经得起认识论拷问的知识包。结语从评分到改进review-dimensions.md 的价值不在于给 ARA 贴一个分数而在于把研究质量拆解成六个可操作的检查维度证据相关性D1、可证伪性D2、范围校准D3、论证连贯性D4、探索完整性D5、方法论严谨性D6。每条检查都对应明确的验证动作与严重度每个锚点都给出了 1–5 分的判别标准每处弱点都要求配一条建设性建议。将这套维度内化为日常的自我审稿习惯是让 Agent 产出的研究从看起来有道理走向站得住、可复现、可证伪的关键一步。赞分享AI 技能人工智能大模型深度学习【免费下载链接】AI-Research-SKILLsComprehensive open-source library of AI research and engineering skills for any AI model. Package the skills and your claude code/codex/gemini agent will be an AI research agent with full horsepower. Maintained by Orchestra Research.项目地址https://gitcode.com/gh_mirrors/ai/AI-Research-SKILLs点击查看免费下载相关推荐RuView Homecore 服务器运维评审一条由 ADR-161 与源码共同锚定的六步检查清单RuView Homecore 服务器运维评审一条由 ADR 161 与源码共同锚定的六步检查清单 本文以 RuView 仓库中 Homecore metah人工智能计算机视觉物联网智能家居后端嵌入式AriaNg代码评审清单质量与安全检查点AriaNg代码评审清单质量与安全检查点 1. 架构设计检查 1.1 核心模块完整性验证 | 模块类型 | 关键文件 | 职责验证点 | | | | | |前端JTAppleCalendar代码评审清单确保评审全面性的检查项JTAppleCalendar代码评审清单确保评审全面性的检查项 一、协议与接口一致性检查 1.1 核心协议实现验证 检查 JTACMonthViewData移动开发UI组件创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关推荐

2026 深圳装配电工怎么批量输送?从技能筛选到入职 7 个关键节点 SOP
2026 深圳装配电工怎么批量输送?从技能筛选到入职 7 个关键节点 SOP

一、为什么装配电工批量输送需要一个 SOP 某智能装备企业接到一笔新能源产线订单,要求 45 天内交付 60 台自动化装配设备。项目经理翻开人力需求表:装配电工缺口 28 人,要求持电工上岗证、能看懂电气原理图、能独立完成控制柜布线。HR 部门两… · 2026/9/24 23:13:21

OOTDiffusion 模型文件缺失排障:对照 4 个子目录,3 步补齐 checkpoints
OOTDiffusion 模型文件缺失排障:对照 4 个子目录,3 步补齐 checkpoints

OOTDiffusion 模型文件缺失排障:对照 4 个子目录,3 步补齐 checkpoints 【免费下载链接】OOTDiffusion [AAAI 2025] Official implementation of "OOTDiffusion: Outfitting Fusion based Latent Diffusion for Controllable Virtual Try-on" … · 2026/9/24 23:13:21

功放接音箱线全攻略:从正负极到桥接,避开烧机陷阱
功放接音箱线全攻略:从正负极到桥接,避开烧机陷阱

手里有台新功放,或者想把旧系统重新整理一遍,很多人的第一步会卡在“音箱线到底怎么接”上。这看起来是接两根铜线的事,但实际操作里,有人把左右声道接反,有人正负极搞错导致低音凭空消失,还有人因为接线短… · 2026/9/24 23:13:15

十年无博士毕业的博导背后:科研评价、导师指导与博士延毕的系统性困局
十年无博士毕业的博导背后:科研评价、导师指导与博士延毕的系统性困局

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:04:47

ESP32C3 LuatOS环境搭建避坑指南:固件烧录与脚本管理
ESP32C3 LuatOS环境搭建避坑指南:固件烧录与脚本管理

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:04:47

MobaXterm文件传输完整指南:SFTP拖拽、scp与rsync实战
MobaXterm文件传输完整指南:SFTP拖拽、scp与rsync实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:04:47

Ubuntu下Zephyr开发环境搭建实战:从west到SDK完整指南
Ubuntu下Zephyr开发环境搭建实战:从west到SDK完整指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:04:47

CUDA安装失败全解析:驱动版本匹配与报错排查实战指南
CUDA安装失败全解析:驱动版本匹配与报错排查实战指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:04:47

Linux下HP LaserJet P1008驱动安装与CUPS配置实战
Linux下HP LaserJet P1008驱动安装与CUPS配置实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:04:41

数值优化(Numerical Optimization)学习系列-03-共轭梯度方法(Conjugate Gradient)
数值优化(Numerical Optimization)学习系列-03-共轭梯度方法(Conjugate Gradient)

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:31

创维E900V22D刷机全攻略:S905L3SB芯片兼容性解析与救砖实战
创维E900V22D刷机全攻略:S905L3SB芯片兼容性解析与救砖实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:31

MQTT协议原理与Broker服务器搭建实战:从Mosquitto到EMQX
MQTT协议原理与Broker服务器搭建实战:从Mosquitto到EMQX

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:37

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码