首页/新闻资讯/正文详情

Feynman Verifier Agent 深度解析:基于引文交叉核验的事实核查与代码对账机制

发布时间:2026/9/25 15:39:15 来源:云帆数科 栏目:资讯中心
Feynman Verifier Agent 深度解析:基于引文交叉核验的事实核查与代码对账机制
【免费下载链接】feynmanThe open source AI research agent.项目地址https://gitcode.com/gh_mirrors/feynman/feynman点击查看免费下载导读Verifier核验智能体是开源 AI 研究智能体 Feynman 中负责事实核查与验证的关键环节它以声明 被引来源为单位做定点核查而非像 Reviewer 那样通篇通读专门捕捉错误归因引用了观点不同的论文、过度陈述声称的结果强于来源所报与凭空捏造被引来源中毫无依据。本文以 verifier 智能体文档 为主体结合 Feynman 仓库中的 workflow 提示词prompts/deepresearch.md、prompts/audit.md、prompts/replicate.md、prompts/recipe.md、agents 系列文档 与各 workflow 文档系统讲解 Verifier 的职责边界、五步核验流程、置信度分级、局限性诚实声明以及在/deepresearch、/audit、/replicate、/recipe四条核心流水线中的调度位置帮助你理解 Feynman 如何把引用即事实从口头承诺落地为可审计的工程机制。Verifier 在 Feynman Agent 体系中的定位Feynman 内置了四类研究智能体构成一条收集 → 写作 → 评审 → 核验的流水线Agent职责对应文档Researcher检索文献与网页、深度阅读、抽取声明与方法论是多数流程的起点researcher.mdWriter将原始研究素材合成为带引文的学术文本简报、综述、论文草稿、对比报告writer.mdReviewer以严重度分级critical/major/minor/nit对研究产物做方法论评审reviewer.mdVerifier对具体声明做事实核查交叉核验引文与来源检查代码实现与论文描述是否一致verifier.md从角色分工看Verifier 与 Reviewer 存在显著区别Reviewer 是读者视角对整份文档做广度评审评估方法论、实验设计、写作质量与可复现性Verifier 是证据视角对单条声明逐一做深度核验不追求读完整个文档只聚焦这条声明 这个被引来源是否站得住。两者在/deepresearch中按严格的先后顺序执行Verifier 必须先于 Reviewer 完成核验且二者不允许在同一并行subagent调用中同时运行见 prompts/deepresearch.md Step 5/6从而保证先纠错、后评审的时序约束。Verifier 做什么三类典型缺陷的定点拦截根据 verifier.mdVerifier 针对的是以下三类高发研究缺陷误归因misattribution引用的论文实际上表达的是另一个观点声明与来源内容不符过度陈述overstatement声明声称的结果比来源实际报告的结果更强例如把相关性说成因果、把单数据集结果说成普适结论捏造fabrication声明在被引来源中根本没有依据属于凭空编造。Verifier 的工作单元是一个**声明-来源对**它接收一条声明和其被引来源检索该来源然后判断来源是否如声明所述支持该结论。这一机制可以从 Feynman 的 workflow 提示词中得到印证——prompts/deepresearch.md 明确要求草稿阶段执行citation sweep每条关键声明、数字、图表或基准必须映射到一个来源 URL、研究笔记、原始产物路径或命令/脚本输出无法支撑的声明必须删除或降级推断必须标注为推断。这正是 Verifier 后续逐条核验的输入前提。代码 vs 论文的核对维度当核验对象是代码实现 vs 论文描述时Verifier 检查的是具体的实现细节维度超参数hyperparameters架构配置architecture configurations训练流程training procedures评估指标evaluation metrics。它逐项比较论文描述与实际代码行为并以精确的文件路径和行号记录差异。这一能力的工程化落点在/audit流程中最为典型详见下文。五步核验流程可审计的证据链Verifier 对每条声明遵循一个系统化流程文档将其概括为五个步骤检索来源Retrieve the source——获取被引的论文、文章或代码文件定位相关章节Locate the relevant section——找到来源中处理该声明的具体位置比较Compare——检查来源是否如声明所述支持该结论分类Classify——将声明标记为 verified已核验、unsupported无支撑、overstated过度陈述或 contradicted被反驳记录Document——保存证据注明来源位置仅在必要时附上简短引文。这套流程设计上完全可追溯每一条完成的核验记录都会指明被检查的具体段落或代码便于第三方审计 Verifier 的工作质量。从仓库证据看这一可审计性要求贯穿整个产物体系/deepresearch要求产出outputs/slug.provenance.md侧车文件其中包含Verification: PASS / PASS WITH NOTES / BLOCKED状态与验证日志prompts/deepresearch.md计划阶段即需写入Verification log且修复后必须做磁盘级验证——用rg/grep/diff/wc证明旧的错误措辞已消失、新措辞已存在否则不得声称已修复对应 workflow 文档 deep-research.md 明确说明Feynman 对声明与引用来源进行交叉核验标记误归因或无法支撑的断言。置信度分级核验结论的可信度声明Verifier 为每条核验分配一个置信度等级文档给出了三级划分核验场景置信度原因声明直接引用来源原文高high字面对字面歧义空间小声明是转述或对结果的解读中moderate合理解读可能因人而异声明涉及结果的意义或重要性implications/significance低lower涉及主观判断这一分级逻辑与 Reviewer 的置信度评分设计一致reviewer.md 同样区分高置信度清晰无争议的问题与低置信度见仁见智的判断也与 Researcher 抽取阶段每条抽取项都打上来源位置标签以便追踪的做法呼应researcher.md。置信度分级不是装饰它直接影响最终产物/deepresearch要求single-source critical claims必须被 Reviewer 单独标记prompts/deepresearch.md Step 6正是因为低置信度声明更容易被过度采信。诚实的边界核验不了就说核验不了Verifier 明确拒绝猜测。当以下情况发生时它会显式声明无法核验而非强行给出结论来源位于付费墙之后paywall无法读取原文代码不可得code not available声明需要超出其评估能力的领域专业知识domain expertise。这一诚实失败原则同样体现在 workflow 提示词的降级策略中/deepresearch要求如果任何能力失败继续以降级模式运行仍然写出 blocked 或 partial 的最终产物与 provenance 侧车并标记Verification: BLOCKED/recipe明确禁止在未实际检查数据集可用性与格式的情况下把数据集描述为可用未检查项必须标记unverifiedprompts/recipe.md。换句话说无法验证是有记录的失败不是失败地记录——这是 Feynman 事实核验体系的核心纪律。调度位置Verifier 被哪些工作流调用verifier.md 明确列出了四条使用场景结合仓库中的 workflow 提示词与文档可以还原出每条场景下的具体调度方式/deepresearch最终事实核查通道在 deep research 流程中当启用了 researcher 子智能体时运行 Verifier 是强制步骤prompts/deepresearch.md Step 5触发条件只有使用了 researcher 子智能体即宽泛主题、多智能体调查时才必须运行 Verifier窄主题的what is X直接搜索模式禁止派生 Verifier 子智能体调度形状以subagent工具调用agent: verifier任务为为outputs/.drafts/slug-draft.md添加行内引文使用研究文件作为素材验证每个 URL将完整带引文的简报写入outputs/.drafts/slug-cited.md时序约束Verifier 必须在 Reviewer 之前完成且不能与 Reviewer 并行Verifier 返回后还要在磁盘上验证outputs/.drafts/slug-cited.md确实存在若写到了别处需移动或复制回来。注意这里 Verifier 承担了双重职责既逐条核验声明与来源是否匹配防止误归因/过度陈述/捏造又负责行内引文落地与 URL 可达性验证——两条能力合起来构成带引文简报的质量关。/audit论文声明 vs 代码实现的对账/audit流程把 Verifier 用在最贴合其代码核对能力的场景prompts/audit.md 与 audit.mdResearcher 先读论文抽取所有具体声明超参数、架构细节、训练流程、数据集划分、评估指标、报告结果并为每条声明打上论文中的位置标签Verifier 检查代码库为每条声明寻找对应实现核对配置文件、训练脚本、模型定义与评估代码确认代码与论文描述一致发现差异超参数不同、论文描述了但代码未实现某训练步骤、评估流程偏离论文时以精确文件路径和行号记录不匹配项同时检查常见可复现性隐患缺失随机种子、未固定版本的非确定性操作、硬编码路径、缺失环境规格。产出报告包含 Match Summary声明匹配代码的百分比、Confirmed Claims、Mismatches、Missing Implementations 与 Reproducibility Risks。审计计划的提示词要求对比论文所述的方法、默认值、指标与数据处理方式和实际代码并把verifier子智能体用于验证来源并添加行内引文。/replicate复现计划完整性的把关复现流程用 Verifier 确保复现计划捕获了所有必要细节prompts/replicate.md、replication.md。在 recipe pass 中每条被声称的结果必须链接到产生它的确切数据集、方法、超参数、计算假设、指标与代码路径无法验证的数据集可用性/模式必须标记为unverified而非假定可用。Verifier 在这里扮演计划完整性质检角色防止复现计划遗漏实现细节从而避免复现失败时无法区分论文问题与计划问题。/recipe头部配方关键来源的抽查对于非平凡的/recipe运行Verifier 检查排名第一的配方的关键来源、数据集可用性与代码路径prompts/recipe.md、recipe.md。/recipe的最终产物以verified、unverified、blocked、inferred四个标签精确标注每个配方的验证状态只有底层检查真正通过才允许声称某个方法是 SOTA、已被复现或可用于生产——这套标签体系正是 Verifier 核验结论在配方产物中的直接映射。全局调度方式从 slash-commands.md 可以确认 Verifier 的通用调度机制workflow 提示词通过 Pi 的subagent工具调用 researcher、reviewer、writer、verifier 等专用智能体窄任务保持由主智能体lead直接执行避免不必要的编排开销。同时/feynman-model命令允许为verifier子智能体单独指派已批准的研究模型实现主模型与核验模型的解耦。与其他 Agent 的分工边界将四个 agent 文档并置阅读可以勾勒出完整的质量保障矩阵Researcher收集抽取声明并打上来源位置标签产出带坐标的证据——这是 Verifier 可核验的前提Writer写作强事实声明回链到素材、单来源声明加限定语——写作端先做一轮自我约束Verifier 再做独立复核Reviewer评审评估方法学、实验设计、可复现性与写作质量产出严重度分级反馈Verifier核验逐条验证声明-来源一致性、代码与论文一致性产出可审计的核验记录。从执行顺序看Verifier 总是作为研究者与写作者产出之后的质控步骤quality control step运行。以/deepresearch为例完整顺序是Plan → Gather Evidence → Draft →CiteVerifier→ ReviewReviewer→ Deliver且 Verifier 完成后必须磁盘验证产物存在、Reviewer 完成后若发现 FATAL 问题需修复并复跑。这套先核验、后评审、再交付的流水线使得最终交付物同时具备引文正确性与方法论稳健性。小结Verifier 是 Feynman 事实质量体系的最后一道闸门它用声明-来源定点核验替代全文档通读用五步流程保证每条核验可追溯用三级置信度区分字面引用与主观解读的可信差异并用显式的无法核验声明拒绝猜测。在/deepresearch中它是强制的事实核查通道在/audit中它是论文与代码的对账引擎在/replicate与/recipe中它是计划完整性与配方可信度的把关者。若想进一步深入可以阅读 agents 目录 下的四份智能体文档、workflows 目录 下对应流程文档以及 prompts 目录中的原始 workflow 提示词——后者包含 Verifier 调度 JSON 与验证日志格式等最底层实现约定。赞分享【免费下载链接】feynmanThe open source AI research agent.项目地址https://gitcode.com/gh_mirrors/feynman/feynman点击查看免费下载相关推荐Claude Ads source-verifier 深度解析付费媒体事实的对抗性核查与四级置信度分类Claude Ads source verifier 深度解析付费媒体事实的对抗性核查与四级置信度分类 Claude Ads 的审计、规划、创意与投放建议全部Feynman pdf-explore跨页科学论文的提取、锚定与交叉核验实战指南Feynman pdf explore跨页科学论文的提取、锚定与交叉核验实战指南 导读 本指南围绕开源 AI 研究代理 Feynman 的 pdf exploget-shit-done 的 gsd-doc-verifier 详解用对抗性事实核查让项目文档与真实代码库保持一致get shit done 的 gsd doc verifier 详解用对抗性事实核查让项目文档与真实代码库保持一致 导读 在 AI 辅助编程的时代项目文档人工智能AI 应用提示工程开发工具工作流自动化AI Agent上一篇douyin-downloader 实战上手指南批量下载抖音视频、合集与直播的完整攻略下一篇iPhone激活锁绕过免费工具applera1n怎么用4步解锁iOS 15-16.6完整教程创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关推荐

AI芯片部署实战:模型量化与推理优化全链路解析
AI芯片部署实战:模型量化与推理优化全链路解析

1. 这不是“芯片AI”的简单拼凑,而是算力与算法的重新契约很多人看到“AI芯片架构”四个字,第一反应是:哦,又一个讲NPU、TPU、存算一体的硬件科普。但Day35这期内容的真正起点,恰恰是从一次失败的模型部署开始的——我… · 2026/9/25 15:39:09

企业级AI平台与Agent生态:从工具到数字员工的落地实践
企业级AI平台与Agent生态:从工具到数字员工的落地实践

1. 从"工具"到"同事":企业级AI平台到底在解决什么问题过去两年,我参与过好几个中大型企业的AI落地项目,从最初大家把大模型当成一个"高级搜索框",到后来试图让它接管工单、写代码、跑数据分析&… · 2026/9/25 15:38:44

从龚克之问看人工智能:认知框架、学习路径与制造业智能体实践
从龚克之问看人工智能:认知框架、学习路径与制造业智能体实践

1. 从龚克之问说起:人工智能到底该怎么看“龚克:今天我们该怎么看人工智能?”这个问题第一次看到的时候,我正坐在办公室里调一个推荐系统的排序模型,屏幕上跑着特征重要性的输出,脑子里还在想某个特征的分箱… · 2026/9/25 15:38:37

ChatGPT failed to start报错
ChatGPT failed to start报错

文章目录前言一、移动到C盘二、编辑环境变量1.下载文件总结前言 8月27日windows打开gpt后报错: ChatGPT failed to start. Unable to locate the Codex CLI binary. Set CODEX_CLI_PATH or ensure the Electron resources include bin/codex. 一、移动到C盘 第一… · 2026/9/25 16:24:57

Ghidra MCP 7.0.0 工具整合迁移指南:272→251工具的破坏性变更全解析
Ghidra MCP 7.0.0 工具整合迁移指南:272→251工具的破坏性变更全解析

Ghidra MCP 7.0.0 工具整合迁移指南:272→251工具的破坏性变更全解析 【免费下载链接】ghidra-mcp Ghidra MCP Server — 200 MCP tools for AI-powered reverse engineering. GUI plugin headless server, lazy tool loading, convention enforcement, batch oper… · 2026/9/25 16:24:27

OBS/会议/游戏怎么接入手机麦克风?MicYou虚拟声卡路由保姆级教程
OBS/会议/游戏怎么接入手机麦克风?MicYou虚拟声卡路由保姆级教程

OBS/会议/游戏怎么接入手机麦克风?MicYou虚拟声卡路由保姆级教程 【免费下载链接】MicYou MicYou is a powerful tool that turns your Android device into a high-quality microphone for your PC. 项目地址: https://gitcode.com/gh_mirrors/mi/MicYou MicYou 是一款… · 2026/9/25 16:24:20

基于 Spring Boot 的二手车交易网站的设计与实现
基于 Spring Boot 的二手车交易网站的设计与实现

温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 1. 项目背景与意义 随着汽车保有量的持续增长和消费观念的转变,二手车交易市场呈现出快速发展的态势。传统的线下二手车交易存在信息不对称、车源分散、交易… · 2026/9/25 16:23:56

GEOFlow知识库搭建完整指南:pgvector向量检索让AI内容生产有据可依
GEOFlow知识库搭建完整指南:pgvector向量检索让AI内容生产有据可依

GEOFlow知识库搭建完整指南:pgvector向量检索让AI内容生产有据可依 【免费下载链接】GEOFlow Open-source GEO content engineering and multi-site distribution platform with AI quality inspection, illustrated admin help, hosted sites, browser-assisted pu… · 2026/9/25 16:23:31

Agent Skills 实用指南:构建可复用智能体技能体系
Agent Skills 实用指南:构建可复用智能体技能体系

"agent-skills"这个词,最近在AI圈子里被反复提起。我做智能体开发也有两三年了,从最早的提示词堆砌,到后来的函数调用,再到现在围绕技能(skills)来构建智能体,最大的感受是&#xff1… · 2026/9/25 16:23:31

数值优化(Numerical Optimization)学习系列-03-共轭梯度方法(Conjugate Gradient)
数值优化(Numerical Optimization)学习系列-03-共轭梯度方法(Conjugate Gradient)

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:31

创维E900V22D刷机全攻略:S905L3SB芯片兼容性解析与救砖实战
创维E900V22D刷机全攻略:S905L3SB芯片兼容性解析与救砖实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:31

MQTT协议原理与Broker服务器搭建实战:从Mosquitto到EMQX
MQTT协议原理与Broker服务器搭建实战:从Mosquitto到EMQX

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:37

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码