AERS eval-harness 评测指南41个行为场景 × 210项评分细则如何检验AI Agent的实证研究能力【免费下载链接】Auto-Empirical-Research-Skills A curated collection of 23,000 agent skills for empirical research across 8 social science disciplines. | 精选 23,000 AI Agent 技能库覆盖8大社会科学学科的实证研究。CoPaper.AI 20分钟完成一篇可复现的规范实证论文并支持用户上传 Skills。-- Maintained by CoPaper.AI from Stanford REAP.项目地址: https://gitcode.com/gh_mirrors/aw/Auto-Empirical-Research-Skills在让 AI Agent 写实证论文时最大的隐患不是它不会写而是它写出看起来合理但推断上有错的文本。Auto-Empirical-Research-SkillsAERS开源了eval-harness/评测框架用41 个行为场景和210 项评分细则rubric自动检验Agent 加载技能后能否拒绝在小样本交错 DID 中报朴素 TWFE、能否在工具变量 F 统计量偏低时切换弱 IV 稳健推断、能否把 AER 摘要压缩到 100 词以内。它是一个零第三方依赖的打分器机器可判定项自动判分主观项生成评审提示词交给人或 LLM 评审——这正是评估 AI Agent 实证研究行为的一把标尺。一、为什么给提示词技能写评分细则AERS 收录的 23,000 技能大多是prompt-context提示词上下文而非可执行代码——没有函数可以做单元测试。那能测什么测 Agent 加载技能后输出是否具有正确的属性。每个评测由两部分组成定义在 eval-harness/README.md场景scenario一个真实感用户请求例如我用大学距离做工具变量估计教育回报第一阶段 F 约 8请像一篇严谨的应用微观论文那样报告结果评分细则rubric一份可检查属性的清单逐条判分。场景文件是 TOML 格式eval-harness/scenarios/ 下每场景一个文件文件名即场景 ID以 statspai-weak-iv.toml 为例它的 5 条细则包括必须报告第一阶段 F 值、必须把 F≈8 标记为弱工具变量、必须推荐 Anderson-Rubin 置信区间、不得出现F8 没问题这类虚假安慰regex_none检查禁用表述外加一条交人工评审的排他性假设讨论项。二、41 个行为场景覆盖实证研究的 8 大风险区场景按category字段归入 8 类对应实证研究中 Agent 最容易翻车的环节类别数量典型场景causal-identification因果识别20statspai-staggered-did.toml交错DID陷阱、aer-shiftshare-identification.tomlBartik 识别statistical-validity统计有效性8pyfixest-panel-clustering.toml面板聚类、statspai-rdd-diagnostics.toml断点诊断writing-compliance写作合规3aer-abstract-100words.toml摘要≤100词reproducibility可复现性3aer-replication-package.toml复现包结构citation-hygiene引用卫生3citation-hygiene-no-fake-refs.toml禁止虚构文献research-integrity研究诚信2econ-audit-recompute-not-restate.toml审计必须重算而非复述writing-style写作风格2english-deslop.toml去 AI 腔runtime-safety运行时安全1runtime-safety-replication-setup.toml拒绝陌生复现包中的危险指令每个场景还带severity严重级critical/high/medium/low——critical 场景强制配备鉴别性夹具见第四节因为仓库最依赖的检查恰恰是最不能赌在未经证明的细则上的地方。三、210 项评分细则8 种检查类型自动判分全部细则按检查类型分布为regex_any164 条、regex_none24 条、word_count_max1 条、regex_all3 条、regex_count_max4 条以及 21 条manual项。核心检查原语定义在 eval-harness/lib/checks.py检查类型通过条件用途regex_any至少一个模式命中必须出现的关键表述regex_none所有模式均未命中禁止出现的错误安慰word_count_max/min词数/字数/CJK 字符数达标摘要 100 词上限等numeric_tolerance/numeric_sign提取数字与期望值偏差/符号匹配报告数值是否算对manual永不自动通过转人工/LLM 评审两个设计细节值得新手注意section作用域检查可限定在文档某一段用正则捕获比如只统计改写正文里的 AI 腔套话避免误伤引用原句的变更说明非必需项与必需项分开计分required true的细则全库 151 条挂掉即整个场景不通过非必需项挂掉只影响分数不影响结论。四、鉴别性夹具评分细则自己也要被考试细则数量很容易注水——把模式写得宽泛所有场景全绿却什么都没测。AERS 的对策是给场景配夹具对eval-harness/fixtures/eval-harness/fixtures/场景ID/ pass.md 一份谨慎、正确的答案 fail.md 一份会语法但不懂推断的答案fail.md不是稻草人而是 Agent 真的会写、并且会理直气壮辩护的那种民间错误。自检命令 run_evals.py 的--selftest模式执行两条硬标准每一条自动可查细则必须在pass.md上通过——正确答案都满足不了的细则是坏细则不是严细则fail.md上至少一条必需细则必须失败——错误答案能一路冲过的细则等于没测。五、如何运行三条命令跑完评分流程整个框架只依赖 Python 标准库配合 scripts/toml_compat.py 解析 TOML无需 API Key# 1. 校验全部场景 覆盖率报告CI 门禁 python3 eval-harness/run_evals.py # 2. 对 Agent 输出打分生成 results/RESULTS.md 与 results.json python3 eval-harness/run_evals.py --grade eval-harness/candidates/_example # 3. 为人工/LLM 评审项生成即贴即用的 judge 提示词 python3 eval-harness/run_evals.py --judge-prompts /tmp/judge \ --grade eval-harness/candidates/_example要评测真实 Agent 时把每个场景的prompt带着指定技能喂给你的 Agent把回复存为candidates/运行名/场景ID.md再执行--grade。示例输出集 candidates/_example/ 是手写的评分夹具——其中一份刻意薄弱弱 IV 场景用于证明打分器本身能区分好坏。状态语义全部机器项通过、无必需项失败、无未决人工项才是pass只要还有未决的manual项状态就是needs-manual而非通过。这是一个刻意的必要非充分门禁全绿只说明没踩中已知雷区而失败则能证明答案是错的例如它把 F8 的工具变量说成强工具——这种不对称性正是一个廉价、常开 CI 门禁最需要的性质。六、诚实的局限别把它当论文质量证书eval-harness/README.md 明确列出了三条限制新手使用时应同样清醒正则细则粗粒度是设计使然它抓的是旗舰技能要防的特定失败模式不证明整体质量。绿色机器项 manual评审项才构成完整判断场景绑定编写时已验证存在的技能内容技能方法论变更时需同步更新场景自检只证明细则能区分一份正确 vs 一份错误答案排除了全匹配/全不匹配两种廉价失败模式但不证明细则在经济计量学上是正确的。结语评测层如何拼成完整闭环AERS 的评测体系是三层递进声明层的 docs/EVALS.md8 个旗舰技能评测提示词定义好长什么样→ 可执行层的eval-harness/本次主角把预期变成 CI 里强制执行的自动判分→ 数值层的 benchmark/20 类模拟数据任务的数值对标。对想评估自家 AI Agent 实证研究能力的新手建议从python3 eval-harness/run_evals.py开始读懂 schema/scenario.schema.json 后即可按 statspai-weak-iv.toml 的模板为自己关心的失败模式新增场景——让Agent 会不会做研究这个问题第一次变得可测量。【免费下载链接】Auto-Empirical-Research-Skills A curated collection of 23,000 agent skills for empirical research across 8 social science disciplines. | 精选 23,000 AI Agent 技能库覆盖8大社会科学学科的实证研究。CoPaper.AI 20分钟完成一篇可复现的规范实证论文并支持用户上传 Skills。-- Maintained by CoPaper.AI from Stanford REAP.项目地址: https://gitcode.com/gh_mirrors/aw/Auto-Empirical-Research-Skills创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
企业数字化 ERP 产品动态
相关推荐
苍穹外卖 引言标题欧克,接下来让我们步入正题项目背景:黑马程序员《苍穹外卖》作为Java企业级开发实战项目,涵盖SpringBoot、MySQL、Redis等技术栈学习目标:掌握外卖系统核心功能开发与全栈技术整合技术选择技术选型技术栈概览后端框架&… · 2026/9/26 2:41:12
判据、全绿、缺口、漂移与自查 —— 线上补课(下) 系列:gdev-master(NVIDIA/nouveau 用户态 GPGPU 运行时)从 C/C 到 Rust 的移植工程 第三部换了一个问题:前两部回答「怎么搬」,这一部回答「凭什么说对了」。
一句话核心最值钱的一格每写一条检查,同时写… · 2026/9/26 2:41:00
通达信涨停回踩缩量选股公式:BARSLAST函数实战与参数调优 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 2:41:00
金融行业网络钓鱼攻击演进与防御体系适应性强化策略 上周三下午,我收到了一封自称来自“内部系统管理中心”的邮件,提示财务报销系统需要重新认证。发件域名看起来是内部后缀,邮件里嵌的链接点开后的登录页和我们实际使用的系统几乎一模一样,唯一破绽是URL前缀多了一个字符。那一刻我… · 2026/9/26 3:23:21
Laya+System 1本地部署实战:轻量级可解释决策模型落地指南 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 3:23:21
SolidWorks紫色漏斗怎么解决?选择过滤器导致草图选不中 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 3:23:21
IntelliCLI 开源啦!!!用 Docker + ollama 把本地 LLM 接进命令行 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 3:23:15
Cursor Rule 实战:用 MDC 规则文件让大模型不再胡乱回答 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 3:23:15
数据库课后习题答案别硬背:当测试用例集刷,效率翻倍 简介:万常选版《数据库原理与设计》课后习题答案资源,覆盖第2至6章及第9章,适合正在学习关系模型、数据库建模、关系数据理论与模式求精的本科生、自学者作为复习与自测材料。压缩包共7个文件,含3个doc参考答案、2个sql示例脚本、… · 2026/9/26 0:00:21
OpenClaw 替代品?Hermes Agent 踩坑实录:macOS 飞书接入 TaoToken 配置 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 0:00:40
向下兼容与向上兼容:接口设计中的兼容性策略与工程实践 一次版本升级事故,是很多团队绕不过去的坎。线上环境里,服务端明明已经上线了新版接口,老的移动端还在照着旧文档传参数。请求一到网关,校验直接拒绝,用户操作失败,客服群炸了锅,开发群里开始互… · 2026/9/26 0:00:46