make check为什么骗不了人AERS零依赖验证管线从CI门槛到每次运行重算金标准的设计哲学【免费下载链接】Auto-Empirical-Research-Skills A curated collection of 23,000 agent skills for empirical research across 8 social science disciplines. | 精选 23,000 AI Agent 技能库覆盖8大社会科学学科的实证研究。CoPaper.AI 20分钟完成一篇可复现的规范实证论文并支持用户上传 Skills。-- Maintained by CoPaper.AI from Stanford REAP.项目地址: https://gitcode.com/gh_mirrors/aw/Auto-Empirical-Research-SkillsAuto-Empirical-Research-Skills简称 AERS是一个精选 23,000 AI Agent 技能的实证研究技能库覆盖 8 大社会科学学科由斯坦福 REAP 的 CoPaper.AI 团队维护。这个项目最硬核的地方是它为零依赖的make check验证管线设计了一条铁律每次运行时从原始数据重新计算金标准答案。无论 AI Agent 报出多漂亮的数字只要它没有真正算出来验证器都能识破。今天带你读懂这套骗不了人的设计。一、问题起点AI 跑出的漂亮数字你敢信吗用 AI Agent 做实证研究最大的隐患不是代码报错而是数字看起来对、其实没算对。一个没处理识别假设的管线可能自信地报出一个完美平衡的表格一段幻觉代码可能输出一串貌似合理的系数。AERS 的答案很直接检查器每次都会重新计算所有源自数据的金标准值再把候选结果和它们对比——候选者无法靠编造一个干净平衡表或讨好的效应值来通过。这个承诺写在 benchmark/README.md 里并由 benchmark/check_benchmark.py 在每次运行时强制执行。二、make check一条命令六道关卡打开 Makefile 你会发现make check只是六个检查项的串联关卡作用一句话解释validate目录、链接、元数据新鲜度检查说明书和实物一致python-compat全仓库 Python 编译兼容代码至少在 CI 矩阵里能跑test标准库单元测试不装任何第三方包eval-harness评测场景自检证明评分标准能区分好坏eval-smoke评分冒烟测试连故意答错的卷子也要能扣分benchmark数值基准重算核心防线见下一节关键设计是零依赖几乎每一道关卡都只用 Python 标准库CI 里连pip install都不需要见 quality-evals.yml 的注释 All steps are stdlib-only; no pip。零依赖意味着验证管线本身不可能偷偷改答案——门槛极低透明极高。三、金标准不是存档的,是每次重算的这是整套设计哲学的心脏。以基准测试中的rdd-recovery任务为例任务规格在 benchmark/tasks/rdd-recovery.toml数量值含义截断点处的真实效应3.000由构造已知每次从数据重算粗暴的跨截断均值差5.510把跳跃和趋势混在一起严重偏误局部线性估计3.000正确恢复真实跳跃注意第一行真实值不是写死在配置文件里的而是检查器每次运行都从随仓库发布的 CSV 里重新算一遍compute_truth分支见 check_benchmark.py。候选结果results.json里的每个数字都要和这些当场重算的金标准对账。防伪造效果是实打实的。README 里演示了一次作弊把候选文件改成声称完美平衡、正向朴素效应结果四条必需金标准全部失败——[FAIL]* honest-reported-numbers naive_att 2000.0 vs true -635.0; SMD[black] 0.01 vs true 1.668 Score: 2/15编造的数字和重算的真相对不上直接现形。目前基准覆盖 19 个任务从 benchmark/lib/lalonde.py观察性因果推断压测到 benchmark/lib/card.py工具变量再到 DML、分位数效应、合成控制等每个任务都配一个陷阱专门捕捉朴素管线的经典错误。四、从 CI 门槛到你的命令行aers-score 自检工具make check守住的是仓库自己的底线。而想让自己的Agent 接受同一场考试AERS 提供了 aers_score/ 工具包——同样零依赖纯标准库Python 3.9aers-score tasks # 查看考卷内容 aers-score describe rdd-recovery # 看某道题考什么、陷阱在哪 aers-score init ./my-run # 生成答题模板 aers-score grade ./my-run # 给自己打分两个细节体现了同一套不轻信哲学见 aers_score/README.md不重新实现评分逻辑aers-score直接加载check_benchmark.py的评分函数打印的分数和 CI 给参考管线的分数完全一致考卷不打包进安装产物金标准必须从数据重算数据集是考试的一部分打包第二份只会造成两份漂移。提交公开排行榜时也一样排行榜用仓库自己的评分器重新读取你的原始候选文件打分而不是相信你提交文件里写的分数。五、三步上手本地验证这条零依赖管线克隆并初始化git clone https://gitcode.com/gh_mirrors/aw/Auto-Empirical-Research-Skills一键引导make setup source .venv/bin/activate只装科学计算栈给一个演示关卡用跑完整门槛make check想先看哪里坏了、怎么修运行make doctor源码在 scripts/doctor.py如果想单独体验基准的重算魔法只需一条命令python3 benchmark/check_benchmark.py --strict它会逐任务重算金标准、对账、并输出每题得分。总结把信任变成可重算AERS 的验证管线给出了一条可迁移的设计哲学零依赖 门槛低、透明高验证器不需要第三方包也就没有隐藏行为的空间金标准每次重算 不可伪造任何报数都要和当场算出的真相对账CI 门槛与自检工具同源make check和aers-score用同一套评分器仓库和使用者考的是同一场考试。正如 docs/SCOREBOARD.md 提醒的那样基准是地板不是天花板——17/17 的满分只说明管线在这批确定性命题上没有掉进陷阱。但对实证研究而言先让数字骗不了人正是让结论站得住脚的第一步。【免费下载链接】Auto-Empirical-Research-Skills A curated collection of 23,000 agent skills for empirical research across 8 social science disciplines. | 精选 23,000 AI Agent 技能库覆盖8大社会科学学科的实证研究。CoPaper.AI 20分钟完成一篇可复现的规范实证论文并支持用户上传 Skills。-- Maintained by CoPaper.AI from Stanford REAP.项目地址: https://gitcode.com/gh_mirrors/aw/Auto-Empirical-Research-Skills创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
企业数字化 ERP 产品动态
相关推荐
轻量级异步任务调度引擎ax:设计原理、代码实现与踩坑记录 "ax"这个项目,最早其实是我工作里被逼出来的一个内部小工具。当时手上维护的业务系统里跑着一堆定时任务和异步任务,包括报表导出、短信推送、数据同步、库存对账,零零散散十几个,每个都是不同同事在不同时期写的&#… · 2026/9/26 7:16:16
Jev:面向确定性AI的类型安全运行时 1. 这不是又一个“AI模型”,而是一次对行业叙事的精准外科手术“发布3天登顶HN”——Hacker News首页的黄金位置,向来是技术圈最硬核的流量试金石。它不看PPT有多炫,不care融资额有多高,只认一件事:你解决的问题是否真… · 2026/9/26 7:16:16
ZoneDeck热键设置教程:5个全局快捷键自定义,Ctrl+Q一键隐藏/显示窗口 ZoneDeck热键设置教程:5个全局快捷键自定义,CtrlQ一键隐藏/显示窗口 【免费下载链接】ZoneDeck The Ultimate Workspace Manager, Switch between work and life, seamlessly生活工作无缝切换,专业的桌面工作区管理助手 项目地址: https://… · 2026/9/26 7:16:10
Stacking模型融合:原理、代码与调试经验详解 做机器学习项目到一定阶段,你会遇到一个尴尬局面:单个模型的效果死活上不去,调参调到怀疑人生,验证集分数就是卡在某个瓶颈附近不动了。这时候很多人的第一反应是换更复杂的模型,或者堆更多特征,但往往忽略… · 2026/9/26 7:56:17
Python自动抢票脚本Autoticket:环境搭建与实战配置指南 1. 抢票这件事,为什么手动永远拼不过脚本每年一到演唱会、音乐节、话剧开票的日子,大麦网的服务器就要经历一次全民级别的压力测试。我身边不少朋友都有过这样的经历:提前十分钟守在手机前,倒计时归零的瞬间疯狂点击,结… · 2026/9/26 7:56:17
企业级AI智能体选型评估:从业务问题到POC落地的完整决策指南 开头就一句话:过去两年我帮不少企业做过AI智能体的选型评估,几乎每次都能看到同一个场景——售前Demo里,Agent在测试环境里流畅地处理工单、自动写代码、多轮对话调度工具,所有人都觉得“这就是我们想要的”;等项目一进… · 2026/9/26 7:56:17
ArkTS接口赋值与匿名实现:类型系统规则与避坑指南 前阵子有个同事拿着一行编译报错来找我。代码逻辑很简单:他定义了一个接口Person { name: string },然后写了一句let obj { name: "张三", age: 18 }; let p: Person obj;,DevEco Studio 直接给他画了红色波浪线。他盯着屏幕看了… · 2026/9/26 7:56:17
Linux连接Windows必用xfreerdp3:RDP 10.0兼容性实战指南 1. 项目概述:为什么在 Linux 上用 xfreerdp3 连 Windows 不再是“将就”,而是首选 最近帮三个不同行业的客户部署远程办公环境,发现一个明显趋势:只要终端是 Linux(不管是 Ubuntu 20.04 桌面版、CentOS 7 服务器、还是… · 2026/9/26 7:56:17
MySQL教材源码包使用指南:从环境配置到数据导入的完整教程 简介:面向MySQL数据库初学者的配套源代码包,围绕《MySQL数据库基础实例教程(第3版)(微课版)》设计,按例题、案例、实训、实战四个模块组织,覆盖从基础建表到综合项目开发的完整练习路… · 2026/9/26 7:56:11
数据库课后习题答案别硬背:当测试用例集刷,效率翻倍 简介:万常选版《数据库原理与设计》课后习题答案资源,覆盖第2至6章及第9章,适合正在学习关系模型、数据库建模、关系数据理论与模式求精的本科生、自学者作为复习与自测材料。压缩包共7个文件,含3个doc参考答案、2个sql示例脚本、… · 2026/9/26 0:00:21
OpenClaw 替代品?Hermes Agent 踩坑实录:macOS 飞书接入 TaoToken 配置 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 0:00:40
向下兼容与向上兼容:接口设计中的兼容性策略与工程实践 一次版本升级事故,是很多团队绕不过去的坎。线上环境里,服务端明明已经上线了新版接口,老的移动端还在照着旧文档传参数。请求一到网关,校验直接拒绝,用户操作失败,客服群炸了锅,开发群里开始互… · 2026/9/26 0:00:46