首页/新闻资讯/正文详情

LaLonde数据为何让Naive ATT翻车?AERS基准如何逼出+$1548而非-$635的真实因果效应

发布时间:2026/9/26 2:46:36 来源:云帆数科 栏目:资讯中心
LaLonde数据为何让Naive ATT翻车?AERS基准如何逼出+$1548而非-$635的真实因果效应
LaLonde数据为何让Naive ATT翻车AERS基准如何逼出$1548而非-$635的真实因果效应【免费下载链接】Auto-Empirical-Research-Skills A curated collection of 23,000 agent skills for empirical research across 8 social science disciplines. | 精选 23,000 AI Agent 技能库覆盖8大社会科学学科的实证研究。CoPaper.AI 20分钟完成一篇可复现的规范实证论文并支持用户上传 Skills。-- Maintained by CoPaper.AI from Stanford REAP.项目地址: https://gitcode.com/gh_mirrors/aw/Auto-Empirical-Research-SkillsAuto-Empirical-Research-SkillsAERS是由 CoPaper.AIStanford REAP维护的 23,000 AI Agent 实证研究技能库覆盖 8 大社会科学学科。其中内置了一套可复现的基准测试Benchmark给它一份有标准答案的数据看分析流水线能否恢复真实因果效应、并且躲开新手必踩的陷阱。本文用计量经济学史上最著名的LaLonde 数据做案例——同一个问题Naive ATT 给出 −$635正确做法给出 $1,548符号完全相反。1️⃣ 先看结论同一批人两个符号相反的答案数据就在仓库里demo-notebooks/_lalonde_data.csv共 614 行——185 名参加 NSW 就业培训项目的受训者加上 429 名来自 CPS 的非实验比较组。结局变量是 1978 年真实收入re78。估计方式数值说明Naive ATT未调整均值差−$635培训组收入反而更低 ❌ 误导性结论协变量调整后 ATT条件于前期收入 re74/re75$1,548真实因果效应的方向 ✅随机实验基准NSW 实验≈$1,794金标准选择偏误−$2,429两者之差$1,794 这个金标准不是抄来的。仓库把 NSW 随机实验的两臂数据原样存档在 demo-notebooks/nsw-lalonde-1986/用 replicate_nsw.py 直接算出 1,794.34185 减 260无模型、无协变量再由 tests/test_nsw_replication.py 把常数与推导钉死——改任何一边测试就挂。2️⃣ 为什么 Naive ATT 会翻车选择偏误的解剖两组人根本不是同类Naive ATT 的潜台词是培训组和对照组本来就差不多。但 LaLonde 数据狠狠打脸同一批受训者 vs随机化对照组处理前 1974 年收入差仅−$11基数约 $2,100——随机化生效两组本来可比较同一批受训者 vsPSID 观测比较组同一个差是−$3,524——受训者处理前就值钱得多。这意味着培训组是自我筛选出的、本来收入就更高的人群。直接拿他们和 CPS 比较组比 1978 年收入比较出来的差距里混着 −$2,429 的选择偏误把真实收益压成了负的。8 个协变量中有5 个的 |SMD| 0.25black、married、re74、re75、hispan属于严重失衡。平衡表在看结果之前就能发现的问题上图中蓝色是 185 名受训者、红色是 429 名对照两组的倾向得分分布几乎错开——不重叠就无法比较。这是在看结果之前就能诊断出的症状也正是平衡表balance table必须排在结果表前面的原因3️⃣ $1,548 是怎么被找回的逐步加协变量正确做法是条件于处理前变量尤其是前期收入 re74、re75做回归调整。仓库演示了一条渐进规格路线 M1→M6完整表格见 table2_main.tex规格控制内容TREAT 系数M1仅培训变量Naive−0.64M2 age、educ−0.48M3 black、hispan0.32M4 married1.16M5前期收入 re74/re75符号稳定为正M6 多项式控制0.74关键转折在收入类协变量进入回归的那一刻符号从负翻正。全协变量 OLSHC3 稳健标准误给出头条估计$1,54895% CI 为 [$78, $3,018]——与实验基准 $1,794 同量级、同方向完整机读结果见 result.json4️⃣ AERS 基准如何判卷把讲道理变成硬门槛如果只是口头强调别信 Naive ATT流水线尤其是 AI Agent仍然可能偷懒。AERS 的做法是把教训写成可执行的判分规则任务定义见 benchmark/tasks/lalonde-recovery.toml判分点Gold是否必需要求surfaces-imbalance✅ 必需平衡表中至少 3 个协变量 |SMD| 0.25naive-is-negative✅ 必需报告 Naive ATT 且为负承认它被误导adjusted-flips-positive✅ 必需调整后 ATT 翻正且上修 ≥ $1,000honest-reported-numbers✅ 必需报告的 Naive ATT 与 SMD 必须与数据重算值一致容差 $50 / 0.05near-experimental-benchmark⭕ 信息性落在 $1,794 附近容差 $1,500判卷脚本 check_benchmark.py 每次运行都从原始数据重算数据派生的标准答案失衡数量、真实 Naive ATT、SMD 表再与候选流水线的报告值对账。想伪造一张干净的平衡表基准文档里演示了篡改的候选连拿 4 个必需项挂掉只得了 2/15 分。稳健性方面基线 $1,548 在一串稳健性检验下保持稳定5️⃣ 新手上手三步 看数据打开 demo-notebooks/_lalonde_data.csv确认treat处理与re78结局两列复现金标准运行python3 demo-notebooks/nsw-lalonde-1986/replicate_nsw.py亲眼看到 $1,794 从随机化数据里被算出来并顺手完成 −$11 vs −$3,524 的随机化检验跑基准判卷运行python3 benchmark/check_benchmark.py查看 lalonde-recovery 等任务的得分参考流水线满分 15/15。基准总览与所有任务的判分逻辑见 benchmark/README.md。6️⃣ 值得记住的三件事符号可以骗人方向不能−$635 不是训练无效而是 −$2,429 选择偏误盖住了真实收益先看平衡表再看结果表处理前收入差 −$3,524 在碰 re78 之前就已暴露问题基准不是论文是裁判AERS 的 benchmark 把诚实报告失衡 → 拒绝 Naive 结论 → 调整后恢复正值从口号变成了 5 条可自动判分的硬规则这正是 23,000 技能库中可复现实证研究能力的压舱石。【免费下载链接】Auto-Empirical-Research-Skills A curated collection of 23,000 agent skills for empirical research across 8 social science disciplines. | 精选 23,000 AI Agent 技能库覆盖8大社会科学学科的实证研究。CoPaper.AI 20分钟完成一篇可复现的规范实证论文并支持用户上传 Skills。-- Maintained by CoPaper.AI from Stanford REAP.项目地址: https://gitcode.com/gh_mirrors/aw/Auto-Empirical-Research-Skills创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关推荐

RAG知识库文档引用溯源-技术实现方式_如何让rag返回 引用的结果输出时所引用的文档编号-CSDN博客
RAG知识库文档引用溯源-技术实现方式_如何让rag返回 引用的结果输出时所引用的文档编号-CSDN博客

首屏导读 本教程配套付费专栏: 大模型工程师修炼手记 19.9 元(AI 编程 / Agent 实战 | 本文同主题系统课程) AI时代程序员的自我提升 49.9 元(AI 时代成长方法论)。 单篇不过瘾?订阅解锁全量源… · 2026/9/26 2:46:30

windows下RabbitMQ的使用(1)——下载与安装
windows下RabbitMQ的使用(1)——下载与安装

一.RabbitMQ简介 RabbitMQ 是一款开源、高性能、高可靠的消息队列中间件(Message Queue, MQ),基于 AMQP 0-9-1 协议,使用 Erlang 语言开发,主要用于分布式系统中的异步通信、应用解耦与流量削峰。 1.核心组件 Produ… · 2026/9/26 2:46:30

少样本规则推理模型与未知任务自适应应用
少样本规则推理模型与未知任务自适应应用

Kaggle竞赛“ARC Prize 2026 - ARC-AGI-2”并非传统的预测建模任务,其核心目标是推动人工智能系统具备真正的“泛化”与“新颖问题解决”能力。竞赛要求构建的模型能够从极少数示例中推断出隐藏的抽象规则,并将此规则应用于从未见过的全新任务。 这种能力直接对应着现实业务… · 2026/9/26 2:46:30

中文用户全线中招,Claude网页限速,只因回复里有汉字
中文用户全线中招,Claude网页限速,只因回复里有汉字

万万没想到,Claude竟然被自己的「AI味儿」给坑惨了! 万万没想到,Claude竟然被自己的「AI味儿」给坑惨了! 今天凌晨,Anthropic放出一篇硬核的工程复盘。 他们把一个内部研究版Claude扔进Slack频道,「连轴… · 2026/9/26 4:12:07

Meta不再谈元宇宙,关键词改为“个人超级智能”
Meta不再谈元宇宙,关键词改为“个人超级智能”

2026年的Meta Connect大会,元宇宙“隐身”了,个人超级智能成为绝对主角。 2026年的Meta Connect大会,元宇宙“隐身”了,个人超级智能成为绝对主角。 美国当地时间9月23日,Meta在加州门洛帕克举行年度Connect开发者大… · 2026/9/26 4:12:07

WorkBuddy数据与隐私设置全指南:工作区授权、缓存迁移与记忆管理
WorkBuddy数据与隐私设置全指南:工作区授权、缓存迁移与记忆管理

1. 为什么数据与隐私设置值得单独拎出来讲很多人上手 WorkBuddy 的时候,注意力全在"怎么让它帮我干活"上——写代码、抓数据、生成网站、跑自动化工作流,恨不得第一天就把所有 Skill 都装一遍。结果用了两三周,突然发现工作台里堆了… · 2026/9/26 4:12:07

AI大模型编程实战:用TaoToken统一Key接入Cline与CC Switch的配置指南
AI大模型编程实战:用TaoToken统一Key接入Cline与CC Switch的配置指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 4:12:07

软考架构设计师论文 —— 论软件系统测试(3)
软考架构设计师论文 —— 论软件系统测试(3)

接前一篇文章:软考架构设计师论文 —— 论软件系统测试(2) 本文内容参考: 软考架构设计师论文 —— 论系统性能测试技术及其应用(1)_软件架构师论文 软件测试-CSDN博客 软考架构设计师论文 —— 论单元测试方法及其应用(3)_软考架构设计师论文 如何回应问题2-CSDN博客… · 2026/9/26 4:12:01

DeepSeek    LeetCode 153. 寻找旋 Java实现
DeepSeek LeetCode 153. 寻找旋 Java实现

LeetCode 153 题「寻找旋转排序数组中的最小值」要求以 O(log n) 的时间复杂度找出旋转后的升序数组中的最小元素。由于数组无重复元素,可以使用二分查找。 Java 实现 class Solution {public int findMin(int[] nums) {int left 0;int right nums.length - 1;whi… · 2026/9/26 4:12:01

数据库课后习题答案别硬背:当测试用例集刷,效率翻倍
数据库课后习题答案别硬背:当测试用例集刷,效率翻倍

简介:万常选版《数据库原理与设计》课后习题答案资源,覆盖第2至6章及第9章,适合正在学习关系模型、数据库建模、关系数据理论与模式求精的本科生、自学者作为复习与自测材料。压缩包共7个文件,含3个doc参考答案、2个sql示例脚本、… · 2026/9/26 0:00:21

OpenClaw 替代品?Hermes Agent 踩坑实录:macOS 飞书接入 TaoToken 配置
OpenClaw 替代品?Hermes Agent 踩坑实录:macOS 飞书接入 TaoToken 配置

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 0:00:40

向下兼容与向上兼容:接口设计中的兼容性策略与工程实践
向下兼容与向上兼容:接口设计中的兼容性策略与工程实践

一次版本升级事故,是很多团队绕不过去的坎。线上环境里,服务端明明已经上线了新版接口,老的移动端还在照着旧文档传参数。请求一到网关,校验直接拒绝,用户操作失败,客服群炸了锅,开发群里开始互… · 2026/9/26 0:00:46

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码