arc-task-gen分层生成实战用Chollet分类17种mechanic均匀覆盖ARC变换机制【免费下载链接】arc-task-genGenerates original ARC-AGI-1-style tasks distribution-matched to the public eval set.项目地址: https://gitcode.com/gh_mirrors/ar/arc-task-genarc-task-gen 是一个按分布匹配的 ARC-AGI-1 风格网格任务生成器。本文带你实战它的分层生成stratified generation流程先用 Chollet 六类认知原语给公开评测集打标再用 17 种变换 mechanic 均匀分配任务让模型无法靠背题得分。公开评测集早已出现在训练语料里模型在它上面的分数只是少样本规则归纳的上界。arc-task-gen 的解法是生成一套私有任务且可测量属性与公开评测集一致使两次成绩可以相互比较。上图即配套研究中私有评测集的用法背景BDH-CQ 用 150M 参数在 ARC-AGI-1 公开集上取得 29.5% pass2单任务成本仅 $0.0007 —— 而 arc-task-gen 正是用来生成模型没见过的等价题来交叉验证这类成绩的工具。 分层生成 vs 基础生成多了什么基础版 generate_tasks.py 做的是联合约束采样每个生成任务从某一个公开评测任务整体抽取行、列、颜色数、训练/测试对数见 sample_joint_slots保证网格大小、配色数、对数的自然协方差被保留。但任务考的是什么能力仍未受控。分层版 generate_tasks_stratified.py 在此基础上再加两个条件条件轴粒度作用Chollet 类别6 类认知原语粗粒度跨任务集可比的确认性分析轴mechanic17 种具体变换细粒度均匀覆盖变换机制避免自然分布的严重偏斜两类标签都由 LLM 一次性标注完成代码在 label_eval_tasks.py。6 类 Chollet 认知原语object_centric对象中心、geometric几何变换、spatial_relational空间关系、numerical数值参数化、pattern_completion模式补全、compositional组合原语。17 种 mechanic含other逃生口超过 15% 即说明列表需要修订类别包含的 mechanic几何类symmetry_completion、reflection、rotation、translation、scaling、tiling_repetition对象类cropping_extraction、flood_fill、denoising、object_counting、object_sorting_rank、recolor_by_property、gravity_stacking结构类line_drawing、occlusion_repair、panel_set_operation、other 设计意图mechanic 是闭合列表这样不同任务集之间的计数才可比other是刻意留的逃生阀。 三步跑通 stratified 生成先获取项目并安装Pixi 管理环境依赖见 pixi.tomlgit clone https://gitcode.com/gh_mirrors/ar/arc-task-gen cd arc-task-gen pixi install export OPENAI_API_KEYsk-... # 任意 OpenAI 兼容端点均可然后三步走python label_eval_tasks.py # ① 一次性打标category mechanic python generate_tasks_stratified.py --n 400 # ② 仅类别匹配按公开集类别比例 python generate_tasks_stratified.py --mechanics all --per-mechanic 25 # ③ mechanic 均匀分层三条命令的含义打标label_eval_tasks.py 只把每个任务的训练对喂给 LLM盲于求解结果产出data/arc_agi_eval_categories.json。可用--limit 10先做便宜冒烟测试。类别匹配每个生成任务绑定一个公开评测锚点任务的形状序列 类别。mechanic 分层--mechanics all --per-mechanic 25即 16 种 mechanic 各 25 题共 400 题——均匀分配而不是听任自然分布自然分布非常偏斜。怕烧钱加--dry-run-plan可只写出抽样计划默认存到data/stratified_slot_plan.json而不发起任何 API 调用先检查锚点与 mechanic 的分配是否合理。⚙️ 锚点画像与均匀分配的机制细节每个生成任务的提示词由 format_prompt 拼装携带该锚点任务的形状序列、颜色数、密度标签、输出尺寸关系等统计量外加一个必须实现的 mechanic。注意公开网格、规则描述和任务 id从不进入提示词只有统计量和标签——从机制上杜绝了向生成模型泄露公开题。均匀分配的核心在 build_mechanic_plan每种 mechanic 固定分配--per-mechanic个 slot从拥有该 mechanic 的公开锚点中随机抽取某 mechanic 锚点不足 8 个MIN_ANCHORS时自动向其众数类别借用锚点池并在计划中标记anchor_pool_borrowed整个计划由 seed 控制可复现。生成的 slot 计划会写入 write_plan其中包含类别计数、形状关系分布和mechanic_counts方便你在正式跑之前核对均匀覆盖是否达成。由于 stratified 版只是包装器它完整复用 generate_tasks.py 的生成循环每调用只生成一题实测一次要多题会显著缩小网格、embedding 余弦去重阈值 0.80、与公开评测规则的去重阈值 0.92需先跑 describe_eval_tasks.py、结构校验与收敛循环。 输出产物与分布验证结果落在data/generations_stratified/gen_timestamp/与基础版相同的三件套文件内容tasks.json全部任务id 键控标准 ARC{train: [...], test: [...]}格式separated/id.json每题一文件可直接载入 ARC 测试界面sanity_check.json分布对比、每题规则描述、slot 溯源、逐轮过滤历史想肉眼看题visualize_tasks.py 会把任务渲染成 PNG输入在左输出在右测试对带红色标注python visualize_tasks.py data/generations_stratified/gen_ts/官方 400 题 vs 生成 400 题的关键指标对照摘自 instructions.md输入面积均值 226.92 vs 224.70、输入行数 13.23 vs 13.19、颜色数 5.35 vs 5.24、≥4 训练对占比 34.2% vs 34.8%——分布对齐精度在 1% 量级。⚠️ 使用前的三个注意事项可解性不做程序校验结构检查只验证矩形网格与 0–9 取值。官方盲测 20 题中 19 题可解——建议你自己抽样验证再信分数。去重受措辞限制两题机制相同但描述不同会双双存活聚类内留下哪一题是任意的。任务 id 会泄露规则diagonal_corner_echo这类名字是模型起的给人工求解者看题前请重编号且sanity_check.json里含有每题的规则描述注意保密。另外生成的任务集刻意不提交进仓库——一旦公开就会进入网络爬取语料基准即失效。 核心文件速查文件职责generate_tasks.py基础生成器联合槽采样、去重循环、sanity 检查generate_tasks_stratified.py分层生成包装器类别匹配 mechanic 均匀分配label_eval_tasks.py一次调用打两个标签Chollet 类别 mechanicdescribe_eval_tasks.py为公开评测集生成规则描述启用跨集去重visualize_tasks.py任务渲染为 PNG快速肉眼质检instructions.md完整使用说明与数据目录约定一句话总结先label_eval_tasks.py打标再generate_tasks_stratified.py --mechanics all --per-mechanic 25即可得到一套类别分布对齐、16 种变换机制均匀覆盖的 400 题私有评测集——用它测出的分数才是模型真会推理的证据。【免费下载链接】arc-task-genGenerates original ARC-AGI-1-style tasks distribution-matched to the public eval set.项目地址: https://gitcode.com/gh_mirrors/ar/arc-task-gen创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
企业数字化 ERP 产品动态
相关推荐
如何看苹果手机型号图解原理3步搞定源码级拆解 如何看苹果手机型号图解原理3步搞定源码级拆解 看了一堆教程还是不会写项目?别急,今天咱们不聊虚的。很多开发者卡在环境配置或硬件兼容性上,其实核心就在于搞懂底层逻辑。今天这篇《如何看苹果手机型号图解原理》,带你从代码层面彻底吃透这套机制。… · 2026/9/22 11:11:55
cc助手实战:3步搞定性能优化避坑指南 cc助手实战:3步搞定性能优化避坑指南 刚学完 Python 语法,面对空白的 IDE 窗口,你是不是也懵了?知道怎么写 for 循环,却不知怎么搭个能跑的项目。很多人卡在“从代码到产品”的鸿沟里,尤其是做工具类应用时, 性能优化… · 2026/9/22 11:48:56
国六标准实战避坑指南:转行数据人必备速查手册 国六标准实战避坑指南:转行数据人必备速查手册 看了一堆教程还是不会写项目?这是很多转行数据开发的伙伴最真实的崩溃时刻。你背了无数概念,敲了无数Hello… · 2026/9/22 11:48:49
团新手避坑 3步搞定劳务班组薪资避坑:完整示例与原理拆解 面试被问原理答不上来,是大多数劳务班组负责人和技术骨干的噩梦。你背了无数条款,一到现场算薪、补证、报名就卡壳,根本讲不清背后的逻辑。别慌,今天这篇不整虚的,直接上 完整示例… · 2026/9/22 11:48:37
魏世杰版API迁移实战项目避坑指南 魏世杰版API迁移实战项目避坑指南 版本升级后 API 全变了,这是后端开发最绝望的瞬间。你明明看着旧的文档写的代码,一跑测试全红,报错信息却像天书。更恶心的是,新版文档把旧接口直接删了,连个过渡期都不给。这种痛苦在 魏世杰 参与的几个… · 2026/9/22 11:48:31
2026最新华为荣耀8价格源码解析与Javyes对比选型指南 2026最新华为荣耀8价格源码解析与Javyes对比选型指南 官方文档翻了三遍,核心逻辑还是抓不住重点?别急,很多开发者都卡在“华为荣耀8价格”这个看似与代码无关的关键词上。其实,这背后隐藏着电商系统最核心的 数据一致性 与 并发处理… · 2026/9/22 11:48:31
5个电影海报图片处理坑,新手避坑指南 5个电影海报图片处理坑,新手避坑指南 刚写完代码,一运行屏幕直接炸了。满屏红色的 StackTrace 滚得比弹幕还快,什么 NullPointerException 、 ImageIO.read() returned null 、… · 2026/9/22 0:00:07
注册微信公众账号:一文搞懂从0到1全流程 注册微信公众账号:一文搞懂从0到1全流程 复制来的代码跑不通,报错信息满屏飞,到底卡在哪?别急,咱们先停下手里的调试。很多开发者觉得注册微信公众账号只是填个表单、传个身份证那么简单,真上手才发现坑深不见底。今天这篇 一文搞懂… · 2026/9/22 0:00:07