首页/新闻资讯/正文详情

明日直播|ICLR2026,首个可Scaling!FeatureBench打造Agentic Coding评测新框架

发布时间:2026/9/26 9:43:31 来源:云帆数科 栏目:资讯中心
明日直播|ICLR2026,首个可Scaling!FeatureBench打造Agentic Coding评测新框架
1. 为什么 FeatureBench 值得 Code Agent 开发者关注如果你正在做 Code Agent 的评测或训练大概率遇到过这样的尴尬模型在 SWE-bench 上分数刷得很高但一放到真实仓库里让它实现一个新功能就频繁翻车。原因不复杂——SWE-bench 这类基准的平均补丁只有约 30 行任务描述还常常含糊模型靠猜也能蒙对一部分区分度早就饱和了。FeatureBench 是 ICLR 2026 收录的工作它把评测目标从「修 bug」换成了「实现一个完整 feature」。任务来自真实仓库平均涉及 790.2 行代码修改并且配有规范的接口签名来消除歧义。更关键的是它把从数据生成到推理评测的全套基础设施都开源了原生适配 OpenHands 和 Claude Code 等主流 Agent 框架。这意味着你可以直接拿它跑自己的 Agent而不是从零搭一套评测环境。这篇文章面向两类人一是想复现 FeatureBench 评测流程的 Code Agent 开发者二是需要一套可扩展评测框架的研究者。我会给出可复制的配置骨架settings.json 与 config.toml并演示如何在 TaoToken 统一 Key/API 通道下跑通一次评测任务。整个流程你可以在本地跟着做不需要复杂的集群。2. TaoToken 前置准备统一 Key 与 API 通道FeatureBench 本身是一个评测框架它需要调用大模型来完成 Agent 的推理。这里我用 TaoToken 作为统一的模型接入通道好处是一个 Key 就能切换不同模型省去在多个平台之间来回配置的麻烦。你需要先拿到一个 API Key。访问控制台地址创建https://taotoken.net/api-keys?utm_sourcetaotoken_aicg_blog_endutm_contentapi_keysutm_campaignrewrite创建完成后记下 Key后面配置里会用到。TaoToken 的 API 基地址是https://taotoken.net/api注意这个地址不带任何查询参数直接作为 base_url 使用。如果你用的是 OpenAI 兼容的 SDK把 base_url 指向它即可。模型对话的入口在这里可以先手动验证一下 Key 是否可用https://taotoken.net/models?utm_sourcetaotoken_aicg_blog_endutm_contentmodelsutm_campaignrewrite提示FeatureBench 的评测任务会消耗较多 token尤其是涉及 790 行级别的 feature 实现。建议先在模型对话页面用一个小任务确认通道正常再跑完整评测。对于长期做编码和 Agent 评测的场景可以考虑 Coding Plan它在批量任务下更划算https://taotoken.net/coding-plan?utm_sourcetaotoken_aicg_blog_endutm_contentcoding_planutm_campaignrewrite接入文档在这里遇到参数问题可以对照查https://taotoken.net/doc?utm_sourcetaotoken_aicg_blog_endutm_contentdocutm_campaignrewrite3. 可复制配置settings.json 与 config.toml 骨架FeatureBench 的评测流程通常分两部分Agent 运行配置和评测任务配置。下面给出两个文件的骨架你可以直接复制后改 Key 和路径。3.1 settings.jsonAgent 与模型通道配置这个文件负责告诉 FeatureBench 用哪个 Agent 框架、调用哪个模型、走哪个 API 通道。{ agent: { framework: openhands, max_iterations: 50, timeout_seconds: 1800, workspace_dir: ./workspace }, model: { provider: openai_compatible, base_url: https://taotoken.net/api, api_key: sk-your-taotoken-key, model_name: claude-sonnet-4-20250514, temperature: 0.2, max_tokens: 8192 }, evaluation: { benchmark: featurebench, task_split: dev, output_dir: ./results, save_trajectory: true } }几个关键点说明。base_url固定为 TaoToken 的 API 地址不要加斜杠结尾。model_name可以换成你实际要评测的模型TaoToken 通道支持多种模型切换时只改这一行。max_iterations控制 Agent 的最大交互轮数feature 实现任务通常比修 bug 需要更多轮次50 是一个保守起点。save_trajectory建议开启方便后续分析 Agent 的失败模式。3.2 config.toml评测任务与数据配置这个文件定义评测数据集、任务筛选和评分方式。[dataset] name featurebench version v1.0 root ./data/featurebench task_manifest ./data/featurebench/manifest.jsonl [task_filter] difficulty [easy, medium, hard] language [python, typescript] max_tasks 20 [scoring] metric test_pass_rate require_interface_signature true partial_credit false [environment] docker_image featurebench/base:latest setup_script ./scripts/setup_env.shtask_manifest指向任务清单FeatureBench 开源的数据里每个任务都带有接口签名和测试用例。require_interface_signature true表示评分时会检查 Agent 是否按规范签名实现这是 FeatureBench 消除歧义的核心机制。max_tasks先设小一点比如 20跑通后再扩大。3.3 环境变量与启动命令把 Key 放到环境变量里避免写死在配置文件中export TAOTOKEN_API_KEYsk-your-taotoken-key export FEATUREBENCH_CONFIG./config.toml export FEATUREBENCH_SETTINGS./settings.json启动一次评测任务python -m featurebench.run \ --settings ./settings.json \ --config ./config.toml \ --output ./results/run_001如果一切正常你会看到 Agent 开始逐个任务执行终端会打印每个任务的迭代轮数和当前状态。4. 验证请求跑通一次评测任务配置写好后先别急着跑全量。用一个最小任务验证整条链路是否通。4.1 单任务验证在 config.toml 里把max_tasks改成 1然后执行python -m featurebench.run \ --settings ./settings.json \ --config ./config.toml \ --output ./results/smoke_test观察终端输出。正常情况下会依次出现加载数据集、初始化 Agent、调用模型接口、执行测试用例、输出评分。如果卡在「调用模型接口」这一步多半是 Key 或 base_url 有问题。4.2 检查结果文件跑完后查看输出目录ls ./results/smoke_test cat ./results/smoke_test/summary.jsonsummary.json里会有类似这样的结构{ total_tasks: 1, passed: 1, failed: 0, test_pass_rate: 1.0, avg_iterations: 23, trajectory_saved: true }test_pass_rate是核心指标表示测试用例通过比例。avg_iterations反映 Agent 完成一个 feature 平均需要多少轮交互这个数字对评估 Agent 效率很有参考价值。4.3 用模型对话快速验证通道如果你不想跑完整评测只想确认 TaoToken 通道能正常调用模型可以直接在模型对话页面发一条测试消息https://taotoken.net/models?utm_sourcetaotoken_aicg_blog_endutm_contentmodelsutm_campaignrewrite输入一个简单的代码生成请求比如「用 Python 写一个带类型注解的二分查找函数」看返回是否正常。这一步能排除大部分接入问题。5. 本篇常见错排查5.1 报错 401 Unauthorized最常见的原因是 Key 没传对。检查三点环境变量TAOTOKEN_API_KEY是否导出成功settings.json 里的api_key是否被环境变量覆盖Key 是否有多余空格。可以用echo $TAOTOKEN_API_KEY确认。5.2 报错 Connection refused 或超时先确认base_url写的是https://taotoken.net/api不要加/v1或其他后缀。如果网络环境有代理设置确保没有把 TaoToken 的域名走错通道。另外检查防火墙是否放行了出站 HTTPS。5.3 Agent 迭代次数爆掉但任务没完成这通常不是接入问题而是模型能力或任务难度匹配问题。可以先把max_iterations调大或者把task_filter.difficulty限制为[easy]先跑通。FeatureBench 的 hard 任务涉及大量代码修改对 Agent 的规划能力要求很高。5.4 测试用例全部失败但代码看起来对检查require_interface_signature是否开启。FeatureBench 要求 Agent 按规范接口签名实现如果签名不匹配即使逻辑正确也会判失败。这是设计上的取舍目的是消除任务描述歧义。你可以先关掉这个选项对比结果。5.5 Docker 环境启动失败确认docker_image存在且能拉取。如果本地没有 Docker可以先用environment.setup_script指向一个本地脚本手动准备 Python 和依赖。FeatureBench 的评测环境依赖较多建议用官方镜像起步。6. 下一步扩展评测场景与长期编码跑通单任务后你可以逐步扩大max_tasks观察不同模型在 FeatureBench 上的表现差异。由于 TaoToken 是统一通道切换模型只需要改model_name一行非常适合做横向对比。如果你打算长期做 Code Agent 的评测和训练建议把评测流程接入 Coding Plan批量任务下成本更可控https://taotoken.net/coding-plan?utm_sourcetaotoken_aicg_blog_endutm_contentcoding_planutm_campaignrewrite接入过程中遇到参数或鉴权问题对照接入文档排查https://taotoken.net/doc?utm_sourcetaotoken_aicg_blog_endutm_contentdocutm_campaignrewrite需要新建或轮换 Key 时走 API Keys 页面https://taotoken.net/api-keys?utm_sourcetaotoken_aicg_blog_endutm_contentapi_keysutm_campaignrewriteFeatureBench 的价值在于它把评测从「修小 bug」推进到了「实现完整 feature」这更贴近当下人提需求、Agent 动手的开发范式。你可以先从 20 个任务的小规模评测开始记录每个任务的迭代轮数和失败原因积累一段时间后这些轨迹数据本身就是优化 Agent 的宝贵素材。

相关推荐

恒生电子笔试全攻略:题型分布、高频考点与答题策略
恒生电子笔试全攻略:题型分布、高频考点与答题策略

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 9:43:31

DB2 V11.1下载安装与实例管理全攻略
DB2 V11.1下载安装与实例管理全攻略

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 9:43:31

Mira系列可见光与近红外图像传感器:AI视觉数据质量的关键突破
Mira系列可见光与近红外图像传感器:AI视觉数据质量的关键突破

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 9:43:31

彻底搞懂 MCP (Model Context Protocol):用 TaoToken 统一 Key 打通大模型“数据孤岛”
彻底搞懂 MCP (Model Context Protocol):用 TaoToken 统一 Key 打通大模型“数据孤岛”

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 12:45:23

你的企业可能正在“多付利息”:2026年贷款贴息政策自查指南
你的企业可能正在“多付利息”:2026年贷款贴息政策自查指南

“我们公司去年贷款3000万,一年利息一百多万。后来才知道,如果早三个月申请贴息,能省下近50万。” 这是一位制造业企业主的真实反馈。他不是个例。2026年,国家推出了多项中小微企业贷款贴息政策,但大量符合条件的企业因… · 2026/9/26 12:45:23

免费大纲生成到付费全文中间的能力差距,2026 年该怎么逐项补齐
免费大纲生成到付费全文中间的能力差距,2026 年该怎么逐项补齐

不少人是先摸到免费大纲生成这一步,才决定要不要继续往下付费的。60 秒拿到一份二至三级的章节骨架,图表、公式、代码该插在哪一段也先标好——这是大纲层给得出的东西。可骨架要变成正文,中间要补的是四类落到正文里的活:文献、成… · 2026/9/26 12:45:23

用Python爬虫与数据分析透视arXiv:从API抓取到学术趋势图
用Python爬虫与数据分析透视arXiv:从API抓取到学术趋势图

这篇记录我在 GitHub 上开源过的那个“arXiv 趋势透视”小项目的完整过程,其实代码量不大,但整个思路从数据采集到最后的趋势判断,每一步都值得拆开讲一讲。先说明白这项目是干嘛的:用 Python 写爬虫,从 arXiv 公开接口… · 2026/9/26 12:45:16

Claude Code 模板化实战:把高频指令变成稳定输出
Claude Code 模板化实战:把高频指令变成稳定输出

如果你也和我一样,每天打开 Claude Code 的第一件事,就是把同一段角色设定、同一套审查要求、同一个输出格式再敲一遍,那你大概率会在某一天突然问自己:我到底是在用 AI 干活,还是在替 AI 做填空题? 我大概… · 2026/9/26 12:45:16

UML考勤系统建模闭环:从用例图到代码生成
UML考勤系统建模闭环:从用例图到代码生成

简介:本资源是一份面向高校软件工程与计算机专业学生的UML课程设计实践文档,聚焦考勤系统这一典型企业级应用,系统讲解UML建模方法在真实软件开发全流程中的落地应用。文档完整覆盖引言、总体设计(含系统结构与功能模块划分&#… · 2026/9/26 12:45:16

数据库课后习题答案别硬背:当测试用例集刷,效率翻倍
数据库课后习题答案别硬背:当测试用例集刷,效率翻倍

简介:万常选版《数据库原理与设计》课后习题答案资源,覆盖第2至6章及第9章,适合正在学习关系模型、数据库建模、关系数据理论与模式求精的本科生、自学者作为复习与自测材料。压缩包共7个文件,含3个doc参考答案、2个sql示例脚本、… · 2026/9/26 0:00:21

OpenClaw 替代品?Hermes Agent 踩坑实录:macOS 飞书接入 TaoToken 配置
OpenClaw 替代品?Hermes Agent 踩坑实录:macOS 飞书接入 TaoToken 配置

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 0:00:40

向下兼容与向上兼容:接口设计中的兼容性策略与工程实践
向下兼容与向上兼容:接口设计中的兼容性策略与工程实践

一次版本升级事故,是很多团队绕不过去的坎。线上环境里,服务端明明已经上线了新版接口,老的移动端还在照着旧文档传参数。请求一到网关,校验直接拒绝,用户操作失败,客服群炸了锅,开发群里开始互… · 2026/9/26 0:00:46

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码