首页/新闻资讯/正文详情

SWE-bench 完整指南:用真实 GitHub Issue 评测你的 AI 编程助手

发布时间:2026/9/26 2:57:44 来源:云帆数科 栏目:资讯中心
SWE-bench 完整指南:用真实 GitHub Issue 评测你的 AI 编程助手
SWE-bench 完整指南用真实 GitHub Issue 评测你的 AI 编程助手【免费下载链接】SWE-benchSWE-bench: Can Language Models Resolve Real-world Github Issues?项目地址: https://gitcode.com/GitHub_Trending/sw/SWE-benchAI 编程助手在很多团队已经成了日常工具但各家发布的评测数字很难直接对比数据集不一样测法不一样环境也不一样。SWE-bench 就是为了解决这个空白它把开源项目里真实的 GitHub Issue 当考题只给语言模型问题描述和代码库让它产出一个修复补丁再把这个补丁放进隔离的 Docker 容器里跑项目真实的测试套件通过才计分。项目速览一句话看懂 SWE-bench 评测框架它回答的问题是语言模型能不能解决真实世界的 GitHub IssueICLR 2024 Oral。每个实例包含五样东西仓库、base commit问题出现时的代码快照、问题描述、测试补丁新加的、用来验证修复的测试和 gold patch被验证过能通过的参考补丁。官方数据集有 5 个变体变体规模适合场景SWE-bench 全集2,294 个实例综合能力评估Lite534 个实例快速迭代、跑通流程Verified500 个实例人工确认可解模型排名对比Multimodaldev 100 / test 500涉及 UI 截图的任务Multilingual300 个实例9 种语言、42 个仓库跨语言能力核心能力有四条容器化评测每个实例在独立 Docker 镜像里评测结果可复现双重校验任务实例先过测试补丁 gold 补丁两道检查才入正集多语言解析内置 Python、JS、Rust、Java 等 8 种语言的测试输出解析器完整工具链数据收集、推理、评测、出报告一套 CLI 搞定为什么该把评测换到 SWE-bench三组对照就能看出差异题目来源以前是自造算法题或手写小项目容易被针对性刷分现在题目来自真实项目里修完并合并的 Issue问题描述带噪音代码库体量大。运行环境以前本地跑测试套件在我机器上是好的很常见现在每个实例在独立镜像里检出到 base commit环境被钉死。判定标准以前看模型说修好了没有现在看测试日志——FAIL_TO_PASS修复前必挂、修复后必过的用例全过PASS_TO_PASS原来就过的用例不许挂全满足得 1 分否则 0 分。拆解 SWE-bench 三层架构数据层、执行层、判定层数据层是质量守门员。每个任务实例都要过双重校验先按 base commit 装好仓库、打上测试补丁跑一遍测试再叠加 gold 补丁跑第二遍。两关都过才算有效实例任何一步失败直接丢弃。执行层是标准化工位。评测引擎为每个实例构建专用镜像把代码检出到 base commit应用预测补丁和测试补丁然后执行测试脚本。中间任何一步没跑完这个实例就判未解决。判定层最抠细节。不同语言的测试输出格式不同项目按语言内置了解析器见 log_parsers 目录grading.py里还有防御性逻辑比如检查测试运行器是否真的启动过防止测试套件静默没跑却被判全过蒙混得分。5 分钟上手新手、研究者、工程团队三条路径新手先别急着解题先验证流程。装好环境、确认 Docker 在跑然后用 gold 补丁做自检git clone https://gitcode.com/GitHub_Trending/sw/SWE-bench cd SWE-bench pip install -e . swebench eval verified --gold -i sympy__sympy-20590 --run-id validate-gold这条自检报出 resolved说明你的环境没问题接下来就能换上自己模型的预测结果。研究者按目标选数据集——Lite 做冒烟Verified 做模型对比带 difficulty 字段方便分档分析论文用全集。实例的完整字段结构见数据集指南。工程团队关心的是可复现和成本。用swebench images build提前构建镜像-j控制并行建议小于 min(0.75 × 核数, 24)日志已经跑过就swebench report直接重打分不用再起容器。落地与扩展两个最有用的接入点换成自己的预测把模型产出的补丁整理成 predictions 文件一条swebench eval verified -p 预测文件 --run-id run id -j 8就能出分。新增语言支持log_parsers 下每种语言一个独立解析模块注册仓库到解析器的映射后汇入统一注册表新增一种语言的测试输出格式成本就是写一个解析模块。避坑指南跑 SWE-bench 的 5 个常见误区 ⚠️别复用同一个 run_id引擎按run_id instance_id缓存结果换了新预测但不改 run_id拿到的是旧缓存。磁盘别省官方建议 x86_64、120GB 空闲磁盘、16GB 内存、8 核起步Docker Desktop 用户还要调大虚拟磁盘。ARM 机器属于实验性支持Apple Silicon 需要用--task-repo本地构建镜像。gold patch 别偷看数据集里就有这个字段解题时看了等于作弊评估结果作废。区分没解决和环境挂了超时、环境损坏会被判定层归为基础设施失败分析结果时别算到模型头上。收尾现在就能做的 3 件事SWE-bench 的价值是把感觉它变聪明了换成测试通过了。今天就可以做三件事跑通上面那组 gold 补丁自检命令。挑一个符合目标的数据集变体翻几个实例的问题描述。给自己的模型生成 10 个实例的预测把 eval report 全流程走一遍。【免费下载链接】SWE-benchSWE-bench: Can Language Models Resolve Real-world Github Issues?项目地址: https://gitcode.com/GitHub_Trending/sw/SWE-bench创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关推荐

字符串解码:用栈和递归拆解嵌套结构,吃透力扣394题
字符串解码:用栈和递归拆解嵌套结构,吃透力扣394题

力扣hot100榜单里的第394题“字符串解码”,是我见过把“栈”这个数据结构讲得最透彻的一道题。题面看起来吓人:给你一串带数字和方括号的字符串,比如3[a2[c]],让你按照规则展开成accaccacc。很多人第一次做的时候会被嵌套括号绕晕… · 2026/9/26 2:57:44

【无需前端基础】前端新手必备 OpenClaw 本地 AI 工具搭建官网实操:TaoToken 统一 Key 配置与验证
【无需前端基础】前端新手必备 OpenClaw 本地 AI 工具搭建官网实操:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 2:57:44

KernelSU元模块架构解析:从模块加载到插件化模块系统
KernelSU元模块架构解析:从模块加载到插件化模块系统

1. 从模块加载到元模块:KernelSU 模块系统的架构演进KernelSU 的模块机制从诞生之初就带着一个很明确的目标:在不修改 system 分区的前提下,往 Android 设备上挂载自定义内容。早期版本的实现思路相当直接——把模块文件放到/data/adb/module… · 2026/9/26 2:57:44

大模型选型与落地实战:从开源闭源对比到微调部署全指南
大模型选型与落地实战:从开源闭源对比到微调部署全指南

1. 模型维度:国内外头部大模型全景盘点先说点题外话。2026年9月这个时间节点,大模型已经卷过了“聊天机器人”阶段,变成了实实在在的研发工具、业务中台和端侧能力来源。这几个月我身边问得最多的不是“哪个模型更聪明”,而是“哪… · 2026/9/26 6:20:22

GPT-Astra-Loop架构实战:从实时多模态到Agent闭环的工程指南
GPT-Astra-Loop架构实战:从实时多模态到Agent闭环的工程指南

1. 为什么说“GPT-Astra-Loop”是一条完整的技术链路最近在梳理AI应用架构时,我越来越强烈地感觉到一件事:很多人把GPT、Astra、Loop这三个词当成三个孤立的概念去了解,但真正把它们串起来看,才会发现这其实是一条完整的实时交互闭… · 2026/9/26 6:20:22

键盘工作原理:矩阵扫描、消抖与HID协议详解
键盘工作原理:矩阵扫描、消抖与HID协议详解

前阵子帮朋友修一块茶轴键盘,故障很典型:中间一排按键集体失灵。朋友的第一反应是轴坏了,打开淘宝就要下单十几个轴回来全换。我拦了一下,拿万用表从主控引脚沿走线往外扫,最后发现是那一排的扫描线在PCB转角处断了。换… · 2026/9/26 6:20:22

云原生交付效率革命:上线时间从2天缩短到3分钟的自动化实践
云原生交付效率革命:上线时间从2天缩短到3分钟的自动化实践

这两年聊云原生,大家关注得最多的已经不是“要不要上”,而是“怎么把落地的最后一公里走完”。所谓最后一公里,就是代码写好之后,从提交到真正跑在生产环境的那段路。很多团队的现状是:开发两小时,上线等两… · 2026/9/26 6:20:22

企业AI智能体落地:协议、工具接入与执行环境实战指南
企业AI智能体落地:协议、工具接入与执行环境实战指南

企业级的 AI 智能体(Agent)落地,不像大家在技术博客里看到的 Demo 那样简单——调个大模型 API,配上几句 Prompt,能回答几个问题就算完事。真正把它接进生产环境、跑在业务流程里,你会发现第一步就把很多人… · 2026/9/26 6:20:22

JavaScript学习笔记:字符串包含、数组排序与异步编程
JavaScript学习笔记:字符串包含、数组排序与异步编程

说实话,JavaScript 这门语言我已经写了挺多年,但真正把学习笔记整理成一条完整知识线,还是最近的事。网上一搜“js 判断字符串是否包含”“js 数组排序”这类零散问题一大把,可初学者照着抄完代码,下个场景照样懵。我这… · 2026/9/26 6:20:16

数据库课后习题答案别硬背:当测试用例集刷,效率翻倍
数据库课后习题答案别硬背:当测试用例集刷,效率翻倍

简介:万常选版《数据库原理与设计》课后习题答案资源,覆盖第2至6章及第9章,适合正在学习关系模型、数据库建模、关系数据理论与模式求精的本科生、自学者作为复习与自测材料。压缩包共7个文件,含3个doc参考答案、2个sql示例脚本、… · 2026/9/26 0:00:21

OpenClaw 替代品?Hermes Agent 踩坑实录:macOS 飞书接入 TaoToken 配置
OpenClaw 替代品?Hermes Agent 踩坑实录:macOS 飞书接入 TaoToken 配置

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 0:00:40

向下兼容与向上兼容:接口设计中的兼容性策略与工程实践
向下兼容与向上兼容:接口设计中的兼容性策略与工程实践

一次版本升级事故,是很多团队绕不过去的坎。线上环境里,服务端明明已经上线了新版接口,老的移动端还在照着旧文档传参数。请求一到网关,校验直接拒绝,用户操作失败,客服群炸了锅,开发群里开始互… · 2026/9/26 0:00:46

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码