首页/新闻资讯/正文详情

SWE-bench:3 步跑出编码模型“真实修 Bug 能力“评分——GitHub Issue 修复基准完整上手指南

发布时间:2026/9/26 2:35:21 来源:云帆数科 栏目:资讯中心
SWE-bench:3 步跑出编码模型“真实修 Bug 能力“评分——GitHub Issue 修复基准完整上手指南
SWE-bench3 步跑出编码模型真实修 Bug 能力评分——GitHub Issue 修复基准完整上手指南【免费下载链接】SWE-benchSWE-bench: Can Language Models Resolve Real-world Github Issues?项目地址: https://gitcode.com/GitHub_Trending/sw/SWE-bench如果你对比过几款编码模型大概率碰过这种尴尬补全基准分很高拿到真实项目里却连一个 issue 都修不动。SWE-bench 就是为这个落差而建的评测框架它取真实的 GitHub issue 和对应时间点的代码库让语言模型生成修复补丁再在隔离的 Docker 环境里应用补丁、跑仓库自带的测试用测试通过与否给出判定。它适合需要客观比较大模型软件工程能力的开发者与研究者。项目初览SWE-bench 做什么给谁用SWE-bench 是普林斯顿团队论文 Can Language Models Resolve Real-World Github Issues?ICLR 2024 Oral的官方代码与数据集。任务设定只有一句话给定一个 issue 和对应代码库模型需要产出能解决问题的代码补丁patch。它和多数代码补全基准的差别在于验证方式补全题只看答案对不对而 SWE-bench 是端到端验证——补丁必须真实应用到仓库、在容器里跑通该仓库自己的测试套件结果是可复现的解决/未解决而不是人工判分的相似度。关键基础信息主要语言Python要求 3.10PyPI 包名swebench当前版本 5.0.2协议MIT安装方式克隆仓库后pip install -e .运行环境本地评测依赖 Docker官方建议 x86_64 机器120GB 空闲磁盘、16GB 内存、8 核 CPU数据集完整集 2294 个实例Lite 534 个Verified 500 个工程师确认可解Multimodal 100 dev 500 testMultilingual 300 个9 种语言、42 个仓库详见 docs/guides/datasets.md快速上手三步跑起来第一步安装 Docker 并确认守护进程在运行本地评测的每一步都依赖它。第二步克隆仓库并从源码安装装完后swebench命令即可用git clone https://gitcode.com/GitHub_Trending/sw/SWE-bench cd SWE-bench pip install -e .第三步用官方参考补丁gold patch验证环境正确性只跑一个实例耗时短swebench eval verified --gold -i sympy__sympy-20590 --run-id validate-gold跑完预期看到当前目录生成logs/build_images镜像构建日志和logs/run_evaluation评测日志最终报告写入evaluation_results目录关键字段是 Instances resolved 和 Resolution rate。gold 验证这条实例应当显示已解决——这说明镜像、补丁应用、测试运行整条链路都正常。一点说明v5 CLI 默认从镜像仓库拉取预构建镜像M 系列 Mac 等 ARM 系统需要额外用--task-repo指定本地任务仓库通过 Docker Buildx 在本地构建镜像README 中有对应示例。核心能力拆解Docker 化评测引擎补丁必须真的修好才算数它做什么为每个任务实例安装仓库到指定的 base_commit应用测试补丁与模型补丁运行测试脚本从日志解析每个测试的通过状态并评分——全链路成功且所有目标测试通过才记 1 分任何一步失败记 0 分。解决什么问题不同机器上的 Python 版本、依赖差异会让评测结果互相不可比容器化把环境固定住任何人复现都得到同样的结论。怎么实现swebench/harness/ 负责镜像构建、容器生命周期管理和并行调度-j参数控制并行数官方建议不超过min(0.75 * cpu_count, 24)。# 提交模型预测preds.jsonl 为模型生成的补丁8 个实例并行评测 swebench eval verified -p preds.jsonl --run-id my-run -j 8多变体数据集与双重验证先保证数据本身干净它做什么提供 5 个数据集变体从快速迭代Lite到高质量对比Verified再到跨语言Multilingual按需选择评测规模。解决什么问题完整集跑一轮成本高而且不是每个 issue 都保证可解——如果数据本身带噪声比如参考补丁都跑不过测试评测结果就不公平。怎么实现每个实例入库前走一遍双重验证——先应用 test_patch 确认目标测试确实处于失败状态FAIL_TO_PASS再应用 gold patch 确认测试转为通过PASS_TO_PASS两步都成功该实例才可用于评测。from datasets import load_dataset # 加载专家验证集500 个经工程师确认可解的 issue带难度分级字段 sbv load_dataset(SWE-bench/SWE-bench_Verified, splittest)推理生成与报告重算生成和评分解耦它做什么推理阶段把 repo issue 交给模型生成补丁swebench infer内置 mini-SWE-agent 可直接调用 API 模型批量生成预测swebench report则不启动任何容器只从已保存的日志重新计分。解决什么问题模型跑一次推理成本很高但如果你想调整评分口径或修复某个解析 bug不必把容器评测整轮重跑一遍。预测文件是 JSONL每行一个实例核心就三个字段{instance_id: sympy__sympy-20590, model_name_or_path: gpt-5, model_patch: diff --git a/...}边界说明它擅长什么不擅长什么擅长不擅长 / 限制端到端、可复现地比较模型的修 bug 能力判定标准是仓库自己的测试无人工判分资源消耗大官方建议 x86_64 机器、120GB 空闲磁盘、16GB 内存、8 核arm64 支持仍标注为实验性数据集变体多Lite/Verified 适合快速迭代和日常对比结果缓存容易踩坑缓存键只有run_idinstance_id换个补丁复用同一 run_id 会直接返回上次的结果支持 Modal 云端评测结果可发布到 Hugging Face bucket便于学术场景横向对比覆盖范围有偏主集以 Python 仓库为主跨语言能力只由 300 实例的 Multilingual 子集衡量Multimodal 的 test 集需在官方渠道计分本地拿不到 gold 补丁进阶用法与常见坑两个最常用的进阶配置只评测指定实例swebench eval verified -p preds.jsonl -i astropy__astropy-14539 -i sympy__sympy-20590-i可重复调试时不必整轮跑。不启容器重新计分swebench report run_id -d verified只读取已保存的日志重算报告镜像缓存级别可用--cache_levelnone/base/env/instance 四档调节env档配合清理可省磁盘但每轮更慢细节见 docs/faq.md。三个高频问题⚠️ 改了补丁却得到旧结果几乎总是 run_id 复用了缓存命中上次评测。重新评测请换一个--run-id。磁盘被 Docker 占满先docker system prune清理无用镜像和容器Docker Desktop 用户记得把虚拟磁盘扩到约 120GB 空闲。镜像拉不下来或 ARM 上构建失败本地加--task-repo指向任务仓库用 Buildx 构建构建失败会被如实报告只有存在已发布镜像时才会回退使用。完整参数以swebench eval --help为准评测细节可查 docs/guides/evaluation.md。SWE-bench 把这个编码模型到底行不行变成一组可复现的数字同样的容器、同样的测试、同样的判分口径换台机器也能对上。如果你正在选型编码模型或准备一份模型对比报告建议从 Verified 或 Lite 开始试。下一步动作克隆仓库、pip install -e .然后跑swebench eval verified --gold -i sympy__sympy-20590 --run-id validate-gold先确认整条评测链路在你的机器上是通的。【免费下载链接】SWE-benchSWE-bench: Can Language Models Resolve Real-world Github Issues?项目地址: https://gitcode.com/GitHub_Trending/sw/SWE-bench创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关推荐

DankMaterialShell 的 Void Linux 打包与安装指南:XBPS 模板、自托管仓库与运行配置
DankMaterialShell 的 Void Linux 打包与安装指南:XBPS 模板、自托管仓库与运行配置

桌面应用 【免费下载链接】DankMaterialShell Desktop shell for wayland compositors built with Quickshell & GO, optimized for niri, hyprland, sway, MangoWC, labwc, and MiracleWM. 项目地址: https://gitcode.com/gh_mirrors/da/DankMaterialShell 点击… · 2026/9/26 2:35:15

Mumble 网络协议深度解析:TCP 控制通道与 UDP 语音通道的通信机制全解
Mumble 网络协议深度解析:TCP 控制通道与 UDP 语音通道的通信机制全解

音视频即时通讯 【免费下载链接】mumble Mumble is an open-source, low-latency, high quality voice chat software. 项目地址: https://gitcode.com/gh_mirrors/mu/mumble 点击查看 免费下载 Mumble 是一款开源、低延迟、高质量语音聊天软件,其客户端… · 2026/9/26 2:35:15

ReactXP 跨平台图片列表实战:基于 RXPImageList 示例的 REST 数据获取与虚拟化列表开发指南
ReactXP 跨平台图片列表实战:基于 RXPImageList 示例的 REST 数据获取与虚拟化列表开发指南

跨平台前端 【免费下载链接】reactxp Library for cross-platform app development. 项目地址: https://gitcode.com/gh_mirrors/re/reactxp 点击查看 免费下载 本指南以仓库 samples/ImageList(即 RXPImageList 示例)为主体,系统… · 2026/9/26 2:35:15

408考研真题统计怎么用:14年考频数据拆出四科高频章节
408考研真题统计怎么用:14年考频数据拆出四科高频章节

408考研真题统计怎么用:14年考频数据拆出四科高频章节 【免费下载链接】cs-408 计算机考研专业课程408相关的复习经验,资源和OneNote笔记 项目地址: https://gitcode.com/GitHub_Trending/cs/cs-408 打开 6其他资源/历年真题考频统计.xlsx 你会发… · 2026/9/26 3:10:51

后缀数组(Suffix Array)与倍增算法(Doubling Algorithm):后缀排序、Height 数组与最长公共前缀(LCP)实战
后缀数组(Suffix Array)与倍增算法(Doubling Algorithm):后缀排序、Height 数组与最长公共前缀(LCP)实战

后缀数组(Suffix Array)与倍增算法(Doubling Algorithm):后缀排序、Height 数组与最长公共前缀(LCP)实战在高级字符串算法、生物信息学 DNA 碱基序列比对、海量代码重复子串挖掘以及搜索引擎后缀… · 2026/9/26 3:10:51

ReactPy 组件开发指南:从 @component 装饰器到条件渲染的完整实战
ReactPy 组件开发指南:从 @component 装饰器到条件渲染的完整实战

前端UI组件 【免费下载链接】reactpy Its React, but in Python 项目地址: https://gitcode.com/gh_mirrors/re/reactpy 点击查看 免费下载 本篇技术指南围绕 ReactPy(Python 中的 React)组件体系的入门核心展开:如何用 componen… · 2026/9/26 3:10:51

ponytail skill:为AI编码助手构建持久化上下文管理
ponytail skill:为AI编码助手构建持久化上下文管理

1. 为什么你的 AI 编码助手总是“失忆”用 AI 编码助手写代码,最让人抓狂的不是它不会写,而是它“记不住”。你花了二十分钟跟它解释项目结构、命名规范、数据库表关系,它点头如捣蒜,代码也写得像模像样。结果你关掉会话去开了个会… · 2026/9/26 3:10:45

生产级智能体平台实战:任务编排、工具管理与运行监控
生产级智能体平台实战:任务编排、工具管理与运行监控

1. 从单机脚本到生产级智能体平台:为什么“能跑”和“敢用”之间隔着一整个工程体系很多人第一次接触 Agent,都是从一段几十行的脚本开始的:调一个模型接口,塞几个工具函数,跑通一个“查天气发邮件”的流程&#xff0c… · 2026/9/26 3:10:45

Databasus 邮件双因子认证(Email 2FA)全解析:全局开关、验证码生命周期与主机逃生通道
Databasus 邮件双因子认证(Email 2FA)全解析:全局开关、验证码生命周期与主机逃生通道

数据库灾备 【免费下载链接】databasus PostgreSQL backup tool with Point-In-Time-Recovery and restore verification 项目地址: https://gitcode.com/gh_mirrors/po/databasus 点击查看 免费下载 导读 本文基于开源仓库 openspec/specs/two-factor-authentica… · 2026/9/26 3:10:45

数据库课后习题答案别硬背:当测试用例集刷,效率翻倍
数据库课后习题答案别硬背:当测试用例集刷,效率翻倍

简介:万常选版《数据库原理与设计》课后习题答案资源,覆盖第2至6章及第9章,适合正在学习关系模型、数据库建模、关系数据理论与模式求精的本科生、自学者作为复习与自测材料。压缩包共7个文件,含3个doc参考答案、2个sql示例脚本、… · 2026/9/26 0:00:21

OpenClaw 替代品?Hermes Agent 踩坑实录:macOS 飞书接入 TaoToken 配置
OpenClaw 替代品?Hermes Agent 踩坑实录:macOS 飞书接入 TaoToken 配置

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 0:00:40

向下兼容与向上兼容:接口设计中的兼容性策略与工程实践
向下兼容与向上兼容:接口设计中的兼容性策略与工程实践

一次版本升级事故,是很多团队绕不过去的坎。线上环境里,服务端明明已经上线了新版接口,老的移动端还在照着旧文档传参数。请求一到网关,校验直接拒绝,用户操作失败,客服群炸了锅,开发群里开始互… · 2026/9/26 0:00:46

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码