如何复现并验证SimpleEnglish的基准数据面向开发者的诚实Benchmark完全教程【免费下载链接】SimpleEnglishAgent skill: make LLMs write docs in ASD-STE100 Simplified Technical项目地址: https://gitcode.com/gh_mirrors/si/SimpleEnglishSimpleEnglish 是一个 Agent skill让大语言模型按 ASD-STE100 简化技术英语STE规范写文档。它的核心卖点是一组可复现的 Benchmark 数据开启 skill 后每百词 STE 违规数平均下降 74.6%7 个 Claude 模型 × 8 个写作任务共 112 次生成。本教程带你从零复现这些数据无需 API Key只需登录的 Claude Code CLI即使只想验证数据一条命令 30 秒搞定。动手前先看懂112 次生成在测什么复现之前先理解这套 benchmark 的设计才能判断结果是否可信组成内容文件模型7 个 Claude 模型opus-5 到 sonnet-4-6定义在 evals/run_bench.py 的MODELS任务8 个写作场景README 简介、快速上手、故障排查、错误消息、事故报告、发布说明、runbook 压缩、架构说明evals/scenarios.json条件每个任务跑两遍baseline无 skill和skill把 SKILL.md 全文注入 prompt同上评分器确定性正则 linter数句子超长、缩写词、禁用情态动词、slop 词汇等 12 类违规evals/ste_lint.py全部 8 个场景都围绕同一个虚构工具 sqlpipePostgres 同步到 S3 的 CLI保证 baseline 与 skill 两组输出面对完全相同的输入。环境准备3 项检查清单✅需要Python 3评分器纯标准库无第三方依赖Claude Code CLI 并已登录claude --version能输出即可仓库代码git clone https://gitcode.com/gh_mirrors/si/SimpleEnglish cd SimpleEnglish✅不需要API Key、付费额度之外的额外配置。先花 5 秒确认 linter 自检通过后面所有数字才有意义python3 evals/ste_lint.py --self-test三步命令复现 74.6% 的完整流程第 1 步冒烟测试1 个模型 × 2 个场景python3 evals/run_bench.py --smoke这条命令只跑claude-sonnet-4-6的前两个场景几十秒出结果用来确认 CLI 登录态和参数没问题。第 2 步完整矩阵7 模型 × 8 任务 × 2 条件 112 次生成python3 evals/run_bench.py几个值得注意的工程细节都写在 evals/run_bench.py 头部注释里可断点续跑evals/results/raw/下已存在的结果文件会自动跳过中断后重跑即可推理力度锁定low避免继承你本地配置的effortLevel每个 raw 文件都会记录实际用的力度每次调用禁用所有工具Bash、Read、WebFetch 等保证输出只来自语言模型本身。第 3 步只从原始数据重建报告不调用任何模型python3 evals/run_bench.py --report-only它扫描evals/results/raw/全部 JSON重新聚合出 evals/results/RESULTS.md 和 evals/results/results.json。这正是验证而非重跑的关键README 里的每一个数字都能从提交的 raw 文件复算出来。零成本验证直接给已提交的 raw 文件打分仓库里已提交 168 个 raw 文件112 个生成 56 个裁判打分你甚至不必调用任何模型就能验证公开数字# 重算主 benchmark 表格 python3 evals/run_bench.py --report-only # 重算其他 harness 的表格如 OpenAI API 的 gpt-4.1-mini降幅 95.8% python3 evals/score_text_dir.py evals/results/openai-2026-09-01/raw打分工具 evals/score_text_dir.py 会自动按文件名解析模型/条件/场景输出与 evals/results/openai-2026-09-01/RESULTS.md、evals/results/pi-2026-07-31/RESULTS.md 一致的表格。盲测裁判45/56 胜局是怎么来的除了硬性违规计数项目还跑了一轮盲测 pairwise 裁判evals/run_bench.py 的judge()函数python3 evals/run_bench.py --judge方法裁判模型claude-opus-4-8对每组 baseline/skill 文本按 0–10 分细则打分两种文本顺序各打一次再取平均消除位置偏差裁判看不到任何标签。最终 skill 输出在 56 组中胜出 45 组、平 5 组、输 6 组平均 8.12 分对 6.04 分。想复现时用自定义力度或输出目录python3 evals/run_bench.py --effort high # 覆盖锁定的 low 力度 python3 evals/run_bench.py --results-dir /tmp/r2 # 结果写到别处避免污染 raw/怎么读这些数字4 个诚实的 caveat结果报告 evals/results/RESULTS.md 专门有一节 Honest number warnings值得原样读一遍linter 是正则不是语法分析器查不出被动语态和词性问题绝对值偏低但两组用同一把尺子相对降幅依然公平skill 条件输入 token 更多因为 SKILL.md 全文进了 prompt所以报告的是输出 token7 个模型全部下降每格只生成一次想看方差就整矩阵重跑runner 可续跑删掉results/raw即可重来力度敏感同一批场景claude-opus-5 在low力度下是 85.0%xhigh下是 90.2%——比较结果前先确认effort一致。核心结论一句话74.6% 是用确定性 linter 在同一任务集上测得的均值最低的是 claude-opus-4-841%最高的 gpt-4.1-mini95.8%OpenAI API 通道。完整模型表见 evals/results/RESULTS.md。复现常见问题 FAQQ数字和我跑的不完全一样正常。每格一次生成语言模型有随机性项目文档也明确建议重跑矩阵看方差。对比的是量级与方向。Q我只想手工体验 skill 效果安装 skill 后新开会话粘贴 evals/scenarios.json 里任意一条 prompt再用 evals/pressure-tests.md 里的清单人工打分即可。Qskill 本体在哪里看53 条编号规则、Pragmatic/Strict 两种模式都在 skills/simple-english/SKILL.md配套词表在 skills/simple-english/references/word-swaps.md。按以上流程走完你就完整复现并独立验证了 SimpleEnglish 公开的全部 benchmark 数据——从 112 次生成到盲测裁判每一步都可从提交文件重算这正是诚实 benchmark的含义。【免费下载链接】SimpleEnglishAgent skill: make LLMs write docs in ASD-STE100 Simplified Technical项目地址: https://gitcode.com/gh_mirrors/si/SimpleEnglish创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
企业数字化 ERP 产品动态
相关推荐
从批处理控制到着色器预编译,揭秘让帧率翻倍的底层黑科技 一、"反直觉"优化:移除"优化"反而性能暴涨2025 年,一位独立开发者在 Steam 上公开了自家游戏的优化全过程,揭示了一个令人意外的真相:某些"优化"其实是性能杀手。开发团队最初从主机版移植到 PC 时… · 2026/9/27 7:40:09
8051单片机实战:使用HRTOS+DS1302+4位数码管实现电子时钟 在8051单片机项目中,DS1302是一款比较经典的实时时钟芯片,可以用于保存和读取当前的秒、分、时、日、月、星期和年份信息。本文使用 HRTOS 作为系统运行环境,通过DS1302读取当前时间,再使用4位数码管显示当前的“时”和“分”&… · 2026/9/27 7:40:09
open-slide 设计工程实战:基于 Emil Kowalski 动画决策框架打磨幻灯片细节体验 【免费下载链接】open-slide A slide framework built for agents. 项目地址: https://gitcode.com/gh_mirrors/op/open-slide 点击查看 免费下载 open-slide 是一款为 Agent 而生的幻灯片框架,它把"演示体验"本身当作一等公民:页… · 2026/9/27 8:24:17
2026最新解析:旅游网站建设属于什么以及学科,解决没人访问难题 2026最新解析:旅游网站建设属于什么以及学科,解决没人访问难题 网站上线三个月,后台流量曲线几乎是一条死线,每天个位数的IP,连蜘蛛抓取记录都寥寥无几。这种“网站做好了没人访问”的绝望感,是无数旅游企业建站后最真实的痛点。很多人误以为只要… · 2026/9/27 8:24:17
F2 玫瑰图(南丁格尔玫瑰图)开发指南:用极坐标半径表达数据大小 数据可视化前端 【免费下载链接】F2 📱📈An elegant, interactive and flexible charting library for mobile. 项目地址: https://gitcode.com/gh_mirrors/f2/F2 点击查看 免费下载 导读
玫瑰图(Rose Chart)&#x… · 2026/9/27 8:24:11
电脑虚拟主机避坑指南:5个关键注意事项教你省下30%预算 电脑虚拟主机避坑指南:5个关键注意事项教你省下30%预算 找建站公司怕被坑高价?别急,先看看你选的电脑虚拟主机是否踩了这些坑。很多站长花了大价钱,网站却卡得像PPT,核心问题往往出在虚拟主机的 注意事项… · 2026/9/27 8:24:05
如何攻击Wordpress站点常见报错与解决 5个WordPress安全陷阱与防御注意事项 改个需求建站公司拖一周,这种憋屈感谁懂?刚上线的WordPress站点,后台改个按钮颜色,外包团队说“底层逻辑冲突”,得排期。结果第二天网站直接变白屏,或者更糟——被黑客植入了恶意代码,SEO收… · 2026/9/27 8:23:47
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现 简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01
汕头网站建设制作厂家避坑指南:5大注意事项救急 汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习 简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现 简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01
汕头网站建设制作厂家避坑指南:5大注意事项救急 汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习 简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01