首页/新闻资讯/正文详情

risky-changes 技能剖析:为什么单元测试全绿,改动仍是坏主意?

发布时间:2026/9/26 6:14:52 来源:云帆数科 栏目:资讯中心
risky-changes 技能剖析:为什么单元测试全绿,改动仍是坏主意?
risky-changes 技能剖析为什么单元测试全绿改动仍是坏主意【免费下载链接】skillsaccess to david ondrejs personal agent skills项目地址: https://gitcode.com/gh_mirrors/skills46/skills在 skillsDavid Ondrej 的 Agent Skills 仓库中risky-changes 是一个上线前体检技能它提醒 AI 编码代理在改动 API、计费、配额、默认值等高风险功能时先验证假设、再测量真实行为而不是只盯着单元测试跑没跑通。下面拆解它的触发逻辑和五步流程。一个真实教训过滤器通过了所有测试却在线上杀死了功能技能开篇就讲了一个真实案例SKILL.md 第 8 行一个过滤器通过了所有测试但在真实数据上让约 99% 的功能失效了。这句话点出了整个技能的核心观点验证手段回答的问题局限单元测试代码写对了吗不关心数据在真实世界里长什么样调研 真实流量测量改动有用吗成本高但必须做测试检查的是代码正确性而改动是否值得上线取决于它在真实数据、真实用户行为下会不会出事。两者缺一不可。哪些改动算高风险对照这张清单自查技能给出了明确的适用场景SKILL.md 第 12–18 行满足任一条就建议走完整流程 公共 API 的字段、过滤器、响应结构 删除、转换或重排上游数据 计费、定价、上限、配额⚙️ 默认值、阈值、发给供应商的请求参数❓ 任何关于外部数据或用户行为的未经验证的假设技能还有一句兜底话术拿不准这个改动算不算高风险就按流程走一遍。误判安全的代价远高于多花一点验证时间。五步验证流程从假设清单到部署后复查第 1 步列出假设标注证据状态把改动依赖的每条假设写下来并明确标记哪些有证据支撑、哪些还没验证。这一步的价值在于把模糊的我觉得应该没事变成可逐条核对的清单。第 2 步先调研再动手写代码调研至少覆盖三个问题SKILL.md 第 28–33 行头部产品遇到同样的设计决策是怎么处理的真实数据长什么样——频率、形态、边界情况用户或代理真正需要的是什么规则很硬如果证据推翻了假设先改设计再写代码如果查不到结论就如实标注证据缺口而不是把假设当成已验证。只要关键假设没验证完就不发布。第 3 步用 10–20 个真实用例做实测这是最容易省、也最不该省的一步SKILL.md 第 36–46 行用例要基于真实使用场景变换主题、参数、语言、边界条件每个用例定好基准速度、质量、准确率、新行为出现的频率能上硬指标就上硬指标主观质量用盲评 明确评分标准可测量的话对比改动前后只读的生产数据分析也算测量——不必真的动线上数据还有一条容易被忽略的硬性要求用例和结果必须存档到项目的 evals 目录例如docs/evals/YYYY-MM-DD-endpoint-focus.md。技能原话是——没有这份记录就等于改动没有被验证。单元测试不能替代真实测量。第 4 步发布前拿到产品负责人批准凡是客户会看到、会为此付费的决策都要附上调研和实测数据显式地拿到产品负责人批准——不要埋进计划文档或代码默认值里。注意细节如果既有批准已经覆盖了你实际要发布的行为那就直接算数不必重复走流程。第 5 步部署后一天内复查真实流量上线不是终点。技能要求在部署后一天内通过只读的生产分析或一次线上扫描测量改动在真实流量下的表现且结果一旦偏离预期立即上报SKILL.md 第 52–53 行。为什么值得把它用在你的 AI 代理上risky-changes 是典型的流程型技能——没有一行脚本全靠把一套验证纪律写成可执行步骤。结合 effective-agent-skills 中的分类它属于 Pattern B认知纪律类当瓶颈是代理的行为质量而非缺少工具时这类纯流程技能正是解药。它和仓库里其他技能形成互补before-building用户刚提出想法时立刻揪出 1–3 个隐藏的关键决策risky-changes改动进入高风险区域时强制假设 → 调研 → 实测 → 批准 → 复查闭环AGENTS.md全局规则层面也要求修 bug 先从端到端复现开始不许删测试、弱化测试来让任务通过快速上手如何应用这套检查清单给 AI 编码代理或你自己的落地建议改公共接口、数据流、计费、默认值前先问一句这次改动依赖哪些假设假设没证据就停下——先查同行做法、先摸真实数据再写代码用真实用例跑 10–20 个场景结果存档到docs/evals/无记录不算验证影响客户可见行为的决策显式找产品负责人确认上线后一天内回到真实流量上再量一次一句话总结全绿的测试用例只说明代码没写错而一次坏主意式的改动往往错在假设本身没被真实世界检验过。risky-changes 技能做的就是把这道常被跳过的体检变成 AI 代理的标准动作。【免费下载链接】skillsaccess to david ondrejs personal agent skills项目地址: https://gitcode.com/gh_mirrors/skills46/skills创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关推荐

扣子(Coze)实战:从零搭建能干活的Agent工作流
扣子(Coze)实战:从零搭建能干活的Agent工作流

1. 这不是“又一篇Agent教程”,而是我踩了37次坑后整理的实操路线图你搜“Agent入门”时,看到的大多是概念堆砌、框架罗列、API调用示例——讲清楚了“怎么调”,却没人告诉你“为什么这么调”;演示了“能跑通”,但没说… · 2026/9/26 6:14:52

Claude Code模板体系实战:从零搭建可复用的AI协作模板库
Claude Code模板体系实战:从零搭建可复用的AI协作模板库

最近终于有空把 claude-code-templates 这套模板体系从头到尾重写了一遍。玩 claude-code 也有一阵子了,刚开始我跟大多数人一样,把它当成智能问答终端用,遇到问题直接开问,结果就是每次会话都像跟一个新同事合作:它不… · 2026/9/26 6:14:52

CodeBuddy IDE:面向工业协议开发的定制化交互式环境
CodeBuddy IDE:面向工业协议开发的定制化交互式环境

1. CodeBuddy IDE 是什么?它不是另一个“套壳编辑器”我第一次听说 CodeBuddy IDE,是在帮一家做工业边缘网关的客户排查固件升级失败问题时。他们工程师甩给我一个截图:IDE 界面左下角赫然写着 “CodeBuddy v2.4.1”,但整个工作流… · 2026/9/26 6:14:46

Agent Skills实战:与Prompt/Tool的区别及安装编写指南
Agent Skills实战:与Prompt/Tool的区别及安装编写指南

做AI Agent开发这一年多,我发现一个特别有意思的现象:聊起“Agent Skills”这个词,一半人在问“这个不就是高级Prompt吗?”,另一半人在问“它和Tool到底有什么区别?”。其实我第一次接触这个词时也差不多&a… · 2026/9/26 6:47:37

海光网卡驱动安装实战:从内核匹配到麒麟系统识别
海光网卡驱动安装实战:从内核匹配到麒麟系统识别

简介:面向成都海光网卡用户、服务器管理员和网络运维人员的驱动源码包,主要解决该型号网卡在主流操作系统中无法被正确识别、缺少驱动导致功能受限或性能无法发挥的问题。压缩包共收录22个文件,整体约146KB,内容以14个C源码文件和… · 2026/9/26 6:47:37

AgentScope 2.0上下文压缩实战:AgentState结构与长会话优化
AgentScope 2.0上下文压缩实战:AgentState结构与长会话优化

1. 会话与上下文压缩到底在解决什么问题做过 Agent 应用的人大概都经历过这个场景:一个多轮对话跑了几十轮之后,响应越来越慢,费用越来越高,最后直接抛出一个上下文超限的报错。这不是模型不行,而是上下文窗口被撑爆了… · 2026/9/26 6:47:37

Linux开机启动程序详解:systemd、rc.local与Autostart选型排查
Linux开机启动程序详解:systemd、rc.local与Autostart选型排查

1. 动手之前先搞清楚:你的程序究竟适合哪种开机启动方式干运维的朋友多半有过这种经历:程序手工启动一切正常,日志也刷得飞起,结果服务器一重启,服务就消失了。更气人的是,有些程序明明配了开机启动&#x… · 2026/9/26 6:47:37

Agent Skill从概念到落地:架构设计、开发流程与排错实践
Agent Skill从概念到落地:架构设计、开发流程与排错实践

我做了几年Agent应用落地,从最早的Prompt工程一路踩坑走过来:一个问题轮询调模型、写死流程、每次需求变化就要重构整个对话逻辑。后来接触到Agent Skill这个概念,才意识到之前很多问题的根源,是把“技能”和“流程”混在一起&… · 2026/9/26 6:47:37

气象数据分析大作业指南:Python数据清洗到可视化全流程
气象数据分析大作业指南:Python数据清洗到可视化全流程

简介:这是一份基于Python的气象数据分析与可视化项目源码,面向需要完成毕业设计、课程设计或期末大作业的学习者,尤其适合有Python基础、想借鉴高分项目快速搭建完整系统的新手,可直接覆盖气象数据获取、分析与展示等核心需求。压… · 2026/9/26 6:47:31

数据库课后习题答案别硬背:当测试用例集刷,效率翻倍
数据库课后习题答案别硬背:当测试用例集刷,效率翻倍

简介:万常选版《数据库原理与设计》课后习题答案资源,覆盖第2至6章及第9章,适合正在学习关系模型、数据库建模、关系数据理论与模式求精的本科生、自学者作为复习与自测材料。压缩包共7个文件,含3个doc参考答案、2个sql示例脚本、… · 2026/9/26 0:00:21

OpenClaw 替代品?Hermes Agent 踩坑实录:macOS 飞书接入 TaoToken 配置
OpenClaw 替代品?Hermes Agent 踩坑实录:macOS 飞书接入 TaoToken 配置

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 0:00:40

向下兼容与向上兼容:接口设计中的兼容性策略与工程实践
向下兼容与向上兼容:接口设计中的兼容性策略与工程实践

一次版本升级事故,是很多团队绕不过去的坎。线上环境里,服务端明明已经上线了新版接口,老的移动端还在照着旧文档传参数。请求一到网关,校验直接拒绝,用户操作失败,客服群炸了锅,开发群里开始互… · 2026/9/26 0:00:46

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码