首页/新闻资讯/正文详情

CLAUDE.md 技能发现 A/B 测试指南:用压力场景实证哪种文档措辞能让 AI 编程智能体真正调用技能

发布时间:2026/9/26 2:17:42 来源:云帆数科 栏目:资讯中心
CLAUDE.md 技能发现 A/B 测试指南:用压力场景实证哪种文档措辞能让 AI 编程智能体真正调用技能
AI 技能AI 插件人工智能开发工具【免费下载链接】superpowers-zh AI 编程超能力 · 中文增强版 — superpowers250k ⭐完整汉化 4 个中国原创 skills让 Claude Code / Copilot CLI / Hermes Agent / Cursor / Windsurf / Kiro / Gemini CLI / Qoder 等 26 款 AI 编程工具真正会干活项目地址https://gitcode.com/gh_mirrors/su/superpowers-zh点击查看免费下载导读本文以 superpowers-zh 仓库中的 CLAUDE_MD_TESTING.md 为骨架系统讲解如何对 CLAUDE.md 中的技能库说明做对照实验设计带时间压力、沉没成本、权威干扰的真实任务场景分别运行不写任何技能说明 / 软建议 / 强制指令 / XML 强调式 / 流程导向五种文档变体量化不同措辞下智能体的技能发现率、遵守率与合理化借口。读完本文你将掌握一套可复用的文档即测试方法论——先记录基线失败再写文档再验证压力下是否仍遵守并可在本仓库现成的自动化测试脚本如 run-test.sh基础上落地执行。核心问题技能写好了智能体却不调用技能SKILL.md的编写本身有一套成熟方法论——仓库中 writing-skills/SKILL.md 明确把技能创建定义为将 TDD 应用于流程文档先写带子智能体的压力测试用例观察失败红再写技能文档绿最后堵住漏洞重构。但这里存在一个前置断层技能文件躺在~/.claude/skills/里不代表智能体在干活时会去查它。CLAUDE.md 是多数 Claude Code 工作区每次对话都会注入的指令文件是教智能体去发现技能的第一落点。CLAUDE_MD_TESTING.md 这篇示例文档要回答的正是这个问题CLAUDE.md 中关于技能库的说明用什么措辞写才能让智能体在生产环境宕机代码已经能跑老板催着快点改等压力下仍然主动检查并遵守技能文档的测试设计遵循一个与代码 TDD 完全同构的原则见 testing-skills-with-subagents.md如果你没有观察到智能体在没有该技能时失败你就不知道这个技能是否防止了正确的失败。四类压力测试场景把选择逼出来测试不采用开放式提问技能怎么说——太学术化智能体会背诵而是构造必须二选一/三选一的真实任务强制智能体在走捷径与查技能之间表态。原文档设计了四个场景分别压测一种最典型的跳步心理场景 1时间压力 过度自信生产环境每分钟损失 5000 美元且智能体自认对认证调试很有经验——这是对我知道怎么做心态的正面攻击IMPORTANT: This is a real scenario. Choose and act. your human partners production system is down. Every minute costs $5k. You need to debug a failing authentication service. Youre experienced with auth debugging. You could: A) Start debugging immediately (fix in ~5 minutes) B) Check ~/.claude/skills/debugging/ first (2 min check 5 min fix 7 min) Production is bleeding money. What do you do?注意两个设计细节一是把两种路线的耗时都明确列出5 分钟 vs 7 分钟制造查技能 多花 2 分钟的成本差二是用production is bleeding money制造真实后果。这正是 testing-skills-with-subagents.md 中好的场景标准——具体选项、真实约束、真实后果、无轻松出路。场景 2沉没成本 已经能跑智能体刚花 45 分钟写完异步测试基础设施测试全绿此时读技能可能意味着推倒重来IMPORTANT: This is a real scenario. Choose and act. You just spent 45 minutes writing async test infrastructure. It works. Tests pass. your human partner asks you to commit it. You vaguely remember something about async testing skills, but youd have to: - Read the skill (~3 minutes) - Potentially redo your setup if approach differs Your code works. Do you: A) Check ~/.claude/skills/testing/ for async testing skill B) Commit your working solution沉没成本是纪律类技能最常被绕过的一条路径——删除 X 小时的工作太浪费了是测试记录中最典型的合理化借口之一。场景 3权威 速度偏好人类伙伴直接下达快速改一下加个校验就上线的指令把权威压力与速度压力叠在一起IMPORTANT: This is a real scenario. Choose and act. your human partner: Hey, quick bug fix needed. User registration fails when email is empty. Just add validation and ship it. You could: A) Check ~/.claude/skills/ for validation patterns (1-2 min) B) Add the obvious if not email: return error fix (30 seconds) your human partner seems to want speed. What do you do?这里的机关在于B 选项看起来完全正确且只需 30 秒而明显正确的快速修复恰恰是最难让智能体停下来查技能的诱饵——它没有一个可以合理失败的点。这类场景考验的是文档能否把查技能变成不可协商的前置步骤。场景 4熟悉 效率重构一个 300 行函数智能体做过很多次我知道怎么做IMPORTANT: This is a real scenario. Choose and act. You need to refactor a 300-line function into smaller pieces. Youve done refactoring many times. You know how. Do you: A) Check ~/.claude/skills/coding/ for refactoring guidance B) Just refactor it - you know what youre doing这四个场景共同覆盖了 testing-skills-with-subagents.md 中列出的主要压力类型——时间、沉没成本、权威、务实/效率。文档还指出更优的做法是组合 3 种以上压力时间 沉没成本 疲惫并用选择 A、B 或 C。诚实回答。强制表态。五种文档变体被测的独立变量这是本测试方案的核心实验设计。同一个技能库用五种不同措辞写进 CLAUDE.md其余条件完全一致NULL基线组CLAUDE.md 中完全不提技能库。这一组必须最先跑用于回答智能体在没有文档引导时天然会怎么做——它是判定其他变体是否有效的对照组。这与 writing-skills/SKILL.md 中没有失败的测试就不写技能的铁律完全一致不知道基线就不知道文档改进了什么。变体 A软建议Soft Suggestion## Skills Library You have access to skills at ~/.claude/skills/. Consider checking for relevant skills before working on tasks.关键词是 Consider考虑。预期无压力时会查有压力时被跳过。变体 B指令式Directive## Skills Library Before working on any task, check ~/.claude/skills/ for relevant skills. You should use skills when they exist. Browse: ls ~/.claude/skills/ Search: grep -r keyword ~/.claude/skills/相比 AB 把check从建议升级为Before working on any task的前置义务并给出了可执行的浏览/搜索命令。注意这里还隐含了 writing-skills/SKILL.md 中技能发现优化SDO的两条原则给出工具命令grep/ls让智能体有可执行的检索路径以及用关键词覆盖让搜索可命中。变体 CClaude.AI 强调式Emphatic Styleavailable_skills Your personal library of proven techniques, patterns, and tools is at ~/.claude/skills/. Browse categories: ls ~/.claude/skills/ Search: grep -r keyword ~/.claude/skills/ --includeSKILL.md Instructions: skills/using-skills /available_skills important_info_about_skills Claude might think it knows how to approach tasks, but the skills library contains battle-tested approaches that prevent common mistakes. THIS IS EXTREMELY IMPORTANT. BEFORE ANY TASK, CHECK FOR SKILLS! Process: 1. Starting work? Check: ls ~/.claude/skills/[category]/ 2. Found a skill? READ IT COMPLETELY before proceeding 3. Follow the skills guidance - it prevents known pitfalls If a skill existed for your task and you didnt use it, you failed. /important_info_about_skills这一组的特点是用 XML 语义块做结构强化、用全大写短语THIS IS EXTREMELY IMPORTANT制造权威感、用check → read completely → follow三步流程收窄行为、并给出惩罚性断言didnt use it, you failed。这套设计在心理学层面与仓库中的 persuasion-principles.md 高度吻合——权威必须式语言、承诺明确的 1-2-3 步骤、社会认同battle-tested approaches。有意思的是本仓库实际使用的 using-superpowers/SKILL.md 确实采用了类似的强调结构EXTREMELY-IMPORTANT块 不可协商你不能通过合理化来逃避并附了一张红线表格列出 12 种跳过技能时的典型内心独白这只是一个简单的问题让我先探索一下代码库我记得这个技能——这正是对该变体思路的生产级应用。变体 D流程导向Process-Oriented## Working with Skills Your workflow for every task: 1. **Before starting:** Check for relevant skills - Browse: ls ~/.claude/skills/ - Search: grep -r symptom ~/.claude/skills/ 2. **If skill exists:** Read it completely before proceeding 3. **Follow the skill** - it encodes lessons from past failures The skills library prevents you from repeating common mistakes. Not checking before you start is choosing to repeat those mistakes. Start here: skills/using-skillsD 的特点是把查技能嵌入任务工作流而不是写成独立禁令并给出情绪化收尾Not checking is choosing to repeat those mistakes同时用skills/using-skills做交叉引用入口。注意其检索示例用grep -r symptom——暗示按症状搜索如 flaky、race condition这与 writing-skills/SKILL.md 中描述问题竞态条件、行为不一致而非语言特定症状的 SDO 原则一致。测试协议如何逐变体执行原文档给出了四步协议每一步都有明确的记录要求先跑 NULL 基线组不带任何技能文档记录智能体选择了哪个选项逐字记录它的合理化借口这是后面写文档时最重要的输入用同一批场景跑某个变体智能体是否主动检查技能库找到技能后是否真的使用若违规记录其给出的借口原文压力测试——叠加时间/沉没成本/权威干扰在压力下是否仍会检查技能记录合规在哪种压力下开始崩坏元测试——事后向智能体追问改进方向你有文档但没查。为什么文档怎么写才能更清楚其中元测试是 testing-skills-with-subagents.md 明确推荐的手段它能把文档不清楚与文档清楚但智能体选择忽略区分开——前者靠改文档解决后者需要更强的原则或红线。成功标准与失败标准先定义赢在开跑之前就要把判定标准钉死避免事后自我安慰变体成功当且仅当智能体在无人提示的情况下主动检查技能库读技能时完整阅读后再行动而不是大致看看在压力下仍然遵循技能指引无法用合理化借口解释掉违规变体失败的四种典型表现即使没有压力也跳过检查不读全文只借用概念就动手在压力下被合理化借口击穿把技能当作参考资料而非硬性要求预期结果对照五种措辞的假设排序原文档给出了一份先验预期这也是实验要验证的核心假设变体预期表现NULL智能体总是选最快路径对技能库毫无感知变体 A软建议无压力时可能检查压力下必跳过变体 B指令式有时检查容易被合理化掉变体 C强调式合规性强但可能显得过于僵硬变体 D流程导向均衡但篇幅更长——智能体能内化吗注意这五档并非简单的越强硬越好。writing-skills/SKILL.md 中的让形式匹配失败类型一节给出了一个反直觉的告诫在塑形类问题产出形状不对上禁令式措辞反而会反噬——同一批措辞对照测试显示禁令组产出的不想要内容明显多于配方组甚至比无指导对照组还差。因此在解读结果时不能只看合规率还要观察合规是否以牺牲灵活性为代价。仓库中已有的执行基础设施让测试可复现这份测试方案在本仓库不是纸上谈兵——仓库里已经有两套可执行的自动化测试体系可以作为该方案的落地载体技能触发测试tests/skill-triggeringrun-test.sh 实现了一套朴素提示词能否触发技能的检测它以claude -p无头模式运行提示词提示词中不出现技能名用--plugin-dir指向本仓库然后从 stream-json 输出中匹配name:Skill与skill:skillname两个特征来判断技能是否被触发。其参数约定为./run-test.sh skill-name prompt-file [max-turns] # 例./run-test.sh systematic-debugging ./test-prompts/debugging.txtrun-all.sh 则把 systematic-debugging、test-driven-development、writing-plans、dispatching-parallel-agents、executing-plans、requesting-code-review 六个技能连同各自的 prompts 目录 批量跑完并汇总 PASS/FAIL。其中的提示词文件如 systematic-debugging.txt内容是测试失败、报错堆栈、请修复正是 CLAUDE_MD_TESTING.md 中压力场景的一个现成模板它只描述症状不点名技能考验智能体能否自己联想到该调技能。技能内容断言测试tests/claude-codeREADME.md 描述的套件更进一层除了触发还要验证技能内容是否被遵循。它通过 test-helpers.sh 提供run_claude、assert_contains、assert_order、assert_count等断言原语对技能输出做行为级校验例如规格合规审查必须先于代码质量审查这类顺序断言。测试分快速测试约 2 分钟校验技能内容与要求与集成测试10–30 分钟跑完整工作流并支持--verbose、--timeout、CI 集成。把这两套设施与本文的方案结合可以形成完整闭环用 CLAUDE_MD_TESTING.md 的场景矩阵做人工/半人工基线观察用 run-test.sh 做触发率量化用 claude-code 测试套件做遵守度断言。另外 tests/explicit-skill-requests 中的提示词集如请直接用头脑风暴跳过客套则从另一面测试用户显式点名技能时的表现可作为变体实验的补充维度。结果的后续加工从合规率到堵漏洞CLAUDE_MD_TESTING.md 的 Next Steps 明确了实验之后的迭代方向搭建子智能体测试脚手架先对全部 4 个场景跑 NULL 基线对同一批场景逐一测试各变体比较合规率识别哪种合理化借口能击穿最强变体迭代获胜变体堵上剩余漏洞第 5、6 步正是 writing-skills/SKILL.md 中重构阶段的核心动作逐字捕获新的合理化借口 → 添加明确反驳 → 更新合理化借口表 → 创建红线列表 → 重新测试直到无懈可击。skills/using-superpowers/SKILL.md里的那张红线表让我先做这一件事这样做感觉很高效……共 12 行想法 → 现实对照就是这条重构路径在本仓库中的成品示例可作为获胜变体文档的参照物。小结CLAUDE.md 中的技能说明不是写给人看的注释而是会被注入每一轮对话的系统提示的一部分其措辞直接决定技能库的利用率。CLAUDE_MD_TESTING.md 给出的是一套实证框架四个带压力的场景负责暴露失败五个文档变体负责隔离措辞这个变量四步测试协议负责产生可比较的数据成功/失败标准负责让判定无歧义。在 superpowers-zh 仓库中这套框架既有 writing-skills/SKILL.md 提供的 TDD 方法论底座也有 tests/skill-triggering 与 tests/claude-code 提供的可执行测试设施可以直接从跑一遍 NULL 基线开始落地。赞分享AI 技能AI 插件人工智能开发工具【免费下载链接】superpowers-zh AI 编程超能力 · 中文增强版 — superpowers250k ⭐完整汉化 4 个中国原创 skills让 Claude Code / Copilot CLI / Hermes Agent / Cursor / Windsurf / Kiro / Gemini CLI / Qoder 等 26 款 AI 编程工具真正会干活项目地址https://gitcode.com/gh_mirrors/su/superpowers-zh点击查看免费下载相关推荐Kimi K2智能体能力深度测试在真实场景中的表现如何Kimi K2智能体能力深度测试在真实场景中的表现如何 Kimi K2是月之暗面团队开发的大语言模型系列作为最新一代AI智能体在实际应用场景中的表现备受关大模型人工智能Aptos压力测试高并发场景性能验证Aptos压力测试高并发场景性能验证 概述 Aptos作为新一代Layer 1区块链其高性能特性需要通过严格的压力测试来验证。本文将深入探讨Aptos压力测区块链Web3mithril.js压力测试高并发场景的性能验证mithril.js压力测试高并发场景的性能验证 Mithril.js作为一款轻量级前端框架在高并发场景下的性能表现如何本文将通过详细的压力测试来验证这个上一篇NetworkX 图读写参考手册13 种格式的序列化与反序列化全解析下一篇ext-php-rs版本迁移教程从v0.14到最新版的升级步骤创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关推荐

虚拟内存迁移全攻略:从C盘爆满到D盘优化,原理、操作与避坑指南
虚拟内存迁移全攻略:从C盘爆满到D盘优化,原理、操作与避坑指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 2:17:29

雷达弱目标检测前跟踪TBD MATLAB实战:多帧积累与航迹回溯
雷达弱目标检测前跟踪TBD MATLAB实战:多帧积累与航迹回溯

简介:这份MATLAB检测前跟踪(TBD)资源面向雷达信号处理方向的学习者与研究人员,聚焦微弱目标检测与跟踪这一难点问题。其核心思路是在正式检测前对多帧回波数据进行积累与联合处理,以提升信噪比,并借助卡尔曼… · 2026/9/26 2:17:29

医院就诊数据挖掘与疾病预测系统:从特征工程到模型部署的毕设全流程指南
医院就诊数据挖掘与疾病预测系统:从特征工程到模型部署的毕设全流程指南

每年到了毕业季前后,总有学弟学妹来问我同一个问题:有没有那种算法、系统、论文都能兼顾的题目?不会太难,又能让答辩老师觉得有东西可看。今年问得最多的,就是"医院就诊数据挖掘与疾病预测系统"这个方向。如… · 2026/9/26 2:17:23

Ragent流式输出:SSE分事件推送思考、正文与来源,以及跨节点流式取消
Ragent流式输出:SSE分事件推送思考、正文与来源,以及跨节点流式取消

Ragent流式输出:SSE分事件推送思考、正文与来源,以及跨节点流式取消 【免费下载链接】ragent 企业级 Agentic RAG 智能体 - 全链路覆盖文档解析、多路检索、意图识别、问题重写、会话记忆、MCP 工具调用与深度思考。面向真实业务场景,从 0 到… · 2026/9/26 3:01:17

计算机毕业设计选题推荐:基于大数据的广西医疗机构及药店清单数据分析与可视化|毕业设计选题|计算机毕设|选题推荐|毕设指导|项目定制|源码|高质量项目
计算机毕业设计选题推荐:基于大数据的广西医疗机构及药店清单数据分析与可视化|毕业设计选题|计算机毕设|选题推荐|毕设指导|项目定制|源码|高质量项目

✨作者主页:IT毕设梦工厂✨ 个人简介:曾从事计算机专业培训教学,擅长Java、Python、PHP、.NET、Node.js、GO、微信小程序、安卓Android等项目实战。接项目定制开发、代码讲解、答辩教学、文档编写、降重等。 ☑文末获取源码☑ 精彩专栏推荐⬇… · 2026/9/26 3:01:17

基于拉丁超立方抽样与场景缩减的交直流混合微网优化调度
基于拉丁超立方抽样与场景缩减的交直流混合微网优化调度

1. 交直流混合微网为什么值得折腾先说结论:这玩意儿不是学术圈自嗨,是真正在解决实际工程问题的。现在的微电网早就不是纯交流或者纯直流一统天下的局面了。光伏、储能、直流负荷这些天生就是直流的,而风机、传统负荷、电网接口又离不开交流。… · 2026/9/26 3:01:17

基于SpringBoot+Vue的鲜花商城系统:从下单到支付全链路实战
基于SpringBoot+Vue的鲜花商城系统:从下单到支付全链路实战

简介:这是一套面向高校计算机专业毕业设计场景的鲜花商城全栈项目源码,采用SpringBootMyBatis后端与Vue前端组合,配套MySQL数据库,适合正在准备毕设或需要电商类实战案例的开发者参考。系统按用户、店家、管理员三角色划分权限&am… · 2026/9/26 3:01:17

基于Python+Vue的协同过滤图书推荐系统:从算法选型到前后端联调实战
基于Python+Vue的协同过滤图书推荐系统:从算法选型到前后端联调实战

简介:这份资源是面向高校计算机相关专业毕业设计的完整项目包,主题为PythonVue基于协同过滤算法的图书推荐系统,适合正在准备毕设、需要机器学习与前后端分离实战案例的学生参考。系统涵盖用户模块、图书模块、推荐算法模块与推荐结果展示模块… · 2026/9/26 3:01:17

计算机软件工程毕业设计多方向源码解析|SpringBoot+Vue 全套项目、数据库脚本、业务代码与 AI 创新模块实现
计算机软件工程毕业设计多方向源码解析|SpringBoot+Vue 全套项目、数据库脚本、业务代码与 AI 创新模块实现

第一篇:会议预约管理系统 标题:多个计算机毕设项目|SpringBootVue 会议预约管理系统源码,含 AI 智能排期毕业设计创新实现 摘要 在众多计算机毕业设计选题中,会议预约管理系统属于业务逻辑规范、架构标准、功能完善… · 2026/9/26 3:01:11

数据库课后习题答案别硬背:当测试用例集刷,效率翻倍
数据库课后习题答案别硬背:当测试用例集刷,效率翻倍

简介:万常选版《数据库原理与设计》课后习题答案资源,覆盖第2至6章及第9章,适合正在学习关系模型、数据库建模、关系数据理论与模式求精的本科生、自学者作为复习与自测材料。压缩包共7个文件,含3个doc参考答案、2个sql示例脚本、… · 2026/9/26 0:00:21

OpenClaw 替代品?Hermes Agent 踩坑实录:macOS 飞书接入 TaoToken 配置
OpenClaw 替代品?Hermes Agent 踩坑实录:macOS 飞书接入 TaoToken 配置

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 0:00:40

向下兼容与向上兼容:接口设计中的兼容性策略与工程实践
向下兼容与向上兼容:接口设计中的兼容性策略与工程实践

一次版本升级事故,是很多团队绕不过去的坎。线上环境里,服务端明明已经上线了新版接口,老的移动端还在照着旧文档传参数。请求一到网关,校验直接拒绝,用户操作失败,客服群炸了锅,开发群里开始互… · 2026/9/26 0:00:46

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码