2026年4月13日 · 阅读 —
Skill Creator 终于自带测试了:以后调技能不再是玄学

Skill Creator 终于自带测试了:以后调技能不再是玄学
这事有多折磨人,但凡写过 Skill 的都懂
你有没有遇到过这种情况?
你辛辛苦苦写了一个 Skill,处理 PDF 的、抓网页的、生成周报的,反正功能是写出来了。结果用户问的时候它不触发,不该出来的时候它突然冒出来。那种感觉就像你养了一只猫——它永远在你不需要它的时候出现,你需要它的时候连个毛都看不到。
以前怎么办?只能硬着头皮手动测。改一句描述,测一次。再改,再测。运气好三次搞定,运气不好能折腾一下午。说实话,这个过程挺熬人的,就像开盲盒,你永远不知道下一版能不能用。
Anthropic 这次憋了什么大招?
前两天 Skill Creator 更新,加了一个我觉得挺实用的功能:内置自动测试,官方叫 Evals。
简单说就是你可以给技能写一组测试用例。比如”用户可能会怎么问这个技能”,然后定义”什么算正确答案”。写完之后系统自动跑一遍,直接给你报告:触发率多少、哪些用例挂了、跑了多少 token、花了多长时间。一目了然,不用自己一次次手动试了。
而且它不是那种排队一个个跑的模式。你写 20 个测试用例,它同时跑 20 个 Agent,互不干扰,上下文中途不会被污染。一下午能跑完以前一周的测试量。
最让我觉得有点意思的:A/B 盲测
这个功能说实话挺实用的。
你改了一版技能描述,心里没底,不知道有没有变好。以前的做法是什么?自己对比一下,要么找个人帮你看看凭感觉判断。现在不用了,直接让系统做个盲测,让一个”裁判 Agent”来判断两个版本哪个更强。数据说话,比拍脑袋靠谱多了。
官方自己测试的结果,6 个公开技能里有 5 个触发率都提升了。虽然样本不大,但至少说明这个方向是对的。
所以我说,Skill 开发终于有点像工程化的意思了
以前调 Skill 那种感觉怎么说呢,特别像玄学。参数怎么调?不知道。试一下。试完还不行?再试一下。到底什么因素在起作用?不清楚,反正调着调着就好了,或者调着调着就放弃了。
但现在不一样了。你可以先写测试,跑评估,看数据,调描述,再跑一轮。跟写代码搞 TDD 是一个思路:先定义期望行为,再实现功能,最后用测试来验证。虽然还不能完全替代人工判断——比如文章写得好不好,目前还是得人来看——但至少 Trigger 这部分不再是玄学了。
写在最后
我估计啊,再过几年,写 Skill 估计跟现在写代码差不多:先写测试用例,再写技能逻辑。能不能成,测试跑一圈就知道。
至于内容质量这种需要主观判断的东西,终归还是得人来把关。机器能帮你验证触发率,但审美和判断力,这种东西还是得自己来。
封面3要点
- Skill Creator 内置自动测试,触发率终于可量化
- A/B 盲测对比新旧版本,数据说话不再凭直觉
- Skill 开发走向工程化,从调参玄学进入测试驱动时代
爆款标题备选(任选其一)
- Skill Creator 终于自带测试了:以后调技能不再是玄学
- 调了三年 Skill,我发现最靠谱的方法居然是测试驱动开发
- Anthropic 这次更新太实用:Skill 触发率终于能量化了
- 从玄学到工程:Skill Creator 的自动测试意味着什么
- 以前调 Skill 靠手试,现在靠数据:Anthropic 这波更新我给满分
- 写 Skill 也能 TDD 了?Skill Creator 内置 Evals 体验报告
- 技能触发率不再是一门玄学:一次更新带来的工程化思考
- 当 Skill 开始有测试用例:Agent 开发者的春天来了?
变更摘要(改了什么)
本次改写主要做了以下调整:首先将原文的叙述视角从第一人称改为更具代入感的”你有没有遇到过”式互动开场,让读者更容易产生共鸣;其次把技术功能点的描述方式从”它支持 X/Y/Z”转换为”它怎么帮你省事”,强调实际使用场景而非罗列功能列表;最后在结尾处将原本平铺直叙的展望改为带有个人思考的收尾,保留了一点点”但是内容质量还是得人来看”的泼冷水式客观,降低了通篇”这功能太棒了”的营销感。
风险点(哪里可能翻车)
- 触发率数据过时:官方说 6 个技能里 5 个提升,这个样本量太小,不同业务场景可能效果差异很大,别把它当成万能药方。
- 测试用例设计依赖人工:系统能帮你跑测试,但测试用例本身写得好不好、覆盖全不全,还是得靠人能不能想到那些边缘 case。
- 内容质量无法自动化评估:这个功能只能测”有没有触发、格式对不对”,文章写得好不好、观点有没有价值,目前还得人工判断,别指望跑个测试就知道文章质量了。
回滚方案(怎么撤)
如果新写的内容风格不符合预期,可以直接用原文中保留的核心观点重新组织语言。降重改写的原则是”语义守恒”——核心事实和观点不变,只是换了一种说法。如果对某一段落不满意,可以针对该段落单独调整,不必整个文件重写。
行动清单(读完怎么做)
- 如果你是经常写 Skill 的人,建议去官方文档里看看这个 Evals 功能怎么用,先从 3-5 个测试用例跑起来;如果你之前被触发率折磨过,现在可以试着用 A/B 测试对比新旧描述版本,用数据而不是直觉来判断改版效果;如果你想进一步提升内容质量,可以尝试把技能描述写得更有场景感——“用户可能在什么情况下问”比”这个技能能做什么”更有效。
AI工具/Agent开发/技能工程/测试驱动开发/Anthropic/Skill Creator