2026年4月18日 · 阅读 —

这个 Skill 工具有点狠,连你写的 Skill 水不水都能给你打分

Agent 与 Skills测试与评测

这个 Skill 工具有点狠,连你写的 Skill 水不水都能给你打分

前两天刷 GitHub,看到一个项目名叫 Skill Craft。 第一眼我还以为又是那种“讲得很满,落地一坨”的工具。 结果往下一看,这东西不是教你写 Skill 的鸡汤文,它是直接冲着 Skill 质量工程 去的。 如果你也遇到过“Skill 看着能跑,结果一上手就开始飘”的情况,这玩意儿你大概率会有点感觉。

这个项目是干嘛的

一句话说白了,它是一个覆盖 Skill 评估、修复、创建、系统审计 全生命周期的质量工程工具。

它解决了什么问题

很多人现在会写 Skill,但真到可复用、可维护、可扩展这一步,经常开始出幺蛾子。 比如触发条件写得很糊,工具优先级乱飞,输出约束一松就开始啰嗦,依赖链一断整个流程像断电一样。

Skill Craft 干的事,本质上就是把这些“看起来能用,实际上容易翻车”的问题拆开来检查。 它不是给你一把万能锤,而更像是装修前先给你验房的老师傅,哪面墙空鼓、哪根线虚接,先给你挑出来,免得后面越修越狗血。

核心功能亮点

  • check 模式,用于评估单个 Skill 的质量 这在实际中有啥用,就是你不用靠感觉判断“这个 Skill 行不行”,它会按 8 个模块给你做质量评分。

  • fix 模式,用于修复 Skill 这在实际中有啥用,就是不是只告诉你哪里烂,而是会按优先级修,再做回归验证,避免修完像没修一样。

  • create 模式,用于从零创建 Skill 这在实际中有啥用,就是你想新建一个 Skill,不用从空白文档开始搓,流程里包含需求确认、规模判断、生成文件、自检和自动化验证。

  • audit 模式,用于多 Skill 系统审计 这在实际中有啥用,就是如果你不是只有一个 Skill,而是一整个目录,这个模式能查路由冲突、一致性和引用完整性,适合做系统级排雷。

  • 三维评分体系 这在实际中有啥用,就是它不只看“有没有写”,还会从 8 模块检查、7 反模式评估、3 完整性原则三个维度一起看,尽量减少那种表面工整、实际发虚的情况。

  • 自动化验证脚本 这在实际中有啥用,就是你可以直接跑元数据验证和结构验证,不用纯靠肉眼巡检,省得像查错字一样来回翻。

快速开始

README 里给了最直接的使用方式,下面这些命令原样保留。

评估一个 Skill

评估 /path/to/my-skill

输出:8 模块评分 + 7 反模式风险 + 3 完整性评级 + 行动项清单

修复一个 Skill

修复 /path/to/my-skill

输出:问题清单(P0/P1/P2)→ 逐项修复 → 回归评估(修复前 vs 修复后分数)

创建一个 Skill

创建一个代码审计 skill

输出:需求确认 → 规模判断 → 生成文件 → 自检 → 自动化验证

审计多 Skill 系统

审计 /path/to/skills-directory

输出:路由冲突 + 一致性 + 引用完整性 + P0/P1/P2 系统级问题

关键用法 / 示例

除了上面的交互式入口,README 还给了自动化验证命令。 这个就很实在,等于告诉你别光靠嘴说“我这个 Skill 很规范”,先跑一遍再吹。

# 验证元数据(name + description)
python3 scripts/validate-metadata.py --path /path/to/skill

# 验证结构(目录 + 8模块 + 引用完整性 + 空文件检测)
python3 scripts/validate-structure.py --path /path/to/skill

另外,README 里还把目录结构列出来了:

skill-craft/
├── skill-craft-cn/          # 中文版
│   ├── SKILL.md             # 主入口(192 行)
│   ├── references/          # 按需加载的参考文档
│   │   ├── check-guide.md       # check 流程 + 质量框架
│   │   ├── fix-guide.md         # fix 流程 + 修复约束
│   │   ├── create-guide.md      # create 流程 + 生成指南
│   │   ├── audit-guide.md       # audit 流程 + 审计标准
│   │   ├── quality-standards.md  # 7 反模式 + 3 完整性原则
│   │   ├── practical-best-practices.md  # 实战最佳实践
│   │   ├── report-template.md    # 报告模板
│   │   └── skill-scaffold.md     # 新 Skill 骨架模板
│   └── scripts/             # 自动化验证脚本
│       ├── validate-metadata.py   # 元数据验证
│       └── validate-structure.py  # 结构 + 引用 + 空文件检测
└── skill-craft-en/          # 英文版(结构同上)

这套结构的意思也很明确,主入口常驻,参考文档按需加载,脚本单独放一边做验证。说白了,就是别把一个 Skill 写成一锅乱炖,不然上下文一长,模型脑子也容易抽一下。

使用感受(不官方版)

我比较喜欢它这一点,不是只教你“怎么写”,而是盯着“怎么别写废”。 README 给的信息虽然不长,但路径很清楚,从评估到修复再到审计,链路是闭的。 如果你已经在维护一堆 Skill,这种工具比再看十篇方法论鸡汤有用得多。

适合哪些人用

  • 在做 AI Agent / Skill 体系,手头已经有多个 Skill 的人
  • 经常要评审别人写的 Skill,又不想每次全靠经验拍脑袋的人
  • 想从零创建一个 Skill,但希望过程更规范的人
  • 需要做 Skill 质量治理、系统巡检、路由冲突检查的人
  • 团队里已经开始沉淀 Skill 资产,准备走工程化的人

注意事项 / 坑点

  • README 里强调的是 全生命周期质量工程,不是一个“万能自动生成器”,别把它当一键出奇迹。
  • 它的检查体系很完整,包含 8 模块检查、7 反模式评估、3 完整性原则,所以你在使用时更适合把它当成规范化校验器,而不是只图一个分数。
  • fix 模式里写得很明确,修复后会强制做 回归验证,这点挺重要。很多人修 Skill 像补墙,补完一看另一面又裂了,这个流程至少是在防这种事。
  • README 提到的“上下文保护”“Checkpoint 驱动”“防失效”,本质上都说明它很重视边界和稳定性。所以它强归强,但也不是让你无脑堆规则,规则堆多了也可能把 Skill 写成说明书。

一句话总结

这玩意儿挺猛,适合拿来治 Skill 工程化里的散装毛病,但别上头,它更像质检员,不是许愿机。

评论区交作业

你现在写 Skill,最头疼的是哪一类问题?

  1. 触发条件老是写糊
  2. 工具调用顺序容易漂
  3. 输出越来越啰嗦
  4. 多 Skill 一起用就开始打架

也可以直接说一句,你会不会拿这个工具去审一下自己现在的 Skill?

#GitHub #SkillCraft #AI工程化 #Agent #PromptEngineering #OpenClaw #工作流 #自动化 #质量治理 #技术分享