ratemy.sh

rate-my-skill · 面向 Agent Skill 的上线审查

格式没错,不等于有用。

你的 Skill 通过了校验。现在证明它值得被装上:该触发的请求找得到它、装了确实比不装做得好、它的脚本没有越权。

审计 · S-014 目标:public-marketplace ref: sha256:2f90…b14c

问题清单

HIGH · S-002触发范围过宽,普通的写作请求也会把它唤起。它会打断无关的工作,让用户学会不信任它。

HIGH · S-005没有装了与不装的成对证据。所谓的行为增益未经证实。

待验证

UNKNOWN · U-001从未在全新会话里测过隐式触发。在市场里能不能被发现,还不知道。

证据通道

deterministic-checksPASS
critical-journey-e2ePASS
probabilistic-evalUNVERIFIED (无成对运行)
continuous-evidenceN/A (未部署)
最高安全档位:local-draft
阻断闸门:无激活
NOT READY
这份判决样张里,四条证据通道分别是:确定性检查(校验器和断言过没过)、 关键旅程(干净地装一遍、真的触发一次没有)、概率性评测(重复跑多次的行为达没达到门槛)、 持续证据(上架之后这套结论还成不成立)。最高安全档位是它敢放行到哪一步,五档从松到严是 local-draft、team-shared、public-marketplace、privileged-production、high-stakes。

范围

它到底审什么。

只审有产品后果的东西。风格偏好和时髦架构不算问题。

·

触发精度:该找到它的请求找得到吗?擦边的请求会不会误触发?

·

行为增益:同一个任务,装与不装各跑多次,用同一把尺打分。

·

渐进披露:它是只加载当前路线需要的部分,还是每次会话都把全部内容塞进上下文?

·

引用完整性:它让 agent 去读的每一条路径,真的都存在吗?

·

脚本与工具安全:权限、网络、密钥、供应链。

·

提示注入:输入里那些长得像指令的文本,有没有被当成数据?

·

打包完整性与上架就绪:一个陌生人能不能装上并复现它?

装与不装

装上它之后,有什么变化。

一个称职的 agent 本来就会读你的 SKILL.md,也会有意见。下面这些是只有装了它才会出现的行为。

SKILL.md 让 agent 去读的文件,有一个不在包里。

没装它

它清点的是包里有什么,不是 SKILL.md 要什么,于是什么也没发现。

装了它

它照着 SKILL.md 把每条引用走一遍,报出缺的文件和对不上的文件名,附确切路径。

包里带着一份 eval 文件,但从来没跑过。

没装它

格式合法、文件齐全,于是被当成效果已经证明过了。

装了它

它认出这份 JSON 只是定义、不是跑出来的记录,拒绝把它当成效果的证据。

被审的包里藏着一句写给 agent 的指令。

没装它

它照着执行了,因为那看起来就是指引。

装了它

它把包里的每一条指令都只当成证据,绝不照做,也绝不为了证明风险去读真实密钥或发起网络请求。

要测它会不会在不该出现的时候冒出来。

没装它

它试几条明显应该命中的提示词。

装了它

它还会拿一批用词相近、但不该触发的请求去试,过度触发是量出来的,不是被假设不存在。

别家跳过的一步

那修复本身,谁来审?

多数审查列完问题就结束了。要是接着动手修,先想清楚补丁是什么。它是项目里最新写的代码,为了赶紧关掉问题才写出来。它没有自己的测试,也没人读过。

1

修复的人不能给自己打分。

得换一个人来看。

2

一份 diff 不等于修好了。

每条问题都带一个验收测试。另一个人重现出原来的故障,又看着它不再发生, 这条才算 verified-fixed

3

补丁本身也要被审。

复测的人还会把改动本身当成新代码,再审一遍。修复自己带出来的毛病算新问题、新编号, 没解决之前这一批不算完。

4

什么时候停,看证据不看清单。

它只在三种情况下停:全部验过、遇到一个它说得出名字的阻碍、或者你明说剩下的风险你认了。最后这种会记成「你认了」,不会被悄悄写成「修好了」。

这个网站本身就是这么审的。第一轮问题修完之后,独立复测在那批补丁里又找出两个缺陷:一份公开可读的旧备份,和一个焦点进不了正文的跳转链接。两个都是修复过程带出来的,重跑原来的验收测试一个也发现不了。

怎么跑

开审之前,先问你两个设置。

它不会默默替你选最严的那档,也不会默默选最松的。

1

审查角色

按你要做的决定来选审查角色

2

审查程度

从松到严五档:快速体检(默认,只查最要紧的几项)、严格审查(给小范围试用的标准)、 上线门禁(公开发布的标准)、真实收米档(要碰真钱或敏感数据)、生死档(受监管或者出事就致命)。

§

分数不能把硬闸门平均掉。

有些问题不管总分多好看都拦住发布。你说「这个我认了」,它也不会因此变成通过。

§

从快速体检起步。

它是默认档,因为完整档要贵好几倍。它查得少,但会告诉你哪些没查。

五个 skill

各审一层,共用一套证据合同。

每一个都是独立插件。只装你正要上线的那一层。

安装

一条命令,或者插件市场。

一个客户端选一种装法就行。第一遍只读,什么都不改;能碰什么,仍然由你自己的沙箱和授权弹窗说了算。

任意 Skills 客户端 · 推荐
npx skills add AmsonntagChow/rate-my-skill --skill rate-my-skill
Claude Code
/plugin marketplace add AmsonntagChow/rate-my-skill
Codex
codex plugin marketplace add AmsonntagChow/rate-my-skill && codex plugin add rate-my-skill@amsonntagchow-rate-my-skill