法律风险管理这件事有个很诡异的地方:大部分法务团队天天在做的事,居然没有一套标准化的操作流程。问一个法务”这个合同风险大不大”,回答可能是”还行”“有点悬”“问题不小”,但你很难得到一个精确的数字。
不是法务不专业。法律风险评估天然带有主观性,同一个条款在不同行业、不同公司甚至不同时点的判断都不一样。但你想过没有,如果一个公司连财务风险都能量化到小数点后两位,为什么法律风险就只能靠”感觉”?
Anthropic 最近在 knowledge-work-plugins 仓库里发布了一个叫 legal-risk-assessment 的 Skill。这个 Skill 做的事说起来简单:用一套 severity×likelihood 的双维度矩阵,把法律风险从”感觉不妙”变成 1 到 25 的精确数字。GitHub 上已经超过两万 star,在 Smithery 等 Skill 市场也能直接搜到。
说真的,这篇文章不打算跟你讲太多法律理论。我就是把这个 Skill 的框架拆了一遍,看看它到底解决了什么问题,哪些地方设计得聪明,哪些地方明显还需要自己动手改。如果你也在法务团队里管风险,或者正在考虑把 AI 引入法律工作流,这篇应该能帮你看清这个方向到底值不值得跟。
环境准备
这个 Skill 的获取方式相当直接。它是 Anthropic 官方 knowledge-work-plugins 仓库的一部分,在 Smithery 和 skills.sh 等 Skill 市场也能直接搜到。不需要额外的 API key,不需要配置外部服务,本质上就是一个纯 Prompt 文件,加载到 AI 助手后就能直接使用。
安装命令只有一行:
npx skills add anthropics/knowledge-work-plugins
装完之后用 skills use legal-risk-assessment 激活。前提是你的环境支持 Skill 系统,WorkBuddy、CodeBuddy、Claude Code 都行。没有额外的依赖项,甚至连特定的 Node 版本都不要求。

这种”零配置”的设计思路很符合 Anthropic 一贯的风格。他们的 Skill 大多数是纯知识注入,不依赖外部工具链。好处是开箱即用,坏处也很明显:它不会自动帮你查法规,不会自动检索案例库,所有判断基础都来自你喂给它的原始信息。
值得一提的是 Skill 头部有一句很关键的免责声明:“You assist with legal workflows but do not provide legal advice.” 翻译过来就是:它帮你走流程,但不替你下结论。这个定位在整个框架设计里贯穿始终,后面你会反复看到这种克制的边界感。
操作流程
这个 Skill 的核心工作流可以用一个公式概括:输入法律事项,走两维评估,得出风险分数,匹配行动方案。听起来简单,但每一步都有明确定义,不是”差不多就行”。
第一步永远是拆成两个独立维度分别打分。Severity 从 1 到 5,每一档都有具体的财务敞口锚点:Negligible 是几乎没影响,Low 对应合同金额 1% 以下的敞口,Moderate 是 1% 到 5%,High 是 5% 到 25%,Critical 是超过 25% 且可能牵连董事个人责任。Likelihood 也是 1 到 5,从 Remote(几乎没有先例)到 Almost Certain(触发条件已经存在)。
两边分数相乘,得到 1 到 25 的风险评分,再落入四个区间:
-
GREEN(1-4,低风险):接受风险,记录在案,季度审查即可 -
YELLOW(5-9,中等风险):实施缓解措施,指定负责人,月度跟踪 -
ORANGE(10-15,高风险):上报高级法律顾问,制定缓解计划,周度审查,考虑外部律师 -
RED(16-25,致命风险):立刻通知 GC 和董事会,组建应急团队,启动危机管理,强制引入外部律师
这个设计的巧妙之处在于,它用乘法而不是加法,自然拉开了不同风险等级的差距。一个 Critical 但 Remote 的风险(5×1=5,YELLOW)和一个 Moderate 但 Almost Certain 的风险(3×5=15,ORANGE),在直觉判断里可能都让人”感觉不妙”,但数值差了三倍,行动路径完全不同。

拿一个实际场景来说。公司签了一份 SaaS 合同,对方的数据处理条款没有明确的数据删除机制,而你的业务涉及 GDPR 管辖的用户数据。评估这条款的 Severity 至少有 4(High),因为潜在罚款和声誉损失不小。Likelihood 要看对方作为成熟厂商出问题的概率,如果历史上没出过事给 2(Unlikely),4×2=8,YELLOW 区,需要协商修改条款并持续跟踪。但如果对方是家初创公司、安全记录不明,Likelihood 调到 4,4×4=16,直接进 RED 区,这事必须拉 GC 进来讨论。
关键设计
从 SKILL.md 的完整文档来看,这个 Skill 最聪明的地方不是评分框架本身,而是它把所有评分结果都绑定到了具体的行动方案上。GREEN 区怎么做,RED 区怎么做,什么情况下通知保险公司,什么情况下必须找外部律师,每一步都有明确指引。
四个风险等级不只是在名字上做了区分,每个等级的责任人、审查频率、是否引入外部律师都有清晰的层级差异:
| 风险等级 | 责任人 | 审查频率 | 外部律师 |
|---|---|---|---|
| GREEN (1-4) | 团队成员 | 每季度/每年 | 不需要 |
| YELLOW (5-9) | 指定负责人 | 每月 | 不需要 |
| ORANGE (10-15) | 高级法律顾问 | 每周 | 考虑 |
| RED (16-25) | GC / 董事会 | 每日及以上 | 强制 |
这套设计等于把公司法务团队的汇报层级直接编码进了风险评估流程里。与其说它是风险分级工具,不如说它是一套自动化的升级路由:什么时候该由谁介入,不需要靠”我觉得这事有点大”来判断,分数自己会说话。

文档标准部分也下了功夫。Skill 内置了两套模板:一套是风险评估备忘录,从风险描述、背景分析、双维度评估到缓解方案和残值风险评估,十节完整结构,可以直接产出内部分析报告。另一套是风险登记册条目,方便把评估结果录入团队的追踪系统。这两套模板的字段设计和实际法务团队的工作流对齐度很高。
不过有一个设计让我有点纠结。这个框架把 Severity 和 Likelihood 各拆成 5 级 25 格的矩阵,颗粒度看起来很细,但实际用的时候你会发现从 3 分调到 4 分的边界并不总是那么清晰。Anthropic 在说明里也坦白写了:“This framework is a starting point that organizations should customize to their specific risk appetite.” 如果你的法务团队只有两三个人、业务复杂度有限,这五级体系可能反而增加了决策成本。
使用场景
从 Skill 的触发条件来看,Anthropic 给它设计了四个核心场景:合同风险评估、交易敞口评估、问题严重性分级,以及判断是否需要高级法律顾问或外部律师介入。四个场景精准覆盖了公司法务日常工作中最高频的决策点。
合同审查是最高频的应用入口。一份供应商协议,对方在知识产权条款里塞了过宽的使用授权,在赔偿条款里把己方责任写得模糊不清。传统做法是法务逐条标注”风险较高”“建议修改”,但什么叫”较高”?跟团队其他人的标准一致吗?换到这个框架下,你能给每条风险标注一个具体的分数和色标,整个团队看同一份合同的风险热力图,沟通成本直接降一个量级。
M&A 交易的前期尽调场景也很有意思。一次并购的法律尽调少则几十项、多则上百项风险点,没有统一标准的话,团队会在”看起来有点问题但是说不清多严重”的项目上反复拉扯。用这套框架给每个风险点统一打分和分级,整个团队对风险全景的感知就有了同一把尺子。
不过,Anthropic 对这个 Skill 的定位相当克制。在”何时引入外部律师”的章节里,它明确列出了必须引入和强烈建议引入的场景。
强制引入的场景只有四个:
-
已立案的诉讼 -
政府调查 -
潜在刑事责任 -
证券披露相关事项
强烈建议引入的还有:新类型法律问题、跨司法管辖区冲突、超过公司风险承受阈值的敞口。这个自知之明反而让它更可信,它知道自己能做什么,不能做什么。
洞察与反思
从法律风险 Skill 的设计往回推,Anthropic 对法律 AI 的定位非常克制。有三件事它明确没有做:
-
没有让 AI 尝试”法律推理” -
没有做案例检索 -
没有做法规数据库对接
它只做了一件事,把法务团队每天都在做但从未标准化的”判断过程”做了结构化。这种策略反而比那些号称”AI 律师”的产品更有实际价值。
如果让我猜 Anthropic 的下一步,他们很可能会把这套法律 Skill 系列和 MCP 工具对接。现在 legal-risk-assessment 是个纯 Prompt Skill,分析依据全靠用户自己喂信息。但你可以想象这样一个画面:Skill 负责评估框架和判断逻辑,MCP 工具负责自动拉取相关法规和案例库。用户在对话里就能走完完整的闭环:
-
识别风险 -
引用法规 -
评估等级 -
生成备忘录
四个步骤一气呵成,比现在纯 Prompt 方案的价值大得多。
法律行业对 AI 的态度一直很分裂。一边是律所和公司法务部门在疯狂试用各种 AI 工具,另一边是行业监管和伦理讨论在持续踩刹车。从 Skill 的角度来看,这类工具并不挑战法律行业的执业壁垒,它只是把判断过程做了显性化和可追溯化。过去你说”这个风险是高的”,别人只能信或不信。现在你说”Severity 4,Likelihood 3,得分 12,落 ORANGE 区”,别人可以和你争论你的 4 分打高了还是打低了。
换个角度讲,这类 Skill 冲击最大的对象可能不是律师,而是那些缺少成熟法务体系的中小企业。大公司的法务团队本来就有自己的风险评估框架和文档模板,这个 Skill 对他们来说是锦上添花。但对于只有一两个法务甚至没有专职法务的公司,它相当于免费赠送了一套法务团队的内部操作手册。这种知识平权的效应,可能比 Skill 本身的功能更值得长期关注。
| 资源 | 地址 |
|---|---|
| Smithery | https://smithery.ai/skills/anthropics/legal-risk-assessment |
| GitHub | https://github.com/anthropics/knowledge-work-plugins |
总结
法律风险评估这种”天天在做但从未标准化”的工作,恰好是 AI Skill 最适合切入的领域。不需要替代律师的判断,只需要把判断过程结构化,框架的价值就已经超出了大多数人对 AI 法律工具的预期。
但也不要高估它。这个 Skill 本质上是一套 Prompt 驱动的分类框架,不是一个能自动检索法规、分析案例、审理合同的完整系统。它的上限取决于你喂进去的信息质量和你对评分标准的自定义程度。直接用默认模板跑出来的结果,参考价值有限。
如果你正在考虑把 AI 引入法务团队的工作流,这个 Skill 是个不错的起点。花十分钟装上,先拿几个历史合同的风险评估做回测,看看它给的分跟你团队实际做的判断差多远。校准了自己的评分标准之后,它才能真正变成一件趁手的工具。

