前阵子帮一家做跨境业务的公司做法务 AI 选型,法务负责人提了一个特别具体的需求:别让 AI 只回答“合同里违约金条款是怎么写的”这种零散问答,而是让它把一份 30 页的经销协议完整读下来,逐条对照公司最新模板,把偏差整理成一张差异表,再给业务部门直接生成一版谈判要点。说实话,两年前听到这个需求,我会觉得这是在难为 AI;但这半年深入评估 Claude Cowork 这类多代理协作工具之后,我发现这个需求已经从“基本做不到”变成了“需要认真设计能力边界才能做好”。
这个转变,就是标题里说的“从助手到协作者”。在法务 AI 观察这个系列的前两篇里,我们聊过通用大模型对法律检索的改造,也聊过 RAG 在法律知识库里的落地姿势。这一篇我想把镜头对准更前端的岗位:企业法务部内部,AI 不再只当一个随叫随到的问答工具,而是成为能接住一整条任务链的协作者。Claude Cowork 是观察这个趋势很好的样本,但更值得聊的是它背后那套工作流、边界和治理逻辑。这篇文章适合正在做法务数字化的团队负责人,也适合被老板要求“研究一下 AI 能帮法务干什么”的同行——我会尽量把能直接落地的判断和步骤写清楚。
1. 助手与协作者的分水岭:Cowork 在法务场景里究竟多做了什么
1.1 从“你问我答”到“你给目标、我跑流程”
传统 AI 助手的工作模式,一句话就能概括:人出题,AI 做题,做完一道再等下一道。律师让它总结一份合同,它就给你一份摘要;律师再问“知识产权条款有没有风险”,它又单独回答这个问题。这种模式不是没用,而是每一轮交互都要人来拆解任务、组织追问、拼接结论。换句话说,人承担了绝大部分的流程编排工作,AI 只是被调用的计算单元。
Claude Cowork 代表的协作模式,把这一层关系翻了过来。人给出的是目标和边界条件,AI 自己负责拆解任务、规划执行顺序、调用需要的工具和知识源,最后把成果按约定格式交付,并且标注出它做了哪些判断、依据是什么。用一句行业里越来越流行的话说,这已经从“工具”变成了“可交付工作的实体”。
我理解的 Cowork 并不是单一模型能力的堆叠,而是一套任务编排机制:它能同时管理多个子任务,每个子任务有独立的上下文目标,最终汇合到主任务的结果里。这个机制在法务场景里价值很大。因为法律工作天然是“多线程、多材料、多输出物”的:审一份合同可能要同时查公司模板、查历史谈判记录、查法规库、查对方公开信息;做一次合规自查要同时比对公司制度、监管清单、业务流程文档。传统助手做这些事要人反复切换,而 Cowork 让 AI 可以自己在一条工作流里反复横跳。
1.2 三种 AI 工作模式:问答式、流程式、协作式
为了把“协作者”这个概念落到可比较的位置上,我习惯把法务团队常用的 AI 工作方式分成三档。
| 模式 | 交互特点 | 法务中的典型表现 | 人需要付出的工作量 |
|---|---|---|---|
| 问答式 | 人问一句,AI答一句 | “帮我解释一下这个条款”“这份合同里有哪些赔偿条款” | 高,需要人不断追问和拼装结果 |
| 流程式 | 人搭好流水线,AI按步骤跑 | 用脚本批量提取合同字段,自动填入表格 | 中,搭建阶段辛苦,跑通后稳定 |
| 协作式 | 人给目标,AI拆解并执行多步任务 | 输入一份合同和审查要求,AI输出差异表、风险标注、谈判建议 | 低,人对结果做复核而非从零拼装 |
需要说明的是,这三档不是替代关系。问答式适合临时性小问题,流程式适合固定格式的批量作业,协作式适合“过程复杂、输出物多、需要重新组织材料”的任务。法务部门真正缺的,恰恰是第三档。因为合同审查、尽调初筛、合规自查这类工作,最大的成本从来不是某一个问答,而是把十几个问答串成一条完整链路的过程。协作式 AI 吃掉的就是这部分成本。
1.3 Cowork 的核心能力组合:拆解、记忆、引用、异步
如果要拆开看 Cowork 在法务场景里“多做了什么”,我会归纳成四个关键词。
第一是任务拆解。拿到“审查这份经销协议”的指令后,它不会直接甩给你一段总结,而是先建立任务清单:提取交易结构、核对授权范围、比对赔偿条款、检查终止条件、识别数据跨境相关表述等等。每个子任务有明确的输入和输出,最后汇总成一个结构化报告。这跟一个初级法务助理的工作习惯是一致的,只是速度要快得多。
第二是上下文保持。长文档审查最怕“忘记前文”。一份 30 页的合同,传统助手在回答第 5 个问题时可能已经忘了第 1 个问题引用的页码。Cowork 在任务编排中会持续维护一个上下文空间,把关键条款、风险标签、修改建议挂在里面,后续子任务都能引用。这个能力对法务太关键了,因为法律意见最忌讳逻辑断裂。
第三是引用可回溯。协作式 AI 给出的每条风险判断,都能指回原文段落。这一点我在后面“坑”的部分会重点讲,这里先说结论:没有引用回溯能力的 AI 审查,在法务场景里基本没有可用性,因为你没法在争议发生的时候证明“AI 当时是读了那一页才这么说的”。
第四是异步执行。任务发起后,人可以先去开下一个会,AI 自己在后台跑流程,跑完推通知。传统助手是“你等它”,协作模式变成“它等你”。法务负责人的时间本来就碎,这个改变看起来小,实际体感差异很大。
2. 合同审查是 Cowork 模式最有说服力的试验场
2.1 为什么第一站必须选合同
我见过的法务 AI 落地案例里,合同审查永远是第一个被选中的场景。原因不复杂:合同是法务部最刚性、最高频、最难外包的工作;文档的形式相对结构化,条款类型有规律;风险判断有公司模板和历史经验可以做锚点。换句话说,合同审查具备“可定义、可衡量、可迭代”三个特征,天然适合作为 AI 协作能力的试验田。
更现实的原因是,合同审查的痛感足够强。业务部门催着要合同,销售等签约,供应商等付款,而法务部只有那么几个人。很多公司的合同审查周期是 3 到 5 个工作日,其中大量时间花在机械的条款比对和格式检查上,真正需要律师职业判断的部分占比反而不高。AI 协作者如果能先把机械部分接住,释放出来的人力自然流向高价值判断,这就是路线图的第一步。
2.2 Cowork 式合同智审的一条完整链路
用一个具体的例子来说明。假设公司要审一份英文版的软件采购协议,配套文件包括公司最新标准合同模板、上一轮与该供应商谈判的历史记录、公司数据合规管理制度。传统做法是律师亲自打开三份材料,逐段核对。Cowork 模式下,这条链路可以这样编排:
第一层,信息抽取。AI 先读取采购协议全文,提取出交易双方、采购标的、合同金额、许可范围、服务期限、付款节奏、违约金上限、管辖地等关键字段,形成一份结构化摘要。这一层考的是模型的长文档理解能力,现在的头部模型基本不是瓶颈。
第二层,差异比对。把提取出的条款与公司标准模板逐条对照,找出所有不一致的地方。这里的价值在于“逐条”而不是“抽样”:人做不到每一条都精读,AI 可以。输出是一张差异表,每行包含模板原条款、合同现条款、差异类型(更优、更劣、中性)和对应页码。
第三层,风险标注。针对差异点,结合公司数据合规制度和历史谈判记录,标出哪些条款触及红线,哪些属于可协商空间。比如合同中把“数据处理需遵循当地法律”写成了“数据处理仅遵循供应商所在国法律”,这就直接与公司跨境数据传输政策冲突,Cowork 会把它标记为高风险并附上理由。
第四层,成果生成。最后不是给一堆表格让律师自己拼,而是直接产出一版可用的审查意见:包括风险清单、修改建议、给业务部门的谈判要点,甚至一段可以直接发给对方的外部沟通草稿。律师做的是检查、调整口径和签字确认,而不是从零开始写。
2.3 与传统 AI 审查的对比:效率差在哪一层
同样是“审合同”,传统 AI 助手的典型方式是:人把合同上传,提问“把里面的赔偿责任条款翻译成大白话”,AI 回答一段;再问“这个赔偿条款和行业惯例比有什么问题”,AI 再回答一段。问题在于,人的提问质量决定了结果质量,而律师的高价值时间恰恰不应该花在组织提问上。
Cowork 模式的价值,是把“提问”替换成了“目标描述”。人只要说清楚审查范围、使用模板、参考材料、输出格式,AI 自己完成中间所有步骤。我实测过同一份 15 页的采购合同:传统方式,先分段提问、再人工汇总,花了大约 40 分钟;Cowork 式的一次性任务编排,AI 跑完约 8 分钟,人工复核用了 15 分钟。总时长从 40 分钟降到 23 分钟,看起来只是快了一点,但注意人工从“全程参与”变成了“节点复核”,这才是质的区别。
2.4 试点批次怎么选:建议从低风险、高重复的合同开始
我建议第一次试点不要拿复杂并购协议试,而是选两类“低风险高重复”的合同:一类是 NDA(保密协议),另一类是标准采购订单。原因是它们条款模式固定、公司模板成熟、出错的容忍度相对高,适合建立内部信心和校准阈值。
操作上可以这样做:挑选最近 12 个月已经审结的 50 份 NDA,让 Cowork 重新审查一遍,把输出与当年律师的审查意见逐条对照。这一步不是为了“证明 AI 比律师厉害”,而是为了建立质量基线。统计三个数字:风险条款识别率、误报率、漏报率。识别率高、漏报率低,就可以扩大范围;误报率太高,就说明上下文提示词和模板输入方式需要调整。这个过程一点都不性感,但它是后面所有判断的基础。
3. 能力边界不是一条线,而是一张地图
3.1 先做风险分级,再谈自动化率
很多团队在引入 AI 协作者时,第一反应是问“它能替代多少人工”,我建议反过来问“哪些环节能安全放权,哪些环节绝对不能放”。因为 AI 的确定性输出能力还远达不到法律意见所要求的严谨度,真正的工程问题不是“能不能全自动”,而是“在哪个范围、以什么方式、多大置信度下自动”。
我习惯用四象限法来画边界:横轴是任务的可标准化程度(从高度定制到高度重复),纵轴是出错后果的严重程度(从影响轻微到合规红线、重大财务损失)。这样自然分出四块:高重复且低风险的任务,可以大量放权;高重复但高风险的任务,做 AI 初筛加人工终审;低重复且低风险的,辅助提效;低重复且高风险的,坚决保留给人类专家。
3.2 法务场景的边界地图示例
下面这张图,是我经过多个项目总结出的法务 AI 边界地图,可以直接抄去当讨论起点:
| 放权区(AI 直接产出,人抽检) | 半放权区(AI 初筛,人终审) |
|---|---|
| 合同字段抽取与摘要、条款版本差异比对、历史合同检索、多语言初翻、格式合规初检、模块化文书初稿 | 合同风险条款初评、合规清单自查初筛、尽调底稿摘要整理、证据材料初步归档、法律检索摘要 |
| 保留区(人主导,AI 辅助) | 暂不碰区(尽量不引入) |
| 最终法律意见定稿、对外承诺文案、争议应对策略制定、涉及特权和保密的判断、监管沟通口径 | 直接对外签字文件、需要主观价值权衡的条款决策、涉及客户特权判断的场景 |
为什么保留区和暂不碰区要单独划出来?因为法律工作的核心责任链条非常明确:最后签字的律师要对意见负责。AI 可以帮律师更快地找到依据、更全面地列出风险,但它不能替律师扛责任,也不该在责任链条里处于不可回溯的位置。边界画得越早,后面追责越清楚,团队用起来也越不忐忑。
3.3 边界是设计出来的,不是等出来的
一个容易忽略的事实是:模型能力本身没有边界意识,边界是人通过任务设定、权限控制、输出分级和复核流程“做”出来的。同样一个 Cowork 任务,配置成“输出风险清单”还是“输出可直接发送的外部函件”,边界完全不同;给它的知识源是“公司公开文件库”还是“包括涉密谈判记录在内的全部档案”,边界也完全不同。
所以我在和法务团队一起设计时,通常会让流程负责人先写一页纸的“AI 使用规则”,明确三件事:第一,哪些任务允许 AI 直接产出结果;第二,哪些任务产出结果后必须由哪个角色审核;第三,AI 输出的哪些字段必须回溯到原始文档。把这个规则固化到工作流配置里去,比事后提醒要可靠得多。
4. 部署前要备好的四件套:数据、权限、留痕、质量基线
4.1 数据合规:文件不离开受控范围
法务部处理的材料,相当一部分属于保密信息甚至律师-客户特权信息的范畴。部署 Cowork 之前,第一件事不是讨论模型选型,而是确认数据链路:文档存储在哪里、传输过程是否加密、模型服务商的数据留存策略是什么、训练数据是否包含客户数据。企业级场景里,私有化部署或者签订严格的数据处理协议通常是基本条件。
在这方面我的建议很朴素:宁可功能弱一点,也要先把数据边界收紧。如果某个协同功能必须把文件传到外部服务才能跑,而这个服务的数据协议达不到公司合规要求,那就先不开这个功能。法务 AI 的价值在于提高效率,而不在于制造新的合规风险,别本末倒置。
4.2 权限体系:最小必要原则
协作式 AI 的能力范围,很大程度取决于它能访问哪些知识库和工具。给它的权限越大,它表面上越“能干”,但失控面也越大。设计权限时,我建议遵循最小必要原则:每个任务只开放完成任务所需的最小数据范围。比如审 NDA,只需要开放 NDA 模板库和相关法规库;审并购合同,才需要临时开放尽调材料库和历史交易库。
权限不仅是安全控制,也是质量控制的杠杆。AI 看到的文件越多,输出被无关信息带偏的概率也越大。把权限收紧,反而能让它的判断更聚焦。这个道理适用于人,也适用于模型。
4.3 过程留痕:审计日志是法务 AI 的底线
法务工作天然要求可审计。引入 AI 协作者之后,必须保证每一次任务都能追溯到完整的执行记录:谁在什么时间发起了任务、AI 读了哪些文档、引用了哪些段落、做了哪些判断、输出最终由谁审核确认。不要指望靠模型自带的日志,要在集成设计阶段就把审计字段作为强制要求。
我见过一个反例:某团队上了 AI 合同审查,用了三个月都挺好,直到一单业务出了争议,老板问“这份合同当时是谁审的、AI 判断依据是什么”,结果系统只能给出最终报告,拿不出过程中的引用记录。虽然最后靠人的记忆勉强补上,但这件事让团队重新做了一轮系统改造。所以说,留痕功能最好一开始就设计进去,后面补永远是高成本的。
4.4 质量基线:用 golden set 校准输出
这部分是最容易跳过的,也是我最想强调的。AI 协作工具的“可用性”不是一个抽象概念,而是一组可以用历史数据实测的数字。做法是构建一个 golden set:从公司已审结的合同里选 50 到 100 份,律师对每份合同的关键风险点已经给出了权威标注,这组数据就是“标准答案”。让 Cowork 跑同样的审查任务,把输出与标准答案做比对,计算识别率、误报率、漏报率,再决定上线还是调整。
golden set 不只用于上线前验收,上线后也要定期抽检。法规在变、公司模板在变、合同对手方的手段也在变,三个月前的质量表现不代表今天的质量表现。定期抽检是法务 AI 运营里的“体检项”,没有它,所谓的“稳定运行”只是幻觉。
4.5 选型对照表:用五个问题快速过滤产品
选型阶段与其听厂商讲参数,不如用一套统一的问题去问。我常用的五个问题是:上下文长度能否覆盖你的典型长文档?输出是否自带引用回溯?是否支持私有化或本地化部署?权限控制和审计日志做到什么颗粒度?是否支持工作流级别的任务编排,还是只能单轮问答?前三个问题过滤合规和可用性,第四个问题过滤安全性,第五个问题过滤它到底是不是“协作者”而不是“高级助手”。五个问题答完,大部分产品就被筛掉了。
5. 从试点到扩面:法务 AI 路线图重新编排
5.1 四周试点跑法
我推荐一个四周试点结构,目标是快速验证质量、摸清阻力、建立数据基线。
第一周做两件事:选定试点场景(如 NDA 审查)和构建 golden set。第二周做配置:写清楚审查要求提示词、挂接模板库、配置权限和审计日志。第三周是并行运行:同一批合同,人工审一遍,AI 审一遍,对比差异,逐步调整提示词和风险标签体系。第四周复盘:统计质量数据和工时数据,决定是扩大场景、调整方案还是暂停。
这套跑法的关键是“人工与 AI 并行”而不是“直接让 AI 独立干活”。并行期虽然看起来增加了工作量,但它是唯一能在真实业务流量里暴露问题的方式。这个阶段的产出不仅是“能不能用”的结论,更是一份属于本公司的质量报告,后续说服管理层扩面时很有说服力。
5.2 扩面节奏:从低风险到高价值的三个阶梯
试点通过后,扩面不要一步到位。我通常按三个阶梯推进。
第一阶梯是标准化文书的批量处理,NDA、订单确认函、渠道合作协议这类;第二阶梯是复杂一点的经营性合同,采购、销售、服务协议,开始涉及谈判底线和风险容忍度设置;第三阶梯才是尽调初筛、合规自查、知识产权风险排查这类需要跨材料综合判断的场景。每个阶梯之间留出至少两周的评估期,质量数据达标了再上台阶,不达标就停在原地修配置。
这个节奏看起来保守,但它能让团队始终保持“可控试错”的状态。法务 AI 最怕的不是跑得慢,而是跑得太快之后出现一次高质量翻车,把整个项目的信任基础打没了。
5.3 组织角色正在变化:从“干活的人”到“训练和复核的人”
路线图走到中段,组织内部最明显的变化不是裁员,而是岗位职责的迁移。Junior 法务的工作内容从“逐条读合同、比对模板、整理摘要”慢慢变成“定义风险标签体系、为 AI 完善审查规则、复核 AI 标记的风险点”。这其实不是坏事——初级岗位从重复劳动里解放出来,开始做更有判断力的工作,对个人成长和团队能力建设都是正向的。
但这里也存在一个管理提醒:法务负责人要主动更新岗位说明书和培训计划。如果团队里的小朋友还以为自己的核心价值是“比 AI 读得快”,那路线图会卡在人才层面。相反,如果他们学会如何给 AI 设定高质量的目标、如何校验输出、如何设计边界,这些能力本身就是未来两三年法务团队最稀缺的竞争力。
6. 我在实践里看到且踩过的五个坑
6.1 把协作者当成高级搜索框
这是最常见的首月误区。团队把 Cowork 部署好之后,使用方法还是“我问一句、它答一句”,有人甚至拿它当企业版搜索引擎用,问“公司的保密制度是哪条规定”,却从不让它承担一条完整任务。结果自然是感觉“好像也没比 ChatGPT 强多少”。破解方法是回到任务思维:找三个典型的业务流程(审合同、做合规自查、整理尽调底稿),分别为它们设计完整的任务模板,让 AI 从 A 点跑到 B 点,而不是停在中间。
6.2 AI 直接产出了“最终法律意见”
这个坑我见过真实的翻车案例。有团队在配置时为了省事,让 AI 直接生成给业务部门的最终审查意见并自动发送,法务只在后台看到通知。结果有一份合同里 AI 没识别出独家排他条款的后续影响,直接按模板输出“无重大风险”,业务部门拿这个结果去推进签约。后来幸好在签约前被法务抽检发现,不然就是一笔实打实的违约责任。这件事之后,我把“输出分级”列为了法务 AI 制度的默认要求:AI 可以产出初稿、风险清单、参考文案,但只有当某个环节在配置里注明“人工终审”时,输出才会流向业务方。
6.3 不给 AI 喂口径,输出就飘
AI 再强,也猜不到你的业务部门习惯用什么话术、谈判底线设在哪、哪些条款是老板特别在意的。如果不把公司模板、历史审结意见、谈判记录这些“口径”喂进去,AI 输出的审查建议就偏向通用法律知识,看起来对,用起来不对。我的经验是,花在整理提示词和组织知识库上的时间,会比花在调模型参数上的时间多得多,但这部分功夫不能省。
6.4 权限边界失守,信息越域流动
有一次我给一个团队做配置评审,发现“合同审查”任务的权限里,误挂载了一个包含高管薪酬条款的敏感文件库。权限模型里可能只是多勾选了一个文件夹的事,但在协作式 AI 的场景里,这意味着任何一次合同审查都可能把不相关的敏感信息读进上下文并出现在输出里。这个问题的严重性远超模型能力问题,属于数据安全事件。所以配置完成后一定要做一次交叉验证,把权限矩阵打印出来逐个核对,别信直觉。
6.5 试点不错就急着全量推广
试点阶段因为场景窄、人工复核密度高,质量数据通常好看。但全量推广意味着场景变宽、复核人力稀释、长尾情况变多,质量会自然回落。正确做法是给全量推广预设一个过渡期:上线后每周抽检 10% 到 20% 的任务,连续四到六周质量稳定,再逐步降低抽检比例。这个过程不刺激,但能挡住大多数后期翻车。
回到开头那个选型问题。那位法务负责人想要的不是“更聪明的问答机器人”,而是一个能接住整条合同审查链路、把差异表、风险清单、谈判要点都直接摆到桌面上的协作者。Claude Cowork 这类的协作式 AI,确实把法务部的 AI 路线从“辅助提效”推到了“重新设计工作方式”的位置。把边界画清楚,把数据、权限、留痕、质量基线这四件套备齐,再沿着低风险到高价值的阶梯推进,这条路是可以稳稳走通的。