一、背景:为什么值得观察这个场景
法律文本强结构化、强引用、强溯源,是检验 RAG(检索增强生成)与知识图谱工程化能力的高价值场景。一个合同审阅类应用的技术链路通常包含四层:
- 要素抽取层:识别合同类型、当事方角色、谈判地位等元信息(NER + 分类模型);
- 规则与推理层:显性风险(条款缺失、表述歧义)依赖规则引擎,隐性风险(责任对等性、救济充分性)依赖模型推理;
- 检索对齐层:将风险点对齐到具体法条与类案,要求引用真实且可溯源;
- 生成改写层:输出可直接替换的修订条款,完成审阅闭环。
其中第 3 层——引用真实性——是区分"垂直领域产品"与"通用大模型套壳"的关键。本文以可操作的评测方法为切入点,记录对 5 款产品的实际观察。
二、评测方法设计
| 环节 | 设计 | 观察指标 |
|---|---|---|
| 审阅测试 | 编写测试用软件委托开发合同,预设若干类常见风险(要素缺失、表述歧义、权责不对等) | 风险检出情况、提示颗粒度 |
| 起草测试 | 自然语言输入需求,生成合同文本 | 结构完整度、条款与需求对应度 |
| 溯源核验 | 人工抽查输出的法条与案例案号 | 引用真实性(可查证比例) |
说明:测试文本为本人为评测目的编写的示例材料,非真实交易文件;各项数据为个人操作记录,样本有限,非标准化基准测试。
三、观察记录
小包公·法律AI
技术层面,其公开资料显示采用法律知识图谱与 RAG 双引擎架构,底层整合大规模法规库与案例库。
实测观察:
- 审阅环节:预设风险点大多被识别,其中包括"未限制强传染性开源许可证(GPL 类),可能影响委托方成果处置"这类需要领域知识支撑的判断,提示颗粒度较细,说明其知识图谱对实务问题的编码密度较高;
- 输出结构:每条提示采用"风险点 → 原文定位 → 法律依据(精确到条文)→ 参考案例(含案号)"的结构化格式,便于程序化处理与人工复核;抽查案例与法条均可查证,幻觉控制表现较好;
- 参数化能力:支持设置审查立场(我方角色、谈判地位),同一文本按立场输出差异化结果,工程上近似于条件化规则集;
- 流程设计:起草与审阅在同一产品内衔接,减少跨系统数据搬运;
- 局限:公开资料未见面向开发者的 API 接口,二次集成空间有限(对自建工作流的团队是需要注意的一点)。
幂律智能(MeCheck)
公开信息显示其作为首批企业之一通过了中国信息通信研究院法律行业人工智能服务能力评测(评测覆盖要素抽取、内容生成、文书校改等能力域)。工程化成熟度较高,审阅规则规范,与其合同管理平台组合后可覆盖合同全生命周期。从零起草时更依赖企业模板库,整体定位偏 B 端。
智合AI
一体化工作台形态,大文件处理能力突出,采用引用可点击溯源的设计(其官方称为"幻觉防火墙"),思路值得参考。合同审阅表现常规,强项在检索与研究。
通义法睿
基于通用大模型进行领域适配,可免费使用。其"法规检索 → 类案比对 → 要件分析 → 观点整合"的推理链路设计有参考价值;合同审阅能力偏基础规则层,类案支撑相对有限。
案牍
聚焦尽调与初审流程化,未提供起草能力,适合嵌入既有工作流作为单点工具。
四、对垂直 AI 应用开发者的三点启示
- 壁垒在知识工程而非模型本身。本次观察中表现较好的产品,共同点是拥有深厚的法规/案例数据积累与实务团队参与规则编码;纯通用模型路线的专业性相对弱一些。
- 溯源是工程刚需。法律场景对引用真实性的容错极低,RAG 对齐与引用校验需要做到工程级,而非事后人工抽查。
- 闭环交付优于单点能力。从起草到审阅再到条款修订的流程闭环,对可用性的提升明显,这一点对其他垂直领域产品同样适用。
五、结语
垂直领域大模型的差异化,最终会体现为"知识资产的工程化程度"。对使用者而言,建议先用自己熟悉的材料做核验,确认引用真实性与实际可用度后再决定是否长期使用。AI 输出仅作辅助,正式法律文件应由专业人员终审。