Legal AI 入门简明指南(中文译本)
Published:
这是 英文原文 的普通话中文译本。
在过去几天下午里,我向共事的研究生推荐了一些阅读材料,帮助他们快速进入 Legal AI 领域。因此,我想把自己会推荐给 Legal AI 新入门者的资源整理成一份指南。本文反映了我的经验与兴趣,因此选材明显偏向 NLP 和机器学习。我主要研究英国和中国法律语境下的 Legal AI,所以这两个语境下的资源会比其他语境介绍得更详细。我正在继续补充其他法域的资源;不过,本文包含许多能够跨法域迁移或不依赖特定法域的信息和技术线索,因此我相信其目前的形式已可为不同法律语境的 Legal AI 研究者提供帮助。本文是一份起步指南,而不是全面综述。
本文围绕三个问题展开:哪些技术背景是有用的?目前有哪些法律任务和资源?截至写作时(2026 年 9 月),研究者正在构建哪些法律模型和智能体?
1. 先定义任务
开始一个 Legal AI 项目时,我认为首先应明确任务的范围:法域、法律领域(例如刑法、民法或行政法等),以及可用的知识与数据来源。还应想清楚任务的具体形式——写出预期输入和输出的例子通常很有帮助——以及如何评估输出,即评估方案。对于计算建模和应用而言,目标最好不是含糊的“好或坏”,而是可以评估的,最好可以量化。
一个很好的入口是 Zhong 等人的 How Does NLP Benefit Legal System?(ACL 2020),该文将法律任务映射到 NLP 方法。
2. AI 与 NLP 背景
对非技术背景的研究者而言,这一节可能稍显令人望而生畏。但请放心:在开始项目之前,并不需要读完所有论文。本节的目的,是提供一份基础 AI/NLP 概念清单,帮助你阅读 Legal AI 论文时理解可能遇到的术语。
从 Transformer 到通用语言模型
- Attention Is All You Need(Vaswani 等,2017) 提出了 Transformer 架构。它是理解注意力机制、位置嵌入以及编码器和解码器组件的自然起点。
- 接下来可阅读 BERT(Devlin 等,2018/2019),了解双向预训练表征和任务特定微调。许多法律分类和抽取系统建立在这一范式之上,其中一些至今仍是有用的基线。
- T5(Raffel 等,2019/2020) 以统一的 text-to-text 方式看待 NLP 任务,并系统研究迁移学习的不同选择。通过这篇论文,也可以初步了解“通用”语言模型的轮廓。
- GPT 系列包括 GPT-1(Radford 等,2018)、GPT-2(Radford 等,2019) 和 GPT-3(Brown 等,2020)。它们有助于理解从生成式预训练到如今广为人知的 ChatGPT 模型的转变。
- Scaling law 方面,可阅读 Scaling Laws for Neural Language Models(Kaplan 等,2020) 与 Training Compute-Optimal Large Language Models(Hoffmann 等,2022)。两篇论文实证研究了模型规模、训练数据、计算量与语言模型表现之间的关系,并被视为推动模型规模扩展的重要动力。
上下文学习与思维链提示
- GPT-3 是理解 in-context learning(上下文学习) 的核心参考:在不更新模型参数的情况下,于提示中提供示例。
- Jason Wei 等人的经典论文 Chain-of-Thought Prompting Elicits Reasoning in Large Language Models(2022) 提出了如今广为人知的 Chain-of-Thought(CoT,思维链)提示。
两者相关,但不应混为一种技术。提示可以包含没有推理轨迹的“端到端”示例,也可以不提供示例而要求模型“逐步思考”。对于法律研究,我还会区分模型生成的解释(“模型的推理”)和经过独立核验的推理;模型生成的中间“推理”步骤仍须检查其是否有效,并是否与相关事实和法律规则一致。
指令微调、偏好学习与强化学习
- Finetuned Language Models Are Zero-Shot Learners(Wei 等,2021/2022)(FLAN 论文)是了解 instruction tuning(指令微调)的好起点。监督微调从输入—输出示范中学习;数据告诉模型应模仿哪一种回答。
- Training Language Models to Follow Instructions with Human Feedback(Ouyang 等,2022)(InstructGPT 论文)涵盖监督微调、从偏好中学习奖励模型,以及使用该奖励进行强化学习。
如果你的工作涉及模型微调和对齐,我建议将这两篇论文放在一起阅读。
如果你特别关注强化学习,我建议按以下顺序阅读:
- Proximal Policy Optimization Algorithms(Schulman 等,2017):许多早期 RLHF 流程采用的策略优化方法。
- Learning to Summarize from Human Feedback(Stiennon 等,2020):从偏好中学习、并据此优化语言生成的一个例子。
- Direct Preference Optimization(Rafailov 等,2023):直接从偏好对训练的替代方法,无需标准 RLHF 流程中独立的奖励模型训练和在线 RL 循环。
- Let’s Verify Step by Step(Lightman 等,2023):提出了监督最终结果与监督中间步骤之间的重要区别。
- DeepSeekMath(Shao 等,2024):在数学推理中提出 Group Relative Policy Optimization(GRPO)。
- DeepSeek-R1(2025):有助于理解面向推理的 RL,以及它与冷启动数据和蒸馏的关系。
上述大部分实验涉及数学或代码。将奖励建模和强化学习用于法律,需要设计能够捕捉法律正确性和推理质量的奖励信号,其中还包括多个结论都可能成立的情形。根据我们团队近期的实证工作(LexReward;即将发布),这比人们想象的更困难。
检索增强生成(RAG)
法律是知识密集型领域,因此检索增强生成(RAG)自然是 Legal AI 任务中有用的设计。可阅读 Retrieval-Augmented Generation(Lewis 等,2020) 进一步了解 RAG。在法律应用中使用 RAG 时,有几个问题值得考虑和检查:应检索哪些来源?模型是否正确使用了它们?若检索失败,系统能否识别失败,还是会继续给出缺乏依据的回答?
智能体(注:本节将继续扩充)
- Plan-and-Solve(Wang 等,2023) 提示语言模型先制定计划,将问题拆解为更小的子任务,再逐步解决。
- Plan-and-Execute(2023) 将高层规划与执行分开:规划器勾勒步骤,使用工具的智能体负责执行。
- ReAct(Yao 等,2023) 交错进行推理和行动,使来自环境的观察能够影响后续步骤。
3. 数据集与基准
下面我大致按法域整理资源,并为多语言和跨法域工作留出单独位置。请注意,语言和法域是不同属性;例如,英语并不等于美国或英国法。目前这份汇总只涵盖文本数据;未来我可能会加入一些多模态数据集,因为这一方向已有一些新工作。
在进入资源清单前,区分每种资源提供的内容也很有帮助:
| 资源类型 | 典型用途 | 首先应检查什么 |
|---|---|---|
| 文本语料库 | 预训练、检索 | 来源、覆盖范围、日期、访问条件 |
| 标注数据 | 抽取、分类、检索、生成 | 金标准标签、标注过程 |
| 评估基准 | 评估模型表现 | 任务定义、评估设计 |
| 交互环境 | 智能体规划与工具使用评估 | 工具、状态、反馈、成功标准 |
欧洲与多语言资源
- LexGLUE(Chalkidis 等,2022) 是很好的起步基准,提供七项英语任务,涵盖 ECtHR、美国最高法院、欧盟立法、合同和案例要旨数据集。
- MultiEURLEX(Chalkidis 等,2021) 提供带有 EuroVoc 标签的欧盟立法文本,覆盖 23 种语言。
- LEXTREME(Niklaus 等,2023) 提供 11 个数据集,覆盖 24 种语言和多项法律 NLP 任务。
- MultiLegalPile(Niklaus 等,2024) 是一个大型多语言法律文本语料库,覆盖 24 种语言和 17 个法域。
中国
- CAIL2018 是大型刑事案件数据集,任务包括罪名预测、适用法条预测和刑期预测,确立了若干有影响力的任务设定。
- JEC-QA(Zhong 等,2020) 包含法律考试题,适合研究法律问答。
- LeCaRDv2 研究中国刑事案例检索,并提供专家标注。
- LexChain(2026) 将中国侵权案件分析结构化为法律要件识别、责任分析和裁判综合,适合研究显式分析流程中错误出现的位置。
- LexRel(2026) 使用结构化分类体系研究中国民事案件中的法律关系抽取,使人注意到系统在给出有用分析前必须表征的主体和关系。
- LexIssue(2026) 通过生成和层级分类处理中国民事诉讼中的争点识别。
- 若要进行更广泛的 LLM 评估,可以看看 LexEval(2024)、LawBench(2024) 和 PLawBench(2026)。它们都提供法律评估任务集合;若要为模型寻找中国法律基准,它们是不错的起点。
美国
- Pile of Law(Henderson 等,2022) 是大型英语法律和行政文本语料库。
- LegalBench(Guha 等,2023) 提供 162 项围绕不同法律推理形式设计的任务。
- CUAD(Hendrycks 等,2021):专家标注的合同审查数据,适合识别合同中具有法律重要性的部分。
- ContractNLI(Koreeda 和 Manning,2021):合同上的文档级推断,包含蕴含、矛盾和支持证据片段。
- LegalBench-RAG(Pipitone 和 Alami,2024):以现有法律数据集构建的细粒度检索评估,可用于考察检索器是否找到回答问题所需段落。
英国(注:本节将继续扩充)
- Cambridge Law Corpus(Östling 等,2023) 包含超过 25 万份英国法院案例,以及用于结果抽取的专家标注子集。
德国
- GerDaLIR(Wrzalik 和 Krechel,2021) 提供由法院判决构成的德国法律检索数据集。
- GerLayQA(Büttner 和 Habernal,2024) 将普通人的法律问题、律师回答与德国法律规定的引用联系起来,尤其适合研究日常问题描述和正式法律语言之间的差距。
印度
- ILDC(Malik 等,2021) 提供印度最高法院案件,用于裁判预测;其中一个子集具有专家解释标注。
- LegalEval(SemEval-2023 Task 6) 涵盖修辞角色、命名实体以及带解释的裁判预测。辨识段落的功能——陈述事实、报告论点或给出理由——在尝试端到端分析前很有价值。
- IL-TUR(2024) 研究印度法律理解任务,包括检索、摘要、翻译和与裁判相关的任务。
日本
- COLIEE(2025) 提供日本民法材料和法律考试题。
4. 法律模型与系统
- LEGAL-BERT(Chalkidis 等,2020) 是领域适配 Transformer 模型的重要参考。
- Lawformer(Xiao 等,2021) 将基于 Longformer 的架构适配至中国法律文书,强调长文档处理。
- 对于生成模型,DISC-LawLLM(Yue 等,2023) 将中文法律指令微调与法律知识检索结合起来。
- SaulLM-7B(Colombo 等,2024) 基于 Mistral 训练英语法律模型,并进行法律领域训练和指令适配。
- LegalOne(2026 预印本) 是较新的模型,结合了法律中期训练、带蒸馏推理数据的监督训练以及基于课程的 RL。
5. 法律中的奖励建模与强化学习
这是我目前最感兴趣的领域之一。当我们能够生成许多看似合理的答案或论证时,问题就变成:应向模型提供什么反馈(奖励),才能让下一次回答更好?
- Building Legal Reward Models for Grounding and Abstention(2026):这篇近期论文提出 LegalRewardBench,并研究情境化奖励建模,即根据提供的证据评估回答。研究从生成回答和自动标注中构建偏好,数据主要基于维多利亚州刑法,并附有美国评估。
- LegalΔ: Enhancing Legal Reasoning in LLMs via Reinforcement Learning with Chain-of-Thought Guided Information Gain(2025) 将蒸馏推理数据与 RL 结合,并采用部分基于推理对答案预测贡献的奖励。
6. 法律智能体
智能体系统会连续作出选择:搜索什么、检查哪份文档、调用什么工具等。与“静态”LLM 相比,这增加了规划和状态管理。
基准与环境
- LegalAgentBench(2025) 使用中国法律资源和工具评估智能体,包括需要多步操作的任务。它的代码库是考察实际环境的有用入口。
- Ready Jurist One: Benchmarking Language Agents for Legal Intelligence in Dynamic Environments(2025) 提出 J1-ENVS,其中六个场景涵盖中国法律语境下的法律咨询、文书起草与司法裁判。配套框架 J1-EVAL 同时评估最终结果与程序遵从。我会将它与 LegalAgentBench 一起阅读,以考察当评估包括信息收集和角色互动时会发生什么变化。
- LegalWorld(2026) 考察中国民事诉讼不同阶段的较长工作流,具有持续的案件信息和长时程评估设定。
在智能体场景中,评估通常会同时考察任务成功、工具调用正确性、证据质量、中间步骤和预算使用等。
单智能体系统(待补充)
多智能体系统(MAS)
法律场景为多个智能体提供了自然的角色分工。以下是几篇近期 MAS 论文:
- AgentCourt(2025) 使用法庭模拟和对抗性交互,并保留经验与法律材料。
- LinguaGame(2026) 通过信号博弈刻画语言交互,并采用免训练的策略推断方法,与辩论和法庭模拟相关。
- GARL(2026) 明确研究博弈论多智能体强化学习;其法律应用通过策略性资源分配和仲裁,对争议中的法律争点进行排序。
7. 延伸阅读
Lilian Weng 的博客 是我最喜欢用来建立概念地图、再沿参考文献深入单篇论文的地方之一。就本文主题而言,我建议从 LLM Powered Autonomous Agents 和 Reward Hacking in Reinforcement Learning 开始。
我也推荐关注 Bingxiang He 的研究主页,特别是其关于 on-policy distillation(OPD) 的工作。 Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe 讨论蒸馏何时成功,以及师生模型兼容性如何影响结果。 Rethinking On-Policy Distillation of Large Language Models II: One Training Example 考察训练数据需求和学生模型 rollout 所访问的状态。