Legal AI 入门简明指南(中文译本)

2 minute read

Published:

这是 英文原文 的普通话中文译本。

在过去几天下午里,我向共事的研究生推荐了一些阅读材料,帮助他们快速进入 Legal AI 领域。因此,我想把自己会推荐给 Legal AI 新入门者的资源整理成一份指南。本文反映了我的经验与兴趣,因此选材明显偏向 NLP 和机器学习。我主要研究英国和中国法律语境下的 Legal AI,所以这两个语境下的资源会比其他语境介绍得更详细。我正在继续补充其他法域的资源;不过,本文包含许多能够跨法域迁移或不依赖特定法域的信息和技术线索,因此我相信其目前的形式已可为不同法律语境的 Legal AI 研究者提供帮助。本文是一份起步指南,而不是全面综述。

本文围绕三个问题展开:哪些技术背景是有用的?目前有哪些法律任务和资源?截至写作时(2026 年 9 月),研究者正在构建哪些法律模型和智能体?

1. 先定义任务

开始一个 Legal AI 项目时,我认为首先应明确任务的范围:法域、法律领域(例如刑法、民法或行政法等),以及可用的知识与数据来源。还应想清楚任务的具体形式——写出预期输入和输出的例子通常很有帮助——以及如何评估输出,即评估方案。对于计算建模和应用而言,目标最好不是含糊的“好或坏”,而是可以评估的,最好可以量化。

一个很好的入口是 Zhong 等人的 How Does NLP Benefit Legal System?(ACL 2020),该文将法律任务映射到 NLP 方法。

2. AI 与 NLP 背景

对非技术背景的研究者而言,这一节可能稍显令人望而生畏。但请放心:在开始项目之前,并不需要读完所有论文。本节的目的,是提供一份基础 AI/NLP 概念清单,帮助你阅读 Legal AI 论文时理解可能遇到的术语。

从 Transformer 到通用语言模型

上下文学习与思维链提示

两者相关,但不应混为一种技术。提示可以包含没有推理轨迹的“端到端”示例,也可以不提供示例而要求模型“逐步思考”。对于法律研究,我还会区分模型生成的解释(“模型的推理”)和经过独立核验的推理;模型生成的中间“推理”步骤仍须检查其是否有效,并是否与相关事实和法律规则一致。

指令微调、偏好学习与强化学习

如果你的工作涉及模型微调和对齐,我建议将这两篇论文放在一起阅读。

如果你特别关注强化学习,我建议按以下顺序阅读:

  1. Proximal Policy Optimization Algorithms(Schulman 等,2017):许多早期 RLHF 流程采用的策略优化方法。
  2. Learning to Summarize from Human Feedback(Stiennon 等,2020):从偏好中学习、并据此优化语言生成的一个例子。
  3. Direct Preference Optimization(Rafailov 等,2023):直接从偏好对训练的替代方法,无需标准 RLHF 流程中独立的奖励模型训练和在线 RL 循环。
  4. Let’s Verify Step by Step(Lightman 等,2023):提出了监督最终结果与监督中间步骤之间的重要区别。
  5. DeepSeekMath(Shao 等,2024):在数学推理中提出 Group Relative Policy Optimization(GRPO)。
  6. DeepSeek-R1(2025):有助于理解面向推理的 RL,以及它与冷启动数据和蒸馏的关系。

上述大部分实验涉及数学或代码。将奖励建模和强化学习用于法律,需要设计能够捕捉法律正确性和推理质量的奖励信号,其中还包括多个结论都可能成立的情形。根据我们团队近期的实证工作(LexReward;即将发布),这比人们想象的更困难。

检索增强生成(RAG)

法律是知识密集型领域,因此检索增强生成(RAG)自然是 Legal AI 任务中有用的设计。可阅读 Retrieval-Augmented Generation(Lewis 等,2020) 进一步了解 RAG。在法律应用中使用 RAG 时,有几个问题值得考虑和检查:应检索哪些来源?模型是否正确使用了它们?若检索失败,系统能否识别失败,还是会继续给出缺乏依据的回答?

智能体(注:本节将继续扩充)

3. 数据集与基准

下面我大致按法域整理资源,并为多语言和跨法域工作留出单独位置。请注意,语言和法域是不同属性;例如,英语并不等于美国或英国法。目前这份汇总只涵盖文本数据;未来我可能会加入一些多模态数据集,因为这一方向已有一些新工作。

在进入资源清单前,区分每种资源提供的内容也很有帮助:

资源类型典型用途首先应检查什么
文本语料库预训练、检索来源、覆盖范围、日期、访问条件
标注数据抽取、分类、检索、生成金标准标签、标注过程
评估基准评估模型表现任务定义、评估设计
交互环境智能体规划与工具使用评估工具、状态、反馈、成功标准

欧洲与多语言资源

中国

  • CAIL2018 是大型刑事案件数据集,任务包括罪名预测、适用法条预测和刑期预测,确立了若干有影响力的任务设定。
  • JEC-QA(Zhong 等,2020) 包含法律考试题,适合研究法律问答。
  • LeCaRDv2 研究中国刑事案例检索,并提供专家标注。
  • LexChain(2026) 将中国侵权案件分析结构化为法律要件识别、责任分析和裁判综合,适合研究显式分析流程中错误出现的位置。
  • LexRel(2026) 使用结构化分类体系研究中国民事案件中的法律关系抽取,使人注意到系统在给出有用分析前必须表征的主体和关系。
  • LexIssue(2026) 通过生成和层级分类处理中国民事诉讼中的争点识别。
  • 若要进行更广泛的 LLM 评估,可以看看 LexEval(2024)LawBench(2024)PLawBench(2026)。它们都提供法律评估任务集合;若要为模型寻找中国法律基准,它们是不错的起点。

美国

英国(注:本节将继续扩充)

德国

印度

  • ILDC(Malik 等,2021) 提供印度最高法院案件,用于裁判预测;其中一个子集具有专家解释标注。
  • LegalEval(SemEval-2023 Task 6) 涵盖修辞角色、命名实体以及带解释的裁判预测。辨识段落的功能——陈述事实、报告论点或给出理由——在尝试端到端分析前很有价值。
  • IL-TUR(2024) 研究印度法律理解任务,包括检索、摘要、翻译和与裁判相关的任务。

日本

4. 法律模型与系统

5. 法律中的奖励建模与强化学习

这是我目前最感兴趣的领域之一。当我们能够生成许多看似合理的答案或论证时,问题就变成:应向模型提供什么反馈(奖励),才能让下一次回答更好?

6. 法律智能体

智能体系统会连续作出选择:搜索什么、检查哪份文档、调用什么工具等。与“静态”LLM 相比,这增加了规划和状态管理。

基准与环境

在智能体场景中,评估通常会同时考察任务成功、工具调用正确性、证据质量、中间步骤和预算使用等。

单智能体系统(待补充)

多智能体系统(MAS)

法律场景为多个智能体提供了自然的角色分工。以下是几篇近期 MAS 论文:

  • AgentCourt(2025) 使用法庭模拟和对抗性交互,并保留经验与法律材料。
  • LinguaGame(2026) 通过信号博弈刻画语言交互,并采用免训练的策略推断方法,与辩论和法庭模拟相关。
  • GARL(2026) 明确研究博弈论多智能体强化学习;其法律应用通过策略性资源分配和仲裁,对争议中的法律争点进行排序。

7. 延伸阅读

Lilian Weng 的博客 是我最喜欢用来建立概念地图、再沿参考文献深入单篇论文的地方之一。就本文主题而言,我建议从 LLM Powered Autonomous AgentsReward Hacking in Reinforcement Learning 开始。

我也推荐关注 Bingxiang He 的研究主页,特别是其关于 on-policy distillation(OPD) 的工作。 Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe 讨论蒸馏何时成功,以及师生模型兼容性如何影响结果。 Rethinking On-Policy Distillation of Large Language Models II: One Training Example 考察训练数据需求和学生模型 rollout 所访问的状态。