法律 AI 研究简明指南

16 minute read

Published:

这是 英文原文 的普通话中文译本。

在花了几个下午为希望快速进入法律 AI 领域的研究生推荐阅读材料后,我觉得或许有必要整理一份面向法律 AI 新入门者的资源指南。本文反映了我的经验与兴趣,因此选材较偏向自然语言处理(NLP)和机器学习。我主要从事英国和中国法律语境下的法律 AI 研究,所以这两个语境的推荐资源会比其他法域更为详尽。我正在逐步补充其他法域的资源;不过,本文所列的许多信息和技术线索可以跨法域迁移,或并不依赖特定法域。因此,无论读者关注何种法律语境,我相信本文目前已可作为法律 AI 研究的有用起点。本文旨在提供入门路径,而非一篇全面的综述。

我围绕三个问题组织这份指南:需要哪些技术背景?已有何种法律数据集和资源?研究者已经构建了哪些法律模型与智能体?

1. 先定义任务

开始一个法律 AI 项目时,我认为准确界定任务范围非常重要。我会明确法域、法律部门(例如刑法、民法或行政法),以及可获得的知识来源和数据来源。我也会思考任务在实践中具体是什么样子;列出预期输入和输出的例子通常很有帮助。此外,还应考虑如何评估输出,即评价协议。对于计算建模和实际应用,几乎总是应当追求比模糊的“好或坏”更精确的目标:应当能够评价,最好能够进行量化评价。

一个很好的入口是 Zhong 等人的 How Does NLP Benefit Legal System?(ACL 2020),该文将法律任务映射到 NLP 方法。

2. AI 与 NLP 背景

这一部分对非技术背景的研究者来说或许显得有些令人生畏。请放心,在开始项目之前,并不需要读完这里的所有论文。本节的目的是列出阅读法律 AI 论文时可能遇到的基本 AI/NLP 概念。

从 Transformer 到通用语言模型

上下文学习与思维链提示

两者相关,但不应混为一种技术。提示可以包含没有推理轨迹的“端到端”示例,也可以不提供示例而要求模型“逐步思考”。对于法律研究,我还会区分模型生成的解释(“模型的推理”)和经过独立核验的推理;模型生成的中间“推理”步骤仍须检查其是否有效,并是否与相关事实和法律规则一致。

指令微调、偏好学习与强化学习

如果你特别关注强化学习,我建议按以下顺序阅读:

  1. Proximal Policy Optimization Algorithms(Schulman 等,2017):许多早期 RLHF 流程采用的策略优化方法。
  2. Learning to Summarize from Human Feedback(Stiennon 等,2020):从偏好中学习、并据此优化语言生成的一个例子。
  3. Direct Preference Optimization(Rafailov 等,2023):直接从偏好对训练的替代方法,无需标准 RLHF 流程中独立的奖励模型训练和在线 RL 循环。
  4. Let’s Verify Step by Step(Lightman 等,2023):提出了监督最终结果与监督中间步骤之间的重要区别。
  5. DeepSeekMath(Shao 等,2024):在数学推理中提出 Group Relative Policy Optimization(GRPO)。
  6. DeepSeek-R1(2025):有助于理解面向推理的 RL,以及它与冷启动数据和蒸馏的关系。

上述大部分实验涉及数学或代码。将奖励建模和强化学习用于法律,需要设计能够捕捉法律正确性和推理质量的奖励信号,其中还包括多个结论都可能成立的情形。根据我们团队近期的实证工作(LexReward;即将发布),这比人们想象的更困难。

检索增强生成(RAG)

法律是知识密集型领域,因此检索增强生成(RAG)自然是 Legal AI 任务中有用的设计。可阅读 Retrieval-Augmented Generation(Lewis 等,2020) 进一步了解 RAG。在法律应用中使用 RAG 时,有几个问题值得考虑和检查:应检索哪些来源?模型是否正确使用了它们?若检索失败,系统能否识别失败,还是会继续给出缺乏依据的回答?

智能体(注:本节将继续扩充)

3. 数据集与基准

下面我大致按法域整理资源,并为多语言和跨法域工作留出单独位置。请注意,语言和法域是不同属性;例如,英语并不等于美国或英国法。目前这份汇总只涵盖文本数据;未来我可能会加入一些多模态数据集,因为这一方向已有一些新工作。

在进入资源清单前,区分每种资源提供的内容也很有帮助:

资源类型典型用途首先应检查什么
文本语料库预训练、检索来源、覆盖范围、时间范围、获取条件
标注数据抽取、分类、检索、生成金标准标签、标注流程
评测基准评估模型表现任务定义、评估设计
交互式环境评估智能体的规划和工具使用工具、状态、反馈、成功标准

欧洲与多语言资源

中国

  • CAIL2018 是大型刑事案件数据集,任务包括罪名预测、适用法条预测和刑期预测,确立了若干有影响力的任务设定。
  • JEC-QA(Zhong 等,2020) 包含法律考试题,适合研究法律问答。
  • LeCaRDv2 研究中国刑事案例检索,并提供专家标注。
  • LexChain(2026) 将中国侵权案件分析结构化为法律要件识别、责任分析和裁判综合,适合研究显式分析流程中错误出现的位置。
  • LexRel(2026) 使用结构化分类体系研究中国民事案件中的法律关系抽取,使人注意到系统在给出有用分析前必须表征的主体和关系。
  • LexIssue(2026) 通过生成和层级分类处理中国民事诉讼中的争点识别。
  • 若要进行更广泛的 LLM 评估,可以看看 LexEval(2024)、LawBench(2024) 和 PLawBench(2026)。它们都提供法律评估任务集合;若要为模型寻找中国法律基准,它们是不错的起点。

美国

英国(注:本节将继续扩充)

德国

印度

  • ILDC(Malik 等,2021) 提供印度最高法院案件,用于裁判预测;其中一个子集具有专家解释标注。
  • LegalEval(SemEval-2023 Task 6) 涵盖修辞角色、命名实体以及带解释的裁判预测。辨识段落的功能——陈述事实、报告论点或给出理由——在尝试端到端分析前很有价值。
  • IL-TUR(2024) 研究印度法律理解任务,包括检索、摘要、翻译和与裁判相关的任务。

日本

4. 法律模型与系统

5. 法律中的奖励建模与强化学习

这是我目前最感兴趣的领域之一。当我们能够生成许多看似合理的答案或论证时,问题就变成:应向模型提供什么反馈(奖励),才能让下一次回答更好?

6. 法律智能体

智能体系统会连续作出选择:搜索什么、检查哪份文档、调用什么工具等。与“静态”LLM 相比,这增加了规划和状态管理。

基准与环境

在智能体场景中,评估通常会同时考察任务成功、工具调用正确性、证据质量、中间步骤和预算使用等。

单智能体系统(待补充)

多智能体系统(MAS)

法律场景为多个智能体提供了自然的角色分工。以下是几篇近期 MAS 论文:

  • AgentCourt(2025) 使用法庭模拟和对抗性交互,并保留经验与法律材料。
  • LinguaGame(2026) 通过信号博弈刻画语言交互,并采用免训练的策略推断方法,与辩论和法庭模拟相关。
  • GARL(2026) 明确研究博弈论多智能体强化学习;其法律应用通过策略性资源分配和仲裁,对争议中的法律争点进行排序。

7. 延伸阅读

对于希望建立更直观技术基础的读者,我强烈推荐 Andrej Karpathy 的 Neural Networks: Zero to Hero。这套课程从反向传播、语言建模到类 GPT 架构,循序渐进地带领读者构建神经网络。如果你想理解现代 AI 工具的抽象封装之下究竟发生了什么,它尤其值得学习。

Chris Olah 在 Distill 上的文章是培养关于神经网络如何表征和处理信息的直觉的绝佳资源。例如,Feature Visualization 和 Circuits 专题系列,对可解释性以及逆向解析神经网络中习得的计算过程作出了尤为清晰的介绍。

若想以可视化的方式了解大多数现代语言模型背后的架构,Jay Alammar 的 The Illustrated Transformer至今仍是解释注意力机制和 Transformer 模型最清晰的材料之一。

Hugging Face LLM Course 是下一步的好选择,适合希望更实际、动手地学习 Transformer、微调、数据集及更广泛开源 NLP 生态的读者。

Lilian Weng 的博客 是我最喜欢用来建立概念地图、再沿参考文献深入单篇论文的地方之一。就本文主题而言,我建议从 LLM Powered Autonomous Agents 和 Reward Hacking in Reinforcement Learning 开始。

我也推荐关注 Bingxiang He 的研究主页,特别是其关于 on-policy distillation(OPD) 的工作。 Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe 讨论蒸馏何时成功,以及师生模型兼容性如何影响结果。 Rethinking On-Policy Distillation of Large Language Models II: One Training Example 考察训练数据需求和学生模型 rollout 所访问的状态。

若想查阅更全面的 Legal AI 数据集、基准及相关资源,可参考以下 GitHub 仓库:

  • Awesome Legal Benchmarks:收录 Legal AI 基准、数据集、评估框架和指标的精选资源库。
  • Awesome Legal NLP:收录 Legal NLP 数据集、模型、论文、工具及会议/研讨会资源的精选资源库。