◄ 所有文章
AI 评估

我们如何为法律分析找到最佳 AI 模型

NW Nils Weiser January 7, 2025

一套三层评估方法:LLM-as-a-Judge、Crew-as-a-Judge,以及人工验证。三者并行,而非串行。

挑战:让质量变得可度量

哪个 AI 模型能给出最好的法律分析?在 Erst Recht,这是我们面对的第一个问题。凭直觉和听营销话术是不够的。我们需要一套系统化、数据驱动的方法。

结果就是:一套三层评估,让 AI 打分与人类专业判断协同工作。在这篇文章里,我来讲讲我们是怎么做的。

问题:你怎么度量一份法律分析“好不好”?

做数学题时,有明确的标准答案:40+2=42,搞定。(而且不,我们这里说的不是 JavaScript,那里 '1' + '1' = '11'。)而在法律分析里,这种明确性并不存在。要求是多方面的:

人工逐一评估每个测试用例既耗时又主观。我们需要一种既可扩展又可靠的方法。

我们的做法:三位并行的评判者

重点:这三层评估是并行运行的,而不是串行。每位评判者独立评估同一批输出,最后再把结果汇总。

测试用例 • 租客保护 • Scrum Master • 解雇 • ... → 送往所有模型 模型 Model A Model B Model C Model D 生成 输出 Output A Output B Output C Output D LLM-as-a-Judge 自动化 一个强模型 评估所有输出 Crew-as-a-Judge 多视角 多个 agent 共同评审 Human-as-a-Judge 专家评审 律师验证 抽样样本 获胜者 Model A, C Model B Model A, D 逐个用例 总体 Model A 总体 并行评估

1. LLM-as-a-Judge

思路是:让一个强大的语言模型,按照明确定义的标准去评估所有其他模型的输出。自动化,且可扩展。

我们从四个专门的维度来评估每一份分析:

法律准确性

  • 引用的法律条文正确吗?
  • 考虑了最新的判例吗?
  • 有没有得出错误的法律后果?

外行可理解度

  • 1 = 看不懂,满是法律术语
  • 3 = 大体能理解
  • 5 = 完全能看懂

完整性

  • 识别出所有相关法律领域了吗?
  • 提到期限了吗?
  • 说明了风险和反驳论点吗?

可操作的建议

  • 给出了具体、可执行的步骤吗?
  • 优先级清晰吗?
  • 指出了什么时候需要找律师吗?

2. Crew-as-a-Judge

单一评判者会有盲区。解决办法是:让多个专门化的 AI agent 从不同视角来评估。

法律审查员

合规性与专业准确性

外行可读性测试员

以非法律人士的视角

完整性检查员

找出遗漏的方面和缺口

可行性评估员

评估建议的可落地性

关键在于:这些 agent 会互相“讨论”,并汇聚成一个总体判断。这样得到的结果比任何单一评估都更稳健。

3. Human-as-a-Judge(人工验证)

AI 评估并不能取代人类的专业判断,但它也不需要审查每一个案例。相反,一个由律师和法律科技专家组成的专家小组,只验证结果中的一个抽样样本

目标是:确保自动化评估是可靠的。人工抽样起的是完整性检查(sanity check)的作用,而不是完整地重新评估一遍。

结果汇总

三位评判者都会对每个模型每个案例进行评估。结果被合并成:

评判者之间达成共识,会提升我们对结果的信心。当判断出现分歧时,我们就更深入地分析那个案例。

测试流程详解

系统化的评估需要系统化的测试:

  1. 创建测试用例:覆盖所有法律领域的案例(劳动法、租赁法、家庭法等)
  2. 相同条件:对每个模型使用完全相同的提示词
  3. 多次运行:逐场景检查一致性
  4. 并行评估:两位评判者同时评估

(简化示例!)

示例测试用例:劳动法中的解雇

“我在一家有 50 名员工的公司工作了 8 年。昨天我收到一份解雇通知,通知期为 4 周,于月底生效。这合法吗?我能做什么?”
一份正确的分析必须识别出:
  • 通知期过短(《德国民法典》第 622 条第 2 款:工作满 8 年应为 3 个月)
  • 适用解雇保护(员工数 >10)
  • 提起不当解雇之诉的 3 周期限至关重要

评判者评估:所有要点都识别到了吗?表述清晰吗?有具体的行动步骤吗?

结果与洞见

“AI 评判者以多数意见把 Model A 评为获胜者。人工抽样也证实了这一结果。这对我们自动化评估的可靠性来说,是一个强有力的信号。”

这次评估给出了清晰的结论:LLM-as-a-Judge 和 Crew-as-a-Judge 都一致地把同一个模型评为获胜者。通过抽样进行的人工验证也得出了相同的结论。

这次评估的关键洞见:

我们学到了什么

迭代就是一切

最初的评估标准太模糊了。“这份分析好不好?”这样问是行不通的。每一次迭代都让评估变得更精确。

AI 评估省时间,但取代不了人

LLM-as-a-Judge:能高效评估数百个测试用例。而最终决策和边界案例:人类的专业判断仍然不可或缺。

评估不是一次性的项目

新的模型版本会不断发布。持续的重新评估才能长期保证最好的质量。


Erst Recht 用 AI 让法律咨询变得触手可及。我们 AI 分析的质量,欢迎你亲自来体验。

立即获取你的初步评估(9.99 欧元起)

在筹划你自己的 LLM 评估项目吗?联系我。我很乐意在方案设计和落地实施上帮上忙。

NW
Nils WeiserAI Agent 专家 · 博登湖地区
与我合作 ▸

更多现场笔记

所有文章 ▸