一套三层评估方法:LLM-as-a-Judge、Crew-as-a-Judge,以及人工验证。三者并行,而非串行。
挑战:让质量变得可度量
哪个 AI 模型能给出最好的法律分析?在 Erst Recht,这是我们面对的第一个问题。凭直觉和听营销话术是不够的。我们需要一套系统化、数据驱动的方法。
结果就是:一套三层评估,让 AI 打分与人类专业判断协同工作。在这篇文章里,我来讲讲我们是怎么做的。
问题:你怎么度量一份法律分析“好不好”?
做数学题时,有明确的标准答案:40+2=42,搞定。(而且不,我们这里说的不是 JavaScript,那里 '1' + '1' = '11'。)而在法律分析里,这种明确性并不存在。要求是多方面的:
- 事实正确:引用正确的法律、最新的判例
- 完整:覆盖所有相关方面,不漏掉任何期限
- 易懂:没有法学学位也能看明白
- 可操作:给出具体的下一步
人工逐一评估每个测试用例既耗时又主观。我们需要一种既可扩展又可靠的方法。
我们的做法:三位并行的评判者
重点:这三层评估是并行运行的,而不是串行。每位评判者独立评估同一批输出,最后再把结果汇总。
1. LLM-as-a-Judge
思路是:让一个强大的语言模型,按照明确定义的标准去评估所有其他模型的输出。自动化,且可扩展。
我们从四个专门的维度来评估每一份分析:
法律准确性
- 引用的法律条文正确吗?
- 考虑了最新的判例吗?
- 有没有得出错误的法律后果?
外行可理解度
- 1 = 看不懂,满是法律术语
- 3 = 大体能理解
- 5 = 完全能看懂
完整性
- 识别出所有相关法律领域了吗?
- 提到期限了吗?
- 说明了风险和反驳论点吗?
可操作的建议
- 给出了具体、可执行的步骤吗?
- 优先级清晰吗?
- 指出了什么时候需要找律师吗?
2. Crew-as-a-Judge
单一评判者会有盲区。解决办法是:让多个专门化的 AI agent 从不同视角来评估。
法律审查员
合规性与专业准确性
外行可读性测试员
以非法律人士的视角
完整性检查员
找出遗漏的方面和缺口
可行性评估员
评估建议的可落地性
关键在于:这些 agent 会互相“讨论”,并汇聚成一个总体判断。这样得到的结果比任何单一评估都更稳健。
3. Human-as-a-Judge(人工验证)
AI 评估并不能取代人类的专业判断,但它也不需要审查每一个案例。相反,一个由律师和法律科技专家组成的专家小组,只验证结果中的一个抽样样本:
- 盲测:专家不知道哪个输出出自哪个模型
- 边界案例:有针对性地测试临界场景
- 校准:人类的判断和 AI 评估一致吗?
目标是:确保自动化评估是可靠的。人工抽样起的是完整性检查(sanity check)的作用,而不是完整地重新评估一遍。
结果汇总
三位评判者都会对每个模型的每个案例进行评估。结果被合并成:
- 各案例的获胜模型:在这个具体案例上,哪个模型表现最好?
- 总体获胜模型:跨所有案例的整体赢家
评判者之间达成共识,会提升我们对结果的信心。当判断出现分歧时,我们就更深入地分析那个案例。
测试流程详解
系统化的评估需要系统化的测试:
- 创建测试用例:覆盖所有法律领域的案例(劳动法、租赁法、家庭法等)
- 相同条件:对每个模型使用完全相同的提示词
- 多次运行:逐场景检查一致性
- 并行评估:两位评判者同时评估
(简化示例!)
示例测试用例:劳动法中的解雇
- 通知期过短(《德国民法典》第 622 条第 2 款:工作满 8 年应为 3 个月)
- 适用解雇保护(员工数 >10)
- 提起不当解雇之诉的 3 周期限至关重要
评判者评估:所有要点都识别到了吗?表述清晰吗?有具体的行动步骤吗?
结果与洞见
“AI 评判者以多数意见把 Model A 评为获胜者。人工抽样也证实了这一结果。这对我们自动化评估的可靠性来说,是一个强有力的信号。”
这次评估给出了清晰的结论:LLM-as-a-Judge 和 Crew-as-a-Judge 都一致地把同一个模型评为获胜者。通过抽样进行的人工验证也得出了相同的结论。
这次评估的关键洞见:
- 定制化的方法值回票价:我们专门化的方法胜过了通用方案(ChatGPT、Gemini)
- 存在取舍:有些方法更快,有些更精确。我们选择为质量而优化
- 一致性很重要:质量忽高忽低的方法被淘汰了
我们学到了什么
迭代就是一切
最初的评估标准太模糊了。“这份分析好不好?”这样问是行不通的。每一次迭代都让评估变得更精确。
AI 评估省时间,但取代不了人
LLM-as-a-Judge:能高效评估数百个测试用例。而最终决策和边界案例:人类的专业判断仍然不可或缺。
评估不是一次性的项目
新的模型版本会不断发布。持续的重新评估才能长期保证最好的质量。
Erst Recht 用 AI 让法律咨询变得触手可及。我们 AI 分析的质量,欢迎你亲自来体验。
在筹划你自己的 LLM 评估项目吗?联系我。我很乐意在方案设计和落地实施上帮上忙。