近年来,伴随大语言模型的迅猛发展,法律判决预测( Legal Judgment Prediction, LJP )已逐步演化为法律人工智能领域的核心研究方向之一。然而,现有主流方法在本质上仍高度依赖数据驱动的模式匹配机制:尽管其在标准化测试基准上展现出较高的预测精度,但一旦进入真实司法语境,尤其是在法律条文动态调整或涉及复杂推理链条的情形下,模型性能往往显著波动。围绕"模型是否真正具备法律推理能力"这一关键科学问题,语言智能处理实验室冯奕老师带领团队开展了系统性探索,相关代表性成果分别被 NeurIPS 2025、AAAI 2026、ACL 2026 等国际顶级会议和 ACM TKDD 期刊录用。
一、当法律发生变化,模型还能"看懂"吗?—— NeurIPS 2025
现实中的法律并不是静止的——法条会修改、解释会演进、司法实践会变化。但我们的模型,是否真的具备这种"适应变化"的能力?首先,针对"法律变化下模型是否具备稳健理解能力"这一问题,团队从"法条迁移"的新视角出发,系统研究法律规则变动对模型行为的影响,并构建了相应评测基准。研究发现,即便是在传统测试集上表现优异的模型,在面对法律条文发生修改或解释演进的场景时,其性能会出现显著退化。这一现象表明,当前LJP模型更倾向于拟合既有数据分布,而非真正掌握法律规则及其内在逻辑。
二、不仅要预测,更要"推理"—— AAAI 2026,ACM TKDD
既然问题在于"不会推理",那么下一步就是:能否让模型像法官一样,一步一步推导出结论?在此基础上,研究进一步推进至"如何使模型具备类司法推理能力"。团队提出面向法律任务的"System 2式推理"框架,通过显式建模推理过程,引导模型基于案件事实、证据材料与适用法条进行逐步推导,从而得到判决结论。该方法不仅显著提升了模型在复杂案件中的多步推理能力,也增强了推理过程的可解释性,使模型由"黑盒式预测"向"可验证推理"范式转变。
三、我们到底在做什么?方向是否正确?——ACL 2026
当方法不断演进,一个更宏观的问题浮现:LJP这个领域,本身是否走在正确的轨道上?团队从更宏观的视角对LJP领域进行了系统反思。研究指出,当前研究范式存在三方面关键局限:其一,过度依赖静态数据分布,忽视真实司法环境中的动态性与复杂性;其二,偏重结果预测,缺乏对推理过程的建模;其三,评测指标设计与司法实践需求之间存在脱节。基于此,研究明确提出未来LJP应从"结果导向"转向"推理导向",重点强化模型的泛化能力、可解释性以及与法律规范的一致性。
上述系列工作从评测基准构建、方法论创新到领域范式反思三个层面,形成了一条清晰且递进的研究路径:由能力评测出发,过渡至推理机制建模,最终上升至研究范式重构,推动法律人工智能从"能够预测"迈向"能够推理、具备可验证性与可信性"的新阶段。
四、招生信息:一起做"会推理"的AI
围绕上述研究方向,语言智能处理实验室长期招收对自然语言处理、法律人工智能、大模型推理、智能软工感兴趣的硕士和博士生。实验室鼓励与产业界保持紧密合作,参与顶级学术会议投稿。如果你的兴趣不仅在于模型训练本身,而在于探究模型如何进行推理与决策,这里将提供良好的研究环境与发展空间。
欢迎具有计算机、软件工程、人工智能等相关背景的同学加入!
联系方式: fy@nju.edu.cn( 冯奕老师 )。