LLM多智能体系统故障归因新研究:谁在何时出错?
宾州州立大学与杜克大学联合谷歌DeepMind等机构,首次提出并定义‘自动化故障归因’问题,构建首个基准数据集Who&When,涵盖127个多智能体系统失败案例及细粒度人工标注(谁出错、何时出错、为何出错),并评估三种归因方法。该成果被ICML 2025接收为Spotlight论文,代码与数据集已开源。
研究背景:多智能体系统失效诊断的‘大海捞针’困境
近年来,基于大语言模型(LLM)的多智能体系统因其协同解决复杂任务的能力广受关注。然而,这类系统常出现‘表面活跃却任务失败’的现象——大量交互发生,最终结果却偏离目标。开发者面临一个关键难题:究竟是哪个智能体、在哪个交互步骤中导致了失败?当前,排查依赖人工翻阅冗长的交互日志,如同‘大海捞针’:耗时、低效,且高度依赖开发者对系统架构与任务逻辑的深度理解。随着系统复杂度提升,智能体自主协作与信息传递链延长,故障定位愈发困难,严重制约系统迭代与可靠性优化。
核心突破:定义新问题、构建首套基准、验证初步方法
为应对这一挑战,宾州州立大学与杜克大学牵头,联合谷歌DeepMind、华盛顿大学、Meta、南洋理工大学及俄勒冈州立大学,首次正式提出‘自动化故障归因’(Automated Failure Attribution)这一研究问题——即自动识别导致任务失败的责任智能体(Who)与决定性错误步骤(When)。研究团队同步构建首个专用基准数据集‘Who&When’:涵盖127个LLM多智能体系统的失败轨迹,来源包括算法生成与专家手工构造,确保真实性和多样性;每个失败日志均配有三类细粒度人工标注:责任智能体身份、错误发生的精确交互步序、以及自然语言形式的失败原因解释(Why)。
方法探索:三种归因策略的实证评估
基于Who&When数据集,研究设计并评估了三类初步自动化归因方法:
- All-at-Once(一次性归因):将用户查询与完整失败日志一次性输入大模型,要求其直接输出责任智能体与错误步骤。该方法成本较低,但在长上下文场景下易遗漏精准定位。
- Step-by-Step(逐步归因):模拟人工调试流程,让大模型按时间顺序逐条审查交互记录,在每一步判断是否已出现决定性错误。精度更高,但推理开销大,且存在错误累积风险。
- Binary Search(二分搜索归因):借鉴软件调试中的经典思想,通过递归式地将日志切分为前后两半,引导大模型判断错误更可能位于哪一半,直至收敛至具体步骤。该方法在精度与效率间取得较好平衡,实验显示其综合表现最优。
开源与影响:推动多智能体系统可信赖演进
该研究已被国际顶级机器学习会议ICML 2025接收为Spotlight论文(接受率约3.5%)。全部代码、数据集与技术细节均已开源:论文见arXiv:2505.00212,代码库托管于GitHub,数据集发布于Hugging Face。研究不仅填补了多智能体系统故障诊断的方法论空白,也为构建可解释、可调试、可信赖的下一代AI智能体系统提供了关键基础设施支撑。
编者观点:对中国企业而言,该工作提示——在推进AI智能体商业化落地过程中,除关注功能实现外,亟需同步构建面向生产环境的智能体可观测性与诊断能力,将‘谁在何时出错’从运维难题转化为标准化工程模块。
本文为企业智脑(优秘智能)编译整理自公开资讯,信息与观点以原文为准,仅供参考。阅读原文(Synced) →