ai, agenticsystems,

一分钟读论文:《追踪错误生命周期以识别长程Agent轨迹中的关键失败》

Unbug By Unbug Follow Aug 08, 2026 · 1 min read
一分钟读论文:《追踪错误生命周期以识别长程Agent轨迹中的关键失败》
Share this

清华大学和腾讯混元合作的一篇论文《TRAJDEBUG: Tracing Error Lifecycle to Identify Critical Failures in Long-Horizon Agent Trajectories》,提出了一种从被动调试到主动错误生命周期追踪的范式转移方法。该方法将关键错误检测分解为多粒度历史压缩、错误触发检测和因果归因三阶段流程,在诊断驱动的Agent改进中实现成功率提升10.80%,失败记忆迁移提升5.70%:

长程轨迹中的关键错误检测难题

基于大语言模型的智能体系统在软件工程、科学发现和多轮客服等复杂领域中展现出强大能力,但其执行轨迹往往长达数百步推理、行动和观察。当最终任务失败时,定位导致失败的最早关键错误步骤是一个长期存在的挑战。

现有方法面临两大困难:一是长轨迹中个体错误的识别需要追溯到遥远的任务指令和环境反馈;二是失败轨迹中通常存在多个局部错误,有些被后续修复了,有些无害,只有部分真正导致了最终失败。关键错误不一定是第一个出现的局部错误

三阶段框架设计

TrajDebug将关键错误检测分解为三个递进阶段:

多粒度历史压缩。为每个轨迹步骤构建三种视图——高细节视图保留原始指令和行动用于证据验证,中细节视图总结主要意图和状态更新,低细节视图仅记录粗略进度。按需检索最细粒度视图,在压缩远距离上下文的同时保留可验证证据。

错误触发检测与状态分类。为每个步骤提取原子级错误触发器,要求每个触发器必须满足逐字证据条件——错误承诺和被违反的参考都必须可明确引用,防止主观漂移和幻觉诊断。将相关触发器分组为错误实例后判断是否已解决以及是否有终端印记,产生四种错误状态:Clean Resolution(已解决无印记)、Costly Resolution(已解决有预算债务)、Manifest Active(活跃有不可逆印记)和Latent Active(活跃无印记)。

候选集引导的因果归因。从保留的终端相关实例中,使用大语言模型作为最终归因头选择最能解释终端失败的关键错误步骤。简单”最早候选”规则不足——需要判断预算债务实例与语义实例之间的因果关系权重。

实验结果与应用价值

论文构建了TrajErrBench基准测试,包含486条手动标注的失败轨迹:400条来自工具使用场景(平均29.3步),86条来自编码场景(平均119.7步)。三名标注员独立标注,多数投票作为标准答案。

关键发现包括:长轨迹中检测准确率随长度增加而下降;失败轨迹平均包含7.62个局部错误但只有1个关键错误;61.9%的局部错误被后续修复,31.4%持续到最后。TrajDebug在现有Agent基准和TrajErrBench上优于先进的提示基线和诊断系统。

在应用层面,对失败轨迹进行诊断并转换为针对性引导后重新执行同一任务,平均成功率提升10.80%;将历史失败的诊断聚合为可复用的失败记忆并转移到未见过的任务,平均提升5.70%

References


Related
Featured