All 289

一分钟读论文:《去中心化Agent信任层——ERC-8004的实证诊断》

帝国理工学院的研究团队在 arXiv 上发表了一篇论文《Can Trustless Agents Be Trusted? An Empirical Study of the ERC-8004 Decentralized AI Agent Ecosystem》,对当前最主流的去中心化AI Agent信任基础设施ERC-8004进行了系统性实证评估。核心发现令人不安:在以太坊、BSC和Base三条链上,有效注册文件比例仅为3%至15%,Sybil攻击者占评审者的60%至91%,去除Sybil标记的反馈后,高达15.5%至89.4%的Agent没有任何有效反馈。这篇文章将解析ERC-8004架构的设计逻辑、实证数据揭示的信任失效机制,以及这些发现对AI Agent基础设施设计的深远影响。

In AI, ParadigmRadar, 1 min read

一分钟读论文:《让 Agent 看见代码仓库——多模态表示如何重塑编码代理》

如果你正在构建一个基于 LLM 的代码修复 Agent,你可能已经注意到一个反直觉的现象:给模型”看”代码仓库的结构图,反而让它变得更笨了。这不是你的错觉——慕尼黑工业大学和达姆施塔特大学的研究团队在 SWE-bench Verified 上做了系统实验,发现纯视觉模式让所有模型的修复准确率显著下降,GPT-5-mini 从 55.0% 跌至 41.4%,Doubao 更是暴跌至 16.9%。但混合文本加视觉的模式却实现了双赢:Token 成本降低最高达 26%,同时修复准确率持平或微升。这篇文章将解析 SeeRepo 的核心发现,并带你理解多模态表示在编码 Agent 中的正确打开方式。

In AI, ParadigmRadar, 3 mins read

一分钟读论文:《Agent规划脆弱性——检索受限下大规模工具生态中的长期规划基准测试》

如果你正在构建一个需要调用多个工具的 AI Agent,你可能已经经历过这样的场景:Agent 在前几步调用一切顺利,但某个工具突然返回了意外结果,之后整个任务链就开始失控——要么反复尝试同一个无效路径,要么干脆放弃。伊利诺伊大学厄巴纳-香槟分校的研究团队在最新论文中首次系统量化了这个问题的严重程度:在最先进的模型上,一旦关键工具链路被阻断,规划准确率会从 51.90% 暴跌至 11.36%,降幅超过 40 个百分点。读完这篇文章,你将理解为什么”能调用工具”和”能在混乱中完成规划”是两回事,以及你的 Agent 工程实践需要做出哪些调整。

In AI, ParadigmRadar, 2 mins read

一分钟读论文:《HarnessFix——从失败轨迹到可靠 Agent 的自动修复》

如果你正在构建 LLM Agent,你可能已经发现一个令人沮丧的事实:大多数 Agent 失败不是模型不够聪明,而是执行环境(Harness)本身有缺陷。 传统方法只告诉你”哪里失败了”,但从不告诉你”怎么修好它”。arXiv:2606.06324 提出的 HarnessFix 首次实现了从失败轨迹到自动修复的完整闭环——它将碎片化的执行证据编译为标准中间表示,精确归因到具体步骤和基础设施层,并生成可直接应用的修复操作符。本文将带你理解 HTIR 的核心设计,以及它如何改变 Agent 可靠性的工程范式。

In AI, ParadigmRadar, 2 mins read

一分钟读论文:《AgentCIBench:Computer-Use Agent的跨上下文隐私泄露》

德国达姆施塔特大学UKP实验室和ATHENE网络安全研究中心合作的一篇论文《Capable but Careless: Do Computer-Use Agents Follow Contextual Integrity?》,首次将Contextual Integrity理论引入AI Agent评估领域,发现Computer-Use Agent在执行跨应用任务时存在严重的上下文泄露问题:高能力代理反而是最严重的隐私泄露者。在15个前沿代理中,80%在超过一半的测试场景中出现信息泄露,平均泄露率达到67.9%。

In AI, Security, 1 min read

一分钟读论文:《通过智能体轨迹解剖模型行为》

堪萨斯大学的一篇论文《Dissecting model behavior through agent trajectories》,首次将意图-执行差距(intent-execution gap)形式化为可测量的系统偏差。通过分析138k条智能体轨迹、覆盖Claude、Gemini、GPT、Grok、Qwen五大模型家族,论文证明:AI Agent性能不仅是建模问题,更是系统问题——模型假设与harness行为之间的差距会阻止模型能力的充分转化。

In AI, Agent, 1 min read

一分钟读论文:《选择性验证还是延长预算?推理时Token分配的新范式》

如果你正在构建需要深度推理的 AI 系统,你可能已经发现一个令人困惑的现象:给模型更多的 Token 预算并不总是带来更好的结果。Virginia Tech 的研究者 Sajib Acharjee Dip、Dawei Zhou 和 Liqing Zhang 在最近发表的论文《Think Again or Think Longer? Selective Verification for Budget-Aware Reasoning》中揭示了一个反直觉的结论——始终验证初始答案不仅浪费 Token,甚至可能降低准确率。他们提出的 SEVRA(Selective Verification with Re-verification and Adaptation)框架在 MATH500 上达到了 76.3% 的准确率,比”始终验证”策略高出 0.8 个百分点,同时将有害翻转率从 2.2% 降至 1.0%。这篇文章将带你理解 SEVRA 的核心原理、五种服务决策路径,以及如何在你的推理管线中集成它。

In AI, ParadigmRadar, 3 mins read

一分钟读论文:《当工具失败时:LLM智能体的动态重规划与异常恢复基准测试》

腾讯优图实验室、中山大学与清华大学合作的一篇论文《When Tools Fail: Benchmarking Dynamic Replanning and Anomaly Recovery in LLM Agents》,首次系统性地评估了LLM智能体在工具失败场景下的动态重规划能力。现有基准测试几乎全部在理想化的”快乐路径”上评估工具集成推理,忽视了真实世界中的工具失败场景。论文发现动态重规划是独立于模型缩放和提示工程的独特瓶颈:容错能力的增长仅为基本任务执行的1/3.66倍,隐式语义失败下扰动恢复率暴跌约37%。

In AI, Agent, 1 min read

一分钟读论文:《LedgerAgent:面向策略遵循的工具调用智能体的结构化状态管理》

亚利桑那州立大学与亚利桑那大学合作的一篇论文《LedgerAgent: Structured State for Policy-Adherent Tool-Calling Agents》,提出了一种推理时方法解决工具调用智能体中任务状态隐式编码在提示词中的根本问题。传统智能体的观察结果、工具返回和政策指令全部放在提示词中,导致两种常见故障:智能体检索到正确事实但后续基于过时信息做决策,或语法上有效的工具调用违反依赖当前状态的领域策略。论文通过类型化账本与政策门控器两个确定性组件实现零额外token开销的状态一致性保障。

In AI, Agent, 1 min read

一分钟读论文:《重新思考还是延长预算?面向推理预算的选择性验证》

弗吉尼亚理工大学的 Sajib Acharjee Dip、Dawei Zhou 和 Liqing Zhang 发表的论文《重新思考还是延长预算?面向推理预算的选择性验证》,揭示了推理时 Token 分配中的一个反直觉发现:始终验证初始答案不仅浪费计算资源,在某些场景下还会降低准确率。他们提出的 SEVRA(Selective Verification for Reasoning Allocation)框架将验证决策从固定策略升级为服务层控制器,在 MathFive 基准上达到 76.3% 的准确率,同时将有害翻转率从 2.2% 降至 1.0%,并减少 26.8% 的后生成 Token。

In AI, Agent, 1 min read

Featured