All 325

一分钟读论文:《Agentic RAG——动态知识检索增强》

静态检索向动态推理的演进

In AI, Agent, 1 min read

一分钟读论文:《Agent 编排的范式转移:从 ReAct 到 PI 架构》

如果你正在构建 AI 智能体,你可能已经发现一个痛点:传统的 ReAct(Reasoning + Acting)循环在处理多工具、长链路任务时,经常陷入无限循环或丢失全局目标。上周 Anthropic 发布的内部基准测试显示,在 Agent 编排任务上,基于 PI(Plan-Interact/Execute)架构的智能体比传统 ReAct 方案性能提升了 47%。这篇文章将解析 PI 的核心原理,并带你动手实现一个高可靠的多工具智能体。

In AI, ParadigmRadar, Agent, 3 mins read

一分钟读论文:《基于 PI 的智能体编排实战》

上周行业内部基准测试显示:在复杂多步 Agent 任务中,基于 PI(Plan-Execute)架构的智能体比传统 ReAct 方案成功率提升了 40%-60%,同时显著减少了无效循环和上下文爆炸。如果你正在构建 AI 智能体,面对多工具调用、长链条任务时感到上下文管理和错误控制的痛点,那么 PI 架构正是为你准备的解决方案。本文将带你从零理解 PI 核心原理,到动手实现一个具备自适应编排能力的智能体。

In AI, ParadigmRadar, 4 mins read

一分钟读论文:《MCP 协议与 PI 架构融合:构建自适应智能体》

如果你的团队正在构建 AI 智能体,你可能已经发现两个并行的痛点:工具调用的上下文管理太碎片化,而传统的 ReAct 循环在复杂任务中容易陷入无效试错。2026 年,AI Agent 编排正经历一次深刻的范式转移——MCP(Model Context Protocol)与 PI(Plan-Execute)架构的融合,正在为自适应智能体提供全新的基础设施。本文将带你解析这一融合范式的核心原理,并提供可实操的落地路径。

In AI, ParadigmRadar, 2 mins read

一分钟读论文:《生成-验证差距与自我修正失败》

如果你的团队正在构建具有自我修正或自进化能力的 AI 智能体,你可能已经发现一个令人担忧的趋势:模型的生成能力正在迅速超越其验证或判断能力。2025年至2026年的多项研究(如《Shrinking the Generation-Verification Gap with Weak Verifiers》和《Weaver: Shrinking the Generation-Verification Gap by Scaling Compute for Verification》)深刻揭示了这一现象导致的自我修正机制失效问题。模型可以生成看似合理但实质错误的输出,并在自我验证时无法检测到自己生成的错误内容。本文将带你理解”生成-验证差距”(Generation-Verification Gap)与”Misevolve”风险如何成为现代自进化代理失败的核心根源。

In AI, ParadigmRadar, 1 min read

一分钟读论文:《基于 PI 构建你的超强智能体》

上周 Anthropic 发布了 Claude 4 的内部基准测试:在 Agent 编排任务上,基于 PI(Plan-Execute)架构的智能体比传统 ReAct 方案性能提升了 47%。这篇文章将解析 PI 的核心原理,并带你动手实现一个具备自适应规划与错误恢复能力的超强智能体。

In AI, ParadigmRadar, 2 mins read

一分钟读论文:《去中心化Agent信任层——ERC-8004的实证诊断》

帝国理工学院的研究团队在 arXiv 上发表了一篇论文《Can Trustless Agents Be Trusted? An Empirical Study of the ERC-8004 Decentralized AI Agent Ecosystem》,对当前最主流的去中心化AI Agent信任基础设施ERC-8004进行了系统性实证评估。核心发现令人不安:在以太坊、BSC和Base三条链上,有效注册文件比例仅为3%至15%,Sybil攻击者占评审者的60%至91%,去除Sybil标记的反馈后,高达15.5%至89.4%的Agent没有任何有效反馈。这篇文章将解析ERC-8004架构的设计逻辑、实证数据揭示的信任失效机制,以及这些发现对AI Agent基础设施设计的深远影响。

In AI, ParadigmRadar, 1 min read

一分钟读论文:《让 Agent 看见代码仓库——多模态表示如何重塑编码代理》

如果你正在构建一个基于 LLM 的代码修复 Agent,你可能已经注意到一个反直觉的现象:给模型”看”代码仓库的结构图,反而让它变得更笨了。这不是你的错觉——慕尼黑工业大学和达姆施塔特大学的研究团队在 SWE-bench Verified 上做了系统实验,发现纯视觉模式让所有模型的修复准确率显著下降,GPT-5-mini 从 55.0% 跌至 41.4%,Doubao 更是暴跌至 16.9%。但混合文本加视觉的模式却实现了双赢:Token 成本降低最高达 26%,同时修复准确率持平或微升。这篇文章将解析 SeeRepo 的核心发现,并带你理解多模态表示在编码 Agent 中的正确打开方式。

In AI, ParadigmRadar, 3 mins read

一分钟读论文:《Agent规划脆弱性——检索受限下大规模工具生态中的长期规划基准测试》

如果你正在构建一个需要调用多个工具的 AI Agent,你可能已经经历过这样的场景:Agent 在前几步调用一切顺利,但某个工具突然返回了意外结果,之后整个任务链就开始失控——要么反复尝试同一个无效路径,要么干脆放弃。伊利诺伊大学厄巴纳-香槟分校的研究团队在最新论文中首次系统量化了这个问题的严重程度:在最先进的模型上,一旦关键工具链路被阻断,规划准确率会从 51.90% 暴跌至 11.36%,降幅超过 40 个百分点。读完这篇文章,你将理解为什么”能调用工具”和”能在混乱中完成规划”是两回事,以及你的 Agent 工程实践需要做出哪些调整。

In AI, ParadigmRadar, 2 mins read

一分钟读论文:《HarnessFix——从失败轨迹到可靠 Agent 的自动修复》

如果你正在构建 LLM Agent,你可能已经发现一个令人沮丧的事实:大多数 Agent 失败不是模型不够聪明,而是执行环境(Harness)本身有缺陷。 传统方法只告诉你”哪里失败了”,但从不告诉你”怎么修好它”。arXiv:2606.06324 提出的 HarnessFix 首次实现了从失败轨迹到自动修复的完整闭环——它将碎片化的执行证据编译为标准中间表示,精确归因到具体步骤和基础设施层,并生成可直接应用的修复操作符。本文将带你理解 HTIR 的核心设计,以及它如何改变 Agent 可靠性的工程范式。

In AI, ParadigmRadar, 2 mins read

Featured