All 271

一分钟读论文:《SkillCoach——自进化评分如何评估和增强智能体技能使用》

香港科技大学(广州)和京东集团合作的一篇论文《SkillCoach: Self-Evolving Rubrics for Evaluating and Enhancing Agentic Skill-Use》首次提出自进化评分框架来评估和增强智能体的技能使用能力。核心突破在于将”技能使用”定义为轨迹级元能力而非任务成功与否:从真实交互轨迹中自动推导并持续改进过程评分标准,而非依赖人工标注的固定体系。实验揭示了一个关键发现——Gemini 3.1 Pro在干扰项存在时选择分数从98.0骤降至78.0,表明大模型”找到正确技能后执行尚可,但选择本身在干扰下极其脆弱”。

In ai, agent, 1 min read

一分钟读论文:《Agent安全与评估的范式转移——从持续学习对齐退化到四轴决策框架》

加州大学伯克利分校和斯坦福大学合作的一篇论文《Narrow Fine-Tuning Erodes Safety Alignment in Vision-Language Agents》,以及另一篇来自清华大学的研究《Four-Axis Decision Alignment for Long-Horizon Enterprise AI Agents》,共同揭示了一个正在被行业忽视的危机:当AI Agent通过持续学习不断扩展能力时,其安全对齐正在系统性退化。WildClawBench基准测试数据显示,多模态Agent的误对齐率高达70.71%,远超文本模型的41.19%。与此同时,企业级Agent评估领域存在两个真正的空白维度——CRR(合规风险比率)和CAR(因果归因率)。这两篇论文共同指向一个核心论断:对齐即能力——AI Agent的评估范式正从”能否完成任务”转向”是否以正确标准完成任务”。

In ai, paradigm-radar, agent, 1 min read

一分钟读论文:《Agent 编排框架与 MCP 协议生态 2026》

如果你正在构建企业级 AI 智能体,你可能已经发现一个痛点:工具调用的上下文管理太碎片化了,而不同框架之间的互操作性几乎为零。2026 年的 AI Agent 开发正经历从”单模型推理”到”多智能体协作+标准化协议连接”的范式转移。MCP(Model Context Protocol)与各类编排框架的组合,正在重塑我们构建 AI 应用的方式。本文将带你解析 MCP 协议的生态现状、主流编排框架的选型指南,以及如何在生产环境中落地。

In AI, ParadigmRadar, Agent, 2 mins read

一分钟读论文:《Where Do CoT Training Gains Land in LLM based Agents?》

一篇关于CoT训练增益本质的论文《Where Do CoT Training Gains Land in LLM based Agents?》,通过系统性实验揭示了思维链(Chain of Thought, CoT)训练在大语言模型智能体中的实际作用机制。研究发现,CoT训练并未如预期那样扩大CoT推理的优势,而是帮助提高了prompt action的质量。

In AI, Research, 1 min read

一分钟读论文:《多模型组合的共失败天花板》

一篇关于多模型组合性能极限的论文《Co-Failure Ceiling: Hard Limits on Multi-Model Ensembles》,通过跨67个模型、21家提供商的大规模实测发现,多模型组合存在硬性的共失败率天花板beta(co-failure rate)。研究指出,传统的错误相关性指标rho无法准确反映模型间的真实依赖关系,而共失败率beta揭示了多模型集成性能的硬性上限。

In AI, Research, 1 min read

一分钟读论文:《Agentic RAG——动态知识检索增强》

静态检索向动态推理的演进

In AI, Agent, 1 min read

一分钟读论文:《Agent 编排的范式转移:从 ReAct 到 PI 架构》

如果你正在构建 AI 智能体,你可能已经发现一个痛点:传统的 ReAct(Reasoning + Acting)循环在处理多工具、长链路任务时,经常陷入无限循环或丢失全局目标。上周 Anthropic 发布的内部基准测试显示,在 Agent 编排任务上,基于 PI(Plan-Interact/Execute)架构的智能体比传统 ReAct 方案性能提升了 47%。这篇文章将解析 PI 的核心原理,并带你动手实现一个高可靠的多工具智能体。

In AI, ParadigmRadar, Agent, 3 mins read

一分钟读论文:《基于 PI 的智能体编排实战》

上周行业内部基准测试显示:在复杂多步 Agent 任务中,基于 PI(Plan-Execute)架构的智能体比传统 ReAct 方案成功率提升了 40%-60%,同时显著减少了无效循环和上下文爆炸。如果你正在构建 AI 智能体,面对多工具调用、长链条任务时感到上下文管理和错误控制的痛点,那么 PI 架构正是为你准备的解决方案。本文将带你从零理解 PI 核心原理,到动手实现一个具备自适应编排能力的智能体。

In AI, ParadigmRadar, 4 mins read

一分钟读论文:《MCP 协议与 PI 架构融合:构建自适应智能体》

如果你的团队正在构建 AI 智能体,你可能已经发现两个并行的痛点:工具调用的上下文管理太碎片化,而传统的 ReAct 循环在复杂任务中容易陷入无效试错。2026 年,AI Agent 编排正经历一次深刻的范式转移——MCP(Model Context Protocol)与 PI(Plan-Execute)架构的融合,正在为自适应智能体提供全新的基础设施。本文将带你解析这一融合范式的核心原理,并提供可实操的落地路径。

In AI, ParadigmRadar, 2 mins read

Featured