AI 范式雷达:《Agentic RAG:让检索系统学会自我反思》

Aug 01, 2026 · 3 mins read

如果你正在构建一个需要回答复杂问题的 AI 应用,你可能已经发现传统 RAG 的天花板:当用户问”某公司的 CEO 在哪个大学获得了什么学位?”时,一次向量检索往往只能命中其中一个事实片段,答案要么不完整,要么干脆产生幻觉。最新的研究表明,Agentic RAG 能将这类多跳问题的幻觉率降低 30% 到 50%,代价是延迟增加约 2 到 4 倍、Token 消耗增加约 1.5 到 3 倍。这篇文章将带你理解 Agentic RAG 的核心原理,分析五篇关键论文,并给出一条从传统 RAG 迁移的实操路径。

一分钟读论文:《Scratch Copilot:用 AI 支持青少年创意编程》

Google DeepMind 研究科学家和华盛顿大学教授合作的一篇论文《Scratch Copilot: Supporting Youth Creative Coding with AI》,首次提出了专门为儿童设计的 AI 编程助手——Scratch Copilot,这是一个集成在类 Scratch 环境中的 AI 助手,为青少年提供创意编程支持。

Read More

一分钟读论文:《被掏空的一天:软件工程师的日常》

作为团队的 Leader,如何通过改进流程和⼯具,并最终提⾼团队⽣产⼒呢?可以参考微软研究院和英国伦敦大学、瑞士苏黎世大学信息学系合著的论文《Today was a Good Day: The Daily Life of Software Developers》。该论文分析了微软工程师的5,971份问卷结果,发现工程师「良好」和「典型」的工作日是怎么样,并总结了使良好的工作日成为典型的建议:

Read More

All

AI 范式雷达:《Agentic RAG:让检索系统学会自我反思》

如果你正在构建一个需要回答复杂问题的 AI 应用,你可能已经发现传统 RAG 的天花板:当用户问”某公司的 CEO 在哪个大学获得了什么学位?”时,一次向量检索往往只能命中其中一个事实片段,答案要么不完整,要么干脆产生幻觉。最新的研究表明,Agentic RAG 能将这类多跳问题的幻觉率降低 30% 到 50%,代价是延迟增加约 2 到 4 倍、Token 消耗增加约 1.5 到 3 倍。这篇文章将带你理解 Agentic RAG 的核心原理,分析五篇关键论文,并给出一条从传统 RAG 迁移的实操路径。

In AI, ParadigmRadar, 3 mins read

一分钟读论文:《可扩展 LLM 驱动多智能体系统的设计原则》

德国埃尔朗根-纽伦堡大学等机构的研究团队发表的论文《Scaling LLM-Driven Multi-Agent Systems: Design Principles and Architectural Scalability Analysis》系统性地提出了可扩展多智能体系统的四大设计原则,并通过四种复杂度递增配置的实证评估验证了这些原则的有效性。研究发现缩放带来约线性的成本增长和可测量的准确率提升,但仅当底层 LLM 超过最小能力阈值时有效——性能在中间复杂度处达到峰值,之后因超时和评估限制而退化。

In AI, Engineering, 1 min read

一分钟读论文:《重新思考本地计算机使用 Agent 的推理时扩展》

韩国研究团队发表的论文《Rethinking Inference-Time Scaling in Local Computer-Use Agents: Failure Modes and Compute Tradeoffs》系统性地研究了推理时扩展在本地计算机使用 Agent 中的有效性,发现额外计算往往产生递减回报并改变失败模式而非提高成功率。在对四个开源模型和 OSWorld 基准的评估中,上下文扩展改善轨迹稳定性但收益随 token 成本饱和,时间扩展减少停滞却不显著提高任务成功率——更长的视界往往延长错误轨迹而非纠正它们。

In AI, Engineering, 1 min read

一分钟读论文:《ORCA-bench:语言模型 Agent 准备好应对 On-Call 了吗?》

研究团队发表的论文《ORCA-bench: How Ready Are Language Model Agents for Oncall?》提出了一个生产保真度的根因分析基准测试,将通用编码 Agent 置于真实的生产环境中进行评估。在包含 1,079 个任务的测试中,最佳语言模型 Agent 在中等难度任务上的 RCA 准确率仅为 25.3%,在困难任务上仅 10.0%——即使使用 Claude Fable 5 模型也无法弥合这一差距。

In AI, Engineering, 1 min read

一分钟读论文:《MANTA:面向自演化多智能体系统的网络拓扑自适应》

哥伦比亚大学和中央研究院联合团队发表的论文《MANTA: Multi-Agent Network Topology Adaptation for Self-Evolving Multi-Agent Systems》提出了一种推理时拓扑自适应框架,使多Agent系统的通信结构能够在执行过程中动态演化。该框架在五个基准测试上平均得分74.0,比最强基线高出5.8个百分点,其中PlanCraft任务取得最佳结果。

In AI, ML, 1 min read

一分钟读论文:《Frontis-MA1:面向递归自改进的AI4AI模型》

Horizon Research、Frontis.AI 和清华大学联合团队发表的论文《Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering》提出了首个面向递归自改进(RSI)的全栈开源系统 OpenMLE。该系统将机器学习工程任务分解为四个原子演化算子,通过 SFT+RL 训练出一个 35B 参数的元进化代理 Frontis-MA1,在 MLE-Bench Lite 上将 Medal Average 从基座模型的 39.39% 提升至 60.61%,配合进化搜索框架 OpenMLE-Evo-Max 进一步达到 71.21%,超越了 GPT-5.5 + Codex 组合。

In AI, ML, 1 min read

一分钟读论文:《通过合作-义务耦合审计涌现的LLM-Agent协作》

华盛顿大学等机构的研究团队发表的论文《Auditing Emergent LLM-Agent Collaboration through Cooperation-Obligation Coupling》提出了iCORE(Integrated Cooperation-Obligation REpresentation)框架,通过统一编码合作图、义务图和审计映射来解决多智能体协作的可审计性缺口。在真实LLM执行中,iCORE-Audit相比被动全状态观测实现了26.4%的轨迹质量提升和显著的终端性能改进。

In AI, Security, 1 min read

一分钟读论文:《AgentRadio:面向长程多智能体协作的被动感知》

佐治亚理工学院等机构的研究团队发表的论文《AgentRadio: Passive Awareness for Long-Horizon Multi-Agent Collaboration》提出了一种异步消息传递层,使编码 Agent 能在后台监听队友的消息而不中断前台工作。在 SWE-Atlas QnA 基准测试上,四个由 AgentRadio 组织的 Claude Code Agent 解决了 62.1% 的任务,比单 Agent 高出 29.8 个百分点,甚至超越了使用更新模型 Opus 4.8 的单 Agent(57.2%)。

In AI, Engineering, 1 min read

一分钟读论文:《多轮长程规划的训练物理》

中国科学院自动化研究所复杂系统认知与决策智能重点实验室的论文《The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation》首次从预训练到后训练再到多教师整合的全生命周期,系统研究了基础模型智能体多轮长程规划能力的获取与塑造机制。研究构建了首个可控的多轮长程规划实验平台(Controllable Planning Gym),揭示了世界模型内部化、RL 后训练适用边界和多教师蒸馏兼容性的核心规律。

In AI, Agent, 1 min read

一分钟读论文:《Agentic Real2Sim:用视觉语言代理实现物理世界建模》

UCLA、MIT 和 UCSD 联合团队发表的论文《Agentic Real2Sim: Physics-based World Modeling with Vision-Language Agents》提出了一种全新的真实世界到仿真环境的自动化转换框架。该研究利用视觉语言代理(VLM Agent)将真实世界的物体-机器人交互记录自动转换为可仿真的”episodic twin”,保留了观测数据、几何结构、机器人交互信息和物体状态,为下游机器人策略学习提供了低成本的高质量仿真环境。

In AI, Robotics, 1 min read

Featured