All 322

One Minute Read Paper Agentic Web Navigation Paradigm Shift

Agentic Web Navigation: From Passive Retrieval to Active Problem-Solving Paradigm Shift

In 7 mins read

一分钟读论文:《PAST-Bench:评估个人智能体递归自我改进的基础基准》

香港中文大学和阿里巴巴集团合作的一篇论文《PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents》,首次提出了针对个人 AI 智能体递归自我改进能力的系统性基准测试框架。该研究通过匹配的控制组设计隔离经验保留的因果效应,在 26 个任务族、204 个 episode 上评估了 7 个基础模型和 4 种 Agent 框架的跨会话能力演进表现:

In AI, AgentFoundationModels, 1 min read

One Minute Read Paper Magnet Detecting Cross Session Ai Misuse Through Capability Accumulation

One-Minute Read: Magnet — 通过能力累积检测跨会话 AI 滥用

In 1 min read

One Minute Read Paper Stair Reusing Past Repairs Through Hierarchical Trajectory Abstraction For Coding Agents

One-Minute Read: STAIR — 编码代理的分层轨迹抽象与经验复用

In 1 min read

AI 范式雷达:《Agent 推理时扩展:动态预算分配的范式转移》

如果你正在构建 AI 智能体,你可能已经发现一个越来越明显的瓶颈:无论你的 Agent 是处理简单的工具调用还是复杂的逻辑推理,它消耗的推理计算量几乎是一样的。ReAct 循环中的每一步”思考-行动-观察”都消耗大致相同的 token 数——简单查询和复杂决策没有区别。这种”一刀切”的推理模式正在被一种新的范式取代:根据任务难度动态分配推理时计算资源。本文将带你理解这一范式转移的核心原理、关键证据,以及如何在你的 Agent 架构中引入自适应预算分配机制。

In AI, ParadigmRadar, 7 mins read

One Minute Read Paper Test Time Compute For Agents Dynamic Budget Allocation

Test-Time Compute for Agents: Dynamic Budget Allocation — 从均匀分配到自适应推理的范式转移

In 1 min read

一分钟读论文:《Beacon:通过强化学习实现智能视觉推理》

多机构研究团队发表的论文《Beacon: Knowing When and How to Perform Agentic Visual Reasoning》提出了 Mode Adaptiveness(MA)和 Tool Effect(TE)双维度分析框架,通过 Necessity-Aware Adaptive Reward 强化学习训练机制,使多模态大语言模型学会在视觉推理任务中何时需要调用工具以及如何有效使用工具。实验表明,Beacon 在多个 agentic vision benchmark 上显著降低了工具滥用率,同时保持了推理准确性。

In AI, ComputerVision, 1 min read

AI 范式雷达:《Agentic RAG:让检索系统学会自我反思》

如果你正在构建一个需要回答复杂问题的 AI 应用,你可能已经发现传统 RAG 的天花板:当用户问”某公司的 CEO 在哪个大学获得了什么学位?”时,一次向量检索往往只能命中其中一个事实片段,答案要么不完整,要么干脆产生幻觉。最新的研究表明,Agentic RAG 能将这类多跳问题的幻觉率降低 30% 到 50%,代价是延迟增加约 2 到 4 倍、Token 消耗增加约 1.5 到 3 倍。这篇文章将带你理解 Agentic RAG 的核心原理,分析五篇关键论文,并给出一条从传统 RAG 迁移的实操路径。

In AI, ParadigmRadar, 3 mins read

一分钟读论文:《可扩展 LLM 驱动多智能体系统的设计原则》

德国埃尔朗根-纽伦堡大学等机构的研究团队发表的论文《Scaling LLM-Driven Multi-Agent Systems: Design Principles and Architectural Scalability Analysis》系统性地提出了可扩展多智能体系统的四大设计原则,并通过四种复杂度递增配置的实证评估验证了这些原则的有效性。研究发现缩放带来约线性的成本增长和可测量的准确率提升,但仅当底层 LLM 超过最小能力阈值时有效——性能在中间复杂度处达到峰值,之后因超时和评估限制而退化。

In AI, Engineering, 1 min read

一分钟读论文:《重新思考本地计算机使用 Agent 的推理时扩展》

韩国研究团队发表的论文《Rethinking Inference-Time Scaling in Local Computer-Use Agents: Failure Modes and Compute Tradeoffs》系统性地研究了推理时扩展在本地计算机使用 Agent 中的有效性,发现额外计算往往产生递减回报并改变失败模式而非提高成功率。在对四个开源模型和 OSWorld 基准的评估中,上下文扩展改善轨迹稳定性但收益随 token 成本饱和,时间扩展减少停滞却不显著提高任务成功率——更长的视界往往延长错误轨迹而非纠正它们。

In AI, Engineering, 1 min read

Featured