All 322
One Minute Read Paper Agentic Web Navigation Paradigm Shift
Agentic Web Navigation: From Passive Retrieval to Active Problem-Solving Paradigm Shift
In 7 mins read一分钟读论文:《PAST-Bench:评估个人智能体递归自我改进的基础基准》
香港中文大学和阿里巴巴集团合作的一篇论文《PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents》,首次提出了针对个人 AI 智能体递归自我改进能力的系统性基准测试框架。该研究通过匹配的控制组设计隔离经验保留的因果效应,在 26 个任务族、204 个 episode 上评估了 7 个基础模型和 4 种 Agent 框架的跨会话能力演进表现:
In AI, AgentFoundationModels, 1 min readOne Minute Read Paper Magnet Detecting Cross Session Ai Misuse Through Capability Accumulation
One-Minute Read: Magnet — 通过能力累积检测跨会话 AI 滥用
In 1 min readOne Minute Read Paper Stair Reusing Past Repairs Through Hierarchical Trajectory Abstraction For Coding Agents
One-Minute Read: STAIR — 编码代理的分层轨迹抽象与经验复用
In 1 min readAI 范式雷达:《Agent 推理时扩展:动态预算分配的范式转移》
如果你正在构建 AI 智能体,你可能已经发现一个越来越明显的瓶颈:无论你的 Agent 是处理简单的工具调用还是复杂的逻辑推理,它消耗的推理计算量几乎是一样的。ReAct 循环中的每一步”思考-行动-观察”都消耗大致相同的 token 数——简单查询和复杂决策没有区别。这种”一刀切”的推理模式正在被一种新的范式取代:根据任务难度动态分配推理时计算资源。本文将带你理解这一范式转移的核心原理、关键证据,以及如何在你的 Agent 架构中引入自适应预算分配机制。
In AI, ParadigmRadar, 7 mins readOne Minute Read Paper Test Time Compute For Agents Dynamic Budget Allocation
Test-Time Compute for Agents: Dynamic Budget Allocation — 从均匀分配到自适应推理的范式转移
In 1 min read一分钟读论文:《Beacon:通过强化学习实现智能视觉推理》
多机构研究团队发表的论文《Beacon: Knowing When and How to Perform Agentic Visual Reasoning》提出了 Mode Adaptiveness(MA)和 Tool Effect(TE)双维度分析框架,通过 Necessity-Aware Adaptive Reward 强化学习训练机制,使多模态大语言模型学会在视觉推理任务中何时需要调用工具以及如何有效使用工具。实验表明,Beacon 在多个 agentic vision benchmark 上显著降低了工具滥用率,同时保持了推理准确性。
In AI, ComputerVision, 1 min readAI 范式雷达:《Agentic RAG:让检索系统学会自我反思》
如果你正在构建一个需要回答复杂问题的 AI 应用,你可能已经发现传统 RAG 的天花板:当用户问”某公司的 CEO 在哪个大学获得了什么学位?”时,一次向量检索往往只能命中其中一个事实片段,答案要么不完整,要么干脆产生幻觉。最新的研究表明,Agentic RAG 能将这类多跳问题的幻觉率降低 30% 到 50%,代价是延迟增加约 2 到 4 倍、Token 消耗增加约 1.5 到 3 倍。这篇文章将带你理解 Agentic RAG 的核心原理,分析五篇关键论文,并给出一条从传统 RAG 迁移的实操路径。
In AI, ParadigmRadar, 3 mins read一分钟读论文:《可扩展 LLM 驱动多智能体系统的设计原则》
德国埃尔朗根-纽伦堡大学等机构的研究团队发表的论文《Scaling LLM-Driven Multi-Agent Systems: Design Principles and Architectural Scalability Analysis》系统性地提出了可扩展多智能体系统的四大设计原则,并通过四种复杂度递增配置的实证评估验证了这些原则的有效性。研究发现缩放带来约线性的成本增长和可测量的准确率提升,但仅当底层 LLM 超过最小能力阈值时有效——性能在中间复杂度处达到峰值,之后因超时和评估限制而退化。
In AI, Engineering, 1 min read一分钟读论文:《重新思考本地计算机使用 Agent 的推理时扩展》
韩国研究团队发表的论文《Rethinking Inference-Time Scaling in Local Computer-Use Agents: Failure Modes and Compute Tradeoffs》系统性地研究了推理时扩展在本地计算机使用 Agent 中的有效性,发现额外计算往往产生递减回报并改变失败模式而非提高成功率。在对四个开源模型和 OSWorld 基准的评估中,上下文扩展改善轨迹稳定性但收益随 token 成本饱和,时间扩展减少停滞却不显著提高任务成功率——更长的视界往往延长错误轨迹而非纠正它们。
In AI, Engineering, 1 min readFeatured
-
一分钟读论文:《Scratch Copilot:用 AI 支持青少年创意编程》推荐
In AI, 编程教育, -
一分钟读论文:《技术债的普遍性、原因和影响:业界系统调查》推荐
In Engineering, Architecture, -
一分钟读论文:《玩转 GitHub 开源软件社区的必备技能树》推荐
In OpenSource, Engineer, -
一分钟读论文:《ChatGPT 提示模式:提高代码质量、重构、需求获取和软件设计》
In AI, Engineering, Engineer, -
一分钟读论文:《用 Rust 和 WebAssembly 补充 JS 实现高性能 Node、Web 应用程序》
In Architecture, Performance, -
一分钟读论文:《通过反思性目标设定培养工程师的好习惯》
In Engineer, Productivity, -
一分钟读论文:《卓越的开源维护者是如何成就的?》
In OpenSource, Engineer, -
一分钟读论文:《我们走了多远——WebAssembly 运行时的全面特征研究》
In FrontEnd, -
一分钟读论文:《XSS 攻击22年:全面调查及系统综述》
In Security, -
一分钟读论文:《细孔沉千帆:小程序权限漏洞研究》
In Security, -
一分钟读论文:《影响大规模敏捷软件开发按时交付的因素》
In Productivity, -
一分钟读论文:《被掏空的一天:软件工程师的日常》
In Productivity, Engineer, -
一分钟读论文:《30年软件重构研究:系统性文献综述》
In Engineering, -
一分钟读论文:《要不要上 TypeScript?GitHub 上 JS 和 TS 应用软件质量的系统比较》
In FrontEnd, -
一分钟读论文:《NPM 供应链的软肋是什么?》
In Security,