All 334
一分钟读论文:《E3:AI Agent 何时知道任务很简单?》
佐治亚理工学院和麻省理工学院合作的一篇论文《Do AI Agents Know When a Task Is Simple? Toward Complexity-Aware Reasoning and Execution》(arXiv:2607.13034)提出 E3 框架,让编码 Agent 在执行前先评估任务复杂度,以最小可行路径执行,仅在验证失败时扩展范围。在 MSE-Bench 基准测试上,E3 达到与最强基线相同的 100% 成功率,同时将成本降低 85%,Token 消耗减少 91%,检查文件数减少 92%。
In AI, Engineering, 1 min read一分钟读论文:《GitHub 项目的 AI Agent 编码工具早期采用研究》
罗切斯特理工学院的论文《Early Adoption of Agentic Coding Tools by GitHub Projects》基于 AIDev-pop 数据集中 2,361 个仓库的 25,264 条 Agent PR,首次从项目层面系统研究了 AI Agent 编码工具在开源社区中的采用模式。现有研究主要关注 PR 级别的结果如代码质量和接受率,但缺乏对大型项目中 Agent 工具如何被采纳和管理的全局视角。研究发现小型项目的参与率显著高于大型项目,人类与 Agent 协作以单人监督为主,Agentic Coding 整体仍处于早期阶段。
In OpenSource, SoftwareEngineering, 1 min read一分钟读论文:《Omni-Decision:一种面向全模态问答的渐进式证据状态Agent系统》
Meta AI的研究团队在2026年7月13日提交的论文《Omni-Decision: A Progressive Evidence-State Agent System for Omni-Modal QA》提出了一种将证据状态管理作为Agent核心控制机制的新方法。传统多模态推理Agent的决策过程高度隐式,难以追踪从信息收集到最终答案之间的因果关系。Omni-Decision通过为每个查询维护结构化状态——包含确认证据、未解决冲突、事实与计算依赖关系以及开放证据需求——将内部推理转化为可检查、可追踪的显式表示。该方法训练无关,可直接应用于现有Agent系统。
In AI, Engineering, 1 min read一分钟读论文:《Interaction Scaling:测试时计算的第三维度》
Pine AI 和华盛顿大学合作的一篇论文《Think Through a Bottleneck: Interaction Scaling — Grounding the Third Axis of Test-Time Compute》(https://arxiv.org/abs/2607.11598)提出,推理时计算的缩放存在三个正交维度:推理缩放、采样缩放和交互缩放。前两者受数据处理不等式限制存在”内部天花板”,交互缩放通过引入外部仪器观测打破了这一限制。
In AI, 1 min read一分钟读论文:《Remember When It Matters:长程Agent的主动记忆干预》
Meta AI的研究者发表的论文《Remember When It Matters:长程Agent的主动记忆干预》,提出了一种将Agent记忆从被动检索转变为主动干预的全新范式。在长程任务中,决策相关信息虽然存在于对话历史或上下文窗口中,但不再可靠地影响后续决策——作者称之为行为状态衰减。该研究通过双Agent架构和选择性干预机制,在Terminal-Bench 2.0上将Claude Sonnet 4.5的表现从37.6%提升至45.9%,增幅达8.3个百分点。
In AI, 1 min read一分钟读论文:《OPINE-World:程序化世界模型与本体论误差引导的交互探索》
加州大学圣地亚哥分校和OpenAI的研究者发表的论文《OPINE-World:程序化世界模型与本体论误差引导的交互探索》,提出了一种让LLM Agent通过程序化世界模型在未知环境中主动学习的新范式。该研究在ARC-AGI-3基准测试中,OPINE-World在25个游戏中无需针对每个游戏单独训练即可解决20个,达到78.4的动作效率分数(以人类基线为参照)。
In AI, Engineering, 1 min read一分钟读论文:《失败是一个过程:CLI编码代理轨迹解剖》
清华大学和阿里巴巴达摩院合作的一篇论文《Failure as a Process: An Anatomy of CLI Coding Agent Trajectories》,首次将CLI编码代理的失败建模为时间过程而非静态标签。通过对3843条执行轨迹的分析,论文发现决定性错误的中位发生步仅为第7步,而错误暴露的中位滞后高达10步——这意味着大多数失败在可修复窗口关闭后仍在徒劳地继续执行。
In AI, Engineering, 1 min readAI 范式雷达:《从并行到递归:WebSwarm的多Agent深度广度协同搜索范式》
上周阿里巴巴达摩院发布了 WebSwarm——一个渐进式递归多Agent搜索框架。在 BrowseComp-Plus、WideSearch、DeepWideSearch、GISA 四个基准测试上,WebSwarm 全面超越单 Agent ReAct 和多 Agent 并行基线。这篇文章将解析 WebSwarm 的核心原理,并带你理解为什么”从并行到递归”是 Web 搜索 Agent 的下一个范式转移。
In AI, ParadigmRadar, 3 mins readFeatured
-
一分钟读论文:《Scratch Copilot:用 AI 支持青少年创意编程》推荐
In AI, 编程教育, -
一分钟读论文:《技术债的普遍性、原因和影响:业界系统调查》推荐
In Engineering, Architecture, -
一分钟读论文:《玩转 GitHub 开源软件社区的必备技能树》推荐
In OpenSource, Engineer, -
一分钟读论文:《ChatGPT 提示模式:提高代码质量、重构、需求获取和软件设计》
In AI, Engineering, Engineer, -
一分钟读论文:《用 Rust 和 WebAssembly 补充 JS 实现高性能 Node、Web 应用程序》
In Architecture, Performance, -
一分钟读论文:《通过反思性目标设定培养工程师的好习惯》
In Engineer, Productivity, -
一分钟读论文:《卓越的开源维护者是如何成就的?》
In OpenSource, Engineer, -
一分钟读论文:《我们走了多远——WebAssembly 运行时的全面特征研究》
In FrontEnd, -
一分钟读论文:《XSS 攻击22年:全面调查及系统综述》
In Security, -
一分钟读论文:《细孔沉千帆:小程序权限漏洞研究》
In Security, -
一分钟读论文:《影响大规模敏捷软件开发按时交付的因素》
In Productivity, -
一分钟读论文:《被掏空的一天:软件工程师的日常》
In Productivity, Engineer, -
一分钟读论文:《30年软件重构研究:系统性文献综述》
In Engineering, -
一分钟读论文:《要不要上 TypeScript?GitHub 上 JS 和 TS 应用软件质量的系统比较》
In FrontEnd, -
一分钟读论文:《NPM 供应链的软肋是什么?》
In Security,