All 288
一分钟读论文:《Memory as a Controlled Process:Agent记忆操作的马尔可夫决策建模》
加州大学洛杉矶分校和华盛顿大学等机构合作的一篇论文《Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents》提出了一种将Agent外部记忆操作建模为马尔可夫决策过程的方法。该方法通过轻量级上下文赌博机控制器在线学习检索策略,自适应决定何时检索、检索什么以及检索多少内容,在六个基准测试上最高提升15.2分成功率,同时将token消耗减少5%至20%。
In AI, Agent, 1 min read一分钟读论文:《Experience Memory Graph:Agent一次性错误纠正的图匹配方法》
电子科技大学的一篇论文《Experience Memory Graph: One-Shot Error Correction for Agents》提出了一种将Agent失败恢复从LLM反思循环范式转向图匹配范式的训练方法。该方法在训练阶段将成功与失败的轨迹转换为有向动作决策图,通过图编辑路径显式编码纠正策略;测试时一次性检索并执行,无需迭代重试。在ALFWorld和ScienceWorld基准上,EMG的表现优于现有的SOTA反思基线方法。
In AI, Agent, 1 min readAI 范式雷达:《ScaleCUA — 可验证数据合成如何突破 Computer Use Agent 的能力天花板》
如果你正在构建 Computer Use Agent(CUA),你可能已经发现一个令人沮丧的事实:你的模型在 OSWorld 上跑不过参数量大它四倍的竞品。这不是模型能力的问题——而是训练数据的问题。清华大学和 Z.AI 团队在 arXiv:2607.11185 中提出的 ScaleCUA,首次系统性地解决了 CUA 领域最核心的瓶颈:可验证训练数据的稀缺性。本文将带你理解它的三大创新如何共同作用,让开源 CUA 在 OSWorld 上达到 68.7% 的 SOTA 水平。
In AI, ParadigmRadar, 2 mins read一分钟读论文:《Function-Aware Fill-in-the-Middle 作为编码 Agent 基础模型的中期训练》
阿里巴巴达摩院和宾夕法尼亚大学合作的一篇论文《Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation Models》(arXiv:2607.12463)提出了一种面向编码 Agent 基础模型的中期训练方法。通过在从 968 个 GitHub 仓库抽取的 2.6B token 去污染语料上进行自监督中期训练,该方法将函数调用模式映射到代码填充任务中,实现了工具调用归纳偏置的内化。在 SWE-Bench-Verified 上,7B、14B 和 Qwen3-8B 模型分别获得 +2.8、+3.0 和 +3.2 的绝对提升;SWE-Bench-Lite 上的提升更为显著,分别为 +3.7、+4.0 和 +5.4。
In AI, Engineering, 1 min read一分钟读论文:《E3:AI Agent 何时知道任务很简单?》
佐治亚理工学院和麻省理工学院合作的一篇论文《Do AI Agents Know When a Task Is Simple? Toward Complexity-Aware Reasoning and Execution》(arXiv:2607.13034)提出 E3 框架,让编码 Agent 在执行前先评估任务复杂度,以最小可行路径执行,仅在验证失败时扩展范围。在 MSE-Bench 基准测试上,E3 达到与最强基线相同的 100% 成功率,同时将成本降低 85%,Token 消耗减少 91%,检查文件数减少 92%。
In AI, Engineering, 1 min read一分钟读论文:《GitHub 项目的 AI Agent 编码工具早期采用研究》
罗切斯特理工学院的论文《Early Adoption of Agentic Coding Tools by GitHub Projects》基于 AIDev-pop 数据集中 2,361 个仓库的 25,264 条 Agent PR,首次从项目层面系统研究了 AI Agent 编码工具在开源社区中的采用模式。现有研究主要关注 PR 级别的结果如代码质量和接受率,但缺乏对大型项目中 Agent 工具如何被采纳和管理的全局视角。研究发现小型项目的参与率显著高于大型项目,人类与 Agent 协作以单人监督为主,Agentic Coding 整体仍处于早期阶段。
In OpenSource, SoftwareEngineering, 1 min read一分钟读论文:《Omni-Decision:一种面向全模态问答的渐进式证据状态Agent系统》
Meta AI的研究团队在2026年7月13日提交的论文《Omni-Decision: A Progressive Evidence-State Agent System for Omni-Modal QA》提出了一种将证据状态管理作为Agent核心控制机制的新方法。传统多模态推理Agent的决策过程高度隐式,难以追踪从信息收集到最终答案之间的因果关系。Omni-Decision通过为每个查询维护结构化状态——包含确认证据、未解决冲突、事实与计算依赖关系以及开放证据需求——将内部推理转化为可检查、可追踪的显式表示。该方法训练无关,可直接应用于现有Agent系统。
In AI, Engineering, 1 min read一分钟读论文:《Interaction Scaling:测试时计算的第三维度》
Pine AI 和华盛顿大学合作的一篇论文《Think Through a Bottleneck: Interaction Scaling — Grounding the Third Axis of Test-Time Compute》(https://arxiv.org/abs/2607.11598)提出,推理时计算的缩放存在三个正交维度:推理缩放、采样缩放和交互缩放。前两者受数据处理不等式限制存在”内部天花板”,交互缩放通过引入外部仪器观测打破了这一限制。
In AI, 1 min readFeatured
-
一分钟读论文:《Scratch Copilot:用 AI 支持青少年创意编程》推荐
In AI, 编程教育, -
一分钟读论文:《技术债的普遍性、原因和影响:业界系统调查》推荐
In Engineering, Architecture, -
一分钟读论文:《玩转 GitHub 开源软件社区的必备技能树》推荐
In OpenSource, Engineer, -
一分钟读论文:《ChatGPT 提示模式:提高代码质量、重构、需求获取和软件设计》
In AI, Engineering, Engineer, -
一分钟读论文:《用 Rust 和 WebAssembly 补充 JS 实现高性能 Node、Web 应用程序》
In Architecture, Performance, -
一分钟读论文:《通过反思性目标设定培养工程师的好习惯》
In Engineer, Productivity, -
一分钟读论文:《卓越的开源维护者是如何成就的?》
In OpenSource, Engineer, -
一分钟读论文:《我们走了多远——WebAssembly 运行时的全面特征研究》
In FrontEnd, -
一分钟读论文:《XSS 攻击22年:全面调查及系统综述》
In Security, -
一分钟读论文:《细孔沉千帆:小程序权限漏洞研究》
In Security, -
一分钟读论文:《影响大规模敏捷软件开发按时交付的因素》
In Productivity, -
一分钟读论文:《被掏空的一天:软件工程师的日常》
In Productivity, Engineer, -
一分钟读论文:《30年软件重构研究:系统性文献综述》
In Engineering, -
一分钟读论文:《要不要上 TypeScript?GitHub 上 JS 和 TS 应用软件质量的系统比较》
In FrontEnd, -
一分钟读论文:《NPM 供应链的软肋是什么?》
In Security,