All 288

一分钟读论文:《Memory as a Controlled Process:Agent记忆操作的马尔可夫决策建模》

加州大学洛杉矶分校和华盛顿大学等机构合作的一篇论文《Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents》提出了一种将Agent外部记忆操作建模为马尔可夫决策过程的方法。该方法通过轻量级上下文赌博机控制器在线学习检索策略,自适应决定何时检索、检索什么以及检索多少内容,在六个基准测试上最高提升15.2分成功率,同时将token消耗减少5%至20%。

In AI, Agent, 1 min read

一分钟读论文:《Experience Memory Graph:Agent一次性错误纠正的图匹配方法》

电子科技大学的一篇论文《Experience Memory Graph: One-Shot Error Correction for Agents》提出了一种将Agent失败恢复从LLM反思循环范式转向图匹配范式的训练方法。该方法在训练阶段将成功与失败的轨迹转换为有向动作决策图,通过图编辑路径显式编码纠正策略;测试时一次性检索并执行,无需迭代重试。在ALFWorld和ScienceWorld基准上,EMG的表现优于现有的SOTA反思基线方法。

In AI, Agent, 1 min read

AI 范式雷达:《ScaleCUA — 可验证数据合成如何突破 Computer Use Agent 的能力天花板》

如果你正在构建 Computer Use Agent(CUA),你可能已经发现一个令人沮丧的事实:你的模型在 OSWorld 上跑不过参数量大它四倍的竞品。这不是模型能力的问题——而是训练数据的问题。清华大学和 Z.AI 团队在 arXiv:2607.11185 中提出的 ScaleCUA,首次系统性地解决了 CUA 领域最核心的瓶颈:可验证训练数据的稀缺性。本文将带你理解它的三大创新如何共同作用,让开源 CUA 在 OSWorld 上达到 68.7% 的 SOTA 水平。

In AI, ParadigmRadar, 2 mins read

一分钟读论文:《Function-Aware Fill-in-the-Middle 作为编码 Agent 基础模型的中期训练》

阿里巴巴达摩院和宾夕法尼亚大学合作的一篇论文《Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation Models》(arXiv:2607.12463)提出了一种面向编码 Agent 基础模型的中期训练方法。通过在从 968 个 GitHub 仓库抽取的 2.6B token 去污染语料上进行自监督中期训练,该方法将函数调用模式映射到代码填充任务中,实现了工具调用归纳偏置的内化。在 SWE-Bench-Verified 上,7B、14B 和 Qwen3-8B 模型分别获得 +2.8、+3.0 和 +3.2 的绝对提升;SWE-Bench-Lite 上的提升更为显著,分别为 +3.7、+4.0 和 +5.4。

In AI, Engineering, 1 min read

一分钟读论文:《E3:AI Agent 何时知道任务很简单?》

佐治亚理工学院和麻省理工学院合作的一篇论文《Do AI Agents Know When a Task Is Simple? Toward Complexity-Aware Reasoning and Execution》(arXiv:2607.13034)提出 E3 框架,让编码 Agent 在执行前先评估任务复杂度,以最小可行路径执行,仅在验证失败时扩展范围。在 MSE-Bench 基准测试上,E3 达到与最强基线相同的 100% 成功率,同时将成本降低 85%,Token 消耗减少 91%,检查文件数减少 92%。

In AI, Engineering, 1 min read

一分钟读论文:《GitHub 项目的 AI Agent 编码工具早期采用研究》

罗切斯特理工学院的论文《Early Adoption of Agentic Coding Tools by GitHub Projects》基于 AIDev-pop 数据集中 2,361 个仓库的 25,264 条 Agent PR,首次从项目层面系统研究了 AI Agent 编码工具在开源社区中的采用模式。现有研究主要关注 PR 级别的结果如代码质量和接受率,但缺乏对大型项目中 Agent 工具如何被采纳和管理的全局视角。研究发现小型项目的参与率显著高于大型项目,人类与 Agent 协作以单人监督为主,Agentic Coding 整体仍处于早期阶段。

In OpenSource, SoftwareEngineering, 1 min read

一分钟读论文:《StructAgent:用因果结构驾驭长程数字Agent》

一分钟读论文:《StructAgent:用因果结构驾驭长程数字Agent》

In AI, 1 min read

一分钟读论文:《Omni-Decision:一种面向全模态问答的渐进式证据状态Agent系统》

Meta AI的研究团队在2026年7月13日提交的论文《Omni-Decision: A Progressive Evidence-State Agent System for Omni-Modal QA》提出了一种将证据状态管理作为Agent核心控制机制的新方法。传统多模态推理Agent的决策过程高度隐式,难以追踪从信息收集到最终答案之间的因果关系。Omni-Decision通过为每个查询维护结构化状态——包含确认证据、未解决冲突、事实与计算依赖关系以及开放证据需求——将内部推理转化为可检查、可追踪的显式表示。该方法训练无关,可直接应用于现有Agent系统。

In AI, Engineering, 1 min read

一分钟读论文:《Interaction Scaling:测试时计算的第三维度》

Pine AI 和华盛顿大学合作的一篇论文《Think Through a Bottleneck: Interaction Scaling — Grounding the Third Axis of Test-Time Compute》(https://arxiv.org/abs/2607.11598)提出,推理时计算的缩放存在三个正交维度:推理缩放、采样缩放和交互缩放。前两者受数据处理不等式限制存在”内部天花板”,交互缩放通过引入外部仪器观测打破了这一限制。

In AI, 1 min read

一分钟读论文:《异构智能体群体:用角色分离解决安全与创造力的困境》

一分钟读论文:《异构智能体群体:用角色分离解决安全与创造力的困境》

In AI, Research, 1 min read

Featured