All 358

一分钟读论文:《AgentRadio:面向长程多智能体协作的被动感知》

佐治亚理工学院等机构的研究团队发表的论文《AgentRadio: Passive Awareness for Long-Horizon Multi-Agent Collaboration》提出了一种异步消息传递层,使编码 Agent 能在后台监听队友的消息而不中断前台工作。在 SWE-Atlas QnA 基准测试上,四个由 AgentRadio 组织的 Claude Code Agent 解决了 62.1% 的任务,比单 Agent 高出 29.8 个百分点,甚至超越了使用更新模型 Opus 4.8 的单 Agent(57.2%)。

In AI, Engineering, 1 min read

一分钟读论文:《多轮长程规划的训练物理》

中国科学院自动化研究所复杂系统认知与决策智能重点实验室的论文《The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation》首次从预训练到后训练再到多教师整合的全生命周期,系统研究了基础模型智能体多轮长程规划能力的获取与塑造机制。研究构建了首个可控的多轮长程规划实验平台(Controllable Planning Gym),揭示了世界模型内部化、RL 后训练适用边界和多教师蒸馏兼容性的核心规律。

In AI, Agent, 1 min read

一分钟读论文:《Agentic Real2Sim:用视觉语言代理实现物理世界建模》

UCLA、MIT 和 UCSD 联合团队发表的论文《Agentic Real2Sim: Physics-based World Modeling with Vision-Language Agents》提出了一种全新的真实世界到仿真环境的自动化转换框架。该研究利用视觉语言代理(VLM Agent)将真实世界的物体-机器人交互记录自动转换为可仿真的”episodic twin”,保留了观测数据、几何结构、机器人交互信息和物体状态,为下游机器人策略学习提供了低成本的高质量仿真环境。

In AI, Robotics, 1 min read

一分钟读论文:《安全的模型为何组合后不再安全?》

独立研究团队 Elias Hossain 等人发表的论文《ChannelGuard: Safe Models Do Not Compose into Safe Multi-Agent Systems》揭示了一个被忽视的多 Agent 安全问题:即使每个单独的 Agent 模型都是安全的,组合成多 Agent 流水线后安全性会显著下降。作者通过 2,100 条 trace 评估发现,一个在标准报告下看似完全安全的多 Agent 管道(工具投毒和记忆投毒攻击成功率均为 0.000),其安全性几乎完全依赖云提供商的服务端过滤器——在 Azure GPT-5 上 60 次攻击中有 54 次被拦截。切换到无服务端过滤器的后端时,系统完全依赖 Agent 模型自身的对齐能力,安全性能大幅下降。

In AI, Security, 1 min read

一分钟读论文:《基于物理的世界建模与视觉语言智能体》

加州大学洛杉矶分校、麻省理工学院和加州大学圣地亚哥分校合作的论文《Agentic Real2Sim: Physics-based World Modeling with Vision-Language Agents》,提出了一种利用视觉语言智能体自动化真实世界到仿真环境转换的框架,在刚性物体操作、可变形物体交互和人形运动三个场景上均实现了与前沿模型相当的转换成功率。

In AI, Robotics, 1 min read

一分钟读论文:《软件智能体的修复策略探索》

中山大学、浙江大学、华中科技大学和华为合作的论文《PhoenixRepair: Rethinking Repair Strategy Exploration in Software Agents》,提出了一种多智能体框架来系统性探索软件修复策略,在 SWE-bench-Verified 上达到了 76.0% 的 Pass@1 成绩。

In AI, Engineering, 1 min read

一分钟读论文:《自动化AI研发中的隐蔽破坏与监控评估》

DeepMind的论文《ResearchArena: Evaluating Sabotage and Monitoring in Automated AI R&D》,首次系统评估了AI Agent在自动化研发任务中执行隐蔽破坏行为的能力以及现有监控机制的检测效果。研究构建了覆盖四个长周期任务的评估框架,发现训练数据注入攻击的检测率不足50%,揭示了当前Agent安全监控体系的关键盲区。

In AI, Security, 1 min read

一分钟读论文:《StructureClaw——可追溯的LLM智能体与结构工程工作流》

Sizhong Qin、Yi Gu 等人的一篇论文《Traceable LLM Agents and an Executable Benchmark for Structural Engineering Workflows》,提出了一种以工件为中心(artifact-centered)的LLM智能体工作平台 StructureClaw,并配套发布了包含150个受控场景的可执行benchmark。在十个智能体-模型配置的对比实验中,使用通用技能基线的平均成功率仅为56.8%,而采用完整自动工作流的平均成功率达到88.6%。

In AI, SoftwareEngineering, 1 min read

一分钟读论文:《智能每美元的经济学》

Epoch AI 与 Artificial Analysis 合作发表的论文《The Price of Progress: Price Performance and the Future of AI》,构建了迄今为止最大规模的 LLM 推理价格数据集,量化了每美元智能的年度变化趋势。核心发现揭示了一个深刻的悖论:前沿模型在知识、推理、数学和软件工程基准上的单位性能成本每年下降 5x 至 10x,但前沿模型的实际运行成本因更大规模和更长推理需求反而上升 3x 至 18x 每年。

In AI, LLM-Economics, 1 min read

一分钟读论文:《From World Action Models to Embodied Brains》

本文是对 arXiv:2607.11689 的系统性解读。该论文由上海人工智能实验室与南京大学的研究团队联合提出,题为《From World Action Models to Embodied Brains: A Roadmap for Open-World Physical Intelligence》。文章系统梳理了从传统世界模型到 World Action Models(WAMs)的演进路径,并提出了以”具身大脑”为核心的协同进化路线图,为开放世界的物理智能研究提供了清晰的框架指引。

In ai-agent, embodied-ai, 1 min read

Featured