All 325
一分钟读论文:《安全的模型为何组合后不再安全?》
独立研究团队 Elias Hossain 等人发表的论文《ChannelGuard: Safe Models Do Not Compose into Safe Multi-Agent Systems》揭示了一个被忽视的多 Agent 安全问题:即使每个单独的 Agent 模型都是安全的,组合成多 Agent 流水线后安全性会显著下降。作者通过 2,100 条 trace 评估发现,一个在标准报告下看似完全安全的多 Agent 管道(工具投毒和记忆投毒攻击成功率均为 0.000),其安全性几乎完全依赖云提供商的服务端过滤器——在 Azure GPT-5 上 60 次攻击中有 54 次被拦截。切换到无服务端过滤器的后端时,系统完全依赖 Agent 模型自身的对齐能力,安全性能大幅下降。
In AI, Security, 1 min read一分钟读论文:《基于物理的世界建模与视觉语言智能体》
加州大学洛杉矶分校、麻省理工学院和加州大学圣地亚哥分校合作的论文《Agentic Real2Sim: Physics-based World Modeling with Vision-Language Agents》,提出了一种利用视觉语言智能体自动化真实世界到仿真环境转换的框架,在刚性物体操作、可变形物体交互和人形运动三个场景上均实现了与前沿模型相当的转换成功率。
In AI, Robotics, 1 min read一分钟读论文:《软件智能体的修复策略探索》
中山大学、浙江大学、华中科技大学和华为合作的论文《PhoenixRepair: Rethinking Repair Strategy Exploration in Software Agents》,提出了一种多智能体框架来系统性探索软件修复策略,在 SWE-bench-Verified 上达到了 76.0% 的 Pass@1 成绩。
In AI, Engineering, 1 min read一分钟读论文:《自动化AI研发中的隐蔽破坏与监控评估》
DeepMind的论文《ResearchArena: Evaluating Sabotage and Monitoring in Automated AI R&D》,首次系统评估了AI Agent在自动化研发任务中执行隐蔽破坏行为的能力以及现有监控机制的检测效果。研究构建了覆盖四个长周期任务的评估框架,发现训练数据注入攻击的检测率不足50%,揭示了当前Agent安全监控体系的关键盲区。
In AI, Security, 1 min read一分钟读论文:《StructureClaw——可追溯的LLM智能体与结构工程工作流》
Sizhong Qin、Yi Gu 等人的一篇论文《Traceable LLM Agents and an Executable Benchmark for Structural Engineering Workflows》,提出了一种以工件为中心(artifact-centered)的LLM智能体工作平台 StructureClaw,并配套发布了包含150个受控场景的可执行benchmark。在十个智能体-模型配置的对比实验中,使用通用技能基线的平均成功率仅为56.8%,而采用完整自动工作流的平均成功率达到88.6%。
In AI, SoftwareEngineering, 1 min read一分钟读论文:《智能每美元的经济学》
Epoch AI 与 Artificial Analysis 合作发表的论文《The Price of Progress: Price Performance and the Future of AI》,构建了迄今为止最大规模的 LLM 推理价格数据集,量化了每美元智能的年度变化趋势。核心发现揭示了一个深刻的悖论:前沿模型在知识、推理、数学和软件工程基准上的单位性能成本每年下降 5x 至 10x,但前沿模型的实际运行成本因更大规模和更长推理需求反而上升 3x 至 18x 每年。
In AI, LLM-Economics, 1 min read一分钟读论文:《From World Action Models to Embodied Brains》
本文是对 arXiv:2607.11689 的系统性解读。该论文由上海人工智能实验室与南京大学的研究团队联合提出,题为《From World Action Models to Embodied Brains: A Roadmap for Open-World Physical Intelligence》。文章系统梳理了从传统世界模型到 World Action Models(WAMs)的演进路径,并提出了以”具身大脑”为核心的协同进化路线图,为开放世界的物理智能研究提供了清晰的框架指引。
In ai-agent, embodied-ai, 1 min read一分钟读论文:《BrainPilot -- 科研自动化的多Agent系统与伪造检测审计员》
清华大学、上海智源研究院、复旦大学等11家机构联合发表的论文《BrainPilot: Automating Brain Discovery with Agentic Research》,提出了一套面向脑科学研究的多Agent协作系统。与多数将AI Agent应用于特定领域的研究不同,BrainPilot的核心贡献在于可追溯性设计和伪造检测机制。它通过PI-Agent协调七个专业智能体、Graph of Trace记录完整推理链、以及Auditor Agent实时审计事实准确性,为多Agent科研自动化提供了安全可靠的范式。
In ai-agent, multi-agent, 1 min readAI 范式雷达:《CodeAct — Agent 执行范式的根本性转移》
如果你正在构建一个需要调用多个工具的 AI Agent,你可能已经注意到一个隐蔽的性能瓶颈:不是模型不够聪明,而是编排开销太高。每个工具调用都是一次独立的模型推理回合——生成 token、网络往返、状态序列化。当任务涉及 10 个工具时,你实际上在等待 10 次完整的推理循环。
In AI, ParadigmRadar, 7 mins read一分钟读论文:《SearchOS:开放域信息检索的多代理协作框架》
浙江大学与阿里巴巴集团合作发表的论文《SearchOS:Towards Robust Open-Domain Information-Seeking Agent Collaboration》,提出了一种面向开放域信息检索的多代理协作框架 SearchOS,通过搜索导向上下文管理(SOCM)将演化状态外显为四个可追踪组件,有效缓解多代理系统在长交互历史中重复循环、浪费搜索预算的问题。
In ai-agent, multi-agent, 1 min readFeatured
-
一分钟读论文:《Scratch Copilot:用 AI 支持青少年创意编程》推荐
In AI, 编程教育, -
一分钟读论文:《技术债的普遍性、原因和影响:业界系统调查》推荐
In Engineering, Architecture, -
一分钟读论文:《玩转 GitHub 开源软件社区的必备技能树》推荐
In OpenSource, Engineer, -
一分钟读论文:《ChatGPT 提示模式:提高代码质量、重构、需求获取和软件设计》
In AI, Engineering, Engineer, -
一分钟读论文:《用 Rust 和 WebAssembly 补充 JS 实现高性能 Node、Web 应用程序》
In Architecture, Performance, -
一分钟读论文:《通过反思性目标设定培养工程师的好习惯》
In Engineer, Productivity, -
一分钟读论文:《卓越的开源维护者是如何成就的?》
In OpenSource, Engineer, -
一分钟读论文:《我们走了多远——WebAssembly 运行时的全面特征研究》
In FrontEnd, -
一分钟读论文:《XSS 攻击22年:全面调查及系统综述》
In Security, -
一分钟读论文:《细孔沉千帆:小程序权限漏洞研究》
In Security, -
一分钟读论文:《影响大规模敏捷软件开发按时交付的因素》
In Productivity, -
一分钟读论文:《被掏空的一天:软件工程师的日常》
In Productivity, Engineer, -
一分钟读论文:《30年软件重构研究:系统性文献综述》
In Engineering, -
一分钟读论文:《要不要上 TypeScript?GitHub 上 JS 和 TS 应用软件质量的系统比较》
In FrontEnd, -
一分钟读论文:《NPM 供应链的软肋是什么?》
In Security,