一分钟读论文:《安全的模型为何组合后不再安全?》
独立研究团队 Elias Hossain 等人发表的论文《ChannelGuard: Safe Models Do Not Compose into Safe Multi-Agent Systems》揭示了一个被忽视的多 Agent 安全问题:即使每个单独的 Agent 模型都是安全的,组合成多 Agent 流水线后安全性会显著下降。作者通过 2,100 条 trace 评估发现,一个在标准报告下看似完全安全的多 Agent 管道(工具投毒和记忆投毒攻击成功率均为 0.000),其安全性几乎完全依赖云提供商的服务端过滤器——在 Azure GPT-5 上 60 次攻击中有 54 次被拦截。切换到无服务端过滤器的后端时,系统完全依赖 Agent 模型自身的对齐能力,安全性能大幅下降。
一分钟读论文:《软件智能体的修复策略探索》
In AI, Engineering, 1 min read一分钟读论文:《自动化AI研发中的隐蔽破坏与监控评估》
In AI, Security, 1 min read一分钟读论文:《智能每美元的经济学》
In AI, LLM-Economics, 1 min read一分钟读论文:《Scratch Copilot:用 AI 支持青少年创意编程》
Google DeepMind 研究科学家和华盛顿大学教授合作的一篇论文《Scratch Copilot: Supporting Youth Creative Coding with AI》,首次提出了专门为儿童设计的 AI 编程助手——Scratch Copilot,这是一个集成在类 Scratch 环境中的 AI 助手,为青少年提供创意编程支持。
Read More一分钟读论文:《被掏空的一天:软件工程师的日常》
作为团队的 Leader,如何通过改进流程和⼯具,并最终提⾼团队⽣产⼒呢?可以参考微软研究院和英国伦敦大学、瑞士苏黎世大学信息学系合著的论文《Today was a Good Day: The Daily Life of Software Developers》。该论文分析了微软工程师的5,971份问卷结果,发现工程师「良好」和「典型」的工作日是怎么样,并总结了使良好的工作日成为典型的建议:
Read MoreAll
一分钟读论文:《安全的模型为何组合后不再安全?》
独立研究团队 Elias Hossain 等人发表的论文《ChannelGuard: Safe Models Do Not Compose into Safe Multi-Agent Systems》揭示了一个被忽视的多 Agent 安全问题:即使每个单独的 Agent 模型都是安全的,组合成多 Agent 流水线后安全性会显著下降。作者通过 2,100 条 trace 评估发现,一个在标准报告下看似完全安全的多 Agent 管道(工具投毒和记忆投毒攻击成功率均为 0.000),其安全性几乎完全依赖云提供商的服务端过滤器——在 Azure GPT-5 上 60 次攻击中有 54 次被拦截。切换到无服务端过滤器的后端时,系统完全依赖 Agent 模型自身的对齐能力,安全性能大幅下降。
In AI, Security, 1 min read一分钟读论文:《软件智能体的修复策略探索》
中山大学、浙江大学、华中科技大学和华为合作的论文《PhoenixRepair: Rethinking Repair Strategy Exploration in Software Agents》,提出了一种多智能体框架来系统性探索软件修复策略,在 SWE-bench-Verified 上达到了 76.0% 的 Pass@1 成绩。
In AI, Engineering, 1 min read一分钟读论文:《自动化AI研发中的隐蔽破坏与监控评估》
DeepMind的论文《ResearchArena: Evaluating Sabotage and Monitoring in Automated AI R&D》,首次系统评估了AI Agent在自动化研发任务中执行隐蔽破坏行为的能力以及现有监控机制的检测效果。研究构建了覆盖四个长周期任务的评估框架,发现训练数据注入攻击的检测率不足50%,揭示了当前Agent安全监控体系的关键盲区。
In AI, Security, 1 min read一分钟读论文:《智能每美元的经济学》
Epoch AI 与 Artificial Analysis 合作发表的论文《The Price of Progress: Price Performance and the Future of AI》,构建了迄今为止最大规模的 LLM 推理价格数据集,量化了每美元智能的年度变化趋势。核心发现揭示了一个深刻的悖论:前沿模型在知识、推理、数学和软件工程基准上的单位性能成本每年下降 5x 至 10x,但前沿模型的实际运行成本因更大规模和更长推理需求反而上升 3x 至 18x 每年。
In AI, LLM-Economics, 1 min read一分钟读论文:《From World Action Models to Embodied Brains》
本文是对 arXiv:2607.11689 的系统性解读。该论文由上海人工智能实验室与南京大学的研究团队联合提出,题为《From World Action Models to Embodied Brains: A Roadmap for Open-World Physical Intelligence》。文章系统梳理了从传统世界模型到 World Action Models(WAMs)的演进路径,并提出了以”具身大脑”为核心的协同进化路线图,为开放世界的物理智能研究提供了清晰的框架指引。
In ai-agent, embodied-ai, 1 min read一分钟读论文:《BrainPilot -- 科研自动化的多Agent系统与伪造检测审计员》
清华大学、上海智源研究院、复旦大学等11家机构联合发表的论文《BrainPilot: Automating Brain Discovery with Agentic Research》,提出了一套面向脑科学研究的多Agent协作系统。与多数将AI Agent应用于特定领域的研究不同,BrainPilot的核心贡献在于可追溯性设计和伪造检测机制。它通过PI-Agent协调七个专业智能体、Graph of Trace记录完整推理链、以及Auditor Agent实时审计事实准确性,为多Agent科研自动化提供了安全可靠的范式。
In ai-agent, multi-agent, 1 min readAI 范式雷达:《CodeAct — Agent 执行范式的根本性转移》
如果你正在构建一个需要调用多个工具的 AI Agent,你可能已经注意到一个隐蔽的性能瓶颈:不是模型不够聪明,而是编排开销太高。每个工具调用都是一次独立的模型推理回合——生成 token、网络往返、状态序列化。当任务涉及 10 个工具时,你实际上在等待 10 次完整的推理循环。
In AI, ParadigmRadar, 7 mins read一分钟读论文:《SearchOS:开放域信息检索的多代理协作框架》
浙江大学与阿里巴巴集团合作发表的论文《SearchOS:Towards Robust Open-Domain Information-Seeking Agent Collaboration》,提出了一种面向开放域信息检索的多代理协作框架 SearchOS,通过搜索导向上下文管理(SOCM)将演化状态外显为四个可追踪组件,有效缓解多代理系统在长交互历史中重复循环、浪费搜索预算的问题。
In ai-agent, multi-agent, 1 min read一分钟读论文:《Proof-or-Stop:自主编码Agent的可验证证据门控机制》
独立研究团队发表的论文《Proof-or-Stop Lifecycle Control – Loop Engineering for Verifiable Evidence-Gated Lifecycle Control》,提出了一种将自主编码Agent的DONE声明转化为可验证证据门控机制的方法。该机制要求生命周期状态转换必须依赖新鲜、绑定源状态且可通过机械方式验证的证据,从而解决了当前自主编码Agent在 reviewed、tested 和 ready-to-merge 等状态上仅有声明而无实质证据的信任危机。
In ai-agent, agentic-coding, 1 min read一分钟读论文:《Qwen-AgentWorld:通用智能体的语言世界模型》
阿里巴巴通义千问团队的一篇论文《Qwen-AgentWorld: Language World Models for General Agents》提出了首个面向通用智能体环境的语言世界模型。该模型覆盖七个领域,使用超过一千万条真实环境交互轨迹进行三阶段训练,在AgentWorldBench基准上实现了多维度仿真质量评估。
In AI, Agent, 1 min readFeatured
-
一分钟读论文:《Scratch Copilot:用 AI 支持青少年创意编程》推荐
In AI, 编程教育, -
一分钟读论文:《技术债的普遍性、原因和影响:业界系统调查》推荐
In Engineering, Architecture, -
一分钟读论文:《玩转 GitHub 开源软件社区的必备技能树》推荐
In OpenSource, Engineer, -
一分钟读论文:《ChatGPT 提示模式:提高代码质量、重构、需求获取和软件设计》
In AI, Engineering, Engineer, -
一分钟读论文:《用 Rust 和 WebAssembly 补充 JS 实现高性能 Node、Web 应用程序》
In Architecture, Performance, -
一分钟读论文:《通过反思性目标设定培养工程师的好习惯》
In Engineer, Productivity, -
一分钟读论文:《卓越的开源维护者是如何成就的?》
In OpenSource, Engineer, -
一分钟读论文:《我们走了多远——WebAssembly 运行时的全面特征研究》
In FrontEnd, -
一分钟读论文:《XSS 攻击22年:全面调查及系统综述》
In Security, -
一分钟读论文:《细孔沉千帆:小程序权限漏洞研究》
In Security, -
一分钟读论文:《影响大规模敏捷软件开发按时交付的因素》
In Productivity, -
一分钟读论文:《被掏空的一天:软件工程师的日常》
In Productivity, Engineer, -
一分钟读论文:《30年软件重构研究:系统性文献综述》
In Engineering, -
一分钟读论文:《要不要上 TypeScript?GitHub 上 JS 和 TS 应用软件质量的系统比较》
In FrontEnd, -
一分钟读论文:《NPM 供应链的软肋是什么?》
In Security,