All 290
一分钟读论文:《Frontis-MA1:面向递归自改进的AI4AI模型》
Horizon Research、Frontis.AI 和清华大学联合团队发表的论文《Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering》提出了首个面向递归自改进(RSI)的全栈开源系统 OpenMLE。该系统将机器学习工程任务分解为四个原子演化算子,通过 SFT+RL 训练出一个 35B 参数的元进化代理 Frontis-MA1,在 MLE-Bench Lite 上将 Medal Average 从基座模型的 39.39% 提升至 60.61%,配合进化搜索框架 OpenMLE-Evo-Max 进一步达到 71.21%,超越了 GPT-5.5 + Codex 组合。
In AI, ML, 1 min read一分钟读论文:《通过合作-义务耦合审计涌现的LLM-Agent协作》
华盛顿大学等机构的研究团队发表的论文《Auditing Emergent LLM-Agent Collaboration through Cooperation-Obligation Coupling》提出了iCORE(Integrated Cooperation-Obligation REpresentation)框架,通过统一编码合作图、义务图和审计映射来解决多智能体协作的可审计性缺口。在真实LLM执行中,iCORE-Audit相比被动全状态观测实现了26.4%的轨迹质量提升和显著的终端性能改进。
In AI, Security, 1 min read一分钟读论文:《AgentRadio:面向长程多智能体协作的被动感知》
佐治亚理工学院等机构的研究团队发表的论文《AgentRadio: Passive Awareness for Long-Horizon Multi-Agent Collaboration》提出了一种异步消息传递层,使编码 Agent 能在后台监听队友的消息而不中断前台工作。在 SWE-Atlas QnA 基准测试上,四个由 AgentRadio 组织的 Claude Code Agent 解决了 62.1% 的任务,比单 Agent 高出 29.8 个百分点,甚至超越了使用更新模型 Opus 4.8 的单 Agent(57.2%)。
In AI, Engineering, 1 min read一分钟读论文:《多轮长程规划的训练物理》
中国科学院自动化研究所复杂系统认知与决策智能重点实验室的论文《The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation》首次从预训练到后训练再到多教师整合的全生命周期,系统研究了基础模型智能体多轮长程规划能力的获取与塑造机制。研究构建了首个可控的多轮长程规划实验平台(Controllable Planning Gym),揭示了世界模型内部化、RL 后训练适用边界和多教师蒸馏兼容性的核心规律。
In AI, Agent, 1 min read一分钟读论文:《Agentic Real2Sim:用视觉语言代理实现物理世界建模》
UCLA、MIT 和 UCSD 联合团队发表的论文《Agentic Real2Sim: Physics-based World Modeling with Vision-Language Agents》提出了一种全新的真实世界到仿真环境的自动化转换框架。该研究利用视觉语言代理(VLM Agent)将真实世界的物体-机器人交互记录自动转换为可仿真的”episodic twin”,保留了观测数据、几何结构、机器人交互信息和物体状态,为下游机器人策略学习提供了低成本的高质量仿真环境。
In AI, Robotics, 1 min read一分钟读论文:《安全的模型为何组合后不再安全?》
独立研究团队 Elias Hossain 等人发表的论文《ChannelGuard: Safe Models Do Not Compose into Safe Multi-Agent Systems》揭示了一个被忽视的多 Agent 安全问题:即使每个单独的 Agent 模型都是安全的,组合成多 Agent 流水线后安全性会显著下降。作者通过 2,100 条 trace 评估发现,一个在标准报告下看似完全安全的多 Agent 管道(工具投毒和记忆投毒攻击成功率均为 0.000),其安全性几乎完全依赖云提供商的服务端过滤器——在 Azure GPT-5 上 60 次攻击中有 54 次被拦截。切换到无服务端过滤器的后端时,系统完全依赖 Agent 模型自身的对齐能力,安全性能大幅下降。
In AI, Security, 1 min read一分钟读论文:《基于物理的世界建模与视觉语言智能体》
加州大学洛杉矶分校、麻省理工学院和加州大学圣地亚哥分校合作的论文《Agentic Real2Sim: Physics-based World Modeling with Vision-Language Agents》,提出了一种利用视觉语言智能体自动化真实世界到仿真环境转换的框架,在刚性物体操作、可变形物体交互和人形运动三个场景上均实现了与前沿模型相当的转换成功率。
In AI, Robotics, 1 min read一分钟读论文:《软件智能体的修复策略探索》
中山大学、浙江大学、华中科技大学和华为合作的论文《PhoenixRepair: Rethinking Repair Strategy Exploration in Software Agents》,提出了一种多智能体框架来系统性探索软件修复策略,在 SWE-bench-Verified 上达到了 76.0% 的 Pass@1 成绩。
In AI, Engineering, 1 min read一分钟读论文:《自动化AI研发中的隐蔽破坏与监控评估》
DeepMind的论文《ResearchArena: Evaluating Sabotage and Monitoring in Automated AI R&D》,首次系统评估了AI Agent在自动化研发任务中执行隐蔽破坏行为的能力以及现有监控机制的检测效果。研究构建了覆盖四个长周期任务的评估框架,发现训练数据注入攻击的检测率不足50%,揭示了当前Agent安全监控体系的关键盲区。
In AI, Security, 1 min read一分钟读论文:《StructureClaw——可追溯的LLM智能体与结构工程工作流》
Sizhong Qin、Yi Gu 等人的一篇论文《Traceable LLM Agents and an Executable Benchmark for Structural Engineering Workflows》,提出了一种以工件为中心(artifact-centered)的LLM智能体工作平台 StructureClaw,并配套发布了包含150个受控场景的可执行benchmark。在十个智能体-模型配置的对比实验中,使用通用技能基线的平均成功率仅为56.8%,而采用完整自动工作流的平均成功率达到88.6%。
In AI, SoftwareEngineering, 1 min readFeatured
-
一分钟读论文:《Scratch Copilot:用 AI 支持青少年创意编程》推荐
In AI, 编程教育, -
一分钟读论文:《技术债的普遍性、原因和影响:业界系统调查》推荐
In Engineering, Architecture, -
一分钟读论文:《玩转 GitHub 开源软件社区的必备技能树》推荐
In OpenSource, Engineer, -
一分钟读论文:《ChatGPT 提示模式:提高代码质量、重构、需求获取和软件设计》
In AI, Engineering, Engineer, -
一分钟读论文:《用 Rust 和 WebAssembly 补充 JS 实现高性能 Node、Web 应用程序》
In Architecture, Performance, -
一分钟读论文:《通过反思性目标设定培养工程师的好习惯》
In Engineer, Productivity, -
一分钟读论文:《卓越的开源维护者是如何成就的?》
In OpenSource, Engineer, -
一分钟读论文:《我们走了多远——WebAssembly 运行时的全面特征研究》
In FrontEnd, -
一分钟读论文:《XSS 攻击22年:全面调查及系统综述》
In Security, -
一分钟读论文:《细孔沉千帆:小程序权限漏洞研究》
In Security, -
一分钟读论文:《影响大规模敏捷软件开发按时交付的因素》
In Productivity, -
一分钟读论文:《被掏空的一天:软件工程师的日常》
In Productivity, Engineer, -
一分钟读论文:《30年软件重构研究:系统性文献综述》
In Engineering, -
一分钟读论文:《要不要上 TypeScript?GitHub 上 JS 和 TS 应用软件质量的系统比较》
In FrontEnd, -
一分钟读论文:《NPM 供应链的软肋是什么?》
In Security,