一分钟读论文:《智能每美元的经济学》
Epoch AI 与 Artificial Analysis 合作发表的论文《The Price of Progress: Price Performance and the Future of AI》,构建了迄今为止最大规模的 LLM 推理价格数据集,量化了每美元智能的年度变化趋势。核心发现揭示了一个深刻的悖论:前沿模型在知识、推理、数学和软件工程基准上的单位性能成本每年下降 5x 至 10x,但前沿模型的实际运行成本因更大规模和更长推理需求反而上升 3x 至 18x 每年。
一分钟读论文:《From World Action Models to Embodied Brains》
In ai-agent, embodied-ai, 1 min read一分钟读论文:《BrainPilot -- 科研自动化的多Agent系统与伪造检测审计员》
In ai-agent, multi-agent, 1 min readAI 范式雷达:《CodeAct — Agent 执行范式的根本性转移》
In AI, ParadigmRadar, 7 mins read一分钟读论文:《Scratch Copilot:用 AI 支持青少年创意编程》
Google DeepMind 研究科学家和华盛顿大学教授合作的一篇论文《Scratch Copilot: Supporting Youth Creative Coding with AI》,首次提出了专门为儿童设计的 AI 编程助手——Scratch Copilot,这是一个集成在类 Scratch 环境中的 AI 助手,为青少年提供创意编程支持。
Read More一分钟读论文:《被掏空的一天:软件工程师的日常》
作为团队的 Leader,如何通过改进流程和⼯具,并最终提⾼团队⽣产⼒呢?可以参考微软研究院和英国伦敦大学、瑞士苏黎世大学信息学系合著的论文《Today was a Good Day: The Daily Life of Software Developers》。该论文分析了微软工程师的5,971份问卷结果,发现工程师「良好」和「典型」的工作日是怎么样,并总结了使良好的工作日成为典型的建议:
Read MoreAll
一分钟读论文:《智能每美元的经济学》
Epoch AI 与 Artificial Analysis 合作发表的论文《The Price of Progress: Price Performance and the Future of AI》,构建了迄今为止最大规模的 LLM 推理价格数据集,量化了每美元智能的年度变化趋势。核心发现揭示了一个深刻的悖论:前沿模型在知识、推理、数学和软件工程基准上的单位性能成本每年下降 5x 至 10x,但前沿模型的实际运行成本因更大规模和更长推理需求反而上升 3x 至 18x 每年。
In AI, LLM-Economics, 1 min read一分钟读论文:《From World Action Models to Embodied Brains》
本文是对 arXiv:2607.11689 的系统性解读。该论文由上海人工智能实验室与南京大学的研究团队联合提出,题为《From World Action Models to Embodied Brains: A Roadmap for Open-World Physical Intelligence》。文章系统梳理了从传统世界模型到 World Action Models(WAMs)的演进路径,并提出了以”具身大脑”为核心的协同进化路线图,为开放世界的物理智能研究提供了清晰的框架指引。
In ai-agent, embodied-ai, 1 min read一分钟读论文:《BrainPilot -- 科研自动化的多Agent系统与伪造检测审计员》
清华大学、上海智源研究院、复旦大学等11家机构联合发表的论文《BrainPilot: Automating Brain Discovery with Agentic Research》,提出了一套面向脑科学研究的多Agent协作系统。与多数将AI Agent应用于特定领域的研究不同,BrainPilot的核心贡献在于可追溯性设计和伪造检测机制。它通过PI-Agent协调七个专业智能体、Graph of Trace记录完整推理链、以及Auditor Agent实时审计事实准确性,为多Agent科研自动化提供了安全可靠的范式。
In ai-agent, multi-agent, 1 min readAI 范式雷达:《CodeAct — Agent 执行范式的根本性转移》
如果你正在构建一个需要调用多个工具的 AI Agent,你可能已经注意到一个隐蔽的性能瓶颈:不是模型不够聪明,而是编排开销太高。每个工具调用都是一次独立的模型推理回合——生成 token、网络往返、状态序列化。当任务涉及 10 个工具时,你实际上在等待 10 次完整的推理循环。
In AI, ParadigmRadar, 7 mins read一分钟读论文:《SearchOS:开放域信息检索的多代理协作框架》
浙江大学与阿里巴巴集团合作发表的论文《SearchOS:Towards Robust Open-Domain Information-Seeking Agent Collaboration》,提出了一种面向开放域信息检索的多代理协作框架 SearchOS,通过搜索导向上下文管理(SOCM)将演化状态外显为四个可追踪组件,有效缓解多代理系统在长交互历史中重复循环、浪费搜索预算的问题。
In ai-agent, multi-agent, 1 min read一分钟读论文:《Proof-or-Stop:自主编码Agent的可验证证据门控机制》
独立研究团队发表的论文《Proof-or-Stop Lifecycle Control – Loop Engineering for Verifiable Evidence-Gated Lifecycle Control》,提出了一种将自主编码Agent的DONE声明转化为可验证证据门控机制的方法。该机制要求生命周期状态转换必须依赖新鲜、绑定源状态且可通过机械方式验证的证据,从而解决了当前自主编码Agent在 reviewed、tested 和 ready-to-merge 等状态上仅有声明而无实质证据的信任危机。
In ai-agent, agentic-coding, 1 min read一分钟读论文:《Qwen-AgentWorld:通用智能体的语言世界模型》
阿里巴巴通义千问团队的一篇论文《Qwen-AgentWorld: Language World Models for General Agents》提出了首个面向通用智能体环境的语言世界模型。该模型覆盖七个领域,使用超过一千万条真实环境交互轨迹进行三阶段训练,在AgentWorldBench基准上实现了多维度仿真质量评估。
In AI, Agent, 1 min read一分钟读论文:《MCPEvol-Bench:MCP服务器动态演化的LLM Agent性能基准测试》
清华大学和阿里巴巴达摩院合作的一篇论文《MCPEvol-Bench: Benchmarking LLM Agent Performance Across Dynamic Evolutions of MCP Servers》首次系统评估了LLM Agent在动态工具环境中的适应能力。通过设计11种突变算子模拟真实MCP服务器的演化过程,覆盖123个MCP服务器和12个主流LLM模型,研究发现顶级Agent模型在工具接口发生演化后性能下降13.7%至14.4%,暴露出当前Agent系统在动态环境中的脆弱性。
In AI, Agent, 1 min read一分钟读论文:《Do Agent Optimizers Compound?Agent优化收益能否持续累积》
RELAI团队的论文《Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0》首次系统评估了Agent优化收益能否在持续学习中累积。通过构建基于Terminal-Bench 2.0的两阶段持续学习评估框架,对比GEPA、Meta Harness和RELAI-VCL三种方法后发现:只有内置回归控制的方法能实现正向迁移和持续改进,最终得分达到76.4%,显著高于基线的58.7%。
In AI, Agent, 1 min read一分钟读论文:《SR2AM:自我调节模拟规划如何实现高效Agent推理》
卡内基梅隆大学和国际金融管理学院的论文《Efficient Agentic Reasoning Through Self-Regulated Simulative Planning (SR2AM)》提出了一种将大语言模型决策过程分解为三个系统的架构,使30B参数模型的性能达到685B至1T参数级系统的水平,同时将推理token消耗减少25.8%至95.3%。
In AI, Agent, 1 min readFeatured
-
一分钟读论文:《Scratch Copilot:用 AI 支持青少年创意编程》推荐
In AI, 编程教育, -
一分钟读论文:《技术债的普遍性、原因和影响:业界系统调查》推荐
In Engineering, Architecture, -
一分钟读论文:《玩转 GitHub 开源软件社区的必备技能树》推荐
In OpenSource, Engineer, -
一分钟读论文:《ChatGPT 提示模式:提高代码质量、重构、需求获取和软件设计》
In AI, Engineering, Engineer, -
一分钟读论文:《用 Rust 和 WebAssembly 补充 JS 实现高性能 Node、Web 应用程序》
In Architecture, Performance, -
一分钟读论文:《通过反思性目标设定培养工程师的好习惯》
In Engineer, Productivity, -
一分钟读论文:《卓越的开源维护者是如何成就的?》
In OpenSource, Engineer, -
一分钟读论文:《我们走了多远——WebAssembly 运行时的全面特征研究》
In FrontEnd, -
一分钟读论文:《XSS 攻击22年:全面调查及系统综述》
In Security, -
一分钟读论文:《细孔沉千帆:小程序权限漏洞研究》
In Security, -
一分钟读论文:《影响大规模敏捷软件开发按时交付的因素》
In Productivity, -
一分钟读论文:《被掏空的一天:软件工程师的日常》
In Productivity, Engineer, -
一分钟读论文:《30年软件重构研究:系统性文献综述》
In Engineering, -
一分钟读论文:《要不要上 TypeScript?GitHub 上 JS 和 TS 应用软件质量的系统比较》
In FrontEnd, -
一分钟读论文:《NPM 供应链的软肋是什么?》
In Security,