一分钟读论文:《最佳选手未必是最佳教练》
加州大学伯克利分校哈斯商学院数据创新与人工智能实验室(DIAL)的论文《CentaurBench: Benchmarking LLM Capabilities on Augmenting vs. Automating Real-World Work Tasks》发现,大语言模型的”自动化”能力与”增强”能力几乎不相关:最会自己干活的”选手”,未必是最会指导别人干活的”教练”。论文用统一框架在 7 个真实工作任务上评测 9 个助手模型,每任务独立重复 10 次,两种角色排名的模型级 Spearman 相关仅 0.48(p=0.187),在常规显著性水平下与零不可区分。
一分钟读论文:《贝叶斯伙伴建模与 LLM 协同重规划》
In AI, MultiAgent, 1 min readAI 智创简报:《标签可撕,凭证要验:内容溯源的打标缺口》
In AI, InnovationBrief, 1 min read一分钟读论文:《工具调用的苦涩教训》
In AI, LLM, 1 min read一分钟读论文:《Scratch Copilot:用 AI 支持青少年创意编程》
Google DeepMind 研究科学家和华盛顿大学教授合作的一篇论文《Scratch Copilot: Supporting Youth Creative Coding with AI》,首次提出了专门为儿童设计的 AI 编程助手——Scratch Copilot,这是一个集成在类 Scratch 环境中的 AI 助手,为青少年提供创意编程支持。
Read MoreAll
一分钟读论文:《最佳选手未必是最佳教练》
加州大学伯克利分校哈斯商学院数据创新与人工智能实验室(DIAL)的论文《CentaurBench: Benchmarking LLM Capabilities on Augmenting vs. Automating Real-World Work Tasks》发现,大语言模型的”自动化”能力与”增强”能力几乎不相关:最会自己干活的”选手”,未必是最会指导别人干活的”教练”。论文用统一框架在 7 个真实工作任务上评测 9 个助手模型,每任务独立重复 10 次,两种角色排名的模型级 Spearman 相关仅 0.48(p=0.187),在常规显著性水平下与零不可区分。
In AI, LLM, 1 min read一分钟读论文:《贝叶斯伙伴建模与 LLM 协同重规划》
论文《Bayesian Partner Modelling enables Adaptive Replanning for LLM Coordination》针对多智能体大语言模型系统的一个常见问题:队友会在任务中途切换策略,智能体却常常在公开证据表明伙伴已更换技能之后,仍继续执行过时的计划。现有方法要么把伙伴追踪当作被动上下文,知道变化发生但反应迟缓,要么不加区分地频繁重规划。论文提出 BayesBeliefAgent,将基于 GPT-4o 的分层大语言模型规划器与一个贝叶斯追踪模块配对,仅当伙伴的实际动作与推断技能直接矛盾时,才中断当前技能并触发重规划。除标准奖励外,论文以重规划效率与 belief-action gap 作为核心评估维度。
In AI, MultiAgent, 1 min readAI 智创简报:《标签可撕,凭证要验:内容溯源的打标缺口》
2026 年 AI 内容溯源与水印主题的美国申请至少公开 6 件,其中 3 件在近 90 天内。8 月 2 日 EU AI Act 透明度条款生效,AI 生成内容必须机器可读标记。「标签可撕」与「可验证凭证」之间的缺口,是一个能接的活儿。
In AI, InnovationBrief, 1 min read一分钟读论文:《工具调用的苦涩教训》
普华永道美国(PricewaterhouseCoopers U.S.A.)的论文《The Bitter Lesson of Tool Calling》(v1 提交于 2026 年 8 月),在伯克利函数调用基准(Berkeley Function-Calling Leaderboard,BFCL)v4 上用 14 个模型系统对比了两种工具调用范式:JSON tool calling(模型输出 JSON 函数调用)与 programmatic tool calling(PTC,模型写 Python 代码调用类型化 stub)。核心发现是 PTC 在 11/14 的模型上持平或更优、长链任务领先 18.8%,但全模型宏平均反而略低——优势随模型代际而非厂商分化。
In AI, LLM, 1 min read一分钟读论文:《近端文本梯度下降驱动的智能体技能自进化》
香港科技大学与澳门大学的论文《SkillProx: Self-Evolving Agent Skills via Proximal Textual Gradient Descent》,针对智能体技能(由主指令文件 SKILL.md 和可选引用资源目录构成的结构化文本工件)提出受近端梯度下降(交替执行任务损失方向步与正则约束子问题求解的优化算法)启发的”前向-后向”双阶段框架:前向闭环诊断演化验证每次编辑的实际效果,后向效用感知近端精炼审计并收缩累积知识。在 SpreadSheetBench、WikiTQ 和 HiTab 三个基准上,SkillProx 相比最强基线 SkillGrad 平均提升约 3.0 个百分点,且分布外(OOD)泛化显著更稳:Qwen3.5-4B 下 SkillOpt 的 OOD 得分在 WikiTQ、HiTab 上分别跌至 26.0 和 16.0,SkillProx 则达到 78.5 与 69.2。
In AI, Agent, 1 min read一分钟读论文:《SABLE:智能体编排的先导化合物优化》
美国北卡罗来纳大学教堂山分校(UNC Chapel Hill)的论文《A Modular Agentic Framework for Synthetically Constrained Multi-Objective Hit-to-Lead Optimization》,提出开源智能体框架 SABLE(Synthetically-accessible Agentic Bayesian Ligand Exploration):LLM 解析自然语言优化目标并路由任务,调度反应模板类似物枚举、ADMET 与理化性质预测、Boltz-2 结构亲和力打分、贝叶斯优化四类专用工具,构成药物发现「设计-合成-测试-分析」(DMTA)循环中分析与优先级排序阶段的计算孪生体。METTL3 回顾性案例中,单次运行即得到预测浓度 102.33 nM 的头部类似物(相对起始化合物约 95 倍预测活性提升),且论文明确该候选未经湿实验验证、属前瞻性优先级排序。
In AI, DrugDiscovery, 1 min read一分钟读论文:《G0.5:单流自回归统一机器人推理与动作》
上海机器人公司银河通用(Galaxea)的论文《G0.5: One Autoregressive Stream for Robot Reasoning and Action》,提出预训练自回归视觉-语言-动作模型(VLA)G0.5:单一 transformer decoder 在同一 token 流中同时输出推理与动作。主流 VLA 配方把预训练视觉语言模型(VLM)当上下文编码器、另配独立 flow-matching 动作专家(通过回归向量场生成连续动作),使 VLM 只负责编码上下文;G0.5 让 VLM 直接成为决策者。相对主流配方,这是架构层面的改变而非训练技巧。真机微调成功率 76.7%,超过 π0.5 的 53.3% 和 GR00T-N1.7 的 24.4%;模型权重已开放,为社区验证这一路线提供了可复现起点。
In embodiedai, robotics, 1 min readAI 智创简报:《Agent 纠错专利扎堆,一个人能做的护栏生意》
2026 年上半年集中公开的一批 Agent 专利,主题高度一致:让 Agent 记得住上次说过什么、别张口就编、出错了能自己爬起来。大厂圈的是平台,但这三件事的实现层薄到一个人一周就能做出可演示版本,接在别人的 API 调用链上收钱。
In AI, InnovationBrief, 1 min readAI 范式雷达:《从代码补全到自主软件工程:Agentic Coding 的范式转移》
SWE-bench Verified 基准上,开源框架的成绩从 2023 年的不足 6% 跃升至 2025-2026 年的 50%-70%+,增幅超过 8 倍。这意味着 AI Agent 已经能够自主解决真实 GitHub Issue 中的复杂 Bug 修复任务——而这一切只用了不到三年时间。本文将带你理解 Agentic Coding 的核心原理、对比主流框架的适用场景,并给出从零搭建第一个自主编程 Agent 的实操路径。
In AI, ParadigmRadar, 3 mins read一分钟读论文:《w-0:潜变量预测式世界动作模型实现人形机器人并发运动操作》
新加坡南洋理工大学、北京大学和北京智源研究院等机构合作的一篇论文w-0:潜变量预测式世界动作模型实现人形机器人并发运动操作 (w-0: A Latent Predictive World Action Model for Concurrent Humanoid Loco-Manipulation),提出了一种将未来视觉潜在预测与全身动作生成联合建模的新范式。该论文在 11 个真实家庭任务上持续优于 9 种基线方法,并发布了目前最大规模的人形家庭操作数据集 w-HOME(40+ 小时)。
In embodiedai, robotics, humanoid, 1 min readFeatured
-
一分钟读论文:《Scratch Copilot:用 AI 支持青少年创意编程》推荐
In AI, 编程教育, -
一分钟读论文:《技术债的普遍性、原因和影响:业界系统调查》推荐
In Engineering, Architecture, -
一分钟读论文:《玩转 GitHub 开源软件社区的必备技能树》推荐
In OpenSource, Engineer, -
一分钟读论文:《ChatGPT 提示模式:提高代码质量、重构、需求获取和软件设计》
In AI, Engineering, Engineer, -
一分钟读论文:《用 Rust 和 WebAssembly 补充 JS 实现高性能 Node、Web 应用程序》
In Architecture, Performance, -
一分钟读论文:《通过反思性目标设定培养工程师的好习惯》
In Engineer, Productivity, -
一分钟读论文:《卓越的开源维护者是如何成就的?》
In OpenSource, Engineer, -
一分钟读论文:《我们走了多远——WebAssembly 运行时的全面特征研究》
In FrontEnd, -
一分钟读论文:《XSS 攻击22年:全面调查及系统综述》
In Security, -
一分钟读论文:《细孔沉千帆:小程序权限漏洞研究》
In Security, -
一分钟读论文:《影响大规模敏捷软件开发按时交付的因素》
In Productivity, -
一分钟读论文:《被掏空的一天:软件工程师的日常》
In Productivity, Engineer, -
一分钟读论文:《30年软件重构研究:系统性文献综述》
In Engineering, -
一分钟读论文:《要不要上 TypeScript?GitHub 上 JS 和 TS 应用软件质量的系统比较》
In FrontEnd, -
一分钟读论文:《NPM 供应链的软肋是什么?》
In Security,