一分钟读论文:《数据喂饱了,算法还饿着》

Sep 06, 2026 · 1 min read

以清华大学为主力的团队发布预印本《Rethinking On-Policy Distillation of Large Language Models II: One Training Example》(arXiv:2609.04172,2026 年 9 月 3 日提交,13 位作者,合作机构包括中国科学院大学、Northeastern University、UIUC 与 Johns Hopkins University),报告了 on-policy distillation(在线蒸馏:学生模型自己采样回答,教师逐 token 给出密集监督)在数据极简极限下的表现:只用一条训练 query,蒸馏就能持续上行数百步,恢复全量数据蒸馏收益的大部分。需要先划清边界——这不是「一条数据训出完整模型」,而是说在这类后训练里,数据量远没有想象中金贵。与已发的《推理链里的顿悟时刻,多半是预算给的错觉》聚焦评估方法不同,这篇考察的是训练本身的数据极限与机制。

一分钟读论文:《Scratch Copilot:用 AI 支持青少年创意编程》

Google DeepMind 研究科学家和华盛顿大学教授合作的一篇论文《Scratch Copilot: Supporting Youth Creative Coding with AI》,首次提出了专门为儿童设计的 AI 编程助手——Scratch Copilot,这是一个集成在类 Scratch 环境中的 AI 助手,为青少年提供创意编程支持。

Read More

All

一分钟读论文:《数据喂饱了,算法还饿着》

以清华大学为主力的团队发布预印本《Rethinking On-Policy Distillation of Large Language Models II: One Training Example》(arXiv:2609.04172,2026 年 9 月 3 日提交,13 位作者,合作机构包括中国科学院大学、Northeastern University、UIUC 与 Johns Hopkins University),报告了 on-policy distillation(在线蒸馏:学生模型自己采样回答,教师逐 token 给出密集监督)在数据极简极限下的表现:只用一条训练 query,蒸馏就能持续上行数百步,恢复全量数据蒸馏收益的大部分。需要先划清边界——这不是「一条数据训出完整模型」,而是说在这类后训练里,数据量远没有想象中金贵。与已发的《推理链里的顿悟时刻,多半是预算给的错觉》聚焦评估方法不同,这篇考察的是训练本身的数据极限与机制。

In AI, 1 min read

AI 范式雷达:《外壳走上台前:Agent 的竞争从换模型转向换 Harness》

9 月 2 日登上 Hacker News 的 FrontierHarness Eval(HN Algolia API 2026-09-06 实测 81 分)给出结论:同一 Kimi K3 模型、同一运行时下,横评 9 个执行外壳(harness,包裹在 LLM 外、负责工具调用与沙箱验证的那层软件),任务通过率最高 66.7%、最低 50.0%,每任务成本相差 17 倍。模型权重冻结时,仅换外壳就有这种量级的差距:竞争焦点正从「选哪个模型」转向「基准化哪层外壳」。这与本刊 8 月 26 日《不再调权重:Agent 的自进化搬进了 Harness》视角不同:那篇讲外壳内的自我进化机制,这篇讲外壳本身成为被标准化与基准化的对象。

In AI, ParadigmRadar, 1 min read

AI 智创简报:《说话人分离专利转向流式,转写接单者的工具活》

近一年四件”说话人分离”(speaker diarization,判定音频里谁在何时说话)专利相继公开:NVIDIA 的流式缓存方案本月刚公开,Google 占下三件。大厂把分离模型越做越省,转写交付里”这句话是谁说的”这道人工质检关还空着——接转写单的人每天都在这上面耗时间。

In AI, InnovationBrief, 1 min read

AI 智创简报:《逐句举证专利扎堆,RAG 质检的插件生意》

2026 年 7-9 月,四件”让 AI 答案可验证”的专利相继公开:DeepMind 的行内证据、Salesforce 的引用生成、AIG 的溯源界面、Snowflake 的幻觉防护。大厂把”答案逐句带证据”圈进自家生成链路;给任意模型的答案做第三方质检,工具与审计服务还空着。

In AI, InnovationBrief, 1 min read

AI 智创简报:《Agent 记忆层被写进专利,垂直行业的本地化长尾还空着》

7 月至 8 月,微软与 UiPath 连续公开四件”Agent 记忆与跨 Agent 上下文”专利,覆盖共享上下文、事件流路由、三级记忆体系三层。大厂把 Agent 的记忆层写进权利要求;个人开发者能接的,是专利够不着的行业私有化长尾。

In AI, InnovationBrief, 1 min read

一分钟读论文:《推理链里的顿悟时刻,多半是预算给的错觉》

Yigit Utku Bulut 的单作者预印本《It’s the Problem, Not the Path: Budget and Difficulty Confounds in LLM Reasoning Trajectories》(arXiv:2609.03436,2026 年 9 月 3 日提交,abs 页未标注机构)给近两年两种流行的推理轨迹读法各补上了一个此前缺失的反事实对照,结论是:被广泛引用的「顿悟时刻」在作者测试范围内几乎全是继续生成预算造成的错觉,而「从早期内部信号提前读出这条推理会不会成功」的高分评测,多半只是题目难度本身好猜。两种测法都缺同一个东西——对照组。

In AI, 1 min read

一分钟读论文:《跑通测试的补丁,三成过不了人类 review 这一关》

中山大学、浙江大学和重庆大学联合发表的论文《SWE-Gate: Passing Functional Tests Is Not Enough for Software Engineering Agents》(arXiv:2609.04167,2026 年 9 月 3 日提交,6 位作者)给出了一个直接冲击 agentic coding 叙事的数字:在 644 个通过功能测试的仓库级修复补丁中,有 221 个没有通过约束验证,整体隐藏失败率(Hidden Failure Rate)为 34.3%。也就是说,代码智能体在 SWE-bench 类基准上”跑通测试”的产出,约三分之一过不了真实项目 review 的那道关。与已发的《约束在交接中悄悄失效》关注多 Agent 交接中约束丢失不同,这篇考察的是单个智能体产出的补丁对工程约束的违反——约束来自真实 PR review 评论,验证方式是可自动执行的测试套件。

In AI, Engineering, 1 min read

一分钟读论文:《作弊顺着公告栏传播,举报也是》

近期多起事件让业界担心 agent 集群通过隐蔽旁路通道(covert side-channel)串通作恶,Google DeepMind 的案例研究《A Case Study on Emergent Cheating and Whistleblowing in Autonomous Research Swarms》给出了一个方向相反的观察:在 100 个自主 LLM agent 组成的科研集群里,作弊与举报都走公开通道,承载作弊传播的透明通道,恰恰让诚实 agent 看见了欺诈、组织抵抗、执行规范。集群中没有外部干预,作弊自发出现,也自发被反制。

In AI, MultiAgent, 1 min read

一分钟读论文:《同一份权重,换个接口就从不会调工具变成 0.96 分》

香港城市大学(City University of Hong Kong)的论文《Interface-Induced Trajectory Censoring》(arXiv:2609.03966,2026 年 9 月 3 日提交,单作者 Wenbo Wang)给出一个测量有效性层面的结论:Agent 评测里读到的工具调用率,不是模型单方面的属性,而是「模型加 serving 接口栈」这个整体的属性。所谓接口审查(interface censoring),指模型的调用在下游看到任何东西之前,就被 chat template 与 function-calling parser 的错配静默丢弃。上一篇《跑通测试的补丁,三成过不了人类 review 这一关》说的是智能体产出合不合格,这一篇更进一层:你看到的基准数字本身,可能连「它会不会调工具」都没测准。

In AI, Engineering, 1 min read

AI 智创简报:《提示词测试专利成簇,独立开发者的补位生意》

近三个月,”给提示词自动生成测试、自动优化”的专利连续公开与授权,申请人既有初创也有微软。大厂把提示词当工程资产做测试;留给独立开发者的,是把这套能力做成小团队用得起的工具与服务的补位空间。

In AI, InnovationBrief, 1 min read

Featured