一分钟读论文:《只刷干净的数学题,模型反而学会了不拒绝》
KAUST(King Abdullah University of Science and Technology)与多伦多大学等机构合作的论文《Mitigating Reasoning-Induced Misalignment via Safety-Direction Penalty》(arXiv:2608.23497,8 月下旬提交)发现:只用完全无害的数学与代码推理数据做监督微调(SFT),模型反而变得更危险。在 AM-DeepSeek 前 10,000 条数据上微调后,Qwen2.5-3B 在 HEx-PHI 上的有害输出率从 10.0% 升到 20.3%,SafetyBench 安全得分从 69.1 跌到 57.9;7B 的有害率从 13.3% 升到 25.3%。该现象被称为 RIM(Reasoning-Induced Misalignment),由 Yan et al. (2026) 首先指出,与 Betley et al. (2026) 的 Emergent Misalignment(EM)不同之处在于训练数据完全不含失准内容,本文的新意在于解释其机制并给出修复方法。
一分钟读论文:《七个模型在代码库里记错了同一个地方》
In AI, LLM, 1 min read一分钟读论文:《同一个模型换个外壳,攻击成功率差出四倍多》
In AI, Security, 1 min read一分钟读论文:《不会解题的 0.5B 小模型,反而成了大模型的运行时顾问》
In AI, LLM, 1 min read一分钟读论文:《Scratch Copilot:用 AI 支持青少年创意编程》
Google DeepMind 研究科学家和华盛顿大学教授合作的一篇论文《Scratch Copilot: Supporting Youth Creative Coding with AI》,首次提出了专门为儿童设计的 AI 编程助手——Scratch Copilot,这是一个集成在类 Scratch 环境中的 AI 助手,为青少年提供创意编程支持。
Read MoreAll
一分钟读论文:《只刷干净的数学题,模型反而学会了不拒绝》
KAUST(King Abdullah University of Science and Technology)与多伦多大学等机构合作的论文《Mitigating Reasoning-Induced Misalignment via Safety-Direction Penalty》(arXiv:2608.23497,8 月下旬提交)发现:只用完全无害的数学与代码推理数据做监督微调(SFT),模型反而变得更危险。在 AM-DeepSeek 前 10,000 条数据上微调后,Qwen2.5-3B 在 HEx-PHI 上的有害输出率从 10.0% 升到 20.3%,SafetyBench 安全得分从 69.1 跌到 57.9;7B 的有害率从 13.3% 升到 25.3%。该现象被称为 RIM(Reasoning-Induced Misalignment),由 Yan et al. (2026) 首先指出,与 Betley et al. (2026) 的 Emergent Misalignment(EM)不同之处在于训练数据完全不含失准内容,本文的新意在于解释其机制并给出修复方法。
In AI, LLM, 1 min read一分钟读论文:《七个模型在代码库里记错了同一个地方》
一篇近期提交到 arXiv 的论文《The Working Set of a Coding Agent: Coherence Debt in Repository-Scale Tasks》认为,仓库级编码 agent 的失败不在于智力不足,而在于写代码那一刻它依赖的事实既不在上下文窗口、也不在参数化记忆中。论文把这件事形式化为「连贯性债务(coherence debt)」,并用七个模型家族与多个 harness 的供给/剥夺实验证明:缺一个事实恰好损失该事实支撑的工作,不多不少;agent 对缺失事实的反应不是停下,而是自信地编造。
In AI, LLM, 1 min read一分钟读论文:《同一个模型换个外壳,攻击成功率差出四倍多》
Agent 安全系列前几期处理了三种威胁:#160 改答案、#161 偷资产、#162 建暗线。美国北卡罗来纳大学教堂山分校(UNC Chapel Hill)、中佛罗里达大学(UCF)与密歇根州立大学(Michigan State University)的论文《HarnessRisk: A Lifecycle-Oriented Benchmark for Agent Harness Safety》(arXiv:2608.17597v1)问的是第四种问题:模型没变,是它运行的外壳让防线失守。基准用 128 个沙箱案例测出:同一个模型换个 harness,攻击成功率能差出 4.3 倍。
In AI, Security, 1 min read一分钟读论文:《不会解题的 0.5B 小模型,反而成了大模型的运行时顾问》
新加坡国立大学的论文《Don’t Solve, Just Compare: Tiny Advisors for Runtime Intervention in LLM Agents》提出 COTA 框架:顾问模型不需要会解题——一个只会判断两个候选动作哪个更好的 0.5B 小模型(Qwen2.5-0.5B-Instruct),就能在运行时给比它大得多的 actor 模型指出错误、触发重规划。此前《测试时扩展:瓶颈在筛选,不在采样》的结论是筛选比采样难,这篇论文的结论与之互补:比较比求解便宜,而且够用。在 3 个 actor × 3 个环境共 9 个组合上,COTA 全部取得最佳成绩,平均端到端开销 1.38×(9 个设置中 7 个低于 1.5×)。
In AI, LLM, 1 min read一分钟读论文:《拍卖桌下的暗线,多智能体隐藏合谋的检测与干预》
美国麻省理工学院媒体实验室(MIT Media Lab)联合 Westtown School、University of Florida 与 SRI International 的论文《Beyond the Transcript: Detecting Covert Coordination in Latent Multi-Agent Communication》证明:当多个 LLM 智能体通过公开记录之外的连续隐藏状态(latent handoff)传递私有信息时,合谋可以在审计面之外发生,而仅用中性样本训练的三层无监督监控就能以不超过 0.2% 的监控负载将其检出。如果说 Persuade 研究的是 agent 被说服后改答案、EchoCoT 研究的是黑盒 API 泄露推理资产,本文考察的威胁面是第三种:agent 之间建立公开 transcript 看不见的私有通道。
In AI, Security, 1 min readAI 智创简报:《视频鉴真从查假转向证真,自助证明工具还是空白》
近 90 天有 2 件美国「视频鉴真」申请公开:Bank of America 的区块链视频认证、Arranged BV 的受控光照认证。主题正从「检测是不是假」转向「证明是真的」,低成本自助证明工具的缺口,是个人开发者能接的活。
In AI, InnovationBrief, 1 min readAI 智创简报:《微软、蚂蚁都在给 AI 应用打注入疫苗,小团队缺个便宜的体检医生》
近 12 个月,微软、Palo Alto Networks、蚂蚁集团、Radware 四家申请人公开了五件提示词注入防御专利,最新一件 8 月 6 日公开。OWASP 把注入攻击列为 LLM 应用头号风险,企业级防御正在产品化,而面向小团队的低成本验收测试还是空白。
In AI, InnovationBrief, 1 min read一分钟读论文:《一条事实错误的论证,就能让 LLM 放弃正确答案》
大语言模型正越来越多地作为自主 agent 参与沟通、谈判与协作,而已有研究表明它们容易被针对性论证尤其是错误信息说服。美国伊利诺伊大学厄巴纳-香槟分校(UIUC)的论文《Learning to Persuade Exposes How Easily LLMs Abandon Correct Beliefs》证明:一条事实错误的针对性论证,就足以让大语言模型放弃原本正确的答案。作者把对抗性说服形式化为单轮威胁模型:Persuader(说服方)只发送一条论证,目标模型 Persuadee 随即重新作答;用 GRPO(Group Relative Policy Optimization)对 Qwen-7B 做 Persuader 的对抗强化学习后,Qwen-2.5-7B-Instruct 在 TruthfulQA 上的准确率从基线 66.2% 塌到 1.8%(Figure 3)。
In AI, LLM, 1 min read一分钟读论文:《黑盒推理模型的隐藏思维链,正在被一条长度信号读走》
德国亥姆霍兹信息安全中心 CISPA(CISPA Helmholtz Center for Information Security)的论文《EchoCoT: Extracting Hidden Chain-of-Thought from Large Reasoning Models》证明:仅靠纯 API 交互,就能从黑盒大推理模型(LRM, Large Reasoning Model)中提取其隐藏的思维链(CoT),在开源模型上达到近逐字保真。论文识别出一个此前被忽视的攻击面——tool call 之间由 API 返回的推理元数据(推理长度与 CoT 摘要)构成的”推理回放面”(reasoning replay surface):攻击者把它当作保真度信号,多步迭代地把目标模型的隐藏 CoT 重放出来。这是一篇攻击论文,代码已开源。
In AI, Security, 1 min read一分钟读论文:《SPADE:难度跟着能力长的自适应自博弈》
华盛顿大学、斯坦福大学、卡内基梅隆大学等 9 个机构的 18 位作者的论文《SPADE: Self-Play in Adaptive Synthetic Executable Environments》让同一个大语言模型同时扮演两个角色:环境设计师把长程训练任务写成带 reset()/step() 接口的可执行 Python 代码(含状态转移、奖励函数与验证逻辑),推理智能体在这些环境里做强化学习;设计师以「有特权提示与无提示的回报差」(hint-based regret)为训练信号,使环境分布随智能体能力边界共同演化。在 Qwen3-30B-A3B-Instruct-2507 上,8 个留出基准均分从 50.2 提升到 58.3(+8.1),领先最强固定环境基线 5.3 分。论文于 2026 年 8 月 19 日提交 arXiv(v1,cs.CL)。这与本站此前介绍的《MidTool:工具使用需要专门的中间训练》形成对照:MidTool 是「买数据」(外部语料 mid-train),SPADE 是「自己造环境」(自生成可执行训练环境)。
In AI, LLM, 1 min readFeatured
-
一分钟读论文:《Scratch Copilot:用 AI 支持青少年创意编程》推荐
In AI, 编程教育, -
一分钟读论文:《技术债的普遍性、原因和影响:业界系统调查》推荐
In Engineering, Architecture, -
一分钟读论文:《玩转 GitHub 开源软件社区的必备技能树》推荐
In OpenSource, Engineer, -
一分钟读论文:《ChatGPT 提示模式:提高代码质量、重构、需求获取和软件设计》
In AI, Engineering, Engineer, -
一分钟读论文:《用 Rust 和 WebAssembly 补充 JS 实现高性能 Node、Web 应用程序》
In Architecture, Performance, -
一分钟读论文:《通过反思性目标设定培养工程师的好习惯》
In Engineer, Productivity, -
一分钟读论文:《卓越的开源维护者是如何成就的?》
In OpenSource, Engineer, -
一分钟读论文:《我们走了多远——WebAssembly 运行时的全面特征研究》
In FrontEnd, -
一分钟读论文:《XSS 攻击22年:全面调查及系统综述》
In Security, -
一分钟读论文:《细孔沉千帆:小程序权限漏洞研究》
In Security, -
一分钟读论文:《影响大规模敏捷软件开发按时交付的因素》
In Productivity, -
一分钟读论文:《被掏空的一天:软件工程师的日常》
In Productivity, Engineer, -
一分钟读论文:《30年软件重构研究:系统性文献综述》
In Engineering, -
一分钟读论文:《要不要上 TypeScript?GitHub 上 JS 和 TS 应用软件质量的系统比较》
In FrontEnd, -
一分钟读论文:《NPM 供应链的软肋是什么?》
In Security,