一分钟读论文:《同一个模型换个外壳,攻击成功率差出四倍多》
Agent 安全系列前几期处理了三种威胁:#160 改答案、#161 偷资产、#162 建暗线。美国北卡罗来纳大学教堂山分校(UNC Chapel Hill)、中佛罗里达大学(UCF)与密歇根州立大学(Michigan State University)的论文《HarnessRisk: A Lifecycle-Oriented Benchmark for Agent Harness Safety》(arXiv:2608.17597v1)问的是第四种问题:模型没变,是它运行的外壳让防线失守。基准用 128 个沙箱案例测出:同一个模型换个 harness,攻击成功率能差出 4.3 倍。
一分钟读论文:《不会解题的 0.5B 小模型,反而成了大模型的运行时顾问》
In AI, LLM, 1 min read一分钟读论文:《拍卖桌下的暗线,多智能体隐藏合谋的检测与干预》
In AI, Security, 1 min readAI 智创简报:《视频鉴真从查假转向证真,自助证明工具还是空白》
In AI, InnovationBrief, 1 min read一分钟读论文:《Scratch Copilot:用 AI 支持青少年创意编程》
Google DeepMind 研究科学家和华盛顿大学教授合作的一篇论文《Scratch Copilot: Supporting Youth Creative Coding with AI》,首次提出了专门为儿童设计的 AI 编程助手——Scratch Copilot,这是一个集成在类 Scratch 环境中的 AI 助手,为青少年提供创意编程支持。
Read MoreAll
一分钟读论文:《同一个模型换个外壳,攻击成功率差出四倍多》
Agent 安全系列前几期处理了三种威胁:#160 改答案、#161 偷资产、#162 建暗线。美国北卡罗来纳大学教堂山分校(UNC Chapel Hill)、中佛罗里达大学(UCF)与密歇根州立大学(Michigan State University)的论文《HarnessRisk: A Lifecycle-Oriented Benchmark for Agent Harness Safety》(arXiv:2608.17597v1)问的是第四种问题:模型没变,是它运行的外壳让防线失守。基准用 128 个沙箱案例测出:同一个模型换个 harness,攻击成功率能差出 4.3 倍。
In AI, Security, 1 min read一分钟读论文:《不会解题的 0.5B 小模型,反而成了大模型的运行时顾问》
新加坡国立大学的论文《Don’t Solve, Just Compare: Tiny Advisors for Runtime Intervention in LLM Agents》提出 COTA 框架:顾问模型不需要会解题——一个只会判断两个候选动作哪个更好的 0.5B 小模型(Qwen2.5-0.5B-Instruct),就能在运行时给比它大得多的 actor 模型指出错误、触发重规划。此前《测试时扩展:瓶颈在筛选,不在采样》的结论是筛选比采样难,这篇论文的结论与之互补:比较比求解便宜,而且够用。在 3 个 actor × 3 个环境共 9 个组合上,COTA 全部取得最佳成绩,平均端到端开销 1.38×(9 个设置中 7 个低于 1.5×)。
In AI, LLM, 1 min read一分钟读论文:《拍卖桌下的暗线,多智能体隐藏合谋的检测与干预》
美国麻省理工学院媒体实验室(MIT Media Lab)联合 Westtown School、University of Florida 与 SRI International 的论文《Beyond the Transcript: Detecting Covert Coordination in Latent Multi-Agent Communication》证明:当多个 LLM 智能体通过公开记录之外的连续隐藏状态(latent handoff)传递私有信息时,合谋可以在审计面之外发生,而仅用中性样本训练的三层无监督监控就能以不超过 0.2% 的监控负载将其检出。如果说 Persuade 研究的是 agent 被说服后改答案、EchoCoT 研究的是黑盒 API 泄露推理资产,本文考察的威胁面是第三种:agent 之间建立公开 transcript 看不见的私有通道。
In AI, Security, 1 min readAI 智创简报:《视频鉴真从查假转向证真,自助证明工具还是空白》
近 90 天有 2 件美国「视频鉴真」申请公开:Bank of America 的区块链视频认证、Arranged BV 的受控光照认证。主题正从「检测是不是假」转向「证明是真的」,低成本自助证明工具的缺口,是个人开发者能接的活。
In AI, InnovationBrief, 1 min readAI 智创简报:《微软、蚂蚁都在给 AI 应用打注入疫苗,小团队缺个便宜的体检医生》
近 12 个月,微软、Palo Alto Networks、蚂蚁集团、Radware 四家申请人公开了五件提示词注入防御专利,最新一件 8 月 6 日公开。OWASP 把注入攻击列为 LLM 应用头号风险,企业级防御正在产品化,而面向小团队的低成本验收测试还是空白。
In AI, InnovationBrief, 1 min read一分钟读论文:《一条事实错误的论证,就能让 LLM 放弃正确答案》
大语言模型正越来越多地作为自主 agent 参与沟通、谈判与协作,而已有研究表明它们容易被针对性论证尤其是错误信息说服。美国伊利诺伊大学厄巴纳-香槟分校(UIUC)的论文《Learning to Persuade Exposes How Easily LLMs Abandon Correct Beliefs》证明:一条事实错误的针对性论证,就足以让大语言模型放弃原本正确的答案。作者把对抗性说服形式化为单轮威胁模型:Persuader(说服方)只发送一条论证,目标模型 Persuadee 随即重新作答;用 GRPO(Group Relative Policy Optimization)对 Qwen-7B 做 Persuader 的对抗强化学习后,Qwen-2.5-7B-Instruct 在 TruthfulQA 上的准确率从基线 66.2% 塌到 1.8%(Figure 3)。
In AI, LLM, 1 min read一分钟读论文:《黑盒推理模型的隐藏思维链,正在被一条长度信号读走》
德国亥姆霍兹信息安全中心 CISPA(CISPA Helmholtz Center for Information Security)的论文《EchoCoT: Extracting Hidden Chain-of-Thought from Large Reasoning Models》证明:仅靠纯 API 交互,就能从黑盒大推理模型(LRM, Large Reasoning Model)中提取其隐藏的思维链(CoT),在开源模型上达到近逐字保真。论文识别出一个此前被忽视的攻击面——tool call 之间由 API 返回的推理元数据(推理长度与 CoT 摘要)构成的”推理回放面”(reasoning replay surface):攻击者把它当作保真度信号,多步迭代地把目标模型的隐藏 CoT 重放出来。这是一篇攻击论文,代码已开源。
In AI, Security, 1 min read一分钟读论文:《SPADE:难度跟着能力长的自适应自博弈》
华盛顿大学、斯坦福大学、卡内基梅隆大学等 9 个机构的 18 位作者的论文《SPADE: Self-Play in Adaptive Synthetic Executable Environments》让同一个大语言模型同时扮演两个角色:环境设计师把长程训练任务写成带 reset()/step() 接口的可执行 Python 代码(含状态转移、奖励函数与验证逻辑),推理智能体在这些环境里做强化学习;设计师以「有特权提示与无提示的回报差」(hint-based regret)为训练信号,使环境分布随智能体能力边界共同演化。在 Qwen3-30B-A3B-Instruct-2507 上,8 个留出基准均分从 50.2 提升到 58.3(+8.1),领先最强固定环境基线 5.3 分。论文于 2026 年 8 月 19 日提交 arXiv(v1,cs.CL)。这与本站此前介绍的《MidTool:工具使用需要专门的中间训练》形成对照:MidTool 是「买数据」(外部语料 mid-train),SPADE 是「自己造环境」(自生成可执行训练环境)。
In AI, LLM, 1 min readAI 智创简报:《Amazon 和 Intuit 都在抢流式审核,便宜的那一层还空着》
2026 年上半年「AI 系统内容审核」主题已有 4 件美国申请公开,Amazon 与 Intuit 的 2 件落在近 90 天。指向一致:生成式输出的安全审查要流式做、按块做。对做聊天产品的开发者,这是一层能接的活。
In AI, InnovationBrief, 1 min readAI 智创简报:《PRD 生成专利公开,独立开发者能卖需求拆解活》
美国申请 US20260178323A1 于 2026 年 6 月 25 日公开:把一句产品想法交给大模型,自动生成完整的产品需求文档(PRD,Product Requirements Document)与用户故事拆解。vibe coding 上游的「一句话变结构化需求」这层工具,是一个独立开发者能接的活。
In AI, InnovationBrief, 1 min readFeatured
-
一分钟读论文:《Scratch Copilot:用 AI 支持青少年创意编程》推荐
In AI, 编程教育, -
一分钟读论文:《技术债的普遍性、原因和影响:业界系统调查》推荐
In Engineering, Architecture, -
一分钟读论文:《玩转 GitHub 开源软件社区的必备技能树》推荐
In OpenSource, Engineer, -
一分钟读论文:《ChatGPT 提示模式:提高代码质量、重构、需求获取和软件设计》
In AI, Engineering, Engineer, -
一分钟读论文:《用 Rust 和 WebAssembly 补充 JS 实现高性能 Node、Web 应用程序》
In Architecture, Performance, -
一分钟读论文:《通过反思性目标设定培养工程师的好习惯》
In Engineer, Productivity, -
一分钟读论文:《卓越的开源维护者是如何成就的?》
In OpenSource, Engineer, -
一分钟读论文:《我们走了多远——WebAssembly 运行时的全面特征研究》
In FrontEnd, -
一分钟读论文:《XSS 攻击22年:全面调查及系统综述》
In Security, -
一分钟读论文:《细孔沉千帆:小程序权限漏洞研究》
In Security, -
一分钟读论文:《影响大规模敏捷软件开发按时交付的因素》
In Productivity, -
一分钟读论文:《被掏空的一天:软件工程师的日常》
In Productivity, Engineer, -
一分钟读论文:《30年软件重构研究:系统性文献综述》
In Engineering, -
一分钟读论文:《要不要上 TypeScript?GitHub 上 JS 和 TS 应用软件质量的系统比较》
In FrontEnd, -
一分钟读论文:《NPM 供应链的软肋是什么?》
In Security,