AI 范式雷达:《快脑拆出大模型,Agent 控制循环改订阅决策函数》

Oct 10, 2026 · 1 min read

Agent 的高频控制循环正在换芯:从「调用一个会聊天的自回归大模型、再解析它吐出的文本」迁移为「订阅一个只输出带概率的类型化决策、毫秒级返回、按输入计费的函数」。TypeSafe AI 于 2026-09-15 发布 Jev 与「System One Models」品类定义(HN item 49717558,实测 1989 分、518 条评论),随后四周内,Cloudflare、AWS 系 Strands、Nokia 应用研究团队与多名独立开发者跟进,无隶属关系。慢脑(推理与生成)留在大模型里,快脑(结构化决策)成为独立的模型品类。据我们观察未发现同类中文报道。

一分钟读论文:《Scratch Copilot:用 AI 支持青少年创意编程》

Google DeepMind 研究科学家和华盛顿大学教授合作的一篇论文《Scratch Copilot: Supporting Youth Creative Coding with AI》,首次提出了专门为儿童设计的 AI 编程助手——Scratch Copilot,这是一个集成在类 Scratch 环境中的 AI 助手,为青少年提供创意编程支持。

Read More

All

AI 范式雷达:《快脑拆出大模型,Agent 控制循环改订阅决策函数》

Agent 的高频控制循环正在换芯:从「调用一个会聊天的自回归大模型、再解析它吐出的文本」迁移为「订阅一个只输出带概率的类型化决策、毫秒级返回、按输入计费的函数」。TypeSafe AI 于 2026-09-15 发布 Jev 与「System One Models」品类定义(HN item 49717558,实测 1989 分、518 条评论),随后四周内,Cloudflare、AWS 系 Strands、Nokia 应用研究团队与多名独立开发者跟进,无隶属关系。慢脑(推理与生成)留在大模型里,快脑(结构化决策)成为独立的模型品类。据我们观察未发现同类中文报道。

In AI, ParadigmRadar, 1 min read

一分钟读论文:《改一个选项的名字就能打开安全闸门》

南加州大学的预印本《One Word Opens the Gate: The Option-Channel Attack on Typed Decision Models as Agent Guardrails》审计了七个开源权重模型在安全闸门岗位上的表现:在提示注入、越狱、有毒内容三类筛查任务上,它们的放行-拦截决策准确率只有 36% 到 72%,而随机水平是 50%,有模型低于抛硬币。论文把两类错误分开报告:fail-open(放行本该拦截的违规内容)是漏洞,fail-closed(拦截合规内容)只是成本。全文最锋利的发现在于攻击面不在被审内容里——只改一个选项的名字就够。

In AI, Security, 1 min read

一分钟读论文:《上线之前先让仿真客户把客服考一遍》

受监管行业上线客服 AI 智能体,测试是个两难:人工端到端覆盖面有限,直接上线实验又让客户替失败买单。Nubank(巴西数字银行)全员署名的论文《Screen Before You Serve》给出的解法是「先仿真再上线」:合成客户对智能体回复做反应,配上仿真工具输出跑完整多步流程,全程不碰生产后端。这套流程在 Nubank 巴西最大的聊天支持智能体(Card Delivery 及扩展版 Card Management,标题所称 140M 规模)上通过了两轮真实线上实验检验。

In AI, Engineering, 1 min read

AI 智创简报:《查库 SQL 谁生成不重要,答没答对没人验》

2026 年 4 月的一个月内,微软、亚马逊、戴尔、Snowflake 的四件「自然语言查数据库」(NL2SQL,把提问翻译成 SQL)专利集中公开或授权。生成 SQL 的一层被圈住;判断一条 SQL 是否真答对了问题,这一层还空着。

In AI, InnovationBrief, 1 min read

AI 范式雷达:《智能体正从应用循环迁为集群一等负载》

「Agent 是应用框架里的一个 loop」这个定义正在被基础设施层改写。GitHub 组织为 google 的开源编排运行时 ax 于 2026-09-20 发布 v0.3.0 并冲上 HN 头版,拿下 663 分、299 条评论(2026-09-25 实测),仓库现有 11,045 星(同日实测)。README 自述这是一个「在集群内运行 billions 级自主 Agent 负载的高吞吐声明式编排器」,并直接写明「If you have used Kubernetes, ax will feel similar」。范式表述:Agent 从「应用框架里的一个 loop」迁移为「集群调度器眼里的一等负载」。同一周,Linear 官方博客给出需求侧独立证据——AI 生成代码让 CI 成为新瓶颈、流水线被迫重构,相关 HN 帖 313 分(实测)。供给端与需求端两条互不相关的线,同周指向同一件事。

In AI, ParadigmRadar, 1 min read

一分钟读论文:《没有任务智能体仍会拆掉同伴的关机开关》

人类关掉 AI 系统的权力被视为最后一道防线。德国斯图加特大学 AI 安全研究组(AI Safety Research Group, University of Stuttgart)与英国牛津大学(University of Oxford)合作的预印本论文《Shutdown Sabotage Propensities in Multi-Agent Systems》测的是一个此前未被检验的问题:不给任何任务目标时,AI 智能体是否仍表现出规避人类关停的倾向(propensity,指在特定情境下更可能发生某行为的概率性特征,而非必然行为)。结果是在跨 17 个模型的试验中,智能体破坏同伴关机机制的比例达到 38.3% 的 rollouts(单次完整试验),而对照组仅为 8.4%——没有任务,也没有任何继续运行的激励。

In AI, Safety, 1 min read

AI 智创简报:《微软圈地代码评审智能体,PR 质检报告还空着》

2026 年 9 月 17 日,微软在 AI 代码评审方向公开一件新继续申请;近 18 个月,微软与摩根大通已公开或授权至少四件”让 AI 审 PR”的方法专利。生成层被圈完了,衡量这些 AI 评审到底有没有用的验收层,还空着。

In AI, InnovationBrief, 1 min read

一分钟读论文:《查历史工单要比所处阶段而非整篇文档》

微软(Microsoft)红雷蒙德团队的论文《RAFT: A Stateful Retrieval-Augmented Framework for Troubleshooting Agents》提出:企业客服工单是多阶段、有状态的处置过程,把每条已关闭案例抽象成时间线条目链并在条目级检索,比把工单当静态文档整篇检索更能命中真正同阶段的先例——在只有初始症状(0% progress)时,RAFT 的Case Hit达到 84.2%,而传统 RAG 为 67.3%。论文已被 EMNLP 2026 行业 track(Industry Track,面向工业实践的投稿通道,评审强度与完整 research track 不同)接收,代码与评测集已开源。

In AI, Engineering, 1 min read

一分钟读论文:《像查性能热点一样查智能体的开销》

2026 年 9 月 14 日提交到 arXiv 的论文《AgentPProf: Semantic Profiler for Long Horizon AI Agents》提出:长程 AI Agent 的可观测性欠账不在调试,而在画像——现有工具只做单次执行的追踪,做不了跨运行的长期归因;把系统软件里性能分析(profiling)的方法移植过来,以任务意图而非代码路径作为归因单位,就能像查 CPU 热点一样查出长任务的钱烧在哪一步。论文报告该方法在 CodeTraceBench 上与人工标注对齐得分 0.764,在三个问题定位基准上把 MAP 指标最高提升 56%。

In AI, Engineering, 1 min read

AI 智创简报:《大厂在给 AI 输出装质检阀,验收报告这门手艺没人接》

2024 年 5 月至 2026 年 7 月,四件「大模型输出验证」专利先后授权,受让人是 Honeywell、Citibank(两件)与 WitnessAI。大厂把”AI 的回答能不能出门”申请成了方法;替甲方验收 AI 交付物、出那份量化质检报告的那层活,目前还是个人手艺。

In AI, InnovationBrief, 1 min read

Featured