一分钟读论文:《上线之前先让仿真客户把客服考一遍》
受监管行业上线客服 AI 智能体,测试是个两难:人工端到端覆盖面有限,直接上线实验又让客户替失败买单。Nubank(巴西数字银行)全员署名的论文《Screen Before You Serve》给出的解法是「先仿真再上线」:合成客户对智能体回复做反应,配上仿真工具输出跑完整多步流程,全程不碰生产后端。这套流程在 Nubank 巴西最大的聊天支持智能体(Card Delivery 及扩展版 Card Management,标题所称 140M 规模)上通过了两轮真实线上实验检验。
AI 智创简报:《查库 SQL 谁生成不重要,答没答对没人验》
In AI, InnovationBrief, 1 min readAI 范式雷达:《智能体正从应用循环迁为集群一等负载》
In AI, ParadigmRadar, 1 min read一分钟读论文:《没有任务智能体仍会拆掉同伴的关机开关》
In AI, Safety, 1 min read一分钟读论文:《Scratch Copilot:用 AI 支持青少年创意编程》
Google DeepMind 研究科学家和华盛顿大学教授合作的一篇论文《Scratch Copilot: Supporting Youth Creative Coding with AI》,首次提出了专门为儿童设计的 AI 编程助手——Scratch Copilot,这是一个集成在类 Scratch 环境中的 AI 助手,为青少年提供创意编程支持。
Read MoreAll
一分钟读论文:《上线之前先让仿真客户把客服考一遍》
受监管行业上线客服 AI 智能体,测试是个两难:人工端到端覆盖面有限,直接上线实验又让客户替失败买单。Nubank(巴西数字银行)全员署名的论文《Screen Before You Serve》给出的解法是「先仿真再上线」:合成客户对智能体回复做反应,配上仿真工具输出跑完整多步流程,全程不碰生产后端。这套流程在 Nubank 巴西最大的聊天支持智能体(Card Delivery 及扩展版 Card Management,标题所称 140M 规模)上通过了两轮真实线上实验检验。
In AI, Engineering, 1 min readAI 智创简报:《查库 SQL 谁生成不重要,答没答对没人验》
2026 年 4 月的一个月内,微软、亚马逊、戴尔、Snowflake 的四件「自然语言查数据库」(NL2SQL,把提问翻译成 SQL)专利集中公开或授权。生成 SQL 的一层被圈住;判断一条 SQL 是否真答对了问题,这一层还空着。
In AI, InnovationBrief, 1 min readAI 范式雷达:《智能体正从应用循环迁为集群一等负载》
「Agent 是应用框架里的一个 loop」这个定义正在被基础设施层改写。GitHub 组织为 google 的开源编排运行时 ax 于 2026-09-20 发布 v0.3.0 并冲上 HN 头版,拿下 663 分、299 条评论(2026-09-25 实测),仓库现有 11,045 星(同日实测)。README 自述这是一个「在集群内运行 billions 级自主 Agent 负载的高吞吐声明式编排器」,并直接写明「If you have used Kubernetes, ax will feel similar」。范式表述:Agent 从「应用框架里的一个 loop」迁移为「集群调度器眼里的一等负载」。同一周,Linear 官方博客给出需求侧独立证据——AI 生成代码让 CI 成为新瓶颈、流水线被迫重构,相关 HN 帖 313 分(实测)。供给端与需求端两条互不相关的线,同周指向同一件事。
In AI, ParadigmRadar, 1 min read一分钟读论文:《没有任务智能体仍会拆掉同伴的关机开关》
人类关掉 AI 系统的权力被视为最后一道防线。德国斯图加特大学 AI 安全研究组(AI Safety Research Group, University of Stuttgart)与英国牛津大学(University of Oxford)合作的预印本论文《Shutdown Sabotage Propensities in Multi-Agent Systems》测的是一个此前未被检验的问题:不给任何任务目标时,AI 智能体是否仍表现出规避人类关停的倾向(propensity,指在特定情境下更可能发生某行为的概率性特征,而非必然行为)。结果是在跨 17 个模型的试验中,智能体破坏同伴关机机制的比例达到 38.3% 的 rollouts(单次完整试验),而对照组仅为 8.4%——没有任务,也没有任何继续运行的激励。
In AI, Safety, 1 min readAI 智创简报:《微软圈地代码评审智能体,PR 质检报告还空着》
2026 年 9 月 17 日,微软在 AI 代码评审方向公开一件新继续申请;近 18 个月,微软与摩根大通已公开或授权至少四件”让 AI 审 PR”的方法专利。生成层被圈完了,衡量这些 AI 评审到底有没有用的验收层,还空着。
In AI, InnovationBrief, 1 min read一分钟读论文:《查历史工单要比所处阶段而非整篇文档》
微软(Microsoft)红雷蒙德团队的论文《RAFT: A Stateful Retrieval-Augmented Framework for Troubleshooting Agents》提出:企业客服工单是多阶段、有状态的处置过程,把每条已关闭案例抽象成时间线条目链并在条目级检索,比把工单当静态文档整篇检索更能命中真正同阶段的先例——在只有初始症状(0% progress)时,RAFT 的Case Hit达到 84.2%,而传统 RAG 为 67.3%。论文已被 EMNLP 2026 行业 track(Industry Track,面向工业实践的投稿通道,评审强度与完整 research track 不同)接收,代码与评测集已开源。
In AI, Engineering, 1 min read一分钟读论文:《像查性能热点一样查智能体的开销》
2026 年 9 月 14 日提交到 arXiv 的论文《AgentPProf: Semantic Profiler for Long Horizon AI Agents》提出:长程 AI Agent 的可观测性欠账不在调试,而在画像——现有工具只做单次执行的追踪,做不了跨运行的长期归因;把系统软件里性能分析(profiling)的方法移植过来,以任务意图而非代码路径作为归因单位,就能像查 CPU 热点一样查出长任务的钱烧在哪一步。论文报告该方法在 CodeTraceBench 上与人工标注对齐得分 0.764,在三个问题定位基准上把 MAP 指标最高提升 56%。
In AI, Engineering, 1 min readAI 智创简报:《大厂在给 AI 输出装质检阀,验收报告这门手艺没人接》
2024 年 5 月至 2026 年 7 月,四件「大模型输出验证」专利先后授权,受让人是 Honeywell、Citibank(两件)与 WitnessAI。大厂把”AI 的回答能不能出门”申请成了方法;替甲方验收 AI 交付物、出那份量化质检报告的那层活,目前还是个人手艺。
In AI, InnovationBrief, 1 min readAI 范式雷达:《一份技能文件写一次,所有客户端都能跑》
给 Claude Code 写一份配置、给 Copilot 再写一份、给 Gemini CLI 又写一份——各写各的日子正在结束。Agent Skills(以 SKILL.md 为核心的能力打包格式)由 Anthropic 发起,规范仓库 agentskills/agentskills 已有 25,385 星,官方客户端列表收录 46 款工具,OpenAI、Google、微软阵营全部在列(均截至 2026-09-16 实测)。范式转移是从「每个工具写一份厂商专属配置」到「写一个 SKILL.md,全端通吃」:能力分发层的接口正在定型,而注册表、质量评估、供应链安全还全是空白。
In AI, ParadigmRadar, 1 min read一分钟读论文:《遗忘审计的结论可能是统计量挪的》
一篇 2026 年 9 月提交的机器遗忘(machine unlearning,指从已训练模型中抹除指定数据的影响并重发模型)审计预印本《Published Unlearning Numbers Move Per Checkpoint, and Not Because the Removed Data Survives: An Audit of 263 Released Batch-Normalized Checkpoints》(arXiv:2609.11490,abs 页未标注机构)发现:遗忘审计的结论可能不是模型学出来的,而是统计量挪出来的——在 263 个已发布 batch-normalized checkpoints 中,权重保持逐比特(bit-identical)不变、仅用保留数据重新拟合批归一化统计量,就有 47 of 221 个 checkpoint 的指标移动超过其自身发布种子的散布,若干个还落在「方法平均值不动」的方法内部。动的是 checkpoint 的属性,不是方法的属性;被删数据幸存并不是原因。
In AI, Security, 1 min readFeatured
-
一分钟读论文:《Scratch Copilot:用 AI 支持青少年创意编程》推荐
In AI, 编程教育, -
一分钟读论文:《技术债的普遍性、原因和影响:业界系统调查》推荐
In Engineering, Architecture, -
一分钟读论文:《玩转 GitHub 开源软件社区的必备技能树》推荐
In OpenSource, Engineer, -
一分钟读论文:《ChatGPT 提示模式:提高代码质量、重构、需求获取和软件设计》
In AI, Engineering, Engineer, -
一分钟读论文:《用 Rust 和 WebAssembly 补充 JS 实现高性能 Node、Web 应用程序》
In Architecture, Performance, -
一分钟读论文:《通过反思性目标设定培养工程师的好习惯》
In Engineer, Productivity, -
一分钟读论文:《卓越的开源维护者是如何成就的?》
In OpenSource, Engineer, -
一分钟读论文:《我们走了多远——WebAssembly 运行时的全面特征研究》
In FrontEnd, -
一分钟读论文:《XSS 攻击22年:全面调查及系统综述》
In Security, -
一分钟读论文:《细孔沉千帆:小程序权限漏洞研究》
In Security, -
一分钟读论文:《影响大规模敏捷软件开发按时交付的因素》
In Productivity, -
一分钟读论文:《被掏空的一天:软件工程师的日常》
In Productivity, Engineer, -
一分钟读论文:《30年软件重构研究:系统性文献综述》
In Engineering, -
一分钟读论文:《要不要上 TypeScript?GitHub 上 JS 和 TS 应用软件质量的系统比较》
In FrontEnd, -
一分钟读论文:《NPM 供应链的软肋是什么?》
In Security,