一分钟读论文:《近端文本梯度下降驱动的智能体技能自进化》

Aug 17, 2026 · 1 min read

香港科技大学与澳门大学的论文《SkillProx: Self-Evolving Agent Skills via Proximal Textual Gradient Descent》,针对智能体技能(由主指令文件 SKILL.md 和可选引用资源目录构成的结构化文本工件)提出受近端梯度下降(交替执行任务损失方向步与正则约束子问题求解的优化算法)启发的”前向-后向”双阶段框架:前向闭环诊断演化验证每次编辑的实际效果,后向效用感知近端精炼审计并收缩累积知识。在 SpreadSheetBench、WikiTQ 和 HiTab 三个基准上,SkillProx 相比最强基线 SkillGrad 平均提升约 3.0 个百分点,且分布外(OOD)泛化显著更稳:Qwen3.5-4B 下 SkillOpt 的 OOD 得分在 WikiTQ、HiTab 上分别跌至 26.0 和 16.0,SkillProx 则达到 78.5 与 69.2。

一分钟读论文:《Scratch Copilot:用 AI 支持青少年创意编程》

Google DeepMind 研究科学家和华盛顿大学教授合作的一篇论文《Scratch Copilot: Supporting Youth Creative Coding with AI》,首次提出了专门为儿童设计的 AI 编程助手——Scratch Copilot,这是一个集成在类 Scratch 环境中的 AI 助手,为青少年提供创意编程支持。

Read More

All

一分钟读论文:《近端文本梯度下降驱动的智能体技能自进化》

香港科技大学与澳门大学的论文《SkillProx: Self-Evolving Agent Skills via Proximal Textual Gradient Descent》,针对智能体技能(由主指令文件 SKILL.md 和可选引用资源目录构成的结构化文本工件)提出受近端梯度下降(交替执行任务损失方向步与正则约束子问题求解的优化算法)启发的”前向-后向”双阶段框架:前向闭环诊断演化验证每次编辑的实际效果,后向效用感知近端精炼审计并收缩累积知识。在 SpreadSheetBench、WikiTQ 和 HiTab 三个基准上,SkillProx 相比最强基线 SkillGrad 平均提升约 3.0 个百分点,且分布外(OOD)泛化显著更稳:Qwen3.5-4B 下 SkillOpt 的 OOD 得分在 WikiTQ、HiTab 上分别跌至 26.0 和 16.0,SkillProx 则达到 78.5 与 69.2。

In AI, Agent, 1 min read

一分钟读论文:《G0.5:单流自回归统一机器人推理与动作》

上海机器人公司银河通用(Galaxea)的论文《G0.5: One Autoregressive Stream for Robot Reasoning and Action》,提出预训练自回归视觉-语言-动作模型(VLA)G0.5:单一 transformer decoder 在同一 token 流中同时输出推理与动作。主流 VLA 配方把预训练视觉语言模型(VLM)当上下文编码器、另配独立 flow-matching 动作专家(通过回归向量场生成连续动作),使 VLM 只负责编码上下文;G0.5 让 VLM 直接成为决策者。相对主流配方,这是架构层面的改变而非训练技巧。真机微调成功率 76.7%,超过 π0.5 的 53.3% 和 GR00T-N1.7 的 24.4%;模型权重已开放,为社区验证这一路线提供了可复现起点。

In embodiedai, robotics, 1 min read

AI 智创简报:《Agent 纠错专利扎堆,一个人能做的护栏生意》

2026 年上半年集中公开的一批 Agent 专利,主题高度一致:让 Agent 记得住上次说过什么、别张口就编、出错了能自己爬起来。大厂圈的是平台,但这三件事的实现层薄到一个人一周就能做出可演示版本,接在别人的 API 调用链上收钱。

In AI, InnovationBrief, 1 min read

AI 范式雷达:《从代码补全到自主软件工程:Agentic Coding 的范式转移》

SWE-bench Verified 基准上,开源框架的成绩从 2023 年的不足 6% 跃升至 2025-2026 年的 50%-70%+,增幅超过 8 倍。这意味着 AI Agent 已经能够自主解决真实 GitHub Issue 中的复杂 Bug 修复任务——而这一切只用了不到三年时间。本文将带你理解 Agentic Coding 的核心原理、对比主流框架的适用场景,并给出从零搭建第一个自主编程 Agent 的实操路径。

In AI, ParadigmRadar, 3 mins read

一分钟读论文:《w-0:潜变量预测式世界动作模型实现人形机器人并发运动操作》

新加坡南洋理工大学、北京大学和北京智源研究院等机构合作的一篇论文w-0:潜变量预测式世界动作模型实现人形机器人并发运动操作 (w-0: A Latent Predictive World Action Model for Concurrent Humanoid Loco-Manipulation),提出了一种将未来视觉潜在预测与全身动作生成联合建模的新范式。该论文在 11 个真实家庭任务上持续优于 9 种基线方法,并发布了目前最大规模的人形家庭操作数据集 w-HOME(40+ 小时)。

In embodiedai, robotics, humanoid, 1 min read

一分钟读论文:《追踪错误生命周期以识别长程Agent轨迹中的关键失败》

清华大学和腾讯混元合作的一篇论文《TRAJDEBUG: Tracing Error Lifecycle to Identify Critical Failures in Long-Horizon Agent Trajectories》,提出了一种从被动调试到主动错误生命周期追踪的范式转移方法。该方法将关键错误检测分解为多粒度历史压缩、错误触发检测和因果归因三阶段流程,在诊断驱动的Agent改进中实现成功率提升10.80%,失败记忆迁移提升5.70%:

In AI, AgenticSystems, 1 min read

One Minute Read Paper Fedworld Scope Aware Federation Of Agent World Models

One-Minute Read Paper: FedWorld — Scope-Aware Federation of Agent World Models

In 1 min read

One Minute Read Paper Agentic Web Navigation Paradigm Shift

Agentic Web Navigation: From Passive Retrieval to Active Problem-Solving Paradigm Shift

In 7 mins read

一分钟读论文:《PAST-Bench:评估个人智能体递归自我改进的基础基准》

香港中文大学和阿里巴巴集团合作的一篇论文《PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents》,首次提出了针对个人 AI 智能体递归自我改进能力的系统性基准测试框架。该研究通过匹配的控制组设计隔离经验保留的因果效应,在 26 个任务族、204 个 episode 上评估了 7 个基础模型和 4 种 Agent 框架的跨会话能力演进表现:

In AI, AgentFoundationModels, 1 min read

One Minute Read Paper Magnet Detecting Cross Session Ai Misuse Through Capability Accumulation

One-Minute Read: Magnet — 通过能力累积检测跨会话 AI 滥用

In 1 min read

Featured