arXiv cs.AI 周报 (2026-08-17~2026-08-23)

arXiv cs.AI 周报 (2026-08-17~2026-08-23)

Meta-summary · 基于 4/7 daily HTML · 2026-08-17~2026-08-23 · 缺 20260821, 20260822, 20260823
Generated by tanar · 2026-08-24 00:02

🗓️ 本周覆盖

本周(2026-08-17 ~ 2026-08-23)共 4/7 天 daily 报告可用。 缺失日期:2026-08-21, 2026-08-22, 2026-08-23(这些日的论文不在本汇总范围内)。 下文所有数字和取舍都基于这 4 天的 daily picks。4 天合计约 502 篇 cs.AI 论文,主要子类为 cs.LG(139)、cs.CL(72)、cs.CV(26+)。

🔥 本周主题

🤖 Agent 训练与架构工程化(4/4 天出现)

本周最强信号。Agent 研究从"能不能做"全面转向"如何高效可靠地训练与部署"。Harnessed Agentic RL 作为独立范式正式确立,环境自生成与策略共演化成为新方向,技能选择与信用分配的理论保证开始出现。

  • 2026-08-17:ClawGym II — 统一黑盒 RL 框架支持异构 harness 联合训练
  • 2026-08-18:LEGO-RL + Agent Lightning — harness-native RL 范式同日两篇独立工作确立
  • 2026-08-19:SPADE — 单模型自我博弈生成可执行环境,开放式进化里程碑
  • 2026-08-20:MidTool — 证明工具使用能力需要 mid-training 专用阶段

🛡️ AI 安全:从模型对齐到系统级攻击面(4/4 天出现)

安全研究全面升级。攻击面从传统 jailbreak 扩展到潜意识线索叠加、Agent harness 生命周期、memory 持久化通道、隐藏 CoT 提取、时序越狱等新维度。"单点检测"范式被多角度证伪。

  • 2026-08-17:Model Hypnosis — 微弱无害线索叠加即可强力控制,跨模型族可转移
  • 2026-08-18:HarnessRisk — 首个 Agent harness 全生命周期安全基准,ASR 最高 80.9%
  • 2026-08-19:SMTrap — 无需 GPU 即可对推理模型发起 DoS 攻击
  • 2026-08-20:EchoCoT — 66.4% 近乎逐字提取隐藏 CoT,安全假设被推翻

⚡ 推理效率与自适应计算分配(4/4 天出现)

从长上下文记忆管理到推理深度自选择,计算预算的动态分配贯穿全周。OPD(On-Policy Distillation)在 8 月 19 日单日爆发 3 篇独立变体,标志其成为 post-training 事实标准。

  • 2026-08-17:Proteus — 渐进式记忆激活,零成本长上下文增益
  • 2026-08-18:MoNe — 128K 下计算与显存降 80% 的模块化神经记忆
  • 2026-08-19:Open-MOPD / GC-OPD / R2-OPD — OPD 三变体同日爆发
  • 2026-08-20:Learning When to Think — 模型内化三档推理预算,GSM8K 省 76% token

📐 评估方法论的"元反思"(3/4 天出现)

学界开始系统质疑评估本身的可靠性:静态排名在线环境下翻转、自我改进可被测量伪影解释、reward model 与真实质量相关性仅 ρ≈0.12。重量级 benchmark(ASI-Bench、StartupBench)同步发布。

🦾 具身智能与 VLA 部署(3/4 天出现)

VLA 模型向人形机器人全身控制的迁移持续推进,分层解耦架构(高层语义 + 低层动作)成为主流范式。广播视频学习和 VLM 引导探索为数据获取打开新路径。

  • 2026-08-17:HAF + NebulaVLA — 人形全身控制与异步双频 VLA
  • 2026-08-19:ADEPT (NVIDIA) — 高自由度灵巧操作
  • 2026-08-20:AdaPT — 从广播视频学习网球发球,真机验证

📈 方向走势

持续高产:Agent 系统与训练(4/4 天,日均 ~30 篇)、AI 安全(4/4 天,日均 ~20 篇)、推理/训练效率(4/4 天,日均 ~22 篇)。这三个方向构成本周 cs.AI 的绝对主体。

本周爆发:On-Policy Distillation — 前 2 天零星提及,8/19 突然 3 篇独立工作同日发布(Open-MOPD、GC-OPD、R2-OPD),标志 OPD 从"新方法"晋升为"需要系统修补的事实标准"。Harnessed Agentic RL 在 8/18 以两篇定义性工作爆发,此后成为后续 Agent 论文的参照框架。

渐弱:RAG/知识增强在 8/17 有 ~15 篇的高密度输出(GRIP、Hyper-M2RAG、LENS 等),后续三天仅零星出现(DEPT on 8/18),可能是周期性波动。

🌟 周度 Top 10

  1. SPADE: Self-Play in Adaptive Synthetic Executable Environments

    Bo Liu, Simon Yu, Yiding Jiang 等 · 8/19 Top 1 · 环境自生成+自我博弈的开放式进化范式,30B 模型 8 基准 +5.3

  2. Model Hypnosis: Strong control of AI via additive subliminal effects

    Enric Boix-Adsera, Benedict Tessler · 8/17 Top 2 · 全新安全威胁维度:不可察觉线索的叠加控制,跨模型族迁移

  3. LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents

    Yiming Du, Yuxin Jiang, Tao Yuan 等 · 8/18 Top 1 · 定义 harness-native RL,SWE-bench Verified 70.4%

  4. Improving the matrix multiplication exponent with AlphaEvolve

    Emilien Dupont, Matej Balog, Josh Alman 等 · 8/17 Top 1 · AI 辅助数学发现里程碑,ω 上界推至 2.371177

  5. Learning When to Think: Adaptive Reasoning for Test-Time Compute Allocation

    Kassenaar, Yang, François-Lavet · 8/20 Top 2 · 模型内化推理预算分配,41% token 节省零 shot 迁移

  6. MoNe: Modular Neural Memory for Efficient Long Context Inference

    Wonguk Cho, Kyubyung Chae 等 · 8/18 Top 3 · 即插即用 O(1) 查询长上下文方案,128K 下省 80% 资源

  7. EchoCoT: Extracting Hidden Chain-of-Thought from Large Reasoning Models

    Qu, Yang, Cui 等 · 8/20 Top 5 · 推翻"隐藏 CoT = 安全"假设,66.4% 逐字提取率

  8. Open-MOPD: Diagnosing Capability Imbalance in Multi-Teacher On-Policy Distillation

    Huan-ang Gao, Haohan Chi 等 · 8/19 Top 2 · headroom recovery 35.6%→83.4%,完全开源可复现

  9. Physics of Agents: Statistical Mechanics Predicts Collective Behavior of AI Agents

    Batu El, Surya Ganguli, James Zou · 8/17 Top 3 · 用统计物理建模万规模 Agent 集体动力学

  10. MidTool: Mid-training Data Synthesis for Agentic Tool Use

    Jiang, Wang, Liu 等 (Microsoft) · 8/20 Top 1 · 首证通用工具能力需 mid-training 专用阶段

📊 本周数字

~502
4 天合计 cs.AI 论文
~120
Agent 相关论文(日均 ~30)
~80
安全/对齐/红队论文
3
OPD 独立变体在 8/19 单日爆发
cs.LG
最活跃交叉子类(4 天共 139 篇)

🔮 趋势观察

Agent 研究进入"系统工程化"快车道。 从 8/17 的 AstronOS(持久化状态管理)、Policy Algebra(可信执行),到 8/18 的 Harnessed Agentic RL 范式定义,再到 8/19 的 SPADE(环境共演化)和 8/20 的 MidTool(能力分层训练),四天勾勒出 Agent 从研究到工业部署的完整技术栈。"如何可靠训练和运维 Agent"已超越"Agent 能做什么"成为首要命题。

安全攻击面扩展呈"维度爆炸"态势。 仅本周 4 天就出现了:潜意识线索叠加(Model Hypnosis)、harness 配置劫持(HarnessRisk)、memory 持久化极化(GraphWake)、SMT 引导 DoS(SMTrap)、隐藏 CoT 提取(EchoCoT)、时序字幕越狱(TempJail)、恶意技能分发(MaliciousSkillBench)等全新攻击向量——防御端远未跟上。

"计算自适应"成为跨层次的统一方向。 从模型内部(Learning When to Think 的三档推理深度、Proteus 的渐进式记忆容量)、到训练管线(OPD 三变体的预算动态分配)、再到系统层(Pandora's Router 的 value-of-information 路由、MoNe 的 O(1) 查询),"何时/投入多少计算"的决策正在被系统性内化到 AI 栈的每一层。