[
  {
    "id": "arxiv-2609-11308",
    "title": "2AM: Grounding Agent-Side Memory as Guidance for Steerable Action Models in Long-Horizon Manipulation",
    "authors": [
      "Yutong Hu",
      "Fengjiao Chen",
      "Xuezhi Cao",
      "Renaud Detry"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本，v1",
    "arxiv_id": "2609.11308",
    "doi": "10.48550/arXiv.2609.11308",
    "links": {
      "paper": "https://arxiv.org/abs/2609.11308",
      "alphaxiv": "https://alphaxiv.org/abs/2609.11308"
    },
    "tags": [
      "VLA",
      "多模态感知与提示",
      "长时记忆"
    ],
    "figure": {
      "url": "content/images/2609.11308-representative.webp",
      "alt": "Figure 1",
      "label": "Figure 1",
      "paper_title": "2AM: Grounding Agent-Side Memory as Guidance for Steerable Action Models in Long-Horizon Manipulation",
      "source_url": "https://arxiv.org/html/2609.11308v1#S1.F1"
    },
    "summary": "贡献是把历史压缩成当前可执行的空间意图：Agent 输出子任务语言和可选的 grasp/place/move 二维提示；动作模型利用当前双视角 RGB 与机器人状态执行动作块。实验支持这种接口改善子目标推进和宽松成功，但 没有证明它解决了精确计数与停止：严格成功率 11.83%，略低于对齐复现基线的 12.25% 。因此，“记得过去”与“恰好完成并及时停止”应作为两个问题分别评估。",
    "insight": "贡献是把历史压缩成当前可执行的空间意图：Agent 输出子任务语言和可选的 grasp/place/move 二维提示；动作模型利用当前双视角 RGB 与机器人状态执行动作块。实验支持这种接口改善子目标推进和宽松成功，但**没有证明它解决了精确计数与停止：严格成功率 11.83%，略低于对齐复现基线的 12.25%**。因此，“记得过去”与“恰好完成并及时停止”应作为两个问题分别评估。",
    "pipeline": {
      "input": "Agent 接收全局任务、当前全局 RGB，以及整理后的“观测—命令—结果”历史；动作模型接收当前全局与腕部 RGB、机器人本体状态及 Agent 命令，不接收整段任务历史。",
      "process": "Agent 将目标身份、目的地、次数与阶段压缩为结构化命令。动作模型采用 Qwen3-VL-4B 视觉语言骨干与 flow-matching Action Expert，每次预测 16 步绝对末端执行器动作块。Agent 在执行短动作块后重新观察并更新历史摘要，形成闭环。论文实验的 Agent 名称写作 Qwen3.8-27B；模型发布及可获得性待独立核验。",
      "output": "16 步动作块，包含末端执行器绝对位姿和夹爪控制。部署不使用深度、在线分割掩码、物体位姿、标定三维几何或规划器替代执行任务运动；该限制不意味着离线训练标签也不使用几何信息。",
      "details": "**输入**：Agent 接收全局任务、当前全局 RGB，以及整理后的“观测—命令—结果”历史；动作模型接收当前全局与腕部 RGB、机器人本体状态及 Agent 命令，不接收整段任务历史。\n\n**过程**：Agent 将目标身份、目的地、次数与阶段压缩为结构化命令。动作模型采用 Qwen3-VL-4B 视觉语言骨干与 flow-matching Action Expert，每次预测 16 步绝对末端执行器动作块。Agent 在执行短动作块后重新观察并更新历史摘要，形成闭环。论文实验的 Agent 名称写作 Qwen3.8-27B；模型发布及可获得性待独立核验。\n\n**输出**：16 步动作块，包含末端执行器绝对位姿和夹爪控制。部署不使用深度、在线分割掩码、物体位姿、标定三维几何或规划器替代执行任务运动；该限制不意味着离线训练标签也不使用几何信息。\n\n#### 接口到底传什么\n\n提示点定义在当前 Agent 视角图像上，坐标归一化到 [0, 1000]²，原点在左上角。\n\n| 字段 | 传递的意图 | 有效期与边界 |\n| --- | --- | --- |\n| subtask language | 当前子任务与语义目标 | 提供动作语义，单独使用容易发生对象或目的地歧义 |\n| grasp_target | 当前应抓取的对象实例 | 抓住后应移除，避免过期抓取点将执行器拉回 |\n| place_target | 搬运后的目的地 | 可跨搬运过程保留，用于持续绑定目标位置 |\n| move_target | 近期夹爪移动方向的二维提示 | 不是完整轨迹、精确三维路点、姿态或持续时间指令 |\n\n#### 如何训练执行器读懂提示\n\n作者对示范轨迹进行离线标注：利用阶段、对象框或掩码、接触、对象运动和投影的末端执行器位置，确定性构造提示，不依赖 VLM 教师生成标签。grasp/place 用相关对象图像框中心；move 使用示范中未来 10–20 步的末端投影，临近轨迹结尾时截断。框中心是对象指向，不等于最佳物理接触点。\n\n训练动作窗口长 16 步，可以跨越子任务边界；使用非空条件 dropout（至少保留一种可用条件）、提示点空间高斯噪声和时间窗口抖动，以适应 Agent 漏给提示、位置不准和阶段切换不精确。论文没有通过完整的逐提示消融，将各项增强的独立贡献全部分离。[接口与训练：正文第 2–4 节](https://arxiv.org/html/2609.11308v1#S2)。"
    },
    "experiments": "LIBERO-Mem 共 10 个长程任务，包含重复动作、关系约束与遮挡。以下为论文表 3 的平均结果，单位均为百分比；“完成度”统计有序子目标推进比例，不是 episode 成功率。\n\n| 方法 | 严格成功率 Strict SR | 宽松成功率 Relaxed SR | 子目标完成度 Completion |\n| --- | ---: | ---: | ---: |\n| SlotSSM（已发表结果） | 0.00 | 未报告 | 14.80 |\n| 对齐复现基线（文中称 π0） | 12.25 | 37.42 | 70.79 |\n| 相同 Agent/动作模型，仅语言接口 | 7.25 | 19.42 | 53.72 |\n| 2AM | 11.83 | 63.00 | 76.29 |\n\nStrict SR 要求正确顺序、精确重复次数与及时停止：要求做三次却尝试第四次也算失败。Relaxed SR 允许在随后过度执行前已经达到完整有序目标；Completion 则允许只完成部分子目标。对齐复现使用相同 Qwen3-VL-4B 骨干、双 RGB 输入和 16 步动作块，不能把这一行写成官方原始 π0 权重的直接评测。\n\n相对对齐复现，2AM 的完成度提升 **5.50 个百分点**、宽松成功率提升 **25.58 点**，严格成功率却下降 **0.42 点**。相对同系统的仅语言接口，分别提升 **22.57、43.58、4.58 点**；这一控制更直接支持结构化空间提示的价值，仍不能单独归因于“记忆更强”。跨系统对比 SlotSSM 的 61.49 点完成度差距涉及更多配置差异。\n\n逐任务看，宽松成功率在 10/10 任务更高，完成度在 7/10 更高；对齐基线在重复运动任务 T1–T6 的严格成功更好，2AM 在关系/遮挡任务 T7–T10 更好。没有显著性检验依据时，不把平均数差异写成统计显著提升。[实验与表 3](https://arxiv.org/html/2609.11308v1#S6)。",
    "evidence_notes": "2026-09-14 已核对 arXiv 元数据、正文主要实验与对照；未运行复现实验。",
    "code_data_status": "截至本次核验，未发现官方代码、模型权重或扩展标注数据下载。基准为 LIBERO-Mem；Agent 的完整记忆整理提示词、运行依赖和训练配置的可复现性仍需核验。本卡片依据论文正文，未运行复现实验。",
    "limitations": "论文展示的失败包括抓取不精确、子任务选择错误与目的地绑定错误。二维提示无法直接表示遮挡后的力状态、精确三维接触和完整运动约束；Agent 错误会通过提示传给执行器。当前证据来自单一仿真基准，没有实机验证，也没有充分比较更强 Agent、各提示独立作用及更新频率—延迟权衡。\n\n严格成功率偏低表明停止条件和重复计数仍是瓶颈。方法证明的是 Agent 侧记忆与可引导执行器的一种可行接口，不是少样本学习新动力学、因果识别或通用长程操作已经解决。",
    "comments": "",
    "source_reports": [
      "report-37b94c4145"
    ],
    "deleted": false,
    "updated_at": "2026-09-14",
    "discussion": "值得借鉴的是“记忆的输出接口”，而非笼统地给动作模型增加历史。可将 2AM 的二维指向与 MaP-WAM 的视觉计划、MemCorr-DP 的几何条件并列，在同一 Agent、控制器、示例和计算预算下比较：对象身份保持、遮挡恢复、接触可达性以及精确终止。进一步加入持续 3D/4D 对应或接触状态是否有独立收益，属于阅读者提出的待检验假设，不能写成 2AM 已验证的结论。",
    "arxiv": {
      "published": "2026-09-10T09:35:56Z",
      "revised_at": "2026-09-10T09:35:56Z",
      "primary_category": "cs.RO"
    },
    "challenges": "长程操作需要记住目标对象、已完成阶段和重复次数。但高层 Agent 往往同时调用 VLA、几何工具和运动规划器，性能改善究竟来自记忆、额外传感器还是其他执行工具，很难归因；只给动作模型一句子任务语言，又可能无法明确“抓哪一个、放在哪里、往哪边移动”。",
    "motivation": "2AM 检验一种受约束的分工：**任务记忆全部放在 Agent 侧，所有任务相关运动交给同一个动作模型，通过更明确的视觉指向接口连接两者。** 这里的 episodically stateless 指执行器不持有跨阶段的 episode 历史，不是没有当前视觉或机器人本体状态。",
    "technical_approach": "**输入**：Agent 接收全局任务、当前全局 RGB，以及整理后的“观测—命令—结果”历史；动作模型接收当前全局与腕部 RGB、机器人本体状态及 Agent 命令，不接收整段任务历史。\n\n**过程**：Agent 将目标身份、目的地、次数与阶段压缩为结构化命令。动作模型采用 Qwen3-VL-4B 视觉语言骨干与 flow-matching Action Expert，每次预测 16 步绝对末端执行器动作块。Agent 在执行短动作块后重新观察并更新历史摘要，形成闭环。论文实验的 Agent 名称写作 Qwen3.8-27B；模型发布及可获得性待独立核验。\n\n**输出**：16 步动作块，包含末端执行器绝对位姿和夹爪控制。部署不使用深度、在线分割掩码、物体位姿、标定三维几何或规划器替代执行任务运动；该限制不意味着离线训练标签也不使用几何信息。\n\n#### 接口到底传什么\n\n提示点定义在当前 Agent 视角图像上，坐标归一化到 [0, 1000]²，原点在左上角。\n\n| 字段 | 传递的意图 | 有效期与边界 |\n| --- | --- | --- |\n| subtask language | 当前子任务与语义目标 | 提供动作语义，单独使用容易发生对象或目的地歧义 |\n| grasp_target | 当前应抓取的对象实例 | 抓住后应移除，避免过期抓取点将执行器拉回 |\n| place_target | 搬运后的目的地 | 可跨搬运过程保留，用于持续绑定目标位置 |\n| move_target | 近期夹爪移动方向的二维提示 | 不是完整轨迹、精确三维路点、姿态或持续时间指令 |\n\n#### 如何训练执行器读懂提示\n\n作者对示范轨迹进行离线标注：利用阶段、对象框或掩码、接触、对象运动和投影的末端执行器位置，确定性构造提示，不依赖 VLM 教师生成标签。grasp/place 用相关对象图像框中心；move 使用示范中未来 10–20 步的末端投影，临近轨迹结尾时截断。框中心是对象指向，不等于最佳物理接触点。\n\n训练动作窗口长 16 步，可以跨越子任务边界；使用非空条件 dropout（至少保留一种可用条件）、提示点空间高斯噪声和时间窗口抖动，以适应 Agent 漏给提示、位置不准和阶段切换不精确。论文没有通过完整的逐提示消融，将各项增强的独立贡献全部分离。[接口与训练：正文第 2–4 节](https://arxiv.org/html/2609.11308v1#S2)。"
  },
  {
    "id": "arxiv-2608-25956",
    "title": "4DGS-WAM: Bridging Past and Future with an Object-Centric World Action Model based on 4D Gaussian Splatting",
    "authors": [
      "Yueen Ma",
      "Zenglin Xu",
      "Irwin King"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本（首发 2026-08-26，作者标注 work in progress）",
    "arxiv_id": "2608.25956",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.25956",
      "alphaxiv": "https://alphaxiv.org/abs/2608.25956"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "流式与自回归",
      "第一视角与人类视频",
      "长时记忆"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.25956v1/figures/qualitative/future_prediction_examples.jpg",
      "alt": "4DGS-WAM: Bridging Past and Future with an Object-Centric World Action Model based on 4D Gaussian Splatting 代表图",
      "label": "Figure 4: Future prediction on KITTI-MOT scenes. The three rows use horizons h = 1 h{=}1 , h = 2 h{=}2 , and h = 1 h{=}1 , respectively. Left to right: ground truth, Epona, DriveDreamer-2, Envision4D, and policy-fed 4DGS-WAM. Epona and DriveDreamer-2 use the given future camera; Envision4D and 4DGS-WAM use their predicted cameras. The 4DGS-WAM panels include the frozen fusion underlay described in the text. 来源：论文图",
      "paper_title": "4DGS-WAM: Bridging Past and Future with an Object-Centric World Action Model based on 4D Gaussian Splatting",
      "source_url": "https://arxiv.org/html/2608.25956v1/figures/qualitative/future_prediction_examples.jpg"
    },
    "summary": "主流 WAM 在 2D 视频上操作：视觉质量好，但缺乏单对象的显式空间结构，且反复生成冗余背景。点云可表示 3D 但跨视角对齐/累积难。4DGS-WAM 的 Insight： 用显式 4D Gaussian Splatting 把动态对象与静态背景分开建模 ——策略预测未来 actor 动作，世界模型预测观测到的对象 splat 的变换；已观测到的静态背景无需为未来状态重新生成。这构成对象中心的、持久的 4D 表示，让过去帧承载背景、把生成预算留给对象。",
    "insight": "主流 WAM 在 2D 视频上操作：视觉质量好，但缺乏单对象的显式空间结构，且反复生成冗余背景。点云可表示 3D 但跨视角对齐/累积难。4DGS-WAM 的 Insight：**用显式 4D Gaussian Splatting 把动态对象与静态背景分开建模**——策略预测未来 actor 动作，世界模型预测观测到的对象 splat 的变换；已观测到的静态背景无需为未来状态重新生成。这构成对象中心的、持久的 4D 表示，让过去帧承载背景、把生成预算留给对象。",
    "pipeline": {
      "input": "2D 观测序列（多视角/单视角）。",
      "process": "4DGS 表示（动态对象 vs 静态背景分离）→ 策略网络（预测动作）→ 世界模型（预测动态对象 splat 的几何变换 + 残差运动/外观传输）→ 背景复用。",
      "output": "未来对象 splat 状态（可渲染为未来帧）与动作预测。",
      "details": "**输入**：2D 观测序列（多视角/单视角）。\n**过程**：4DGS 表示（动态对象 vs 静态背景分离）→ 策略网络（预测动作）→ 世界模型（预测动态对象 splat 的几何变换 + 残差运动/外观传输）→ 背景复用。\n**输出**：未来对象 splat 状态（可渲染为未来帧）与动作预测。"
    },
    "experiments": "评估了未来预测与过去重建（含定性结果），消融覆盖策略损失、世界模型几何损失、光度与总损失等。作者标注\"work in progress\"，证据等级以自报告实验为主。",
    "evidence_notes": "",
    "code_data_status": "本窗口未见代码/数据发布。",
    "limitations": "- 对象中心划分依赖初始分割质量；\n- 4DGS 表示在复杂光照/拓扑变化下的稳定性；\n- 与文本/语言条件 WAM 的衔接尚未展开。\n\n### 与知域的关系\n对象中心 4D 表示是\"流式生成（StreamingHOI 类）\"与\"世界模型\"的交汇点；与已收录的 iMaC（动作→运动与接触图）、Object-Centric World Models 可对照阅读。",
    "comments": "",
    "source_reports": [
      "report-a141624b1e"
    ],
    "deleted": false,
    "updated_at": "2026-08-31",
    "arxiv": {
      "published": "2026-08-26T16:16:57Z",
      "revised_at": "2026-08-26T16:16:57Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2608-25479",
    "title": "4DStreamCtrl: Interactive Video Generation with Online 4D Control",
    "authors": [
      "Shiqian Li",
      "Chenguo Lin",
      "Zhiguang Liu",
      "Yu Tang",
      "Jiarong Ou",
      "Rui Chen",
      "Yixin Zhu"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本（首发 2026-08-26，v2 2026-08-27）",
    "arxiv_id": "2608.25479",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.25479",
      "project": "https://4dstreamctrl.github.io/",
      "alphaxiv": "https://alphaxiv.org/abs/2608.25479"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "流式与自回归",
      "第一视角与人类视频",
      "视频生成",
      "长时记忆"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.25479v2/overview.png",
      "alt": "4DStreamCtrl: Interactive Video Generation with Online 4D Control 代表图",
      "label": "Figure 1: Overview of 4 D S t r e a m C t r l capabilities. (a) Motion transfer . Given a source video (top row), we extract decomposed 4D representations of camera motion, human motion, and background structure (middle row), which transfer to a new scene via image style transfer while preserving the original 3D-consistent motion (bottom row). (b) Joint 4D control . 3D point tracks, camera parameters, and depth are u… 来源：论文图",
      "paper_title": "4DStreamCtrl: Interactive Video Generation with Online 4D Control",
      "source_url": "https://arxiv.org/html/2608.25479v2/overview.png"
    },
    "summary": "现有交互视频控制在三个维度各自残缺：相机参数法只能动视角、2D 轨迹法忽略深度与遮挡、3D 方法仅离线固定长度—— 没有一种同时做到\"相机+物体 3D 一致控制 + 实时流式生成\" 。4DStreamCtrl 的 Insight：把相机运动、物体轨迹、深度统一进 单一 3D 点轨迹表示 ，一个模型在单次前向中同时做联合相机与物体控制、深度编辑、运动迁移；用 in-the-wild 视频挖掘 3D 运动监督（OpenVidHD-Motion）并配两阶段训练（3D 运动条件视频模型 + 流式蒸馏）实现交互式流式 4D 控制。",
    "insight": "现有交互视频控制在三个维度各自残缺：相机参数法只能动视角、2D 轨迹法忽略深度与遮挡、3D 方法仅离线固定长度——**没有一种同时做到\"相机+物体 3D 一致控制 + 实时流式生成\"**。4DStreamCtrl 的 Insight：把相机运动、物体轨迹、深度统一进**单一 3D 点轨迹表示**，一个模型在单次前向中同时做联合相机与物体控制、深度编辑、运动迁移；用 in-the-wild 视频挖掘 3D 运动监督（OpenVidHD-Motion）并配两阶段训练（3D 运动条件视频模型 + 流式蒸馏）实现交互式流式 4D 控制。",
    "pipeline": {
      "input": "源视频 + 3D 点轨迹控制（相机/物体/深度）。",
      "process": "3D 运动条件视频模型（per-track 正弦嵌入、潜在网格光栅化、track/depth 分支融合、参数高效微调、两阶段课程）→ 流式蒸馏（ODE 对生成、DMD 对抗蒸馏）→ 在线 3D 控制。",
      "output": "受控未来的流式视频。",
      "details": "**输入**：源视频 + 3D 点轨迹控制（相机/物体/深度）。\n**过程**：3D 运动条件视频模型（per-track 正弦嵌入、潜在网格光栅化、track/depth 分支融合、参数高效微调、两阶段课程）→ 流式蒸馏（ODE 对生成、DMD 对抗蒸馏）→ 在线 3D 控制。\n**输出**：受控未来的流式视频。"
    },
    "experiments": "联合物体与相机控制、运动迁移、交互式流式控制均有实验；消融覆盖 3D vs 2D 条件、motion head、训练课程、蒸馏、随机种子、控制点数量、attention sink。局限：依赖单目 3D 估计、固定密度轨迹表示、流式学生与教师存在 gap。证据等级：论文实验直接支持；单目估计噪声对其评测的影响需注意。",
    "evidence_notes": "",
    "code_data_status": "项目页上线；数据与代码发布状态待确认。",
    "limitations": "- 单目 3D 估计作为监督的噪声传导；\n- 固定密度轨迹表示限制长程/大位移控制；\n- 流式学生与教师的质量差距。\n\n### 与知域的关系\n与\"流式生成（StreamingHOI）\"关注方向直接对应，是交互式流式视频生成的代表；与已收录 Causal Forcing++、LongLive、Stream4D 同属流式生成主线，并叠加 3D 轨迹控制维度。",
    "comments": "",
    "source_reports": [
      "report-a141624b1e"
    ],
    "deleted": false,
    "updated_at": "2026-08-31",
    "arxiv": {
      "published": "2026-08-26T07:49:39Z",
      "revised_at": "2026-08-27T05:39:42Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "arxiv": {
      "published": "2026-08-13T16:40:35Z",
      "revised_at": "2026-09-03T12:16:19Z",
      "primary_category": "cs.AI"
    },
    "arxiv_id": "2608.13456",
    "authors": [
      "Avinash Kori",
      "Fabrizio Russo"
    ],
    "code_data_status": "- 版本很新且未同行评审；应低于正式会议论文置信度使用。未来工作部分也承认需发展具体算法、经验测试和对 partial observability 的扩展。\n\n---",
    "comments": "",
    "deleted": false,
    "doi": "",
    "evidence_notes": "- **作者明确主张：** CWM 应连接感知、实体/关系表征、结构、干预和 utility，而不是只做 next-frame prediction。\n- **论文提供的支持：** 定义、命题与文献统一；没有新经验验证。\n- **阅读判断：** 很适合作为本课题的概念规范和审稿清单，但其中“统一”仍是 proposal，算法实现、部分可观测、latent confounding 和真实评测均待完成。",
    "experiments": "**无实证实验。**\n\n这是一个 formal / conceptual paper，不应把它当成 empirical SOTA 方法。",
    "figure": {
      "url": "https://arxiv.org/html/2608.13456v1/figures/Causal_Ladder_of_World_Models.png",
      "alt": "A Unifying Perspective on Causal World Models Fig. 1: causal ladder",
      "label": "A Unifying Perspective on Causal World Models，Fig. 1，从预测到干预与反事实能力的世界模型因果阶梯。来源：Fig. 1 原图 PNG",
      "paper_title": "A Unifying Perspective on Causal World Models: From Observations to Representations to Structure",
      "source_url": "https://arxiv.org/html/2608.13456v1/figures/Causal_Ladder_of_World_Models.png"
    },
    "id": "arxiv-2608-13456",
    "insight": "这篇不是一个新的 SOTA model，而是一篇**非常新的理论/概念框架论文**，对“什么才应该叫 Causal World Model”很有价值。\n\n作者认为 world model 不应仅仅能生成 plausible future，而应捕获：\n\n- entity properties；\n- entity–entity interactions；\n- entity–environment interactions；\n- action / intervention 下的 transition；\n- 支持 decision-making 所需的 utility / task structure。\n\n论文把 CWM 从 observation 一层层提升到：\n\n\\[\nx_t\n\\rightarrow\nv_t\n\\rightarrow\nr_t\n\\rightarrow\nG_r\n\\]\n\n其中：\n\n- \\(x_t\\)：原始 observation；\n- \\(v_t\\)：entity-level representation；\n- \\(r_t\\)：structured relational state；\n- \\(G_r\\)：causal relational structure。\n\n其核心价值是明确区分：\n\n> **predictive dynamics ≠ identified causal dynamics**。\n\n尤其重要的是，论文指出：\n\n\\[\nP(r_{t+1}\\mid r_t,a_t)\n\\]\n\n只有在满足 consistency、positivity，以及 action randomized 或 no-unmeasured-confounding 等条件下，才能被解释成：\n\n\\[\nP(r_{t+1}\\mid r_t;do(a_t=a))\n\\]\n\n这对当前大量“action-conditioned world model = causal world model”的说法是非常重要的校正。",
    "limitations": "- 理论/框架性工作，尚未证明实际视觉 world model 能满足其识别条件；\n- entity / relational representations 如何从真实图像自动学习仍是开放问题；\n- 对真实机器人和 3D/4D world state 没有实验验证。\n\n**阅读判断**：  \n如果你要写 Causal HOI World Model 的 motivation，这篇非常值得作为“概念基准”：它帮助你避免把普通 action-conditioned prediction 直接说成 causal inference。\n\n---",
    "links": {
      "paper": "https://arxiv.org/abs/2608.13456",
      "alphaxiv": "https://alphaxiv.org/abs/2608.13456"
    },
    "pipeline": {
      "input": "- 没有实验、数据集、baseline、消融或代码。 它是观点与形式化框架论文，不应作为实证 SOTA 引用。",
      "process": "- 论文明确讨论 causal sufficiency：缺失共同原因会使关系学习混杂；不能直接在 raw pixels 上假设有可解释的 pixel-level causal DAG。",
      "output": "- 强 identifiability 在高维世界中往往不现实，论文主张以可保持决策接口的等价类为目标。",
      "details": "```text\nraw observation x_t\n  -> encoder phi\nentity-indexed representation v_t\n  -> relational map psi\nrelational state r_t (diagonal: attributes; off-diagonal: relations)\n  -> structured transition / intervention model\nfuture state, counterfactual rollout, utility-aware decision\n```\n\n论文将世界模型写为包含观测、动作、关系状态、transition 与 utility 的组合对象，并区分 observation、intervention、counterfactual 三层能力（原文 Definition 3、Fig. 1）。\n\n### 证据范围\n\n- **没有实验、数据集、baseline、消融或代码。** 它是观点与形式化框架论文，不应作为实证 SOTA 引用。\n- 论文明确讨论 causal sufficiency：缺失共同原因会使关系学习混杂；不能直接在 raw pixels 上假设有可解释的 pixel-level causal DAG。\n- 强 identifiability 在高维世界中往往不现实，论文主张以可保持决策接口的等价类为目标。"
    },
    "publication": "2026，arXiv preprint",
    "source_reports": [
      "report-554de78a93",
      "report-6fa37648ba",
      "report-ce5d8128c6"
    ],
    "summary": "论文： A Unifying Perspective on Causal World Models: From Observations to Representations to Structure 作者： Avinash Kori, Fabrizio Russo 年份： 2026，arXiv preprint 入口： arXiv",
    "tags": [
      "3D/4D",
      "因果与反事实",
      "对象与可供性"
    ],
    "title": "A Unifying Perspective on Causal World Models: From Observations to Representations to Structure",
    "updated_at": "2026-08-31",
    "year": 2026
  },
  {
    "id": "arxiv-2609-05892",
    "title": "A4A: Cross-Embodiment Transfer of Action-Oriented 4D Affordances from Human Demonstrations",
    "authors": [
      "Yifan Han",
      "Litao Liu",
      "Yuqi Gu",
      "Ye Lu",
      "Hanqing Wang",
      "Sidney Wai",
      "Ishaan Myrie",
      "Qi Zhang",
      "Jingjin Yu",
      "Gen Li"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本，v1",
    "arxiv_id": "2609.05892",
    "doi": "10.48550/arXiv.2609.05892",
    "links": {
      "paper": "https://arxiv.org/abs/2609.05892",
      "project": "https://ru-arcl.github.io/a4a/",
      "code": "https://github.com/ru-arcl/a4a",
      "alphaxiv": "https://alphaxiv.org/abs/2609.05892"
    },
    "tags": [
      "HOI",
      "对象与可供性",
      "跨本体迁移",
      "预训练与扩展律"
    ],
    "figure": {
      "url": "content/images/2609.05892-representative.webp",
      "alt": "Figure 2",
      "label": "Figure 2",
      "paper_title": "A4A: Cross-Embodiment Transfer of Action-Oriented 4D Affordances from Human Demonstrations",
      "source_url": "https://arxiv.org/html/2609.05892v1#S3.F2"
    },
    "summary": "A4A把人类视频中可迁移的监督定义为“任务条件下交互相关 3D 点未来如何移动”，而不是人体关节或外观。该表示同时携带对象几何、运动方向和作用位置，并弱化人手与机器人末端执行器的形态差异。",
    "insight": "A4A把人类视频中可迁移的监督定义为“任务条件下交互相关 3D 点未来如何移动”，而不是人体关节或外观。该表示同时携带对象几何、运动方向和作用位置，并弱化人手与机器人末端执行器的形态差异。",
    "pipeline": {
      "input": "人类 HOI 视频/RGB-D 演示、语言任务和机器人观测。",
      "process": "GroundingDINO、SAM2、CoTracker3 与深度修正提取交互对象的 3D 点轨迹；预训练阶段用查询点替换机器人状态，并以未来点运动替换动作目标；微调时恢复机器人本体和动作接口。",
      "output": "预测的 4D affordance 轨迹，以及经该预训练初始化的机器人动作策略。",
      "details": "**输入**：人类 HOI 视频/RGB-D 演示、语言任务和机器人观测。\n\n**过程**：GroundingDINO、SAM2、CoTracker3 与深度修正提取交互对象的 3D 点轨迹；预训练阶段用查询点替换机器人状态，并以未来点运动替换动作目标；微调时恢复机器人本体和动作接口。\n\n**输出**：预测的 4D affordance 轨迹，以及经该预训练初始化的机器人动作策略。"
    },
    "experiments": "LIBERO-Object 10 个任务使用 500 条演示、每任务 50 次评估。平均成功率从 Octo 28.2% 提升到 57.2%，OpenVLA 66.4% 到 76.4%，OpenVLA-OFT 98.0% 到 98.6%，\\(\\pi_0\\) 77.8% 到 87.8%，\\(\\pi_{0.5}\\) 94.0% 到 96.0%。多架构一致增益支持表示可迁移，但高基线模型存在天花板效应。真实任务每技能 100 个演示、10 次 rollout，样本规模不足以稳定比较小差异。 [正文实验与表格](https://arxiv.org/html/2609.05892v1)。",
    "evidence_notes": "2026-09-14 已核对 arXiv 元数据、正文主要实验与对照；未运行复现实验。",
    "code_data_status": "官方仓库含 code 与 docs 目录；资源入口存在，完整训练复现尚未运行。 以上状态核验于 2026-09-14；入口和目录存在不等于已经运行复现实验。",
    "limitations": "表示依赖检测、分割、跟踪与深度估计；遮挡、薄物体、透明反光表面和快速接触会产生级联误差。未来点轨迹描述运动后果，但不直接包含力、摩擦或可执行抓取约束。",
    "comments": "",
    "source_reports": [
      "report-37b94c4145"
    ],
    "deleted": false,
    "updated_at": "2026-09-14",
    "discussion": "该工作直接连接从人类视频学习、4D HOI 与 WAM，可作为 HarmoHOI/StreamingHOI 类几何表示进入机器人控制的参考接口。",
    "arxiv": {
      "published": "2026-09-05T05:23:29Z",
      "revised_at": "2026-09-05T05:23:29Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2609-22332",
    "title": "AffordanceWAM: Affordance-Aware Joint World-Action Modeling for Robot Manipulation",
    "authors": [
      "Jiadi You",
      "Qize Yu",
      "Yue Chen",
      "Minghong Cai",
      "Zhide Zhong",
      "Yuran Wang",
      "Bowen Ping",
      "Jiaqi Liang",
      "Zhenhao Shen",
      "Haodong Yan",
      "Yinchuan Li",
      "Ruihai Wu",
      "Xiaojuan Qi",
      "Yingcong Chen"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本",
    "arxiv_id": "2609.22332",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2609.22332",
      "project": "https://alexyd2001.github.io/AffordanceWAM",
      "alphaxiv": "https://alphaxiv.org/abs/2609.22332"
    },
    "tags": [
      "World Action Model",
      "对象与可供性",
      "机器人学习",
      "跨本体迁移"
    ],
    "figure": {
      "url": "content/images/2609.22332-main.webp",
      "alt": "Figure 2：世界专家预测 RGB 和可供性，动作专家通过受限注意力读取世界特征",
      "label": "Figure 2 · 世界专家预测 RGB 和可供性，动作专家通过受限注意力读取世界特征",
      "paper_title": "AffordanceWAM: Affordance-Aware Joint World-Action Modeling for Robot Manipulation",
      "source_url": "https://arxiv.org/html/2609.22332v2/Pipeline.png"
    },
    "summary": "AffordanceWAM 用对象中心的时空 affordance 作为共享目标：预测哪些物体与任务相关、哪些局部区域可交互，再据此生成动作。关键可检验主张是 affordance 是否真正改变人类数据对机器人学习的作用。",
    "insight": "AffordanceWAM 用对象中心的时空 affordance 作为共享目标：预测哪些物体与任务相关、哪些局部区域可交互，再据此生成动作。关键可检验主张是 affordance 是否真正改变人类数据对机器人学习的作用。",
    "pipeline": {
      "input": "视觉历史、语言任务和机器人本体状态；训练数据包括无机器人动作标签的人类视频与带动作的机器人轨迹。",
      "process": "World Expert 用视频 DiT 联合预测未来 RGB、Scalar Affordance 和 Affordance Heatmap；独立 Action Expert 逐层读取 RGB 与 Scalar Affordance 隐特征，联合 flow matching 生成连续动作。",
      "output": "未来外观、交互相关区域和机器人 action chunk。",
      "details": "**过程**：World Expert 用视频 DiT 联合预测未来 RGB、Scalar Affordance 和 Affordance Heatmap；独立 Action Expert 逐层读取 RGB 与 Scalar Affordance 隐特征，联合 flow matching 生成连续动作。\n\n- **输入**：视觉历史、语言任务和机器人本体状态；训练数据包括无机器人动作标签的人类视频与带动作的机器人轨迹。\n- **过程**：World Expert 用视频 DiT 联合预测未来 RGB、Scalar Affordance 和 Affordance Heatmap；独立 Action Expert 逐层读取 RGB 与 Scalar Affordance 隐特征，联合 flow matching 生成连续动作。\n- **输出**：未来外观、交互相关区域和机器人 action chunk。\n\nMasked Joint Self-Attention 阻断 Action→World，也阻断 Affordance Heatmap→Action，因为后者含较多 RGB 外观，可能成为额外外观捷径。人类数据监督三个 World 流，机器人数据额外监督动作，不要求把人类动作重定向成机器人关节控制。掩码说明计算依赖，不代表结构因果识别。[方法 §3](https://arxiv.org/html/2609.22332#S3)\n\n### 方法细节与实现\n\n**三种未来目标的区别。**RGB 描述场景外观，Scalar Affordance 是 [0,1] 的空间场，强调任务相关对象及交互区域；Affordance Heatmap 则把该场叠加到 RGB，保留交互位置与视觉背景的关系。标量场有独立可训练 codec 和像素级 MSE 重建损失，RGB/热图共用冻结视频编码器，三流在时间潜变量上对齐。\n\n**注意力的前向通路与梯度。**动作读取 RGB 与标量 affordance 的逐层特征；热图不能直接或经中间 RGB/标量 token 间接向动作传递前向特征。但热图预测损失仍可通过训练梯度塑造共享世界特征。动作对 RGB 的访问一直保留，所以该掩码减少外观捷径，不等于彻底消除 RGB 依赖，更不是结构因果图。\n\n**分阶段训练和推理。**先以世界预测热身，再逐步引入机器人动作监督；人类视频只训练世界三流，不构造伪机器人动作。目标任务后训练冻结整个世界模型，只优化动作专家，并混合噪声世界特征和已完成的预测世界条件。推理先联合去噪，再固定预测世界进行短程动作精修，训练也逐渐用模型自身预测替换干净真值，缓解训练—部署条件不一致。\n\n[对应方法原文](https://arxiv.org/html/2609.22332#S3)"
    },
    "experiments": "RoboCasa 成功率 69.4%；CALVIN ABC→D 平均连续任务数 4.22，最强列入基线为 4.01。关键控制实验：无 affordance 时加入人类视频，RoboCasa 从 57.3% 降到 55.1%，CALVIN 从 3.75 降到 3.68；有 affordance 时，同样的人类数据使两者从 63.7% 升到 69.4%、从 3.91 升到 4.22。\n\n固定机器人数据曝光和训练步数后，人类 affordance 视频增加带来单调收益；这比单纯增加混合训练集更直接支持共享表示的价值。实机实验补充了指定操作任务上的效果，但不能直接推广到任意本体和任意人类视频。[表 1–4、§4](https://arxiv.org/html/2609.22332#S4)\n\n**最有解释力的对照。**关键不是单个最高分，而是同样加入人类视频在有无 affordance 时方向相反：无该接口时 RoboCasa 57.3%→55.1%，有该接口时 63.7%→69.4%。结合固定机器人曝光和训练步数的扩展实验，才较直接支持“交互区域监督改善人类数据利用”，而非简单的数据量或算力增加。\n\n[实验与设置原文](https://arxiv.org/html/2609.22332)",
    "evidence_notes": "已核验原文方法、实验与局限；以下数值为作者报告，分析另行标注",
    "code_data_status": "官方项目页可访问，已核对论文标题与 arXiv 链接；未确认可下载训练代码、权重及 affordance 标注流水线。页面还保留预发布占位语，应以实际链接和文件为准。",
    "limitations": "affordance 标注质量和人机交互语义一致性是必要条件；复杂多对象、遮挡与不可见接触仍需要验证。收益证明的是当前训练协议下的有效迁移接口，不能将预测热图解释成已识别物体的物理可操作机制。",
    "comments": "",
    "source_reports": [],
    "deleted": false,
    "updated_at": "2026-09-24",
    "challenges": "人类交互视频容易获得，却缺少机器人动作，且人体外观和本体运动与机器人不同。直接把人类 RGB 加入 WAM 训练，可能把外观差异带入控制，并不必然改善迁移。",
    "motivation": "AffordanceWAM 用对象中心的时空 affordance 作为共享目标：预测哪些物体与任务相关、哪些局部区域可交互，再据此生成动作。关键可检验主张是 affordance 是否真正改变人类数据对机器人学习的作用。",
    "technical_approach": "**过程**：World Expert 用视频 DiT 联合预测未来 RGB、Scalar Affordance 和 Affordance Heatmap；独立 Action Expert 逐层读取 RGB 与 Scalar Affordance 隐特征，联合 flow matching 生成连续动作。\n\n- **输入**：视觉历史、语言任务和机器人本体状态；训练数据包括无机器人动作标签的人类视频与带动作的机器人轨迹。\n- **过程**：World Expert 用视频 DiT 联合预测未来 RGB、Scalar Affordance 和 Affordance Heatmap；独立 Action Expert 逐层读取 RGB 与 Scalar Affordance 隐特征，联合 flow matching 生成连续动作。\n- **输出**：未来外观、交互相关区域和机器人 action chunk。\n\nMasked Joint Self-Attention 阻断 Action→World，也阻断 Affordance Heatmap→Action，因为后者含较多 RGB 外观，可能成为额外外观捷径。人类数据监督三个 World 流，机器人数据额外监督动作，不要求把人类动作重定向成机器人关节控制。掩码说明计算依赖，不代表结构因果识别。[方法 §3](https://arxiv.org/html/2609.22332#S3)\n\n### 方法细节与实现\n\n**三种未来目标的区别。**RGB 描述场景外观，Scalar Affordance 是 [0,1] 的空间场，强调任务相关对象及交互区域；Affordance Heatmap 则把该场叠加到 RGB，保留交互位置与视觉背景的关系。标量场有独立可训练 codec 和像素级 MSE 重建损失，RGB/热图共用冻结视频编码器，三流在时间潜变量上对齐。\n\n**注意力的前向通路与梯度。**动作读取 RGB 与标量 affordance 的逐层特征；热图不能直接或经中间 RGB/标量 token 间接向动作传递前向特征。但热图预测损失仍可通过训练梯度塑造共享世界特征。动作对 RGB 的访问一直保留，所以该掩码减少外观捷径，不等于彻底消除 RGB 依赖，更不是结构因果图。\n\n**分阶段训练和推理。**先以世界预测热身，再逐步引入机器人动作监督；人类视频只训练世界三流，不构造伪机器人动作。目标任务后训练冻结整个世界模型，只优化动作专家，并混合噪声世界特征和已完成的预测世界条件。推理先联合去噪，再固定预测世界进行短程动作精修，训练也逐渐用模型自身预测替换干净真值，缓解训练—部署条件不一致。\n\n[对应方法原文](https://arxiv.org/html/2609.22332#S3)",
    "discussion": "**阅读者分析**：与骨架接口相比，affordance 更靠近“操作哪个对象/区域”，对具体手形依赖较少；但它没有直接提供接触力、摩擦或可执行关节动力学。适合与 3D 部件、轨迹或触觉状态组合验证。",
    "arxiv": {
      "published": "2026-09-16",
      "revised_at": "2026-09-22",
      "primary_category": "cs.RO"
    },
    "source_papers": [
      "content/papers/2609.22332.md"
    ]
  },
  {
    "id": "arxiv-2609-24487",
    "title": "AgentSTAR: Agentic Shape Tracking and Reconstruction from Monocular Videos",
    "authors": [
      "Kirill Mazur",
      "Nikita Karaev",
      "Matthew Chang",
      "Jitendra Malik",
      "Nur Muhammad \"Mahi'' Shafiullah"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本",
    "arxiv_id": "2609.24487",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2609.24487",
      "project": "https://agenticstar.github.io/",
      "code": "https://github.com/makezur/agenticSTAR",
      "alphaxiv": "https://alphaxiv.org/abs/2609.24487"
    },
    "tags": [
      "3D/4D",
      "Agent与可执行世界",
      "HOI"
    ],
    "figure": {
      "url": "content/images/2609.24487-main.webp",
      "alt": "Figure 2：VLM 查看渲染叠加结果，交替修订对象形状与时序姿态",
      "label": "Figure 2 · VLM 查看渲染叠加结果，交替修订对象形状与时序姿态",
      "paper_title": "AgentSTAR: Agentic Shape Tracking and Reconstruction from Monocular Videos",
      "source_url": "https://arxiv.org/html/2609.24487v1/method.png"
    },
    "summary": "AgentSTAR 先提出能解释视频的结构化物体，再优化它随时间的状态。VLM 负责形状和机制假设，数值工具负责精细位姿；两者通过渲染—比较循环互补，避免仅依赖像素匹配。",
    "insight": "AgentSTAR 先提出能解释视频的结构化物体，再优化它随时间的状态。VLM 负责形状和机制假设，数值工具负责精细位姿；两者通过渲染—比较循环互补，避免仅依赖像素匹配。",
    "pipeline": {
      "input": "关键帧、目标物体 mask、相机参数，可选手部遮挡 mask 和深度。实际代码提供 Pi3X 相机恢复入口，物体 mask 仍需提供或由分割模型生成。",
      "process": "Agent 用 Python/Blender primitives 编写 canonical 物体、命名部件和关节；交替修改共享形状和每帧 generalized pose；渲染 silhouette，与扣除手部遮挡的目标 mask 计算 IoU；借助 pose sweep、局部数值搜索和跨关键帧时间诊断修正结果。",
      "output": "结构化物体几何、关节参数和各帧 SE(3)+关节状态；官方代码导出 GLB 与 pose.json。",
      "details": "**过程**：Agent 用 Python/Blender primitives 编写 canonical 物体、命名部件和关节；交替修改共享形状和每帧 generalized pose；渲染 silhouette，与扣除手部遮挡的目标 mask 计算 IoU；借助 pose sweep、局部数值搜索和跨关键帧时间诊断修正结果。\n\n- **输入**：关键帧、目标物体 mask、相机参数，可选手部遮挡 mask 和深度。实际代码提供 Pi3X 相机恢复入口，物体 mask 仍需提供或由分割模型生成。\n- **过程**：Agent 用 Python/Blender primitives 编写 canonical 物体、命名部件和关节；交替修改共享形状和每帧 generalized pose；渲染 silhouette，与扣除手部遮挡的目标 mask 计算 IoU；借助 pose sweep、局部数值搜索和跨关键帧时间诊断修正结果。\n- **输出**：结构化物体几何、关节参数和各帧 SE(3)+关节状态；官方代码导出 GLB 与 pose.json。\n\n深度是可选监督，默认方案不依赖深度拟合；但单目结果存在全局尺度歧义，部分 3D 评估另用深度对齐尺度。代码与论文的相机/尺度协议需要共同阅读。[方法 §3](https://arxiv.org/html/2609.24487#S3)\n\n### 方法细节与实现\n\n**共享形状与逐帧状态。**Agent 生成 Python/Blender 程序定义规范空间中的对象形状与关节结构，同一形状跨所有帧共享；每帧只改变 SE(3) 位姿和关节状态。相比逐帧独立拟合，这使遮挡时的部件身份和结构保持受到约束，也让重建结果可以被继续编辑或执行。\n\n**交替优化。**shape step 修改形状代码，pose step 调整每帧刚体和关节参数；VLM 查看参考帧与渲染叠加图后提出修正，优化 harness 管理候选执行、评分、历史和接受规则。轮廓 IoU 是主要图像证据，可结合手部遮挡排除和深度，但单一轮廓指标存在翻转、尺度和背面形状歧义。\n\n**时序约束的作用。**相邻帧状态应平滑且共享同一物理对象，时序一致性帮助避免逐帧局部最优。程序可执行并不等于实时：论文给出每视频可达 10 小时的优化预算。公开实现中的部分机制模块默认关闭、不同分支配置不同，复现应检查实际运行配置，而不是只按框图理解所有模块都启用。\n\n[对应方法原文](https://arxiv.org/html/2609.24487#S3)"
    },
    "experiments": "评测包含 ARCTIC 关节物体、HOT3D 刚体和 iTACO。ARCTIC harness 消融中，默认 GPT-5.6 Sol 的 3D tracking EPE 为 5.59 cm；去掉时间工具为 6.15 cm、无 harness 为 11.26 cm，仅使用 IoU objective 的变体达到 151.46 cm，说明可用优化工具和搜索设计十分关键。\n\nHOT3D 上平均平移误差 3.04 cm、平均旋转误差 37.6°；SAM3D-Tracker 为 6.41 cm/51.6°。iTACO 的多个关节指标领先，但 world-frame Chamfer 并非所有指标最佳。默认每视频优化预算为 **10 小时**，因此与前馈模型比较时必须同时报告成本。[实验 §4](https://arxiv.org/html/2609.24487#S4)\n\n**消融揭示的不只是 VLM 能力。**完整 harness 的跟踪 EPE 为 5.59，去掉时序项为 6.15、去掉 harness 为 11.26，单独 IoU 优化可到 151.46。这说明状态管理、约束与评分设计非常关键。HOT3D 平移误差 3.04 cm 与旋转误差 37.6° 并存，也表明视觉上吻合不能替代准确 6D 位姿。\n\n[实验与设置原文](https://arxiv.org/html/2609.24487)",
    "evidence_notes": "已核验原文方法、实验与局限；以下数值为作者报告，分析另行标注",
    "code_data_status": "[makezur/agenticSTAR](https://github.com/makezur/agenticSTAR) 已公开 harness、Blender 工具、样例和输入约定。README 提醒论文启用了 mechanism 模块，而代码默认关闭；GPT-5.6 Sol 论文结果使用 critic 分支。运行耗时数小时且消耗大量模型 tokens，复现不能只运行默认命令。",
    "limitations": "形状原语、关节假设、相机和分割质量限制上限；silhouette 相似不能唯一确定隐藏表面或真实机制。粗语义先验可能生成看似合理但错误的结构。当前系统不适合低延迟在线 HOI 跟踪，向柔性物体、多对象接触及自动可靠初始化的扩展仍待验证。",
    "comments": "",
    "source_reports": [],
    "deleted": false,
    "updated_at": "2026-09-24",
    "challenges": "从单目交互视频先求密集对应、再估几何和关节，容易受大运动、遮挡、透明物体和弱纹理干扰。无结构点轨迹也不能直接给机器人提供可操作的部件和关节状态。",
    "motivation": "AgentSTAR 先提出能解释视频的结构化物体，再优化它随时间的状态。VLM 负责形状和机制假设，数值工具负责精细位姿；两者通过渲染—比较循环互补，避免仅依赖像素匹配。",
    "technical_approach": "**过程**：Agent 用 Python/Blender primitives 编写 canonical 物体、命名部件和关节；交替修改共享形状和每帧 generalized pose；渲染 silhouette，与扣除手部遮挡的目标 mask 计算 IoU；借助 pose sweep、局部数值搜索和跨关键帧时间诊断修正结果。\n\n- **输入**：关键帧、目标物体 mask、相机参数，可选手部遮挡 mask 和深度。实际代码提供 Pi3X 相机恢复入口，物体 mask 仍需提供或由分割模型生成。\n- **过程**：Agent 用 Python/Blender primitives 编写 canonical 物体、命名部件和关节；交替修改共享形状和每帧 generalized pose；渲染 silhouette，与扣除手部遮挡的目标 mask 计算 IoU；借助 pose sweep、局部数值搜索和跨关键帧时间诊断修正结果。\n- **输出**：结构化物体几何、关节参数和各帧 SE(3)+关节状态；官方代码导出 GLB 与 pose.json。\n\n深度是可选监督，默认方案不依赖深度拟合；但单目结果存在全局尺度歧义，部分 3D 评估另用深度对齐尺度。代码与论文的相机/尺度协议需要共同阅读。[方法 §3](https://arxiv.org/html/2609.24487#S3)\n\n### 方法细节与实现\n\n**共享形状与逐帧状态。**Agent 生成 Python/Blender 程序定义规范空间中的对象形状与关节结构，同一形状跨所有帧共享；每帧只改变 SE(3) 位姿和关节状态。相比逐帧独立拟合，这使遮挡时的部件身份和结构保持受到约束，也让重建结果可以被继续编辑或执行。\n\n**交替优化。**shape step 修改形状代码，pose step 调整每帧刚体和关节参数；VLM 查看参考帧与渲染叠加图后提出修正，优化 harness 管理候选执行、评分、历史和接受规则。轮廓 IoU 是主要图像证据，可结合手部遮挡排除和深度，但单一轮廓指标存在翻转、尺度和背面形状歧义。\n\n**时序约束的作用。**相邻帧状态应平滑且共享同一物理对象，时序一致性帮助避免逐帧局部最优。程序可执行并不等于实时：论文给出每视频可达 10 小时的优化预算。公开实现中的部分机制模块默认关闭、不同分支配置不同，复现应检查实际运行配置，而不是只按框图理解所有模块都启用。\n\n[对应方法原文](https://arxiv.org/html/2609.24487#S3)",
    "discussion": "**阅读者分析**：这是一条以物体结构约束轨迹的 inverse graphics 路线，很适合为 object-centric HOI 构建离线资产或伪标签。其部件对应来自共享模型和 forward kinematics，不等同于通用非刚体稠密点跟踪，也没有恢复力学参数。",
    "arxiv": {
      "published": "2026-09-21",
      "revised_at": "",
      "primary_category": "cs.CV"
    },
    "source_papers": [
      "content/papers/2609.24487.md"
    ]
  },
  {
    "id": "arxiv-2609-20761",
    "title": "Agile-WAM: An Agile Tactile World Action Model for Contact-Rich Robot Control",
    "authors": [
      "Hanchu Zhou",
      "Brendan Lynch",
      "Raman Goyal",
      "Dechen Gao",
      "Begum Kasap",
      "Boqi Zhao",
      "Junshan Zhang"
    ],
    "year": 2026,
    "publication": "2026，arXiv v2",
    "arxiv_id": "2609.20761",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2609.20761",
      "project": "https://hanchuzhou.github.io/TARO_project_page/",
      "alphaxiv": "https://alphaxiv.org/abs/2609.20761"
    },
    "tags": [
      "World Action Model",
      "触觉与灵巧操作"
    ],
    "figure": {
      "url": "content/images/2609.20761-main.webp",
      "alt": "Figure 2：从共享观测潜变量联合生成动作及不同预测时距的视觉、触觉状态",
      "label": "Figure 2 · 从共享观测潜变量联合生成动作及不同预测时距的视觉、触觉状态",
      "paper_title": "Agile-WAM: An Agile Tactile World Action Model for Contact-Rich Robot Control",
      "source_url": "https://arxiv.org/html/2609.20761v2/figures/tac_framework.png"
    },
    "summary": "Agile-WAM不依赖大型视频 diffusion backbone，而是在共享 visual-tactile latent 中直接联合生成 action chunk和future visual/tactile latent。核心设计是认识到 vision 和 touch 的变化时间尺度不同：视觉预测较远 horizon，而 tactile只预测下一时间步。",
    "insight": "Agile-WAM不依赖大型视频 diffusion backbone，而是在共享 visual-tactile latent 中直接联合生成 action chunk和future visual/tactile latent。核心设计是认识到 vision 和 touch 的变化时间尺度不同：视觉预测较远 horizon，而 tactile只预测下一时间步。",
    "pipeline": {
      "input": "视觉、触觉、机器人状态。",
      "process": "联合编码到 shared latent → multi-horizon multimodal prediction → flow matching联合生成 future latent 与 action chunk。",
      "output": "机器人动作和未来 visual/tactile state。",
      "details": "**过程**：联合编码到 shared latent → multi-horizon multimodal prediction → flow matching联合生成 future latent 与 action chunk。\n\n**输入**：视觉、触觉、机器人状态。\n\n**输出**：机器人动作和未来 visual/tactile state。\n\n采用联合 action–vision–tactile 预测，而非只在策略输入中拼接触觉。不同未来 horizon 分配给两种感知模态，消融分别检查世界预测、模态组合和 horizon，借此分辨额外 latent 容量与预测目标的贡献。\n\n[原文方法](https://arxiv.org/html/2609.20761)\n\n### 方法细节与实现\n\n**从观测潜变量出发的流。**视觉、触觉和本体编码器先把当前观测融合成 z_0，流模型从这个状态出发，一次预测动作、未来视觉和未来触觉潜变量。这样把多模态状态融合作为共同起点，避免每个积分步都重复整套高成本感知条件化；与只预测动作的策略相比，未来模态提供额外动态监督。\n\n**动作编解码与训练一致性。**动作自编码器以 L1 重建学习动作潜空间；训练还解码实际 ODE 积分得到的动作潜变量，并让动作误差经积分过程反传。这样优化的不是只在干净动作编码上表现良好的解码器，也约束了流模型生成路径与最终可执行动作之间的匹配。\n\n**不同模态使用不同预测时距。**视觉目标预测到执行动作段末尾 h_vis=h，触觉目标只预测下一步 h_tac=1。设计动机是视觉可提供较长时程的目标与场景变化，而接触状态切换快、远期触觉不确定性更大。两种未来潜变量分别以预测损失监督，不能把该模型解释成已经准确生成整段高频接触过程。\n\n[对应方法原文](https://arxiv.org/html/2609.20761#S3)"
    },
    "experiments": "论文覆盖9个仿真任务和5个实机接触任务。实机五任务各20次试验，Agile-WAM分别成功16/20、11/20、13/20、6/20、17/20，合计63/100；VITA-VT为49/100。绝对提高14个百分点，按这组表格数计算相对提高28.6%。原文摘要/正文写作29.4%，与表中汇总不能完全对应，此处保留两种口径的差异，不把29.4%误写成上述公式的计算结果。\n\nPeg Insertion为55%，低于VITA-VT的60%，并非每任务领先。11.9 ms是论文配置中的模型推理时间，实际闭环还包含传感器读取和控制执行。未来预测和预测时距消融支持多模态目标的作用，但当前证据未将可解释接触状态与抽象预测特征完全分离。\n\n[实验表格与消融](https://arxiv.org/html/2609.20761#S4)",
    "evidence_notes": "已核验原文方法与实验；关键比较与限制见各节",
    "code_data_status": "本次没有核验到稳定官方代码和权重。",
    "limitations": "当前优势主要在 contact-rich manipulation；共享 latent究竟学习到了可解释的 contact state还是有效但抽象的 predictive feature仍未完全分离。",
    "comments": "",
    "source_reports": [],
    "deleted": false,
    "updated_at": "2026-09-24",
    "challenges": "视觉变化与指尖接触变化的时间尺度不同。统一预测很长的视觉和触觉未来会增加难度，大型视频扩散模型的延迟也不适合插入、旋拧等需要及时修正的任务。",
    "motivation": "Agile-WAM不依赖大型视频 diffusion backbone，而是在共享 visual-tactile latent 中直接联合生成 action chunk和future visual/tactile latent。核心设计是认识到 vision 和 touch 的变化时间尺度不同：视觉预测较远 horizon，而 tactile只预测下一时间步。",
    "technical_approach": "**过程**：联合编码到 shared latent → multi-horizon multimodal prediction → flow matching联合生成 future latent 与 action chunk。\n\n**输入**：视觉、触觉、机器人状态。\n\n**输出**：机器人动作和未来 visual/tactile state。\n\n采用联合 action–vision–tactile 预测，而非只在策略输入中拼接触觉。不同未来 horizon 分配给两种感知模态，消融分别检查世界预测、模态组合和 horizon，借此分辨额外 latent 容量与预测目标的贡献。\n\n[原文方法](https://arxiv.org/html/2609.20761)\n\n### 方法细节与实现\n\n**从观测潜变量出发的流。**视觉、触觉和本体编码器先把当前观测融合成 z_0，流模型从这个状态出发，一次预测动作、未来视觉和未来触觉潜变量。这样把多模态状态融合作为共同起点，避免每个积分步都重复整套高成本感知条件化；与只预测动作的策略相比，未来模态提供额外动态监督。\n\n**动作编解码与训练一致性。**动作自编码器以 L1 重建学习动作潜空间；训练还解码实际 ODE 积分得到的动作潜变量，并让动作误差经积分过程反传。这样优化的不是只在干净动作编码上表现良好的解码器，也约束了流模型生成路径与最终可执行动作之间的匹配。\n\n**不同模态使用不同预测时距。**视觉目标预测到执行动作段末尾 h_vis=h，触觉目标只预测下一步 h_tac=1。设计动机是视觉可提供较长时程的目标与场景变化，而接触状态切换快、远期触觉不确定性更大。两种未来潜变量分别以预测损失监督，不能把该模型解释成已经准确生成整段高频接触过程。\n\n[对应方法原文](https://arxiv.org/html/2609.20761#S3)",
    "discussion": "**阅读者分析**：提供了“高频 contact world model”设计，对未来将低频4D geometry和高频contact dynamics异步结合很有启发。",
    "arxiv": {
      "published": "2026-09-17",
      "revised_at": "2026-09-18",
      "primary_category": "cs.RO"
    },
    "source_papers": [
      "content/papers/2609.20761.md"
    ]
  },
  {
    "id": "arxiv-2609-14462",
    "title": "AlayaVista: Streaming World Modeling from Panoramic States to Perspective Video",
    "authors": [
      "Jiaming Tan",
      "Mingliang Zhai",
      "Zhen Li",
      "Yuwei Wu",
      "Chuanhao Li",
      "Kaipeng Zhang"
    ],
    "year": 2026,
    "publication": "2026，arXiv v1，2026-09-13 提交",
    "arxiv_id": "2609.14462",
    "doi": "10.48550/arXiv.2609.14462",
    "links": {
      "paper": "https://arxiv.org/abs/2609.14462",
      "project": "https://alaya-lab.github.io/AlayaVista/",
      "code": "https://github.com/AlayaLab/AlayaVista",
      "alphaxiv": "https://alphaxiv.org/abs/2609.14462"
    },
    "tags": [
      "世界模型",
      "流式与自回归",
      "视频生成",
      "长时记忆"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2609.14462v1/teaser.png",
      "alt": "AlayaVista Fig. 1",
      "label": "AlayaVista，Fig. 1，由全景 latent state 查询并渲染当前透视视口。来源：Fig. 1 原图 PNG",
      "paper_title": "AlayaVista: Streaming World Modeling from Panoramic States to Perspective Video",
      "source_url": "https://arxiv.org/html/2609.14462v1/teaser.png"
    },
    "summary": "AlayaVista针对流式交互视频中的 off-screen memory 问题，将“世界状态”和“当前视口”解耦：由单张透视图先扩展出 360° scene prior，随后在 panoramic latent space 中持续更新世界，再根据相机轨迹查询当前 perspective viewport。",
    "insight": "AlayaVista针对流式交互视频中的 off-screen memory 问题，将“世界状态”和“当前视口”解耦：由单张透视图先扩展出 360° scene prior，随后在 panoramic latent space 中持续更新世界，再根据相机轨迹查询当前 perspective viewport。\n\n这避免了始终生成完整高分辨率全景视频，同时又让离开视野的场景内容保留在全局 latent 中。",
    "pipeline": {
      "input": "单张 perspective image 与后续相机控制。",
      "process": "预训练 panorama expansion 构造 360° ERP prior；camera-conditioned panoramic latent generator 持续更新世界状态；latent viewport renderer从全局状态抽取当前视野；deterministic latent upsampler 与 perspective generative refiner恢复细节。生成器采用 chunk-autoregressive/causal 机制，并使用 few-step distillation 降低流式推理成本。",
      "output": "相机可控、连续的 perspective RGB video。",
      "details": "**输入**：单张 perspective image 与后续相机控制。\n\n**过程**：预训练 panorama expansion 构造 360° ERP prior；camera-conditioned panoramic latent generator 持续更新世界状态；latent viewport renderer从全局状态抽取当前视野；deterministic latent upsampler 与 perspective generative refiner恢复细节。生成器采用 chunk-autoregressive/causal 机制，并使用 few-step distillation 降低流式推理成本。\n\n**输出**：相机可控、连续的 perspective RGB video。"
    },
    "experiments": "论文构建 MUGEN：约 1,318 小时、至少 4K 分辨率、6,446 段来源视频，并附加相机、深度和实例等标注。评测使用 200 个 MUGEN-HQ case、每个 81 帧、1024×576。AlayaVista报告 SSIM 0.4616、LPIPS 0.5321、一致性 0.9240、质量 0.5579、动态性 0.9200、PSNR 14.10，rotation error 2.132；大多数感知/一致性指标占优，但 translation error 0.03312 并非所有比较中最佳。",
    "evidence_notes": "全文已核验",
    "code_data_status": "论文 HTML 的官方资源区提供 AlayaLab/AlayaVista GitHub 仓库入口，因此代码入口可确认。",
    "limitations": "论文没有集中列出完整 limitations section。根据架构可明确识别的一项风险是：初始 perspective-to-panorama expansion 必然需要生成不可见区域，因此世界状态起点包含 hallucinated content。另一个需后续核验的问题是 MUGEN/MUGEN-HQ 的视频级训练—评测去重方式；本报告没有发现泄漏证据，因此这里只作为审计问题，不作为负面结论。",
    "comments": "",
    "source_reports": [
      "report-1b1ffacf7d"
    ],
    "deleted": false,
    "updated_at": "2026-09-16",
    "challenges": "透视视频流只能观察当前视口；相机离开后，视野外内容容易从模型状态中消失，而持续生成完整高分辨率全景又带来过高计算成本。",
    "motivation": "AlayaVista针对流式交互视频中的 off-screen memory 问题，将“世界状态”和“当前视口”解耦：由单张透视图先扩展出 360° scene prior，随后在 panoramic latent space 中持续更新世界，再根据相机轨迹查询当前 perspective viewport。\n\n这避免了始终生成完整高分辨率全景视频，同时又让离开视野的场景内容保留在全局 latent 中。",
    "technical_approach": "**输入**：单张 perspective image 与后续相机控制。\n\n**过程**：预训练 panorama expansion 构造 360° ERP prior；camera-conditioned panoramic latent generator 持续更新世界状态；latent viewport renderer从全局状态抽取当前视野；deterministic latent upsampler 与 perspective generative refiner恢复细节。生成器采用 chunk-autoregressive/causal 机制，并使用 few-step distillation 降低流式推理成本。\n\n**输出**：相机可控、连续的 perspective RGB video。",
    "discussion": "它与 StreamingHOI 的任务对象不同，但对“流式世界状态如何长期保存”非常 relevant。尤其值得尝试把 panoramic latent 的思想替换为 object-centric / interaction-centric 4D memory，再按当前手物交互区域生成高频局部状态。",
    "arxiv": {
      "published": "2026-09-13T12:13:51Z",
      "revised_at": "2026-09-13T12:13:51Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2608-29242",
    "title": "AnyWorld: Factorized Egocentric World Models for Cross-Embodiment Generalization",
    "authors": [
      "Cheng Chen",
      "Jerry Bai",
      "Jiacheng Wei",
      "Boyu Chen",
      "Xiaoji Zheng",
      "Fan Wu",
      "Minghao Yang",
      "Tianrun Chen",
      "Ruibo Li",
      "Xiaoyu Yue",
      "Xiaoyang Guo",
      "Yixiao Ge",
      "Guosheng Lin",
      "Fayao Liu"
    ],
    "year": 2026,
    "publication": "2026，arXiv v2",
    "arxiv_id": "2608.29242",
    "doi": "10.48550/arXiv.2608.29242",
    "links": {
      "paper": "https://arxiv.org/abs/2608.29242",
      "project": "https://xpeng-robotics.github.io/anyworld/",
      "code": "https://github.com/xpeng-robotics/AnyWorld",
      "alphaxiv": "https://alphaxiv.org/abs/2608.29242"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "机器人学习",
      "流式与自回归",
      "物理建模与仿真",
      "第一视角与人类视频",
      "跨本体迁移"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.29242v2/method_figure_v2.png",
      "alt": "AnyWorld 从人类交互到机器人经验的因子化重组框架",
      "label": "Figure 1，从单个人类第一视角交互重组多样机器人经验并用于 VLA 适配；来源：论文原图",
      "paper_title": "AnyWorld: Factorized Egocentric World Models for Cross-Embodiment Generalization",
      "source_url": "https://arxiv.org/html/2608.29242v2/method_figure_v2.png"
    },
    "summary": "AnyWorld 把第一视角交互拆成动作、相机和目标 embodiment/context 三组条件：图像平面骨架控制描述“发生什么运动”，Plücker ray 描述视角如何演化，目标首帧与 embodiment tag 指定身体、场景布局、物体配置和初始交互几何。这样，同一人类交互可以在没有成对人—机器人视频的条件下重组为多种机器人域 rollout。",
    "insight": "AnyWorld 把第一视角交互拆成动作、相机和目标 embodiment/context 三组条件：图像平面骨架控制描述“发生什么运动”，Plücker ray 描述视角如何演化，目标首帧与 embodiment tag 指定身体、场景布局、物体配置和初始交互几何。这样，同一人类交互可以在没有成对人—机器人视频的条件下重组为多种机器人域 rollout。\n\n关键边界是：论文没有声称把场景因素完全解耦；场景、物体和初始几何仍由目标首帧共同承载。它也不是把人类关节动作直接复制给机器人，而是在下游数据构造时另用 action-calibration module 将人类腕部轨迹映射到机器人相对末端执行器动作空间。",
    "pipeline": {
      "input": "人类第一视角交互视频、渲染的动作骨架控制视频、相机内外参与 Plücker ray、目标机器人首帧、embodiment tag 和任务文本。",
      "process": "先用 200K EgoDex clips 预训练 action-camera conditioned video prior，再用未配对的 EgoDex、RoboCasa GR1 和 IRON 视频做 mixed-embodiment fine-tuning；推理时固定或替换动作、相机、目标首帧和 embodiment tag，生成目标机器人域视频。用于 VLA 时，视觉重组与腕部轨迹到机器人相对 EEF 动作的校准并行进行，形成机器人域视频—动作对。",
      "output": "可独立控制动作、视角和 embodiment/context 的机器人域 rollout，以及用于目标机器人策略适配的视觉—动作训练经验。",
      "details": "**输入**：人类第一视角交互视频、渲染的动作骨架控制视频、相机内外参与 Plücker ray、目标机器人首帧、embodiment tag 和任务文本。\n\n**过程**：先用 200K EgoDex clips 预训练 action-camera conditioned video prior，再用未配对的 EgoDex、RoboCasa GR1 和 IRON 视频做 mixed-embodiment fine-tuning；推理时固定或替换动作、相机、目标首帧和 embodiment tag，生成目标机器人域视频。用于 VLA 时，视觉重组与腕部轨迹到机器人相对 EEF 动作的校准并行进行，形成机器人域视频—动作对。\n\n**输出**：可独立控制动作、视角和 embodiment/context 的机器人域 rollout，以及用于目标机器人策略适配的视觉—动作训练经验。"
    },
    "experiments": "在 60 个 EgoDex、RoboCasa GR1 与 IRON 测试视频上，AnyWorld 的 ActionAlign、CameraAlign、EmbodAcc 分别为 0.659、0.789、0.886，平均 0.778；WAN Fun-Control 的平均值为 0.609，Cosmos-Predict2.5 为 0.417。VBench 四项均值为 0.971，与两条 baseline 的 0.968、0.962 接近，说明可控性提升没有在这些代理视频质量指标上出现明显退化。\n\n在下游 UniT 系 VLA 适配中，加入重组经验后，RoboCasa GR1 的 18 项 pick-and-place 成功率从 49.8% 提升至 54.6%；真实 IRON 机器人 20 次香蕉抓取从 20.0% 提升至 55.0%。定向干预实验还显示：只加入左右 counterfactual actions 而保留原单侧视觉状态，空间指令跟随仍不稳定；同时重组机器人域视觉状态和动作后，策略才稳定切换左右目标。该结果支持“视觉状态覆盖 + 动作校准”的联合数据机制，但不构成 SCM、因果识别或一般反事实推理证明。",
    "evidence_notes": "",
    "code_data_status": "官方 GitHub 已公开 image editing、world model inference、训练/推理脚本、数据格式和模型权重布局说明，代码采用 Apache-2.0。仓库说明 AnyWorld 的适配 Transformer 与 Wan2.1 Combined-Control 基础组件分开提供；本次未发现独立数据集下载页，具体权重入口与上游模型许可证仍需按官方文档复核。",
    "limitations": "- 视觉 rollout 不能完整表示精细接触控制所需的触觉与接触力。\n- 方法依赖可靠的动作—相机提取；严重遮挡、快速运动、tracking error 和强烈相机抖动会降低可控性。\n- 当前只覆盖 human、RoboCasa GR1 和 IRON 三类 embodiment，真实机器人结果仅 20 次抓取；对更多形态、物体、软体交互与长时任务的泛化尚未建立。\n- ActionAlign、CameraAlign 和 CLIP-based EmbodAcc 都是代理指标，不能单独证明生成视频保持了完整 3D 几何或真实动力学。\n\n### 与知域的关系\n\nAnyWorld 位于知域几条主线的交叉点：它把 egocentric human video 转成跨具身 WAM 的可控经验源；用图像平面运动和相机几何分离动作与视角；并通过真实机器人策略适配检验生成经验是否真正可用。它适合与 Zero-WAM、Vid2WAM、UniT、Scaling Cross-Embodiment World Models、EgoSim 和 XEWorld 对照，重点比较“共享动作表示”“视觉重组”“显式 3D/4D 状态”和“真实闭环收益”各自的贡献。",
    "comments": "",
    "source_reports": [
      "report-0d81d19c6c"
    ],
    "deleted": false,
    "updated_at": "2026-09-08",
    "arxiv": {
      "published": "2026-08-29T12:55:15Z",
      "revised_at": "2026-09-01T11:29:01Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2609-23578",
    "title": "AR-WAM: A Visual-Conditioned Agent-Ready World Action Model for Robotic Manipulation",
    "authors": [
      "Yicheng Jiang",
      "Zesen Gan",
      "Xiaobo Wang",
      "Tianlun He",
      "Chenxu Zhao",
      "Minghui Wu",
      "Xinyue Wang",
      "Jiaxu Wang",
      "Junhao He",
      "Jianan Wang",
      "Qiming Shao"
    ],
    "year": 2026,
    "publication": "2026，arXiv",
    "arxiv_id": "2609.23578",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2609.23578",
      "alphaxiv": "https://alphaxiv.org/abs/2609.23578"
    },
    "tags": [
      "Agent与可执行世界",
      "World Action Model",
      "多模态感知与提示"
    ],
    "figure": {
      "url": "content/images/2609.23578-main.webp",
      "alt": "Figure 1：结构化推理、视觉与语义未来对齐共同条件化动作生成",
      "label": "Figure 1 · 结构化推理、视觉与语义未来对齐共同条件化动作生成",
      "paper_title": "AR-WAM: A Visual-Conditioned Agent-Ready World Action Model for Robotic Manipulation",
      "source_url": "https://arxiv.org/html/2609.23578v1/AR-WAM_overview.png"
    },
    "summary": "AR-WAM认为上层AI Agent本身已经具有language reasoning，因此底层机器人policy不一定还需要natural-language interface。它用target bounding box + learnable operation token定义任务。",
    "insight": "AR-WAM认为上层AI Agent本身已经具有language reasoning，因此底层机器人policy不一定还需要natural-language interface。它用target bounding box + learnable operation token定义任务。",
    "pipeline": {
      "input": "视觉场景、visual grounding box、operation token。",
      "process": "0.5B model通过frozen visual encoder编码当前世界，在compact latent中预测scene evolution，同时输出动作；外部Agent通过detect/execute/query primitive控制长程流程。",
      "output": "world-state latent和robot action。",
      "details": "**过程**：0.5B model通过frozen visual encoder编码当前世界，在compact latent中预测scene evolution，同时输出动作；外部Agent通过detect/execute/query primitive控制长程流程。\n\n**输入**：视觉场景、visual grounding box、operation token。\n\n**输出**：world-state latent和robot action。\n\n视觉框用于指定交互对象，可学习 operation token 指定操作类型；模型用紧凑的 gist future state 支持动作。上层 detect/execute/query 负责长程分解与查询，不能把整个 Agent 的记忆能力归到 0.5B 底层模型。\n\n[原文方法](https://arxiv.org/html/2609.23578)\n\n### 方法细节与实现\n\n**可解释推理目标。**AR-WAM 的 reasoning queries 预测目标掩码、双臂末端终态和原子任务类别，分别用分割、位姿和分类损失监督；这是一组结构化隐变量，不是自由文本思维链。上层 Agent 提供目标框和原子操作，底层据此形成可执行动作段。\n\n**双层未来对齐。**离线逆动力学模块从当前与未来视觉特征提取 foresight gist，作为冻结的视觉未来目标；同时用未来 reasoning token 提供语义未来目标。世界动作专家联合预测动作、视觉 gist 与未来推理状态，分别优化动作和两类未来对齐损失。总参数约 0.5B，其中约 0.3B 为冻结 DINOv3、约 0.2B 为共享推理/动作网络。\n\n**调度与缓存。**每轮先执行一次推理并缓存 K/V，动作去噪时复用；累计末端移动、夹爪开闭或时间条件触发上层重新规划。这样的事件触发机制把低频语义规划和连续控制衔接起来，也意味着失败恢复收益同时依赖工具接口与调用规则。\n\n[对应方法原文](https://arxiv.org/html/2609.23578#S3)"
    },
    "experiments": "RoboTwin clean平均87.2%、random 84.2%；matched ablation中text condition为74.2%，完整visual prompt + reasoning + gist foresight为87.2%。真实机器人long-horizon结果相对基线提升36.7%，报告14.1 ms inference。\n\n\nRoboTwin 表 1 显示 clean 87.2% 低于 Fast-WAM 的 87.8%，random 84.2% 高于 82.5%；优势不是全设置最高。匹配消融里去 reasoning 为 79.4%，去 foresight 为 78.6%，用 patch 目标代替 gist 为 76.4%，完整为 87.2%。这组消融比不同大小的外部模型比较更能支持紧凑未来状态设计。\n\n[原文实验与表格](https://arxiv.org/html/2609.23578)\n\n**不要只看随机化榜单。**RoboTwin 随机设置为 84.2%，对照 Fast-WAM 为 82.5%；干净设置为 87.2%，略低于 87.8%。去掉 reasoning 或 foresight 后分别为 79.4%/78.6%，支持两类监督有效，但高层视觉提示、训练框抖动和推理缓存也参与最终系统表现。\n\n[实验与设置原文](https://arxiv.org/html/2609.23578)",
    "evidence_notes": "已核验原文方法与实验；关键比较与限制见各节",
    "code_data_status": "未核验到公开资源。",
    "limitations": "需要外部detector / Agent提供目标和memory，因此系统边界比普通VLA/WAM更大；长时能力不能全部归功于内部 world model。",
    "comments": "",
    "source_reports": [],
    "deleted": false,
    "updated_at": "2026-09-24",
    "challenges": "上层 Agent 已能做语言推理，底层策略再次解析长指令可能增加歧义和模型开销。复杂任务还需要显式目标绑定，避免动作作用于错误对象。",
    "motivation": "AR-WAM认为上层AI Agent本身已经具有language reasoning，因此底层机器人policy不一定还需要natural-language interface。它用target bounding box + learnable operation token定义任务。",
    "technical_approach": "**过程**：0.5B model通过frozen visual encoder编码当前世界，在compact latent中预测scene evolution，同时输出动作；外部Agent通过detect/execute/query primitive控制长程流程。\n\n**输入**：视觉场景、visual grounding box、operation token。\n\n**输出**：world-state latent和robot action。\n\n视觉框用于指定交互对象，可学习 operation token 指定操作类型；模型用紧凑的 gist future state 支持动作。上层 detect/execute/query 负责长程分解与查询，不能把整个 Agent 的记忆能力归到 0.5B 底层模型。\n\n[原文方法](https://arxiv.org/html/2609.23578)\n\n### 方法细节与实现\n\n**可解释推理目标。**AR-WAM 的 reasoning queries 预测目标掩码、双臂末端终态和原子任务类别，分别用分割、位姿和分类损失监督；这是一组结构化隐变量，不是自由文本思维链。上层 Agent 提供目标框和原子操作，底层据此形成可执行动作段。\n\n**双层未来对齐。**离线逆动力学模块从当前与未来视觉特征提取 foresight gist，作为冻结的视觉未来目标；同时用未来 reasoning token 提供语义未来目标。世界动作专家联合预测动作、视觉 gist 与未来推理状态，分别优化动作和两类未来对齐损失。总参数约 0.5B，其中约 0.3B 为冻结 DINOv3、约 0.2B 为共享推理/动作网络。\n\n**调度与缓存。**每轮先执行一次推理并缓存 K/V，动作去噪时复用；累计末端移动、夹爪开闭或时间条件触发上层重新规划。这样的事件触发机制把低频语义规划和连续控制衔接起来，也意味着失败恢复收益同时依赖工具接口与调用规则。\n\n[对应方法原文](https://arxiv.org/html/2609.23578#S3)",
    "discussion": "**阅读者分析**：提示WAM可能成为Agent体系中的“execution primitive”，而不一定承担全部language planning。",
    "arxiv": {
      "published": "2026-09-20",
      "revised_at": "",
      "primary_category": "cs.RO"
    },
    "source_papers": [
      "content/papers/2609.23578.md"
    ]
  },
  {
    "id": "arxiv-2609-12498",
    "title": "ArtManip: Category-Level Articulated In-Hand Manipulation",
    "authors": [
      "Yang Yang",
      "Tengyu Liu",
      "Puhao Li",
      "Zeyuan Chen",
      "Yuyang Li",
      "Xingwan Wang",
      "Yingying Wu",
      "Zhaopeng Cui",
      "Siyuan Huang"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本，v1",
    "arxiv_id": "2609.12498",
    "doi": "10.48550/arXiv.2609.12498",
    "links": {
      "paper": "https://arxiv.org/abs/2609.12498",
      "project": "https://artmanip.github.io/",
      "code": "https://github.com/youngcv/artgym",
      "alphaxiv": "https://alphaxiv.org/abs/2609.12498"
    },
    "tags": [
      "HOI",
      "物理建模与仿真",
      "触觉与灵巧操作",
      "适应与泛化"
    ],
    "figure": {
      "url": "content/images/2609.12498-representative.webp",
      "alt": "Figure 3",
      "label": "Figure 3",
      "paper_title": "ArtManip: Category-Level Articulated In-Hand Manipulation",
      "source_url": "https://arxiv.org/html/2609.12498v1#S3.F3"
    },
    "summary": "ArtManip研究单一策略在同类不同几何和初始抓取下持续开合铰接物体。系统自动生成程序化对象与任务导向抓取，以关节物理随机化和奖励课程训练特权教师，再将 latent 蒸馏到部分观测学生策略。",
    "insight": "ArtManip研究单一策略在同类不同几何和初始抓取下持续开合铰接物体。系统自动生成程序化对象与任务导向抓取，以关节物理随机化和奖励课程训练特权教师，再将 latent 蒸馏到部分观测学生策略。",
    "pipeline": {
      "input": "铰接物体类别、程序化几何、初始抓取与仿真特权状态；部署时使用机器人可观测信号。",
      "process": "生成多样对象和抓取；随机化关节阻尼等动力学；课程式 RL 训练教师；latent distillation 训练学生；仿真筛选高质量抓取后零样本部署。",
      "output": "22-DoF 灵巧手的连续控制，可重复完成对象开—合循环。",
      "details": "**输入**：铰接物体类别、程序化几何、初始抓取与仿真特权状态；部署时使用机器人可观测信号。\n\n**过程**：生成多样对象和抓取；随机化关节阻尼等动力学；课程式 RL 训练教师；latent distillation 训练学生；仿真筛选高质量抓取后零样本部署。\n\n**输出**：22-DoF 灵巧手的连续控制，可重复完成对象开—合循环。"
    },
    "experiments": "仿真未见实例中，Knife、Lighter、Stapler、Tong 成功率为 85.0%、72.1%、83.2%、79.8%；Knife 类从单实例到 30 个训练实例，未见对象成功率从 29.4% 升至 85.0%，支持训练多样性。真实世界 12 个对象、四类、300 次执行中，257 次至少完成一个开合循环，执行级成功率 85.7%。Geo-OOD/Dyn-OOD 的 55.5%/74.9% 仍低于分布内结果，说明几何和动力学外推有限。 [正文实验与表格](https://arxiv.org/html/2609.12498v1)。",
    "evidence_notes": "2026-09-14 已核对 arXiv 元数据、正文主要实验与对照；未运行复现实验。",
    "code_data_status": "官方项目指向 artgym，包含 isaacgymenvs、rl_games、make_data、脚本和部署说明。 以上状态核验于 2026-09-14；入口和目录存在不等于已经运行复现实验。",
    "limitations": "类别仅覆盖四种单关节或近似单关节物体；程序化数字孪生与真实复杂几何仍有差距。策略依赖仿真筛选的初始抓取，尚未形成从视觉识别、抓取获取到持续手内操作的完整闭环。",
    "comments": "",
    "source_reports": [
      "report-37b94c4145"
    ],
    "deleted": false,
    "updated_at": "2026-09-14",
    "discussion": "ArtManip扩展了 HOI 从单次抓取/重建到长时铰接接触控制，可为 4D HOI 表示、接触世界模型和生成式动作规划提供任务基准。",
    "arxiv": {
      "published": "2026-09-11T06:59:21Z",
      "revised_at": "2026-09-11T06:59:21Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2609-07126",
    "title": "Beyond Task Success: Stage-Wise Reliability of World Model Planning under Sensing Degradation",
    "authors": [
      "Geonmyeong Lee",
      "Byoung-Tak Zhang"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本，v1",
    "arxiv_id": "2609.07126",
    "doi": "10.48550/arXiv.2609.07126",
    "links": {
      "paper": "https://arxiv.org/abs/2609.07126",
      "alphaxiv": "https://alphaxiv.org/abs/2609.07126"
    },
    "tags": [
      "世界模型",
      "数据与评测",
      "规划与控制"
    ],
    "figure": {
      "url": "content/images/2609.07126-representative.webp",
      "alt": "Figure 1",
      "label": "Figure 1",
      "paper_title": "Beyond Task Success: Stage-Wise Reliability of World Model Planning under Sensing Degradation",
      "source_url": "https://arxiv.org/html/2609.07126v1#S1.F1"
    },
    "summary": "该工作把感知退化逐级追踪到表示、未来预测、动作偏好和最终结果。重要发现是误差影响不会按固定比例逐层传播，因此只看任务成功或 latent 距离都会遗漏规划脆弱点。",
    "insight": "该工作把感知退化逐级追踪到表示、未来预测、动作偏好和最终结果。重要发现是误差影响不会按固定比例逐层传播，因此只看任务成功或 latent 距离都会遗漏规划脆弱点。",
    "pipeline": {
      "input": "相同起终点任务的干净/退化观测历史，以及冻结世界模型和规划器。",
      "process": "施加 10 类视觉/时间退化，配对比较表示偏移、未来预测偏移、候选动作排名和闭环成功；用另一任务与另一世界模型检查结论范围。",
      "output": "分阶段退化诊断及规划器实际暴露于损坏观测的条件统计。",
      "details": "- **输入**：相同起终点任务的干净/退化观测历史，以及冻结世界模型和规划器。\n- **过程**：施加 10 类视觉/时间退化，配对比较表示偏移、未来预测偏移、候选动作排名和闭环成功；用另一任务与另一世界模型检查结论范围。\n- **输出**：分阶段退化诊断及规划器实际暴露于损坏观测的条件统计。"
    },
    "experiments": "主评测使用 DINO-WM、OGBench OGBScene Drawer 的同一组 50 个可重规划任务。表 2 的 Cube 补充实验中，DINO-WM 在 Motion blur 下 14/17 成功、Low-light 下 8/17；LeWM 分别为 11/15 和 2/15。分母是各模型干净条件下成功的子集，不是统一总体。Delay-10 还需区分真正暴露于延迟的规划步骤，避免重规划掩盖错误动作排序。 [正文实验与表格](https://arxiv.org/html/2609.07126v1)。",
    "evidence_notes": "2026-09-14 已核对 arXiv 元数据、正文主要实验与对照；未运行复现实验。",
    "code_data_status": "原始论文未提供可确认的公开代码、数据或模型下载入口，开放状态待核验。",
    "limitations": "退化为受控合成条件，模型与任务覆盖有限；分阶段相关和配对退化不等于已经证明修复某一表示就能恢复闭环表现。不同模型的干净成功子集不能直接当作同分母排名。",
    "comments": "",
    "source_reports": [
      "report-37b94c4145"
    ],
    "deleted": false,
    "updated_at": "2026-09-14",
    "discussion": "为本专题“错误来自哪里、是否影响动作”的实验协议提供直接参考，可作为新的 4D/接触接口实验的诊断层。",
    "arxiv": {
      "published": "2026-09-07T07:19:37Z",
      "revised_at": "2026-09-07T07:19:37Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2609-11172",
    "title": "Beyond Visual Quality: Evaluating Physical Consistency under Ego-Motion with EgoGenEval",
    "authors": [
      "Yilin Long",
      "Chenming Zhu",
      "Zitang Gou",
      "Jingli Lin",
      "Tai Wang"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本，v1",
    "arxiv_id": "2609.11172",
    "doi": "10.48550/arXiv.2609.11172",
    "links": {
      "paper": "https://arxiv.org/abs/2609.11172",
      "alphaxiv": "https://alphaxiv.org/abs/2609.11172"
    },
    "tags": [
      "数据与评测",
      "物理建模与仿真",
      "第一视角与人类视频"
    ],
    "figure": {
      "url": "content/images/2609.11172-representative.webp",
      "alt": "Figure 2",
      "label": "Figure 2",
      "paper_title": "Beyond Visual Quality: Evaluating Physical Consistency under Ego-Motion with EgoGenEval",
      "source_url": "https://arxiv.org/html/2609.11172v1#S3.F2"
    },
    "summary": "视觉生成器生成高保真图像但常在 ego-motion 下违反物理一致性，限制空间推理与具身规划使用。现有基准多聚焦孤立图像或单步质量。EgoGenEval 是几何接地、pose-free 的基准：1,400 例 / 2,360 目标视角，覆盖单步与多步 ego-motion；分别度量 Camera Motion Grounding（CMG）与 Scene State Preservation（SSP），双指标经盲人评判验证。16 个 pose-free 生成器 + 2 个 pose-conditioned 参考的评测发现：现有模型难以在执行相机运动的同时保持场景状态，没有系统能在两轴同时做好。并构建 EgoGen-Train（同几何来源）验证基准数据能否改进能力。",
    "insight": "视觉生成器生成高保真图像但常在 ego-motion 下违反物理一致性，限制空间推理与具身规划使用。现有基准多聚焦孤立图像或单步质量。EgoGenEval 是几何接地、pose-free 的基准：1,400 例 / 2,360 目标视角，覆盖单步与多步 ego-motion；分别度量 Camera Motion Grounding（CMG）与 Scene State Preservation（SSP），双指标经盲人评判验证。16 个 pose-free 生成器 + 2 个 pose-conditioned 参考的评测发现：现有模型难以在执行相机运动的同时保持场景状态，没有系统能在两轴同时做好。并构建 EgoGen-Train（同几何来源）验证基准数据能否改进能力。",
    "pipeline": {
      "input": "源视图 + ego-motion 描述（pose-free 设定）。",
      "process": "几何接地生成案例（1,400 例）→ CMG（相机运动接地）与 SSP（场景状态保持）双指标 → 盲人评判验证指标 → EgoGen-Train 微调生成器。",
      "output": "生成器物理一致性的标准化评测 + 改进数据。",
      "details": "**输入**：源视图 + ego-motion 描述（pose-free 设定）。\n**过程**：几何接地生成案例（1,400 例）→ CMG（相机运动接地）与 SSP（场景状态保持）双指标 → 盲人评判验证指标 → EgoGen-Train 微调生成器。\n**输出**：生成器物理一致性的标准化评测 + 改进数据。"
    },
    "experiments": "正文主表分别列出 16 个 pose-free 模型与 2 个 pose-conditioned 参考系统；两类输入权限不同，不混合排行。GPT-Image-2 的 CMG/SSP 为 0.72/0.60，而 GT-target oracle 为 0.98/0.90；高视觉质量尚不能保证相机运动接地与场景状态保持。论文给出人类一致性和评分校准。指标主要针对跨视角几何、对象/场景状态，不覆盖接触力、摩擦或材料响应；“本批最强评测证据”不能靠模型数量直接判定。 [正文实验与表格](https://arxiv.org/html/2609.11172v1)。",
    "evidence_notes": "2026-09-14 已核对 arXiv 元数据、正文主要实验与对照；未运行复现实验。",
    "code_data_status": "论文或项目列出的代码地址当前返回 404，不能认定已公开可获取代码。论文中资源发布声明保留为作者声明，数据、权重的实际可获取状态待核验。",
    "limitations": "pose-free 与 pose-conditioned 系统的输入权限不同，论文将后者单列参考是必要的。人类一致性验证支持所定义的评分任务，但 CMG/SSP 不能覆盖力、材料或接触动力学，GT-target 得分也并非数学上界。",
    "comments": "",
    "source_reports": [
      "report-37b94c4145"
    ],
    "deleted": false,
    "updated_at": "2026-09-14",
    "discussion": "直接命中「世界模型评测」与「egocentric 物理一致性」，是知域证据审计方法论的外部基准资源。对任何声称「世界模型物理一致」的工作，EgoGenEval 是可引用的评测标准。",
    "arxiv": {
      "published": "2026-09-10T07:19:50Z",
      "revised_at": "2026-09-10T07:19:50Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2608-30692",
    "title": "Can Video World Models Track Unobserved World States?",
    "authors": [
      "Joonghyuk Shin",
      "Yicong Hong",
      "Jaesik Park",
      "Xun Huang"
    ],
    "year": 2026,
    "publication": "2026，arXiv",
    "arxiv_id": "2608.30692",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.30692",
      "project": "https://joonghyuk.com/stateful-vwm-web/",
      "alphaxiv": "https://alphaxiv.org/abs/2608.30692"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "流式与自回归",
      "物理建模与仿真",
      "第一视角与人类视频",
      "跨本体迁移"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.30692v1/toy_s3_s5_exp.svg",
      "alt": "不可见世界状态追踪实验设置",
      "label": "不可见世界状态追踪实验设置；来源：论文原图",
      "paper_title": "Can Video World Models Track Unobserved World States?",
      "source_url": "https://arxiv.org/html/2608.30692v1/toy_s3_s5_exp.svg"
    },
    "summary": "论文使用 action-conditioned video Shell Game 检验视频世界模型是否追踪不可见的隐状态。摘要称多种模型在训练长度内能够拟合，但在更长交换链上趋近随机猜测；仅增加去噪步骤不能解决问题。",
    "insight": "论文使用 action-conditioned video Shell Game 检验视频世界模型是否追踪不可见的隐状态。摘要称多种模型在训练长度内能够拟合，但在更长交换链上趋近随机猜测；仅增加去噪步骤不能解决问题。\n\n论文进一步指出，能够外推的机制需要跨块维护并原地更新状态，例如允许负特征值的线性注意力或 TTT fast weight。",
    "pipeline": {
      "input": "历史视觉、动作、隐状态转移和视频生成模型。",
      "process": "在视频生成同时维持隐藏状态；通过长链交换和动态探索检验状态是否被持续更新。",
      "output": "未来观测及隐状态预测能力。",
      "details": "**输入**：历史视觉、动作、隐状态转移和视频生成模型。\n\n**过程**：在视频生成同时维持隐藏状态；通过长链交换和动态探索检验状态是否被持续更新。\n\n**输出**：未来观测及隐状态预测能力。"
    },
    "experiments": "摘要明确报告训练 horizon 为 5 次交换，超过该长度后多数模型性能趋近随机。需要全文核验具体模型、训练配置、状态准确率和动态探索实验。",
    "evidence_notes": "",
    "code_data_status": "项目页已确认；代码和数据开放范围待人工核验。",
    "limitations": "- Shell Game 是人为构造的离散隐状态任务。\n- 该任务中的状态记忆机制未必直接迁移到连续机器人动力学。\n- 隐状态追踪能力和视频质量之间的关系仍需单独分析。\n\n### 与知域的关系\n\n该工作为知域的 Causal-JEPA、世界状态记忆、长时交互和 WorldSimProbe 提供了重要诊断任务。",
    "comments": "",
    "source_reports": [
      "report-0d81d19c6c"
    ],
    "deleted": false,
    "updated_at": "2026-09-08",
    "arxiv": {
      "published": "2026-08-31T12:29:24Z",
      "revised_at": "2026-08-31T12:29:24Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2605-15141",
    "title": "Causal Forcing++: Scalable Few-Step Autoregressive Diffusion Distillation for Real-Time Interactive Video Generation",
    "authors": [
      "Min Zhao",
      "Hongzhou Zhu",
      "Kaiwen Zheng",
      "Zihan Zhou",
      "Bokai Yan",
      "Xinyuan Li",
      "Xiao Yang",
      "Chongxuan Li",
      "Jun Zhu"
    ],
    "year": 2026,
    "publication": "2026，arXiv preprint（v3 HTML）。Min Zhao 与 Hongzhou Zhu 共同一作；通讯 Jun Zhu。清华 / 生数 / 人大。arXiv:2605.15141。尚无 DOI / 正式出版页。",
    "arxiv_id": "2605.15141",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2605.15141",
      "code": "https://github.com/thu-ml/Causal-Forcing",
      "alphaxiv": "https://alphaxiv.org/abs/2605.15141"
    },
    "tags": [
      "Agent与可执行世界",
      "因果与反事实",
      "流式与自回归",
      "视频生成"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2605.15141v3/overall.png",
      "alt": "Causal Forcing++ Fig. 1: causal CD replacing causal ODE initialization",
      "label": "Causal Forcing++，Fig. 1，相对 Self Forcing / Causal Forcing 的正确性、效率与延迟对比。来源：Fig. 1 原图 PNG",
      "paper_title": "Causal Forcing++: Scalable Few-Step Autoregressive Diffusion Distillation for Real-Time Interactive Video Generation",
      "source_url": "https://arxiv.org/html/2605.15141v3/overall.png"
    },
    "summary": "核心 Insight： 因果 ODE 与因果 CD 学的是同一个 AR 条件 flow map / consistency function；CD 用相邻时间步的一次在线 teacher ODE 步代替整条离线轨迹。 局部配对的逐步间隙更小，因而更好优化。Stage 1 / Stage 3 沿用 Causal Forcing，只换 Stage 2。",
    "insight": "核心 Insight：**因果 ODE 与因果 CD 学的是同一个 AR 条件 flow map / consistency function；CD 用相邻时间步的一次在线 teacher ODE 步代替整条离线轨迹。** 局部配对的逐步间隙更小，因而更好优化。Stage 1 / Stage 3 沿用 Causal Forcing，只换 Stage 2。\n\n与本知识库课题 **直接相关**：第 3.3 节把同一配方蒸到相机位姿条件生成器，明确对标 Genie 3 式交互世界模型；完整工程化交给 minWM。动作条件变体仍是 chunk-wise 4-step，frame-wise 2-step 留作未来工作。",
    "pipeline": {
      "input": "文本；Wan2.1-1.3B；480×832、81 帧； frame-wise AR。Stage 1–2 用含 OpenVid 采样的 80K 视频；Stage 3 用 VidProM。",
      "process": "Stage 1 TF AR 扩散 20K 步。Stage 2 因果 CD：平方距离、48 个离散时间步、Euler，5K 步；学生 G theta(x t^i,x gt^<i,t)=x t^i-t ,v theta(cdot)。Stage 3 不对称 DMD 1K 步；batch 64。少于 4 步时采用 ASD 技巧：第一帧仍 4 步，后续 20 个 latent 帧用 1 或 2 步——因此文中 1/2/4-step 的首帧延迟相同。动作世界模型：WorldPlay 标注相机 → PRoPE 注入双向 Wan → 再走 CF++。",
      "output": "流式帧。效率在 单卡 A800、不含 VAE 上测：2-step 14.1 FPS / 0.27 s；1-step 20.7 FPS / 0.27 s；4-step 8.69 FPS / 0.27 s。与 Self Forcing / Causal Forcing 的 H100+VAE 测速不可直接比。",
      "details": "- **输入：** 文本；Wan2.1-1.3B；480×832、81 帧；**frame-wise** AR。Stage 1–2 用含 OpenVid 采样的 80K 视频；Stage 3 用 VidProM。\n- **过程：** Stage 1 TF AR 扩散 20K 步。Stage 2 因果 CD：平方距离、48 个离散时间步、Euler，5K 步；学生 \\(G_\\theta(x_t^i,x_{\\mathrm{gt}}^{<i},t)=x_t^i-t\\,v_\\theta(\\cdot)\\)。Stage 3 不对称 DMD 1K 步；batch 64。少于 4 步时采用 ASD 技巧：第一帧仍 4 步，后续 20 个 latent 帧用 1 或 2 步——因此文中 1/2/4-step 的首帧延迟相同。动作世界模型：WorldPlay 标注相机 → PRoPE 注入双向 Wan → 再走 CF++。\n- **输出：** 流式帧。效率在 **单卡 A800、不含 VAE** 上测：2-step 14.1 FPS / 0.27 s；1-step 20.7 FPS / 0.27 s；4-step 8.69 FPS / 0.27 s。与 Self Forcing / Causal Forcing 的 H100+VAE 测速不可直接比。\n\n与最近 baseline 的实质差异：相对 Causal Forcing，Stage 2 从离线因果 ODE 换成在线因果 CD；相对 Self Forcing，初始化教师是 AR 而非双向。APT2 同样用过 TF-CD，但走 GAN、无双向 DMD teacher、无时序 KV cache。"
    },
    "experiments": "**作者主张：** frame-wise 2-step 在 VBench Total / Quality / VisionReward 上超过 SOTA 的 chunk-wise 4-step Causal Forcing，首帧延迟降 50%，Stage 2 成本约 \\(4\\times\\)。\n\n实验实际支持：\n\n- **主表（相对先前 chunk-wise 4-step 方法）：** CF++ 2-step Total/Quality/Semantic **84.14 / 84.89 / 81.13**，Dynamic 64，VisionReward 6.661，Instruct 51。Causal Forcing 84.04 / 84.59 / 81.84 / 68 / 6.326 / 56。4-step CF++ Quality 84.94、VisionReward 6.798、Dynamic 71，但 Semantic 80.75、Instruct 47，并非全面领先。1-step Total 83.35，Instruct 38。\n- **“超过 CF 0.1 / 0.3 / 0.335”：** 2-step vs CF 的 Total 84.14−84.04、Quality 84.89−84.59、VisionReward 6.661−6.326。Semantic 与 Instruct 并未全面超过 CF。\n- **消融（frame-wise，Stage 2 成本含 ODE 数据制作）：** 2-step 下因果 CD 84.14 / 6.661 / 51，2900 GPU·h、0 额外存储；因果 ODE 83.77 / 6.224 / 46，11600 GPU·h、1900 GiB；SF ODE 79.44、Dynamic 0；多步 AR init Dynamic 8；因果 DMD init VisionReward 6.108。1-step 下多步 AR init Instruct −14、Dynamic 0。\n- **动作条件：** Fig. 4 定性展示前进/俯仰；无 VBench 或控制误差表。\n\n**证据未支持：** 1-step 已达到 4-step 质量；CF++ 在所有轴上严格支配 Causal Forcing；A800 无 VAE 的 0.27 s 等于 H100 端到端延迟；动作世界模型已实时。",
    "evidence_notes": "",
    "code_data_status": "- **代码：** 并入 [thu-ml/Causal-Forcing](https://github.com/thu-ml/Causal-Forcing)；世界模型栈见 [shengshu-ai/minWM](https://github.com/shengshu-ai/minWM)。\n- **数据：** Stage 1–2 的 80K 含 OpenVid；ODE 对照需额外轨迹存储。动作数据经 WorldPlay 生成。\n- **测速口径：** 文中反复强调与 SF/CF 论文的 H100 口径不同。",
    "limitations": "- 1-step 语义与指令跟随仍明显弱于 2-step。\n- ASD 技巧使“1-step 模型”的第一帧其实仍是 4-step。\n- 动作世界模型只有定性图，未推到 frame-wise 2-step。\n- 因果 DMD 初始化不适合 AR rollout，作者认为与 reverse KL 有关，但未做因果消融。\n- 效率数字不含 VAE，真实交互延迟会被解码拖累。\n- 与 APT2 仍无公平数字对照。\n\n---",
    "comments": "",
    "source_reports": [
      "report-c7ced2c92d"
    ],
    "deleted": false,
    "updated_at": "2026-08-21",
    "challenges": "Causal Forcing 在 chunk-wise 4-step 已能打，但交互仍受 **块粒度过粗** 和 **每块 4 步延迟** 限制。本文把设定推到 **frame-wise × 1–2 采样步**，并指出这时 Stage 2 初始化成为瓶颈：\n\n- Self Forcing 式双向 ODE：目标与 AR 学生不对齐，在 frame-wise 低步数下 DMD 后会崩（消融里 Dynamic Degree 可到 0）。\n- 直接用多步 AR 当初始化：没有 few-step 能力，1-step 时动态/指令跟随接近崩溃。\n- Causal Forcing 的因果 ODE：目标正确，但每条样本要跑完整 PF-ODE（文中例 48 步）并离线存盘；80K 视频规模约 11,600 A800 GPU·h + 1,900 GiB。\n\n作者还检查了因果 DMD 当 Stage 2：早期帧更锐，但 reverse KL 的 mode-seeking 在历史漂移后把质量质量迅速推进低质量区，暴露偏差比因果 CD 更重。这是作者的机制假说，配有 Fig. 5 示意，不是因果识别实验。",
    "motivation": "核心 Insight：**因果 ODE 与因果 CD 学的是同一个 AR 条件 flow map / consistency function；CD 用相邻时间步的一次在线 teacher ODE 步代替整条离线轨迹。** 局部配对的逐步间隙更小，因而更好优化。Stage 1 / Stage 3 沿用 Causal Forcing，只换 Stage 2。\n\n与本知识库课题 **直接相关**：第 3.3 节把同一配方蒸到相机位姿条件生成器，明确对标 Genie 3 式交互世界模型；完整工程化交给 minWM。动作条件变体仍是 chunk-wise 4-step，frame-wise 2-step 留作未来工作。",
    "technical_approach": "- **输入：** 文本；Wan2.1-1.3B；480×832、81 帧；**frame-wise** AR。Stage 1–2 用含 OpenVid 采样的 80K 视频；Stage 3 用 VidProM。\n- **过程：** Stage 1 TF AR 扩散 20K 步。Stage 2 因果 CD：平方距离、48 个离散时间步、Euler，5K 步；学生 \\(G_\\theta(x_t^i,x_{\\mathrm{gt}}^{<i},t)=x_t^i-t\\,v_\\theta(\\cdot)\\)。Stage 3 不对称 DMD 1K 步；batch 64。少于 4 步时采用 ASD 技巧：第一帧仍 4 步，后续 20 个 latent 帧用 1 或 2 步——因此文中 1/2/4-step 的首帧延迟相同。动作世界模型：WorldPlay 标注相机 → PRoPE 注入双向 Wan → 再走 CF++。\n- **输出：** 流式帧。效率在 **单卡 A800、不含 VAE** 上测：2-step 14.1 FPS / 0.27 s；1-step 20.7 FPS / 0.27 s；4-step 8.69 FPS / 0.27 s。与 Self Forcing / Causal Forcing 的 H100+VAE 测速不可直接比。\n\n与最近 baseline 的实质差异：相对 Causal Forcing，Stage 2 从离线因果 ODE 换成在线因果 CD；相对 Self Forcing，初始化教师是 AR 而非双向。APT2 同样用过 TF-CD，但走 GAN、无双向 DMD teacher、无时序 KV cache。",
    "discussion": "Causal Forcing++ 把“正确的 AR flow map”从昂贵离线轨迹改成可扩展的局部 consistency。frame-wise 2-step 的 Total/Quality/VisionReward 支持这一替换；Instruct 和部分动态轴上 4-step Causal Forcing 仍有优势。适用边界是 Wan-1.3B 级 T2V 蒸馏，外加一个尚未量化的相机控制演示。阅读判断：这是工程可扩展性论文，理论等价依赖于 CD 误差 \\(\\mathcal{O}((\\Delta t)^p)\\) 的标准界；不要把 VisionReward +0.335 写成交互世界模型已闭环。失败案例见消融可视化：错误初始化会出现糊、场景崩、物体漂移。",
    "arxiv": {
      "published": "2026-05-14T17:46:36Z",
      "revised_at": "2026-06-01T14:27:49Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2602-02214",
    "title": "Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation",
    "authors": [
      "Hongzhou Zhu",
      "Min Zhao",
      "Guande He",
      "Hang Su",
      "Chongxuan Li",
      "Jun Zhu"
    ],
    "year": 2026,
    "publication": "2026，arXiv preprint（v2/v5 HTML 与摘要一致；cs.LG/cs.CV 线索见 arXiv）。Hongzhou Zhu 与 Min Zhao 共同一作；通讯 Jun Zhu（dcszj@tsinghua.edu.cn）。清华 / 生数 / UT Austin / 人大。尚无 DOI / 正式出版页。arXiv:2602.02214。",
    "arxiv_id": "2602.02214",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2602.02214",
      "project": "https://thu-ml.github.io/CausalForcing.github.io/",
      "code": "https://github.com/thu-ml/Causal-Forcing",
      "alphaxiv": "https://alphaxiv.org/abs/2602.02214"
    },
    "tags": [
      "Agent与可执行世界",
      "因果与反事实",
      "流式与自回归",
      "视频生成"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2602.02214v5/Fig3.png",
      "alt": "Causal Forcing Fig. 3: frame-level injectivity vs bidirectional ODE pairs",
      "label": "Causal Forcing，Fig. 3，ODE 初始化需要帧级单射，以及 Self Forcing 用双向 teacher 监督 AR 学生为何违规。来源：Fig. 3 原图 PNG",
      "paper_title": "Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation",
      "source_url": "https://arxiv.org/html/2602.02214v5/Fig3.png"
    },
    "summary": "核心 Insight： few-step AR 学生的 ODE 教师必须自己也是 AR，其 PF-ODE 才天然满足帧级单射。 三阶段因此变成：TF 训多步 AR teacher → 用该 teacher 采因果 ODE 轨迹做学生初始化 → 再走 Self Forcing 同款不对称 DMD（双向 real/fake score + 学生自 rollout）。这改变的是初始化目标，不是 DMD 损失本身。",
    "insight": "核心 Insight：**few-step AR 学生的 ODE 教师必须自己也是 AR，其 PF-ODE 才天然满足帧级单射。** 三阶段因此变成：TF 训多步 AR teacher → 用该 teacher 采因果 ODE 轨迹做学生初始化 → 再走 Self Forcing 同款不对称 DMD（双向 real/fake score + 学生自 rollout）。这改变的是初始化目标，不是 DMD 损失本身。\n\n与本知识库课题 **直接相关于交互视频世界模型接口，间接相关于因果**。标题里的 Causal 指时序因果注意力与因果 ODE，不是结构因果。Causal Forcing++ / minWM 把它当成可插拔 Stage 2。",
    "pipeline": {
      "input": "文本；骨干 Wan2.1-T2V-1.3B，81 帧、832× 480，chunk-wise（3 latent 帧）。",
      "process": "Stage 1：在双向模型合成的 3K 集 mathcalD Bi 上 TF 训 AR 扩散 2K 步。Stage 2：用该 AR teacher 在 GT 历史上对当前帧解 PF-ODE，存 3K 条 mathcalD Causal，对学生做 1K 步回归。Stage 3：与 Self Forcing 相同的 asymmetric DMD，VidProM，750 步。作者强调 ODE+DMD 总步数与 Self Forcing 同预算。附录还给出因果 CD，作为 ODE 的替代初始化，质量仍低于 score distillation。",
      "output": "4-step chunk-wise 流式视频；吞吐/延迟与 Self Forcing 相同（文中 17.0 FPS / 0.69 s，H100）。",
      "details": "- **输入：** 文本；骨干 Wan2.1-T2V-1.3B，81 帧、\\(832\\times 480\\)，chunk-wise（3 latent 帧）。\n- **过程：** Stage 1：在双向模型合成的 3K 集 \\(\\mathcal{D}_{\\text{Bi}}\\) 上 TF 训 AR 扩散 2K 步。Stage 2：用该 AR teacher 在 GT 历史上对当前帧解 PF-ODE，存 3K 条 \\(\\mathcal{D}_{\\text{Causal}}\\)，对学生做 1K 步回归。Stage 3：与 Self Forcing 相同的 asymmetric DMD，VidProM，750 步。作者强调 ODE+DMD 总步数与 Self Forcing 同预算。附录还给出因果 CD，作为 ODE 的替代初始化，质量仍低于 score distillation。\n- **输出：** 4-step chunk-wise 流式视频；吞吐/延迟与 Self Forcing 相同（文中 17.0 FPS / 0.69 s，H100）。\n\n与最近 baseline 的实质差异：相对 Self Forcing，只换 ODE teacher（AR vs 双向）；相对 APT2（GAN + TF-CD、无时序 KV cache），本文留在不对称 DMD + KV cache 路线。作者声明 APT2 未开源故不比数字。"
    },
    "experiments": "**作者主张：** 同训练预算、同推理成本下全面超过 Self Forcing；相对 SF 提升 Dynamic Degree 19.3%、VisionReward 8.7%、Instruction Following 16.7%。\n\n实验实际支持：\n\n- **主表：** Causal Forcing Total/Quality/Semantic = **84.04 / 84.59 / 81.84**；Dynamic Degree **68**，VisionReward **6.326**，Instruct **56**，用户排序 1.64（越小越好）。Self Forcing 83.74 / 84.48 / 80.77 / 57 / 5.820 / 48 / 2.87。CausVid 81.33 / 83.98 / 70.72 / 62 / 5.741 / 12。Wan2.1-1.3B 83.37 / 84.30 / 79.65 / 61 / 5.275 / 42，但 0.78 FPS / 103 s。MAGI-1-4.5B 在此表上 78.88 total、0.19 FPS / 282 s。\n- **评测拆分：** VBench 总体；VisionReward / Instruct / Dynamic Degree 用作者另编的 100 条高运动 prompt（补充材料），并 ×100。用户研究 10 人 × 10 prompt 排序。这些子集不是 VBench 官方 split。\n- **消融：** TF 3.343 VisionReward vs DF 1.583。Causal ODE+DMD vs SF ODE+DMD：chunk-wise VisionReward 6.326 vs 3.330，Dynamic 68 vs 24；frame-wise Dynamic 64 vs 2，VisionReward 6.204 vs 1.951。因果 CD 相对不对称 CD 有提升，但仍弱于 DMD。\n- **百分比：** 19.3% 来自 (68−57)/57；8.7% 来自 (6.326−5.820)/5.820；16.7% 来自 (56−48)/48。这是作者定义的相对提升，不是 VBench Total 的 19%。\n\n**证据未支持：** DMD 阶段被证明“不能”缩小架构差距（只是该对照下没缩小）；帧级非单射在所有双向 DiT 上必然成立（引理依赖“对其余帧非几乎处处常数”的假设，作者用注意力图文献作为经验理由）；长视频外推已被作者自己排除，需 LongLive 等正交方法。",
    "evidence_notes": "",
    "code_data_status": "- **代码：** [thu-ml/Causal-Forcing](https://github.com/thu-ml/Causal-Forcing)，同时承接 Causal Forcing++。\n- **数据：** \\(\\mathcal{D}_{\\text{Bi}}\\) / \\(\\mathcal{D}_{\\text{Causal}}\\) 为内部合成轨迹；DMD 用 VidProM。完整复现依赖 Wan 权重与这些合成对。\n- **许可：** 以仓库 LICENSE 为准，本次未逐文件核验。",
    "limitations": "- 训练长度 5 s，外推需 LongLive / Rolling Forcing / Infinity-RoPE 等，本文不解决。\n- Dynamic Degree / VisionReward 用自建 100 prompt，与 VBench 官方运动轴不是同一分布。\n- 用户研究仅 10×10，排序均值不能当大规模主观结论。\n- 因果 CD 仍是 vanilla LCM，作者承认弱于 score distillation。\n- ODE 轨迹存储/生成成本高，直接催生 Causal Forcing++。\n- 与 APT2 无数字对照，架构不同不能外推胜负。\n\n---",
    "comments": "",
    "source_reports": [
      "report-c7ced2c92d"
    ],
    "deleted": false,
    "updated_at": "2026-08-21",
    "challenges": "领域长期问题仍是把双向基础模型蒸成实时 AR 学生。本文针对的缺口是 **ODE 初始化的理论对象错了**，而不是再调 DMD。\n\n- **作者用对照隔离问题：** 即使把 AR 学生初始化成已经 few-step 的双向 DMD 模型（采样步差距消失、只剩架构差距），后续 DMD 仍明显弱于标准双向 DMD。结论：架构差距必须在 ODE 阶段补，DMD 补不上。\n- **帧级单射：** ODE 回归要求噪声样本对应唯一干净样本。双向 PF-ODE 只在整段视频上单射；AR 学生按帧生成，同一噪声帧在不同未来上下文下可对应多个干净帧。MSE 最优解退化成条件期望，表现为糊。Lemma 3.2 / Prop. 3.3 给出形式化陈述；经验支撑是 Fig. 3c 的糊视频，不是对真实物理因果的证明。\n- **TF vs DF：** 作者主张 AR 扩散训练应用 teacher forcing。Prop. 3.4 说 DF 在干净前缀条件下不跟随数据分布；Fig. 4 显示 DF 更易崩溃，其更高 Dynamic Degree 被作者读成病态运动而非更好动态。",
    "motivation": "核心 Insight：**few-step AR 学生的 ODE 教师必须自己也是 AR，其 PF-ODE 才天然满足帧级单射。** 三阶段因此变成：TF 训多步 AR teacher → 用该 teacher 采因果 ODE 轨迹做学生初始化 → 再走 Self Forcing 同款不对称 DMD（双向 real/fake score + 学生自 rollout）。这改变的是初始化目标，不是 DMD 损失本身。\n\n与本知识库课题 **直接相关于交互视频世界模型接口，间接相关于因果**。标题里的 Causal 指时序因果注意力与因果 ODE，不是结构因果。Causal Forcing++ / minWM 把它当成可插拔 Stage 2。",
    "technical_approach": "- **输入：** 文本；骨干 Wan2.1-T2V-1.3B，81 帧、\\(832\\times 480\\)，chunk-wise（3 latent 帧）。\n- **过程：** Stage 1：在双向模型合成的 3K 集 \\(\\mathcal{D}_{\\text{Bi}}\\) 上 TF 训 AR 扩散 2K 步。Stage 2：用该 AR teacher 在 GT 历史上对当前帧解 PF-ODE，存 3K 条 \\(\\mathcal{D}_{\\text{Causal}}\\)，对学生做 1K 步回归。Stage 3：与 Self Forcing 相同的 asymmetric DMD，VidProM，750 步。作者强调 ODE+DMD 总步数与 Self Forcing 同预算。附录还给出因果 CD，作为 ODE 的替代初始化，质量仍低于 score distillation。\n- **输出：** 4-step chunk-wise 流式视频；吞吐/延迟与 Self Forcing 相同（文中 17.0 FPS / 0.69 s，H100）。\n\n与最近 baseline 的实质差异：相对 Self Forcing，只换 ODE teacher（AR vs 双向）；相对 APT2（GAN + TF-CD、无时序 KV cache），本文留在不对称 DMD + KV cache 路线。作者声明 APT2 未开源故不比数字。",
    "discussion": "Causal Forcing 把 Self Forcing 的失败从“DMD 匹配错分布”推进到“ODE 回归对象不单射”。在 Wan-1.3B、同预算设定下，运动与 VisionReward 的增益与消融同向。适用边界仍是 5 s 注意力窗口的 T2V 蒸馏。作者明确：直接外推会长于训练长度会出训练–推理差。阅读判断：理论部分是关于 PF-ODE 回归良定性，不要写成发现了世界的因果结构；引用 19.3% 时必须标明是 100-prompt Dynamic Degree，不是 VBench Total。",
    "arxiv": {
      "published": "2026-02-02T15:19:22Z",
      "revised_at": "2026-06-01T14:32:37Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "arxiv": {
      "published": "2026-01-29T17:07:43Z",
      "revised_at": "2026-03-22T15:37:40Z",
      "primary_category": "cs.CV"
    },
    "arxiv_id": "2601.21998",
    "authors": [
      "Lin Li",
      "Qihang Zhang",
      "Yiming Luo",
      "Shuai Yang",
      "Ruilin Wang",
      "Fei Han",
      "Mingrui Yu",
      "Zelin Gao",
      "Nan Xue",
      "Xing Zhu",
      "Yujun Shen",
      "Yinghao Xu"
    ],
    "code_data_status": "- 代码与部分模型权重公开，许可证可核；完整 16K 小时语料包含内部数据，不能完全复现。\n- 5.3B 视频生成带来高计算与时延；论文自己指出视频与真实 dynamics 不对齐和执行漂移会导致失败，并将更高效压缩、触觉/力觉/音频列为未来方向。\n\n---",
    "comments": "",
    "deleted": false,
    "doi": "",
    "evidence_notes": "- **作者明确主张：** 自回归 video-action modeling 改善长时记忆、数据效率、闭环控制与泛化。\n- **实验实际支持：** 在给定预训练数据和多个机器人 benchmark 上，控制 success 高，长 horizon 与少样本适配对 π0.5 有优势。\n- **阅读判断：** “causal”主要是 temporal arrow、causal attention 和 action-conditioned dynamics。没有 causal graph、干预目标识别、SCM 或 counterfactual benchmark，因此不能据此声称掌握结构因果或反事实推理。",
    "experiments": "论文使用约 5.3B 总模型规模，训练数据包括多来源 robot datasets。\n\n公开描述中包含约 **16K hours** robot data，并进行大规模 video-action pretraining。\n\n### RoboTwin 2.0\n\n- 50 tasks；\n- Clean + Randomized；\n- 多任务训练；\n- 论文报告 Easy / Hard 均取得非常强结果，long-horizon 任务优势更明显。\n\n### LIBERO\n\n论文报告平均约 **98.5%**；  \n评估采用多个 seeds / 大量 trials。\n\n需要注意公平性：\n\n> 部分 baseline 数字来自已有论文/报告，而非全部由作者在完全相同代码和训练设置下重新跑，因此不宜把小幅差距解释成严格 apples-to-apples superiority。\n\n### Real-world\n\n论文展示：\n\n- long-horizon manipulation；\n- few-shot post-training；\n- novel object / layout generalization。\n\n这些结果支持的是实际机器人控制能力，而不是正式 causal identification。\n\n## 代码 / 数据\n\n- 官方代码仓库公开；\n- model weights / 部分 post-training datasets 公开；\n- RoboTwin / LIBERO 训练使用方式有说明。\n\n## 最重要的局限：它的 “causal” 不是 causal inference\n\nLingBot-VA 中的 causality 主要指：\n\n\\[\naction \\rightarrow future\\ visual\\ dynamics\n\\]\n\n以及 autoregressive **causal attention / temporal ordering**。\n\n论文并没有：\n\n- causal graph discovery；\n- \\(do(\\cdot)\\) intervention identification；\n- structural causal model；\n- counterfactual benchmark；\n- identifiability proof。\n\n因此从严格 causal learning 角度，它更适合放在：\n\n> **causality-motivated generative world model**\n\n而不是“formal Causal WM”。\n\n**阅读判断**：  \n非常值得用作机器人世界模型 baseline，但如果你的论文强调 causal reasoning，必须在定义上与 LingBot-VA 拉开距离。\n\n---",
    "figure": {
      "url": "content/images/lingbot_va_framework.png",
      "alt": "LingBot-VA 框架",
      "label": "LingBot-VA 框架",
      "paper_title": "Causal World Modeling for Robot Control（LingBot-VA）",
      "source_url": "content/images/lingbot_va_framework.png"
    },
    "id": "arxiv-2601-21998",
    "insight": "这是机器人 World Action Model 中非常新的代表工作，但它也是理解“causal”一词被过度使用的好例子。\n\nLingBot-VA 的基本逻辑：\n\n> video prediction 可以学习 action 与 future visual dynamics 的关系；因此将 video world model 与 action prediction 在同一 autoregressive diffusion framework 中联合学习，可以给 robot policy 提供更密集的 dynamics supervision。\n\n架构上：\n\n- video latent stream；\n- action stream；\n- MoT；\n- autoregressive causal ordering；\n- visual transition 再反哺 action generation；\n- closed-loop ground-truth observation feedback；\n- asynchronous execution。",
    "limitations": "- 代码与部分模型权重公开，许可证可核；完整 16K 小时语料包含内部数据，不能完全复现。\n- 5.3B 视频生成带来高计算与时延；论文自己指出视频与真实 dynamics 不对齐和执行漂移会导致失败，并将更高效压缩、触觉/力觉/音频列为未来方向。\n\n---",
    "links": {
      "paper": "https://arxiv.org/abs/2601.21998",
      "code": "https://github.com/Robbyant/lingbot-va",
      "model": "https://huggingface.co/robbyant/lingbot-va",
      "alphaxiv": "https://alphaxiv.org/abs/2601.21998"
    },
    "pipeline": {
      "input": "Wan2.2 causal VAE + T5；5B video stream + 350M action stream 的 MoT；inverse-dynamics flow matching；KV cache + FDM-grounded asynchronous loop",
      "process": "video latents + instruction features；未来 visual latents；action chunk；闭环机器人控制",
      "output": "video latents + instruction features；未来 visual latents；action chunk；闭环机器人控制",
      "details": "**输入**：\n\n- 当前多视角 RGB observations；\n- robot state / language instruction。\n\n**过程**：\n\n1. video model 预测未来 visual latent；\n2. action model 根据 visual transition 预测 action；\n3. video/action 交替 autoregressive generation；\n4. causal attention mask 保证时间/信息顺序；\n5. real observation 定期替换 imagined state，形成闭环；\n6. KV cache + async execution 加速。\n\n**输出**：\n\n- future video latent；\n- robot action chunk。"
    },
    "publication": "2026，arXiv",
    "source_reports": [
      "report-554de78a93",
      "report-6fa37648ba",
      "report-ce5d8128c6"
    ],
    "summary": "将机器人策略拆成“想象未来视觉变化”和“从期望变化反推动作”两部分，并在统一自回归序列中交织 video/action tokens。KV cache 保留长历史，真实 observation 持续纠偏，异步推理把下一段预测与当前动作执行重叠。",
    "tags": [
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "因果与反事实",
      "对象与可供性",
      "机器人学习"
    ],
    "title": "Causal World Modeling for Robot Control",
    "updated_at": "2026-09-02",
    "year": 2026,
    "challenges": "机器人 policy 与视频预测分离、闭环观测无法及时纠错，长时操作和推理时延受限。",
    "motivation": "共享 vision/action latent，用自回归视频–动作模型同时预测未来与执行，并异步接收真实反馈。",
    "technical_approach": "- **输入：** 多源机器人视频、语言指令、动作 tokens 与在线观测\n- **过程：** Mixture-of-Transformers 共享 latent；autoregressive diffusion；closed-loop refresh 与异步推理\n- **输出：** 未来视频/latent 和机器人动作",
    "discussion": "“causal”主要指 action→future dynamics、temporal causal mask 和闭环顺序；没有 causal graph、SCM、干预识别或 counterfactual benchmark。它是强 action-conditioned baseline，不是严格 CWM。"
  },
  {
    "arxiv": {
      "published": "2026-02-11T21:47:26Z",
      "revised_at": "2026-05-28T17:57:16Z",
      "primary_category": "cs.AI"
    },
    "arxiv_id": "2602.11389",
    "authors": [
      "Heejeong Nam",
      "Quentin Le Lidec",
      "Lucas Maes",
      "Yann LeCun",
      "Randall Balestriero"
    ],
    "code_data_status": "- 代码公开；CLEVRER、Push-T 为已有公开数据/环境。仓库可训练复现，但预训练对象编码器及具体环境版本仍需按 README 配置。\n- 依赖对象分解质量；未与真实 temporal causal graph 对齐验证；没有 `do`-calculus、个体反事实或隐藏混杂识别；复杂接触、遮挡和真实机器人未覆盖。\n\n---",
    "comments": "",
    "deleted": false,
    "doi": "",
    "evidence_notes": "- **作者明确主张：** masking 学到的是被遮挡对象的 *influence neighborhood*，即预测上最小充分的上下文。\n- **实验实际支持：** 该目标在两个对象编码器和两个 benchmark 上改善若干反事实 QA/控制指标，并显著压缩规划 latent。\n- **阅读判断：** 这是 causal inductive bias，不是 causal parent identification。作者也明确承认 influence neighborhood 可能包含后代或混杂相关变量。",
    "experiments": "- **CLEVRER：** 10,000/5,000/5,000 train/val/test，视频 128 帧、480×320；评价 descriptive、predictive、explanatory、counterfactual VQA（原文 §4.1、Table 1–3）。\n- 在 VideoSAUR 编码下，object mask 从 0 增至 4 后，总体准确率 **82.79→89.40**；counterfactual per-question **47.68→68.81**，提升 21.13 个百分点。该对照支持“对象级遮挡带来增益”，但仍是 CLEVRER 内分布题型。\n- **失败/非单调性：** SAVi 编码下 mask=2 的 counterfactual 为 **60.19**，mask=4 降到 **34.06**，甚至低于不遮挡的 **41.10**。因此“遮得越多越因果”不成立，效果依赖 slot 质量和可恢复信息量（Table 2）。\n- **Push-T MPC：** C-JEPA mask=1 成功率 **88.67%**；DINO-WM 为 **91.33%**，OC-JEPA 为 **76.00%**（Table 6）。对象 latent 只占 patch 特征预算约 **1.02%**；单张 L40S、50 条候选轨迹的规划时间约 **673 s vs. 5,763 s**，报告为 3 个 seed 平均。\n- 所有模型在预提取对象 embedding 上训练，单 GPU、30 epochs、batch 256。论文未给出真实机器人或跨域视频验证。",
    "figure": {
      "url": "content/images/causal_jepa_pipeline.png",
      "alt": "Causal-JEPA 训练框架",
      "label": "Causal-JEPA 训练框架",
      "paper_title": "Causal-JEPA: Learning World Models through Object-Level Latent Masking",
      "source_url": "content/images/causal_jepa_pipeline.png"
    },
    "id": "arxiv-2602-11389",
    "insight": "这是目前最值得关注的新一代 **causal predictive world model** 之一。\n\n作者的出发点是：**object-centric representation 本身并不保证模型真正学习 object interaction**。即使已经把视频表示成 objects/slots，predictor 仍可能依赖每个 object 自己的 temporal dynamics 或统计 shortcut，而不理解 object-object interaction。\n\nC-JEPA 的核心设计非常简单：\n\n> **把某个 object 在 history 中的大部分 latent trajectory 整体 mask 掉，只保留最早的 identity anchor，迫使模型必须根据其他 objects 的状态、actions / proprioception 等信息推断这个 object 的状态。**\n\n因此，模型不能只做：\n\n\\[\nO_t^i \\rightarrow O_{t+1}^i\n\\]\n\n而必须利用：\n\n\\[\n\\{O^j\\}_{j\\neq i},\\, a_t\n\\rightarrow O^i\n\\]\n\n作者把这种 object-level masking 解释为一种 **latent intervention on predictor observability**，并认为它产生了 counterfactual-like training queries，使 interaction reasoning 变成完成预测任务所必需的能力。\n\n### 非常重要的“因果”边界\n\n论文自己明确强调：\n\n> C-JEPA 中的 “causal” 指的是在 object-level masking 下保持稳定的、时间有向的 predictive dependency，以及由 latent observability intervention 诱导的 causal inductive bias；**并不声称 causal identifiability**。\n\n所以这篇论文的贡献应该准确理解为：\n\n**causal inductive bias for world modeling**，而不是“恢复真实 SCM”。",
    "limitations": "作者实验直接显示一个重要失败模式：\n\n- mask 太少，interaction forcing 不够；\n- **mask 太多会把真正必要的信息也删掉**。\n\n例如 SAVi encoder 下，mask 4 objects 后 counterfactual per-question 反而从 41.10 降至 34.06。\n\n因此最优 masking 强烈依赖 object representation 的质量和稳定性。\n\n其他局限：\n\n- CLEVRER 是 synthetic 场景；\n- Push-T 任务单一；\n- object slot 本身依赖现有 object-centric encoder；\n- 没有显式 3D/4D grounding；\n- masking 是对 **observability** 的 intervention，不是直接对真实 environment variables 施加 \\(do(\\cdot)\\)。\n\n**阅读判断**：  \n目前这是最适合你关注的论文之一，因为它给出了一个非常干净的答案：**如何让 latent world model 不得不学习 interaction dependency**。但它距离真正“3D grounded interventional world model”仍有很明显的空间。\n\n---",
    "links": {
      "publication": "https://openreview.net/pdf?id=VMAHQDOtjp",
      "paper": "https://arxiv.org/abs/2602.11389",
      "code": "https://github.com/galilai-group/cjepa",
      "alphaxiv": "https://alphaxiv.org/abs/2602.11389"
    },
    "pipeline": {
      "input": "视频帧；slots 历史；其余对象、可选 action/proprioception；learned slots",
      "process": "冻结的 SAVi/VideoSAUR 等对象编码器；选择对象并遮挡其轨迹，仅留身份 anchor；predictor 同时重建被遮挡历史并预测未来 latent；VQA 头或 latent-space MPC",
      "output": "每帧 object slots；masked slot sequence；目标对象历史与未来 latent；问答答案或控制动作",
      "details": "**输入**：\n\n- 视频帧 \\(X_{t-T_h+1:t}\\)\n- 可选 action \\(a_t\\)\n- 可选 proprioception \\(p_t\\)\n\n**过程**：\n\n1. 冻结的 object-centric encoder（主要使用 VideoSAUR + frozen DINOv2）；\n2. 每帧编码成固定数量 object slots：\n   \\[\n   S_t=\\{s_t^1,\\ldots,s_t^N\\}\n   \\]\n3. 训练阶段选若干 object，把其 history latent 大部分 mask；\n4. 保留最早时刻的 object identity anchor；\n5. ViT-style masked predictor 同时：\n   - 恢复 masked history；\n   - 预测 future object latents；\n6. 使用 latent L2 prediction objective；\n7. inference 时不再 mask history，只 rollout future object states。\n\n**输出**：\n\n\\[\n\\hat S_{t+1:t+T_p}\n\\]\n\n即未来 object-centric latent trajectories。"
    },
    "publication": "2026，ICML 2026",
    "source_reports": [
      "report-554de78a93",
      "report-6fa37648ba",
      "report-ce5d8128c6"
    ],
    "summary": "论文： Causal-JEPA: Learning World Models through Object-Level Latent Masking 作者： Heejeong Nam et al. 年份： 2026，ICML 2026 入口： arXiv｜代码",
    "tags": [
      "3D/4D",
      "HOI",
      "世界模型",
      "因果与反事实",
      "对象与可供性"
    ],
    "title": "Causal-JEPA: Learning World Models through Object-Level Latent Masking",
    "updated_at": "2026-09-02",
    "year": 2026,
    "challenges": "对象中心表示仍可走单对象捷径，不必学习对象间互动。",
    "motivation": "遮掉整个对象 latent，迫使模型从其他对象推断它，形成 interaction-aware causal inductive bias。",
    "technical_approach": "- **输入：** 视频对象 slots、动作及对象级 mask\n- **过程：** JEPA 在 latent 空间预测被遮对象/未来；将 rollout 接入 Push-T latent MPC\n- **输出：** 对象 latent 预测、CLEVRER 问答特征和规划轨迹",
    "discussion": "这是对象交互训练偏置的重要 novelty 邻居；masking 改变的是可观测性，不是物理环境节点，因此作者的 counterfactual-like 表述不应扩成 causal identification。"
  },
  {
    "id": "arxiv-2608-27406",
    "title": "CLAP: Cross-Embodiment Video World Models are Zero-Shot Physical Simulators",
    "authors": [
      "Kechen Liu",
      "Ola Shorinwa"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本（首发 2026-08-27）",
    "arxiv_id": "2608.27406",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.27406",
      "project": "https://omni-clap.github.io",
      "alphaxiv": "https://alphaxiv.org/abs/2608.27406"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "机器人学习",
      "流式与自回归",
      "第一视角与人类视频",
      "长时记忆"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.27406v1/teaser.png",
      "alt": "CLAP: Cross-Embodiment Video World Models are Zero-Shot Physical Simulators 代表图",
      "label": "Figure 1: We introduce CLAP , a cross-embodiment learning framework that trains action-conditioned video models on diverse human and robot video data to learn fundamental physical priors that are critical for fine-grained dynamics prediction. 来源：论文图",
      "paper_title": "CLAP: Cross-Embodiment Video World Models are Zero-Shot Physical Simulators",
      "source_url": "https://arxiv.org/html/2608.27406v1/teaser.png"
    },
    "summary": "SOTA action-conditioned 视频模型通常绑定单一具身，无法利用异构视频中的通用物理信号。CLAP 的核心主张： 时空动力学由普适物理规律支配，与执行者无关 。为桥接差异巨大的动作空间，CLAP 用 end-effector 姿态、语言指令、潜在动作三路 reconcile；并以 curriculum 两阶段训练——先在无标签视频上以潜在动作学习物理先验，再 grounding 到 end-effector 动作空间做零样本真实部署。这是\"跨具身预训练配方\"的代表作。",
    "insight": "SOTA action-conditioned 视频模型通常绑定单一具身，无法利用异构视频中的通用物理信号。CLAP 的核心主张：**时空动力学由普适物理规律支配，与执行者无关**。为桥接差异巨大的动作空间，CLAP 用 end-effector 姿态、语言指令、潜在动作三路 reconcile；并以 curriculum 两阶段训练——先在无标签视频上以潜在动作学习物理先验，再 grounding 到 end-effector 动作空间做零样本真实部署。这是\"跨具身预训练配方\"的代表作。",
    "pipeline": {
      "input": "异构视频（人类+多种机器人）+ 三种动作条件（end-effector / 语言 / 潜在动作）。",
      "process": "curriculum 阶段一（无标签视频 + 潜在动作，学物理先验）→ 阶段二（grounding 到 end-effector 动作空间）→ 少样本适配（few-shot adaptation）。",
      "output": "跨具身、跨动作空间的视频世界模型，可零样本部署到真实任务。",
      "details": "**输入**：异构视频（人类+多种机器人）+ 三种动作条件（end-effector / 语言 / 潜在动作）。\n**过程**：curriculum 阶段一（无标签视频 + 潜在动作，学物理先验）→ 阶段二（grounding 到 end-effector 动作空间）→ 少样本适配（few-shot adaptation）。\n**输出**：跨具身、跨动作空间的视频世界模型，可零样本部署到真实任务。"
    },
    "experiments": "在 DROID 等挑战环境上，CLAP 接近或超过单具身 SOTA 视频模型；few-shot 适配后性能进一步提升。跨 DROID、Bridge、双手机器人（YAM）、G1 人形等形态均有模型。证据等级：摘要层面核验；\"zero-shot physical simulator\"与基准对比的统计细节待全文确认。",
    "evidence_notes": "",
    "code_data_status": "作者明确开源全部代码与模型，项目页 omni-clap.github.io 提供入口——这是该工作最可复现的部分。",
    "limitations": "- 跨具身动作对齐的忠实度缺标准化评测（与本周 WorldEcho 的问题直接相关）；\n- \"零样本物理模拟\"的物理保真度（接触、刚体动力学）未在摘要披露，需全文核验；\n- 异构数据源的尺度/具身校准成本未量化。\n\n### 与知域的关系\n直接落在\"Video / World Action Model\"关注方向，是交叉具身 WAM 预训练的关键参照；与已收录的 OSCAR（omni-embodiment）、Scaling Cross-Embodiment World Models 同主线，可并入交叉具身专题。",
    "comments": "",
    "source_reports": [
      "report-a141624b1e"
    ],
    "deleted": false,
    "updated_at": "2026-08-31",
    "arxiv": {
      "published": "2026-08-27T17:35:10Z",
      "revised_at": "2026-08-27T17:35:10Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2608-27549",
    "title": "Code as Worlds: Agentic Discovery of Executable World Representations for Physical Reasoning",
    "authors": [
      "Hanyang Wang",
      "Yimo Cai",
      "Weiliang Chen",
      "Jiawei Chi",
      "Haowen Sun",
      "Qiyu Dai",
      "Yi-Hsin Hung",
      "Xingzhuo Guo",
      "Jinshan Ren",
      "Runmao Yao",
      "Ziwei Liu",
      "Mingsheng Long",
      "Yueqi Duan",
      "Jun Gao",
      "Jiangran Lyu",
      "Fangfu Liu",
      "Jialong Wu"
    ],
    "year": 2026,
    "publication": "2026，arXiv preprint（v1，2026-08-27）；arXiv:2608.27549；正式 DOI 未见",
    "arxiv_id": "2608.27549",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.27549",
      "project": "https://mirros-lab.github.io/code-as-world/",
      "code": "https://github.com/mirros-lab/code-as-world",
      "alphaxiv": "https://alphaxiv.org/abs/2608.27549"
    },
    "tags": [
      "3D/4D",
      "Agent与可执行世界",
      "世界模型",
      "物理建模与仿真"
    ],
    "figure": {
      "url": "content/images/2608.27549-main.webp",
      "alt": "Figure 2：提出、实例化、执行和验证世界假设，以多模态证据迭代修订程序",
      "label": "Figure 2 · 提出、实例化、执行和验证世界假设，以多模态证据迭代修订程序",
      "paper_title": "Code as Worlds: Agentic Discovery of Executable World Representations for Physical Reasoning",
      "source_url": "https://arxiv.org/html/2608.27549v1/pipeline-wjl.png"
    },
    "summary": "把世界表示成可执行代码，显式组织 scene composition、dynamics 和 appearance；通过 propose→execute→render→verify→refine 的 abductive loop，从文本或视频反推出可运行 hypothesis。",
    "insight": "把世界表示成可执行代码，显式组织 scene composition、dynamics 和 appearance；通过 propose→execute→render→verify→refine 的 abductive loop，从文本或视频反推出可运行 hypothesis。",
    "pipeline": {
      "input": "自然语言描述或真实视频，以及可调用的代码执行/物理渲染环境",
      "process": "视频路径用 SAM3 提取实例掩码和轨迹、VGGT-Ω 估计深度和相机、SAM3D 产生物体几何；Agent 组装可执行场景，运行模拟并比较图像、掩码、深度和轨迹，逐轮修改。文字路径从描述直接构造模拟世界。两者统一导出状态轨迹与定量 VQA。",
      "output": "可检查和编辑的 executable world、模拟轨迹/视频，以及 Code-as-World-VL 推理模型",
      "details": "**过程**：视频路径用 SAM3 提取实例掩码和轨迹、VGGT-Ω 估计深度和相机、SAM3D 产生物体几何；Agent 组装可执行场景，运行模拟并比较图像、掩码、深度和轨迹，逐轮修改。文字路径从描述直接构造模拟世界。两者统一导出状态轨迹与定量 VQA。\n\n- **输入**：文字物理场景，或经过筛选的真实运动视频。\n- **过程**：视频路径用 SAM3 提取实例掩码和轨迹、VGGT-Ω 估计深度和相机、SAM3D 产生物体几何；Agent 组装可执行场景，运行模拟并比较图像、掩码、深度和轨迹，逐轮修改。文字路径从描述直接构造模拟世界。两者统一导出状态轨迹与定量 VQA。\n- **输出**：可执行世界、同步视觉/物理状态，以及训练后的 Code-as-World-VL 定量物理推理模型。\n\n训练分两步：先用 RefCOCO 系列与 GOT-10K 学习图像空间中的框、尺度与运动测量；再用 EWR 的世界坐标状态监督 GRPO，奖励包含相对数值误差、单位和格式。物理推理模型回答尺寸、位移、速度、加速度等问题。[方法 §3–5](https://arxiv.org/html/2608.27549#S3)\n\n### 方法细节与实现\n\n**EWR 的结构。**可执行表示同时定义对象与组合关系、运动规律或模拟参数，以及渲染外观。执行一次程序就能得到同步的视觉序列和可查询物理状态，从而把“画面里发生什么”与“数值上移动多少”接到同一条证据链。这种表示提供了测量接口，但恢复出的尺度和隐藏参数仍依赖所采用的物理先验。\n\n**发现循环。**Agent 根据文字或视觉证据提出世界假设，将其实例化为模拟场景，执行后把渲染结果与参考的实例、轨迹、深度及语义比较，再据差异修订程序。最多 5 轮的迭代与一次生成、Best-of-5 对照，分别区分“利用反馈修正”和“多采样碰到较好结果”。视频证据由多个预训练模块提取，分割、尺度或相机估计错误可能成为后续优化共同追随的偏差。\n\n**训练监督的两层校准。**第一阶段用图像空间测量任务建立框、距离和运动的读取能力；第二阶段用经验证的可执行世界提供世界坐标真值，以 GRPO 奖励数值相对误差、单位和回答格式。前者解决能否从图像中测量，后者解决像素变化到物理量的校准。提升定量问答不自动意味着发现了唯一正确的微观机制。\n\n[对应方法原文](https://arxiv.org/html/2608.27549#S3)"
    },
    "experiments": "真实视频从 WISA-80K 筛选，排除大幅相机运动、运动不足、剪辑和不完整物理事件，并经过人工审核。重建比较最多 5 轮 agentic refinement 与 one-shot、Best-of-5，指标包含 Visual Alignment、Object IoU、Traj-ADE、Velocity-ADE 和 Accuracy@2%D。\n\nQuantiPhy-validation 的表 1 报告 MRA：4B 为 50.6，9B 为 55.4，27B reasoning 为 58.6；作为直接回答比较，Qwen3.5-4B 为 31.2，Gemini-3.1 Flash 为 54.8。27B 使用 reasoning trace，不能视作与直接回答模型完全等价的推理预算。评测限于官方 2S/2D/3S/3D 子集和相应物理先验。[实验与表 1](https://arxiv.org/html/2608.27549#S5.SS4)\n\n**重建与推理须分开评估。**Visual Alignment 和 Object IoU 测量渲染/实例吻合；轨迹与速度误差测试运动拟合；QuantiPhy 的 MRA 测试最终问答模型。这三类证据处于不同环节。更强的机制验证应固定恢复的世界，换动作或初始条件检查预测，而不是继续针对同一参考视频调参；本文主要支持观测匹配与受控定量推理。\n\n[实验与设置原文](https://arxiv.org/html/2608.27549)",
    "evidence_notes": "已核验原文方法、实验与局限；以下数值为作者报告，分析另行标注",
    "code_data_status": "[官方仓库](https://github.com/mirros-lab/code-as-world) 提供 4B/9B 权重与推理说明、QuantiPhy 评估、MuJoCo 示例。完整大规模 EWR 发现与训练数据管线的公开程度需逐项检查，不能用一个弹道示例替代整个自动发现系统的复现。",
    "limitations": "- 程序搜索与反复渲染计算昂贵。\n- 单段观测通常不足以辨识质量、摩擦和隐藏力。\n- 可执行代码有安全风险，复现需隔离 sandbox。\n- QuantiPhy 成绩主要验证 quantitative reasoning，不等于机器人闭环成功。",
    "comments": "",
    "source_reports": [
      "report-d2be249044"
    ],
    "deleted": false,
    "updated_at": "2026-09-24",
    "challenges": "像素容易表示外观，却没有直接可计算的物理量；一般 3D 表示有几何但未必有动力学；自然语言能描述规律但难保证数值精确。单目视频中的尺度、隐藏参数和不完全观测，也使真实机制恢复存在歧义。",
    "motivation": "把世界表示成可执行代码，显式组织 scene composition、dynamics 和 appearance；通过 propose→execute→render→verify→refine 的 abductive loop，从文本或视频反推出可运行 hypothesis。",
    "technical_approach": "**过程**：视频路径用 SAM3 提取实例掩码和轨迹、VGGT-Ω 估计深度和相机、SAM3D 产生物体几何；Agent 组装可执行场景，运行模拟并比较图像、掩码、深度和轨迹，逐轮修改。文字路径从描述直接构造模拟世界。两者统一导出状态轨迹与定量 VQA。\n\n- **输入**：文字物理场景，或经过筛选的真实运动视频。\n- **过程**：视频路径用 SAM3 提取实例掩码和轨迹、VGGT-Ω 估计深度和相机、SAM3D 产生物体几何；Agent 组装可执行场景，运行模拟并比较图像、掩码、深度和轨迹，逐轮修改。文字路径从描述直接构造模拟世界。两者统一导出状态轨迹与定量 VQA。\n- **输出**：可执行世界、同步视觉/物理状态，以及训练后的 Code-as-World-VL 定量物理推理模型。\n\n训练分两步：先用 RefCOCO 系列与 GOT-10K 学习图像空间中的框、尺度与运动测量；再用 EWR 的世界坐标状态监督 GRPO，奖励包含相对数值误差、单位和格式。物理推理模型回答尺寸、位移、速度、加速度等问题。[方法 §3–5](https://arxiv.org/html/2608.27549#S3)\n\n### 方法细节与实现\n\n**EWR 的结构。**可执行表示同时定义对象与组合关系、运动规律或模拟参数，以及渲染外观。执行一次程序就能得到同步的视觉序列和可查询物理状态，从而把“画面里发生什么”与“数值上移动多少”接到同一条证据链。这种表示提供了测量接口，但恢复出的尺度和隐藏参数仍依赖所采用的物理先验。\n\n**发现循环。**Agent 根据文字或视觉证据提出世界假设，将其实例化为模拟场景，执行后把渲染结果与参考的实例、轨迹、深度及语义比较，再据差异修订程序。最多 5 轮的迭代与一次生成、Best-of-5 对照，分别区分“利用反馈修正”和“多采样碰到较好结果”。视频证据由多个预训练模块提取，分割、尺度或相机估计错误可能成为后续优化共同追随的偏差。\n\n**训练监督的两层校准。**第一阶段用图像空间测量任务建立框、距离和运动的读取能力；第二阶段用经验证的可执行世界提供世界坐标真值，以 GRPO 奖励数值相对误差、单位和回答格式。前者解决能否从图像中测量，后者解决像素变化到物理量的校准。提升定量问答不自动意味着发现了唯一正确的微观机制。\n\n[对应方法原文](https://arxiv.org/html/2608.27549#S3)",
    "discussion": "**阅读者分析**：最有价值的接口是“可执行状态生成精确训练标签”。它比用视频外观打分更直接连接尺度和运动量，但一个能解释视频的程序未必是唯一真实机制。若用于 HOI，需要额外验证接触、摩擦、遮挡和跨动作干预后的预测。",
    "arxiv": {
      "published": "2026-08-27T17:57:25Z",
      "revised_at": "2026-08-27T17:57:25Z",
      "primary_category": "cs.CV"
    },
    "source_papers": [
      "content/papers/2608.27549.md"
    ]
  },
  {
    "id": "arxiv-2609-26458",
    "title": "Code Plans, Diffusion Renders: Open-Ended Generative World Modeling",
    "authors": [
      "Zixun Fang",
      "Yawen Shao",
      "Kai Zhu",
      "Jie Xiao",
      "Shihan Chen",
      "Yu Liu",
      "Xueyang Fu",
      "Yang Cao",
      "Wei Zhai",
      "Zheng-Jun Zha"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本",
    "arxiv_id": "2609.26458",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2609.26458",
      "project": "https://becauseimbatman0.github.io/CoDeR",
      "alphaxiv": "https://alphaxiv.org/abs/2609.26458"
    },
    "tags": [
      "3D/4D",
      "Agent与可执行世界",
      "视频生成",
      "长时记忆"
    ],
    "figure": {
      "url": "content/images/2609.26458-main.webp",
      "alt": "Figure 2：代码 Agent 维护白盒世界，扩散 Artist 将几何与动作代理渲染为视频",
      "label": "Figure 2 · 代码 Agent 维护白盒世界，扩散 Artist 将几何与动作代理渲染为视频",
      "paper_title": "Code Plans, Diffusion Renders: Open-Ended Generative World Modeling",
      "source_url": "https://arxiv.org/html/2609.26458v1/method.png"
    },
    "summary": "CoDeR 先用代码构建持续存在的世界，再用视频生成模型呈现观察。除逻辑/视觉分工外，它强调把已生成的外观注册回世界，从而在返回区域或改变视角时复用。",
    "insight": "CoDeR 先用代码构建持续存在的世界，再用视频生成模型呈现观察。除逻辑/视觉分工外，它强调把已生成的外观注册回世界，从而在返回区域或改变视角时复用。",
    "pipeline": {
      "input": "用户文字/图像概念、世界规则和探索者的交互与视角。",
      "process": "God of Concepts 给出意图；Creator 分解规则与逻辑空间；Executors 编写可组合的 Three.js 白模和状态逻辑；Travelers 选择观察路径并交互；Artist 以视频模型把白模观测转换成外观丰富的视频，再通过深度完成 Observation as World Registration。",
      "output": "可执行的白模世界、持续实体状态和相应视频观察。",
      "details": "**过程**：God of Concepts 给出意图；Creator 分解规则与逻辑空间；Executors 编写可组合的 Three.js 白模和状态逻辑；Travelers 选择观察路径并交互；Artist 以视频模型把白模观测转换成外观丰富的视频，再通过深度完成 Observation as World Registration。\n\n- **输入**：用户文字/图像概念、世界规则和探索者的交互与视角。\n- **过程**：God of Concepts 给出意图；Creator 分解规则与逻辑空间；Executors 编写可组合的 Three.js 白模和状态逻辑；Travelers 选择观察路径并交互；Artist 以视频模型把白模观测转换成外观丰富的视频，再通过深度完成 Observation as World Registration。\n- **输出**：可执行的白模世界、持续实体状态和相应视频观察。\n\nVisual Cue Hacking 使用白模的深度/Canny 等线索生成多风格训练配对，减少直接白模条件造成的生硬渲染外观。人类场景使用 SMPL-H；Artist 采用 MiniMax H3，LoRA 调整主干并全量训练 ControlNet 分支。[方法 §3](https://arxiv.org/html/2609.26458#S3)\n\n### 方法细节与实现\n\n**显式白盒与扩散外观。**Creator 根据概念生成 Three.js 世界的布局与逻辑，Executor 运行结构与动作，Artist 根据代理观测渲染高质量视频，Traveler 驱动探索与观察。世界结构作为可持续修改的代码资产存在，人物动作通过 SMPL-H 等代理表达，视觉样式由扩散生成补充。\n\n**结构约束如何传递。**深度及边缘线索把白盒世界的相机、几何和运动连接到 Artist，观察与深度注册用于保持后续生成参照。视觉 cue hacking 使用适配生成器的控制提示，使低保真代理能触发更丰富的外观；但这种接口仍可能丢失细接触关系，生成器也可能偏离代理。\n\n**训练与开放世界能力。**Artist 的适配采用 MiniMax H3、LoRA，32张A800训练200步。可扩展世界来自代码可追加场景、Agent可继续规划，以及渲染器可持续生成的组合；它不是单个视频模型在无限长度上维持精确状态的证明，也不直接保证世界里每个对象都物理可交互。\n\n[对应方法原文](https://arxiv.org/html/2609.26458#S3)"
    },
    "experiments": "Artist 在 32 张 A800 上训练 200 步、batch 16，片段为 124 帧、1280×704。WorldScore 的 10 项平均分为 87.88；ABot-World、Matrix-Game 3.0、LingBot-World 分别为 69.24、74.20、74.79。Motion Magnitude 是分数的一部分，高平均分不能单独等同于精确物理正确性。\n\n消融中，去掉 Visual Cue Hacking，Content Alignment 为 82.48，完整模型为 98.44；去掉 Observation as World Registration，Subject Consistency 为 84.63，完整模型为 96.31。它们支持外观适配与回写记忆的贡献，开放多 Agent/离屏自主演化仍主要依靠系统实例展示。[实验 §4](https://arxiv.org/html/2609.26458#S4)\n\n**长程边界。**WorldScore为87.88，较强对照为74.79；约5,000帧后仍可能退化，人物手部形变和穿插也未解决。相对短片质量提升应与长程结构/身份一致性分别评估，若用于机器人世界模拟，还需接触和动作响应测试，而不能只依赖视频评分。\n\n[实验与设置原文](https://arxiv.org/html/2609.26458)",
    "evidence_notes": "已核验原文方法、实验与局限；以下数值为作者报告，分析另行标注",
    "code_data_status": "官方项目页已确认；论文声明代码和权重将公开，本次尚未核验到对应可下载仓库及模型文件，不把“将公开”记成“已开源”。",
    "limitations": "附录展示约 5,000 帧后的画质退化：Artist 仅在固定窗口训练，分块延展仍积累误差。白模中的手形畸变与物体穿透会传递到视频。尚需验证回写错误外观后能否纠正、跨视角几何的定量稳定性，以及与真实机器人交互的连接。",
    "comments": "",
    "source_reports": [],
    "deleted": false,
    "updated_at": "2026-09-24",
    "challenges": "开放世界需要维持看不见的状态、规则、离屏演化和多实体交互。仅把历史视频继续生成下去，难以明确保存这些信息；纯代码白模世界又缺乏视觉丰富度。",
    "motivation": "CoDeR 先用代码构建持续存在的世界，再用视频生成模型呈现观察。除逻辑/视觉分工外，它强调把已生成的外观注册回世界，从而在返回区域或改变视角时复用。",
    "technical_approach": "**过程**：God of Concepts 给出意图；Creator 分解规则与逻辑空间；Executors 编写可组合的 Three.js 白模和状态逻辑；Travelers 选择观察路径并交互；Artist 以视频模型把白模观测转换成外观丰富的视频，再通过深度完成 Observation as World Registration。\n\n- **输入**：用户文字/图像概念、世界规则和探索者的交互与视角。\n- **过程**：God of Concepts 给出意图；Creator 分解规则与逻辑空间；Executors 编写可组合的 Three.js 白模和状态逻辑；Travelers 选择观察路径并交互；Artist 以视频模型把白模观测转换成外观丰富的视频，再通过深度完成 Observation as World Registration。\n- **输出**：可执行的白模世界、持续实体状态和相应视频观察。\n\nVisual Cue Hacking 使用白模的深度/Canny 等线索生成多风格训练配对，减少直接白模条件造成的生硬渲染外观。人类场景使用 SMPL-H；Artist 采用 MiniMax H3，LoRA 调整主干并全量训练 ControlNet 分支。[方法 §3](https://arxiv.org/html/2609.26458#S3)\n\n### 方法细节与实现\n\n**显式白盒与扩散外观。**Creator 根据概念生成 Three.js 世界的布局与逻辑，Executor 运行结构与动作，Artist 根据代理观测渲染高质量视频，Traveler 驱动探索与观察。世界结构作为可持续修改的代码资产存在，人物动作通过 SMPL-H 等代理表达，视觉样式由扩散生成补充。\n\n**结构约束如何传递。**深度及边缘线索把白盒世界的相机、几何和运动连接到 Artist，观察与深度注册用于保持后续生成参照。视觉 cue hacking 使用适配生成器的控制提示，使低保真代理能触发更丰富的外观；但这种接口仍可能丢失细接触关系，生成器也可能偏离代理。\n\n**训练与开放世界能力。**Artist 的适配采用 MiniMax H3、LoRA，32张A800训练200步。可扩展世界来自代码可追加场景、Agent可继续规划，以及渲染器可持续生成的组合；它不是单个视频模型在无限长度上维持精确状态的证明，也不直接保证世界里每个对象都物理可交互。\n\n[对应方法原文](https://arxiv.org/html/2609.26458#S3)",
    "discussion": "**阅读者分析**：与 Code World Model 同属“代码管状态、生成模型管外观”，CoDeR 更强调角色分工、逻辑空间组合和观察回写。这里“物理规则可执行”取决于写入的规则与碰撞实现，并不表示模型从数据识别到了真实物理。",
    "arxiv": {
      "published": "2026-09-22",
      "revised_at": "",
      "primary_category": "cs.CV"
    },
    "source_papers": [
      "content/papers/2609.26458.md"
    ]
  },
  {
    "id": "arxiv-2608-25927",
    "title": "Code World Model: Coding Agent as World Brain",
    "authors": [
      "Yiwen Chen",
      "Guosheng Lin",
      "Chi Zhang"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本",
    "arxiv_id": "2608.25927",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.25927",
      "project": "https://buaacyw.github.io/cwm/",
      "code": "https://github.com/buaacyw/code-world-model",
      "alphaxiv": "https://alphaxiv.org/abs/2608.25927"
    },
    "tags": [
      "Agent与可执行世界",
      "世界模型",
      "视频生成"
    ],
    "figure": {
      "url": "content/images/2608.25927-main.webp",
      "alt": "Figure 2：代码维护世界状态，代理观测约束视频渲染，并响应后续交互",
      "label": "Figure 2 · 代码维护世界状态，代理观测约束视频渲染，并响应后续交互",
      "paper_title": "Code World Model: Coding Agent as World Brain",
      "source_url": "https://arxiv.org/html/2608.25927v1/code_world_model_pipeline.png"
    },
    "summary": "Code World Model 将世界演化和视觉呈现分开：Coding Agent 在需要解释事件、修改规则时工作，可执行代码高频维护状态；视频模型把该状态转换成丰富的视觉观察。连接两者的关键是逐帧空间代理 proxy，而非不断增长的文字历史。",
    "insight": "Code World Model 将世界演化和视觉呈现分开：Coding Agent 在需要解释事件、修改规则时工作，可执行代码高频维护状态；视频模型把该状态转换成丰富的视觉观察。连接两者的关键是逐帧空间代理 proxy，而非不断增长的文字历史。",
    "pipeline": {
      "input": "用户事件和控制、持续保存的世界代码与状态、已有游戏引擎模板，以及外观描述。",
      "process": "Coding Agent 修改实体、规则和事件逻辑；代码执行世界更新；轻量编译/渲染管线生成深度与语义 ID 代理视频；经 LoRA 适配的 MiniMax-H3 Ref2VA 接收 proxy、文字和首帧外观锚点，生成视频。",
      "output": "可执行、可由玩家控制的世界状态，以及与代理轨迹对齐的视频观察。",
      "details": "**过程**：Coding Agent 修改实体、规则和事件逻辑；代码执行世界更新；轻量编译/渲染管线生成深度与语义 ID 代理视频；经 LoRA 适配的 MiniMax-H3 Ref2VA 接收 proxy、文字和首帧外观锚点，生成视频。\n\n- **输入**：用户事件和控制、持续保存的世界代码与状态、已有游戏引擎模板，以及外观描述。\n- **过程**：Coding Agent 修改实体、规则和事件逻辑；代码执行世界更新；轻量编译/渲染管线生成深度与语义 ID 代理视频；经 LoRA 适配的 MiniMax-H3 Ref2VA 接收 proxy、文字和首帧外观锚点，生成视频。\n- **输出**：可执行、可由玩家控制的世界状态，以及与代理轨迹对齐的视频观察。\n\n推理时利用已有引擎的控制、碰撞和更新循环，不是从零自动生成完整大型游戏。训练视频为 1344×768、24 FPS、124 帧，proxy 为 336×192；长视频使用 124 帧窗口和 34 帧重叠，复用首帧外观锚点。[方法 §3](https://arxiv.org/html/2608.25927#S3)\n\n### 方法细节与实现\n\n**世界状态与视频的职责。**编码 Agent 修改可执行代码和显式状态，引擎根据状态推进对象与交互逻辑；视频模型把简化场景观测转换成高质量画面。未来的结构约束来自持续存在的程序状态，而不是只靠视频模型的历史上下文记住场景。这也意味着可执行世界的逻辑正确性主要依赖代码和引擎。\n\n**状态如何进入视频模型。**论文不直接把完整程序当作视频 token，而是由引擎产生深度、语义或实例标识等视觉代理，将对象布局、遮挡和运动压缩成视频模型能消费的条件。实验使用 336×192 的代理观测，生成 1,344×768、124 帧、24 FPS 的片段。代理的条件带宽决定了哪些状态能被画面保留，未被代理编码的属性仍可能由生成先验补写。\n\n**训练与系统成本。**视频适配使用 rank 128 LoRA，约 5.96 亿可训练参数，8 张 H800；数据为 9,420 段视频、约 5.6 小时，训练 3,534 步。已有游戏模板和资产提供了可运行世界的起点，因此案例展示应与完全从零构造任意世界区分。作者当前的生成演示没有把编码、引擎执行和视频渲染合计成实时交互延迟。\n\n[对应方法原文](https://arxiv.org/html/2608.25927#S3)"
    },
    "experiments": "作者用 157 段游戏录制、约 5.6 小时视频抽取 9,420 个五秒片段。LoRA rank 128、约 596M 可训练参数，在 8 张 H800 上训练 3 个 epoch、3,534 步；推理采用 20 步 Euler。\n\n§4.2 主要报告位置、动作、场景布局和相机控制的**定性结果**与项目视频；比较明确不考虑推理延迟。现有证据支持“少量 proxy–RGB 适配可以控制视觉生成”，尚不足以宣称开放世界长期自主运行、实时交互或量化 benchmark 的普遍领先。[实验 §4](https://arxiv.org/html/2608.25927#S4)\n\n**目前支持的结论。**持续对象、状态编辑和跨交互画面是主要展示内容，尚缺统一的大规模定量测试及完整延迟分解。可以据此判断代码状态是可行的控制接口，但不能推出视觉生成严格忠于每个物理参数，也不能把输出片段的 24 FPS 当作系统生成速度。\n\n[实验与设置原文](https://arxiv.org/html/2608.25927)",
    "evidence_notes": "已核验原文方法、实验与局限；以下数值为作者报告，分析另行标注",
    "code_data_status": "[官方仓库](https://github.com/buaacyw/code-world-model) 已提供推理模块、环境文档、公开 CWM LoRA 与 40 个紧凑示例的安装入口。示例包含 NPZ 条件，需在本地展开；仓库开放不能自动视作完整训练数据和全部世界构建流程均已发布。独立基础模型仍依赖 MiniMax-H3。",
    "limitations": "作者明确指出训练规模小、生成质量受限，尚未实现自回归实时生成；Coding Agent 仍难从零可靠实现复杂游戏机制。持久的代码状态也不能保证视频生成始终遵守状态，特别是遮挡、细动作和长时身份一致性。",
    "comments": "",
    "source_reports": [],
    "deleted": false,
    "updated_at": "2026-09-24",
    "challenges": "视频生成能展示事件外观，却难持续维护离屏角色、数值规则和跨很长时间发展的后果。让语言模型逐帧更新所有实体又会带来高延迟；仅用文字描述位置和运动，也很难精确控制视频模型。",
    "motivation": "Code World Model 将世界演化和视觉呈现分开：Coding Agent 在需要解释事件、修改规则时工作，可执行代码高频维护状态；视频模型把该状态转换成丰富的视觉观察。连接两者的关键是逐帧空间代理 proxy，而非不断增长的文字历史。",
    "technical_approach": "**过程**：Coding Agent 修改实体、规则和事件逻辑；代码执行世界更新；轻量编译/渲染管线生成深度与语义 ID 代理视频；经 LoRA 适配的 MiniMax-H3 Ref2VA 接收 proxy、文字和首帧外观锚点，生成视频。\n\n- **输入**：用户事件和控制、持续保存的世界代码与状态、已有游戏引擎模板，以及外观描述。\n- **过程**：Coding Agent 修改实体、规则和事件逻辑；代码执行世界更新；轻量编译/渲染管线生成深度与语义 ID 代理视频；经 LoRA 适配的 MiniMax-H3 Ref2VA 接收 proxy、文字和首帧外观锚点，生成视频。\n- **输出**：可执行、可由玩家控制的世界状态，以及与代理轨迹对齐的视频观察。\n\n推理时利用已有引擎的控制、碰撞和更新循环，不是从零自动生成完整大型游戏。训练视频为 1344×768、24 FPS、124 帧，proxy 为 336×192；长视频使用 124 帧窗口和 34 帧重叠，复用首帧外观锚点。[方法 §3](https://arxiv.org/html/2608.25927#S3)\n\n### 方法细节与实现\n\n**世界状态与视频的职责。**编码 Agent 修改可执行代码和显式状态，引擎根据状态推进对象与交互逻辑；视频模型把简化场景观测转换成高质量画面。未来的结构约束来自持续存在的程序状态，而不是只靠视频模型的历史上下文记住场景。这也意味着可执行世界的逻辑正确性主要依赖代码和引擎。\n\n**状态如何进入视频模型。**论文不直接把完整程序当作视频 token，而是由引擎产生深度、语义或实例标识等视觉代理，将对象布局、遮挡和运动压缩成视频模型能消费的条件。实验使用 336×192 的代理观测，生成 1,344×768、124 帧、24 FPS 的片段。代理的条件带宽决定了哪些状态能被画面保留，未被代理编码的属性仍可能由生成先验补写。\n\n**训练与系统成本。**视频适配使用 rank 128 LoRA，约 5.96 亿可训练参数，8 张 H800；数据为 9,420 段视频、约 5.6 小时，训练 3,534 步。已有游戏模板和资产提供了可运行世界的起点，因此案例展示应与完全从零构造任意世界区分。作者当前的生成演示没有把编码、引擎执行和视频渲染合计成实时交互延迟。\n\n[对应方法原文](https://arxiv.org/html/2608.25927#S3)",
    "discussion": "**阅读者分析**：该工作是“代码状态 → 空间控制 → 视频呈现”的系统原型。与 Code as Worlds 的主要区别是，它侧重运行和呈现世界；后者侧重从观察构造可执行表示，并把模拟状态转成定量物理推理监督。代码中有显式规则，不等于这些规则已由真实观测因果识别。",
    "arxiv": {
      "published": "2026-08-26",
      "revised_at": "",
      "primary_category": "cs.CV"
    },
    "source_papers": [
      "content/papers/2608.25927.md"
    ]
  },
  {
    "id": "arxiv-2609-06852",
    "title": "ContextFlow: In-Context Flow Matching for Robot Manipulation",
    "authors": [
      "Jian Ding",
      "Xianjie Dai",
      "Roei Herzig",
      "Nussair Hroub",
      "Jinjie Mai",
      "Dengxin Dai",
      "Bernard Ghanem",
      "Mohamed Elhoseiny"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本，v1；arXiv 作者备注称 ECCV 2026 接收",
    "arxiv_id": "2609.06852",
    "doi": "10.48550/arXiv.2609.06852",
    "links": {
      "paper": "https://arxiv.org/abs/2609.06852",
      "project": "https://dingjiansw101.github.io/contextflow-page/",
      "code": "https://github.com/dingjiansw101/ContextFlow",
      "data": "https://huggingface.co/datasets/vo2yager/aloha_incontext",
      "alphaxiv": "https://alphaxiv.org/abs/2609.06852"
    },
    "tags": [
      "具身上下文学习",
      "扩散与流匹配",
      "机器人学习"
    ],
    "figure": {
      "url": "content/images/2609.06852-representative.webp",
      "alt": "Figure 2 ",
      "label": "Figure 2",
      "paper_title": "ContextFlow: In-Context Flow Matching for Robot Manipulation",
      "source_url": "https://arxiv.org/html/2609.06852v1#S2.F2"
    },
    "summary": "ContextFlow让策略在推理时接收一条完整示例轨迹和当前任务观测，在不针对新任务更新参数的情况下生成动作。核心 Insight 是把“示例理解”和“动作生成”分别交给上下文专家与动作专家，并用压缩 token 建立跨时间对应关系，避免自回归离散动作建模的累积误差。",
    "insight": "ContextFlow让策略在推理时接收一条完整示例轨迹和当前任务观测，在不针对新任务更新参数的情况下生成动作。核心 Insight 是把“示例理解”和“动作生成”分别交给上下文专家与动作专家，并用压缩 token 建立跨时间对应关系，避免自回归离散动作建模的累积误差。",
    "pipeline": {
      "input": "语言指令、一条示例的多视角观测—动作轨迹、当前机器人观测与本体状态。",
      "process": "Perceiver 类压缩器将长示例和当前多视角图像压缩为固定数量 token；上下文专家提取任务动态，动作专家通过交叉注意力读取上下文；条件流匹配从噪声迭代生成动作块。",
      "output": "未来约 50 步连续机器人动作。",
      "details": "**输入**：语言指令、一条示例的多视角观测—动作轨迹、当前机器人观测与本体状态。\n\n**过程**：Perceiver 类压缩器将长示例和当前多视角图像压缩为固定数量 token；上下文专家提取任务动态，动作专家通过交叉注意力读取上下文；条件流匹配从噪声迭代生成动作块。\n\n**输出**：未来约 50 步连续机器人动作。"
    },
    "experiments": "LIBERO 使用 32 个训练任务、4 个未见任务，每任务 50 次评估；ContextFlow 在未见任务平均成功率 73.5%，对比 ContextAR 53.5%、ICRT 38.5%、零样本 \\(\\pi_0\\) 44.5%，与对新任务单独微调的 \\(\\pi_0\\) 72.5% 接近。真实 ALOHA 的 6 个未见任务各 10 次，成功次数为 2、5、4、4、4、6；ICRT 几乎全部失败。结果支持单演示条件策略，但不能证明跨机器人或长期自主积累经验。 [正文实验与表格](https://arxiv.org/html/2609.06852v1)。",
    "evidence_notes": "2026-09-14 已核对 arXiv 元数据、正文主要实验与对照；未运行复现实验。",
    "code_data_status": "训练/推理相关源码、脚本和测试已公开；ALOHA 数据集入口可访问。 以上状态核验于 2026-09-14；入口和目录存在不等于已经运行复现实验。",
    "limitations": "性能依赖示例质量和视角对应；一条示例可能无法覆盖接触恢复和多解策略。外部 baseline 的训练数据、模型容量与动作表示并非完全一致。真实实验每任务仅 10 次，统计波动较大。",
    "comments": "",
    "source_reports": [
      "report-37b94c4145"
    ],
    "deleted": false,
    "updated_at": "2026-09-14",
    "discussion": "这是本期最直接的具身 In-Context Learning 工作，可作为“演示轨迹即上下文”的强基线，并与 WAM 的动作后果建模形成接口。",
    "arxiv": {
      "published": "2026-09-06T21:53:58Z",
      "revised_at": "2026-09-06T21:53:58Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2609-06302",
    "title": "CST-WM: A Causally Structured World Model for Embodied Visual Tracking",
    "authors": [
      "Junyi Hu",
      "Shuaihang Yuan",
      "Yi Fang"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本，v1",
    "arxiv_id": "2609.06302",
    "doi": "10.48550/arXiv.2609.06302",
    "links": {
      "paper": "https://arxiv.org/abs/2609.06302",
      "project": "https://junyi2005.github.io/cst-wm/",
      "alphaxiv": "https://alphaxiv.org/abs/2609.06302"
    },
    "tags": [
      "因果与反事实",
      "数据与评测",
      "规划与控制",
      "适应与泛化"
    ],
    "figure": {
      "url": "content/images/2609.06302-representative.webp",
      "alt": "Figure 2",
      "label": "Figure 2",
      "paper_title": "CST-WM: A Causally Structured World Model for Embodied Visual Tracking",
      "source_url": "https://arxiv.org/html/2609.06302v1#S3.F2"
    },
    "summary": "CST-WM 针对 embodied tracking 的“因果幻觉”：模型可能把动作直接写入目标状态。它将 latent 拆为 target-evidence、robot、observation 三支，并阻断不合理的 action-to-target shortcut。",
    "insight": "CST-WM 针对 embodied tracking 的“因果幻觉”：模型可能把动作直接写入目标状态。它将 latent 拆为 target-evidence、robot、observation 三支，并阻断不合理的 action-to-target shortcut。",
    "pipeline": {
      "input": "机器人观测、动作和目标信息。",
      "process": "按预设因果路径学习结构化 latent transition，并在 rollout 上用 MPC 选动作。",
      "output": "未来 belief/latent、跟踪动作和重捕获行为。",
      "details": "- **输入**：机器人观测、动作和目标信息。\n- **过程**：按预设因果路径学习结构化 latent transition，并在 rollout 上用 MPC 选动作。\n- **输出**：未来 belief/latent、跟踪动作和重捕获行为。"
    },
    "experiments": "正文表 4 在 EVT-Bench 上报告 SR/TR/CR 为 88.7/83.4/1.41，对比 TrackVLA++ 的 86.0/81.0/2.10；表 5 的长遮挡重捕获率为 0.69，对比 Adapted NWM 的 0.54。表 3 给出 scene-disjoint 数据划分、3 个随机种子、模型容量和 CEM 参数。结构消融与 action-leakage 诊断支持阻断指定任务中的动作捷径；这依赖“机器人动作不直接改变目标自身状态”的任务假设，不能原样迁移到手物接触操纵。 [正文实验与表格](https://arxiv.org/html/2609.06302v1)。",
    "evidence_notes": "2026-09-14 已核对 arXiv 元数据、正文主要实验与对照；未运行复现实验。",
    "code_data_status": "公共环境存在，论文实现与权重未确认。",
    "limitations": "预设图可能遗漏目标自身动力学与遮挡者运动；机器人与目标真实接触时，动作到目标状态的直接影响并非错误边。",
    "comments": "",
    "source_reports": [
      "report-37b94c4145"
    ],
    "deleted": false,
    "updated_at": "2026-09-14",
    "discussion": "提供具体可测的因果捷径问题，可与 Causal-JEPA 对照，也提醒因果边应随物理关系变化。",
    "arxiv": {
      "published": "2026-09-05T23:24:32Z",
      "revised_at": "2026-09-05T23:24:32Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2608-19085",
    "title": "DA-WAM: Decision-Aligned Future Latents for Driving World Models",
    "authors": [
      "Ruiguo Zhong",
      "Benshan Ma",
      "Xiaolong Chen",
      "Lang Zhang",
      "Mingyue Feng",
      "Yaonong Wang",
      "Pei Liu",
      "Jun Ma"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本（v2 于 2026-08-20 更新）",
    "arxiv_id": "2608.19085",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.19085",
      "alphaxiv": "https://alphaxiv.org/abs/2608.19085"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "World Action Model",
      "动作表征",
      "因果与反事实",
      "流式与自回归",
      "第一视角与人类视频"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.19085v2/Figures/overview2.png",
      "alt": "DA-WAM Fig. 2：候选轨迹与未来隐状态一一对齐的规划框架",
      "label": "DA-WAM，Fig. 2，为每条候选轨迹预测专属未来隐状态并进行因子化规划评分的整体框架。来源：Fig. 2 原图 PNG",
      "paper_title": "DA-WAM: Decision-Aligned Future Latents for Driving World Models",
      "source_url": "https://arxiv.org/html/2608.19085v2/Figures/overview2.png"
    },
    "summary": "DA-WAM 的核心 insight 是： 世界模型对规划最有用时，其预测应当是\"决策信息性的\"——每个候选轨迹应有其专属的未来隐状态预测 ，而非所有候选共享一个\"全局未来\"。现有方法或将预测表示学习与规划优化脱耦，或跨候选共享预测状态，稀释了动作特异性的后果信息。",
    "insight": "DA-WAM 的核心 insight 是：**世界模型对规划最有用时，其预测应当是\"决策信息性的\"——每个候选轨迹应有其专属的未来隐状态预测**，而非所有候选共享一个\"全局未来\"。现有方法或将预测表示学习与规划优化脱耦，或跨候选共享预测状态，稀释了动作特异性的后果信息。\n\nDA-WAM 统一了预测性表示学习、动作条件未来建模和轨迹评分于单一决策目标：在线编码器（V-JEPA 2.1 + LoRA）提取场景隐 token，动作条件预测器为每个候选轨迹生成独立未来隐状态，因子化评分器基于未来隐状态评估轨迹。专家匹配轨迹的预测隐状态由观测未来表示直接监督；安全关键硬负例在规划边界提供额外监督。",
    "pipeline": {
      "input": "当前视觉观测（相机帧）+ 候选轨迹集合 tau i i=1^N",
      "process": "在线编码器 E theta（V-JEPA 2.1 + LoRA）提取当前场景 token Z t；轨迹编码器 E tau 将每条候选编码为动作表示 a i；动作条件预测器 P phi 结合 a i 和 Z t 预测每条候选的未来隐状态 hatZ^i；因子化评分器基于 hatZ^i 输出轨迹评分；目标编码器 E bartheta（EMA 更新）提供未来表示监督",
      "output": "每条候选轨迹的评分（用于规划选择）",
      "details": "**输入**：当前视觉观测（相机帧）+ 候选轨迹集合 \\(\\{\\tau_i\\}_{i=1}^N\\)\n\n**过程**：在线编码器 \\(E_\\theta\\)（V-JEPA 2.1 + LoRA）提取当前场景 token \\(Z_t\\)；轨迹编码器 \\(E_\\tau\\) 将每条候选编码为动作表示 \\(a_i\\)；动作条件预测器 \\(P_\\phi\\) 结合 \\(a_i\\) 和 \\(Z_t\\) 预测每条候选的未来隐状态 \\(\\hat{Z}^i\\)；因子化评分器基于 \\(\\hat{Z}^i\\) 输出轨迹评分；目标编码器 \\(E_{\\bar\\theta}\\)（EMA 更新）提供未来表示监督\n\n**输出**：每条候选轨迹的评分（用于规划选择）"
    },
    "experiments": "- **数据集**：NAVSIM-v1, NAVSIM-v2\n- **指标**：规划相关指标（具体指标待全文确认）\n- **定量结果**：声称 SOTA，具体数值待全文核验\n- **消融**：AlphaXiv 概述提及消融验证了 action-conditioned predictor 和 hard negative 的贡献\n- **实验直接支持的结论**：统一预测与规划目标优于脱耦方案；每候选独立未来隐状态优于共享方案\n- **尚未被实验支持的主张**：反事实隐建模在更复杂场景下的校准性；方法的通用性（限于驾驶规划）",
    "evidence_notes": "",
    "code_data_status": "代码未公开。使用 NAVSIM 公开基准。",
    "limitations": "- 反事实隐状态的监督仅在专家轨迹上直接施加，其余候选通过评分器间接优化——评分器校准是隐假设\n- 方法专用于驾驶规划，非通用世界模型框架\n- 依赖 V-JEPA 2.1 作为视觉骨干，迁移性未验证\n- 硬负例的选取策略和其对评分器决策边界的影响需进一步分析\n\n### 与知域的关系\n\nDA-WAM 与知域关注的 World-Action-Model 和因果建模方向直接相关。其\"每候选独立反事实隐状态\"的思路与 Causal-JEPA 等因果世界建模方向有概念交叉——两者都试图建模\"如果做 A 而非 B 会怎样\"——但 DA-WAM 的反事实是规划层面的隐空间干预（action-conditioned counterfactual latents），而非结构因果模型层面的识别。对\"世界模型如何服务于决策\"这一路线提供了新的架构选择。\n\n---",
    "comments": "",
    "source_reports": [
      "report-f5f82689ca"
    ],
    "deleted": false,
    "updated_at": "2026-08-23",
    "arxiv": {
      "published": "2026-08-19T16:33:02Z",
      "revised_at": "2026-08-20T06:46:02Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2609-09119",
    "title": "DeCAL: Towards Physically-Grounded Dexterous Vision-Language-Action Models via Contact-Aware Latent Co-Imagination",
    "authors": [
      "Yankai Fu",
      "Ning Chen",
      "Junkai Zhao",
      "Heng Zhang",
      "Guocai Yao",
      "Pengwei Wang",
      "Zhongyuan Wang",
      "Shanghang Zhang"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本，v1",
    "arxiv_id": "2609.09119",
    "doi": "10.48550/arXiv.2609.09119",
    "links": {
      "paper": "https://arxiv.org/abs/2609.09119",
      "project": "https://aureleopku.github.io/DeCAL/",
      "code": "https://github.com/AureleoPKU/DeCAL",
      "alphaxiv": "https://alphaxiv.org/abs/2609.09119"
    },
    "tags": [
      "世界模型",
      "触觉与灵巧操作"
    ],
    "figure": {
      "url": "content/images/2609.09119-representative.webp",
      "alt": "Figure 2",
      "label": "Figure 2",
      "paper_title": "DeCAL: Towards Physically-Grounded Dexterous Vision-Language-Action Models via Contact-Aware Latent Co-Imagination",
      "source_url": "https://arxiv.org/html/2609.09119v1#S4.F2"
    },
    "summary": "DeCAL通过 MoT 为理解、想象和动作配置专门专家；接触门控在无接触时降低触觉影响，在接触阶段提高权重；视觉—触觉 latent 共想象联合预测未来外观与力变化，使动作专家获得接触动态线索。",
    "insight": "DeCAL通过 MoT 为理解、想象和动作配置专门专家；接触门控在无接触时降低触觉影响，在接触阶段提高权重；视觉—触觉 latent 共想象联合预测未来外观与力变化，使动作专家获得接触动态线索。",
    "pipeline": {
      "input": "多视角视觉、触觉形变/力、本体状态和语言。",
      "process": "视觉与触觉编码后经 Adaptive Visuo-Tactile Fusion 门控；理解、想象、动作专家交换 token；训练期联合学习未来视觉/触觉 latent 和动作生成。",
      "output": "灵巧手动作块及辅助性的未来视觉—触觉表示。",
      "details": "**输入**：多视角视觉、触觉形变/力、本体状态和语言。\n\n**过程**：视觉与触觉编码后经 Adaptive Visuo-Tactile Fusion 门控；理解、想象、动作专家交换 token；训练期联合学习未来视觉/触觉 latent 和动作生成。\n\n**输出**：灵巧手动作块及辅助性的未来视觉—触觉表示。"
    },
    "experiments": "六项真实任务每项 100 条演示、默认 20 次测试。DeCAL 的六项成功率为 100%、80%、65%、80%、60%、40%，平均约 71%；对比 DECO 为 90%、60%、35%、70%、45%、35%。进度率平均 83.4%。未见物体的 Twist Cap 成功率 75%。结果支持自适应触觉融合，但许多差异只对应 20 次试验中的少数成功；不同 baseline 架构和训练配方仍不完全匹配。平均动作块延迟 0.27 秒。 [正文实验与表格](https://arxiv.org/html/2609.09119v1)。",
    "evidence_notes": "2026-09-14 已核对 arXiv 元数据、正文主要实验与对照；未运行复现实验。",
    "code_data_status": "源码、launch、配置与测试目录已公开；完整训练数据/权重范围待核验。 以上状态核验于 2026-09-14；入口和目录存在不等于已经运行复现实验。",
    "limitations": "依赖特定触觉传感器和遥操作系统；触觉漂移、跨手型标定及传感器损坏会影响门控。任务均为实验室接触操作，跨对象、跨机器人和长期磨损下的泛化证据有限。",
    "comments": "",
    "source_reports": [
      "report-37b94c4145"
    ],
    "deleted": false,
    "updated_at": "2026-09-14",
    "discussion": "DeCAL把接触后果显式加入灵巧 HOI/WAM，可为 StreamingHOI 或 4D HOI 生成引入触觉监督提供依据。",
    "arxiv": {
      "published": "2026-09-08T17:47:43Z",
      "revised_at": "2026-09-08T17:47:43Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2609-07747",
    "title": "Dex-X: Learning Visual-Tactile Dexterous Manipulation From Human Videos with Simulated Interaction",
    "authors": [
      "Ruoqu Chen",
      "Feixiang Ruan",
      "Liu Cao",
      "Zihao Wang",
      "Botian Xu",
      "Shiqin Tong",
      "Jiajun Liu",
      "Mingzhi Pei",
      "Chenyu Zhang",
      "Wanli Xing",
      "Kaifeng Zhang",
      "Mengdi Xu"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本，v2",
    "arxiv_id": "2609.07747",
    "doi": "10.48550/arXiv.2609.07747",
    "links": {
      "paper": "https://arxiv.org/abs/2609.07747",
      "project": "https://dexx-code.github.io/dexx-code/",
      "alphaxiv": "https://alphaxiv.org/abs/2609.07747"
    },
    "tags": [
      "HOI",
      "第一视角与人类视频",
      "触觉与灵巧操作"
    ],
    "figure": {
      "url": "content/images/2609.07747-representative.webp",
      "alt": "Figure 2",
      "label": "Figure 2",
      "paper_title": "Dex-X: Learning Visual-Tactile Dexterous Manipulation From Human Videos with Simulated Interaction",
      "source_url": "https://arxiv.org/html/2609.07747v2#S2.F2"
    },
    "summary": "DEX-X 把单目人类示范重建为仿真 hand-object interaction，再用仿真作为“触觉补全引擎”，为只有视觉的人类视频生成接触监督。",
    "insight": "DEX-X 把单目人类示范重建为仿真 hand-object interaction，再用仿真作为“触觉补全引擎”，为只有视觉的人类视频生成接触监督。",
    "pipeline": {
      "input": "单目人类操作视频。",
      "process": "恢复手—物体运动并转入模拟；生成 tactile supervision；联合点云和触觉训练；zero-shot sim-to-real。",
      "output": "视觉—触觉灵巧操作策略和补全交互数据。",
      "details": "- **输入**：单目人类操作视频。\n- **过程**：恢复手—物体运动并转入模拟；生成 tactile supervision；联合点云和触觉训练；zero-shot sim-to-real。\n- **输出**：视觉—触觉灵巧操作策略和补全交互数据。"
    },
    "experiments": "正文表 1 的六类仿真任务平均总体成功率为 65.9%，但 In-hand Rotation 仅 36.8%，低于 ManipTrans 的 56.9%；DAPG 只覆盖五类单手任务，不能直接比较其五类平均与六类平均。表 2 的真机 cube picking 为 28/30（93.3%），去触觉后 11/30（36.7%），支持触觉在该任务中的作用。表 3 的未见物体只有 Thin Cube 达 23/30，其他未见形状约为 23.3%–26.7%，跨对象泛化仍有限。 [正文实验与表格](https://arxiv.org/html/2609.07747v2)。",
    "evidence_notes": "2026-09-14 已核对 arXiv 元数据、正文主要实验与对照；未运行复现实验。",
    "code_data_status": "官方项目页可访问；本次页面未给出可确认的训练/推理仓库或权重下载入口，代码、数据和模型开放范围待核验。",
    "limitations": "仿真六任务均值和真机单任务结果不能互相替代；不同类别的基线覆盖不同，未见对象成功率明显低于训练对象。",
    "comments": "",
    "source_reports": [
      "report-37b94c4145"
    ],
    "deleted": false,
    "updated_at": "2026-09-14",
    "discussion": "高度关联 3D HOI、人类视频学习和灵巧操作；接触/触觉可作为检验生成世界物理一致性的额外通道。",
    "arxiv": {
      "published": "2026-09-07T16:47:39Z",
      "revised_at": "2026-09-09T06:54:53Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2609-24976",
    "title": "DexTacWAM: A Visuo-Tactile World-Action Model for Dexterous Manipulation",
    "authors": [
      "Haoran Yuan",
      "Zekai Wang",
      "Boning Shao",
      "Haoran Lu",
      "Trevor Darrell",
      "Ismini Lourentzou",
      "Wei Zhan"
    ],
    "year": 2026,
    "publication": "2026，arXiv",
    "arxiv_id": "2609.24976",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2609.24976",
      "project": "https://dextacwam.github.io/",
      "alphaxiv": "https://alphaxiv.org/abs/2609.24976"
    },
    "tags": [
      "World Action Model",
      "触觉与灵巧操作"
    ],
    "figure": {
      "url": "content/images/2609.24976-main.webp",
      "alt": "Figure 1：视触觉世界潜变量经分模态 K/V 归一化输入动作专家",
      "label": "Figure 1 · 视触觉世界潜变量经分模态 K/V 归一化输入动作专家",
      "paper_title": "DexTacWAM: A Visuo-Tactile World-Action Model for Dexterous Manipulation",
      "source_url": "https://arxiv.org/html/2609.24976v1/architecture.png"
    },
    "summary": "将每个fingertip独立编码，再通过finger- and pose-aware compressor聚合为tactile latent，并把该latent真正放入video diffusion world model预测，而不只是给action head附加触觉feature。",
    "insight": "将每个fingertip独立编码，再通过finger- and pose-aware compressor聚合为tactile latent，并把该latent真正放入video diffusion world model预测，而不只是给action head附加触觉feature。",
    "pipeline": {
      "input": "多视角视觉、多指tactile map和robot state。",
      "process": "fingertip encoder → pose-aware tactile compressor → tactile latent与visual latent联合world prediction → action expert读取visuo-tactile future state。",
      "output": "future visual/contact state和dexterous action。",
      "details": "**过程**：fingertip encoder → pose-aware tactile compressor → tactile latent与visual latent联合world prediction → action expert读取visuo-tactile future state。\n\n**输入**：多视角视觉、多指tactile map和robot state。\n\n**输出**：future visual/contact state和dexterous action。\n\nfingertip encoder 后的 finger/pose-aware compressor 生成可供世界预测的触觉 latent；视频世界专家联合预测视觉与接触，动作专家读取共享动态。设计重点是把触觉置于预测目标中，而不仅扩展策略输入。\n\n[原文方法](https://arxiv.org/html/2609.24976)\n\n### 方法细节与实现\n\n**触觉压缩。**十指触觉先保留 finger identity，再将手部姿态注入聚合查询；每只手用一个查询聚合五指 token，实现 5:1 压缩。轻量空间—时间注意力继续建模滑动、换抓和交接过程，左右手触觉潜变量与视觉时间轴对齐，作为额外视图进入世界模型。\n\n**动作读取接口。**视觉 token 稠密，触觉稀疏且统计尺度不同；直接拼接会使共享注意力优化不稳定。方法在交叉注意力前分别对视觉与触觉 K/V 做无参数 RMSNorm，再拼回同一注意力模块，而不是新增独立模态门控。动作目标包含手臂、手、状态及十指共 60D 的力相关目标，整体使用一个 flow-matching MSE。\n\n**三阶段实际训练。**约4小时、488段交互先训练触觉投影和压缩，冻结视觉 VAE；随后直接用各任务约100条示范适配视频世界模型，没有额外触觉中间训练；最后从头训练动作专家，同样没有独立动作预训练。因而题目中的 continual 是逐阶段扩展模态能力，不能直接理解为部署期间持续在线学习。\n\n[对应方法原文](https://arxiv.org/html/2609.24976#S3)"
    },
    "experiments": "22-DoF bimanual平台6个contact-rich tasks平均70.6，strongest baseline 38.0；matched ablation中删除tactile world modeling但保留相同tactile feature/action expert后，四任务平均74.7→26.6。每方法每任务20次real-robot trial。\n\n\n70.6 是论文六任务聚合指标，部分任务包含阶段性进度，不能都解读成二元成功事件百分比。匹配四任务消融 74.7→26.6 则保留相同触觉特征与动作专家，更接近隔离 tactile world modeling 的贡献。基线 RDP 38.0 与该四任务子集的 26.6 来自不同汇总，不能直接拼接为同一排名。\n\n[原文实验与表格](https://arxiv.org/html/2609.24976)\n\n**收益与可比性。**六任务平均任务得分70.6，其中若干任务按阶段进度计分，不能统一称为70.6%二元成功率。四任务匹配消融去掉触觉世界建模后74.7→26.6，更直接支持未来触觉的作用。主表基线沿用原动作格式，而本文使用相对末端动作，需将这种接口差异纳入归因。\n\n[实验与设置原文](https://arxiv.org/html/2609.24976)",
    "evidence_notes": "已核验原文方法与实验；关键比较与限制见各节",
    "code_data_status": "官方项目有代码入口占位，但尚未公开训练仓库。",
    "limitations": "传感器仍高度embodiment-specific；真实任务规模只有6类。未来需验证contact representation能否迁移到不同tactile hardware。",
    "comments": "",
    "source_reports": [],
    "deleted": false,
    "updated_at": "2026-09-24",
    "challenges": "只把当前触觉拼到 action head 可能帮助瞬时控制，却没有约束模型理解接触会如何随未来动作变化。多手指触觉还需要保留手指身份与位置，而不能无差别平均。",
    "motivation": "将每个fingertip独立编码，再通过finger- and pose-aware compressor聚合为tactile latent，并把该latent真正放入video diffusion world model预测，而不只是给action head附加触觉feature。",
    "technical_approach": "**过程**：fingertip encoder → pose-aware tactile compressor → tactile latent与visual latent联合world prediction → action expert读取visuo-tactile future state。\n\n**输入**：多视角视觉、多指tactile map和robot state。\n\n**输出**：future visual/contact state和dexterous action。\n\nfingertip encoder 后的 finger/pose-aware compressor 生成可供世界预测的触觉 latent；视频世界专家联合预测视觉与接触，动作专家读取共享动态。设计重点是把触觉置于预测目标中，而不仅扩展策略输入。\n\n[原文方法](https://arxiv.org/html/2609.24976)\n\n### 方法细节与实现\n\n**触觉压缩。**十指触觉先保留 finger identity，再将手部姿态注入聚合查询；每只手用一个查询聚合五指 token，实现 5:1 压缩。轻量空间—时间注意力继续建模滑动、换抓和交接过程，左右手触觉潜变量与视觉时间轴对齐，作为额外视图进入世界模型。\n\n**动作读取接口。**视觉 token 稠密，触觉稀疏且统计尺度不同；直接拼接会使共享注意力优化不稳定。方法在交叉注意力前分别对视觉与触觉 K/V 做无参数 RMSNorm，再拼回同一注意力模块，而不是新增独立模态门控。动作目标包含手臂、手、状态及十指共 60D 的力相关目标，整体使用一个 flow-matching MSE。\n\n**三阶段实际训练。**约4小时、488段交互先训练触觉投影和压缩，冻结视觉 VAE；随后直接用各任务约100条示范适配视频世界模型，没有额外触觉中间训练；最后从头训练动作专家，同样没有独立动作预训练。因而题目中的 continual 是逐阶段扩展模态能力，不能直接理解为部署期间持续在线学习。\n\n[对应方法原文](https://arxiv.org/html/2609.24976#S3)",
    "discussion": "**阅读者分析**：这是目前最直接证明“contact prediction作为world state对action有额外价值”的本期工作之一。",
    "arxiv": {
      "published": "2026-09-21",
      "revised_at": "",
      "primary_category": "cs.RO"
    },
    "source_papers": [
      "content/papers/2609.24976.md"
    ]
  },
  {
    "arxiv": {
      "published": "2025-12-19T18:59:51Z",
      "revised_at": "2025-12-19T18:59:51Z",
      "primary_category": "cs.CV"
    },
    "arxiv_id": "2512.17907",
    "authors": [
      "Byungjun Kim",
      "Taeksoo Kim",
      "Junyoung Lee",
      "Hanbyul Joo"
    ],
    "code_data_status": "模型/权重链接已记录",
    "comments": "",
    "deleted": false,
    "doi": "",
    "evidence_notes": "",
    "experiments": "构建 synthetic + real hybrid interaction dataset。实验显示 DWM 在 synthetic / real、static / dynamic view 设置下，相比 SDEdit、CogVideoX-Fun、InterDyn 等具有更好的视觉质量、物理合理性和场景一致性。\n\n**对你方向的启发**\n\n- 强项是 **3D scene prior + 2D video dynamics**。\n- 弱点是没有显式更新 object state；更像“3D-conditioned video world model”。\n- 可扩展方向：把 static 3D scene 改成 **dynamic 4D scene state**，做可累计交互。\n\n---",
    "figure": {
      "alt": "DWM overview",
      "label": "DWM overview",
      "paper_title": "Dexterous World Models",
      "source_url": "https://arxiv.org/html/2512.17907v1/overview_v2_fix.png",
      "url": "https://arxiv.org/html/2512.17907v1/overview_v2_fix.png"
    },
    "id": "arxiv-2512-17907",
    "insight": "DWM 关注如何让静态 3D digital twin 具备可交互性。它不是让视频模型从零生成整个场景，而是先给定静态 3D scene rendering，再让模型学习 hand action 导致的 residual dynamics。关键是把 **static scene renderings** 和 **egocentric hand mesh renderings** 同时作为 video diffusion 条件。",
    "limitations": "- 强项是 **3D scene prior + 2D video dynamics**。\n- 弱点是没有显式更新 object state；更像“3D-conditioned video world model”。\n- 可扩展方向：把 static 3D scene 改成 **dynamic 4D scene state**，做可累计交互。\n\n---",
    "links": {
      "paper": "https://arxiv.org/abs/2512.17907",
      "project": "https://snuvclab.github.io/dwm/",
      "alphaxiv": "https://alphaxiv.org/abs/2512.17907",
      "publication": "https://openaccess.thecvf.com/content/CVPR2026/html/Kim_Dexterous_World_Models_CVPR_2026_paper.html"
    },
    "pipeline": {
      "input": "静态 3D scene rendering、camera trajectory、egocentric hand mesh motion、文本 prompt。",
      "process": "用 inpainting video diffusion 初始化；静态场景 latent 与手部 mesh latent 作为条件；DiT 在 latent video space 学习动作导致的残差变化。",
      "output": "抓取、打开、移动物体等第一视角交互视频。",
      "details": "- **输入**：静态 3D scene rendering、camera trajectory、egocentric hand mesh motion、文本 prompt。\n- **过程**：渲染静态场景以保证空间一致；渲染手部 mesh 表达动作几何和运动；video diffusion 学习 action-induced visual dynamics。\n- **输出**：抓取、打开、移动物体等第一视角交互视频。"
    },
    "publication": "CVPR 2026",
    "source_reports": [
      "report-0ad44831eb",
      "report-90041fa2f9"
    ],
    "summary": "DWM 关注如何让静态 3D digital twin 具备可交互性。它不是让视频模型从零生成整个场景，而是先给定静态 3D scene rendering，再让模型学习 hand action 导致的 residual dynamics。关键是把 static scene renderings 和 egocentric hand mesh renderings 同时作为 video diffusion 条件。",
    "tags": [
      "3D/4D",
      "Agent与可执行世界",
      "HOI",
      "第一视角与人类视频",
      "视频生成"
    ],
    "title": "Dexterous World Models",
    "updated_at": "2026-08-31",
    "year": 2026,
    "discussion": "- 强项是 **3D scene prior + 2D video dynamics**。\n- 弱点是没有显式更新 object state；更像“3D-conditioned video world model”。\n- 可扩展方向：把 static 3D scene 改成 **dynamic 4D scene state**，做可累计交互。\n\n---"
  },
  {
    "id": "arxiv-2609-20649",
    "title": "DexTouch-WM: Learning Action-Conditioned Tactile World Models from Human Touch for Dexterous Robot Manipulation",
    "authors": [
      "Yan Qin",
      "Yue Chen",
      "Wenwei Lin",
      "Shujia Liu",
      "Chuqiao Lyu",
      "Kailun Su",
      "Weiyang Jin",
      "Chenze Yu",
      "Ping Luo",
      "Wenbo Ding",
      "Tianxing Chen",
      "Renjing Xu"
    ],
    "year": 2026,
    "publication": "2026，arXiv v2；IROS 2026 Workshop RoBoWoMo Lightning Talk",
    "arxiv_id": "2609.20649",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2609.20649",
      "alphaxiv": "https://alphaxiv.org/abs/2609.20649"
    },
    "tags": [
      "World Action Model",
      "触觉与灵巧操作",
      "跨本体迁移"
    ],
    "figure": {
      "url": "content/images/2609.20649-main.webp",
      "alt": "Figure 2：独立触觉编码与视觉专家通过联合注意力预测未来 RGB 和接触状态",
      "label": "Figure 2 · 独立触觉编码与视觉专家通过联合注意力预测未来 RGB 和接触状态",
      "paper_title": "DexTouch-WM: Learning Action-Conditioned Tactile World Models from Human Touch for Dexterous Robot Manipulation",
      "source_url": "https://arxiv.org/html/2609.20649v2/Pipeline.png"
    },
    "summary": "DexTouch-WM将 human touch作为 robot tactile world-model 的 scaling data。作者在人手和机器人手上使用兼容的柔性压阻 tactile array，并把 human motion retarget 到 robot action space，使 human/robot transition能够监督同一个 action-conditioned visual-tactile world model。",
    "insight": "DexTouch-WM将 human touch作为 robot tactile world-model 的 scaling data。作者在人手和机器人手上使用兼容的柔性压阻 tactile array，并把 human motion retarget 到 robot action space，使 human/robot transition能够监督同一个 action-conditioned visual-tactile world model。",
    "pipeline": {
      "input": "RGB、多区域 tactile observations 和 retargeted action。",
      "process": "预训练 video expert处理视觉，anatomy-aware tactile expert处理 palm/fingertip token；AdaLN式 action conditioning对齐世界演化；模型联合预测 future RGB 与 bilateral tactile state。",
      "output": "未来视觉和接触状态，可进一步作为 policy evaluator 或 synthetic trajectory generator。",
      "details": "**过程**：预训练 video expert处理视觉，anatomy-aware tactile expert处理 palm/fingertip token；AdaLN式 action conditioning对齐世界演化；模型联合预测 future RGB 与 bilateral tactile state。\n\n**输入**：RGB、多区域 tactile observations 和 retargeted action。\n\n**输出**：未来视觉和接触状态，可进一步作为 policy evaluator 或 synthetic trajectory generator。\n\n区分数据规模化和控制验证：共享传感器布局与动作重定向使人类触觉序列进入同一个预测器；世界模型还被用来估计策略相对好坏、生成额外训练轨迹。前者需要评价排序相关性，不能把模拟成功率直接当成真实成功率。\n\n[原文方法](https://arxiv.org/html/2609.20649)\n\n### 方法细节与实现\n\n**视觉与触觉双专家。**视觉端继承 Wan2.2-TI2V-5B 和冻结 VAE，触觉端使用较轻的专门编码与 Transformer；两者通过带掩码的联合注意力交互，同时保留各自的前馈层和时间调制。触觉不是贴在 RGB 上的一幅提示图，而是有独立预测目标的动力学模态。\n\n**触觉编码细节。**每只手保留 320 个 taxel：五个 4×4 指尖阵列和一个 15×16 掌部阵列。所有指尖共享编码器、两掌共享另一编码器，以 pad identity 保留传感器位置。预训练采用接触加权以避免大量零接触区域主导损失，然后冻结触觉编解码器。未来触觉预测相对初始潜变量的残差 r_t=z_t−z_0，解码时加回干净的初始锚点。\n\n**人机对齐并非无标定。**HumanTouch 联合采集触觉、Manus 手部骨架、Vive 腕部位姿和多视角 RGB；将人手运动通过 IK 对齐到 WujiHand2。统一的 67D 动作包含双腕姿态、双手关节和相机位姿，并相对首帧表达。传感器空间布局、时间同步与手部几何标定是迁移前提，而非从普通网络视频直接恢复真实触觉。\n\n[对应方法原文](https://arxiv.org/html/2609.20649#S3)"
    },
    "experiments": "固定 5 小时 robot data，把 human interaction由 0 扩到 100 小时后，held-out robot prediction持续改善；Contact-IoU由0.42升至0.59，Contact-F1由0.55升至0.71，同时视觉 trajectory accuracy也改善。\n\n\n表 1 的精确 Contact-IoU 为 0.415→0.588、Contact-F1 为 0.551→0.706，触觉 MSE 为 0.093→0.029；变化对应固定 5h 机器人数据、加入 100h 人类数据。表 2 的模拟策略评分有明显乐观偏差，例如 FTP-1 Place Shoes 的真实成功率 0.725，WM-Mix 为 0.963。因此论文还用 Pearson/MMRV 衡量策略排序，预测更好不等于绝对成功率已校准。\n\n[原文实验与表格](https://arxiv.org/html/2609.20649)\n\n**数据增量与用途。**固定 5 小时机器人数据，加入 100 小时人类数据后，接触 IoU 从 0.415 到 0.588、F1 从 0.551 到 0.706、MSE 从 0.093 到 0.029，支持触觉未来预测改善。将世界模型作为策略评价器时，作者仍观察到绝对成功率偏乐观；相对排名有用与绝对成功概率校准是两个不同问题。\n\n[实验与设置原文](https://arxiv.org/html/2609.20649)",
    "evidence_notes": "已核验原文方法与实验；关键比较与限制见各节",
    "code_data_status": "本次未核验到正式公开仓库、数据下载或模型权重。",
    "limitations": "human→robot transfer依赖共享 tactile sensor topology与action retargeting；因此它目前还不是“任意互联网人类视频/触觉直接迁移”的通用方案。",
    "comments": "",
    "source_reports": [],
    "deleted": false,
    "updated_at": "2026-09-24",
    "challenges": "视觉能看到物体移动，但很难单独确定是否接触、接触在哪个手指及压力如何演化。机器人触觉数据昂贵，而人类触摸数据与机器人动作和传感器拓扑并不天然对齐。",
    "motivation": "DexTouch-WM将 human touch作为 robot tactile world-model 的 scaling data。作者在人手和机器人手上使用兼容的柔性压阻 tactile array，并把 human motion retarget 到 robot action space，使 human/robot transition能够监督同一个 action-conditioned visual-tactile world model。",
    "technical_approach": "**过程**：预训练 video expert处理视觉，anatomy-aware tactile expert处理 palm/fingertip token；AdaLN式 action conditioning对齐世界演化；模型联合预测 future RGB 与 bilateral tactile state。\n\n**输入**：RGB、多区域 tactile observations 和 retargeted action。\n\n**输出**：未来视觉和接触状态，可进一步作为 policy evaluator 或 synthetic trajectory generator。\n\n区分数据规模化和控制验证：共享传感器布局与动作重定向使人类触觉序列进入同一个预测器；世界模型还被用来估计策略相对好坏、生成额外训练轨迹。前者需要评价排序相关性，不能把模拟成功率直接当成真实成功率。\n\n[原文方法](https://arxiv.org/html/2609.20649)\n\n### 方法细节与实现\n\n**视觉与触觉双专家。**视觉端继承 Wan2.2-TI2V-5B 和冻结 VAE，触觉端使用较轻的专门编码与 Transformer；两者通过带掩码的联合注意力交互，同时保留各自的前馈层和时间调制。触觉不是贴在 RGB 上的一幅提示图，而是有独立预测目标的动力学模态。\n\n**触觉编码细节。**每只手保留 320 个 taxel：五个 4×4 指尖阵列和一个 15×16 掌部阵列。所有指尖共享编码器、两掌共享另一编码器，以 pad identity 保留传感器位置。预训练采用接触加权以避免大量零接触区域主导损失，然后冻结触觉编解码器。未来触觉预测相对初始潜变量的残差 r_t=z_t−z_0，解码时加回干净的初始锚点。\n\n**人机对齐并非无标定。**HumanTouch 联合采集触觉、Manus 手部骨架、Vive 腕部位姿和多视角 RGB；将人手运动通过 IK 对齐到 WujiHand2。统一的 67D 动作包含双腕姿态、双手关节和相机位姿，并相对首帧表达。传感器空间布局、时间同步与手部几何标定是迁移前提，而非从普通网络视频直接恢复真实触觉。\n\n[对应方法原文](https://arxiv.org/html/2609.20649#S3)",
    "discussion": "**阅读者分析**：它把“从人类视频学习”进一步扩展到“从人类**触觉交互**学习”，对 contact-aware 3D/4D HOI WAM尤其重要。",
    "arxiv": {
      "published": "2026-09-17",
      "revised_at": "2026-09-18",
      "primary_category": "cs.RO"
    },
    "source_papers": [
      "content/papers/2609.20649.md"
    ]
  },
  {
    "arxiv": {
      "published": "2026-06-04T03:16:31Z",
      "revised_at": "2026-06-09T07:25:40Z",
      "primary_category": "cs.RO"
    },
    "arxiv_id": "2606.05645",
    "authors": [
      "Ziyang Yao",
      "Haochen Liu",
      "Yuncheng Jiang",
      "Zeyu Zhu",
      "Zibin Guo",
      "Jingru Wang",
      "Tianle Liu",
      "Jianwei Cui",
      "Kuiyuan Yang",
      "Hongwei Xie",
      "Jingwei Zhao",
      "Guang Chen",
      "Hangjun Ye"
    ],
    "code_data_status": "截至来源报告核验时，未记录可确认的官方代码、数据或模型入口；这表示开放状态待核验，不代表资源确定不存在。",
    "comments": "",
    "deleted": false,
    "doi": "",
    "evidence_notes": "",
    "experiments": "NAVSIM v2 达 90.4 EPDMS；world generation 达 FID 6.6 / FVD 80.0；SFT 89.1，decision-conditioned 90.0，RL post-training 90.4。结论：统一 discrete vision-action space 不只用于视频生成，也能支撑 planning、counterfactual generation 和 RL refinement。\n\n---",
    "figure": {
      "url": "https://arxiv.org/html/2606.05645v2/pic1_v5.png",
      "alt": "Discrete-WAM architecture",
      "label": "Discrete-WAM 模型架构。来源：原图",
      "paper_title": "Discrete-WAM: Unified Discrete Vision-Action Token Editing for World-Policy Learning",
      "source_url": "https://arxiv.org/html/2606.05645v2/pic1_v5.png"
    },
    "id": "arxiv-2606-05645",
    "insight": "Discrete-WAM 认为 continuous world latent 与 continuous action 分处不同表示空间，使 world generation、policy learning、counterfactual reasoning 难以统一。因此它提出：**把 future vision 和 ego action 都离散成 token，在同一个 discrete generative / editing framework 中建模**。这样“换一组 action token 后世界如何变化”天然成为可编辑、可组合的问题。",
    "limitations": "来源报告未单列可核验的局限、失败案例或开放问题；在补充原论文正文核验前，不对该工作的泛化性、因果性、复现性或 SOTA 结论作扩大解释。\n\n### 与知域的关系\n\n统一离散视觉与动作 token 后再做 RL refinement，把 R1/GRPO 路线从纯视频生成延伸到 world-policy learning。",
    "links": {
      "paper": "https://arxiv.org/abs/2606.05645",
      "alphaxiv": "https://alphaxiv.org/abs/2606.05645"
    },
    "pipeline": {
      "input": "camera observations、driving context / ego state / navigation。",
      "process": "- 离散化 ：image 转 discrete visual tokens；trajectory/action 转 discrete action tokens；高层行为转 decision token。；- 统一 Transformer 任务 ：World Modeling，即 action 到 future vision；World-Policy Modeling，即交错预测 action / vision token；Decision-conditioned Policy，即 decision 到 action trajectory。",
      "output": "先得到 high-level decision，再通过 confidence-guided parallel token editing 迭代 refinement action trajectory。",
      "details": "- **输入**：camera observations、driving context / ego state / navigation。\n- **离散化**：image 转 discrete visual tokens；trajectory/action 转 discrete action tokens；高层行为转 decision token。\n- **统一 Transformer 任务**：World Modeling，即 action 到 future vision；World-Policy Modeling，即交错预测 action / vision token；Decision-conditioned Policy，即 decision 到 action trajectory。\n- **推理期输出**：先得到 high-level decision，再通过 confidence-guided parallel token editing 迭代 refinement action trajectory。"
    },
    "publication": "arXiv 2026",
    "source_reports": [
      "report-cedaa0825a",
      "report-e81e6bd3a1"
    ],
    "summary": "Discrete-WAM 认为 continuous world latent 与 continuous action 分处不同表示空间，使 world generation、policy learning、counterfactual reasoning 难以统一。因此它提出： 把 future vision 和 ego action 都离散成 token，在同一个 discrete generative / editing framework 中建模 。这样“换一组 action token 后世界如何变化”天然成为可编辑、可组合的问题。",
    "tags": [
      "3D/4D",
      "World Action Model",
      "因果与反事实",
      "强化与模仿学习",
      "机器人学习",
      "自监督与预测表征",
      "视频生成"
    ],
    "title": "Discrete-WAM: Unified Discrete Vision-Action Token Editing for World-Policy Learning",
    "updated_at": "2026-08-31",
    "year": 2026
  },
  {
    "id": "arxiv-2609-03673",
    "title": "Do Video Generators Track the World Across Segments? A Benchmark and Method for World-State Reasoning in Video Continuation",
    "authors": [
      "Yingmao Miao",
      "Pengfei Zhang",
      "Chaoran Xu",
      "Meng Yu",
      "Jing Tang",
      "Xiangxiang Chu",
      "Chao Shen",
      "Chenhao Lin"
    ],
    "year": 2026,
    "publication": "2026，arXiv",
    "arxiv_id": "2609.03673",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2609.03673",
      "alphaxiv": "https://alphaxiv.org/abs/2609.03673"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "流式与自回归",
      "物理建模与仿真",
      "第一视角与人类视频",
      "跨本体迁移"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2609.03673v1/Figures/teaser.jpg",
      "alt": "视频续接中的世界状态推理评测概览",
      "label": "视频续接中的世界状态推理评测概览；来源：论文原图",
      "paper_title": "Do Video Generators Track the World Across Segments? A Benchmark and Method for World-State Reasoning in Video Continuation",
      "source_url": "https://arxiv.org/html/2609.03673v1/Figures/teaser.jpg"
    },
    "summary": "论文区分\"历史画面记忆\"和\"由历史动作决定的世界状态\"。Statebench 覆盖过去可见状态、遮挡过程状态和复杂转移状态，用于检验视频续接是否真正反映历史视频和新 prompt 共同决定的后续状态。",
    "insight": "论文区分\"历史画面记忆\"和\"由历史动作决定的世界状态\"。Statebench 覆盖过去可见状态、遮挡过程状态和复杂转移状态，用于检验视频续接是否真正反映历史视频和新 prompt 共同决定的后续状态。",
    "pipeline": {
      "input": "历史视频、历史 prompt、新 prompt。",
      "process": "维护实体—状态表示，根据新 prompt 更新状态，再生成视频续接。",
      "output": "包含正确世界状态的后续视频。",
      "details": "**输入**：历史视频、历史 prompt、新 prompt。\n\n**过程**：维护实体—状态表示，根据新 prompt 更新状态，再生成视频续接。\n\n**输出**：包含正确世界状态的后续视频。"
    },
    "experiments": "摘要介绍 benchmark 和 Stateagent，但未提供足够定量结果。需要全文核验：\n\n- 状态标注如何获得；\n- 续接视频的评价指标；\n- 与普通历史帧检索和视频扩展方法的比较；\n- 遮挡状态是否存在唯一答案。",
    "evidence_notes": "",
    "code_data_status": "未确认公开链接。",
    "limitations": "- 隐式状态可能无法从历史视频唯一确定。\n- 结构化状态表示可能遗漏连续物理量。\n- benchmark 设计可能偏向显式实体和离散状态。\n\n### 与知域的关系\n\n该工作直接影响知域对长时记忆、交互视频和世界状态接口的研究，补充 R2M-Bench、ReWorld 和 Matrix-Game 系列。",
    "comments": "",
    "source_reports": [
      "report-0d81d19c6c"
    ],
    "deleted": false,
    "updated_at": "2026-09-08",
    "arxiv": {
      "published": "2026-09-03T11:09:46Z",
      "revised_at": "2026-09-03T11:09:46Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2608-20308",
    "title": "DreamHand: Repurposing Video Diffusion Models for Occlusion-Robust Egocentric 3D Hand Motion Recovery",
    "authors": [
      "Yufei Liu",
      "Xixi Wang",
      "Hao Li",
      "Ganlong Zhao",
      "Kaitong Cai",
      "Chengkai Jin",
      "Chunxiao Liu",
      "Jianbo Liu",
      "Siyuan Huang",
      "Xingang Pan",
      "Hongsheng Li"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本",
    "arxiv_id": "2608.20308",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.20308",
      "project": "https://ggxxii.github.io/dreamhand/",
      "alphaxiv": "https://alphaxiv.org/abs/2608.20308"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "World Action Model",
      "动作表征",
      "因果与反事实",
      "流式与自回归",
      "第一视角与人类视频",
      "视频生成"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.20308v1/dreamhand_method.png",
      "alt": "DreamHand Fig. 2：遮挡鲁棒的自我中心 3D 手部恢复框架",
      "label": "DreamHand，Fig. 2，clean-latent 编码、Ray Head 与双向时空解码器组成的整体框架。来源：Fig. 2 原图 PNG",
      "paper_title": "DreamHand: Repurposing Video Diffusion Models for Occlusion-Robust Egocentric 3D Hand Motion Recovery",
      "source_url": "https://arxiv.org/html/2608.20308v1/dreamhand_method.png"
    },
    "summary": "DreamHand 的核心 insight 是： 视频扩散模型的 clean latent（sigma=0 单次前向）已经编码了被遮挡和出视野手部的状态信息 ，不需要多步随机采样做像素空间渲染。因此，将 VDM 从随机像素生成器重新定位为确定性几何编码器——Deterministic Clean-Latent Encoder——即可从单次前向中提取出包含遮挡区域信息的特征。",
    "insight": "DreamHand 的核心 insight 是：**视频扩散模型的 clean latent（\\(\\sigma=0\\) 单次前向）已经编码了被遮挡和出视野手部的状态信息**，不需要多步随机采样做像素空间渲染。因此，将 VDM 从随机像素生成器重新定位为确定性几何编码器——Deterministic Clean-Latent Encoder——即可从单次前向中提取出包含遮挡区域信息的特征。\n\n配合双向时空解码器（Bidirectional Spatiotemporal Decoder），DreamHand 从离线 clip 级别恢复连续双手轨迹，实现度量级 3D 定位，无需外接检测器。Ray-Based Camera Solver 支持免相机内参配置。",
    "pipeline": {
      "input": "自我中心视频片段",
      "process": "Wan VAE 编码为 latent → Wan DiT（sigma=0，确定性前向）提取 Block-15 特征 → 特征分两路：(1) Ray Head 预测相机内参（训练时监督，推理时可弃用）；(2) 双向时空解码器从特征恢复连续双手 3D 关节轨迹 → Ray-Based Camera Solver 从射线解算平移",
      "output": "双手 3D 关节位置序列（度量坐标），可选配相机内参",
      "details": "**输入**：自我中心视频片段\n\n**过程**：Wan VAE 编码为 latent → Wan DiT（\\(\\sigma=0\\)，确定性前向）提取 Block-15 特征 → 特征分两路：(1) Ray Head 预测相机内参（训练时监督，推理时可弃用）；(2) 双向时空解码器从特征恢复连续双手 3D 关节轨迹 → Ray-Based Camera Solver 从射线解算平移\n\n**输出**：双手 3D 关节位置序列（度量坐标），可选配相机内参"
    },
    "experiments": "- **基准**：ARCTIC, HOT3D, OAKINK2, HOCapture, 野生视频\n- **指标**：MPJPE-p, PA-p, MPJPE+OOS, EPE2D-p, GO-p, CT-p, Jitter, FAcc, Recall, F1\n- **定量结果**：ARCTIC 上 MPJPE-p 降低 30%（遮挡密集场景）；HOT3D 上降低 40%；含出视野手部评估时增益 46%–61%；五个基准全部 SOTA\n- **基线**：InterWild, HaMeR, Hamba, WildHands, WiLoR, EgoForce, OmniHands, Dyn-HaMR, HaWoR\n- **消融**：项目页展示了 K-free 配置（免相机内参）与标准配置的对比；展示了逐步遮挡程度的性能曲线\n- **实验直接支持的结论**：clean-latent 编码在遮挡和出视野场景下显著优于逐帧/窗口回归方法；无需外接检测器；免内参配置可行\n- **尚未被实验支持的主张**：方法对 Wan VAE+DiT 以外骨干的通用性；实时适用性（离线 clip 级别）",
    "evidence_notes": "",
    "code_data_status": "代码和模型暂未公开。项目页展示定性演示和 retargeting 结果，但无下载链接。",
    "limitations": "- 方法依赖 Wan VAE+DiT 的特定架构，迁移到其他视频扩散骨干的通用性未验证\n- 离线 clip-level 框架，不适合实时场景\n- retargeting 演示为定性，缺定量评估\n- \"clean latent 隐含遮挡信息\"的机制解释停留在经验层面，理论分析不足\n\n### 与知域的关系\n\nDreamHand 与知域关注的自我中心世界模型和 HOI 方向直接相关。从人类日常自我中心视频恢复 3D 手部轨迹是 HOI 数据管线的关键入口，DreamHand 的遮挡鲁棒性直接提升了该管线的可用性。与知域已收录的 EgoGrasp（自我中心 HOI 估计）、Hand2World（自我中心交互生成）、HandsOnWorld（自我中心视频生成）形成互补——DreamHand 提供更上游的 3D 手部数据。\n\n---",
    "comments": "",
    "source_reports": [
      "report-f5f82689ca"
    ],
    "deleted": false,
    "updated_at": "2026-08-23",
    "arxiv": {
      "published": "2026-08-20T17:46:24Z",
      "revised_at": "2026-09-01T06:09:24Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2608-23863",
    "title": "DreamLedger: Where to Refuse World-Model Imagination Using Execution-Settled Credit",
    "authors": [
      "Xianyao Li",
      "Ruitong Tian",
      "Rui Min",
      "Fang Xu",
      "Jing Du"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本（首发 2026-08-24，v2 2026-08-26）",
    "arxiv_id": "2608.23863",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.23863",
      "alphaxiv": "https://alphaxiv.org/abs/2608.23863"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "流式与自回归",
      "第一视角与人类视频",
      "长时记忆"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.23863v2/teaser.png",
      "alt": "DreamLedger: Where to Refuse World-Model Imagination Using Execution-Settled Credit 代表图",
      "label": "Fig. 1: DreamLedger overview. Top: real Franka tabletop deployment: a consumed prediction is frozen as a claim (endpoint within R R ; actual wrist-camera view); settled history quotes p ^ hat{p} and gates reliance; attributable execution evidence updates the books; every spend is audit-replayable (all values are deployment records). Bottom: the same ledger core, with host models unchanged, spans three simulated doma… 来源：论文图",
      "paper_title": "DreamLedger: Where to Refuse World-Model Imagination Using Execution-Settled Credit",
      "source_url": "https://arxiv.org/html/2608.23863v2/teaser.png"
    },
    "summary": "机器人开始基于世界模型预测行动，但可靠性仍用\"当下瞬时、模型内部\"的信号表达——预测现在看起来可信，却不知道同类想象过去是否失败过。DreamLedger 把可靠性当作 持久化部署对象 ：一份执行结算信用文件，记录被消费的预测被现实兑现的频次，按运行工况、区域、预测视界索引，每次使用前查询；每条预测注册为 claim、无人工标注地与到达的现实结算；低信用缩短依赖或触发观测。",
    "insight": "机器人开始基于世界模型预测行动，但可靠性仍用\"当下瞬时、模型内部\"的信号表达——预测现在看起来可信，却不知道同类想象过去是否失败过。DreamLedger 把可靠性当作**持久化部署对象**：一份执行结算信用文件，记录被消费的预测被现实兑现的频次，按运行工况、区域、预测视界索引，每次使用前查询；每条预测注册为 claim、无人工标注地与到达的现实结算；低信用缩短依赖或触发观测。",
    "pipeline": {
      "input": "世界模型预测 + 执行现实。",
      "process": "预测注册为 claim → 与现实结算（无标注）→ 信用文件按工况/区域/视界索引更新 → 消费前门控（低信用缩短依赖/触发观测）。",
      "output": "带执行结算信用的可靠性门控。",
      "details": "**输入**：世界模型预测 + 执行现实。\n**过程**：预测注册为 claim → 与现实结算（无标注）→ 信用文件按工况/区域/视界索引更新 → 消费前门控（低信用缩短依赖/触发观测）。\n**输出**：带执行结算信用的可靠性门控。"
    },
    "experiments": "仅摘要核验：报告信用门控减少灾难性依赖。证据等级：仅摘要；门控收益的规模与基准待全文。",
    "evidence_notes": "",
    "code_data_status": "未公开。",
    "limitations": "- 信用结算的延迟（预测兑现周期长则信用滞后）；\n- 区域/工况离散化的粒度；\n- 与概率性不确定度量（如 ensemble/confidence）的对比。\n\n### 与知域的关系\n属世界模型\"可靠性/拒绝\"机制，与知域 FACT（failure-aware causal training）、Where World Models Break 形成评测-机制-部署闭环。",
    "comments": "",
    "source_reports": [
      "report-a141624b1e"
    ],
    "deleted": false,
    "updated_at": "2026-08-31",
    "arxiv": {
      "published": "2026-08-24T22:12:10Z",
      "revised_at": "2026-09-02T08:30:28Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "arxiv": {
      "published": "2026-08-05T16:04:23Z",
      "revised_at": "2026-08-05T16:04:23Z",
      "primary_category": "cs.RO"
    },
    "arxiv_id": "2608.04996",
    "authors": [
      "Shanglin Yuan",
      "Weiheng Zhao",
      "Xin Shi",
      "Haoyi Jiang",
      "Xianda Guo",
      "Liu Liu",
      "Wenyu Liu",
      "Wei Sui",
      "Xinggang Wang"
    ],
    "code_data_status": "截至来源报告核验时，未记录可确认的官方代码、数据或模型入口；这表示开放状态待核验，不代表资源确定不存在。",
    "comments": "",
    "deleted": false,
    "doi": "",
    "evidence_notes": "",
    "experiments": "LIBERO-Plus no-rollout 从 Fast-WAM 51.36 提升到 63.44，joint rollout 从 69.16 提升到 75.47；真机 unseen visual perturbation 从 55.6 提升到 74.4。关键证据是 no-rollout 也显著提升，说明 beyond-RGB future 的主要价值在训练期塑造 action representation，而不只是 test-time imagination。\n\n---",
    "figure": {
      "alt": "DreamWAM overview",
      "label": "DreamWAM 框架",
      "paper_title": "DreamWAM: Beyond RGB Future Prediction for World Action Models",
      "source_url": "https://arxiv.org/html/2608.04996v1/DreamWAM.png",
      "url": "https://arxiv.org/html/2608.04996v1/DreamWAM.png"
    },
    "id": "arxiv-2608-04996",
    "insight": "DreamWAM 对 RGB foresight 的批判更彻底：RGB future 混合了 action-relevant dynamics 与 texture、background、lighting、viewpoint 等 nuisance factors。因此 WAM 应预测的不是“未来长什么样”，而是未来有哪些对 action 有意义的状态变化。它将 future 拆为 **appearance + motion + geometry + semantics**。",
    "limitations": "来源报告未单列可核验的局限、失败案例或开放问题；在补充原论文正文核验前，不对该工作的泛化性、因果性、复现性或 SOTA 结论作扩大解释。",
    "links": {
      "paper": "https://arxiv.org/abs/2608.04996",
      "alphaxiv": "https://alphaxiv.org/abs/2608.04996"
    },
    "pipeline": {
      "input": "当前 RGB observation、language、action trajectory。",
      "process": "- 训练 future targets ：RGB 使用 Wan VAE latent；Motion 使用 RAFT optical flow 后接 VAE；Geometry 使用 Depth Anything V3 feature；Semantic 使用 DINOv2 feature。；- 建模方式 ：RGB + optical flow 做 joint latent denoising；geometry / semantic 通过 gated residual branches 注入 VideoDiT；VideoDiT 与 ActionDiT shared attention。",
      "output": "beyond-RGB branches 删除；支持 no-rollout 当前帧到 action，也支持 joint RGB future + action 联合生成。",
      "details": "- **输入**：当前 RGB observation、language、action trajectory。\n- **训练 future targets**：RGB 使用 Wan VAE latent；Motion 使用 RAFT optical flow 后接 VAE；Geometry 使用 Depth Anything V3 feature；Semantic 使用 DINOv2 feature。\n- **建模方式**：RGB + optical flow 做 joint latent denoising；geometry / semantic 通过 gated residual branches 注入 VideoDiT；VideoDiT 与 ActionDiT shared attention。\n- **推理期输出**：beyond-RGB branches 删除；支持 no-rollout 当前帧到 action，也支持 joint RGB future + action 联合生成。"
    },
    "publication": "arXiv 2026",
    "source_reports": [
      "report-e81e6bd3a1"
    ],
    "summary": "DreamWAM 对 RGB foresight 的批判更彻底：RGB future 混合了 action-relevant dynamics 与 texture、background、lighting、viewpoint 等 nuisance factors。因此 WAM 应预测的不是“未来长什么样”，而是未来有哪些对 action 有意义的状态变化。它将 future 拆为 appearance + motion + geometry + semantics 。",
    "tags": [
      "3D/4D",
      "World Action Model",
      "机器人学习",
      "自监督与预测表征"
    ],
    "title": "DreamWAM: Beyond RGB Future Prediction for World Action Models",
    "updated_at": "2026-08-20",
    "year": 2026
  },
  {
    "id": "arxiv-2609-26293",
    "title": "Dual-Frontier: When Can an Agent Trust Its World Model?",
    "authors": [
      "Huatai Zhu",
      "Qiang Chen",
      "Ziqian Kou",
      "Wenhao Li",
      "Fei Wang",
      "Yichao Cao",
      "Xiu Su",
      "Yi Chen"
    ],
    "year": 2026,
    "publication": "2026，arXiv",
    "arxiv_id": "2609.26293",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2609.26293",
      "alphaxiv": "https://alphaxiv.org/abs/2609.26293"
    },
    "tags": [
      "因果与反事实",
      "数据与评测"
    ],
    "figure": {
      "url": "content/images/2609.26293-main.webp",
      "alt": "Figure 1：主动证据、规划资格与想象更新的受控验证",
      "label": "Figure 1 · 主动证据、规划资格与想象更新的受控验证",
      "paper_title": "Dual-Frontier: When Can an Agent Trust Its World Model?",
      "source_url": "https://arxiv.org/pdf/2609.26293#page=7"
    },
    "summary": "论文问的是：当world-model-guided action失败时，究竟是decision rule错了还是world model错了？作者把return loss分为counterfactual components，并证明仅观察passive trajectories时，即使finite horizon也无法总是识别这两个成分。",
    "insight": "论文问的是：当world-model-guided action失败时，究竟是decision rule错了还是world model错了？作者把return loss分为counterfactual components，并证明仅观察passive trajectories时，即使finite horizon也无法总是识别这两个成分。",
    "pipeline": {
      "input": "agent policy、world-model prediction、observed interaction evidence。",
      "process": "计算predicted advantage与decision-relevant WM error bound；只有前者超过certified error时才promote model-guided decision，否则优先收集world-model verification evidence。",
      "output": "带verification gate的decision policy和confidence certificate。",
      "details": "**过程**：计算predicted advantage与decision-relevant WM error bound；只有前者超过certified error时才promote model-guided decision，否则优先收集world-model verification evidence。\n\n**输入**：agent policy、world-model prediction、observed interaction evidence。\n\n**输出**：带verification gate的decision policy和confidence certificate。\n\n先定义固定模型到策略算子和参照策略下的损失分解，再对具体“使用模型做决策”的请求建立误差与估计不确定性界；预测优势超过证据支持的总误差后才推进 Agent，否则优先验证世界模型。这是针对使用场景的可靠性证书，不是模型的一次性通用可信标签。\n\n[原文方法](https://arxiv.org/html/2609.26293)\n\n### 方法细节与实现\n\n**信任必须绑定具体用途。**固定一个世界模型和策略操作后，问题是“这一次规划或想象更新是否值得采用”，而不是给模型一个永久可信分数。模型在常见观察上的预测准确，不保证对未尝试动作的反事实后果准确；同样的被动数据可能与多种干预响应相容。\n\n**双边界与证书。**方法分别维护可支持规划的范围和可支持想象学习/策略改进的范围。候选提议需要把估计优势与世界模型误差、估计不确定性共同比较，只有通过相应保证的提议才被提升为可使用行为。校准证据可复用，避免每次请求都从零审计；主动查询把证据预算投向影响当前决策的未知行为。\n\n**理论条件与实现范围。**保证依赖有限世界、可获得的交互证据及误差校准假设，不是从任意离线视频中自动识别反事实因果效应。受控实验用16状态、4动作以及4/8/12的规划时距，之后在工具调用任务检验路由规则。工具使用上的效果尚不能直接推广到连续接触控制。\n\n[对应方法原文](https://arxiv.org/html/2609.26293#S3)"
    },
    "experiments": "在Llama-3.1-8B和Qwen3-8B tool-use benchmark上，相比最强competing rule，Success平均提升约11.57/11.07个百分点，Accuracy提升5.93/5.83个百分点。\n\n\n主实验是 BFCL v4、API-Bank、NexusRaven 等工具调用任务。表 2 的 Llama 消融，Advantage-only 的 Success/Acc 为 84.57/91.37，完整为 91.62/95.71；去掉 world-model error 为 87.31/93.19，支持将预测优势与不确定性分开。理论假设包括固定接口、适当误差上界和校准/采样条件，不能直接由任意视觉 loss 导出证书。\n\n[原文实验与表格](https://arxiv.org/html/2609.26293)\n\n**看效果也看拒绝代价。**BFCL v4/API-Bank/NexusRaven 上，Llama-3.1-8B 的平均成功指标由Agent-only63.46到Dual-Frontier91.62，而Always-WM为50.81，表明无条件用模型可能更差。拒绝提议和额外查询都消耗预算，因此除成功率外，还应看接受率、证据成本和校准条件；这些是“可信使用”的组成部分。\n\n[实验与设置原文](https://arxiv.org/html/2609.26293)",
    "evidence_notes": "已核验原文方法与实验；关键比较与限制见各节",
    "code_data_status": "本次未核验到公开代码。",
    "limitations": "主要实验不是robotics；模型误差certificate需要自身假设和校准条件成立。",
    "comments": "",
    "source_reports": [],
    "deleted": false,
    "updated_at": "2026-09-24",
    "challenges": "一次失败无法自动区分决策规则与世界模型的责任。低像素预测误差也不一定对应低决策损失；如果只观察被动轨迹，有些反事实归因根本不可识别。",
    "motivation": "论文问的是：当world-model-guided action失败时，究竟是decision rule错了还是world model错了？作者把return loss分为counterfactual components，并证明仅观察passive trajectories时，即使finite horizon也无法总是识别这两个成分。",
    "technical_approach": "**过程**：计算predicted advantage与decision-relevant WM error bound；只有前者超过certified error时才promote model-guided decision，否则优先收集world-model verification evidence。\n\n**输入**：agent policy、world-model prediction、observed interaction evidence。\n\n**输出**：带verification gate的decision policy和confidence certificate。\n\n先定义固定模型到策略算子和参照策略下的损失分解，再对具体“使用模型做决策”的请求建立误差与估计不确定性界；预测优势超过证据支持的总误差后才推进 Agent，否则优先验证世界模型。这是针对使用场景的可靠性证书，不是模型的一次性通用可信标签。\n\n[原文方法](https://arxiv.org/html/2609.26293)\n\n### 方法细节与实现\n\n**信任必须绑定具体用途。**固定一个世界模型和策略操作后，问题是“这一次规划或想象更新是否值得采用”，而不是给模型一个永久可信分数。模型在常见观察上的预测准确，不保证对未尝试动作的反事实后果准确；同样的被动数据可能与多种干预响应相容。\n\n**双边界与证书。**方法分别维护可支持规划的范围和可支持想象学习/策略改进的范围。候选提议需要把估计优势与世界模型误差、估计不确定性共同比较，只有通过相应保证的提议才被提升为可使用行为。校准证据可复用，避免每次请求都从零审计；主动查询把证据预算投向影响当前决策的未知行为。\n\n**理论条件与实现范围。**保证依赖有限世界、可获得的交互证据及误差校准假设，不是从任意离线视频中自动识别反事实因果效应。受控实验用16状态、4动作以及4/8/12的规划时距，之后在工具调用任务检验路由规则。工具使用上的效果尚不能直接推广到连续接触控制。\n\n[对应方法原文](https://arxiv.org/html/2609.26293#S3)",
    "discussion": "**阅读者分析**：虽然不是embodied WAM，但它对“因果/反事实world model”研究方法非常重要：不是先把模型称为causal，而是先明确哪些failure component可识别、哪些不可识别。",
    "arxiv": {
      "published": "2026-09-22",
      "revised_at": "",
      "primary_category": "cs.AI"
    },
    "source_papers": [
      "content/papers/2609.26293.md"
    ]
  },
  {
    "id": "arxiv-2609-24868",
    "title": "DualWAM: Dual-System World Action Models for Asynchronous Global Planning and Local Refinement",
    "authors": [
      "Yixin Zheng",
      "Jiangran Lyu",
      "Yuntian Deng",
      "Kai Liu",
      "Yizhou Zhou",
      "Yizhou Wang",
      "Xiaoguang Zhao",
      "He Wang",
      "Zhizheng Zhang"
    ],
    "year": 2026,
    "publication": "2026，arXiv",
    "arxiv_id": "2609.24868",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2609.24868",
      "project": "https://steveouo.github.io/DualWAM-Web/",
      "alphaxiv": "https://alphaxiv.org/abs/2609.24868"
    },
    "tags": [
      "Agent与可执行世界",
      "World Action Model",
      "流式与自回归",
      "第一视角与人类视频"
    ],
    "figure": {
      "url": "content/images/2609.24868-main.webp",
      "alt": "Figure 1：高噪声全局规划与低噪声局部修正承接同一去噪过程",
      "label": "Figure 1 · 高噪声全局规划与低噪声局部修正承接同一去噪过程",
      "paper_title": "DualWAM: Dual-System World Action Models for Asynchronous Global Planning and Local Refinement",
      "source_url": "https://arxiv.org/html/2609.24868v1/figures/DualWAM-pipeline.png"
    },
    "summary": "将WAM分成低频global System 2和高频wrist-centric System 1，但两者不是完全分离的两个policy，而是接力处理同一条world-action denoising trajectory。",
    "insight": "将WAM分成低频global System 2和高频wrist-centric System 1，但两者不是完全分离的两个policy，而是接力处理同一条world-action denoising trajectory。",
    "pipeline": {
      "input": "language、robot state、global view和wrist view。",
      "process": "System 2高noise范围对完整global world/action sequence双向denoise → 在handoff noise tau 截取时间对齐局部window → System 1结合最新wrist observation完成低noise refinement → 异步执行。",
      "output": "持续高频robot action与较长horizon world prediction。",
      "details": "**过程**：System 2高noise范围对完整global world/action sequence双向denoise → 在handoff noise tau 截取时间对齐局部window → System 1结合最新wrist observation完成低noise refinement → 异步执行。\n\n**输入**：language、robot state、global view和wrist view。\n\n**输出**：持续高频robot action与较长horizon world prediction。\n\n两个系统分担同一 denoising trajectory：System 2 处理高噪声全局状态，System 1 读取时间对齐的中间窗口和新腕部观察完成低噪声更新；旧的全局计划持续可用，因此局部动作无需等待下一轮全局推理完成。\n\n[原文方法](https://arxiv.org/html/2609.24868)\n\n### 方法细节与实现\n\n**按去噪阶段分工。**System 2 在较高噪声阶段低频生成全局视觉—动作计划，System 1 在较低噪声阶段结合最新腕部观察高频修正局部动作。二者承接同一条去噪轨迹，因此局部模块不是完全独立重新规划，而是在已有粗计划附近快速纠偏。\n\n**异步执行。**机器人执行当前动作段时，后台继续推理后续段；局部时间窗与新到达观察对齐，减少长计划因接触或物体位移而过时的问题。系统既涉及网络角色分配，也涉及缓存、并行调度及实现优化，部署延迟不能只从参数量推算。\n\n**辅助数据的角色匹配。**全局模块需要较长时程任务结构，局部模块需要近距离视觉和动作修正证据。分别给两者匹配训练数据比无区分扩展训练集更符合分工，但真实收益仍需与相同数据预算的同步单模型对照。双系统名称本身并不保证高层推理更强。\n\n[对应方法原文](https://arxiv.org/html/2609.24868#S3)"
    },
    "experiments": "Franka与Galbot zero-shot任务中，平均比strongest evaluated baseline高4.5个百分点；critical path speedup 16.6×；加入role-matched egocentric + UMI auxiliary data后成功率提高14个百分点。\n\n\n63 ms critical path 相对 1043 ms 的 System 2/比较基线为 16.6×；表 2 从原单 GPU 四步实现 2854 ms 到最终 63 ms 的累计优化为 45.3×，两者分母不同。局部模型替换消融中，完整系统 SR 54%，Action-only DiT 7%、Fast-WAM 14%，延迟分别约 63/59/62 ms，支持该设置中局部 future prediction 的额外作用。\n\n[原文实验与表格](https://arxiv.org/html/2609.24868)\n\n**速度分母须写清。**最终局部推理约 63 ms，相对一个 1,043 ms 阶段是约 16.6 倍，相对完整 2,854 ms 基线才约 45.3 倍；不同分母不能混用。局部动作模型单独仅 7、Fast 版本 14，而双系统为 54 的相关消融，支持全局计划与局部世界动作联合建模的协作价值。\n\n[实验与设置原文](https://arxiv.org/html/2609.24868)",
    "evidence_notes": "已核验原文方法与实验；关键比较与限制见各节",
    "code_data_status": "项目公开；本次未核验到代码、模型或数据下载。",
    "limitations": "系统依赖多GPU/异步execution和较复杂的数据组合；效率数字需要区分model critical path、完整系统latency和hardware配置。",
    "comments": "",
    "source_reports": [],
    "deleted": false,
    "updated_at": "2026-09-24",
    "challenges": "全局视频规划需要长上下文与较大计算量，局部接触修正需要最新观察和低延迟。同步等待全局重规划会阻塞机器人，完全独立的小策略又可能偏离全局计划。",
    "motivation": "将WAM分成低频global System 2和高频wrist-centric System 1，但两者不是完全分离的两个policy，而是接力处理同一条world-action denoising trajectory。",
    "technical_approach": "**过程**：System 2高noise范围对完整global world/action sequence双向denoise → 在handoff noise tau 截取时间对齐局部window → System 1结合最新wrist observation完成低noise refinement → 异步执行。\n\n**输入**：language、robot state、global view和wrist view。\n\n**输出**：持续高频robot action与较长horizon world prediction。\n\n两个系统分担同一 denoising trajectory：System 2 处理高噪声全局状态，System 1 读取时间对齐的中间窗口和新腕部观察完成低噪声更新；旧的全局计划持续可用，因此局部动作无需等待下一轮全局推理完成。\n\n[原文方法](https://arxiv.org/html/2609.24868)\n\n### 方法细节与实现\n\n**按去噪阶段分工。**System 2 在较高噪声阶段低频生成全局视觉—动作计划，System 1 在较低噪声阶段结合最新腕部观察高频修正局部动作。二者承接同一条去噪轨迹，因此局部模块不是完全独立重新规划，而是在已有粗计划附近快速纠偏。\n\n**异步执行。**机器人执行当前动作段时，后台继续推理后续段；局部时间窗与新到达观察对齐，减少长计划因接触或物体位移而过时的问题。系统既涉及网络角色分配，也涉及缓存、并行调度及实现优化，部署延迟不能只从参数量推算。\n\n**辅助数据的角色匹配。**全局模块需要较长时程任务结构，局部模块需要近距离视觉和动作修正证据。分别给两者匹配训练数据比无区分扩展训练集更符合分工，但真实收益仍需与相同数据预算的同步单模型对照。双系统名称本身并不保证高层推理更强。\n\n[对应方法原文](https://arxiv.org/html/2609.24868#S3)",
    "discussion": "**阅读者分析**：与X-WAM asynchronous denoising、StreamingHOI和未来3D/4D WAM高度相关；尤其适合扩展为global 4D memory + local contact refinement。",
    "arxiv": {
      "published": "2026-09-21",
      "revised_at": "",
      "primary_category": "cs.RO"
    },
    "source_papers": [
      "content/papers/2609.24868.md"
    ]
  },
  {
    "id": "arxiv-2609-10506",
    "title": "DUET-DINO: Simultaneous Cross-View World Modeling for Latent Planning in Robot Manipulation",
    "authors": [
      "Nisarga Nilavadi",
      "Ralf Römer",
      "Moritz Reuss",
      "Michael Krawez",
      "Tobias Jülg",
      "Angela P. Schoellig",
      "Rudolf Lioutikov",
      "Wolfram Burgard"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本，v1",
    "arxiv_id": "2609.10506",
    "doi": "10.48550/arXiv.2609.10506",
    "links": {
      "paper": "https://arxiv.org/abs/2609.10506",
      "project": "https://utn-air.github.io/DUET-DINO",
      "code": "https://github.com/nisarganc/DUET-DINO",
      "alphaxiv": "https://alphaxiv.org/abs/2609.10506"
    },
    "tags": [
      "世界模型",
      "多模态感知与提示",
      "自监督与预测表征",
      "规划与控制"
    ],
    "figure": {
      "url": "content/images/2609.10506-representative.webp",
      "alt": "Fig. 2",
      "label": "Fig. 2",
      "paper_title": "DUET-DINO: Simultaneous Cross-View World Modeling for Latent Planning in Robot Manipulation",
      "source_url": "https://arxiv.org/html/2609.10506v1#S3.F2"
    },
    "summary": "DUET-DINO 同时建模侧视角全局场景和腕部局部几何，以 cross-attention 交换信息。关键发现是 frozen representation 影响细粒度动态：其设置中 DINOv3 比 V-JEPA 2 更能保留腕视角动作变化。",
    "insight": "DUET-DINO 同时建模侧视角全局场景和腕部局部几何，以 cross-attention 交换信息。关键发现是 frozen representation 影响细粒度动态：其设置中 DINOv3 比 V-JEPA 2 更能保留腕视角动作变化。",
    "pipeline": {
      "input": "同步侧视/腕视 RGB、末端状态和 7D 动作。",
      "process": "冻结 DINOv3；双向 cross-attention；分别预测未来 latent；用 teacher-forcing 与短程 autoregressive loss 训练；CEM 最小化双视角目标 latent 距离。",
      "output": "双视角 future latents 与 7-DoF 动作序列。",
      "details": "- **输入**：同步侧视/腕视 RGB、末端状态和 7D 动作。\n- **过程**：冻结 DINOv3；双向 cross-attention；分别预测未来 latent；用 teacher-forcing 与短程 autoregressive loss 训练；CEM 最小化双视角目标 latent 距离。\n- **输出**：双视角 future latents 与 7-DoF 动作序列。"
    },
    "experiments": "训练含 62,877 条 DROID、5,856 条 RoboArena 轨迹。仿真 reach、angled-reach、lift 成功率为 92%、72.5%、60%；去掉 cross-attention 后前两项降至 81%、42.5%。真实硬件 angled-reach 仅 26.7%，虽优于所测 baseline，但显示 sim-to-real 与预算瓶颈。双视角约慢两倍，规划步约 15–17 秒。 [正文实验与表格](https://arxiv.org/html/2609.10506v1)。",
    "evidence_notes": "2026-09-14 已核对 arXiv 元数据、正文主要实验与对照；未运行复现实验。",
    "code_data_status": "当前仓库仅有 README，代码实现尚未在该入口公开。 以上状态核验于 2026-09-14；入口和目录存在不等于已经运行复现实验。",
    "limitations": "CEM 昂贵，硬件减少搜索预算；侧视角对相机位姿敏感。视觉 latent 不显式保证对象 SE(3)、接触和动力学一致。",
    "comments": "",
    "source_reports": [
      "report-37b94c4145"
    ],
    "deleted": false,
    "updated_at": "2026-09-14",
    "discussion": "是 DWM/V-JEPA 类 latent world model 向真实 7-DoF manipulation 的推进，也为结合显式 3D/4D 几何提供基线。",
    "arxiv": {
      "published": "2026-09-09T17:41:38Z",
      "revised_at": "2026-09-09T17:41:38Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "paper-1d4c797b72",
    "title": "Dyna-2: A 1-Million-Hour Scaling Law for World-Action Models",
    "authors": [
      "Dyna Robotics"
    ],
    "year": 2026,
    "publication": "2026 年 8 月，Dyna Robotics 官方网页版 technical report；无 arXiv ID、DOI 或 PDF，未核验同行评审",
    "arxiv_id": "",
    "doi": "",
    "links": {
      "paper": "https://www.dyna.co/dyna-2"
    },
    "tags": [
      "VLA",
      "World Action Model",
      "具身上下文学习",
      "扩散与流匹配",
      "机器人学习",
      "第一视角与人类视频",
      "视频生成",
      "跨本体迁移",
      "适应与泛化",
      "长时记忆",
      "预训练与扩展律"
    ],
    "figure": {
      "url": "https://www.dyna.co/assets/research/dyna2-fig16-one-step-geometry.jpg",
      "alt": "Dyna-2 one-step video distillation",
      "label": "Dyna-2 一步视频蒸馏中固定教师目标与随学生能力推进的移动目标几何示意。来源：官方原图",
      "paper_title": "Dyna-2: A 1-Million-Hour Scaling Law for World-Action Models",
      "source_url": "https://www.dyna.co/assets/research/dyna2-fig16-one-step-geometry.jpg"
    },
    "summary": "Dyna-2 不是严格的 one-shot ICL 工作。它的主要问题是：把人类第一视角操作视频从 1K 扩到 1M 小时，并让同一模型联合预测未来视频和动作，能否形成可迁移到未见机器人数据与少量机器人 post-training 的基础。其 ICL 意义在于提供“为什么视频上下文策略可能随规模变强”的预训练证据：未来预测迫使表征建模跨 embodiment 共享的场景变化，额外无动作视频又形成独立扩展轴。但官方没有把单段新示范插入测试 context、再用正确/错误示范对照，因此不能把 Dyna-2 本身标为已验证的 in-context learner。",
    "insight": "作者从目标反推数据来源：若通用机器人最终要执行人类正在完成的广泛经济活动，那么记录人类真实操作过程的第一视角视频应当包含对象如何响应接触、手如何作用于物体以及场景如何演化。Dyna-2 要验证的不是“人类和机器人已经同构”，而是更窄也更可操作的命题：当预训练只增加人类视频经验时，机器人域预测和后训练策略是否保持可测的规模排序。如果成立，工程路线就可以分成“继续扩大人类感知数据”和“缩小 embodiment gap”，而不必把所有预训练数据都做成昂贵的机器人轨迹。\n\n作者进一步假设，未来视频预测提供了比伪动作监督更通用的物理表征。其受控消融试图检验：只有 action loss 时，规模增长是否足够；在同一数据上同时预测视频和动作是否足够；再加入不带动作标签的视频，能否形成新的扩展轴。这里的证据是训练目标与跨域预测之间的受控关联，不等同于结构因果模型、`do(·)` 干预、因果识别或对真实物理机制的可解释恢复。",
    "pipeline": {
      "input": "条件上下文包括过去视频帧、机器人或人体本体状态、语言指令；视频分支接收加噪的未来视频 latent，动作分支接收加噪的未来动作块。人类预训练数据主要是头戴式第一视角双手操作视频，动作伪标签由通过质量过滤的 3D 手部轨迹生成：腕部位姿近似末端轨迹，拇指—食指开合距离形成连续抓握信号。",
      "process": "Dyna-2 以视频扩散 backbone 为主体，采用 mixture-of-transformers：视频与动作分别 token 化并进入各自的 DiT 层，通过注意力交互；本体状态直接送入动作 transformer。视频 token 使用时序 causal mask，动作 token 内部使用双向 self-attention，并只读取已观察上下文的视频 token；文本与视频 token cross-attention，但不直接进入动作 token。作者依据早层保留主要时序推理能力的先验，把动作 transformer 做得更浅并只在视频网络早层连接，以降低控制延迟。训练采用 flow matching，在共享 trunk 上拟合视频和动作两个边缘速度场： video loss + λ × action loss 。一步视频学生则不追逐固定教师，而是在高斯平滑后，沿从可达初始分布到真实数据分布的连续目标路径训练；路径进度由学生样本的在线读数控制，只有学生追上当前目标才继续推进。",
      "output": "控制模式输出未来动作块；生成模式输出指令条件的未来视频。重要的是，官方 scaling-law 版本的动作速度场不把加噪未来视频作为参数：推理时策略既不生成、也不读取预测未来视频，仍是 reactive policy。视频预测在训练期塑造共享表征，而不是在控制期执行显式 imagined rollout 或规划。",
      "details": "- **输入：** 条件上下文包括过去视频帧、机器人或人体本体状态、语言指令；视频分支接收加噪的未来视频 latent，动作分支接收加噪的未来动作块。人类预训练数据主要是头戴式第一视角双手操作视频，动作伪标签由通过质量过滤的 3D 手部轨迹生成：腕部位姿近似末端轨迹，拇指—食指开合距离形成连续抓握信号。\n- **过程：** Dyna-2 以视频扩散 backbone 为主体，采用 mixture-of-transformers：视频与动作分别 token 化并进入各自的 DiT 层，通过注意力交互；本体状态直接送入动作 transformer。视频 token 使用时序 causal mask，动作 token 内部使用双向 self-attention，并只读取已观察上下文的视频 token；文本与视频 token cross-attention，但不直接进入动作 token。作者依据早层保留主要时序推理能力的先验，把动作 transformer 做得更浅并只在视频网络早层连接，以降低控制延迟。训练采用 flow matching，在共享 trunk 上拟合视频和动作两个边缘速度场：`video loss + λ × action loss`。一步视频学生则不追逐固定教师，而是在高斯平滑后，沿从可达初始分布到真实数据分布的连续目标路径训练；路径进度由学生样本的在线读数控制，只有学生追上当前目标才继续推进。\n- **输出：** 控制模式输出未来动作块；生成模式输出指令条件的未来视频。重要的是，官方 scaling-law 版本的动作速度场不把加噪未来视频作为参数：推理时策略既不生成、也不读取预测未来视频，仍是 reactive policy。视频预测在训练期塑造共享表征，而不是在控制期执行显式 imagined rollout 或规划。\n\n对 scaling-law 版本，设条件为 $c$、未来视频 latent 为 $z$、未来动作块为 $a$，前向扰动为\n\n$$\nz_t = tz + (1-t)\\varepsilon_z, \\qquad\na_t = ta + (1-t)\\varepsilon_a,\n\\qquad \\varepsilon_z,\\varepsilon_a \\sim \\mathcal{N}(0,I).\n$$\n\n共享模型分别拟合视频与动作速度：\n\n$$\n\\mathcal{L}_{\\mathrm{co}}(\\theta)=\n\\mathbb{E}\\left\\lVert u_\\theta^{\\mathrm{vid}}(z_t;t,c)-(z-\\varepsilon_z)\\right\\rVert^2\n+\\lambda\\,\\mathbb{E}\\left\\lVert u_\\theta^{\\mathrm{act}}(a_t;t,c)-(a-\\varepsilon_a)\\right\\rVert^2.\n$$"
    },
    "experiments": "官方报告实际包含十组互相衔接的实验或探查。下面每组都区分“探查问题—设置—结果—能支持什么—不能支持什么”。\n\n**实验 1：百万小时人类数据本身是否呈现稳定扩展律**\n\n- **设置与控制：** 总语料超过 100 万小时，页面动态统计给出约 4380 万 clips、97,160 条不同任务指令和 9,917 类不同对象。数据来自合作方和内部采集，以头戴第一视角日常双手操作为主，经过清洗、手姿提取、验证和过滤。作者按来源保持相同比例，构造严格嵌套的 1k、10k、100k、1M 小时子集；大子集只增加样本，不替换小子集。固定一套与训练集不重叠的 100 小时人类验证集，并保持训练和评测配置相同。每条曲线在训练后期窗口取 10 个 checkpoint，报告均值和标准差，而不是只挑最好 checkpoint。\n- **指标：** 对预测动作块和真值动作，在动作维及 chunk horizon 上平均 MSE、L1；另报告归一化动作单位下 `accuracy@0.1` 和 `accuracy@0.5`。作者把 0.5 解释为粗粒度运动意图，把 0.1 解释为更严格的运动精度。\n\n| 人类预训练小时 | MSE ↓ | L1 ↓ | accuracy@0.1 ↑ | accuracy@0.5 ↑ |\n|---:|---:|---:|---:|---:|\n| 1k | 0.062 | 0.140 | 0.017 | 0.40 |\n| 10k | 0.057 | 0.131 | 0.021 | 0.44 |\n| 100k | 0.056 | 0.129 | 0.024 | 0.45 |\n| 1M | 0.054 | 0.127 | 0.026 | 0.47 |\n\n- **拟合结果：** 官方图给出 `MSE = 0.0691·D^-0.0184`（$R^2=0.919$）、`L1 = 0.151·D^-0.0132`（$R^2=0.879$）、`acc@0.1 = 0.0116·D^0.0606`（$R^2=0.926$）和 `acc@0.5 = 0.357·D^0.0203`（$R^2=0.865$）。从 1k 到 1M，MSE 约降 12%，accuracy@0.1 约升 51%。\n- **证据支持：** 在固定模型与内部协议中，四种连续/阈值指标都随嵌套数据规模单调改善，说明结果不是只由某一个阈值指标制造的“突现”。\n- **证据边界：** 幂律只由四个数据点拟合；10 个 checkpoint 不是 10 个独立训练种子。报告没有公开 exponent 的置信区间、独立重复训练、模型参数量、总训练算力或数据源构成，也明确把 compute scaling 和 model-size scaling 留到未来。因此它支持“这套配置的数据扩展趋势”，不能证明通用且算力最优的机器人 scaling law。\n\n**实验 2：只用人类预训练，能否在未见机器人数据上保持扩展排序**\n\n- **设置：** 同一组四级 checkpoint 不做适配，直接在 39 项机器人离线任务上预测动作。评测覆盖两套 stationary bi-manual YAM 平台：12 项内部任务和 27 项外部 xdof ABC 任务，涉及布料、打结、包装、清洁、餐饮和装配；预训练没有使用这些来源的任何机器人轨迹。\n- **汇总结果：** 对全部 39 项任务，zero-shot action MSE 依次为 0.180、0.174、0.124、0.117，`accuracy@0.5` 为 0.067、0.074、0.136、0.159。官方拟合为 `MSE = 0.306·D^-0.0713`（$R^2=0.884$）和 `acc@0.5 = 0.0241·D^0.139`（$R^2=0.918$）。内部 12 项、外部 27 项和全部 39 项曲线在图中均保持随数据增加而改善的排序，最大跃迁出现在 10k 到 100k。\n- **证据支持：** 这是报告最重要的结果：在没有机器人预训练或额外对齐的条件下，扩大人类视频能改善所测机器人数据上的开放环动作预测，而且改善斜率高于同域人类指标。\n- **证据边界：** “zero-shot”指预训练未见该机器人轨迹，并非任务语义、物体或场景从未以人类视频出现。离线动作误差也不等于闭环成功；语料来源、去污染方式和 39 项任务的完整样本量未公开。“10k–100k 突变”只有相邻两个量级点，不能单凭四点曲线断言普遍 emergent threshold。\n\n**实验 3：离线跨 embodiment 排序能否转化为后训练后的真机表现**\n\n- **设置：** 四级 checkpoint 分别在完全相同的 14 项内部机器人任务数据上 post-train，每项最多 10 小时机器人数据，不做人类—机器人对齐或联合训练。11 项使用双 6-DoF YAM 臂和自研平行夹爪，2 项把同一机械臂换成一对 WUJI-2 20-DoF 五指手，语言任务使用早期 semi-humanoid 原型。每项评测 10 次，语言任务 12 次；盲测评审者不参与模型开发。不同任务先按各自可达到上限归一化，再对 14 项平均。\n- **汇总结果：** 平均归一化得分从 1k/10k/100k/1M 的 20%/28%/45%/53% 单调上升；1M 模型在 14 项中的 9 项最好。它支持总体排序转化到闭环真机，但单项任务并不全部单调。\n\n| 真机任务与原生指标 | 1k | 10k | 100k | 1M |\n|---|---:|---:|---:|---:|\n| Highlighter in Drawer，成功率 | 10% | 80% | 80% | 90% |\n| Bottle Cap Untwisting，成功率 | 10% | 10% | 40% | 50% |\n| Trash Tray Pickup，平均拾取件数/6 | 2.2 | 3.9 | 4.5 | 4.8 |\n| Pants Hanger Preparation，成功率 | 10% | 0% | 20% | 50% |\n| Rope Tie，成功率 | 0% | 40% | 90% | 40% |\n| Lockbox Key Turning，成功率 | 0% | 0% | 0% | 90% |\n| Food Scooping，成功率 | 10% | 30% | 80% | 50% |\n| First Aid Kitting，正确分区数/10 | 2.0 | 0.2 | 2.9 | 4.8 |\n| Unsort，移出箱子件数/10 | 6.4 | 5.5 | 3.6 | 5.8 |\n| Fridge Tube Insertion，成功率 | 10% | 10% | 10% | 20% |\n| Tote Construction，成功率 | 20% | 10% | 40% | 30% |\n| Mug Unboxing，成功率 | 20% | 0% | 10% | 20% |\n| Pick & Place，平均放置件数/10 | 1.8 | 2.1 | 4.2 | 3.9 |\n| Targeted Drink Retrieval，成功率 | 58% | 75% | 83% | 83% |\n\n- **重点案例：** Lockbox Key Turning 直到 1M 才从 0% 升到 90%；Bottle Cap Untwisting 只用约 10 分钟机器人示范，随预训练规模从 10%/10% 升到 40%/50%；语言饮料检索从 58% 升到 83%。\n- **证据边界：** Rope Tie、Food Scooping、Tote Construction、Pick & Place 等任务在 1M 反而低于 100k，Unsort 也明显非单调；因此报告证明的是 14 项平均趋势和部分任务阈值现象，不是“每个任务数据越多越好”。单任务通常只有 10 次 trial，差 10 个百分点常常只代表一次成败，页面未报告置信区间或多随机种子。\n\n**实验 4：跨 embodiment 扩展究竟需要什么训练目标**\n\n- **设置：** 固定 Dyna-2 架构，在 5k、50k、100k 小时带手姿伪动作标签的人类数据上比较三种 recipe：`action-only` 只优化动作；`joint` 在同一数据上同时预测动作块和未来视频；`video co-training` 在 joint 基础上再加入等量无动作标签视频，只用于视频预测。三组在相同训练 step 上，以同一 39 项机器人离线套件 zero-shot 评估。\n- **结果：** joint 在每个动作数据规模、39/39 项任务上都优于 action-only；action-only 随数据增加出现严重且不稳定的过拟合。joint 减轻过拟合，但本身没有随动作数据规模持续改善。只有加入额外视频数据的 video co-training 随动作数据规模变大而改善；在 5k 小规模时额外视频甚至没有优势，规模增大后差距才扩大。\n- **证据支持：** 在所测架构与训练步数下，未来视频目标对跨 embodiment 离线预测具有可测增益，而且“同数据联合目标”和“额外 video-only 数据”扮演不同角色。\n- **证据边界：** 该消融能支持局部的 objective/data 依赖，不能据此说模型识别了真实因果动力学。video co-training 同时改变了目标与可见样本量；页面没有给出等总 token、等 FLOPs 或等墙钟成本的反事实对照。\n\n**实验 5：无动作标签视频能否成为独立扩展轴**\n\n- **设置 A：** 固定 50k 小时带动作标签人类数据，只把 video-only 数据从 0 扩到 1k、10k、50k 小时。zero-shot robot action MSE 从约 0.34 降到 0.12。\n- **设置 B：** 把量级整体放大，固定 250k 小时动作数据，加入 0、250k、750k 小时 video-only 数据；对应 MSE 从约 0.10 降到 0.084，保持单调改善。\n- **域别对照：** 在 50k 动作数据实验中，最终 robot MSE 降至各自 0-video 基线的约 34%，但 held-out human MSE 约为基线的 104%，即没有改善且略差。作者提出一种尚未验证的解释：视频训练可能稀释同 embodiment 动作梯度，却同时形成更通用的跨 embodiment 表征。\n- **证据支持：** 这组实验比“总数据更多所以更好”更具体：固定动作标签量时，增加 video-only 数据仍改善机器人域预测，而且同域人类指标没有同步改善，说明收益主要表现为跨域泛化。\n- **证据边界：** 结果仍来自开放环离线指标，页面没有公布数据去重、视频质量分层、训练 token/FLOPs 对齐或不同 video-only 分布的消融，尚不能确定收益来自物理动态、场景多样性、视觉不变性还是其他共变因素。\n\n**实验 6：WAM 与内部 VLA 的受控真机比较**\n\n- **设置：** 早期 Dyna-2 WAM 与生产 Dyna-1 VLA 比较。Dyna-1 是从 Qwen3-VL-4B 初始化的 mixture-of-transformers 动作模型；两者使用相同 pre-training/post-training 数据、训练超参数和 7 项真机任务，各从 3 个不同预训练 checkpoint 初始化，共 21 个 task×checkpoint cells。实验管线原本针对 VLA 调优，早期 Dyna-2 既没有 1M 小时预训练，还用 action-only loss 监督整个模型，作者因此把结果视为 WAM 的保守下界。\n- **结果：** 汇总成功率为 VLA 的 1.55 倍，平均质量 grade 为 1.12 倍；图中对 21 个 paired cells 给出 bootstrap 95% CI。逐 cell 对决中 WAM 胜 65%、VLA 胜 29%、平 6%，VLA 胜项主要集中在最早 checkpoint。\n- **证据支持：** 在同一机构、相同数据和 post-training 配置中，早期 WAM 的总体真机表现优于其强内部 VLA baseline，且优势随预训练推进而扩大。\n- **证据边界：** 页面没有披露两者精确参数量、预训练算力、推理延迟或每项原始 trial 数；Dyna-1 是内部 baseline，不代表公开 VLA 的上限。这一实验不能证明“所有 WAM 架构普遍优于 VLA”。\n\n**实验 7：精度、扰动鲁棒性与目标持续性的定性案例**\n\n- **质量案例：** 在相同 post-training 数据配置的芹菜切割任务中，作者展示 Dyna-2 切片比 Dyna-1 更薄、更均匀，更接近专家示范。\n- **扰动案例：** 改变灯光、显著降低照明后，Dyna-2 仍继续完成切割；中途遮住顶视相机后仍可执行。官方页面特意把后者称为 sensor-loss robustness，而不是对不可见状态的预测。\n- **持续性案例：** 人为不断把已经切好的食材放回砧板，策略持续清空，没有在固定循环次数后停止，而是在砧板为空时结束。\n- **证据边界：** 这些是视频案例，不是有样本量、对照组和统计检验的鲁棒性 benchmark；它们揭示值得系统测量的行为，但不能给出扰动成功率、恢复边界或安全保证。\n\n**实验 8：客户现场的零站点数据部署**\n\n- **设置：** Dyna-1 与 Dyna-2 使用相同任务 post-training 数据和相同步数，两者都未见目标客户站点数据。现场由不参与模型开发的操作员按客户对质量、吞吐和可靠性的验收标准打分。\n- **结果：** 两者在内部 in-distribution 评测都接近 100% pass；到未见客户现场后，Dyna-1 为 46%，Dyna-2 为 87%，相差 41 个百分点。\n- **证据支持：** 相同任务训练预算下，Dyna-2 对站点分布变化的适应性明显优于 Dyna-1，且差异只有在更严格的生产标准和域外现场才暴露。\n- **证据边界：** 这里的 zero-shot 是“未使用目标站点数据”，不是“从未训练该任务”。页面没有公开客户数、任务数、总 trial、各标准权重、置信区间或失败类型，因此不能把 87% 外推为任意新任务或新站点的成功率。\n\n**实验 9：视频预测和规模是否改善语言遵循**\n\n- **设置：** 设计四类同场景换指令的评测：Jenga 方块推/拉与方向，五选一物体装箱，红黄块上下关系堆叠，以及餐巾的拾取、放下、拉动、旋转、翻面、折叠和展平。场景尽量固定，仅改变语言命令。所有模型再用少量同一套机器人任务数据微调。评分为完成指令记 1，尝试正确语言 primitive 但未完成记 0.5，执行错误动词/对象/方向记 0。\n\n| 配置 | 全部 36 次 | Jenga n=8 | Object kitting n=10 | Piece stacking n=10 | Napkin n=8 |\n|---|---:|---:|---:|---:|---:|\n| action-only，早期 Dyna-2 | 0.35 | 0.44 | 0.10 | 0.60 | 0.25 |\n| video co-train，早期 Dyna-2 | 0.67 | 1.00 | 0.35 | 0.95 | 0.38 |\n| video co-train，完整 Dyna-2 | 0.96 | 1.00 | 0.95 | 1.00 | 0.88 |\n\n- **证据支持：** 同一早期语料上，video co-training 相对 action-only 把总分从 0.35 提到 0.67；扩大到完整 Dyna-2 语料后升到 0.96。结果支持视频目标和大规模多样数据都与语言 grounding 改善有关。\n- **证据边界：** 报告把同场景换指令称为 counterfactual cases，但这是评测构造，不是 SCM 反事实推理。完整 Dyna-2 相对早期版本同时改变规模、数据多样性和可能的生产 recipe，无法把第二段提升只归因于单一变量。\n\n**实验 10：一步视频生成为什么失败，以及移动目标蒸馏能否修复**\n\n- **方法探查：** 作者指出，直接回归一步结果会逼近条件均值而变模糊；直接做分布匹配时，一步学生会离开教师 score 可靠的概率流路径。其教师路径局部每步约弯 4°、全程累计约 58°；高维视频流形缺少重叠时，散度容易饱和并产生弱梯度。提出的训练把学生 $p_\\theta$ 与目标路径 $q_r$ 都用 $\\mathcal{D}(0,\\sigma^2)$ 平滑，并以快慢两组更新让学生参数追逐当前目标、让目标进度只在学生追上时前移：\n\n$$\n\\frac{\\mathrm d\\theta}{\\mathrm dt}\\propto\n-w(\\hat m)\\nabla_\\theta\n\\mathbb D\\!\\left(p_\\theta*\\mathcal D_\\sigma\\,\\|\\,q_r*\\mathcal D_\\sigma\\right),\n\\qquad\n\\frac{\\mathrm dr}{\\mathrm dt}=f(\\hat m).\n$$\n\n- **量化设置：** 单张 H100，生成 3 秒、3 视角操作视频；比较 NFE、采样时间、FVD、相对真实视频运动量和 flicker。\n\n| Sampler | NFE | 时间 | 加速 | FVD ↓ | Motion ↑ | Flicker |\n|---|---:|---:|---:|---:|---:|---:|\n| 真实未来 | — | — | — | — | 100% | 2.37 |\n| 教师默认 schedule | 100 | 10,203 ms | 1× | 80 | 94% | 2.69 |\n| 教师硬截为 1 step | 2 | 210 ms | 48.6× | 1039 | 27% | 15.81 |\n| DMD2，2 steps | 2 | 211 ms | 48.4× | 115 | 79% | 2.95 |\n| DMD2，1 step | 1 | 109 ms | 93.6× | 599 | 56% | 5.81 |\n| Dyna-2 方法，1 step | 1 | 110 ms | 93× | 121 | 75% | 1.94 |\n\n- **证据支持：** 新方法把 100-NFE 教师的 10.203 秒降到 110 ms，同时显著优于硬截一步和 DMD2 一步；FVD 接近 DMD2 两步，flicker 甚至低于记录视频。官方还展示了未做机器人适配的人类第一视角指令条件未来，以及机器人数据 post-train 后的多视角未来。\n- **证据边界：** 一步学生仍落后完整教师的 FVD 80 和 motion 94%，只保留真实运动量的 75%；过低 flicker 也可能部分来自运动不足，不能单独当成更真实。报告声称质量可用于 planning/evaluation，但没有提供下游规划成功率、闭环控制收益或多视角几何一致性的量化指标；Fig. 17–18 主要是定性样例。",
    "evidence_notes": "",
    "code_data_status": "截至 2026-09-02，官方技术报告页面没有给出代码仓库、模型权重、数据下载、训练配置或许可证入口；公开 GitHub 检索未发现可确认属于 Dyna Robotics 的 Dyna-2 官方实现。官方只提供网页正文、图表、图片和演示视频。\n\n百万小时语料由合作方与内部操作共同构建，但具体来源比例、采集协议、参与者同意、地理/人口分布、数据许可证、商业使用权、去重清单和原始/派生标注均未公开。39 项离线机器人评测含 27 项外部 xdof ABC 与 12 项内部任务，但完整评测数据与脚本未提供。因而目前可以审计报告逻辑和页面数值，不能复现预训练、消融或真机结论。",
    "limitations": "- **来源与评审：** 只有机构署名的网页版技术报告，没有 PDF、arXiv、DOI、个人作者列表或可核验同行评审；页面可以更新，当前结论应绑定 2026-09-02 的核验日期。\n- **可复现性：** 模型规模、关键超参数、训练 token/FLOPs、数据配比、完整 checkpoint、代码和权重未公开；外部研究者无法复核幂律指数或消融公平性。\n- **统计强度：** scaling law 只有四个数据规模；后期 10 checkpoints 不能代替独立种子。多数真机任务约 10 次试验，页面未给置信区间，单项结果存在明显非单调和回落。\n- **数据泄漏与覆盖：** 预训练人类视频来源和去污染流程未披露。即使机器人轨迹从未进入预训练，任务语义、对象和场景仍可能在人类视频中出现，不能把 zero-shot 写成完全无先验。\n- **混杂变量：** video co-training 同时改变目标、样本量和训练负载；完整 Dyna-2 的“production recipe”又与专门研究 scaling law 的版本不同。等 FLOPs、等 token、等模型容量的对照仍缺失。\n- **离线—在线鸿沟：** 跨 embodiment 核心曲线以动作 MSE/accuracy 为主；这些指标与闭环成功并非一一对应。14 项平均值上升，但 Rope Tie、Food Scooping 等在 1M 上回落。\n- **因果边界：** temporal causal mask、future prediction 和同场景换指令都不构成结构因果模型、干预识别或反事实生成；消融只支持给定训练协议内的局部依赖。\n- **WAM 机制边界：** 动作推理不读取生成未来，尚未比较显式 rollout planning、latent state planning、对象中心 3D/4D 状态或 contact dynamics 是否比训练期 RGB prediction 更有效。\n- **一步视频边界：** 一步学生仍有 motion deficit，且“可用于规划”没有下游任务证据；需要报告控制成功率、规划校准、多样未来覆盖和多视角几何一致性。\n- **安全与社会边界：** 官方没有系统报告失败恢复、碰撞/误操作、安全约束、数据隐私和劳动数据治理；客户现场 87% pass 仍意味着按其内部标准存在未通过案例，但失败类型未披露。",
    "comments": "",
    "source_reports": [
      "report-1950a5754f",
      "report-f3ad8e6a32"
    ],
    "deleted": false,
    "updated_at": "2026-09-02",
    "challenges": "机器人基础模型扩展面临的第一道约束不是模型接口，而是可获得的数据轴。遥操作和专用采集装置能提供与机器人执行器严格对齐的动作标签，但每小时数据都要主动生产；互联网或专门采集的人类第一视角视频规模更大，却存在手—机器人 embodiment gap、动作标签缺失和视觉/运动学分布差异。领域此前还缺少一组彼此连贯的实证答案：人类操作视频从千小时扩到百万小时时是否持续改善，离线动作误差的改善能否跨到未见机器人 embodiment，离线排序能否转化成后训练后的真机性能，以及究竟是动作标签、视频预测目标还是二者共同驱动迁移。\n\nDyna-2 还面对两个次级问题。其一，联合视频—动作生成是否真的优于只做 action prediction 的 VLA 风格目标，还是只增加训练成本；其二，视频扩散模型通常需要多次网络求值，难以直接服务低延迟规划或评测，而把多步教师硬截成一步会产生模糊、抖动或静态视频。",
    "motivation": "作者从目标反推数据来源：若通用机器人最终要执行人类正在完成的广泛经济活动，那么记录人类真实操作过程的第一视角视频应当包含对象如何响应接触、手如何作用于物体以及场景如何演化。Dyna-2 要验证的不是“人类和机器人已经同构”，而是更窄也更可操作的命题：当预训练只增加人类视频经验时，机器人域预测和后训练策略是否保持可测的规模排序。如果成立，工程路线就可以分成“继续扩大人类感知数据”和“缩小 embodiment gap”，而不必把所有预训练数据都做成昂贵的机器人轨迹。\n\n作者进一步假设，未来视频预测提供了比伪动作监督更通用的物理表征。其受控消融试图检验：只有 action loss 时，规模增长是否足够；在同一数据上同时预测视频和动作是否足够；再加入不带动作标签的视频，能否形成新的扩展轴。这里的证据是训练目标与跨域预测之间的受控关联，不等同于结构因果模型、`do(·)` 干预、因果识别或对真实物理机制的可解释恢复。",
    "technical_approach": "- **输入：** 条件上下文包括过去视频帧、机器人或人体本体状态、语言指令；视频分支接收加噪的未来视频 latent，动作分支接收加噪的未来动作块。人类预训练数据主要是头戴式第一视角双手操作视频，动作伪标签由通过质量过滤的 3D 手部轨迹生成：腕部位姿近似末端轨迹，拇指—食指开合距离形成连续抓握信号。\n- **过程：** Dyna-2 以视频扩散 backbone 为主体，采用 mixture-of-transformers：视频与动作分别 token 化并进入各自的 DiT 层，通过注意力交互；本体状态直接送入动作 transformer。视频 token 使用时序 causal mask，动作 token 内部使用双向 self-attention，并只读取已观察上下文的视频 token；文本与视频 token cross-attention，但不直接进入动作 token。作者依据早层保留主要时序推理能力的先验，把动作 transformer 做得更浅并只在视频网络早层连接，以降低控制延迟。训练采用 flow matching，在共享 trunk 上拟合视频和动作两个边缘速度场：`video loss + λ × action loss`。一步视频学生则不追逐固定教师，而是在高斯平滑后，沿从可达初始分布到真实数据分布的连续目标路径训练；路径进度由学生样本的在线读数控制，只有学生追上当前目标才继续推进。\n- **输出：** 控制模式输出未来动作块；生成模式输出指令条件的未来视频。重要的是，官方 scaling-law 版本的动作速度场不把加噪未来视频作为参数：推理时策略既不生成、也不读取预测未来视频，仍是 reactive policy。视频预测在训练期塑造共享表征，而不是在控制期执行显式 imagined rollout 或规划。\n\n对 scaling-law 版本，设条件为 $c$、未来视频 latent 为 $z$、未来动作块为 $a$，前向扰动为\n\n$$\nz_t = tz + (1-t)\\varepsilon_z, \\qquad\na_t = ta + (1-t)\\varepsilon_a,\n\\qquad \\varepsilon_z,\\varepsilon_a \\sim \\mathcal{N}(0,I).\n$$\n\n共享模型分别拟合视频与动作速度：\n\n$$\n\\mathcal{L}_{\\mathrm{co}}(\\theta)=\n\\mathbb{E}\\left\\lVert u_\\theta^{\\mathrm{vid}}(z_t;t,c)-(z-\\varepsilon_z)\\right\\rVert^2\n+\\lambda\\,\\mathbb{E}\\left\\lVert u_\\theta^{\\mathrm{act}}(a_t;t,c)-(a-\\varepsilon_a)\\right\\rVert^2.\n$$",
    "discussion": "Dyna-2 最重要的贡献可以浓缩为三个相互约束的发现。第一，固定架构和训练协议时，嵌套人类操作视频从 1k 扩到 1M 小时，四种同域动作指标都单调改善。第二，这个排序在没有机器人预训练的 39 项离线机器人任务中更明显，并能在相同机器人 post-training 数据下转化为 14 项真机任务的平均提升。第三，单纯扩大动作监督不够：同数据上的未来视频目标普遍优于 action-only，而额外 video-only 数据是报告中唯一持续形成跨 embodiment 扩展趋势的 recipe。\n\n对 World Action Model 研究而言，最有启发性的不是“生成视频即可控制”，而是“未来预测可以作为跨 embodiment 表征学习目标”。Dyna-2 的动作头在推理时不消费预测未来，所以当前证据更接近 `video prediction during pre-training → shared representation → reactive action chunk`，而不是 `generate futures → evaluate futures → plan action`。这让它与 DreamZero 等把生成未来直接转成策略的路线有清楚区别，也提示后续研究应分别测量表征迁移与显式规划的贡献。\n\n关于“证明了什么”，较严谨的表述是：Dyna-2 **证明其内部受控协议能够观察到**百万小时范围内的人类数据扩展趋势、未见机器人数据上的跨 embodiment 排序，以及训练目标/数据组成对该排序的必要影响；真机平均分、内部 VLA 对照、站点泛化和语言遵循进一步提供一致但样本量较小的支持。它**没有证明**人类视频规模本身是唯一原因、该幂律在更大规模或其他机构数据上继续成立、视频模型已经学习可识别的物理因果变量、所有单项任务随规模单调改善，或一步视频已被验证为有效规划器。\n\n对知域现有研究方向，这项工作直接改变了值得优先验证的 baseline：任何主张 object-centric 4D、HOI track、contact state 或显式因果变量能改善世界动作模型的方案，都不应只对比 action-only VLA，而应至少加入大规模 video co-training WAM。更有辨识度的实验是固定动作标签、video-only 数据和算力，比较 `RGB future prediction` 与 `object/contact/4D state prediction` 在未见 embodiment 上的增益，并检查它们是否改善真机长尾任务，而不只是同域重建指标。"
  },
  {
    "arxiv": {
      "published": "2026-03-09T11:24:14Z",
      "revised_at": "2026-03-09T11:24:14Z",
      "primary_category": "cs.CV"
    },
    "arxiv_id": "2603.08254",
    "authors": [
      "Zhuolin He",
      "Jing Li",
      "Guanghao Li",
      "Xiaolei Chen",
      "Jiacheng Tang",
      "Siyang Zhang",
      "Zhounan Jin",
      "Feipeng Cai",
      "Bin Li",
      "Jian Pu",
      "Jia Cai",
      "Xiangyang Xue"
    ],
    "code_data_status": "截至来源报告核验时，未记录可确认的官方代码、数据或模型入口；这表示开放状态待核验，不代表资源确定不存在。",
    "comments": "",
    "deleted": false,
    "doi": "",
    "evidence_notes": "",
    "experiments": "在 KITTI、Waymo 上验证 dynamic point-map reconstruction 和 4D scene reconstruction。相较静态 VGGT，动态区域重建和时序一致性明显提升。\n\n**对你方向的启发**\n\n- 它不是 HOI，但可以给你一个 4D 表示灵感：**把 HOI world state 表示成 dynamic point map / Gaussian state，而不是只用 video latent**。\n- 很适合借来做“object 4D state update”的几何 backbone。\n\n---",
    "figure": {
      "alt": "DynamicVGGT pipeline",
      "label": "DynamicVGGT pipeline",
      "paper_title": "DynamicVGGT: Learning Dynamic Point Maps for 4D Scene Reconstruction in Autonomous Driving",
      "source_url": "https://arxiv.org/html/2603.08254v1/totalpipelinev4.png",
      "url": "https://arxiv.org/html/2603.08254v1/totalpipelinev4.png"
    },
    "id": "arxiv-2603-08254",
    "insight": "VGGT 擅长 static 3D reconstruction，但 dynamic scene 的关键不是独立重建每一帧，而是在统一坐标表示中显式建模 point 随时间如何运动。DynamicVGGT 将 static point map 扩展为 **Dynamic Point Map (DPM)**，同时学习 implicit temporal correspondence 和 explicit motion。",
    "limitations": "- 它不是 HOI，但可以给你一个 4D 表示灵感：**把 HOI world state 表示成 dynamic point map / Gaussian state，而不是只用 video latent**。\n- 很适合借来做“object 4D state update”的几何 backbone。\n\n---",
    "links": {
      "publication": "https://openaccess.thecvf.com/content/CVPR2026/html/He_DynamicVGGT_Learning_Dynamic_Point_Maps_for_4D_Scene_Reconstruction_in_CVPR_2026_paper.html",
      "paper": "https://arxiv.org/abs/2603.08254",
      "alphaxiv": "https://alphaxiv.org/abs/2603.08254"
    },
    "pipeline": {
      "input": "monocular / multi-camera image sequences。",
      "process": "VGGT backbone 提取 geometry；Motion-aware Temporal Attention 建模时序；Future Point Head 预测 current/future point maps，并在统一 reference 中通过差值得到 implicit motion；Dynamic Gaussian Head 将 points 转为 3D Gaussians，并用 motion tokens 预测 Gaussian velocity，受 scene-flow supervision 约束。",
      "output": "dynamic point maps、dynamic 3D Gaussians / velocities，可用于 4D reconstruction / rendering。",
      "details": "- **输入**：时间序列 monocular / multi-camera images。\n- **过程**：VGGT backbone 提取 geometry；Motion-aware Temporal Attention 建模时序；Future Point Head 预测 current/future point maps，并在统一 reference 中通过差值得到 implicit motion；Dynamic Gaussian Head 将 points 转为 3D Gaussians，并用 motion tokens 预测 Gaussian velocity，受 scene-flow supervision 约束。\n- **输出**：dynamic point maps、dynamic 3D Gaussians / velocities，可用于 4D reconstruction / rendering。"
    },
    "publication": "CVPR 2026",
    "source_reports": [
      "report-0ad44831eb",
      "report-e81e6bd3a1"
    ],
    "summary": "VGGT 擅长 static 3D reconstruction，但 dynamic scene 的关键不是独立重建每一帧，而是在统一坐标表示中显式建模 point 随时间如何运动。DynamicVGGT 将 static point map 扩展为 Dynamic Point Map (DPM) ，同时学习 implicit temporal correspondence 和 explicit motion。",
    "tags": [
      "3D/4D",
      "HOI",
      "World Action Model",
      "机器人学习",
      "第一视角与人类视频",
      "自监督与预测表征"
    ],
    "title": "DynamicVGGT: Learning Dynamic Point Maps for 4D Scene Reconstruction in Autonomous Driving",
    "updated_at": "2026-08-23",
    "year": 2026,
    "discussion": "- 它不是 HOI，但可以给你一个 4D 表示灵感：**把 HOI world state 表示成 dynamic point map / Gaussian state，而不是只用 video latent**。\n- 很适合借来做“object 4D state update”的几何 backbone。\n\n---"
  },
  {
    "id": "arxiv-2605-06192",
    "title": "EA-WM: Event-Aware Generative World Model with Structured Kinematic-to-Visual Action Fields",
    "authors": [
      "Zhaoyang Yang",
      "Yurun Jin",
      "Lizhe Qi",
      "Kai Chen",
      "Cong Huang"
    ],
    "year": 2026,
    "publication": "2026，arXiv preprint",
    "arxiv_id": "2605.06192",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2605.06192",
      "alphaxiv": "https://alphaxiv.org/abs/2605.06192"
    },
    "tags": [
      "世界模型",
      "动作表征",
      "机器人学习",
      "跨本体迁移"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2605.06192v1/figure/fig2_copy_1.png",
      "alt": "EA-WM Fig. 2: structured kinematic-to-visual action fields",
      "label": "EA-WM，Fig. 2，结构化运动学视觉动作场与事件增强双流生成框架。来源：Fig. 2 原图 PNG",
      "paper_title": "EA-WM: Event-Aware Generative World Model with Structured Kinematic-to-Visual Action Fields",
      "source_url": "https://arxiv.org/html/2605.06192v1/figure/fig2_copy_1.png"
    },
    "summary": "作者把关节动作与运动学状态投影成 Structured Kinematic-to-Visual Action Fields（KVAF），再用帧差监督 event gate。核心 Insight 是同时对齐表示空间和信息交换时机；与本专题直接相关，但 KVAF 是高带宽生成条件，不是数值动作的无损编码。",
    "insight": "作者把关节动作与运动学状态投影成 Structured Kinematic-to-Visual Action Fields（KVAF），再用帧差监督 event gate。核心 Insight 是同时对齐表示空间和信息交换时机；与本专题直接相关，但 KVAF 是高带宽生成条件，不是数值动作的无损编码。",
    "pipeline": {
      "input": "首帧、语言、双臂关节/夹爪/末端位姿、URDF、相机参数和目标视频。",
      "process": "前向运动学与投影生成深度骨架、landmark、夹爪几何、末端热图和 RGB 位姿轴；RGB/KVAF 用同一 Wan2.2 VAE。两个 full-depth DiT 流在稀疏层双向 cross-attention；共享 event MLP 用相邻 RGB 绝对帧差 latent 监督门控。两阶段先训 LoRA/KVAF head，再解冻 fusion。",
      "output": "未来 RGB 与可解释 KVAF 序列；启发式动作恢复仅是附加分析。",
      "details": "- **输入：** 首帧、语言、双臂关节/夹爪/末端位姿、URDF、相机参数和目标视频。\n- **过程：** 前向运动学与投影生成深度骨架、landmark、夹爪几何、末端热图和 RGB 位姿轴；RGB/KVAF 用同一 Wan2.2 VAE。两个 full-depth DiT 流在稀疏层双向 cross-attention；共享 event MLP 用相邻 RGB 绝对帧差 latent 监督门控。两阶段先训 LoRA/KVAF head，再解冻 fusion。\n- **输出：** 未来 RGB 与可解释 KVAF 序列；启发式动作恢复仅是附加分析。"
    },
    "experiments": "WorldArena/RoboTwin 的六项 P3CScore 上 EA-WM 为 76.60，最强总体基线 CogVideoX 为 71.08。EA-WM 的 Interaction/Trajectory/Depth/Perspectivity/Instruction 为 0.682/0.430/0.959/0.838/0.792，均领先；Semantic 0.895 略低于 CogVideoX 0.898，所以不是六项全胜。Wan2.2、无 KVAF、无 EAF、完整模型为 60.83/70.97/74.80/76.60，支持 KVAF 是主要增益来源。\n\n动作恢复中 raw-action baseline 的 translation/rotation/gripper 误差为 0.004/0.009/0.013，KVAF recovery 为 0.0155/0.110/0.039，检测率约 0.45，说明视觉场不适合精确反演控制。训练使用 32×H100、LoRA rank 32、batch 32；未报告步数和 GPU-hours，也无真机闭环实验。",
    "evidence_notes": "",
    "code_data_status": "未核验到官方代码、权重或 KVAF 处理数据。实验依赖 WorldArena/RoboTwin，不代表本文实现已经开放。",
    "limitations": "- 依赖 URDF、同步状态日志和准确相机标定。\n- KVAF 只显式编码机器人，对象接触仍由模型隐式学习。\n- 动作恢复检测率约 0.45，不能替代原始控制量。\n- 仅模拟基准，无真实闭环策略验证。\n- 32×H100 且缺少训练时长，复现成本不透明。",
    "comments": "",
    "source_reports": [
      "report-a77d9a7ad6"
    ],
    "deleted": false,
    "updated_at": "2026-08-23",
    "challenges": "低维动作 token 缺少目标视角中的机器人几何、深度和接触位置；即使增设动作分支，普通融合也可能忽略物体真正发生变化的交互事件。本文具体针对“动作空间—视频空间错位”和“双流只交换一般特征而不聚焦事件”。",
    "motivation": "作者把关节动作与运动学状态投影成 Structured Kinematic-to-Visual Action Fields（KVAF），再用帧差监督 event gate。核心 Insight 是同时对齐表示空间和信息交换时机；与本专题直接相关，但 KVAF 是高带宽生成条件，不是数值动作的无损编码。",
    "technical_approach": "- **输入：** 首帧、语言、双臂关节/夹爪/末端位姿、URDF、相机参数和目标视频。\n- **过程：** 前向运动学与投影生成深度骨架、landmark、夹爪几何、末端热图和 RGB 位姿轴；RGB/KVAF 用同一 Wan2.2 VAE。两个 full-depth DiT 流在稀疏层双向 cross-attention；共享 event MLP 用相邻 RGB 绝对帧差 latent 监督门控。两阶段先训 LoRA/KVAF head，再解冻 fusion。\n- **输出：** 未来 RGB 与可解释 KVAF 序列；启发式动作恢复仅是附加分析。",
    "discussion": "EA-WM 的受控结果支持相机对齐视觉场改善轨迹与几何、事件融合进一步改善综合一致性。证据局限于模拟视频评测；高算力、完整标定和双 DiT 流使其更像高成本视觉模拟器，而非已验证的实时控制接口。",
    "arxiv": {
      "published": "2026-05-07T13:06:19Z",
      "revised_at": "2026-05-07T13:06:19Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2608-23189",
    "title": "EchoWM: Open and Enterable Omnimodal World Models",
    "authors": [
      "Songchun Zhang",
      "Yaowei Li",
      "Junhao Zhuang",
      "Weiyang Jin",
      "Haoyu Wang",
      "Xin Lu",
      "Yilang Sun",
      "Shiyi Zhang",
      "Haoran Li",
      "Xiaoxiao Ma",
      "Yuming Li",
      "Yijun Liu",
      "Yaofeng Su",
      "Yanwen Ma",
      "Haoyu Wu",
      "Zihan Su",
      "Yue Ma",
      "Lvmin Zhang",
      "Haoyang Huang",
      "Zeyue Xue",
      "Anyi Rao",
      "Nan Duan"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本（首发 2026-08-24）",
    "arxiv_id": "2608.23189",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.23189",
      "alphaxiv": "https://alphaxiv.org/abs/2608.23189"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "流式与自回归",
      "第一视角与人类视频",
      "长时记忆"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.23189v1/data_vis.png",
      "alt": "EchoWM: Open and Enterable Omnimodal World Models 代表图",
      "label": "Figure 2 : Gameplay recordings with native game audio. Representative frames from the internally collected gameplay corpus span six activity categories, with synchronized native-game audio waveforms shown below the visual sequences. 来源：论文图",
      "paper_title": "EchoWM: Open and Enterable Omnimodal World Models",
      "source_url": "https://arxiv.org/html/2608.23189v1/data_vis.png"
    },
    "summary": "EchoWM 面向\"可进入的生成媒体\"：连续导航下联合生成 720p 视频、环境音、音乐与语音。交互围绕 相机意图 组织：第一人称场景指定观察者运动，第三人称场景从数据学习相机-角色动态（无需视角特定控制器）；离散命令与连续位姿映射到共享 metric-scale 相对 6-DoF 轨迹，数据集级校准保持异构数据的运动幅度。",
    "insight": "EchoWM 面向\"可进入的生成媒体\"：连续导航下联合生成 720p 视频、环境音、音乐与语音。交互围绕**相机意图**组织：第一人称场景指定观察者运动，第三人称场景从数据学习相机-角色动态（无需视角特定控制器）；离散命令与连续位姿映射到共享 metric-scale 相对 6-DoF 轨迹，数据集级校准保持异构数据的运动幅度。",
    "pipeline": {
      "input": "导航命令（离散/连续位姿）+ 历史帧。",
      "process": "相机意图 → metric-scale 相对 6-DoF 轨迹 → 视听联合生成（视频+环境音+音乐+语音）→ 数据集级校准。",
      "output": "可导航的多模态媒体流。",
      "details": "**输入**：导航命令（离散/连续位姿）+ 历史帧。\n**过程**：相机意图 → metric-scale 相对 6-DoF 轨迹 → 视听联合生成（视频+环境音+音乐+语音）→ 数据集级校准。\n**输出**：可导航的多模态媒体流。"
    },
    "experiments": "仅摘要核验；42 页长文的实验细节（导航保真、视听同步、记忆保持）待全文。",
    "evidence_notes": "",
    "code_data_status": "未公开。",
    "limitations": "- 跨数据源运动尺度校准；\n- 视听联合生成的长程一致；\n- 语音/音乐的语义控制边界。\n\n### 与知域的关系\n与知域 EgoSim、EgoForge、minWM 的\"可进入/交互世界模型\"主线一致，增加多模态（音+语音）维度，建议同专题。",
    "comments": "",
    "source_reports": [
      "report-a141624b1e"
    ],
    "deleted": false,
    "updated_at": "2026-08-31",
    "arxiv": {
      "published": "2026-08-24T12:39:59Z",
      "revised_at": "2026-08-24T12:39:59Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "arxiv": {
      "published": "2026-06-08T18:14:08Z",
      "revised_at": "2026-06-10T06:52:36Z",
      "primary_category": "cs.RO"
    },
    "arxiv_id": "2606.10040",
    "authors": [
      "Jiajun Li",
      "Tiecheng Guo",
      "Yifan Ye",
      "Rongyu Zhang",
      "Xiaowei Chi",
      "Qianpu Sun",
      "Ying Li",
      "Yunfan Lou",
      "Yan Huang",
      "Zhihe Lu",
      "Meng Guo",
      "Shanghang Zhang"
    ],
    "code_data_status": "截至来源报告核验时，未记录可确认的官方代码、数据或模型入口；这表示开放状态待核验，不代表资源确定不存在。",
    "comments": "",
    "deleted": false,
    "doi": "",
    "evidence_notes": "",
    "experiments": "RoboTwin 2.0 上 1B Efficient-WAM 达 86.7% clean / 85.7% random；真机 Efficient-WAM-RT 平均 66.25%，接近或超过更重模型。每 action chunk 约 98 ms，显著快于传统重型 WAM。结论：低分辨率、低成本、少步 future imagination 已足以提供有效 dynamics supervision。\n\n---",
    "figure": {
      "alt": "Efficient-WAM architecture",
      "label": "Efficient-WAM 架构",
      "paper_title": "Efficient-WAM: A 1B-Parameter World-Action Model with Low-Cost Future Imagination",
      "source_url": "https://arxiv.org/html/2606.10040v2/architecture.png",
      "url": "https://arxiv.org/html/2606.10040v2/architecture.png"
    },
    "id": "arxiv-2606-10040",
    "insight": "Efficient-WAM 直接挑战一个默认假设：**control 是否真的需要 photorealistic future video？** 作者认为 action 主要需要物体运动、接触、空间变化等 dynamics cue，而不是纹理、光照等视觉细节。因此 future prediction 应被看作 action guidance signal，而不是 video generation task 本身。",
    "limitations": "来源报告未单列可核验的局限、失败案例或开放问题；在补充原论文正文核验前，不对该工作的泛化性、因果性、复现性或 SOTA 结论作扩大解释。",
    "links": {
      "paper": "https://arxiv.org/abs/2606.10040",
      "alphaxiv": "https://alphaxiv.org/abs/2606.10040"
    },
    "pipeline": {
      "input": "当前 observation、language、robot state。",
      "process": "从 WAN2.2-5B 蒸馏/压缩 Compact Video Expert 到约 1B；使用 sparse / low-resolution video tokens；video 分支使用比 action 分支更少的 denoising steps；训练分为 video dynamics 蒸馏、冻结 video expert 训练 action expert、video/action 联合 refinement。",
      "output": "future latent + action chunk；部署时实现低延迟 action generation。",
      "details": "- **输入**：当前 observation、language、robot state。\n- **过程**：从 WAN2.2-5B 蒸馏/压缩 Compact Video Expert 到约 1B；使用 sparse / low-resolution video tokens；video 分支使用比 action 分支更少的 denoising steps；训练分为 video dynamics 蒸馏、冻结 video expert 训练 action expert、video/action 联合 refinement。\n- **输出**：future latent + action chunk；部署时实现低延迟 action generation。"
    },
    "publication": "arXiv 2026",
    "source_reports": [
      "report-e81e6bd3a1"
    ],
    "summary": "Efficient-WAM 直接挑战一个默认假设： control 是否真的需要 photorealistic future video？ 作者认为 action 主要需要物体运动、接触、空间变化等 dynamics cue，而不是纹理、光照等视觉细节。因此 future prediction 应被看作 action guidance signal，而不是 video generation task 本身。",
    "tags": [
      "World Action Model",
      "机器人学习",
      "自监督与预测表征",
      "视频生成"
    ],
    "title": "Efficient-WAM: A 1B-Parameter World-Action Model with Low-Cost Future Imagination",
    "updated_at": "2026-08-20",
    "year": 2026
  },
  {
    "arxiv": {
      "published": "2026-03-13T21:46:17Z",
      "revised_at": "2026-03-13T21:46:17Z",
      "primary_category": "cs.CV"
    },
    "arxiv_id": "2603.13615",
    "authors": [
      "Dayou Li",
      "Lulin Liu",
      "Bangya Liu",
      "Shijie Zhou",
      "Jiu Feng",
      "Ziqi Lu",
      "Minghui Zheng",
      "Chenyu You",
      "Zhiwen Fan"
    ],
    "code_data_status": "截至来源报告核验时，未记录可确认的官方代码、数据或模型入口；这表示开放状态待核验，不代表资源确定不存在。",
    "comments": "",
    "deleted": false,
    "doi": "",
    "evidence_notes": "",
    "experiments": "在 HOT3D 上，与 Wan、Cosmos 2B/14B、Uni3C 等强基线比较，在视觉预测、ego-motion consistency、kinematic fidelity、object consistency 等方面取得提升。消融验证 physics-informed embeddings 对手部稳定、相机一致、物体保持都有效。\n\n**对你方向的启发**\n\n- 这是目前最贴近“HOI world model”的工作之一。\n- 它强在 **3D prior distillation into video world model**。\n- 仍可继续做的点：显式 object pose/state update、contact state transition、4D object representation，而不是只作为 embedding regularizer。\n\n---",
    "figure": {
      "alt": "EgoHOI pipeline",
      "label": "EgoHOI pipeline",
      "paper_title": "EgoHOI: Egocentric World Model for Photorealistic Hand-Object Interaction Synthesis",
      "source_url": "https://arxiv.org/html/2603.13615v1/pipeline.png",
      "url": "https://arxiv.org/html/2603.13615v1/pipeline.png"
    },
    "id": "arxiv-2603-13615",
    "insight": "EgoHOI 明确反对“给未来物体轨迹等 privileged future state，再做条件视频生成”的捷径。它认为真正的 egocentric HOI world model 应该从 action signals 推断 hand-object dynamics。为此，它从 3D estimates 中蒸馏 **physics-informed embeddings**：hand kinematic embeddings、ego-motion embeddings、object entity embeddings，用来约束 latent rollout 的物理合理性、手部运动学一致性、物体身份稳定性。",
    "limitations": "- 这是目前最贴近“HOI world model”的工作之一。\n- 它强在 **3D prior distillation into video world model**。\n- 仍可继续做的点：显式 object pose/state update、contact state transition、4D object representation，而不是只作为 embedding regularizer。\n\n---",
    "links": {
      "paper": "https://arxiv.org/abs/2603.13615",
      "project": "https://egohoi.github.io/",
      "alphaxiv": "https://alphaxiv.org/abs/2603.13615"
    },
    "pipeline": {
      "input": "第一帧、action signals、估计出的 3D hand/camera/object priors。",
      "process": "DiT backbone 做 latent-space state transition；HKE 约束高自由度手部运动；EME 用 Pluecker camera geometry 约束 ego-motion；OEE 用首帧物体实体特征维护 object identity；这些 embedding 通过 lightweight adapters 融入生成模型。",
      "output": "photorealistic、contact-consistent 的 egocentric HOI rollout。",
      "details": "- **输入**：第一帧、action signals、估计出的 3D hand/camera/object priors。\n- **过程**：DiT backbone 做 latent-space state transition；HKE 约束高自由度手部运动；EME 用 Pluecker camera geometry 约束 ego-motion；OEE 用首帧物体实体特征维护 object identity；这些 embedding 通过 lightweight adapters 融入生成模型。\n- **输出**：photorealistic、contact-consistent 的 egocentric HOI rollout。"
    },
    "publication": "arXiv 2026；作者主页标注 ECCV 2026",
    "source_reports": [
      "report-0ad44831eb"
    ],
    "summary": "EgoHOI 明确反对“给未来物体轨迹等 privileged future state，再做条件视频生成”的捷径。它认为真正的 egocentric HOI world model 应该从 action signals 推断 hand-object dynamics。为此，它从 3D estimates 中蒸馏 physics-informed embeddings ：hand kinematic embeddings、ego-motion embeddings、object entity embeddings，用来约束 latent rollout 的物理合理性、手部运动学一致性、物体身份稳定性。",
    "tags": [
      "3D/4D",
      "HOI",
      "世界模型",
      "因果与反事实",
      "第一视角与人类视频"
    ],
    "title": "Egocentric World Model for Photorealistic Hand-Object Interaction Synthesis",
    "updated_at": "2026-09-02",
    "year": 2026,
    "discussion": "- 这是目前最贴近“HOI world model”的工作之一。\n- 它强在 **3D prior distillation into video world model**。\n- 仍可继续做的点：显式 object pose/state update、contact state transition、4D object representation，而不是只作为 embedding regularizer。\n\n---",
    "challenges": "给定未来对象轨迹的条件生成泄漏了待预测状态；纯视频 latent 又容易出现手部、相机和对象身份漂移。",
    "motivation": "从 3D estimates 蒸馏 hand kinematic、ego-motion 和 object entity embeddings，在不直接给未来对象状态的情况下约束 rollout。",
    "technical_approach": "- **输入：** 初始第一视角场景、动作/手部控制与训练期 3D 估计\n- **过程：** video world model 联合 physics-informed embedding regularization，约束手、相机和对象一致性\n- **输出：** photorealistic egocentric HOI rollout"
  },
  {
    "arxiv": {
      "published": "2026-03-20T17:46:55Z",
      "revised_at": "2026-03-20T17:46:55Z",
      "primary_category": "cs.CV"
    },
    "arxiv_id": "2603.20169",
    "authors": [
      "Yifan Shen",
      "Jiateng Liu",
      "Xinzhuo Li",
      "Yuanzhe Liu",
      "Bingxuan Li",
      "Houze Yang",
      "Wenqi Jia",
      "Yijiang Li",
      "Tianjiao Yu",
      "James Matthew Rehg",
      "Xu Cao",
      "Ismini Lourentzou"
    ],
    "code_data_status": "截至来源报告核验时，未记录可确认的官方代码、数据或模型入口；这表示开放状态待核验，不代表资源确定不存在。",
    "comments": "",
    "deleted": false,
    "doi": "",
    "evidence_notes": "",
    "experiments": "构建 X-Ego benchmark，评估 goal alignment、temporal coherence、physical consistency。相对强基线，DINO-Score、CLIP-Score、FVD、Flow MSE、SSIM、LPIPS、PSNR 等指标均有提升。结论是 reward-guided diffusion refinement 能显著提升长程目标一致性和稳定性。\n\n---",
    "figure": {
      "alt": "EgoForge overview",
      "label": "EgoForge 总览",
      "paper_title": "EgoForge: Goal-Directed Egocentric World Simulator",
      "source_url": "https://arxiv.org/html/2603.20169v1/concept_video_yifan.png",
      "url": "https://arxiv.org/html/2603.20169v1/concept_video_yifan.png"
    },
    "id": "arxiv-2603-20169",
    "insight": "EgoForge 关注“目标导向”的第一视角世界模拟：给一张 egocentric image、高层指令、可选 exocentric view，生成完成目标的第一视角 rollout。核心 insight：长程 egocentric video 不仅要像，还要满足目标完成、时序因果、场景稳定和几何一致。",
    "limitations": "来源报告未单列可核验的局限、失败案例或开放问题；在补充原论文正文核验前，不对该工作的泛化性、因果性、复现性或 SOTA 结论作扩大解释。",
    "links": {
      "paper": "https://arxiv.org/abs/2603.20169",
      "project": "https://plan-lab.github.io/projects/egoforge/",
      "alphaxiv": "https://alphaxiv.org/abs/2603.20169"
    },
    "pipeline": {
      "input": "单张第一视角图像、自然语言目标/指令、可选第三视角参考图。",
      "process": "DiT backbone；引入 geometry-level grounding，与 VGGT 几何特征对齐；VideoDiffusionNFT 用 trajectory-level reward 细化采样。",
      "output": "目标导向的第一视角视频 rollout。",
      "details": "- **输入**：单张第一视角图像、自然语言目标/指令、可选第三视角参考图。\n- **过程**：DiT backbone；引入 geometry-level grounding，与 VGGT 几何特征对齐；VideoDiffusionNFT 用 trajectory-level reward 细化采样。\n- **输出**：目标导向的第一视角视频 rollout。"
    },
    "publication": "arXiv 2026",
    "source_reports": [
      "report-90041fa2f9"
    ],
    "summary": "EgoForge 关注“目标导向”的第一视角世界模拟：给一张 egocentric image、高层指令、可选 exocentric view，生成完成目标的第一视角 rollout。核心 insight：长程 egocentric video 不仅要像，还要满足目标完成、时序因果、场景稳定和几何一致。",
    "tags": [
      "3D/4D",
      "Agent与可执行世界",
      "HOI",
      "第一视角与人类视频"
    ],
    "title": "EgoForge: Goal-Directed Egocentric World Simulator",
    "updated_at": "2026-08-20",
    "year": 2026
  },
  {
    "arxiv": {
      "published": "2026-01-03T03:08:48Z",
      "revised_at": "2026-03-13T21:58:25Z",
      "primary_category": "cs.CV"
    },
    "arxiv_id": "2601.01050",
    "authors": [
      "Hongming Fu",
      "Wenjia Wang",
      "Xiaozhen Qiao",
      "Rolandos Alexandros Potamias",
      "Taku Komura",
      "Shuo Yang",
      "Zheng Liu",
      "Bo Zhao"
    ],
    "code_data_status": "截至来源报告核验时，未记录可确认的官方代码、数据或模型入口；这表示开放状态待核验，不代表资源确定不存在。",
    "comments": "",
    "deleted": false,
    "doi": "",
    "evidence_notes": "",
    "experiments": "在 H2O、HOI4D 等数据上，EgoGrasp 在 world-space hand/object reconstruction 上达到 SOTA 或竞争性能，并能处理多个 open-vocabulary objects。\n\n**对你方向的启发**\n\n- 它可以作为 3D/4D pseudo-label generator。\n- 如果你要用真实 ego video 训练 world model，EgoGrasp 这类方法可提供 object pose / contact / hand trajectory 标注。\n\n---",
    "figure": {
      "alt": "EgoGrasp pipeline",
      "label": "EgoGrasp pipeline",
      "paper_title": "EgoGrasp: World-Space Hand-Object Interaction Estimation from Egocentric Videos",
      "source_url": "https://arxiv.org/html/2601.01050v2/pipelinev2.png",
      "url": "https://arxiv.org/html/2601.01050v2/pipelinev2.png"
    },
    "id": "arxiv-2601-01050",
    "insight": "EgoGrasp 解决从动态 egocentric monocular videos 中恢复 world-space hand-object interaction 的问题。它指出多数 HOI 方法停留在 camera coordinate 或单帧层面，缺少全局世界坐标下的时间一致 hand/object trajectory。EgoGrasp 通过 foundation models + body prior + HOI diffusion，实现 open-vocabulary object 的 world-space HOI reconstruction。",
    "limitations": "- 它可以作为 3D/4D pseudo-label generator。\n- 如果你要用真实 ego video 训练 world model，EgoGrasp 这类方法可提供 object pose / contact / hand trajectory 标注。\n\n---",
    "links": {
      "paper": "https://arxiv.org/abs/2601.01050",
      "project": "https://mint-sjtu.github.io/EgoGrasp.io/",
      "alphaxiv": "https://alphaxiv.org/abs/2601.01050"
    },
    "pipeline": {
      "input": "动态相机下的 egocentric monocular video。",
      "process": "用 spatial perception models 提取 3D scene、hand、object attributes；用 body-guided diffusion 重建 upper-body / hand pose；用 HOI-prior-informed diffusion 对离散 object 6DoF 序列做 infilling，保证空间、时间、接触一致性。",
      "output": "world-space hand poses、object 6DoF trajectories、temporally consistent W-HOI。",
      "details": "- **输入**：动态相机下的 egocentric monocular video。\n- **过程**：用 spatial perception models 提取 3D scene、hand、object attributes；用 body-guided diffusion 重建 upper-body / hand pose；用 HOI-prior-informed diffusion 对离散 object 6DoF 序列做 infilling，保证空间、时间、接触一致性。\n- **输出**：world-space hand poses、object 6DoF trajectories、temporally consistent W-HOI。"
    },
    "publication": "arXiv 2026",
    "source_reports": [
      "report-0ad44831eb"
    ],
    "summary": "EgoGrasp 解决从动态 egocentric monocular videos 中恢复 world-space hand-object interaction 的问题。它指出多数 HOI 方法停留在 camera coordinate 或单帧层面，缺少全局世界坐标下的时间一致 hand/object trajectory。EgoGrasp 通过 foundation models + body prior + HOI diffusion，实现 open-vocabulary object 的 world-space HOI reconstruction。",
    "tags": [
      "3D/4D",
      "HOI",
      "第一视角与人类视频"
    ],
    "title": "EgoGrasp: World-Space Hand-Object Interaction Estimation from Egocentric Videos",
    "updated_at": "2026-08-23",
    "year": 2026,
    "discussion": "- 它可以作为 3D/4D pseudo-label generator。\n- 如果你要用真实 ego video 训练 world model，EgoGrasp 这类方法可提供 object pose / contact / hand trajectory 标注。\n\n---"
  },
  {
    "arxiv": {
      "published": "2026-04-01T15:00:46Z",
      "revised_at": "2026-07-01T11:45:08Z",
      "primary_category": "cs.CV"
    },
    "arxiv_id": "2604.01001",
    "authors": [
      "Jinkun Hao",
      "Mingda Jia",
      "Ruiyan Wang",
      "Hongrui Zhu",
      "Jiafei Cao",
      "Xihui Liu",
      "Ran Yi",
      "Lizhuang Ma",
      "Jiangmiao Pang",
      "Xudong Xu"
    ],
    "code_data_status": "截至来源报告核验时，未记录可确认的官方代码、数据或模型入口；这表示开放状态待核验，不代表资源确定不存在。",
    "comments": "",
    "deleted": false,
    "doi": "",
    "evidence_notes": "",
    "experiments": "论文在视觉质量、空间一致性、复杂场景泛化、in-the-wild dexterous interaction 上优于现有方法，并展示 cross-embodiment transfer 到 robot manipulation。\n\n**对你方向的启发**\n\n- 如果你要强调 3D/4D，EgoSim 比纯视频生成更重要。\n- 它提供了一个可讲的核心卖点：**persistent 3D state update**。\n- 可扩展方向：把 state update 细化到 object-centric 4D state、contact state、hand-object relation graph。\n\n---",
    "figure": {
      "alt": "EgoSim overview",
      "label": "EgoSim overview",
      "paper_title": "EgoSim: Egocentric World Simulator for Embodied Interaction Generation",
      "source_url": "https://arxiv.org/html/2604.01001v2/Network04011416.png",
      "url": "https://arxiv.org/html/2604.01001v2/Network04011416.png"
    },
    "id": "arxiv-2604-01001",
    "insight": "EgoSim 把问题从“生成一段视频”推进到“维护并更新 3D scene state”。它指出现有 egocentric simulators 要么缺显式 3D grounding，视角变化时结构漂移；要么把场景当静态，无法支持多阶段交互后的世界状态变化。因此 EgoSim 建模 **updatable world state**，让交互视频生成和 3D 状态更新互相约束。",
    "limitations": "- 如果你要强调 3D/4D，EgoSim 比纯视频生成更重要。\n- 它提供了一个可讲的核心卖点：**persistent 3D state update**。\n- 可扩展方向：把 state update 细化到 object-centric 4D state、contact state、hand-object relation graph。\n\n---",
    "links": {
      "paper": "https://arxiv.org/abs/2604.01001",
      "project": "https://egosimulator.github.io/",
      "alphaxiv": "https://alphaxiv.org/abs/2604.01001"
    },
    "pipeline": {
      "input": "scene image / scene video、action sequence、相机轨迹/动作估计。",
      "process": "Geometry-action-aware Observation Simulation 生成 action-conditioned egocentric observation；Interaction-aware State Updating 维护并更新 3D scene state；数据管线从 in-the-wild monocular ego videos 中抽取 static point cloud、camera trajectory、embodiment actions；EgoCap 用手机低成本扫描真实场景并采集交互。",
      "output": "空间一致的第一视角交互视频，以及随交互持续更新的 3D world state。",
      "details": "- **输入**：scene image / scene video、action sequence、相机轨迹/动作估计。\n- **过程**：Geometry-action-aware Observation Simulation 生成 action-conditioned egocentric observation；Interaction-aware State Updating 维护并更新 3D scene state；数据管线从 in-the-wild monocular ego videos 中抽取 static point cloud、camera trajectory、embodiment actions；EgoCap 用手机低成本扫描真实场景并采集交互。\n- **输出**：空间一致的第一视角交互视频，以及随交互持续更新的 3D world state。"
    },
    "publication": "arXiv 2026；v2 更新于 2026-07",
    "source_reports": [
      "report-0ad44831eb"
    ],
    "summary": "EgoSim 把问题从“生成一段视频”推进到“维护并更新 3D scene state”。它指出现有 egocentric simulators 要么缺显式 3D grounding，视角变化时结构漂移；要么把场景当静态，无法支持多阶段交互后的世界状态变化。因此 EgoSim 建模 updatable world state ，让交互视频生成和 3D 状态更新互相约束。",
    "tags": [
      "3D/4D",
      "HOI",
      "机器人学习",
      "第一视角与人类视频"
    ],
    "title": "EgoSim: Egocentric World Simulator for Embodied Interaction Generation",
    "updated_at": "2026-08-23",
    "year": 2026,
    "discussion": "- 如果你要强调 3D/4D，EgoSim 比纯视频生成更重要。\n- 它提供了一个可讲的核心卖点：**persistent 3D state update**。\n- 可扩展方向：把 state update 细化到 object-centric 4D state、contact state、hand-object relation graph。\n\n---"
  },
  {
    "arxiv": {
      "published": "2026-08-04T01:01:18Z",
      "revised_at": "2026-08-04T01:01:18Z",
      "primary_category": "cs.RO"
    },
    "arxiv_id": "2608.02990",
    "authors": [
      "Jiayi Luo",
      "Hanxin Zhu",
      "Chen Gao",
      "Jiankun Wang",
      "Cong Wang",
      "Tianyu He",
      "Jianxin Li",
      "Zhibo Chen"
    ],
    "code_data_status": "截至来源报告核验时，未记录可确认的官方代码、数据或模型入口；这表示开放状态待核验，不代表资源确定不存在。",
    "comments": "",
    "deleted": false,
    "doi": "",
    "evidence_notes": "",
    "experiments": "约 100 万机器人 manipulation videos 训练；compression rate 仅 0.39%；Agibot-2025 reconstruction PSNR 31.67；在 IRASim-L action-conditioned generation 中，同样 0.39% latent 下取得最优或接近最优 reconstruction / generation 指标。消融显示去掉 mask 或 OT motion loss 后 reconstruction 和 manipulation generation 均下降。结论：WAM efficiency 不只来自 DiT 压缩，embodied-specific tokenizer / VAE 本身也是关键方向。\n\n---",
    "figure": {
      "alt": "EmbodiedVAE framework",
      "label": "EmbodiedVAE 架构",
      "paper_title": "EmbodiedVAE: Disentangled Video VAE for Efficient and Controllable Embodied Manipulation",
      "source_url": "https://arxiv.org/html/2608.02990v1/framework.png",
      "url": "https://arxiv.org/html/2608.02990v1/framework.png"
    },
    "id": "arxiv-2608-02990",
    "insight": "EmbodiedVAE 关注更底层的 tokenizer / VAE 问题：WAM 常用 Video VAE 原本面向 natural video，其 latent 未必适合机器人。机器人视频具有明显结构：robot arm 运动丰富、需要 controllability；environment/background 时序冗余大。因此不应对整段视频使用统一 compression rate，而应做 **robot / environment disentanglement + asymmetric compression**。",
    "limitations": "来源报告未单列可核验的局限、失败案例或开放问题；在补充原论文正文核验前，不对该工作的泛化性、因果性、复现性或 SOTA 结论作扩大解释。",
    "links": {
      "paper": "https://arxiv.org/abs/2608.02990",
      "alphaxiv": "https://alphaxiv.org/abs/2608.02990"
    },
    "pipeline": {
      "input": "robot manipulation video；arm mask 仅训练时使用。",
      "process": "- 结构 ：双 Encoder + 单 Decoder。Arm Encoder 使用较弱 temporal compression 以保留 motion；Environment Encoder 使用更强 temporal compression 以压缩静态背景；OT-based motion consistency 约束 arm latent 跨帧 correspondence；Unified Decoder 合并两种 latent 重建完整视频。",
      "output": "更紧凑、可控的 embodied video latent，可供下游 action-conditioned world model 使用。",
      "details": "- **输入**：robot manipulation video；arm mask 仅训练时使用。\n- **结构**：双 Encoder + 单 Decoder。Arm Encoder 使用较弱 temporal compression 以保留 motion；Environment Encoder 使用更强 temporal compression 以压缩静态背景；OT-based motion consistency 约束 arm latent 跨帧 correspondence；Unified Decoder 合并两种 latent 重建完整视频。\n- **输出**：更紧凑、可控的 embodied video latent，可供下游 action-conditioned world model 使用。"
    },
    "publication": "ECCV 2026；arXiv 2026",
    "source_reports": [
      "report-e81e6bd3a1"
    ],
    "summary": "EmbodiedVAE 关注更底层的 tokenizer / VAE 问题：WAM 常用 Video VAE 原本面向 natural video，其 latent 未必适合机器人。机器人视频具有明显结构：robot arm 运动丰富、需要 controllability；environment/background 时序冗余大。因此不应对整段视频使用统一 compression rate，而应做 robot / environment disentanglement + asymmetric compression 。",
    "tags": [
      "3D/4D",
      "World Action Model",
      "机器人学习",
      "自监督与预测表征"
    ],
    "title": "EmbodiedVAE: Disentangled Video VAE for Efficient and Controllable Embodied Manipulation",
    "updated_at": "2026-08-20",
    "year": 2026
  },
  {
    "id": "arxiv-2608-22449",
    "title": "EMPIRE: Explicit Manipulation Planning as a Learnable Intermediate Representation for Egocentric Hand-Motion Forecasting",
    "authors": [
      "Wen Wang",
      "Ruibing Hou",
      "Hong Chang",
      "Shiguang Shan",
      "Xilin Chen"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本（首发 2026-08-23）",
    "arxiv_id": "2608.22449",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.22449",
      "code": "https://github.com/wangwen-banban/EMPIRE",
      "alphaxiv": "https://alphaxiv.org/abs/2608.22449"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "流式与自回归",
      "第一视角与人类视频",
      "长时记忆"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.22449v1/empire_method_teaser_v2.png",
      "alt": "EMPIRE: Explicit Manipulation Planning as a Learnable Intermediate Representation for Egocentric Hand-Motion Forecasting 代表图",
      "label": "Figure 1: EMPIRE at a glance. Stage I learns to plan; Stage II learns to act with the planner frozen. 来源：论文图",
      "paper_title": "EMPIRE: Explicit Manipulation Planning as a Learnable Intermediate Representation for Egocentric Hand-Motion Forecasting",
      "source_url": "https://arxiv.org/html/2608.22449v1/empire_method_teaser_v2.png"
    },
    "summary": "egocentric 双手手部动作预测长期被当作\"观测→未来动作\"的端到端映射，VLM 方法往往忽略驱动手-物交互的底层操作过程，且端到端优化会让动作生成梯度干扰已学到的操作感知表示。EMPIRE 的 Insight： 把\"显式操作规划\"作为可学习中间表示，两阶段解耦 ——先学\"规划\"（从多模态上下文捕捉手-物交互进程），再学\"动作\"（冻结规划表示，条件生成未来双手动作），阻断规划与运动之间的梯度串扰。",
    "insight": "egocentric 双手手部动作预测长期被当作\"观测→未来动作\"的端到端映射，VLM 方法往往忽略驱动手-物交互的底层操作过程，且端到端优化会让动作生成梯度干扰已学到的操作感知表示。EMPIRE 的 Insight：**把\"显式操作规划\"作为可学习中间表示，两阶段解耦**——先学\"规划\"（从多模态上下文捕捉手-物交互进程），再学\"动作\"（冻结规划表示，条件生成未来双手动作），阻断规划与运动之间的梯度串扰。",
    "pipeline": {
      "input": "egocentric 观测（视频/帧）+ 多模态上下文。",
      "process": "Stage I Learn to Plan（显式操作计划学习）→ Stage II Learn to Act（冻结规划器表示，DiT 生成动作）；部署时 Plan-then-Act；用骨架-到-MANO 转换构建 651K 数据，含图文标注与操作计划标注及人工审计。",
      "output": "未来双手（bimanual）手部动作/MANO 运动。",
      "details": "**输入**：egocentric 观测（视频/帧）+ 多模态上下文。\n**过程**：Stage I Learn to Plan（显式操作计划学习）→ Stage II Learn to Act（冻结规划器表示，DiT 生成动作）；部署时 Plan-then-Act；用骨架-到-MANO 转换构建 651K 数据，含图文标注与操作计划标注及人工审计。\n**输出**：未来双手（bimanual）手部动作/MANO 运动。"
    },
    "experiments": "评估了预测精度、训练/推理效率，并回答\"何时操作规划有帮助\"；消融覆盖模型组件、阻止运动梯度更新 VLM、DiT 容量。证据等级：论文实验直接支持\"显式规划中间表示 + 梯度隔离\"的有效性；具体数值未逐项复核。",
    "evidence_notes": "",
    "code_data_status": "代码已在 [GitHub](https://github.com/wangwen-banban/EMPIRE) 公开；EMPIRE-651K 数据构成（骨架转 MANO、时间窗、图文+操作计划标注、人工审计）随论文描述。",
    "limitations": "- 依赖 egocentric 观测质量与骨架-到-MANO 转换精度；\n- 规划表示的手工角色/阶段设定可能限制开放世界泛化；\n- 双手交互的长视界预测与罕见操作模式的覆盖待验证。\n\n### 与知域的关系\n与知域 Egocentric 关注方向高度契合，与 HandsOnWorld、EgoGrasp、MEgoHand 形成\"生成/估计/预测\"互补；其\"操作计划作为中间表示\"思想可迁移到 egocentric 世界模型的动作抽象层。",
    "comments": "",
    "source_reports": [
      "report-a141624b1e"
    ],
    "deleted": false,
    "updated_at": "2026-08-31",
    "arxiv": {
      "published": "2026-08-23T14:58:31Z",
      "revised_at": "2026-08-23T14:58:31Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2609-01596",
    "title": "Facet-0: A Robotic Foundation Model for Contact-Rich Precise Manipulation",
    "authors": [
      "Haoyuan Deng",
      "Haichao Liu",
      "Wenkai Guo",
      "Yuan Ling",
      "Zaijia Yang",
      "Yuanjiang Xue",
      "Haosheng Sun",
      "Liangzi Wang",
      "Ziwei Wang"
    ],
    "year": 2026,
    "publication": "2026，arXiv",
    "arxiv_id": "2609.01596",
    "doi": "10.48550/arXiv.2609.01596",
    "links": {
      "paper": "https://arxiv.org/abs/2609.01596",
      "project": "https://pine-lab-ntu.github.io/facet-0/",
      "alphaxiv": "https://alphaxiv.org/abs/2609.01596"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "机器人学习",
      "流式与自回归",
      "物理建模与仿真",
      "第一视角与人类视频",
      "跨本体迁移"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2609.01596v1/Teaser1.png",
      "alt": "Facet-0 接触丰富操作任务概览",
      "label": "Facet-0 接触丰富操作任务概览；来源：论文原图",
      "paper_title": "Facet-0: A Robotic Foundation Model for Contact-Rich Precise Manipulation",
      "source_url": "https://arxiv.org/html/2609.01596v1/Teaser1.png"
    },
    "summary": "Facet-0 将动作与未来腕部力矩轨迹联合建模。模型通过 action-wrench proposal 预测动作及其可能诱导的接触后果，并使用 Action-Wrench Critic 区分任务进度相似但接触结果不同的动作。",
    "insight": "Facet-0 将动作与未来腕部力矩轨迹联合建模。模型通过 action-wrench proposal 预测动作及其可能诱导的接触后果，并使用 Action-Wrench Critic 区分任务进度相似但接触结果不同的动作。\n\n摘要声称 ManuFacet-1K 包含约 1000 小时力同步数据，覆盖 3 种本体和多个制造单元。",
    "pipeline": {
      "input": "视觉语言语义、运动学状态、历史力矩、可执行动作。",
      "process": "流匹配生成动作块和未来腕部力矩；使用分布式 Action-Wrench Critic、阶段奖励和接触选择性 credit 进行策略改进。",
      "output": "精密操作动作和接触后果预测。",
      "details": "**输入**：视觉语言语义、运动学状态、历史力矩、可执行动作。\n\n**过程**：流匹配生成动作块和未来腕部力矩；使用分布式 Action-Wrench Critic、阶段奖励和接触选择性 credit 进行策略改进。\n\n**输出**：精密操作动作和接触后果预测。"
    },
    "experiments": "摘要报告在 5 个亚毫米级计算机装配任务上达到 82% 平均成功率，强 baseline 为 15%。需要全文核验：\n\n- 任务是否与训练数据存在相同工位或部件；\n- 82% 是否为单次部署或多次重复均值；\n- 力传感器在测试时是否可用；\n- 与传统视觉策略、力控策略和 VLA 的公平比较。",
    "evidence_notes": "",
    "code_data_status": "项目页已确认。ManuFacet-1K、模型权重和代码的开放范围待人工核验。",
    "limitations": "- 力矩预测质量不等于接触控制质量。\n- 工业装配数据可能具有较窄的任务和工位分布。\n- 亚毫米级成功率对标定、夹具和部件容差非常敏感。\n\n### 与知域的关系\n\nFacet-0 将知域关注的 HOI、动作后果预测和物理世界模型推进到接触力层面，可作为视觉世界模型之外的多模态接触建模参考。",
    "comments": "",
    "source_reports": [
      "report-0d81d19c6c"
    ],
    "deleted": false,
    "updated_at": "2026-09-08",
    "arxiv": {
      "published": "2026-09-01T17:58:07Z",
      "revised_at": "2026-09-01T17:58:07Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2608-10232",
    "title": "FACT: Failure-Aware Causal Training for World-Action Models",
    "authors": [
      "Quanquan Peng",
      "Yutong Liang",
      "Rui Yan",
      "Nicklas Hansen",
      "Xiaolong Wang"
    ],
    "year": 2026,
    "publication": "2026，arXiv preprint（v1，cs.RO，2026-08-10）。尚无 DOI / 正式出版页。arXiv 论文许可为 CC BY-NC-ND 4.0；代码仓库声明 Apache-2.0。",
    "arxiv_id": "2608.10232",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.10232",
      "project": "https://fact-wam.github.io/",
      "code": "https://github.com/Bariona/FACT",
      "model": "https://huggingface.co/Bariona/fact-wam",
      "alphaxiv": "https://alphaxiv.org/abs/2608.10232"
    },
    "tags": [
      "VLA",
      "World Action Model",
      "因果与反事实",
      "机器人学习",
      "自监督与预测表征"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.10232v1/x2.png",
      "alt": "FACT Fig. 2: action-then-imagine causal diffusion transformer",
      "label": "FACT，Fig. 2，共享因果扩散 Transformer：动作、value 与未来视频同骨干，value/未来视频只看干净动作槽 G。来源：Fig. 2 原图 PNG",
      "paper_title": "FACT: Failure-Aware Causal Training for World-Action Models",
      "source_url": "https://arxiv.org/html/2608.10232v1/x2.png"
    },
    "summary": "FACT 的核心判断是： 动作必须先于想象；世界分支必须回答“这个动作会怎样”，而不是替动作提供一个成功偏向的未来。 因此 token 顺序被写成 prefix P → 噪声动作 A → 干净 GT 动作 G → value V → 未来视频 I。动作分支看不到 G，而 value 与视频只条件在干净动作上。",
    "insight": "核心 Insight：**先生成动作，再在干净已执行动作上预测未来视频与任务进度；失败 rollout 只监督观察到的失败未来和被压低的进度，不进入动作模仿损失。**\n\n方法选择因此改变了三个接口：\n\n1. **顺序接口：** token 序为 prefix \\(P\\) → 噪声动作 \\(A\\) → 干净 GT 动作 \\(G\\) → value \\(V\\) → 未来视频 \\(I\\)；世界分支只看 \\(G\\)，\\(A\\) 看不到 \\(G\\)。\n2. **训练信号：** 成功演示监督 \\(\\mathcal{L}_a+\\mathcal{L}_v+\\mathcal{L}_I\\)；失败窗口把 \\(\\mathcal{L}_a\\) mask 掉。\n3. **推理接口：** Stage 1 只解动作即可部署；可选 Stage 2 用 value 对 \\(N\\) 个候选打分。部署不必生成视频。\n\n与本知识库课题 **直接相关**：它明确站在 WAM 谱系上，对照 video-first / future-as-condition 设计，并在 RoboTwin 与真机双臂上同时测策略成功率和失败条件下的未来幻觉。它建模的是动作条件后果，**不是**结构因果。可与已入库的 FlowWAM、LingBot-VA、Causal World Modeling for Robot Control 对照阅读。",
    "pipeline": {
      "input": "语言指令 ℓ；多视角 RGB（主视 + 左右腕）与本体感觉 s t 打包成 prefix；训练时还有动作块 a t:t+H（H=48）、未来视频窗口（当前帧加四个偏移 [0,H/4,H/2,3H/4,H]）以及归一化进度目标。",
      "process": "从 WAN2.2-5B / Wan2.2-TI2V-5B 初始化共享视频 DiT；每个 block 的 FFN 后接轻量 action adapter。三模态共用 flow-matching 去噪损失，w a=20，w v=w I=1。进度目标在成功轨迹上为 p t+H=t/T（均匀进度奖励）；失败轨迹再减去 lambda fail=1 的失败指示并 clip 到 [0,1]。失败数据来自先在成功数据上训练的策略 rollout，并标注失败 onset。推理默认 20 步 flow-Euler；动作-only 路径缓存 prefix KV。可选 N 候选并行 Stage 1，再 Stage 2 取 argmax k V theta(o t,ℓ,a^(k))。",
      "output": "默认可执行动作块；需要时再输出动作条件进度值与未来视频。主策略评估走动作-only，不在测试时生成视频。",
      "details": "- **输入：** 语言指令 \\(\\ell\\)；多视角 RGB（主视 + 左右腕）与本体感觉 \\(s_t\\) 打包成 prefix；训练时还有动作块 \\(a_{t:t+H}\\)（\\(H=48\\)）、未来视频窗口（当前帧加四个偏移 \\([0,H/4,H/2,3H/4,H]\\)）以及归一化进度目标。\n- **过程：** 从 WAN2.2-5B / Wan2.2-TI2V-5B 初始化共享视频 DiT；每个 block 的 FFN 后接轻量 action adapter。三模态共用 flow-matching 去噪损失，\\(w_a=20\\)，\\(w_v=w_I=1\\)。进度目标在成功轨迹上为 \\(p_{t+H}=t/T\\)（均匀进度奖励）；失败轨迹再减去 \\(\\lambda_{\\mathrm{fail}}=1\\) 的失败指示并 clip 到 \\([0,1]\\)。失败数据来自先在成功数据上训练的策略 rollout，并标注失败 onset。推理默认 20 步 flow-Euler；动作-only 路径缓存 prefix KV。可选 \\(N\\) 候选并行 Stage 1，再 Stage 2 取 \\(\\arg\\max_k V_\\theta(o_t,\\ell,a^{(k)})\\)。\n- **输出：** 默认可执行动作块；需要时再输出动作条件进度值与未来视频。主策略评估走动作-only，不在测试时生成视频。\n\n与最近 baseline 的实质差异：相对 Motus / video-first WAM，FACT 先出动作、部署可跳过视频；相对把未来当动作条件的 WAM，未来与 value 条件在干净动作而非噪声动作上；相对直接把失败当 BC 数据，失败只进世界分支。作者强调共享骨干让未来/value 损失能回到动作通路，而不是 MoT 里隔离的 world expert。"
    },
    "experiments": "**作者主张：** 失败感知的动作条件后果学习提高策略成功、降低坏动作下的成功偏向幻觉，并且 value 头可选用作候选排序。\n\n实验实际支持（数字均来自原文表格/正文）：\n\n- **RoboTwin 2.0（50 任务；Clean 每任务 50 条、Randomized 每任务 500 条合训；每任务 100 trial；另加约 1.3K rollout 失败）：** 无视频共训 81.8% 平均成功 → 视频共训 85.6%（Clean 86.3 / Rand. 84.9）→ 再加失败 87.5%（88.4 / 86.6）。Motus 87.8%，Gigaworld-Policy 86.0%，\\(\\pi_{0.5}\\) 79.8%。附录按任务表上 Hanging Mug 即便加失败仍只有 36/49；Turn Switch 加失败后 Clean 从 66 降到 61。这些数字与同日入库的 FlowWAM / G0.5 **不是同一套训练脚本**，不宜直接排成 SOTA 竞赛。\n- **延迟（RTX PRO 6000）：** 动作-only FACT w/ failure **380 ms**，Motus 1220 ms（作者称约 \\(3\\times\\) 更快），\\(\\pi_{0.5}\\) 47 ms。速度优势相对 video-first WAM，不是相对纯 VLA。\n- **真机（双 YAM 臂，主视 D435 + 两腕 D405；seen 五任务，cube 类 200 条专家演示、其余 50 条，cube 任务约 30 条失败；每格 20 trial）：** seen 平均 Cosmos 25、\\(\\pi_0\\) 48、Motus 64、FACT 82、FACT+failure 89、再加 \\(N=4\\) scoring 92；\\(\\pi_{0.5}\\) 88。unseen（改颜色/形状/指令）FACT 67 → +failure 77 → +scoring 82；\\(\\pi_{0.5}\\) 85。作者写明 \\(\\pi_{0.5}\\) 有大规模机器人预训练而 FACT 没有。所有表内 baseline 都在同一批成功演示上 fine-tune。\n- **消融（真机 seen）：** 去掉因果 mask（无失败、且去掉干净 \\(G\\) 槽）77%；失败动作仍算模仿损失 **63%**；去掉视频共训 58%；**只用 scoring、不训失败** 79%（低于无 scoring 的 82%）。这支持“value 头必须先见过失败后果才有用”，不是“多采样总能涨点”。\n- **幻觉诊断（512 个 held-out 窗口，成功/失败各半，20 步去噪）：** 失败窗口 PSNR 19.51→25.92，SSIM 0.7461→0.8290；成功窗口几乎不变（PSNR 26.12 vs 26.08）。Fig. 5 定性显示同一坏动作下，成功-only 模型仍想象抓住，失败共训预测真实失败。\n- **失败比例：** 三个 RoboTwin clean 任务上 \\(p\\in\\{0,50,100\\}\\%\\) 失败混合，平均成功 32.7%→57.3%；\\(p=100\\%\\) 时失败约占训练集 45%。这是子集探针，不是 50 任务主表。\n- **\\(N\\) sweep：** 长时程抓取上 \\(N=1\\to 4\\) 完成度明显上升，更大 \\(N\\) 的增益相对延迟变小；真机 optional scoring 取 \\(N=4\\)。\n\n**证据未支持：** 结构因果或 \\(do(\\cdot)\\) 识别；失败数据在所有任务上都单调有益（Turn Switch 反例）；FACT 在无预训练条件下击败 \\(\\pi_{0.5}\\) 的真机 unseen；value 头是独立 critic。",
    "evidence_notes": "",
    "code_data_status": "- **代码：** [Bariona/FACT](https://github.com/Bariona/FACT) 含 RoboTwin 数据准备、训练、推理与闭环评估；Apache-2.0。\n- **权重：** Hugging Face `Bariona/fact-wam` 为 RoboTwin checkpoint（从 Wan2.2-TI2V-5B fine-tune），含 `norm_stats_delta.json`；另有 Spaces 演示。\n- **数据：** 仓库脚本下载 `Bariona/robotwin-v2`；真机失败 rollout 与完整专家语料未作为可复现公开包核验。WAN 骨干与 T5 指令嵌入是外部依赖。\n- **许可冲突需分开写：** 代码 Apache-2.0，arXiv 论文页为 CC BY-NC-ND 4.0。",
    "limitations": "- Hanging Mug、Turn Switch 等任务上失败共训增益很小或为负；失败数据不是万灵药。\n- 进度目标用均匀 \\(t/T\\)，失败再减常数，不是学习到的稠密成功检测器。\n- Best-of-\\(N\\) 用额外 Stage 2 换可靠性；主文策略数字多数仍是单样本。\n- 真机每格 20 trial；unseen 仍低于有大规模预训练的 \\(\\pi_{0.5}\\)。\n- “causal”是动作→未来的时间箭头与注意力掩码，没有因果图、干预识别或反事实 benchmark。\n- 作者自己把在线 rollout、DAgger 式修正、以及用更好进度估计器替换 value 头列为未来工作。\n\n---",
    "comments": "",
    "source_reports": [
      "report-af906c7fa2"
    ],
    "deleted": false,
    "updated_at": "2026-08-21",
    "challenges": "领域长期问题是：WAM 想用未来预测给动作生成提供物理先验，但训练数据几乎全是成功演示。本文针对的缺口是**失败后果无法进入世界分支，而不只是“再加一个视频头”**。\n\n- **作者明确指出的失败模式：** 一类 WAM（DreamZero 等）先想象未来视频再用 IDM 解码动作，控制必须等视频去完噪。另一类（BagelVLA、Fast-WAM、Gigaworld-Policy 等）把预测帧/latent 当作动作条件，未来目标仍是专家成功轨迹。测试时坏动作仍可配上成功偏向的未来。\n- **数据接口缺口：** 失败 rollout 若当模仿目标会污染策略；若直接丢掉，世界模型就没有理由预测坏动作的后果。关键不是“再收集更多成功数据”，而是**失败轨迹能监督后果、不能变成坏示范**。\n- **评测缺口：** 既有 WAM 很少把 success-biased future hallucination 当作可量化诊断；value 头若只在专家流形上校准，会对差动作给出过于乐观的进度分。\n\n这些是训练信号与因果顺序缺口。作者所说的 causal 是 **action-then-imagine 的时间顺序与 teacher-forced 动作条件**，不是 SCM、\\(do(\\cdot)\\) 或反事实识别。",
    "motivation": "核心 Insight：**先生成动作，再在干净已执行动作上预测未来视频与任务进度；失败 rollout 只监督观察到的失败未来和被压低的进度，不进入动作模仿损失。**\n\n方法选择因此改变了三个接口：\n\n1. **顺序接口：** token 序为 prefix \\(P\\) → 噪声动作 \\(A\\) → 干净 GT 动作 \\(G\\) → value \\(V\\) → 未来视频 \\(I\\)；世界分支只看 \\(G\\)，\\(A\\) 看不到 \\(G\\)。\n2. **训练信号：** 成功演示监督 \\(\\mathcal{L}_a+\\mathcal{L}_v+\\mathcal{L}_I\\)；失败窗口把 \\(\\mathcal{L}_a\\) mask 掉。\n3. **推理接口：** Stage 1 只解动作即可部署；可选 Stage 2 用 value 对 \\(N\\) 个候选打分。部署不必生成视频。\n\n与本知识库课题 **直接相关**：它明确站在 WAM 谱系上，对照 video-first / future-as-condition 设计，并在 RoboTwin 与真机双臂上同时测策略成功率和失败条件下的未来幻觉。它建模的是动作条件后果，**不是**结构因果。可与已入库的 FlowWAM、LingBot-VA、Causal World Modeling for Robot Control 对照阅读。",
    "technical_approach": "- **输入：** 语言指令 \\(\\ell\\)；多视角 RGB（主视 + 左右腕）与本体感觉 \\(s_t\\) 打包成 prefix；训练时还有动作块 \\(a_{t:t+H}\\)（\\(H=48\\)）、未来视频窗口（当前帧加四个偏移 \\([0,H/4,H/2,3H/4,H]\\)）以及归一化进度目标。\n- **过程：** 从 WAN2.2-5B / Wan2.2-TI2V-5B 初始化共享视频 DiT；每个 block 的 FFN 后接轻量 action adapter。三模态共用 flow-matching 去噪损失，\\(w_a=20\\)，\\(w_v=w_I=1\\)。进度目标在成功轨迹上为 \\(p_{t+H}=t/T\\)（均匀进度奖励）；失败轨迹再减去 \\(\\lambda_{\\mathrm{fail}}=1\\) 的失败指示并 clip 到 \\([0,1]\\)。失败数据来自先在成功数据上训练的策略 rollout，并标注失败 onset。推理默认 20 步 flow-Euler；动作-only 路径缓存 prefix KV。可选 \\(N\\) 候选并行 Stage 1，再 Stage 2 取 \\(\\arg\\max_k V_\\theta(o_t,\\ell,a^{(k)})\\)。\n- **输出：** 默认可执行动作块；需要时再输出动作条件进度值与未来视频。主策略评估走动作-only，不在测试时生成视频。\n\n与最近 baseline 的实质差异：相对 Motus / video-first WAM，FACT 先出动作、部署可跳过视频；相对把未来当动作条件的 WAM，未来与 value 条件在干净动作而非噪声动作上；相对直接把失败当 BC 数据，失败只进世界分支。作者强调共享骨干让未来/value 损失能回到动作通路，而不是 MoT 里隔离的 world expert。",
    "discussion": "FACT 把 WAM 的一个具体接口写清楚了：未来预测应当条件在**已执行动作**上，失败才是后果监督而不是坏 BC。RoboTwin 上它接近 Motus 且部署更快；真机 seen 上失败共训和可选 scoring 的增益与“失败当模仿目标会掉点”的消融方向一致；PSNR/SSIM 支持成功偏向幻觉被减轻。适用边界是短中程操作式 WAM，不是形式因果、也不是互联网级无动作预训练。阅读判断：若课题关心 WAM 如何用负样本，这篇比再堆一个 RGB 头更直接；引用时不要把 teacher-forced 动作条件写成因果识别，也不要把 380 ms vs Motus 1220 ms 写成已经赶上 \\(\\pi_{0.5}\\) 的 47 ms。",
    "arxiv": {
      "published": "2026-08-10T21:10:46Z",
      "revised_at": "2026-08-10T21:10:46Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2609-20817",
    "title": "FAMOS: Feed-Forward 3D Articulation Modeling from Sparse Observations",
    "authors": [
      "Kevin Qu",
      "Tao Sun",
      "Massimiliano Viola",
      "Liyuan Zhu",
      "Zhizhuo Zhou",
      "Sayan Deb Sarkar",
      "Konrad Schindler",
      "Iro Armeni"
    ],
    "year": 2026,
    "publication": "2026，arXiv",
    "arxiv_id": "2609.20817",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2609.20817",
      "project": "https://kevinqu7.github.io/famos/",
      "alphaxiv": "https://alphaxiv.org/abs/2609.20817"
    },
    "tags": [
      "3D/4D",
      "Agent与可执行世界"
    ],
    "figure": {
      "url": "content/images/2609.20817-main.webp",
      "alt": "Figure 2：跨状态部件查询联合预测分割、关节类型、轴线和已观测运动跨度",
      "label": "Figure 2 · 跨状态部件查询联合预测分割、关节类型、轴线和已观测运动跨度",
      "paper_title": "FAMOS: Feed-Forward 3D Articulation Modeling from Sparse Observations",
      "source_url": "https://arxiv.org/html/2609.20817v1/method.png"
    },
    "summary": "FAMOS从稀疏、无序、多状态 partial point clouds中直接预测 movable-part segmentation和joint parameters，而不是只从单一静态形状猜 articulation prior。",
    "insight": "FAMOS从稀疏、无序、多状态 partial point clouds中直接预测 movable-part segmentation和joint parameters，而不是只从单一静态形状猜 articulation prior。",
    "pipeline": {
      "input": "一到多个 sparse monocular observations，经几何模型提升到 partial point clouds。",
      "process": "Multi-state Articulation Transformer交替进行state-wise和global attention；observed articulation span objective迫使模型利用跨状态motion evidence。",
      "output": "movable parts、joint type、axis/origin和observed motion range。",
      "details": "**过程**：Multi-state Articulation Transformer交替进行state-wise和global attention；observed articulation span objective迫使模型利用跨状态motion evidence。\n\n**输入**：一到多个 sparse monocular observations，经几何模型提升到 partial point clouds。\n\n**输出**：movable parts、joint type、axis/origin和observed motion range。\n\nMulti-State Articulation Transformer 将局部状态内结构和跨状态关系交替融合；监督除了部件与关节参数，也约束已观察到的运动跨度。这个 observed range 来自实际输入状态，不应被解释为已经恢复物体所有机械极限。\n\n[原文方法](https://arxiv.org/html/2609.20817)\n\n### 方法细节与实现\n\n**多状态而非单状态识别。**输入是同一物体在若干开合状态下的局部点云。冻结的 PartField 提供局部形状语义，坐标和法向的位置编码提供几何线索。Transformer 交替进行单状态内部注意力和跨状态全局交互，没有绑定固定状态序号的 embedding，因此可以处理数量变化、顺序不固定的观测集合。\n\n**部件槽位与输出。**可学习的部件查询不是预设“抽屉/门”等类别，而是待匹配的实例槽位；每个槽预测部件分割、关节类型、轴线、原点及观测到的运动跨度。训练时用跨所有状态共享的匹配分配槽位，避免某个部件在不同状态被不同槽位接管。\n\n**运动跨度不是关节极限。**对至少在两个状态可见的部件，跨度定义为观测到的最大与最小关节状态之差；转动用弧度，平移按物体尺度归一化。这刻意把任务限定为观测证据支持的运动幅度，避免仅凭静态物体类别猜测整个可动范围。未展示的极限位置和接触约束不由这项预测直接给出。\n\n[对应方法原文](https://arxiv.org/html/2609.20817#S3)"
    },
    "experiments": "在PartNet-Mobility、ACD、ArtiCraft-10K上比较 feed-forward与optimization baselines；ACD上相对 strongest feed-forward baseline的movable-part segmentation提升28.2 F1点，项目页报告motion MAO F1提升27.8点和约0.1 s inference。\n\n\n表 1 的 ACD 部件分割 F1：FAMOS 71.9%，Particulate 43.7%，差 28.2 个百分点。表 2 的 ACD +MAO F1：64.5% 对 36.7%，差 27.8 点。MAO 逐层加入运动类型、轴与原点条件，比分割分数更接近完整关节建模。单视图测试也有收益，但不能用多状态结果替代单视图证据。\n\n[原文实验与表格](https://arxiv.org/html/2609.20817)\n\n**主要收益与适用边界。**ACD 和 MAO 的分割指标分别为 71.9 对 43.7、64.5 对 36.7，但分割提高并不自动等于关节轴精度提高，应结合各关节指标看。模型仍需要多状态点云及可靠的同物体关联；普通单帧 RGB 中完全不可见的运动机制，不能由该协议证明可恢复。\n\n[实验与设置原文](https://arxiv.org/html/2609.20817)",
    "evidence_notes": "已核验原文方法与实验；关键比较与限制见各节",
    "code_data_status": "代码尚未正式公开。",
    "limitations": "它预测的是 articulation model而不是完整dynamic world rollout；真实 casual capture结果目前更偏generalization demo。",
    "comments": "",
    "source_reports": [],
    "deleted": false,
    "updated_at": "2026-09-24",
    "challenges": "静态外形无法唯一决定哪里能动、关节轴在哪里；多次观察又稀疏、无序且不完整。逐实例优化虽然可利用运动证据，却往往慢且依赖初始化。",
    "motivation": "FAMOS从稀疏、无序、多状态 partial point clouds中直接预测 movable-part segmentation和joint parameters，而不是只从单一静态形状猜 articulation prior。",
    "technical_approach": "**过程**：Multi-state Articulation Transformer交替进行state-wise和global attention；observed articulation span objective迫使模型利用跨状态motion evidence。\n\n**输入**：一到多个 sparse monocular observations，经几何模型提升到 partial point clouds。\n\n**输出**：movable parts、joint type、axis/origin和observed motion range。\n\nMulti-State Articulation Transformer 将局部状态内结构和跨状态关系交替融合；监督除了部件与关节参数，也约束已观察到的运动跨度。这个 observed range 来自实际输入状态，不应被解释为已经恢复物体所有机械极限。\n\n[原文方法](https://arxiv.org/html/2609.20817)\n\n### 方法细节与实现\n\n**多状态而非单状态识别。**输入是同一物体在若干开合状态下的局部点云。冻结的 PartField 提供局部形状语义，坐标和法向的位置编码提供几何线索。Transformer 交替进行单状态内部注意力和跨状态全局交互，没有绑定固定状态序号的 embedding，因此可以处理数量变化、顺序不固定的观测集合。\n\n**部件槽位与输出。**可学习的部件查询不是预设“抽屉/门”等类别，而是待匹配的实例槽位；每个槽预测部件分割、关节类型、轴线、原点及观测到的运动跨度。训练时用跨所有状态共享的匹配分配槽位，避免某个部件在不同状态被不同槽位接管。\n\n**运动跨度不是关节极限。**对至少在两个状态可见的部件，跨度定义为观测到的最大与最小关节状态之差；转动用弧度，平移按物体尺度归一化。这刻意把任务限定为观测证据支持的运动幅度，避免仅凭静态物体类别猜测整个可动范围。未展示的极限位置和接触约束不由这项预测直接给出。\n\n[对应方法原文](https://arxiv.org/html/2609.20817#S3)",
    "discussion": "**阅读者分析**：对object-centric HOI world model意义直接：如果要预测“手推动抽屉/门之后世界如何变化”，movable-part identity与joint geometry是比纯point map更具可执行性的状态。",
    "arxiv": {
      "published": "2026-09-17",
      "revised_at": "",
      "primary_category": "cs.CV"
    },
    "source_papers": [
      "content/papers/2609.20817.md"
    ]
  },
  {
    "id": "arxiv-2609-11445",
    "title": "FARM: Reading Failure Signals from the Internal Predictive States of a Frozen Robotic World Model",
    "authors": [
      "Haoran Pei",
      "Mingrui Luo",
      "Senbao Wang",
      "Haoran Lv",
      "Jie Guo",
      "Sheng Zhong",
      "Ruixi Ci"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本，v1",
    "arxiv_id": "2609.11445",
    "doi": "10.48550/arXiv.2609.11445",
    "links": {
      "paper": "https://arxiv.org/abs/2609.11445",
      "code": "https://github.com/HaoranPei-casia/FARM",
      "alphaxiv": "https://alphaxiv.org/abs/2609.11445"
    },
    "tags": [
      "数据与评测",
      "自监督与预测表征",
      "长时记忆"
    ],
    "figure": {
      "url": "content/images/2609.11445-representative.webp",
      "alt": "Fig. 1",
      "label": "Fig. 1",
      "paper_title": "FARM: Reading Failure Signals from the Internal Predictive States of a Frozen Robotic World Model",
      "source_url": "https://arxiv.org/html/2609.11445v1#S3.F1"
    },
    "summary": "FARM不重新训练世界模型，只在冻结 VLA-JEPA 的内部预测状态上训练一个 33,985 参数读出头，输出逐步失败概率并沿仅包含过去的轨迹聚合风险。研究问题是预测 latent 是否已编码部署失败，而非再构造一个专用生成模型。",
    "insight": "FARM不重新训练世界模型，只在冻结 VLA-JEPA 的内部预测状态上训练一个 33,985 参数读出头，输出逐步失败概率并沿仅包含过去的轨迹聚合风险。研究问题是预测 latent 是否已编码部署失败，而非再构造一个专用生成模型。",
    "pipeline": {
      "input": "当前及历史观测、语言、动作条件下的冻结世界模型内部状态。",
      "process": "压缩预测 token 为 32 维失败表示；监督小型读出器；使用时间因果的前缀聚合得到轨迹风险。",
      "output": "逐步失败分数和在线轨迹风险。",
      "details": "**输入**：当前及历史观测、语言、动作条件下的冻结世界模型内部状态。\n\n**过程**：压缩预测 token 为 32 维失败表示；监督小型读出器；使用时间因果的前缀聚合得到轨迹风险。\n\n**输出**：逐步失败分数和在线轨迹风险。"
    },
    "experiments": "正文表 II 的 350 条轨迹、五折 OOF 检验得到 pooled AUROC/AUPRC 85.68/88.59。表 III 的匹配 10-task 评测中，FARM 在 Seen pooled 为 83.70/83.19，在 Strict-Unseen 为 65.67/69.38；Strict-Unseen 下 STAC-Single 达到 68.28/74.62，说明源任务优势未全部迁移。训练型方法平均 3 个种子，Adapt-35 每任务每外折使用 35 条目标标注轨迹。0.2256 ms 是已有世界模型状态之后的监控器增量延迟，不含世界模型预测总成本。 [正文实验与表格](https://arxiv.org/html/2609.11445v1)。",
    "evidence_notes": "2026-09-14 已核对 arXiv 元数据、正文主要实验与对照；未运行复现实验。",
    "code_data_status": "仓库含 src、configs、data_indices、examples 和 tests；数据使用条件见 DATA.md。 以上状态核验于 2026-09-14；入口和目录存在不等于已经运行复现实验。",
    "limitations": "监督读出会继承训练任务的失败定义和类不平衡；对新硬件的固定读出迁移有限。风险可预测性可能来自视觉异常相关线索，而非动力学因果结构。",
    "comments": "",
    "source_reports": [
      "report-37b94c4145"
    ],
    "deleted": false,
    "updated_at": "2026-09-14",
    "discussion": "FARM为 WAM/VLA-JEPA 增加部署可靠性维度，可与 Causal-JEPA 类表示研究结合，但应明确其属于时间因果掩码和风险预测，不是因果识别。",
    "arxiv": {
      "published": "2026-09-10T12:14:37Z",
      "revised_at": "2026-09-10T12:14:37Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2609-13733",
    "title": "FFVO: A Feedforward Pose Decoder for Long-Horizon Visual Odometry",
    "authors": [
      "Meng-Li Shih",
      "Shih-Yang Su",
      "Yuliang Zou",
      "Hao Xiang",
      "Haidong Zhu",
      "Vincent Casser",
      "Brian Curless",
      "Dmitry Kalenichenko",
      "Mingxing Tan",
      "Dragomir Anguelov"
    ],
    "year": 2026,
    "publication": "2026，arXiv v1，2026-09-12 提交",
    "arxiv_id": "2609.13733",
    "doi": "10.48550/arXiv.2609.13733",
    "links": {
      "paper": "https://arxiv.org/abs/2609.13733",
      "alphaxiv": "https://alphaxiv.org/abs/2609.13733"
    },
    "tags": [
      "3D/4D",
      "长时记忆"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2609.13733v1/images/method_overview.png",
      "alt": "FFVO Fig. 3",
      "label": "FFVO，Fig. 3，冻结 π³ 骨干与可训练 camera-token / local-to-global pose decoder。来源：Fig. 3 原图 PNG",
      "paper_title": "FFVO: A Feedforward Pose Decoder for Long-Horizon Visual Odometry",
      "source_url": "https://arxiv.org/html/2609.13733v1/images/method_overview.png"
    },
    "summary": "FFVO将 feedforward joint reconstruction backbone 专门改造成长时程 camera-pose decoder。它使用紧凑 camera tokens 避免对长视频中全部 image tokens 做昂贵全局聚合，并将时间建模拆为 local motion aggregation 与 global sequence integration。",
    "insight": "FFVO将 feedforward joint reconstruction backbone 专门改造成长时程 camera-pose decoder。它使用紧凑 camera tokens 避免对长视频中全部 image tokens 做昂贵全局聚合，并将时间建模拆为 local motion aggregation 与 global sequence integration。",
    "pipeline": {
      "input": "长视频单目图像序列。",
      "process": "feedforward reconstruction backbone提取视觉/几何表示；compact camera token 汇总每帧相机状态；hierarchical local-to-global temporal decoder处理短程运动和长程一致性；中间 trajectory supervision 稳定训练。",
      "output": "完整长序列相机轨迹。",
      "details": "**输入**：长视频单目图像序列。\n\n**过程**：feedforward reconstruction backbone提取视觉/几何表示；compact camera token 汇总每帧相机状态；hierarchical local-to-global temporal decoder处理短程运动和长程一致性；中间 trajectory supervision 稳定训练。\n\n**输出**：完整长序列相机轨迹。"
    },
    "experiments": "在作者消融中，finetuned \\(\\pi^3\\) 的 ATE/RPE-translation/RPE-rotation 约为 15.989 / 8.452 / 0.596；加入 camera token 后为 11.776 / 5.509 / 0.379；再加 auxiliary supervision 为 11.195 / 5.354 / 0.373；使用 local temporal structure 后降至 7.070 / 1.090 / 0.289，增加 token 数后进一步小幅改善至 7.060 / 1.070 / 0.281。",
    "evidence_notes": "全文已核验",
    "code_data_status": "论文使用 WOD、KITTI 与 13,140 个 100-frame proprietary sequences；本次未核验到官方代码或模型权重发布。",
    "limitations": "论文明确讨论高速超过约 55 mph、极端天气和低光环境困难；FFVO-Long仍因显存限制采用 segment-wise post-optimization。Sim(3)-aligned ATE 与连续 RPE 也可能低估尺度不一致和长期漂移；正文没有给出足够完整的 latency/throughput/memory benchmark。",
    "comments": "",
    "source_reports": [
      "report-1b1ffacf7d"
    ],
    "deleted": false,
    "updated_at": "2026-09-16",
    "challenges": "前馈联合重建模型扩展到长视频时，全局聚合全部图像 token 的开销迅速增长，逐帧位姿回归又难同时保持局部运动精度与长程轨迹一致性。",
    "motivation": "FFVO将 feedforward joint reconstruction backbone 专门改造成长时程 camera-pose decoder。它使用紧凑 camera tokens 避免对长视频中全部 image tokens 做昂贵全局聚合，并将时间建模拆为 local motion aggregation 与 global sequence integration。",
    "technical_approach": "**输入**：长视频单目图像序列。\n\n**过程**：feedforward reconstruction backbone提取视觉/几何表示；compact camera token 汇总每帧相机状态；hierarchical local-to-global temporal decoder处理短程运动和长程一致性；中间 trajectory supervision 稳定训练。\n\n**输出**：完整长序列相机轨迹。",
    "discussion": "FFVO不是生成式 world model，但直接属于 Feedforward Reconstruction 基础路线。对 DynamicVGGT/Gen3R 类模型向长视频或 4D 扩展时，它的 hierarchical temporal pose decoder 是值得比较的基础组件。",
    "arxiv": {
      "published": "2026-09-12T05:56:52Z",
      "revised_at": "2026-09-12T05:56:52Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2609-08848",
    "title": "FIRE3D: Feed-forward Interactive 3D Scene Reconstruction Within A Minute",
    "authors": [
      "Hongchi Xia",
      "Tianhang Cheng",
      "Wei-Chiu Ma",
      "Shenlong Wang"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本，v1",
    "arxiv_id": "2609.08848",
    "doi": "10.48550/arXiv.2609.08848",
    "links": {
      "paper": "https://arxiv.org/abs/2609.08848",
      "project": "https://xiahongchi.github.io/Fire3D/",
      "code": "https://github.com/xiahongchi/Fire3D",
      "model": "https://huggingface.co/hongchi/Fire3D",
      "data": "https://huggingface.co/datasets/hongchi/Fire3D",
      "alphaxiv": "https://alphaxiv.org/abs/2609.08848"
    },
    "tags": [
      "3D/4D",
      "Agent与可执行世界",
      "对象与可供性"
    ],
    "figure": {
      "url": "content/images/2609.08848-representative.webp",
      "alt": "Figure 2",
      "label": "Figure 2",
      "paper_title": "FIRE3D: Feed-forward Interactive 3D Scene Reconstruction Within A Minute",
      "source_url": "https://arxiv.org/html/2609.08848v1#S2.F2"
    },
    "summary": "FIRE3D 不只恢复可渲染表面，而是在一分钟内生成可模拟的对象级资产，显式输出每个对象的 6-DoF 位姿、包围盒、网格和纹理，使对象物理分离并可交互。",
    "insight": "FIRE3D 不只恢复可渲染表面，而是在一分钟内生成可模拟的对象级资产，显式输出每个对象的 6-DoF 位姿、包围盒、网格和纹理，使对象物理分离并可交互。",
    "pipeline": {
      "input": "单张 RGB 或普通 RGB 视频。",
      "process": "估计带位姿 RGB-D，再由端到端前馈网络预测组合式对象场景；无测试时优化。",
      "output": "对象位姿、包围盒、完整网格与纹理组成的 simulation-ready 场景。",
      "details": "- **输入**：单张 RGB 或普通 RGB 视频。\n- **过程**：估计带位姿 RGB-D，再由端到端前馈网络预测组合式对象场景；无测试时优化。\n- **输出**：对象位姿、包围盒、完整网格与纹理组成的 simulation-ready 场景。"
    },
    "experiments": "正文表 3 的 iTHOR 真值感知条件下，CD/PSNR 为 1.38/23.85；推断感知条件下降为 6.15/19.04，输入估计误差仍显著影响结果。表 7 明确区分每物体网络推理 0.601 s 与后处理 4.181 s，含几何与纹理的合计为 4.783 s/物体；还需计入获得 posed RGB-D 的成本。因此“一分钟内”必须结合物体数和上游输入范围理解，不能把 0.60 s/物体当成端到端场景耗时。 [正文实验与表格](https://arxiv.org/html/2609.08848v1)。",
    "evidence_notes": "2026-09-14 已核对 arXiv 元数据、正文主要实验与对照；未运行复现实验。",
    "code_data_status": "代码包含 training、eval、data_processing 与模型模块；Hugging Face 模型库已确认权重文件，数据集已确认场景 tar 文件，两者当前均非 gated。 以上状态核验于 2026-09-14；入口和目录存在不等于已经运行复现实验。",
    "limitations": "对象可交互资产仍依赖输入位姿/深度质量、物体数和后处理；几何完整不自动代表质量、摩擦、刚度或接触动力学正确。",
    "comments": "",
    "source_reports": [
      "report-37b94c4145"
    ],
    "deleted": false,
    "updated_at": "2026-09-14",
    "discussion": "补齐 VGGT/Gen3R 类快速几何恢复到“可交互对象资产”的接口，可用于世界模型或 HOI 仿真初始化。",
    "arxiv": {
      "published": "2026-09-08T15:01:49Z",
      "revised_at": "2026-09-08T15:01:49Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2607-13017",
    "title": "FlowWAM: Optical Flow as a Unified Action Representation for World Action Models",
    "authors": [
      "Yixiang Chen",
      "Peiyan Li",
      "Yuan Xu",
      "Qisen Ma",
      "Jiabing Yang",
      "Kai Wang",
      "Jianhua Yang",
      "Dong An",
      "He Guan",
      "Gaoteng Liu",
      "Jianlou Si",
      "Jun Huang",
      "Jing Liu",
      "Nianfeng Liu",
      "Yan Huang",
      "Liang Wang"
    ],
    "year": 2026,
    "publication": "2026，arXiv preprint（v1，cs.RO，2026-07-14）。通讯作者 Yan Huang、Liang Wang。尚无 DOI / 正式出版页。",
    "arxiv_id": "2607.13017",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2607.13017",
      "project": "https://flow-wam.github.io/",
      "code": "https://github.com/YixiangChen515/FlowWAM",
      "model": "https://huggingface.co/YixiangChen/FlowWAM",
      "data": "https://huggingface.co/datasets/YixiangChen/FlowWAM_RoboTwin",
      "alphaxiv": "https://alphaxiv.org/abs/2607.13017"
    },
    "tags": [
      "VLA",
      "World Action Model",
      "世界模型",
      "动作表征",
      "机器人学习",
      "跨本体迁移"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2607.13017v1/method.png",
      "alt": "FlowWAM Fig. 2: dual-stream RGB and optical flow generation",
      "label": "FlowWAM，Fig. 2，dual-stream RGB–flow diffusion overview。来源：Fig. 2 原图 PNG",
      "paper_title": "FlowWAM: Optical Flow as a Unified Action Representation for World Action Models",
      "source_url": "https://arxiv.org/html/2607.13017v1/method.png"
    },
    "summary": "核心 Insight： 把光流编码成与 RGB 同格式的视频，就可以作为 WAM 的统一动作表征——策略模式生成 flow 再解码动作，世界模型模式固定目标 flow 来引导未来 RGB，并且可以从无动作标签的自我中心视频里预训练。",
    "insight": "核心 Insight：**把光流编码成与 RGB 同格式的视频，就可以作为 WAM 的统一动作表征——策略模式生成 flow 再解码动作，世界模型模式固定目标 flow 来引导未来 RGB，并且可以从无动作标签的自我中心视频里预训练。**\n\n这改变的是动作/视频接口，不是再加一个更重的 RGB rollout 头：flow 与 RGB 共享冻结 VAE 和 DiT 主体，只保留轻量 stream-specific patch embedding 与输出头。与本知识库课题 **直接相关**：它明确站在 WAM 动作表征谱系上，对照数值 token、latent action 和静态图像动作，并在 RoboTwin / WorldArena 上同时测策略与世界模型。它建模的是像素位移场，**不是**结构因果或反事实。",
    "pipeline": {
      "input": "参考 RGB (I 0 )、语言指令 ( tau )；策略模式还要本体感觉。RoboTwin 阶段把头/左腕/右腕拼成 (320 times 384 ) 的 T 形拼图。",
      "process": "RAFT 提取光流，HSV 色轮编码 ( phi )（色相=方向，饱和度=幅度， (m ) 为幅度归一化；在该归一化下可逆）。同一冻结 VAE 分别编码 RGB 与 flow latent；各 self-attention 层把两路 token 拼接做联合注意力再拆回，RoPE 分路施加。策略模式：两路后续帧从噪声联合去噪，action expert（约 780M AdaLN DiT，30 层）交叉注意各层 RGB+flow hidden state，用 flow matching 预测 (N ) 步动作块；训练时以 (p=0.5 ) 向 expert 所见 latent 混噪声，以对齐推理时的残差去噪误差。世界模型模式：flow latent 固定为所需轨迹的干净 VAE 编码，只去噪 RGB。 ( mathcal{L} { text{video}}=(1- lambda f) mathcal{L} { text{RGB}}+ lambda f mathcal{L} { text{flow}} )，并对 flow 做 motion-aware 重加权以免背景主导。有动作标签时再加 ( lambda a mathcal{L} { text{action}} )。两阶段：EgoDex 无标签只训双流 DiT；再在 RoboTwin 上接入 action expert 联合训练。backbone 为 Wan2.2-TI2V-5B。",
      "output": "策略模式 → 未来 RGB + flow 视频 + 可执行动作块；世界模型模式 → 与指定运动一致的未来 RGB。",
      "details": "- **输入：** 参考 RGB \\(I_0\\)、语言指令 \\(\\tau\\)；策略模式还要本体感觉。RoboTwin 阶段把头/左腕/右腕拼成 \\(320\\times 384\\) 的 T 形拼图。\n- **过程：** RAFT 提取光流，HSV 色轮编码 \\(\\phi\\)（色相=方向，饱和度=幅度，\\(m\\) 为幅度归一化；在该归一化下可逆）。同一冻结 VAE 分别编码 RGB 与 flow latent；各 self-attention 层把两路 token 拼接做联合注意力再拆回，RoPE 分路施加。策略模式：两路后续帧从噪声联合去噪，action expert（约 780M AdaLN DiT，30 层）交叉注意各层 RGB+flow hidden state，用 flow matching 预测 \\(N\\) 步动作块；训练时以 \\(p=0.5\\) 向 expert 所见 latent 混噪声，以对齐推理时的残差去噪误差。世界模型模式：flow latent 固定为所需轨迹的干净 VAE 编码，只去噪 RGB。\\(\\mathcal{L}_{\\text{video}}=(1-\\lambda_f)\\mathcal{L}_{\\text{RGB}}+\\lambda_f\\mathcal{L}_{\\text{flow}}\\)，并对 flow 做 motion-aware 重加权以免背景主导。有动作标签时再加 \\(\\lambda_a\\mathcal{L}_{\\text{action}}\\)。两阶段：EgoDex 无标签只训双流 DiT；再在 RoboTwin 上接入 action expert 联合训练。backbone 为 Wan2.2-TI2V-5B。\n- **输出：** 策略模式 → 未来 RGB + flow 视频 + 可执行动作块；世界模型模式 → 与指定运动一致的未来 RGB。\n\n与最近 baseline 的实质差异：Motus 用光流衍生的 **latent action**，FlowWAM 生成显式 flow **视频**；Fast-WAM 训练期有视频、测试期跳过 imagination 并走数值动作；X-WAM 用数值投影的动作/状态 latent 而非稠密图像空间 flow。RoboTwin 的 flow 监督来自 SAPIEN 中只重放机器人、去掉背景/物体运动后的 robot-only 渲染，腕部 flow 区域用占位常量，因为腕部 robot-only flow 不可用。"
    },
    "experiments": "**作者主张：** 同一套 flow 表征在策略、世界模型和无标签预训练三侧都带来增益，且策略增益可追溯到 flow 预测质量而非 decoder 捷径。\n\n实验实际支持：\n\n- **RoboTwin 2.0（50 任务，Clean 50 demo + Random 500 demo 合训，每任务 100 rollout）：** FlowWAM w/ PT 平均成功 **92.94% Clean / 92.14% Random**，高于表中 \\(\\pi_{0.5}\\)、X-VLA、Motus、GigaWorld Policy、X-WAM、Fast-WAM；无 EgoDex 预训练仍有 82.40 / 80.80，说明 flow 流本身贡献大部分，预训练是放大器。Hanging Mug 等难任务仍明显低于均值（65/68）。这些数字与 G0.5 文中的 93.7/92.8 **不是同一套训练/评估脚本**，不宜直接排序成 SOTA 竞赛。\n- **WorldArena（121 帧、24 fps）：** 总 EWMScore **63.71**，Trajectory Accuracy **64.26**（相对第二名约 +10 分，作者称轨迹精度相对提升 18.4%）。外观类 Subject/Background Consistency 接近但不全面领先。消融用自定义 validation split，与主表数字不一致，作者已注明。\n- **真机（Franka 单臂 4 任务 + ARX 双臂 3 任务，各 100 条演示、10 trial）：** 平均 **75.7%** vs \\(\\pi_{0.5}\\) 61.4%、Motus 57.1%；双臂任务差距更大。\n- **消融（RoboTwin 子集）：** 数值动作 69.8，原始 \\((u,v)\\) 72.3，去掉 flow 重加权 83.9，去掉 stochastic AE 条件 82.1，完整 89.8。世界模型侧：text 49.31，数值动作 54.18，原始 flow 56.72，mask 图像动作 57.84，完整 65.23。\n- **可解码性：** 50 个 RoboTwin 任务上，预测 flow 相对 RAFT 伪 GT 的误差与成功率 Pearson **\\(r=-0.81\\)**。这支持“flow 质量与控制成功相关”，不是因果识别。",
    "evidence_notes": "",
    "code_data_status": "- **代码：** [YixiangChen515/FlowWAM](https://github.com/YixiangChen515/FlowWAM) 含 `training/`、`inference/`、`data_generation/`、`diffsynth/`。LICENSE 为 Apache-2.0（文件末尾仍留有 diffsynth 来源的 Zhongjie Duan 版权样板，以仓库实际 NOTICE 为准）。\n- **模型 / 数据：** README 指向 Hugging Face `YixiangChen/FlowWAM` 与 `YixiangChen/FlowWAM_RoboTwin`；本次未逐文件核验权重是否已全部上传。\n- **依赖数据：** EgoDex（无机器人动作标签）、RoboTwin 2.0、RAFT 伪标签；完整复现仍依赖这些外部语料和 32×H100 级训练设置。",
    "limitations": "- 腕部视角没有 robot-only flow 监督，拼图里用常量占位。\n- RoboTwin flow 目标去掉了物体/背景运动，接触后的 object response 不在动作表征里。\n- WorldArena 消融 split 与官方远程评测不一致，不能把 65.23 与主表 63.71 混比。\n- Hanging Mug 等任务成功率仍低；真机每任务仅 10 trial。\n- 光流是像素位移，不是可干预因果变量；RAFT 误差会进入训练目标。\n- 未来工作承认尚未做 internet-scale 无动作预训练和更长时域 flow planning。",
    "comments": "",
    "source_reports": [
      "report-365c2cc93b",
      "report-a77d9a7ad6"
    ],
    "deleted": false,
    "updated_at": "2026-08-21",
    "challenges": "WAM 想借用预训练视频生成器的运动先验做控制，但动作必须同时满足两件事：格式贴合视频生成器，以及跨帧运动线索足够解码成可执行控制。本文针对的是这个表征缺口，而不是“视频生成还不够像真”。\n\n- **数值动作 token**（DreamZero、Cosmos Policy、UWM、Fast-WAM 等）精确，但动作空间随本体变化，和像素先验不在同一模态。\n- **学习 latent action**（Motus、LAPO 等）可跨本体，却往往丢掉稠密、空间对齐的运动。\n- **图像空间动作**（ray map、mask、多视角 action image）把控制画进视觉域，但多是静态“在哪里动”，不是“每一可见部分如何随帧移动”，因此仍是帧级条件，而不是与未来视频一起演化的时间稠密动作流。\n- 先前光流工作多把 flow 当 VLA 辅助监督、规划中间量或模块桥，**没有**把它放进视频生成器的生成 latent，同时充当策略目标和世界模型条件。",
    "motivation": "核心 Insight：**把光流编码成与 RGB 同格式的视频，就可以作为 WAM 的统一动作表征——策略模式生成 flow 再解码动作，世界模型模式固定目标 flow 来引导未来 RGB，并且可以从无动作标签的自我中心视频里预训练。**\n\n这改变的是动作/视频接口，不是再加一个更重的 RGB rollout 头：flow 与 RGB 共享冻结 VAE 和 DiT 主体，只保留轻量 stream-specific patch embedding 与输出头。与本知识库课题 **直接相关**：它明确站在 WAM 动作表征谱系上，对照数值 token、latent action 和静态图像动作，并在 RoboTwin / WorldArena 上同时测策略与世界模型。它建模的是像素位移场，**不是**结构因果或反事实。",
    "technical_approach": "- **输入：** 参考 RGB \\(I_0\\)、语言指令 \\(\\tau\\)；策略模式还要本体感觉。RoboTwin 阶段把头/左腕/右腕拼成 \\(320\\times 384\\) 的 T 形拼图。\n- **过程：** RAFT 提取光流，HSV 色轮编码 \\(\\phi\\)（色相=方向，饱和度=幅度，\\(m\\) 为幅度归一化；在该归一化下可逆）。同一冻结 VAE 分别编码 RGB 与 flow latent；各 self-attention 层把两路 token 拼接做联合注意力再拆回，RoPE 分路施加。策略模式：两路后续帧从噪声联合去噪，action expert（约 780M AdaLN DiT，30 层）交叉注意各层 RGB+flow hidden state，用 flow matching 预测 \\(N\\) 步动作块；训练时以 \\(p=0.5\\) 向 expert 所见 latent 混噪声，以对齐推理时的残差去噪误差。世界模型模式：flow latent 固定为所需轨迹的干净 VAE 编码，只去噪 RGB。\\(\\mathcal{L}_{\\text{video}}=(1-\\lambda_f)\\mathcal{L}_{\\text{RGB}}+\\lambda_f\\mathcal{L}_{\\text{flow}}\\)，并对 flow 做 motion-aware 重加权以免背景主导。有动作标签时再加 \\(\\lambda_a\\mathcal{L}_{\\text{action}}\\)。两阶段：EgoDex 无标签只训双流 DiT；再在 RoboTwin 上接入 action expert 联合训练。backbone 为 Wan2.2-TI2V-5B。\n- **输出：** 策略模式 → 未来 RGB + flow 视频 + 可执行动作块；世界模型模式 → 与指定运动一致的未来 RGB。\n\n与最近 baseline 的实质差异：Motus 用光流衍生的 **latent action**，FlowWAM 生成显式 flow **视频**；Fast-WAM 训练期有视频、测试期跳过 imagination 并走数值动作；X-WAM 用数值投影的动作/状态 latent 而非稠密图像空间 flow。RoboTwin 的 flow 监督来自 SAPIEN 中只重放机器人、去掉背景/物体运动后的 robot-only 渲染，腕部 flow 区域用占位常量，因为腕部 robot-only flow 不可用。",
    "discussion": "FlowWAM 把 WAM 的动作表征问题收束成一句可检验的话：动作应是视频原生、跨帧稠密、且能解码成关节指令的运动场。RoboTwin、WorldArena 轨迹轴和真机双臂任务支持这一主张；相关工作里最接近的是 Motus，但表征层级不同。适用边界是操作式短中程 WAM，不是 HOI 接触力学，也不是 Pearl 式因果。失败与开放问题包括：腕部 flow 缺失、robot-only 伪标签丢掉物体被推动后的 scene flow、HSV 幅度截断、5B 级视频骨干的算力，以及未来工作自己列出的互联网级无动作预训练和更长时域。阅读判断：若课题关心 WAM 里“动作该长成什么样”，这篇比再堆一个 RGB imagination 头更直接；不要把光流一致性写成世界的因果结构，也不要和 G0.5 的 RoboTwin 数字做未经对齐的榜首比较。",
    "arxiv": {
      "published": "2026-07-14T17:57:12Z",
      "revised_at": "2026-07-14T17:57:12Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2609-08743",
    "title": "FOCI Policy: Focus on Object-Centric Interactions for Relational Manipulation Policies",
    "authors": [
      "Ze Fu",
      "Pinhao Song",
      "Yutong Hu",
      "Renaud Detry"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本，v1；arXiv 作者备注称 CoRL 2026 接收",
    "arxiv_id": "2609.08743",
    "doi": "10.48550/arXiv.2609.08743",
    "links": {
      "paper": "https://arxiv.org/abs/2609.08743",
      "project": "https://fitz0401.github.io/foci-page/",
      "alphaxiv": "https://alphaxiv.org/abs/2609.08743"
    },
    "tags": [
      "HOI",
      "对象与可供性",
      "预训练与扩展律"
    ],
    "figure": {
      "url": "content/images/2609.08743-representative.webp",
      "alt": "Figure 2",
      "label": "Figure 2",
      "paper_title": "FOCI Policy: Focus on Object-Centric Interactions for Relational Manipulation Policies",
      "source_url": "https://arxiv.org/html/2609.08743v1#S3.F2"
    },
    "summary": "object-centric 操作策略通过建模物体运动而非直接预测机器人动作来改善泛化，但现有表示要么过简（无法捕捉交互动态）要么过密（学习效率低）。观察：许多刚体关系操作任务由短交互阶段主导，期间任务相关物体间的相对运动受紧密约束。FOCI Policy 做两层抽象：(1) 时间上——从演示自动提取紧凑交互段；(2) 空间上——用任务相关物体间的相对 SE(3) 运动表示技能，对场景配置与机器人本体不变。",
    "insight": "object-centric 操作策略通过建模物体运动而非直接预测机器人动作来改善泛化，但现有表示要么过简（无法捕捉交互动态）要么过密（学习效率低）。观察：许多刚体关系操作任务由短交互阶段主导，期间任务相关物体间的相对运动受紧密约束。FOCI Policy 做两层抽象：(1) 时间上——从演示自动提取紧凑交互段；(2) 空间上——用任务相关物体间的相对 SE(3) 运动表示技能，对场景配置与机器人本体不变。",
    "pipeline": {
      "input": "演示（含物体轨迹）+ 场景观测。",
      "process": "自动提取紧凑交互段 → 表示相对 SE(3) 运动技能 → 物体间交互建模 → 策略生成物体运动 → 控制器执行。",
      "output": "关系操作策略（RLBench/COLOSSEUM/真机）。",
      "details": "**输入**：演示（含物体轨迹）+ 场景观测。\n**过程**：自动提取紧凑交互段 → 表示相对 SE(3) 运动技能 → 物体间交互建模 → 策略生成物体运动 → 控制器执行。\n**输出**：关系操作策略（RLBench/COLOSSEUM/真机）。"
    },
    "experiments": "正文表 1 在八项 RLBench 关系操作中采用 1 次演示、单 RGB-D 相机，每任务 25 个测试并平均 3 次运行；例如 phone_on_base/stack_wine 为 96.0±3.3/97.3±1.9。表 3 扩至 RLBench-18 后，容易接地/难接地任务为 79.6%/7.8%，整体 43.7%；给真值位姿后整体为 88.2%。因此少样本收益依赖任务对象能够正确定位。表 2 的 COLOSSEUM 全扰动成功率为 25.3%，相较其 58.9% 的无扰动结果仍大幅下降。 [正文实验与表格](https://arxiv.org/html/2609.08743v1)。",
    "evidence_notes": "2026-09-14 已核对 arXiv 元数据、正文主要实验与对照；未运行复现实验。",
    "code_data_status": "论文或项目列出的代码地址当前返回 404，不能认定已公开可获取代码。论文中资源发布声明保留为作者声明，数据、权重的实际可获取状态待核验。",
    "limitations": "对象接地是主要瓶颈：困难任务 7.8% 与真值位姿上界的差距明显。相对 SE(3) 表示的结构性质不能替代跨本体实测。",
    "comments": "",
    "source_reports": [
      "report-37b94c4145"
    ],
    "deleted": false,
    "updated_at": "2026-09-14",
    "discussion": "命中 HOI + object-centric + 紧凑段抽象，与知域「交互世界模型」专题相关。其「时间上压缩交互段 + 空间上相对运动」与流式 HOI 的表示设计有方法联系。",
    "arxiv": {
      "published": "2026-09-08T13:35:56Z",
      "revised_at": "2026-09-08T13:35:56Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2609-21751",
    "title": "ForceTwin: Physics-informed Digital Twins for Robotic Manipulation from Instrumented Human Interaction",
    "authors": [
      "Tim Engelbracht",
      "René Zurbrügg",
      "Mayank Mittal",
      "Marco Hutter",
      "Marc Pollefeys",
      "Hermann Blum",
      "Zuria Bauer"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本",
    "arxiv_id": "2609.21751",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2609.21751",
      "project": "https://timengelbracht.github.io/forcetwin-website/",
      "alphaxiv": "https://alphaxiv.org/abs/2609.21751"
    },
    "tags": [
      "机器人学习",
      "物理建模与仿真",
      "触觉与灵巧操作"
    ],
    "figure": {
      "url": "content/images/2609.21751-main.webp",
      "alt": "Figure 1：力觉主动探测辨识对象动力学，构建可用于规划与仿真训练的数字孪生",
      "label": "Figure 1 · 力觉主动探测辨识对象动力学，构建可用于规划与仿真训练的数字孪生",
      "paper_title": "ForceTwin: Physics-informed Digital Twins for Robotic Manipulation from Instrumented Human Interaction",
      "source_url": "https://arxiv.org/html/2609.21751v1/figures/ForceTwin_PipelineFigure.png"
    },
    "summary": "ForceTwin 让人用带力传感器的手持夹具主动探索对象，通过同步位姿与 wrench 估计运动学和有效动力学，并把结果用于机器人操作和策略训练。它的额外观测是直接测量的交互力，因此不能当成从普通 RGB 视频恢复动力学的方法。",
    "insight": "ForceTwin 让人用带力传感器的手持夹具主动探索对象，通过同步位姿与 wrench 估计运动学和有效动力学，并把结果用于机器人操作和策略训练。它的额外观测是直接测量的交互力，因此不能当成从普通 RGB 视频恢复动力学的方法。",
    "pipeline": {
      "input": "逐对象采集的工具位姿、六维力/力矩和交互轨迹。",
      "process": "估计转动/移动关节与轴线；补偿工具自身的重力和惯性 wrench；利用关节 Jacobian 投影为广义作用力；非负拟合惯量、库仑摩擦和黏性阻尼，再用位置负载与非负速度相关阻尼网络拟合机构残差；组装孪生用于仿真与控制。",
      "output": "对象关节参数、有效动力学及机构函数；可供阻抗控制器前馈补偿和门穿越策略训练使用的资产。",
      "details": "**过程**：估计转动/移动关节与轴线；补偿工具自身的重力和惯性 wrench；利用关节 Jacobian 投影为广义作用力；非负拟合惯量、库仑摩擦和黏性阻尼，再用位置负载与非负速度相关阻尼网络拟合机构残差；组装孪生用于仿真与控制。\n\n- **输入**：逐对象采集的工具位姿、六维力/力矩和交互轨迹。\n- **过程**：估计转动/移动关节与轴线；补偿工具自身的重力和惯性 wrench；利用关节 Jacobian 投影为广义作用力；非负拟合惯量、库仑摩擦和黏性阻尼，再用位置负载与非负速度相关阻尼网络拟合机构残差；组装孪生用于仿真与控制。\n- **输出**：对象关节参数、有效动力学及机构函数；可供阻抗控制器前馈补偿和门穿越策略训练使用的资产。\n\n模型可写为 τ = Iq̈ + μ sign(q̇) + bq̇ + g(q) + c(q,|q̇|)q̇。非负 c 约束耗散性；g 可以包含弹簧，也可以吸收未补偿的重力负载。[方法 §III](https://arxiv.org/html/2609.21751#S3)\n\n### 方法细节与实现\n\n**主动辨识而非只重建外观。**人使用带力传感器的手持夹具推动、拉动或转动物体，同步记录工具位姿与接触力/力矩，辨识关节结构和作用力模型；这一步不要求机器人参与。物理模型可独立于几何重建估计，再与同段记录恢复或另行提供的几何资产配准。力数据约束仅凭外观与运动难以确定的实例动力学，使资产可用于后续机器人控制与仿真训练。\n\n**物理参数化。**关节广义力由惯性项 Iq̈、库仑摩擦 μsign(q̇)、黏性项 bq̇、重力项 g(q) 和非负的状态相关耗散 c(q,|q̇|)q̇ 组成。非负耗散约束避免残差网络凭空向系统注入能量。这个结构把可解释低阶物理项与难以解析建模的状态依赖阻力结合起来，但有限探测轨迹下若干参数仍可能互相补偿。\n\n**使用方式。**辨识后的对象进入模拟器，支持基于模型的操作和仿真策略学习，再回到真实对象执行。每个新对象需要探测和注册，不是只凭一幅图片直接预测通用接触力；力传感器质量、探测动作覆盖和关节模型正确性会决定孪生模型的有效范围。\n\n[对应方法原文](https://arxiv.org/html/2609.21751#S3)"
    },
    "experiments": "12 根真实测试轴上，移动/转动类型准确率均为 100%；转动轴位置误差为 23±26 mm，MoMa-SG 为 46±20 mm。Spot 与 Franka 的 9 个可执行对象—本体组合中，平均目标完成程度为 87.3%，VLM prior 为 59.7%，kinematics-only 为 56.9%；该 Complete 指标不应改写成同等比例的二元任务成功率。\n\n强机构场景收益尤其明显，例如 Franka 金属门完成程度 81.2%，两个基线约 1.6%/1.5%；但弱负载的抽屉、滑门上并非每项都领先。Spot 的金属门因作用力超过执行器能力未纳入可执行组合。论文还报告用孪生训练门穿越策略并部署实机。[实验 §IV](https://arxiv.org/html/2609.21751#S4)\n\n**评价口径。**9 个对象—本体组合中报告 87.3% 的目标完成程度，对照为 59.7%/56.9%；这里不是 87.3% 的二元任务成功率。结果支持物理校准在测试对象上的效用，尚不足以证明摩擦、重力和残差被唯一识别。更强外推证据需要未用于辨识的速度、负载和接触位置测试。\n\n[实验与设置原文](https://arxiv.org/html/2609.21751)",
    "evidence_notes": "已核验原文方法、实验与局限；以下数值为作者报告，分析另行标注",
    "code_data_status": "官方项目页已确认；页面仍显示 Paper/Code/Video soon，但 arXiv 原文已经可访问。尚未确认公开实现、原始仪器采集数据或训练资产下载。",
    "limitations": "作者明确指出参数分解不唯一：常量残差阻尼与 b 可互相吸收，配置相关重力与 g 也不可自动区分。模型在 (q,q̇) 上无记忆，不能表示回差、静止粘滞和锁扣状态；仅在探索过的关节范围有效。改变抽屉负载后如何在线更新，仍未解决。",
    "comments": "",
    "source_reports": [],
    "deleted": false,
    "updated_at": "2026-09-24",
    "challenges": "外观相似的门可能需要完全不同的力。现有数字孪生往往恢复关节几何，或由 VLM 赋予静态质量/摩擦先验，难刻画闭门器、弹簧等随位置与速度变化的机构负载。",
    "motivation": "ForceTwin 让人用带力传感器的手持夹具主动探索对象，通过同步位姿与 wrench 估计运动学和有效动力学，并把结果用于机器人操作和策略训练。它的额外观测是直接测量的交互力，因此不能当成从普通 RGB 视频恢复动力学的方法。",
    "technical_approach": "**过程**：估计转动/移动关节与轴线；补偿工具自身的重力和惯性 wrench；利用关节 Jacobian 投影为广义作用力；非负拟合惯量、库仑摩擦和黏性阻尼，再用位置负载与非负速度相关阻尼网络拟合机构残差；组装孪生用于仿真与控制。\n\n- **输入**：逐对象采集的工具位姿、六维力/力矩和交互轨迹。\n- **过程**：估计转动/移动关节与轴线；补偿工具自身的重力和惯性 wrench；利用关节 Jacobian 投影为广义作用力；非负拟合惯量、库仑摩擦和黏性阻尼，再用位置负载与非负速度相关阻尼网络拟合机构残差；组装孪生用于仿真与控制。\n- **输出**：对象关节参数、有效动力学及机构函数；可供阻抗控制器前馈补偿和门穿越策略训练使用的资产。\n\n模型可写为 τ = Iq̈ + μ sign(q̇) + bq̇ + g(q) + c(q,|q̇|)q̇。非负 c 约束耗散性；g 可以包含弹簧，也可以吸收未补偿的重力负载。[方法 §III](https://arxiv.org/html/2609.21751#S3)\n\n### 方法细节与实现\n\n**主动辨识而非只重建外观。**人使用带力传感器的手持夹具推动、拉动或转动物体，同步记录工具位姿与接触力/力矩，辨识关节结构和作用力模型；这一步不要求机器人参与。物理模型可独立于几何重建估计，再与同段记录恢复或另行提供的几何资产配准。力数据约束仅凭外观与运动难以确定的实例动力学，使资产可用于后续机器人控制与仿真训练。\n\n**物理参数化。**关节广义力由惯性项 Iq̈、库仑摩擦 μsign(q̇)、黏性项 bq̇、重力项 g(q) 和非负的状态相关耗散 c(q,|q̇|)q̇ 组成。非负耗散约束避免残差网络凭空向系统注入能量。这个结构把可解释低阶物理项与难以解析建模的状态依赖阻力结合起来，但有限探测轨迹下若干参数仍可能互相补偿。\n\n**使用方式。**辨识后的对象进入模拟器，支持基于模型的操作和仿真策略学习，再回到真实对象执行。每个新对象需要探测和注册，不是只凭一幅图片直接预测通用接触力；力传感器质量、探测动作覆盖和关节模型正确性会决定孪生模型的有效范围。\n\n[对应方法原文](https://arxiv.org/html/2609.21751#S3)",
    "discussion": "**阅读者分析**：它直接补上几何孪生到接触控制之间缺失的“需要多少力”。对 HOI，最有价值的是运动学约束与测力联合辨识；其规模化代价则是每个实例都需要充分激励的物理探索。",
    "arxiv": {
      "published": "2026-09-18",
      "revised_at": "",
      "primary_category": "cs.RO"
    },
    "source_papers": [
      "content/papers/2609.21751.md"
    ]
  },
  {
    "id": "arxiv-2609-08636",
    "title": "From Where to How: Continuous 4D Interaction Forecasting from Egocentric Video",
    "authors": [
      "Qiaohui Chu",
      "Haoyu Zhang",
      "Meng Liu",
      "Haoxiang Shi",
      "Dongmei Jiang",
      "Liqiang Nie"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本，v1",
    "arxiv_id": "2609.08636",
    "doi": "10.48550/arXiv.2609.08636",
    "links": {
      "paper": "https://arxiv.org/abs/2609.08636",
      "project": "https://corrineqiu.github.io/from-where-to-how/",
      "code": "https://github.com/CorrineQiu/from-where-to-how",
      "alphaxiv": "https://alphaxiv.org/abs/2609.08636"
    },
    "tags": [
      "HOI",
      "扩散与流匹配",
      "第一视角与人类视频"
    ],
    "figure": {
      "url": "content/images/2609.08636-representative.webp",
      "alt": "Fig. 5",
      "label": "Fig. 5",
      "paper_title": "From Where to How: Continuous 4D Interaction Forecasting from Egocentric Video",
      "source_url": "https://arxiv.org/html/2609.08636v1#S3.F5"
    },
    "summary": "论文将“未来在哪里交互”和“身体如何运动”统一为连续 4D 预测。Coherent4D 约 233K 样本、三个域，每个样本把未来 3D 交互位置与全身姿态在同一坐标和时间轴对齐；HIGFlow 采用 where-to-how 级联。",
    "insight": "论文将“未来在哪里交互”和“身体如何运动”统一为连续 4D 预测。Coherent4D 约 233K 样本、三个域，每个样本把未来 3D 交互位置与全身姿态在同一坐标和时间轴对齐；HIGFlow 采用 where-to-how 级联。",
    "pipeline": {
      "input": "egocentric 历史视频。",
      "process": "融合语义 grounding 与短时动态预测未来 3D 交互位置；以位置序列条件化 deterministic motion anchor，再用 residual flow matching 生成全身运动。",
      "output": "时间对齐的未来 3D 交互位置与全身姿态序列。",
      "details": "- **输入**：egocentric 历史视频。\n- **过程**：融合语义 grounding 与短时动态预测未来 3D 交互位置；以位置序列条件化 deterministic motion anchor，再用 residual flow matching 生成全身运动。\n- **输出**：时间对齐的未来 3D 交互位置与全身姿态序列。"
    },
    "experiments": "正文表 I 列出 Coherent4D 的 233,828 个样本：193,598/20,484/19,746 train/val/test，覆盖 Cooking、Health、Bike Repair 三域。表 II 的位置 ADE（mm）依次为 Health 40.21、Bike Repair 80.91、Cooking 93.46，对比 FIction 的 40.30、88.55、100.61；Health FDE 则略差（41.44 对 40.58）。表 III 分开报告真值/预测交互位置条件以及 Single/Best-5，不能把真值条件或 best-of-5 当成单次端到端部署效果。 [正文实验与表格](https://arxiv.org/html/2609.08636v1)。",
    "evidence_notes": "2026-09-14 已核对 arXiv 元数据、正文主要实验与对照；未运行复现实验。",
    "code_data_status": "仓库包含项目网站、data 与 process 目录，完整训练权重和数据下载范围需按仓库说明核验。 以上状态核验于 2026-09-14；入口和目录存在不等于已经运行复现实验。",
    "limitations": "预测未来交互位置和姿态不直接给出机器人可执行动作；不同域、真值位置条件、预测位置条件和 best-of-N 必须分别比较。",
    "comments": "",
    "source_reports": [
      "report-37b94c4145"
    ],
    "deleted": false,
    "updated_at": "2026-09-14",
    "discussion": "是 3D/4D HOI 与 egocentric world modeling 的直接交叉，可作为从交互位置预测走向人体—环境联合预测的参考。",
    "arxiv": {
      "published": "2026-09-08T12:06:23Z",
      "revised_at": "2026-09-08T12:06:23Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2609-24981",
    "title": "GAE: Learning a Geometry-Native Latent Space for 3D-Consistent World Generation",
    "authors": [
      "Jiahao Lu",
      "Minghao Yin",
      "Wenbo Hu",
      "Hengyu Liu",
      "Wang Zhao",
      "Sai-Kit Yeung",
      "Ying Shan",
      "Yuan Liu"
    ],
    "year": 2026,
    "publication": "2026，arXiv",
    "arxiv_id": "2609.24981",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2609.24981",
      "project": "https://jiah-cloud.github.io/GAE.github.io/",
      "code": "https://github.com/TencentARC/GAE-GeometricAutoEncoder",
      "model": "https://huggingface.co/TencentARC/GAE-D64-1B",
      "alphaxiv": "https://alphaxiv.org/abs/2609.24981"
    },
    "tags": [
      "3D/4D"
    ],
    "figure": {
      "url": "content/images/2609.24981-main.webp",
      "alt": "Figure 2：先学习同时解码外观与几何的潜空间，再训练条件流生成器",
      "label": "Figure 2 · 先学习同时解码外观与几何的潜空间，再训练条件流生成器",
      "paper_title": "GAE: Learning a Geometry-Native Latent Space for 3D-Consistent World Generation",
      "source_url": "https://arxiv.org/html/2609.24981v1/ngd_pipeline_overview.png"
    },
    "summary": "GAE认为3D consistency问题不应只靠添加geometry loss解决，而应让生成模型的latent本身就是geometry-native representation，可共同解码RGB、depth、camera和point map。",
    "insight": "GAE认为3D consistency问题不应只靠添加geometry loss解决，而应让生成模型的latent本身就是geometry-native representation，可共同解码RGB、depth、camera和point map。",
    "pipeline": {
      "input": "多视图图像 / geometry foundation features。",
      "process": "geometry feature reparameterization → compact GAE latent → conditional flow generator在latent上建模未来/新视图。",
      "output": "appearance、depth、camera、point map以及geometry-consistent generation。",
      "details": "**过程**：geometry feature reparameterization → compact GAE latent → conditional flow generator在latent上建模未来/新视图。\n\n**输入**：多视图图像 / geometry foundation features。\n\n**输出**：appearance、depth、camera、point map以及geometry-consistent generation。\n\n冻结 DA3 编码器与几何头，归一化并融合四层 feature hierarchy；codec 保留 patch 网格，将通道压到 64 或 128，再恢复各层供 RGB/深度/相机/点图联合解码。C-RADIO token alignment 改善语义组织，DINOv2 pairwise relation loss 防止逐 token 对齐破坏空间关系；随后在 posterior mean latent 上训练条件 flow。\n\n[原文方法](https://arxiv.org/html/2609.24981)\n\n### 方法细节与实现\n\n**几何原生 codec。**编码端以冻结的 Depth Anything 3 几何骨干为基础，将四层特征归一化并融合，压缩到较低通道数的潜变量；解码端同时恢复 RGB 与几何信息。与事后给普通视频 latent 加深度头相比，几何结构在表征形成时就成为约束，使同一潜空间可以支撑外观与结构生成。\n\n**为什么重建好还不够。**强重建 codec 的潜变量可能不适合扩散：局部特征分布不规则或空间关系不稳定，会增加生成模型学习难度。GAE 用 C-RADIO 进行 token 特征对齐，并用 DINOv2 的成对关系提供结构监督，既组织单点语义，也保留 token 间的空间关系，避免只做特征回归导致关系结构坍缩。\n\n**两阶段学习。**先学习可同时解码外观与几何的紧凑 codec，再在冻结的潜空间训练条件 flow matching。实验比较不同通道预算并尽量匹配生成骨干，用以区分潜空间设计与更大生成器的收益。深度和相机相关输出提供3D一致性依据，但该模型没有显式接触力或动作干预状态转移。\n\n[对应方法原文](https://arxiv.org/html/2609.24981#S3)"
    },
    "experiments": "固定相同generator/training protocol时，GAE相对最佳非GAE latent使RealEstate10K FVD降低12.7%、DL3DV降低23.1%，并把RealEstate10K camera trajectory error约减半。\n\n\n表 5 的受控生成比较中，GAE-64 在 RealEstate10K / DL3DV 的 FVD 为 225.7 / 287.0，最佳非 GAE 受控 latent 为 258.6 / 373.2，分别降低 12.7%/23.1%。表 1 只加 token alignment 时 LDS/SRSS 为 0.020/0.030，加入关系损失后为 0.444/0.553，说明“语义对齐”本身不足以保住空间结构。几何指标仍依赖 VGGT、Pi3、DA3 等估计器和 Sim(3) 对齐，不能等同真实传感器级 metric accuracy。\n\n[原文实验与表格](https://arxiv.org/html/2609.24981)\n\n**指标与权重版本。**相关两组生成设置的 FVD 为225.7/287.0，对照为258.6/373.2；还需结合 RGB 重建、几何误差及多视角一致性共同判断。公开的 GAE-D64-1B 权重经过继续训练，官方说明它与论文实验模型不完全相同，因此复现实验应固定版本，不能默认下载权重能直接重现表中所有数字。\n\n[实验与设置原文](https://arxiv.org/html/2609.24981)",
    "evidence_notes": "已核验原文方法与实验；关键比较与限制见各节",
    "code_data_status": "官方项目、GitHub 与 GAE-D64-1B 权重均已公开，包含 codec/flow 推理、训练与评估入口。官方 README 明确说明公开 flow checkpoint 是更高分辨率、更多帧和更多数据继续训练后的版本，不能直接复现论文提交时表 5–7 的数字。复现必须区分论文配置与公开权重配置。",
    "limitations": "目前验证重点仍是视觉生成/几何一致性，不是动作条件、交互或长期物理rollout。",
    "comments": "",
    "source_reports": [],
    "deleted": false,
    "updated_at": "2026-09-24",
    "challenges": "外观 VAE 的压缩目标未必保留跨视图结构；原始几何特征虽有几何信息，却高维、病态且未必适合 flow matching。问题不是简单“增加深度输出”，而是同时保留几何可解码性和生成可学习性。",
    "motivation": "GAE认为3D consistency问题不应只靠添加geometry loss解决，而应让生成模型的latent本身就是geometry-native representation，可共同解码RGB、depth、camera和point map。",
    "technical_approach": "**过程**：geometry feature reparameterization → compact GAE latent → conditional flow generator在latent上建模未来/新视图。\n\n**输入**：多视图图像 / geometry foundation features。\n\n**输出**：appearance、depth、camera、point map以及geometry-consistent generation。\n\n冻结 DA3 编码器与几何头，归一化并融合四层 feature hierarchy；codec 保留 patch 网格，将通道压到 64 或 128，再恢复各层供 RGB/深度/相机/点图联合解码。C-RADIO token alignment 改善语义组织，DINOv2 pairwise relation loss 防止逐 token 对齐破坏空间关系；随后在 posterior mean latent 上训练条件 flow。\n\n[原文方法](https://arxiv.org/html/2609.24981)\n\n### 方法细节与实现\n\n**几何原生 codec。**编码端以冻结的 Depth Anything 3 几何骨干为基础，将四层特征归一化并融合，压缩到较低通道数的潜变量；解码端同时恢复 RGB 与几何信息。与事后给普通视频 latent 加深度头相比，几何结构在表征形成时就成为约束，使同一潜空间可以支撑外观与结构生成。\n\n**为什么重建好还不够。**强重建 codec 的潜变量可能不适合扩散：局部特征分布不规则或空间关系不稳定，会增加生成模型学习难度。GAE 用 C-RADIO 进行 token 特征对齐，并用 DINOv2 的成对关系提供结构监督，既组织单点语义，也保留 token 间的空间关系，避免只做特征回归导致关系结构坍缩。\n\n**两阶段学习。**先学习可同时解码外观与几何的紧凑 codec，再在冻结的潜空间训练条件 flow matching。实验比较不同通道预算并尽量匹配生成骨干，用以区分潜空间设计与更大生成器的收益。深度和相机相关输出提供3D一致性依据，但该模型没有显式接触力或动作干预状态转移。\n\n[对应方法原文](https://arxiv.org/html/2609.24981#S3)",
    "discussion": "**阅读者分析**：对PixWorld、UniRecGen、VGGT/Gen3R融合生成的方向非常高相关；也可能成为未来geometry-native WAM的latent backbone。",
    "arxiv": {
      "published": "2026-09-21",
      "revised_at": "",
      "primary_category": "cs.CV"
    },
    "source_papers": [
      "content/papers/2609.24981.md"
    ]
  },
  {
    "id": "arxiv-2608-11739",
    "title": "Galaxea G0.5: One Autoregressive Stream for Robot Reasoning and Action",
    "authors": [
      "Yicheng Liu",
      "Zibin Dong",
      "Baijun Ye",
      "Tianyuan Yuan",
      "Tao Jiang",
      "Anqi Yang",
      "Shicheng Cao",
      "Haonan Liu",
      "Yue Sun",
      "Zihan Guo",
      "Xiao Liu",
      "Ke Dong",
      "Changxun Pan",
      "Chenru Wu",
      "Tailai Cheng",
      "Xiaoshu Ren",
      "Xinlei Zhang",
      "Jianning Cui",
      "Zijie Zhao",
      "Haoyu Zhang",
      "Kaiming Xu",
      "Haodong Yang",
      "Bowen Zhang",
      "Jiahui Niu",
      "Shaoting Zhu",
      "Shiduo Zhang",
      "Hang Zhao"
    ],
    "year": 2026,
    "publication": "2026，arXiv preprint（v1，cs.RO）；arXiv HTML 署名 Galaxea Team，项目负责 Yicheng Liu，PI Hang Zhao。GitHub 新闻记论文于 2026-08-12 上线。尚无 DOI / 正式出版页。",
    "arxiv_id": "2608.11739",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.11739",
      "project": "https://opengalaxea.github.io/G05/",
      "code": "https://github.com/OpenGalaxea/GalaxeaVLA",
      "model": "https://huggingface.co/OpenGalaxea/G05",
      "alphaxiv": "https://alphaxiv.org/abs/2608.11739"
    },
    "tags": [
      "3D/4D",
      "VLA",
      "World Action Model",
      "强化与模仿学习",
      "机器人学习",
      "视频生成"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.11739v1/teaser.png",
      "alt": "Galaxea G0.5 Fig. 1: reasoning and action in one autoregressive stream",
      "label": "Galaxea G0.5，Fig. 1，reasoning and action in one autoregressive stream。。来源：原图",
      "paper_title": "Galaxea G0.5: One Autoregressive Stream for Robot Reasoning and Action",
      "source_url": "https://arxiv.org/html/2608.11739v1/teaser.png"
    },
    "summary": "核心 Insight： 不要把越来越复杂的 action expert 架在被降级的 VLM 上，而应让 VLM 继续做它被预训练成的自回归推理器，同时在同一 token 流里行动。",
    "insight": "核心 Insight：**不要把越来越复杂的 action expert 架在被降级的 VLM 上，而应让 VLM 继续做它被预训练成的自回归推理器，同时在同一 token 流里行动。**\n\n方法选择因此改变了三个接口：\n\n1. **动作接口：** 学习式、跨本体的 ActionCodec / RVQ，把异构连续动作压成共享离散词表，并用 active-part tokenization 丢掉空闲控制组。\n2. **推理接口：** Subtask / BBox / Trace / ActionHint 四种自描述 CoT 目标与动作码共用 decoder、上下文和 next-token 损失，而不是 bolt-on 规划模块。\n3. **记忆接口：** 在 ViT 中插入分解的时空注意力，把数秒视觉历史注入视觉编码器，而不是在 LLM 侧无限堆图像 token。\n\n与本知识库课题的关系：**强相关于机器人 VLA / 通用操作，与 World Action Model 是相邻对照而非同类。** G0.5 主实验把 Fast-WAM、LingBot-VA 等 WAM 当作成功率 baseline，但它本身不生成未来 RGB 世界，也不做 \\(do(\\cdot)\\) 或反事实。可借鉴点是：跨本体动作分词、原生 CoT 与动作共用目标、以及“VLM 应否继续当 actor”这一接口争论。",
    "pipeline": {
      "input": "多视角 RGB 短时窗、本体标识 (e )、自然语言指令 ( ell )、本体感觉 (s t )；可选外部裁剪目标图或坐标 token。",
      "process": "从 Qwen3.5-2B 初始化；全部序列化为一段 chat：条件段（图像 / 本体 / 任务 / 状态）+ 生成段（可选 CoT + 动作码）。单一 next-token 交叉熵只加在生成段，联合监督 CoT 与动作。动作码经冻结的跨本体 ActionCodec 解码到统一 27 维动作空间：left control 9 + gripper 1 + right control 9 + gripper 1 + lower body 7；空闲槽用 noop。CoT 从 8 种模板中采样（含 no-CoT），评估默认 no-CoT。视觉记忆每四层做分解时空注意力，训练时随机丢掉历史帧；可选附加 ( pi {0.5} ) 式 flow-matching 头作推理加速，主文默认仍是 AR。",
      "output": "结构化离散动作码 → 连续电机指令；需要时同时输出子任务文本、物体框、2D gripper trace、动作提示。",
      "details": "- **输入：** 多视角 RGB 短时窗、本体标识 \\(e\\)、自然语言指令 \\(\\ell\\)、本体感觉 \\(s_t\\)；可选外部裁剪目标图或坐标 token。\n- **过程：** 从 Qwen3.5-2B 初始化；全部序列化为一段 chat：条件段（图像 / 本体 / 任务 / 状态）+ 生成段（可选 CoT + 动作码）。单一 next-token 交叉熵只加在生成段，联合监督 CoT 与动作。动作码经冻结的跨本体 ActionCodec 解码到统一 27 维动作空间：left control 9 + gripper 1 + right control 9 + gripper 1 + lower body 7；空闲槽用 noop。CoT 从 8 种模板中采样（含 no-CoT），评估默认 no-CoT。视觉记忆每四层做分解时空注意力，训练时随机丢掉历史帧；可选附加 \\(\\pi_{0.5}\\) 式 flow-matching 头作推理加速，主文默认仍是 AR。\n- **输出：** 结构化离散动作码 → 连续电机指令；需要时同时输出子任务文本、物体框、2D gripper trace、动作提示。\n\n与最近 baseline 的实质差异：相对 \\(\\pi_{0.5}\\) / GR00T，VLM 不是条件编码器而是 actor；相对 OpenVLA / FAST，分词是学习式、按运动部件分组、只预测激活组；相对 ECoT，四种推理原语进入同一共享词表且可按 prompt 开关。预训练是单阶段混合：14 个本体的机器人数据 + web/embodied VQA；DROID 不进 foundation mix，评估时再 post-train。CoT 语言标注来自 Gemini 3 / Doubao 等自动标注，视觉框来自 MLLM + SAM3。"
    },
    "experiments": "**作者主张：** AR 主干在 7 个独立设定上匹配或超过最强 VLM-as-encoder、AR 和 WAM baseline；语言跟随和多阶段执行上优势更结构性。\n\n实验实际支持（数字均来自原文表格/正文）：\n\n- **真机 fine-tune（R1-Lite / R1-Pro，6 个 task–embodiment，各 15 episode，对齐 16×H20 墙钟）：** 平均成功率 **76.7%** vs \\(\\pi_{0.5}\\) 53.3%、GR00T-N1.7 24.4%；process score 129.2 vs 105.2 / 68.9。R1-Pro 搬箱堆叠是例外：\\(\\pi_{0.5}\\) 93.3% vs G0.5 80.0%。\n- **2025 BEHAVIOR Challenge（50 长时程家务，单 checkpoint）：** Task Success Score，G0.5 1 epoch **0.2904**、4 epoch **0.3136**；\\(\\pi_{0.5}\\) 4 epoch 0.2626；冠军 RLC 四 checkpoint 0.2605。作者强调这是单策略 vs 多 checkpoint 的不对等对照。\n- **DROID post-train 后环境/物体 zero-shot（10 任务×10 trial）：** 平均 **82.5%** vs \\(\\pi_{0.5}\\)-DROID 57.5%、MolmoAct2-DROID 52.0%。抽屉任务上，半透明柜体无高对比标记时 G0.5 仅 60%，贴橙色标记后到 100%；作者承认对低对比半透明表面更敏感。\n- **仿真：** LIBERO 平均 **98.9%**（Long 98.6）；RoboTwin 2.0 Clean/Rand/Avg **93.7 / 92.8 / 93.3**；SimplerEnv-Bridge 平均 **87.3%**（部分 baseline 数字编译自既有论文，不是全部同代码重跑）。\n- **PP Bench（64 次真机 trial）：** zero-shot 语言跟随 65.6%、任务成功 59.4%；50H post-train 分别为 84.4% / 75.0%，同设置下仍高于 \\(\\pi_{0.5}\\) 的 68.8% / 65.6%。单阶段任务上 CoT 几乎无增益；五阶段 Air Fryer / Cook Bacon 零样本探测中，AR+CoT 的 progress 从 2.4→3.8 与 1.5→3.4。作者把 prompt 措辞能改变 rollout 写成定性探针，**不是**定量结论。\n- **GRPO：** 每任务 1 条演示后，AR 比可选 FM 头收敛更快、终值更高、方差更低（Fig. 12）。这支持“AR 提供可直接用的 token log-prob”，不支持“FM 不能做 RL”。\n\n**证据未支持：** 提示词即可零样本控制系统性地调节粒度/时域/OOD；lower-body 被单独评测；AR 消除了感知失败。",
    "evidence_notes": "",
    "code_data_status": "- **代码：** [OpenGalaxea/GalaxeaVLA](https://github.com/OpenGalaxea/GalaxeaVLA) 含推理、fine-tune、LIBERO / DROID / RoboTwin / R1 部署入口。\n- **权重：** Hugging Face `OpenGalaxea/G05` 提供 g05-base、libero、droid、so101、robotwin20 及对应 ActionCodec。\n- **许可：** `LICENSE-G0.5` 为 **非商业 + 有限专利** 社区协议；Qwen3.5 另有独立许可。商业用途需另签协议。\n- **数据：** 预训练含内部多本体数据与自动标注；完整语料不能仅凭公开 checkpoint 复现。Galaxea Open-World Dataset 另有 HF 条目，但是否覆盖 G0.5 全文预训练 mix 需按数据卡核对。",
    "limitations": "- 抽屉插入和半透明柜体是作者承认的感知失败，AR 本身不消除。\n- 视觉记忆只有数秒；lower-body 在统一动作空间里有槽位，但本文未单独评测。\n- 预训练长尾偏 pick-and-place，BEHAVIOR 上微波炉/热狗等容器交互弱于 \\(\\pi_{0.5}\\)。\n- Prompt 级动作调节目前只是定性探针，不是系统实验。\n- SimplerEnv 部分 baseline 来自文献汇编；BEHAVIOR 对照混有单/多 checkpoint。\n- 社区许可禁止商业使用；自动标注 CoT 质量依赖闭源 MLLM。\n\n### 与知域的关系\n\n展示自回归动作 token 可直接提供策略 log-prob，并以 GRPO 做机器人策略优化；属于机器人 R1/GRPO 侧，而非未来 RGB 世界生成模型。",
    "comments": "",
    "source_reports": [
      "report-365c2cc93b",
      "report-cedaa0825a"
    ],
    "deleted": false,
    "updated_at": "2026-08-31",
    "challenges": "领域长期问题是：通用机器人策略既要继承大规模 VLM 的语言/感知能力，又要在高频、跨本体、长时程控制上可部署。本文针对的具体缺口是当前主流 VLA 配方把这两件事拆开了。\n\n- **作者明确指出的失败模式：** 早期 RT-2 / OpenVLA 式自回归动作离散化，在控制频率、动作时域和动作维度上升后，逐步 token 数量爆炸，推理变慢、变贵。随后 \\(\\pi_0\\) / \\(\\pi_{0.5}\\) / GR00T 等把预训练 VLM 降为条件编码器，另训 flow-matching / diffusion action expert。VLM 不再是 actor，chain-of-thought、in-context learning 和 prompt 级动作调节只能穿过压缩条件瓶颈间接影响动作分布。\n- **知识隔离信号：** 当 expert 梯度回传到 VLM 时，会出现 anti-forgetting；Knowledge Insulation 干脆切断梯度，再用 AR 动作预测作辅助目标。作者把它读成：AR 动作监督恰恰是保护 VLM 能力的信号，而不是该被丢掉的瓶颈。\n- **分词缺口：** FAST 等对每个本体单独做固定 DCT pipeline；多数方法把整段动作压成一个向量再离散化，token 与形态结构不对齐，空闲关节仍占 token，语义相近动作的 Hamming 距离也大。\n- **记忆缺口：** 单帧观测在遮挡和失败重试时不够；直接堆历史视觉 token 则二次方变贵，且未见过的时间轨迹容易漂移。\n\n这些是架构与表征缺口，不是“再做一个更强的视频预测器”就能自动解决的问题。",
    "motivation": "核心 Insight：**不要把越来越复杂的 action expert 架在被降级的 VLM 上，而应让 VLM 继续做它被预训练成的自回归推理器，同时在同一 token 流里行动。**\n\n方法选择因此改变了三个接口：\n\n1. **动作接口：** 学习式、跨本体的 ActionCodec / RVQ，把异构连续动作压成共享离散词表，并用 active-part tokenization 丢掉空闲控制组。\n2. **推理接口：** Subtask / BBox / Trace / ActionHint 四种自描述 CoT 目标与动作码共用 decoder、上下文和 next-token 损失，而不是 bolt-on 规划模块。\n3. **记忆接口：** 在 ViT 中插入分解的时空注意力，把数秒视觉历史注入视觉编码器，而不是在 LLM 侧无限堆图像 token。\n\n与本知识库课题的关系：**强相关于机器人 VLA / 通用操作，与 World Action Model 是相邻对照而非同类。** G0.5 主实验把 Fast-WAM、LingBot-VA 等 WAM 当作成功率 baseline，但它本身不生成未来 RGB 世界，也不做 \\(do(\\cdot)\\) 或反事实。可借鉴点是：跨本体动作分词、原生 CoT 与动作共用目标、以及“VLM 应否继续当 actor”这一接口争论。",
    "technical_approach": "- **输入：** 多视角 RGB 短时窗、本体标识 \\(e\\)、自然语言指令 \\(\\ell\\)、本体感觉 \\(s_t\\)；可选外部裁剪目标图或坐标 token。\n- **过程：** 从 Qwen3.5-2B 初始化；全部序列化为一段 chat：条件段（图像 / 本体 / 任务 / 状态）+ 生成段（可选 CoT + 动作码）。单一 next-token 交叉熵只加在生成段，联合监督 CoT 与动作。动作码经冻结的跨本体 ActionCodec 解码到统一 27 维动作空间：left control 9 + gripper 1 + right control 9 + gripper 1 + lower body 7；空闲槽用 noop。CoT 从 8 种模板中采样（含 no-CoT），评估默认 no-CoT。视觉记忆每四层做分解时空注意力，训练时随机丢掉历史帧；可选附加 \\(\\pi_{0.5}\\) 式 flow-matching 头作推理加速，主文默认仍是 AR。\n- **输出：** 结构化离散动作码 → 连续电机指令；需要时同时输出子任务文本、物体框、2D gripper trace、动作提示。\n\n与最近 baseline 的实质差异：相对 \\(\\pi_{0.5}\\) / GR00T，VLM 不是条件编码器而是 actor；相对 OpenVLA / FAST，分词是学习式、按运动部件分组、只预测激活组；相对 ECoT，四种推理原语进入同一共享词表且可按 prompt 开关。预训练是单阶段混合：14 个本体的机器人数据 + web/embodied VQA；DROID 不进 foundation mix，评估时再 post-train。CoT 语言标注来自 Gemini 3 / Doubao 等自动标注，视觉框来自 MLLM + SAM3。",
    "discussion": "G0.5 把当代 VLA 的主分歧写清楚了：VLM-as-encoder 换来连续高频动作，却把推理能力隔在 expert 之外；G0.5 用压缩动作码把 AR 路线重新做大规模。真机、长时程家务和语言跟随上的数字支持“同一套权重同时推理和行动”这一工程主张。适用边界是操作式 VLA，不是世界模型，更不是因果识别。失败案例集中在抽屉/半透明柜、预训练偏 pick-and-place 导致的容器/电器交互偏弱、以及数秒级视觉记忆。阅读判断：适合作为跨本体 AR-VLA 和 LingBot-VA / Fast-WAM 的对照基线；引用时不要把 CoT 增益外推到单阶段任务，也不要把 BEHAVIOR 的单 checkpoint 优势直接写成击败了多策略冠军系统。",
    "arxiv": {
      "published": "2026-08-12T07:26:47Z",
      "revised_at": "2026-08-12T07:26:47Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2608-26200",
    "title": "GameWAM: A World Action Model for Video Games",
    "authors": [
      "Yuncheng Guo",
      "Zhanqiu Zhang",
      "Yiwen Guo",
      "Weijia Li"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本（首发 2026-08-25）",
    "arxiv_id": "2608.26200",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.26200",
      "project": "https://yunncheng.github.io/GameWAM",
      "alphaxiv": "https://alphaxiv.org/abs/2608.26200"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "流式与自回归",
      "第一视角与人类视频",
      "长时记忆"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.26200v1/gamewam_overview.png",
      "alt": "GameWAM: A World Action Model for Video Games 代表图",
      "label": "Figure 1: Overview of GameWAM. GameWAM jointly models future visual observations and native actions for closed-loop gameplay and GUI control. 来源：论文图",
      "paper_title": "GameWAM: A World Action Model for Video Games",
      "source_url": "https://arxiv.org/html/2608.26200v1/gamewam_overview.png"
    },
    "summary": "现代视频游戏兼具第一人称感知、快速视觉变化、持久世界状态与异构原生控制；既有游戏 agent 直接映射视觉→动作但缺显式世界动力学建模，交互式游戏世界模型又只预测视觉未来而不做任务策略。GameWAM 是（作者声称） 首个面向原生闭环 gameplay 与 GUI 控制的 WAM ：并行视觉与动作生成过程 + block-causal 条件 + flow matching；为处理异构原生控制，每步预测 gameplay/GUI 模式并按模式特定分布与连续动作归一化生成动作；用 block-cycle control 预测超出承诺视界的长视界交互。",
    "insight": "现代视频游戏兼具第一人称感知、快速视觉变化、持久世界状态与异构原生控制；既有游戏 agent 直接映射视觉→动作但缺显式世界动力学建模，交互式游戏世界模型又只预测视觉未来而不做任务策略。GameWAM 是（作者声称）**首个面向原生闭环 gameplay 与 GUI 控制的 WAM**：并行视觉与动作生成过程 + block-causal 条件 + flow matching；为处理异构原生控制，每步预测 gameplay/GUI 模式并按模式特定分布与连续动作归一化生成动作；用 block-cycle control 预测超出承诺视界的长视界交互。",
    "pipeline": {
      "input": "游戏画面帧 + 任务上下文。",
      "process": "并行视觉/动作生成（block-causal 条件 + flow matching）→ 每步 gameplay/GUI 模式预测 → 模式特定动作分布 + 连续动作归一化 → block-cycle control 长视界预测。",
      "output": "未来视觉观测 + 可执行的键盘/鼠标动作轨迹。",
      "details": "**输入**：游戏画面帧 + 任务上下文。\n**过程**：并行视觉/动作生成（block-causal 条件 + flow matching）→ 每步 gameplay/GUI 模式预测 → 模式特定动作分布 + 连续动作归一化 → block-cycle control 长视界预测。\n**输出**：未来视觉观测 + 可执行的键盘/鼠标动作轨迹。"
    },
    "experiments": "摘要核验 + 结构核验；在原生闭环 gameplay 与 GUI 控制基准上评测。证据等级：摘要层面；具体环境与胜率/进度指标待全文。",
    "evidence_notes": "",
    "code_data_status": "项目页 yunncheng.github.io/GameWAM 上线；代码状态待确认。",
    "limitations": "- 同步 gameplay/GUI 轨迹构建的成本与覆盖；\n- 模式切换误判对动作分布的影响；\n- 长视界 block-cycle 预测的误差累积。\n\n### 与知域的关系\n落在 World Action Model 主线在\"开放世界游戏\"领域的应用，与知域 GigaWorld-Policy、Galaxea G0.5 的\"统一动作+世界\"思路互补，可并入 WAM 专题。",
    "comments": "",
    "source_reports": [
      "report-a141624b1e"
    ],
    "deleted": false,
    "updated_at": "2026-08-31",
    "arxiv": {
      "published": "2026-08-25T17:21:15Z",
      "revised_at": "2026-08-25T17:21:15Z",
      "primary_category": "cs.AI"
    }
  },
  {
    "id": "arxiv-2608-15651",
    "title": "Gaussian-JEPA: Joint-Embedding Predictive Learning for 3D Gaussian Splats",
    "authors": [
      "Bin Ren",
      "Qi Ma",
      "Yue Li",
      "Zongyan Han",
      "Yidi Li",
      "Yuqian Fu",
      "Rao Muhammad Anwer",
      "Theo Gevers",
      "Fahad Shahbaz Khan",
      "Salman Khan"
    ],
    "year": 2026,
    "publication": "2026，arXiv preprint（v1，cs.CV，2026-08-16）。尚无 DOI / 正式出版页。",
    "arxiv_id": "2608.15651",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.15651",
      "project": "https://amazingren.github.io/Gaussian-JEPA",
      "code": "https://github.com/Amazingren/Gaussian-JEPA",
      "alphaxiv": "https://alphaxiv.org/abs/2608.15651"
    },
    "tags": [
      "3D/4D",
      "World Action Model",
      "机器人学习",
      "自监督与预测表征"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.15651v1/framework.png",
      "alt": "Gaussian-JEPA Fig. 2: multi-scale latent prediction on Gaussian tokens",
      "label": "Gaussian-JEPA，Fig. 2，1K Gaussian → 64 token，共享 context 预测多尺度目标块。来源：Fig. 2 原图 PNG",
      "paper_title": "Gaussian-JEPA: Joint-Embedding Predictive Learning for 3D Gaussian Splats",
      "source_url": "https://arxiv.org/html/2608.15651v1/framework.png"
    },
    "summary": "方法把监督对象从“这次采样的 14 维属性”改成“完整物体中被遮挡多尺度块的潜在表征”。Online encoder 只看 context；共享 EMA encoder 看完整 token 场，再按块索引提供目标。两个名为 geo/app 的互补投影与 VISReg 式 feature-space grounding 提供额外约束，但它们是对全部属性特征学出的视图，不是手工拆开的几何/外观通道。",
    "insight": "核心 Insight：**对物体级 Gaussian 资产做 JEPA——用可见 context 预测被挡住的多尺度 token 块表征，而不是重建某一次采样的 14 维属性。**\n\n这改变的是自监督目标：online encoder 只看 context；共享 EMA encoder 看完整 token 场再按块索引取目标；两个互补投影（名为 geo/app，但是对全部属性特征的学习视图，不是手工拆通道）加 VISReg 式 feature-space grounding。与本知识库 **间接相关**：它是 3DGS 表征学习，不输出动作、不做 rollout、不评机器人。可借鉴点是“预测潜空间而非重建观察实现”，以及重采样一致性这种对随机观察更敏感的评测，而不是只报分类。",
    "pipeline": {
      "input": "物体级 3DGS 资产 mathcalX=[C,O,S,R,SH]inmathbbR^N× 14；每次迭代先缓冲再无放回抽 p=1024 个 primitive。Centroid FPS 出 n=64 组、每组 KNN k=32，PointNet 式 tokenizer 得 D=384 token。",
      "process": "默认目标日程 s=[11,9,7,5]（32 个 target token + 32 个 context）。Online encoder 编码 context 一次；每个目标块由共享 EMA encoder 处理全场后索引。Predictor 用目标中心位置查询、不看目标 token 内容。mathcalL pred 为两路 SmoothL1；mathcalL ground 为两路 VISReg 加跨协方差惩罚；lambda=0.1。无输入空间解码器，损失不含 centroid/opacity/scale/rotation/SH。",
      "output": "预训练后的 Gaussian token 特征，供冻结检索、补全解码器、部件分割与分类微调。不是视频或控制指令。",
      "details": "- **输入：** 物体级 3DGS 资产 \\(\\mathcal{X}=[C,O,S,R,\\mathrm{SH}]\\in\\mathbb{R}^{N\\times 14}\\)；每次迭代先缓冲再无放回抽 \\(p=1024\\) 个 primitive。Centroid FPS 出 \\(n=64\\) 组、每组 KNN \\(k=32\\)，PointNet 式 tokenizer 得 \\(D=384\\) token。\n- **过程：** 默认目标日程 \\(\\mathbf{s}=[11,9,7,5]\\)（32 个 target token + 32 个 context）。Online encoder 编码 context 一次；每个目标块由共享 EMA encoder 处理全场后索引。Predictor 用目标中心位置查询、不看目标 token 内容。\\(\\mathcal{L}_{\\mathrm{pred}}\\) 为两路 SmoothL1；\\(\\mathcal{L}_{\\mathrm{ground}}\\) 为两路 VISReg 加跨协方差惩罚；\\(\\lambda=0.1\\)。无输入空间解码器，损失不含 centroid/opacity/scale/rotation/SH。\n- **输出：** 预训练后的 Gaussian token 特征，供冻结检索、补全解码器、部件分割与分类微调。不是视频或控制指令。\n\n与最近 baseline 的实质差异：相对 Gaussian-MAE，监督在 stop-gradient 潜空间而非原始属性；相对 Point-JEPA / 3D-JEPA，token 含 14 维 Gaussian 属性且目标块尺度异构。分类/分割里的点云数字来自文献原协议，作者已用 † 标明，不是同输入重跑。"
    },
    "experiments": "**作者主张：** 相对匹配的 Gaussian-MAE 预训练，潜空间预测在重采样一致性、部分观察检索和可渲染补全上更强，语义迁移有竞争力。\n\n实验实际支持：\n\n- **数据划分：** ShapeNet55-GS 预训练 51,934 / 测试 520（Gaussian-MAE 资产）；ModelNet10 3,991/908、ModelNet40 9,842/2,467，**ModelNet 物体不进预训练**；ShapeNet-Part 用官方划分。Objaverse 只用于补充 PCA 图，不进训练或主表。\n- **重采样一致性（ModelNet40-GS 全部 2,467 测试物体，五次独立 1K 采样，1 gallery + 4 query = 9,868）：** 相对 drift 0.3400→**0.2594**（相对降 23.7%），96.2% 物体上 drift 更低；R@1 92.95 vs 93.00（几乎持平），R@5 98.89→99.36。\n- **部分观察检索（缺组 0–85%）：** 55% 缺失时 R@1/R@5/R@10 = 39.82/65.28/75.95 vs MAE 的 19.80/39.02/49.14（+20.02 / +26.26 / +26.81）。30% 缺失时 R@1 仍高 10.56 点。\n- **ShapeNet55-GS 补全（半空间 crop 的 512 Gaussian → 预测独立 1K 完整采样；冻结 encoder + 相同解码器，三颗 decoder seed）：** CD 0.0732→0.0678（−7.4%），F1% 6.62→7.42；seed-0、50% 可见度渲染 PSNR 16.03→17.24、SSIM 0.7148→0.7469。\n- **ShapeNet-Part：** class/instance mIoU 84.5 / 86.1，相对 Gaussian-MAE +0.3 / +0.1。点云 Point-JEPA 文献数字为 83.9 / 85.8，协议不同。\n- **ModelNet 分类（相对 Gaussian-MAE）：** Full FT MN10/40 94.94/92.63（+0.78 / +0.09）；线性探针 93.72/90.47（+0.22 / +1.50）；MLP-3 探针 MN40 +2.55 至 90.27。冻结骨干上的 MN40 差距大于全微调。\n- **消融：** 单目标空间 93.06 LP / 90.85 R@1；双空间+特征 grounding 93.50 / 93.23；双空间若改回属性重建，R@1 掉到 88.18。\\(M=6\\) 最高 LP（93.83）但 R@1 降到 91.89；选 \\(M=4\\) 是折中。过大尺度差 \\(\\delta=2\\) 两指标都降。Centroid+covariance 的 R@1（94.14）高于全属性（93.23），全属性 LP 更高——外观有助于语义、不一律提高重采样稳定。\n\n**证据未支持：** 场景级/动态 3DGS；机器人转移；相对点云 SOTA 的严格公平超越（输入与协议不同）；分类全微调上的 MN40 +0.09 具有实际意义。",
    "evidence_notes": "",
    "code_data_status": "- **代码：** [Amazingren/Gaussian-JEPA](https://github.com/Amazingren/Gaussian-JEPA) 含预训练、分类、部件分割、补全与文档；许可证 **CC BY-SA 4.0**（不是 Apache）。\n- **数据：** 依赖 Gaussian-MAE 发布的 ShapeNet/ModelNet Gaussian 资产；完整复现需这些外部资产与作者预处理（centroid 单位球、opacity/scale/SH 规范化等）。\n- **权重：** README 指向下游结果文档；本次未逐一核验预训练 checkpoint 是否已全部上传。",
    "limitations": "- 仅物体级资产；作者自己把场景扩展留作后续。\n- 编码器固定 1K primitive，无法直接吃完整密集资产。\n- 分类全微调在 MN40 上与 MAE 几乎持平，主增益在冻结/部分观察设定。\n- geo/app 是学习视图，消融说明外观通道甚至可能损害重采样 R@1。\n- 与点云方法的表不是同输入协议。\n- 无控制、无时间、无动作；不能当作 JEPA world model 引用。\n\n---",
    "comments": "",
    "source_reports": [
      "report-af906c7fa2"
    ],
    "deleted": false,
    "updated_at": "2026-08-21",
    "challenges": "领域长期问题是：3DGS 正在成为可学习的原生 3D 输入，但实用编码器只能吃固定数量的 primitive。本文针对的是 **同一物体在固定预算重采样下观察实现不一致，以及 MAE 把监督绑在某一次采样的原始属性上**，不是机器人控制或视频世界模型。\n\n- **接口缺口：** 资产可能有数万 Gaussian，编码器预算 1K；独立重采样得到不同 primitive 集合。这不是设计好的语义增强，而是密集资产与固定预算编码器之间的观察噪声。\n- **现有 SSL 失败模式：** Gaussian-MAE 用输入空间解码器重建被 mask 组的 centroid/属性，目标绑死在当次采样；对比学习的不变性取决于所选视角/增强，且不显式监督缺失空间内容。\n- **Gaussian token 特有困难：** 每个 token 耦合几何、各向异性支撑、可见度与外观；缺失区域空间尺度不一；潜空间目标必须在不做属性重建时仍有信息。",
    "motivation": "核心 Insight：**对物体级 Gaussian 资产做 JEPA——用可见 context 预测被挡住的多尺度 token 块表征，而不是重建某一次采样的 14 维属性。**\n\n这改变的是自监督目标：online encoder 只看 context；共享 EMA encoder 看完整 token 场再按块索引取目标；两个互补投影（名为 geo/app，但是对全部属性特征的学习视图，不是手工拆通道）加 VISReg 式 feature-space grounding。与本知识库 **间接相关**：它是 3DGS 表征学习，不输出动作、不做 rollout、不评机器人。可借鉴点是“预测潜空间而非重建观察实现”，以及重采样一致性这种对随机观察更敏感的评测，而不是只报分类。",
    "technical_approach": "- **输入：** 物体级 3DGS 资产 \\(\\mathcal{X}=[C,O,S,R,\\mathrm{SH}]\\in\\mathbb{R}^{N\\times 14}\\)；每次迭代先缓冲再无放回抽 \\(p=1024\\) 个 primitive。Centroid FPS 出 \\(n=64\\) 组、每组 KNN \\(k=32\\)，PointNet 式 tokenizer 得 \\(D=384\\) token。\n- **过程：** 默认目标日程 \\(\\mathbf{s}=[11,9,7,5]\\)（32 个 target token + 32 个 context）。Online encoder 编码 context 一次；每个目标块由共享 EMA encoder 处理全场后索引。Predictor 用目标中心位置查询、不看目标 token 内容。\\(\\mathcal{L}_{\\mathrm{pred}}\\) 为两路 SmoothL1；\\(\\mathcal{L}_{\\mathrm{ground}}\\) 为两路 VISReg 加跨协方差惩罚；\\(\\lambda=0.1\\)。无输入空间解码器，损失不含 centroid/opacity/scale/rotation/SH。\n- **输出：** 预训练后的 Gaussian token 特征，供冻结检索、补全解码器、部件分割与分类微调。不是视频或控制指令。\n\n与最近 baseline 的实质差异：相对 Gaussian-MAE，监督在 stop-gradient 潜空间而非原始属性；相对 Point-JEPA / 3D-JEPA，token 含 14 维 Gaussian 属性且目标块尺度异构。分类/分割里的点云数字来自文献原协议，作者已用 † 标明，不是同输入重跑。",
    "discussion": "Gaussian-JEPA 把 3DGS SSL 的问题从“重建这次采样的属性”改成“预测被挡住块的表征”。重采样 drift、部分观察检索和冻结补全是比 MN40 全微调 +0.09 更贴题的证据。适用边界是物体级、静态 Gaussian 资产；不是 WAM，也不是场景理解基础模型。阅读判断：若课题做 3D/4D 观察噪声下的表征，这篇有方法对照价值；不要把它写成世界模型，也不要把 geo/app 两个投影名理解成已经解耦几何与外观。",
    "arxiv": {
      "published": "2026-08-16T09:43:50Z",
      "revised_at": "2026-08-16T09:43:50Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2608-24714",
    "title": "GaussianWAM: Distilling Geometry and Semantics from 3D Gaussian Fields into World-Action Models",
    "authors": [
      "Zijian Zhang",
      "Yuqing Jiang",
      "Weitao Zhou",
      "Minglei Li",
      "Jinhao Zhang",
      "Yao Mu",
      "Xiaofan Li",
      "Hao Zhao",
      "Haibao Yu"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本（首发 2026-08-25）",
    "arxiv_id": "2608.24714",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.24714",
      "code": "https://github.com/TuojingAI/GaussianWAM",
      "alphaxiv": "https://alphaxiv.org/abs/2608.24714"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "机器人学习",
      "流式与自回归",
      "第一视角与人类视频",
      "长时记忆"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.24714v1/assets/framework_gaussian4X.drawio.png",
      "alt": "GaussianWAM Fig. 2：3D Gaussian teacher 到 WAM 的蒸馏框架",
      "label": "GaussianWAM Fig. 2：训练期构建 3D Gaussian teacher，并向 WAM 蒸馏语义、深度、覆盖率和有效区域监督。来源：Fig. 2 原图",
      "paper_title": "GaussianWAM: Distilling Geometry and Semantics from 3D Gaussian Fields into World-Action Models",
      "source_url": "https://arxiv.org/html/2608.24714v1/assets/framework_gaussian4X.drawio.png"
    },
    "summary": "WAM 的视频潜在表示主要为视觉预测优化，不显式保持跨视角几何结构与空间局部的对象相关语义。GaussianWAM 的 Insight： 用 3D Gaussian field 作为组织几何与语义监督的中间载体 ——冻结几何/视觉基础模型提供深度、相机参数与密集语义特征，绑定到共享 Gaussian 基元上，渲染出空间对齐的语义、深度、覆盖目标，蒸馏进 WAM 的当前观测表示。所有教师模型、Gaussian 组件在训练后可丢弃，测试期不增开销。",
    "insight": "WAM 的视频潜在表示主要为视觉预测优化，不显式保持跨视角几何结构与空间局部的对象相关语义。GaussianWAM 的 Insight：**用 3D Gaussian field 作为组织几何与语义监督的中间载体**——冻结几何/视觉基础模型提供深度、相机参数与密集语义特征，绑定到共享 Gaussian 基元上，渲染出空间对齐的语义、深度、覆盖目标，蒸馏进 WAM 的当前观测表示。所有教师模型、Gaussian 组件在训练后可丢弃，测试期不增开销。",
    "pipeline": {
      "input": "同步多视角观测。",
      "process": "几何/语义特征提取 → Gaussian 场初始化与多视角拟合 → 离线条理缓存（offline teacher cache）→ 渲染对齐的语义/深度/覆盖目标 → 蒸馏进当前观测表示（FastWAM-Style / Cosmos-Policy-Style 主干）。",
      "output": "几何与语义增强的 WAM 表示，用于机器人操作。",
      "details": "**输入**：同步多视角观测。\n**过程**：几何/语义特征提取 → Gaussian 场初始化与多视角拟合 → 离线条理缓存（offline teacher cache）→ 渲染对齐的语义/深度/覆盖目标 → 蒸馏进当前观测表示（FastWAM-Style / Cosmos-Policy-Style 主干）。\n**输出**：几何与语义增强的 WAM 表示，用于机器人操作。"
    },
    "experiments": "在 LIBERO、LIBERO-Plus、RoboTwin 与真机操作上评估；消融覆盖 Gaussian 场统一的效果、Gaussian 监督各组件贡献。证据等级：论文实验直接支持其训练期表示增强有效性；跨环境数字未逐项复核。",
    "evidence_notes": "",
    "code_data_status": "代码已在 [GitHub](https://github.com/TuojingAI/GaussianWAM) 公开，可复现其 LIBERO/RoboTwin 流程。",
    "limitations": "- 需要同步多视角 + 冻结基础模型的深度/相机，训练数据准备成本高；\n- Gaussian 监督对未见过的物体/场景的泛化未充分论证；\n- 训练期开销与真机样本效率的权衡。\n\n### 与知域的关系\n与知域 GeoSem-WAM（几何语义感知 WAM）、GWM-VLA 直接同源，是\"几何语义监督注入 WAM\"一族的又一实证，可与已收录条目做交叉比对。",
    "comments": "",
    "source_reports": [
      "report-a141624b1e"
    ],
    "deleted": false,
    "updated_at": "2026-08-31",
    "arxiv": {
      "published": "2026-08-25T15:34:13Z",
      "revised_at": "2026-08-25T15:34:13Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2609-05588",
    "title": "GE-Act 2.0: Pretraining and Scaling a World-Action Model for Robotic Manipulation",
    "authors": [
      "AgiBot Research Team",
      "Renhang Liu",
      "Wenzhi Zhao",
      "Zhuo Yang",
      "Liliang Chen",
      "Pengfei Zhou",
      "Shengcong Chen",
      "Guanghui Ren",
      "Youlun Peng",
      "Rongjun Jin",
      "Nan Wang",
      "Sukai Wang",
      "Xindong He",
      "Jinyuan Feng",
      "Ziyu Xiong",
      "Linqing Zhong",
      "Yifei Wei",
      "Feng Han",
      "Long Zhang",
      "Da Huang",
      "Nanshu Zhao",
      "Chenghao Yin",
      "Mo Wu",
      "Zhaodong Yan",
      "Kongtao Hu",
      "Yuxiang Yan",
      "Aogelijiang Niyazi",
      "Yu Fang",
      "Jia Zeng",
      "Lizhu Meng",
      "Daizhen Lv",
      "Haoyu Cao",
      "Zhiwen Hou",
      "Lianjin Ye",
      "Yuehan Niu",
      "Zhikai Cai",
      "Xuan Hu",
      "Hui Min",
      "Xiongfeng Cai",
      "Yue Liao",
      "Jing Wu",
      "Soujanya Poria",
      "Ye Li",
      "Sanping Zhou",
      "Maoqing Yao"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本，v1",
    "arxiv_id": "2609.05588",
    "doi": "10.48550/arXiv.2609.05588",
    "links": {
      "paper": "https://arxiv.org/abs/2609.05588",
      "project": "https://ge-act-v2.github.io/",
      "alphaxiv": "https://alphaxiv.org/abs/2609.05588"
    },
    "tags": [
      "World Action Model",
      "机器人学习",
      "跨本体迁移",
      "预训练与扩展律"
    ],
    "figure": {
      "url": "content/images/2609.05588-representative.webp",
      "alt": "Figure 1",
      "label": "Figure 1",
      "paper_title": "GE-Act 2.0: Pretraining and Scaling a World-Action Model for Robotic Manipulation",
      "source_url": "https://arxiv.org/html/2609.05588v1#S3.F1"
    },
    "summary": "GE-Act 2.0 声称是可规模化 WAM 预训练路线：生成与动作组件全部在操作数据上从零初始化（不继承视频生成先验），由三部分组成——控制导向自编码器（CoAE）、单步视觉规划器（SVP）与逆动力学模型（IDM）。CoAE 在激进压缩下保留动作与指令相关信息；SVP 可微单步生成完整未来状态，使视觉规划与逆动力学能在互补数据上分别预训练；之后用知识对齐选择性优化（KASO）联合训练，只选择与记录动作行为兼容的预测未来，减少错配监督。在 100 任务/20 技能组、held-out 场景/背景/光照/物体实例上直接评估预训练 checkpoint（无 per-task 微调）。共训数据从 300 小时扩到 30,000 小时，G1-OP 成功率 17.1%→44.1%，G2-90D 13.4%→31.1%；G2-90D 仅占共训数据不到 2% 却提升 17.7 点，作者解读为跨本体迁移信号。",
    "insight": "GE-Act 2.0 声称是可规模化 WAM 预训练路线：生成与动作组件全部在操作数据上从零初始化（不继承视频生成先验），由三部分组成——控制导向自编码器（CoAE）、单步视觉规划器（SVP）与逆动力学模型（IDM）。CoAE 在激进压缩下保留动作与指令相关信息；SVP 可微单步生成完整未来状态，使视觉规划与逆动力学能在互补数据上分别预训练；之后用知识对齐选择性优化（KASO）联合训练，只选择与记录动作行为兼容的预测未来，减少错配监督。在 100 任务/20 技能组、held-out 场景/背景/光照/物体实例上直接评估预训练 checkpoint（无 per-task 微调）。共训数据从 300 小时扩到 30,000 小时，G1-OP 成功率 17.1%→44.1%，G2-90D 13.4%→31.1%；G2-90D 仅占共训数据不到 2% 却提升 17.7 点，作者解读为跨本体迁移信号。",
    "pipeline": {
      "input": "操作数据（观测+指令+动作），规模 300→30,000 小时。",
      "process": "CoAE 压缩观测/指令到信息密集潜在空间 → SVP 单步预测完整未来状态 → IDM 从预测未来反解动作 → 分阶段预训练（视觉规划与逆动力学分离）→ KASO 联合微调（只保留行为兼容的预测未来）。",
      "output": "可直接部署的 WAM 策略（无 per-task 微调）。",
      "details": "**输入**：操作数据（观测+指令+动作），规模 300→30,000 小时。\n**过程**：CoAE 压缩观测/指令到信息密集潜在空间 → SVP 单步预测完整未来状态 → IDM 从预测未来反解动作 → 分阶段预训练（视觉规划与逆动力学分离）→ KASO 联合微调（只保留行为兼容的预测未来）。\n**输出**：可直接部署的 WAM 策略（无 per-task 微调）。"
    },
    "experiments": "正文表 2 给出受控 KASO 消融：相同预训练组件、相同 300 小时连接/对齐数据下，四物体抓取宏平均由 E2E 的 27.5% 和 E2E+PT 的 22.5% 提升至 37.5%；单物体拾取由 12% 提升至 40%。四物体每目标 10 次、单物体 25 次。表 3 的 RoboTwin Clean-to-Random 中，GE-Act 2.0 的 Hard 为 60.52%，对比 π0.5 的 47.90%，但 Light 项低于 π0.5（65.92% 对 69.20%）。这支持特定训练设计和 OOD 收益，不能概括为所有维度均领先；预训练规模曲线与少量跨本体数据收益还需区分总数据量和配方的作用。 [正文实验与表格](https://arxiv.org/html/2609.05588v1)。",
    "evidence_notes": "2026-09-14 已核对 arXiv 元数据、正文主要实验与对照；未运行复现实验。",
    "code_data_status": "arXiv 页面未发现公开代码/模型/数据链接。作为技术报告，若 AgiBot 后续开源将大幅提升可复现性；当前公开内容不足以复现扩展律实验。",
    "limitations": "分阶段预训练与连接训练的预算需要分开计算；KASO 受控拾取实验样本量较小，宏平均提升不能直接替代跨任务、跨本体的独立验证。",
    "comments": "",
    "source_reports": [
      "report-37b94c4145"
    ],
    "deleted": false,
    "updated_at": "2026-09-14",
    "discussion": "WAM 预训练与扩展律的直接证据，与馆藏 Dyna-2（百万小时扩展律）互补——Dyna-2 回答「数据多大」，GE-Act 2.0 回答「从零怎么训、信号怎么选」。KASO 的「选择行为兼容的未来」与知域关注的世界模型可靠性直接相关。",
    "arxiv": {
      "published": "2026-09-04T17:16:48Z",
      "revised_at": "2026-09-04T17:16:48Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "paper-5299527392",
    "title": "GEN-1.5: Embodied Foundation Models are One-Shot Learners",
    "authors": [
      "Generalist Team"
    ],
    "year": 2026,
    "publication": "2026-08-19，Generalist AI Blog 官方研究长文；无 arXiv ID、DOI 或 PDF，未核验同行评审",
    "arxiv_id": "",
    "doi": "",
    "links": {
      "paper": "https://generalistai.com/blog/gen-1.5"
    },
    "tags": [
      "VLA",
      "World Action Model",
      "具身上下文学习",
      "物理建模与仿真",
      "适应与泛化",
      "长时记忆",
      "预训练与扩展律"
    ],
    "figure": {
      "url": "https://generalistai.com/assets/pages/blog/gen-1.5/assets/images/generalist-gen1p5-og.jpg",
      "alt": "GEN-1.5 physical prompting",
      "label": "GEN-1.5 官方文章封面。来源：官方图片",
      "paper_title": "GEN-1.5: Embodied Foundation Models are One-Shot Learners",
      "source_url": "https://generalistai.com/assets/pages/blog/gen-1.5/assets/images/generalist-gen1p5-og.jpg"
    },
    "summary": "GEN-1.5 的关键概念是 physical prompting：把一段包含 sensor data 与 action trajectories 的例子插入 30 秒 context window，剩余空间滚动接收当前观察；模型立即以 100 Hz 输出动作。示范通常由人手持一对 grippers 记录，也可以来自机器人或模拟器，因此比纯 RGB 人类视频拥有更直接的 action/embodiment 接口。作者称 ICL 并非显式 meta-learning、辅助目标或特制 prompt packing 的产物，而是大规模连续物理预训练中自然涌现。",
    "insight": "GEN-1.5 的关键概念是 physical prompting：把一段包含 sensor data 与 action trajectories 的例子插入 30 秒 context window，剩余空间滚动接收当前观察；模型立即以 100 Hz 输出动作。示范通常由人手持一对 grippers 记录，也可以来自机器人或模拟器，因此比纯 RGB 人类视频拥有更直接的 action/embodiment 接口。作者称 ICL 并非显式 meta-learning、辅助目标或特制 prompt packing 的产物，而是大规模连续物理预训练中自然涌现。\n\n这篇长文同时讨论两种不同能力：zero-gradient physical prompting 和用 1–10 个 gradient steps 的 few-shot adaptation。前者才是严格 ICL；后者会改变模型权重，作者也把它类比 test-time training。两套数值不能合并成同一种 one-shot 结果。",
    "pipeline": {
      "input": "3–12 秒单条 sensorimotor demonstration、滚动视频记忆，以及其他传感、语言和本体输入；也可拼接两条 physical prompts。",
      "process": "一个从头训练的大型多模态模型在连续物理交互片段上预训练超过 8 个月；ICL 模式只改变 context buffer。few-step 模式则从 1–5 分钟、约 10–50 条示范采样序列，用接近预训练的超参数做 1–10 次梯度更新。",
      "output": "100 Hz action trajectories；官方未披露 action space、机器人平台数量、参数量、训练数据小时数和实时延迟。",
      "details": "- **输入**：3–12 秒单条 sensorimotor demonstration、滚动视频记忆，以及其他传感、语言和本体输入；也可拼接两条 physical prompts。\n- **过程**：一个从头训练的大型多模态模型在连续物理交互片段上预训练超过 8 个月；ICL 模式只改变 context buffer。few-step 模式则从 1–5 分钟、约 10–50 条示范采样序列，用接近预训练的超参数做 1–10 次梯度更新。\n- **输出**：100 Hz action trajectories；官方未披露 action space、机器人平台数量、参数量、训练数据小时数和实时延迟。"
    },
    "experiments": "1. **十项 short-horizon 新任务的 one-shot/few-shot 主结果。** 任务含开罐、拉拉链、从钱包取钱等。3–12 秒单示范、0 梯度的 physical prompt 平均成功率 59%±10%；5 分钟/任务、约 50 条示范、10 gradient steps 为 83%±9%。作者承认任务简单、短时且 one-shot 仍较脆弱。标准差看起来是跨任务离散度，不等同独立训练种子的置信区间；每任务试验数和 baseline 未披露。\n2. **少步梯度适应。** 1–10 步即可提高 held-out task；10 步后权重相对初始变化不足 0.15%。极端 1-step、1 分钟数据的一个 held-out task 成功率 66.5%，更大 batch 和学习率更好；作者没有调参或系统 sweep。它支持预训练表征对新任务高度可塑，但只有一个任务的 1-step 数值，且这不是 frozen-weight ICL。\n3. **prompt composition。** 将“解开铅笔袋”和“取出钱”两条独立示范同时放入 context，模型按顺序连接为一个行为，并自行生成重定位、重抓与恢复动作。该案例说明 context 可以规定组合而非逐轨迹复刻，但只有展示，没有组合任务成功率、顺序交换或错误组合对照。\n4. **zero-shot sim-to-real physical prompt。** 模型预训练不含模拟数据，任务也没有在模拟或真实环境训练；把模拟器 rollout 放进 context 后，真机执行，并对手型、物体位置和尺寸变化有一定泛化。这是很强的跨域案例，但页面未给任务数、成功率或 simulator mismatch 分层，不能外推为一般 sim-to-real 方法。\n5. **human-to-robot ICL。** 部分任务由人在机器人相机前直接用手展示，机器人随后复现。官方只称 “in some cases”，没有系统指标；因此它证明存在成功样例，证据强度低于 HOST 的 50-task/20-trial protocol。\n6. **预训练 scaling 与涌现过程。** 文章展示连续 8 个月、三个训练阶段的 held-out next-action error 持续下降，并描述适应从数百步逐渐降到 10 步、1 步、最终 0 步；但图没有公开数据规模、compute、模型版本或重复训练，不能建立可复核 scaling law，也不能确定 ICL 是何时、由何变量涌现。\n7. **物理泛化与即兴策略。** 5 分钟人类示范、1–10 步微调后的模型会用香蕉当刷子、用簸箕铲块、移开遮挡、双手旋盖、换手操作，并泛化到新杯瓶。最近邻语言检索覆盖 1,891,392 scenes，作者称未找到相同策略。这些展示主要属于 lightly fine-tuned models，不应被误写成 one-shot ICL 的量化证据；最近邻检索也不能证明预训练中绝无视觉/行为近邻。",
    "evidence_notes": "",
    "code_data_status": "官方只披露 30 秒 memory、100 Hz action、连续预训练超过 8 个月、10 项 ICL 均值和少步数据预算。参数量、训练总小时、数据分布、机器人/手型构成、去污染、任务明细、trial 数、评分规则、代码、权重和 benchmark 都未公开。当前可将其作为重要 capability report，而非可复现实验论文。",
    "limitations": "59% 平均值意味着 one-shot 仍有明显失败；30 秒 context 对更长任务如何保存 prompt、是否会被滚动观察挤出没有说明。短任务和 S1 的 4–10 分钟任务不能直接比较；physical prompt 含动作轨迹，与 Zero-WAM/HOST 的纯人类 RGB 视频也不是同等信息预算。组合、sim-to-real、人到机器人和工具即兴多为视频案例，缺少分母。few-step 结果与 ICL 混在同一发布中容易造成概念混淆，入库必须分别标注。\n\n### 与知域的关系\n\nGEN-1.5 展示了“上下文适应—极少步参数适应”的连续谱，并提供 sensorimotor prompt、prompt composition 与 sim-to-real 三种独特接口。它是能力信号很强、公开可审计性较弱的公司技术发布。",
    "comments": "",
    "source_reports": [
      "report-1950a5754f"
    ],
    "deleted": false,
    "updated_at": "2026-09-02"
  },
  {
    "id": "arxiv-2601-04090",
    "title": "Gen3R: 3D Scene Generation Meets Feed-Forward Reconstruction",
    "authors": [
      "Jiaxin Huang",
      "Yuanbo Yang",
      "Bangbang Yang",
      "Lin Ma",
      "Yuewen Ma",
      "Yiyi Liao"
    ],
    "year": 2026,
    "publication": "2026，CVPR 2026（官方项目标注）",
    "arxiv_id": "2601.04090",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2601.04090",
      "project": "https://xdimlab.github.io/Gen3R/",
      "code": "https://github.com/JaceyHuang/Gen3R",
      "model": "https://huggingface.co/JaceyH919/Gen3R",
      "alphaxiv": "https://alphaxiv.org/abs/2601.04090"
    },
    "tags": [
      "3D/4D",
      "世界模型"
    ],
    "figure": {
      "url": "content/images/2601.04090-main.webp",
      "alt": "Figure 2：方法总览",
      "label": "Figure 2 · 方法总览",
      "paper_title": "Gen3R: 3D Scene Generation Meets Feed-Forward Reconstruction",
      "source_url": "https://arxiv.org/html/2601.04090v2/fig/pipeline/gen3r_method_v7.png"
    },
    "summary": "Gen3R 将重建模型的中间表示改造成几何潜空间，让视频生成先验与几何重建先验在采样过程中交互。关键不是事后增加深度输出，而是在保留外观、几何两个解码通道的同时联合生成它们。",
    "insight": "Gen3R 将重建模型的中间表示改造成几何潜空间，让视频生成先验与几何重建先验在采样过程中交互。关键不是事后增加深度输出，而是在保留外观、几何两个解码通道的同时联合生成它们。\n\n## 核心 Insight\n\n几何潜变量不必从昂贵的完整 3D 真值重新学起：可以压缩 VGGT 多层 token，并用外观 latent 的分布约束使其适合扩散。论文的两阶段串联对照与移除分布对齐消融支持这一设计；它仍依赖几何教师，不能解释为无几何先验的纯 RGB 学习。",
    "pipeline": {
      "input": "单张图、首尾两张图或完整图像序列，可选文本与相机条件；重建评测不提供相机条件。",
      "process": "VGGT 四层 token → 几何 adapter 编解码与分布对齐 → 与 Wan 外观 latent 联合去噪 → 分别解码图像和几何。",
      "output": "RGB 视频、相机参数、深度与全局点云；最终几何采用深度结合预测相机反投影。该输出不是原生带纹理 mesh 或 3DGS。",
      "details": "**输入**：单张图、首尾两张图或完整图像序列，可选文本与相机条件；重建评测不提供相机条件。\n\n**过程**：VGGT 四层 token → 几何 adapter 编解码与分布对齐 → 与 Wan 外观 latent 联合去噪 → 分别解码图像和几何。\n\n**输出**：RGB 视频、相机参数、深度与全局点云；最终几何采用深度结合预测相机反投影。该输出不是原生带纹理 mesh 或 3DGS。\n\n**第一阶段：几何压缩。**从 VGGT 第 4、11、17、23 层读取 2048 维特征，经 adapter 映射到与 Wan VAE 相同的时空大小和通道维度，再映射回几何 token。重建目标同时约束 token、自带相机头、深度头和点图头的输出，以保留原有几何能力；KL 项将几何分布对齐到预训练外观 latent 分布。监督主要来自教师预测，不要求所有训练集都有完整 3D 真值。\n\n**第二阶段：联合生成。**将外观与几何 latent 沿宽度拼接，微调相机条件 Wan2.1。训练均匀采样单图、首尾双图、全序列三种输入模式，图像掩码标识已观测位置；相机条件以 50% 概率丢弃。已知的几何 latent 不作为额外条件，因此推理仍从图像进入。生成器与 adapter 分开训练，不能把此处“统一”理解成一个无压缩的端到端像素目标。\n\n**训练规模。**十个数据集混合提供超过 30 万场景，覆盖室内外、对象、驾驶及合成数据。adapter 先用 25 帧训练 15K 步，再用 49 帧训练 6K 步；生成器用 49 帧、560×560、24 张 H20 微调 8K 步。RE10K 使用官方划分，其余数据集随机约 90% 训练、10% 测试。\n\n[方法与训练设置](https://arxiv.org/html/2601.04090v2#S3)"
    },
    "experiments": "外观评测从 RE10K、DL3DV 各取 200 段序列；几何评测从 Co3Dv2、WildRGB-D 各取 300 段，TartanAir 取 80 段。点云先做 Umeyama 对齐，再各采样 20K 点，报告 Accuracy、Completeness 和 CD。生成任务给定相机，完整序列重建则不给相机，两个任务的分数不能混用。\n\n| 设置 | Gen3R | 对照 | 解释 |\n| --- | --- | --- | --- |\n| 单图生成，RE10K PSNR / LPIPS | 20.51 / 0.2281 | Gen3C 20.26 / 0.2302 | 保真度小幅改善，需结合几何评价 |\n| 双图生成，RE10K PSNR | 27.05 | LVSM 29.58 | 统一模型并未全面超过专用视图合成 |\n| 单图生成，Co3Dv2 CD | 1.1047 | VGGT 2.3561 | 完整度改善；VGGT 的点云 Accuracy 反而更好 |\n| 全序列重建，TartanAir CD | 1.5101 | VGGT 1.5957 | 生成先验在此设置改善综合几何误差 |\n| 全序列重建，WildRGB-D CD | 0.1260 | VGGT 0.1165 | 优势不是跨数据集一致成立 |\n\n单图 Co3Dv2 中，Gen3R 的 Accuracy / Completeness 为 0.8284 / 1.3811，VGGT 为 0.3291 / 4.3830。Accuracy 衡量预测点到真值表面的距离，并非单独对可见区域计算；更完整带来的 CD 收益不等于表面精度同步提高。消融还比较了同训练数据下的“视频生成后接 VGGT”与去掉 KL 对齐：联合采样改善外观、几何及相机控制；潜空间失配则阻碍收敛。\n\n[表 1–5 与评测协议](https://arxiv.org/html/2601.04090v2#S4)",
    "evidence_notes": "已核验原文方法、实验表格与官方资源；未独立复现实验",
    "code_data_status": "官方 GitHub 提供训练、推理与几何 adapter 代码，Hugging Face 提供模型；项目标注 CVPR 2026。WVD 在论文比较时由作者重实现，不能默认与后续官方版本完全等价。本次核验了公开入口，没有下载运行模型。",
    "limitations": "几何教师可能把系统误差带入潜空间；点云经对齐后的评价不证明绝对尺度正确。生成包含多步去噪，“feed-forward”不等于单次网络前向或实时；完整 mesh 的拓扑、碰撞面与物理参数也不在输出保证内。论文主要论证多视角场景生成，不应把沿相机轨迹的视频直接称为对象动态 4D 世界。",
    "comments": "",
    "source_reports": [],
    "deleted": false,
    "updated_at": "2026-09-24",
    "challenges": "先生成视频再交给重建器，可能累积跨视图不一致；直接把 RGB VAE 用于点云压缩，又容易丢失几何。VGGT 已经学习了相机、深度与点图的联合特征，但高维几何 token 的分辨率和统计分布都不适合直接送入预训练视频扩散模型。",
    "motivation": "Gen3R 将重建模型的中间表示改造成几何潜空间，让视频生成先验与几何重建先验在采样过程中交互。关键不是事后增加深度输出，而是在保留外观、几何两个解码通道的同时联合生成它们。\n\n## 核心 Insight\n\n几何潜变量不必从昂贵的完整 3D 真值重新学起：可以压缩 VGGT 多层 token，并用外观 latent 的分布约束使其适合扩散。论文的两阶段串联对照与移除分布对齐消融支持这一设计；它仍依赖几何教师，不能解释为无几何先验的纯 RGB 学习。",
    "technical_approach": "**输入**：单张图、首尾两张图或完整图像序列，可选文本与相机条件；重建评测不提供相机条件。\n\n**过程**：VGGT 四层 token → 几何 adapter 编解码与分布对齐 → 与 Wan 外观 latent 联合去噪 → 分别解码图像和几何。\n\n**输出**：RGB 视频、相机参数、深度与全局点云；最终几何采用深度结合预测相机反投影。该输出不是原生带纹理 mesh 或 3DGS。\n\n**第一阶段：几何压缩。**从 VGGT 第 4、11、17、23 层读取 2048 维特征，经 adapter 映射到与 Wan VAE 相同的时空大小和通道维度，再映射回几何 token。重建目标同时约束 token、自带相机头、深度头和点图头的输出，以保留原有几何能力；KL 项将几何分布对齐到预训练外观 latent 分布。监督主要来自教师预测，不要求所有训练集都有完整 3D 真值。\n\n**第二阶段：联合生成。**将外观与几何 latent 沿宽度拼接，微调相机条件 Wan2.1。训练均匀采样单图、首尾双图、全序列三种输入模式，图像掩码标识已观测位置；相机条件以 50% 概率丢弃。已知的几何 latent 不作为额外条件，因此推理仍从图像进入。生成器与 adapter 分开训练，不能把此处“统一”理解成一个无压缩的端到端像素目标。\n\n**训练规模。**十个数据集混合提供超过 30 万场景，覆盖室内外、对象、驾驶及合成数据。adapter 先用 25 帧训练 15K 步，再用 49 帧训练 6K 步；生成器用 49 帧、560×560、24 张 H20 微调 8K 步。RE10K 使用官方划分，其余数据集随机约 90% 训练、10% 测试。\n\n[方法与训练设置](https://arxiv.org/html/2601.04090v2#S3)",
    "discussion": "**阅读者分析**：Gen3R 的关键价值在于明确展示“重建 token 可以成为生成变量”。与 GAE 的几何原生 codec、PixWorld 的像素空间渲染监督相比，它选择保留预训练外观 latent 并对齐几何分支，兼顾复用强视频先验与多种几何输出。选型时应同时考虑可见面精度、完整度、输出格式和采样成本。",
    "arxiv": {
      "published": "2026-01-07",
      "revised_at": "2026-03-23",
      "primary_category": "cs.CV"
    },
    "source_papers": [
      "content/papers/2601.04090.md"
    ]
  },
  {
    "id": "arxiv-2608-06332",
    "title": "GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions",
    "authors": [
      "Chenghao Gu",
      "Hanyang Yu",
      "Jingbo Zhang",
      "Haitao Lin",
      "Wenyao Zhang",
      "Jinghe Wang",
      "Hanglei Jin",
      "Shuzhao Xie",
      "Jingyan Jiang",
      "Zhi Wang"
    ],
    "year": 2026,
    "publication": "2026，arXiv preprint",
    "arxiv_id": "2608.06332",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.06332",
      "project": "https://chenghaogu.github.io/GeniWorld/",
      "alphaxiv": "https://alphaxiv.org/abs/2608.06332"
    },
    "tags": [
      "3D/4D",
      "世界模型",
      "动作表征",
      "因果与反事实",
      "机器人学习",
      "跨本体迁移"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.06332/x1.png",
      "alt": "GeniWorld Fig. 1",
      "label": "GeniWorld，Fig. 1，视觉动作条件与闭环交互总览。来源：Fig. 1 原图",
      "paper_title": "GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions",
      "source_url": "https://arxiv.org/html/2608.06332/x1.png"
    },
    "summary": "GeniWorld 用 URDF 渲染把实施体运动学显式移出环境动力学学习：模型看到“机器人将在图像中怎样运动”，只需预测环境如何响应。目标是让少量固定场景数据训练的模型支持 OOD rollout、闭环人机交互、策略评估与合成轨迹。",
    "insight": "GeniWorld 用 URDF 渲染把实施体运动学显式移出环境动力学学习：模型看到“机器人将在图像中怎样运动”，只需预测环境如何响应。目标是让少量固定场景数据训练的模型支持 OOD rollout、闭环人机交互、策略评估与合成轨迹。",
    "pipeline": {
      "input": "初始/历史观测、数值动作、URDF、运动学与相机参数、语言和训练期未来视频。",
      "process": "数值动作经正向运动学渲染为不含物体/背景的视觉动作；视频和动作由 causal 3D VAE 编码并按通道拼成 96-channel latent。Wan2.2-TI2V-5B causal DiT 仅对视频 latent 加噪，以 flow matching 预测；训练逐渐以生成帧替换真实上下文，推理用 KV cache 闭环。",
      "output": "与动作一致的未来 RGB、可反馈给策略的交互环境，以及合成 observation–action trajectories。",
      "details": "- **输入：** 初始/历史观测、数值动作、URDF、运动学与相机参数、语言和训练期未来视频。\n- **过程：** 数值动作经正向运动学渲染为不含物体/背景的视觉动作；视频和动作由 causal 3D VAE 编码并按通道拼成 96-channel latent。Wan2.2-TI2V-5B causal DiT 仅对视频 latent 加噪，以 flow matching 预测；训练逐渐以生成帧替换真实上下文，推理用 KV cache 闭环。\n- **输出：** 与动作一致的未来 RGB、可反馈给策略的交互环境，以及合成 observation–action trajectories。"
    },
    "experiments": "RoboTwin2.0 50 任务，Clean 每任务 45 train/5 test；Clean-to-Random 零适配使用 250 Random episodes。Clean-to-Random 的数值动作与 GeniWorld 分别为 LPIPS 0.3659/0.144、FID 40.91/13.08、FVD 53.69/20.15、EWMScore 51.49/63.54；ControlNet-style 视觉条件 FVD 59.95，说明表示与 latent 拼接方式都重要。\n\n5-step、单 H20、480×640 闭环约 8 Hz；作者称相对 50-step 约 10× 加速且 FVD 只退化约 2%。世界模型训练用 4×H20，但未报告总步数/GPU-hours。合成数据实验每任务 25 real + 65 spatial + 65 diverse；四任务、五设置、共 1,200 次物理试验。仅真实数据 overall 40.8%，加入两类生成数据为 69.0%；但初始图像编辑与世界模型 rollout 同时变化，归因没有完全隔离。策略评估未报告相关系数和置信区间。",
    "evidence_notes": "",
    "code_data_status": "论文与项目页公开；未核验到代码、权重、真实数据或完整训练配置。RoboTwin、Wan2.2 和 OpenPI 是外部资源，不等于 GeniWorld 已开源。",
    "limitations": "- 真实实验仅双臂 Xtrainer，跨本体未验证。\n- 依赖 URDF、正向运动学和相机标定。\n- 策略评估没有公开相关系数与统计区间。\n- 合成数据收益未隔离图像编辑和世界模型 rollout。\n- 真实任务与视角覆盖有限，缺少力学状态。",
    "comments": "",
    "source_reports": [
      "report-a77d9a7ad6"
    ],
    "deleted": false,
    "updated_at": "2026-08-21",
    "challenges": "数值动作缺乏像素空间锚定，视频模型需同时学习机器人运动学和环境响应，容易在新背景、物体与布局中过拟合。现实中扩展训练/评估环境昂贵，传统图像增强又不能产生新的可交互行为。",
    "motivation": "GeniWorld 用 URDF 渲染把实施体运动学显式移出环境动力学学习：模型看到“机器人将在图像中怎样运动”，只需预测环境如何响应。目标是让少量固定场景数据训练的模型支持 OOD rollout、闭环人机交互、策略评估与合成轨迹。",
    "technical_approach": "- **输入：** 初始/历史观测、数值动作、URDF、运动学与相机参数、语言和训练期未来视频。\n- **过程：** 数值动作经正向运动学渲染为不含物体/背景的视觉动作；视频和动作由 causal 3D VAE 编码并按通道拼成 96-channel latent。Wan2.2-TI2V-5B causal DiT 仅对视频 latent 加噪，以 flow matching 预测；训练逐渐以生成帧替换真实上下文，推理用 KV cache 闭环。\n- **输出：** 与动作一致的未来 RGB、可反馈给策略的交互环境，以及合成 observation–action trajectories。",
    "discussion": "GeniWorld 对视觉动作的生成质量与合成数据价值给出较强证据，尤其是 Clean-to-Random 和真实策略改进；但“generalizable”目前主要指场景 OOD，不是跨机器人零样本。输出仍是视觉状态，没有力、触觉或碰撞保证。",
    "arxiv": {
      "published": "2026-08-06T17:40:32Z",
      "revised_at": "2026-08-06T17:40:32Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "arxiv": {
      "published": "2026-05-18T13:17:08Z",
      "revised_at": "2026-05-18T13:17:08Z",
      "primary_category": "cs.CV"
    },
    "arxiv_id": "2605.18365",
    "authors": [
      "Jan Ackermann",
      "Shengqu Cai",
      "Boyang Deng",
      "Zhengfei Kuang",
      "Songyou Peng",
      "Gordon Wetzstein"
    ],
    "code_data_status": "- **代码**：GitHub 已公开，包含 sampler、evaluation scripts、reward server、tests、第三方子模块说明。\n- **模型**：Hugging Face 发布 GeoFlow LoRA adapter；模型卡显示是基于 `wan-ai/Wan2.1-T2V-1.3B-Diffusers` 的 PEFT LoRA。\n- **数据**：论文说明 evaluation prompts 来自 OpenVid-1M / DL3DV 并经 Gemini 标准化；仓库含 `eval_data`，但训练 prompt 全量细节需要以仓库实际发布为准。",
    "comments": "",
    "deleted": false,
    "doi": "",
    "evidence_notes": "",
    "experiments": "- GeoFlow 在 static / dynamic、simple / complex 四类设置下整体降低几何错误。\n- 它并非简单提升画质，而是针对几何与时序一致性有针对性改善。\n- 消融显示：几何结构奖励与 DINO semantic consistency reward 互补；只做 SFT 不足以稳定提升几何一致性。",
    "figure": {
      "url": "https://geometryflow.github.io/assets/images/method.png",
      "alt": "GeoFlow Fig. 2: method overview",
      "label": "GeoFlow，Fig. 2 \"GeoFlow method overview\"，。来源：原图",
      "paper_title": "GeoFlow: Enforcing Implicit Geometric Consistency in Video Generation",
      "source_url": "https://geometryflow.github.io/assets/images/method.png"
    },
    "id": "arxiv-2605-18365",
    "insight": "作者明确声称的问题：通用 text-to-video diffusion model 在 camera motion 和 object motion 下常出现对象形变、纹理漂移、背景非刚性抖动。GeoFlow 的核心 insight 是：\n\n> 几何一致的视频应满足两类近似条件：静态背景运动应能被相机运动诱导的刚性 flow 解释；独立运动物体沿其运动轨迹应保持语义/外观身份。\n\n因此 GeoFlow 不直接要求有 3D/4D ground truth，而是从生成视频自身出发，用 monocular depth/pose、optical flow、DINO feature correspondence 构造一个 geometry-consistency reward，再用 Flow-GRPO 对 video generator 做 RL fine-tuning。",
    "limitations": "作者在附录和项目页明确提到：\n\n- 对严重拓扑变化不稳，例如大遮挡、打开抽屉露出新内容等，因为 pixel persistence 假设被破坏。\n- 快速瞬时错误如果发生在 reward sampling interval 之外，可能无法惩罚。\n- RL alignment 受基础模型能力上限约束；若 base model 对 OOD prompt 已经完全混乱，reward 可能过稀疏。\n- 静态/动态区域边界模糊时，reward 可能误伤合理动态，例如布料/帐篷摆动。\n- 仍可能只部分改善一致性，不能消除所有 artifacts。\n\n## 对 HOI world model 的启发\n\nGeoFlow 适合作为 **HOI 视频生成的几何一致性 reward/evaluator**。但它没有显式建模 hand mesh、object pose、contact、force-like object response。若直接用于手物交互，建议把 reward 从“background rigid + dynamic identity”扩展为：\n\n- hand kinematics consistency；\n- hand-object contact timing；\n- object pose / shape persistence；\n- contact 后 object motion 是否由 hand motion 合理导致。\n\n---",
    "links": {
      "paper": "https://arxiv.org/abs/2605.18365",
      "project": "https://geometryflow.github.io/",
      "code": "https://github.com/geometryflow/GeoFlow",
      "model": "https://huggingface.co/ackermannj/geoflow",
      "alphaxiv": "https://alphaxiv.org/abs/2605.18365"
    },
    "pipeline": {
      "input": "text prompt；基础视频模型为 Wan2.1-T2V-1.3B。",
      "process": "- 视频采样 ：对每个 prompt 采样一组 candidate videos，并同步初始噪声以降低 group comparison 方差。；- 几何奖励 ：；- Depth Anything 3 预测 depth、camera intrinsics / extrinsics；；- WAFT / optical flow 估计相邻帧 observed flow；；- 由 depth + relative camera pose 计算 rigid camera-induced flow；；- 比较 observed flow 与 rigid flow，得到 background / structural consistency；；- 用 DINOv2 feature 在 flow-warped frame 与目标帧间比较，约束 dynamic object identity。；- 优化 ：用 Flow-GRPO 做 RL post-training；仅对早期 denoising steps 做 truncated backpropagation，以控制显存和计算。",
      "output": "几何一致性更好的 text-to-video generator / LoRA adapter。",
      "details": "- **输入**：text prompt；基础视频模型为 Wan2.1-T2V-1.3B。\n- **视频采样**：对每个 prompt 采样一组 candidate videos，并同步初始噪声以降低 group comparison 方差。\n- **几何奖励**：\n  - Depth Anything 3 预测 depth、camera intrinsics / extrinsics；\n  - WAFT / optical flow 估计相邻帧 observed flow；\n  - 由 depth + relative camera pose 计算 rigid camera-induced flow；\n  - 比较 observed flow 与 rigid flow，得到 background / structural consistency；\n  - 用 DINOv2 feature 在 flow-warped frame 与目标帧间比较，约束 dynamic object identity。\n- **优化**：用 Flow-GRPO 做 RL post-training；仅对早期 denoising steps 做 truncated backpropagation，以控制显存和计算。\n- **输出**：几何一致性更好的 text-to-video generator / LoRA adapter。"
    },
    "publication": "2026",
    "source_reports": [
      "report-1818b05f33",
      "report-cedaa0825a"
    ],
    "summary": "作者明确声称的问题：通用 text-to-video diffusion model 在 camera motion 和 object motion 下常出现对象形变、纹理漂移、背景非刚性抖动。GeoFlow 的核心 insight 是：",
    "tags": [
      "3D/4D",
      "HOI",
      "强化与模仿学习",
      "机器人学习",
      "视频生成"
    ],
    "title": "GeoFlow: Enforcing Implicit Geometric Consistency in Video Generation",
    "updated_at": "2026-08-31",
    "year": 2026
  },
  {
    "id": "arxiv-2609-13812",
    "title": "GeomVLA: Unifying Scene, Motion, and Action in 3D",
    "authors": [
      "Ziyin Xiong",
      "Nikos Gkanatsios",
      "Moritz Reuss",
      "Katerina Fragkiadaki"
    ],
    "year": 2026,
    "publication": "2026，arXiv；作者页面标注 CoRL 2026",
    "arxiv_id": "2609.13812",
    "doi": "10.48550/arXiv.2609.13812",
    "links": {
      "paper": "https://arxiv.org/abs/2609.13812",
      "project": "https://ziyin-xiong.github.io/geomvla.io/",
      "alphaxiv": "https://alphaxiv.org/abs/2609.13812"
    },
    "tags": [
      "3D/4D",
      "VLA",
      "World Action Model",
      "动作表征"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2609.13812v1/teaser_new4.png",
      "alt": "GeomVLA Fig. 1",
      "label": "GeomVLA，Fig. 1，在共享 3D 空间连接感知、未来场景运动与机器人控制。来源：Fig. 1 原图 PNG",
      "paper_title": "GeomVLA: Unifying Scene, Motion, and Action in 3D",
      "source_url": "https://arxiv.org/html/2609.13812v1/teaser_new4.png"
    },
    "summary": "GeomVLA把视觉、未来场景运动和动作统一到显式 3D 坐标系。视觉语言特征先通过 depth 与 calibration lift 到 3D；随后 task-conditioned 3D Scene Trajectory Denoiser 预测场景点的未来运动，其 latent 再条件化机器人 action denoiser。",
    "insight": "GeomVLA把视觉、未来场景运动和动作统一到显式 3D 坐标系。视觉语言特征先通过 depth 与 calibration lift 到 3D；随后 task-conditioned 3D Scene Trajectory Denoiser 预测场景点的未来运动，其 latent 再条件化机器人 action denoiser。\n\n关键区别在于中间 prediction target 不是 RGB，也不是抽象隐藏状态，而是具有物理坐标语义的未来 3D motion。",
    "pipeline": {
      "input": "多视角或相机观测、深度/标定、语言任务和机器人状态。",
      "process": "视觉/VLM 特征 lift 到 3D；预测未来 3D scene trajectory；将预测 motion latent 注入 3D flow-based action denoiser。",
      "output": "任务相关的未来 3D 场景运动以及机器人控制动作。",
      "details": "**输入**：多视角或相机观测、深度/标定、语言任务和机器人状态。\n\n**过程**：视觉/VLM 特征 lift 到 3D；预测未来 3D scene trajectory；将预测 motion latent 注入 3D flow-based action denoiser。\n\n**输出**：任务相关的未来 3D 场景运动以及机器人控制动作。"
    },
    "experiments": "官方结果包括 CALVIN 4.624、LIBERO 98.4% 以及 RoboTwin/真实任务结果。在更有解释价值的 matched 2D-JA 与 3D-JA 对照中，CALVIN 分别约 4.195 与 4.508，五任务 RoboTwin 为 66.2% 与 81.6%，真实机器人为 28.8% 与 59.4%，直接支持显式 3D 表示在这些设置中的作用。\n\n但不同表格的训练任务范围不完全一致：完整 GeomVLA与 \\(\\pi_{0.5}\\) 使用 50 个 RoboTwin 任务训练，而某些消融只使用五任务数据，因此不应将所有数字混合成严格同条件架构比较。",
    "evidence_notes": "全文已核验",
    "code_data_status": "官方项目页存在，但本次核验时项目中的代码链接返回 404，因此当前不能认定代码已经可用。",
    "limitations": "模型依赖 depth 与 calibration，输入几何误差会直接传播到 3D representation。当前实验仍集中在 benchmark-scale robot demonstrations，尚未验证大规模人类视频、强 cross-embodiment 或长期 object permanence。",
    "comments": "",
    "source_reports": [
      "report-1b1ffacf7d"
    ],
    "deleted": false,
    "updated_at": "2026-09-16",
    "challenges": "以 2D 图像特征连接视觉、未来运动与机器人动作时，跨视角几何和场景点运动缺少统一坐标语义，容易造成世界预测与动作生成之间的表示错位。",
    "motivation": "GeomVLA把视觉、未来场景运动和动作统一到显式 3D 坐标系。视觉语言特征先通过 depth 与 calibration lift 到 3D；随后 task-conditioned 3D Scene Trajectory Denoiser 预测场景点的未来运动，其 latent 再条件化机器人 action denoiser。\n\n关键区别在于中间 prediction target 不是 RGB，也不是抽象隐藏状态，而是具有物理坐标语义的未来 3D motion。",
    "technical_approach": "**输入**：多视角或相机观测、深度/标定、语言任务和机器人状态。\n\n**过程**：视觉/VLM 特征 lift 到 3D；预测未来 3D scene trajectory；将预测 motion latent 注入 3D flow-based action denoiser。\n\n**输出**：任务相关的未来 3D 场景运动以及机器人控制动作。",
    "discussion": "这是本期最直接对应“结合 3D/4D 信息的具身 WAM/VLA”的论文之一。它显著提高了未来研究的 baseline：后续仅称“3D-aware VLA”已经不够，应进一步体现 temporal persistence、interaction/contact 或跨 embodiment 4D state 的新价值。",
    "arxiv": {
      "published": "2026-09-12T08:51:52Z",
      "revised_at": "2026-09-12T08:51:52Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "arxiv": {
      "published": "2026-06-02T05:48:02Z",
      "revised_at": "2026-06-02T05:48:02Z",
      "primary_category": "cs.RO"
    },
    "arxiv_id": "2606.03188",
    "authors": [
      "Fulong Ma",
      "Daojie Peng",
      "Wenjun Yue",
      "Jiahang Cao",
      "Bintao Wang",
      "Qiang Zhang",
      "Jun Ma"
    ],
    "code_data_status": "截至来源报告核验时，未记录可确认的官方代码、数据或模型入口；这表示开放状态待核验，不代表资源确定不存在。",
    "comments": "",
    "deleted": false,
    "doi": "",
    "evidence_notes": "",
    "experiments": "LIBERO ablation 中，RGB-only 97.6，加入 Geometry 为 98.2，加入 Semantic 为 98.1，Geometry + Semantic 为 98.6。真机平均成功率从 Fast-WAM 的 88.9 提升到 95.4。结论：geometry 和 semantic 是互补的 structured supervision；future modeling 的价值主要在训练期塑造 representation。\n\n---",
    "figure": {
      "alt": "GeoSem-WAM architecture",
      "label": "GeoSem-WAM 架构",
      "paper_title": "GeoSem-WAM: Geometry- and Semantic-Aware World Action Models",
      "source_url": "https://arxiv.org/html/2606.03188v1/figures/architecture.png",
      "url": "https://arxiv.org/html/2606.03188v1/figures/architecture.png"
    },
    "id": "arxiv-2606-03188",
    "insight": "GeoSem-WAM 关注 WAM 收益究竟来自 test-time imagination，还是 predictive training 学到的 representation。论文倾向后者，并进一步指出：如果 future prediction 主要是 representation learning objective，那么 RGB 不应是唯一监督，应该显式加入 **geometry + semantics**。",
    "limitations": "来源报告未单列可核验的局限、失败案例或开放问题；在补充原论文正文核验前，不对该工作的泛化性、因果性、复现性或 SOTA 结论作扩大解释。",
    "links": {
      "paper": "https://arxiv.org/abs/2606.03188",
      "alphaxiv": "https://alphaxiv.org/abs/2606.03188"
    },
    "pipeline": {
      "input": "RGB observation、language、action trajectory。",
      "process": "- 训练期监督 ：future RGB、future geometry、future semantic segmentation、future action。；- 实现方式 ：基于 Wan2.2-5B + Action DiT；geometry / semantic 使用 DPT-style auxiliary heads，从 VideoDiT 中间 feature 解码。",
      "output": "只输入当前 observation，single forward 直接预测 action；不生成 future video，geometry / semantic heads 删除。",
      "details": "- **输入**：RGB observation、language、action trajectory。\n- **训练期监督**：future RGB、future geometry、future semantic segmentation、future action。\n- **实现方式**：基于 Wan2.2-5B + Action DiT；geometry / semantic 使用 DPT-style auxiliary heads，从 VideoDiT 中间 feature 解码。\n- **推理期输出**：只输入当前 observation，single forward 直接预测 action；不生成 future video，geometry / semantic heads 删除。"
    },
    "publication": "arXiv 2026",
    "source_reports": [
      "report-e81e6bd3a1"
    ],
    "summary": "GeoSem-WAM 关注 WAM 收益究竟来自 test-time imagination，还是 predictive training 学到的 representation。论文倾向后者，并进一步指出：如果 future prediction 主要是 representation learning objective，那么 RGB 不应是唯一监督，应该显式加入 geometry + semantics 。",
    "tags": [
      "3D/4D",
      "World Action Model",
      "机器人学习",
      "自监督与预测表征"
    ],
    "title": "GeoSem-WAM: Geometry- and Semantic-Aware World Action Models",
    "updated_at": "2026-08-20",
    "year": 2026
  },
  {
    "id": "arxiv-2608-23486",
    "title": "GeoWAM: Visual Geometry World Action Models for Autonomous Driving",
    "authors": [
      "Yiren Lu",
      "Xin Ye",
      "Jiaming Liu",
      "Philip Jacobson",
      "Jin Yao",
      "Yi-chung Chen",
      "Liam Merino",
      "Dhruva Dixith Kurra",
      "Min Cai",
      "Tom Lampo",
      "Yu Yin",
      "Danhua Guo",
      "Burhan Yaman"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本（首发 2026-08-24）",
    "arxiv_id": "2608.23486",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.23486",
      "project": "https://yiren-lu.com/project_pages/geowam",
      "alphaxiv": "https://alphaxiv.org/abs/2608.23486"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "流式与自回归",
      "第一视角与人类视频",
      "长时记忆"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.23486v2/GeoWAM_teaser.png",
      "alt": "GeoWAM: Visual Geometry World Action Models for Autonomous Driving 代表图",
      "label": "Figure 1 : Video and geometry world models represent scene dynamics differently. Given the same current observation, a video world model predicts how pixel values evolve over time. The underlying 3D transformations remain implicit in these pixel changes and are therefore difficult to recover. In contrast, a geometry world model predicts future 3D structure, whose evolution explicitly exposes the underlying spatial tr… 来源：论文图",
      "paper_title": "GeoWAM: Visual Geometry World Action Models for Autonomous Driving",
      "source_url": "https://arxiv.org/html/2608.23486v2/GeoWAM_teaser.png"
    },
    "summary": "把视觉几何信号注入驾驶世界动作模型，用几何约束强化动作条件未来预测（与 GeoSem-WAM 的几何语义路线同源，但面向驾驶域）。具体方法与实验数字本轮未读取全文，摘要层面确认其属于\"几何增强驾驶 WAM\"。",
    "insight": "把视觉几何信号注入驾驶世界动作模型，用几何约束强化动作条件未来预测（与 GeoSem-WAM 的几何语义路线同源，但面向驾驶域）。具体方法与实验数字本轮未读取全文，摘要层面确认其属于\"几何增强驾驶 WAM\"。",
    "pipeline": {
      "input": "",
      "process": "",
      "output": "",
      "details": "（待全文核验）预期为视觉几何先验 → 驾驶 WAM 动作条件预测。"
    },
    "experiments": "仅摘要核验；驾驶场景基准结果待全文确认。",
    "evidence_notes": "",
    "code_data_status": "项目页上线（yiren-lu.com/project_pages/geowam）；代码状态待确认。",
    "limitations": "待全文核验；长程几何一致性、罕见驾驶事件覆盖是驾驶 WAM 的普遍开放问题。\n\n### 与知域的关系\n与知域 DA-WAM、GWM-VLA 同属\"驾驶/几何 WAM\"主线，建议与 DA-WAM 对照收录进驾驶世界模型专题。",
    "comments": "",
    "source_reports": [
      "report-a141624b1e"
    ],
    "deleted": false,
    "updated_at": "2026-08-31",
    "arxiv": {
      "published": "2026-08-24T16:49:53Z",
      "revised_at": "2026-08-25T05:05:45Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2608-18234",
    "title": "GigaBrain-WBC-0.5: A Behavior World Model for Robust Whole-Body Control with Environment Interaction",
    "authors": [
      "Ziyang Cheng",
      "Tianshu Tang",
      "Jinxin Lan",
      "Xinze Chen",
      "Yuhan Gong",
      "Zhichao Liu",
      "Changzhong Wu",
      "Yahao Mao",
      "Zongyan Deng",
      "Mingxuan Ma",
      "Huasen Xi",
      "Yilong Liu",
      "Yutong Wu",
      "Xiaofeng Wang",
      "Yang Wang",
      "Yun Ye",
      "Guan Huang",
      "Xiaojie Jin",
      "Zheng Zhu",
      "Jiwen Lu"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本（Technical report）",
    "arxiv_id": "2608.18234",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.18234",
      "project": "https://shepherd1226.github.io/gigabrain-wbc-0.5/",
      "alphaxiv": "https://alphaxiv.org/abs/2608.18234"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "World Action Model",
      "动作表征",
      "因果与反事实",
      "流式与自回归",
      "第一视角与人类视频"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.18234v1/overview.png",
      "alt": "GigaBrain-WBC-0.5 Fig. 2：行为世界模型整体框架",
      "label": "GigaBrain-WBC-0.5，Fig. 2，行为命令量化与因果 Transformer 联合预测动作、状态和下一步隐行为命令的整体框架。来源：Fig. 2 原图 PNG",
      "paper_title": "GigaBrain-WBC-0.5: A Behavior World Model for Robust Whole-Body Control with Environment Interaction",
      "source_url": "https://arxiv.org/html/2608.18234v1/overview.png"
    },
    "summary": "GigaBrain-WBC-0.5 提出行为世界模型（BWM）范式： 因果 Transformer 同时预测下一步动作、下一步状态和下一步隐行为命令分布 ，使动作网络本身建模环境如何塑造其下一步能做什么。传统追踪器在空场景训练，从未学习地形和物体接触如何重塑动力学，而是试图通过不断增大参考运动语料来覆盖——一旦可行行为变得环境依赖，这条路线就失效了。",
    "insight": "GigaBrain-WBC-0.5 提出行为世界模型（BWM）范式：**因果 Transformer 同时预测下一步动作、下一步状态和下一步隐行为命令分布**，使动作网络本身建模环境如何塑造其下一步能做什么。传统追踪器在空场景训练，从未学习地形和物体接触如何重塑动力学，而是试图通过不断增大参考运动语料来覆盖——一旦可行行为变得环境依赖，这条路线就失效了。\n\nBWM 的预测命令分布被复用于在线检测不可行指令并回退到已学行为，使机器人以\"尽力而为\"方式执行任务。自动地形标注管线从 retargeted 运动恢复完整 3D 接触几何，使地形标注达到现有运动数据集的规模。",
    "pipeline": {
      "input": "实时命令 + 本体感知 + 视觉/地形观测",
      "process": "因果 Transformer 联合预测 (1) 下一步动作、(2) 下一步状态、(3) 下一步隐行为命令分布；预测的分布用于检测不可行命令并回退；自动地形标注管线在训练时为运动数据提供 3D 接触几何",
      "output": "全身控制指令；不可行命令检测与回退",
      "details": "**输入**：实时命令 + 本体感知 + 视觉/地形观测\n\n**过程**：因果 Transformer 联合预测 (1) 下一步动作、(2) 下一步状态、(3) 下一步隐行为命令分布；预测的分布用于检测不可行命令并回退；自动地形标注管线在训练时为运动数据提供 3D 接触几何\n\n**输出**：全身控制指令；不可行命令检测与回退"
    },
    "experiments": "- **基线**：三个大规模追踪器基线\n- **指标**：成功率\n- **定量结果**：地形交互成功率 81.3%（最强基线的 4.3×）；不可行指令下成功率 83.1%；跌倒恢复 99.3%（最强基线的 16.8×）；Unitree G1 → Maker L01 简单微调即可迁移\n- **消融**：待全文核验\n- **实验直接支持的结论**：BWM 在地形交互和不可行指令场景下大幅优于传统追踪器；跌倒恢复能力极强；跨硬件可迁移\n- **尚未被实验支持的主张**：BWM 对分布外地形/行为的处理能力；命令分布预测的校准性",
    "evidence_notes": "",
    "code_data_status": "代码和模型暂未公开。",
    "limitations": "- 地形标注管线依赖 retargeted motion 的 3D 接触几何恢复，精度下界未分析\n- BWM 预测的命令分布与训练数据中的命令分布相关，分布外行为的处理能力未显式评估\n- 仅在类人机器人全身控制中验证，BWM 范式是否适用于其他控制场景未讨论\n- 多本体迁移的\"简单微调\"具体成本未量化\n\n### 与知域的关系\n\nGigaBrain-WBC-0.5 与知域关注的世界模型方向有交叉——其行为世界模型预测下一步隐行为命令分布，与世界动作模型预测未来场景/动作的思路有概念关联。但该工作聚焦在低层全身控制的策略层面而非视觉生成层面，属于世界模型在控制中的应用而非世界动作模型的方法论推进。对全身交互控制、地形感知行为生成的研究路线有参考价值。",
    "comments": "",
    "source_reports": [
      "report-f5f82689ca"
    ],
    "deleted": false,
    "updated_at": "2026-08-23",
    "arxiv": {
      "published": "2026-08-18T18:21:36Z",
      "revised_at": "2026-08-23T09:07:15Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "arxiv": {
      "published": "2026-07-15T15:46:42Z",
      "revised_at": "2026-07-17T13:39:37Z",
      "primary_category": "cs.RO"
    },
    "arxiv_id": "2607.13960",
    "authors": [
      "GigaWorld Team",
      "Angen Ye",
      "Angyuan Ma",
      "Boyuan Wang",
      "Chaojun Ni",
      "Fangzheng Ye",
      "Guan Huang",
      "Guo Li",
      "Guosheng Zhao",
      "Haodong Yan",
      "Hengtao Li",
      "Jiwen Lu",
      "Kai Wang",
      "Mingming Yu",
      "Qitang Hu",
      "Qiuping Deng",
      "Songling Liu",
      "Xiaoyu Tian",
      "Xiaofeng Wang",
      "Xinyu Zhou",
      "Xiuwei Xu",
      "Xinze Chen",
      "Yang Wang",
      "Yejun Zeng",
      "Yifan Chang",
      "Yun Ye",
      "Zhenyu Wu",
      "Zhanqian Wu",
      "Zheng Zhu"
    ],
    "code_data_status": "截至来源报告核验时，未记录可确认的官方代码、数据或模型入口；这表示开放状态待核验，不代表资源确定不存在。",
    "comments": "",
    "deleted": false,
    "doi": "",
    "evidence_notes": "",
    "experiments": "Fruit Picking 平均 graded SR 0.85；三个 long-horizon task 平均成功率 0.77，优于约 0.47-0.57 的基线；mixed AC-WM + WAM pretraining 收敛更快、最终性能更高；本地 RTX 4090 上 action inference 约 85 ms。结论：video prediction 最合理的角色可以是 action 的训练监督者，而不是推理计算前置条件。\n\n---",
    "figure": {
      "alt": "GigaWorld-Policy-0.5 framework",
      "label": "GigaWorld-Policy-0.5 框架",
      "paper_title": "GigaWorld-Policy-0.5: A Faster and Stronger WAM Empowered by AutoResearch",
      "source_url": "https://arxiv.org/html/2607.13960v3/framework.png",
      "url": "https://arxiv.org/html/2607.13960v3/framework.png"
    },
    "id": "arxiv-2607-13960",
    "insight": "延续 GigaWorld-Policy 的 Action-Centered World Modeling：future RGB 是 action 的密集监督，但不应成为 action 推理时的前置依赖。核心是让 **Action -> Future RGB**，而不是让 action 依赖 future RGB；训练获得 dense video supervision，推理可完全关闭 video generation。",
    "limitations": "来源报告未单列可核验的局限、失败案例或开放问题；在补充原论文正文核验前，不对该工作的泛化性、因果性、复现性或 SOTA 结论作扩大解释。",
    "links": {
      "paper": "https://arxiv.org/abs/2607.13960",
      "project": "https://open-gigaai.github.io",
      "alphaxiv": "https://alphaxiv.org/abs/2607.13960"
    },
    "pipeline": {
      "input": "left / front / right cameras、proprioception、language；三视角先 compose 成一张 image。",
      "process": "- 训练期 ：Visual Expert 预测 future visual observations；Action Expert 预测 action chunk；causal attention mask 允许 future visual 读取 action，但 action 不能读取 future visual；混合 AC-WM + WAM pretraining；MoT 分离大 Visual Expert 与小 Action Expert；AutoResearch 自动搜索 LR、warmup 等配置。",
      "output": "关闭 future visual tokens，只运行 action pathway。",
      "details": "- **输入**：left / front / right cameras、proprioception、language；三视角先 compose 成一张 image。\n- **训练期**：Visual Expert 预测 future visual observations；Action Expert 预测 action chunk；causal attention mask 允许 future visual 读取 action，但 action 不能读取 future visual；混合 AC-WM + WAM pretraining；MoT 分离大 Visual Expert 与小 Action Expert；AutoResearch 自动搜索 LR、warmup 等配置。\n- **推理期输出**：关闭 future visual tokens，只运行 action pathway。"
    },
    "publication": "arXiv 2026",
    "source_reports": [
      "report-e81e6bd3a1"
    ],
    "summary": "延续 GigaWorld-Policy 的 Action-Centered World Modeling：future RGB 是 action 的密集监督，但不应成为 action 推理时的前置依赖。核心是让 Action - Future RGB ，而不是让 action 依赖 future RGB；训练获得 dense video supervision，推理可完全关闭 video generation。",
    "tags": [
      "World Action Model",
      "因果与反事实",
      "机器人学习",
      "自监督与预测表征",
      "视频生成"
    ],
    "title": "GigaWorld-Policy-0.5: A Faster and Stronger WAM Empowered by AutoResearch",
    "updated_at": "2026-08-20",
    "year": 2026
  },
  {
    "id": "arxiv-2609-14561",
    "title": "GLAM: Training a Latent World Model over Global Spatiotemporal Memory for Active Exploration and Navigation",
    "authors": [
      "I-Tak Ieong",
      "Ruizhi Feng",
      "Zhaoyang Lu",
      "Yifei Cao",
      "Jiayao Zhao",
      "Leon Li",
      "Senhua Zhu",
      "Wenbo Ding"
    ],
    "year": 2026,
    "publication": "2026，arXiv v1，2026-09-13 提交",
    "arxiv_id": "2609.14561",
    "doi": "10.48550/arXiv.2609.14561",
    "links": {
      "paper": "https://arxiv.org/abs/2609.14561",
      "alphaxiv": "https://alphaxiv.org/abs/2609.14561"
    },
    "tags": [
      "世界模型",
      "规划与控制",
      "长时记忆"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2609.14561v1/figs/GLaM_Nav.png",
      "alt": "GLAM Fig. 2",
      "label": "GLAM，Fig. 2，基于全局时空记忆的 latent world model 导航架构。来源：Fig. 2 原图 PNG",
      "paper_title": "GLAM: Training a Latent World Model over Global Spatiotemporal Memory for Active Exploration and Navigation",
      "source_url": "https://arxiv.org/html/2609.14561v1/figs/GLaM_Nav.png"
    },
    "summary": "GLAM将世界模型的预测对象从 RGB 改成 global spatiotemporal map memory。给定历史 map tokens、目标和当前 pose，模型同时预测 future map representation 与 robot-centric waypoint latent；采用 JEPA-like latent prediction，而非像素重建。",
    "insight": "GLAM将世界模型的预测对象从 RGB 改成 global spatiotemporal map memory。给定历史 map tokens、目标和当前 pose，模型同时预测 future map representation 与 robot-centric waypoint latent；采用 JEPA-like latent prediction，而非像素重建。",
    "pipeline": {
      "input": "历史 global map tokens、navigation goal、当前机器人 pose。",
      "process": "latent world model预测未来地图状态和 waypoint representation；预训练 waypoint encoder/decoder负责将规划 latent 映射回可执行导航 waypoint。",
      "output": "未来空间记忆 latent 和机器人导航 waypoint。",
      "details": "**输入**：历史 global map tokens、navigation goal、当前机器人 pose。\n\n**过程**：latent world model预测未来地图状态和 waypoint representation；预训练 waypoint encoder/decoder负责将规划 latent 映射回可执行导航 waypoint。\n\n**输出**：未来空间记忆 latent 和机器人导航 waypoint。"
    },
    "experiments": "训练轨迹来自 Habitat HM3D v0.2 上的 ObjectNav expert replay，并切成多时间尺度 prediction samples。在论文的 50% HM3D subset reproduction 设置中，BSC-Nav约为 78.50% SR / 47.70 SPL，GLAM NAV约为 86.89% SR / 48.35 SPL。成功率提升明显，但 SPL 提升较小，因此不能仅据此声称路径效率获得同幅度改善。",
    "evidence_notes": "全文已核验",
    "code_data_status": "本次未核验到新的官方代码或模型发布。",
    "limitations": "目前主要量化实验是 benchmark 子集复现；尚缺乏充分组件消融来单独隔离 future-map prediction 的贡献。真实办公室展示具有可行性，但不是多建筑、多本体统计评测。",
    "comments": "",
    "source_reports": [
      "report-1b1ffacf7d"
    ],
    "deleted": false,
    "updated_at": "2026-09-16",
    "challenges": "主动探索和导航依赖跨时间累积的全局空间状态，当前 RGB 或局部地图不足以表达未来可达区域和长期目标，像素预测又不是规划所需的最直接接口。",
    "motivation": "GLAM将世界模型的预测对象从 RGB 改成 global spatiotemporal map memory。给定历史 map tokens、目标和当前 pose，模型同时预测 future map representation 与 robot-centric waypoint latent；采用 JEPA-like latent prediction，而非像素重建。",
    "technical_approach": "**输入**：历史 global map tokens、navigation goal、当前机器人 pose。\n\n**过程**：latent world model预测未来地图状态和 waypoint representation；预训练 waypoint encoder/decoder负责将规划 latent 映射回可执行导航 waypoint。\n\n**输出**：未来空间记忆 latent 和机器人导航 waypoint。",
    "discussion": "GLAM对 egocentric world model 的价值在于长期 memory representation。若把 global map token 替换成 object/contact-centric 3D/4D memory，可能形成更接近 manipulation world model 的持续状态表示。",
    "arxiv": {
      "published": "2026-09-13T14:47:33Z",
      "revised_at": "2026-09-13T14:47:33Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2608-23927",
    "title": "GlanceWAM: Sparse Test-Time Imagination for World-Action Models",
    "authors": [
      "Linhan Wang",
      "Zijian An",
      "Mingyuan Zhang",
      "Chen Dai",
      "Yi Xu",
      "Can Cui",
      "Zichong Yang",
      "Yinlin Chen",
      "Lifeng Zhou",
      "Chang-Tien Lu"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本（首发 2026-08-25）",
    "arxiv_id": "2608.23927",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.23927",
      "code": "https://github.com/linhanwang/GlanceWAM",
      "alphaxiv": "https://alphaxiv.org/abs/2608.23927"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "流式与自回归",
      "第一视角与人类视频",
      "长时记忆"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.23927v1/fig_teaser_v3.png",
      "alt": "GlanceWAM: Sparse Test-Time Imagination for World-Action Models 代表图",
      "label": "Figure 1: Synchronous imagination versus sparse lookahead foresight. (a) Prior WAMs couple future generation to the action chunk at control rate, incurring heavy multi-step sampling latency over near-static horizons. (b) GlanceWAM decouples timescales: it glances ahead asynchronously to imagine a single latent lookahead frame seconds into the future ( H f ≈ 3 H {f} approx 3 s) on a slow clock, pipelining imagination… 来源：论文图",
      "paper_title": "GlanceWAM: Sparse Test-Time Imagination for World-Action Models",
      "source_url": "https://arxiv.org/html/2608.23927v1/fig_teaser_v3.png"
    },
    "summary": "WAM 面临两难：控制频率下的同步视频生成延迟过高，弃掉测试期视觉想象又损失任务成功率。GlanceWAM 的 Insight： 当想象以异步方式离关键路径生成、并直接在潜在空间被消费时，能同时拿到实时推理与更高成功率 ——异步 proposer 以慢时钟预先\"瞥一眼\"未来几秒的单帧 lookahead，主策略直接消费潜在表示，避免同步生成的延迟代价。",
    "insight": "WAM 面临两难：控制频率下的同步视频生成延迟过高，弃掉测试期视觉想象又损失任务成功率。GlanceWAM 的 Insight：**当想象以异步方式离关键路径生成、并直接在潜在空间被消费时，能同时拿到实时推理与更高成功率**——异步 proposer 以慢时钟预先\"瞥一眼\"未来几秒的单帧 lookahead，主策略直接消费潜在表示，避免同步生成的延迟代价。",
    "pipeline": {
      "input": "当前观测 + 动作流。",
      "process": "异步 proposer（慢时钟，后台生成单帧 lookahead）→ 潜在空间直接消费 → 控制流解耦。",
      "output": "实时动作 + 稀疏未来想象。",
      "details": "**输入**：当前观测 + 动作流。\n**过程**：异步 proposer（慢时钟，后台生成单帧 lookahead）→ 潜在空间直接消费 → 控制流解耦。\n**输出**：实时动作 + 稀疏未来想象。"
    },
    "experiments": "仅摘要核验：报告异步离关键路径想象同时达成实时推理与更高成功率。证据等级：仅摘要；与 LAWA（不生成）的对照待读全文。",
    "evidence_notes": "",
    "code_data_status": "[GitHub](https://github.com/linhanwang/GlanceWAM) 已公开。",
    "limitations": "- lookahead 单帧的信息上限；\n- 异步调度在算力波动下的确定性；\n- 与\"完全不生成\"（LAWA/Fast-WAM）的严格对比。\n\n### 与知域的关系\n与 LAWA、Efficient-WAM 构成\"测试期想象策略\"三元组，直接关系到 WAM 实时化的研究路线选择。",
    "comments": "",
    "source_reports": [
      "report-a141624b1e"
    ],
    "deleted": false,
    "updated_at": "2026-08-31",
    "arxiv": {
      "published": "2026-08-25T00:19:09Z",
      "revised_at": "2026-08-25T00:19:09Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2607-09225",
    "title": "Glob3R: Global Structure-from-Motion with 3D Foundation Models",
    "authors": [
      "Junyuan Deng",
      "Heng Li",
      "Kejie Qiu",
      "Lingteng Qiu",
      "Rui Peng",
      "Weichao Shen",
      "Weihao Yuan",
      "Siyu Zhu",
      "Zilong Dong",
      "Ping Tan"
    ],
    "year": 2026,
    "publication": "2026，arXiv preprint，v1 于 2026-07-10 提交；截至核验日未发现正式出版页",
    "arxiv_id": "2607.09225",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2607.09225",
      "project": "https://junyuandeng.github.io/Glob3r/",
      "code": "https://github.com/aigc3d/Glob3R",
      "alphaxiv": "https://alphaxiv.org/abs/2607.09225"
    },
    "tags": [
      "3D/4D",
      "视频生成"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2607.09225v1/pipeline_pdf.png",
      "alt": "Glob3R Fig. 1：全局 Structure-from-Motion 重建框架",
      "label": "Glob3R，Fig. 1，全局重建框架：几何先验与稠密 warp、跨窗口 tracks、全局关联图及优化。来源：Fig. 1 原图 PNG",
      "paper_title": "Glob3R: Global Structure-from-Motion with 3D Foundation Models",
      "source_url": "https://arxiv.org/html/2607.09225v1/pipeline_pdf.png"
    },
    "summary": "作者希望让 feed-forward 预测从“最终答案”变成“可优化初始化”，再把 foundation model 的鲁棒先验与经典 SfM 的全局几何约束结合。关键接口是把冻结 Pi3X 的 token 变成稠密 image warp，再筛成跨窗口的稀疏多视图 tracks；这些 tracks 比直接拼接窗口位姿更适合逐帧 motion averaging 与 bundle adjustment。",
    "insight": "作者希望让 feed-forward 预测从“最终答案”变成“可优化初始化”，再把 foundation model 的鲁棒先验与经典 SfM 的全局几何约束结合。关键接口是把冻结 Pi3X 的 token 变成稠密 image warp，再筛成跨窗口的稀疏多视图 tracks；这些 tracks 比直接拼接窗口位姿更适合逐帧 motion averaging 与 bundle adjustment。",
    "pipeline": {
      "input": "有序图像序列，或把无序图像经检索排成的伪序列；若有相机标定可固定内参与畸变，否则共同优化。",
      "process": "冻结 Pi3X 主干及原有预测头，仅训练一个由 transformer decoder、DPT 和多尺度 refinement 组成的稠密匹配头，预测参考帧到邻帧的全分辨率 warp 与置信度；在重叠滑窗中按重投影覆盖率选关键帧，把高置信 warp 稀疏化成多视图 tracks 并合并为全局关联图；以最大生成树和 Pi3X 相对尺度初始化，然后依次执行鲁棒旋转平均、基于多视图射线一致性的平移/稀疏点估计、bundle adjustment，以及深度融合得到稠密几何。",
      "output": "全局一致的逐帧相机位姿、相机参数、稀疏多视图点和融合后的稠密场景几何，可用于新视角渲染。",
      "details": "- **输入：** 有序图像序列，或把无序图像经检索排成的伪序列；若有相机标定可固定内参与畸变，否则共同优化。\n- **过程：** 冻结 Pi3X 主干及原有预测头，仅训练一个由 transformer decoder、DPT 和多尺度 refinement 组成的稠密匹配头，预测参考帧到邻帧的全分辨率 warp 与置信度；在重叠滑窗中按重投影覆盖率选关键帧，把高置信 warp 稀疏化成多视图 tracks 并合并为全局关联图；以最大生成树和 Pi3X 相对尺度初始化，然后依次执行鲁棒旋转平均、基于多视图射线一致性的平移/稀疏点估计、bundle adjustment，以及深度融合得到稠密几何。\n- **输出：** 全局一致的逐帧相机位姿、相机参数、稀疏多视图点和融合后的稠密场景几何，可用于新视角渲染。"
    },
    "experiments": "- **实验事实：** Tanks and Temples 所列 14 个场景上，用优化位姿训练/评估渲染的平均 PSNR 为 19.56 dB，高于 COLMAP 18.73、SAIL-Recon 18.55、Pi3X 17.62；但不是每个场景都最优，例如 Church 略低于 GLOMAP，Courtroom 也低于 GLOMAP。\n- **实验事实：** TUM RGB-D 九序列平均轨迹 RMSE 为 3.2 cm，与 AMB3R 同均值；论文称其为所比较 uncalibrated 方法中最佳，但逐序列并非始终领先。KITTI 11 个序列平均 RMSE 为 13.21 m，低于 Scal3R 的 14.55 m 和 LoGeR 的 18.65 m；序列 01、06、10 等仍有对照更优。\n- **实验事实：** ETH3D 无序图像集上，Glob3R 在 5° 阈值的平均旋转/平移准确率为 100.0/91.3；在更严格 1° 阈值为 91.58/73.27。由于表中不同方法使用 5° 与 1° 两种阈值，不能跨列直接做无条件排名。\n- **实验事实：** 800 帧序列处理速度为 2.06 FPS，快于 COLMAP 0.14、GLOMAP 0.67 和 Pi3X 1.64 FPS，但明显慢于 DA3 8.10、FastVGGT 15.10、VGGT-SLAM 16.87 FPS。\n- **作者主张：** 显式 tracks 加全局优化能系统性修正 foundation model 的粗糙位姿与窗口尺度不一致，同时保持可扩展性。\n- **阅读判断：** 跨室内、驾驶、无序 SfM 和渲染评测的结果支持“精度—速度折中优于单纯 feed-forward/拼窗”这一结论；但 backbone、matching head 和优化后端强耦合，且官方代码尚未释放，当前无法独立复现训练、超参数和对照配置。",
    "evidence_notes": "",
    "code_data_status": "官方项目页和 GitHub 仓库已建立，但截至 2026-08-26，仓库仅含 README，`Inference Code Release` 与 `Evaluation Script` 均仍列为 TODO，未提供可运行实现、权重或明确许可证。论文使用 Tanks and Temples、TUM RGB-D、KITTI、ETH3D 等公开 benchmark；训练 matching head 所用数据构成和可获取性仍需结合代码发布进一步核验。",
    "limitations": "- 论文附录明确报告 Tanks and Temples Ballroom/Palace 一类失败：Pi3X 把单一房间预测成多个不一致片段，重复吊灯又产生错误匹配，后端只能部分修复。\n- matching head 建立在 Pi3X token 上，初始 foundation geometry 严重错误时，匹配与优化误差会级联。\n- 2.06 FPS 不是实时高速方案，且仍显著慢于多种 feed-forward/streaming 对照。\n- 部分实验的阈值、标定条件和失败/OOM 状态不同，需谨慎解释平均排名的公平性。\n- 官方代码、评测脚本、权重和许可证尚未落地，论文数字目前不可独立复核。",
    "comments": "",
    "source_reports": [
      "report-5a20368080",
      "report-89efbb2378"
    ],
    "deleted": false,
    "updated_at": "2026-08-31",
    "challenges": "VGGT、Pi3X 等 3D foundation model 能快速给出相机和点图，但几何精度仍不足；面对长序列或大规模无序图像集时通常要切窗，窗口级结果会出现尺度不一致、漂移和接缝。经典 SfM 的全局优化精确，却高度依赖可靠匹配，在弱纹理、重复结构、前向驾驶和大规模图像集上既昂贵又容易被错误边破坏。",
    "motivation": "作者希望让 feed-forward 预测从“最终答案”变成“可优化初始化”，再把 foundation model 的鲁棒先验与经典 SfM 的全局几何约束结合。关键接口是把冻结 Pi3X 的 token 变成稠密 image warp，再筛成跨窗口的稀疏多视图 tracks；这些 tracks 比直接拼接窗口位姿更适合逐帧 motion averaging 与 bundle adjustment。",
    "technical_approach": "- **输入：** 有序图像序列，或把无序图像经检索排成的伪序列；若有相机标定可固定内参与畸变，否则共同优化。\n- **过程：** 冻结 Pi3X 主干及原有预测头，仅训练一个由 transformer decoder、DPT 和多尺度 refinement 组成的稠密匹配头，预测参考帧到邻帧的全分辨率 warp 与置信度；在重叠滑窗中按重投影覆盖率选关键帧，把高置信 warp 稀疏化成多视图 tracks 并合并为全局关联图；以最大生成树和 Pi3X 相对尺度初始化，然后依次执行鲁棒旋转平均、基于多视图射线一致性的平移/稀疏点估计、bundle adjustment，以及深度融合得到稠密几何。\n- **输出：** 全局一致的逐帧相机位姿、相机参数、稀疏多视图点和融合后的稠密场景几何，可用于新视角渲染。",
    "discussion": "Glob3R 的贡献可概括为把学习到的稠密对应转译成经典全局 SfM 能消费的 tracks，并把所有图像而非仅窗口边界纳入优化。它对长序列 feed-forward 重建和可扩展 BA 很有参考价值，也适合作为 VGGT/Pi3X 类模型的后端；代价是失去纯前馈速度，且恢复上限受初始几何和匹配质量限制。",
    "arxiv": {
      "published": "2026-07-10T09:18:35Z",
      "revised_at": "2026-07-10T09:18:35Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2609-20012",
    "title": "GRF-Recon: Global Ray-Field Optimization for Long-Sequence Feed-forward Reconstruction",
    "authors": [
      "Enpeng Li",
      "Yunzhou Zhang",
      "Zhiyao Zhang",
      "Dexuan Lyu",
      "Chenyu Wang",
      "Chiyuan Cui",
      "Cheng Cheng"
    ],
    "year": 2026,
    "publication": "2026，ECCV 2026 Spotlight；arXiv",
    "arxiv_id": "2609.20012",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2609.20012",
      "alphaxiv": "https://alphaxiv.org/abs/2609.20012"
    },
    "tags": [
      "3D/4D"
    ],
    "figure": {
      "url": "content/images/2609.20012-main.webp",
      "alt": "Figure 2：局部深度适配、稀疏射线场及回环图优化共同校正长序列几何",
      "label": "Figure 2 · 局部深度适配、稀疏射线场及回环图优化共同校正长序列几何",
      "paper_title": "GRF-Recon: Global Ray-Field Optimization for Long-Sequence Feed-forward Reconstruction",
      "source_url": "https://arxiv.org/html/2609.20012v1/pipeline.png"
    },
    "summary": "GRF-Recon关注feedforward reconstruction扩展到长单目序列后的三个核心问题：GPU memory、局部geometry degradation和长期camera drift。它不完全依赖简单chunk stitching，而是在ray-field level增加跨帧全局几何约束。",
    "insight": "GRF-Recon关注feedforward reconstruction扩展到长单目序列后的三个核心问题：GPU memory、局部geometry degradation和长期camera drift。它不完全依赖简单chunk stitching，而是在ray-field level增加跨帧全局几何约束。",
    "pipeline": {
      "input": "long monocular image sequence。",
      "process": "coarse-to-fine trajectory alignment → LoRA注入monocular geometric prior → hybrid-weight sparse ray-field optimization进行local point refinement和cross-frame ray coupling → joint ray-error trajectory stitching降低累计drift。",
      "output": "长序列camera trajectory与globally consistent 3D reconstruction。",
      "details": "**过程**：coarse-to-fine trajectory alignment → LoRA注入monocular geometric prior → hybrid-weight sparse ray-field optimization进行local point refinement和cross-frame ray coupling → joint ray-error trajectory stitching降低累计drift。\n\n**输入**：long monocular image sequence。\n\n**输出**：长序列camera trajectory与globally consistent 3D reconstruction。\n\nDA3 前端通过重归一化 LoRA 引入单目几何蒸馏，再构造 hybrid sparse ray-field 并用回环与全局图优化耦合序列。它保留前馈几何初始化，但完整管线包括优化后端。\n\n[原文方法](https://arxiv.org/html/2609.20012)\n\n### 方法细节与实现\n\n**局部预测。**GRF-Recon 先在窗口内进行前馈几何预测，再用深度适配模块修正局部深度，并将相邻窗口初始轨迹拼接起来。DAR 使用 rank 8 LoRA，可训练参数低于骨干的 3%；报告训练 15 个 epoch、单 RTX 3090 约 14 小时。这个阶段解决局部深度系统偏差，不能独立消除长程累计漂移。\n\n**全局射线场。**系统把深度、深度梯度、置信度和相机射线组织成稀疏几何约束，再借助回环检测把远隔时间但观察同一区域的窗口连接起来，进行全局图优化。相较只拼接点云，射线约束能够把重投影方向和尺度关系带入全局一致性求解。\n\n**前馈与优化的边界。**标题中的 feed-forward 描述底层几何预测来源，最终长序列结果仍经过回环与图优化。部署成本应包含局部网络、候选匹配和全局求解；不能把最后的精度归因于一次纯前馈推理。弱纹理、动态对象和缺少回环的路径会削弱优化约束。\n\n[对应方法原文](https://arxiv.org/html/2609.20012#S3)"
    },
    "experiments": "论文在多个长序列重建基准上比较feedforward和SLAM方法，报告在保持feedforward scalability的同时取得有竞争力的trajectory accuracy，并显著改善global reconstruction consistency。当前结论最直接支持“长序列feedforward reconstruction需要跨chunk显式global geometric coupling”，而不能解释成所有场景都全面优于成熟SLAM。\n\n\nKITTI 表 2 的 ATE RMSE 平均为 7.18 m，DA3-Streaming 12.72 m、ORB-SLAM3 7.93 m；该平均**排除了高速序列 01**，本文在该序列仍为 76.52 m。Waymo 平均为 1.39 m，DA3-Streaming 1.76 m。所有轨迹/点云经全局 Sim(3) 对齐 LiDAR GT；实验使用单张 RTX 3090 24GB，深度前端微调约 14 小时。\n\n[原文实验与表格](https://arxiv.org/html/2609.20012)\n\n**重要口径。**轨迹评测使用 Sim(3) 对齐，说明误差是在允许全局旋转、平移和尺度校准后测得。KITTI 主均值 7.18 排除了困难序列 01，而该序列单独误差为 76.52；Waymo 为 1.39。阅读时需要同时看到排除规则和失败序列，不能只引用一个平均值作为任意长程相机轨迹都稳定的证据。\n\n[实验与设置原文](https://arxiv.org/html/2609.20012)",
    "evidence_notes": "已核验原文方法与实验；关键比较与限制见各节",
    "code_data_status": "本次未核验到官方代码、模型权重或独立新数据发布。",
    "limitations": "方法仍需要额外ray-field optimization和trajectory stitching，因此并非严格意义上的single-pass纯feedforward；其长期性能也依赖monocular prior和跨帧overlap。",
    "comments": "",
    "source_reports": [],
    "deleted": false,
    "updated_at": "2026-09-24",
    "challenges": "长序列前馈重建受到显存限制，分块虽能运行，却带来尺度不一致与累积轨迹漂移；局部点云漂亮也不保证长期全局坐标正确。",
    "motivation": "GRF-Recon关注feedforward reconstruction扩展到长单目序列后的三个核心问题：GPU memory、局部geometry degradation和长期camera drift。它不完全依赖简单chunk stitching，而是在ray-field level增加跨帧全局几何约束。",
    "technical_approach": "**过程**：coarse-to-fine trajectory alignment → LoRA注入monocular geometric prior → hybrid-weight sparse ray-field optimization进行local point refinement和cross-frame ray coupling → joint ray-error trajectory stitching降低累计drift。\n\n**输入**：long monocular image sequence。\n\n**输出**：长序列camera trajectory与globally consistent 3D reconstruction。\n\nDA3 前端通过重归一化 LoRA 引入单目几何蒸馏，再构造 hybrid sparse ray-field 并用回环与全局图优化耦合序列。它保留前馈几何初始化，但完整管线包括优化后端。\n\n[原文方法](https://arxiv.org/html/2609.20012)\n\n### 方法细节与实现\n\n**局部预测。**GRF-Recon 先在窗口内进行前馈几何预测，再用深度适配模块修正局部深度，并将相邻窗口初始轨迹拼接起来。DAR 使用 rank 8 LoRA，可训练参数低于骨干的 3%；报告训练 15 个 epoch、单 RTX 3090 约 14 小时。这个阶段解决局部深度系统偏差，不能独立消除长程累计漂移。\n\n**全局射线场。**系统把深度、深度梯度、置信度和相机射线组织成稀疏几何约束，再借助回环检测把远隔时间但观察同一区域的窗口连接起来，进行全局图优化。相较只拼接点云，射线约束能够把重投影方向和尺度关系带入全局一致性求解。\n\n**前馈与优化的边界。**标题中的 feed-forward 描述底层几何预测来源，最终长序列结果仍经过回环与图优化。部署成本应包含局部网络、候选匹配和全局求解；不能把最后的精度归因于一次纯前馈推理。弱纹理、动态对象和缺少回环的路径会削弱优化约束。\n\n[对应方法原文](https://arxiv.org/html/2609.20012#S3)",
    "discussion": "**阅读者分析**：对VGGT、DynamicVGGT、Gen3R等向长视频/4D reconstruction扩展很有价值：它说明局部feedforward geometry之外，长期全局坐标一致性仍然需要专门机制。",
    "arxiv": {
      "published": "2026-09-17",
      "revised_at": "",
      "primary_category": "cs.CV"
    },
    "source_papers": [
      "content/papers/2609.20012.md"
    ]
  },
  {
    "id": "arxiv-2609-10050",
    "title": "Grounding Generated Video Plans in Simulation Towards Versatile Dexterous Controllers",
    "authors": [
      "Tianyue Wu",
      "Boyuan An",
      "Shuqi Zhao",
      "Heyu Guo",
      "Wanli Xing",
      "Yi Ma",
      "Kaifeng Zhang",
      "Ruihai Wu",
      "Masayoshi Tomizuka"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本，v1",
    "arxiv_id": "2609.10050",
    "doi": "10.48550/arXiv.2609.10050",
    "links": {
      "paper": "https://arxiv.org/abs/2609.10050",
      "project": "https://boyuan-an.github.io/GALATEA/",
      "alphaxiv": "https://alphaxiv.org/abs/2609.10050"
    },
    "tags": [
      "3D/4D",
      "物理建模与仿真",
      "规划与控制",
      "触觉与灵巧操作"
    ],
    "figure": {
      "url": "content/images/2609.10050-representative.webp",
      "alt": "\\fnum@figure",
      "label": "fnum@figure",
      "paper_title": "Grounding Generated Video Plans in Simulation Towards Versatile Dexterous Controllers",
      "source_url": "https://arxiv.org/html/2609.10050v1#S3.F3"
    },
    "summary": "该工作不直接把生成视频像素映射为机器人动作，而是将视频计划重建为手指和物体的联合运动，再在物理模拟器中训练闭环跟踪器。关键 Insight 是：视觉计划只有同时保留代理运动与对象效果，并经过接触动力学验证，才更可能成为可执行控制目标。",
    "insight": "该工作不直接把生成视频像素映射为机器人动作，而是将视频计划重建为手指和物体的联合运动，再在物理模拟器中训练闭环跟踪器。关键 Insight 是：视觉计划只有同时保留代理运动与对象效果，并经过接触动力学验证，才更可能成为可执行控制目标。",
    "pipeline": {
      "input": "文本/任务条件下生成的 HOI 视频。",
      "process": "对视频执行少量人工筛选和 HOI 重建，获得手指级与物体轨迹；在模拟器中将其作为噪声参考，采用改进的 tracking-style RL 和优化器训练多计划控制器；部署时由视频模型给出计划，策略闭环跟踪。",
      "output": "可执行抓取、推拉、非预抓取交互及抓取后物体姿态调整动作。",
      "details": "**输入**：文本/任务条件下生成的 HOI 视频。\n\n**过程**：对视频执行少量人工筛选和 HOI 重建，获得手指级与物体轨迹；在模拟器中将其作为噪声参考，采用改进的 tracking-style RL 和优化器训练多计划控制器；部署时由视频模型给出计划，策略闭环跟踪。\n\n**输出**：可执行抓取、推拉、非预抓取交互及抓取后物体姿态调整动作。"
    },
    "experiments": "正文表 I 在 H2O、HO-Cap 各 40 段、每段 150 帧上做 HOI 重建对照；表 II 报告 intent-executing 轨迹的对象位置误差 10.2 mm、旋转 17.4°、手部 36.2 mm，旋转误差并非所有方法中最低。表 III 的未见真机轨迹分为 jar neck、jar top、mug rim、mug handle，各 10 次，总计 27/40 成功（67.5%）。结果支持仿真接地后的轨迹执行，但测试范围与计划筛选机制仍限制泛化结论。 [正文实验与表格](https://arxiv.org/html/2609.10050v1)。",
    "evidence_notes": "2026-09-14 已核对 arXiv 元数据、正文主要实验与对照；未运行复现实验。",
    "code_data_status": "官方项目页可访问；本次页面未给出可确认的训练/推理仓库或权重下载入口，代码、数据和模型开放范围待核验。",
    "limitations": "仍需要人工参与计划筛选/重建；生成视频中的接触穿透和对象身份漂移可能污染参考；模拟器对软体、摩擦和手部接触的建模误差会影响 sim-to-real。训练成本随计划数增长。",
    "comments": "",
    "source_reports": [
      "report-37b94c4145"
    ],
    "deleted": false,
    "updated_at": "2026-09-14",
    "discussion": "这是从人类式/生成 HOI 视频到灵巧控制的关键桥梁，直接关联 Video/WAM、4D HOI 重建和接触物理落地。",
    "arxiv": {
      "published": "2026-09-09T11:26:25Z",
      "revised_at": "2026-09-09T11:26:25Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "arxiv": {
      "published": "2026-08-07T06:41:51Z",
      "revised_at": "2026-08-07T06:41:51Z",
      "primary_category": "cs.RO"
    },
    "arxiv_id": "2608.07619",
    "authors": [
      "Yanping Zhao",
      "Hang Yu",
      "Yiwei Wang",
      "Chen Ye",
      "Siyu Tian",
      "Di Zhang",
      "Qingjun Wang",
      "Qian Chen",
      "Junqiao Zhao",
      "Chen Ye",
      "Guang Chen"
    ],
    "code_data_status": "截至来源报告核验时，未记录可确认的官方代码、数据或模型入口；这表示开放状态待核验，不代表资源确定不存在。",
    "comments": "",
    "deleted": false,
    "doi": "",
    "evidence_notes": "",
    "experiments": "LIBERO 97.1%，LIBERO-Plus 76.9%，相比 robot-only VLA-JEPA 的 62.9% 提升 14.0 points。SO-101 真机少量数据实验中，对 novel layout 很强；但 held-out object-receptacle composition 上 GWM-VLA 53.3%，低于 pi_0.5 的 60%。结论：显式 multi-view geometry 对视觉变化、相机变化、layout OOD 尤其有效，但它解决的是 spatial robustness，不等价于更强 semantic compositional generalization。\n\n---",
    "figure": {
      "alt": "GWM-VLA architecture",
      "label": "GWM-VLA 架构",
      "paper_title": "GWM-VLA: Geometry-Aware Latent World Modeling for Vision-Language-Action Learning",
      "source_url": "https://arxiv.org/html/2608.07619v1/architecture.png",
      "url": "https://arxiv.org/html/2608.07619v1/architecture.png"
    },
    "id": "arxiv-2608-07619",
    "insight": "GWM-VLA 针对 VLA-JEPA 类 latent world model 的问题：多相机分别编码再 concat，虽然能预测 future latent，但跨视角 geometry relationship 没有被显式编码。它使用 **VGGT-Omega jointly encode multi-view**，把带 cross-view geometry 的 representation 直接作为 world-model state。",
    "limitations": "来源报告未单列可核验的局限、失败案例或开放问题；在补充原论文正文核验前，不对该工作的泛化性、因果性、复现性或 SOTA 结论作扩大解释。",
    "links": {
      "paper": "https://arxiv.org/abs/2608.07619",
      "alphaxiv": "https://alphaxiv.org/abs/2608.07619"
    },
    "pipeline": {
      "input": "multi-view images、language、proprioception。",
      "process": "Frozen VGGT-Omega 联合同一 timestep 所有视角，得到 geometry-aware multi-view state；不预测完整 multi-view future，只预测 target wrist-view patch tokens；wrist-view register tokens 提供 global geometric context；Qwen3-VL-2B 产生 latent-action tokens；同一组 latent-action 同时 condition latent world model 与 flow-matching action head。",
      "output": "current observations - latent action - continuous action chunk；world-model loss 只是训练辅助目标。",
      "details": "- **输入**：multi-view images、language、proprioception。\n- **过程**：Frozen VGGT-Omega 联合同一 timestep 所有视角，得到 geometry-aware multi-view state；不预测完整 multi-view future，只预测 target wrist-view patch tokens；wrist-view register tokens 提供 global geometric context；Qwen3-VL-2B 产生 latent-action tokens；同一组 latent-action 同时 condition latent world model 与 flow-matching action head。\n- **推理期输出**：current observations -> latent action -> continuous action chunk；world-model loss 只是训练辅助目标。"
    },
    "publication": "arXiv 2026",
    "source_reports": [
      "report-e81e6bd3a1"
    ],
    "summary": "GWM-VLA 针对 VLA-JEPA 类 latent world model 的问题：多相机分别编码再 concat，虽然能预测 future latent，但跨视角 geometry relationship 没有被显式编码。它使用 VGGT-Omega jointly encode multi-view ，把带 cross-view geometry 的 representation 直接作为 world-model state。",
    "tags": [
      "3D/4D",
      "VLA",
      "World Action Model",
      "机器人学习",
      "自监督与预测表征"
    ],
    "title": "GWM-VLA: Geometry-Aware Latent World Modeling for Vision-Language-Action Learning",
    "updated_at": "2026-08-20",
    "year": 2026
  },
  {
    "arxiv": {
      "published": "2026-02-10T09:51:07Z",
      "revised_at": "2026-02-13T08:39:01Z",
      "primary_category": "cs.CV"
    },
    "arxiv_id": "2602.09600",
    "authors": [
      "Yuxi Wang",
      "Wenqi Ouyang",
      "Tianyi Wei",
      "Yi Dong",
      "Zhiqi Shen",
      "Xingang Pan"
    ],
    "code_data_status": "截至来源报告核验时，未记录可确认的官方代码、数据或模型入口；这表示开放状态待核验，不代表资源确定不存在。",
    "comments": "",
    "deleted": false,
    "doi": "",
    "evidence_notes": "",
    "experiments": "在三个 egocentric interaction benchmark 上，论文报告其在 perceptual quality、3D consistency、camera control、long-horizon generation 上显著优于 InterDyn、Mask2IV、CosHand、PlayerOne、Wan2.1-Control 等。\n\n**对你方向的启发**\n\n- 它非常适合和 HandsOnWorld 放一起对比：二者都强调 **3D hand + camera disentanglement**。\n- 但 Hand2World 的 object response 仍是 video diffusion 隐式学习出来的；缺少显式 object state / 4D object dynamics。\n- 可扩展方向：把 hand mesh control 扩为 **hand-object-contact-object-state control**。\n\n---",
    "figure": {
      "alt": "Hand2World pipeline",
      "label": "Hand2World pipeline",
      "paper_title": "Hand2World: Autoregressive Egocentric Interaction Generation via Free-Space Hand Gestures",
      "source_url": "https://arxiv.org/html/2602.09600v2/method_pipeline.png",
      "url": "https://arxiv.org/html/2602.09600v2/method_pipeline.png"
    },
    "id": "arxiv-2602-09600",
    "insight": "Hand2World 从单张 scene image 和 free-space hand gesture 生成第一视角交互视频。它指出 mask-based hand conditioning 会把“手几何”和“可见性/遮挡”混在一起：训练视频中手常被物体遮挡，而推理时 free-space gesture 是完整可见的手，导致分布偏移。因此它用 **projected 3D MANO hand mesh 的 silhouette + wireframe** 作为 occlusion-invariant control，并用 per-pixel Pluecker-ray embedding 显式建模相机运动。",
    "limitations": "- 它非常适合和 HandsOnWorld 放一起对比：二者都强调 **3D hand + camera disentanglement**。\n- 但 Hand2World 的 object response 仍是 video diffusion 隐式学习出来的；缺少显式 object state / 4D object dynamics。\n- 可扩展方向：把 hand mesh control 扩为 **hand-object-contact-object-state control**。\n\n---",
    "links": {
      "paper": "https://arxiv.org/abs/2602.09600",
      "project": "https://hand2world.github.io/",
      "alphaxiv": "https://alphaxiv.org/abs/2602.09600"
    },
    "pipeline": {
      "input": "单张 egocentric scene image、free-space hand gesture sequence、可选 camera control。",
      "process": "重建/投影 3D hand mesh；生成 silhouette + wireframe 控制信号；注入 Pluecker-ray camera geometry；将 bidirectional diffusion distill 成 causal autoregressive generator。",
      "output": "可长时程、可流式生成的第一视角手-物交互视频。",
      "details": "- **输入**：单张 egocentric scene image、free-space hand gesture sequence、可选 camera control。\n- **过程**：重建/投影 3D hand mesh；生成 silhouette + wireframe 控制信号；注入 Pluecker-ray camera geometry；将 bidirectional diffusion distill 成 causal autoregressive generator。\n- **输出**：可长时程、可流式生成的第一视角手-物交互视频。"
    },
    "publication": "arXiv 2026",
    "source_reports": [
      "report-0ad44831eb",
      "report-90041fa2f9"
    ],
    "summary": "Hand2World 从单张 scene image 和 free-space hand gesture 生成第一视角交互视频。它指出 mask-based hand conditioning 会把“手几何”和“可见性/遮挡”混在一起：训练视频中手常被物体遮挡，而推理时 free-space gesture 是完整可见的手，导致分布偏移。因此它用 projected 3D MANO hand mesh 的 silhouette + wireframe 作为 occlusion-invariant control，并用 per-pixel Pluecker-ray embedding 显式建模相机运动。",
    "tags": [
      "3D/4D",
      "Agent与可执行世界",
      "HOI",
      "因果与反事实",
      "第一视角与人类视频",
      "视频生成"
    ],
    "title": "Hand2World: Autoregressive Egocentric Interaction Generation via Free-Space Hand Gestures",
    "updated_at": "2026-08-23",
    "year": 2026,
    "discussion": "- 它非常适合和 HandsOnWorld 放一起对比：二者都强调 **3D hand + camera disentanglement**。\n- 但 Hand2World 的 object response 仍是 video diffusion 隐式学习出来的；缺少显式 object state / 4D object dynamics。\n- 可扩展方向：把 hand mesh control 扩为 **hand-object-contact-object-state control**。\n\n---"
  },
  {
    "arxiv": {
      "published": "2026-07-02T12:14:02Z",
      "revised_at": "2026-08-14T13:15:06Z",
      "primary_category": "cs.CV"
    },
    "arxiv_id": "2607.02075",
    "authors": [
      "Yushuo Chen",
      "Xiaoyu Shi",
      "Xiaoshi Wu",
      "Xintao Wang",
      "Pengfei Wan",
      "Yebin Liu"
    ],
    "code_data_status": "截至来源报告核验时，未记录可确认的官方代码、数据或模型入口；这表示开放状态待核验，不代表资源确定不存在。",
    "comments": "",
    "deleted": false,
    "doi": "",
    "evidence_notes": "",
    "experiments": "论文报告其在视觉保真度、手部控制精度、跨真实日常场景泛化方面优于 prior hand-controlled generators。它的强项是 **unconstrained data scale + camera-hand disentanglement**。\n\n**对你方向的启发**\n\n- 适合作为出发点和 baseline。\n- 但它更偏 **hand-controlled video generation**，不是完整 HOI simulator。\n- 可扩展方向：加入 **object-centric 3D/4D state、contact dynamics、persistent world memory**。\n\n---",
    "figure": {
      "alt": "HandsOnWorld",
      "label": "HandsOnWorld 生成示例",
      "paper_title": "HandsOnWorld: Unconstrained Egocentric Video Generation with Camera-Disentangled Hand Control",
      "source_url": "https://arxiv.org/html/2607.02075v2/showcases.png",
      "url": "https://arxiv.org/html/2607.02075v2/showcases.png"
    },
    "id": "arxiv-2607-02075",
    "insight": "HandsOnWorld 解决的是 unconstrained monocular egocentric video 下的 hand-controlled generation。关键 insight 是：实验室多视角/动捕数据太窄，真实 ego video 又缺干净 3D hand annotation；因此它构建 EgoVid-Pro，用 protagonist-centered annotation pipeline 从大规模单目视频中过滤出干净 3D hand trajectories。另一个关键点是 **Pluecker Hand Map**：把手部表面也放进与相机同一世界坐标下的 Pluecker-style representation，缓解 camera motion 和 hand motion 的纠缠。",
    "limitations": "- 适合作为出发点和 baseline。\n- 但它更偏 **hand-controlled video generation**，不是完整 HOI simulator。\n- 可扩展方向：加入 **object-centric 3D/4D state、contact dynamics、persistent world memory**。\n\n---",
    "links": {
      "paper": "https://arxiv.org/abs/2607.02075",
      "alphaxiv": "https://alphaxiv.org/abs/2607.02075"
    },
    "pipeline": {
      "input": "首帧图像、目标 3D camera trajectory、目标 3D hand trajectory。",
      "process": "从 EgoVid-5M 中筛选出动作语义、图像质量、3D 几何都可靠的 EgoVid-Pro；用 Pluecker Hand Map 表达 3D-aware hand control；训练 egocentric video generator。",
      "output": "手部动作可控、相机-手部运动解耦的第一视角视频。",
      "details": "- **输入**：首帧图像、目标 3D camera trajectory、目标 3D hand trajectory。\n- **过程**：从 EgoVid-5M 中筛选出动作语义、图像质量、3D 几何都可靠的 EgoVid-Pro；用 Pluecker Hand Map 表达 3D-aware hand control；训练 egocentric video generator。\n- **输出**：手部动作可控、相机-手部运动解耦的第一视角视频。"
    },
    "publication": "arXiv 2026；v2 更新于 2026-08-13",
    "source_reports": [
      "report-0ad44831eb"
    ],
    "summary": "HandsOnWorld 解决的是 unconstrained monocular egocentric video 下的 hand-controlled generation。关键 insight 是：实验室多视角/动捕数据太窄，真实 ego video 又缺干净 3D hand annotation；因此它构建 EgoVid-Pro，用 protagonist-centered annotation pipeline 从大规模单目视频中过滤出干净 3D hand trajectories。另一个关键点是 Pluecker Hand Map ：把手部表面也放进与相机同一世界坐标下的 Pluecker-style representation，缓解 camera motion 和 hand motion 的纠缠。",
    "tags": [
      "3D/4D",
      "HOI",
      "第一视角与人类视频",
      "视频生成"
    ],
    "title": "HandsOnWorld: Unconstrained Egocentric Video Generation with Camera-Disentangled Hand Control",
    "updated_at": "2026-08-23",
    "year": 2026,
    "discussion": "- 适合作为出发点和 baseline。\n- 但它更偏 **hand-controlled video generation**，不是完整 HOI simulator。\n- 可扩展方向：加入 **object-centric 3D/4D state、contact dynamics、persistent world memory**。\n\n---"
  },
  {
    "id": "arxiv-2609-09941",
    "title": "HaWMPO: Hallucination-Aware World Model-based Policy Optimization for Generalist Robot Policy",
    "authors": [
      "Zengjue Chen",
      "Peidong Liu",
      "Jiawei Li",
      "Qi Wang"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本，v1",
    "arxiv_id": "2609.09941",
    "doi": "10.48550/arXiv.2609.09941",
    "links": {
      "paper": "https://arxiv.org/abs/2609.09941",
      "alphaxiv": "https://alphaxiv.org/abs/2609.09941"
    },
    "tags": [
      "VLA",
      "世界模型",
      "强化与模仿学习",
      "数据与评测"
    ],
    "figure": {
      "url": "content/images/2609.09941-representative.webp",
      "alt": "Figure 2",
      "label": "Figure 2",
      "paper_title": "HaWMPO: Hallucination-Aware World Model-based Policy Optimization for Generalist Robot Policy",
      "source_url": "https://arxiv.org/html/2609.09941v1#S3.F2"
    },
    "summary": "通用机器人策略在复杂长程场景成功率受限；在线 RL 改善 VLA 但依赖昂贵物理交互、样本效率低且有安全风险。世界模型提供想象 rollout 的替代，但长程 rollout 的预测幻觉产生有偏状态转移，误导策略学习。HaWMPO 提出幻觉感知世界模型策略优化：action-conditioned 幻觉感知模型估计生成图像序列的可靠性，把幻觉分数并入组相对策略优化（GRPO）的 Reward-Soft 机制，训练中抑制不可靠动作块。LIBERO 上平均成功率最佳（超基线模型 15.0%、超最强 baseline 2.8%），G1 机器人真机验证。",
    "insight": "通用机器人策略在复杂长程场景成功率受限；在线 RL 改善 VLA 但依赖昂贵物理交互、样本效率低且有安全风险。世界模型提供想象 rollout 的替代，但长程 rollout 的预测幻觉产生有偏状态转移，误导策略学习。HaWMPO 提出幻觉感知世界模型策略优化：action-conditioned 幻觉感知模型估计生成图像序列的可靠性，把幻觉分数并入组相对策略优化（GRPO）的 Reward-Soft 机制，训练中抑制不可靠动作块。LIBERO 上平均成功率最佳（超基线模型 15.0%、超最强 baseline 2.8%），G1 机器人真机验证。",
    "pipeline": {
      "input": "VLA 策略 + 世界模型 + 目标任务。",
      "process": "世界模型生成想象 rollout → 幻觉感知模型逐动作块估计可靠性 → 幻觉分数进入 Reward-Soft（GRPO）→ 抑制不可靠动作块 → 策略更新（闭环）。",
      "output": "世界模型后训练（post-training）的 VLA 策略。",
      "details": "**输入**：VLA 策略 + 世界模型 + 目标任务。\n**过程**：世界模型生成想象 rollout → 幻觉感知模型逐动作块估计可靠性 → 幻觉分数进入 Reward-Soft（GRPO）→ 抑制不可靠动作块 → 策略更新（闭环）。\n**输出**：世界模型后训练（post-training）的 VLA 策略。"
    },
    "experiments": "正文表 1 在所选 LIBERO Spatial/Goal/Object 设置下报告平均成功率 63.7%，对比 OpenVLA-OFT-base 48.7%、WMPO 56.8%、WoVR* 60.9%，分别高 15.0、6.9、2.8 个百分点。表 3 还在 50 个 LIBERO 动作块上与人类幻觉标注比较：HAM 的 AUROC 为 0.9375，轨迹 bootstrap 95% CI 为 [0.8648,0.9911]；AP 为 0.8952，95% CI 为 [0.7660,0.9885]。因此“完全未直接验证幻觉分数”不成立，但样本仅 50 个块、标签仍依赖人工定义，不能等同普遍可靠的物理误差估计。 [正文实验与表格](https://arxiv.org/html/2609.09941v1)。",
    "evidence_notes": "2026-09-14 已核对 arXiv 元数据、正文主要实验与对照；未运行复现实验。",
    "code_data_status": "未发现公开代码/模型/数据。不可复现（基于摘要信息）。",
    "limitations": "人类标注幻觉对照仅 50 个动作块；检测分数在长程、相机变化和真实物理失败上的校准仍待验证。报告的 2.8 是百分点增益，且来自指定训练/测试设置。",
    "comments": "",
    "source_reports": [
      "report-37b94c4145"
    ],
    "deleted": false,
    "updated_at": "2026-09-14",
    "discussion": "直接命中「世界模型中的可靠性」与「世界模型用于策略优化」。与知域 8 月收录的失败条件世界模型（FACT 等）专题衔接，把「失败/幻觉」从评测对象变成训练信号。",
    "arxiv": {
      "published": "2026-09-09T09:33:25Z",
      "revised_at": "2026-09-09T09:33:25Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "arxiv": {
      "published": "2026-04-12T22:06:11Z",
      "revised_at": "2026-04-12T22:06:11Z",
      "primary_category": "cs.CV"
    },
    "arxiv_id": "2604.10836",
    "authors": [
      "Zerui Chen",
      "Rolandos Alexandros Potamias",
      "Shizhe Chen",
      "Jiankang Deng",
      "Cordelia Schmid",
      "Stefanos Zafeiriou"
    ],
    "code_data_status": "截至来源报告核验时，未记录可确认的官方代码、数据或模型入口；这表示开放状态待核验，不代表资源确定不存在。",
    "comments": "",
    "deleted": false,
    "doi": "",
    "evidence_notes": "",
    "experiments": "在 GRAB、OakInk、DexYCB 上，HO-Flow 在物理合理性、运动多样性、接触保持方面超过 prior methods。\n\n**对你方向的启发**\n\n- 适合作为 4D HOI motion prior。\n- 不做 RGB video，但可作为 video world model 的 3D latent supervision。\n\n---",
    "figure": {
      "alt": "HO-Flow overview",
      "label": "HO-Flow overview",
      "paper_title": "HO-Flow: Generalizable Hand-Object Interaction Generation with Latent Flow Matching",
      "source_url": "https://arxiv.org/html/2604.10836v1/overview.png",
      "url": "https://arxiv.org/html/2604.10836v1/overview.png"
    },
    "id": "arxiv-2604-10836",
    "insight": "HO-Flow 生成 text-conditioned 3D hand-object interaction motion sequence。它的重点是把 hand 和 object motion 编进统一 latent manifold，并用 masked flow matching 做时间推理和连续 latent generation。关键 insight 是：要同时建模 hand kinematics、object motion、contact-rich coordination，才能得到物理合理且多样的 4D interaction sequence。",
    "limitations": "- 适合作为 4D HOI motion prior。\n- 不做 RGB video，但可作为 video world model 的 3D latent supervision。\n\n---",
    "links": {
      "paper": "https://arxiv.org/abs/2604.10836",
      "project": "https://zerchen.github.io/projects/hoflow.html",
      "alphaxiv": "https://alphaxiv.org/abs/2604.10836"
    },
    "pipeline": {
      "input": "text prompt、object geometry / point cloud、上下文 motion tokens。",
      "process": "Interaction-aware VAE 编码 hand/object motion；masked auto-regressive flow matching 逐步生成 latent；object motion 用相对初始帧表示以增强泛化。",
      "output": "3D hand-object interaction motion sequence。",
      "details": "- **输入**：text prompt、object geometry / point cloud、上下文 motion tokens。\n- **过程**：Interaction-aware VAE 编码 hand/object motion；masked auto-regressive flow matching 逐步生成 latent；object motion 用相对初始帧表示以增强泛化。\n- **输出**：3D hand-object interaction motion sequence。"
    },
    "publication": "ECCV 2026",
    "source_reports": [
      "report-0ad44831eb"
    ],
    "summary": "HO-Flow 生成 text-conditioned 3D hand-object interaction motion sequence。它的重点是把 hand 和 object motion 编进统一 latent manifold，并用 masked flow matching 做时间推理和连续 latent generation。关键 insight 是：要同时建模 hand kinematics、object motion、contact-rich coordination，才能得到物理合理且多样的 4D interaction sequence。",
    "tags": [
      "3D/4D",
      "HOI",
      "第一视角与人类视频"
    ],
    "title": "HO-Flow: Generalizable Hand-Object Interaction Generation with Latent Flow Matching",
    "updated_at": "2026-08-23",
    "year": 2026,
    "discussion": "- 适合作为 4D HOI motion prior。\n- 不做 RGB video，但可作为 video world model 的 3D latent supervision。\n\n---"
  },
  {
    "id": "arxiv-2609-06009",
    "title": "How to Learn from What a Human Would Avoid? Intervention-Aware World Models with Real-World RL for Dexterous Manipulation",
    "authors": [
      "Jiaju Yin",
      "Zhenhui Zhang",
      "Lixin Xu",
      "Heng Zhang",
      "Jun Shao",
      "Yating Feng",
      "Arash Ajoudani",
      "Renjing Xu"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本，v1；arXiv 作者备注称 CoRL 2026 接收",
    "arxiv_id": "2609.06009",
    "doi": "10.48550/arXiv.2609.06009",
    "links": {
      "paper": "https://arxiv.org/abs/2609.06009",
      "project": "https://whirl-dexterous.github.io/",
      "alphaxiv": "https://alphaxiv.org/abs/2609.06009"
    },
    "tags": [
      "世界模型",
      "强化与模仿学习",
      "触觉与灵巧操作"
    ],
    "figure": {
      "url": "content/images/2609.06009-representative.webp",
      "alt": "Figure 2",
      "label": "Figure 2",
      "paper_title": "How to Learn from What a Human Would Avoid? Intervention-Aware World Models with Real-World RL for Dexterous Manipulation",
      "source_url": "https://arxiv.org/html/2609.06009v1#S1.F2"
    },
    "summary": "WHIRL 不把人类接管只当纠错动作，而把“人何时会接管”建模为未来风险。接管事件编码操作者的隐式安全边界，世界模型预测未来接管概率，再作为 actor 的风险 shaping，提前避开高风险区域。",
    "insight": "WHIRL 不把人类接管只当纠错动作，而把“人何时会接管”建模为未来风险。接管事件编码操作者的隐式安全边界，世界模型预测未来接管概率，再作为 actor 的风险 shaping，提前避开高风险区域。",
    "pipeline": {
      "input": "真实机器人状态、动作、奖励、终止信号和二值接管记录。",
      "process": "训练包含 dynamics、reward、termination、intervention-probability 四个头的 latent world model；策略在 imagined rollout 中联合优化回报和预测风险。",
      "output": "具备主动避险倾向的灵巧手策略。",
      "details": "- **输入**：真实机器人状态、动作、奖励、终止信号和二值接管记录。\n- **过程**：训练包含 dynamics、reward、termination、intervention-probability 四个头的 latent world model；策略在 imagined rollout 中联合优化回报和预测风险。\n- **输出**：具备主动避险倾向的灵巧手策略。"
    },
    "experiments": "在 16-DoF LEAP Hand 上覆盖规则/不规则物体抓取、棱柱操作和长时任务。摘要报告复杂抓取成功率 96.7%，按步数加权的干预负担最多下降 84%。这支持所测真实任务中的风险 shaping 收益，但未证明对不同操作者、风险偏好或机器人普遍成立；摘要未给完整方差和失败分布。 [正文实验与表格](https://arxiv.org/html/2609.06009v1)。",
    "evidence_notes": "2026-09-14 已核对 arXiv 元数据、正文主要实验与对照；未运行复现实验。",
    "code_data_status": "项目页存在；未确认代码、训练数据或权重已实际开放，不能认定可复现。",
    "limitations": "二值接管混合反应延迟、注意力和个人风险偏好；接管概率是风险代理，不是事故概率。需检查漏接管状态是否被误标安全，并研究跨操作者校准。",
    "comments": "",
    "source_reports": [
      "report-37b94c4145"
    ],
    "deleted": false,
    "updated_at": "2026-09-14",
    "discussion": "连接灵巧 HOI、真实机器人 RL 和动作条件世界模型。重要启发是：不仅学习人做了什么，也学习人拒绝进入哪些状态。",
    "arxiv": {
      "published": "2026-09-05T10:28:23Z",
      "revised_at": "2026-09-05T10:28:23Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2609-10706",
    "title": "HuRo: Robotizing Human Videos for Scalable VLA Pretraining",
    "authors": [
      "Jinho Jeong",
      "Se June Joo",
      "Jaehyun Kang",
      "Dongyun Kim",
      "Yena Kim",
      "Hanjung Kim",
      "Seon Joo Kim"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本，v2；arXiv 作者备注称 CoRL 2026 接收",
    "arxiv_id": "2609.10706",
    "doi": "10.48550/arXiv.2609.10706",
    "links": {
      "paper": "https://arxiv.org/abs/2609.10706",
      "project": "https://3587jjh.github.io/HuRo",
      "code": "https://github.com/3587jjh/HuRo",
      "alphaxiv": "https://alphaxiv.org/abs/2609.10706"
    },
    "tags": [
      "第一视角与人类视频",
      "触觉与灵巧操作",
      "跨本体迁移",
      "预训练与扩展律"
    ],
    "figure": {
      "url": "content/images/2609.10706-representative.webp",
      "alt": "Figure 2",
      "label": "Figure 2",
      "paper_title": "HuRo: Robotizing Human Videos for Scalable VLA Pretraining",
      "source_url": "https://arxiv.org/html/2609.10706v2#S3.F2"
    },
    "summary": "HuRo 把异构 egocentric 视频统一转为机器人观测—动作序列：估计手、相机和语言，做三维运动重定向，去除人臂并叠加机器人。关键证据是规模曲线，以及“视觉+动作端到端预训练”优于只迁移视觉。",
    "insight": "HuRo 把异构 egocentric 视频统一转为机器人观测—动作序列：估计手、相机和语言，做三维运动重定向，去除人臂并叠加机器人。关键证据是规模曲线，以及“视觉+动作端到端预训练”优于只迁移视觉。",
    "pipeline": {
      "input": "Ego4D、EPIC-Kitchens、EgoDex、EgoVerse、Ego10K 视频。",
      "process": "相机/手追踪；估计世界空间手姿与相机轨迹；语言分段；重定向到 ALLEX；分割修复人臂并渲染机器人；预训练 VLA。",
      "output": "约 630K episodes、142M 帧和下游 VLA 参数。",
      "details": "- **输入**：Ego4D、EPIC-Kitchens、EgoDex、EgoVerse、Ego10K 视频。\n- **过程**：相机/手追踪；估计世界空间手姿与相机轨迹；语言分段；重定向到 ALLEX；分割修复人臂并渲染机器人；预训练 VLA。\n- **输出**：约 630K episodes、142M 帧和下游 VLA 参数。"
    },
    "experiments": "四个真实任务总体完成率 51.5%→80.3%，OOD 34.9%→72.2%。无 overlay 版本 ID 89.4% 略高于 full 88.4%，但 OOD 55.7% 对 72.2%，支持 visual robotization 主要改善所测 OOD。Visual+Action 也优于 Visual Only。结果来自 ALLEX 和有限任务，不是跨机器人 scaling law。 [正文实验与表格](https://arxiv.org/html/2609.10706v2)。",
    "evidence_notes": "2026-09-14 已核对 arXiv 元数据、正文主要实验与对照；未运行复现实验。",
    "code_data_status": "仓库含 pipeline、configs、run_pipeline.sh 和部署说明；完整 142M 帧数据的独立下载范围待核验。 以上状态核验于 2026-09-14；入口和目录存在不等于已经运行复现实验。",
    "limitations": "作者指出 overlay 未显式处理遮挡；缺力觉/触觉；重定向不模拟自碰撞和接触。五源审计仅 55.2% 轨迹无检测到非抓取自接触，因此更适合预训练监督而非直接执行示范。",
    "comments": "",
    "source_reports": [
      "report-37b94c4145"
    ],
    "deleted": false,
    "updated_at": "2026-09-14",
    "discussion": "是从人类视频学习具身策略的大规模证据；其世界空间手运动和相机轨迹可进一步用于显式 3D world-action modeling。",
    "arxiv": {
      "published": "2026-09-09T18:02:05Z",
      "revised_at": "2026-09-11T06:22:28Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2608-18077",
    "title": "Hydra-0: Action Flow for Generalist World Modeling and Control",
    "authors": [
      "Hongyu Li",
      "Bowen Wen",
      "Xinghao Zhu",
      "Yixuan Wang",
      "Yilun Du",
      "Yunzhu Li",
      "George Konidaris",
      "Stan Birchfield",
      "Soha Pouya",
      "Chenran Li",
      "Yan Chang"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本",
    "arxiv_id": "2608.18077",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.18077",
      "project": "https://nvidia-isaac.github.io/video_to_data/hydra-0/",
      "alphaxiv": "https://alphaxiv.org/abs/2608.18077"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "动作表征",
      "因果与反事实",
      "流式与自回归",
      "第一视角与人类视频"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.18077v1/method_overview.png",
      "alt": "Hydra-0 Fig. 1：action flow 世界建模与控制总览",
      "label": "Hydra-0，Fig. 1，action flow 统一跨本体世界建模与控制的方法总览。来源：Fig. 1 原图 PNG",
      "paper_title": "Hydra-0: Action Flow for Generalist World Modeling and Control",
      "source_url": "https://arxiv.org/html/2608.18077v1/method_overview.png"
    },
    "summary": "Hydra-0 提出以 action flow ——图像平面上的轨迹流——作为跨本体的统一动作表示。核心 insight 是：无论是人手、手持夹爪、单臂还是双臂机器人，其可见运动都可以被描述为相机平面上的像素轨迹。这一表示将异质交互数据置于同一动作空间中，使单一通用世界模型能从多本体视频学习动作后果，并在正向模式下做未来场景预测、在逆向模式下从期望物体运动推导兼容机器人动作。",
    "insight": "Hydra-0 提出以 **action flow**——图像平面上的轨迹流——作为跨本体的统一动作表示。核心 insight 是：无论是人手、手持夹爪、单臂还是双臂机器人，其可见运动都可以被描述为相机平面上的像素轨迹。这一表示将异质交互数据置于同一动作空间中，使单一通用世界模型能从多本体视频学习动作后果，并在正向模式下做未来场景预测、在逆向模式下从期望物体运动推导兼容机器人动作。\n\n关键创新点：action flow 既是条件信号（正向：给定轨迹流预测视频），也是控制接口（逆向：给定目标物体流反推机器人运动），且两者共享同一世界模型潜在空间。",
    "pipeline": {
      "input": "当前观测帧 + 动作流（像素平面轨迹序列，含可见性标记）",
      "process": "动作流在训练时从交互视频中用密集追踪器恢复并用接地掩码分为本体轨迹和物体轨迹；在部署时从机器人运动学投影得到。视频扩散模型以第一帧 + 动作流为条件，用流匹配目标训练。逆向模式中，目标物体流编码到隐空间，经监督式动作头映射为可执行动作。",
      "output": "正向模式输出未来视频序列（用于开环策略评估）；逆向模式输出可执行机器人动作（无需任务特定专家演示）",
      "details": "**输入**：当前观测帧 + 动作流（像素平面轨迹序列，含可见性标记）\n\n**过程**：动作流在训练时从交互视频中用密集追踪器恢复并用接地掩码分为本体轨迹和物体轨迹；在部署时从机器人运动学投影得到。视频扩散模型以第一帧 + 动作流为条件，用流匹配目标训练。逆向模式中，目标物体流编码到隐空间，经监督式动作头映射为可执行动作。\n\n**输出**：正向模式输出未来视频序列（用于开环策略评估）；逆向模式输出可执行机器人动作（无需任务特定专家演示）"
    },
    "experiments": "- **数据**：2,202 小时过滤多本体训练视频（EgoDex 人手、Deform360 手持夹爪、DROID 单臂、XVLA-Soft-Fold 双臂）\n- **指标**：机器人运动误差、物体运动误差、RoboLab 成功率 Pearson 相关\n- **定量结果**：action flow 条件相比原生动作条件，机器人运动误差降低 90.4%，物体运动误差降低 60.2%；RoboLab 300 episode 上 replayed 与 reference 成功率 \\(r=0.96\\)；蒸馏后生成加速 16×\n- **消融**：摘要中提及零样本组合和数据高效适应，具体消融设计待全文核验\n- **实验直接支持的结论**：action flow 作为条件显著优于原生动作条件；世界模型评分与实际控制成功率高度相关；逆向模式可工作\n- **尚未被实验支持的主张**：跨本体逆向迁移（逆向模式仅在单一本体验证）；action flow 在非操作场景的通用性",
    "evidence_notes": "",
    "code_data_status": "代码、数据和模型在论文提交时均未公开。项目页仅展示演示视频和方法说明。无法判断复现性。",
    "limitations": "- 逆向模式的跨本体迁移未验证\n- action flow 依赖密集追踪器在训练时的恢复质量，追踪失败如何影响世界模型训练未讨论\n- 2D 图像平面表示丢失深度信息，对需要 3D 精度的操作可能不足\n- 2,202 小时视频的过滤标准未在摘要中披露\n\n### 与知域的关系\n\nHydra-0 与知域关注的 World-Action-Model 方向直接相关。其 action flow 概念是 FlowWAM（光流动作）在 2D 图像平面的对应，但额外支持正向/逆向双模式操作，这是此前 WAM 路线中未见的。对跨本体学习、从人类视频到机器人控制的研究路线有直接影响。\n\n---",
    "comments": "",
    "source_reports": [
      "report-f5f82689ca"
    ],
    "deleted": false,
    "updated_at": "2026-08-23",
    "arxiv": {
      "published": "2026-08-18T17:59:30Z",
      "revised_at": "2026-08-18T17:59:30Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2609-07581",
    "title": "ICI-VLA: In-Context Imitation with Spatiotemporally Aligned Demonstrations for Vision-Language-Action Models",
    "authors": [
      "Songhua Yang",
      "Ziyu Liu",
      "Xuetao Li",
      "Ruqi Xiao",
      "Kangxin Zhu",
      "Miao Li"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本，v1",
    "arxiv_id": "2609.07581",
    "doi": "10.48550/arXiv.2609.07581",
    "links": {
      "paper": "https://arxiv.org/abs/2609.07581",
      "alphaxiv": "https://alphaxiv.org/abs/2609.07581"
    },
    "tags": [
      "VLA",
      "具身上下文学习",
      "强化与模仿学习",
      "长时记忆"
    ],
    "figure": {
      "url": "content/images/2609.07581-representative.webp",
      "alt": "Figure 2",
      "label": "Figure 2",
      "paper_title": "ICI-VLA: In-Context Imitation with Spatiotemporally Aligned Demonstrations for Vision-Language-Action Models",
      "source_url": "https://arxiv.org/html/2609.07581v1#S3.F2"
    },
    "summary": "ICI-VLA 让固定参数 VLA 在推理时读取检索到的短示范，不为每个新任务做梯度更新。长演示被切成语义 micro-demonstrations，上下文同时匹配任务阶段和几何状态。",
    "insight": "ICI-VLA 让固定参数 VLA 在推理时读取检索到的短示范，不为每个新任务做梯度更新。长演示被切成语义 micro-demonstrations，上下文同时匹配任务阶段和几何状态。",
    "pipeline": {
      "input": "当前视觉/语言状态与演示库短轨迹。",
      "process": "用 DTW 挖掘时空对齐正样本训练 RD-Encoder；推理时检索微示范；Target Action Masking 降低直接复制。",
      "output": "参数冻结条件下生成的机器人动作。",
      "details": "- **输入**：当前视觉/语言状态与演示库短轨迹。\n- **过程**：用 DTW 挖掘时空对齐正样本训练 RD-Encoder；推理时检索微示范；Target Action Masking 降低直接复制。\n- **输出**：参数冻结条件下生成的机器人动作。"
    },
    "experiments": "正文表 1 报告 LIBERO 97.7%、RoboTwin 2.0 60.4%，后者比所列最高基线高 19.3 个百分点；论文明确这些历史基线采用各自已发表协议。表 2 中去掉 DTW 后 RoboTwin 平均降至 31.4%，去掉语义检索为 38.1%，Naive ICL 为 10.7%，比跨模型排行更直接支持检索对齐和目标动作掩蔽。表 3 的四个真机任务每项 250 次，共 1,000 次；平均成功率 83.2%，95% Wilson 区间为 [80.8,85.4]。不应把该论文归入“每任务仅 10–25 次且无置信区间”的情况。 [正文实验与表格](https://arxiv.org/html/2609.07581v1)。",
    "evidence_notes": "2026-09-14 已核对 arXiv 元数据、正文主要实验与对照；未运行复现实验。",
    "code_data_status": "未确认代码和模型发布；使用公共 benchmark 不等于训练流水线可复现。",
    "limitations": "检索库覆盖决定能力上限；测试与示范过近会高估泛化。需报告检索延迟、上下文长度、无相关示范和对抗性近邻下的退化。",
    "comments": "",
    "source_reports": [
      "report-37b94c4145"
    ],
    "deleted": false,
    "updated_at": "2026-09-14",
    "discussion": "直接命中 embodied in-context learning，可与世界模型式 test-time planning 对照。",
    "arxiv": {
      "published": "2026-09-07T14:55:35Z",
      "revised_at": "2026-09-07T14:55:35Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2609-09210",
    "title": "Identifying Habit, Physics, and Nuisance in Robot World Models",
    "authors": [
      "Jinting Hang",
      "Zhenhui Cai"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本，v1",
    "arxiv_id": "2609.09210",
    "doi": "10.48550/arXiv.2609.09210",
    "links": {
      "paper": "https://arxiv.org/abs/2609.09210",
      "alphaxiv": "https://alphaxiv.org/abs/2609.09210"
    },
    "tags": [
      "世界模型",
      "因果与反事实",
      "适应与泛化"
    ],
    "figure": {
      "url": "content/images/2609.09210-representative.webp",
      "alt": "Fig. 3",
      "label": "Fig. 3",
      "paper_title": "Identifying Habit, Physics, and Nuisance in Robot World Models",
      "source_url": "https://arxiv.org/html/2609.09210v1#S5.F3"
    },
    "summary": "论文用 SCM 区分操作者习惯、共享物理和观测干扰：a=g(h,z,u)、z'=f(z,a)、o=r(z,c)。多模态示范常来自选动作习惯，而非物理随机；若排除限制成立，应冻结共享 dynamics，只适配薄接口。",
    "insight": "论文用 SCM 区分操作者习惯、共享物理和观测干扰：\\(a=g(h,z,u)\\)、\\(z'=f(z,a)\\)、\\(o=r(z,c)\\)。多模态示范常来自选动作习惯，而非物理随机；若排除限制成立，应冻结共享 dynamics，只适配薄接口。",
    "pipeline": {
      "input": "状态或图像、动作、操作者/命令信息和下一状态。",
      "process": "训练动作条件动力学；用动作替换/打乱、操作者交换、外观与相机扰动测试路径；比较 freeze、finetune、scratch。",
      "output": "下一状态预测、habit-aware reverse score 和适配接口。",
      "details": "- **输入**：状态或图像、动作、操作者/命令信息和下一状态。\n- **过程**：训练动作条件动力学；用动作替换/打乱、操作者交换、外观与相机扰动测试路径；比较 freeze、finetune、scratch。\n- **输出**：下一状态预测、habit-aware reverse score 和适配接口。"
    },
    "experiments": "StackCube 错误动作使误差约增 10.4 倍，16-shot 下 freeze+interface 优于 finetune/scratch；DROID 图像中错误动作约增 9.5 倍而外观扰动比值近 1；多步错误动作比随 horizon 增大。闭环仅仿真。证据是对 SCM 排除限制的代理检验，不是无条件 causal identification。 [正文实验与表格](https://arxiv.org/html/2609.09210v1)。",
    "evidence_notes": "2026-09-14 已核对 arXiv 元数据、正文主要实验与对照；未运行复现实验。",
    "code_data_status": "使用公开数据和仿真环境，但实现与权重未确认公开。",
    "limitations": "跨任务 habit transfer 不确定，跨相机退化明显；若习惯改变接触参数，\\(h\\to z\\) 不可忽略，冻结 dynamics 会错设。",
    "comments": "",
    "source_reports": [
      "report-37b94c4145"
    ],
    "deleted": false,
    "updated_at": "2026-09-14",
    "discussion": "价值主要在干预诊断协议，可直接启发 Causal-JEPA 增加可证伪的动作/外观对照。",
    "arxiv": {
      "published": "2026-09-06T00:20:22Z",
      "revised_at": "2026-09-06T00:20:22Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2606-09813",
    "title": "iMaC: Translating Actions into Motion and Contact Images for Embodied World Models",
    "authors": [
      "Zhenyu Wu",
      "Xiuwei Xu",
      "Yukun Zhou",
      "Yifan Li",
      "Qiuping Deng",
      "Xiaofeng Wang",
      "Zheng Zhu",
      "Bingyao Yu",
      "Ziwei Wang",
      "Jiwen Lu",
      "Haibin Yan"
    ],
    "year": 2026,
    "publication": "2026，arXiv preprint",
    "arxiv_id": "2606.09813",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2606.09813",
      "project": "https://imac-wm.github.io/",
      "alphaxiv": "https://alphaxiv.org/abs/2606.09813"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "世界模型",
      "动作表征",
      "因果与反事实",
      "机器人学习",
      "跨本体迁移"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2606.09813/x1.png",
      "alt": "iMaC Fig. 1",
      "label": "iMaC，Fig. 1，动作转换为 motion images 与 contact images 的整体流程。来源：Fig. 1 原图",
      "paper_title": "iMaC: Translating Actions into Motion and Contact Images for Embodied World Models",
      "source_url": "https://arxiv.org/html/2606.09813/x1.png"
    },
    "summary": "iMaC 把动作翻译成两类图像：motion image 给出未来机器人外观/位置，双向 contact image 给出未来机器人与当前场景的 3D 距离。核心 Insight 是让视频生成器显式读取“谁移动到哪里”和“哪里可能接触”，用于分钟级 rollout 与策略 checkpoint 排序。",
    "insight": "iMaC 把动作翻译成两类图像：motion image 给出未来机器人外观/位置，双向 contact image 给出未来机器人与当前场景的 3D 距离。核心 Insight 是让视频生成器显式读取“谁移动到哪里”和“哪里可能接触”，用于分钟级 rollout 与策略 checkpoint 排序。",
    "pipeline": {
      "input": "头部与双腕 RGB、语言、未来关节动作、URDF、关节状态、相机参数和 DA3 初始深度。",
      "process": "三视角拼 mosaic；控制器与正向运动学渲染未来机器人 motion images。移除当前机器人并构造场景点云，再计算 robot→scene 与 scene→gripper 最近距离场，投影为两路 contact images。三类控制 latent 注入 Wan2.2；模型联合预测 RGB/彩色深度，并以训练期生成参考缓解分块 rollout 的 exposure bias。",
      "output": "多视角 RGB/深度长视频，以及由 rollout 得到的策略成功分数与排序。",
      "details": "- **输入：** 头部与双腕 RGB、语言、未来关节动作、URDF、关节状态、相机参数和 DA3 初始深度。\n- **过程：** 三视角拼 mosaic；控制器与正向运动学渲染未来机器人 motion images。移除当前机器人并构造场景点云，再计算 robot→scene 与 scene→gripper 最近距离场，投影为两路 contact images。三类控制 latent 注入 Wan2.2；模型联合预测 RGB/彩色深度，并以训练期生成参考缓解分块 rollout 的 exposure bias。\n- **输出：** 多视角 RGB/深度长视频，以及由 rollout 得到的策略成功分数与排序。"
    },
    "experiments": "八项真实长时任务混合成功/失败数据，π0.5 与 GigaBrain-0.5 各取早中晚 checkpoint，每评估组 30 episodes；先联合训练再逐任务微调，最终不是单一通用模型。iMaC 的 MSE/FID/PSNR/SSIM/FVD 为 0.028/36.96/16.39/0.735/489.51，Ctrl-World 为 0.030/48.64/16.22/0.730/591.47；去掉 contact images 的 FVD 523.94，说明接触场主要改善时序质量。\n\n世界模型分数与真实成功率的八任务 Pearson 为 0.956、0.931、0.678、0.915、0.428、0.870、0.856、0.833；两项涉及相机难观察的高度关系，明确暴露观测盲区。相关性只来自两个策略族×三个 checkpoint，且没有 CI、p 值或 Spearman。论文未披露数据规模、GPU、时延与训练成本。",
    "evidence_notes": "",
    "code_data_status": "项目页公开；未核验到完整代码、权重、训练集和评测脚本，论文未充分披露 GPU、数据规模和时延。",
    "limitations": "- 依赖 URDF、精确标定和深度；DA3 误差会改变接触时序。\n- 相机盲区会生成视觉合理但物理错误的结果。\n- 分块生成仍会累积模糊与动作漂移。\n- 每任务单独微调，不是通用单模型。\n- 仅两个策略族，相关性的泛化与统计稳定性不足。",
    "comments": "",
    "source_reports": [
      "report-a77d9a7ad6"
    ],
    "deleted": false,
    "updated_at": "2026-09-02",
    "challenges": "离线策略评估要求世界模型区分厘米级动作差异导致的抓住、错过或碰撞。低维动作没有直接指明机器人将出现在哪里、与物体多远；仅渲染机器人运动仍无法消除 2D 重叠下的深度和接触歧义。",
    "motivation": "iMaC 把动作翻译成两类图像：motion image 给出未来机器人外观/位置，双向 contact image 给出未来机器人与当前场景的 3D 距离。核心 Insight 是让视频生成器显式读取“谁移动到哪里”和“哪里可能接触”，用于分钟级 rollout 与策略 checkpoint 排序。",
    "technical_approach": "- **输入：** 头部与双腕 RGB、语言、未来关节动作、URDF、关节状态、相机参数和 DA3 初始深度。\n- **过程：** 三视角拼 mosaic；控制器与正向运动学渲染未来机器人 motion images。移除当前机器人并构造场景点云，再计算 robot→scene 与 scene→gripper 最近距离场，投影为两路 contact images。三类控制 latent 注入 Wan2.2；模型联合预测 RGB/彩色深度，并以训练期生成参考缓解分块 rollout 的 exposure bias。\n- **输出：** 多视角 RGB/深度长视频，以及由 rollout 得到的策略成功分数与排序。",
    "discussion": "iMaC 已占据“motion/contact images as action interface”。Contact 真正参与动态条件和消融，但仍由动作几何构造，不是从事实实例推断后可执行机制替换的 SCM 变量。",
    "arxiv": {
      "published": "2026-06-08T17:55:41Z",
      "revised_at": "2026-06-08T17:55:41Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2609-15005",
    "title": "IMPACT-VLA: Interaction-aware Multimodal Propagation Attribution via Counterfactual Trajectories for Vision-Language-Action Policies",
    "authors": [
      "Jinwoong Kim",
      "Sangjin Park"
    ],
    "year": 2026,
    "publication": "2026，arXiv v1，2026-09-14 提交",
    "arxiv_id": "2609.15005",
    "doi": "10.48550/arXiv.2609.15005",
    "links": {
      "paper": "https://arxiv.org/abs/2609.15005",
      "alphaxiv": "https://alphaxiv.org/abs/2609.15005"
    },
    "tags": [
      "VLA",
      "因果与反事实"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2609.15005v1/figures/fig1_framework.png",
      "alt": "IMPACT-VLA Fig. 1",
      "label": "IMPACT-VLA，Fig. 1，基于闭环反事实轨迹的阶段化多模态归因框架。来源：Fig. 1 原图 PNG",
      "paper_title": "IMPACT-VLA: Interaction-aware Multimodal Propagation Attribution via Counterfactual Trajectories for Vision-Language-Action Policies",
      "source_url": "https://arxiv.org/html/2609.15005v1/figures/fig1_framework.png"
    },
    "summary": "IMPACT-VLA研究的不是训练更强策略，而是解释视觉、语言和 proprioception 在 哪个执行阶段 对任务成功真正重要。它先从成功参考轨迹中建立 behavioral phases，再把 phase × modality 作为 attribution block，通过闭环重新执行替换后的输入，观察改变如何沿后续状态和动作传播。",
    "insight": "IMPACT-VLA研究的不是训练更强策略，而是解释视觉、语言和 proprioception 在**哪个执行阶段**对任务成功真正重要。它先从成功参考轨迹中建立 behavioral phases，再把 phase × modality 作为 attribution block，通过闭环重新执行替换后的输入，观察改变如何沿后续状态和动作传播。",
    "pipeline": {
      "input": "成功参考 rollout、待解释 policy、视觉/语言/本体感知等模态。",
      "process": "按 action transition 分割 behavioral phase；与 policy query boundary 对齐；对 phase-modality block 做 closed-loop replacement；执行新的轨迹；以 sampled Shapley 和 cross-phase interaction 分析各 block 对最终成功的影响，并区分 behavioral recovery 与 functional recovery。",
      "output": "阶段化模态贡献、跨阶段交互以及干预后的 counterfactual trajectory。",
      "details": "**输入**：成功参考 rollout、待解释 policy、视觉/语言/本体感知等模态。\n\n**过程**：按 action transition 分割 behavioral phase；与 policy query boundary 对齐；对 phase-modality block 做 closed-loop replacement；执行新的轨迹；以 sampled Shapley 和 cross-phase interaction 分析各 block 对最终成功的影响，并区分 behavioral recovery 与 functional recovery。\n\n**输出**：阶段化模态贡献、跨阶段交互以及干预后的 counterfactual trajectory。"
    },
    "experiments": "在 30 个 LIBERO manipulation tasks、OpenVLA-OFT 上，25/30 个任务即 83.3% 出现 dominant-modality transition。对负交互 pair，早期 block 被替换时，后期 block 的 marginal gain 约提高 3.3×；作者还报告不同 intervention kernel 下的 attribution ranking 具有一定稳定性。",
    "evidence_notes": "全文已核验",
    "code_data_status": "本次没有核验到官方代码或项目发布。",
    "limitations": "论文采用真实闭环重新执行，因此属于有意义的 intervention-based attribution；但它不是 causal identification，也没有结构因果模型。输入替换可能造成策略训练分布之外的状态，且 sampled permutations 的 rollout 随机性限制了对很小 attribution 差异的解释。",
    "comments": "",
    "source_reports": [
      "report-1b1ffacf7d"
    ],
    "deleted": false,
    "updated_at": "2026-09-16",
    "challenges": "静态特征敏感性或单步遮蔽无法反映多模态信息在闭环执行中的跨阶段传播、恢复和交互，因而难以定位视觉、语言与本体感知何时真正影响成功。",
    "motivation": "IMPACT-VLA研究的不是训练更强策略，而是解释视觉、语言和 proprioception 在**哪个执行阶段**对任务成功真正重要。它先从成功参考轨迹中建立 behavioral phases，再把 phase × modality 作为 attribution block，通过闭环重新执行替换后的输入，观察改变如何沿后续状态和动作传播。",
    "technical_approach": "**输入**：成功参考 rollout、待解释 policy、视觉/语言/本体感知等模态。\n\n**过程**：按 action transition 分割 behavioral phase；与 policy query boundary 对齐；对 phase-modality block 做 closed-loop replacement；执行新的轨迹；以 sampled Shapley 和 cross-phase interaction 分析各 block 对最终成功的影响，并区分 behavioral recovery 与 functional recovery。\n\n**输出**：阶段化模态贡献、跨阶段交互以及干预后的 counterfactual trajectory。",
    "discussion": "它适合加入知域“因果/反事实世界模型”的**审计工具层**，但应与 Causal-JEPA、SCM、intervention identification 等模型层工作分开。其最大价值是提供一种检查多模态 VLA temporal dependency 的实验协议。",
    "arxiv": {
      "published": "2026-09-14T04:13:17Z",
      "revised_at": "2026-09-14T04:13:17Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2609-00161",
    "title": "IMPACT: Attention Is the Interaction Map for Scalable Interaction-Aware World Model Training",
    "authors": [
      "Rongze Tang",
      "Jianjie Fang",
      "Zhaolu Wang",
      "Ziyou Wang",
      "Xvyuan Liu",
      "Haisheng Su",
      "Xin Zhang",
      "Wei Wu",
      "Chen Gao",
      "Yong Li",
      "Zhibo Chen"
    ],
    "year": 2026,
    "publication": "2026，arXiv",
    "arxiv_id": "2609.00161",
    "doi": "10.48550/arXiv.2609.00161",
    "links": {
      "paper": "https://arxiv.org/abs/2609.00161",
      "project": "https://embodiedcity.github.io/IMPACT/",
      "alphaxiv": "https://alphaxiv.org/abs/2609.00161"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "流式与自回归",
      "物理建模与仿真",
      "第一视角与人类视频",
      "视频生成",
      "跨本体迁移"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2609.00161v1/overview_v5.png",
      "alt": "IMPACT 交互感知世界模型训练概览",
      "label": "交互感知世界模型训练概览；来源：论文原图",
      "paper_title": "IMPACT: Attention Is the Interaction Map for Scalable Interaction-Aware World Model Training",
      "source_url": "https://arxiv.org/html/2609.00161v1/overview_v5.png"
    },
    "summary": "IMPACT 认为全局平均 MSE 去噪目标会让静态区域主导训练信号，使真正决定交互的动态物体区域受到不足监督。方法使用与被操作物体 token 相关的 cross-attention 作为内部时空先验，再结合局部预测误差构造 interaction map，对去噪监督重新加权。",
    "insight": "IMPACT 认为全局平均 MSE 去噪目标会让静态区域主导训练信号，使真正决定交互的动态物体区域受到不足监督。方法使用与被操作物体 token 相关的 cross-attention 作为内部时空先验，再结合局部预测误差构造 interaction map，对去噪监督重新加权。",
    "pipeline": {
      "input": "动作条件视频、交互对象 token、扩散模型 cross-attention 和局部误差。",
      "process": "提取 attention 先验，校准局部误差，生成交互区域权重，重加权视频扩散训练目标。",
      "output": "更加关注交互区域的世界模型。",
      "details": "**输入**：动作条件视频、交互对象 token、扩散模型 cross-attention 和局部误差。\n\n**过程**：提取 attention 先验，校准局部误差，生成交互区域权重，重加权视频扩散训练目标。\n\n**输出**：更加关注交互区域的世界模型。"
    },
    "experiments": "摘要声称在机器人操作视频上进行了实验，并改善交互生成质量。具体数据集、指标、baseline 和提升幅度尚未核验。",
    "evidence_notes": "",
    "code_data_status": "未发现公开链接。",
    "limitations": "- Attention 不一定对应真实交互因果区域。\n- 交互对象 token 的识别错误可能导致错误监督。\n- 局部重加权可能损害背景和全局几何一致性。\n\n### 与知域的关系\n\nIMPACT 直接对应知域的 HOI、交互世界模型和 StreamingHOI 方向，提供了不依赖外部密集标注的交互区域监督思路。",
    "comments": "",
    "source_reports": [
      "report-0d81d19c6c"
    ],
    "deleted": false,
    "updated_at": "2026-09-08",
    "arxiv": {
      "published": "2026-08-31T18:00:36Z",
      "revised_at": "2026-08-31T18:00:36Z",
      "primary_category": "cs.AI"
    }
  },
  {
    "id": "arxiv-2609-12441",
    "title": "IMPLY: Physically Anchored Consistency for World-Model Rollouts",
    "authors": [
      "Aman Mehta",
      "Riya Baviskar"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本，v1",
    "arxiv_id": "2609.12441",
    "doi": "10.48550/arXiv.2609.12441",
    "links": {
      "paper": "https://arxiv.org/abs/2609.12441",
      "alphaxiv": "https://alphaxiv.org/abs/2609.12441"
    },
    "tags": [
      "因果与反事实",
      "数据与评测",
      "物理建模与仿真",
      "规划与控制"
    ],
    "figure": {
      "url": "content/images/2609.12441-representative.webp",
      "alt": "Figure 1",
      "label": "Figure 1",
      "paper_title": "IMPLY: Physically Anchored Consistency for World-Model Rollouts",
      "source_url": "https://arxiv.org/html/2609.12441v1#S4.F1"
    },
    "summary": "IMPLY指出，多次 rollout 彼此一致仍可能全部忽略当前物体。方法通过反演模拟器，读取每个推动结果隐含的质量和摩擦，并加入模型已观察到的两次校准推动，检查一个物理对象是否能同时解释所有 rollout。",
    "insight": "IMPLY指出，多次 rollout 彼此一致仍可能全部忽略当前物体。方法通过反演模拟器，读取每个推动结果隐含的质量和摩擦，并加入模型已观察到的两次校准推动，检查一个物理对象是否能同时解释所有 rollout。",
    "pipeline": {
      "input": "不同推动速度下的动作条件 rollout，以及两个真实观察到的校准推动。",
      "process": "从像素或 latent 读取位移；反演模拟器拟合质量 m 和摩擦 mu；计算联合拟合残差作为物理锚定不一致分数。",
      "output": "rollout 集的可信度分数及候选集合排序。",
      "details": "**输入**：不同推动速度下的动作条件 rollout，以及两个真实观察到的校准推动。\n\n**过程**：从像素或 latent 读取位移；反演模拟器拟合质量 \\(m\\) 和摩擦 \\(\\mu\\)；计算联合拟合残差作为物理锚定不一致分数。\n\n**输出**：rollout 集的可信度分数及候选集合排序。"
    },
    "experiments": "在 200 个对象、每对象 5 个速度的受控 stand-in 中，对象盲模型的自一致性 AUROC 仅 0.70，加入锚定后为 1.00；最低锚定不一致选择的中位位移误差 1.5 mm，接近 oracle 1.6 mm，而首样本为 7.1 mm。对场景适配的 V-JEPA 2-AC，正确对象校准与真值相关 0.91，错误对象仅 0.05；锚定分数选择正确证据 73%，自一致性 52%。结果强力支持“必须用观测证据锚定”，但只在简单推动与可参数化物理中验证。 [正文实验与表格](https://arxiv.org/html/2609.12441v1)。",
    "evidence_notes": "2026-09-14 已核对 arXiv 元数据、正文主要实验与对照；未运行复现实验。",
    "code_data_status": "未发现代码和复现实验包。方法依赖模拟器反演、位移读出与校准推动协议。",
    "limitations": "当前物理模型主要是质量—摩擦—位移关系，难以直接推广到抓取、柔性物体、多接触和视觉遮挡。两次真实校准不是零成本；位移读出误差和模拟器失配会影响评分。",
    "comments": "",
    "source_reports": [
      "report-37b94c4145"
    ],
    "deleted": false,
    "updated_at": "2026-09-14",
    "discussion": "IMPLY为世界模型的因果/反事实讨论提供重要边界：它使用干预式观察锚定 rollout，但尚不是结构因果识别；适合作为 WAM 可信度评测模块。",
    "arxiv": {
      "published": "2026-09-11T05:02:08Z",
      "revised_at": "2026-09-11T05:02:08Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2609-19138",
    "title": "In-Context Robot Learning with VLM Agents",
    "authors": [
      "Dongzhou Cheng",
      "Taoran Yi",
      "Ye Fang",
      "Xingwu Zhang",
      "Fan Feng",
      "Yixuan Li",
      "Gengxiong Zhuang",
      "Rongze Wang",
      "Shuai Yang",
      "Wei Song",
      "Weizhi Xue",
      "Minyan Wu",
      "Jie Gui",
      "Jiaqi Wang",
      "Tong Wu"
    ],
    "year": 2026,
    "publication": "2026，arXiv，2026-09-16",
    "arxiv_id": "2609.19138",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2609.19138",
      "project": "https://cheng-haha.github.io/GPT-Policy/",
      "code": "https://github.com/cheng-haha/GPT-Policy",
      "alphaxiv": "https://alphaxiv.org/abs/2609.19138"
    },
    "tags": [
      "Agent与可执行世界",
      "具身上下文学习",
      "第一视角与人类视频"
    ],
    "figure": {
      "url": "content/images/2609.19138-main.webp",
      "alt": "Figure 2：示范与在线历史进入固定 VLM，结构化工具返回执行结果和新观察",
      "label": "Figure 2 · 示范与在线历史进入固定 VLM，结构化工具返回执行结果和新观察",
      "paper_title": "In-Context Robot Learning with VLM Agents",
      "source_url": "https://arxiv.org/html/2609.19138v1/overview.png"
    },
    "summary": "该工作不训练新的机器人 foundation policy，而是让固定 VLM 在 inference context 中读取任务 demonstration。作者提出 context compiler，把机器人或人类演示压缩成保留 task-relevant state transition 的视觉上下文，VLM随后提出工具化的机器人动作，并由受约束 controller执行和检查结果。",
    "insight": "该工作不训练新的机器人 foundation policy，而是让固定 VLM 在 inference context 中读取任务 demonstration。作者提出 context compiler，把机器人或人类演示压缩成保留 task-relevant state transition 的视觉上下文，VLM随后提出工具化的机器人动作，并由受约束 controller执行和检查结果。\n\n关键点是 human video可以直接作为 in-context experience，而无需动作标签；对 contact-sensitive任务，带 aligned action reference 的 robot demonstration仍明显更有效。",
    "pipeline": {
      "input": "当前视觉观察、任务指令、human/robot demonstration、可选动作参考。",
      "process": "context compiler提取关键视觉状态变化 → VLM根据 context提出 robot-tool action → constrained controller执行 → observation反馈重新进入上下文。",
      "output": "可执行机器人动作以及跨尝试更新的任务 context。",
      "details": "**过程**：context compiler提取关键视觉状态变化 → VLM根据 context提出 robot-tool action → constrained controller执行 → observation反馈重新进入上下文。\n\n**输入**：当前视觉观察、任务指令、human/robot demonstration、可选动作参考。\n\n**输出**：可执行机器人动作以及跨尝试更新的任务 context。\n\n上下文来源包括人类视频、机器人视频及对齐动作、目标图、机器人自己的执行历史和在线人类反馈。视觉转移描述与控制工具之间仍需要空间定位、IK、轨迹限幅和实测执行检查；VLM 输出并不直接等于底层电机控制。\n\n[原文方法](https://arxiv.org/html/2609.19138)\n\n### 方法细节与实现\n\n**上下文不是一段笼统摘要。**输入把任务指令、带视角标识的当前图像、机器人状态、目标图或示范关键帧、可选动作参考和本轮执行历史分开组织。示范记录按时间顺序交错图像与状态/动作文本，在线历史另存工具请求及执行结果；旧实时图像可以截断，任务参考则保留，避免把示范动作误认成当前已执行动作。\n\n**工具到控制的完整链条。**VLM 通过结构化调用选择 move_to、move_eef_chunk 或夹爪命令。笛卡尔目标使用各手臂基座坐标系和 xyzw 四元数；控制器对位置线性插值、对旋转做 SLERP，再以前一解为初值逐点求 IK。Ruckig 分配时间并满足采样轨迹的速度、加速度和 jerk 限制，执行后回传实测状态、端点误差及稳定情况。\n\n**在线适应发生在哪里。**VLM 参数固定，行为变化来自参考示范、历史结果与人工反馈的上下文变化。请求被拒绝也产生下一轮可用的反馈；模型宣称完成与物理任务实际成功分别记录。工具层运动学和标定承担大量可执行性保障，因此不能把该系统等价于仅靠视觉语言推理直接控制电机。\n\n[对应方法原文](https://arxiv.org/html/2609.19138#S3)"
    },
    "experiments": "官方项目覆盖十个机器人任务，每种条件仅约 3 次 trial，因此统计规模较小。部分任务从无 demonstration 的 0/3提升到 human-video的2/3；contact-sensitive任务中，video+action reference可进一步达到3/3或2/3。这些结果支持“视觉示例可以驱动 in-context robot adaptation”，但不足以证明大规模任务泛化。\n\n\n表 1 将成功数、决策次数和耗时同时报告。Pick Up Notebook 从无示范 0/3 变为人类视频 2/3，平均时间从 24.6 分钟降到 16.1 分钟；拔插插头由机器人视频的 0/3 变为视频+动作的 2/3，但平均时间从 7.9 分钟增至 10.8 分钟。上下文改善成功率不代表每个任务都更快。\n\n[原文实验与表格](https://arxiv.org/html/2609.19138)\n\n**比较动作参考的条件。**若要判断动作数值本身是否有用，必须固定示范图像和非动作文本，并说明是否额外提供实测状态。否则所谓“视频加动作”的收益可能同时来自更多程序描述或状态信息。论文小样本结果说明上下文接口可工作；商业模型版本、控制工具、示范挑选和额外尝试预算限制了横向可比性。\n\n[实验与设置原文](https://arxiv.org/html/2609.19138)",
    "evidence_notes": "已核验原文方法与实验；关键比较与限制见各节",
    "code_data_status": "GitHub公开了主要框架、ARX X5 与 I2RT/YAM 等接口，但仓库明确说明真实部署 host、私有 prompts、录制数据、calibration 和部分完整 real-robot pipeline 尚未全部公开，因此目前不是完全一键复现状态。",
    "limitations": "试验次数少；性能受商业 VLM 版本影响；系统 latency、inter-arm collision和 demonstration selection仍明显影响结果。当前证据更适合证明“VLM上下文可以承载操作经验”，而不是证明已获得稳定的一般机器人 in-context learner。",
    "comments": "",
    "source_reports": [],
    "deleted": false,
    "updated_at": "2026-09-24",
    "challenges": "机器人示范通常被当作离线训练数据；对于新任务，重新训练代价高。冻结 VLM 即使理解画面，也未必知道双臂命令、接触顺序和具体位移，因此需要把示范中可执行的经验压缩进上下文。",
    "motivation": "该工作不训练新的机器人 foundation policy，而是让固定 VLM 在 inference context 中读取任务 demonstration。作者提出 context compiler，把机器人或人类演示压缩成保留 task-relevant state transition 的视觉上下文，VLM随后提出工具化的机器人动作，并由受约束 controller执行和检查结果。\n\n关键点是 human video可以直接作为 in-context experience，而无需动作标签；对 contact-sensitive任务，带 aligned action reference 的 robot demonstration仍明显更有效。",
    "technical_approach": "**过程**：context compiler提取关键视觉状态变化 → VLM根据 context提出 robot-tool action → constrained controller执行 → observation反馈重新进入上下文。\n\n**输入**：当前视觉观察、任务指令、human/robot demonstration、可选动作参考。\n\n**输出**：可执行机器人动作以及跨尝试更新的任务 context。\n\n上下文来源包括人类视频、机器人视频及对齐动作、目标图、机器人自己的执行历史和在线人类反馈。视觉转移描述与控制工具之间仍需要空间定位、IK、轨迹限幅和实测执行检查；VLM 输出并不直接等于底层电机控制。\n\n[原文方法](https://arxiv.org/html/2609.19138)\n\n### 方法细节与实现\n\n**上下文不是一段笼统摘要。**输入把任务指令、带视角标识的当前图像、机器人状态、目标图或示范关键帧、可选动作参考和本轮执行历史分开组织。示范记录按时间顺序交错图像与状态/动作文本，在线历史另存工具请求及执行结果；旧实时图像可以截断，任务参考则保留，避免把示范动作误认成当前已执行动作。\n\n**工具到控制的完整链条。**VLM 通过结构化调用选择 move_to、move_eef_chunk 或夹爪命令。笛卡尔目标使用各手臂基座坐标系和 xyzw 四元数；控制器对位置线性插值、对旋转做 SLERP，再以前一解为初值逐点求 IK。Ruckig 分配时间并满足采样轨迹的速度、加速度和 jerk 限制，执行后回传实测状态、端点误差及稳定情况。\n\n**在线适应发生在哪里。**VLM 参数固定，行为变化来自参考示范、历史结果与人工反馈的上下文变化。请求被拒绝也产生下一轮可用的反馈；模型宣称完成与物理任务实际成功分别记录。工具层运动学和标定承担大量可执行性保障，因此不能把该系统等价于仅靠视觉语言推理直接控制电机。\n\n[对应方法原文](https://arxiv.org/html/2609.19138#S3)",
    "discussion": "**阅读者分析**：直接对应 embodied in-context learning，并补充 S1、RoboTTT、HOST 等路线：这里上下文是**外部视觉演示和交互历史**，而不是模型参数更新。",
    "arxiv": {
      "published": "2026-09-16",
      "revised_at": "",
      "primary_category": "cs.CV"
    },
    "source_papers": [
      "content/papers/2609.19138.md"
    ]
  },
  {
    "arxiv": {
      "published": "2026-03-10T10:10:34Z",
      "revised_at": "2026-03-10T10:10:34Z",
      "primary_category": "cs.CV"
    },
    "arxiv_id": "2603.13375",
    "authors": [
      "Ronghui Li",
      "Zhongyuan Hu",
      "Li Siyao",
      "Youliang Zhang",
      "Haozhe Xie",
      "Mingyuan Zhang",
      "Jie Guo",
      "Xiu Li",
      "Ziwei Liu"
    ],
    "code_data_status": "模型/权重链接已记录",
    "comments": "",
    "deleted": false,
    "doi": "",
    "evidence_notes": "",
    "experiments": "数据集比既有 3D dance 数据规模更大，含 1000+ dancers、55 joints、手部和面部信息、30 个舞种。实验跨多舞种音乐评估，定量和定性均超过现有方法；RAG 提升陌生音乐下的结构性，Cadence-MoE 改善不同速度音乐的节奏适配，FRDM 提升脚部物理合理性。\n\n---\n\n# 分类梳理与趋势分析\n\n## A. Egocentric Interactive World Model：从“看视频”到“模拟可交互世界”\n\n相关论文：**Dexterous World Models、Hand2World、EgoForge**\n\n这一类论文的共同目标是让生成模型具备第一视角交互模拟能力。DWM 关注“静态 3D 场景 + 手部动作 -> 动态交互视频”；Hand2World 进一步强调 free-space hand gesture、显式相机控制和自回归长视频；EgoForge 则把目标指令和 reward-guided refinement 加入世界模拟，强调 goal completion。\n\n**趋势**：从 image-to-video 的视觉合成，转向 action-conditioned、camera-aware、goal-directed 的 world simulator。\n\n## B. Human/Object Interaction Motion：从“轨迹合理”到“因果与物理一致”\n\n相关论文：**MEgoHand、HOI-Dyn、InterPrior**\n\nMEgoHand 生成第一视角手部 MANO 轨迹，重点是多模态理解和 3D 空间推理；HOI-Dyn 显式建模 human driver -> object responder 的交互动力学；InterPrior 则进入 physics-based controller，要求动作不仅可生成，还能在物理仿真中执行并完成目标。\n\n**趋势**：从离线 motion generation，走向 dynamics-aware generation，再走向可闭环执行的 physics-based generative control。\n\n## C. Affordance / Interaction Understanding：从静态语义到动态交互证据\n\n相关论文：**VideoAfford**\n\nVideoAfford 的位置很关键：它不是直接生成视频或动作，而是从 HOI 视频中抽取 3D affordance。它说明当前领域正在把“人如何和物体互动”的视频证据，转化为机器人可用的 3D 操作区域。\n\n**趋势**：affordance learning 正从 image/text prior 转向 video-demonstration prior，强调时序、接触、因果。\n\n## D. Motion Foundation Model / Data Scaling：动作作为大模型模态\n\n相关论文：**MotionGPT3、InfiniteDance**\n\nMotionGPT3 代表“把 motion 纳入 LLM 多模态体系”的方向，重点解决连续动作与离散文本之间的表示冲突；InfiniteDance 则展示了动作数据和模型规模化的重要性，用大规模野外数据 + LLaMA-style 模型提升音乐舞蹈泛化。\n\n**趋势**：动作生成开始拥抱 foundation model 思路：连续 latent、多分支架构、大规模数据、RAG/MoE 等机制会越来越常见。\n\n## 总结判断\n\n这组论文共同指向一个方向：**Embodied generative modeling 正在从“生成好看的动作/视频”，走向“生成可控、可交互、物理一致、可长程执行的世界演化”。**\n\n更具体地说：\n\n- 控制信号从文本扩展到手势、相机、目标、接触、轨迹、affordance。\n- 表示方式从 2D mask / text prompt 走向 3D mesh、depth、point cloud、geometry embedding。\n- 训练目标从感知质量扩展到 interaction causality、goal completion、physics robustness。\n- 模型形态从 diffusion generator 走向 autoregressive simulator、reward-refined simulator、physics-based controller、motion-language foundation model。\n\n如果后续继续追这个方向，建议重点关注三类关键词：**egocentric world model、interaction dynamics、physics-based generative control**。",
    "figure": {
      "alt": "ChoreoLLaMA",
      "label": "ChoreoLLaMA 框架",
      "paper_title": "InfiniteDance: Scalable 3D Dance Generation Towards in-the-wild Generalization",
      "source_url": "https://arxiv.org/html/2603.13375v1/ChoreoLLaMA.png",
      "url": "https://arxiv.org/html/2603.13375v1/ChoreoLLaMA.png"
    },
    "id": "arxiv-2603-13375",
    "insight": "InfiniteDance 解决 3D dance generation 的野外泛化问题。核心 insight：泛化差主要来自数据规模和模型容量不足，因此同时 scale data 和 model：从野外单目视频自动重建大规模 3D 舞蹈数据，并用 LLaMA-style architecture 学音乐到舞蹈。",
    "limitations": "来源报告未单列可核验的局限、失败案例或开放问题；在补充原论文正文核验前，不对该工作的泛化性、因果性、复现性或 SOTA 结论作扩大解释。",
    "links": {
      "paper": "https://arxiv.org/abs/2603.13375",
      "project": "https://infinitedance.github.io/",
      "model": "https://huggingface.co/huuuuuuuuu/InfiniteDance",
      "alphaxiv": "https://alphaxiv.org/abs/2603.13375"
    },
    "pipeline": {
      "input": "音乐音频，可选检索到的参考舞蹈 prompt。",
      "process": "自动单目视频重建 3D dance；Foot Restoration Diffusion Model 修复脚滑、浮空、穿透；构建 100.69h、30 genres、SMPL-X 数据集；ChoreoLLaMA 用 RAG 注入参考舞蹈，并用 slow/fast-cadence MoE 适配不同节奏。",
      "output": "与音乐同步、长时程、跨舞种泛化的 3D dance motion。",
      "details": "- **输入**：音乐音频，可选检索到的参考舞蹈 prompt。\n- **过程**：自动单目视频重建 3D dance；Foot Restoration Diffusion Model 修复脚滑、浮空、穿透；构建 100.69h、30 genres、SMPL-X 数据集；ChoreoLLaMA 用 RAG 注入参考舞蹈，并用 slow/fast-cadence MoE 适配不同节奏。\n- **输出**：与音乐同步、长时程、跨舞种泛化的 3D dance motion。"
    },
    "publication": "arXiv 2026",
    "source_reports": [
      "report-90041fa2f9"
    ],
    "summary": "InfiniteDance 解决 3D dance generation 的野外泛化问题。核心 insight：泛化差主要来自数据规模和模型容量不足，因此同时 scale data 和 model：从野外单目视频自动重建大规模 3D 舞蹈数据，并用 LLaMA-style architecture 学音乐到舞蹈。",
    "tags": [
      "3D/4D",
      "Agent与可执行世界",
      "HOI",
      "动作表征",
      "因果与反事实",
      "对象与可供性",
      "第一视角与人类视频"
    ],
    "title": "InfiniteDance: Scalable 3D Dance Generation Towards in-the-wild Generalization",
    "updated_at": "2026-08-20",
    "year": 2026
  },
  {
    "arxiv": {
      "published": "2026-02-05T18:59:27Z",
      "revised_at": "2026-02-05T18:59:27Z",
      "primary_category": "cs.CV"
    },
    "arxiv_id": "2602.06035",
    "authors": [
      "Sirui Xu",
      "Samuel Schulter",
      "Morteza Ziyadi",
      "Xialin He",
      "Xiaohan Fei",
      "Yu-Xiong Wang",
      "Liangyan Gui"
    ],
    "code_data_status": "截至来源报告核验时，未记录可确认的官方代码、数据或模型入口；这表示开放状态待核验，不代表资源确定不存在。",
    "comments": "",
    "deleted": false,
    "doi": "",
    "evidence_notes": "",
    "experiments": "在 snapshot、trajectory、contact、long-horizon chain、random initialization 等任务评估。完整 InterPrior 在多个 in-distribution goal-conditioned tasks 上成功率高；随机初始化 object lifting success 明显提升。BEHAVE/HODome 新对象和新交互适配中，InterPrior + finetuning 明显优于 InterMimic + finetuning，说明它是可复用的 HOI prior。\n\n---",
    "figure": {
      "alt": "InterPrior framework",
      "label": "InterPrior 三阶段框架",
      "paper_title": "InterPrior: Scaling Generative Control for Physics-Based Human-Object Interactions",
      "source_url": "https://arxiv.org/html/2602.06035v1/method2.png",
      "url": "https://arxiv.org/html/2602.06035v1/method2.png"
    },
    "id": "arxiv-2602-06035",
    "insight": "InterPrior 学的是 physics simulator 中的 HOI controller，而不只是离线生成轨迹。核心 insight：大规模 imitation distillation 可以提供自然动作先验，但单靠蒸馏泛化差；单靠 RL 容易 reward hacking。因此先蒸馏 imitation expert，再用 RL post-training 把策略推到更鲁棒的可行流形。",
    "limitations": "来源报告未单列可核验的局限、失败案例或开放问题；在补充原论文正文核验前，不对该工作的泛化性、因果性、复现性或 SOTA 结论作扩大解释。",
    "links": {
      "paper": "https://arxiv.org/abs/2602.06035",
      "project": "https://sirui-xu.github.io/InterPrior",
      "alphaxiv": "https://alphaxiv.org/abs/2602.06035"
    },
    "pipeline": {
      "input": "当前人-物状态、历史状态、高层目标，如 snapshot、trajectory、contact、稀疏目标。",
      "process": "训练 full-reference imitation expert；蒸馏成 goal-conditioned variational policy，latent 表示 skill；对 latent/observation 做 bounding；RL finetuning 增强 OOD 鲁棒性。",
      "output": "可在物理仿真中执行的 full-body HOI control policy。",
      "details": "- **输入**：当前人-物状态、历史状态、高层目标，如 snapshot、trajectory、contact、稀疏目标。\n- **过程**：训练 full-reference imitation expert；蒸馏成 goal-conditioned variational policy，latent 表示 skill；对 latent/observation 做 bounding；RL finetuning 增强 OOD 鲁棒性。\n- **输出**：可在物理仿真中执行的 full-body HOI control policy。"
    },
    "publication": "arXiv 2026；IPA 2026 Best Poster",
    "source_reports": [
      "report-90041fa2f9"
    ],
    "summary": "InterPrior 学的是 physics simulator 中的 HOI controller，而不只是离线生成轨迹。核心 insight：大规模 imitation distillation 可以提供自然动作先验，但单靠蒸馏泛化差；单靠 RL 容易 reward hacking。因此先蒸馏 imitation expert，再用 RL post-training 把策略推到更鲁棒的可行流形。",
    "tags": [
      "Agent与可执行世界",
      "HOI"
    ],
    "title": "InterPrior: Scaling Generative Control for Physics-Based Human-Object Interactions",
    "updated_at": "2026-08-20",
    "year": 2026
  },
  {
    "id": "paper-d14a137e07",
    "title": "Introducing S1: In-Context Learning for Robotics",
    "authors": [
      "Skild AI Team"
    ],
    "year": 2026,
    "publication": "2026-08-18，Skild AI 官方研究长文；无 arXiv ID、DOI 或 PDF，未核验同行评审",
    "arxiv_id": "",
    "doi": "",
    "links": {
      "paper": "https://skild.ai/blogs/s1"
    },
    "tags": [
      "VLA",
      "World Action Model",
      "具身上下文学习",
      "多模态感知与提示",
      "跨本体迁移",
      "适应与泛化",
      "长时记忆",
      "预训练与扩展律"
    ],
    "figure": {
      "url": "https://assets.skild.ai/site/v1/blog/sb-812a99baf442e4fb5939/cover-v2-poster.jpg",
      "alt": "S1 in-context manipulation",
      "label": "S1 长时未见任务示例封面；官方页面展示单段人类 prompt 后的 pancake、coffee、kit assembly 与 plant potting 自主执行。来源：官方图片",
      "paper_title": "Introducing S1: In-Context Learning for Robotics",
      "source_url": "https://assets.skild.ai/site/v1/blog/sb-812a99baf442e4fb5939/cover-v2-poster.jpg"
    },
    "summary": "S1 把机器人 ICL 定义为：训练时所有任务只通过 episode 内视频示范指定，使高多样性预训练迫使策略从示范解析意图、功能对应和任务进度；测试时放入一段来自不同场景、视角乃至 embodiment 的视频，不做 post-training。官方把 pretraining 视为 meta-learning outer loop，把 frozen-weight prompt conditioning 视为 inner loop，但没有披露显式 inner-loop 优化器。S1 相对同期工作的差异化主张不是短动作 one-shot，而是 从一段视频完成预训练未见、最长约 10 分钟的任务组合 。",
    "insight": "S1 把机器人 ICL 定义为：训练时所有任务只通过 episode 内视频示范指定，使高多样性预训练迫使策略从示范解析意图、功能对应和任务进度；测试时放入一段来自不同场景、视角乃至 embodiment 的视频，不做 post-training。官方把 pretraining 视为 meta-learning outer loop，把 frozen-weight prompt conditioning 视为 inner loop，但没有披露显式 inner-loop 优化器。S1 相对同期工作的差异化主张不是短动作 one-shot，而是**从一段视频完成预训练未见、最长约 10 分钟的任务组合**。",
    "pipeline": {
      "input": "任务视频 prompt、当前机器人视觉/状态；示范可以是人类第一视角或其他采集形态。",
      "process": "在以示范而非语言定义任务的 episodic mixture 上预训练；数据引擎混合 robot teleoperation、UMI、egocentric video 和 simulation，以硬件接近度、任务多样性与可扩展性互补。部署时视频进入 context window，策略闭环预测本体动作，权重不更新。",
      "output": "机器人动作序列；官方未披露 action representation、控制频率、context token 数、模型结构和推理延迟。",
      "details": "- **输入**：任务视频 prompt、当前机器人视觉/状态；示范可以是人类第一视角或其他采集形态。\n- **过程**：在以示范而非语言定义任务的 episodic mixture 上预训练；数据引擎混合 robot teleoperation、UMI、egocentric video 和 simulation，以硬件接近度、任务多样性与可扩展性互补。部署时视频进入 context window，策略闭环预测本体动作，权重不更新。\n- **输出**：机器人动作序列；官方未披露 action representation、控制频率、context token 数、模型结构和推理延迟。"
    },
    "experiments": "官方长文包含五类量化/定性探查。\n\n1. **长时未见任务展示。** plant potting、pancake cooking、pour-over coffee、kit assembly 四项声称完全不在训练中，包含数十个操作步骤、最长约 10 分钟，由一段视觉示范驱动。plant potting 从录完一次人类示范到机器人开始执行为 11 分钟，其中主要时间是场景设置。视频显示组合、阶段跟踪与部分新动作，但页面未给每项 trial 数、成功率、失败视频或独立评审，因此它证明“存在成功案例”，不能量化可靠性。\n2. **ICL 与 language VLA 的数据 scaling。** 在过滤后的同一预训练池上，ICL 和 language-conditioned policy 使用相同数据、架构（仅 prompt embedding 不同）和 compute，训练数据从 1K 扩到 100K 小时；内部 seen/unseen suites 的任务长 4–8 分钟，用累计逐步成功率，失败后允许人工 intervention 继续评完整流程。seen tasks 在 1K 小时时 VLA 53%、ICL 43%；数据扩大后 ICL 达 96%。unseen tasks 在 100K 小时时 ICL 66%、VLA 9%，约 7.3×。这支持示范条件对 OOD 长任务随数据规模改善得更快；但人工恢复改变 rollout 分布，任务数、每点 trial/种子、误差条和 VLA 最终 seen 数值未公开。\n3. **部署分布与 prompt 分布偏移。** 已知窄分布任务设置 L1–L5：从原物原位，逐步增加 15 cm/30°、30 cm/45° 位姿扰动，替换同 affordance 物体并垂直移动，直到迫使半数动作换另一只手。相对训练分布偏移时，L5 下 language VLA 的降幅最多是 ICL 的三倍；固定训练条件、只增大 prompt 与执行场景差距时，ICL 对位姿和同 affordance 替换仍稳健，到执行计划必须换手的 L5 才明显下降。页面图未在正文给出逐级原始数值与统计量，因此只能支持相对趋势。\n4. **一段 prompt 相当于多少 post-training 数据。** 对未见长任务给 language VLA 1–2,000 条 teleop 示范做 post-training；S1 ICL 固定为单示范 66%。曲线插值交点约 380 条，采集这些 4–10 分钟示范需 50–100 小时；2,000 条后 SFT 达 86%，最终超过 ICL。该实验说明 ICL 显著降低达到“可用起点”的数据成本，也诚实表明充分 SFT 仍更可靠；“380”是内部曲线插值，不是跨模型通用换算率。\n5. **恢复、常识与示范纠错。** 官方展示移动物体、换物体和改灯光后继续执行，滑板轮装配失败后重试，用杯子替代 watering can、只补满已有液体，以及人类打蛋出错而机器人更平稳执行等案例。它们说明策略不是逐像素轨迹回放，并生成可检验的 common-sense 假设；但没有样本量和对照，不构成量化鲁棒性或“理解物理”的证明。",
    "evidence_notes": "",
    "code_data_status": "官方只给高层数据源分类与“1K–100K 小时”受控子集范围，并称所有展示由同一模型权重生成。没有公开 S1 架构、参数量、完整预训练规模与去污染清单、benchmark、trial 日志、代码或权重。页面说明后续文章才会展开训练方法，因此当前不应反推具体网络或把 S1 写成已可复现论文。",
    "limitations": "最关键缺口是内部 benchmark 不透明：无法核验“完全未见任务”、累计逐步成功率的评分细则、人工 intervention 频率和独立种子。长任务展示没有失败分母；data scaling 同时依赖高成本内部质量控制，外部无法复刻。S1 没有报告 wrong-prompt、no-prompt、reverse-prompt、prompt truncation 和相似训练片段检索，因而还不能排除强预训练策略与上下文捷径的贡献。公司称最长 10 分钟，但上下文实现与推理成本均未知。\n\n### 与知域的关系\n\nS1 把具身 ICL 的评价轴从短时原子技能推进到“未见技能 × 长时组合”。它当前最值得跟踪的是 100K 小时下 66% vs 9% 的受控趋势，但证据等级低于公开论文，因为方法和评测仍不可复现。",
    "comments": "",
    "source_reports": [
      "report-1950a5754f"
    ],
    "deleted": false,
    "updated_at": "2026-09-02"
  },
  {
    "id": "arxiv-2608-06799",
    "title": "Is Forward Prediction Enough? Physical State Grounding for JEPA World Models",
    "authors": [
      "Haodong Yan",
      "Jiaguan Zhu",
      "Mingyuan Jia",
      "Ruiqing Yin",
      "Junjie He",
      "Zhide Zhong",
      "Junfeng Li",
      "Jinxuan Lu",
      "Hengtao Li",
      "Tianran Zhang",
      "Jiayi Chen",
      "Wenxuan Song",
      "Wen Chen",
      "Yuxiang Gao",
      "Haoang Li"
    ],
    "year": 2026,
    "publication": "2026，arXiv preprint（v1，cs.RO，2026-08-07）。尚无 DOI / 正式出版页。",
    "arxiv_id": "2608.06799",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.06799",
      "project": "https://haodong-yan.github.io/psg-jepa-project-page/",
      "code": "https://github.com/Haodong-Yan/PSG-JEPA",
      "alphaxiv": "https://alphaxiv.org/abs/2608.06799"
    },
    "tags": [
      "World Action Model",
      "机器人学习",
      "自监督与预测表征"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.06799v1/teaser.png",
      "alt": "PSG-JEPA Fig. 1: physical state grounding beyond forward prediction",
      "label": "PSG-JEPA，Fig. 1，前向预测 JEPA 的本体可识别性缺口，以及训练期-only 的 state / transition grounding。来源：Fig. 1 原图 PNG",
      "paper_title": "Is Forward Prediction Enough? Physical State Grounding for JEPA World Models",
      "source_url": "https://arxiv.org/html/2608.06799v1/teaser.png"
    },
    "summary": "核心 Insight： 在保留 LeWM 的 encoder–predictor 与 SIGReg 的前提下，用训练期-only 的两个头把单个 latent 接到本体感觉、把多 horizon 端点对接到净关节角变化；推理丢掉这两个头，架构和算力不变。",
    "insight": "核心 Insight：**在保留 LeWM 的 encoder–predictor 与 SIGReg 的前提下，用训练期-only 的两个头把单个 latent 接到本体感觉、把多 horizon 端点对接到净关节角变化；推理丢掉这两个头，架构和算力不变。**\n\n这改变的是训练信号，不是推理接口：编码器输入仍只有图像，本体量只作 grounding 目标或探针标签。作者用 \\(\\Delta q_{t,k}=q_{t+k}-q_t\\) 替代动作序列，因为净变化由端点唯一确定且维度固定。与本知识库 **直接相关于潜空间世界模型 / JEPA**，与视频 WAM 是相邻对照。可借鉴点是：前向预测不足以保证控制相关量可读；应用层不要把这里的 identifiability 写成因果可识别。",
    "pipeline": {
      "input": "图像观测窗口 T=C+1=4（C=3 帧上下文）、对应动作；训练期另有对齐的本体感觉 s t（关节角、夹爪、末端位姿）及其关节分量 q t。编码器和预测器 从不把本体当作输入 。",
      "process": "共享编码器 z t+i=E phi(o t+i)；因果动作条件预测器 teacher-forced 一步预测，mathcalL fwd 为 MSE；保留 LeWM 的 SIGReg，lambda reg=0.09。状态头 H s(z)to s；转移头 H Delta(z t+i,z t+i+k)toDelta q，对 kin 1,2,3 各 horizon 等权，避免短程对占优。总损失 mathcalL PSG=mathcalL JEPA+lambda g(mathcalL static+mathcalL dynamic)，lambda g=0.1，全 benchmark 固定。训练后丢掉 H s,H Delta。",
      "output": "推理期与 LeWM 相同：图像 → 规划用 latent，以及可选的动作条件未来 latent。Grounding 头不参与部署。",
      "details": "- **输入：** 图像观测窗口 \\(T=C+1=4\\)（\\(C=3\\) 帧上下文）、对应动作；训练期另有对齐的本体感觉 \\(s_t\\)（关节角、夹爪、末端位姿）及其关节分量 \\(q_t\\)。编码器和预测器 **从不把本体当作输入**。\n- **过程：** 共享编码器 \\(z_{t+i}=E_\\phi(o_{t+i})\\)；因果动作条件预测器 teacher-forced 一步预测，\\(\\mathcal{L}_{\\mathrm{fwd}}\\) 为 MSE；保留 LeWM 的 SIGReg，\\(\\lambda_{\\mathrm{reg}}=0.09\\)。状态头 \\(H_s(z)\\to s\\)；转移头 \\(H_\\Delta(z_{t+i},z_{t+i+k})\\to\\Delta q\\)，对 \\(k\\in\\{1,2,3\\}\\) 各 horizon 等权，避免短程对占优。总损失 \\(\\mathcal{L}_{\\mathrm{PSG}}=\\mathcal{L}_{\\mathrm{JEPA}}+\\lambda_g(\\mathcal{L}_{\\mathrm{static}}+\\mathcal{L}_{\\mathrm{dynamic}})\\)，\\(\\lambda_g=0.1\\)，全 benchmark 固定。训练后丢掉 \\(H_s,H_\\Delta\\)。\n- **输出：** 推理期与 LeWM 相同：图像 → 规划用 latent，以及可选的动作条件未来 latent。Grounding 头不参与部署。\n\n与最近 baseline 的实质差异：相对 DINO-WM / V-JEPA 2-AC，编码器可被前向损失和 grounding 共同塑造；相对 LeWM，只多训练期目标；相对自构的 LeWMActionIDM，监督的是净关节变化而非动作。官方代码在 OGBench-Cube 上提供训练与 GC-IDM 规划；LIBERO-Goal 有独立目录与 checkpoint；OGBench-Scene 仓库标注 coming soon。"
    },
    "experiments": "**作者主张：** 物理 grounding 同时提高潜空间可识别性、冻结 latent 上的目标条件规划、以及仿真/真机策略，且推理无额外模块。\n\n实验实际支持：\n\n- **探针（OGBench-Cube，episode-level train/test，线性 ridge / 浅 MLP，Pearson \\(r\\)）：** 单 latent 上 EE-yaw：LeWM 0.08/0.08，DINOv2 0.51/0.50，LeWMActionIDM 0.11/0.10，PSG-JEPA **0.94/0.98**；JointPos 从 LeWM 的 0.71/0.69 到 0.83/0.81。成对探针 GripVel：LeWM 0.44/0.47 → PSG-JEPA 0.69/0.76；Action 与 LeWMActionIDM 持平（0.80/0.86 vs 0.80/0.84）。这支持“状态从单 latent 读、变化从配对读”，不是因果边恢复。\n- **冻结 latent + 同一 GC-IDM（三层 MLP，512 hidden，AdaLN-Zero；200 个 goal；3 planner seeds）：** OGBench-Cube 全数据、5 epoch：PSG-JEPA **95.0±0.7** vs LeWM 80.7±1.9；100 epoch 仍 98.7 vs 89.7。25% 数据、100 epoch：93.2 vs 83.5。OGBench-Scene 全数据 5 epoch：83.5 vs 76.2。作者另称 Cube 上 5% 数据、100 epoch 规划成功 84.5%，LeWM 大约需要五倍数据才追上（Fig. 3；主表未列该格）。Planner 训练预算与表征质量耦合，不是同一 world-model rollout planner。\n- **开环 latent 预测（512 段，无 teacher forcing）：** Cube 上 5 步 MSE 0.0093→0.0046，30 步 0.1488→0.0485（约 −67%）；Scene 30 步 0.1608→0.0982（约 −39%）。Grounding 没有牺牲递归预测。\n- **LIBERO-Goal 策略（10 任务，OFT 头宽 1024、四层、两帧输入、8 步 action chunk，30 epoch，3 seeds×每任务 50 rollout）：** PSG-JEPA **85.3±3.9** vs LeWM 77.7±0.5、LeWMActionIDM 82.6±2.2、DINOv2 80.1±5.3。编码器与头联合微调，不是冻结表征。\n- **真机（AgileX 双臂 Mobile ALOHA 设计，前视+两腕 RGB；每任务 100 条遥操作，50 trial）：** Place-to-Bread 84 vs 62，Place-to-Plate 74 vs 58，Pour-Water 80 vs 60，平均 **79.3 vs 60.0**。只对照 LeWM，没有 DINOv2 / IDM 真机表。\n- **消融：** 去掉 transition 时规划 SR@5ep 95.0→81.3；去掉 state 时状态探针均值 0.94→0.69；只留相邻或只留端点 horizon 时 LIBERO 约 81.2–81.5，完整模型 85.3。各分量都有贡献；规划对 transition 更敏感，探针对象对 state 更敏感。\n\n**证据未支持：** 物体状态/接触力学可识别； grounding 在无本体日志的互联网视频上可做；“identifiability”等于因果可识别。",
    "evidence_notes": "",
    "code_data_status": "- **代码：** [Haodong-Yan/PSG-JEPA](https://github.com/Haodong-Yan/PSG-JEPA) 覆盖 OGBench-Cube 训练、GC-IDM 规划评估、LIBERO-Goal 策略；GitHub 未声明 SPDX 许可证（本次 API 返回 `license: None`）。OGBench-Scene 标注尚未放出。\n- **数据 / 权重：** 训练用 LeWM 发布的 `cube_single_expert` 像素 `.h5`（Hugging Face `quentinll/lewm` collection），不是 OGBench 官方 state 文件；作者警告跨 GPU 重渲染会与论文数字不一致。LIBERO 目录含已发布 checkpoint 与评估日志（本次未逐文件核验完整性）。\n- **依赖：** `stable-worldmodel`、LeWM 模块与 Nguyen et al. 的 GC-IDM 评估代码。",
    "limitations": "- Grounding 目标是机器人本体，不是物体位姿、接触或场景图；探针缺口针对 EE-yaw 等本体量。\n- 真机只对比 LeWM，50 trial / 任务，没有 IDM / DINOv2 真机对照。\n- LIBERO 是联合微调编码器，不能把 85.3% 全部归因于冻结表征。\n- 仓库与论文范围不完全对齐：Scene 代码未发布；许可证未核到 SPDX。\n- 无本体日志的人类视频/跨本体设定未验证。\n- 作者未提供形式 identifiability 证明；证据是探针可恢复性与下游成功。\n\n---",
    "comments": "",
    "source_reports": [
      "report-af906c7fa2"
    ],
    "deleted": false,
    "updated_at": "2026-08-21",
    "challenges": "领域长期问题是：控制用世界模型需要与动作相关的状态表征，而像素级视频重建会保留对规划无用的外观细节。本文针对的是 **端到端 JEPA 潜空间在前向预测目标下的机器人中心可识别性缺口**，不是“JEPA 会 collapse”这一更早的正则问题。\n\n- **作者用探针刻画的失败模式：** 在 OGBench-Cube 上冻结 LeWM 表征，单 latent 线性/MLP 探针几乎读不出末端 yaw（\\(r\\le 0.08\\)）；成对探针只能部分恢复关节/夹爪速度。DINOv2 预训练也只把 yaw 推到约 0.50。作者称之为 robot-centric identifiability gap：**探针可恢复性**，不是因果识别意义下的 identifiability。\n- **过强假设：** 仅靠 \\(\\hat{z}_{t+1}=F(z_t,a_t)\\) 可预测，并不保证 \\(z_t\\) 暴露本体感觉、也不保证 \\((z_t,z_{t+k})\\) 暴露净关节变化。下游 planner / policy 只得自己从任务监督里补视觉–动作对齐。\n- **与 IDM 辅助目标的缺口：** 用 \\((z_t,z_{t+1})\\mapsto a_t\\) 当正则，动作序列随 horizon 变长，且同一端点变化可对应多种动作，物理转移目标不适定。\n\nLeWM 已有 SIGReg 反 collapse；本文认为 **非 collapse ≠ 物理状态可读**。",
    "motivation": "核心 Insight：**在保留 LeWM 的 encoder–predictor 与 SIGReg 的前提下，用训练期-only 的两个头把单个 latent 接到本体感觉、把多 horizon 端点对接到净关节角变化；推理丢掉这两个头，架构和算力不变。**\n\n这改变的是训练信号，不是推理接口：编码器输入仍只有图像，本体量只作 grounding 目标或探针标签。作者用 \\(\\Delta q_{t,k}=q_{t+k}-q_t\\) 替代动作序列，因为净变化由端点唯一确定且维度固定。与本知识库 **直接相关于潜空间世界模型 / JEPA**，与视频 WAM 是相邻对照。可借鉴点是：前向预测不足以保证控制相关量可读；应用层不要把这里的 identifiability 写成因果可识别。",
    "technical_approach": "- **输入：** 图像观测窗口 \\(T=C+1=4\\)（\\(C=3\\) 帧上下文）、对应动作；训练期另有对齐的本体感觉 \\(s_t\\)（关节角、夹爪、末端位姿）及其关节分量 \\(q_t\\)。编码器和预测器 **从不把本体当作输入**。\n- **过程：** 共享编码器 \\(z_{t+i}=E_\\phi(o_{t+i})\\)；因果动作条件预测器 teacher-forced 一步预测，\\(\\mathcal{L}_{\\mathrm{fwd}}\\) 为 MSE；保留 LeWM 的 SIGReg，\\(\\lambda_{\\mathrm{reg}}=0.09\\)。状态头 \\(H_s(z)\\to s\\)；转移头 \\(H_\\Delta(z_{t+i},z_{t+i+k})\\to\\Delta q\\)，对 \\(k\\in\\{1,2,3\\}\\) 各 horizon 等权，避免短程对占优。总损失 \\(\\mathcal{L}_{\\mathrm{PSG}}=\\mathcal{L}_{\\mathrm{JEPA}}+\\lambda_g(\\mathcal{L}_{\\mathrm{static}}+\\mathcal{L}_{\\mathrm{dynamic}})\\)，\\(\\lambda_g=0.1\\)，全 benchmark 固定。训练后丢掉 \\(H_s,H_\\Delta\\)。\n- **输出：** 推理期与 LeWM 相同：图像 → 规划用 latent，以及可选的动作条件未来 latent。Grounding 头不参与部署。\n\n与最近 baseline 的实质差异：相对 DINO-WM / V-JEPA 2-AC，编码器可被前向损失和 grounding 共同塑造；相对 LeWM，只多训练期目标；相对自构的 LeWMActionIDM，监督的是净关节变化而非动作。官方代码在 OGBench-Cube 上提供训练与 GC-IDM 规划；LIBERO-Goal 有独立目录与 checkpoint；OGBench-Scene 仓库标注 coming soon。",
    "discussion": "PSG-JEPA 将“JEPA 世界模型是否足够”变成了一个可检验问题：本体状态与状态变化能否从规划 latent 中低成本读出？yaw 探针最高 \\(r=0.98\\)、低预算 GC-IDM、递归 latent 预测以及 LIBERO/真机策略给出了方向一致的答案，说明训练期 grounding 不只是让探针数字更好，也改善了后续使用表征的样本效率。\n\n更广泛的研究启示是：设计世界模型目标时，应把“下游需要读出什么”前置，而不是期待前向预测自动保留所有控制变量。边界同样明确：监督只覆盖有本体日志的操作数据，物体、接触和视觉干扰没有进入 grounding 目标；GC-IDM 成功不等于模型预测控制已获得闭环物理一致性，\\(r=0.98\\) 也不等于完整世界状态已被识别。",
    "arxiv": {
      "published": "2026-08-07T04:44:16Z",
      "revised_at": "2026-08-07T04:44:16Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2608-24044",
    "title": "JEPA-x: Cross-Predictive Physics Grounding for Forecastable Latent Dynamics",
    "authors": [
      "Kehan Wen",
      "Ziming Li",
      "Siyuan Luo",
      "Fan Shi"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本（首发 2026-08-25，v2 2026-08-26，审稿中）",
    "arxiv_id": "2608.24044",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.24044",
      "alphaxiv": "https://alphaxiv.org/abs/2608.24044"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "流式与自回归",
      "第一视角与人类视频",
      "长时记忆"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.24044v3/unified_representation.png",
      "alt": "JEPA-x: Cross-Predictive Physics Grounding for Forecastable Latent Dynamics 代表图",
      "label": "Figure 2: Unified privileged-state interface. A scene is represented by a fixed set of object slots, together with end-effector (EE) and table tokens; unused object slots are masked. Each object token encodes SDF geometry G i G {i} , extents e i e {i} , rotation R i R {i} , and position t i t {i} . Masked self-attention followed by learned-query attention pooling maps the resulting token set to the physical latent z… 来源：论文图",
      "paper_title": "JEPA-x: Cross-Predictive Physics Grounding for Forecastable Latent Dynamics",
      "source_url": "https://arxiv.org/html/2608.24044v3/unified_representation.png"
    },
    "summary": "自预测模型中编码器与预测器联合优化，可能共同适应\"易预测但弱受物理约束\"的潜在转移。JEPA-x 的 Insight： 把视觉观测与物理状态当作同一动作条件轨迹的两个 view，用共享预测器同时推进两者，并把任一 view 的预测匹配到另一模态的未来表示 ——迫使预测器学到视觉与物理两种描述共享的转移规则。物理分支仅训练期使用，部署零开销。",
    "insight": "自预测模型中编码器与预测器联合优化，可能共同适应\"易预测但弱受物理约束\"的潜在转移。JEPA-x 的 Insight：**把视觉观测与物理状态当作同一动作条件轨迹的两个 view，用共享预测器同时推进两者，并把任一 view 的预测匹配到另一模态的未来表示**——迫使预测器学到视觉与物理两种描述共享的转移规则。物理分支仅训练期使用，部署零开销。",
    "pipeline": {
      "input": "视觉观测 + 动作 + 特权物理状态（训练期）。",
      "process": "共享预测器在潜在空间推进视觉与物理两个 view → 交叉预测（视觉预测匹配物理未来、物理预测匹配视觉未来）→ 训练期特权、部署去掉物理分支。",
      "output": "可预测的潜在动力学（用于规划/控制）。",
      "details": "**输入**：视觉观测 + 动作 + 特权物理状态（训练期）。\n**过程**：共享预测器在潜在空间推进视觉与物理两个 view → 交叉预测（视觉预测匹配物理未来、物理预测匹配视觉未来）→ 训练期特权、部署去掉物理分支。\n**输出**：可预测的潜在动力学（用于规划/控制）。"
    },
    "experiments": "在自建多族物理套件上评估：JEPA-x 提升 forecastability（fresh-predictor probe、被操纵对象解码 probe、多任务）与多任务控制；消融覆盖 cross-only / share-only / regress / distill / align-only / shuffle 等变体，并报告 per-family 统计检验。证据等级：论文实验直接支持其主张；套件为自建，跨套件泛化待独立验证。",
    "evidence_notes": "",
    "code_data_status": "套件与协议在论文附录描述；本轮未检索到公开代码/数据。",
    "limitations": "- 特权物理状态要求训练期可获取（仿真友好、真机需状态估计）；\n- \"物理分支仅训练期\"意味着部署泛化依赖训练分布的物理覆盖；\n- 属于 action-conditioned prediction + privileged supervision，不做 intervention/counterfactual identification。\n\n### 与知域的关系\n与知域 Causal-JEPA、Is Forward Prediction Enough 直接同源，是\"JEPA 世界模型的物理 grounding\"路线的下一环；为知域因果世界模型专题补充\"训练信号层面 grounding\"的实证对照，应明确区分其未做因果识别。",
    "comments": "",
    "source_reports": [
      "report-a141624b1e"
    ],
    "deleted": false,
    "updated_at": "2026-08-31",
    "arxiv": {
      "published": "2026-08-25T04:07:07Z",
      "revised_at": "2026-08-28T10:39:50Z",
      "primary_category": "cs.LG"
    }
  },
  {
    "id": "arxiv-2609-06955",
    "title": "Joint-Conditioned Stereo Surface Reasoning for Interaction Field Estimation",
    "authors": [
      "Yanlin Jin",
      "Yifan Yang",
      "Bowen Yang",
      "Kai Zhu"
    ],
    "year": 2026,
    "publication": "2026，arXiv v1，2026-09-07 提交",
    "arxiv_id": "2609.06955",
    "doi": "10.48550/arXiv.2609.06955",
    "links": {
      "paper": "https://arxiv.org/abs/2609.06955",
      "alphaxiv": "https://alphaxiv.org/abs/2609.06955"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "触觉与灵巧操作"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2609.06955v1/jssr.png",
      "alt": "JSSR Fig. 1",
      "label": "JSSR，Fig. 1，关节条件的双目表面候选搜索与 interaction field 估计。来源：Fig. 1 原图 PNG",
      "paper_title": "Joint-Conditioned Stereo Surface Reasoning for Interaction Field Estimation",
      "source_url": "https://arxiv.org/html/2609.06955v1/jssr.png"
    },
    "summary": "JSSR把 interaction field 重新表述为：对每个 hand joint，找到其最近 object-surface endpoint。不同关节需要自己的 endpoint，但同一只手的关节可以共享局部 surface evidence。因此模型把 learned direct prediction 与显式 stereo geometry candidate search 结合。",
    "insight": "JSSR把 interaction field 重新表述为：对每个 hand joint，找到其最近 object-surface endpoint。不同关节需要自己的 endpoint，但同一只手的关节可以共享局部 surface evidence。因此模型把 learned direct prediction 与显式 stereo geometry candidate search 结合。",
    "pipeline": {
      "input": "七个时间步的同步 stereo image pairs，以及相机 calibration。",
      "process": "DINOv3 backbone联合预测 3D joints、direct interaction field 和各视图 surface endpoint evidence；沿校准相机射线采样深度候选；结合 joint-specific image compatibility 与 cross-view matching评分；同手关节共享 candidate support，并用 residual gate决定是否采用 geometric correction。",
      "output": "每个 hand joint 到最近 object surface 的 3D interaction-field vector / endpoint。",
      "details": "**输入**：七个时间步的同步 stereo image pairs，以及相机 calibration。\n\n**过程**：DINOv3 backbone联合预测 3D joints、direct interaction field 和各视图 surface endpoint evidence；沿校准相机射线采样深度候选；结合 joint-specific image compatibility 与 cross-view matching评分；同手关节共享 candidate support，并用 residual gate决定是否采用 geometric correction。\n\n**输出**：每个 hand joint 到最近 object surface 的 3D interaction-field vector / endpoint。"
    },
    "experiments": "论文去除 535 个不一致 annotation 后，使用 72,307 个训练样本和 12,201 个 clip-held-out evaluation 样本，避免 temporal overlap。消融中 ResNet基线 mean ADE约 29.172 mm、Acc@10 26.91%；DINO direct prediction约 16.278 / 50.04%；加入完整 JSSR后约 15.740 / 51.23。完整 stereo reasoning相对 temporal endpoint baseline的 mean ADE进一步改善约 0.454 mm。\n\n论文系统在 SHOW3D Interaction Field Challenge 中排名第三，但作者明确指出 leaderboard 数字与消融 checkpoint 使用的训练设置不同，因此不能直接把 challenge score 和主表模型逐项等同。",
    "evidence_notes": "全文已核验",
    "code_data_status": "本次未核验到官方代码或独立模型发布。",
    "limitations": "这里所谓“surface reasoning”是共享的 stereo-validated endpoint support；模型不恢复完整 object mesh、CAD model 或完整 object pose。因此它解决了 contact-neighborhood geometry，但距离 object-centric 4D interaction world representation 还有明显差距。",
    "comments": "",
    "source_reports": [
      "report-1b1ffacf7d"
    ],
    "deleted": false,
    "updated_at": "2026-09-16",
    "challenges": "仅靠单目或直接回归难以稳定估计每个手部关节最近的物体表面点，遮挡、深度歧义和逐关节独立预测会削弱接触邻域的几何一致性。",
    "motivation": "JSSR把 interaction field 重新表述为：对每个 hand joint，找到其最近 object-surface endpoint。不同关节需要自己的 endpoint，但同一只手的关节可以共享局部 surface evidence。因此模型把 learned direct prediction 与显式 stereo geometry candidate search 结合。",
    "technical_approach": "**输入**：七个时间步的同步 stereo image pairs，以及相机 calibration。\n\n**过程**：DINOv3 backbone联合预测 3D joints、direct interaction field 和各视图 surface endpoint evidence；沿校准相机射线采样深度候选；结合 joint-specific image compatibility 与 cross-view matching评分；同手关节共享 candidate support，并用 residual gate决定是否采用 geometric correction。\n\n**输出**：每个 hand joint 到最近 object surface 的 3D interaction-field vector / endpoint。",
    "discussion": "这是本期最直接的 3D HOI 感知论文之一。它可以作为 4D HOI 世界模型的低层监督：未来研究可以不只预测 hand trajectory，还同时预测每个关节未来接触 surface endpoint 及其随物体运动产生的 4D trajectory。",
    "arxiv": {
      "published": "2026-09-07T02:47:45Z",
      "revised_at": "2026-09-07T02:47:45Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2608-24882",
    "title": "LAWA: Latent Action as Intention Enables Efficient Future Imagination for World Action Models",
    "authors": [
      "Xiang Li",
      "Yupeng Zheng",
      "Songen Gu",
      "Huailiang Ma",
      "Feng Yu",
      "Yuhang Zheng",
      "Xian Nie",
      "Shanshuai Yuan",
      "Yujie Zang",
      "Weize Li",
      "Shuai Tian",
      "Moyang Liu",
      "Ya-Qin Zhang",
      "Wenchao Ding"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本（首发 2026-08-25）",
    "arxiv_id": "2608.24882",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.24882",
      "project": "https://getterupper.github.io/LAWA",
      "alphaxiv": "https://alphaxiv.org/abs/2608.24882"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "流式与自回归",
      "第一视角与人类视频",
      "长时记忆"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.24882v1/teaser.png",
      "alt": "LAWA: Latent Action as Intention Enables Efficient Future Imagination for World Action Models 代表图",
      "label": "Figure 1: Conceptual and quantitative comparison of WAM paradigms. Fast-WAM, our primary performance baseline, removes test-time future imagination but generalizes worse; Joint-WAM predicts future observations and serves as the efficiency reference. LAWA treats latent actions as future intentions, substantially improving performance over Fast-WAM while matching Joint-WAM at lower latency. Moreover, LAWA obtains large… 来源：论文图",
      "paper_title": "LAWA: Latent Action as Intention Enables Efficient Future Imagination for World Action Models",
      "source_url": "https://arxiv.org/html/2608.24882v1/teaser.png"
    },
    "summary": "WAM 测试期生成未来观测带来显著延迟；Fast-WAM 直接去掉该过程换效率，但本文作者在 matched implementation 下发现 Fast-WAM 泛化更差 ，尤其在稀缺演示与 OOD 场景。LAWA 提出第三条路：用紧凑 潜在动作作为\"意图\"的操作性表示 ，实现高效的测试期未来想象而不生成未来观测——离散 tokenizer 经动作无关预训练增强，把\"未来意图\"编码进潜在动作，兼顾效率与想象收益。",
    "insight": "WAM 测试期生成未来观测带来显著延迟；Fast-WAM 直接去掉该过程换效率，但本文作者在 matched implementation 下发现 **Fast-WAM 泛化更差**，尤其在稀缺演示与 OOD 场景。LAWA 提出第三条路：用紧凑**潜在动作作为\"意图\"的操作性表示**，实现高效的测试期未来想象而不生成未来观测——离散 tokenizer 经动作无关预训练增强，把\"未来意图\"编码进潜在动作，兼顾效率与想象收益。",
    "pipeline": {
      "input": "当前观测 + 动作。",
      "process": "离散潜在动作 tokenizer（动作无关预训练增强）→ 潜在动作=意图表示 → 测试期以意图驱动未来想象（不生成观测）→ 策略解码。",
      "output": "动作序列（带意图结构）。",
      "details": "**输入**：当前观测 + 动作。\n**过程**：离散潜在动作 tokenizer（动作无关预训练增强）→ 潜在动作=意图表示 → 测试期以意图驱动未来想象（不生成观测）→ 策略解码。\n**输出**：动作序列（带意图结构）。"
    },
    "experiments": "在 matched 实现下对比 Fast-WAM 与未来感知变体，报告 Fast-WAM 泛化劣势（稀缺演示、OOD）；消融/效率分析见正文。证据等级：论文实验支持其设计；对 Fast-WAM 的结论是\"作者实现内\"对比，需独立复现。",
    "evidence_notes": "",
    "code_data_status": "项目页上线，代码公开状态待确认。",
    "limitations": "- 对 Fast-WAM 的对比基于自述 matched implementation；\n- 潜在动作作为意图的语义可解释性；\n- 与 GlanceWAM（异步生成）的实时性/成功率权衡未直接对照。\n\n### 与知域的关系\n直接关系\"流式生成\"与 WAM 效率路线，与已收录 Efficient-WAM、FlowWAM、RepWAM 形成\"测试期生成策略\"家族，值得在 WAM 效率专题中对照。",
    "comments": "",
    "source_reports": [
      "report-a141624b1e"
    ],
    "deleted": false,
    "updated_at": "2026-08-31",
    "arxiv": {
      "published": "2026-08-25T17:59:03Z",
      "revised_at": "2026-09-01T06:44:23Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2608-22403",
    "title": "LD4WAM: Learning Latent Dynamics from Human Videos for World Action Models",
    "authors": [
      "Zhenhao Shen",
      "Jiaqi Liang",
      "Jasper Lu",
      "Feng Jiang",
      "Yuran Wang",
      "Chuanbo Wei",
      "Jiayi Liu",
      "Jianchun Yang",
      "Qize Yu",
      "Jiadi You",
      "Ce Hao",
      "Guanqi He",
      "Chen Xie",
      "Ruihai Wu"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本（首发 2026-08-23）",
    "arxiv_id": "2608.22403",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.22403",
      "code": "https://github.com/huggingface/lerobot",
      "alphaxiv": "https://alphaxiv.org/abs/2608.22403"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "机器人学习",
      "流式与自回归",
      "第一视角与人类视频",
      "长时记忆"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.22403v1/LD4WAM_Teaser_final.png",
      "alt": "LD4WAM: Learning Latent Dynamics from Human Videos for World Action Models 代表图",
      "label": "Figure 1: Overview of LD4WAM. Left: a unified pretraining dataset of 5,000 + 5{,}000+ hours human and robot videos. Middle: a Latent Dynamics Model distills motion-aligned latent dynamics via semantic and motion (Delta EE) supervision; in the World Dynamics Action Model, learnable queries carry these latent dynamics to bridge the video and action experts. Right: qualitative and quantitative results on RoboTwin and re… 来源：论文图",
      "paper_title": "LD4WAM: Learning Latent Dynamics from Human Videos for World Action Models",
      "source_url": "https://arxiv.org/html/2608.22403v1/LD4WAM_Teaser_final.png"
    },
    "summary": "人类视频因多样性与低成本在 WAM 训练中越来越重要，但多数 WAM 只从视频学像素级未来帧预测，动力学不可直接执行；运动重定向虽恢复可执行动作，却留大跨具身视觉鸿沟。LD4WAM 的 Insight： 用\"运动对齐的潜在动力学\"作为具身无关表示 ，桥接视频先验与低层动作——Latent Dynamics Model 同时做语义重建与真实运动对齐，再与 WAM 配对，把人类视频的动力学转成可执行的动作先验。",
    "insight": "人类视频因多样性与低成本在 WAM 训练中越来越重要，但多数 WAM 只从视频学像素级未来帧预测，动力学不可直接执行；运动重定向虽恢复可执行动作，却留大跨具身视觉鸿沟。LD4WAM 的 Insight：**用\"运动对齐的潜在动力学\"作为具身无关表示**，桥接视频先验与低层动作——Latent Dynamics Model 同时做语义重建与真实运动对齐，再与 WAM 配对，把人类视频的动力学转成可执行的动作先验。",
    "pipeline": {
      "input": "人类视频 + 机器人动作数据。",
      "process": "Latent Dynamics Model（语义重建 + 真实运动对齐）→ 运动对齐潜在动力学（具身无关）→ 与 WAM 配对训练 → 动作解码。",
      "output": "可由人类视频驱动的 WAM 动作先验。",
      "details": "**输入**：人类视频 + 机器人动作数据。\n**过程**：Latent Dynamics Model（语义重建 + 真实运动对齐）→ 运动对齐潜在动力学（具身无关）→ 与 WAM 配对训练 → 动作解码。\n**输出**：可由人类视频驱动的 WAM 动作先验。"
    },
    "experiments": "在公开机器人基准上评估跨具身迁移收益。证据等级：摘要核验 + 结构核验，具体数字待全文确认。",
    "evidence_notes": "",
    "code_data_status": "实现基于 LeRobot 与 AgiBot-World 开源生态（可复现路径清晰）；新增代码未见独立仓库。",
    "limitations": "- 运动对齐在双手/复杂交互下的退化；\n- 跨具身体态差异的表示覆盖；\n- 人类视频中动作标注缺失时的弱监督上限。\n\n### 与知域的关系\n与知域 TraceGen、Vid2WAM、Latent Policy Steering 的\"跨具身/人类视频到 WAM\"主线一致，是\"运动对齐潜在动力学\"这一表示的又一实证。",
    "comments": "",
    "source_reports": [
      "report-a141624b1e"
    ],
    "deleted": false,
    "updated_at": "2026-08-31",
    "arxiv": {
      "published": "2026-08-23T13:09:30Z",
      "revised_at": "2026-08-23T13:09:30Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "arxiv": {
      "published": "2026-07-06T07:10:22Z",
      "revised_at": "2026-07-06T07:10:22Z",
      "primary_category": "cs.RO"
    },
    "arxiv_id": "2607.05468",
    "authors": [
      "Jianjun Zhang",
      "Jian Zhu",
      "Taiyi Su",
      "Chong Ma",
      "Zitai Huang",
      "Yi Xu",
      "Hanli Wang"
    ],
    "code_data_status": "截至来源报告核验时，未记录可确认的官方代码、数据或模型入口；这表示开放状态待核验，不代表资源确定不存在。",
    "comments": "",
    "deleted": false,
    "doi": "",
    "evidence_notes": "",
    "experiments": "LIBERO 平均成功率 98.2%，RoboTwin 2.0 达 92.6%，真机任务减少 correction、缩短完成时间。实验说明：单独挂 geometry branch 帮助有限，关键在于把 4D knowledge 迁移进部署时仍保留的 policy representation。\n\n---",
    "figure": {
      "alt": "MECo-WAM overview",
      "label": "MECo-WAM 训练/推理总览",
      "paper_title": "Learning 4D Geometric Priors for Inference-Efficient World Action Models",
      "source_url": "https://arxiv.org/html/2607.05468v1/overview.png",
      "url": "https://arxiv.org/html/2607.05468v1/overview.png"
    },
    "id": "arxiv-2607-05468",
    "insight": "传统 WAM 用 future RGB / video prediction 为 action 学习提供密集监督，但 video latent 更偏 appearance，不一定显式编码 manipulation 所需的时变 3D / 4D geometry。MECo-WAM 的关键观点是：**4D geometry 不必成为推理阶段的输入或输出，更适合作为 training-time representation constraint**，把几何知识蒸馏进最终部署的 video-action representation。",
    "limitations": "来源报告未单列可核验的局限、失败案例或开放问题；在补充原论文正文核验前，不对该工作的泛化性、因果性、复现性或 SOTA 结论作扩大解释。",
    "links": {
      "paper": "https://arxiv.org/abs/2607.05468",
      "alphaxiv": "https://alphaxiv.org/abs/2607.05468"
    },
    "pipeline": {
      "input": "当前 RGB observation、proprioception、language instruction。",
      "process": "- 训练期 ：Video Expert 预测 future video latent；Action Expert 预测 future action chunk；额外 4D Expert 使用 frozen VGGT 提取 current/future geometry feature；Decayed 4D Read-Mask 早期允许有限读取当前几何，随后逐渐关闭；Action-Aware Temporal Geometric Distillation 对齐几何关系及其时间变化，并强调 action-relevant region。",
      "output": "直接输出 action chunk；VGGT、4D Expert、alignment module 全部删除。",
      "details": "- **输入**：当前 RGB observation、proprioception、language instruction。\n- **训练期**：Video Expert 预测 future video latent；Action Expert 预测 future action chunk；额外 4D Expert 使用 frozen VGGT 提取 current/future geometry feature；Decayed 4D Read-Mask 早期允许有限读取当前几何，随后逐渐关闭；Action-Aware Temporal Geometric Distillation 对齐几何关系及其时间变化，并强调 action-relevant region。\n- **推理期输出**：直接输出 action chunk；VGGT、4D Expert、alignment module 全部删除。"
    },
    "publication": "arXiv 2026",
    "source_reports": [
      "report-e81e6bd3a1"
    ],
    "summary": "传统 WAM 用 future RGB / video prediction 为 action 学习提供密集监督，但 video latent 更偏 appearance，不一定显式编码 manipulation 所需的时变 3D / 4D geometry。MECo-WAM 的关键观点是： 4D geometry 不必成为推理阶段的输入或输出，更适合作为 training-time representation constraint ，把几何知识蒸馏进最终部署的 video-action representation。",
    "tags": [
      "3D/4D",
      "World Action Model",
      "机器人学习",
      "自监督与预测表征"
    ],
    "title": "Learning 4D Geometric Priors for Inference-Efficient World Action Models",
    "updated_at": "2026-08-20",
    "year": 2026
  },
  {
    "id": "arxiv-2609-05834",
    "title": "Learning Counterfactual World Models for Embodied Reasoning under Partial Observability",
    "authors": [
      "Todd Y. Zhou",
      "Daniel Zhang"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本，v1",
    "arxiv_id": "2609.05834",
    "doi": "10.48550/arXiv.2609.05834",
    "links": {
      "paper": "https://arxiv.org/abs/2609.05834",
      "alphaxiv": "https://alphaxiv.org/abs/2609.05834"
    },
    "tags": [
      "因果与反事实",
      "适应与泛化"
    ],
    "figure": {
      "url": "content/images/2609.05834-representative.webp",
      "alt": "Figure 1",
      "label": "Figure 1",
      "paper_title": "Learning Counterfactual World Models for Embodied Reasoning under Partial Observability",
      "source_url": "https://arxiv.org/html/2609.05834v1#S6.F1"
    },
    "summary": "论文提出 counterfactual collapse：未来视觉上合理，却不能区分不同动作干预的后果。CLWM 使用 recurrent belief、action-conditioned latent dynamics 和 contrastive counterfactual objective，使同一历史下的不同 intervention futures 可分。",
    "insight": "论文提出 counterfactual collapse：未来视觉上合理，却不能区分不同动作干预的后果。CLWM 使用 recurrent belief、action-conditioned latent dynamics 和 contrastive counterfactual objective，使同一历史下的不同 intervention futures 可分。",
    "pipeline": {
      "input": "部分可观测历史、候选动作及后续观测。",
      "process": "更新 belief，按动作预测 latent future，并用对比目标拉开不同干预后果。",
      "output": "用于 reasoning/planning 的 future latent。",
      "details": "- **输入**：部分可观测历史、候选动作及后续观测。\n- **过程**：更新 belief，按动作预测 latent future，并用对比目标拉开不同干预后果。\n- **输出**：用于 reasoning/planning 的 future latent。"
    },
    "experiments": "正文表 1 给出 5 个种子、每模型 100 个固定测试 episode：Occluded Push 成功率 74.6±1.5% 对 65.1±1.6%，Aliased Maze 78.9±1.4% 对 67.3±1.5%，其中 ± 为种子均值标准误；Deferred Kitchen exploit rate 从 18.4% 降至 9.7%。表 2 中移除 perceptual-alias negatives 后 Push/Maze 降至 67.5/69.1，支持反事实负样本作用。所有模型从头训练，作者明确未在大规模预训练 encoder 上测量，不能直接外推到视频基础模型。 [正文实验与表格](https://arxiv.org/html/2609.05834v1)。",
    "evidence_notes": "2026-09-14 已核对 arXiv 元数据、正文主要实验与对照；未运行复现实验。",
    "code_data_status": "未确认实现、环境和权重开放。",
    "limitations": "反事实分支来自环境构造，不等同现实中不可观测的潜在结果；对比目标可能学动作分类捷径。需测试 unseen intervention、隐藏混杂和多步累积。",
    "comments": "",
    "source_reports": [
      "report-37b94c4145"
    ],
    "deleted": false,
    "updated_at": "2026-09-14",
    "discussion": "直接命中反事实世界模型，提供比 temporal causal attention 更明确的 intervention-level 目标。",
    "arxiv": {
      "published": "2026-09-05T02:56:47Z",
      "revised_at": "2026-09-05T02:56:47Z",
      "primary_category": "cs.AI"
    }
  },
  {
    "id": "arxiv-2609-06578",
    "title": "Learning to Use Imagination: Progress-Conditioned Future Utilization for World Action Models",
    "authors": [
      "Yijie Zhu",
      "Zitong Yu",
      "Wei Li",
      "Hui Ma",
      "Wen Li",
      "Rui Shao",
      "Liqiang Nie"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本，v1；投稿 TPAMI，非接收状态",
    "arxiv_id": "2609.06578",
    "doi": "10.48550/arXiv.2609.06578",
    "links": {
      "paper": "https://arxiv.org/abs/2609.06578",
      "code": "https://github.com/JiuTian-VL/ProWAM",
      "alphaxiv": "https://alphaxiv.org/abs/2609.06578"
    },
    "tags": [
      "VLA",
      "World Action Model",
      "长时记忆"
    ],
    "figure": {
      "url": "content/images/2609.06578-representative.webp",
      "alt": "Fig. 3",
      "label": "Fig. 3",
      "paper_title": "Learning to Use Imagination: Progress-Conditioned Future Utilization for World Action Models",
      "source_url": "https://arxiv.org/html/2609.06578v1#S4.F3"
    },
    "summary": "WAM 把未来视觉动态并入动作生成，但现有 WAM 对想象未来的利用缺乏对执行进度的适应。作者识别出未来效用的两种非均匀性：(i) inter-progress——不同执行阶段控制需求变化，想象未来的效用随阶段变化；(ii) intra-progress——同一进度状态下个体未来潜在的相关性异构。ProWAM 引入执行进度作为显式中间表示，由两个耦合组件构成：SS-DTPE（自监督双时序进度编码器）耦合短期动作-观测交互建模与长期循环进度聚合；进度条件化想象利用模块（PUAM）根据进度表示自适应调度未来潜在。",
    "insight": "WAM 把未来视觉动态并入动作生成，但现有 WAM 对想象未来的利用缺乏对执行进度的适应。作者识别出未来效用的两种非均匀性：(i) inter-progress——不同执行阶段控制需求变化，想象未来的效用随阶段变化；(ii) intra-progress——同一进度状态下个体未来潜在的相关性异构。ProWAM 引入执行进度作为显式中间表示，由两个耦合组件构成：SS-DTPE（自监督双时序进度编码器）耦合短期动作-观测交互建模与长期循环进度聚合；进度条件化想象利用模块（PUAM）根据进度表示自适应调度未来潜在。",
    "pipeline": {
      "input": "观测+动作历史+指令。",
      "process": "SS-DTPE 编码执行进度（短期交互+长期聚合）→ 进度表示条件化 PUAM → PUAM 自适应选择/加权想象未来 → 动作生成。",
      "output": "进度感知的动作序列。",
      "details": "**输入**：观测+动作历史+指令。\n**过程**：SS-DTPE 编码执行进度（短期交互+长期聚合）→ 进度表示条件化 PUAM → PUAM 自适应选择/加权想象未来 → 动作生成。\n**输出**：进度感知的动作序列。"
    },
    "experiments": "正文表 I 报告 LIBERO 平均成功率 99.1%；表 II 的 RoboTwin 2.0 Clean/Randomized 为 93.9%/92.8%，平均 93.4%；表 III 的 VLABench SR/IS/PS 为 68.4/85.4/81.2。论文包含进度模块与训练配方消融。跨论文总表同时包含不同具身预训练条件，主表排名不能直接视为同预算因果比较；提交 TPAMI 不等于已接收。 [正文实验与表格](https://arxiv.org/html/2609.06578v1)。",
    "evidence_notes": "2026-09-14 已核对 arXiv 元数据、正文主要实验与对照；未运行复现实验。",
    "code_data_status": "当前仓库仅见 README 与展示素材，未见训练或推理实现。 以上状态核验于 2026-09-14；入口和目录存在不等于已经运行复现实验。",
    "limitations": "接近饱和的 LIBERO 分数不能充分检验进度状态是否正确；需要错误进度、阶段回退、接触失败后恢复及端到端延迟评测。",
    "comments": "",
    "source_reports": [
      "report-37b94c4145"
    ],
    "deleted": false,
    "updated_at": "2026-09-14",
    "discussion": "WAM 内部机制方向，与 MaP-WAM（进度校准）、GE-Act 2.0（KASO 选择未来）共同构成「未来利用策略」子主题。对知域 WAM 技术路线是机制层面的补充。",
    "arxiv": {
      "published": "2026-09-06T12:46:20Z",
      "revised_at": "2026-09-06T12:46:20Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2608-27259",
    "title": "LEON: Making Latent Evolution Explicit — Operator-Structured Transitions for World Action Models",
    "authors": [
      "Xiaoxiao Lu",
      "Yunlong Dong",
      "Jiahao Shi",
      "Ye Yuan"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本（首发 2026-08-27）",
    "arxiv_id": "2608.27259",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.27259",
      "alphaxiv": "https://alphaxiv.org/abs/2608.27259"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "流式与自回归",
      "第一视角与人类视频",
      "长时记忆"
    ],
    "figure": {
      "url": "content/images/2608.27259_fig1.png",
      "alt": "LEON: Making Latent Evolution Explicit — Operator-Structured Transitions for World Action Models 代表图",
      "label": "LEON Fig. 1：通用潜在转移与 operator-structured evolution 的结构对比。 来源：论文图",
      "paper_title": "LEON: Making Latent Evolution Explicit — Operator-Structured Transitions for World Action Models",
      "source_url": "content/images/2608.27259_fig1.png"
    },
    "summary": "WAM 越来越多地在潜在表示空间做场景演化预测（避免全外观生成），但潜在转移普遍用 Transformer 预测器实现，其归纳结构围绕 token 交互而非时间演化。LEON 的 Insight： 把\"转移实现\"当作独立于预测表示与策略耦合的架构选择 ，用学习到的算子结构显式建模潜在演化，让时间演化归纳偏置进入潜在动力学。",
    "insight": "WAM 越来越多地在潜在表示空间做场景演化预测（避免全外观生成），但潜在转移普遍用 Transformer 预测器实现，其归纳结构围绕 token 交互而非时间演化。LEON 的 Insight：**把\"转移实现\"当作独立于预测表示与策略耦合的架构选择**，用学习到的算子结构显式建模潜在演化，让时间演化归纳偏置进入潜在动力学。",
    "pipeline": {
      "input": "观测 + 动作 → 潜在状态。",
      "process": "算子结构化潜在转移（替代 Transformer token 交互）→ 动作条件演化。",
      "output": "显式演化的潜在状态序列。",
      "details": "**输入**：观测 + 动作 → 潜在状态。\n**过程**：算子结构化潜在转移（替代 Transformer token 交互）→ 动作条件演化。\n**输出**：显式演化的潜在状态序列。"
    },
    "experiments": "仅摘要核验：报告算子结构转移相对 Transformer 潜在转移的改进。证据等级：仅摘要；消融与统计待全文。",
    "evidence_notes": "",
    "code_data_status": "未公开。",
    "limitations": "- 算子结构的表达能力上限；\n- 连续性/平滑性假设在长视界的漂移。\n\n### 与知域的关系\n为 WAM 家族增加\"潜在转移架构\"对比轴，与知域 RepWAM、SLIM-0.5B 的潜在表示设计直接相关。",
    "comments": "",
    "source_reports": [
      "report-a141624b1e"
    ],
    "deleted": false,
    "updated_at": "2026-08-31",
    "arxiv": {
      "published": "2026-08-27T15:43:44Z",
      "revised_at": "2026-08-27T15:43:44Z",
      "primary_category": "cs.LG"
    }
  },
  {
    "id": "arxiv-2608-27395",
    "title": "LeVJEPA: Efficient & Scalable Video Pretraining without the Heuristics",
    "authors": [
      "Lukas Kuhn",
      "Lucas Maes",
      "Giuseppe Serra",
      "Quentin Le Lidec",
      "Yann LeCun",
      "Randall Balestriero",
      "Florian Buettner"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本",
    "arxiv_id": "2608.27395",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.27395",
      "project": "https://levjepa.github.io/",
      "code": "https://github.com/galilai-group/levjepa",
      "model": "https://huggingface.co/galilai-group/LeVJEPA-VideoMix-Large",
      "alphaxiv": "https://alphaxiv.org/abs/2608.27395"
    },
    "tags": [
      "流式与自回归",
      "自监督与预测表征"
    ],
    "figure": {
      "url": "content/images/2608.27395-main.webp",
      "alt": "Figure 1：全局与局部视频视图共享编码器，以一致性损失和 SIGReg 约束表征",
      "label": "Figure 1 · 全局与局部视频视图共享编码器，以一致性损失和 SIGReg 约束表征",
      "paper_title": "LeVJEPA: Efficient & Scalable Video Pretraining without the Heuristics",
      "source_url": "https://arxiv.org/pdf/2608.27395#page=1"
    },
    "summary": "LeVJEPA 将 LeJEPA 的不变性目标与 SIGReg 用于视频：一个共享编码器和小 projector 即可训练。省掉防坍塌的架构不对称后，可以独立研究 token 保留率和注意力时间方向，减少训练开销。",
    "insight": "LeVJEPA 将 LeJEPA 的不变性目标与 SIGReg 用于视频：一个共享编码器和小 projector 即可训练。省掉防坍塌的架构不对称后，可以独立研究 token 保留率和注意力时间方向，减少训练开销。",
    "pipeline": {
      "input": "同一时间窗口的视频全局视图和多个局部空间裁剪。",
      "process": "随机丢弃约 95% patch tokens；共享编码器提取各视图 CLS；用局部与全局的均方不变性损失，以及将随机投影分布约束为各向同性高斯的 SIGReg 训练，两分支均传梯度。",
      "output": "可用于冻结探针、检索或下游模块的视频表征。",
      "details": "**过程**：随机丢弃约 95% patch tokens；共享编码器提取各视图 CLS；用局部与全局的均方不变性损失，以及将随机投影分布约束为各向同性高斯的 SIGReg 训练，两分支均传梯度。\n\n- **输入**：同一时间窗口的视频全局视图和多个局部空间裁剪。\n- **过程**：随机丢弃约 95% patch tokens；共享编码器提取各视图 CLS；用局部与全局的均方不变性损失，以及将随机投影分布约束为各向同性高斯的 SIGReg 训练，两分支均传梯度。\n- **输出**：可用于冻结探针、检索或下游模块的视频表征。\n\n编码器可采用帧内双向、帧间 causal 的 block-causal attention，时间 tubelet 为 1。无需目标编码器、预测器、stop-gradient 或遮挡像素恢复。这里的 causal 是“当前帧不看未来”的计算约束，不是因果发现或干预世界模型。[方法与消融](https://arxiv.org/html/2608.27395)\n\n### 方法细节与实现\n\n**训练对象与损失。**同一视频的全局视图与局部裁剪共享时间区间，通过同一个编码器和投影器得到表示。局部与全局的表示以均方误差约束一致；SIGReg 在随机投影方向上检验批次表示与标准高斯的偏离，用分布约束防止所有样本坍缩成常数。两支均有梯度，不依赖 EMA 教师、stop-gradient 或掩码重建解码器。\n\n**计算节省来自哪里。**每个视图均匀随机丢弃 95% patch token，只把保留的少量 token 输入编码器。这里是实际减少 Transformer 序列长度，区别于仍计算大部分 token 的重建目标。论文同时分析局部视图数量和时间 patch 聚合，因此效率收益需要结合视图预算及总训练 FLOPs 看，而不能仅比较 epoch 数。\n\n**时间因果性的准确含义。**block-causal attention 允许同帧 token 交互、禁止访问未来帧，使逐帧表示可在线计算；它没有学习动作干预下的未来转移，也没有辨识物体动力学。因而该模型适合作为视频编码器或世界模型的表征初始化，不能直接当作已具备物理预测能力的动作条件世界模型。\n\n[对应方法原文](https://arxiv.org/html/2608.27395#S3)"
    },
    "experiments": "相同数据、相同 epoch 下，相对 V-JEPA 2 的总预训练计算减少 5.6–20.8 倍，并在所测 ViT-S/B/L 达到可比或更好表现。等 FLOPs 的 ViT-B 比较中，ImageNet-1K / SSv2 / K400 分别为 61.0 / 40.4 / 44.6；VideoMAEv2 为 53.4 / 43.6 / 37.4，V-JEPA 2 为 51.6 / 42.5 / 40.7。故不能表述成所有任务都领先：SSv2 仍低于这两个基线。\n\nblock-causal 与双向的 IN1K top-1 为 51.2/50.7。与从相同视频帧训练的 DINOv2 等算力比较，LeVJEPA IN1K 为 50.7 对 53.8，而 SSv2 为 30.4 对 16.9，体现外观与运动能力的不同权衡。[表 1–4](https://arxiv.org/html/2608.27395#S4)\n\n**计算匹配比较。**相同 FLOPs 设置中，ImageNet/SSv2/Kinetics 指标为 61.0/40.4/44.6，对照视频模型为 53.4/43.6/37.4：外观任务和部分动作任务提高，但 SSv2 并未全面领先。block-causal 与双向注意力比较为 51.2 与 50.7，支持当前设置下几乎无精度损失。公开 VideoMix-Large 权重对应另一规模的训练，不能把其成绩与小规模消融直接拼接。\n\n[实验与设置原文](https://arxiv.org/html/2608.27395)",
    "evidence_notes": "已核验原文方法、实验与局限；以下数值为作者报告，分析另行标注",
    "code_data_status": "[官方代码](https://github.com/galilai-group/levjepa) 与 [VideoMix-Large 权重](https://huggingface.co/galilai-group/LeVJEPA-VideoMix-Large) 已公开。权重为 303M 参数 ViT-L/16，使用 1.8M VideoMix clips；模型卡报告冻结 attentive probe 的 IN1K 69.5%、SSv2 55.0%。这是更大数据配置，不能混入上面的受控 ViT-B 表格。权重为 CC BY-NC 4.0，推理需对应的自定义编码器实现。",
    "limitations": "SIGReg 的防坍塌性质不保证表征自动得到接触、可执行状态或物理规律。主要验证是冻结探针，尚需机器人闭环、长期状态记忆和预测任务来衡量对世界模型的实际收益；token 丢弃率的结论也依赖当前采样和数据协议。",
    "comments": "",
    "source_reports": [],
    "deleted": false,
    "updated_at": "2026-09-24",
    "challenges": "视频自监督学习计算昂贵。典型 JEPA 依赖 EMA 目标编码器、stop-gradient 和受限预测器避免坍塌；像素重建路线又需要解码器。双向视频编码还会让流式使用时的帧表征依赖未来。",
    "motivation": "LeVJEPA 将 LeJEPA 的不变性目标与 SIGReg 用于视频：一个共享编码器和小 projector 即可训练。省掉防坍塌的架构不对称后，可以独立研究 token 保留率和注意力时间方向，减少训练开销。",
    "technical_approach": "**过程**：随机丢弃约 95% patch tokens；共享编码器提取各视图 CLS；用局部与全局的均方不变性损失，以及将随机投影分布约束为各向同性高斯的 SIGReg 训练，两分支均传梯度。\n\n- **输入**：同一时间窗口的视频全局视图和多个局部空间裁剪。\n- **过程**：随机丢弃约 95% patch tokens；共享编码器提取各视图 CLS；用局部与全局的均方不变性损失，以及将随机投影分布约束为各向同性高斯的 SIGReg 训练，两分支均传梯度。\n- **输出**：可用于冻结探针、检索或下游模块的视频表征。\n\n编码器可采用帧内双向、帧间 causal 的 block-causal attention，时间 tubelet 为 1。无需目标编码器、预测器、stop-gradient 或遮挡像素恢复。这里的 causal 是“当前帧不看未来”的计算约束，不是因果发现或干预世界模型。[方法与消融](https://arxiv.org/html/2608.27395)\n\n### 方法细节与实现\n\n**训练对象与损失。**同一视频的全局视图与局部裁剪共享时间区间，通过同一个编码器和投影器得到表示。局部与全局的表示以均方误差约束一致；SIGReg 在随机投影方向上检验批次表示与标准高斯的偏离，用分布约束防止所有样本坍缩成常数。两支均有梯度，不依赖 EMA 教师、stop-gradient 或掩码重建解码器。\n\n**计算节省来自哪里。**每个视图均匀随机丢弃 95% patch token，只把保留的少量 token 输入编码器。这里是实际减少 Transformer 序列长度，区别于仍计算大部分 token 的重建目标。论文同时分析局部视图数量和时间 patch 聚合，因此效率收益需要结合视图预算及总训练 FLOPs 看，而不能仅比较 epoch 数。\n\n**时间因果性的准确含义。**block-causal attention 允许同帧 token 交互、禁止访问未来帧，使逐帧表示可在线计算；它没有学习动作干预下的未来转移，也没有辨识物体动力学。因而该模型适合作为视频编码器或世界模型的表征初始化，不能直接当作已具备物理预测能力的动作条件世界模型。\n\n[对应方法原文](https://arxiv.org/html/2608.27395#S3)",
    "discussion": "**阅读者分析**：适合关注高效视频 backbone 和流式表征。虽然使用 JEPA 名称，当前目标主要是跨视图不变性，不是学习动作条件的未来状态转移；用于 WAM 仍需新增动态预测与控制验证。",
    "arxiv": {
      "published": "2026-08-27",
      "revised_at": "",
      "primary_category": "cs.CV"
    },
    "source_papers": [
      "content/papers/2608.27395.md"
    ]
  },
  {
    "id": "arxiv-2608-23383",
    "title": "Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds",
    "authors": [
      "Nan Duan",
      "Haoyang Huang",
      "Weiyang Jin",
      "Haoran Li",
      "Yaowei Li",
      "Yuming Li",
      "Yijun Liu",
      "Xin Lu",
      "Xiaoxiao Ma",
      "Yanwen Ma",
      "Yaofeng Su",
      "Yilang Sun",
      "Haoyu Wang",
      "Zeyue Xue",
      "Songchun Zhang",
      "Junhao Zhuang"
    ],
    "year": 2026,
    "publication": "2026，arXiv",
    "arxiv_id": "2608.23383",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.23383",
      "project": "https://echo-team-joy-future-academy-jd.github.io/Echo-1.5-Page/",
      "alphaxiv": "https://alphaxiv.org/abs/2608.23383"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "流式与自回归",
      "第一视角与人类视频",
      "长时记忆"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.23383v2/echolong_data_pipeline.png",
      "alt": "Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds 代表图",
      "label": "Figure 1 : Two-stage data construction pipeline of JoyAI-Echo-1.5. Raw videos are quality-filtered and organized into an identity-centric Memory corpus and a high-quality corpus with broader resolution, language, and multi-shot coverage. 来源：论文图",
      "paper_title": "Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds",
      "source_url": "https://arxiv.org/html/2608.23383v2/echolong_data_pipeline.png"
    },
    "summary": "JoyAI-Echo-1.5 包含长视频和世界模型两个变体：前者用可组合跨镜头记忆保持角色外观与声音身份，后者把多种控制输入统一为度量 6-DoF 相机轨迹。其关键 Insight 是将身份记忆、几何控制和自生成 rollout 训练统一到一个音视频生成框架。",
    "insight": "JoyAI-Echo-1.5 包含长视频和世界模型两个变体：前者用可组合跨镜头记忆保持角色外观与声音身份，后者把多种控制输入统一为度量 6-DoF 相机轨迹。其关键 Insight 是将身份记忆、几何控制和自生成 rollout 训练统一到一个音视频生成框架。",
    "pipeline": {
      "input": "文本、图像、全镜头音频/说话人线索、历史镜头记忆，或导航控制。",
      "process": "聚合跨镜头视觉和语音身份；将控制校准为 6-DoF 轨迹并进行几何条件注入；以渐进 teacher forcing 和长短期 Self-Gradient Forcing 将双向骨干转成因果少步生成器。",
      "output": "跨镜头身份一致的长音视频，或可控制的交互世界视频。",
      "details": "**输入**：文本、图像、全镜头音频/说话人线索、历史镜头记忆，或导航控制。\n\n**过程**：聚合跨镜头视觉和语音身份；将控制校准为 6-DoF 轨迹并进行几何条件注入；以渐进 teacher forcing 和长短期 Self-Gradient Forcing 将双向骨干转成因果少步生成器。\n\n**输出**：跨镜头身份一致的长音视频，或可控制的交互世界视频。"
    },
    "experiments": "作者报告长视频变体在跨镜头一致性、画质、文本对齐和语音保真度上优于比较方法；世界模型变体在 WBench 平均 81.7，并在 SANA-WM-Bench 的画质和长时持续性上领先。跨模型计算预算和数据差异限制了“全面领先”的外推。",
    "evidence_notes": "",
    "code_data_status": "项目页公开，代码、数据和权重未核验为公开。",
    "limitations": "系统由两个目的不同的变体组成，统一能力边界需谨慎解释。音频身份、视觉身份和几何控制可能相互牵制；长时间交互中的错误恢复尚缺少标准化证据。\n\n### 与知域的关系\n\n与流式生成、Video World Model 和长时一致性直接相关，可补足仅关注静音视频世界模型的路线。",
    "comments": "",
    "source_reports": [
      "report-a141624b1e"
    ],
    "deleted": false,
    "updated_at": "2026-08-31",
    "arxiv": {
      "published": "2026-08-24T15:31:12Z",
      "revised_at": "2026-08-25T14:42:59Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2605-18739",
    "title": "LongLive-2.0: An NVFP4 Parallel Infrastructure for Long Video Generation",
    "authors": [
      "Yukang Chen",
      "Luozhou Wang",
      "Wei Huang",
      "Shuai Yang",
      "Bohan Zhang",
      "Yicheng Xiao",
      "Ruihang Chu",
      "Weian Mao",
      "Qixin Hu",
      "Shaoteng Liu",
      "Yuyang Zhao",
      "Huizi Mao",
      "Ying-Cong Chen",
      "Enze Xie",
      "Xiaojuan Qi",
      "Song Han"
    ],
    "year": 2026,
    "publication": "2026，arXiv preprint（cs.CV / cs.DC，v2）。Yukang Chen、Luozhou Wang、Wei Huang、Shuai Yang 为共同一作；NVIDIA。arXiv:2605.18739；arXiv DOI：10.48550/arXiv.2605.18739。尚无正式会议或期刊页。",
    "arxiv_id": "2605.18739",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2605.18739",
      "project": "https://nvlabs.github.io/LongLive/LongLive2/",
      "code": "https://github.com/NVlabs/LongLive",
      "alphaxiv": "https://alphaxiv.org/abs/2605.18739"
    },
    "tags": [
      "Agent与可执行世界",
      "VLA",
      "因果与反事实",
      "流式与自回归",
      "视频生成"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2605.18739v2/fig1-overall.png",
      "alt": "LongLive-2.0 Fig. 1: end-to-end NVFP4 training and inference infrastructure",
      "label": "LongLive-2.0，Fig. 1，训练侧 Balanced SP / NVFP4 / few-step LoRA 与推理侧 W4A4、KV 量化、异步 VAE 的全链路。来源：Fig. 1 原图 PNG",
      "paper_title": "LongLive-2.0: An NVFP4 Parallel Infrastructure for Long Video Generation",
      "source_url": "https://arxiv.org/html/2605.18739v2/fig1-overall.png"
    },
    "summary": "核心 Insight： 把 AR 数据布局、sequence parallel、4-bit 数值格式和流式解码作为一个系统共同设计。 Balanced SP 在每个 rank 上配对 clean-history 与 noisy-target temporal chunks，使 teacher-forcing mask 自然落在本地布局；训练线性层使用 NVFP4，并让 reduction、normalization statistics、optimizer states 等敏感操作保留高精度。推理则同时做 W4A4 model、NVFP4 KV cache、并行 KV 解量化和异步 streaming VAE。",
    "insight": "核心 Insight：**把 AR 数据布局、sequence parallel、4-bit 数值格式和流式解码作为一个系统共同设计。** Balanced SP 在每个 rank 上配对 clean-history 与 noisy-target temporal chunks，使 teacher-forcing mask 自然落在本地布局；训练线性层使用 NVFP4，并让 reduction、normalization statistics、optimizer states 等敏感操作保留高精度。推理则同时做 W4A4 model、NVFP4 KV cache、并行 KV 解量化和异步 streaming VAE。\n\n算法上另一个重要变化是 **clean pipeline**：直接在真实 long multi-shot 数据上把 Wan2.2-TI2V-5B 调成 AR；实时 4/3/2-step 能力以独立 DMD LoRA 叠加，不污染主 AR checkpoint。与本知识库课题 **直接相关于部署与长程状态接口，间接相关于世界模型**：它支持 T2V/I2V、多镜头和交互 prompt，不提供相机动作或物理干预控制。",
    "pipeline": {
      "input": "长单镜头或多镜头视频、shot-level prompts；骨干 Wan2.2-TI2V-5B，支持 T2V / I2V，目标分辨率最高 1280×720。训练按时间 chunk 拆成干净历史和当前加噪目标。",
      "process": "Balanced sequence parallel 将成对 chunks 分发到各 rank，并用 SP-aware chunked VAE encoding 控制峰值显存；主模型直接做长视频 teacher-forcing AR 微调，可使用 BF16 或 end-to-end NVFP4。少步阶段以 standalone LoRA 做 DMD，teacher/student/real-score 同步到 W4A4。推理将线性层权重与激活量化为 NVFP4，KV cache 以 chunk 为单位量化（论文给出的存储式从约 4T cHd bytes 降到 9T cHd/8，实测约 3.6× 压缩），sink-token 滑窗内用定制 CUDA 并行解量化；VAE 在独立 stream 上边生成边解码。非 Blackwell 用多卡 SP inference 替代原生 NVFP4 加速。",
      "output": "720p 流式、可多次切换 prompt 的长视频；主模型可叠加 4/3/2-step LoRA，在 GB200 NVL72 的论文口径下最高 45.7 FPS 端到端吞吐。",
      "details": "- **输入：** 长单镜头或多镜头视频、shot-level prompts；骨干 Wan2.2-TI2V-5B，支持 T2V / I2V，目标分辨率最高 1280×720。训练按时间 chunk 拆成干净历史和当前加噪目标。\n- **过程：** Balanced sequence parallel 将成对 chunks 分发到各 rank，并用 SP-aware chunked VAE encoding 控制峰值显存；主模型直接做长视频 teacher-forcing AR 微调，可使用 BF16 或 end-to-end NVFP4。少步阶段以 standalone LoRA 做 DMD，teacher/student/real-score 同步到 W4A4。推理将线性层权重与激活量化为 NVFP4，KV cache 以 chunk 为单位量化（论文给出的存储式从约 \\(4T_cHd\\) bytes 降到 \\(9T_cHd/8\\)，实测约 3.6× 压缩），sink-token 滑窗内用定制 CUDA 并行解量化；VAE 在独立 stream 上边生成边解码。非 Blackwell 用多卡 SP inference 替代原生 NVFP4 加速。\n- **输出：** 720p 流式、可多次切换 prompt 的长视频；主模型可叠加 4/3/2-step LoRA，在 GB200 NVL72 的论文口径下最高 45.7 FPS 端到端吞吐。\n\n相对 LongLive 1.0，2.0 更换为 5B Wan2.2 基座、引入真实 multi-shot 数据与 shot-level attention sink，并把量化/并行覆盖训练、蒸馏、KV 和 VAE；相对 Self/Causal Forcing，主 AR 模型不需要 ODE 初始化，DMD 只负责独立的实时 LoRA。"
    },
    "experiments": "**作者主张：** 这是首个面向长视频生成的 end-to-end NVFP4 训练与推理系统，训练最高加速约 2.15×，推理最高约 1.84×，5B 模型达到 45.7 FPS。\n\n实验实际支持：\n\n- **公开模型总表：** BF16 LongLive-2.0-5B 为 **24.8 FPS / VBench 85.06**；NVFP4 4-step 为 **29.7 FPS / 84.51**；NVFP4 2-step 为 **45.7 FPS / 83.14**。LongLive-1.3B 为 20.7 FPS / 84.87。速度提升伴随 VBench 下降，2-step 不是免费加速。\n- **步数–速度：** 3-step 35.2 FPS，2-step 45.7 FPS；论文称相对既有方法最高约 2×。这些是 1280×720、Blackwell 集群与其端到端 pipeline 的特定口径，不能写成单卡 45.7 FPS。\n- **训练基础设施：** 随视频长度增加，GEMM 占比上升，NVFP4 收益更明显；Balanced SP + NVFP4 在论文设置中给出最高 **2.15×** 加速，并降低峰值显存。需按各表的 GPU 数与视频长度比较，不能把峰值倍数视为所有配置恒定值。\n- **60 s 长视频（MovieGenBench prompts + VBench-Long，4-step）：** LongLive-2.0 在比较方法中平均 rank 最好；NVFP4 的 Subject Consistency **97.62** 最优，BF16 的 Background Consistency **97.00** 最优。量化与 BF16 各胜不同维度，并非 NVFP4 全轴更高。\n- **推理部件消融：** W4A4、NVFP4 KV、并行解量化与异步 VAE 共同形成最高约 **1.84×** 端到端加速；KV 存储约 3.6× 压缩。作者明确强调 end-to-end FPS，不只统计 DiT。\n\n**证据未支持：** GB200 上的 NVFP4 加速可原样迁移到 H100/A100；VBench 83.14 的 2-step 模型质量优于 4-step/BF16；多镜头 benchmark 已覆盖叙事一致性与剪辑质量；“clean pipeline”说明 DMD 不再有用——论文仍用 DMD 训练实时 LoRA。",
    "evidence_notes": "",
    "code_data_status": "- **代码：** [NVlabs/LongLive](https://github.com/NVlabs/LongLive)，main 分支为 2.0，1.0 保留在 `v1.0` 分支；仓库声明 Apache-2.0。\n- **模型：** 仓库/项目页提供 LongLive-2.0-5B、NVFP4 4-step / 2-step 等权重入口；以 release 页面实际文件为准。\n- **数据：** 论文使用长单镜头与 multi-shot 策展数据，具体语料规模、来源与可再分发性需按论文附录/仓库数据说明核对；完整训练集并非由代码仓库自动提供。\n- **实现边界：** NVFP4 路径依赖 Transformer Engine、定制 CUDA/Triton kernel 与 Blackwell；非 Blackwell 文档走 sequence-parallel 推理。",
    "limitations": "- NVFP4 的实质加速依赖 Blackwell Tensor Cores；H100/A100 只能用 SP 等替代路线。\n- 2-step 45.7 FPS 的 VBench 低于 4-step 与 BF16，速度–质量权衡明确存在。\n- 多镜头和 prompt 切换仍是文本接口，没有相机/动作控制与闭环环境反馈。\n- 真实 long multi-shot 数据质量是 clean pipeline 成立的重要前提，数据不完整公开会影响复现。\n- 系统包含量化、SP、LoRA、KV kernel、异步 VAE，多部件组合使跨硬件公平复现困难。\n- 60 s 指标与演示不能证明任意时长无漂移；长程叙事和镜头转场仍缺统一标准。\n\n---",
    "comments": "",
    "source_reports": [
      "report-c7ced2c92d"
    ],
    "deleted": false,
    "updated_at": "2026-08-24",
    "challenges": "LongLive 1.0 已能分钟级流式生成，但其算法链仍是“ODE 初始化 → DMD → streaming long tuning”，基座只有 1.3B；长序列训练会被视频 token、VAE 编码和 teacher-forcing mask 的显存/通信成本卡住，推理还要同时承担 DiT、不断增长的 KV cache 和 VAE 解码。本文针对的不是新的 DMD 理论，而是：**如何把 5B、720p、multi-shot 长视频的训练与端到端推理共同扩展到实时。**\n\n- 常规 sequence parallel 只均分 token，没有利用 AR teacher forcing 中“干净历史 + 加噪目标块”的结构，容易负载不均或需要复杂 mask。\n- 只量化 DiT 权重不足以解决长视频 KV cache；只报 denoiser FPS 也会掩盖 VAE 解码空转。\n- Blackwell 有 NVFP4 Tensor Core，A100/H100 没有同等原生 W4A4 加速；硬件口径必须分开。\n- 算法侧，作者认为高质量长视频数据与基础设施足够时，可以直接把双向模型 TF 微调成 long multi-shot AR，而不必把 ODE/DMD/long tuning 全串进主模型训练。",
    "motivation": "核心 Insight：**把 AR 数据布局、sequence parallel、4-bit 数值格式和流式解码作为一个系统共同设计。** Balanced SP 在每个 rank 上配对 clean-history 与 noisy-target temporal chunks，使 teacher-forcing mask 自然落在本地布局；训练线性层使用 NVFP4，并让 reduction、normalization statistics、optimizer states 等敏感操作保留高精度。推理则同时做 W4A4 model、NVFP4 KV cache、并行 KV 解量化和异步 streaming VAE。\n\n算法上另一个重要变化是 **clean pipeline**：直接在真实 long multi-shot 数据上把 Wan2.2-TI2V-5B 调成 AR；实时 4/3/2-step 能力以独立 DMD LoRA 叠加，不污染主 AR checkpoint。与本知识库课题 **直接相关于部署与长程状态接口，间接相关于世界模型**：它支持 T2V/I2V、多镜头和交互 prompt，不提供相机动作或物理干预控制。",
    "technical_approach": "- **输入：** 长单镜头或多镜头视频、shot-level prompts；骨干 Wan2.2-TI2V-5B，支持 T2V / I2V，目标分辨率最高 1280×720。训练按时间 chunk 拆成干净历史和当前加噪目标。\n- **过程：** Balanced sequence parallel 将成对 chunks 分发到各 rank，并用 SP-aware chunked VAE encoding 控制峰值显存；主模型直接做长视频 teacher-forcing AR 微调，可使用 BF16 或 end-to-end NVFP4。少步阶段以 standalone LoRA 做 DMD，teacher/student/real-score 同步到 W4A4。推理将线性层权重与激活量化为 NVFP4，KV cache 以 chunk 为单位量化（论文给出的存储式从约 \\(4T_cHd\\) bytes 降到 \\(9T_cHd/8\\)，实测约 3.6× 压缩），sink-token 滑窗内用定制 CUDA 并行解量化；VAE 在独立 stream 上边生成边解码。非 Blackwell 用多卡 SP inference 替代原生 NVFP4 加速。\n- **输出：** 720p 流式、可多次切换 prompt 的长视频；主模型可叠加 4/3/2-step LoRA，在 GB200 NVL72 的论文口径下最高 45.7 FPS 端到端吞吐。\n\n相对 LongLive 1.0，2.0 更换为 5B Wan2.2 基座、引入真实 multi-shot 数据与 shot-level attention sink，并把量化/并行覆盖训练、蒸馏、KV 和 VAE；相对 Self/Causal Forcing，主 AR 模型不需要 ODE 初始化，DMD 只负责独立的实时 LoRA。",
    "discussion": "LongLive-2.0 的贡献是算法–基础设施收口，而不是替代 LongLive 1.0 的三项算法 Insight。1.0 解决 train-long–test-long、KV-recache 与 frame sink；2.0 解决 5B 长视频怎样训练、怎样把少步蒸馏以 LoRA 插拔、怎样让 4-bit model/KV 与 VAE 真正端到端跑快。它还给出一个重要谱系修正：主 AR 能力可以由高质量长视频 TF 直接得到，ODE/DMD 不必承担所有能力迁移；但实时化仍使用 DMD。阅读判断：适合作为“长视频生成系统层”的收尾卡片；不能把 NVFP4 吞吐写成新的生成建模定律，也不能把 prompt 交互等同动作世界模型。",
    "arxiv": {
      "published": "2026-05-18T17:57:03Z",
      "revised_at": "2026-05-19T17:46:12Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2608-22764",
    "title": "LpWM: A Case for Sparse Representations in World Models",
    "authors": [
      "Yilun Kuang",
      "Yash Dagade",
      "Quentin Le Lidec",
      "Lucas Maes",
      "Randall Balestriero",
      "Yann LeCun"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本（首发 2026-08-24）",
    "arxiv_id": "2608.22764",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.22764",
      "alphaxiv": "https://alphaxiv.org/abs/2608.22764"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "流式与自回归",
      "第一视角与人类视频",
      "长时记忆"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.22764v1/fig_piecewise_heatmap_r14c14.png",
      "alt": "LpWM: A Case for Sparse Representations in World Models 代表图",
      "label": "(a) Support Jaccard Heatmap. 来源：论文图",
      "paper_title": "LpWM: A Case for Sparse Representations in World Models",
      "source_url": "https://arxiv.org/html/2608.22764v1/fig_piecewise_heatmap_r14c14.png"
    },
    "summary": "JEPA 系模型把特征匹配到最大熵分布（如各向同性高斯）得到稠密表示以避免坍塌，但 稠密表示是否是最利于建模动力学的几何？ LpWM 论证：非线性 Lipschitz 动力学可被高维 action-conditioned 线性动力学任意逼近，因此稀疏表示几何可能让动作条件潜在动力学更容易建模，并研究稀疏表示中涌现的动力学结构。",
    "insight": "JEPA 系模型把特征匹配到最大熵分布（如各向同性高斯）得到稠密表示以避免坍塌，但**稠密表示是否是最利于建模动力学的几何？**LpWM 论证：非线性 Lipschitz 动力学可被高维 action-conditioned 线性动力学任意逼近，因此稀疏表示几何可能让动作条件潜在动力学更容易建模，并研究稀疏表示中涌现的动力学结构。",
    "pipeline": {
      "input": "观测序列 + 动作。",
      "process": "理论（Lipschitz 动力学→高维线性逼近）→ 稀疏表示世界模型设计 → action-conditioned 潜在动力学学习 → 规划/控制评估。",
      "output": "稀疏潜在动力学世界模型。",
      "details": "**输入**：观测序列 + 动作。\n**过程**：理论（Lipschitz 动力学→高维线性逼近）→ 稀疏表示世界模型设计 → action-conditioned 潜在动力学学习 → 规划/控制评估。\n**输出**：稀疏潜在动力学世界模型。"
    },
    "experiments": "理论部分为可逼近性结果（存在性论证）；实验部分待全文核验。证据等级：仅摘要核验；应把理论\"可逼近\"与实验\"更优\"分开解读。",
    "evidence_notes": "",
    "code_data_status": "未公开。",
    "limitations": "- 理论可逼近 ≠ 现实学习器必然更优；\n- 稀疏表示的码本/稀疏度选择；\n- 与稠密 JEPA 的经验差距规模。\n\n### 与知域的关系\n与 Causal-JEPA、Gaussian-JEPA 同属\"JEPA 世界模型表示几何\"专题，提供\"稀疏 vs 稠密\"的新对比轴，建议并入知域 JEPA 主题。",
    "comments": "",
    "source_reports": [
      "report-a141624b1e"
    ],
    "deleted": false,
    "updated_at": "2026-08-31",
    "arxiv": {
      "published": "2026-08-24T03:37:39Z",
      "revised_at": "2026-08-24T03:37:39Z",
      "primary_category": "cs.LG"
    }
  },
  {
    "id": "arxiv-2609-25627",
    "title": "MachEmbodied-U0: Unified Understanding and Generation Model for Embodied Intelligence",
    "authors": [
      "Haoran Wen",
      "Wenfu Wang",
      "Kunsong Shi",
      "Jingke Wang",
      "Wancheng Feng",
      "Yiren Zhang",
      "Yueran Zhao",
      "Xuancheng Zhang",
      "Nanfei Ye",
      "Xingru Chen",
      "Zhaohong Sun",
      "Chengmin Yang",
      "Zikang Yu",
      "Penghao Bi",
      "Jia Shi",
      "Yu Liu",
      "Kun Zhan",
      "Yan Xie"
    ],
    "year": 2026,
    "publication": "2026，Technical Report / arXiv",
    "arxiv_id": "2609.25627",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2609.25627",
      "project": "https://machembodied.com/ME-U/ME-U0.html",
      "code": "https://github.com/MachEmbodied/ME-U0",
      "alphaxiv": "https://alphaxiv.org/abs/2609.25627"
    },
    "tags": [
      "VLA",
      "World Action Model",
      "第一视角与人类视频",
      "自监督与预测表征"
    ],
    "figure": {
      "url": "content/images/2609.25627-main.webp",
      "alt": "Figure 6：理解专家与生成专家通过共享多模态注意力联合建模语义、视觉和动作",
      "label": "Figure 6 · 理解专家与生成专家通过共享多模态注意力联合建模语义、视觉和动作",
      "paper_title": "MachEmbodied-U0: Unified Understanding and Generation Model for Embodied Intelligence",
      "source_url": "https://arxiv.org/html/2609.25627v1/pipeline.png"
    },
    "summary": "ME-U0试图统一understanding与generation：subtask prediction和affordance grounding先提供task-relevant结构，generation expert随后联合预测RGB、depth、surface normal、optical flow和actions。",
    "insight": "ME-U0试图统一understanding与generation：subtask prediction和affordance grounding先提供task-relevant结构，generation expert随后联合预测RGB、depth、surface normal、optical flow和actions。",
    "pipeline": {
      "input": "视觉、语言、机器人状态。",
      "process": "understanding expert预测subtask/affordance → Mixture-of-Transformers与generation expert交互 → flow matching联合预测multi-modal visual dynamics和action；MRPE对齐不同temporal rate。",
      "output": "subtask、affordance、future RGB/depth/normal/flow以及robot actions。",
      "details": "**过程**：understanding expert预测subtask/affordance → Mixture-of-Transformers与generation expert交互 → flow matching联合预测multi-modal visual dynamics和action；MRPE对齐不同temporal rate。\n\n**输入**：视觉、语言、机器人状态。\n\n**输出**：subtask、affordance、future RGB/depth/normal/flow以及robot actions。\n\nunderstanding expert 提供 subtask/affordance 条件，generation expert 预测多模态未来和动作；Multi-rate RoPE 用物理时间对齐不同采样率。预训练用额外结构监督，下游 LIBERO/RoboDojo post-training 只用基准原生监督，应区分两个阶段的数据需求。\n\n[原文方法](https://arxiv.org/html/2609.25627)\n\n### 方法细节与实现\n\n**理解分支。**视觉语言专家以自回归文本预测当前子任务，以及任务相关对象框、交互点和操作语义；损失为 next-token 交叉熵。理解 token 只能访问当前观测和状态，注意力阻止其读取未来训练目标，避免把预测答案泄漏给语义理解。\n\n**生成分支。**MoT 的共享多模态注意力联合处理未来视觉和动作。RGB、深度、法线或光流均表示为三通道视觉目标，依据输入提示选择生成模态，共用视频 VAE 潜空间和输出投影；不是四种模态各设一个独立几何预测头。动作每个时刻对应一个 token，经专用输出头预测流速度并以 Euler 步同步更新。\n\n**多频率位置编码。**视频被时间下采样，而动作保持原始采样频率。MRPE 给同一视频 latent 对应的一段动作共享时间索引，再在位置编码的另一轴上为段内动作分配不同序号，既保留跨模态时间对齐，又不丢失动作先后顺序。几何和光流监督扩展了目标类型，但仍不等于显式求解三维动力学。\n\n[对应方法原文](https://arxiv.org/html/2609.25627#S3)"
    },
    "experiments": "约4,200小时预训练；RoboDojo score 17.66，LIBERO 99.0%，LIBERO-Plus 82.5%。\n\n\nRoboDojo-Sim 的 17.66 是过程 Score，SR 实际为 11.18%；并未超过表中全部 VLA（例如 DM0.5 的 Score 24.90）。LIBERO 99.0% 也低于 OpenWAM-α 的 99.3%；LIBERO-Plus 82.5% 低于部分 VLA。优势应限定为多模态预训练后的竞争力；memory 子集 SR 7.00%/Score 8.42，暴露无显式历史记忆的短板。\n\n[原文实验与表格](https://arxiv.org/html/2609.25627)\n\n**全面性不等于每项领先。**约4,200小时混合数据支持多任务统一训练。RoboDojo 的综合分17.66与二元成功率11.18是不同指标；LIBERO 99.0略低于表中99.3的对照，LIBERO-Plus82.5也不是所有VLA最高。记忆相关任务仍弱，说明增加输出模态尚未解决持续状态维护和长期执行问题。\n\n[实验与设置原文](https://arxiv.org/html/2609.25627)",
    "evidence_notes": "已核验原文方法与实验；关键比较与限制见各节",
    "code_data_status": "GitHub 已确认公开 post-training 与 LIBERO/RoboDojo evaluation 代码；项目页本次连接重置，开放状态以可访问的官方仓库为依据。README 明确说明model weights、datasets和simulator assets并未打包，需要用户自行准备。",
    "limitations": "完整系统同时改变semantic understanding、geometry/motion supervision和action generation，当前外部benchmark无法单独说明哪个world modality贡献最大；LIBERO也接近ceiling。",
    "comments": "",
    "source_reports": [],
    "deleted": false,
    "updated_at": "2026-09-24",
    "challenges": "动作策略缺少对未来场景的结构化描述，而纯视频世界模型又未必突出任务相关对象和子目标。统一多模态未来状态时，不同本体和视频/动作采样频率进一步增加对齐困难。",
    "motivation": "ME-U0试图统一understanding与generation：subtask prediction和affordance grounding先提供task-relevant结构，generation expert随后联合预测RGB、depth、surface normal、optical flow和actions。",
    "technical_approach": "**过程**：understanding expert预测subtask/affordance → Mixture-of-Transformers与generation expert交互 → flow matching联合预测multi-modal visual dynamics和action；MRPE对齐不同temporal rate。\n\n**输入**：视觉、语言、机器人状态。\n\n**输出**：subtask、affordance、future RGB/depth/normal/flow以及robot actions。\n\nunderstanding expert 提供 subtask/affordance 条件，generation expert 预测多模态未来和动作；Multi-rate RoPE 用物理时间对齐不同采样率。预训练用额外结构监督，下游 LIBERO/RoboDojo post-training 只用基准原生监督，应区分两个阶段的数据需求。\n\n[原文方法](https://arxiv.org/html/2609.25627)\n\n### 方法细节与实现\n\n**理解分支。**视觉语言专家以自回归文本预测当前子任务，以及任务相关对象框、交互点和操作语义；损失为 next-token 交叉熵。理解 token 只能访问当前观测和状态，注意力阻止其读取未来训练目标，避免把预测答案泄漏给语义理解。\n\n**生成分支。**MoT 的共享多模态注意力联合处理未来视觉和动作。RGB、深度、法线或光流均表示为三通道视觉目标，依据输入提示选择生成模态，共用视频 VAE 潜空间和输出投影；不是四种模态各设一个独立几何预测头。动作每个时刻对应一个 token，经专用输出头预测流速度并以 Euler 步同步更新。\n\n**多频率位置编码。**视频被时间下采样，而动作保持原始采样频率。MRPE 给同一视频 latent 对应的一段动作共享时间索引，再在位置编码的另一轴上为段内动作分配不同序号，既保留跨模态时间对齐，又不丢失动作先后顺序。几何和光流监督扩展了目标类型，但仍不等于显式求解三维动力学。\n\n[对应方法原文](https://arxiv.org/html/2609.25627#S3)",
    "discussion": "**阅读者分析**：是“多模态结构化future state + action”的大型系统实例，可作为3D/4D WAM强baseline参考。",
    "arxiv": {
      "published": "2026-09-22",
      "revised_at": "",
      "primary_category": "cs.RO"
    },
    "source_papers": [
      "content/papers/2609.25627.md"
    ]
  },
  {
    "arxiv": {
      "published": "2026-04-21T17:05:37Z",
      "revised_at": "2026-04-22T17:44:56Z",
      "primary_category": "cs.RO"
    },
    "arxiv_id": "2604.19683",
    "authors": [
      "Yunfan Lou",
      "Xiaowei Chi",
      "Xiaojie Zhang",
      "Zezhong Qian",
      "Chengxuan Li",
      "Rongyu Zhang",
      "Yaoxu Lyu",
      "Guoyu Song",
      "Chuyao Fu",
      "Haoxuan Xu",
      "Pengwei Wang",
      "Shanghang Zhang"
    ],
    "code_data_status": "- 代码仓库公开，但 README 说明当前 release 主要保留 LIBERO 与核心实现；RLBench、真实机器人流程和完整预训练数据并未全部打包。训练 masks 需借助外部 RoboEngine/segmentation pipeline 生成。\n- 依赖 mask 质量和类别体系；checkpoint 逐 suite 选择；无随机波动；部分 baseline 比较/正文数字不一致；没有 SCM、反事实或因果图评测。\n\n---",
    "comments": "",
    "deleted": false,
    "doi": "",
    "evidence_notes": "- **作者明确主张：** 未来 mask prediction 让策略聚焦 action-relevant geometry，改善 OOD robustness。\n- **实验实际支持：** 在视觉扰动、6-task RLBench 子集和 4 个真实任务上，成功率高于所选 baseline。\n- **阅读判断：** 这是信息瓶颈与几何监督带来的稳健性，不是因果识别。mask 会主动丢弃纹理/颜色；若任务本身依赖颜色、材质或文字，这可能成为失败源，但论文未充分覆盖该反例。",
    "experiments": "- **LIBERO：** 每 suite 用 held-out validation 选 checkpoint，再评 500 episodes。MWM Spatial/Object/Goal/LIBERO-10 为 **0.988/1.000/0.982/0.960**，平均 **0.983**；GE-ACT **0.965**，π0 **0.942**（Table 1）。没有报告 seed/std，近饱和差异需谨慎。\n- **表文不一致：** Table 1 中 Cosmos + Latent IDM 平均为 **0.919**、MWM-C2 为 **0.918**，但正文写成从 **0.873 提升到 0.918**。因此不能依据正文声称 C2 优于该表中 baseline；报告应以表格并标注冲突。\n- **RLBench：** 从 100 个任务中只选 6 个，每任务 20 episodes；MWM **68.3%**，FiS-VLA **50.0%**、CogACT **42.5%**、π0 **33.3%**、GE-ACT **30.8%**（Table 2）。每 task 20 次使成功率步长为 5 个百分点，且不代表完整 100-task benchmark。\n- **真实 Franka：** 4 tasks，每 task 50 demos，20 trials；ID 平均 **67.5%**，π0 **38.8%**、GE-ACT **23.8%**；appearance OOD 平均 **42.1%**，对照 **19.2/12.5%**（Table 3）。同数据训练增强了公平性，但 trial 数仍小。\n- 论文另做 token pruning/视觉扰动压力测试，支持 mask bottleneck 对背景变化更稳；没有直接证明其表征是 causal variables。",
    "figure": {
      "url": "https://arxiv.org/html/2604.19683v2/mwm.png",
      "alt": "Mask World Model Fig. 2: future semantic-mask prediction framework",
      "label": "Mask World Model，Fig. 2，以未来语义 mask 作为预测瓶颈并向动作策略提供中间特征的整体框架。来源：Fig. 2 原图 PNG",
      "paper_title": "Mask World Model: Predicting What Matters for Robust Robot Policy Learning",
      "source_url": "https://arxiv.org/html/2604.19683v2/mwm.png"
    },
    "id": "arxiv-2604-19683",
    "insight": "RGB future prediction会浪费容量重建纹理、光照和背景。MWM 改为预测未来 semantic masks，把对象身份、布局、接触和运动压进低带宽几何瓶颈；action policy 读取 mask-predictive intermediate features。训练需要离线 mask，推理只需 RGB，不在线调用 segmenter。",
    "limitations": "- 代码仓库公开，但 README 说明当前 release 主要保留 LIBERO 与核心实现；RLBench、真实机器人流程和完整预训练数据并未全部打包。训练 masks 需借助外部 RoboEngine/segmentation pipeline 生成。\n- 依赖 mask 质量和类别体系；checkpoint 逐 suite 选择；无随机波动；部分 baseline 比较/正文数字不一致；没有 SCM、反事实或因果图评测。\n\n---",
    "links": {
      "paper": "https://arxiv.org/abs/2604.19683",
      "publication": "https://openreview.net/pdf?id=CWerqtOXif",
      "code": "https://github.com/LYFCLOUDFAN/mask-world-model",
      "alphaxiv": "https://alphaxiv.org/abs/2604.19683"
    },
    "pipeline": {
      "input": "输入；4 帧多视角 RGB；未来 mask targets；当前视觉 + world-model features；raw RGB",
      "process": "模块；conditional diffusion/latent mask predictor；diffusion action policy；recurrent horizon control；10 Euler steps",
      "output": "输出；5 帧未来 mask latent 与中间特征；36-step action chunk；执行首个动作后重规划",
      "details": "| 阶段 | 输入 | 模块 | 输出 |\n|---|---|---|---|\n| world-model pretraining | 4 帧多视角 RGB；未来 mask targets | conditional diffusion/latent mask predictor | 5 帧未来 mask latent 与中间特征 |\n| policy training | 当前视觉 + world-model features | diffusion action policy | 36-step action chunk |\n| deployment | raw RGB | recurrent horizon control；10 Euler steps | 执行首个动作后重规划 |"
    },
    "publication": "ICML 2026；OpenReview camera-ready 页眉标注 PMLR 306。早期标题为 Predicting What Matters: Robust Generalist Robot Policy Learning via Future Semantic Mask ；截至检索日 PMLR 独立落地页尚未被检索索引。",
    "source_reports": [
      "report-ce5d8128c6"
    ],
    "summary": "RGB future prediction会浪费容量重建纹理、光照和背景。MWM 改为预测未来 semantic masks，把对象身份、布局、接触和运动压进低带宽几何瓶颈；action policy 读取 mask-predictive intermediate features。训练需要离线 mask，推理只需 RGB，不在线调用 segmenter。",
    "tags": [
      "3D/4D",
      "VLA",
      "因果与反事实",
      "对象与可供性",
      "机器人学习"
    ],
    "title": "Mask World Model: Predicting What Matters for Robust Robot Policy Learning",
    "updated_at": "2026-08-31",
    "year": 2026
  },
  {
    "id": "arxiv-2607-19343",
    "title": "Masked Visual Actions for Unified World Modeling",
    "authors": [
      "Hadi Alzayer",
      "Wenlong Huang",
      "Haonan Chen",
      "Christopher Luey",
      "Lvmin Zhang",
      "Maneesh Agrawala",
      "Gordon Wetzstein",
      "Li Fei-Fei",
      "Yilun Du",
      "Jiajun Wu",
      "Jia-Bin Huang"
    ],
    "year": 2026,
    "publication": "2026，arXiv preprint（v1，cs.CV，2026-07-21）。尚无 DOI / 正式出版页。",
    "arxiv_id": "2607.19343",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2607.19343",
      "project": "https://masked-visual-actions.github.io/",
      "code": "https://github.com/HadiZayer/masked-visual-actions",
      "model": "https://huggingface.co/HadiZayer/masked-visual-actions",
      "alphaxiv": "https://alphaxiv.org/abs/2607.19343"
    },
    "tags": [
      "VLA",
      "World Action Model",
      "世界模型",
      "动作表征",
      "因果与反事实",
      "机器人学习",
      "自监督与预测表征",
      "跨本体迁移"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2607.19343v1/teaser.png",
      "alt": "Masked Visual Actions Fig. 1: forward and inverse queries via masked trajectories",
      "label": "Masked Visual Actions，Fig. 1，同一 checkpoint：遮罩机器人轨迹做正向动力学，遮罩物体运动做逆向合成。来源：Fig. 1 原图 PNG",
      "paper_title": "Masked Visual Actions for Unified World Modeling",
      "source_url": "https://arxiv.org/html/2607.19343v1/teaser.png"
    },
    "summary": "核心做法是把动作表示成视频中任意实体的部分可见时空轨迹：露出机器人运动，模型补全物体与场景响应；露出期望物体运动，同一模型补全机器人行为。主动与被动不再是两套架构，而是对同一交互先验的不同 masked-video 查询。它与 FlowWAM 一起构成本专题最直接的两个端点：显式 flow field 与实体 masked trajectory。",
    "insight": "核心 Insight：**把动作写成视频里任意实体的部分可见时空轨迹。露出机器人，模型预测场景响应（正向）；露出物体期望运动，同一模型补出机器人行为（逆向）。主动/被动不是两套架构，而是对同一交互先验的不同查询。**\n\n这改变的是控制接口：条件是与输出空间对齐的 masked video，用 concatenation 注入 Wan-Fun-Control，而不是另开动作通道。训练只用主动机器人实体的 mask，逆向查询零样本泛化。与本知识库 **直接相关于视频世界模型 / WAM 的动作表征**；与 FlowWAM 的光流视频动作、FACT 的数值动作块是同一谱系上的不同点。作者在讨论里自己写明学的是交互相关而非因果关系。\n\n注意：库中已有 **Mask World Model: Predicting What Matters for Robust Robot Policy Learning**，是另一篇工作（预测语义 mask 当输出），标题相近但不是本文。",
    "pipeline": {
      "input": "参考帧 I 0、masked 条件视频 Modot V（未露出区域填均匀灰）、文本 prompt。正向时 M 为机器人轨迹；逆向时为物体/期望运动。",
      "process": "骨干 Wan-Fun-Control 2.2 14B（双 expert MoE，高低噪 DiT 在 timestep 0.358 分界）。条件经同一 VAE 编码后与视频 latent 拼接。LoRA rank 256，batch 4，8×H200，约 10,000 step / 4 天。数据约 15 小时 ，混合 DROID 与 RoboCasa 的成功和失败轨迹。两条互补构造：(1) SAM 类分割“A robotic arm”，无需标定，但测试难提供精确 mask，且遮挡可能泄漏原视频动态；(2) 按机器人状态渲染 URDF（DROID 标定 refinement 跟随 PointWorld；RoboCasa 只渲染半透明机器人、夹爪标红）。推理期任意动作可渲染成 control video。",
      "output": "完整 RGB 视频。正向：场景对机器人运动的响应；逆向：与给定物体运动一致的机器人运动，再经单独训练的 IDM 变成可执行关节/末端指令。规划时对 Diffusion Policy 的 N 条候选在想象中 rollout，用 Gemini 3.1 Pro 按任务成功、交互保真、物理真实排序。",
      "details": "- **输入：** 参考帧 \\(I_0\\)、masked 条件视频 \\(M\\odot V\\)（未露出区域填均匀灰）、文本 prompt。正向时 \\(M\\) 为机器人轨迹；逆向时为物体/期望运动。\n- **过程：** 骨干 Wan-Fun-Control 2.2 14B（双 expert MoE，高低噪 DiT 在 timestep 0.358 分界）。条件经同一 VAE 编码后与视频 latent 拼接。LoRA rank 256，batch 4，8×H200，约 10,000 step / 4 天。数据约 **15 小时**，混合 DROID 与 RoboCasa 的成功和失败轨迹。两条互补构造：(1) SAM 类分割“A robotic arm”，无需标定，但测试难提供精确 mask，且遮挡可能泄漏原视频动态；(2) 按机器人状态渲染 URDF（DROID 标定 refinement 跟随 PointWorld；RoboCasa 只渲染半透明机器人、夹爪标红）。推理期任意动作可渲染成 control video。\n- **输出：** 完整 RGB 视频。正向：场景对机器人运动的响应；逆向：与给定物体运动一致的机器人运动，再经单独训练的 IDM 变成可执行关节/末端指令。规划时对 Diffusion Policy 的 \\(N\\) 条候选在想象中 rollout，用 Gemini 3.1 Pro 按任务成功、交互保真、物理真实排序。\n\n与最近 baseline 的实质差异：相对 Ctrl-World，条件是像素轨迹而非原始动作向量；相对 Wan-Move，条件是实体 mask 而非 GT tracks；相对 skeleton/EE 可视化，条件稠密且与像素对齐。GitHub 明确：**没有改视频模型或训练器**，只是 DiffSynth-Studio 上的 LoRA 薄层；URDF 渲染工具标注 coming soon。"
    },
    "experiments": "**作者主张：** 约 15 小时 masked 微调后，单 checkpoint 在多样场景和多本体上有高视觉保真与可控性，并可用于策略评估、基于模型的规划和逆向动作提取。\n\n实验实际支持：\n\n- **可控生成（LPIPS↓ / SSIM↑ / PSNR↑）：** DROID 上 Masked Visual Actions 0.0945 / 0.887 / 23.74，Ctrl-World 0.362 / 0.708 / 18.15，Wan-Move（GT tracks）0.534 / 0.562 / 12.99，纯 I2V 0.521 / 0.548 / 12.42。BEHAVIOR（训练未见的 R1-Pro 双臂）0.123 / 0.843 / 22.90 vs Ctrl-World 0.196 / 0.837 / 18.39。**重要公平性注释：** 作者脚注写明 Ctrl-World 在全部 DROID 上训练，因此见过文中 held-out 场景；本方法没有。BEHAVIOR 上 Ctrl-World 的 SSIM 已接近，差距主要在 LPIPS/PSNR 与定性是否塌缩。\n- **条件消融：** DROID 域内 EE vis / skeleton / masked 接近（PSNR 22.64 / 22.74 / 23.74）。自定义夹爪真机：0.183 / 0.169 / **0.148** LPIPS。BEHAVIOR：0.171 / 0.162 / **0.123**。稀疏条件会幻觉出训练集机器人或扭曲双臂。\n- **规划（RoboCasa，每任务 10 场景，Diffusion Policy 候选，\\(N=10\\)，Gemini 3.1 Pro 评判）：** Fig. 8 显示多样任务成功率相对直接执行上升，且随评估样本数增加。这是 test-time scaling / Best-of-N，评判器是闭源 VLM，不是学习到的 value 头。作者把“同一初值下想象不同动作”称作 counterfactuals，**实验是相关排序，不是因果识别**。\n- **策略评估：** 开环 Diffusion Policy，每场景 10 条；视频模型内成功率与 GT 环境相关系数 **\\(r=0.982\\)**。作者同时写明视频模型对任务进度有正偏差（想象成功率系统性更高）。真机四任务各 20 条演示，按 rubric 的进度分布接近真机，同样有正偏差。\n- **逆向动作提取（RoboCasa CoffeeServeMug；视频模型未见该任务；IDM 与 DP/ACT/SmolVLA 都用 100 条演示；20 trial）：** 作者报告本方法 **90%**，高于所列模仿学习 baseline（具体 baseline 数字在 Fig. 11，HTML 未转成可复制表；此处不编造）。正向-only 训练即可零样本转逆向。\n\n**证据未支持：** 学到了接触因果；闭源 VLM judge 无偏；15 小时数据可任意扩展到新本体而不要渲染标定；视频模型成功率可替代真机评测（存在正偏差）。",
    "evidence_notes": "",
    "code_data_status": "- **代码：** [HadiZayer/masked-visual-actions](https://github.com/HadiZayer/masked-visual-actions) 为 DiffSynth-Studio 上的推理脚本与 LoRA 训练配方；Apache-2.0。URDF control video 渲染工具尚未发布。\n- **权重：** Hugging Face `HadiZayer/masked-visual-actions`（high/low noise 两套 LoRA）。基座是 ModelScope `PAI/Wan2.2-Fun-A14B-Control`。\n- **数据：** DROID + RoboCasa；论文称将释放数据，GitHub 目前需要用户自备 CSV（`prompt, reference_image, video, control_video`）。完整 15 小时 masked 语料是否已全部上传待核验。\n- **评测依赖：** 规划用 Gemini 3.1 Pro，闭源且不可完全复现。",
    "limitations": "- 作者原文：模型学的是物体交互的 **相关** 而非因果，因果仍是开放问题。\n- 能力与时延受基座 14B 视频模型限制；没有改骨干表达能力。\n- 分割路径可能从遮挡泄漏原视频动态；渲染路径需要相机标定，且默认只渲染机器人。\n- 视频内评测对成功有正偏差；不能当作无偏仿真器。\n- 规划排序依赖闭源 VLM；自定义夹爪/未见双臂上稀疏条件失败，说明泛化来自 mask 接口而非任意可视化。\n- 逆向仍需要单独 IDM 才能落地关节指令；视频本身不是可执行策略。",
    "comments": "",
    "source_reports": [
      "report-a77d9a7ad6",
      "report-af906c7fa2"
    ],
    "deleted": false,
    "updated_at": "2026-08-21",
    "challenges": "领域长期问题是：大规模视频模型学到了运动、接触和形变先验，但多数仍是被动观察者。本文针对的缺口是 **如何把动作告诉视频模型——既要落在它预训练的像素空间里，又要对物理操作有用**。\n\n- **现有条件信号的失败模式：** 文本过于欠定；tracks / 力 / 关键点稀疏；关节或末端位姿 embodiment-specific，且与视频先验不对齐。Ctrl-World 等在训练域内跟动作准，换未见本体就塌成静止或损坏视频。\n- **稀疏可视化的失败模式：** 同一骨干上训 skeleton 或 end-effector vis，在 DROID 域内与 masked actions 接近；换自定义夹爪会把机器人“改回”训练集外观，BEHAVIOR 双臂上则扭曲本体。\n- **统一接口缺口：** UVA / UWM / X-WAM 等在模态通道上做 masking，动作仍是低维向量，正向/逆向切换不迁移跨本体。已有像素条件（BridgeV2W、Action Images、Mask2IV）几乎只把机器人当主动实体、只跑正向。\n\n作者强调：缺的不是更大的视频骨干，而是 **与预训练视觉空间对齐的动作表征**。",
    "motivation": "核心 Insight：**把动作写成视频里任意实体的部分可见时空轨迹。露出机器人，模型预测场景响应（正向）；露出物体期望运动，同一模型补出机器人行为（逆向）。主动/被动不是两套架构，而是对同一交互先验的不同查询。**\n\n这改变的是控制接口：条件是与输出空间对齐的 masked video，用 concatenation 注入 Wan-Fun-Control，而不是另开动作通道。训练只用主动机器人实体的 mask，逆向查询零样本泛化。与本知识库 **直接相关于视频世界模型 / WAM 的动作表征**；与 FlowWAM 的光流视频动作、FACT 的数值动作块是同一谱系上的不同点。作者在讨论里自己写明学的是交互相关而非因果关系。\n\n注意：库中已有 **Mask World Model: Predicting What Matters for Robust Robot Policy Learning**，是另一篇工作（预测语义 mask 当输出），标题相近但不是本文。",
    "technical_approach": "- **输入：** 参考帧 \\(I_0\\)、masked 条件视频 \\(M\\odot V\\)（未露出区域填均匀灰）、文本 prompt。正向时 \\(M\\) 为机器人轨迹；逆向时为物体/期望运动。\n- **过程：** 骨干 Wan-Fun-Control 2.2 14B（双 expert MoE，高低噪 DiT 在 timestep 0.358 分界）。条件经同一 VAE 编码后与视频 latent 拼接。LoRA rank 256，batch 4，8×H200，约 10,000 step / 4 天。数据约 **15 小时**，混合 DROID 与 RoboCasa 的成功和失败轨迹。两条互补构造：(1) SAM 类分割“A robotic arm”，无需标定，但测试难提供精确 mask，且遮挡可能泄漏原视频动态；(2) 按机器人状态渲染 URDF（DROID 标定 refinement 跟随 PointWorld；RoboCasa 只渲染半透明机器人、夹爪标红）。推理期任意动作可渲染成 control video。\n- **输出：** 完整 RGB 视频。正向：场景对机器人运动的响应；逆向：与给定物体运动一致的机器人运动，再经单独训练的 IDM 变成可执行关节/末端指令。规划时对 Diffusion Policy 的 \\(N\\) 条候选在想象中 rollout，用 Gemini 3.1 Pro 按任务成功、交互保真、物理真实排序。\n\n与最近 baseline 的实质差异：相对 Ctrl-World，条件是像素轨迹而非原始动作向量；相对 Wan-Move，条件是实体 mask 而非 GT tracks；相对 skeleton/EE 可视化，条件稠密且与像素对齐。GitHub 明确：**没有改视频模型或训练器**，只是 DiffSynth-Studio 上的 LoRA 薄层；URDF 渲染工具标注 coming soon。",
    "discussion": "Masked Visual Actions 将“视频世界模型如何接收动作”具体化为像素空间中的遮罩轨迹，并用同一 checkpoint 完成正向模拟与逆向合成。DROID/BEHAVIOR 保真度、自定义夹爪与双臂上的稀疏条件失败，以及策略评估相关 \\(r=0.982\\)，共同支持“稠密、像素对齐的条件更容易跨本体迁移”。与此同时，成功率正偏差和闭源 VLM 排序器提醒我们：生成保真并不自动等于可靠规划。\n\n对后续研究最有价值的问题是：动作接口能否写成基座模型原生理解的模态，同时保留执行精度。本文给出了实体 mask 这一端点，FlowWAM 的光流视频是另一端点；二者都值得与 FACT 的数值动作块比较。适用边界是能够渲染或分割实体轨迹的操作视频，且延迟受 14B 骨干限制。想象 rollout 不能写成反事实识别，Ctrl-World 的 DROID 结果也不是同等训练数据下的严格失败对照。",
    "arxiv": {
      "published": "2026-07-21T17:59:11Z",
      "revised_at": "2026-07-21T17:59:11Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2608-29910",
    "title": "Matrix-Game 3.5: Enhancing Real-Time Streaming Interactive World Models with Patch Memory",
    "authors": [
      "Runjia Qian",
      "Zile Wang",
      "Jihai Zhang",
      "Kai Zou",
      "Wei Yu",
      "Jiaxing Li",
      "Zexiang Liu",
      "Yaokun Li",
      "Fei Kang",
      "Kaichen Huang",
      "Mengyin An",
      "Haobo Zhang",
      "Biao Jiang",
      "Jiahua Wang",
      "Haofeng Sun",
      "Yang Liu",
      "Yangguang Li"
    ],
    "year": 2026,
    "publication": "2026，arXiv",
    "arxiv_id": "2608.29910",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.29910",
      "project": "https://matrix-game-v3-5.github.io/",
      "code": "https://github.com/Riemann-Dynamics/Matrix-Game-3.5",
      "model": "https://huggingface.co/RiemannDynamics/Matrix-Game-3.5-Base",
      "alphaxiv": "https://alphaxiv.org/abs/2608.29910"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "流式与自回归",
      "物理建模与仿真",
      "第一视角与人类视频",
      "视频生成",
      "跨本体迁移"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.29910v1/teaser_white_Riemann.png",
      "alt": "Matrix-Game 3.5 流式交互世界模型概览",
      "label": "Matrix-Game 3.5 流式交互世界模型概览；来源：论文原图",
      "paper_title": "Matrix-Game 3.5: Enhancing Real-Time Streaming Interactive World Models with Patch Memory",
      "source_url": "https://arxiv.org/html/2608.29910v1/teaser_white_Riemann.png"
    },
    "summary": "Matrix-Game 3.5 在 Matrix-Game 3.0 基础上引入：",
    "insight": "Matrix-Game 3.5 在 Matrix-Game 3.0 基础上引入：\n\n- geometry-aware patch memory；\n- tiled-PRoPE 相机条件；\n- 静态场景与动态主体解耦；\n- 两阶段渐进式实时蒸馏。\n\n目标是提高长时交互中的场景几何、动态主体身份和相机控制一致性。",
    "pipeline": {
      "input": "当前视频帧、用户相机动作、历史 patch memory。",
      "process": "检索 3D patch，使用相机条件控制生成；分别建模静态场景和动态主体；通过蒸馏将双向扩散模型转为少步因果生成器。",
      "output": "实时交互视频和持续更新的场景记忆。",
      "details": "**输入**：当前视频帧、用户相机动作、历史 patch memory。\n\n**过程**：检索 3D patch，使用相机条件控制生成；分别建模静态场景和动态主体；通过蒸馏将双向扩散模型转为少步因果生成器。\n\n**输出**：实时交互视频和持续更新的场景记忆。"
    },
    "experiments": "当前摘要主要描述方法改进，尚未核验具体速度、长时长度、基线和一致性指标。项目页和模型页已确认存在，但模型下载和复现实验尚未验证。",
    "evidence_notes": "",
    "code_data_status": "代码、项目页和模型链接公开；数据开放情况待核验。",
    "limitations": "- Patch memory 的检索错误可能导致历史几何污染。\n- 静态—动态解耦在复杂交互、遮挡和主体拓扑变化时可能失效。\n- 少步蒸馏可能牺牲细节和动作响应稳定性。\n\n### 与知域的关系\n\n该工作延续知域已有 Causal Forcing、Causal Forcing++、minWM 和交互视频世界模型路线，重点贡献在长期记忆和几何一致性。",
    "comments": "",
    "source_reports": [
      "report-0d81d19c6c"
    ],
    "deleted": false,
    "updated_at": "2026-09-08",
    "arxiv": {
      "published": "2026-08-30T17:11:00Z",
      "revised_at": "2026-08-30T17:11:00Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2609-10954",
    "title": "Measuring the Value of World-Model Updates: A Counterfactual Utility Protocol for Continual Adaptation",
    "authors": [
      "Anqi Peter Li",
      "Kaden Kim"
    ],
    "year": 2026,
    "publication": "2026，arXiv；论文注明 under review at the CWM workshop",
    "arxiv_id": "2609.10954",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2609.10954",
      "alphaxiv": "https://alphaxiv.org/abs/2609.10954"
    },
    "tags": [
      "世界模型",
      "因果与反事实",
      "强化与模仿学习",
      "适应与泛化"
    ],
    "figure": {
      "url": "content/images/2609.10954-main.webp",
      "alt": "Figure 1：固定更新与不更新的成对分叉评估协议",
      "label": "Figure 1 · 固定更新与不更新的成对分叉评估协议",
      "paper_title": "Measuring the Value of World-Model Updates: A Counterfactual Utility Protocol for Continual Adaptation",
      "source_url": "https://arxiv.org/pdf/2609.10954#page=3"
    },
    "summary": "论文提出 fork ledger：在预注册的部署决策点保存状态，运行 UPDATE 与 HOLD 两条匹配 continuation，用相同初始状态、动作噪声和 planner 采样噪声计算 Delta R。它把“误差是否变大”与“此刻更新是否有价值”分开，使任何只读取分叉前信号的触发器都能在同一组 treatment-effect 标签上比较。",
    "insight": "论文提出 fork ledger：在预注册的部署决策点保存状态，运行 UPDATE 与 HOLD 两条匹配 continuation，用相同初始状态、动作噪声和 planner 采样噪声计算 \\(\\Delta R\\)。它把“误差是否变大”与“此刻更新是否有价值”分开，使任何只读取分叉前信号的触发器都能在同一组 treatment-effect 标签上比较。\n\n最重要的 insight 是固定更新机制即使降低模型误差，也未必提高控制回报；更新价值依赖任务、漂移方向和当前能力。因果含义严格限定为：对该模拟器、该决策点和该固定更新干预的配对效果，不是关于世界动力学的一般因果发现。",
    "pipeline": {
      "input": "干净动力学上预训练的 DreamerV3 风格 RSSM、发生物理参数漂移的部署流、预注册决策点、固定更新剂量及窗口。",
      "process": "先记录冻结参考流；每个决策点创建 UPDATE/HOLD 分支，UPDATE 对最近 10,000 transitions 做 200 个梯度步，HOLD 不更新；两分支在固定扰动和 30 个匹配 episode 上用 latent-space MPC/CEM 评估；计算 Delta R，再用分叉前 prediction error、KL 或 return 等信号排序更新时机。",
      "output": "每个决策点的更新效用 ledger、置信区间、触发器 AUC 与策略回报汇总。",
      "details": "**过程**：先记录冻结参考流；每个决策点创建 UPDATE/HOLD 分支，UPDATE 对最近 10,000 transitions 做 200 个梯度步，HOLD 不更新；两分支在固定扰动和 30 个匹配 episode 上用 latent-space MPC/CEM 评估；计算 Delta R，再用分叉前 prediction error、KL 或 return 等信号排序更新时机。\n\n- **输入**：干净动力学上预训练的 DreamerV3 风格 RSSM、发生物理参数漂移的部署流、预注册决策点、固定更新剂量及窗口。\n- **过程**：先记录冻结参考流；每个决策点创建 UPDATE/HOLD 分支，UPDATE 对最近 10,000 transitions 做 200 个梯度步，HOLD 不更新；两分支在固定扰动和 30 个匹配 episode 上用 latent-space MPC/CEM 评估；计算 \\(\\Delta R\\)，再用分叉前 prediction error、KL 或 return 等信号排序更新时机。\n- **输出**：每个决策点的更新效用 ledger、置信区间、触发器 AUC 与策略回报汇总。\n\nUPDATE 与 HOLD 在同一决策点分叉，以匹配随机数运行固定剂量更新的两个后续分支；只有分叉前信号可被用作更新触发器。reference stream 始终按 HOLD 继续，因此不同 fork 的单次更新效用不等价于长期连续提交更新的收益。\n\n[原文方法](https://arxiv.org/html/2609.10954)\n\n### 方法细节与实现\n\n**评估对象。**论文并不设计一个更强的自适应世界模型，而是为“此刻是否值得更新”生成可重复使用的评估标签。参考部署流保持模型冻结，在预注册时刻复制完整状态，分别执行固定更新规则 UPDATE 和保持参数 HOLD。两支使用相同初始状态、动作噪声和规划采样随机数，以减少与更新无关的回报方差。\n\n**反事实量与触发器隔离。**标签 ΔR = R_UPDATE − R_HOLD 定义的是一次完整更新干预的价值，包括更新时间、步数、数据窗口及其引起的参数变化。任何候选触发器只能读取分叉前的误差信号，对相同标签排序和打分；不能把分叉后的 HOLD 回报当成在线特征。这样避免不同触发器各自产生部署轨迹，导致阈值比较混入状态分布变化。\n\n**实验机制的边界。**参考流为 6,000 个控制步、每 250 步一个决策点；主设置用最近 10,000 条转移执行 200 个梯度步，再以 30 个相同评估回合比较两支。评估时物理漂移固定在分叉瞬间值，因此测到的是当下世界里的更新价值；这与漂移继续加速时的前瞻价值不同。更新采用不回放旧训练数据的微调，不能据此否定所有持续学习方法。\n\n[对应方法原文](https://arxiv.org/html/2609.10954#S3)"
    },
    "experiments": "主要环境是 DeepMind Control Suite/MuJoCo 的 cartpole-swingup、walker-walk、cheetah-run，另有 legacy schedule 的 hopper-hop 负对照。每个主要任务为 5 个预训练 checkpoint × 2 个漂移方向 × 每 cell 24 次 attempted fork，共 240 次；以 checkpoint cluster bootstrap 计算区间。\n\n全 attempted forks 上，固定无 replay 更新在 CartPole、Walker、Cheetah 的平均 \\(\\Delta R\\) 分别为 -144.0（95% CI [-185.4, -116.1]）、-82.8（[-101.1, -61.7]）、-18.6（[-29.0, -6.6]）。排除更新后发散的 fork 会产生 post-treatment conditioning；该子集上 CartPole 和 Walker 仍为负，而 Cheetah 为 -3.9（[-17.5, +13.0]），不能判定。独立 stream seeds 保持该符号格局，但独立推断单位仍是任务而不是种子。\n\n论文还显示 CartPole 上按 residual 选择时机可优于 rate-matched random，但跨任务排序不稳定。实验直接支持“该固定无 replay 更新机制的价值随任务和漂移变化，以及 fork ledger 能比较触发器”；不支持“在线更新通常有害”或“该触发器可泛化到视觉世界模型”。\n\n\n核验定位：摘要的 all-attempted estimand、正文表 1 的 retained subset 与表 3 触发器比较。720 次主要 attempted forks 中保留 693 次；剔除发散属于处理后筛选。CartPole/Walker/Cheetah 的全尝试均值为 −144.0/−82.8/−18.6，而保留子集为 −113.4/−82.1/−3.9，必须标明分母和估计对象。\n\n[原文实验与表格](https://arxiv.org/html/2609.10954)\n\n**避免幸存者偏差。**全部尝试为 720 个分叉，保留集为 693；三任务的全尝试平均回报差约为 −144.0/−82.8/−18.6，保留集为 −113.4/−82.1/−3.9。删除失败更新会使结果显得更乐观，因此主结论应优先依据全尝试口径。实验是少数低维控制任务和固定更新机制，推广到视觉 WAM 尚需重新构建分叉环境。\n\n[实验与设置原文](https://arxiv.org/html/2609.10954)",
    "evidence_notes": "已核验原文方法与实验；关键比较与限制见各节",
    "code_data_status": "正文明确称 accompanying code artifact 包含 harness、分析脚本和 corrected fork ledgers，但 arXiv 元数据和本次可访问正文未给出可核验仓库链接。因此只能确认作者的开放声明，不能确认下载可用性、许可证或复现实验是否完整；模型权重未见公开。",
    "limitations": "研究依赖可恢复模拟器状态、标量回报和固定更新机制；每个 \\(\\Delta R\\) 只衡量一次更新，参考流始终从 HOLD 继续，不评估已触发更新持续提交后的复合效果。主要证据仅有三个任务族和五个 checkpoint clusters；bootstrap 可能欠覆盖，多个 signal 比较没有 multiplicity correction。预注册主端点未报告、episode ramp 未执行、阈值规则有偏离，作者也把相关结果限定为描述性。视觉世界模型还缺少统一下游 outcome 与可控配对 rollout，部署到真实机器人时也难精确复现随机分支。",
    "comments": "",
    "source_reports": [],
    "deleted": false,
    "updated_at": "2026-09-24",
    "challenges": "部署期模型误差上升不意味着马上更新一定提高控制回报。单条在线轨迹只能看到更新或不更新之一，需要可恢复状态的配对实验建立更新效用标签。",
    "motivation": "论文提出 fork ledger：在预注册的部署决策点保存状态，运行 UPDATE 与 HOLD 两条匹配 continuation，用相同初始状态、动作噪声和 planner 采样噪声计算 \\(\\Delta R\\)。它把“误差是否变大”与“此刻更新是否有价值”分开，使任何只读取分叉前信号的触发器都能在同一组 treatment-effect 标签上比较。\n\n最重要的 insight 是固定更新机制即使降低模型误差，也未必提高控制回报；更新价值依赖任务、漂移方向和当前能力。因果含义严格限定为：对该模拟器、该决策点和该固定更新干预的配对效果，不是关于世界动力学的一般因果发现。",
    "technical_approach": "**过程**：先记录冻结参考流；每个决策点创建 UPDATE/HOLD 分支，UPDATE 对最近 10,000 transitions 做 200 个梯度步，HOLD 不更新；两分支在固定扰动和 30 个匹配 episode 上用 latent-space MPC/CEM 评估；计算 Delta R，再用分叉前 prediction error、KL 或 return 等信号排序更新时机。\n\n- **输入**：干净动力学上预训练的 DreamerV3 风格 RSSM、发生物理参数漂移的部署流、预注册决策点、固定更新剂量及窗口。\n- **过程**：先记录冻结参考流；每个决策点创建 UPDATE/HOLD 分支，UPDATE 对最近 10,000 transitions 做 200 个梯度步，HOLD 不更新；两分支在固定扰动和 30 个匹配 episode 上用 latent-space MPC/CEM 评估；计算 \\(\\Delta R\\)，再用分叉前 prediction error、KL 或 return 等信号排序更新时机。\n- **输出**：每个决策点的更新效用 ledger、置信区间、触发器 AUC 与策略回报汇总。\n\nUPDATE 与 HOLD 在同一决策点分叉，以匹配随机数运行固定剂量更新的两个后续分支；只有分叉前信号可被用作更新触发器。reference stream 始终按 HOLD 继续，因此不同 fork 的单次更新效用不等价于长期连续提交更新的收益。\n\n[原文方法](https://arxiv.org/html/2609.10954)\n\n### 方法细节与实现\n\n**评估对象。**论文并不设计一个更强的自适应世界模型，而是为“此刻是否值得更新”生成可重复使用的评估标签。参考部署流保持模型冻结，在预注册时刻复制完整状态，分别执行固定更新规则 UPDATE 和保持参数 HOLD。两支使用相同初始状态、动作噪声和规划采样随机数，以减少与更新无关的回报方差。\n\n**反事实量与触发器隔离。**标签 ΔR = R_UPDATE − R_HOLD 定义的是一次完整更新干预的价值，包括更新时间、步数、数据窗口及其引起的参数变化。任何候选触发器只能读取分叉前的误差信号，对相同标签排序和打分；不能把分叉后的 HOLD 回报当成在线特征。这样避免不同触发器各自产生部署轨迹，导致阈值比较混入状态分布变化。\n\n**实验机制的边界。**参考流为 6,000 个控制步、每 250 步一个决策点；主设置用最近 10,000 条转移执行 200 个梯度步，再以 30 个相同评估回合比较两支。评估时物理漂移固定在分叉瞬间值，因此测到的是当下世界里的更新价值；这与漂移继续加速时的前瞻价值不同。更新采用不回放旧训练数据的微调，不能据此否定所有持续学习方法。\n\n[对应方法原文](https://arxiv.org/html/2609.10954#S3)",
    "discussion": "**阅读者分析**：该工作与 Causal-JEPA 所代表的“因果世界模型”关注点相邻但层级不同：它没有学习 SCM 或干预结构，而是为世界模型更新构造实验性反事实评价。对 DWM、HandsOnWorld、X-WAM、Flow WAM 等方向，它提供一种更严格的更新/适应评测思路：不要只报告 action-conditioned prediction 或视频质量，而应比较同一状态下 update/hold 对任务成功的影响。若知域后续设计因果 WAM，可把该 protocol 作为评估层，同时另行建立干预变量、识别假设和反事实泛化实验。",
    "arxiv": {
      "published": "2026-09-10",
      "revised_at": "",
      "primary_category": "cs.LG"
    },
    "source_papers": [
      "content/papers/2609.10954.md"
    ]
  },
  {
    "id": "arxiv-2609-06615",
    "title": "MemCorr-DP: Counterfactual Correspondence Conditioning for a Diffusion Policy Guided by a Reference",
    "authors": [
      "Tan Su",
      "Haoxiang Yang",
      "Ruxin Wang",
      "Binghui Xie"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本，v1",
    "arxiv_id": "2609.06615",
    "doi": "10.48550/arXiv.2609.06615",
    "links": {
      "paper": "https://arxiv.org/abs/2609.06615",
      "alphaxiv": "https://alphaxiv.org/abs/2609.06615"
    },
    "tags": [
      "3D/4D",
      "多模态感知与提示",
      "强化与模仿学习",
      "数据与评测"
    ],
    "figure": {
      "url": "content/images/2609.06615-representative.webp",
      "alt": "Figure 1",
      "label": "Figure 1",
      "paper_title": "MemCorr-DP: Counterfactual Correspondence Conditioning for a Diffusion Policy Guided by a Reference",
      "source_url": "https://arxiv.org/html/2609.06615v1#S1.F1"
    },
    "summary": "MemCorr-DP 把“选哪条示例”转化为当前场景与参考轨迹之间的显式 3D 对应条件，并用同状态、反向任务的成对训练迫使策略真正使用参考。核心价值是可干预的参考接口。",
    "insight": "MemCorr-DP 把“选哪条示例”转化为当前场景与参考轨迹之间的显式 3D 对应条件，并用同状态、反向任务的成对训练迫使策略真正使用参考。核心价值是可干预的参考接口。",
    "pipeline": {
      "input": "当前 RGB-D、对象 mask、机器人状态和已知任务的一条固定参考轨迹。",
      "process": "冻结 RoMa v2 匹配并提升为 3D 关系；第一阶段用真值关系和成对反向目标训练扩散策略，第二阶段混合真实匹配误差微调；每次预测 16 步、执行 8 步后重规划。",
      "output": "受参考轨迹条件控制的机器人动作块。",
      "details": "- **输入**：当前 RGB-D、对象 mask、机器人状态和已知任务的一条固定参考轨迹。\n- **过程**：冻结 RoMa v2 匹配并提升为 3D 关系；第一阶段用真值关系和成对反向目标训练扩散策略，第二阶段混合真实匹配误差微调；每次预测 16 步、执行 8 步后重规划。\n- **输出**：受参考轨迹条件控制的机器人动作块。"
    },
    "experiments": "正文表 2 在单个 Meta-World Door、位置与 ±15° 相机联合偏移上报告 145/150（96.67%），对比共享动作架构的视觉 Transformer 132/150（88.00%）。训练使用 80 对配置、160 条轨迹，3 个种子；视觉控制参数仅差 +0.36%，但不计冻结 RoMa v2。表 3 中错误参考使最终模型成功率降至 5/300，正确参考为 292/300，支持参考条件确实影响行为。 [正文实验与表格](https://arxiv.org/html/2609.06615v1)。",
    "evidence_notes": "2026-09-14 已核对 arXiv 元数据、正文主要实验与对照；未运行复现实验。",
    "code_data_status": "原始论文未提供可确认的公开代码、数据或模型下载入口，开放状态待核验。",
    "limitations": "只测试单个模拟 Door 的开/关，依赖对象 mask、标定 RGB-D、已知任务和固定参考；未验证跨实例、跨类别、真实机器人或在线检索。成对条件干预不等于完整 SCM 识别。",
    "comments": "",
    "source_reports": [
      "report-37b94c4145"
    ],
    "deleted": false,
    "updated_at": "2026-09-14",
    "discussion": "为具身 ICL、4D 对应和条件敏感性提供小规模可复现的实验设计，连接“示例几何”与“动作后果”。",
    "arxiv": {
      "published": "2026-09-06T14:03:20Z",
      "revised_at": "2026-09-06T14:03:20Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2609-11561",
    "title": "Memory as Plans: World-Action Modeling with Memory-Grounded Planning",
    "authors": [
      "Sizhe Zhao",
      "Haozhe Xie",
      "Weiyu Zhao",
      "Chenchu Zhang",
      "Huan Wang",
      "Chenyang Wang",
      "Qinglin Liu",
      "Shengping Zhang"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本，v1",
    "arxiv_id": "2609.11561",
    "doi": "10.48550/arXiv.2609.11561",
    "links": {
      "paper": "https://arxiv.org/abs/2609.11561",
      "project": "https://sizhezhao.github.io/projects/MaP-WAM/",
      "alphaxiv": "https://alphaxiv.org/abs/2609.11561"
    },
    "tags": [
      "World Action Model",
      "规划与控制",
      "长时记忆"
    ],
    "figure": {
      "url": "content/images/2609.11561-representative.webp",
      "alt": "Figure 2 ",
      "label": "Figure 2",
      "paper_title": "Memory as Plans: World-Action Modeling with Memory-Grounded Planning",
      "source_url": "https://arxiv.org/html/2609.11561v1#S2.F2"
    },
    "summary": "MaP-WAM把已完成片段的语言和稀疏视觉证据保存为 episodic memory，仅在规划阶段读取长历史；执行器接收压缩后的语言—视觉计划，从而避免每一步都扩展上下文。它还联合预测动作与进度，用真实观测校正计划位置。",
    "insight": "MaP-WAM把已完成片段的语言和稀疏视觉证据保存为 episodic memory，仅在规划阶段读取长历史；执行器接收压缩后的语言—视觉计划，从而避免每一步都扩展上下文。它还联合预测动作与进度，用真实观测校正计划位置。",
    "pipeline": {
      "input": "当前观测、任务语言、已完成片段的稀疏视觉与语言记录。",
      "process": "语言规划器生成下一片段目标；因果世界模型生成视觉计划；WAP 联合预测未来视觉 latent、动作块和进度；plan-observation alignment 校正进度并触发片段切换，固定计划前缀通过 KV cache 复用。",
      "output": "分段语言/视觉计划、动作块与完成进度。",
      "details": "**输入**：当前观测、任务语言、已完成片段的稀疏视觉与语言记录。\n\n**过程**：语言规划器生成下一片段目标；因果世界模型生成视觉计划；WAP 联合预测未来视觉 latent、动作块和进度；plan-observation alignment 校正进度并触发片段切换，固定计划前缀通过 KV cache 复用。\n\n**输出**：分段语言/视觉计划、动作块与完成进度。"
    },
    "experiments": "RMBench 九项任务平均成功率 83.3%，对比 LingBot-VA 77.1%、Mem-0 42.0%；真实机器人任务平均 78.0%。分任务结果显示个别 M(1) 任务不占优，但多观察记忆任务提升明显。结果支持稀疏视觉记忆和计划分解，但项目页未给所有方法相同推理预算下的完整吞吐、显存与规划器成本对比。 [正文实验与表格](https://arxiv.org/html/2609.11561v1)。",
    "evidence_notes": "2026-09-14 已核对 arXiv 元数据、正文主要实验与对照；未运行复现实验。",
    "code_data_status": "官方项目页可访问；本次页面未给出可确认的训练/推理仓库或权重下载入口，代码、数据和模型开放范围待核验。",
    "limitations": "规划错误可能在整个片段持续影响执行；视觉计划质量受生成模型限制。方法假设已完成片段可以可靠切分并压缩，开放世界中的模糊阶段边界和错误记忆尚未充分评测。",
    "comments": "",
    "source_reports": [
      "report-37b94c4145"
    ],
    "deleted": false,
    "updated_at": "2026-09-14",
    "discussion": "该工作把长期记忆显式转成 WAM 的语言—视觉计划，适合与具身 ICL 的检索示例和流式执行做统一研究。",
    "arxiv": {
      "published": "2026-09-10T13:52:51Z",
      "revised_at": "2026-09-10T13:52:51Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2608-27407",
    "title": "MILO: Reconstructing Humans and Objects in Interaction using Large Reconstruction Models",
    "authors": [
      "Agniv Chatterjee",
      "Georgios Pavlakos"
    ],
    "year": 2026,
    "publication": "2026，ECCV 2026（arXiv 首发 2026-08-27）",
    "arxiv_id": "2608.27407",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.27407",
      "project": "https://ac5113.github.io/MILO",
      "alphaxiv": "https://alphaxiv.org/abs/2608.27407"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "流式与自回归",
      "第一视角与人类视频",
      "长时记忆"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.27407v1/teaser.png",
      "alt": "MILO: Reconstructing Humans and Objects in Interaction using Large Reconstruction Models 代表图",
      "label": "Figure 1 : We present MILO , an approach for reconstructing 3D human-object interactions from a single image. Given an input photo (left), MILO uses a Large Reconstruction Model to predict a combined human-object mesh (center). This mesh is interpreted (right) by identifying human and object parts, fitting a SMPL-H body to the human part, and optionally an object template to the object part. The examples illustrate a… 来源：论文图",
      "paper_title": "MILO: Reconstructing Humans and Objects in Interaction using Large Reconstruction Models",
      "source_url": "https://arxiv.org/html/2608.27407v1/teaser.png"
    },
    "summary": "单图 3D HOI 重建长期依赖把参数化人体模型和物体模板拟合到 2D 的重投影与接触约束。本文反其道而行： 用 LRM 输出的网格作为几何脚手架 。LRM 网格天然保留人-物相对排布与邻近线索，于是把重建重构为\"解读 LRM 网格\"——分割人/物、做模板对齐，再经人体优化（root 拟合、姿态拟合）恢复参数化交互。Insight 在于：与其在 2D 上对抗深度歧义与遮挡，不如借用前馈重建模型已经隐式解出的 3D 结构，再在其上做语义解读。",
    "insight": "单图 3D HOI 重建长期依赖把参数化人体模型和物体模板拟合到 2D 的重投影与接触约束。本文反其道而行：**用 LRM 输出的网格作为几何脚手架**。LRM 网格天然保留人-物相对排布与邻近线索，于是把重建重构为\"解读 LRM 网格\"——分割人/物、做模板对齐，再经人体优化（root 拟合、姿态拟合）恢复参数化交互。Insight 在于：与其在 2D 上对抗深度歧义与遮挡，不如借用前馈重建模型已经隐式解出的 3D 结构，再在其上做语义解读。",
    "pipeline": {
      "input": "单张 RGB 图像。",
      "process": "LRM 前馈重建得到场景网格（脚手架）→ 3D 关键点估计 → 人体模型拟合（root / pose）→ 点云分割出人/物 → 物体模板对齐（template alignment）→ 人-物接触估计。",
      "output": "参数化人体网格 + 对齐的物体网格 + 接触标注，即在单图上的 3D HOI 重建。",
      "details": "**输入**：单张 RGB 图像。\n**过程**：LRM 前馈重建得到场景网格（脚手架）→ 3D 关键点估计 → 人体模型拟合（root / pose）→ 点云分割出人/物 → 物体模板对齐（template alignment）→ 人-物接触估计。\n**输出**：参数化人体网格 + 对齐的物体网格 + 接触标注，即在单图上的 3D HOI 重建。"
    },
    "experiments": "在 3D HOI 重建的公开基准上比较 SOTA（含 Open3DHOI 等 baseline），并做接触估计、网格几何影响、与单独重建人/物的对比、以及消融。作者披露的主要局限：性能受底层 LRM 质量与点云分割精度制约；小物体的 LRM 输出有待精化。消融表明网格几何质量与分割精度是主要瓶颈，这与其方法依赖脚手架一致。证据等级：以上结论由论文实验直接支持；具体数值本轮未逐项复核。",
    "evidence_notes": "",
    "code_data_status": "实验基于公开数据集；本窗口未检索到官方仓库或微调权重发布，复现依赖 LRM 开源生态（如项目页所述）。",
    "limitations": "- 受 LRM 质量上界约束；小物体重建是明确短板；\n- 点云分割精度直接影响结果（作者列为待改进点）；\n- 未来方向：LRM 输出精化、更强的 instance-level 推理、更优接触估计。\n\n### 与知域的关系\n与知域前馈重建主线（VGGT、DynamicVGGT、SAM 3D 系）直接衔接，是\"LRM 脚手架 → 语义解读\"范式在 3D HOI 的首批代表，接续 DynVGGT 的交互/接触感知方向；也与 EgoGrasp、OpenHOI 的 HOI 语义互补。",
    "comments": "",
    "source_reports": [
      "report-a141624b1e"
    ],
    "deleted": false,
    "updated_at": "2026-08-31",
    "arxiv": {
      "published": "2026-08-27T17:35:46Z",
      "revised_at": "2026-08-27T17:35:46Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2609-04958",
    "title": "MINT: A Unified Model for World-Space Camera and Hand Motion Estimation from Scalable Egocentric Pipeline Supervision",
    "authors": [
      "Zijie Zhu",
      "Weiren Cai",
      "Yizhou Wang",
      "Zhenjie Yang",
      "Yide Liu",
      "Jiahao Chen",
      "Guanqi He"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本，v2",
    "arxiv_id": "2609.04958",
    "doi": "10.48550/arXiv.2609.04958",
    "links": {
      "paper": "https://arxiv.org/abs/2609.04958",
      "alphaxiv": "https://alphaxiv.org/abs/2609.04958"
    },
    "tags": [
      "HOI",
      "动作表征",
      "数据与评测",
      "第一视角与人类视频"
    ],
    "figure": {
      "url": "content/images/2609.04958-representative.webp",
      "alt": "\\fnum@figure",
      "label": "fnum@figure",
      "paper_title": "MINT: A Unified Model for World-Space Camera and Hand Motion Estimation from Scalable Egocentric Pipeline Supervision",
      "source_url": "https://arxiv.org/html/2609.04958v2#S2.F2"
    },
    "summary": "从 egocentric 视频恢复世界坐标下的相机与手部运动是活动理解、机器人学习与 AR 的关键能力。现有系统分阶段处理（相机运动、深度估计、手部重建、轨迹精化），计算开销大且无法联合建模。MINT 从单一共享时空视频表示，联合预测相机轨迹、视场角（FoV）、相机帧手部状态与逐帧手部可观测性，再通过显式坐标变换得到世界空间手部运动。训练数据稀缺的解法是开源标注管线 EGOPIPELINE：把大量公开 egocentric 视频转换为结构化相机与手部轨迹监督；MINT 先在大规模伪标签上预训练，再在小规模高质量标注上微调。",
    "insight": "从 egocentric 视频恢复世界坐标下的相机与手部运动是活动理解、机器人学习与 AR 的关键能力。现有系统分阶段处理（相机运动、深度估计、手部重建、轨迹精化），计算开销大且无法联合建模。MINT 从单一共享时空视频表示，联合预测相机轨迹、视场角（FoV）、相机帧手部状态与逐帧手部可观测性，再通过显式坐标变换得到世界空间手部运动。训练数据稀缺的解法是开源标注管线 EGOPIPELINE：把大量公开 egocentric 视频转换为结构化相机与手部轨迹监督；MINT 先在大规模伪标签上预训练，再在小规模高质量标注上微调。",
    "pipeline": {
      "input": "egocentric RGB 视频。",
      "process": "共享时空表示 → 联合预测相机轨迹/FoV/手部状态/可观测性 → 显式坐标变换 → 世界空间手部轨迹；EGOPIPELINE 生成伪标签用于预训练，小规模高质量标注微调。",
      "output": "世界空间手部运动轨迹 + 相机轨迹。",
      "details": "**输入**：egocentric RGB 视频。\n**过程**：共享时空表示 → 联合预测相机轨迹/FoV/手部状态/可观测性 → 显式坐标变换 → 世界空间手部轨迹；EGOPIPELINE 生成伪标签用于预训练，小规模高质量标注微调。\n**输出**：世界空间手部运动轨迹 + 相机轨迹。"
    },
    "experiments": "正文表 1 区分 MINT 与 MINT+UKF：HOT3D 上基础模型 PA-MPJPE-p/EPE-p 为 13.656 mm/55.117 px，UKF 后为 13.646 mm/55.058 px；jitter 从 12.057 降至 2.373 mm/frame²，FAcc 均为 0.945。表 2 的 HOT3D 平均 RPE-T 为 4.694 mm、RPE-R 为 0.284°；摘要写作 4.690 mm，存在细小文本差异，本卡采用表格值。零样本手部结果与相机指标共同支持监督管线摊销的价值，但相机平移、旋转、尺度和手部误差不可合并成一个“全面 SOTA”判断。 [正文实验与表格](https://arxiv.org/html/2609.04958v2)。",
    "evidence_notes": "2026-09-14 已核对 arXiv 元数据、正文主要实验与对照；未运行复现实验。",
    "code_data_status": "模型、训练/推理代码、标注管线与 1,021 小时数据集将发布，是本周 egocentric 方向数据基础设施的重要资产。",
    "limitations": "UKF 改善时间平滑但引入后处理；世界坐标输出依赖相机和尺度估计，伪标签中的系统误差可能传递到下游世界模型。",
    "comments": "",
    "source_reports": [
      "report-37b94c4145"
    ],
    "deleted": false,
    "updated_at": "2026-09-14",
    "discussion": "命中 egocentric vision + HOI + 世界空间轨迹，与 Coherent4D（#12）共同提供「世界空间轨迹」型监督资产。对知域 egocentric world model 方向是数据与基线双重补充。",
    "arxiv": {
      "published": "2026-09-04T10:05:11Z",
      "revised_at": "2026-09-08T08:22:56Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2605-30263",
    "title": "minWM: A Full-Stack Open-Source Framework for Real-Time Interactive Video World Models",
    "authors": [
      "Min Zhao",
      "Hongzhou Zhu",
      "Bokai Yan",
      "Zihan Zhou",
      "Yimin Chen",
      "Wenqiang Sun",
      "Kaiwen Zheng",
      "Guande He",
      "Xiao Yang",
      "Chongxuan Li",
      "Fan Bao",
      "Jun Zhu"
    ],
    "year": 2026,
    "publication": "2026，arXiv preprint。arXiv:2605.30263。Min Zhao 为项目负责人；Hongzhou Zhu、Bokai Yan、Zihan Zhou、Yimin Chen 共同一作；Fan Bao / Jun Zhu 为顾问。生数 / 清华 / 人大 / HKUST / UT Austin。尚无 DOI / 正式出版页。",
    "arxiv_id": "2605.30263",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2605.30263",
      "code": "https://github.com/shengshu-ai/minWM",
      "alphaxiv": "https://alphaxiv.org/abs/2605.30263"
    },
    "tags": [
      "3D/4D",
      "Agent与可执行世界",
      "因果与反事实",
      "流式与自回归",
      "视频生成"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2605.30263v1/paper_pipeline.png",
      "alt": "minWM Fig. 1: full-stack conversion from bidirectional T2V to camera-controllable few-step AR world models",
      "label": "minWM，Fig. 1，从 T2V/TI2V 基础模型到相机可控 few-step AR 世界模型的全栈流程。来源：Fig. 1 原图 PNG",
      "paper_title": "minWM: A Full-Stack Open-Source Framework for Real-Time Interactive Video World Models",
      "source_url": "https://arxiv.org/html/2605.30263v1/paper_pipeline.png"
    },
    "summary": "核心 Insight： 先把双向基础模型微调成相机可控（PRoPE 把相对投影变换写进注意力），再把 CF/CF++ 的三阶段全部换成带相机条件的版本。 改变的是控制接口与可复现性，不是新的生成损失。与本知识库课题 直接相关 ：这是开源实时视频世界模型配方，动作目前主要是相机轨迹，不是关节/操作 WAM，也不是反事实。",
    "insight": "核心 Insight：**先把双向基础模型微调成相机可控（PRoPE 把相对投影变换写进注意力），再把 CF/CF++ 的三阶段全部换成带相机条件的版本。** 改变的是控制接口与可复现性，不是新的生成损失。与本知识库课题 **直接相关**：这是开源实时视频世界模型配方，动作目前主要是相机轨迹，不是关节/操作 WAM，也不是反事实。",
    "pipeline": {
      "input": "文本，以及每帧相机内参 K i 与 world-to-camera T i^cw；可选图像（TI2V）。输出设定 480×832、77 帧，AR chunk = 4 latent 帧，蒸馏 4 步。",
      "process": "PRoPE 构造 4× 4 提升投影矩阵，按 GTA 形式注入自注意力，使 token 对依赖相对位姿。然后 Stage 1 TF AR、Stage 2 因果 ODE 或因果 CD、Stage 3 不对称 DMD；student / s real / s fake 自 rollout 都吃同一相机条件。HY1.5：batch 32、lr 1× 10^-5，双向 8K → AR 4K → Stage2 1.5K → DMD 500（8K 权重作 Stage 3 score，Stage 1 从 5K 初始化）。Wan2.1：lr 2× 10^-6，双向 5K → 4K → 2K → 200。",
      "output": "相机可控的 few-step AR 视频。A800、不含 VAE 的首帧延迟：HY1.5 few-step AR 3.446 s （相对多步双向 771 s，约 224×）；Wan2.1 few-step AR 1.137 s （相对 269 s，约 237×）。",
      "details": "- **输入：** 文本，以及每帧相机内参 \\(K_i\\) 与 world-to-camera \\(T_i^{cw}\\)；可选图像（TI2V）。输出设定 480×832、77 帧，AR chunk = 4 latent 帧，蒸馏 4 步。\n- **过程：** PRoPE 构造 \\(4\\times 4\\) 提升投影矩阵，按 GTA 形式注入自注意力，使 token 对依赖相对位姿。然后 Stage 1 TF AR、Stage 2 因果 ODE 或因果 CD、Stage 3 不对称 DMD；student / \\(s_{\\text{real}}\\) / \\(s_{\\text{fake}}\\) 自 rollout 都吃同一相机条件。HY1.5：batch 32、lr \\(1\\times 10^{-5}\\)，双向 8K → AR 4K → Stage2 1.5K → DMD 500（8K 权重作 Stage 3 score，Stage 1 从 5K 初始化）。Wan2.1：lr \\(2\\times 10^{-6}\\)，双向 5K → 4K → 2K → 200。\n- **输出：** 相机可控的 few-step AR 视频。A800、不含 VAE 的首帧延迟：HY1.5 few-step AR **3.446 s**（相对多步双向 771 s，约 \\(224\\times\\)）；Wan2.1 few-step AR **1.137 s**（相对 269 s，约 \\(237\\times\\)）。\n\n与最近 baseline 的实质差异：相对 Causal Forcing++ 论文里的定性相机 demo，这里给出两条骨干的可运行脚本、分阶段 checkpoint 和数据消融；相对 HY-WorldPlay，强调可迁移而非从零宣称新 SOTA 质量。"
    },
    "experiments": "**作者主张：** 全栈可复现；few-step AR 大幅降低首帧延迟且保住相机可控。\n\n实验实际支持：\n\n- **延迟表：** 见上。多步 AR 已有约 9.4–9.5× 加速，few-step 再降一个数量级。这是架构（先出首帧）+ 蒸馏的共同结果，不是单点算法奇迹。\n- **定性：** Fig. 2 显示蒸馏后仍能切换相机动作。\n- **数据消融：** 当前设定下 SpatialVid 的感知估计位姿 **未能** 学到可靠相机控制（过滤后仍差）。DL3DV 重建再按指定轨迹渲染，或 OpenVid 图像 + WorldPlay 生成轨迹，可以学会。作者把前者失败解释为位姿噪声假说，并写明 **不能** 据此断言 SpatialVid 不适合该任务。\n- **步数（HY1.5）：** 1–2K 步基本不可控；约 5K 开始有响应但不稳；8K 较强。\n- **Batch（Wan2.1）：** <4 经常学不会；8 改善但不稳；16 可跑通且可控性高。主实验 batch 32。\n\n**无的实验：** 没有 VBench / VisionReward / 轨迹误差表；没有与 Genie 3、WorldPlay、Matrix-Game 的公平质量对比；没有非相机动作。禁止把延迟加速写成质量 SOTA。",
    "evidence_notes": "",
    "code_data_status": "- **代码：** [shengshu-ai/minWM](https://github.com/shengshu-ai/minWM)，README 称 full-stack tutorial 而非单一模型；含脚本、checkpoint、文档、推理。GitHub 记技术报告于 2026-05-29 发布。\n- **开源数据策略：** OpenVid 等图像 + WorldPlay 生成带指定轨迹的视频。论文内部还用过 DL3DV 渲染。\n- **许可 / 权重完整性：** 以仓库为准，本次未逐文件核验所有 stage 的权重是否齐全。",
    "limitations": "- 没有标准视频质量榜，无法与 CF++ T2V 数字横比世界模型质量。\n- SpatialVid 失败只是当前设定的负结果。\n- 控制信号目前主要是相机；作者把 pose 等列为未来。\n- 延迟不含 VAE；HY1.5 的 3.4 s 首帧对“实时游戏”仍偏慢。\n- chunk=4 latent、4-step，未展示 CF++ 的 frame-wise 2-step 世界模型。\n- 依赖 WorldPlay 生成轨迹时，教师模型偏差会进入“GT”。",
    "comments": "",
    "source_reports": [
      "report-c7ced2c92d"
    ],
    "deleted": false,
    "updated_at": "2026-08-31",
    "challenges": "作者认为缺的不是又一篇蒸馏论文，而是 **可复现的全栈**：数据、可控微调、AR 训练、少步蒸馏、流式推理散落在不同仓库。交互世界模型还要求因果 rollout、相机（或其它动作）可控、延迟够低。\n\n本文针对的工程缺口：\n\n- 把 Wan2.1-T2V-1.3B（交叉注意力条件）和 HY1.5-TI2V-8B（MMDiT）两条异构骨干接到同一配方。\n- 也可把已有世界模型（HY-WorldPlay）迁到新数据/新延迟。\n- 需要可操作的训练经验：轨迹质量、可控性步数、最小 batch。\n\n它 **没有** 提出新的蒸馏理论，明确复用 Causal Forcing / Causal Forcing++。",
    "motivation": "核心 Insight：**先把双向基础模型微调成相机可控（PRoPE 把相对投影变换写进注意力），再把 CF/CF++ 的三阶段全部换成带相机条件的版本。** 改变的是控制接口与可复现性，不是新的生成损失。与本知识库课题 **直接相关**：这是开源实时视频世界模型配方，动作目前主要是相机轨迹，不是关节/操作 WAM，也不是反事实。",
    "technical_approach": "- **输入：** 文本，以及每帧相机内参 \\(K_i\\) 与 world-to-camera \\(T_i^{cw}\\)；可选图像（TI2V）。输出设定 480×832、77 帧，AR chunk = 4 latent 帧，蒸馏 4 步。\n- **过程：** PRoPE 构造 \\(4\\times 4\\) 提升投影矩阵，按 GTA 形式注入自注意力，使 token 对依赖相对位姿。然后 Stage 1 TF AR、Stage 2 因果 ODE 或因果 CD、Stage 3 不对称 DMD；student / \\(s_{\\text{real}}\\) / \\(s_{\\text{fake}}\\) 自 rollout 都吃同一相机条件。HY1.5：batch 32、lr \\(1\\times 10^{-5}\\)，双向 8K → AR 4K → Stage2 1.5K → DMD 500（8K 权重作 Stage 3 score，Stage 1 从 5K 初始化）。Wan2.1：lr \\(2\\times 10^{-6}\\)，双向 5K → 4K → 2K → 200。\n- **输出：** 相机可控的 few-step AR 视频。A800、不含 VAE 的首帧延迟：HY1.5 few-step AR **3.446 s**（相对多步双向 771 s，约 \\(224\\times\\)）；Wan2.1 few-step AR **1.137 s**（相对 269 s，约 \\(237\\times\\)）。\n\n与最近 baseline 的实质差异：相对 Causal Forcing++ 论文里的定性相机 demo，这里给出两条骨干的可运行脚本、分阶段 checkpoint 和数据消融；相对 HY-WorldPlay，强调可迁移而非从零宣称新 SOTA 质量。",
    "discussion": "minWM 是 Causal Forcing 谱系的工程收口：异构骨干、分阶段权重、以及“估计位姿不够、GT 或生成 GT 才够”的训练经验。它证明配方可以接到世界模型控制，而不是证明学到了物理因果。适用边界是相机轨迹控制的实时视频世界模型原型。失败案例被作者写进消融：SpatialVid、过小 batch、过少微调步。阅读判断：若课题要复现 Genie 3 风格的开源相机世界模型，应优先跟这个仓库；若课题要操作 WAM 或反事实，它只提供流式生成后端，不提供动作语义。",
    "arxiv": {
      "published": "2026-05-28T17:27:03Z",
      "revised_at": "2026-05-28T17:27:03Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2609-17524",
    "title": "Modality-Autoregressive World-Action Models",
    "authors": [
      "Adam Hung",
      "Bardienus P. Duisterhof",
      "Deva Ramanan",
      "Jeffrey Ichnowski"
    ],
    "year": 2026,
    "publication": "2026，arXiv v1，2026-09-15 提交",
    "arxiv_id": "2609.17524",
    "doi": "10.48550/arXiv.2609.17524",
    "links": {
      "paper": "https://arxiv.org/abs/2609.17524",
      "project": "https://adamhung60.github.io/ModAR/",
      "alphaxiv": "https://alphaxiv.org/abs/2609.17524"
    },
    "tags": [
      "3D/4D",
      "World Action Model",
      "第一视角与人类视频",
      "自监督与预测表征"
    ],
    "figure": {
      "url": "content/images/2609.17524-representative.webp",
      "alt": "ModAR Fig. 1",
      "label": "ModAR，Fig. 1，按模态顺序预测未来观测后再预测动作。arXiv HTML 无 PNG 直链，图下载自论文源文件 figures/teaser.pdf 。来源：Fig. 1 本地 WebP",
      "paper_title": "Modality-Autoregressive World-Action Models",
      "source_url": ""
    },
    "summary": "ModAR直接挑战“WAM 应该先生成未来 RGB”的默认设计。模型按顺序预测 point tracks、DINO feature、depth 等未来模态，后面的模态条件在前面已经生成的结构信息上，最后才预测动作。作者的实验结论是：tracks、DINO 和 depth 在其设定中均有贡献，但加入未来 RGB 没有稳定额外收益。",
    "insight": "ModAR直接挑战“WAM 应该先生成未来 RGB”的默认设计。模型按顺序预测 point tracks、DINO feature、depth 等未来模态，后面的模态条件在前面已经生成的结构信息上，最后才预测动作。作者的实验结论是：tracks、DINO 和 depth 在其设定中均有贡献，但加入未来 RGB 没有稳定额外收益。",
    "pipeline": {
      "input": "视觉观测、任务信息及 action-labeled / actionless demonstrations。",
      "process": "以 modality-autoregressive diffusion/denoising 顺序生成结构化未来模态，例如 point tracks → DINO feature → depth，再基于这些预测状态生成动作；不同模态可以使用不同监督数据。",
      "output": "多个未来世界模态和机器人动作。",
      "details": "**输入**：视觉观测、任务信息及 action-labeled / actionless demonstrations。\n\n**过程**：以 modality-autoregressive diffusion/denoising 顺序生成结构化未来模态，例如 point tracks → DINO feature → depth，再基于这些预测状态生成动作；不同模态可以使用不同监督数据。\n\n**输出**：多个未来世界模态和机器人动作。"
    },
    "experiments": "六个 RoboTwin 任务分别研究 50、250、1250 条总演示，其中基础 robot action-labeled 数据保持为 50 条，其余可加入 actionless 数据。在 250 条数据规模下，ModAR平均成功率 75%，Flex-\\(\\pi\\) 为 72%。不过作者明确把该结果定义为系统级比较：ModAR约 30.1M 参数，而 Flex-\\(\\pi\\) 约 6B，并存在约 20× 训练 FLOPs 差异。\n\n完整模态版本平均为 75%；去除 context noise 后 63%，反转模态顺序约 65%，移除 tracks 约 61%，移除 DINO feature 约 65%，移除 depth 约 70%，去掉 RGB 则没有下降。完整推理约 147.9 ms，即约 6.76 Hz，测试硬件为 RTX 5090。\n\n三个真实双臂任务上，100 robot demos 的平均结果约 70%；加入 200 个 in-domain human demos 后为 81.1%，再加入约 1000 个 EgoDex OOD human demos 后为 83.3%。",
    "evidence_notes": "全文已核验",
    "code_data_status": "官方项目页存在，但代码当前标记为 “coming soon”；本期不将其记为已开源。",
    "limitations": "论文明确指出任务数量有限、任务标签仍是离散类别、模态顺序需要更系统探索，且 sequential modality generation 带来延迟；当前数据规模也不足以回答互联网级人类视频扩展性。",
    "comments": "",
    "source_reports": [
      "report-1b1ffacf7d"
    ],
    "deleted": false,
    "updated_at": "2026-09-16",
    "challenges": "现有 WAM 常默认先生成未来 RGB，但高成本像素预测未必保留最有利于控制的运动、几何和语义信息，也难利用缺少完整模态标注的异构数据。",
    "motivation": "ModAR直接挑战“WAM 应该先生成未来 RGB”的默认设计。模型按顺序预测 point tracks、DINO feature、depth 等未来模态，后面的模态条件在前面已经生成的结构信息上，最后才预测动作。作者的实验结论是：tracks、DINO 和 depth 在其设定中均有贡献，但加入未来 RGB 没有稳定额外收益。",
    "technical_approach": "**输入**：视觉观测、任务信息及 action-labeled / actionless demonstrations。\n\n**过程**：以 modality-autoregressive diffusion/denoising 顺序生成结构化未来模态，例如 point tracks → DINO feature → depth，再基于这些预测状态生成动作；不同模态可以使用不同监督数据。\n\n**输出**：多个未来世界模态和机器人动作。",
    "discussion": "这是对 WAM“世界状态应该是什么”的直接实验。对计划研究 3D/4D WAM 的路线而言，它意味着必须把 tracks/depth/semantic feature 作为强 baseline，而不能只和 RGB-video WAM 比较。",
    "arxiv": {
      "published": "2026-09-15T17:56:24Z",
      "revised_at": "2026-09-15T17:56:24Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2608-30237",
    "title": "Motus2: A Self-Evolving General World Model for Dexterous Manipulation",
    "authors": [
      "Hongzhe Bi",
      "Zihao Zhou",
      "Yihang Tang",
      "Jingrui Pang",
      "Shuhe Huang",
      "Haitian Liu",
      "Runqing Wang",
      "Shuai Huang",
      "Yichen Wang",
      "Yiming Cheng",
      "Ruowen Zhao",
      "Zhenghua Li",
      "Hengkai Tan",
      "Xiaolong Liu",
      "Jinhui Wan",
      "Jiabao Liu",
      "Min Zhao",
      "Fan Bao",
      "Jun Zhu"
    ],
    "year": 2026,
    "publication": "2026，arXiv",
    "arxiv_id": "2608.30237",
    "doi": "10.48550/arXiv.2608.30237",
    "links": {
      "paper": "https://arxiv.org/abs/2608.30237",
      "project": "https://motus-robotics.github.io/motus2/",
      "alphaxiv": "https://alphaxiv.org/abs/2608.30237"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "机器人学习",
      "流式与自回归",
      "物理建模与仿真",
      "第一视角与人类视频",
      "跨本体迁移"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.30237v1/motus2_overview.png",
      "alt": "Motus2 策略—模拟器—价值模型统一框架",
      "label": "策略—模拟器—价值模型统一框架；来源：论文原图",
      "paper_title": "Motus2: A Self-Evolving General World Model for Dexterous Manipulation",
      "source_url": "https://arxiv.org/html/2608.30237v1/motus2_overview.png"
    },
    "summary": "Motus2 将单一共享权重模型暴露为三个控制接口：",
    "insight": "Motus2 将单一共享权重模型暴露为三个控制接口：\n\n1. policy：提出动作候选；\n2. simulator：预测动作后果；\n3. evaluator：评价预测结果。\n\n三者形成闭环，用于策略改进。论文还强调失败和次优交互对动力学建模与价值学习的作用，并从单目第一视角视频扩展到同步双目视频和机器人轨迹。",
    "pipeline": {
      "input": "人类第一视角视频、双目第一视角视频、机器人轨迹、专家示范、失败交互。",
      "process": "统一模型分别承担动作提议、视觉后果预测和价值评估；通过候选动作—模拟—评估闭环进行决策和学习。",
      "output": "动作块、视觉未来、价值评估和策略更新信号。",
      "details": "**输入**：人类第一视角视频、双目第一视角视频、机器人轨迹、专家示范、失败交互。\n\n**过程**：统一模型分别承担动作提议、视觉后果预测和价值评估；通过候选动作—模拟—评估闭环进行决策和学习。\n\n**输出**：动作块、视觉未来、价值评估和策略更新信号。"
    },
    "experiments": "摘要强调模型规模、数据规模和失败数据利用，但没有在摘要中给出足够的定量结果。需要阅读全文核验：\n\n- 三个接口是否完全共享权重；\n- 失败交互如何标注和使用；\n- 与 Motus、WAM、VLA 的比较；\n- 双目视频对性能的独立贡献；\n- 自我改进是否来自模型更新、上下文记忆或搜索策略。",
    "evidence_notes": "",
    "code_data_status": "arXiv comments 未提供明确开放链接。",
    "limitations": "- policy、simulator 和 evaluator 共享权重可能造成目标冲突。\n- 预测视觉后果不代表价值评估可靠。\n- 失败数据的分布可能与真实部署失败分布不同。\n- \"self-evolving\"需要区分持续训练、在线适应和测试时搜索。\n\n### 与知域的关系\n\nMotus2 是知域已收录 Motus 的直接后续，值得作为\"统一 WAM—世界模型—价值模型\"路线的重点更新对象。",
    "comments": "",
    "source_reports": [
      "report-0d81d19c6c"
    ],
    "deleted": false,
    "updated_at": "2026-09-08",
    "arxiv": {
      "published": "2026-08-31T04:44:33Z",
      "revised_at": "2026-08-31T04:44:33Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2512-13030",
    "title": "Motus: A Unified Latent Action World Model",
    "authors": [
      "Hongzhe Bi",
      "Hengkai Tan",
      "Shenghao Xie",
      "Zeyuan Wang",
      "Shuhe Huang",
      "Haitian Liu",
      "Ruowen Zhao",
      "Yao Feng",
      "Chendong Xiang",
      "Yinze Rong",
      "Hongyan Zhao",
      "Hanyu Liu",
      "Zhizhong Su",
      "Lei Ma",
      "Hang Su",
      "Jun Zhu"
    ],
    "year": 2026,
    "publication": "2026，CVPR 2026（arXiv 初稿 2025）",
    "arxiv_id": "2512.13030",
    "doi": "",
    "links": {
      "publication": "https://openaccess.thecvf.com/content/CVPR2026/html/Bi_Motus_A_Unified_Latent_Action_World_Model_CVPR_2026_paper.html",
      "paper": "https://arxiv.org/abs/2512.13030",
      "project": "https://motus-robotics.github.io/motus",
      "model": "https://huggingface.co/motus-robotics/Motus",
      "alphaxiv": "https://alphaxiv.org/abs/2512.13030"
    },
    "tags": [
      "VLA",
      "世界模型",
      "动作表征",
      "机器人学习",
      "跨本体迁移"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2512.13030v2/x1.png",
      "alt": "Motus Fig. 1",
      "label": "Motus，Fig. 1，三专家架构与统一生成模式。来源：Fig. 1 原图",
      "paper_title": "Motus: A Unified Latent Action World Model",
      "source_url": "https://arxiv.org/html/2512.13030v2/x1.png"
    },
    "summary": "作者把光流视为像素级“delta action”：它不要求关节空间一致，可从人类、模拟和多机器人视频自动提取。核心 Insight 是同时建立模型接口（三专家 MoT）与数据接口（低维光流 latent），让同一模型切换 VLA、WM、IDM、视频生成和联合预测。与本专题直接相关，但光流 latent 仍需目标本体动作监督才能成为可执行控制。",
    "insight": "作者把光流视为像素级“delta action”：它不要求关节空间一致，可从人类、模拟和多机器人视频自动提取。核心 Insight 是同时建立模型接口（三专家 MoT）与数据接口（低维光流 latent），让同一模型切换 VLA、WM、IDM、视频生成和联合预测。与本专题直接相关，但光流 latent 仍需目标本体动作监督才能成为可执行控制。",
    "pipeline": {
      "input": "当前观测、语言、可选本体状态，以及按模式提供的未来动作、视频或 DPFlow 光流。",
      "process": "Wan2.2-5B 视频专家、Qwen3-VL 理解专家和 641.5M action expert 通过联合注意力交互；UniDiffuser 式双时间步控制不同条件/生成模式。DC-AE 把 RGB 光流压成 4×512 特征，再映射为 14 维 latent action；90% 无标签流重建与 10% 有动作对齐混训。三阶段数据金字塔依次适配视频模型、训练 latent action 与三专家、最后做目标机器人动作 SFT。",
      "output": "可执行动作块、未来视频、逆动力学动作，或视频—动作联合序列。",
      "details": "- **输入：** 当前观测、语言、可选本体状态，以及按模式提供的未来动作、视频或 DPFlow 光流。\n- **过程：** Wan2.2-5B 视频专家、Qwen3-VL 理解专家和 641.5M action expert 通过联合注意力交互；UniDiffuser 式双时间步控制不同条件/生成模式。DC-AE 把 RGB 光流压成 4×512 特征，再映射为 14 维 latent action；90% 无标签流重建与 10% 有动作对齐混训。三阶段数据金字塔依次适配视频模型、训练 latent action 与三专家、最后做目标机器人动作 SFT。\n- **输出：** 可执行动作块、未来视频、逆动力学动作，或视频—动作联合序列。\n\n相对只做单一 VLA/WAM 的 baseline，Motus 的实质差异是同一 checkpoint 的多条件生成，以及用光流先在 action-free 视频上预训练 action expert；动作 48 步/30 Hz、视频 8 帧/5 Hz，以降低模态失衡。"
    },
    "experiments": "RoboTwin 2.0 使用 50 任务，Clean 每任务 50 条、Randomized 每任务 500 条训练轨迹，每任务 100 次执行。Motus 为 88.66% / 87.02%，X-VLA 为 72.80% / 72.84%，π0.5 为 42.98% / 43.84%；摘要中的“+15%/+45%”接近百分点差，不是严格相对提升率。无预训练为 77.56% / 77.00%，仅 Stage 1 为 82.26% / 81.86%，支持完整预训练有效；但 Place Dual Shoes、Scan Object 等单任务不总领先。\n\n真实 AC-One 和 Agilex-Aloha-2 每任务 100 条轨迹，采用 partial success：Motus 平均 63.22 与 59.30，π0.5 为 14.79 与 48.60；个别任务 Motus 仍低于基线。LIBERO-Long 为 97.6，与 X-VLA 持平。模型约 8B、推理 10 个 flow-matching steps；未报告训练 GPU、时长或 FLOPs。组件未逐项消融，不能把平均增益单独归因于光流。",
    "evidence_notes": "",
    "code_data_status": "Stage-2 权重已公开；未核验到官方代码仓库或整理后的六层混合数据。训练依赖 EgoDex、RoboTwin、AgiBot World、RoboMIND、AnyPos 等外部资源。",
    "limitations": "- 8B 模型训练与部署成本高，算力披露不足。\n- 光流受遮挡、低纹理和相机运动影响，缺少专项鲁棒性实验。\n- 14 维 latent action 未证明对更多形态最优。\n- 关键架构与数据组件缺少正交消融。\n- partial success 不等同完整任务成功，且部分任务出现负迁移。",
    "comments": "",
    "source_reports": [
      "report-a77d9a7ad6"
    ],
    "deleted": false,
    "updated_at": "2026-08-21",
    "challenges": "VLA、视频世界模型、逆动力学和视频—动作联合预测通常由不同系统承担，难共享理解、生成和控制先验。更根本的缺口是不同机器人的动作维度与语义不兼容，人类第一视角视频又没有机器人动作标签；直接联合视频与动作 token 还会因视频 token 数量占优而削弱控制学习。",
    "motivation": "作者把光流视为像素级“delta action”：它不要求关节空间一致，可从人类、模拟和多机器人视频自动提取。核心 Insight 是同时建立模型接口（三专家 MoT）与数据接口（低维光流 latent），让同一模型切换 VLA、WM、IDM、视频生成和联合预测。与本专题直接相关，但光流 latent 仍需目标本体动作监督才能成为可执行控制。",
    "technical_approach": "- **输入：** 当前观测、语言、可选本体状态，以及按模式提供的未来动作、视频或 DPFlow 光流。\n- **过程：** Wan2.2-5B 视频专家、Qwen3-VL 理解专家和 641.5M action expert 通过联合注意力交互；UniDiffuser 式双时间步控制不同条件/生成模式。DC-AE 把 RGB 光流压成 4×512 特征，再映射为 14 维 latent action；90% 无标签流重建与 10% 有动作对齐混训。三阶段数据金字塔依次适配视频模型、训练 latent action 与三专家、最后做目标机器人动作 SFT。\n- **输出：** 可执行动作块、未来视频、逆动力学动作，或视频—动作联合序列。\n\n相对只做单一 VLA/WAM 的 baseline，Motus 的实质差异是同一 checkpoint 的多条件生成，以及用光流先在 action-free 视频上预训练 action expert；动作 48 步/30 Hz、视频 8 帧/5 Hz，以降低模态失衡。",
    "discussion": "Motus 最强证据是多模式统一与预训练阶段消融，而非摘要中的单个提升数字。它展示了光流可把无标签视频接入 action learning，但 14 维瓶颈是启发式设计，遮挡和相机运动鲁棒性未被充分验证，也没有证明 latent 对任意本体都具有稳定语义。",
    "arxiv": {
      "published": "2025-12-15T06:58:40Z",
      "revised_at": "2025-12-25T08:16:05Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2509-21309",
    "title": "NewtonGen: Physics-Consistent and Controllable Text-to-Video Generation via Neural Newtonian Dynamics",
    "authors": [
      "Yu Yuan",
      "Xijun Wang",
      "Tharindu Wickremasinghe",
      "Zeeshan Nadir",
      "Bole Ma",
      "Stanley H. Chan"
    ],
    "year": 2026,
    "publication": "2026，ICLR 2026；arXiv:2509.21309；正式 DOI 未见",
    "arxiv_id": "2509.21309",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2509.21309",
      "publication": "https://openreview.net/pdf?id=zcAwK50ft0",
      "project": "https://yuyuanspace.com/NewtonGen/",
      "code": "https://github.com/pandayuanyu/NewtonGen",
      "alphaxiv": "https://alphaxiv.org/abs/2509.21309"
    },
    "tags": [
      "世界模型",
      "物理建模与仿真",
      "视频生成"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2509.21309v2/framework.png",
      "alt": "NewtonGen Fig. 2",
      "label": "NewtonGen，Fig. 2，整体框架：神经牛顿动力学、物理控制与视频生成的组合。来源：Fig. 2 原图",
      "paper_title": "NewtonGen: Physics-Consistent and Controllable Text-to-Video Generation via Neural Newtonian Dynamics",
      "source_url": "https://arxiv.org/html/2509.21309v2/framework.png"
    },
    "summary": "以少量 physics-clean trajectories 训练 Neural Newtonian Dynamics（NND），先预测用户条件下的未来状态，再把轨迹交给运动控制视频模型渲染。物理模型负责 motion law，生成模型负责 appearance。",
    "insight": "以少量 physics-clean trajectories 训练 Neural Newtonian Dynamics（NND），先预测用户条件下的未来状态，再把轨迹交给运动控制视频模型渲染。物理模型负责 motion law，生成模型负责 appearance。",
    "pipeline": {
      "input": "场景文本、运动类型和用户指定的初始位置/速度/加速度等条件",
      "process": "物理编码器提取 latent state；线性 physics-informed Neural ODE 建模已知动力学，三层 MLP 残差拟合非线性/未知项；从任意初态积分未来轨迹，再条件化 motion-controlled T2V",
      "output": "满足指定运动参数的合成视频及 latent physical trajectory",
      "details": "- **输入：** 场景文本、运动类型和用户指定的初始位置/速度/加速度等条件\n- **过程：** 物理编码器提取 latent state；线性 physics-informed Neural ODE 建模已知动力学，三层 MLP 残差拟合非线性/未知项；从任意初态积分未来轨迹，再条件化 motion-controlled T2V\n- **输出：** 满足指定运动参数的合成视频及 latent physical trajectory"
    },
    "experiments": "论文比较 Sora、Veo3、CogVideoX-5B、Wan2.2、PhyT2V 等。匀速 PIS-v 为 0.9830，参考轨迹为 0.9972；匀加速 PIS-ax 为 0.6568，仍低于参考 0.8489。用 PISABench 真实下落视频训练时，PIS-vx/PIS-ay 为 0.8485/0.6008，低于模拟训练的 0.9803/0.8189，显示真实噪声与 domain gap。表中部分闭源模型结果依赖其服务输出，公平性受生成接口和随机性影响。",
    "evidence_notes": "",
    "code_data_status": "官方代码已公开，README 给出 CogVideoX-5B、Go-with-the-Flow LoRA 和已学习 ODE 权重依赖。许可证与 PISABench/预训练权重的组合条款需复现者自行核验。",
    "limitations": "- 真实视频成绩明显低于模拟数据。\n- 运动族及状态参数由设计者定义，不是开放世界机制发现。\n- 视频 renderer 仍可能偏离正确 latent trajectory。\n- 未覆盖复杂多体接触、形变、遮挡后的状态估计和闭环控制。",
    "comments": "",
    "source_reports": [
      "report-d2be249044"
    ],
    "deleted": false,
    "updated_at": "2026-09-03",
    "challenges": "文本到视频模型可能让物体向上坠落、速度或方向突变，也难按初速度、加速度等连续参数控制。仅从外观分布学习运动，缺少可外推的动力学状态。",
    "motivation": "以少量 physics-clean trajectories 训练 Neural Newtonian Dynamics（NND），先预测用户条件下的未来状态，再把轨迹交给运动控制视频模型渲染。物理模型负责 motion law，生成模型负责 appearance。",
    "technical_approach": "- **输入：** 场景文本、运动类型和用户指定的初始位置/速度/加速度等条件\n- **过程：** 物理编码器提取 latent state；线性 physics-informed Neural ODE 建模已知动力学，三层 MLP 残差拟合非线性/未知项；从任意初态积分未来轨迹，再条件化 motion-controlled T2V\n- **输出：** 满足指定运动参数的合成视频及 latent physical trajectory",
    "discussion": "NewtonGen 的贡献是可学习 ODE 动力学与 T2V 解耦，并提供数值条件控制；它不是通用物理引擎，也没有从任意文本自动识别完整对象、接触和约束图。适用于低维、可参数化运动的可控生成。",
    "arxiv": {
      "published": "2025-09-25T15:25:33Z",
      "revised_at": "2026-03-28T16:05:49Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2608-24199",
    "title": "NVIDIA Cosmos-H-Dreams: Real-Time Generative Physics Simulation for Surgical Robotics",
    "authors": [
      "Javier Gamazo Tejero",
      "Lukas Zbinden",
      "Keyur Sheth",
      "Raghavendra K M",
      "Nadim Daher",
      "Diego Granero Maraña",
      "Filip Binkiewicz",
      "Patrick Thornycroft",
      "Mahdi Azizian",
      "Sean D. Huver"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本（首发 2026-08-25，v2 2026-08-27）",
    "arxiv_id": "2608.24199",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.24199",
      "model": "https://huggingface.co",
      "alphaxiv": "https://alphaxiv.org/abs/2608.24199"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "机器人学习",
      "流式与自回归",
      "第一视角与人类视频",
      "长时记忆"
    ],
    "figure": {
      "url": "content/images/2608.24199_fig1.png",
      "alt": "NVIDIA Cosmos-H-Dreams: Real-Time Generative Physics Simulation for Surgical Robotics 代表图",
      "label": "Cosmos-H-Dreams Fig. 1：首帧、流式 KV cache 与机器人运动学共同条件化实时手术视频生成。 来源：论文图",
      "paper_title": "NVIDIA Cosmos-H-Dreams: Real-Time Generative Physics Simulation for Surgical Robotics",
      "source_url": "content/images/2608.24199_fig1.png"
    },
    "summary": "手术机器人生成式仿真缺乏实时交互；动物/尸体实验昂贵难复现，经典模拟器难做到照片真实与软组织动力学。Cosmos-H-Dreams 集成三件套：action-conditioned 生成模型（Cosmos-H-Surgical-Simulator，在 Open-H-Embodiment 大语料上微调）+ teacher-to-student 蒸馏配方（Self Forcing 因果 few-step）+ 基于 NVIDIA FlashDreams 的流式推理部署栈，把被动视频生成器变成 实时可交互的手术世界模拟器 。",
    "insight": "手术机器人生成式仿真缺乏实时交互；动物/尸体实验昂贵难复现，经典模拟器难做到照片真实与软组织动力学。Cosmos-H-Dreams 集成三件套：action-conditioned 生成模型（Cosmos-H-Surgical-Simulator，在 Open-H-Embodiment 大语料上微调）+ teacher-to-student 蒸馏配方（Self Forcing 因果 few-step）+ 基于 NVIDIA FlashDreams 的流式推理部署栈，把被动视频生成器变成**实时可交互的手术世界模拟器**。",
    "pipeline": {
      "input": "手术/内镜观测 + 动作。",
      "process": "多具身手术视频世界模型预训练 → 具身/手术特定 post-train → 双向 teacher → Self Forcing 因果 few-step student 蒸馏 → FlashDreams 流式推理。",
      "output": "实时交互的手术场景模拟（视频流）。",
      "details": "**输入**：手术/内镜观测 + 动作。\n**过程**：多具身手术视频世界模型预训练 → 具身/手术特定 post-train → 双向 teacher → Self Forcing 因果 few-step student 蒸馏 → FlashDreams 流式推理。\n**输出**：实时交互的手术场景模拟（视频流）。"
    },
    "experiments": "摘要层面确认其实时性与照片真实软组织动力学主张；定量指标（延迟、保真）待全文核验。证据等级：仅摘要核验。",
    "evidence_notes": "",
    "code_data_status": "依赖 Cosmos 生态；模型/权重公开状态待确认。",
    "limitations": "- 手术领域的分布外解剖/器械泛化；\n- 软组织物理保真 vs 计算成本的权衡；\n- 临床验证缺口。\n\n### 与知域的关系\n属于\"Video / World Action Model\"在垂直领域（手术）的落地，与知域 Causal Forcing（流式蒸馏）、Self Forcing 的蒸馏技术直接关联。",
    "comments": "",
    "source_reports": [
      "report-a141624b1e"
    ],
    "deleted": false,
    "updated_at": "2026-08-31",
    "arxiv": {
      "published": "2026-08-25T08:09:40Z",
      "revised_at": "2026-08-27T12:43:06Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "arxiv": {
      "published": "2025-11-18T08:53:09Z",
      "revised_at": "2026-03-30T07:20:18Z",
      "primary_category": "cs.LG"
    },
    "arxiv_id": "2511.14262",
    "authors": [
      "Yosuke Nishimoto",
      "Takashi Matsubara"
    ],
    "code_data_status": "- 训练代码公开。\n- benchmark 小、仅 3 runs；无 SCM、`do`-intervention、graph recovery、counterfactual test；slot failure、遮挡和真实机器人未系统评估。\n\n---",
    "comments": "",
    "deleted": false,
    "doi": "",
    "evidence_notes": "- **作者明确限定：** 原文将 causality 定义为 token-level dependency，并明确写明不是 causal inference 语境下的 causality。\n- **实验实际支持：** 对象分解和任务相关 attention 在这些 RL benchmark 上提高 return/success。\n- **阅读判断：** causality score 可能是 reward relevance、attention utility 或相关性，不能解释为真实因果边、干预效应或反事实机制。",
    "experiments": "### Safety Gym\n\n- 8 个 object-rich 3D tasks；\n- first-person observation；\n- baseline：TWM、DreamerV3、TD-MPC2；\n- learning curves 多 run 汇总；\n- STICA 在绝大多数任务上表现最好或最具竞争力。\n\n### OCVRL\n\n包含：\n\n- 2D object-goal；\n- object-interaction；\n- 3D object-reaching。\n\n典型 final success：\n\n| Model | Object-goal | Interaction | 3D Reaching |\n|---|---:|---:|---:|\n| TWM | 0.727 | 0.080 | 0.772 |\n| DreamerV3 | 0.677 | 0.156 | 0.697 |\n| STICA | **0.737** | **0.333** | **0.867** |\n\n消融表明：\n\n- object-centric WM 本身只带来部分收益；\n- causality-aware attention 对 downstream performance 的贡献更明显。\n\n## 代码 / 数据\n\n- 基于公开 RL benchmarks；\n- arXiv/作者页面声明 code available；可优先从论文页提供的代码入口确认最新版本。",
    "figure": {
      "url": "content/images/stica_world_model.png",
      "alt": "STICA object-centric world model",
      "label": "STICA object-centric world model",
      "paper_title": "Object-Centric World Models for Causality-Aware Reinforcement Learning",
      "source_url": "content/images/stica_world_model.png"
    },
    "id": "arxiv-2511-14262",
    "insight": "STICA 认为 holistic world latent 在 object-rich environment 中效率不高，因此：\n\n1. observation 被拆为 object-centric tokens；\n2. Transformer world model 学 object token dynamics；\n3. policy / value network 估计 token-level cause–effect relevance；\n4. causality-aware attention 重点关注真正影响 reward / decision 的 objects。\n\n它的核心价值是：\n\n> **world model 不只是 object-centric，policy 也应该显式选择“哪些 object 对当前 decision 有影响”。**",
    "limitations": "- “causality” 主要是 learned dependency / relevance，不是正式 intervention；\n- 没有 counterfactual world-state evaluation；\n- benchmark 以 simulation 为主；\n- 没有真实机器人；\n- 没有显式 3D world-state causal consistency。\n\n**阅读判断**：  \n值得作为 **object-centric causal WM** 的相邻工作，但如果你做真正 Causal HOI，应明确比它更进一步：从 relevance/dependency 走到 **interventional / counterfactual dynamics**。\n\n---",
    "links": {
      "publication": "https://ojs.aaai.org/index.php/AAAI/article/view/39642",
      "paper": "https://arxiv.org/abs/2511.14262",
      "code": "https://github.com/nishimoto0430/STICA",
      "alphaxiv": "https://alphaxiv.org/abs/2511.14262"
    },
    "pipeline": {
      "input": "- image observation；",
      "process": "1. object-centric encoder 得到 object tokens；",
      "output": "- imagined object-level world trajectories；",
      "details": "**输入**：\n\n- image observation；\n- action；\n- reward。\n\n**过程**：\n\n1. object-centric encoder 得到 object tokens；\n2. 加入 action / reward tokens；\n3. Transformer world model 预测下一时刻 object tokens、reward、discount；\n4. policy/value networks 估计 token-level dependency score；\n5. causality-aware attention 根据 dependency 调节决策。\n\n**输出**：\n\n- imagined object-level world trajectories；\n- policy action / value。\n\n## “Causal” 的边界\n\n这篇必须谨慎引用。\n\n作者实际使用的是 **token-level cause–effect / dependency score** 来指导 attention。  \n它更接近：\n\n> causality-aware object dependency\n\n而不是完整 causal discovery / intervention identification。\n\n所以不能用这篇证明：\n\n> “object-centric attention 已经学到了真实 causal graph”。"
    },
    "publication": "AAAI 2026",
    "source_reports": [
      "report-554de78a93",
      "report-6fa37648ba",
      "report-ce5d8128c6"
    ],
    "summary": "论文： Object-Centric World Models for Causality-Aware Reinforcement Learning 作者： Yosuke Nishimoto, Takashi Matsubara 发表： AAAI 2026 入口： AAAI｜arXiv",
    "tags": [
      "3D/4D",
      "因果与反事实",
      "对象与可供性"
    ],
    "title": "Object-Centric World Models for Causality-Aware Reinforcement Learning",
    "updated_at": "2026-08-23",
    "year": 2026
  },
  {
    "id": "arxiv-2609-01938",
    "title": "One Demonstration, Many Objects: Generalizing Manipulation via Local Contact Geometry",
    "authors": [
      "Satvik Sharma",
      "Samrat Sahoo",
      "Huang Huang",
      "Fei-Fei Li",
      "Jiajun Wu",
      "Dorsa Sadigh",
      "Jeannette Bohg"
    ],
    "year": 2026,
    "publication": "2026，arXiv v2",
    "arxiv_id": "2609.01938",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2609.01938",
      "alphaxiv": "https://alphaxiv.org/abs/2609.01938"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "流式与自回归",
      "物理建模与仿真",
      "第一视角与人类视频",
      "跨本体迁移"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2609.01938v2/splash_fig.png",
      "alt": "单示范跨物体接触几何泛化概览",
      "label": "单示范跨物体接触几何泛化概览；来源：论文原图",
      "paper_title": "One Demonstration, Many Objects: Generalizing Manipulation via Local Contact Geometry",
      "source_url": "https://arxiv.org/html/2609.01938v2/splash_fig.png"
    },
    "summary": "DemoMimic 使用接触点附近的局部几何作为操作泛化依据，并通过 contact-centric reward 鼓励精准接触。摘要声称单个真实世界策略可跨越不同形状、尺度、质量和摩擦的物体。",
    "insight": "DemoMimic 使用接触点附近的局部几何作为操作泛化依据，并通过 contact-centric reward 鼓励精准接触。摘要声称单个真实世界策略可跨越不同形状、尺度、质量和摩擦的物体。",
    "pipeline": {
      "input": "人类示范、物体几何、机器人手状态。",
      "process": "提取局部接触几何，将接触奖励加入策略训练，并在仿真到真实迁移中保持接触结构。",
      "output": "跨物体和跨机械手的灵巧操作策略。",
      "details": "**输入**：人类示范、物体几何、机器人手状态。\n\n**过程**：提取局部接触几何，将接触奖励加入策略训练，并在仿真到真实迁移中保持接触结构。\n\n**输出**：跨物体和跨机械手的灵巧操作策略。"
    },
    "experiments": "摘要报告在 16 个物体、4 个任务和 2 种机械手上达到 71% 成功率，并称具有较小 sim-to-real drop。尚未核验每个任务的样本数、失败类型和 baseline 训练预算。",
    "evidence_notes": "",
    "code_data_status": "未确认开放状态。",
    "limitations": "局部接触结构相似并不保证整体动力学、摩擦和可达性相似。对于多接触、软物体、遮挡和动态物体，方法的有效性仍需验证。\n\n### 与知域的关系\n\n该工作把 HOI 的几何与接触结构转化为机器人泛化信号，适合与知域的 HOI-Dyn、Hand-Object World Model 和具身视频学习路线结合。",
    "comments": "",
    "source_reports": [
      "report-0d81d19c6c"
    ],
    "deleted": false,
    "updated_at": "2026-09-08",
    "arxiv": {
      "published": "2026-09-01T23:04:35Z",
      "revised_at": "2026-09-03T16:45:27Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2609-14833",
    "title": "One Model, Two Physical Stories: Auditing Misalignment in Multi-Modal World Modeling",
    "authors": [
      "Geigh Zollicoffer",
      "Minh Vu",
      "Rajiv Ranasinghe",
      "Manish Bhattarai"
    ],
    "year": 2026,
    "publication": "2026，arXiv v1，2026-09-13 提交",
    "arxiv_id": "2609.14833",
    "doi": "10.48550/arXiv.2609.14833",
    "links": {
      "paper": "https://arxiv.org/abs/2609.14833",
      "alphaxiv": "https://alphaxiv.org/abs/2609.14833"
    },
    "tags": [
      "世界模型",
      "因果与反事实",
      "物理建模与仿真"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2609.14833v1/figures/fig1_illustration_paper.png",
      "alt": "One Model, Two Physical Stories Fig. 1",
      "label": "One Model, Two Physical Stories，Fig. 1，同一场景下文本物理、视频生成与仿真参考的不一致。来源：Fig. 1 原图 PNG",
      "paper_title": "One Model, Two Physical Stories: Auditing Misalignment in Multi-Modal World Modeling",
      "source_url": "https://arxiv.org/html/2609.14833v1/figures/fig1_illustration_paper.png"
    },
    "summary": "论文指出多模态 world model 可能同时讲出“两套物理故事”：文本推理得到正确的弹跳、碰撞或运动关系，但同一模型的视频生成却违反该关系。作者定义 internal misalignment——模型自己的语言/物理 contract 与视频不一致，以及 external misalignment——视频与解析/模拟物理环境不一致。",
    "insight": "论文指出多模态 world model 可能同时讲出“两套物理故事”：文本推理得到正确的弹跳、碰撞或运动关系，但同一模型的视频生成却违反该关系。作者定义 internal misalignment——模型自己的语言/物理 contract 与视频不一致，以及 external misalignment——视频与解析/模拟物理环境不一致。",
    "pipeline": {
      "input": "物理初始条件、模型文本预测、模型视频生成和解析/模拟物理参考。",
      "process": "把机制拆成 event、magnitude、timing contract；构造由弱到强的 intervention ladder；逐步向模型提供自身 contract 或修正的 physical contract；检查视频行为是否随干预回到一致物理结果。",
      "output": "内部/外部物理一致性测量以及干预后变化。",
      "details": "**输入**：物理初始条件、模型文本预测、模型视频生成和解析/模拟物理参考。\n\n**过程**：把机制拆成 event、magnitude、timing contract；构造由弱到强的 intervention ladder；逐步向模型提供自身 contract 或修正的 physical contract；检查视频行为是否随干预回到一致物理结果。\n\n**输出**：内部/外部物理一致性测量以及干预后变化。"
    },
    "experiments": "实验覆盖四种 physical mechanisms 和 20 个 settings。论文报告 22/22 个文本 physics probes 得到与参考环境一致的回答，但 neutral video 经常与这些文本答案或模拟物理不一致。这直接支持“语言物理知识正确 ≠ 视频 world model 执行相同物理规律”。",
    "evidence_notes": "全文已核验",
    "code_data_status": "本次未核验到公开代码或独立数据集。",
    "limitations": "作者明确指出，Isaac/PhysX 环境并不等同于真实硬件物理；实验只覆盖一个模型系列、四类机制和有限随机种子。因此当前结果支持“存在可复现的跨模态 misalignment”，而不是所有多模态模型都必然存在同样幅度的物理错误。",
    "comments": "",
    "source_reports": [
      "report-1b1ffacf7d"
    ],
    "deleted": false,
    "updated_at": "2026-09-16",
    "challenges": "多模态模型可能在文本中正确描述物理规律，却生成违反同一规律的视频；仅分别评测语言推理或视频质量无法发现这种模型内部跨模态不一致。",
    "motivation": "论文指出多模态 world model 可能同时讲出“两套物理故事”：文本推理得到正确的弹跳、碰撞或运动关系，但同一模型的视频生成却违反该关系。作者定义 internal misalignment——模型自己的语言/物理 contract 与视频不一致，以及 external misalignment——视频与解析/模拟物理环境不一致。",
    "technical_approach": "**输入**：物理初始条件、模型文本预测、模型视频生成和解析/模拟物理参考。\n\n**过程**：把机制拆成 event、magnitude、timing contract；构造由弱到强的 intervention ladder；逐步向模型提供自身 contract 或修正的 physical contract；检查视频行为是否随干预回到一致物理结果。\n\n**输出**：内部/外部物理一致性测量以及干预后变化。",
    "discussion": "对世界模型路线很重要，因为它提供了比 PSNR/FVD 更直接的**物理一致性审计**。它使用 intervention，但不是 causal identification。后续可以将类似 contract test 扩展到 HOI 中的接触、摩擦、遮挡后物体状态和反事实动作。",
    "arxiv": {
      "published": "2026-09-13T22:56:58Z",
      "revised_at": "2026-09-13T22:56:58Z",
      "primary_category": "cs.AI"
    }
  },
  {
    "id": "arxiv-2606-31388",
    "title": "One Video, One World: Turning Monocular Video into Physical 4D Scenes",
    "authors": [
      "Junhao Chen",
      "Boran Zhang",
      "Mingjin Chen",
      "Henghaofan Zhang",
      "Saining Zhang",
      "Congcong Zhu",
      "Hao Zhao",
      "Ruqi Huang",
      "Zhihao Li",
      "Yufei Wang"
    ],
    "year": 2026,
    "publication": "2026，作者与 arXiv 标注 Accepted by ECCV 2026；截至核验日尚未发现可核对 DOI 的正式 proceedings 页面",
    "arxiv_id": "2606.31388",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2606.31388",
      "project": "https://onevideooneworld.github.io/",
      "code": "https://github.com/SparcAI-Inc/OVOW",
      "alphaxiv": "https://alphaxiv.org/abs/2606.31388"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "流式与自回归",
      "第一视角与人类视频",
      "视频生成",
      "长时记忆"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2606.31388v1/pipe_to_tracking.png",
      "alt": "One Video, One World Fig. 2：单目视频到实例级 4D 场景的处理流程",
      "label": "One Video, One World，Fig. 2，单目视频经实例分解、网格重建和时空位姿恢复得到物理 4D 场景的前三阶段。来源：Fig. 2 原图 PNG",
      "paper_title": "One Video, One World: Turning Monocular Video into Physical 4D Scenes",
      "source_url": "https://arxiv.org/html/2606.31388v1/pipe_to_tracking.png"
    },
    "summary": "OVOW 试图把互联网或机器人单目视频变成可编辑、可仿真的结构化资产，而不是只追求新视角外观。作者以直接顶点形变统一静态、刚体和非刚体运动，避免预定义骨架与类别特定 rigging；再用显式接触装配把各实例接入 Blender/URDF 等物理工作流。该方向与 4D world model 的数据基础设施直接相关，但系统本身是训练免除的多模型编排管线，不是学习到的物理动力学模型。",
    "insight": "OVOW 试图把互联网或机器人单目视频变成可编辑、可仿真的结构化资产，而不是只追求新视角外观。作者以直接顶点形变统一静态、刚体和非刚体运动，避免预定义骨架与类别特定 rigging；再用显式接触装配把各实例接入 Blender/URDF 等物理工作流。该方向与 4D world model 的数据基础设施直接相关，但系统本身是训练免除的多模型编排管线，不是学习到的物理动力学模型。",
    "pipeline": {
      "input": "单段 RGB 单目视频（系统也支持单图）；可选择远程或本地 Qwen3-VL，其他阶段调用预训练视觉、3D 与跟踪模型。",
      "process": "Qwen3-VL 发现、命名并把实例分为 static/rigid/deformable，SAM3 生成逐帧掩码；静态/刚体对象经 FLUX.2 amodal inpainting 与 Hi3DGen 得到封闭网格，非刚体经 Motion324 得到拓扑一致的网格序列；利用 VGGT 场景几何、RoMa v2 稠密对应和 FoundationPose 做迭代 render-match-optimize，恢复度量尺度、朝向和逐帧 6-DoF 位姿，并把全局刚体运动与局部顶点形变分离；最后用 RANSAC 地面、接触投影与实例间最近表面约束消除漂浮/穿透，恢复 HDR 环境光并导出场景。",
      "output": "实例分离、封闭且带逐帧刚体位姿/非刚体顶点动画的 4D mesh scene，以及可用于 Blender 物理模拟、编辑和 URDF/GLB 工作流的结构化资产。",
      "details": "- **输入：** 单段 RGB 单目视频（系统也支持单图）；可选择远程或本地 Qwen3-VL，其他阶段调用预训练视觉、3D 与跟踪模型。\n- **过程：** Qwen3-VL 发现、命名并把实例分为 static/rigid/deformable，SAM3 生成逐帧掩码；静态/刚体对象经 FLUX.2 amodal inpainting 与 Hi3DGen 得到封闭网格，非刚体经 Motion324 得到拓扑一致的网格序列；利用 VGGT 场景几何、RoMa v2 稠密对应和 FoundationPose 做迭代 render-match-optimize，恢复度量尺度、朝向和逐帧 6-DoF 位姿，并把全局刚体运动与局部顶点形变分离；最后用 RANSAC 地面、接触投影与实例间最近表面约束消除漂浮/穿透，恢复 HDR 环境光并导出场景。\n- **输出：** 实例分离、封闭且带逐帧刚体位姿/非刚体顶点动画的 4D mesh scene，以及可用于 Blender 物理模拟、编辑和 URDF/GLB 工作流的结构化资产。"
    },
    "experiments": "- **实验设置：** 作者构造两个各含 120 个合成场景的 benchmark：OVOW-3D-Scene-Bench 为静态场景，OVOW-4D-Scene-Bench 至少含一个刚体运动对象。指标包括场景 AABB/OBB IoU、Hungarian 匹配后的 Object-IoU、photometric loss、negative CLIP、耗时和显存；因此它们衡量结构与外观，但不覆盖真实视频的完整 ground-truth 4D 几何。\n- **实验事实：** 静态 benchmark 上，OVOW 的 Scene-IoU-OBB 0.218、Object-IoU 0.190、PL 5.70、N-CLIP 1.87 为表中最佳；Scene-IoU-AABB 0.130 低于 VIGA 的 0.156，单图耗时 272 s 也不是最快。\n- **实验事实：** 4D benchmark 上，OVOW 的 AABB/OBB/Object IoU 为 0.180/0.440/0.210，PL/N-CLIP 为 2.90/1.43，表中均领先；3.35 s/frame 明显快于所列单图对照的 103–788 s，但这种比较利用了视频内摊销，不能理解为所有端到端设置严格同预算。\n- **实验事实：** 验证集上各阶段报告 95.4% motion-category accuracy、93.1%/88.7% 刚体/非刚体重建成功率、92.4% pose recovery、86.8% 最终有效场景率和 82.7% 重力模拟稳定率。超参数表显示迭代次数从 3 增到 5 时 IoU-B 仅由 0.78 到 0.79，接触阈值与装配轮数附近较稳定。\n- **作者主张：** OVOW 是首个从单目视频生成实例级、simulation-ready 4D mesh scene 的 training-free 系统，并可作为合成 Video-to-4D 成对数据的引擎。\n- **阅读判断：** 表格支持其在作者新建合成 benchmark 上的结构指标和运行效率优势，也展示了物理引擎中的稳定输出；但“首个”和“simulation-ready”的外延依赖作者的任务定义，82.7% 稳定率也说明并非普遍物理可用。benchmark、方法和指标均由同一工作提出，需要独立数据与外部复现检验泛化。",
    "evidence_notes": "",
    "code_data_status": "官方主仓库已发布完整管线、smoke tests、benchmark evaluator 和批处理脚本。OVOW 自有代码为 MIT，但仓库整合 FoundationPose、Motion324、SAM3 等多种非商业或专用许可证组件，因此整体仅限非商业研究/评估，不是 OSI 意义的开源发行版。复现建议 Linux、NVIDIA GPU ≥40 GB、约 120 GB 磁盘，需下载约 55 GB 权重；benchmark 仓库提供评测器与协议，ground truth/data 另在 Hugging Face 发布。生成步骤非固定 seed，官方只保证流程产物而非逐位一致。",
    "limitations": "- 对象通常超过 10 个、很小或强遮挡时，VLM/SAM 场景分解会漏实例或误判运动类别；VGGT 的实例尺度和位置也随之恶化。\n- 拓扑变化（破碎、液体、从袋中取物）违反一致网格假设；极大形变如展开成团布料也会产生严重网格伪影。\n- 高遮挡（论文举例 >80%）、稀有类别、透明/反光/细薄/弱纹理对象、运动模糊和剧烈光照变化会影响生成、深度或跟踪。\n- 当前装配只处理重力对齐接触和简单堆叠，不建模关节、摩擦依赖或 deformable-deformable 接触；“物理就绪”不能解释为完整物理参数已恢复。\n- 大幅或快速相机运动会破坏 VGGT 几何与尺度恢复；系统不重建墙、地板和室外地形等背景。\n- 依赖多套重量级模型、混合许可证和较高硬件/磁盘成本，训练免除不等于低成本或易部署。",
    "comments": "",
    "source_reports": [
      "report-5a20368080",
      "report-89efbb2378",
      "report-a141624b1e"
    ],
    "deleted": false,
    "updated_at": "2026-08-31",
    "challenges": "现有单目 4D 重建多输出辐射场、Gaussian 或点云，适合渲染却缺少物理模拟需要的封闭网格、实例分离、统一尺度和标准化接口；单对象网格/骨骼方法又难以覆盖多对象场景和非刚体运动。与此同时，既有指标偏向 PSNR/SSIM/LPIPS，没有检查场景布局、实例分离、接触和重力稳定性，也缺少“视频—实例级 4D 网格场景”成对数据。",
    "motivation": "OVOW 试图把互联网或机器人单目视频变成可编辑、可仿真的结构化资产，而不是只追求新视角外观。作者以直接顶点形变统一静态、刚体和非刚体运动，避免预定义骨架与类别特定 rigging；再用显式接触装配把各实例接入 Blender/URDF 等物理工作流。该方向与 4D world model 的数据基础设施直接相关，但系统本身是训练免除的多模型编排管线，不是学习到的物理动力学模型。",
    "technical_approach": "- **输入：** 单段 RGB 单目视频（系统也支持单图）；可选择远程或本地 Qwen3-VL，其他阶段调用预训练视觉、3D 与跟踪模型。\n- **过程：** Qwen3-VL 发现、命名并把实例分为 static/rigid/deformable，SAM3 生成逐帧掩码；静态/刚体对象经 FLUX.2 amodal inpainting 与 Hi3DGen 得到封闭网格，非刚体经 Motion324 得到拓扑一致的网格序列；利用 VGGT 场景几何、RoMa v2 稠密对应和 FoundationPose 做迭代 render-match-optimize，恢复度量尺度、朝向和逐帧 6-DoF 位姿，并把全局刚体运动与局部顶点形变分离；最后用 RANSAC 地面、接触投影与实例间最近表面约束消除漂浮/穿透，恢复 HDR 环境光并导出场景。\n- **输出：** 实例分离、封闭且带逐帧刚体位姿/非刚体顶点动画的 4D mesh scene，以及可用于 Blender 物理模拟、编辑和 URDF/GLB 工作流的结构化资产。",
    "discussion": "OVOW 最值得关注的是输出接口：从渲染型 4D 表示转向实例级封闭网格、位姿、形变和接触关系，使单目视频可进入仿真与编辑工具链。其优势来自把多个强基础模型组织成明确的结构化管线；同样，任何上游分割、深度、生成或跟踪错误都会传播。它可用作 4D world-model 的伪标签/数据引擎，但不应把几何装配稳定性扩大为真实摩擦、关节或复杂接触动力学已被识别。",
    "arxiv": {
      "published": "2026-06-30T09:16:21Z",
      "revised_at": "2026-06-30T09:16:21Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "arxiv": {
      "published": "2025-12-01T13:44:31Z",
      "revised_at": "2025-12-01T13:44:31Z",
      "primary_category": "cs.CV"
    },
    "arxiv_id": "2512.01677",
    "authors": [
      "Haodong Yan",
      "Hang Yu",
      "Zhide Zhong",
      "Weilin Yuan",
      "Xin Gong",
      "Zehang Luo",
      "Chengxi Heyu",
      "Junfeng Li",
      "Wenxuan Song",
      "Shunbo Zhou",
      "Haoang Li"
    ],
    "code_data_status": "截至来源报告核验时，未记录可确认的官方代码、数据或模型入口；这表示开放状态待核验，不代表资源确定不存在。",
    "comments": "",
    "deleted": false,
    "doi": "",
    "evidence_notes": "",
    "experiments": "在 TASTE-Rob、TACO 等真实数据上，SCAR 相比 CogVideoX、Wan2.1、FLOVD 等在物理合理性、时序一致性、任务对齐上更好，并展示对 unseen non-rigid / transparent / distractor objects 的 open-world 泛化。\n\n**对你方向的启发**\n\n- 你说得对：它不是严格 3D/4D。\n- 但它提供了一个很实用的路线：**用可规模化的 2.5D/contact supervision 替代昂贵 3D annotation**。\n- 可扩展方向：把 SCAR 表示升级成 object-centric 3D point/pose/contact state。\n\n---",
    "figure": {
      "alt": "SCAR pipeline",
      "label": "SCAR joint generation",
      "paper_title": "SCAR: Open-world Hand-Object Interaction Video Generation Based on Structure and Contact-aware Representation",
      "source_url": "https://arxiv.org/html/2512.01677v1/pipeline_i2v.png",
      "url": "https://arxiv.org/html/2512.01677v1/pipeline_i2v.png"
    },
    "id": "arxiv-2512-01677",
    "insight": "SCAR 指出 HOI video generation 面临 2D 与 3D 表示的两难：3D mesh/pose 保真但难规模化，2D mask/flow 易规模化但缺接触与结构。它提出 **structure and contact-aware representation**：用 hand-object contour、contact region、depth map 等形成可规模化的交互监督，不依赖 3D annotation。",
    "limitations": "- 你说得对：它不是严格 3D/4D。\n- 但它提供了一个很实用的路线：**用可规模化的 2.5D/contact supervision 替代昂贵 3D annotation**。\n- 可扩展方向：把 SCAR 表示升级成 object-centric 3D point/pose/contact state。\n\n---",
    "links": {
      "paper": "https://arxiv.org/abs/2512.01677",
      "project": "https://hgzn258.github.io/SCAR/",
      "alphaxiv": "https://alphaxiv.org/abs/2512.01677"
    },
    "pipeline": {
      "input": "初始图像/视频、交互条件，以及伪标注的 hand/object contour、contact 与 depth",
      "process": "- 训练表示构建 ：VLM + SAM2 得到 hand/object masks；估计 contact region；估计 video depth；将 contact-augmented contours 与 depth 融合为 HOI representation。；- 生成模型 ：jointly generate RGB video 和 HOI representation；Hierarchical Joint Denoiser 在统一 latent space 中 co-denoise visual tokens 和 interaction tokens。",
      "output": "HOI video 及对应的结构/接触表示。",
      "details": "- **输入**：observed image、task description。\n- **训练表示构建**：VLM + SAM2 得到 hand/object masks；估计 contact region；估计 video depth；将 contact-augmented contours 与 depth 融合为 HOI representation。\n- **生成模型**：jointly generate RGB video 和 HOI representation；Hierarchical Joint Denoiser 在统一 latent space 中 co-denoise visual tokens 和 interaction tokens。\n- **输出**：HOI video 及对应的结构/接触表示。"
    },
    "publication": "CVPR 2026",
    "source_reports": [
      "report-0ad44831eb"
    ],
    "summary": "SCAR 指出 HOI video generation 面临 2D 与 3D 表示的两难：3D mesh/pose 保真但难规模化，2D mask/flow 易规模化但缺接触与结构。它提出 structure and contact-aware representation ：用 hand-object contour、contact region、depth map 等形成可规模化的交互监督，不依赖 3D annotation。",
    "tags": [
      "3D/4D",
      "HOI",
      "世界模型",
      "因果与反事实",
      "第一视角与人类视频",
      "视频生成"
    ],
    "title": "Open-world Hand-Object Interaction Video Generation Based on Structure and Contact-aware Representation",
    "updated_at": "2026-09-02",
    "year": 2026,
    "discussion": "- 你说得对：它不是严格 3D/4D。\n- 但它提供了一个很实用的路线：**用可规模化的 2.5D/contact supervision 替代昂贵 3D annotation**。\n- 可扩展方向：把 SCAR 表示升级成 object-centric 3D point/pose/contact state。\n\n---",
    "challenges": "3D mesh/pose 精确但难规模化，2D mask/flow 易获取却丢失结构、深度与接触。",
    "motivation": "以 hand/object contour、contact region 和 depth 构造 2.5D interaction token，联合生成 RGB 与结构表示。",
    "technical_approach": "- **输入：** 初始图像/视频、交互条件，以及伪标注的 hand/object contour、contact 与 depth\n- **过程：** VLM/SAM2/深度模型构建表示；Hierarchical Joint Denoiser 在统一 latent 中联合去噪视觉与交互 tokens\n- **输出：** HOI 视频及同步结构/接触表示"
  },
  {
    "id": "arxiv-2609-07398",
    "title": "OpenWAM: An Open, Modular Exploration Towards Systematic World-Action Model Pretraining",
    "authors": [
      "Yuran Wang",
      "Siqiao Huang",
      "Mingleyang Li",
      "Chenhao Zhang",
      "Jiaqi Liang",
      "Weiyang Jin",
      "Yue Chen",
      "Xuemin Chi",
      "Donghao Zhou",
      "Qize Yu",
      "Yu-Kai Wang",
      "Yuhan Rui",
      "Shenzhe Yao",
      "Zhen Yuan",
      "Zhenhao Shen",
      "Kefei Zhu",
      "Zijie Zhu",
      "Ning Gao",
      "Xiaowei Chi",
      "Guanqi He",
      "Shanghang Zhang",
      "Hao Dong",
      "Lin Shao",
      "Hang Zhao"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本，v1",
    "arxiv_id": "2609.07398",
    "doi": "10.48550/arXiv.2609.07398",
    "links": {
      "paper": "https://arxiv.org/abs/2609.07398",
      "project": "https://openwam-official.github.io/",
      "code": "https://github.com/OpenWAM-Official/OpenWAM",
      "model": "https://huggingface.co/OpenWAM",
      "alphaxiv": "https://alphaxiv.org/abs/2609.07398"
    },
    "tags": [
      "World Action Model",
      "第一视角与人类视频",
      "跨本体迁移",
      "预训练与扩展律"
    ],
    "figure": {
      "url": "content/images/2609.07398-representative.webp",
      "alt": "OpenWAM 双系统架构、预训练组成与统一动作空间",
      "label": "OpenWAM 双系统架构、预训练组成与统一动作空间",
      "paper_title": "OpenWAM: An Open, Modular Exploration Towards Systematic World-Action Model Pretraining",
      "source_url": "https://openwam-official.github.io/"
    },
    "summary": "OpenWAM试图把 WAM 从单项方法推进为开放、模块化的预训练体系：统一机器人动作接口，同时把机器人轨迹和第一视角人类视频纳入同一视频—动作生成框架。其价值主要在可拆分的数据、模型与评测组件，而非单一结构技巧。",
    "insight": "OpenWAM试图把 WAM 从单项方法推进为开放、模块化的预训练体系：统一机器人动作接口，同时把机器人轨迹和第一视角人类视频纳入同一视频—动作生成框架。其价值主要在可拆分的数据、模型与评测组件，而非单一结构技巧。",
    "pipeline": {
      "input": "初始视觉、语言、人类/机器人视频及统一到 80 维空间的机器人动作。",
      "process": "Wan2.2 VAE 编码视频；TI2V5B 与 ActionDiT 在 30 层联合自注意力中交换信息；互惠掩码和同步去噪联合建模视觉未来与动作。",
      "output": "动作条件未来视频与可执行动作块。",
      "details": "**输入**：初始视觉、语言、人类/机器人视频及统一到 80 维空间的机器人动作。\n\n**过程**：Wan2.2 VAE 编码视频；TI2V5B 与 ActionDiT 在 30 层联合自注意力中交换信息；互惠掩码和同步去噪联合建模视觉未来与动作。\n\n**输出**：动作条件未来视频与可执行动作块。"
    },
    "experiments": "官方项目页报告 LIBERO 平均 99.3%、RoboTwin 2.0 Full 93.60%；真实 RoboDojo 得分/成功率 37.6/24.4，对比 \\(\\pi_{0.5}\\) 22.9/12.8。项目展示 46 个 checkpoint。结果表明规模化联合预训练具有潜力，但本次未完成论文所有数据划分、训练预算和 baseline 复现细节的逐页审计，不能据此确认全面 SOTA。",
    "evidence_notes": "2026-09-14 已核对 arXiv 元数据、官方项目实验面板、代码目录与模型组织页；未逐页审计 PDF 或运行复现。",
    "code_data_status": "代码目录、配置和测试已公开；Hugging Face 组织页列出模型集合。 以上状态核验于 2026-09-14；入口和目录存在不等于已经运行复现实验。",
    "limitations": "训练资源门槛高；统一动作空间可能掩盖不同机器人动力学与控制频率差异。人类视频只占约 30% 的训练组成，其独立贡献需要严格消融。视频与动作共同生成并不自动保证接触可执行性。",
    "comments": "",
    "source_reports": [
      "report-37b94c4145"
    ],
    "deleted": false,
    "updated_at": "2026-09-14",
    "discussion": "OpenWAM是本期最直接的大规模开放 WAM 工作，尤其符合“从人类视频学习、跨 embodiment、联合视频—动作建模”的关注重点。",
    "arxiv": {
      "published": "2026-09-07T12:12:32Z",
      "revised_at": "2026-09-07T12:12:32Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2606-04463",
    "title": "OSCAR: Omni-Embodiment Action-Conditioned World Model for Robotics",
    "authors": [
      "Zhuoyuan Wu",
      "Jun Gao"
    ],
    "year": 2026,
    "publication": "2026，arXiv preprint",
    "arxiv_id": "2606.04463",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2606.04463",
      "project": "https://wuzy2115.github.io/oscar-project-page/",
      "code": "https://github.com/wuzy2115/oscar-public",
      "model": "https://huggingface.co/zywu2115/OSCAR-2B",
      "data": "https://huggingface.co/datasets/zywu2115/OSCAR_robot",
      "alphaxiv": "https://alphaxiv.org/abs/2606.04463"
    },
    "tags": [
      "世界模型",
      "动作表征",
      "机器人学习",
      "跨本体迁移"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2606.04463/x1.png",
      "alt": "OSCAR Fig. 1",
      "label": "OSCAR，Fig. 1，生成 rollout 与真实 RoboArena 策略评估的对应关系。来源：Fig. 1 原图",
      "paper_title": "OSCAR: Omni-Embodiment Action-Conditioned World Model for Robotics",
      "source_url": "https://arxiv.org/html/2606.04463/x1.png"
    },
    "summary": "二维运动学骨架只依赖拓扑与相机投影，不携带纹理；改变 URDF/MANO 拓扑即可表示不同机器人或人手。作者再通过大规模清洗和去重缓解数据覆盖问题。与 VAP 相邻且直接相关：VAP 强调跨域 action-to-video，OSCAR 更强调数据工程与策略排序。",
    "insight": "二维运动学骨架只依赖拓扑与相机投影，不携带纹理；改变 URDF/MANO 拓扑即可表示不同机器人或人手。作者再通过大规模清洗和去重缓解数据覆盖问题。与 VAP 相邻且直接相关：VAP 强调跨域 action-to-video，OSCAR 更强调数据工程与策略排序。",
    "pipeline": {
      "input": "首帧、caption、机器人关节或 MANO 姿态、运动学树、相机参数和目标视频。",
      "process": "前向运动学投影 link 原点并绘制关节、父子边与夹爪状态；骨架和视频经 Wan VAE 编码，latent patch embedding 后相加，Cosmos-Predict2.5-2B 用 rectified flow 训练。数据经过长度、静态相机、动作、可见性过滤，再用 SigLIP 与轨迹 RMS 去重；先机器人训练 15k iterations，再 warm-start 混入人类数据。",
      "output": "81 帧未来视频；策略评估时由 GPT-5 判断成功与进度。",
      "details": "- **输入：** 首帧、caption、机器人关节或 MANO 姿态、运动学树、相机参数和目标视频。\n- **过程：** 前向运动学投影 link 原点并绘制关节、父子边与夹爪状态；骨架和视频经 Wan VAE 编码，latent patch embedding 后相加，Cosmos-Predict2.5-2B 用 rectified flow 训练。数据经过长度、静态相机、动作、可见性过滤，再用 SigLIP 与轨迹 RMS 去重；先机器人训练 15k iterations，再 warm-start 混入人类数据。\n- **输出：** 81 帧未来视频；策略评估时由 GPT-5 判断成功与进度。"
    },
    "experiments": "2,165,359 原始 episodes 过滤为 180,657（机器人 94,830、人类 85,827），涵盖四种机器人及多个 ego 数据源。200-clips 测试中 OSCAR 的 PSNR 24.24、LPIPS 0.094、FVD 7.08、FPS 2.214；Genie Envisioner 为 23.29/0.140/15.37，但其 tLPIPS 更优（0.007 vs 0.015），OSCAR 在 AIROA-MoMa 子集也非最佳。\n\n条件消融中 latent action/mesh/skeleton 的 FVD 为 12.03/7.89/7.69；骨架与 mesh 像素指标接近，主要优势是跨本体兼容。RoboArena 65 sessions×7 policies：骨架的 Spearman 0.750、Pearson 0.852、成功率绝对误差 1.73 pp；latent action Pearson 0.867 略高，不能写成骨架所有指标最佳。GPT-5 与 100 个真人标注的一致率 78%，recall 仅 0.66。训练为单张 GH200，未报告 wall-clock。",
    "evidence_notes": "",
    "code_data_status": "代码、OSCAR-2B 权重和机器人数据已公开。混合数据包含多种 CC 许可证，不能统一视为可商业使用；人类数据应以实际下载页及许可证为准。",
    "limitations": "- 依赖准确相机参数和运动学标注。\n- 主要筛选静态相机，不覆盖普遍 ego camera motion。\n- GPT-5 成功判定 recall 仅 0.66。\n- 测试仅 200 clips、四种机器人，覆盖仍有限。\n- RoboArena 只保留标定较好的 sessions，可能有选择偏差。",
    "comments": "",
    "source_reports": [
      "report-a77d9a7ad6"
    ],
    "deleted": false,
    "updated_at": "2026-08-21",
    "challenges": "动作条件视频模型面临帧级动作跟随不准、机器人数据场景有限、动作条件绑定具体本体三类问题。latent action 会压缩掉空间定位，密集 mesh 易绑定外观，仅画末端又缺少整臂运动。本文针对的缺口是同时统一机器人和人手，并为真实策略评估提供足够稳定的 rollout。",
    "motivation": "二维运动学骨架只依赖拓扑与相机投影，不携带纹理；改变 URDF/MANO 拓扑即可表示不同机器人或人手。作者再通过大规模清洗和去重缓解数据覆盖问题。与 VAP 相邻且直接相关：VAP 强调跨域 action-to-video，OSCAR 更强调数据工程与策略排序。",
    "technical_approach": "- **输入：** 首帧、caption、机器人关节或 MANO 姿态、运动学树、相机参数和目标视频。\n- **过程：** 前向运动学投影 link 原点并绘制关节、父子边与夹爪状态；骨架和视频经 Wan VAE 编码，latent patch embedding 后相加，Cosmos-Predict2.5-2B 用 rectified flow 训练。数据经过长度、静态相机、动作、可见性过滤，再用 SigLIP 与轨迹 RMS 去重；先机器人训练 15k iterations，再 warm-start 混入人类数据。\n- **输出：** 81 帧未来视频；策略评估时由 GPT-5 判断成功与进度。",
    "discussion": "OSCAR 证明清洗后的混合人类—机器人数据和无纹理骨架可形成可迁移条件，并给出较强策略排序证据。但它依赖准确标定，评估器又依赖 GPT-5；生成世界尚不能完全替代真实评测。",
    "arxiv": {
      "published": "2026-06-03T05:16:41Z",
      "revised_at": "2026-06-04T13:11:48Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2609-12036",
    "title": "Pelican-Sim 1.0: A General World Model Simulator for Embodied Intelligence",
    "authors": [
      "Shilong Zou",
      "Shilin Zhang",
      "Yingji Zhang",
      "Yuhang Huang",
      "Yi Zhang",
      "Zeyuan Ding",
      "Han Dong",
      "Junwei Liao",
      "Yong Dai",
      "Jian Tang",
      "Xiaozhu Ju"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本，v1",
    "arxiv_id": "2609.12036",
    "doi": "10.48550/arXiv.2609.12036",
    "links": {
      "paper": "https://arxiv.org/abs/2609.12036",
      "project": "https://zoushilong1024.github.io/Pelican-Sim1.0/",
      "code": "https://github.com/ZouShilong1024/Pelican-Sim1.0",
      "alphaxiv": "https://alphaxiv.org/abs/2609.12036"
    },
    "tags": [
      "世界模型",
      "强化与模仿学习",
      "视频生成",
      "跨本体迁移"
    ],
    "figure": {
      "url": "content/images/2609.12036-representative.webp",
      "alt": "Figure 1",
      "label": "Figure 1",
      "paper_title": "Pelican-Sim 1.0: A General World Model Simulator for Embodied Intelligence",
      "source_url": "https://arxiv.org/html/2609.12036v1#S0.F1"
    },
    "summary": "Pelican-Sim 1.0把异构机器人的动作归一到 28 维数值接口，并把 URDF/相机渲染的动作视频作为连接动作和像素的中间条件。Sparse MoE吸收跨域动力学差异，因果适配与少步蒸馏将生成压缩为四步自回归 rollout。",
    "insight": "Pelican-Sim 1.0把异构机器人的动作归一到 28 维数值接口，并把 URDF/相机渲染的动作视频作为连接动作和像素的中间条件。Sparse MoE吸收跨域动力学差异，因果适配与少步蒸馏将生成压缩为四步自回归 rollout。",
    "pipeline": {
      "input": "初始 RGB、28 维统一动作值、相机对齐动作视频。",
      "process": "Video DiT 与 sparse MoE 预测未来帧；动作视频注入提升空间控制；35 步模型经因果适配和蒸馏变为四步生成器；微调 VLM 评分器用于数据筛选、策略评价、动作选择与 GRPO 优化。",
      "output": "动作条件未来视频、策略分数、候选动作选择和想象 rollout 奖励。",
      "details": "**输入**：初始 RGB、28 维统一动作值、相机对齐动作视频。\n\n**过程**：Video DiT 与 sparse MoE 预测未来帧；动作视频注入提升空间控制；35 步模型经因果适配和蒸馏变为四步生成器；微调 VLM 评分器用于数据筛选、策略评价、动作选择与 GRPO 优化。\n\n**输出**：动作条件未来视频、策略分数、候选动作选择和想象 rollout 奖励。"
    },
    "experiments": "相对融合 baseline，动作视频注入 PSNR 提升 0.904；sparse MoE 相对 dense backbone 的 FVD 降低 6.530；四步生成相对 35 步获得 5.67 倍加速。在 RoboTwin 中，每任务 50 个真实演示加 500 个生成轨迹将策略成功率从 70% 提高到 93%；五个 checkpoint 的策略评价 Pearson 相关为 0.994；动作选择和策略优化相对成功增益为 47.7% 和 20.3%。这些结论依赖同一基准和 VLM 评价器，相关性不能解释为跨平台因果有效性。 [正文实验与表格](https://arxiv.org/html/2609.12036v1)。",
    "evidence_notes": "2026-09-14 已核对 arXiv 元数据、正文主要实验与对照；未运行复现实验。",
    "code_data_status": "官方项目链接对应此仓库，当前只有 README、许可证与 gitignore，完整实现尚未公开。 以上状态核验于 2026-09-14；入口和目录存在不等于已经运行复现实验。",
    "limitations": "统一数值动作不足以完全描述控制频率、顺应性和硬件延迟；动作视频渲染依赖可靠 URDF 与标定。生成器与 VLM 评分器可能共享视觉偏差，世界模型错误会被下游选择和优化放大。",
    "comments": "",
    "source_reports": [
      "report-37b94c4145"
    ],
    "deleted": false,
    "updated_at": "2026-09-14",
    "discussion": "该工作覆盖 Egocentric/World Action Model 的规模化训练与闭环使用，并提供与 Flow WAM、X-WAM 比较的系统级参照。",
    "arxiv": {
      "published": "2026-09-10T17:51:01Z",
      "revised_at": "2026-09-10T17:51:01Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2607-28624",
    "title": "PhiZero: A World Model Built Around Physical Language",
    "authors": [
      "Shuyao Shang",
      "Yuqi Wang",
      "Ruopeng Gao",
      "Xu Chen",
      "Tieniu Tan",
      "Lue Fan",
      "Zhaoxiang Zhang"
    ],
    "year": 2026,
    "publication": "2026，arXiv preprint（2026-07-30）；arXiv:2607.28624；正式 DOI 未见",
    "arxiv_id": "2607.28624",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2607.28624",
      "project": "https://phi-zero.github.io/",
      "code": "https://github.com/yaoyao-jpg/PhiZero",
      "model": "https://huggingface.co/ShuyaoShang/PhiZero",
      "alphaxiv": "https://alphaxiv.org/abs/2607.28624"
    },
    "tags": [
      "世界模型",
      "因果与反事实",
      "物理建模与仿真"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2607.28624v1/Pipeline.png",
      "alt": "PhiZero Fig. 2",
      "label": "PhiZero，Fig. 2，以物理语言为中间表示的训练与推理管线。来源：Fig. 2 原图",
      "paper_title": "PhiZero: A World Model Built Around Physical Language",
      "source_url": "https://arxiv.org/html/2607.28624v1/Pipeline.png"
    },
    "summary": "学习紧凑的离散“physical language”表示相邻 latent states 的 transition，先自回归推演物理 token，再由 diffusion decoder 渲染，即 reason-then-render。",
    "insight": "学习紧凑的离散“physical language”表示相邻 latent states 的 transition，先自回归推演物理 token，再由 diffusion decoder 渲染，即 reason-then-render。",
    "pipeline": {
      "input": "第一帧、文本 action intent 与训练期无标注/模拟视频",
      "process": "transition-level Q-Former 从相邻 Wan VAE states 提取 32 queries，FSQ 离散为 25K 词表中的 physical tokens；Qwen3-VL-4B 初始化 reasoner 预测 token sequence；Wan2.2-5B decoder 渲染",
      "output": "物理语言序列、未来视频、likelihood-based 物理判断和可复用 motion transfer code",
      "details": "- **输入：** 第一帧、文本 action intent 与训练期无标注/模拟视频\n- **过程：** transition-level Q-Former 从相邻 Wan VAE states 提取 32 queries，FSQ 离散为 25K 词表中的 physical tokens；Qwen3-VL-4B 初始化 reasoner 预测 token sequence；Wan2.2-5B decoder 渲染\n- **输出：** 物理语言序列、未来视频、likelihood-based 物理判断和可复用 motion transfer code"
    },
    "experiments": "数据由 50K 小时池筛至 10K 小时，并形成 5M 个四秒 clips 与 1M motion-rich clips。33 帧视频只用 256 tokens，对比 Wan VAE 44,800，重建 PSNR/SSIM/LPIPS 为 28.9/0.903/0.087。项目页报告 Physics-IQ、PhyGround、WorldModelBench 的所列物理指标领先；论文也在 IntPhys2、LikePhys、YoCausal 做 pairwise likelihood 判断。强压缩相对 VAE 会损失重建质量，物理 benchmark 的 judge/coverage 仍限制结论。",
    "evidence_notes": "",
    "code_data_status": "代码与 Apache-2.0 模型页已上线，模型页给出 reasoner/tokenizer 权重结构；但页面同时提示仓库需要获权认证，Wan2.2 基座不随权重提供。完整训练数据清单仍未开放，实际下载权限需人工确认。",
    "limitations": "- 离散 token 可压缩但未保证可解释或可组合。\n- 训练数据规模大且含模拟/筛选管线，完整复现成本高。\n- 文本 action intent 不等于机器人低层动作。\n- motion transfer 的外观变化不验证新对象真实质量、摩擦或接触机制。",
    "comments": "",
    "source_reports": [
      "report-d2be249044"
    ],
    "deleted": false,
    "updated_at": "2026-09-03",
    "challenges": "像素空间未来预测把动力学埋在高维生成器中，自然语言又太粗，难表达细粒度状态变化并复用于生成、理解和跨 embodiment transfer。",
    "motivation": "学习紧凑的离散“physical language”表示相邻 latent states 的 transition，先自回归推演物理 token，再由 diffusion decoder 渲染，即 reason-then-render。",
    "technical_approach": "- **输入：** 第一帧、文本 action intent 与训练期无标注/模拟视频\n- **过程：** transition-level Q-Former 从相邻 Wan VAE states 提取 32 queries，FSQ 离散为 25K 词表中的 physical tokens；Qwen3-VL-4B 初始化 reasoner 预测 token sequence；Wan2.2-5B decoder 渲染\n- **输出：** 物理语言序列、未来视频、likelihood-based 物理判断和可复用 motion transfer code",
    "discussion": "PhiZero 的 novelty 是 transition-level discrete interface，而不是可读自然语言或显式方程。它能复用运动 token 做外观/embodiment transfer，但 token 语义未必对应可识别物理变量，不能把“reason”直接解释为符号因果推理。",
    "arxiv": {
      "published": "2026-07-30T17:59:46Z",
      "revised_at": "2026-07-30T17:59:46Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2606-28128",
    "title": "PhysisForcing: Physics Reinforced World Simulator for Robotic Manipulation",
    "authors": [
      "Peiwen Zhang",
      "Yufan Deng",
      "Shangkun Sun",
      "Juncheng Ma",
      "Duomin Wang",
      "Jonas Du",
      "Zilin Pan",
      "Ye Huang",
      "Hao Liang",
      "Songyan Huang",
      "Ruihua Zhang",
      "Enze Xie",
      "Ming-Yu Liu",
      "Daquan Zhou"
    ],
    "year": 2026,
    "publication": "2026，arXiv preprint（2026-06-26）；arXiv:2606.28128；正式 DOI 未见",
    "arxiv_id": "2606.28128",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2606.28128",
      "project": "https://dagroup-pku.github.io/PhysisForcing.github.io/",
      "code": "https://github.com/DAGroup-PKU/PhysisForcing",
      "alphaxiv": "https://alphaxiv.org/abs/2606.28128"
    },
    "tags": [
      "世界模型",
      "机器人学习",
      "物理建模与仿真"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2606.28128v1/figs/Fig2_Method.png",
      "alt": "PhysisForcing Fig. 2",
      "label": "PhysisForcing，Fig. 2，面向机器人操作的物理强化世界模拟器架构。来源：Fig. 2 原图",
      "paper_title": "PhysisForcing: Physics Reinforced World Simulator for Robotic Manipulation",
      "source_url": "https://arxiv.org/html/2606.28128v1/figs/Fig2_Method.png"
    },
    "summary": "不增加推理成本，在训练时把监督集中到 physics-informative regions：像素级轨迹约束局部运动，语义级关系约束 interacting entities 的时空关系。",
    "insight": "不增加推理成本，在训练时把监督集中到 physics-informative regions：像素级轨迹约束局部运动，语义级关系约束 interacting entities 的时空关系。",
    "pipeline": {
      "input": "机器人操作视频、参考 point trajectories、物理关键区域和冻结视频理解编码器的 region relations",
      "process": "在 DiT 中间特征同时优化 pixel-level trajectory alignment loss 与 semantic relational alignment loss；适配 Wan2.2 和 Cosmos3 backbones",
      "output": "物理一致性更强的机器人视频 world model 及可供 inverse dynamics/policy 使用的 rollout",
      "details": "- **输入：** 机器人操作视频、参考 point trajectories、物理关键区域和冻结视频理解编码器的 region relations\n- **过程：** 在 DiT 中间特征同时优化 pixel-level trajectory alignment loss 与 semantic relational alignment loss；适配 Wan2.2 和 Cosmos3 backbones\n- **输出：** 物理一致性更强的机器人视频 world model 及可供 inverse dynamics/policy 使用的 rollout"
    },
    "experiments": "作者报告 Wan2.2-I2V-A14B 和 Cosmos3-Nano 在 R-Bench 相对 base 提升 22.3%/9.2%，相对 vanilla finetuning 提升 7.1%/3.7%。WorldArena action-planner closed-loop success 从 16.0% 提至 24.0%，强 baseline WoW 为 20.5%。RoboTwin 下游六任务平均 success 68.2→72.8，但 shake_bottle 97.5→94.5、stack_bowls_two 69.5→63.0，说明不是所有任务改善。消融中 Wan5B ft 44.8，完整方法 47.5。",
    "evidence_notes": "",
    "code_data_status": "MIT 仓库公开 PF-Cosmos/PF-Wan 推理代码与权重；README 在核验时仍写 training code 和 auxiliary checkpoints coming soon，完整训练复现尚不充分。",
    "limitations": "- 两项下游任务出现性能下降。\n- 轨迹/关系 teacher 的错误会传入 DiT。\n- 依赖 benchmark evaluator，接触力和对象状态未显式测量。\n- 训练代码尚未完整开放，数据与 GPU 成本需补核。",
    "comments": "",
    "source_reports": [
      "report-d2be249044"
    ],
    "deleted": false,
    "updated_at": "2026-09-03",
    "challenges": "通用或机器人微调的视频模型仍会让运动物体变形，并在接触附近产生不连续轨迹、错误时空关系和不可信 robot–object response。",
    "motivation": "不增加推理成本，在训练时把监督集中到 physics-informative regions：像素级轨迹约束局部运动，语义级关系约束 interacting entities 的时空关系。",
    "technical_approach": "- **输入：** 机器人操作视频、参考 point trajectories、物理关键区域和冻结视频理解编码器的 region relations\n- **过程：** 在 DiT 中间特征同时优化 pixel-level trajectory alignment loss 与 semantic relational alignment loss；适配 Wan2.2 和 Cosmos3 backbones\n- **输出：** 物理一致性更强的机器人视频 world model 及可供 inverse dynamics/policy 使用的 rollout",
    "discussion": "论文的价值在于把像素轨迹与对象关系监督连接到真实 manipulation planning；“physics reinforced”仍是 representation alignment，不是显式力学状态或因果识别。负增益任务应保留，避免只报告平均提升。",
    "arxiv": {
      "published": "2026-06-26T14:30:18Z",
      "revised_at": "2026-06-26T14:30:18Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2601-11087",
    "title": "PhysRVG: Physics-Aware Unified Reinforcement Learning for Video Generative Models",
    "authors": [
      "Qiyuan Zhang",
      "Biao Gong",
      "Shuai Tan",
      "Zheng Zhang",
      "Yujun Shen",
      "Xing Zhu",
      "Yuyuan Li",
      "Kelu Yao",
      "Chunhua Shen",
      "Changqing Zou"
    ],
    "year": 2026,
    "publication": "2026，ECCV 2026；arXiv:2601.11087；正式 DOI 待核",
    "arxiv_id": "2601.11087",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2601.11087",
      "project": "https://lucaria-academy.github.io/PhysRVG/",
      "code": "https://github.com/ant-research/PhysRVG",
      "model": "https://huggingface.co/HappyP4nda/PhysRVG",
      "alphaxiv": "https://alphaxiv.org/abs/2601.11087"
    },
    "tags": [
      "世界模型",
      "物理建模与仿真"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2601.11087v1/motiv.png",
      "alt": "PhysRVG Fig. 2",
      "label": "PhysRVG，Fig. 2，统一物理奖励强化学习的核心设计。来源：Fig. 2 原图",
      "paper_title": "PhysRVG: Physics-Aware Unified Reinforcement Learning for Video Generative Models",
      "source_url": "https://arxiv.org/html/2601.11087v1/motiv.png"
    },
    "summary": "设计基于对象 mask/轨迹与 collision detection 的可验证 reward，并以 Mimicry–Discovery Cycle 在稳定模仿与物理探索之间切换，避免纯 RL 崩溃。",
    "insight": "设计基于对象 mask/轨迹与 collision detection 的可验证 reward，并以 Mimicry–Discovery Cycle 在稳定模仿与物理探索之间切换，避免纯 RL 崩溃。",
    "pipeline": {
      "input": "初始图像/视频、物理运动条件、对象 masks 与刚体轨迹/碰撞监督",
      "process": "Stage 1 将 Wan2.2-5B TI2V 全参适配为 V2V；Stage 2 用 PEFT 的 MDcycle，Mimicry branch 稳定训练，Discovery branch 以 physics reward 探索；混合 SDE/ODE 采样",
      "output": "碰撞、自由落体、摆动和滚动等物理一致视频",
      "details": "- **输入：** 初始图像/视频、物理运动条件、对象 masks 与刚体轨迹/碰撞监督\n- **过程：** Stage 1 将 Wan2.2-5B TI2V 全参适配为 V2V；Stage 2 用 PEFT 的 MDcycle，Mimicry branch 稳定训练，Discovery branch 以 physics reward 探索；混合 SDE/ODE 采样\n- **输出：** 碰撞、自由落体、摆动和滚动等物理一致视频"
    },
    "experiments": "PhysRVGBench 上论文报告 PhysRVG IoU 0.64、trajectory offset 15.03；表中 Magi-1 为 0.27/113.42。VBench/VideoPhy2 多项视觉与物理指标同时报告。消融显示纯 RL 前 50 steps 不稳，MDcycle 收敛更平滑；16K FT+250 MD steps 达 0.64/15.03，继续到 30K FT 几乎不增益。训练使用 4×8 张 H20；作者指出即使 effective batch 640，全参数 RL 仍会崩溃。",
    "evidence_notes": "",
    "code_data_status": "训练/推理代码和 Hugging Face 权重已公开；模型页包含 DiT/LoRA 与 SAM2 依赖。Stage 1 使用开源与 proprietary video collections，完整数据可复现性仍受限制。",
    "limitations": "- 训练成本高：32 张 H20，且高维 RL 仍不稳定。\n- 主要覆盖四类刚体运动，非刚体/流体/多接触未证明。\n- reward 依赖分割与轨迹估计，可被感知错误或捷径利用。\n- 物理指标改善不自动转化为机器人策略或反事实规划能力。",
    "comments": "",
    "source_reports": [
      "report-d2be249044"
    ],
    "deleted": false,
    "updated_at": "2026-09-03",
    "challenges": "像素重建式 finetuning 会把正确物理约束当作众多条件之一；直接对高维视频做 RL 又因奖励稀疏、batch 小和早期低质采样而不稳定，碰撞尤其容易被错误轨迹蒙混。",
    "motivation": "设计基于对象 mask/轨迹与 collision detection 的可验证 reward，并以 Mimicry–Discovery Cycle 在稳定模仿与物理探索之间切换，避免纯 RL 崩溃。",
    "technical_approach": "- **输入：** 初始图像/视频、物理运动条件、对象 masks 与刚体轨迹/碰撞监督\n- **过程：** Stage 1 将 Wan2.2-5B TI2V 全参适配为 V2V；Stage 2 用 PEFT 的 MDcycle，Mimicry branch 稳定训练，Discovery branch 以 physics reward 探索；混合 SDE/ODE 采样\n- **输出：** 碰撞、自由落体、摆动和滚动等物理一致视频",
    "discussion": "PhysRVG 的关键贡献是可验证刚体 reward 与稳定 video RL，而非通用世界模型。碰撞 reward 能减少消失和错误轨迹，但 reward 只编码覆盖到的运动族，可能出现 metric gaming 或对新机制失效。",
    "arxiv": {
      "published": "2026-01-16T08:40:10Z",
      "revised_at": "2026-01-16T08:40:10Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2607-05373",
    "title": "PixWorld: Unifying 3D Scene Generation and Reconstruction in Pixel Space",
    "authors": [
      "Sensen Gao",
      "Zhaoqing Wang",
      "Qihang Cao",
      "Dongdong Yu",
      "Changhu Wang",
      "Jia-Wang Bian"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本",
    "arxiv_id": "2607.05373",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2607.05373",
      "project": "https://sensengao.github.io/PixWorld/",
      "code": "https://github.com/SensenGao/PixWorld",
      "data": "https://huggingface.co/datasets/Sensen02/NVS-Refined",
      "alphaxiv": "https://alphaxiv.org/abs/2607.05373"
    },
    "tags": [
      "3D/4D",
      "世界模型"
    ],
    "figure": {
      "url": "content/images/2607.05373-main.webp",
      "alt": "Figure 2：方法总览",
      "label": "Figure 2 · 方法总览",
      "paper_title": "PixWorld: Unifying 3D Scene Generation and Reconstruction in Pixel Space",
      "source_url": "https://arxiv.org/html/2607.05373v1/pix_method_v4.png"
    },
    "summary": "PixWorld 用一个像素空间 flow 模型统一已知视图重建和未知视图生成，把预测的 3DGS 通过可微渲染送回训练目标。几何感知损失进一步约束多视图结构，使学习信号直接经过输出资产。",
    "insight": "PixWorld 用一个像素空间 flow 模型统一已知视图重建和未知视图生成，把预测的 3DGS 通过可微渲染送回训练目标。几何感知损失进一步约束多视图结构，使学习信号直接经过输出资产。\n\n## 核心 Insight\n\n把多视图分成干净观测和带噪待生成视图，就能用同一网络连续覆盖重建和生成。这里“像素空间”指扩散变量与监督所在的 RGB 域，网络仍学习中间特征，最终输出仍是显式三维高斯；它不是直接在高斯参数上扩散。",
    "pipeline": {
      "input": "至少一张干净图像、带相机参数的视图集合，以及可选文本；待生成视图用噪声初始化。",
      "process": "干净/含噪双流 token → 联合注意力 → 深度与高斯属性 → 反投影聚合 3DGS → 多视图渲染上的 flow、感知和几何监督。",
      "output": "像素对齐 3D Gaussian 场景及其新视角渲染。全干净输入对应重建，混合输入对应条件生成。",
      "details": "**输入**：至少一张干净图像、带相机参数的视图集合，以及可选文本；待生成视图用噪声初始化。\n\n**过程**：干净/含噪双流 token → 联合注意力 → 深度与高斯属性 → 反投影聚合 3DGS → 多视图渲染上的 flow、感知和几何监督。\n\n**输出**：像素对齐 3D Gaussian 场景及其新视角渲染。全干净输入对应重建，混合输入对应条件生成。\n\n**统一条件机制。**干净流和含噪流采用不同输入投影，经过联合注意力处理；干净流时间固定为去噪终点，含噪流使用随机 flow 时间。相机通过 PRoPE 注入，文本经 cross-attention 注入。网络预测逐像素深度，用给定相机反投影得到高斯中心，而非直接回归任意全局 XYZ。\n\n**监督实际落点。**干净视图渲染使用 MSE；含噪视图把渲染图转成速度目标，对应带时间权重的像素误差。另采样 4–8 个新视图监督重渲染，并以 DA3 伪深度约束深度头。LPIPS 和几何特征损失只在 t>0.3 时启用，避免在接近纯噪声的阶段强行匹配不可靠结构。\n\n**几何感知损失。**冻结的 π³ 对渲染视图和真值视图提取多视图几何特征，以逐位置余弦距离对齐；真值分支停止梯度，渲染分支保留回传。它提供结构先验，但依然是学习式教师，并非精确三维真值。\n\n**训练配置。**约 1.044B 参数，从头训练；RE10K 与 DL3DV 约 67K 场景，另外使用 BLIP-3o 的 10M 单图学习外观。主训练分辨率 336×448、约 200K 步、32 张 A800 80GB。去掉 VAE/RAE 阶段不意味着总体训练便宜，也不能忽略额外单图数据。\n\n[方法与训练协议](https://arxiv.org/html/2607.05373v1#S3)"
    },
    "experiments": "RE10K、DL3DV 各选 200 个大位姿变化场景；单图生成混合首帧前向与中间帧双向两种协议，双图生成混合插值与外推。所有生成基线都接收相机，除 LVSM 外还接收文本。重建用 4/8 张已标定视图，WorldScore 使用官方静态 2000 场景。\n\n| 原文设置 | PixWorld | 对照 | 能支持的结论 |\n| --- | --- | --- | --- |\n| RE10K，4 视图重建，PSNR / LPIPS | 26.21 / 0.138 | YoNoSplat with-pose 25.86 / 0.143 | 已标定稀疏视图下具有竞争力 |\n| RE10K，单图生成，PSNR / AUC@5 | 18.88 / 0.614 | Gen3R 17.59 / 0.147 | 在本文重跑的混合轨迹协议下更好 |\n| RE10K，双图生成，PSNR | 23.54 | LVSM 23.61 | 并非所有保真指标最佳 |\n| WorldScore 静态平均分 | 71.04 | FlashWorld 70.85 | 总分小幅领先；不代表各分项领先 |\n| 移除几何感知损失，RE10K 单图 AUC@5 | 完整模型 0.642 | 移除后 0.562 | 结构监督有贡献；这是独立消融协议 |\n\n相机 AUC 由 π³ 从生成图像估计；训练也使用 π³ 特征，故需要独立后端或真实几何补充检验。Gen3R 原论文的 RE10K PSNR 与此处不同，因为采样、视角跨度和轨迹协议不同，不能把不同论文的数字直接拼成排名。WorldScore 的 Object Control、Content Alignment、Subjective Quality 等分项中本方法并非全部最好。\n\n论文附录报告 RTX 4090 上 8 个关键帧、100 NFE 的场景生成约 15 秒；对照有不同关键帧数量，不能据此直接计算同等输出的速度比。官方仓库另展示四步蒸馏约 0.6 秒，这是不同版本声明，不能回填为论文主实验的速度。\n\n[主表、消融及速度附录](https://arxiv.org/html/2607.05373v1#S4)",
    "evidence_notes": "已核验原文方法、实验表格与官方资源；未独立复现实验",
    "code_data_status": "截至核验时，官方仓库存在，NVS-Refined 数据集入口已发布；README 的四步蒸馏权重和推理代码仍列为待发布。**仓库可访问不等于模型完整可复现**。主论文训练数据配置与后来发布的数据整理也应分别记录。",
    "limitations": "相机是重要输入条件；本文不是未知相机的一般 SfM 替代。像素监督仍存在遮挡、透明物体和重渲染歧义，π³/DA3 先验并未消除它们。评测主要针对静态场景与视角变化，不直接证明动态对象运动、碰撞或动作响应；随机种子方差与跨后端几何评估仍需补充。",
    "comments": "",
    "source_reports": [],
    "deleted": false,
    "updated_at": "2026-09-24",
    "challenges": "潜空间生成把优化目标放在中间特征上，最终可渲染三维资产受到 codec 信息瓶颈和解码误差影响。高保真重建尤其需要保留输入细节；另一方面，仅靠 RGB 重渲染又可能以漂浮高斯或错误深度获得好看的图像。",
    "motivation": "PixWorld 用一个像素空间 flow 模型统一已知视图重建和未知视图生成，把预测的 3DGS 通过可微渲染送回训练目标。几何感知损失进一步约束多视图结构，使学习信号直接经过输出资产。\n\n## 核心 Insight\n\n把多视图分成干净观测和带噪待生成视图，就能用同一网络连续覆盖重建和生成。这里“像素空间”指扩散变量与监督所在的 RGB 域，网络仍学习中间特征，最终输出仍是显式三维高斯；它不是直接在高斯参数上扩散。",
    "technical_approach": "**输入**：至少一张干净图像、带相机参数的视图集合，以及可选文本；待生成视图用噪声初始化。\n\n**过程**：干净/含噪双流 token → 联合注意力 → 深度与高斯属性 → 反投影聚合 3DGS → 多视图渲染上的 flow、感知和几何监督。\n\n**输出**：像素对齐 3D Gaussian 场景及其新视角渲染。全干净输入对应重建，混合输入对应条件生成。\n\n**统一条件机制。**干净流和含噪流采用不同输入投影，经过联合注意力处理；干净流时间固定为去噪终点，含噪流使用随机 flow 时间。相机通过 PRoPE 注入，文本经 cross-attention 注入。网络预测逐像素深度，用给定相机反投影得到高斯中心，而非直接回归任意全局 XYZ。\n\n**监督实际落点。**干净视图渲染使用 MSE；含噪视图把渲染图转成速度目标，对应带时间权重的像素误差。另采样 4–8 个新视图监督重渲染，并以 DA3 伪深度约束深度头。LPIPS 和几何特征损失只在 t>0.3 时启用，避免在接近纯噪声的阶段强行匹配不可靠结构。\n\n**几何感知损失。**冻结的 π³ 对渲染视图和真值视图提取多视图几何特征，以逐位置余弦距离对齐；真值分支停止梯度，渲染分支保留回传。它提供结构先验，但依然是学习式教师，并非精确三维真值。\n\n**训练配置。**约 1.044B 参数，从头训练；RE10K 与 DL3DV 约 67K 场景，另外使用 BLIP-3o 的 10M 单图学习外观。主训练分辨率 336×448、约 200K 步、32 张 A800 80GB。去掉 VAE/RAE 阶段不意味着总体训练便宜，也不能忽略额外单图数据。\n\n[方法与训练协议](https://arxiv.org/html/2607.05373v1#S3)",
    "discussion": "**阅读者分析**：PixWorld 的实质进展是缩短生成目标到显式可渲染资产的监督路径。它与 GAE 不是同一路线的大小版本：GAE 改善潜空间，PixWorld 绕开独立 codec。应在匹配数据、分辨率、算力、相机权限和输出数量后，才讨论哪一种设计更优。",
    "arxiv": {
      "published": "2026-07-06",
      "revised_at": "2026-07-06",
      "primary_category": "cs.CV"
    },
    "source_papers": [
      "content/papers/2607.05373.md"
    ]
  },
  {
    "id": "arxiv-2608-23720",
    "title": "Platonic Representation Hypothesis on World Models",
    "authors": [
      "Wenhow Li",
      "Chengwei Ma",
      "Hui Xiong",
      "Ying-Cong Chen",
      "Lei Zhang"
    ],
    "year": 2026,
    "publication": "2026，arXiv",
    "arxiv_id": "2608.23720",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.23720",
      "project": "https://sellerbubble.github.io/platonic-representation-hypothesis-on-world-models/",
      "alphaxiv": "https://alphaxiv.org/abs/2608.23720"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "流式与自回归",
      "第一视角与人类视频",
      "长时记忆"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.23720v2/images/good.jpg",
      "alt": "Platonic Representation Hypothesis on World Models 代表图",
      "label": "Figure 1 : The Platonic Representation Hypothesis on World Models. World models initialized from heterogeneous visual priors are optimized under the same transition objective ( s t → s t + 1 s {t} to s {t+1} ). Predictive consistency acts as a selective pressure that can drive their internal predictor representations toward a shared latent structure. 来源：论文图",
      "paper_title": "Platonic Representation Hypothesis on World Models",
      "source_url": "https://arxiv.org/html/2608.23720v2/images/good.jpg"
    },
    "summary": "论文提出 Predictive Consistency Assumption：共享状态转移预测目标会促使使用不同视觉编码器的世界模型形成几何相似、可映射的潜在结构。核心贡献不是新生成器，而是把“表征趋同”与可执行的 model stitching 联系起来。",
    "insight": "论文提出 Predictive Consistency Assumption：共享状态转移预测目标会促使使用不同视觉编码器的世界模型形成几何相似、可映射的潜在结构。核心贡献不是新生成器，而是把“表征趋同”与可执行的 model stitching 联系起来。",
    "pipeline": {
      "input": "相同动力学任务上使用不同视觉编码器训练的 DINO-WM。",
      "process": "比较内部表征几何；学习跨模型特征映射；将一个模型的中间表征拼接到另一个模型后测量预测/控制性能变化。",
      "output": "表征相似度、拼接兼容性及任务性能。",
      "details": "**输入**：相同动力学任务上使用不同视觉编码器训练的 DINO-WM。\n\n**过程**：比较内部表征几何；学习跨模型特征映射；将一个模型的中间表征拼接到另一个模型后测量预测/控制性能变化。\n\n**输出**：表征相似度、拼接兼容性及任务性能。"
    },
    "experiments": "异构编码器模型出现更接近的内部几何，且线性/受限映射后的拼接只产生有限性能下降，支持“存在转移兼容结构”。这不证明所有世界模型收敛到唯一真实世界表征，也不排除共同数据和目标诱导的表面同构。",
    "evidence_notes": "",
    "code_data_status": "项目页可访问；完整代码、权重和逐实验配置未核验为公开。",
    "limitations": "实验集中在 DINO-WM 家族及共享预测目标；对生成式视频 WAM、多模态动作模型和不同数据分布的可迁移性未知。表征相似性是相关证据，不是因果识别。\n\n### 与知域的关系\n\n为 VGGT/DynamicVGGT、WAM 和动作表征之间共享 latent space 的研究提供分析工具，可能支持跨骨干拼接、蒸馏和模块复用。",
    "comments": "",
    "source_reports": [
      "report-a141624b1e"
    ],
    "deleted": false,
    "updated_at": "2026-08-31",
    "arxiv": {
      "published": "2026-08-24T18:08:30Z",
      "revised_at": "2026-08-26T03:46:21Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2606-03943",
    "title": "PointAction: 3D Points as Universal Action Representations for Robot Control",
    "authors": [
      "Mutian Tong",
      "Han Jiang",
      "Qiao Feng",
      "Lingjie Liu",
      "Jiatao Gu"
    ],
    "year": 2026,
    "publication": "2026，arXiv preprint",
    "arxiv_id": "2606.03943",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2606.03943",
      "project": "https://oriontmt.github.io/pointaction/",
      "code": "https://github.com/GMLR-Penn/PointAction",
      "alphaxiv": "https://alphaxiv.org/abs/2606.03943"
    },
    "tags": [
      "3D/4D",
      "VLA",
      "世界模型",
      "动作表征",
      "机器人学习",
      "跨本体迁移"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2606.03943/x1.png",
      "alt": "PointAction Fig. 1",
      "label": "PointAction，Fig. 1，RGB 与动态 3D pointmap 联合生成并解码动作。来源：Fig. 1 原图",
      "paper_title": "PointAction: 3D Points as Universal Action Representations for Robot Control",
      "source_url": "https://arxiv.org/html/2606.03943/x1.png"
    },
    "summary": "作者把动态、像素对齐的 XYZ pointmap 作为通用中间动作：大型模型负责预测场景与机器人 4D 运动，小型本体专属 decoder 再映射低层动作。与纯几何输入 VLA 不同，这里的 3D points 是预测输出和控制接口，直接属于 geometry action。",
    "insight": "作者把动态、像素对齐的 XYZ pointmap 作为通用中间动作：大型模型负责预测场景与机器人 4D 运动，小型本体专属 decoder 再映射低层动作。与纯几何输入 VLA 不同，这里的 3D points 是预测输出和控制接口，直接属于 geometry action。",
    "pipeline": {
      "input": "当前 RGB 和语言；动作解码器另接生成视频中的机器人 XYZ 轨迹与当前本体状态。",
      "process": "从 LVP 初始化，冻结 VAE 分别编码 RGB/XYZ，并在 latent 宽度拼接，以 LoRA+flow matching 联合生成。SAM 3 用“robot”提示分割生成 RGB，保留机器人表面 XYZ，每帧 FPS 采 512 点；PointNet 风格特征和 6-block DiT 以 DDIM 生成动作。",
      "output": "49 帧 RGB、像素对齐 XYZ pointmap、目标机器人 49 步动作。",
      "details": "- **输入：** 当前 RGB 和语言；动作解码器另接生成视频中的机器人 XYZ 轨迹与当前本体状态。\n- **过程：** 从 LVP 初始化，冻结 VAE 分别编码 RGB/XYZ，并在 latent 宽度拼接，以 LoRA+flow matching 联合生成。SAM 3 用“robot”提示分割生成 RGB，保留机器人表面 XYZ，每帧 FPS 采 512 点；PointNet 风格特征和 6-block DiT 以 DDIM 生成动作。\n- **输出：** 49 帧 RGB、像素对齐 XYZ pointmap、目标机器人 49 步动作。"
    },
    "experiments": "预训练约 75k 轨迹（DROID 50k、BridgeData V2 25k）。RoboCasa365 的 ID/OOD-Env/OOD-Task 成功率为 47.7/44.1/17.0，Cosmos Policy 为 45.2/42.9/14.0；每单元 100 rollout。xArm7 三任务各 50 demos、100 tests，PointAction 平均 43.0%，π0.5 为 22.7%；YAM 各 20 demos/20 tests 也领先。\n\nRGB-only 为 25.1/20.3，机器人 XYZ 37.2/30.9，联合生成机器人 XYZ 47.7/44.1；DA3 后处理 XYZ 仅 28.4/21.7，支持联合动态几何的重要性。公平性风险是 PointAction 使用额外深度、分割和 4D supervision，主表/附录的 GR00T 与 π 版本还有不一致。单次 49 帧生成在一张 B200 上约 6 分钟、40-step UniPC，不是实时闭环；未报告预训练总算力。",
    "evidence_notes": "",
    "code_data_status": "GitHub 已建立，但核验时 README 仍称代码整理中，不能视为完整开源。DROID、BridgeData V2 可获得；处理后的 75k 语料、真实数据和 checkpoint 未核验公开。",
    "limitations": "- 单次推理约 6 分钟且 49 步开环，无法在线纠错。\n- SAM 3 分割和自遮挡会破坏点轨迹。\n- 深度伪标签可能有系统偏差。\n- 新本体仍需数据、decoder 与后训练。\n- OOD 任务成功率低，缺少统计显著性。",
    "comments": "",
    "source_reports": [
      "report-a77d9a7ad6"
    ],
    "deleted": false,
    "updated_at": "2026-08-21",
    "challenges": "RGB rollout 无法唯一确定 metric 3D motion、接触几何与精细空间约束，因而难直接落地成动作；跨任务/本体收集 action supervision 又昂贵。本文针对的是“视频未来怎样变”与“目标机器人具体怎样动”之间的 grounding gap。",
    "motivation": "作者把动态、像素对齐的 XYZ pointmap 作为通用中间动作：大型模型负责预测场景与机器人 4D 运动，小型本体专属 decoder 再映射低层动作。与纯几何输入 VLA 不同，这里的 3D points 是预测输出和控制接口，直接属于 geometry action。",
    "technical_approach": "- **输入：** 当前 RGB 和语言；动作解码器另接生成视频中的机器人 XYZ 轨迹与当前本体状态。\n- **过程：** 从 LVP 初始化，冻结 VAE 分别编码 RGB/XYZ，并在 latent 宽度拼接，以 LoRA+flow matching 联合生成。SAM 3 用“robot”提示分割生成 RGB，保留机器人表面 XYZ，每帧 FPS 采 512 点；PointNet 风格特征和 6-block DiT 以 DDIM 生成动作。\n- **输出：** 49 帧 RGB、像素对齐 XYZ pointmap、目标机器人 49 步动作。",
    "discussion": "PointAction 对“3D 中间动作有助于控制”提供本专题最直接的真实机器人证据，但“universal”需要限定：每个新本体仍需专属 decoder 与数据。OOD-Task 绝对成功率仅 17%，CoffeeServeMug 甚至只有 2%，跨任务问题远未解决。",
    "arxiv": {
      "published": "2026-06-02T17:30:50Z",
      "revised_at": "2026-06-02T17:30:50Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2608-24115",
    "title": "PonderPounce: A Pretrained MLLM as an Episode Context Engine for Robot Control",
    "authors": [
      "Suhwan Choi",
      "Jaeyoon Jung",
      "Sungkyung Kim",
      "Yunsung Lee",
      "Youngjae Yu"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本（v1：2026-08-25）",
    "arxiv_id": "2608.24115",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.24115",
      "project": "https://worv-ai.github.io/ponderpounce/",
      "alphaxiv": "https://alphaxiv.org/abs/2608.24115"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "机器人学习",
      "流式与自回归",
      "第一视角与人类视频",
      "适应与泛化",
      "长时记忆"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.24115v1/figures/PP-Title.png",
      "alt": "PonderPounce: A Pretrained MLLM as an Episode Context Engine for Robot Control 代表图",
      "label": "Figure 1: Pretrained MLLM context as scalable robot memory. Unlike designs processing context within the controller or through purpose-built memory, PonderPounce retains history in Ponder ’s context and asynchronously routes cognition to Pounce . This separation keeps context processing off the action path and lets System 2 scale without changing the controller architecture.。来源：原图",
      "paper_title": "PonderPounce: A Pretrained MLLM as an Episode Context Engine for Robot Control",
      "source_url": "https://arxiv.org/html/2608.24115v1/figures/PP-Title.png"
    },
    "summary": "PonderPounce 把具身 ICL 扩展为更宽的 episode-context learning：上下文不仅是任务前给定的演示，还包括执行过程中不断累积的观察、先前 cognition 和部分可见事件。慢系统 Ponder 用预训练 MLLM 的原生 causal context 保存这些信息，快系统 Pounce 不重读全部历史，只接收最新连续 cognition token 及其 age。其关键假设是：MLLM 预训练获得的长上下文整合能力可以通过低带宽 latent 接口迁移给机器人控制器。",
    "insight": "PonderPounce 把具身 ICL 扩展为更宽的 episode-context learning：上下文不仅是任务前给定的演示，还包括执行过程中不断累积的观察、先前 cognition 和部分可见事件。慢系统 Ponder 用预训练 MLLM 的原生 causal context 保存这些信息，快系统 Pounce 不重读全部历史，只接收最新连续 cognition token 及其 age。其关键假设是：MLLM 预训练获得的长上下文整合能力可以通过低带宽 latent 接口迁移给机器人控制器。",
    "pipeline": {
      "input": "指令、可选演示、持续追加的 episode 观察、当前本体状态。",
      "process": "Ponder 以 append-only causal context 累积历史，并在较慢时钟上产生 transition 判断、内部子目标/演示推理及 cognition carrier；Pounce 在快时钟上接收当前观察、指令、本体状态、最新 cognition 与其陈旧年龄，flow matching 生成动作；两者联合端到端训练，部署中通过 KV cache 与异步调度避免反复编码全部上下文。",
      "output": "20Hz 回放的动作 chunk，以及只在内部使用的 cognition/子目标状态。",
      "details": "- **输入**：指令、可选演示、持续追加的 episode 观察、当前本体状态。\n- **过程**：Ponder 以 append-only causal context 累积历史，并在较慢时钟上产生 transition 判断、内部子目标/演示推理及 cognition carrier；Pounce 在快时钟上接收当前观察、指令、本体状态、最新 cognition 与其陈旧年龄，flow matching 生成动作；两者联合端到端训练，部署中通过 KV cache 与异步调度避免反复编码全部上下文。\n- **输出**：20Hz 回放的动作 chunk，以及只在内部使用的 cognition/子目标状态。"
    },
    "experiments": "RoboMME 16 个记忆任务、每任务 50 个 episode，PonderPounce 在基础数据规模上平均 60.83%，9× 数据上 75.54%；FrameSamp+Modul 分别为 44.51% 和 57.88%。在相同 Pounce 架构和接口下，9B context engine 比 0.8B 高 10.79 个百分点，但这只证明规模相关，不隔离参数量、预训练质量和优化差异。RoboCasa-DC 五个 held-out demonstration-conditioned 任务上，PonderPounce 为 12.5%±0.9%，SeeTraceAct 为 11.6%；关闭 cognition 降至 8.6%±0.4%。绝对成功率较低，且公开 baseline 无误差条，不能据此声称广泛领先。持续刷新干预显示只在 transition 更新 cognition 会从 60.83% 降至 1.83%，说明当前 checkpoint 强依赖高频上下文更新。",
    "evidence_notes": "",
    "code_data_status": "项目页公开，但本轮未核验到代码或权重。系统推理延迟报告为 cognition refresh p50 78 ms、action invocation 25 ms，并借助 KV cache 与 fused kernel 支持 20Hz 动作播放；这属于作者环境的 batch-1 测量，不等于并发吞吐或端侧成本。RoboMME 使用模拟器派生的 transition、subgoal 与 demonstration-reasoning 标注，监督成本未量化。",
    "limitations": "仅评测两个模拟 benchmark，缺少真实机器人验证；9B MLLM 加 3–3.6B controller 的训练和推理成本高；上下文限制为 16K token；RoboMME baseline 未获得同等推理监督，架构与监督因素纠缠；连续 cognition 与单独训练的文本子目标接口性能差异小于运行间波动。需要用相同监督预算、错配演示、历史反事实、长期上下文溢出和真实延迟测试来判断其 ICL 能力。\n\n### 与知域的关系\n\nPonderPounce 位于 ICL、具身记忆和 fast-slow VLA 的交叉点。与 Zero-WAM/RA-VLA 的部署前示范上下文不同，它强调执行期间持续更新的 episode context；与 RoboTTT 的部署时 fast-weight 更新不同，它在推理阶段保持模型参数不变，只更新 causal cache 和 cognition。因此知域应把“token/cache 状态适应”和“参数状态适应”分开索引。",
    "comments": "",
    "source_reports": [
      "report-1950a5754f",
      "report-a141624b1e"
    ],
    "deleted": false,
    "updated_at": "2026-08-31",
    "arxiv": {
      "published": "2026-08-25T06:24:36Z",
      "revised_at": "2026-08-25T06:24:36Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2609-04200",
    "title": "Principia: Relational Physics Tests for Video Models",
    "authors": [
      "Varun Varma Thozhiyoor",
      "Shivam Tripathi",
      "Venkatesh Babu Radhakrishnan",
      "Anand Bhattad"
    ],
    "year": 2026,
    "publication": "2026，arXiv",
    "arxiv_id": "2609.04200",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2609.04200",
      "project": "https://principiabench.github.io/",
      "alphaxiv": "https://alphaxiv.org/abs/2609.04200"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "流式与自回归",
      "物理建模与仿真",
      "第一视角与人类视频",
      "视频生成",
      "跨本体迁移"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2609.04200v1/dataset_teaser3.png",
      "alt": "Principia 关系物理评测数据概览",
      "label": "Principia 关系物理评测数据概览；来源：论文原图",
      "paper_title": "Principia: Relational Physics Tests for Video Models",
      "source_url": "https://arxiv.org/html/2609.04200v1/dataset_teaser3.png"
    },
    "summary": "Principia 不依赖绝对尺度、帧率或相机标定，而是评估同一场景中两个物体之间是否遵循相同物理规律。benchmark 覆盖重力、恢复系数、摩擦、转动惯量、抛体运动、动量、摆和弹簧等现象。",
    "insight": "Principia 不依赖绝对尺度、帧率或相机标定，而是评估同一场景中两个物体之间是否遵循相同物理规律。benchmark 覆盖重力、恢复系数、摩擦、转动惯量、抛体运动、动量、摆和弹簧等现象。",
    "pipeline": {
      "input": "真实或生成视频、物体轨迹和物理关系。",
      "process": "提取对象运动，计算标定无关的关系一致性，判断生成结果是否违反物理规律。",
      "output": "关系物理一致性分数及按现象划分的评测结果。",
      "details": "**输入**：真实或生成视频、物体轨迹和物理关系。\n\n**过程**：提取对象运动，计算标定无关的关系一致性，判断生成结果是否违反物理规律。\n\n**输出**：关系物理一致性分数及按现象划分的评测结果。"
    },
    "experiments": "摘要报告多个视频生成模型在 Principia 上最高分不超过 0.42，而 VBench 约为 0.8；VLM 物理违规识别最高准确率为 67%。这些结果支持\"视觉流畅不等于物理可靠\"，但需要核验生成样本数量、提示词和评分细节。",
    "evidence_notes": "",
    "code_data_status": "项目页已公开，代码和数据的具体开放范围待人工检查。",
    "limitations": "- 关系物理覆盖有限，不能替代所有世界状态评估。\n- 从视频中提取对象和轨迹本身可能引入误差。\n- 真实视频与生成视频的摄影条件差异可能影响比较。\n\n### 与知域的关系\n\nPrincipia 为知域的物理世界模型和视频生成评估提供了比 VBench 更针对物理关系的补充指标。",
    "comments": "",
    "source_reports": [
      "report-0d81d19c6c"
    ],
    "deleted": false,
    "updated_at": "2026-09-08",
    "arxiv": {
      "published": "2026-09-03T17:59:50Z",
      "revised_at": "2026-09-03T17:59:50Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2609-10540",
    "title": "Programmable World Model",
    "authors": [
      "Zheng-Hui Huang",
      "Guixu Lin",
      "Jiacheng Lin",
      "Yi-Chuan Huang",
      "Ruihan Yu",
      "Muyao Niu",
      "Siqi Yang",
      "Yu-Lun Liu",
      "Yung-Yu Chuang",
      "Kaipeng Zhang",
      "Zhixiang Wang"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本，v1",
    "arxiv_id": "2609.10540",
    "doi": "10.48550/arXiv.2609.10540",
    "links": {
      "paper": "https://arxiv.org/abs/2609.10540",
      "project": "https://alaya-lab.github.io/pwm",
      "code": "https://github.com/AlayaLab/pwm",
      "alphaxiv": "https://alphaxiv.org/abs/2609.10540"
    },
    "tags": [
      "Agent与可执行世界",
      "世界模型",
      "视频生成"
    ],
    "figure": {
      "url": "content/images/2609.10540-representative.webp",
      "alt": "Figure 3",
      "label": "Figure 3",
      "paper_title": "Programmable World Model",
      "source_url": "https://arxiv.org/html/2609.10540v1#S4.F3"
    },
    "summary": "视频世界模型生成越来越真实的交互体验，但缺乏可靠机制在长交互中维持持久世界状态与执行可编程规则。Programmable World Model 把世界状态演化与视觉观测生成解耦：Agent 把 NL 指令翻译成可执行程序，指定实体状态与状态转移规则，直接控制个体实体及其交互；轻量引擎执行程序，更新并维护显式、持久的全局世界状态（包括屏外实体与非视觉属性）。为连接世界状态与视觉生成，引入 state-augmented 3D OBB 作为中间表示，与目标相机轨迹一起确定性编译成像素对齐的时空条件信号，供预训练视频模型（生成渲染器）使用。",
    "insight": "视频世界模型生成越来越真实的交互体验，但缺乏可靠机制在长交互中维持持久世界状态与执行可编程规则。Programmable World Model 把世界状态演化与视觉观测生成解耦：Agent 把 NL 指令翻译成可执行程序，指定实体状态与状态转移规则，直接控制个体实体及其交互；轻量引擎执行程序，更新并维护显式、持久的全局世界状态（包括屏外实体与非视觉属性）。为连接世界状态与视觉生成，引入 state-augmented 3D OBB 作为中间表示，与目标相机轨迹一起确定性编译成像素对齐的时空条件信号，供预训练视频模型（生成渲染器）使用。",
    "pipeline": {
      "input": "自然语言指令（+ 初始场景）。",
      "process": "NL→可执行程序（实体状态+转移规则）→ 轻量引擎执行，维护显式全局状态（含屏外/非视觉属性）→ 状态+3D OBB → 像素对齐时空条件 → 预训练视频模型渲染。",
      "output": "遵循可编程规则的交互式视觉序列，状态可查询/可干预。",
      "details": "**输入**：自然语言指令（+ 初始场景）。\n**过程**：NL→可执行程序（实体状态+转移规则）→ 轻量引擎执行，维护显式全局状态（含屏外/非视觉属性）→ 状态+3D OBB → 像素对齐时空条件 → 预训练视频模型渲染。\n**输出**：遵循可编程规则的交互式视觉序列，状态可查询/可干预。"
    },
    "experiments": "正文表 1 在 50 个 CombatStateBench 片段上评价视觉质量与状态：Count Accuracy 为 94.00%，State Accuracy 为 98.00%，对比 LingBot-World-V2 的 40.75%/8.00% 和 YUME 的 32.00%/58.00%。计数评估覆盖 400 个抽样帧，状态评估覆盖 50 个死亡事件、每事件 3 个转换后帧。结果支持显式状态对该程序化场景的一致性约束；视觉生成器遵循外部已定义规则，不等于从观测中识别出了真实物理机制。 [正文实验与表格](https://arxiv.org/html/2609.10540v1)。",
    "evidence_notes": "2026-09-14 已核对 arXiv 元数据、正文主要实验与对照；未运行复现实验。",
    "code_data_status": "当前仓库仅见 README 与 assets，尚不能认定训练/推理代码可复现。 以上状态核验于 2026-09-14；入口和目录存在不等于已经运行复现实验。",
    "limitations": "程序提供状态和转移规则，实验集中在 CombatStateBench；规则不完整、外部状态估计错误和连续接触动力学会限制迁移。",
    "comments": "",
    "source_reports": [
      "report-37b94c4145"
    ],
    "deleted": false,
    "updated_at": "2026-09-14",
    "discussion": "命中「世界模型中的显式状态」趋势，与 TourPhysics（#10）、World in World（#8）构成「世界模型外挂机制」三方案：物理模拟（TourPhysics）、程序状态（PWM）、推理期接口（WiW）。对知域 world model 专题是状态建模路线的新证据。",
    "arxiv": {
      "published": "2026-09-09T17:59:32Z",
      "revised_at": "2026-09-09T17:59:32Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2512-05564",
    "title": "ProPhy: Progressive Physical Alignment for Dynamic World Simulation",
    "authors": [
      "Zijun Wang",
      "Panwen Hu",
      "Jing Wang",
      "Terry Jingchen Zhang",
      "Yuhao Cheng",
      "Long Chen",
      "Yiqiang Yan",
      "Zutao Jiang",
      "Hanhui Li",
      "Xiaodan Liang"
    ],
    "year": 2026,
    "publication": "2026，CVPR 2026 Oral；arXiv:2512.05564；正式 DOI 待核",
    "arxiv_id": "2512.05564",
    "doi": "",
    "links": {
      "publication": "https://openaccess.thecvf.com/content/CVPR2026/papers/Wang_ProPhy_Progressive_Physical_Alignment_for_Dynamic_World_Simulation_CVPR_2026_paper.pdf",
      "paper": "https://arxiv.org/abs/2512.05564",
      "project": "https://zijunwa.github.io/prophy/",
      "code": "https://github.com/zijunwa/ProPhy",
      "alphaxiv": "https://alphaxiv.org/abs/2512.05564"
    },
    "tags": [
      "世界模型",
      "物理建模与仿真"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2512.05564v2/framework.png",
      "alt": "ProPhy Fig. 2",
      "label": "ProPhy，Fig. 2，渐进式物理对齐的动态世界模拟框架。来源：Fig. 2 原图",
      "paper_title": "ProPhy: Progressive Physical Alignment for Dynamic World Simulation",
      "source_url": "https://arxiv.org/html/2512.05564v2/framework.png"
    },
    "summary": "以两阶段 Mixture-of-Physics-Experts 先路由语义物理类别，再在 token level 选择 refinement experts；从 VLM 蒸馏物理属性，使不同专家专门化于不同现象。",
    "insight": "以两阶段 Mixture-of-Physics-Experts 先路由语义物理类别，再在 token level 选择 refinement experts；从 VLM 蒸馏物理属性，使不同专家专门化于不同现象。",
    "pipeline": {
      "input": "文本 prompt、视频，以及 Qwen2.5-VL-32B 生成的 token-level physical annotations",
      "process": "Semantic Expert Block 学高层物理类别；Refinement Expert Block 做细粒度 token routing；relative/absolute alignment 与 load-balancing loss 将 VLM 判断迁移到 CogVideoX/Wan",
      "output": "physics-aware text-to-video 结果及可操控的 expert activations",
      "details": "- **输入：** 文本 prompt、视频，以及 Qwen2.5-VL-32B 生成的 token-level physical annotations\n- **过程：** Semantic Expert Block 学高层物理类别；Refinement Expert Block 做细粒度 token routing；relative/absolute alignment 与 load-balancing loss 将 VLM 判断迁移到 CogVideoX/Wan\n- **输出：** physics-aware text-to-video 结果及可操控的 expert activations"
    },
    "experiments": "训练从 WISA-80K 随机取 20K 视频，以 600 prompts 评 VideoPhy2/VBench。CogVideoX 加 ProPhy 后 VideoPhy2 Joint 指标报告提升 19.7%；Wan2.1-1.3B 的 PC/SA/Joint 从 57.8/30.0/24.8 提至 65.0/32.0/26.5。消融显示完整 PB+SEB+REB 最好。手工给对象路由错误 expert 会产生刚性车门像布料般变形，支持 experts 与物理属性相关；这仍不是因果变量可识别性的证明。",
    "evidence_notes": "",
    "code_data_status": "MIT 代码公开，包含 annotation 与 inference；官方 checkpoints 在 README 核验时仍标注 soon，训练依赖 WISA 数据和 Qwen2.5-VL-32B。",
    "limitations": "- VLM 物理知识可能含系统偏差和 hallucination。\n- benchmark 依赖 VLM/语义判分，缺少数值轨迹真值。\n- 20K 视频覆盖有限，复杂组合物理未充分验证。\n- expert specialization 相关性不能直接解释为物理定律发现。",
    "comments": "",
    "source_reports": [
      "report-d2be249044"
    ],
    "deleted": false,
    "updated_at": "2026-09-03",
    "challenges": "现有 T2V 对整段视频施加粗粒度物理条件，对局部物理事件响应近似各向同性，难处理碰撞、尘土、液体等不同区域和时刻的物理线索。",
    "motivation": "以两阶段 Mixture-of-Physics-Experts 先路由语义物理类别，再在 token level 选择 refinement experts；从 VLM 蒸馏物理属性，使不同专家专门化于不同现象。",
    "technical_approach": "- **输入：** 文本 prompt、视频，以及 Qwen2.5-VL-32B 生成的 token-level physical annotations\n- **过程：** Semantic Expert Block 学高层物理类别；Refinement Expert Block 做细粒度 token routing；relative/absolute alignment 与 load-balancing loss 将 VLM 判断迁移到 CogVideoX/Wan\n- **输出：** physics-aware text-to-video 结果及可操控的 expert activations",
    "discussion": "ProPhy 占据“progressive semantic-to-token physical alignment”位置。它提升文本视频的局部物理表现，但任务不是 action-conditioned rollout，也没有显式 simulator state。",
    "arxiv": {
      "published": "2025-12-05T09:39:26Z",
      "revised_at": "2026-04-12T02:52:57Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2609-04196",
    "title": "Puffin-World: Scaling a Unified Multimodal Model with Native 3D World States",
    "authors": [
      "Kang Liao",
      "Yihang Luo",
      "Xiao-Ming Wu",
      "Linyi Jin",
      "Size Wu",
      "Chunyu Lin",
      "Yao Zhao",
      "Fei Wang",
      "Wei Li",
      "Chen Change Loy"
    ],
    "year": 2026,
    "publication": "2026，arXiv",
    "arxiv_id": "2609.04196",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2609.04196",
      "project": "https://kangliao929.github.io/projects/puffin-world/",
      "code": "https://github.com/KangLiao929/Puffin",
      "data": "https://huggingface.co/collections/KangLiao/puffin-world",
      "model": "https://huggingface.co/collections/KangLiao/puffin-world",
      "alphaxiv": "https://alphaxiv.org/abs/2609.04196"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "流式与自回归",
      "物理建模与仿真",
      "第一视角与人类视频",
      "跨本体迁移"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2609.04196v1/teaser_new_sub1_crop.png",
      "alt": "Puffin-World 原生 3D 世界状态与多模态生成概览",
      "label": "Puffin-World 原生 3D 世界状态与多模态生成概览；来源：论文原图",
      "paper_title": "Puffin-World: Scaling a Unified Multimodal Model with Native 3D World States",
      "source_url": "https://arxiv.org/html/2609.04196v1/teaser_new_sub1_crop.png"
    },
    "summary": "Puffin-World 将物理状态、几何状态和外观状态作为统一模型中的原生世界状态，并使用 Omni-Camera 表示支持多种相机运动。论文还构建 Puffin-16M，包括约 1500 万 vision-language-camera triplets 和约 100 万条轨迹。",
    "insight": "Puffin-World 将物理状态、几何状态和外观状态作为统一模型中的原生世界状态，并使用 Omni-Camera 表示支持多种相机运动。论文还构建 Puffin-16M，包括约 1500 万 vision-language-camera triplets 和约 100 万条轨迹。\n\n摘要声称发布代码、模型和数据。",
    "pipeline": {
      "input": "图像、语言、相机参数、物理和几何条件。",
      "process": "联合建模重力场、纬度、深度和外观；传播未来物理动态；在生成未来视图的同时重建其几何。",
      "output": "未来视图、深度、物理状态和可交互世界表示。",
      "details": "**输入**：图像、语言、相机参数、物理和几何条件。\n\n**过程**：联合建模重力场、纬度、深度和外观；传播未来物理动态；在生成未来视图的同时重建其几何。\n\n**输出**：未来视图、深度、物理状态和可交互世界表示。"
    },
    "experiments": "摘要强调统一建模和规模化数据，但尚未核验：\n\n- Puffin-16M 的数据来源与训练测试划分；\n- 物理状态是否由真实传感器或模拟器提供；\n- 生成质量、几何质量和物理一致性的具体指标；\n- 与 VGGT、DynamicVGGT、世界视频模型的比较。",
    "evidence_notes": "",
    "code_data_status": "项目页确认 GitHub、模型和数据链接。Hugging Face 页面本次无法直接访问，权重和许可证待人工确认。",
    "limitations": "- 物理状态的显式表示可能依赖合成或弱标注数据。\n- 统一模型同时生成外观和几何，训练目标可能存在冲突。\n- 复杂动态场景中的绝对相机与物理状态估计仍需验证。\n\n### 与知域的关系\n\nPuffin-World 对知域的前馈重建、物理世界模型、3D/4D 生成和 Causal-JEPA 路线具有较强参考价值。",
    "comments": "",
    "source_reports": [
      "report-0d81d19c6c"
    ],
    "deleted": false,
    "updated_at": "2026-09-08",
    "arxiv": {
      "published": "2026-09-03T17:59:13Z",
      "revised_at": "2026-09-03T17:59:13Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2608-27328",
    "title": "R2M-Bench: Evaluating Revisit Memory via Relative Consistency in Interactive Video World Models",
    "authors": [
      "Qiwen Gu",
      "Bingjie Gao",
      "Rui Chen",
      "Geng Li",
      "Jifan Li",
      "Qishuai Wen",
      "Li Niu",
      "Jing Tang",
      "Xiangxiang Chu",
      "Junqiao Zhao"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本（首发 2026-08-27）",
    "arxiv_id": "2608.27328",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.27328",
      "code": "https://github.com/AMAP-ML/R2MBench",
      "alphaxiv": "https://alphaxiv.org/abs/2608.27328"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "流式与自回归",
      "第一视角与人类视频",
      "长时记忆"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.27328v1/overview_compressed.png",
      "alt": "R2M-Bench: Evaluating Revisit Memory via Relative Consistency in Interactive Video World Models 代表图",
      "label": "Figure 2 : Overview of R2M-Bench. (a) Absolute first-visit/revisit similarity is not sufficient evidence of memory because motion magnitude and rendering stability can inflate the raw score. (b) R2M-Bench evaluates navigation-style generated rollouts by detecting leave-and-return revisit pairs from commanded trajectories, then compares each revisit pair with a gap-matched baseline and a short-range reference and repo… 来源：论文图",
      "paper_title": "R2M-Bench: Evaluating Revisit Memory via Relative Consistency in Interactive Video World Models",
      "source_url": "https://arxiv.org/html/2608.27328v1/overview_compressed.png"
    },
    "summary": "首访与重访帧高度相似并不能证明世界模型\"记住了\"场景——中间的 rollout 可能只是变化很小。绝对重访分数对渲染稳定性、重复内容、失败运动敏感。R2M-Bench 用 可观测的重访选择性一致性 评测记忆：对每个检测到的重访，用同一 rollout 内的两个控制对做对照——gap-matched 非重访对（测通用时间稳定性）与短程对（估短视界一致性），从而剥离\"本来就稳定\"的混淆。",
    "insight": "首访与重访帧高度相似并不能证明世界模型\"记住了\"场景——中间的 rollout 可能只是变化很小。绝对重访分数对渲染稳定性、重复内容、失败运动敏感。R2M-Bench 用**可观测的重访选择性一致性**评测记忆：对每个检测到的重访，用同一 rollout 内的两个控制对做对照——gap-matched 非重访对（测通用时间稳定性）与短程对（估短视界一致性），从而剥离\"本来就稳定\"的混淆。",
    "pipeline": {
      "input": "交互世界模型 rollout。",
      "process": "检测重访对 → 构造 gap-matched 非重访控制对 + 短程控制对 → 计算重访选择性一致性 → 打分。",
      "output": "重访记忆评测分（排除渲染稳定性混淆）。",
      "details": "**输入**：交互世界模型 rollout。\n**过程**：检测重访对 → 构造 gap-matched 非重访控制对 + 短程控制对 → 计算重访选择性一致性 → 打分。\n**输出**：重访记忆评测分（排除渲染稳定性混淆）。"
    },
    "experiments": "仅摘要核验：方法上最严谨的评测设计之一（控制对剥离混淆）；覆盖范围与模型池待全文。",
    "evidence_notes": "",
    "code_data_status": "[GitHub](https://github.com/AMAP-ML/R2MBench) 已公开。",
    "limitations": "- \"记忆\"仍是生成一致性的代理；\n- 重访检测的召回；\n- 与 ReWorld 记忆设计（landmark bank）可直接互测。\n\n### 与知域的关系\n与知域 WorldSimProbe 的\"评测方法论\"分支相关，与 ReWorld、minWM 等可进入世界模型的\"记忆\"维度直接配套。",
    "comments": "",
    "source_reports": [
      "report-a141624b1e"
    ],
    "deleted": false,
    "updated_at": "2026-08-31",
    "arxiv": {
      "published": "2026-08-27T16:26:29Z",
      "revised_at": "2026-08-27T16:26:29Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2608-25585",
    "title": "RA-VLA: Retrieval-Augmented VLA for Test-Time Adaptation",
    "authors": [
      "Sanghwan Jang",
      "Minjin Jeon",
      "Minsoo Kim",
      "Seongjin Choi",
      "Dongha Kim",
      "Hwanjo Yu"
    ],
    "year": 2026,
    "publication": "2026，ICML 2026；arXiv v1：2026-08-26",
    "arxiv_id": "2608.25585",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.25585",
      "alphaxiv": "https://alphaxiv.org/abs/2608.25585"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "机器人学习",
      "流式与自回归",
      "第一视角与人类视频",
      "适应与泛化",
      "长时记忆"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.25585v1/intro.png",
      "alt": "RA-VLA: Retrieval-Augmented VLA for Test-Time Adaptation 代表图",
      "label": "Figure 1 : Adaptation bottleneck in existing ICIL frameworks. Existing ICIL methods (a) prioritize superficial visual similarity over functional intent in context retrieval, (b) fail to effectively leverage contextual guidance, and (c) exhibit significant computational overhead for larger contexts. While this overhead is plotted for RICL, other ICIL baselines follow a nearly identical trend.。来源：原图",
      "paper_title": "RA-VLA: Retrieval-Augmented VLA for Test-Time Adaptation",
      "source_url": "https://arxiv.org/html/2608.25585v1/intro.png"
    },
    "summary": "RA-VLA 针对 ICIL 的两个具体失败：检索器按视觉相似而非行为功能找示范，以及 VLA 即使拿到正确示范仍受预训练行为惯性支配。它不把整条演示粗暴拼进上下文，而是先检索行为对齐的局部片段，再在 action head 中注入这些片段；训练时用 contextual adherence margin，要求相关上下文产生的动作误差显著低于随机无关上下文。这个“相关/无关上下文干预”比仅做 no-context 消融更能检验策略是否真正使用示范。",
    "insight": "RA-VLA 针对 ICIL 的两个具体失败：检索器按视觉相似而非行为功能找示范，以及 VLA 即使拿到正确示范仍受预训练行为惯性支配。它不把整条演示粗暴拼进上下文，而是先检索行为对齐的局部片段，再在 action head 中注入这些片段；训练时用 contextual adherence margin，要求相关上下文产生的动作误差显著低于随机无关上下文。这个“相关/无关上下文干预”比仅做 no-context 消融更能检验策略是否真正使用示范。",
    "pipeline": {
      "input": "当前双视角 RGB、语言指令、机器人本体状态，以及每个未见任务 1–5 条专家演示组成的 buffer。",
      "process": "滑窗切分专家轨迹并离线缓存视觉语言特征；轻量检索器按余弦相似度选 top-K 片段，检索器以同任务轨迹的 DTW 动作对齐作为正样本学习行为表征；flow-matching action head 逐层接收检索片段；相关与随机上下文之间施加回归 margin，并以检索动作均值初始化去噪动作。",
      "output": "适配未见任务的动作 chunk；目标任务部署时不更新权重。",
      "details": "- **输入**：当前双视角 RGB、语言指令、机器人本体状态，以及每个未见任务 1–5 条专家演示组成的 buffer。\n- **过程**：滑窗切分专家轨迹并离线缓存视觉语言特征；轻量检索器按余弦相似度选 top-K 片段，检索器以同任务轨迹的 DTW 动作对齐作为正样本学习行为表征；flow-matching action head 逐层接收检索片段；相关与随机上下文之间施加回归 margin，并以检索动作均值初始化去噪动作。\n- **输出**：适配未见任务的动作 chunk；目标任务部署时不更新权重。"
    },
    "experiments": "LIBERO 使用四个 suite 轮流留一整套为未见任务，每个 held-out task 提供 3 条专家演示并评测 50 次；RA-VLA 四套平均成功率 38.45%，最强对照 RICL-R 为 20.85%，绝对提升 17.60 个百分点。真实 UR5e 留一任务评测，每个未见任务提供 4 条示范、12 次试验；RA-VLA 平均 56.25%，RICL-R 为 35.42%。行为对齐检索器把 LIBERO-Goal 上 RA-VLA 从 10.2% 提升至 53.2%；contextual sensitivity 从去掉 adherence loss 后的 0.0353 提升到 0.3639，并伴随成功率提升。作者还报告独立编码与缓存使延迟随检索片段数量近似恒定。",
    "evidence_notes": "",
    "code_data_status": "论文基于 GR00T N1.5、LIBERO 和自采 UR5e 数据；本轮未找到官方代码、权重或真实演示数据下载。因训练阶段需要未见测试任务之外的任务来学习检索器和 adherence，所谓 training-free adaptation 只指新目标任务部署阶段无权重更新，不是整个系统无需训练。",
    "limitations": "DTW 正样本依赖训练演示动作，行为距离对不同 embodiment、速度和坐标系的稳健性尚未充分证明；LIBERO 的 suite-level 留出比随机任务留出严格，但仍是同一模拟生态；真实评测每任务仅 12 次；示范 buffer 的错误、恶意或次优轨迹会直接污染检索与控制。论文也指出 demonstration buffer 存在数据注入安全风险。后续应报告错误检索率、上下文错配校准、跨 embodiment 检索和大 buffer 的端到端延迟。\n\n### 与知域的关系\n\nRA-VLA 补上知域具身 ICL 中“检索增强 VLA”这一脉络，与 ICRT 的长序列 next-token ICL、RICL 的动作融合、Zero-WAM 的完整人类视频条件互补。它最值得复用的是行为相关检索与 context adherence 审计，可用于检查 WAM/VLA 是否只是依赖当前观察和训练先验。",
    "comments": "",
    "source_reports": [
      "report-1950a5754f",
      "report-a141624b1e"
    ],
    "deleted": false,
    "updated_at": "2026-08-31",
    "arxiv": {
      "published": "2026-08-26T09:52:30Z",
      "revised_at": "2026-08-26T09:52:30Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2603-05449",
    "title": "RealWonder: Real-Time Physical Action-Conditioned Video Generation",
    "authors": [
      "Wei Liu",
      "Ziyu Chen",
      "Zizhang Li",
      "Yue Wang",
      "Hong-Xing Yu",
      "Jiajun Wu"
    ],
    "year": 2026,
    "publication": "2026，arXiv preprint（2026-03-05）；arXiv:2603.05449；正式 DOI 未见",
    "arxiv_id": "2603.05449",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2603.05449",
      "code": "https://liuwei283.github.io/RealWonder/",
      "alphaxiv": "https://alphaxiv.org/abs/2603.05449"
    },
    "tags": [
      "3D/4D",
      "世界模型",
      "因果与反事实",
      "机器人学习",
      "物理建模与仿真",
      "视频生成"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2603.05449v1/approach_eccv.png",
      "alt": "RealWonder Fig. 2",
      "label": "RealWonder，Fig. 2，实时物理动作条件视频生成框架。来源：Fig. 2 原图",
      "paper_title": "RealWonder: Real-Time Physical Action-Conditioned Video Generation",
      "source_url": "https://arxiv.org/html/2603.05449v1/approach_eccv.png"
    },
    "summary": "用 physics simulation 作为 action 与 video generator 的桥：模拟器把动作转成 optical flow 与 coarse RGB，再由四步蒸馏模型实时渲染。",
    "insight": "用 physics simulation 作为 action 与 video generator 的桥：模拟器把动作转成 optical flow 与 coarse RGB，再由四步蒸馏模型实时渲染。",
    "pipeline": {
      "input": "单张图像、文本，以及力/力矩、机器人抓手轨迹或相机运动序列",
      "process": "单图重建可模拟 3D 几何与材质；物理引擎处理刚体、形变体、流体和颗粒；渲染 flow/coarse RGB；四步 causal distilled generator 流式生成",
      "output": "480×832 的 action-conditioned video stream",
      "details": "- **输入：** 单张图像、文本，以及力/力矩、机器人抓手轨迹或相机运动序列\n- **过程：** 单图重建可模拟 3D 几何与材质；物理引擎处理刚体、形变体、流体和颗粒；渲染 flow/coarse RGB；四步 causal distilled generator 流式生成\n- **输出：** 480×832 的 action-conditioned video stream"
    },
    "experiments": "作者报告单 GPU 13.2 FPS、0.73 秒 latency；PhysGaussian、CogVideoX、Tora、RealWonder 的 PhysReal 分别为 0.468/0.624/0.578/0.705，RealWonder 的 consistency 为 0.265。运行速度对照中 Tora 0.107 FPS、CogVideoX-I2V 0.225、PhysGaussian 0.207。论文同时展示不同动作导致不同结果；这些指标仍以视觉/自动评测为主，不能等同于物理参数误差。",
    "evidence_notes": "",
    "code_data_status": "项目页提供代码与 checkpoints 入口。完整训练数据、第三方模型与仿真资产的许可证及硬件配置需按仓库说明复核。",
    "limitations": "- 单图 3D/材质估计错误会系统性污染模拟。\n- renderer 可能添加 simulator 中不存在的动力学。\n- “causal”在架构中主要指时间生成与动作传递，不是因果识别。\n- 13.2 FPS 不代表端到端机器人感知、规划和执行延迟。",
    "comments": "",
    "source_reports": [
      "report-d2be249044"
    ],
    "deleted": false,
    "updated_at": "2026-09-03",
    "challenges": "连续 3D force、robot action 和 camera control 与视频模型的像素/latent 接口不匹配；显式 simulator 有结构但渲染不逼真，扩散生成又太慢。",
    "motivation": "用 physics simulation 作为 action 与 video generator 的桥：模拟器把动作转成 optical flow 与 coarse RGB，再由四步蒸馏模型实时渲染。",
    "technical_approach": "- **输入：** 单张图像、文本，以及力/力矩、机器人抓手轨迹或相机运动序列\n- **过程：** 单图重建可模拟 3D 几何与材质；物理引擎处理刚体、形变体、流体和颗粒；渲染 flow/coarse RGB；四步 causal distilled generator 流式生成\n- **输出：** 480×832 的 action-conditioned video stream",
    "discussion": "RealWonder 显著推进 PhysGen 的实时性和材料覆盖，并明确接受物理动作。论文也展示 generator 会给未模拟水动力的船补出波纹：这提高观感，却说明输出含生成先验“脑补”，不能直接当作 simulator ground truth。",
    "arxiv": {
      "published": "2026-03-05T18:22:54Z",
      "revised_at": "2026-03-05T18:22:54Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2604-01479",
    "title": "RecGen3D: Reconstruction-Guided 3D Generation in a Shared Canonical Space",
    "authors": [
      "Zhisheng Huang",
      "Jiahao Chen",
      "Cheng Lin",
      "Chenyu Hu",
      "Hanzhuo Huang",
      "Zhengming Yu",
      "Mengfei Li",
      "Yuheng Liu",
      "Zekai Gu",
      "Zibo Zhao",
      "Yuan Liu",
      "Xin Li",
      "Wenping Wang"
    ],
    "year": 2026,
    "publication": "2026，SIGGRAPH Asia 2026 Conference Papers（官方仓库标注）",
    "arxiv_id": "2604.01479",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2604.01479",
      "code": "https://github.com/zsh523/RecGen3D",
      "model": "https://huggingface.co/zsh523/RecGen3D",
      "alphaxiv": "https://alphaxiv.org/abs/2604.01479"
    },
    "tags": [
      "3D/4D",
      "世界模型"
    ],
    "figure": {
      "url": "content/images/2604.01479-main.webp",
      "alt": "Figure 2：方法总览",
      "label": "Figure 2 · 方法总览",
      "paper_title": "RecGen3D: Reconstruction-Guided 3D Generation in a Shared Canonical Space",
      "source_url": "https://arxiv.org/html/2604.01479v3/pipeline.png"
    },
    "summary": "先把重建证据变成生成器可直接解释的规范几何，再用它约束生成补全。系统保留两个模块的预训练能力，通过分阶段适配协调坐标、表示与训练动态，而不要求一个模型从头兼顾所有目标。",
    "insight": "先把重建证据变成生成器可直接解释的规范几何，再用它约束生成补全。系统保留两个模块的预训练能力，通过分阶段适配协调坐标、表示与训练动态，而不要求一个模型从头兼顾所有目标。\n\n## 核心 Insight\n\n可靠几何条件不仅是“有一份点云”，还要求坐标兼容、噪声分布适配，以及足够稠密的多视图外观上下文。RecGen3D 将显式规范点云与增强的 DINO token 同时提供给原生 3D 生成器，分别承担结构锚定与细节恢复。",
    "pipeline": {
      "input": "单个对象的稀疏、未知相机视图；主实验为四视图，公开推理要求去背景的 RGBA 对象图。",
      "process": "VGGT 分支改造 → 规范点图与深度点云相似对齐 → 点云条件和几何增强多视图 token → Hunyuan3D-Omni VecSet flow → SDF 解码与网格提取。",
      "output": "对象规范坐标中的三角 mesh，另可导出条件点云；不是完整场景重建，也未在本工作中完成纹理合成。",
      "details": "**输入**：单个对象的稀疏、未知相机视图；主实验为四视图，公开推理要求去背景的 RGBA 对象图。\n\n**过程**：VGGT 分支改造 → 规范点图与深度点云相似对齐 → 点云条件和几何增强多视图 token → Hunyuan3D-Omni VecSet flow → SDF 解码与网格提取。\n\n**输出**：对象规范坐标中的三角 mesh，另可导出条件点云；不是完整场景重建，也未在本工作中完成纹理合成。\n\n**规范化的具体做法。**只改变 pointmap 头的监督坐标，令其输出对象规范点图；深度和相机头仍保持参考坐标监督，骨干整体微调。通过置信度加权的 Procrustes 求 Sim(3)，把深度反投影出的点对齐到规范点图；因此能同时利用深度预测精度与点图提供的规范定位。全部头强制改坐标，或仅新增全局刚体变换回归头，在消融中效果更差。\n\n**生成器如何消费证据。**规范点云进入 Hunyuan3D-Omni 的显式控制通道；各视图完整 DINO token 加上经 MLP 投影的 VGGT token 与相机 token，再拼接为多视图上下文。相较根据稀疏点采样图像特征，这种方式保留连续的稠密图像信息。生成器仍需训练以适应重建点云的噪声与多视图条件，不能视为无需适配的组件组合。\n\n**两阶段学习。**40K 个 Objaverse-XL 对象每个渲染 50 视图，先训练规范重建模块 80K 步，再冻结它训练生成器 80K 步。第二阶段将真值几何相似对齐到预测规范几何后编码为生成目标，减少残余坐标歧义。论文报告两阶段分别约 5/8 天，均用 4 张 H800。\n\n[方法与实验设置](https://arxiv.org/html/2604.01479v3#S3)"
    },
    "experiments": "GSO、Toys4K 各选 100 个对象，每个渲染 24 个候选视角，再随机取四张，并扰动相机平移。所有预测 mesh 均使用相同 ICP 流程对齐真值后评价；F-score 阈值为 0.01，另报告 Chamfer-L2、法线一致性及 128³ 体素 IoU。它们衡量对齐后的形状，不是绝对世界坐标误差。\n\n| 设置 | RecGen3D | ReconViaGen / 对照 | 解释 |\n| --- | --- | --- | --- |\n| GSO，Chamfer-L2 / F-score | 0.0192 / 0.7384 | 0.0290 / 0.6069 | 四视图对象几何改善 |\n| Toys4K，Chamfer-L2 / F-score | 0.0175 / 0.7695 | 0.0281 / 0.6105 | 在另一对象基准重复成立 |\n| 小规模条件消融，F-score | 稠密增强 0.7428 | 点引导采样 0.7208 | 保留完整图像上下文有效 |\n| 同初始化训练模式对照，F-score | 分阶段 0.70 | 联合训练 0.59 | 该设置支持解耦训练，而非一般否定端到端学习 |\n\n主表基线使用各自官方权重、没有统一重训；例如 ReconViaGen 的训练集规模与本方法不同，结果不能完全归因于某个单一结构。主文消融缩小到 2K 训练对象和 50 个测试对象，附录另外给出了显式/隐式条件对照、替换 π³ 骨干及三个推理 seed 的条件策略比较；推理 seed 波动不能代替多次训练方差。\n\n论文报告四张输入在 RTX A6000 上约 40 秒/对象、峰值显存约 16GB；基础 Hunyuan3D-Omni 约 27 秒，新增约束有实际成本。重遮挡、反光材质、薄壁与密集孔洞仍存在失败；生成先验可能把细部变得过于光滑或封闭。\n\n[主表与消融](https://arxiv.org/html/2604.01479v3#S4)；[失败案例](https://arxiv.org/html/2604.01479v3#S5)",
    "evidence_notes": "已核验原文方法、实验表格与官方资源；未独立复现实验",
    "code_data_status": "官方仓库提供推理、预处理、示例与权重下载；权重包含规范化 VGGT 和生成适配组件，还依赖基础 VGGT 与 Hunyuan3D-Omni。推理入口已公开，不等于完整训练数据与训练流程均已原样释放。本次未运行 GPU 复现。",
    "limitations": "训练主要来自合成对象，真实反射、遮挡与细小结构仍影响重建。规范坐标与 ICP 评价掩盖不了接入真实世界时需要额外处理的尺度、位姿和实例定位；对象 mesh 也不自动带有关节、材质物理参数或可执行交互。",
    "comments": "",
    "source_reports": [],
    "deleted": false,
    "updated_at": "2026-09-24",
    "challenges": "多视图重建忠实于观测，却可能缺失背面；原生三维生成能补完整形状，却容易改掉实例特有结构。两类模型还使用不同坐标系：重建以参考相机为原点，生成器偏好对象规范坐标。直接拼接模块或一起训练不能自动解决这些冲突。",
    "motivation": "先把重建证据变成生成器可直接解释的规范几何，再用它约束生成补全。系统保留两个模块的预训练能力，通过分阶段适配协调坐标、表示与训练动态，而不要求一个模型从头兼顾所有目标。\n\n## 核心 Insight\n\n可靠几何条件不仅是“有一份点云”，还要求坐标兼容、噪声分布适配，以及足够稠密的多视图外观上下文。RecGen3D 将显式规范点云与增强的 DINO token 同时提供给原生 3D 生成器，分别承担结构锚定与细节恢复。",
    "technical_approach": "**输入**：单个对象的稀疏、未知相机视图；主实验为四视图，公开推理要求去背景的 RGBA 对象图。\n\n**过程**：VGGT 分支改造 → 规范点图与深度点云相似对齐 → 点云条件和几何增强多视图 token → Hunyuan3D-Omni VecSet flow → SDF 解码与网格提取。\n\n**输出**：对象规范坐标中的三角 mesh，另可导出条件点云；不是完整场景重建，也未在本工作中完成纹理合成。\n\n**规范化的具体做法。**只改变 pointmap 头的监督坐标，令其输出对象规范点图；深度和相机头仍保持参考坐标监督，骨干整体微调。通过置信度加权的 Procrustes 求 Sim(3)，把深度反投影出的点对齐到规范点图；因此能同时利用深度预测精度与点图提供的规范定位。全部头强制改坐标，或仅新增全局刚体变换回归头，在消融中效果更差。\n\n**生成器如何消费证据。**规范点云进入 Hunyuan3D-Omni 的显式控制通道；各视图完整 DINO token 加上经 MLP 投影的 VGGT token 与相机 token，再拼接为多视图上下文。相较根据稀疏点采样图像特征，这种方式保留连续的稠密图像信息。生成器仍需训练以适应重建点云的噪声与多视图条件，不能视为无需适配的组件组合。\n\n**两阶段学习。**40K 个 Objaverse-XL 对象每个渲染 50 视图，先训练规范重建模块 80K 步，再冻结它训练生成器 80K 步。第二阶段将真值几何相似对齐到预测规范几何后编码为生成目标，减少残余坐标歧义。论文报告两阶段分别约 5/8 天，均用 4 张 H800。\n\n[方法与实验设置](https://arxiv.org/html/2604.01479v3#S3)",
    "discussion": "**阅读者分析**：RecGen3D（原名 UniRecGen）提供了与 Gen3R、GAE 不同的结合方式：保持原生对象生成器，把重建转为可解释的控制条件。若下游需要完整 mesh，值得优先研究；若目标是大场景的新视角视频或持续动态世界，则还需要场景组合、时序身份和状态更新机制。",
    "arxiv": {
      "published": "2026-04-01",
      "revised_at": "2026-08-21",
      "primary_category": "cs.CV"
    },
    "source_papers": [
      "content/papers/2604.01479.md"
    ]
  },
  {
    "id": "arxiv-2609-10982",
    "title": "ReCHOIR: Contact-guided Human Object Interaction Retargeting to Diverse Characters",
    "authors": [
      "Chaelin Kim",
      "Seokhyeon Hong",
      "Kwan Yun",
      "Soojin Choi",
      "Inseo Jang",
      "Junyong Noh"
    ],
    "year": 2026,
    "publication": "2026，SIGGRAPH Asia 2026 Journal Track；ACM Transactions on Graphics 45(6)，论文原文标注 2026 年 12 月出版",
    "arxiv_id": "2609.10982",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2609.10982",
      "project": "https://cherry-leki.github.io/projects/ReCHOIR/",
      "alphaxiv": "https://alphaxiv.org/abs/2609.10982"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "触觉与灵巧操作",
      "跨本体迁移"
    ],
    "figure": {
      "url": "content/images/2609.10982-main.webp",
      "alt": "Figure 2：接触编码与引导分支协同人体运动重定向和物体运动解码",
      "label": "Figure 2 · 接触编码与引导分支协同人体运动重定向和物体运动解码",
      "paper_title": "ReCHOIR: Contact-guided Human Object Interaction Retargeting to Diverse Characters",
      "source_url": "https://arxiv.org/html/2609.10982v1/figures/03_Method/overview_v6_1.jpg"
    },
    "summary": "论文解决跨不同骨架和体型角色的 HOI 动作重定向：既要保留源人体动作语义，也要维持人体—物体接触并同步调整物体运动。核心 insight 是把可迁移人体动作先验拆成全局与部位 latent，再把物体几何、物体状态和稀疏接触编码到相同部位结构中，以残差控制分支调制冻结的人体动作解码器；同一融合 latent 同时驱动物体运动解码器。",
    "insight": "论文解决跨不同骨架和体型角色的 HOI 动作重定向：既要保留源人体动作语义，也要维持人体—物体接触并同步调整物体运动。核心 insight 是把可迁移人体动作先验拆成全局与部位 latent，再把物体几何、物体状态和稀疏接触编码到相同部位结构中，以残差控制分支调制冻结的人体动作解码器；同一融合 latent 同时驱动物体运动解码器。\n\n这比把 skeleton retargeting 后接 IK 更系统，因为人体与物体共同适配；也比 test-time optimization 更快。但实验表明它追求的是整体平衡，并非每个接触指标最优。",
    "pipeline": {
      "input": "源人体动作和源骨架、目标角色骨架、源物体网格、逐帧物体状态以及由固定交互关节定义的接触线索。",
      "process": "第一阶段训练 PAME 条件自编码器，将全身运动编码为 global token 与 body-part tokens，并用目标骨架解码；第二阶段冻结 PAME，以 PointNet++/MLP 编码物体几何、运动与接触，映射为部位对齐条件，与动作 latent 融合；Contact Guider 以类似 ControlNet 的残差路径调制 PAME Decoder，Object Motion Decoder 联合预测物体轨迹。",
      "output": "适配目标骨架的完整人体运动，以及与之对齐的物体位置轨迹；当前物体朝向沿用源序列。",
      "details": "**过程**：第一阶段训练 PAME 条件自编码器，将全身运动编码为 global token 与 body-part tokens，并用目标骨架解码；第二阶段冻结 PAME，以 PointNet++/MLP 编码物体几何、运动与接触，映射为部位对齐条件，与动作 latent 融合；Contact Guider 以类似 ControlNet 的残差路径调制 PAME Decoder，Object Motion Decoder 联合预测物体轨迹。\n\n- **输入**：源人体动作和源骨架、目标角色骨架、源物体网格、逐帧物体状态以及由固定交互关节定义的接触线索。\n- **过程**：第一阶段训练 PAME 条件自编码器，将全身运动编码为 global token 与 body-part tokens，并用目标骨架解码；第二阶段冻结 PAME，以 PointNet++/MLP 编码物体几何、运动与接触，映射为部位对齐条件，与动作 latent 融合；Contact Guider 以类似 ControlNet 的残差路径调制 PAME Decoder，Object Motion Decoder 联合预测物体轨迹。\n- **输出**：适配目标骨架的完整人体运动，以及与之对齐的物体位置轨迹；当前物体朝向沿用源序列。\n\n全局与部位 latent 先学习可迁移人体先验，再冻结先验并通过 Contact Guider 注入对象与接触条件。人体和对象平移由共享交互条件联合驱动，物体旋转仍沿用源序列。\n\n[原文方法](https://arxiv.org/html/2609.10982)\n\n### 方法细节与实现\n\n**形体变化为何会破坏交互。**按关节旋转直接重定向动作时，目标角色的手长、躯干比例和站姿不同，即使关节轨迹相似，手也可能离开物体表面。ReCHOIR 把源运动中的接触关系作为额外约束，联合调整目标角色动作与物体运动，使“手和物体在何时何地接触”优先于纯姿态相似。\n\n**模块分工。**PAME 自编码器先学习跨骨架的人体运动表示与重建；接触编码器读取物体几何、源物体运动和接触线索；接触引导分支以类似 ControlNet 的方式调制冻结的运动模型；物体运动解码器再输出与目标身体匹配的物体运动。冻结已有运动先验有助于保留自然动作，同时让新增模块学习交互约束。\n\n**数据和监督。**基础动作覆盖 20 个 Mixamo 角色，交互监督来自 OMOMO/BEHAVE；额外以 10 个未见角色测试跨体形泛化。接触约束与运动重建共同塑造结果，目标是给动画角色生成可用 HOI，而不是执行真实机器人接触控制。物体旋转处理仍有限，复杂铰接、滑动和接触力不由当前表示完整描述。\n\n[对应方法原文](https://arxiv.org/html/2609.10982#S3)"
    },
    "experiments": "PAME 使用与 SAME 相同的约 130 分钟 locomotion 数据、160 种骨架；HOI 阶段使用 OMOMO 与 BEHAVE 训练划分，源动作经 MotionBuilder 重定向到 20 个 Mixamo 角色，共 567 个样本、约 64 分钟。测试采用训练未见的 10 个角色：OMOMO-test 88 段/14,733 帧，BEHAVE-test 77 段/18,737 帧，均为 30 fps。训练在单张 NVIDIA RTX A5000 上完成。\n\n指标覆盖人体动作 JR、RT、JP、FS、GP，接触 PRE、REC、F1、CD，物体 OGP、OF、OS，以及每帧耗时。基线包括 PAME、PAME+IK、PAME+Optim、PAME+IM；人体先验另与 SAME、SAN 比较。\n\nReCHOIR 在 OMOMO-test/BEHAVE-test 上分别为 F1 0.9713/0.9818、CD 5.9437/4.3277 cm、耗时 0.421/0.394 ms 每帧。它没有超过所有实例优化基线的接触数值，但相对约 15–200 ms 每帧的 IK/优化基线明显更快。23 名参与者对 12 段 HOI、五种方法的 60 个结果进行五点量表评价，ReCHOIR 在动作语义一致性、接触保持、交互对齐、整体质量上分别得 4.402、4.265、4.308、4.257，均为最高。消融显示去掉 Contact Guider 会显著降低接触指标，支持残差交互控制设计。\n\n实验直接支持的是指定数据和目标角色构造下的效率—质量折中，以及各模块在该协议中的贡献；不直接支持真实捕获 HOI、任意骨架拓扑、长序列稳定性或通用物理可行性。\n\n\n核验定位：原文方法、定量结果、消融和 23 人用户研究；周报中的 0.421/0.394 ms 是每帧推理时间，不包含原始 HOI 捕获与数据构建成本。该任务输入已有结构化动作和物体信息，不能归为从 RGB 直接重建 HOI。\n\n[原文实验与表格](https://arxiv.org/html/2609.10982)\n\n**性能含义。**报告的 0.421 ms 属于相应网络推理设置，不能直接等同于包括输入重建、角色准备和接触提取在内的完整制作耗时。接触保持、运动自然度与人体/物体碰撞应结合观察：接触点接近并不保证无穿透，关节误差低也不保证互动语义保持。\n\n[实验与设置原文](https://arxiv.org/html/2609.10982)",
    "evidence_notes": "已核验原文方法与实验；关键比较与限制见各节",
    "code_data_status": "项目页和论文可访问，但本次未发现官方代码仓库、模型权重或专门数据包。论文基于公开数据集并详细描述训练划分，但 MotionBuilder 生成的配对目标动作和完整预处理是否发布尚不明确，因此目前不足以一键复现。",
    "limitations": "作者明确指出：源接触位置对体型差异大的目标可能不可达，语义等价交互有时需要重新选择接触策略；固定稀疏交互关节难覆盖精细抓握；物体只预测平移、不预测旋转；仅支持单个刚体；逐帧模型不显式建模长时依赖。训练使用构造配对而非真实目标 HOI ground truth，也可能带来工具链偏差。后续应评测接触重规划、手指/网格级接触、碰撞与动力学、多物体/关节物体以及长序列时序稳定性。",
    "comments": "",
    "source_reports": [],
    "deleted": false,
    "updated_at": "2026-09-24",
    "challenges": "角色体型和骨架发生变化时，单独重定向人体会破坏接触，单独复制物体轨迹也可能不合理。逐实例优化能修正部分接触，却难满足快速批量生成。",
    "motivation": "论文解决跨不同骨架和体型角色的 HOI 动作重定向：既要保留源人体动作语义，也要维持人体—物体接触并同步调整物体运动。核心 insight 是把可迁移人体动作先验拆成全局与部位 latent，再把物体几何、物体状态和稀疏接触编码到相同部位结构中，以残差控制分支调制冻结的人体动作解码器；同一融合 latent 同时驱动物体运动解码器。\n\n这比把 skeleton retargeting 后接 IK 更系统，因为人体与物体共同适配；也比 test-time optimization 更快。但实验表明它追求的是整体平衡，并非每个接触指标最优。",
    "technical_approach": "**过程**：第一阶段训练 PAME 条件自编码器，将全身运动编码为 global token 与 body-part tokens，并用目标骨架解码；第二阶段冻结 PAME，以 PointNet++/MLP 编码物体几何、运动与接触，映射为部位对齐条件，与动作 latent 融合；Contact Guider 以类似 ControlNet 的残差路径调制 PAME Decoder，Object Motion Decoder 联合预测物体轨迹。\n\n- **输入**：源人体动作和源骨架、目标角色骨架、源物体网格、逐帧物体状态以及由固定交互关节定义的接触线索。\n- **过程**：第一阶段训练 PAME 条件自编码器，将全身运动编码为 global token 与 body-part tokens，并用目标骨架解码；第二阶段冻结 PAME，以 PointNet++/MLP 编码物体几何、运动与接触，映射为部位对齐条件，与动作 latent 融合；Contact Guider 以类似 ControlNet 的残差路径调制 PAME Decoder，Object Motion Decoder 联合预测物体轨迹。\n- **输出**：适配目标骨架的完整人体运动，以及与之对齐的物体位置轨迹；当前物体朝向沿用源序列。\n\n全局与部位 latent 先学习可迁移人体先验，再冻结先验并通过 Contact Guider 注入对象与接触条件。人体和对象平移由共享交互条件联合驱动，物体旋转仍沿用源序列。\n\n[原文方法](https://arxiv.org/html/2609.10982)\n\n### 方法细节与实现\n\n**形体变化为何会破坏交互。**按关节旋转直接重定向动作时，目标角色的手长、躯干比例和站姿不同，即使关节轨迹相似，手也可能离开物体表面。ReCHOIR 把源运动中的接触关系作为额外约束，联合调整目标角色动作与物体运动，使“手和物体在何时何地接触”优先于纯姿态相似。\n\n**模块分工。**PAME 自编码器先学习跨骨架的人体运动表示与重建；接触编码器读取物体几何、源物体运动和接触线索；接触引导分支以类似 ControlNet 的方式调制冻结的运动模型；物体运动解码器再输出与目标身体匹配的物体运动。冻结已有运动先验有助于保留自然动作，同时让新增模块学习交互约束。\n\n**数据和监督。**基础动作覆盖 20 个 Mixamo 角色，交互监督来自 OMOMO/BEHAVE；额外以 10 个未见角色测试跨体形泛化。接触约束与运动重建共同塑造结果，目标是给动画角色生成可用 HOI，而不是执行真实机器人接触控制。物体旋转处理仍有限，复杂铰接、滑动和接触力不由当前表示完整描述。\n\n[对应方法原文](https://arxiv.org/html/2609.10982#S3)",
    "discussion": "**阅读者分析**：该工作直接属于 3D HOI 的生成与重定向分支。其部位化 interaction latent 和冻结先验上的残差控制，可与 HarmoHOI 类重建结果衔接，也可为 StreamingHOI 提供低延迟动作适配模块。对知域研究路线最重要的提醒是：接触保持已经不能只看 F1/CD，需要同时报告动作语义、物体物理伪影、运行时和用户感知，并把“接触位置复制”升级为“交互语义保持”。",
    "arxiv": {
      "published": "2026-09-10",
      "revised_at": "",
      "primary_category": "cs.GR"
    },
    "source_papers": [
      "content/papers/2609.10982.md"
    ]
  },
  {
    "id": "arxiv-2606-13674",
    "title": "RepWAM: World Action Modeling with Representation Visual-Action Tokenizers",
    "authors": [
      "Junke Wang",
      "Qihang Zhang",
      "Shuai Yang",
      "Yiming Luo",
      "Yujun Shen",
      "Zuxuan Wu",
      "Yu-Gang Jiang",
      "Yinghao Xu"
    ],
    "year": 2026,
    "publication": "2026，arXiv preprint，arXiv:2606.13674；DOI 待核验",
    "arxiv_id": "2606.13674",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2606.13674",
      "project": "https://wdrink.github.io/RepWAM/",
      "code": "https://github.com/wdrink/RepWAM",
      "model": "https://huggingface.co/papers/2606.13674",
      "alphaxiv": "https://alphaxiv.org/abs/2606.13674"
    },
    "tags": [
      "3D/4D",
      "World Action Model",
      "动作表征",
      "因果与反事实",
      "机器人学习",
      "自监督与预测表征",
      "视频生成"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2606.13674v1/x1.png",
      "alt": "RepWAM Fig. 1",
      "label": "RepWAM，Fig. 1，RepViTok 将视觉 token 与冻结视觉基础模型对齐，并在同一语义空间中以 IDM/FDM 学习转移 token。来源：Fig. 1 原图",
      "paper_title": "RepWAM: World Action Modeling with Representation Visual-Action Tokenizers",
      "source_url": "https://arxiv.org/html/2606.13674v1/x1.png"
    },
    "summary": "作者希望把视觉状态和引发状态变化的 latent action 放在共享语义空间中建模，让 world expert 的未来预测与 action expert 的控制输出通过同一 representation visual-action tokenizer 对齐。作者称其 DiT 为 causal world action model，主要依据时序生成/注意结构；阅读时不应将这一命名自动解释为结构因果模型、干预识别或反事实保证。",
    "insight": "作者希望把视觉状态和引发状态变化的 latent action 放在共享语义空间中建模，让 world expert 的未来预测与 action expert 的控制输出通过同一 representation visual-action tokenizer 对齐。作者称其 DiT 为 causal world action model，主要依据时序生成/注意结构；阅读时不应将这一命名自动解释为结构因果模型、干预识别或反事实保证。",
    "pipeline": {
      "input": "视频观测序列、语言指令；适配阶段再加入 embodiment-specific 机器人轨迹和动作。",
      "process": "RepViTok 先以冻结视觉基础模型对齐视觉 latent，再用耦合 IDM/FDM 将相邻视觉 latent 的转移编码为 latent action；预训练阶段以配对的 world expert 与 action expert、flow matching 联合建模未来视觉状态和 latent action；随后用真实机器人示范把 latent dynamics 适配为可执行动作。",
      "output": "指令条件的未来视觉 latent、对应 latent action，以及闭环执行所需的机器人动作序列。",
      "details": "- **输入：** 视频观测序列、语言指令；适配阶段再加入 embodiment-specific 机器人轨迹和动作。\n- **过程：** RepViTok 先以冻结视觉基础模型对齐视觉 latent，再用耦合 IDM/FDM 将相邻视觉 latent 的转移编码为 latent action；预训练阶段以配对的 world expert 与 action expert、flow matching 联合建模未来视觉状态和 latent action；随后用真实机器人示范把 latent dynamics 适配为可执行动作。\n- **输出：** 指令条件的未来视觉 latent、对应 latent action，以及闭环执行所需的机器人动作序列。"
    },
    "experiments": "RepWAM 在 RoboTwin 2.0 的 50 项任务中报告 5B 模型 Easy 89.3、Hard 88.4。1.3B 受控替换中，RepViTok 相比 WAN2.2 VAE 将 Easy/Hard 平均成功率从 78.0/76.0 提高到 86.6/83.1。tokenizer 消融中，RepViTok 相对 reconstruction-only WAN2.2 VAE 的 gFVD 分别下降 9.5%/13.2%，但论文同时显示仅提高开放环 action 指标并不必然带来闭环成功。latent-action 两阶段训练在所测设置取得 gFVD 48.23/58.83、PSNR 22.86/19.93、OLS 19.87/16.98；PickFruit 成功率为 50%，对比无 latent action 的 30% 和 joint prediction 的 20%。三项真机任务各 10 次 rollout：RepWAM-5B 在摘取水果、推抽屉、插试管分别为 60%、80%、60%；样本量较小，应视为初步闭环证据。",
    "evidence_notes": "",
    "code_data_status": "官方项目页与 GitHub 仓库可访问；论文和仓库表述为代码与权重将开放，当前具体 checkpoint、训练脚本、数据处理与许可证完整性需以仓库最新内容逐项核验。实验涉及 RoboTwin 2.0、AgiBot Eval、ImageNet、UCF101 以及自采 Franka 双臂示范。",
    "limitations": "- 真机每任务仅 10 次 rollout，置信区间和随机种子稳定性没有充分呈现。\n- RepWAM 从零训练，与继承 WAN 视频生成预训练的系统并非完全等成本比较。\n- 5B 相比 1.3B 的提升与模型容量、训练资源耦合，尚不能只归因于 tokenizer。\n- 视觉未来与 latent action 的联合预测仍可能编码外观相关捷径，并不保证动作语义可解释。\n- 当前预训练主要是机器人域视频；作者把扩展到互联网、尤其第一视角人类视频列为未来工作。\n- 闭环延迟、算力成本、失败恢复与安全边界仍缺少系统报告。",
    "comments": "",
    "source_reports": [
      "report-89efbb2378"
    ],
    "deleted": false,
    "updated_at": "2026-08-26",
    "challenges": "现有 World Action Models 往往沿用视频生成模型中以像素重建为中心的 VAE latent。它们能保存外观，却不一定提供足够的指令语义、接触相关结构或动作转移信息，可能导致未来预测与闭环控制之间存在表征错位。用户给出的“rapwam”经核验最符合本文 RepWAM；报告不把无关的 RAP-WAM Prolog 架构计入馆藏。",
    "motivation": "作者希望把视觉状态和引发状态变化的 latent action 放在共享语义空间中建模，让 world expert 的未来预测与 action expert 的控制输出通过同一 representation visual-action tokenizer 对齐。作者称其 DiT 为 causal world action model，主要依据时序生成/注意结构；阅读时不应将这一命名自动解释为结构因果模型、干预识别或反事实保证。",
    "technical_approach": "- **输入：** 视频观测序列、语言指令；适配阶段再加入 embodiment-specific 机器人轨迹和动作。\n- **过程：** RepViTok 先以冻结视觉基础模型对齐视觉 latent，再用耦合 IDM/FDM 将相邻视觉 latent 的转移编码为 latent action；预训练阶段以配对的 world expert 与 action expert、flow matching 联合建模未来视觉状态和 latent action；随后用真实机器人示范把 latent dynamics 适配为可执行动作。\n- **输出：** 指令条件的未来视觉 latent、对应 latent action，以及闭环执行所需的机器人动作序列。",
    "discussion": "RepWAM 将 WAM 的问题焦点从“是否生成未来视频”推进到“未来与动作共享什么 latent 接口”。最有价值的消融是：语义 tokenizer、两阶段 latent-action 预训练与机器人动作适配分别有可测贡献，而简单附加 joint-prediction head 反而损害动态质量。对知域的意义是它给出 `observation → semantic visual latent → latent transition → robot action` 的可实现分解；但共享语义空间和时序 causal mask 仍不等于可识别因果机制。",
    "arxiv": {
      "published": "2026-06-11T17:59:43Z",
      "revised_at": "2026-06-13T07:02:30Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2609-13851",
    "title": "ReWeight: Leveraging Human Data for VLA Post-Training via Demonstration Retrieval and Sample Weighting",
    "authors": [
      "Chenwei Wang",
      "Dianye Huang",
      "Match W. L. Ko",
      "Chenjia Bai",
      "Zhongliang Jiang"
    ],
    "year": 2026,
    "publication": "2026，arXiv v1，2026-09-12 提交",
    "arxiv_id": "2609.13851",
    "doi": "10.48550/arXiv.2609.13851",
    "links": {
      "paper": "https://arxiv.org/abs/2609.13851",
      "project": "https://reweight-vla.github.io/",
      "alphaxiv": "https://alphaxiv.org/abs/2609.13851"
    },
    "tags": [
      "VLA",
      "第一视角与人类视频",
      "跨本体迁移",
      "预训练与扩展律"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2609.13851v1/figures/fig1.png",
      "alt": "ReWeight Fig. 1",
      "label": "ReWeight，Fig. 1，检索人类示范并为 VLA post-training 分配样本权重。来源：Fig. 1 原图 PNG",
      "paper_title": "ReWeight: Leveraging Human Data for VLA Post-Training via Demonstration Retrieval and Sample Weighting",
      "source_url": "https://arxiv.org/html/2609.13851v1/figures/fig1.png"
    },
    "summary": "论文的出发点不是“更多人类数据一定更好”，而是 cross-embodiment mismatch 会让随机混入的人类数据伤害或限制 policy post-training。ReWeight先学习包含 visual observation 与 future action 的跨本体 visuomotor representation，再通过 optimal transport 找到与目标机器人数据行为相近的人类 demonstrations，并给 discrepancy 较小的 sample 更大训练权重。",
    "insight": "论文的出发点不是“更多人类数据一定更好”，而是 cross-embodiment mismatch 会让随机混入的人类数据伤害或限制 policy post-training。ReWeight先学习包含 visual observation 与 future action 的跨本体 visuomotor representation，再通过 optimal transport 找到与目标机器人数据行为相近的人类 demonstrations，并给 discrepancy 较小的 sample 更大训练权重。",
    "pipeline": {
      "input": "目标机器人 demonstrations、候选 egocentric human demonstrations、VLA policy。",
      "process": "编码未来行为相关的跨本体 visuomotor representation；使用 optimal transport 做 demonstration retrieval；根据人类—机器人 sample discrepancy 分配 loss weight；对 VLA 做 post-training。",
      "output": "利用筛选后人类经验增强的目标机器人策略。",
      "details": "**输入**：目标机器人 demonstrations、候选 egocentric human demonstrations、VLA policy。\n\n**过程**：编码未来行为相关的跨本体 visuomotor representation；使用 optimal transport 做 demonstration retrieval；根据人类—机器人 sample discrepancy 分配 loss weight；对 VLA 做 post-training。\n\n**输出**：利用筛选后人类经验增强的目标机器人策略。"
    },
    "experiments": "在八个 RoboTwin 2.0 仿真任务中，\\(\\pi_{0.5}\\) robot-only 平均成功率 39%，随机 human+robot mix 为 44%，ReWeight 为 57%。四个真实 DoBot 双臂任务上，ReWeight 平均成功率 68.8%；在加入随机化、光照和干扰因素的设置中仍显著优于基线。",
    "evidence_notes": "全文已核验",
    "code_data_status": "项目页可访问，但本次没有核验到官方代码、数据或权重下载入口。",
    "limitations": "当前证据说明 retrieval/weighting 在作者测试的任务与机器人中有效，但“相似度”仍依赖目标机器人数据来定义。如何在目标机器人 demonstrations 极少甚至为零时判断人类行为的可迁移性，是比继续扩大视频池更关键的问题。",
    "comments": "",
    "source_reports": [
      "report-1b1ffacf7d"
    ],
    "deleted": false,
    "updated_at": "2026-09-16",
    "challenges": "人类与机器人在形态、视角和动作可达性上存在系统差异，随机混合人类示范可能引入不可执行行为，数据规模增加并不必然改善目标机器人策略。",
    "motivation": "论文的出发点不是“更多人类数据一定更好”，而是 cross-embodiment mismatch 会让随机混入的人类数据伤害或限制 policy post-training。ReWeight先学习包含 visual observation 与 future action 的跨本体 visuomotor representation，再通过 optimal transport 找到与目标机器人数据行为相近的人类 demonstrations，并给 discrepancy 较小的 sample 更大训练权重。",
    "technical_approach": "**输入**：目标机器人 demonstrations、候选 egocentric human demonstrations、VLA policy。\n\n**过程**：编码未来行为相关的跨本体 visuomotor representation；使用 optimal transport 做 demonstration retrieval；根据人类—机器人 sample discrepancy 分配 loss weight；对 VLA 做 post-training。\n\n**输出**：利用筛选后人类经验增强的目标机器人策略。",
    "discussion": "这篇对“从人类视频学习”路线很有实用价值，也可与 A4A/WLA³互补：A4A寻找 geometry-level transferable target，WLA³学习 transition latent，ReWeight则解决**哪些 human samples 值得进入训练**。三者组合是值得实验的路线。",
    "arxiv": {
      "published": "2026-09-12T10:09:06Z",
      "revised_at": "2026-09-12T10:09:06Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2608-23565",
    "title": "ReWorld: An Interactive World Model with Long-Horizon Memory",
    "authors": [
      "Zhifei Chen",
      "Luozhou Wang",
      "Guibao Shen",
      "Dongyu Yan",
      "Shuai Yang",
      "Tianshuo Xu",
      "Yihua Du",
      "Wei Wang",
      "Tianyi Gui",
      "Lianghua Huang",
      "Yingcong Chen"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本（首发 2026-08-24）",
    "arxiv_id": "2608.23565",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.23565",
      "project": "https://zhifeichen097.github.io/ReWorld/",
      "alphaxiv": "https://alphaxiv.org/abs/2608.23565"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "流式与自回归",
      "第一视角与人类视频",
      "长时记忆"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.23565v1/figures/wanworld_framework.png",
      "alt": "ReWorld: An Interactive World Model with Long-Horizon Memory 代表图",
      "label": "Figure 2 : Overview of ReWorld. Left: a metric-aligned data pipeline places UE-rendered, real-world, and game footage on a single physical action scale, and palindrome routes—the camera retracing its own path—supply revisit supervision (Sec. 3 ). Middle: teacher-forcing training turns the bidirectional backbone into a streaming world model, with a DMD LoRA trained alongside for few-step real-time inference (Secs. 2.2… 来源：论文图",
      "paper_title": "ReWorld: An Interactive World Model with Long-Horizon Memory",
      "source_url": "https://arxiv.org/html/2608.23565v1/figures/wanworld_framework.png"
    },
    "summary": "交互世界模型要同时满足三件事：服从用户动作、记住展示过的地点、实时流式。三者结构性冲突：控制要短视界、记忆要无界视界。ReWorld 的 Insight： 训练期分离、推理期约束 ——混合 per-head 注意力窗口让多数头盯近期、少数全局头盯全程历史，随机头路由防止能力绑定特定头，随机 chunk 丢弃让稀疏历史进入分布；推理期全部历史活在固定预算下：有界 KV cache + pose 索引 landmark bank，按当前 pose 检索最近 landmark。",
    "insight": "交互世界模型要同时满足三件事：服从用户动作、记住展示过的地点、实时流式。三者结构性冲突：控制要短视界、记忆要无界视界。ReWorld 的 Insight：**训练期分离、推理期约束**——混合 per-head 注意力窗口让多数头盯近期、少数全局头盯全程历史，随机头路由防止能力绑定特定头，随机 chunk 丢弃让稀疏历史进入分布；推理期全部历史活在固定预算下：有界 KV cache + pose 索引 landmark bank，按当前 pose 检索最近 landmark。",
    "pipeline": {
      "input": "用户动作 + 历史帧流。",
      "process": "训练（混合窗口注意力 + 随机头路由 + 随机 chunk 丢弃 + metric-scale 数据引擎统一 8 源）→ 推理（固定预算 KV cache + pose 索引 landmark 检索）→ 流式生成。",
      "output": "实时、可重访（记得去过地点）的交互视频流。",
      "details": "**输入**：用户动作 + 历史帧流。\n**过程**：训练（混合窗口注意力 + 随机头路由 + 随机 chunk 丢弃 + metric-scale 数据引擎统一 8 源）→ 推理（固定预算 KV cache + pose 索引 landmark 检索）→ 流式生成。\n**输出**：实时、可重访（记得去过地点）的交互视频流。"
    },
    "experiments": "21 页正文，含记忆保持（revisit）与交互控制评估；数据引擎的尺度校准是其记忆能力的根基。证据等级：摘要核验 + 结构核验，具体数字未逐项复核。",
    "evidence_notes": "",
    "code_data_status": "项目页上线；数据引擎与代码公开状态待确认。",
    "limitations": "- 跨源数据尺度校准的隐性偏差（真实 vs 渲染）；\n- \"记忆\"仍以视觉一致性代理衡量，与 R2M-Bench 的评测视角互补；\n- landmark bank 的覆盖与检索失败场景。\n\n### 与知域的关系\n与知域 EgoSim、EgoForge、minWM、LongLive 同属\"交互/可进入世界模型\"主线，其\"记忆预算\"设计与 R2M-Bench 评测形成闭环，建议同专题收录。",
    "comments": "",
    "source_reports": [
      "report-a141624b1e"
    ],
    "deleted": false,
    "updated_at": "2026-08-31",
    "arxiv": {
      "published": "2026-08-24T17:59:05Z",
      "revised_at": "2026-08-24T17:59:05Z",
      "primary_category": "cs.AI"
    }
  },
  {
    "id": "arxiv-2608-27033",
    "title": "Riemann-1.0: An Embodied World Action Model for Physical AI",
    "authors": [
      "Haofeng Sun",
      "Jiangbo Pei",
      "Fei Kang",
      "Zexiang Liu",
      "Yaokun Li",
      "Boyi Jiang",
      "Hua Xue",
      "Cindy Zhou",
      "Wei Li",
      "Yichen Wei",
      "Mengyin An",
      "Fanliang Zhao",
      "Biao Jiang",
      "Zile Wang",
      "Yang Liu",
      "Yangguang Li"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本（首发 2026-08-27）",
    "arxiv_id": "2608.27033",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.27033",
      "project": "https://riemann-dynamics.github.io/Riemann-1.0-Website",
      "data": "https://huggingface.co/datasets/GalaxeaAI/Galaxea-Open-World-Dataset",
      "alphaxiv": "https://alphaxiv.org/abs/2608.27033"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "机器人学习",
      "流式与自回归",
      "第一视角与人类视频",
      "长时记忆"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.27033v1/teaser.png",
      "alt": "Riemann-1.0: An Embodied World Action Model for Physical AI 代表图",
      "label": "Figure 1 : Overview of Riemann-1.0 . Riemann-1.0 integrates a unified embodied data infrastructure, Progressive Embodied Pretraining, and a fully causal World Action Model into a unified framework for embodied intelligence. The resulting model simultaneously serves as an executable robot policy and an action-conditioned visual world simulator, achieving state-of-the-art performance across both simulation benchmarks a… 来源：论文图",
      "paper_title": "Riemann-1.0: An Embodied World Action Model for Physical AI",
      "source_url": "https://arxiv.org/html/2608.27033v1/teaser.png"
    },
    "summary": "Riemann-1.0 把多视角视觉观测、机器人状态、具身特定动作放进 单一因果自回归序列 ，将\"机器人动作与世界演化\"表示为因果状态转移。与联合生成、video-first 预测、解耦建模等既有 WAM 范式不同，它用同一模型同时承担在线策略执行与动作条件世界模拟——既是可执行策略，也是多具身视觉世界模拟器。配套提出渐进式具身预训练：统一从 egocentric 人类视频、手持夹爪演示、异构机器人轨迹学习。",
    "insight": "Riemann-1.0 把多视角视觉观测、机器人状态、具身特定动作放进**单一因果自回归序列**，将\"机器人动作与世界演化\"表示为因果状态转移。与联合生成、video-first 预测、解耦建模等既有 WAM 范式不同，它用同一模型同时承担在线策略执行与动作条件世界模拟——既是可执行策略，也是多具身视觉世界模拟器。配套提出渐进式具身预训练：统一从 egocentric 人类视频、手持夹爪演示、异构机器人轨迹学习。",
    "pipeline": {
      "input": "多视角观测 + 机器人状态 + 动作 token 的统一因果序列。",
      "process": "渐进式多具身预训练（人类视频→夹爪→异构机器人轨迹）→ 统一 World Action Modeling 目标 → 在线自回归执行/模拟。",
      "output": "动作（作为策略）与未来观测/世界演化（作为模拟器）。",
      "details": "**输入**：多视角观测 + 机器人状态 + 动作 token 的统一因果序列。\n**过程**：渐进式多具身预训练（人类视频→夹爪→异构机器人轨迹）→ 统一 World Action Modeling 目标 → 在线自回归执行/模拟。\n**输出**：动作（作为策略）与未来观测/世界演化（作为模拟器）。"
    },
    "experiments": "摘要层面核验；作者主张其同时作为策略与世界模拟器优于基于联合生成/视频优先/解耦的范式。具体基准、消融与统计待全文核验。证据等级：仅摘要可见。",
    "evidence_notes": "",
    "code_data_status": "发布了 Galaxea-Open-World 数据集与 InternData-A1 关联数据集链接（HF），项目页已上线；模型权重/代码公开状态待确认。",
    "limitations": "- 单序列长上下文的计算成本与视觉 token 压缩；\n- 多具身统一目标下各具身性能的平衡；\n- 因果自回归序列的\"世界一致性\"（长程几何/物理一致）待评测。\n\n### 与知域的关系\n落在 World Action Model 主线核心，与已收录的 GigaWorld-Policy、Galaxea G0.5（统一自回归流）、OSCAR 直接相关；其\"单模型双角色（策略+模拟器）\"是对 WAM 范式的强声明，值得专题跟踪。",
    "comments": "",
    "source_reports": [
      "report-a141624b1e"
    ],
    "deleted": false,
    "updated_at": "2026-08-31",
    "arxiv": {
      "published": "2026-08-27T12:21:26Z",
      "revised_at": "2026-08-27T12:21:26Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2608-28718",
    "title": "RoboPhys-3D: A Comprehensive Embodied World Model Evaluation via 3D Reconstruction",
    "authors": [
      "Tianyi Wang",
      "Jiazhou Chen",
      "Yiming Xu",
      "Xiangyu Li",
      "Tianyi Zeng",
      "Chih-Hsien Chou",
      "Ning Lu",
      "Liang Peng",
      "Junfeng Jiao",
      "Christian Claudel"
    ],
    "year": 2026,
    "publication": "2026，arXiv",
    "arxiv_id": "2608.28718",
    "doi": "10.48550/arXiv.2608.28718",
    "links": {
      "paper": "https://arxiv.org/abs/2608.28718",
      "alphaxiv": "https://alphaxiv.org/abs/2608.28718"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "机器人学习",
      "流式与自回归",
      "物理建模与仿真",
      "第一视角与人类视频",
      "跨本体迁移"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.28718v1/fig1.png",
      "alt": "RoboPhys-3D 基于重建的世界模型评测框架",
      "label": "Figure 1，基于 3D 重建的世界模型评测框架；来源：论文原图",
      "paper_title": "RoboPhys-3D: A Comprehensive Embodied World Model Evaluation via 3D Reconstruction",
      "source_url": "https://arxiv.org/html/2608.28718v1/fig1.png"
    },
    "summary": "RoboPhys-3D 用同一重建 pipeline 处理参考视频和生成视频，从而估计重建器自身误差，避免把所有几何偏差归因于世界模型。",
    "insight": "RoboPhys-3D 用同一重建 pipeline 处理参考视频和生成视频，从而估计重建器自身误差，避免把所有几何偏差归因于世界模型。",
    "pipeline": {
      "input": "初始帧、指令、参考多视图轨迹和世界模型生成视频。",
      "process": "用 VGGT、VGGT-Omega、4DGS、4C4D 等恢复 3D/4D 表示；计算像素、几何、状态理解和任务完成四层指标；构造 Average Full Score 与 RoboPhyscore。",
      "output": "对世界模型和 reconstruction backend 的分层诊断分数。",
      "details": "**输入**：初始帧、指令、参考多视图轨迹和世界模型生成视频。\n\n**过程**：用 VGGT、VGGT-\\(\\Omega\\)、4DGS、4C4D 等恢复 3D/4D 表示；计算像素、几何、状态理解和任务完成四层指标；构造 Average Full Score 与 RoboPhyscore。\n\n**输出**：对世界模型和 reconstruction backend 的分层诊断分数。"
    },
    "experiments": "四个被测模型中 Cosmos RoboPhyscore 为 0.6330，Wan 为 0.5359。RoboPhyscore 与人工评分 Pearson \\(r=0.9761\\)、Spearman \\(\\rho=0.8962\\)；重建方法可使分数变化最多 21.8%。这支持校准重建误差，但覆盖的模型与 backend 数量有限。",
    "evidence_notes": "",
    "code_data_status": "正文描述了数据和协议，但本次未找到公开代码或数据入口，暂不能确认 benchmark 可直接运行。",
    "limitations": "仅覆盖 RoboTwin 2.0 单一模拟平台和 embodiment；缺少真实机器人与跨硬件评测。指标按当前任务成功相关性选择，可能对模型集合过拟合。\n\n### 与知域的关系\n\n为 Video/WAM 与 VGGT 类重建模型提供交叉评测，适合审查视觉质量、几何正确性和可执行性之间的差异。",
    "comments": "",
    "source_reports": [
      "report-0d81d19c6c"
    ],
    "deleted": false,
    "updated_at": "2026-09-08",
    "arxiv": {
      "published": "2026-08-28T09:44:13Z",
      "revised_at": "2026-08-28T09:44:13Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2609-23252",
    "title": "Robot World Models Are Not Invariant to How the Actions Are Written",
    "authors": [
      "Ahmed Karim",
      "Leon Chlon"
    ],
    "year": 2026,
    "publication": "2026，arXiv",
    "arxiv_id": "2609.23252",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2609.23252",
      "alphaxiv": "https://alphaxiv.org/abs/2609.23252"
    },
    "tags": [
      "世界模型",
      "动作表征",
      "适应与泛化"
    ],
    "figure": {
      "url": "content/images/2609.23252-main.webp",
      "alt": "Figure 1：同一物理动作采用不同编码时的未来检索差异",
      "label": "Figure 1 · 同一物理动作采用不同编码时的未来检索差异",
      "paper_title": "Robot World Models Are Not Invariant to How the Actions Are Written",
      "source_url": "https://arxiv.org/html/2609.23252v1/fig1_montage_2row.png"
    },
    "summary": "论文发现 world model会强烈依赖action notation。即使 absolute target和relative delta在给定当前state后数学上等价，模型训练于一种写法后直接换另一种写法，预测空间可能完全改变。",
    "insight": "论文发现 world model会强烈依赖action notation。即使 absolute target和relative delta在给定当前state后数学上等价，模型训练于一种写法后直接换另一种写法，预测空间可能完全改变。",
    "pipeline": {
      "input": "current JEPA latent与action window。",
      "process": "冻结I-JEPA encoder，仅学习action-conditioned latent transition；比较absolute和relative action encoding；随后通过objective orbit averaging和agreement penalty修复representation dependence。",
      "output": "future latent和用于goal-conditioned action selection的world prediction。",
      "details": "**过程**：冻结I-JEPA encoder，仅学习action-conditioned latent transition；比较absolute和relative action encoding；随后通过objective orbit averaging和agreement penalty修复representation dependence。\n\n**输入**：current JEPA latent与action window。\n\n**输出**：future latent和用于goal-conditioned action selection的world prediction。\n\n研究冻结 I-JEPA 视觉表征，只训练 latent transition，将“动作坐标变化”与“物理行为变化”尽量分开。orbit averaging 在等价表示上聚合目标，agreement penalty 显式约束两种表示的输出一致，而不是只增加一种动作数据增强。\n\n[原文方法](https://arxiv.org/html/2609.23252)\n\n### 方法细节与实现\n\n**被检验的不变性。**给定当前状态，绝对目标位置和相对位移可以相互变换，因而它们应描述同一物理行动。作者冻结 I-JEPA 编码器，只训练动作条件的潜状态转移，比较同一转移分别采用两种动作写法时的预测与检索结果，从而尽量排除视觉编码器差异。\n\n**修复目标。**orbit averaging 对等价动作表示上的训练目标求平均，agreement penalty 进一步把同一物理行动的预测拉近。前者增加跨表示覆盖，后者明确约束输出一致；两者不是只换一种归一化尺度。强约束能改善跨表示一致性，但也可能削弱对熟悉编码的专门拟合。\n\n**决策层检查。**论文除比较 latent 相似度，还用预测未来做目标条件的动作选择，检验表示偏差是否改变实际候选排序。动作编码本身几乎可逆并不能迫使神经网络遵守这种等价性，这是对 WAM 接口和数据混合方式的直接提醒。\n\n[对应方法原文](https://arxiv.org/html/2609.23252#S3)"
    },
    "experiments": "三组robot dataset、两种morphology中cross-encoding retrieval下降2.6–13.4×；goal-conditioned action selection从53.1%降到15.4%；PushT cross-encoding cosine仅0.067、worst −0.377。两种action encoding在joint input上仍可\\(R^2=0.996\\)互相重建。\n\n\n表 2 中 λ=16 时，两种编码 agreement mean/worst 达 0.999/0.995，动作选择为 41.1%/41.1%。它恢复了编码一致性，却低于原 teacher 在熟悉编码下的 53.1%。因此修复的是表示依赖，并非无代价提升每项任务性能；retrieval collapse 倍数也不是机器人成功率下降倍数。\n\n[原文实验与表格](https://arxiv.org/html/2609.23252)\n\n**恢复与损失同时存在。**λ=16 时两种编码的平均/最差 agreement 为 0.999/0.995，动作选择均达到 41.1%，恢复了一致性，但低于原 teacher 在熟悉编码下的 53.1%。因此正确结论是表示稳健性与单域最优性能之间存在权衡，不能只展示 agreement 接近 1 就宣称控制全面改善。\n\n[实验与设置原文](https://arxiv.org/html/2609.23252)",
    "evidence_notes": "已核验原文方法与实验；关键比较与限制见各节",
    "code_data_status": "未核验到新代码发布。",
    "limitations": "重点只验证少数action parameterization；其他representation symmetry是否同样严重仍需系统测试。",
    "comments": "",
    "source_reports": [],
    "deleted": false,
    "updated_at": "2026-09-24",
    "challenges": "同一物理动作可以用绝对目标或相对增量表示。即使给定当前状态后两者信息等价，神经网络也可能将表示方式当成行为差异，进而改变对未来和候选动作的评分。",
    "motivation": "论文发现 world model会强烈依赖action notation。即使 absolute target和relative delta在给定当前state后数学上等价，模型训练于一种写法后直接换另一种写法，预测空间可能完全改变。",
    "technical_approach": "**过程**：冻结I-JEPA encoder，仅学习action-conditioned latent transition；比较absolute和relative action encoding；随后通过objective orbit averaging和agreement penalty修复representation dependence。\n\n**输入**：current JEPA latent与action window。\n\n**输出**：future latent和用于goal-conditioned action selection的world prediction。\n\n研究冻结 I-JEPA 视觉表征，只训练 latent transition，将“动作坐标变化”与“物理行为变化”尽量分开。orbit averaging 在等价表示上聚合目标，agreement penalty 显式约束两种表示的输出一致，而不是只增加一种动作数据增强。\n\n[原文方法](https://arxiv.org/html/2609.23252)\n\n### 方法细节与实现\n\n**被检验的不变性。**给定当前状态，绝对目标位置和相对位移可以相互变换，因而它们应描述同一物理行动。作者冻结 I-JEPA 编码器，只训练动作条件的潜状态转移，比较同一转移分别采用两种动作写法时的预测与检索结果，从而尽量排除视觉编码器差异。\n\n**修复目标。**orbit averaging 对等价动作表示上的训练目标求平均，agreement penalty 进一步把同一物理行动的预测拉近。前者增加跨表示覆盖，后者明确约束输出一致；两者不是只换一种归一化尺度。强约束能改善跨表示一致性，但也可能削弱对熟悉编码的专门拟合。\n\n**决策层检查。**论文除比较 latent 相似度，还用预测未来做目标条件的动作选择，检验表示偏差是否改变实际候选排序。动作编码本身几乎可逆并不能迫使神经网络遵守这种等价性，这是对 WAM 接口和数据混合方式的直接提醒。\n\n[对应方法原文](https://arxiv.org/html/2609.23252#S3)",
    "discussion": "**阅读者分析**：对WAM benchmark和跨本体动作统一极其重要：action coordinate选择本身可能成为隐藏confounder。",
    "arxiv": {
      "published": "2026-09-19",
      "revised_at": "",
      "primary_category": "cs.RO"
    },
    "source_papers": [
      "content/papers/2609.23252.md"
    ]
  },
  {
    "id": "arxiv-2607-22535",
    "title": "Robot-Factored World Models via Robot Rendering",
    "authors": [
      "Byungjun Kim",
      "Taeksoo Kim",
      "Hyunsoo Cha",
      "Hanbyul Joo"
    ],
    "year": 2026,
    "publication": "2026，arXiv preprint",
    "arxiv_id": "2607.22535",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2607.22535",
      "project": "https://bjkim95.github.io/rofacto/",
      "code": "https://github.com/bjkim95/rofacto",
      "alphaxiv": "https://alphaxiv.org/abs/2607.22535"
    },
    "tags": [
      "3D/4D",
      "世界模型",
      "动作表征",
      "机器人学习",
      "跨本体迁移"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2607.22535/x1.png",
      "alt": "Robot-Factored World Models Fig. 1",
      "label": "Robot-Factored World Models，Fig. 1，静态场景上下文与名义机器人渲染组成视觉动作接口。来源：Fig. 1 原图",
      "paper_title": "Robot-Factored World Models via Robot Rendering",
      "source_url": "https://arxiv.org/html/2607.22535/x1.png"
    },
    "summary": "作者提出“名义轨迹”：在无场景交互时，用部署可用的控制器与运动学把动作实现成轨迹，再渲染成相机对齐机器人几何。它将 action realization 和 embodiment geometry 移出网络，让模型专门预测环境响应，并首次清晰审计 logged future state leakage。",
    "insight": "作者提出“名义轨迹”：在无场景交互时，用部署可用的控制器与运动学把动作实现成轨迹，再渲染成相机对齐机器人几何。它将 action realization 和 embodiment geometry 移出网络，让模型专门预测环境响应，并首次清晰审计 logged future state leakage。",
    "pipeline": {
      "input": "当前场景 RGB/深度、动作、初始关节状态、控制器、URDF、相机轨迹和不泄漏结果的文本。",
      "process": "在无碰撞环境中重放动作得到名义关节轨迹，渲染机器人 RGB mesh 与末端深度；静态场景 RGB/深度和机器人几何经 VAE 后与噪声视频拼接。Wan2.1-Fun 14B inpainting 模型以 LoRA+flow matching 训练。",
      "output": "给定名义机器人运动后的交互视频；可组合未见机器人几何与重定向的人类动作。",
      "details": "- **输入：** 当前场景 RGB/深度、动作、初始关节状态、控制器、URDF、相机轨迹和不泄漏结果的文本。\n- **过程：** 在无碰撞环境中重放动作得到名义关节轨迹，渲染机器人 RGB mesh 与末端深度；静态场景 RGB/深度和机器人几何经 VAE 后与噪声视频拼接。Wan2.1-Fun 14B inpainting 模型以 LoRA+flow matching 训练。\n- **输出：** 给定名义机器人运动后的交互视频；可组合未见机器人几何与重定向的人类动作。"
    },
    "experiments": "DROID 41,642 clips、RoboCasa-GR1 9,380 clips；测试 256/128 clips。Wan backbone 下 AdaLN 状态向量与 mesh+EEF/场景深度在 DROID 的 PSNR/LPIPS 为 18.57/0.224 vs 21.87/0.178，RoboCasa 为 17.67/0.194 vs 24.61/0.131。名义 mesh 相对原始动作 mesh 的 DROID PSNR 21.57→22.44，加入深度到 23.08。\n\n泄漏审计中 DROID nominal→nominal、logged→logged oracle、logged train→nominal test 的 LPIPS 为 0.179/0.174/0.187；RoboCasa 为 0.120/0.112/0.126。oracle 条件最好但不可部署，训练/部署错配最差，支持名义条件定义。跨 xArm6、双 Franka 与人手重定向仅定性。论文未报告 GPU、训练步数或延迟。",
    "evidence_notes": "",
    "code_data_status": "项目页和仓库公开，但核验时仓库仍标记 “Code coming soon”。基础数据公开；处理 clips、名义轨迹缓存和渲染资产未核验发布。",
    "limitations": "- 每个机器人都需 URDF、控制器和相机—机器人标定。\n- 名义轨迹不表达接触后的真实顺应与偏差。\n- 仅报告重建指标，缺少任务成功与接触准确率。\n- 跨本体与人类重定向只有定性证据。\n- 失败、滑落和卡住等尾部数据不足。",
    "comments": "",
    "source_reports": [
      "report-a77d9a7ad6"
    ],
    "deleted": false,
    "updated_at": "2026-08-31",
    "challenges": "直接条件化原始命令要求世界模型同时学习控制器如何实现动作；条件化日志中的未来关节状态则泄漏接触、延迟和纠错结果。长期挑战是动作条件视频的可部署性，本文具体缺口是缺少既反映机器人运动、又不偷看未来结果的中间变量。",
    "motivation": "作者提出“名义轨迹”：在无场景交互时，用部署可用的控制器与运动学把动作实现成轨迹，再渲染成相机对齐机器人几何。它将 action realization 和 embodiment geometry 移出网络，让模型专门预测环境响应，并首次清晰审计 logged future state leakage。",
    "technical_approach": "- **输入：** 当前场景 RGB/深度、动作、初始关节状态、控制器、URDF、相机轨迹和不泄漏结果的文本。\n- **过程：** 在无碰撞环境中重放动作得到名义关节轨迹，渲染机器人 RGB mesh 与末端深度；静态场景 RGB/深度和机器人几何经 VAE 后与噪声视频拼接。Wan2.1-Fun 14B inpainting 模型以 LoRA+flow matching 训练。\n- **输出：** 给定名义机器人运动后的交互视频；可组合未见机器人几何与重定向的人类动作。",
    "discussion": "RoFacto 最重要的贡献不是更高 PSNR，而是区分动作命令、部署可用名义轨迹和泄漏未来结果的 logged state。结果证明条件一致性重要；但名义轨迹仍忽略接触后的顺应性与执行误差，跨本体只证明接口可组合，未证明物理预测准确。",
    "arxiv": {
      "published": "2026-07-24T17:59:57Z",
      "revised_at": "2026-07-24T17:59:57Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2609-03199",
    "title": "RoboTok: An Internet-Scale Data Engine for Human Demonstration Retrieval and Dexterous Manipulation Learning",
    "authors": [
      "Howard Qian",
      "Yiting Chen",
      "Yunfei Xie",
      "Kejia Ren",
      "Podshara Chanrungmaneekul",
      "Gaotian Wang",
      "Bowen Wen",
      "Chen Wei",
      "Kaiyu Hang"
    ],
    "year": 2026,
    "publication": "2026，arXiv",
    "arxiv_id": "2609.03199",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2609.03199",
      "alphaxiv": "https://alphaxiv.org/abs/2609.03199"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "机器人学习",
      "流式与自回归",
      "物理建模与仿真",
      "第一视角与人类视频",
      "跨本体迁移"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2609.03199v1/fig_qualitative_activities_keypoints_traj.png",
      "alt": "RoboTok 人类示范活动、关键点与轨迹表示",
      "label": "RoboTok 人类示范活动、关键点与轨迹表示；来源：论文原图",
      "paper_title": "RoboTok: An Internet-Scale Data Engine for Human Demonstration Retrieval and Dexterous Manipulation Learning",
      "source_url": "https://arxiv.org/html/2609.03199v1/fig_qualitative_activities_keypoints_traj.png"
    },
    "summary": "RoboTok 将互联网人类操作视频视为可持续增长的机器人学习数据源。其核心表示是以演员为中心坐标系表达的 3D 手部轨迹，用于跨视角、场景外观和遮挡条件下的操作示范检索。",
    "insight": "RoboTok 将互联网人类操作视频视为可持续增长的机器人学习数据源。其核心表示是以演员为中心坐标系表达的 3D 手部轨迹，用于跨视角、场景外观和遮挡条件下的操作示范检索。",
    "pipeline": {
      "input": "查询人类操作视频、互联网人类操作视频集合、估计的 3D 手部轨迹。",
      "process": "将手轨迹转换到 actor-centered reference frame，学习潜在运动空间，建立大规模检索索引，再将相关示范用于机器人策略学习。",
      "output": "相关人类示范及下游机器人策略监督。",
      "details": "**输入**：查询人类操作视频、互联网人类操作视频集合、估计的 3D 手部轨迹。\n\n**过程**：将手轨迹转换到 actor-centered reference frame，学习潜在运动空间，建立大规模检索索引，再将相关示范用于机器人策略学习。\n\n**输出**：相关人类示范及下游机器人策略监督。"
    },
    "experiments": "摘要声称在检索 benchmark 和下游机器人策略成功率上优于已有机器人数据检索方法。尚未核验：\n\n- 3D 手部轨迹的估计误差；\n- 视频检索数据规模；\n- 互联网视频与测试任务之间的数据泄漏；\n- 机器人策略是否真正使用了检索视频，还是只使用了筛选后的标签；\n- 遮挡和非人手操作场景的失败率。",
    "evidence_notes": "",
    "code_data_status": "当前未确认代码、索引或数据是否开放。",
    "limitations": "- 人类手部轨迹不一定包含接触力、摩擦和机器人执行约束。\n- 互联网视频的镜头剪辑可能破坏时间因果关系。\n- 检索相关性与可执行性之间仍存在明显鸿沟。\n\n### 与知域的关系\n\n该工作直接连接 HOI、Egocentric World Model 和跨具身学习，可能影响知域的数据设计路线：从\"收集更多机器人轨迹\"转向\"检索并筛选高价值人类交互视频\"。",
    "comments": "",
    "source_reports": [
      "report-0d81d19c6c"
    ],
    "deleted": false,
    "updated_at": "2026-09-08",
    "arxiv": {
      "published": "2026-09-02T22:31:43Z",
      "revised_at": "2026-09-02T22:31:43Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2607-20033",
    "title": "Robots Acquire Manipulation Skills in Seconds from a Single Human Video（HOST）",
    "authors": [
      "Guangyan Chen",
      "Meiling Wang",
      "Te Cui",
      "Zichen Zhou",
      "Qi Shao",
      "Shalfun Li",
      "Hang Su",
      "Roy Gan",
      "Hao Wang",
      "Mengyin Fu",
      "Yi Yang",
      "Yufeng Yue"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本（v1：2026-07-22）",
    "arxiv_id": "2607.20033",
    "doi": "10.48550/arXiv.2607.20033",
    "links": {
      "paper": "https://arxiv.org/abs/2607.20033",
      "project": "https://host-site.host-robotics.workers.dev/",
      "alphaxiv": "https://alphaxiv.org/abs/2607.20033"
    },
    "tags": [
      "VLA",
      "World Action Model",
      "具身上下文学习",
      "机器人学习",
      "适应与泛化",
      "长时记忆"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2607.20033v1/x2.png",
      "alt": "HOST method overview",
      "label": "Figure 2，HOST 用共享任务进度对齐演示与机器人轨迹，再按“进度定位 → 机器人未来观测 → 动作”的顺序生成。来源：arXiv HTML 原图",
      "paper_title": "Robots Acquire Manipulation Skills in Seconds from a Single Human Video（HOST）",
      "source_url": "https://arxiv.org/html/2607.20033v1/x2.png"
    },
    "summary": "HOST 把 one-shot visual imitation 的失败归结为两种结构错配：人和机器人完成同一任务的速度不同，固定时间偏移会把监督目标配到错误阶段；即便阶段对齐，人手、机器人、视角和场景外观仍不同，直接从人类帧回归低维动作过难。它因此先离线学习无帧级标注的共享 task-progress manifold，把每个机器人训练目标绑定到演示的 未来进程 ；推理时再通过单个 autoregressive diffusion model 依次预测当前进度、机器人自身未来观测和动作。",
    "insight": "HOST 把 one-shot visual imitation 的失败归结为两种结构错配：人和机器人完成同一任务的速度不同，固定时间偏移会把监督目标配到错误阶段；即便阶段对齐，人手、机器人、视角和场景外观仍不同，直接从人类帧回归低维动作过难。它因此先离线学习无帧级标注的共享 task-progress manifold，把每个机器人训练目标绑定到演示的**未来进程**；推理时再通过单个 autoregressive diffusion model 依次预测当前进度、机器人自身未来观测和动作。\n\n这里的 “causal cascade” 指模型内部生成顺序和 attention mask：动作读取已预测未来观测，未来观测读取已预测进度。它是有向的计算依赖，不是结构因果模型、`do(·)` 干预或可识别的因果机制。HOST 的新技能保存在外部视频上下文里而非权重中；以后可按语言与初始场景检索该视频，从而避免为每个新技能反复 fine-tune 和遗忘旧技能。",
    "pipeline": {
      "input": "一段人类视频、可选语言、最近 K 步三视角机器人观察、当前 20 维本体状态。",
      "process": "训练期用基于 Qwen3-VL-Embedding-8B 的对齐模块恢复人/机器人帧的单调进度；HOST 根据预测进度滑动演示窗口，以 Wan VAE 编码视频，在 mixture-of-transformers 中按 progress → future robot observations → 32-step actions 的顺序做联合 flow matching。Stage 1 用 193,462 条、229 任务的 robot–robot pairs；Stage 2 用 5,847 段自采人类视频及同任务机器人轨迹适配跨 embodiment。",
      "output": "归一化任务进度、机器人自身视角未来 latent 与 32 步双臂动作块；推理时模型权重冻结。",
      "details": "- **输入**：一段人类视频、可选语言、最近 K 步三视角机器人观察、当前 20 维本体状态。\n- **过程**：训练期用基于 Qwen3-VL-Embedding-8B 的对齐模块恢复人/机器人帧的单调进度；HOST 根据预测进度滑动演示窗口，以 Wan VAE 编码视频，在 mixture-of-transformers 中按 progress → future robot observations → 32-step actions 的顺序做联合 flow matching。Stage 1 用 193,462 条、229 任务的 robot–robot pairs；Stage 2 用 5,847 段自采人类视频及同任务机器人轨迹适配跨 embodiment。\n- **输出**：归一化任务进度、机器人自身视角未来 latent 与 32 步双臂动作块；推理时模型权重冻结。"
    },
    "experiments": "HOST 的实验链条较完整，实际探查十个问题。\n\n1. **覆盖面。** 单一 ARX R5 双臂平台、三 RGB 相机、20 维动作；50 个训练集未包含其操作技能的新任务，每任务 20 次、随机化物体位姿，由人按任务标准判定。作者称 50 项都获得非零可执行能力，整体平均成功率 62%。这证明覆盖不局限于一两个 cherry-picked 视频，但非零能力不等于每项可靠，完整逐任务不确定性未报告。\n2. **与 frozen-weight baselines 的比较。** 在核心新任务子集上，对比同样接收一段视频的 Vid2Robot、AWDA，以及只接语言的 π0.5、Wall-OSS、HOST-base。OSVI 的 conditioning 被移植到 HOST backbone，Vid2Robot 为作者复现。HOST 比最强 OSVI 高 43 个百分点、比最强 zero-shot language policy 高 45 个百分点。它支持“如何使用演示”比仅提供视频更重要；但重实现质量与不同 baseline 的原始预训练仍是混杂因素。\n3. **与监督微调的数据/时间效率比较。** π0.5、Wall-OSS、HOST-base 分别用 10/20/50 条机器人演示做 LoRA SFT。50 条时最强 Wall-OSS+SFT 为 56%，仍低于 HOST 单视频的 62%；SFT 的采集加训练约 4.0–4.9 小时，HOST 只需录制视频，平均 29 秒，相对最快 SFT 为 507×。这里的“acquisition time”主要省掉机器人遥操作和离线训练，不是模型单次推理延迟。\n4. **是否遗忘旧技能。** 在 7 个训练内旧任务上比较适应前后。50-demo SFT 后 π0.5、HOST-base、Wall-OSS 分别只保留原性能的 17%、21%、40%；HOST 因权重不变而基本保留。该实验支持外部上下文避免参数覆盖，但也带有定义上的优势：HOST 没有把新知识写进共享权重，持续能力依赖视频存储与正确检索。\n5. **部署扰动。** 相对默认 62%，灯光变化、OOD 物体替换、场景更换和执行中人为移动物体分别下降 1、4、6、9 个百分点。最后一种需要重新定位进度并恢复。结果支持进度定位对一定域差和中途扰动有效，但最强扰动后约 53% 仍意味着近半失败，安全边界没有展开。\n6. **对齐是否比时钟匹配可靠。** 以人工标注事件为参照，按相对时间匹配的平均进度误差为 0.079±0.062，共享进度对齐为 0.006±0.008；推理期进度 head 相对离线对齐标签 MAE 为 0.013。它证明所测 paired data 中 task-progress alignment 更准确，但离线 alignment module 本身充当“真值”，不能替代完整人工 ground truth。\n7. **target coupling 的逐项贡献。** 整段视频条件成功率 0.21；按 timestamp 选局部窗为 0.29；按共享进度选窗为 0.45；再把预测目标绑定到演示未来进程达到 0.62。该消融直接支持时间异步与被动条件是 OSVI 瓶颈之一。\n8. **self-grounded prediction 的逐级贡献。** 在已使用 target coupling 的直接 video→action baseline 上，成功率为 0.34；加入进度定位为 0.43；并行预测未来自身观测为 0.55；让动作条件于预测未来的完整级联为 0.62。每级都提高闭环结果，支持中间自身视角未来可缓和跨 embodiment 差异；但视觉预测质量主要定性展示，未给 FVD、几何一致性或反事实校准。\n9. **同 embodiment 预训练是否必要。** 固定 Stage 2 人—机器人 pairs，只增加 Stage 1 robot–robot 数据比例，新任务成功率单调上升；0% Stage 1 明显较差。它支持大量同机器人演示先学习“跟随程序”，再用较少人类 paired data 跨域，而不能说 5,847 对人—机器人数据已经很少或易收集。\n10. **技能存储与复用。** 视频连同语言和初始场景进入外部 memory；查询以文本/场景相似度加权，在固定阈值上区分旧任务与新任务。论文展示较宽阈值区间内召回与新任务识别均较高，且检索视频驱动的执行接近新录视频。这里没有公开 memory 规模继续扩大、细粒度近邻任务、错误检索或对抗视频下的完整数值，长期可扩展性仍未证明。",
    "evidence_notes": "",
    "code_data_status": "训练规模、两阶段 steps（500K/100K）、30-layer video/action experts、三相机拼接分辨率、动作 horizon 等在附录披露较充分；但完整机器人轨迹、人类 paired videos、权重、代码和评测脚本未见公开下载。Vid2Robot 结果来自作者重实现，复现公平性需要代码才能审计。",
    "limitations": "论文只在一类双臂平行夹爪平台验证，尚未证明跨机器人 embodiment；普通 RGB 视频缺乏接触力与触觉，对精细插接/柔性操作可能不足；50 项都来自作者内部任务体系，训练—测试语义去污染与任务定义需公开；相似度 memory 随规模增长可能混淆指令和场景都很相近的技能。62% 是重要进展但仍不适合无监督部署。最关键的后续干预是错误视频、同首帧不同程序、局部步骤删除、视频倒放和近邻检索冲突。\n\n### 与知域的关系\n\nHOST 是六项核心工作中机制审计最完整的 frozen-weight video ICL：它不仅给视频，还显式解决“当前执行位于示范哪里”和“如何转成自身未来”两个接口问题。",
    "comments": "",
    "source_reports": [
      "report-1950a5754f"
    ],
    "deleted": false,
    "updated_at": "2026-09-02",
    "arxiv": {
      "published": "2026-07-22T11:20:05Z",
      "revised_at": "2026-08-20T06:23:07Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2607-15275",
    "title": "RoboTTT: Context Scaling for Robot Policies",
    "authors": [
      "Yunfan Jiang",
      "Yevgen Chebotar",
      "Ruijie Zheng",
      "Fengyuan Hu",
      "Yunhao Ge",
      "Jimmy Wu",
      "Tianyuan Dai",
      "Scott Reed",
      "Li Fei-Fei",
      "Yuke Zhu",
      "Linxi \"Jim\" Fan"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本（v1：2026-07-16）",
    "arxiv_id": "2607.15275",
    "doi": "10.48550/arXiv.2607.15275",
    "links": {
      "paper": "https://arxiv.org/abs/2607.15275",
      "project": "https://research.nvidia.com/labs/gear/robottt/",
      "alphaxiv": "https://alphaxiv.org/abs/2607.15275"
    },
    "tags": [
      "VLA",
      "World Action Model",
      "具身上下文学习",
      "机器人学习",
      "适应与泛化",
      "长时记忆"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2607.15275v1/x2.png",
      "alt": "RoboTTT architecture",
      "label": "Figure 2，RoboTTT 在 GR00T N1.7 的 DiT action head 中加入 TTT layer；每步观测通过自监督更新写入 fast weights，后续动作再读取该状态。来源：arXiv HTML 原图",
      "paper_title": "RoboTTT: Context Scaling for Robot Policies",
      "source_url": "https://arxiv.org/html/2607.15275v1/x2.png"
    },
    "summary": "RoboTTT 研究的不是“给策略多放几帧”而是如何让机器人在固定推理成本下真正使用数千步历史。它把 Test-Time Training layer 插入 GR00T N1.7 的 16 层 DiT action head：每层的两层 MLP fast model 以当前 token 上的自监督重建损失做一步梯度下降，更新后的参数既是计算权重，也是跨时间传递的 recurrent state。slow weights、VLM 与 fast-weight 初值由外层训练学习；部署时只让 fast weights 随历史变化。因此它属于 参数状态 ICL ，但不是对整套策略做目标任务 fine-tuning。",
    "insight": "RoboTTT 研究的不是“给策略多放几帧”而是如何让机器人在固定推理成本下真正使用数千步历史。它把 Test-Time Training layer 插入 GR00T N1.7 的 16 层 DiT action head：每层的两层 MLP fast model 以当前 token 上的自监督重建损失做一步梯度下降，更新后的参数既是计算权重，也是跨时间传递的 recurrent state。slow weights、VLM 与 fast-weight 初值由外层训练学习；部署时只让 fast weights 随历史变化。因此它属于**参数状态 ICL**，但不是对整套策略做目标任务 fine-tuning。\n\n长序列训练的两个关键配套是 sequence action forcing 与 TBPTT。前者对序列中每个 action chunk 独立采样噪声强度，使模型既看到近似干净的历史动作，也学习当前动作的 flow-matching 去噪；后者在 segment 边界截断梯度却继续传递 fast weights，使显存由 segment 长度而非总 context 决定。为让失败经验可在测试时被利用，作者另提出 DAgger Distillation：完整保留“机器人失败动作 → 人类纠正”作为上下文，只在纠正动作上计算监督损失，让外层训练把在线恢复算法蒸馏进 fast-weight 更新动力学。",
    "pipeline": {
      "input": "语言、四视角 RGB、本体状态、加噪 action chunk，以及此前的人类视频、机器人观察和已执行动作。",
      "process": "VLM 提取当前视觉语言 token；每个时间步的 self/cross-attention 处理局部信息，16 个 register tokens 携带视觉语义进入跨时间 TTT layers；fast MLP 对当前 token 做梯度更新并传到下一步；DiT 以 flow matching 生成动作块。人类演示段只更新 fast weights，不计算 action loss。",
      "output": "当前 H-step 动作块，以及持续演化但固定大小的 fast-weight 状态；其单步计算不随累计 context 线性增长。",
      "details": "- **输入**：语言、四视角 RGB、本体状态、加噪 action chunk，以及此前的人类视频、机器人观察和已执行动作。\n- **过程**：VLM 提取当前视觉语言 token；每个时间步的 self/cross-attention 处理局部信息，16 个 register tokens 携带视觉语义进入跨时间 TTT layers；fast MLP 对当前 token 做梯度更新并传到下一步；DiT 以 flow matching 生成动作块。人类演示段只更新 fast weights，不计算 action loss。\n- **输出**：当前 H-step 动作块，以及持续演化但固定大小的 fast-weight 状态；其单步计算不随累计 context 线性增长。"
    },
    "experiments": "论文实际探查六组问题，不能只保留“8K context 更好”这一句。\n\n1. **长上下文是否改善多阶段真机任务。** 在双臂 YAM、四个 RGB 相机上评测 Pup Go Car、Circuit、Gear Bot；分别收集 8、6、5 小时真机数据，平均任务时长约 2、1、5 分钟。Circuit 有约 80 种部件/顺序配置，20 种训练、60 种测试。Pup Go Car 和 Circuit 每方法 20 次，Gear Bot 10 次。RoboTTT 的三任务平均 rubric completion 为 79%，GR00T 单步为 42%、一帧历史版本约为最佳 short-context 参照、GDN 为 56%；相对单步提高 87%，相对 GDN 提高 41%。Gear Bot 完整成功 2/10，其他方法为 0。它支持长历史有助于阶段消歧、遮挡下精细操作和失败恢复，但 rubric partial credit 与 full success 必须分开理解。\n2. **预训练 context length 是否形成 scaling axis。** 保持结构与后训练协议一致，把预训练长度从 128 扩到 8K timesteps。RoboTTT 平均完成分随长度稳定上升，8K 为 71.5%，比同模型 1K 的 43.9% 高 63%，比最佳短上下文 45.6% 高 57%，未见饱和；参数匹配的 GDN 没有同样趋势。该对照说明收益不只是“有 recurrent state”，而与可通过外层目标塑形的梯度 fast weights 和长序列训练相关；但每个长度没有公开独立随机种子，不能把一条内部曲线当成普适扩展律。\n3. **能否从一段人类视频 one-shot 模仿。** Circuit 的所有配置使用同一句 “assemble circuit”，目标部件和顺序只能从人类视频识别。训练配置每种收集 5–20 段人手组装视频，与同配置机器人轨迹拼成序列；测试为未见配置。RoboTTT 完整成功 6/10，GDN 0/10，后者常选错部件或顺序。这个实验直接支持 fast weights 能读出示范配置；但样本只有 10 次、只在一个任务族上做，也没有错误视频或顺序反转对照。\n4. **是否能利用 episode 内历史应对外部扰动。** Pup Go Car 中，在屋顶或轮胎装好后由人移除，所有模型共同加入 30 分钟扰动训练。RoboTTT 对屋顶恢复 15/20，GDN 13/20，短上下文方法最多 10/20；轮胎恢复中 RoboTTT 与 GDN 都为 18/20。该结果支持长状态对回退阶段有帮助，但轮胎上不能证明梯度 fast weights 优于一般 recurrent memory，而且鲁棒性并非零样本涌现，训练见过该类扰动。\n5. **DAgger Distillation 是否学到在线改进。** 汇总 100 条 DAgger 轨迹（RoboTTT 与 GR00T 各采 50 条）。标准只学人类纠正的 DAgger 对四方法平均提高 9%、对 sequence models 提高 13%；将失败动作保留为 context 的 DAgger Distillation 对 RoboTTT/GDN 平均提高 33%，其中 RoboTTT 36%、GDN 29%。GR00T 把失败动作也当监督目标与只学纠正都为 57%，说明失败动作的价值主要来自上下文而非模仿。它支持“失败—纠正映射可被序列策略利用”，但不是证明模型在部署中继续优化显式任务损失。\n6. **哪些结构和训练选择真正必要。** 去掉 sequence action forcing 后闭环动作质量严重下降；把 fast MLP 换成线性层虽仍胜过 GR00T，但比 MLP 低 27%；在只处理 state tokens 的 TTT 上加入 action tokens 相对提高 23%，再加 register tokens 提高 18%，而单独给 GR00T 加 register tokens 无益。这些消融把收益收窄到非线性 fast model、动作历史与视觉语义桥接的组合，不能归因于单纯参数增加。",
    "evidence_notes": "",
    "code_data_status": "模型基于 GR00T N1.7；原 DiT action head 为 538M 参数，加入 TTT 后约 690M。预训练只更新新增 sequence layers，使用 16 张 GB200、30K steps；任务后训练用 8 张 GPU、1K context、20K steps 并更新全模型。部署为 RTX 5090、30 Hz。论文没有披露预训练混合数据的完整规模与构成，也未给出代码、权重、数据和许可证，因此现阶段可审计方法与内部实验，不能复现 8K scaling 或真机结果。",
    "limitations": "三项主任务都在同一 YAM 双臂平台，任务后训练使用各自数小时数据；因此论文证明的是长上下文对已后训练任务的收益，不是通用任务零样本执行。one-shot 只有 Circuit 10 次；context scaling 没有独立种子或误差条；Pup Go Car 的主要结果又加入了 DAgger 数据，与纯 context scaling 曲线不是完全相同 checkpoint。fast weights 每步由代理重建目标更新，未来还需测错配历史、恶意示范、状态漂移、超长 rollout 稳定性和 reset 策略。所谓“固定推理延迟”指复杂度不随累计历史增长，不代表没有 TTT 更新开销。\n\n### 与知域的关系\n\nRoboTTT 是本专题中唯一明确在部署期执行梯度更新的核心工作。它把上下文从 token/KV cache 压入参数空间，必须与 Zero-WAM/HOST/S1/GEN-1.5 的 frozen-weight prompting 分开索引。",
    "comments": "",
    "source_reports": [
      "report-1950a5754f"
    ],
    "deleted": false,
    "updated_at": "2026-09-02",
    "arxiv": {
      "published": "2026-07-16T17:59:06Z",
      "revised_at": "2026-07-16T17:59:06Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2609-12103",
    "title": "RodForesight: A World Model Enhanced Diffusion Policy for Slender and Material Agnostic Rod Insertion",
    "authors": [
      "Chuanbo Yu",
      "Mingyu Yue",
      "Yan Lyu",
      "Chuhan Song",
      "Peng Wang"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本，v1",
    "arxiv_id": "2609.12103",
    "doi": "10.48550/arXiv.2609.12103",
    "links": {
      "paper": "https://arxiv.org/abs/2609.12103",
      "alphaxiv": "https://alphaxiv.org/abs/2609.12103"
    },
    "tags": [
      "世界模型",
      "强化与模仿学习",
      "规划与控制",
      "触觉与灵巧操作"
    ],
    "figure": {
      "url": "content/images/2609.12103-representative.webp",
      "alt": "Fig. 3",
      "label": "Fig. 3",
      "paper_title": "RodForesight: A World Model Enhanced Diffusion Policy for Slender and Material Agnostic Rod Insertion",
      "source_url": "https://arxiv.org/html/2609.12103v1#S4.F3"
    },
    "summary": "RodForesight 用低维杆尖—孔几何后果对候选动作排序：先用视觉伺服缩小初始状态范围，再让世界模型筛选扩散策略提出的接触敏感动作。它把“预测是否有用”落实为执行前的动作选择。",
    "insight": "RodForesight 用低维杆尖—孔几何后果对候选动作排序：先用视觉伺服缩小初始状态范围，再让世界模型筛选扩散策略提出的接触敏感动作。它把“预测是否有用”落实为执行前的动作选择。",
    "pipeline": {
      "input": "杆与孔的两帧语义 mask、当前几何状态及扩散策略候选。",
      "process": "粗接近进入 hand-off 区域；扩散策略生成 8 组 16 步候选，GRU 世界模型预测径向、深度、倾斜变化；选择预测对齐更好的动作块并执行前 4 步。",
      "output": "完成细杆插入的闭环动作与预测几何后果。",
      "details": "- **输入**：杆与孔的两帧语义 mask、当前几何状态及扩散策略候选。\n- **过程**：粗接近进入 hand-off 区域；扩散策略生成 8 组 16 步候选，GRU 世界模型预测径向、深度、倾斜变化；选择预测对齐更好的动作块并执行前 4 步。\n- **输出**：完成细杆插入的闭环动作与预测几何后果。"
    },
    "experiments": "正文使用 Cosserat 杆与接触模型构造分支监督：300 条成功示范、6,654 个窗口、53,232 条匹配分支。表 II 中两阶段无世界模型为 88.9%，Transformer 世界模型为 93.3%，GRU 版本为 96.7%；位置/初始姿态泛化的总体成功率为 87.5%。表 V 的 623 组候选比较中，全体动作精确命中率仅 3.4%，但 regret 为 0.025；应看候选近似等价性和 regret，不能只看是否选中同一个 oracle 动作。 [正文实验与表格](https://arxiv.org/html/2609.12103v1)。",
    "evidence_notes": "2026-09-14 已核对 arXiv 元数据、正文主要实验与对照；未运行复现实验。",
    "code_data_status": "原始论文未提供可确认的公开代码、数据或模型下载入口，开放状态待核验。",
    "limitations": "评测依赖 Cosserat 动力学、已设材料与接触参数，不能表述成已完成真实制造产线验证。两阶段分解本身带来很大收益，世界模型的独立贡献应与两阶段无模型基线比较；稀疏多样候选子集仅 28 组。",
    "comments": "",
    "source_reports": [
      "report-37b94c4145"
    ],
    "deleted": false,
    "updated_at": "2026-09-14",
    "discussion": "作为“低维物理后果能否改善动作排序”的直接案例，与 4D 接触表征和可靠 rollout 专题衔接。",
    "arxiv": {
      "published": "2026-09-10T18:31:55Z",
      "revised_at": "2026-09-10T18:31:55Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2609-01276",
    "title": "Seeing the World and the Self from Egocentric Video",
    "authors": [
      "Kai Guan",
      "Minchao Jiang",
      "Ruichen WangLi",
      "Wentao Zhu",
      "Lei Zhang"
    ],
    "year": 2026,
    "publication": "2026，arXiv",
    "arxiv_id": "2609.01276",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2609.01276",
      "alphaxiv": "https://alphaxiv.org/abs/2609.01276"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "流式与自回归",
      "物理建模与仿真",
      "第一视角与人类视频",
      "跨本体迁移"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2609.01276v1/fig_teaser.png",
      "alt": "RESELF 第一视角场景与自运动联合重建概览",
      "label": "RESELF 第一视角场景与自运动联合重建概览；来源：论文原图",
      "paper_title": "Seeing the World and the Self from Egocentric Video",
      "source_url": "https://arxiv.org/html/2609.01276v1/fig_teaser.png"
    },
    "summary": "论文提出 RESELF，同时恢复第一视角视频中的环境场景和穿戴者自身全身运动。它将可见场景的确定性几何重建与严重遮挡身体的生成式运动推断结合起来。",
    "insight": "论文提出 RESELF，同时恢复第一视角视频中的环境场景和穿戴者自身全身运动。它将可见场景的确定性几何重建与严重遮挡身体的生成式运动推断结合起来。",
    "pipeline": {
      "input": "第一视角视频、相机运动、场景观测。",
      "process": "使用几何基础模型重建场景和相机轨迹；将几何特征和相机轨迹作为条件输入扩散模型，生成穿戴者运动；通过闭环运动学反馈进一步修正相机头部。",
      "output": "场景几何、相机轨迹和穿戴者 4D 运动。",
      "details": "**输入**：第一视角视频、相机运动、场景观测。\n\n**过程**：使用几何基础模型重建场景和相机轨迹；将几何特征和相机轨迹作为条件输入扩散模型，生成穿戴者运动；通过闭环运动学反馈进一步修正相机头部。\n\n**输出**：场景几何、相机轨迹和穿戴者 4D 运动。"
    },
    "experiments": "摘要说明构建了 EE4D-JSM 数据集，并提出几何条件运动生成框架。尚未核验数据规模、指标、与 EgoExo4D 的划分方式以及身体运动精度。",
    "evidence_notes": "",
    "code_data_status": "数据集和代码开放状态未确认。",
    "limitations": "- 身体严重遮挡会导致运动生成存在多解。\n- 场景几何误差可能通过条件输入传递到身体运动。\n- 相机、身体和场景的联合尺度估计仍可能不稳定。\n\n### 与知域的关系\n\n该工作补充知域的 DreamHand、HandsOnWorld、EgoForge、EgoSim 和 4D hand reconstruction 路线，强调\"世界\"和\"自我\"必须在同一坐标系中建模。",
    "comments": "",
    "source_reports": [
      "report-0d81d19c6c"
    ],
    "deleted": false,
    "updated_at": "2026-09-08",
    "arxiv": {
      "published": "2026-09-01T14:10:13Z",
      "revised_at": "2026-09-01T14:10:13Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2609-16737",
    "title": "Seeing What Matters: Visual Cue Guided Video Planning for Generalizable Robot Navigation",
    "authors": [
      "Hojin Lee",
      "Sizhe Lester Li",
      "Maximilian Hilger",
      "Susie Lu",
      "Achim J. Lilienthal",
      "Vincent Sitzmann",
      "Daniel A. Duecker"
    ],
    "year": 2026,
    "publication": "2026，arXiv v1，2026-09-15 提交",
    "arxiv_id": "2609.16737",
    "doi": "10.48550/arXiv.2609.16737",
    "links": {
      "paper": "https://arxiv.org/abs/2609.16737",
      "project": "https://cuenav.github.io/",
      "alphaxiv": "https://alphaxiv.org/abs/2609.16737"
    },
    "tags": [
      "世界模型",
      "规划与控制",
      "跨本体迁移"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2609.16737v1/Fig2.png",
      "alt": "CueNav Fig. 2",
      "label": "CueNav，Fig. 2，视觉 cue 引导的视频规划与本体相关 inverse dynamics。来源：Fig. 2 原图 PNG",
      "paper_title": "Seeing What Matters: Visual Cue Guided Video Planning for Generalizable Robot Navigation",
      "source_url": "https://arxiv.org/html/2609.16737v1/Fig2.png"
    },
    "summary": "CueNav继续沿“用生成视频作为 plan，再把视觉未来翻译为动作”的路线推进，但增加两个 cue：BEV map给视频模型全局任务上下文，保留机器人身体的一部分则提供 embodiment information。最终动作并不是从视频直接读取几何 waypoint，而是由 embodiment-specific inverse dynamics model 根据生成视频中的 dense flow 解码。",
    "insight": "CueNav继续沿“用生成视频作为 plan，再把视觉未来翻译为动作”的路线推进，但增加两个 cue：BEV map给视频模型全局任务上下文，保留机器人身体的一部分则提供 embodiment information。最终动作并不是从视频直接读取几何 waypoint，而是由 embodiment-specific inverse dynamics model 根据生成视频中的 dense flow 解码。",
    "pipeline": {
      "input": "近期 egocentric visual observation、文本/语义目标、BEV/global cue，以及可见的机器人 embodiment cue。",
      "process": "video planner生成短时未来视觉计划；从预测视频提取 dense optical flow；针对每个机器人本体训练的 IDM将 visual motion翻译成连续控制；系统持续闭环重新规划。",
      "output": "未来视频计划和实际导航控制命令。",
      "details": "**输入**：近期 egocentric visual observation、文本/语义目标、BEV/global cue，以及可见的机器人 embodiment cue。\n\n**过程**：video planner生成短时未来视觉计划；从预测视频提取 dense optical flow；针对每个机器人本体训练的 IDM将 visual motion翻译成连续控制；系统持续闭环重新规划。\n\n**输出**：未来视频计划和实际导航控制命令。"
    },
    "experiments": "狭窄通道实验中，CueNav在 1 m 宽度条件下达到约 70% 成功率，并在 1.5 m 条件完成全部测试。maze navigation训练轨迹来自 3×3 布局，评测扩展到 6×6；在 6×6 设置中，使用 BEV cue 的成功率约 55%，无 BEV约 30%。作者还在 Husky A300 与 Unitree Go2 上复用同一个 video planner，仅替换 embodiment-specific IDM，作为跨本体部署证据。",
    "evidence_notes": "全文已核验",
    "code_data_status": "虽然 arXiv 摘要称额外结果和代码位于项目网站，但本次直接核验项目页时，Code 区仍标为 “coming soon”，因此本报告按**代码尚未公开可用**处理。",
    "limitations": "主要限制是视频生成推理成本和闭环 replanning rate；预测仍是短 horizon，历史上下文有限，长程环境需要外部 visual cue 补充。作者也将更长记忆与模型蒸馏列为后续扩展方向。",
    "comments": "",
    "source_reports": [
      "report-1b1ffacf7d"
    ],
    "deleted": false,
    "updated_at": "2026-09-16",
    "challenges": "短时第一视角视频规划缺少长程全局任务信息，生成的视觉未来也不能直接转换为不同机器人本体可执行的连续控制，限制了导航泛化与闭环效率。",
    "motivation": "CueNav继续沿“用生成视频作为 plan，再把视觉未来翻译为动作”的路线推进，但增加两个 cue：BEV map给视频模型全局任务上下文，保留机器人身体的一部分则提供 embodiment information。最终动作并不是从视频直接读取几何 waypoint，而是由 embodiment-specific inverse dynamics model 根据生成视频中的 dense flow 解码。",
    "technical_approach": "**输入**：近期 egocentric visual observation、文本/语义目标、BEV/global cue，以及可见的机器人 embodiment cue。\n\n**过程**：video planner生成短时未来视觉计划；从预测视频提取 dense optical flow；针对每个机器人本体训练的 IDM将 visual motion翻译成连续控制；系统持续闭环重新规划。\n\n**输出**：未来视频计划和实际导航控制命令。",
    "discussion": "CueNav不是 manipulation WAM，但它很好地暴露了 Video/WAM 的一个接口问题：**生成的未来视频怎样变成不同机器人真正可执行的动作**。其 embodiment-specific IDM 与 WLA³的共享 latent action、A4A的 4D affordance形成三种不同答案，值得作为跨本体 action grounding 的对照路线。",
    "arxiv": {
      "published": "2026-09-15T07:11:21Z",
      "revised_at": "2026-09-15T07:11:21Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "arxiv": {
      "published": "2026-08-02T17:25:08Z",
      "revised_at": "2026-08-02T17:25:08Z",
      "primary_category": "cs.RO"
    },
    "arxiv_id": "2608.01397",
    "authors": [
      "Ruiteng Zhao",
      "Zhengshen Zhang",
      "Yue Su",
      "Wenshuo Wang",
      "Jiahui Li",
      "Zhiyuan Yang",
      "Francis E. H. Tay",
      "Marcelo H. Ang",
      "Haiyue Zhu"
    ],
    "code_data_status": "截至来源报告核验时，未记录可确认的官方代码、数据或模型入口；这表示开放状态待核验，不代表资源确定不存在。",
    "comments": "",
    "deleted": false,
    "doi": "",
    "evidence_notes": "",
    "experiments": "仅 0.9B、无大规模 embodied pretraining，LIBERO 达 98.5%，LIBERO-Plus 达 73.0%。UR5e 真机 Pick&Place、Towel Folding、Toolbox Organization 中，ID 和背景、光照、新物体 OOD 均优于 VPP、VLA-JEPA。结论：future representation 与 policy 使用同一 representation family 很重要，geometry grounding 防止 latent dynamics 只学习 appearance correlation。\n\n---",
    "figure": {
      "alt": "SG-WAM overview",
      "label": "SG-WAM 框架",
      "paper_title": "SG-WAM: Self-Guided World Modeling in Geometry-Aware Policy Space",
      "source_url": "https://arxiv.org/html/2608.01397v1/overview.png",
      "url": "https://arxiv.org/html/2608.01397v1/overview.png"
    },
    "id": "arxiv-2608-01397",
    "insight": "SG-WAM 认为好的 future latent 必须同时满足两点：与 policy/action representation 对齐，并包含足够 geometry。外部 V-JEPA / VGGT latent 虽然强，但未必 policy-aligned；RGB 又太重。因此它提出：**直接在 policy 自己的 representation space 中预测 future，并用 geometry teacher 塑造该 policy space**。",
    "limitations": "来源报告未单列可核验的局限、失败案例或开放问题；在补充原论文正文核验前，不对该工作的泛化性、因果性、复现性或 SOTA 结论作扩大解释。",
    "links": {
      "paper": "https://arxiv.org/abs/2608.01397",
      "alphaxiv": "https://alphaxiv.org/abs/2608.01397"
    },
    "pipeline": {
      "input": "当前 visual observation、language。",
      "process": "Qwen3.5-based policy 内部引入 learnable Dynamics Tokens；SGWP 根据当前 dynamics tokens 与 intervening action 预测 future dynamics tokens；future target 来自同一 policy 的 EMA copy；frozen VGGT 对 visual tokens 施加 geometry supervision；Action Expert 用 flow matching 输出 action。",
      "output": "EMA target、VGGT、SGWP 全部删除，只保留 policy 到 action。",
      "details": "- **输入**：当前 visual observation、language。\n- **过程**：Qwen3.5-based policy 内部引入 learnable Dynamics Tokens；SGWP 根据当前 dynamics tokens 与 intervening action 预测 future dynamics tokens；future target 来自同一 policy 的 EMA copy；frozen VGGT 对 visual tokens 施加 geometry supervision；Action Expert 用 flow matching 输出 action。\n- **推理期输出**：EMA target、VGGT、SGWP 全部删除，只保留 policy 到 action。"
    },
    "publication": "arXiv 2026",
    "source_reports": [
      "report-e81e6bd3a1"
    ],
    "summary": "SG-WAM 认为好的 future latent 必须同时满足两点：与 policy/action representation 对齐，并包含足够 geometry。外部 V-JEPA / VGGT latent 虽然强，但未必 policy-aligned；RGB 又太重。因此它提出： 直接在 policy 自己的 representation space 中预测 future，并用 geometry teacher 塑造该 policy space 。",
    "tags": [
      "3D/4D",
      "VLA",
      "World Action Model",
      "机器人学习",
      "自监督与预测表征"
    ],
    "title": "SG-WAM: Self-Guided World Modeling in Geometry-Aware Policy Space",
    "updated_at": "2026-08-20",
    "year": 2026
  },
  {
    "id": "arxiv-2607-01766",
    "title": "SimWorlds: A Multi-Agent System for Dynamic 3D Scene Creation",
    "authors": [
      "Chunjiang Liu",
      "Xiaoyuan Wang",
      "Haoyu Chen",
      "Yizhou Zhao",
      "Ming-Hsuan Yang",
      "László A. Jeni"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本",
    "arxiv_id": "2607.01766",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2607.01766",
      "project": "https://dynsimworlds.github.io",
      "alphaxiv": "https://alphaxiv.org/abs/2607.01766"
    },
    "tags": [
      "3D/4D",
      "Agent与可执行世界",
      "物理建模与仿真"
    ],
    "figure": {
      "url": "content/images/2607.01766-main.webp",
      "alt": "Figure 2：规划与编码 Agent 分阶段构建 Blender 场景，并由审核与引擎工具反馈修复",
      "label": "Figure 2 · 规划与编码 Agent 分阶段构建 Blender 场景，并由审核与引擎工具反馈修复",
      "paper_title": "SimWorlds: A Multi-Agent System for Dynamic 3D Scene Creation",
      "source_url": "https://arxiv.org/html/2607.01766v1/pipeline.png"
    },
    "summary": "SimWorlds 将“视觉上符合指令”和“引擎内机制正确”分开检查。核心贡献是分阶段构建、可检查的场景协议，以及直接读取引擎运行状态的验证工具；多 Agent 分工服务于局部发现和修复错误。最终产物是可继续编辑的动态 3D 工程。",
    "insight": "SimWorlds 将“视觉上符合指令”和“引擎内机制正确”分开检查。核心贡献是分阶段构建、可检查的场景协议，以及直接读取引擎运行状态的验证工具；多 Agent 分工服务于局部发现和修复错误。最终产物是可继续编辑的动态 3D 工程。",
    "pipeline": {
      "input": "自然语言场景描述；编辑模式还接收已有工程、编辑指令及目标图像。",
      "process": "Planner 制定对象与机制计划；Coder 按固定顺序搭建场景；确定性 verifier 检查协议和结构；Reviewer 检查预览与指令一致性，失败则返回当前阶段修复。工具读取 bake 状态、modifier、动画曲线和实际运动差分，核实指定机制是否生效。",
      "output": "包含几何、材质、灯光、相机、动画与物理的 .blend 文件，以及渲染视频。",
      "details": "**过程**：Planner 制定对象与机制计划；Coder 按固定顺序搭建场景；确定性 verifier 检查协议和结构；Reviewer 检查预览与指令一致性，失败则返回当前阶段修复。工具读取 bake 状态、modifier、动画曲线和实际运动差分，核实指定机制是否生效。\n\n- **输入**：自然语言场景描述；编辑模式还接收已有工程、编辑指令及目标图像。\n- **过程**：Planner 制定对象与机制计划；Coder 按固定顺序搭建场景；确定性 verifier 检查协议和结构；Reviewer 检查预览与指令一致性，失败则返回当前阶段修复。工具读取 bake 状态、modifier、动画曲线和实际运动差分，核实指定机制是否生效。\n- **输出**：包含几何、材质、灯光、相机、动画与物理的 `.blend` 文件，以及渲染视频。\n\n场景协议用对象分组和关系组织计划，使检查项能够定位到具体实体。确定性检查负责可枚举约束，VLM 负责构图、外观等感知判断；后者仍可能判断错误。文本生成模式与 BlenderBench 的图像条件编辑模式应分开理解。[方法 §3](https://arxiv.org/html/2607.01766#S3)\n\n### 方法细节与实现\n\n**场景是有状态的工程产物。**规划 Agent 先把文字要求拆成对象、关系、运动和渲染阶段；编码 Agent 通过 Blender 工具逐阶段修改场景；审核 Agent 根据阶段目标和实际渲染决定接受还是修复。阶段间保留 .blend 场景，因此后续操作是在已有对象及动画上继续构建，而不是每轮从文字重新生成一段视频。\n\n**验证器检查什么。**场景协议把规划中的实体和动作映射到引擎里的对象与状态，形成可核查的对应关系。检查既涉及对象存在、属性和布局，也涉及 modifier、关键帧曲线、模拟烘焙以及跨帧状态差异。视觉审核负责发现外观或语义不符，程序验证负责发现“画面看似合理、实际没有指定动画或模拟结构”的错误。\n\n**编辑与恢复。**系统把修复限制在相应阶段，利用场景快照和工具反馈持续修改；编辑模式则在已有场景上响应新增要求。它更接近可检查的动态图形资产生产流程：有些运动来自物理模拟，有些来自程序动画。仅凭运动出现和协议通过，不能证明全部场景都满足真实动力学。\n\n[对应方法原文](https://arxiv.org/html/2607.01766#S3)"
    },
    "experiments": "4DBuildBench 共 50 个场景：布料、流体、刚体、粒子、软体五类各 9 个，另有 5 个静态场景；动态类别分别覆盖三个难度。表 1 的机制通过率 MPR 为 0.87，VIGA 为 0.67；VLM 分数为 0.82 对 0.78。机制检查与抽帧视觉评价的差距，支持作者关于视觉检查盲区的主张。\n\nBlenderBench 在相同 Opus 4.7、6 次迭代预算下比较：总体 PL 从 6.02 降到 4.63，N-CLIP 从 5.28 降到 4.80，VLM 从 2.76 升到 3.41。15 场景消融子集上，去掉 verifier 使 SPR 从 0.97 降到 0.87；去掉阶段构建使 VLM 从 0.87 降到 0.76。这是子集结果，不能与全量 50 场景分数直接比较。[实验 §4](https://arxiv.org/html/2607.01766#S4)\n\n**证据如何解读。**主评测包含 50 个场景，消融使用 15 个场景。MPR 从比较系统的 0.67 提高到 0.87，视觉语言评分从 0.78 到 0.82，分别反映运动/视觉层面的评估结果。结构协议通过率依赖系统能否输出相应中间产物，跨系统比较时需留意可检查接口不同；生成时长、Agent 调用和 Blender 执行成本也是实际使用门槛。\n\n[实验与设置原文](https://arxiv.org/html/2607.01766)",
    "evidence_notes": "已核验原文方法、实验与局限；以下数值为作者报告，分析另行标注",
    "code_data_status": "官方项目入口可访问；本次未从页面确认独立代码仓库、4DBuildBench 下载包和许可证。论文描述了工具、协议和评测配置，可用于理解实现，但公开可复现状态仍待核验。",
    "limitations": "场景结构指标 SPR 依赖方法自身的分组结构，作者明确承认跨系统公平性有限，因此应以机制指标、视觉指标和编辑任务共同判断。确定性检查不能代替感知判断；复杂材质、布局和语义仍依赖 VLM。物理求解器工作正常也不等于参数与真实世界一致。",
    "comments": "",
    "source_reports": [],
    "deleted": false,
    "updated_at": "2026-09-24",
    "challenges": "把文字转成动态 Blender 场景，需要同时安排几何、物体关系、求解器、时间轴、材质与相机。几张渲染图看起来正确，并不能说明物体真的受刚体、流体或布料求解器驱动：关键帧动画可以模仿运动，却没有可干预的物理机制。",
    "motivation": "SimWorlds 将“视觉上符合指令”和“引擎内机制正确”分开检查。核心贡献是分阶段构建、可检查的场景协议，以及直接读取引擎运行状态的验证工具；多 Agent 分工服务于局部发现和修复错误。最终产物是可继续编辑的动态 3D 工程。",
    "technical_approach": "**过程**：Planner 制定对象与机制计划；Coder 按固定顺序搭建场景；确定性 verifier 检查协议和结构；Reviewer 检查预览与指令一致性，失败则返回当前阶段修复。工具读取 bake 状态、modifier、动画曲线和实际运动差分，核实指定机制是否生效。\n\n- **输入**：自然语言场景描述；编辑模式还接收已有工程、编辑指令及目标图像。\n- **过程**：Planner 制定对象与机制计划；Coder 按固定顺序搭建场景；确定性 verifier 检查协议和结构；Reviewer 检查预览与指令一致性，失败则返回当前阶段修复。工具读取 bake 状态、modifier、动画曲线和实际运动差分，核实指定机制是否生效。\n- **输出**：包含几何、材质、灯光、相机、动画与物理的 `.blend` 文件，以及渲染视频。\n\n场景协议用对象分组和关系组织计划，使检查项能够定位到具体实体。确定性检查负责可枚举约束，VLM 负责构图、外观等感知判断；后者仍可能判断错误。文本生成模式与 BlenderBench 的图像条件编辑模式应分开理解。[方法 §3](https://arxiv.org/html/2607.01766#S3)\n\n### 方法细节与实现\n\n**场景是有状态的工程产物。**规划 Agent 先把文字要求拆成对象、关系、运动和渲染阶段；编码 Agent 通过 Blender 工具逐阶段修改场景；审核 Agent 根据阶段目标和实际渲染决定接受还是修复。阶段间保留 .blend 场景，因此后续操作是在已有对象及动画上继续构建，而不是每轮从文字重新生成一段视频。\n\n**验证器检查什么。**场景协议把规划中的实体和动作映射到引擎里的对象与状态，形成可核查的对应关系。检查既涉及对象存在、属性和布局，也涉及 modifier、关键帧曲线、模拟烘焙以及跨帧状态差异。视觉审核负责发现外观或语义不符，程序验证负责发现“画面看似合理、实际没有指定动画或模拟结构”的错误。\n\n**编辑与恢复。**系统把修复限制在相应阶段，利用场景快照和工具反馈持续修改；编辑模式则在已有场景上响应新增要求。它更接近可检查的动态图形资产生产流程：有些运动来自物理模拟，有些来自程序动画。仅凭运动出现和协议通过，不能证明全部场景都满足真实动力学。\n\n[对应方法原文](https://arxiv.org/html/2607.01766#S3)",
    "discussion": "**阅读者分析**：适合作为可编辑仿真场景和合成数据的构建管线；其价值集中在“生成的代码是否真正调用正确物理机制”。它没有验证从真实视频识别物理参数，也没有证明生成数据能提升机器人策略。",
    "arxiv": {
      "published": "2026-07-02",
      "revised_at": "",
      "primary_category": "cs.AI"
    },
    "source_papers": [
      "content/papers/2607.01766.md"
    ]
  },
  {
    "id": "arxiv-2609-12155",
    "title": "Single-Query Person-Centric Bimanual Hand-Object Interaction Detection",
    "authors": [
      "Jonghyun Kim",
      "Junho Roh",
      "Yubin Yoon",
      "Hyotae Lee",
      "Jongkuk Park",
      "Taehwan Hwang",
      "Jaechul Kim",
      "Jungho Lee"
    ],
    "year": 2026,
    "publication": "2026，arXiv；arXiv comment 标注 Accepted to ECCV 2026",
    "arxiv_id": "2609.12155",
    "doi": "10.48550/arXiv.2609.12155",
    "links": {
      "paper": "https://arxiv.org/abs/2609.12155",
      "project": "https://lgecto-ail-vil.github.io/SingleQuery-BHOI/",
      "alphaxiv": "https://alphaxiv.org/abs/2609.12155"
    },
    "tags": [
      "HOI",
      "多模态感知与提示"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2609.12155v1/figures/oih_architecture.jpg",
      "alt": "Single-Query Bimanual HOI Fig. 2",
      "label": "Single-Query Bimanual HOI，Fig. 2，person-centric query 同时预测人体、双手与交互目标。来源：Fig. 2 原图 JPG",
      "paper_title": "Single-Query Person-Centric Bimanual Hand-Object Interaction Detection",
      "source_url": "https://arxiv.org/html/2609.12155v1/figures/oih_architecture.jpg"
    },
    "summary": "传统 hand-centric HOI detector把每只手独立检测，容易在多人场景中丢失“左右手属于哪个人”的关系。该工作改成 one-query-per-person：单个 query同时输出 human box、body pose、左右手框与状态，并为每只手关联 interaction target。",
    "insight": "传统 hand-centric HOI detector把每只手独立检测，容易在多人场景中丢失“左右手属于哪个人”的关系。该工作改成 one-query-per-person：单个 query同时输出 human box、body pose、左右手框与状态，并为每只手关联 interaction target。",
    "pipeline": {
      "input": "单张包含一个或多个人的 RGB 图像。",
      "process": "person query通过 part-aware deformable attention访问人体、手和姿态区域；同一 query预测 person/pose/hand structure；hand-to-query relationship matrix 让每只手从已检测 person/object query 及 off token 中选择交互目标。",
      "output": "完整 person-centric 双手结构、hand state 及 hand-object target association。",
      "details": "**输入**：单张包含一个或多个人的 RGB 图像。\n\n**过程**：person query通过 part-aware deformable attention访问人体、手和姿态区域；同一 query预测 person/pose/hand structure；hand-to-query relationship matrix 让每只手从已检测 person/object query 及 off token 中选择交互目标。\n\n**输出**：完整 person-centric 双手结构、hand state 及 hand-object target association。"
    },
    "experiments": "论文构建 COCO-based 数据，并与 Hands23 等来源对齐；约 2K COCO validation 图像增加人工 person-centric annotation。对训练标签，作者进行了 VLM-assisted verification 与人工 audit：770 个样本检查中规则错误率由约 2.5% 降至 2.1%，500 个 double-label 样本人工一致率约 98.4%。\n\n在无 pose 的直接比较中，相比 DirectBox，检测 mAP大致接近（49.1 vs 48.8），但中等严格度 interaction 指标约从 44.9 提升到 60.8，hard 指标从 12.6 提升到 28.9，支持 person-centric relation modeling 对完整双手交互关系的贡献。",
    "evidence_notes": "全文已核验",
    "code_data_status": "项目页已公开，但本次没有核验到可用的官方训练代码或权重发布。",
    "limitations": "失败仍集中在模糊、小尺度、严重遮挡和深度关系困难的手/物体；训练标签部分来自规则与 VLM 辅助，因此存在残余伪标注误差。更重要的是，该工作解决的是 2D structured interaction detection，不是 metric 3D/4D HOI。",
    "comments": "",
    "source_reports": [
      "report-1b1ffacf7d"
    ],
    "deleted": false,
    "updated_at": "2026-09-16",
    "challenges": "逐手检测在多人和双手交互场景中容易丢失人体归属、左右手结构以及每只手的交互对象，局部检测正确也不保证完整 person-centric 关系正确。",
    "motivation": "传统 hand-centric HOI detector把每只手独立检测，容易在多人场景中丢失“左右手属于哪个人”的关系。该工作改成 one-query-per-person：单个 query同时输出 human box、body pose、左右手框与状态，并为每只手关联 interaction target。",
    "technical_approach": "**输入**：单张包含一个或多个人的 RGB 图像。\n\n**过程**：person query通过 part-aware deformable attention访问人体、手和姿态区域；同一 query预测 person/pose/hand structure；hand-to-query relationship matrix 让每只手从已检测 person/object query 及 off token 中选择交互目标。\n\n**输出**：完整 person-centric 双手结构、hand state 及 hand-object target association。",
    "discussion": "它为 HarmoHOI/StreamingHOI 类长期交互建模提供了一个更合理的结构单位：**person + two hands + targets**，而不是独立 hand track。后续可进一步增加跨帧 identity、3D contact 和 object motion。",
    "arxiv": {
      "published": "2026-09-10T19:41:28Z",
      "revised_at": "2026-09-10T19:41:28Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2609-21514",
    "title": "Skel-WAM: A Hand-Skeleton-Conditioned World Action Model for Human-to-Robot Manipulation Transfer",
    "authors": [
      "Zetao Cai",
      "Yaping Li",
      "Yiqun Wang",
      "Xinyu Zhan",
      "Yuyin Yang",
      "Haoxiang Ma",
      "Kailin Li",
      "Tao Lu",
      "Jiangmiao Pang",
      "Linning Xu",
      "Dahua Lin"
    ],
    "year": 2026,
    "publication": "2026，arXiv",
    "arxiv_id": "2609.21514",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2609.21514",
      "project": "https://healorcai.github.io/Skel-WAM/",
      "code": "https://github.com/HealorCai/Skel-WAM",
      "alphaxiv": "https://alphaxiv.org/abs/2609.21514"
    },
    "tags": [
      "HOI",
      "World Action Model",
      "第一视角与人类视频",
      "跨本体迁移"
    ],
    "figure": {
      "url": "content/images/2609.21514-main.webp",
      "alt": "Figure 2：视频与手关键点专家共享运动先验，独立动作专家完成机器人控制",
      "label": "Figure 2 · 视频与手关键点专家共享运动先验，独立动作专家完成机器人控制",
      "paper_title": "Skel-WAM: A Hand-Skeleton-Conditioned World Action Model for Human-to-Robot Manipulation Transfer",
      "source_url": "https://arxiv.org/html/2609.21514v1/method_overview_pdf.png"
    },
    "summary": "通过同构hand skeleton，把human hand和robot hand运动映射到scene-grounded skeleton overlay与2.5D keypoint representation；human data训练Video/Keypoint Experts，robot-only Action Expert负责最终可执行动作。",
    "insight": "通过同构hand skeleton，把human hand和robot hand运动映射到scene-grounded skeleton overlay与2.5D keypoint representation；human data训练Video/Keypoint Experts，robot-only Action Expert负责最终可执行动作。",
    "pipeline": {
      "input": "RGB/skeleton-overlay、2.5D hand keypoints、task instruction。",
      "process": "Video–Keypoint Mixture-of-Transformers预测future visual dynamics与skeleton trajectory → Action Expert读取预测状态并输出robot action。",
      "output": "future visual/skeleton state及机器人动作。",
      "details": "**过程**：Video–Keypoint Mixture-of-Transformers预测future visual dynamics与skeleton trajectory → Action Expert读取预测状态并输出robot action。\n\n**输入**：RGB/skeleton-overlay、2.5D hand keypoints、task instruction。\n\n**输出**：future visual/skeleton state及机器人动作。\n\n共享的是手部拓扑、图像内骨架 overlay 和 2.5D keypoints。Video/Keypoint Experts 接受人机数据，Action Expert 只用机器人动作监督；官方说明动作梯度不回传共享 backbone。前向读取共享动态和反向更新共享表示必须分开理解。\n\n[原文方法](https://arxiv.org/html/2609.21514)\n\n### 方法细节与实现\n\n**共享手部接口。**人和机器人都表示成双手、每手 21 点的拓扑，并同步保留两种形式：投影到 RGB 的骨架覆盖图，以及每点的归一化 u/v、米制深度和有效性。人手通过 WiLoR/MANO 加实测手长和相机优化得到米制点；机器人通过 URDF 正运动学及相机外参获得对应点。因此共享的是几何语义，而非直接复用人手关节角。\n\n**四流注意力。**Wan2.2 初始化视频专家，层数对齐的关键点专家处理每手每帧一个 token。视频预测流读取历史骨架，关键点预测流读取视频条件；历史/条件分支隔离，当前锚点保持干净，未来目标参与 flow matching。训练中的未来视频条件可来自真值，而推理依次生成视频、关键点、动作，不能读取未来真实观察。\n\n**人类数据如何影响控制。**人机混合训练只优化视频与关键点的 MoT；机器人专属动作专家随后仅在机器人数据上训练，动作梯度不回传共享骨干。实机为 42D 动作，包含双臂末端位姿和手部关节；视频/关键点/动作分别用 3/3/5 个采样步。此设计将共享运动先验和本体专属动作映射明确分开。\n\n[对应方法原文](https://arxiv.org/html/2609.21514#S3)"
    },
    "experiments": "四个真实双臂任务平均SR 79.86%、七个simulation任务63.29%，分别比strongest baseline高22.22和8.28个百分点；robot-missing variations上human-robot cotrain将38.89%提高到86.11%。\n\n\n原文表格每格同时列 SR / progress，79.86 和 63.29 是 SR。消融里，human cotrain 完整为 86.11%，去掉 overlay 为 50.00%，去掉 keypoints 为 13.89%；说明两种共享运动通道并非可简单互换。robot-missing variations 是特定位置、旋转、扰动与高度变化，不等于任意新任务零样本。\n\n[原文实验与表格](https://arxiv.org/html/2609.21514)\n\n**关键消融。**实机四任务平均 SR 为 79.86%，EgoVLA 为 57.64%；仿真七任务为 63.29% 对 55.01%。去掉骨架覆盖图或关键点分支的相关消融分别降至 50% 和 13.89%，支持两个几何接口的互补性。人类迁移的变化场景实验与机器人单域主表是不同设置，不能把它们拼成同一个总体成功率。\n\n[实验与设置原文](https://arxiv.org/html/2609.21514)",
    "evidence_notes": "已核验原文方法与实验；关键比较与限制见各节",
    "code_data_status": "项目与官方仓库页面已公开，但当前仓库主要为论文介绍和发布计划；evaluation、预处理、训练和 checkpoints 仍列在 TODO，不能记为完整实现已发布。",
    "limitations": "共享hand topology是强先验，对非手形gripper、吸盘、多工具、多接触点系统如何泛化仍需要验证。",
    "comments": "",
    "source_reports": [],
    "deleted": false,
    "updated_at": "2026-09-24",
    "challenges": "低成本人类示范缺少机器人动作标签，人手和机器人手在外观、运动学和控制空间上存在差异。直接混合 RGB 难明确分离共享运动规律与本体专有控制。",
    "motivation": "通过同构hand skeleton，把human hand和robot hand运动映射到scene-grounded skeleton overlay与2.5D keypoint representation；human data训练Video/Keypoint Experts，robot-only Action Expert负责最终可执行动作。",
    "technical_approach": "**过程**：Video–Keypoint Mixture-of-Transformers预测future visual dynamics与skeleton trajectory → Action Expert读取预测状态并输出robot action。\n\n**输入**：RGB/skeleton-overlay、2.5D hand keypoints、task instruction。\n\n**输出**：future visual/skeleton state及机器人动作。\n\n共享的是手部拓扑、图像内骨架 overlay 和 2.5D keypoints。Video/Keypoint Experts 接受人机数据，Action Expert 只用机器人动作监督；官方说明动作梯度不回传共享 backbone。前向读取共享动态和反向更新共享表示必须分开理解。\n\n[原文方法](https://arxiv.org/html/2609.21514)\n\n### 方法细节与实现\n\n**共享手部接口。**人和机器人都表示成双手、每手 21 点的拓扑，并同步保留两种形式：投影到 RGB 的骨架覆盖图，以及每点的归一化 u/v、米制深度和有效性。人手通过 WiLoR/MANO 加实测手长和相机优化得到米制点；机器人通过 URDF 正运动学及相机外参获得对应点。因此共享的是几何语义，而非直接复用人手关节角。\n\n**四流注意力。**Wan2.2 初始化视频专家，层数对齐的关键点专家处理每手每帧一个 token。视频预测流读取历史骨架，关键点预测流读取视频条件；历史/条件分支隔离，当前锚点保持干净，未来目标参与 flow matching。训练中的未来视频条件可来自真值，而推理依次生成视频、关键点、动作，不能读取未来真实观察。\n\n**人类数据如何影响控制。**人机混合训练只优化视频与关键点的 MoT；机器人专属动作专家随后仅在机器人数据上训练，动作梯度不回传共享骨干。实机为 42D 动作，包含双臂末端位姿和手部关节；视频/关键点/动作分别用 3/3/5 个采样步。此设计将共享运动先验和本体专属动作映射明确分开。\n\n[对应方法原文](https://arxiv.org/html/2609.21514#S3)",
    "discussion": "**阅读者分析**：这是本期最直接的“从人类视频学习具身 WAM”论文之一，也为4D HOI提供了明确可解释的cross-embodiment motion interface。",
    "arxiv": {
      "published": "2026-09-18",
      "revised_at": "",
      "primary_category": "cs.RO"
    },
    "source_papers": [
      "content/papers/2609.21514.md"
    ]
  },
  {
    "id": "arxiv-2609-21983",
    "title": "SkelWAM: A Skeleton-Guided World-Action Model for Zero-Shot Cross-Embodiment Manipulation",
    "authors": [
      "Pengjun Niu",
      "Yujia Xie",
      "Rui Peng",
      "Hang Zhao",
      "Ke Liu"
    ],
    "year": 2026,
    "publication": "2026，arXiv",
    "arxiv_id": "2609.21983",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2609.21983",
      "project": "http://www.liukepku.com/skelwam/index.html",
      "alphaxiv": "https://alphaxiv.org/abs/2609.21983"
    },
    "tags": [
      "World Action Model",
      "跨本体迁移"
    ],
    "figure": {
      "url": "content/images/2609.21983-main.webp",
      "alt": "Figure 2：共享手臂骨架统一视觉和动作，再经本体专用解码器生成控制",
      "label": "Figure 2 · 共享手臂骨架统一视觉和动作，再经本体专用解码器生成控制",
      "paper_title": "SkelWAM: A Skeleton-Guided World-Action Model for Zero-Shot Cross-Embodiment Manipulation",
      "source_url": "https://arxiv.org/html/2609.21983v1/figures/fig02_representation/figure.png"
    },
    "summary": "不同于基于手部骨架的 Skel-WAM，本工作定义25D whole-body representation，由arm centerline、TCP pose与parallel-jaw command组成，并将视觉canonicalization和动作表示都建立在同一geometry上。",
    "insight": "不同于基于手部骨架的 Skel-WAM，本工作定义25D whole-body representation，由arm centerline、TCP pose与parallel-jaw command组成，并将视觉canonicalization和动作表示都建立在同一geometry上。",
    "pipeline": {
      "input": "canonical third-person/wrist observations及source robot demonstrations。",
      "process": "video-action MoT预测canonical skeleton action chunk → embodiment-specific constrained decoder转成各robot joint/continuum controls。",
      "output": "目标机器人可执行动作，无需target-task demonstration或policy update。",
      "details": "**过程**：video-action MoT预测canonical skeleton action chunk → embodiment-specific constrained decoder转成各robot joint/continuum controls。\n\n**输入**：canonical third-person/wrist observations及source robot demonstrations。\n\n**输出**：目标机器人可执行动作，无需target-task demonstration或policy update。\n\n统一的 25D 骨架把手臂中心线、TCP 姿态和夹爪状态编码到视觉与动作中；部署仍需目标本体专用的受约束解码器及反馈。零样本指没有目标任务示范或策略梯度更新，并不意味着无需目标机器人几何和控制适配。\n\n[原文方法](https://arxiv.org/html/2609.21983)\n\n### 方法细节与实现\n\n**25D 规范动作。**手臂中心线按弧长均匀采样，以 TCP 为参考、按臂长归一化；五个有效中心线点形成 15D，再加 3D TCP 位置、6D 旋转和 1D 夹爪命令。中心线采样不绑定具体关节位置，因此可在刚性关节臂与连续体臂之间定义同一种形状描述。\n\n**视觉也必须规范化。**原生机器人像素被掩蔽并补全背景，再绘制规范中心线与夹爪代理。仿真可利用特权分割与隐藏机器人后的渲染，实机依赖标定掩码和修补。这解释了为什么去掉视觉规范化会几乎完全失效：共享动作向量不能单独消除本体外观分布变化。\n\n**训练和推理接口。**视频与动作专家均以 30 层 Wan2.2 初始化，先联合训练，再冻结视频专家；24D 连续几何使用 flow matching，夹爪采用事件存在性及首次切换时刻的分解目标。动作查询只读取当前帧 K/V 和动作 token，部署缓存当前 K/V，无需生成未来视频。32×25 的骨架动作段由目标本体的 IK 或连续体运动学解码，并加入中心线形状约束。\n\n[对应方法原文](https://arxiv.org/html/2609.21983#S3)"
    },
    "experiments": "LIBERO-Cross10涵盖10 tasks×10 target embodiments、共1,000 episodes；Franka-trained模型达到43.3%，最佳evaluated baseline为7.1%，95% Wilson CI为40.3–46.4%。\n\n\n最关键的表 2 消融：去掉视觉规范化 SR 43.3%→0.0%，去掉共享动作表示→0.1%；去掉 world modeling 只降到 43.0%，去掉解码改进为 40.9%。因此实验主要支持视觉/动作接口统一，尚不能把大幅迁移收益单独归因于世界预测。官方同时注明各基线预训练与源域适配预算不同。\n\n[原文实验与表格](https://arxiv.org/html/2609.21983)\n\n**归因与零样本定义。**去掉世界建模后 43.3% 仅降为 43.0%，而去掉视觉/动作共享接口分别降到 0.0%/0.1%，这是解释贡献最有力的证据。零样本指没有目标任务示范或策略更新，仍需目标本体标定、运动学与解码器；把它称为完全无适配部署会误导复现预期。\n\n[实验与设置原文](https://arxiv.org/html/2609.21983)",
    "evidence_notes": "已核验原文方法与实验；关键比较与限制见各节",
    "code_data_status": "项目可访问；代码未核验到。",
    "limitations": "真实JAKA→Feagine continuum robot实验目前主要证明可部署性，而非提供与simulation同等级的大规模统计。",
    "comments": "",
    "source_reports": [],
    "deleted": false,
    "updated_at": "2026-09-24",
    "challenges": "只统一末端位姿不能描述不同手臂的整身可达性、中心线与本体外观差异。源本体训练的策略可能在新本体的视觉和动作两个接口上同时失配。",
    "motivation": "不同于基于手部骨架的 Skel-WAM，本工作定义25D whole-body representation，由arm centerline、TCP pose与parallel-jaw command组成，并将视觉canonicalization和动作表示都建立在同一geometry上。",
    "technical_approach": "**过程**：video-action MoT预测canonical skeleton action chunk → embodiment-specific constrained decoder转成各robot joint/continuum controls。\n\n**输入**：canonical third-person/wrist observations及source robot demonstrations。\n\n**输出**：目标机器人可执行动作，无需target-task demonstration或policy update。\n\n统一的 25D 骨架把手臂中心线、TCP 姿态和夹爪状态编码到视觉与动作中；部署仍需目标本体专用的受约束解码器及反馈。零样本指没有目标任务示范或策略梯度更新，并不意味着无需目标机器人几何和控制适配。\n\n[原文方法](https://arxiv.org/html/2609.21983)\n\n### 方法细节与实现\n\n**25D 规范动作。**手臂中心线按弧长均匀采样，以 TCP 为参考、按臂长归一化；五个有效中心线点形成 15D，再加 3D TCP 位置、6D 旋转和 1D 夹爪命令。中心线采样不绑定具体关节位置，因此可在刚性关节臂与连续体臂之间定义同一种形状描述。\n\n**视觉也必须规范化。**原生机器人像素被掩蔽并补全背景，再绘制规范中心线与夹爪代理。仿真可利用特权分割与隐藏机器人后的渲染，实机依赖标定掩码和修补。这解释了为什么去掉视觉规范化会几乎完全失效：共享动作向量不能单独消除本体外观分布变化。\n\n**训练和推理接口。**视频与动作专家均以 30 层 Wan2.2 初始化，先联合训练，再冻结视频专家；24D 连续几何使用 flow matching，夹爪采用事件存在性及首次切换时刻的分解目标。动作查询只读取当前帧 K/V 和动作 token，部署缓存当前 K/V，无需生成未来视频。32×25 的骨架动作段由目标本体的 IK 或连续体运动学解码，并加入中心线形状约束。\n\n[对应方法原文](https://arxiv.org/html/2609.21983#S3)",
    "discussion": "**阅读者分析**：这是非常直接的 cross-embodiment WAM。对“3D/4D信息是否能成为通用动作语言”这个研究问题价值很高。",
    "arxiv": {
      "published": "2026-09-18",
      "revised_at": "",
      "primary_category": "cs.RO"
    },
    "source_papers": [
      "content/papers/2609.21983.md"
    ]
  },
  {
    "arxiv": {
      "published": "2026-08-10T15:58:39Z",
      "revised_at": "2026-08-10T15:58:39Z",
      "primary_category": "cs.RO"
    },
    "arxiv_id": "2608.09771",
    "authors": [
      "Jingkai Wang",
      "Zihan Tang",
      "Gu Zhang",
      "Mingyu Cao",
      "Jiapeng Chen",
      "Jingjiao Zhao",
      "Xiansheng Chen",
      "Pengwei Wang",
      "Lemao Liu",
      "Dejing Dou"
    ],
    "code_data_status": "截至来源报告核验时，未记录可确认的官方代码、数据或模型入口；这表示开放状态待核验，不代表资源确定不存在。",
    "comments": "",
    "deleted": false,
    "doi": "",
    "evidence_notes": "",
    "experiments": "0.47B MoT，无额外 embodied pretraining；LIBERO 97.5，LIBERO-Plus 77.45，CALVIN ABC->D 平均 sequence length 4.556/5。真机 5 tasks / 750 demos 中，多数 nominal / distractor / lighting 设置表现最好；极端 background shift 下略低于 pi_0.5，但显著高于 Fast-WAM。结论：不需要 RGB foresight，也不一定需要大 VLM；action-grounded predictive latent 本身可以成为 compact policy backbone。\n\n---",
    "figure": {
      "alt": "SLIM masked trajectory prediction",
      "label": "action-grounded masked trajectory prediction",
      "paper_title": "SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation",
      "source_url": "https://arxiv.org/html/2608.09771v1/IDM_FDM.png",
      "url": "https://arxiv.org/html/2608.09771v1/IDM_FDM.png"
    },
    "id": "arxiv-2608-09771",
    "insight": "SLIM 同时质疑 VLA 与 WAM：大 VLM 中许多容量用于 open-domain semantics，pixel-level WAM 又花大量计算预测 control-irrelevant details。作者认为 manipulation 真正需要的是一个紧凑的 observation-action-transition latent space。关键是 predictive latent 必须 **action-grounded**：既能由 action 推断 future，也能从 state transition 反推出 action。",
    "limitations": "来源报告未单列可核验的局限、失败案例或开放问题；在补充原论文正文核验前，不对该工作的泛化性、因果性、复现性或 SOTA 结论作扩大解释。",
    "links": {
      "paper": "https://arxiv.org/abs/2608.09771",
      "alphaxiv": "https://alphaxiv.org/abs/2608.09771"
    },
    "pipeline": {
      "input": "current observation latent、future observation latent、proprioception、action tokens、language。",
      "process": "- Stage 1 ：Masked Trajectory Prediction，包括 inverse dynamics grounding：current latent + future latent 重建 action；forward dynamics grounding：current latent + action 预测 future latent。future target 来自 EMA encoder，防止 latent collapse。；- Stage 2 ：current observation + proprioception + language 通过 flow matching 输出 action chunk。",
      "output": "不显式预测 future observation，直接生成 action chunk。",
      "details": "- **输入**：current observation latent、future observation latent、proprioception、action tokens、language。\n- **Stage 1**：Masked Trajectory Prediction，包括 inverse dynamics grounding：current latent + future latent 重建 action；forward dynamics grounding：current latent + action 预测 future latent。future target 来自 EMA encoder，防止 latent collapse。\n- **Stage 2**：current observation + proprioception + language 通过 flow matching 输出 action chunk。\n- **推理期输出**：不显式预测 future observation，直接生成 action chunk。"
    },
    "publication": "arXiv 2026",
    "source_reports": [
      "report-e81e6bd3a1"
    ],
    "summary": "SLIM 同时质疑 VLA 与 WAM：大 VLM 中许多容量用于 open-domain semantics，pixel-level WAM 又花大量计算预测 control-irrelevant details。作者认为 manipulation 真正需要的是一个紧凑的 observation-action-transition latent space。关键是 predictive latent 必须 action-grounded ：既能由 action 推断 future，也能从 state transition 反推出 action。",
    "tags": [
      "VLA",
      "World Action Model",
      "机器人学习",
      "自监督与预测表征"
    ],
    "title": "SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation",
    "updated_at": "2026-08-20",
    "year": 2026
  },
  {
    "id": "arxiv-2609-02886",
    "title": "SolarWM: Open Data and Scalable Training for Long-Horizon Video World Models",
    "authors": [
      "Junchao Huang",
      "Guian Fang",
      "Shengju Qian",
      "Xianghao Kong",
      "Zhuoran Zhao",
      "Wei Huang",
      "Yihua Du",
      "Zixin Zhang",
      "Justin Cui",
      "Yuchao Gu",
      "Yukang Chen",
      "Xinting Hu",
      "Tianyu He",
      "Shaoshuai Shi",
      "Zhuotao Tian",
      "Xin Wang",
      "Mike Zheng Shou",
      "Li Jiang"
    ],
    "year": 2026,
    "publication": "2026，arXiv",
    "arxiv_id": "2609.02886",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2609.02886",
      "project": "https://junchao-cs.github.io/SolarWM-Web/",
      "code": "https://github.com/Junchao-cs/SolarWM",
      "data": "https://huggingface.co/datasets/junchaoh-cs/SolarWM-Data",
      "alphaxiv": "https://alphaxiv.org/abs/2609.02886"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "流式与自回归",
      "物理建模与仿真",
      "第一视角与人类视频",
      "视频生成",
      "跨本体迁移"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2609.02886v1/pipeline_2.png",
      "alt": "SolarWM 长时世界模型数据与训练流程",
      "label": "SolarWM 长时世界模型数据与训练流程；来源：论文原图",
      "paper_title": "SolarWM: Open Data and Scalable Training for Long-Horizon Video World Models",
      "source_url": "https://arxiv.org/html/2609.02886v1/pipeline_2.png"
    },
    "summary": "SolarWM 关注世界模型训练中的数据异构问题。论文构建统一数据合同，将 10 个数据集、约 143 万个 canonical clips 转换为包含视觉观测、相机几何、字幕、质量元数据、筛选决策和 provenance 的统一格式。",
    "insight": "SolarWM 关注世界模型训练中的数据异构问题。论文构建统一数据合同，将 10 个数据集、约 143 万个 canonical clips 转换为包含视觉观测、相机几何、字幕、质量元数据、筛选决策和 provenance 的统一格式。\n\n其训练框架适配 Wan2.2、LTX-2.5 和 MiniMax-H3 等不同视频骨干，并使用多阶段训练和蒸馏支持长时、因果、可交互视频生成。",
    "pipeline": {
      "input": "多来源视频、相机几何、字幕、质量和 provenance 信息。",
      "process": "统一数据预处理、相机条件化、骨干原生适配、教师强制自回归初始化、分布匹配蒸馏。",
      "output": "支持长时 rollout 的多个视频世界模型。",
      "details": "**输入**：多来源视频、相机几何、字幕、质量和 provenance 信息。\n\n**过程**：统一数据预处理、相机条件化、骨干原生适配、教师强制自回归初始化、分布匹配蒸馏。\n\n**输出**：支持长时 rollout 的多个视频世界模型。"
    },
    "experiments": "摘要明确给出 143 万 clips、10 个数据集、4 个 5B–33B 模型的信息，并声称支持分钟级实时交互 rollout。需要全文核验：\n\n- 各数据集在训练与测试中的比例；\n- 训练数据是否包含 benchmark 测试视频；\n- \"real-time\"具体硬件和帧率；\n- 不同骨干之间的比较协议；\n- 长时一致性的评价指标和失败率。",
    "evidence_notes": "",
    "code_data_status": "代码、数据集和项目页已公开链接。Hugging Face 页面本次网络环境无法直接打开，但项目页确认其存在；许可证、完整数据可下载性和模型权重待人工核验。",
    "limitations": "- 统一数据合同可能掩盖不同数据源的相机、运动和标注偏差。\n- 长时视频生成的视觉一致性不一定等于状态一致性。\n- 多骨干适配可能导致不同模型的训练目标和计算成本不可直接比较。\n\n### 与知域的关系\n\nSolarWM 对知域的流式生成、长时记忆、Causal Forcing++、minWM 和 ReWorld 路线具有直接参考价值，尤其是数据工程和可复现训练接口。",
    "comments": "",
    "source_reports": [
      "report-0d81d19c6c"
    ],
    "deleted": false,
    "updated_at": "2026-09-08",
    "arxiv": {
      "published": "2026-09-02T17:59:41Z",
      "revised_at": "2026-09-02T17:59:41Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2609-02531",
    "title": "Spatially Aware World Action Model via Geometric Latent Diffusion",
    "authors": [
      "Javier Alejandro Lopetegui Gonzalez",
      "Paul Pacaud",
      "Cordelia Schmid"
    ],
    "year": 2026,
    "publication": "2026，arXiv",
    "arxiv_id": "2609.02531",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2609.02531",
      "alphaxiv": "https://alphaxiv.org/abs/2609.02531"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "机器人学习",
      "流式与自回归",
      "物理建模与仿真",
      "第一视角与人类视频",
      "跨本体迁移"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2609.02531v1/ep_vs_sr_teaser_a200.svg",
      "alt": "SA-WAM 几何潜变量与空间感知对比",
      "label": "SA-WAM 几何潜变量与空间感知对比；来源：论文原图",
      "paper_title": "Spatially Aware World Action Model via Geometric Latent Diffusion",
      "source_url": "https://arxiv.org/html/2609.02531v1/ep_vs_sr_teaser_a200.svg"
    },
    "summary": "SA-WAM 将动作、RGB 和深度预测放入同一个视频扩散骨干。论文的关键工程设计是把无界深度信号映射到冻结 VAE tokenizer 可以接受的有界输入域，从而不必重新训练 3D 专用 tokenizer。",
    "insight": "SA-WAM 将动作、RGB 和深度预测放入同一个视频扩散骨干。论文的关键工程设计是把无界深度信号映射到冻结 VAE tokenizer 可以接受的有界输入域，从而不必重新训练 3D 专用 tokenizer。\n\n作者声称在 RoboCasa、LIBERO-Plus 和真实 UR5 实验中取得较强结果，并观察到未来状态预测质量与 rollout 成功率之间存在关联。",
    "pipeline": {
      "input": "RGB 观测、深度信息、机器人动作条件。",
      "process": "使用预训练视频模型作为扩散骨干，将深度经过非线性编码后送入冻结 VAE tokenizer；模型联合预测 RGB、深度和动作相关未来状态。",
      "output": "未来 RGB、未来深度和机器人动作。",
      "details": "**输入**：RGB 观测、深度信息、机器人动作条件。\n\n**过程**：使用预训练视频模型作为扩散骨干，将深度经过非线性编码后送入冻结 VAE tokenizer；模型联合预测 RGB、深度和动作相关未来状态。\n\n**输出**：未来 RGB、未来深度和机器人动作。"
    },
    "experiments": "摘要提到 RoboCasa、LIBERO-Plus 和 UR5 真实机器人实验，并声称相较强 baseline 有提升。尚未核验：\n\n- 深度是训练输入、辅助监督还是推理时可用输入；\n- benchmark 的具体版本和训练划分；\n- \"state-of-the-art\" 的比较范围；\n- 未来深度预测与真实控制成功率之间的统计关系；\n- 真实 UR5 中是否使用额外标定或环境先验。",
    "evidence_notes": "",
    "code_data_status": "未在摘要 comments 中发现代码、数据或模型链接。",
    "limitations": "- 深度编码可能丢失绝对尺度或精细几何。\n- RGB、深度和动作联合生成的训练目标可能存在监督不平衡。\n- 3D 信息是否真正带来跨视角、遮挡和新物体泛化，需要消融验证。\n\n### 与知域的关系\n\n该工作直接补充知域已有 DreamWAM、GaussianWAM、GeoWAM、GWM-VLA 和 4DGS-WAM，将几何信息从额外模块提升为 WAM 内部预测目标。",
    "comments": "",
    "source_reports": [
      "report-0d81d19c6c"
    ],
    "deleted": false,
    "updated_at": "2026-09-08",
    "arxiv": {
      "published": "2026-09-02T12:42:37Z",
      "revised_at": "2026-09-02T12:42:37Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2609-12549",
    "title": "STAR: Sparse Tactile Representation Learning in Vision-Tactile-Language-Action Models for Dexterous Manipulation",
    "authors": [
      "Xiangcheng Liu",
      "Tianhao Wu",
      "Le Zheng",
      "Yidong Wang",
      "Bowen Jiang",
      "Mingjie Pan",
      "Xinlin Ren",
      "Yi Liu",
      "Jianlan Luo"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本，v1",
    "arxiv_id": "2609.12549",
    "doi": "10.48550/arXiv.2609.12549",
    "links": {
      "paper": "https://arxiv.org/abs/2609.12549",
      "project": "https://stardex-web.github.io/Star/",
      "alphaxiv": "https://alphaxiv.org/abs/2609.12549"
    },
    "tags": [
      "自监督与预测表征",
      "触觉与灵巧操作"
    ],
    "figure": {
      "url": "content/images/2609.12549-representative.webp",
      "alt": "Fig. 3",
      "label": "Fig. 3",
      "paper_title": "STAR: Sparse Tactile Representation Learning in Vision-Tactile-Language-Action Models for Dexterous Manipulation",
      "source_url": "https://arxiv.org/html/2609.12549v1#S4.F3"
    },
    "summary": "STAR针对灵巧手触觉在时间、空间和信息上的稀疏性，先以高遮蔽率做视觉—触觉联合预训练，再把局部接触 token 与全局触觉 token 分开建模，并用未来触觉预测增强接触阶段表示。",
    "insight": "STAR针对灵巧手触觉在时间、空间和信息上的稀疏性，先以高遮蔽率做视觉—触觉联合预训练，再把局部接触 token 与全局触觉 token 分开建模，并用未来触觉预测增强接触阶段表示。",
    "pipeline": {
      "input": "多视角 RGB、每手高维压阻触觉、本体状态与语言。",
      "process": "以 75% mask 做跨模态预训练；稀疏—全局触觉编码器选择局部活跃区域并保留全局摘要；在 pi 0.5 骨干上联合未来触觉预测和流匹配动作训练。",
      "output": "50 步动作块及多个未来时间点的触觉预测。",
      "details": "**输入**：多视角 RGB、每手高维压阻触觉、本体状态与语言。\n\n**过程**：以 75% mask 做跨模态预训练；稀疏—全局触觉编码器选择局部活跃区域并保留全局摘要；在 \\(\\pi_{0.5}\\) 骨干上联合未来触觉预测和流匹配动作训练。\n\n**输出**：50 步动作块及多个未来时间点的触觉预测。"
    },
    "experiments": "数据包含 65 个任务和 10,576 条轨迹，约 69.5% 为灵巧操作。四项真实任务每方法 20 次，STAR 平均成功率/任务完成率为 0.61/0.79，去除 STAR 的 \\(\\pi_{0.5}\\)-Dex 为 0.44/0.61，普通 \\(\\pi_{0.5}\\) 为 0.28/0.44。结果支持完整训练配方，但数据规模、灵巧任务比例与 baseline 预训练差异可能共同贡献，不能把全部提升只归因于单一 sparse token 结构。 [正文实验与表格](https://arxiv.org/html/2609.12549v1)。",
    "evidence_notes": "2026-09-14 已核对 arXiv 元数据、正文主要实验与对照；未运行复现实验。",
    "code_data_status": "项目页可访问；未确认 200 小时数据、触觉预训练代码、权重和硬件接口是否完整开放。",
    "limitations": "触觉阵列维度和布局与具体硬件强绑定；未来触觉预测的时间点固定，可能错过短暂滑移。每项 20 次试验不足以稳定排序相近变体，且未充分报告长期推理频率和传感器故障鲁棒性。",
    "comments": "",
    "source_reports": [
      "report-37b94c4145"
    ],
    "deleted": false,
    "updated_at": "2026-09-14",
    "discussion": "STAR与 DeCAL共同形成触觉 HOI/WAM 板块，强调世界模型不应只预测视觉未来，还需压缩和预测接触信号。",
    "arxiv": {
      "published": "2026-09-11T07:57:24Z",
      "revised_at": "2026-09-11T07:57:24Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2608-19556",
    "title": "Stream4D: 4D-Consistency for Streaming Autoregressive Diffusion Video Models",
    "authors": [
      "Yuanhao Ban",
      "Jiaqi Feng",
      "Hengguang Zhou",
      "Xiaohuan Pei",
      "Justin Cui",
      "Cho-Jui Hsieh"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本（Under review）",
    "arxiv_id": "2608.19556",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.19556",
      "project": "https://banyuanhao.github.io/Stream4D/",
      "alphaxiv": "https://alphaxiv.org/abs/2608.19556"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "World Action Model",
      "动作表征",
      "因果与反事实",
      "强化与模仿学习",
      "机器人学习",
      "流式与自回归",
      "第一视角与人类视频",
      "视频生成"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.19556v1/figure1_teaser.png",
      "alt": "Stream4D Fig. 1：静态 3D 奖励与动态 4D 奖励对比",
      "label": "Stream4D，Fig. 1，静态 3D 奖励导致场景冻结，而动态 4D 奖励保留运动并改善长程一致性。。来源：原图",
      "paper_title": "Stream4D: 4D-Consistency for Streaming Autoregressive Diffusion Video Models",
      "source_url": "https://arxiv.org/html/2608.19556v1/figure1_teaser.png"
    },
    "summary": "Stream4D 解决流式自回归视频生成中的长程几何漂移和运动退化问题。核心 insight 是： 用静态 3D 高斯泼溅重建作为一致性奖励会惩罚真实运动 ——因为动态物体无法被单个刚性 3D 重建解释，奖励最大化的捷径是冻结画面。在自回归设置下，每个 chunk 会传播前一个 chunk 的错误，这种\"冻结捷径\"尤其有害。",
    "insight": "Stream4D 解决流式自回归视频生成中的长程几何漂移和运动退化问题。核心 insight 是：**用静态 3D 高斯泼溅重建作为一致性奖励会惩罚真实运动**——因为动态物体无法被单个刚性 3D 重建解释，奖励最大化的捷径是冻结画面。在自回归设置下，每个 chunk 会传播前一个 chunk 的错误，这种\"冻结捷径\"尤其有害。\n\nStream4D 用前馈 4D 重建（MoVieS）替代静态 3D 重建，使得能够被一致动态 4D 场景解释的视频获得高奖励。附加运动先验奖励自然场景流幅度并惩罚抖动和非刚性伪影，加上轻量感知锚点稳定外观。",
    "pipeline": {
      "input": "自回归扩散骨干生成的视频 rollout",
      "process": "MoVieS 将 rollout 重建为动态 4D 高斯场景，在估计相机下重渲染，4D PSNR 作为一致性奖励；场景流幅度的峰值高斯目标 + 平滑/刚性正则作为运动先验；HPSv2 作为感知锚点；三项 z 归一化后求和作为总奖励。",
      "output": "奖励信号反馈给自回归扩散策略，用于 RLHF 或蒸馏微调",
      "details": "**输入**：自回归扩散骨干生成的视频 rollout\n\n**过程**：MoVieS 将 rollout 重建为动态 4D 高斯场景，在估计相机下重渲染，4D PSNR 作为一致性奖励；场景流幅度的峰值高斯目标 + 平滑/刚性正则作为运动先验；HPSv2 作为感知锚点；三项 z 归一化后求和作为总奖励。\n\n**输出**：奖励信号反馈给自回归扩散策略，用于 RLHF 或蒸馏微调"
    },
    "experiments": "- **骨干**：Self-Forcing, Causal-Forcing, LongLive\n- **指标**：MoVieS 4D-PSNR, Gemini Consistency win%, VideoReward Overall win%\n- **定量结果**：4D-PSNR 提升 +3.46/+5.53/+6.76 dB；Gemini Consistency win% 82.2%/73.9%/74.2%；VideoReward Overall win% 66.2%/76.0%/84.4%\n- **消融**：项目页对比了 World-R1 和 VideoGPA（静态 3D 奖励基线），Stream4D 在运动保持上一致更优\n- **实验直接支持的结论**：4D 重建奖励有效替代静态 3D 奖励，避免运动退化；跨骨干泛化；人类偏好更高\n- **尚未被实验支持的主张**：运动先验的\"自然运动量级\"假设是否跨场景泛化",
    "evidence_notes": "",
    "code_data_status": "代码和模型在项目页标注 \"Under review\"，暂未公开。",
    "limitations": "- MoVieS 自身的重建误差和偏差会传递到奖励信号中，失败模式未讨论\n- 运动先验对\"自然运动量级\"的假设可能不适用于所有场景\n- 评估在 500 个运动突出提示词上进行，低运动/静态场景覆盖不明\n- 依赖 MoVieS 做 4D 重建，计算开销未报告\n\n### 与知域的关系\n\nStream4D 与知域关注的流式生成方向（Self-Forcing, Causal-Forcing, LongLive）直接相关。它不是新的生成骨干，而是这些骨干上的一致性奖励改进，对\"流式生成如何维持长程几何与运动一致性\"给出了比 World-R1/VideoGPA 更有针对性的方案。4D 重建奖励的思路对前馈重建方向也有间接参考。\n\n---",
    "comments": "",
    "source_reports": [
      "report-cedaa0825a",
      "report-f5f82689ca"
    ],
    "deleted": false,
    "updated_at": "2026-08-31",
    "arxiv": {
      "published": "2026-08-20T01:54:26Z",
      "revised_at": "2026-08-20T01:54:26Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2608-26336",
    "title": "StreamAV-Bench: A Comprehensive Benchmark for Streaming Audio-Video Generation",
    "authors": [
      "Kaiqi Liu",
      "Haoxuan Zeng",
      "Jingqi Liu",
      "Jiacong Fang",
      "Ziqi Cai",
      "Yunyao Mao",
      "Henglin Liu",
      "Yu Sheng",
      "Shuchen Weng",
      "Boxin Shi"
    ],
    "year": 2026,
    "publication": "2026，arXiv",
    "arxiv_id": "2608.26336",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.26336",
      "model": "https://huggingface.co/StreamAVBench",
      "data": "https://huggingface.co/datasets/StreamAVBench/StreamAVBench",
      "alphaxiv": "https://alphaxiv.org/abs/2608.26336"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "流式与自回归",
      "第一视角与人类视频",
      "视频生成",
      "长时记忆"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.26336v1/teaser.png",
      "alt": "StreamAV-Bench: A Comprehensive Benchmark for Streaming Audio-Video Generation 代表图",
      "label": "Figure 1: We present StreamAV-Bench, a comprehensive benchmark for streaming audio-video generation. (a) The benchmark includes a progressive track to assess instruction adherence and long-horizon stability, and an interactive track to measure interactive response alongside state retention and reuse. (b) The benchmark covers content complexity in both tracks and update complexity in the interactive track, with 320 ex… 来源：论文图",
      "paper_title": "StreamAV-Bench: A Comprehensive Benchmark for Streaming Audio-Video Generation",
      "source_url": "https://arxiv.org/html/2608.26336v1/teaser.png"
    },
    "summary": "该基准不再只评估生成完成后的整段视频，而是区分持续接收单一提示的渐进轨和按时间更新指令的交互轨，覆盖指令遵循、长时稳定、响应、状态保留与复用。它把“流式性”从系统宣称变成独立测量维度。",
    "insight": "该基准不再只评估生成完成后的整段视频，而是区分持续接收单一提示的渐进轨和按时间更新指令的交互轨，覆盖指令遵循、长时稳定、响应、状态保留与复用。它把“流式性”从系统宣称变成独立测量维度。",
    "pipeline": {
      "input": "全局提示或按序到达的提示更新，以及系统逐块生成的音视频。",
      "process": "在 320 个专家核验场景上运行 13 个系统；使用专家模型、MLLM 与细粒度 checklist 计算 32 个维度。",
      "output": "渐进和交互两条赛道的综合/分项得分与失败类型。",
      "details": "**输入**：全局提示或按序到达的提示更新，以及系统逐块生成的音视频。\n\n**过程**：在 320 个专家核验场景上运行 13 个系统；使用专家模型、MLLM 与细粒度 checklist 计算 32 个维度。\n\n**输出**：渐进和交互两条赛道的综合/分项得分与失败类型。"
    },
    "experiments": "评测覆盖 8 类场景、5 类音频域、5 类主体和 4 种视觉风格。分析直接支持当前系统存在随时间漂移及交互响应瓶颈；但评审器偏差和不同系统访问方式可能影响排名。",
    "evidence_notes": "",
    "code_data_status": "官方 Hugging Face 组织页及数据集可访问，复现条件显著强于本期多数模型论文；仍应核验各被测闭源系统的版本固定方式。",
    "limitations": "自动评审不能替代用户对交互延迟、可控性和语义错误的感知；32 个维度之间的权重会影响总分。音视频版权和隐私不是该基准主要覆盖点。\n\n### 与知域的关系\n\n可直接用于 StreamingHOI、流式世界模型和长时音视频生成的评价设计，尤其适合补充短片指标无法测到的状态复用与响应延迟。",
    "comments": "",
    "source_reports": [
      "report-a141624b1e"
    ],
    "deleted": false,
    "updated_at": "2026-08-31",
    "arxiv": {
      "published": "2026-08-26T19:16:24Z",
      "revised_at": "2026-08-26T19:16:24Z",
      "primary_category": "cs.SD"
    }
  },
  {
    "id": "arxiv-2609-00610",
    "title": "Streaming4D: Accelerate 4D World Models via Block-wise Video Generation and Incremental Reconstruction",
    "authors": [
      "Xiaoyan Liu",
      "Jiaxin Liu",
      "Kangrui Li",
      "Sifan Zhou"
    ],
    "year": 2026,
    "publication": "2026，arXiv",
    "arxiv_id": "2609.00610",
    "doi": "10.48550/arXiv.2609.00610",
    "links": {
      "paper": "https://arxiv.org/abs/2609.00610",
      "alphaxiv": "https://alphaxiv.org/abs/2609.00610"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "流式与自回归",
      "物理建模与仿真",
      "第一视角与人类视频",
      "视频生成",
      "跨本体迁移"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2609.00610v1/pipeline.png",
      "alt": "Streaming4D 分块生成与增量重建流水线",
      "label": "分块视频生成与增量 4D 重建流水线；来源：论文原图",
      "paper_title": "Streaming4D: Accelerate 4D World Models via Block-wise Video Generation and Incremental Reconstruction",
      "source_url": "https://arxiv.org/html/2609.00610v1/pipeline.png"
    },
    "summary": "Streaming4D 将分块自回归视频生成和增量 3D 重建紧密耦合。每个视频块完成后立即触发重建，使生成和几何更新并行，而不是等整段视频生成完成后再重建。",
    "insight": "Streaming4D 将分块自回归视频生成和增量 3D 重建紧密耦合。每个视频块完成后立即触发重建，使生成和几何更新并行，而不是等整段视频生成完成后再重建。",
    "pipeline": {
      "input": "初始观测、生成条件、相机或时序信息。",
      "process": "按视频块进行自回归生成；每个块完成后送入增量重建后端；视频生成和几何更新并行执行。",
      "output": "持续更新的 4D 世界表示和视频流。",
      "details": "**输入**：初始观测、生成条件、相机或时序信息。\n\n**过程**：按视频块进行自回归生成；每个块完成后送入增量重建后端；视频生成和几何更新并行执行。\n\n**输出**：持续更新的 4D 世界表示和视频流。"
    },
    "experiments": "摘要报告在单张 RTX 4090 上约 \\(1.24\\times\\) 的速度提升，并保持较高 4D 几何和多视角一致性。尚未核验：\n\n- 与哪些 sequential baseline 比较；\n- 视频块长度和分辨率；\n- 重建误差是否随序列长度增加；\n- 并行执行是否引入时序错位；\n- 速度提升是否包含 I/O 和模型加载成本。",
    "evidence_notes": "",
    "code_data_status": "未发现公开代码、数据或模型链接。",
    "limitations": "增量重建可能出现漂移、错误累积和局部几何不可逆。对于快速运动、遮挡和新区域进入场景的情况，需要额外失败分析。\n\n### 与知域的关系\n\n该工作直接连接知域的 StreamingHOI、4DGS-WAM、DynamicVGGT 和流式生成专题，是本期前馈 4D 与实时交互方向的重要新增工作。",
    "comments": "",
    "source_reports": [
      "report-0d81d19c6c"
    ],
    "deleted": false,
    "updated_at": "2026-09-08",
    "arxiv": {
      "published": "2026-09-01T02:49:45Z",
      "revised_at": "2026-09-01T02:49:45Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2608-25798",
    "title": "TacForcing: Streaming Action Generation with Execution-Time Tactile Feedback",
    "authors": [
      "Jianbo Zhou",
      "Boyuan Zhao",
      "Yuzheng Zhang",
      "Yiyang Chen",
      "Wenxin Chen",
      "Qiuyue Li",
      "Xiangyang Gu",
      "Yuhan Cao",
      "Xiao Xia",
      "Yanzhe Hu",
      "Zhijie Deng"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本（首发 2026-08-26）",
    "arxiv_id": "2608.25798",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.25798",
      "alphaxiv": "https://alphaxiv.org/abs/2608.25798"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "流式与自回归",
      "第一视角与人类视频",
      "长时记忆"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.25798v1/Framwork.png",
      "alt": "TacForcing: Streaming Action Generation with Execution-Time Tactile Feedback 代表图",
      "label": "Figure 1 : Overview of TacForcing . The VLM encodes the visual observation and language instruction once, and the resulting task context is reused throughout streaming generation. The Streaming Action Expert progressively refines action blocks according to block-specific flow times, allowing successive blocks to become ready for sequential execution. After each ready block is executed, the resulting tactile feedback… 来源：论文图",
      "paper_title": "TacForcing: Streaming Action Generation with Execution-Time Tactile Feedback",
      "source_url": "https://arxiv.org/html/2608.25798v1/Framwork.png"
    },
    "summary": "接触丰富操作中，接触状态在动作视界内会显著演化，但 chunk-based VLA 用执行前观测预测整个动作块，触觉条件在执行期已过期；现有触觉响应方案多依赖分离的高频控制器，增加架构与训练复杂度。TacForcing 的 Insight： 用流式动作专家取代标准动作专家，动作生成条件于执行期演化的触觉观测 ，并引入 Execution-Aware Tactile Attention（EATA）把触觉条件限制在临近执行的 action 上，从时间错配根源上解决\"触觉过时\"。",
    "insight": "接触丰富操作中，接触状态在动作视界内会显著演化，但 chunk-based VLA 用执行前观测预测整个动作块，触觉条件在执行期已过期；现有触觉响应方案多依赖分离的高频控制器，增加架构与训练复杂度。TacForcing 的 Insight：**用流式动作专家取代标准动作专家，动作生成条件于执行期演化的触觉观测**，并引入 Execution-Aware Tactile Attention（EATA）把触觉条件限制在临近执行的 action 上，从时间错配根源上解决\"触觉过时\"。",
    "pipeline": {
      "input": "观测 + 动作流 + 执行期触觉观测（block-level 更新）。",
      "process": "block-wise flow 调度（流式动作生成）→ 执行期触觉更新 → EATA（临近执行动作被触觉条件化）→ 训练（仿真+真机）。",
      "output": "随执行期触觉演化的流式动作序列。",
      "details": "**输入**：观测 + 动作流 + 执行期触觉观测（block-level 更新）。\n**过程**：block-wise flow 调度（流式动作生成）→ 执行期触觉更新 → EATA（临近执行动作被触觉条件化）→ 训练（仿真+真机）。\n**输出**：随执行期触觉演化的流式动作序列。"
    },
    "experiments": "在接触丰富操作（仿真 + 真机）上评测，含消融与表征-动力学分析；报告流式触觉条件相对固定触觉条件的时间错配缓解。证据等级：论文实验直接支持；任务集与规模待全文确认。",
    "evidence_notes": "",
    "code_data_status": "未公开代码。",
    "limitations": "- 触觉传感的部署依赖（真机传感可用性）；\n- block 粒度选择对触觉响应延迟的影响；\n- 与高频触觉控制器路线的直接对比。\n\n### 与知域的关系\n落在\"流式生成\"与\"接触丰富操作\"交汇；与知域 World Models for Learning Dexterous HOI from Human Videos、EgoGrasp 的接触语义互补，为 WAM/策略的流式触觉条件化提供设计模板。",
    "comments": "",
    "source_reports": [
      "report-a141624b1e"
    ],
    "deleted": false,
    "updated_at": "2026-08-31",
    "arxiv": {
      "published": "2026-08-26T13:48:52Z",
      "revised_at": "2026-08-26T13:48:52Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2609-24507",
    "title": "TACIT: Tactile Contact Supervision for Spatial Attention in Dexterous Manipulation",
    "authors": [
      "Yanhou Lai",
      "Fucai Zhu",
      "Ruiqiang Wang",
      "Koichi Hashimoto"
    ],
    "year": 2026,
    "publication": "2026，arXiv",
    "arxiv_id": "2609.24507",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2609.24507",
      "alphaxiv": "https://alphaxiv.org/abs/2609.24507"
    },
    "tags": [
      "HOI",
      "多模态感知与提示",
      "触觉与灵巧操作"
    ],
    "figure": {
      "url": "content/images/2609.24507-main.webp",
      "alt": "Figure 2：接触事件只提供训练监督，空间注意力与实时视觉触觉共同驱动扩散策略",
      "label": "Figure 2 · 接触事件只提供训练监督，空间注意力与实时视觉触觉共同驱动扩散策略",
      "paper_title": "TACIT: Tactile Contact Supervision for Spatial Attention in Dexterous Manipulation",
      "source_url": "https://arxiv.org/html/2609.24507v1/figure/tacit_policy_architecture.jpg"
    },
    "summary": "使用teleoperation demonstration中真实测得的tactile contact作为训练阶段的3D attention监督，而不需要手工点标注或视觉foundation model生成attention label。",
    "insight": "使用teleoperation demonstration中真实测得的tactile contact作为训练阶段的3D attention监督，而不需要手工点标注或视觉foundation model生成attention label。",
    "pipeline": {
      "input": "camera point cloud、vision与tactile observation。",
      "process": "示范中的后续接触位置监督接触前的三维空间注意力，注意力池化特征条件化视觉触觉扩散策略。",
      "output": "dexterous robot actions。",
      "details": "**过程**：示范中的后续接触位置监督接触前的三维空间注意力，注意力池化特征条件化视觉触觉扩散策略。\n\n**输入**：camera point cloud、vision与tactile observation。\n\n**输出**：dexterous robot actions。\n\n训练期把测得的接触位置映射成 3D Gaussian 注意力目标；策略执行仍接收视觉和触觉。所谓“接触作为训练监督”不意味着测试时不需要触觉。注意力池化用于突出后续操作要到达的区域。\n\n[原文方法](https://arxiv.org/html/2609.24507)\n\n### 方法细节与实现\n\n**接触监督的时间方向。**先从示范中检测在 t_c 发生的接触及其三维中心，再把该位置转换为接触前 t<t_c 的空间注意力监督。后续触觉事件告诉模型此前应关注哪里；不是使用“历史接触点”解释尚未发生的接近。未来接触只作为离线训练标签，推理时没有访问未来传感器。\n\n**点云和注意力。**相机深度与触觉深度转成统一空间的视觉—触觉点云，三维点编码器提供特征，注意力头预测各点权重；以接触中心构造 Gaussian 目标，监督注意力聚焦到目标接触区域。加权池化后的局部特征与本体状态及其他视觉触觉特征融合，交给扩散动作头生成动作段。\n\n**训练监督与部署输入分开。**接触事件标签只用于训练，但运行中的策略仍接收实时触觉。输入匹配对照使用同样 600 个相机点和 900 个触觉点，因而更能隔离“接触监督空间注意力”的作用，而不是将额外传感器或更密点云误算成方法收益。\n\n[对应方法原文](https://arxiv.org/html/2609.24507#S3)"
    },
    "experiments": "每任务仅10 demonstrations、5个placement regions；ball placement 66.7%，peg insertion73.3%，而input-matched 3D visuotactile baseline分别10%与20%。所有30 trials都能在12秒内进入150 mm approach region，剩余失败发生于到达后。\n\n\n输入匹配对照 A2 与 TACIT 都使用 600 camera points + 900 tactile points，区别在接触监督注意力。30 次 ball/peg 测试，A2 成功 3/30、6/30，TACIT 为 20/30、22/30；TACIT reach 均为 30/30。结果支持接近阶段的空间定位改进，剩余失败仍在近距离操作阶段。\n\n[原文实验与表格](https://arxiv.org/html/2609.24507)\n\n**分阶段评价更准确。**每任务 10 条示范，30 次测试中球放置为 20/30、插销为 22/30，输入匹配对照为 3/30、6/30。全部试验都能在 12 秒内到达 150 mm 接近区域，说明定位/接近明显改善，但仍有最后接触与精细操作失败。它是感知和策略学习方法，不是触觉未来生成或力学系统辨识工作。\n\n[实验与设置原文](https://arxiv.org/html/2609.24507)",
    "evidence_notes": "已核验原文方法与实验；关键比较与限制见各节",
    "code_data_status": "未核验到公开资源。",
    "limitations": "论文证据支持的是contact supervision改善approach/spatial grounding；它不是world model，也不能单独证明长期contact dynamics学习。",
    "comments": "",
    "source_reports": [],
    "deleted": false,
    "updated_at": "2026-09-24",
    "challenges": "灵巧操作中，目标接触区往往很小，视觉—触觉简单融合可能仍将注意力分散到无关空间。依赖人工点标注又难扩展，因此需要从示范接触本身提取空间监督。",
    "motivation": "使用teleoperation demonstration中真实测得的tactile contact作为训练阶段的3D attention监督，而不需要手工点标注或视觉foundation model生成attention label。",
    "technical_approach": "**过程**：示范中的后续接触位置监督接触前的三维空间注意力，注意力池化特征条件化视觉触觉扩散策略。\n\n**输入**：camera point cloud、vision与tactile observation。\n\n**输出**：dexterous robot actions。\n\n训练期把测得的接触位置映射成 3D Gaussian 注意力目标；策略执行仍接收视觉和触觉。所谓“接触作为训练监督”不意味着测试时不需要触觉。注意力池化用于突出后续操作要到达的区域。\n\n[原文方法](https://arxiv.org/html/2609.24507)\n\n### 方法细节与实现\n\n**接触监督的时间方向。**先从示范中检测在 t_c 发生的接触及其三维中心，再把该位置转换为接触前 t<t_c 的空间注意力监督。后续触觉事件告诉模型此前应关注哪里；不是使用“历史接触点”解释尚未发生的接近。未来接触只作为离线训练标签，推理时没有访问未来传感器。\n\n**点云和注意力。**相机深度与触觉深度转成统一空间的视觉—触觉点云，三维点编码器提供特征，注意力头预测各点权重；以接触中心构造 Gaussian 目标，监督注意力聚焦到目标接触区域。加权池化后的局部特征与本体状态及其他视觉触觉特征融合，交给扩散动作头生成动作段。\n\n**训练监督与部署输入分开。**接触事件标签只用于训练，但运行中的策略仍接收实时触觉。输入匹配对照使用同样 600 个相机点和 900 个触觉点，因而更能隔离“接触监督空间注意力”的作用，而不是将额外传感器或更密点云误算成方法收益。\n\n[对应方法原文](https://arxiv.org/html/2609.24507#S3)",
    "discussion": "**阅读者分析**：可作为3D/4D HOI world model中contact-supervision设计的重要参考。",
    "arxiv": {
      "published": "2026-09-21",
      "revised_at": "",
      "primary_category": "cs.RO"
    },
    "source_papers": [
      "content/papers/2609.24507.md"
    ]
  },
  {
    "id": "arxiv-2608-30643",
    "title": "Temporal Forcing: 4D Representation Alignment for Vision-Language-Action Models",
    "authors": [
      "Xingyu Ding",
      "Yuzhong Zhao",
      "Chunhai Zhao",
      "Yinghuan Shi",
      "Chaoyang Zhao",
      "Yifan Zhang"
    ],
    "year": 2026,
    "publication": "2026，arXiv",
    "arxiv_id": "2608.30643",
    "doi": "10.48550/arXiv.2608.30643",
    "links": {
      "paper": "https://arxiv.org/abs/2608.30643",
      "alphaxiv": "https://alphaxiv.org/abs/2608.30643"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "机器人学习",
      "流式与自回归",
      "物理建模与仿真",
      "第一视角与人类视频",
      "跨本体迁移"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.30643v1/fig1.png",
      "alt": "Temporal Forcing 的时序表示对齐框架",
      "label": "Figure 1，3D 对齐与 Temporal Forcing 的时序表示对比；来源：论文原图",
      "paper_title": "Temporal Forcing: 4D Representation Alignment for Vision-Language-Action Models",
      "source_url": "https://arxiv.org/html/2608.30643v1/fig1.png"
    },
    "summary": "论文引入历史路径，并让其 latent 对齐预训练 4D foundation model 的时间一致几何特征。4D 模型只在训练期充当教师，部署时保留基础 VLA 和历史路径。",
    "insight": "论文引入历史路径，并让其 latent 对齐预训练 4D foundation model 的时间一致几何特征。4D 模型只在训练期充当教师，部署时保留基础 VLA 和历史路径。",
    "pipeline": {
      "input": "有界视觉历史、语言任务和机器人状态。",
      "process": "历史路径压缩多帧观测；4D 教师从更长因果窗口提取几何 target；当前帧损失锚定局部几何，时间损失约束历史 latent 的状态演化。",
      "output": "依赖历史状态的动作；推理时不运行 4D 教师。",
      "details": "**输入**：有界视觉历史、语言任务和机器人状态。\n\n**过程**：历史路径压缩多帧观测；4D 教师从更长因果窗口提取几何 target；当前帧损失锚定局部几何，时间损失约束历史 latent 的状态演化。\n\n**输出**：依赖历史状态的动作；推理时不运行 4D 教师。"
    },
    "experiments": "报告 LIBERO 平均成功率 98.8%，RoboTwin 2.0 十二项任务从 53.5% 提至 62.8%，隐藏放置任务从 20.0% 提至 43.3%。同基础模型受控表中基础为 90.7%、完整方法为 93.6%，仅加入历史为 88.2%；不同表格配置不可直接混用。",
    "evidence_notes": "",
    "code_data_status": "代码仅声明未来公开；未发现 checkpoint 或自建物理任务数据，暂难复核 4D target 构造成本。",
    "limitations": "物理实验只有一个多阶段场景；历史窗口、快速动态和跨任务状态泛化不明。收益可能同时来自 4D 教师的语义与几何先验，需要更细对照。\n\n### 与知域的关系\n\n直接连接 VGGT/DynamicVGGT 类 4D 几何模型与 VLA，提供“4D teacher、轻量 history student”路线。",
    "comments": "",
    "source_reports": [
      "report-0d81d19c6c"
    ],
    "deleted": false,
    "updated_at": "2026-09-08",
    "arxiv": {
      "published": "2026-08-31T11:47:29Z",
      "revised_at": "2026-08-31T11:47:29Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2606-30308",
    "title": "The Surprising Effectiveness of Video Diffusion Models for Hand Motion Reconstruction",
    "authors": [
      "Yuxi Wang",
      "Chengkai Jin",
      "Yufei Liu",
      "Wenqi Ouyang",
      "Tianyi Wei",
      "Zhiwei Zeng",
      "Siyuan Huang",
      "Zhiqi Shen",
      "Xingang Pan"
    ],
    "year": 2026,
    "publication": "2026，arXiv preprint（cs.CV，v1 提交于 2026-06-29，v2 修订于 2026-07-09）；尚未核验正式会议或期刊录用。arXiv:2606.30308；arXiv DOI：10.48550/arXiv.2606.30308",
    "arxiv_id": "2606.30308",
    "doi": "10.48550/arXiv.2606.30308",
    "links": {
      "paper": "https://arxiv.org/abs/2606.30308",
      "project": "https://vidihand.github.io/",
      "code": "https://github.com/NTUYWANG103/ViDiHand",
      "model": "https://huggingface.co/papers/2606.30308",
      "alphaxiv": "https://alphaxiv.org/abs/2606.30308"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "机器人学习",
      "第一视角与人类视频",
      "自监督与预测表征",
      "视频生成"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2606.30308v2/main_pipeline.png",
      "alt": "ViDiHand Fig. 2：hand-aware 视频扩散与双分支 4D 手部重建流程",
      "label": "The Surprising Effectiveness of Video Diffusion Models for Hand Motion Reconstruction，Fig. 2，ViDiHand 的 hand-aware 视频扩散适配、双分支解码器与推理流程。来源：Fig. 2 原图 PNG",
      "paper_title": "The Surprising Effectiveness of Video Diffusion Models for Hand Motion Reconstruction",
      "source_url": "https://arxiv.org/html/2606.30308v2/main_pipeline.png"
    },
    "summary": "作者主张，大规模视频扩散模型为了生成时空一致的视频，必须隐式处理与 4D 手部重建相似的三类问题：遮挡内容推断、跨帧身份与空间位置稳定、以及平滑运动。因此 ViDiHand 不把生成模型只当冻结特征提取器，而用 hand-overlay rendering 使其表征对 MANO 手部几何敏感，同时冻结 base DiT 以尽量保留原有世界先验。阅读者判断：实验支持“视频预训练表征比随机初始化和所测图像骨干更适合该任务”，但“内部维持 3D 状态”仍是基于任务表现和可视化的机制解释，论文没有直接识别出可解释、可干预的三维状态变量。",
    "insight": "作者主张，大规模视频扩散模型为了生成时空一致的视频，必须隐式处理与 4D 手部重建相似的三类问题：遮挡内容推断、跨帧身份与空间位置稳定、以及平滑运动。因此 ViDiHand 不把生成模型只当冻结特征提取器，而用 hand-overlay rendering 使其表征对 MANO 手部几何敏感，同时冻结 base DiT 以尽量保留原有世界先验。阅读者判断：实验支持“视频预训练表征比随机初始化和所测图像骨干更适合该任务”，但“内部维持 3D 状态”仍是基于任务表现和可视化的机制解释，论文没有直接识别出可解释、可干预的三维状态变量。",
    "pipeline": {
      "input": "81 帧第一视角 RGB 视频片段、每段相机内参；训练阶段另使用 EgoDex 的 2D 关节监督，以及 ARCTIC、HOT3D 的 MANO/相机空间手部标注。",
      "process": "以 1.3B 参数 Wan2.1-VACE 为骨干，仅微调 VACE 分支、冻结 base DiT。Stage 1a 让模型把 2D 关节骨架半透明叠加到原视频，Stage 1b 改为 MANO 网格叠加，并以 flow-matching 学习贯穿遮挡帧的 overlay rendering。随后固定扩散骨干，从第 15 个 DiT block、归一化去噪步约 0.7 的单层激活读取 21 个 latent-frame 特征。双分支解码器用固定左右手 slot 的 hand-token branch 回归整体 MANO 姿态，用 joint-heatmap branch 定位逐关节 2D anchor；双方经 mutual cross-attention 融合。mixed-projection head 回归深度，以相机内参、MANO 关节和 2D anchor 加权最小二乘闭式求解平面内平移。解码器联合优化 MANO、相机、图像重投影、可见性与时间平滑损失。",
      "output": "每一视频帧中左右手的 on-screen 概率、MANO 全局朝向、15 个关节旋转、10 维形状、相机坐标系三维平移与关节/网格轨迹，即 metric-scale 4D 双手重建。",
      "details": "- **输入：** 81 帧第一视角 RGB 视频片段、每段相机内参；训练阶段另使用 EgoDex 的 2D 关节监督，以及 ARCTIC、HOT3D 的 MANO/相机空间手部标注。\n- **过程：** 以 1.3B 参数 Wan2.1-VACE 为骨干，仅微调 VACE 分支、冻结 base DiT。Stage 1a 让模型把 2D 关节骨架半透明叠加到原视频，Stage 1b 改为 MANO 网格叠加，并以 flow-matching 学习贯穿遮挡帧的 overlay rendering。随后固定扩散骨干，从第 15 个 DiT block、归一化去噪步约 0.7 的单层激活读取 21 个 latent-frame 特征。双分支解码器用固定左右手 slot 的 hand-token branch 回归整体 MANO 姿态，用 joint-heatmap branch 定位逐关节 2D anchor；双方经 mutual cross-attention 融合。mixed-projection head 回归深度，以相机内参、MANO 关节和 2D anchor 加权最小二乘闭式求解平面内平移。解码器联合优化 MANO、相机、图像重投影、可见性与时间平滑损失。\n- **输出：** 每一视频帧中左右手的 on-screen 概率、MANO 全局朝向、15 个关节旋转、10 维形状、相机坐标系三维平移与关节/网格轨迹，即 metric-scale 4D 双手重建。"
    },
    "experiments": "实验在 ARCTIC、HOT3D 和 HOI4D 上比较 8 个基线，包括 HaMeR、WiLoR、Hamba、InterWild、WildHands、OmniHands、Dyn-HaMR 和 HaWoR。ARCTIC 与 HOT3D 属于显式训练分布内评测；HOT3D 因官方 test 无 MANO 真值，作者随机留出 validation sequence 的 5% 作 test。HOI4D 不进入任何方法的显式监督训练，但 Wan 视频骨干的互联网预训练语料不可审计，因此只能称“未显式监督见过”，不能证明完全无数据暴露。\n\n作者采用 coverage-aware `-p` 指标：检测到的真阳性使用实际误差，漏检手则以确定性的 canonical MANO 占位误差计入，避免只在容易检测的手上报告 MPJPE。主表中 ViDiHand 在 27 项指标的 26 项排名第一：ARCTIC 的 FAcc 为 0.997（WiLoR 0.919），MPJPE-p / PA-MPJPE-p 为 21.668 / 9.821 mm，EPE-p 为 12.407 px，jitter 为 3.183 mm/frame²；HOT3D 为 FAcc 0.948、MPJPE-p 21.514 mm、jitter 3.741；HOI4D 为 FAcc 0.984、MPJPE-p 30.090 mm、jitter 4.010，并在 9 项中领先 8 项。HOI4D 唯一未领先的是 camera-translation error，ViDiHand 的 CT-p 为 0.117 m，WiLoR 和 OmniHands 分别为 0.115 / 0.108 m。\n\n消融事实支持几个局部设计判断：在所测层中第 15 层的 MPJPE-p / EPE-p 为 20.59 mm / 11.93 px，优于第 8、22、29 层；去噪步约 0.7 在 FAcc、MPJPE-p、EPE-p 上最优，但 jitter 与其他步几乎持平。随机初始化、DINOv3、预训练 T2V、未适配 VACE、mesh overlay、joint+mesh overlay 的 ARCTIC MPJPE-p 依次为 36.39、24.46、21.64、22.67、21.23、20.59 mm，说明视频预训练与 overlay 适配均有贡献。去掉 joint-heatmap 或 mixed-projection 会令 EPE-p 从 11.93 升至 14.91 / 16.26 px；但去掉 mixed-projection 反而把 MPJPE-p 和 jitter 略降到 20.26 和 2.86，说明完整配置是检测覆盖与 2D 定位的折中，并非每一列都最优。\n\n补充材料在“双方都成功检测同一只手”的成对协议下报告 ViDiHand 赢得 120 个比较单元中的 96 个；同时明确指出，在 Procrustes 对齐后的局部关节精度、HOI4D 的 2D 重投影及相机平移上，若只看共同检出的手，若干专用单帧或 SLAM 方法仍可匹配或超过 ViDiHand。故主结果强力支持端到端覆盖、绝对姿态和时间稳定性优势，但不支持其在所有局部 articulation 或跨域相机平移指标上无条件占优。",
    "evidence_notes": "",
    "code_data_status": "官方 GitHub 仓库存在并自称 PyTorch 实现，但截至本次核验，README 明确写有 “Code will be released soon”，仓库页面仅显示 README，未见可运行训练/推理代码、权重、环境文件或许可证，因此尚不能复现。论文使用公开的 EgoDex、ARCTIC、HOT3D 和 HOI4D；并未发布新的完整训练数据集。Wan2.1-VACE 的原始预训练语料不可审计，完整数据许可和潜在 benchmark 暴露无法核验。",
    "limitations": "- 作者报告推理速度仅 5.5 fps，且使用 4 张 A100 GPU；当前定位是离线标注工具，不满足实时闭环控制。\n- 方法仍依赖姿态标注视频；Stage 1a 可使用关节级弱标注，但并未实现完全无标注适配。\n- HOI4D 仅从显式监督中留出，互联网规模视频骨干的训练语料不可审计，跨数据集结果存在无法排除的暴露风险。\n- 覆盖感知主指标把漏检转成 canonical placeholder；它更接近端到端可用性，但与只评共同检出手的传统误差衡量不同，引用排名时必须说明协议。\n- 在共同检出手上，部分基线于局部 articulation、2D 重投影或跨域相机平移仍有优势；完整解码器也不是 MPJPE 和 jitter 两列的消融最优项。\n- 论文定性结果仍有基线漏手、错手性和幻觉第二只手等案例；ViDiHand 的极端域外失败分布、置信度校准和错误恢复没有系统量化。\n- 官方实现、权重和许可证尚未发布；训练成本、数据处理流水线与随机种子复现实验均待核验。\n- 作者把多视角、弱标签扩展和全身运动重建列为未来方向；蒸馏、少步或自回归生成骨干能否保留当前精度也仍是开放问题。",
    "comments": "",
    "source_reports": [
      "report-ea0469615f"
    ],
    "deleted": false,
    "updated_at": "2026-08-31",
    "challenges": "第一视角 4D 手部重建在真实交互中经常遇到手—物体、手—手遮挡、视野边缘截断、运动模糊和鱼眼畸变。逐帧图像方法依赖上游手部检测器，重遮挡下检测漏失会直接变成整帧重建缺失；已有视频方法虽然加入跨帧注意力或 3D 手轨迹 infiller，却主要从稀缺的手姿态标注学习时间先验，且常把手轨迹与物体和场景上下文分开建模。本文针对的具体缺口是：能否直接复用大规模视频生成模型内部已经形成的运动、几何、遮挡与交互表征，在不使用检测器、运动补全器或测试时优化的情况下恢复连续双手轨迹。",
    "motivation": "作者主张，大规模视频扩散模型为了生成时空一致的视频，必须隐式处理与 4D 手部重建相似的三类问题：遮挡内容推断、跨帧身份与空间位置稳定、以及平滑运动。因此 ViDiHand 不把生成模型只当冻结特征提取器，而用 hand-overlay rendering 使其表征对 MANO 手部几何敏感，同时冻结 base DiT 以尽量保留原有世界先验。阅读者判断：实验支持“视频预训练表征比随机初始化和所测图像骨干更适合该任务”，但“内部维持 3D 状态”仍是基于任务表现和可视化的机制解释，论文没有直接识别出可解释、可干预的三维状态变量。",
    "technical_approach": "- **输入：** 81 帧第一视角 RGB 视频片段、每段相机内参；训练阶段另使用 EgoDex 的 2D 关节监督，以及 ARCTIC、HOT3D 的 MANO/相机空间手部标注。\n- **过程：** 以 1.3B 参数 Wan2.1-VACE 为骨干，仅微调 VACE 分支、冻结 base DiT。Stage 1a 让模型把 2D 关节骨架半透明叠加到原视频，Stage 1b 改为 MANO 网格叠加，并以 flow-matching 学习贯穿遮挡帧的 overlay rendering。随后固定扩散骨干，从第 15 个 DiT block、归一化去噪步约 0.7 的单层激活读取 21 个 latent-frame 特征。双分支解码器用固定左右手 slot 的 hand-token branch 回归整体 MANO 姿态，用 joint-heatmap branch 定位逐关节 2D anchor；双方经 mutual cross-attention 融合。mixed-projection head 回归深度，以相机内参、MANO 关节和 2D anchor 加权最小二乘闭式求解平面内平移。解码器联合优化 MANO、相机、图像重投影、可见性与时间平滑损失。\n- **输出：** 每一视频帧中左右手的 on-screen 概率、MANO 全局朝向、15 个关节旋转、10 维形状、相机坐标系三维平移与关节/网格轨迹，即 metric-scale 4D 双手重建。",
    "discussion": "ViDiHand 的核心贡献是把视频扩散模型从生成器改造成 4D 双手重建的表征骨干：overlay 预任务把中间特征对齐到手部几何，双分支解码器把整体 MANO articulation 与局部 2D 定位分开建模，再用显式投影几何组合成 metric-scale 轨迹。相较依赖检测器、手部专用时间模块、SLAM 或测试时优化的管线，它在重遮挡和跨帧稳定性上的结果有充分实验支撑。\n\n对知域方向而言，该工作直接连接 egocentric HOI、4D hand reconstruction 与 video/world prior，可作为从生成模型内部表征提取结构化状态的代表案例。不可扩大之处有两点：其一，作者所称 world prior 是大规模视频预训练得到的统计表征，不等于结构因果模型、干预推断或反事实能力；其二，HOI4D 只保证未用于显式监督，不能排除互联网预训练数据泄漏。当前系统更适合作为离线伪标注器，而非实时闭环机器人感知模块。",
    "arxiv": {
      "published": "2026-06-29T13:53:00Z",
      "revised_at": "2026-07-09T09:39:31Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2609-04911",
    "title": "TourPhysics: Bringing Physics to World Models for Exploration and Manipulation from a Single Image",
    "authors": [
      "Xin Zhang",
      "Yabo Chen",
      "Zixuan Duan",
      "Haibin Huang",
      "Chi Zhang",
      "Feng Xu",
      "Xuelong Li"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本，v2",
    "arxiv_id": "2609.04911",
    "doi": "10.48550/arXiv.2609.04911",
    "links": {
      "paper": "https://arxiv.org/abs/2609.04911",
      "alphaxiv": "https://alphaxiv.org/abs/2609.04911"
    },
    "tags": [
      "3D/4D",
      "世界模型",
      "物理建模与仿真",
      "视频生成"
    ],
    "figure": {
      "url": "content/images/2609.04911-representative.webp",
      "alt": "Figure 2",
      "label": "Figure 2",
      "paper_title": "TourPhysics: Bringing Physics to World Models for Exploration and Manipulation from a Single Image",
      "source_url": "https://arxiv.org/html/2609.04911v2#S2.F2"
    },
    "summary": "交互式视觉世界模型必须区分观测与物理干预：相机运动揭示新表面，干预改变物体运动、接触与形变。现有视频世界模型多由外观先验驱动，长程常丢失物理或空间一致性。TourPhysics 是从单张图初始化的在线框架（扩展自团队 ACM MM 2026 工作 PhysOmni），把确定性模拟与视频生成结合，为模拟器状态、几何证据、生成器控制与外观记忆分配独立角色。每个动作：模拟器先计算有限物理与相机轨迹，再生成对应观测；被接受的观测发布终端状态并更新外观记忆与后续生成器控制，已提交状态与模拟器几何在合成与重试期间保持不变。区分用于投影/可见性的模拟器几何与用于条件化生成器的相对深度；reference-anchored 记忆通过几何跨视角对应检索已接受的静态外观。",
    "insight": "交互式视觉世界模型必须区分观测与物理干预：相机运动揭示新表面，干预改变物体运动、接触与形变。现有视频世界模型多由外观先验驱动，长程常丢失物理或空间一致性。TourPhysics 是从单张图初始化的在线框架（扩展自团队 ACM MM 2026 工作 PhysOmni），把确定性模拟与视频生成结合，为模拟器状态、几何证据、生成器控制与外观记忆分配独立角色。每个动作：模拟器先计算有限物理与相机轨迹，再生成对应观测；被接受的观测发布终端状态并更新外观记忆与后续生成器控制，已提交状态与模拟器几何在合成与重试期间保持不变。区分用于投影/可见性的模拟器几何与用于条件化生成器的相对深度；reference-anchored 记忆通过几何跨视角对应检索已接受的静态外观。",
    "pipeline": {
      "input": "单张图像 + 声明式物理配置。",
      "process": "模拟器计算物理+相机轨迹 → 生成器合成观测 → 接受/拒绝（物理一致性判定）→ 发布终端状态，更新外观记忆 → 下一动作（记忆通过几何对应检索）。",
      "output": "长程一致的探索/操作视频，遵循指定的相机与物体轨迹。",
      "details": "**输入**：单张图像 + 声明式物理配置。\n**过程**：模拟器计算物理+相机轨迹 → 生成器合成观测 → 接受/拒绝（物理一致性判定）→ 发布终端状态，更新外观记忆 → 下一动作（记忆通过几何对应检索）。\n**输出**：长程一致的探索/操作视频，遵循指定的相机与物体轨迹。"
    },
    "experiments": "正文表 2 明确列出输入先验和有效样本范围：相机 ATE 为 0.0233，物体 ADE 为 0.0297，S@0.05 为 81.18%；相机指标使用 40 个输入身份的 49 条轨迹，物体指标使用 49 个身份、93 条轨迹中的 168 个物体。表 3 的碰撞/形变指标是相对于模拟器配对渲染轨迹的图像空间代理，VideoPhy-2 只作辅助感知诊断。部分基线视频经过时间拉伸，且本方法额外获得声明式物理配置；因此不应把表中差异解释为相同信息条件下的纯模型优劣。 [正文实验与表格](https://arxiv.org/html/2609.04911v2)。",
    "evidence_notes": "2026-09-14 已核对 arXiv 元数据、正文主要实验与对照；未运行复现实验。",
    "code_data_status": "未公开。",
    "limitations": "额外物理配置与模拟器状态构成强输入先验；对模拟轨迹的图像匹配不能证明视频生成器自身学会了真实物理。",
    "comments": "",
    "source_reports": [
      "report-37b94c4145"
    ],
    "deleted": false,
    "updated_at": "2026-09-14",
    "discussion": "直接命中「世界模型中的物理 grounding」与「交互式世界模型」，与知域 8/30 物理世界模型专题、馆藏 PhysOmni 系工作衔接。其「观测-干预分离」视角对因果世界模型讨论有意义（区分被动观测与主动干预）。",
    "arxiv": {
      "published": "2026-09-04T09:15:03Z",
      "revised_at": "2026-09-07T04:56:06Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2606-30598",
    "title": "Towards in-the-wild Egocentric 3D Hand-Object Pose Estimation",
    "authors": [
      "Siddhant Bansal",
      "Zhifan Zhu",
      "Shashank Tripathi",
      "Jiahe Zhao",
      "Michael J. Black",
      "Dima Damen"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本",
    "arxiv_id": "2606.30598",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2606.30598",
      "project": "https://sid2697.github.io/epic-contact/",
      "code": "https://github.com/Sid2697/HOPformer",
      "alphaxiv": "https://alphaxiv.org/abs/2606.30598"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "流式与自回归",
      "第一视角与人类视频",
      "长时记忆"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2606.30598v1/teaser_v4.2.png",
      "alt": "Towards in-the-wild Egocentric 3D Hand-Object Pose Estimation 代表图",
      "label": "Figure 1 : ( Left ) We introduce EPIC-Contact, an in-the-wild egocentric dataset for 3D hand-object pose estimation. Unlike typical in-lab MoCap datasets that require specialised equipment and capture limited backgrounds/object instances, EPIC-Contact provides diverse, cluttered real-world interactions with posed 3D hand–object meshes derived from dense, bijective contact annotations. ( Right ) Existing learning-base… 来源：论文图",
      "paper_title": "Towards in-the-wild Egocentric 3D Hand-Object Pose Estimation",
      "source_url": "https://arxiv.org/html/2606.30598v1/teaser_v4.2.png"
    },
    "summary": "论文同时补数据与模型：EPIC-Contact 把 EPIC-KITCHENS 风格的野外第一视角片段转成带稠密、双射 3D 接触对应的手—物网格数据；HOPformer 则把双手先验显式送入物体姿态解码器，使网络不必分别估计后再做脆弱的后处理配准。这里的关键不是把接触当标签装饰，而是用手部几何作为物体姿态的条件信息。",
    "insight": "论文同时补数据与模型：EPIC-Contact 把 EPIC-KITCHENS 风格的野外第一视角片段转成带稠密、双射 3D 接触对应的手—物网格数据；HOPformer 则把双手先验显式送入物体姿态解码器，使网络不必分别估计后再做脆弱的后处理配准。这里的关键不是把接触当标签装饰，而是用手部几何作为物体姿态的条件信息。",
    "pipeline": {
      "input": "单帧第一视角 RGB 图像。",
      "process": "共享视觉编码器提取图像特征；手部分支预测双手姿态并形成 hand priors；跨注意力解码器以手先验调制物体特征，联合回归双手和物体的 3D 姿态；EPIC-Contact 的稠密接触对应为野外数据提供几何监督。",
      "output": "双手 3D 姿态、物体 6D/3D 姿态以及可用于接触误差计算的手—物网格关系。",
      "details": "- **输入**：单帧第一视角 RGB 图像。\n- **过程**：共享视觉编码器提取图像特征；手部分支预测双手姿态并形成 hand priors；跨注意力解码器以手先验调制物体特征，联合回归双手和物体的 3D 姿态；EPIC-Contact 的稠密接触对应为野外数据提供几何监督。\n- **输出**：双手 3D 姿态、物体 6D/3D 姿态以及可用于接触误差计算的手—物网格关系。"
    },
    "experiments": "- **数据与设置**：论文在实验室数据集 ARCTIC 与新建的野外 EPIC-Contact 上评估，分别考察受控场景精度和真实分布泛化。\n- **作者报告**：HOPformer 在 ARCTIC 上达到 82.4% success rate，比当时最佳方法高 6.2 个百分点；在 EPIC-Contact 上成功率接近翻倍，同时 contact deviation 降低 75%。\n- **证据边界**：这些数字支持联合手—物建模和手先验在作者两套协议下有效，但新数据集、指标和方法由同一工作提出，仍需外部复现与跨物体类别验证；不能由接触误差下降直接推出动力学或因果交互已被建模。",
    "evidence_notes": "",
    "code_data_status": "项目页公开 EPIC-Contact、HOPformer 代码与 checkpoints 入口；官方仓库可访问。具体数据许可、下载规模、训练环境和 checkpoint 复现误差以项目页与仓库最新说明为准。",
    "limitations": "- 单帧估计无法保证跨时间身份与姿态连续性，不能替代 4D track 或动作条件状态转移模型；\n- 强遮挡、未见物体类别、透明/反光物体和手外观域偏移仍可能破坏手先验；\n- EPIC-Contact 的接触标注虽显著扩大野外监督，但 2.3K clips 仍不足以穷尽开放世界物体与接触类型；\n- 后续应把 per-frame pose、持续 4D correspondence、接触事件和物体响应联合评测。\n\n### 与知域的关系\n\n直接补齐“野外第一视角 RGB → 双手/物体 3D pose + contact”的中间层，可与 EgoGrasp、OpenHOI、MILO 以及动态 4D 重建工作形成状态估计—几何重建—未来预测链路；同时为 HOI 世界模型提供真实接触监督和失败分析基准。",
    "comments": "",
    "source_reports": [
      "report-a141624b1e"
    ],
    "deleted": false,
    "updated_at": "2026-08-31",
    "challenges": "野外第一视角 RGB 中的双手与物体经常互相遮挡，接触又具有多解性；现有方法多依赖实验室 MoCap 数据，训练分布中的背景、物体实例和相机条件远窄于真实日常交互。缺少同时提供手、物体、接触对应和姿态网格的真实数据，也使模型很难用接触几何约束消除纯视觉歧义。",
    "motivation": "论文同时补数据与模型：EPIC-Contact 把 EPIC-KITCHENS 风格的野外第一视角片段转成带稠密、双射 3D 接触对应的手—物网格数据；HOPformer 则把双手先验显式送入物体姿态解码器，使网络不必分别估计后再做脆弱的后处理配准。这里的关键不是把接触当标签装饰，而是用手部几何作为物体姿态的条件信息。",
    "technical_approach": "- **输入**：单帧第一视角 RGB 图像。\n- **过程**：共享视觉编码器提取图像特征；手部分支预测双手姿态并形成 hand priors；跨注意力解码器以手先验调制物体特征，联合回归双手和物体的 3D 姿态；EPIC-Contact 的稠密接触对应为野外数据提供几何监督。\n- **输出**：双手 3D 姿态、物体 6D/3D 姿态以及可用于接触误差计算的手—物网格关系。",
    "discussion": "这项工作为知域的 HOI 与 3D/4D 主线提供了比纯 2D 手框、掩码或视频流更强的状态接口：真实第一视角输入可以映射到带接触关系的手—物 3D 状态。它尤其适合作为世界模型的观测编码或评测信号，但本身是单帧姿态估计，不包含跨时跟踪、动作条件未来预测或接触动力学。",
    "arxiv": {
      "published": "2026-06-29T17:38:12Z",
      "revised_at": "2026-06-29T17:38:12Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2511-21690",
    "title": "TraceGen: World Modeling in 3D Trace Space Enables Learning from Cross-Embodiment Videos",
    "authors": [
      "Seungjae Lee",
      "Yoonkyo Jung",
      "Inkook Chun",
      "Yao-Chih Lee",
      "Zikui Cai",
      "Hongjia Huang",
      "Aayush Talreja",
      "Tan Dat Dao",
      "Yongyuan Liang",
      "Jia-Bin Huang",
      "Furong Huang"
    ],
    "year": 2026,
    "publication": "2026，CVPR 2026（arXiv 2025）",
    "arxiv_id": "2511.21690",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2511.21690",
      "project": "https://tracegen.github.io/",
      "alphaxiv": "https://alphaxiv.org/abs/2511.21690"
    },
    "tags": [
      "3D/4D",
      "世界模型",
      "动作表征",
      "机器人学习",
      "跨本体迁移"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2511.21690/x1.png",
      "alt": "TraceGen Fig. 1",
      "label": "TraceGen，Fig. 1，TraceForge 数据引擎、3D trace 世界模型与人机迁移。来源：Fig. 1 原图",
      "paper_title": "TraceGen: World Modeling in 3D Trace Space Enables Learning from Cross-Embodiment Videos",
      "source_url": "https://arxiv.org/html/2511.21690/x1.png"
    },
    "summary": "不同本体不可共享关节动作，但被操作物体、末端和工具的场景级 3D 运动具有共同结构。TraceGen 因此预测“世界中什么点怎样移动”，而非主体外观或关节命令；这是把 geometry action 扩展到 ego human、robot 和不同环境的直接方案。",
    "insight": "不同本体不可共享关节动作，但被操作物体、末端和工具的场景级 3D 运动具有共同结构。TraceGen 因此预测“世界中什么点怎样移动”，而非主体外观或关节命令；这是把 geometry action 扩展到 ego human、robot 和不同环境的直接方案。",
    "pipeline": {
      "input": "单帧 RGB、深度与语言；TraceForge 接收未标定人类/机器人视频。",
      "process": "TraceForge 用 CoTracker3、TAPIP3D、VGGT/SpatialTrackerV2 将 20×20 点轨迹变换到参考相机，补偿相机运动并按弧长重采样。TraceGen 冻结 DINOv3、SigLIP、T5，以 CogVideoX 风格 3D Transformer 和 flow matching 生成 400×32×3 trace increments，100 步 ODE；逆运动学转为执行命令。",
      "output": "未来 32 时刻、覆盖机器人/物体/工具的 3D traces，以及经 IK 得到的目标机器人动作。",
      "details": "- **输入：** 单帧 RGB、深度与语言；TraceForge 接收未标定人类/机器人视频。\n- **过程：** TraceForge 用 CoTracker3、TAPIP3D、VGGT/SpatialTrackerV2 将 20×20 点轨迹变换到参考相机，补偿相机运动并按弧长重采样。TraceGen 冻结 DINOv3、SigLIP、T5，以 CogVideoX 风格 3D Transformer 和 flow matching 生成 400×32×3 trace increments，100 步 ODE；逆运动学转为执行命令。\n- **输出：** 未来 32 时刻、覆盖机器人/物体/工具的 3D traces，以及经 IK 得到的目标机器人动作。"
    },
    "experiments": "TraceForge-123K 含 123k 视频、约 1.8M observation–trace–language triplets。Franka 四任务每设置每任务 10 trials：只用 5 个目标机器人视频 warm-up 时从头训练 25%，TraceGen 80%；15 视频为 30% vs 82.5%。只用 5 个未标定手机人类视频时 67.5%，从头训练 0%。预训练来源消融在 Ball/Block 上 scratch/SSV2/Agibot/完整为 0/25/45/70%。\n\n9 episodes 的 3D sanity check 平均运动 70.96 cm，终点绝对误差 x/y/z 为 1.66/1.79/2.26 cm。0.67B 模型比 trace baseline 快 3.8×、比大型视频模型快 50×以上；Wan2.2 超过 600×。训练 GPU 与总成本未报告。长时抓取包含 scripted component，不应归因于 TraceGen。",
    "evidence_notes": "",
    "code_data_status": "项目页公开并描述 TraceForge-123K；未核验到代码、权重或数据下载入口，不能写成已开源。",
    "limitations": "- 自动处理仍保留失败、纠错与低效动作噪声。\n- 新本体可能生成视觉合理但不可执行的轨迹。\n- trace 对精细接触可能过粗，未显式建模力。\n- 评估形态有限，执行依赖 IK 与 scripted grasp。\n- 未研究多模态轨迹模式选择及更多生成 schedule。",
    "comments": "",
    "source_reports": [
      "report-a77d9a7ad6"
    ],
    "deleted": false,
    "updated_at": "2026-08-21",
    "challenges": "人类和异构机器人视频丰富，却有本体、相机、尺度、速度与环境差异；像素世界模型昂贵且可能产生几何幻觉，VLM token 又缺精细时空分辨率。既有 trace 方法常停留在 2D、静态相机或依赖检测器的目标中心轨迹。",
    "motivation": "不同本体不可共享关节动作，但被操作物体、末端和工具的场景级 3D 运动具有共同结构。TraceGen 因此预测“世界中什么点怎样移动”，而非主体外观或关节命令；这是把 geometry action 扩展到 ego human、robot 和不同环境的直接方案。",
    "technical_approach": "- **输入：** 单帧 RGB、深度与语言；TraceForge 接收未标定人类/机器人视频。\n- **过程：** TraceForge 用 CoTracker3、TAPIP3D、VGGT/SpatialTrackerV2 将 20×20 点轨迹变换到参考相机，补偿相机运动并按弧长重采样。TraceGen 冻结 DINOv3、SigLIP、T5，以 CogVideoX 风格 3D Transformer 和 flow matching 生成 400×32×3 trace increments，100 步 ODE；逆运动学转为执行命令。\n- **输出：** 未来 32 时刻、覆盖机器人/物体/工具的 3D traces，以及经 IK 得到的目标机器人动作。",
    "discussion": "TraceGen 强力支持“场景级 3D 运动是跨本体中间语言”，且少样本与速度优势明确；但执行依赖深度校正、坐标变换、IK 与 scripted grasping，不是完全端到端。真实试验每格仅 10 次，置信度有限。",
    "arxiv": {
      "published": "2025-11-26T18:59:55Z",
      "revised_at": "2025-11-26T18:59:55Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2608-24101",
    "title": "TrAct: Bridging Robot Control and Visual Prediction with Visual Tracks",
    "authors": [
      "Zhi Cao",
      "Howard Ji",
      "Kevin Zhang",
      "Kuangzhi Ge",
      "Li Fei-Fei",
      "Jiajun Wu",
      "Huang Huang"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本（首发 2026-08-25）",
    "arxiv_id": "2608.24101",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.24101",
      "alphaxiv": "https://alphaxiv.org/abs/2608.24101"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "机器人学习",
      "流式与自回归",
      "第一视角与人类视频",
      "长时记忆"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.24101v1/img/splash.png",
      "alt": "TrAct: Bridging Robot Control and Visual Prediction with Visual Tracks 代表图",
      "label": "Figure 1: Overview of TrAct. TrAct uses VLAT (left, purple), pretrained on large-scale cross-embodiment data, to propose candidate action–track pairs. TWM (middle, gray) rolls out the visual outcome for each candidate conditioned on the tracks, and VLAC (middle, green) selects the highest-reward rollout; the robot executes the paired action. Visual tracks thus serve as an intermediate interface between future predict… 来源：论文图",
      "paper_title": "TrAct: Bridging Robot Control and Visual Prediction with Visual Tracks",
      "source_url": "https://arxiv.org/html/2608.24101v1/img/splash.png"
    },
    "summary": "机器人动作高度具身特定、与图像空间视觉变化弱对齐，作为世界模型条件信号效力有限； 视觉轨迹（visual tracks）是具身无关的任务相关点运动表示 ，提供密集图像空间引导以支撑精准的未来视频预测。TrAct 以 visual tracks 为\"控制与预测之间的中间接口\"，VLAT 联合预测候选动作与轨迹。",
    "insight": "机器人动作高度具身特定、与图像空间视觉变化弱对齐，作为世界模型条件信号效力有限；**视觉轨迹（visual tracks）是具身无关的任务相关点运动表示**，提供密集图像空间引导以支撑精准的未来视频预测。TrAct 以 visual tracks 为\"控制与预测之间的中间接口\"，VLAT 联合预测候选动作与轨迹。",
    "pipeline": {
      "input": "观测 + 语言指令。",
      "process": "VLAT（联合预测候选动作 + 视觉轨迹）→ 世界模型以轨迹为条件做未来预测 → 决策。",
      "output": "动作 + 未来视频预测。",
      "details": "**输入**：观测 + 语言指令。\n**过程**：VLAT（联合预测候选动作 + 视觉轨迹）→ 世界模型以轨迹为条件做未来预测 → 决策。\n**输出**：动作 + 未来视频预测。"
    },
    "experiments": "仅摘要核验；benchmark 与消融待全文确认。",
    "evidence_notes": "",
    "code_data_status": "未见公开代码（Li 组惯例）。",
    "limitations": "- 轨迹点的选取与密度；\n- 长视界轨迹的漂移；\n- 与 4DGS-WAM 类\"对象中心表示\"的关系未直接对照。\n\n### 与知域的关系\n与知域 FlowWAM（光流作为统一动作表示）、PointAction（3D 点作为动作表示）同属\"以稠密/稀疏视觉结构为动作-预测中间表示\"主线。",
    "comments": "",
    "source_reports": [
      "report-a141624b1e"
    ],
    "deleted": false,
    "updated_at": "2026-08-31",
    "arxiv": {
      "published": "2026-08-25T06:00:01Z",
      "revised_at": "2026-09-01T23:59:10Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2609-22966",
    "title": "Transferring the Intelligence of VLMs to Robotic Control",
    "authors": [
      "Meng-Hao Guo",
      "Zhe-Han Mo",
      "Jia-Jun Wang",
      "Yi Zhang",
      "Kejin Wang",
      "Yi-Xuan Deng",
      "Jia-Peng Zhang",
      "Yongming Rao",
      "Shi-Min Hu"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本",
    "arxiv_id": "2609.22966",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2609.22966",
      "project": "https://robodawn.top/",
      "code": "https://github.com/Hugo-AGI/RoboDawn",
      "alphaxiv": "https://alphaxiv.org/abs/2609.22966"
    },
    "tags": [
      "Agent与可执行世界",
      "具身上下文学习",
      "机器人学习"
    ],
    "figure": {
      "url": "content/images/2609.22966-main.webp",
      "alt": "Figure 2：语义运动接口、上下文示范与执行反馈连接冻结 VLM 和机器人",
      "label": "Figure 2 · 语义运动接口、上下文示范与执行反馈连接冻结 VLM 和机器人",
      "paper_title": "Transferring the Intelligence of VLMs to Robotic Control",
      "source_url": "https://arxiv.org/html/2609.22966v1/pipeline.png"
    },
    "summary": "RoboDawn 用少量符合人类直觉的离散运动命令连接 VLM 与机器人，再用上下文示范教会命令约定和任务策略。能力适配主要发生在推理上下文中，无需任务专用梯度训练。",
    "insight": "RoboDawn 用少量符合人类直觉的离散运动命令连接 VLM 与机器人，再用上下文示范教会命令约定和任务策略。能力适配主要发生在推理上下文中，无需任务专用梯度训练。",
    "pipeline": {
      "input": "带空间网格标注的多视图图像、机器人状态、任务指令、命令说明、零到多个任务示范和历史反馈。",
      "process": "冻结 VLM 观察、推理、生成批量命令；控制层以夹爪指尖中点 GIP 为参考，将 move、rotate、point、gripper、home 等命令转成目标位姿与规划运动；收到 reached/partial/failed 后继续更新计划和记忆。",
      "output": "闭环机器人操作及执行过程记录。",
      "details": "**过程**：冻结 VLM 观察、推理、生成批量命令；控制层以夹爪指尖中点 GIP 为参考，将 move、rotate、point、gripper、home 等命令转成目标位姿与规划运动；收到 reached/partial/failed 后继续更新计划和记忆。\n\n- **输入**：带空间网格标注的多视图图像、机器人状态、任务指令、命令说明、零到多个任务示范和历史反馈。\n- **过程**：冻结 VLM 观察、推理、生成批量命令；控制层以夹爪指尖中点 GIP 为参考，将 move、rotate、point、gripper、home 等命令转成目标位姿与规划运动；收到 reached/partial/failed 后继续更新计划和记忆。\n- **输出**：闭环机器人操作及执行过程记录。\n\n示范轨迹被转成在线可执行的命令和简短解释。默认平移和旋转单命令幅度分别限制为 20 cm 与 90°；世界坐标约定和 GIP 一致性是落地关键。零样本指无任务示范，仍包含公共命令说明。[原文方法 §3](https://arxiv.org/html/2609.22966#S3)\n\n### 方法细节与实现\n\n**语义控制接口。**RoboDawn 把机器人的运动暴露为以世界坐标和语义方向描述的移动、旋转与夹爪操作，单次位移和转角分别限制在 20 cm、90° 范围。VLM 需要推理相对目标及操作顺序，由运动规划和控制器负责执行具体轨迹。这层接口降低不同机器人底层动作格式差异对语言模型的影响。\n\n**上下文示范与反馈。**固定 VLM 读取多视角图像、机器人状态、任务指令和少量示范，将示范中的操作模式迁移到当前对象与布局；每次命令后接收实际移动量、夹爪状态及执行成功/失败信息。记忆保存已发生操作、进度和相关空间事实，使下次决策能根据执行偏差修正。\n\n**为何不能把它当成新训练的 VLA。**模型能力主要来自已有 VLM，加上机器人接口、提示和上下文组织，任务期间不训练新的动作网络。代码开放有利于复现编排流程，但相机与机器人标定、可达性检查和商业模型调用条件仍需在本地适配。\n\n[对应方法原文](https://arxiv.org/html/2609.22966#S3)"
    },
    "experiments": "RoboTwin 2.0 C2R 为 50 个双臂任务、每任务 10 次：零样本 53.2%，一个任务示范 73.6%；训练于全量基准示范的 π0.5 为 46.0%。RoboDojo 为 42 个任务、每任务 5 次，零/单样本分别 35.67%/47.17%。后者混有开放指令任务，阅读比较时需留意各基线训练覆盖。\n\n项目页报告 RoboDojo 单样本从 60 命令预算的 31.2% 提升到 240 命令的 47.2%，因此成功率也依赖测试时交互预算。实机 Franka 展示入篮和叠块；入篮零样本为 9/10。时间分析用 Seed-2.1-Pro：每决策推理约 9.74 秒，机器人运动约 2.09 秒，不是高频控制。[原文](https://arxiv.org/html/2609.22966)；[官方实验页](https://robodawn.top/)\n\n**规模与效率。**C2R 采用 50 个任务、每任务 10 次评估；RoboDojo 为 42 个任务、每任务 5 次。后者由 35.67% 提高到 47.17%，单次决策平均推理约 9.74 秒、运动约 2.09 秒，瓶颈主要在高层模型。增加一条示范带来的改善支持上下文学习，但不同模型推理预算和重试次数应同时对齐。\n\n[实验与设置原文](https://arxiv.org/html/2609.22966)",
    "evidence_notes": "已核验原文方法、实验与局限；以下数值为作者报告，分析另行标注",
    "code_data_status": "[Hugo-AGI/RoboDawn](https://github.com/Hugo-AGI/RoboDawn) 已公开，官方项目页已从早期 coming soon 更新为开源链接。模型依赖外部 VLM；不能把无需任务训练解释为不依赖任何预训练模型和控制基础设施。",
    "limitations": "细接触精度不足、IK 路径碰撞、过早判断成功是已展示失败。精确旋转比平移更困难；增加示范不保证单调改善，长上下文可能降低效果。实机任务和次数仍少，VLM 版本与命令预算影响复现。",
    "comments": "",
    "source_reports": [],
    "deleted": false,
    "updated_at": "2026-09-24",
    "challenges": "通用 VLM 有视觉推理能力，却不自然对应高频关节角和机器人动作坐标。任务专用策略又通常需要大量示范和参数更新。问题是如何给冻结 VLM 一个它能理解、能根据反馈修正的机器人接口。",
    "motivation": "RoboDawn 用少量符合人类直觉的离散运动命令连接 VLM 与机器人，再用上下文示范教会命令约定和任务策略。能力适配主要发生在推理上下文中，无需任务专用梯度训练。",
    "technical_approach": "**过程**：冻结 VLM 观察、推理、生成批量命令；控制层以夹爪指尖中点 GIP 为参考，将 move、rotate、point、gripper、home 等命令转成目标位姿与规划运动；收到 reached/partial/failed 后继续更新计划和记忆。\n\n- **输入**：带空间网格标注的多视图图像、机器人状态、任务指令、命令说明、零到多个任务示范和历史反馈。\n- **过程**：冻结 VLM 观察、推理、生成批量命令；控制层以夹爪指尖中点 GIP 为参考，将 move、rotate、point、gripper、home 等命令转成目标位姿与规划运动；收到 reached/partial/failed 后继续更新计划和记忆。\n- **输出**：闭环机器人操作及执行过程记录。\n\n示范轨迹被转成在线可执行的命令和简短解释。默认平移和旋转单命令幅度分别限制为 20 cm 与 90°；世界坐标约定和 GIP 一致性是落地关键。零样本指无任务示范，仍包含公共命令说明。[原文方法 §3](https://arxiv.org/html/2609.22966#S3)\n\n### 方法细节与实现\n\n**语义控制接口。**RoboDawn 把机器人的运动暴露为以世界坐标和语义方向描述的移动、旋转与夹爪操作，单次位移和转角分别限制在 20 cm、90° 范围。VLM 需要推理相对目标及操作顺序，由运动规划和控制器负责执行具体轨迹。这层接口降低不同机器人底层动作格式差异对语言模型的影响。\n\n**上下文示范与反馈。**固定 VLM 读取多视角图像、机器人状态、任务指令和少量示范，将示范中的操作模式迁移到当前对象与布局；每次命令后接收实际移动量、夹爪状态及执行成功/失败信息。记忆保存已发生操作、进度和相关空间事实，使下次决策能根据执行偏差修正。\n\n**为何不能把它当成新训练的 VLA。**模型能力主要来自已有 VLM，加上机器人接口、提示和上下文组织，任务期间不训练新的动作网络。代码开放有利于复现编排流程，但相机与机器人标定、可达性检查和商业模型调用条件仍需在本地适配。\n\n[对应方法原文](https://arxiv.org/html/2609.22966#S3)",
    "discussion": "**阅读者分析**：与 VoLo 的互补点是接口层级不同：RoboDawn 让 VLM 直接组合简单运动命令；VoLo 调度已经具有接触技能的策略与工具。它也不同于 WAM：没有训练一个显式未来视觉/触觉预测器。",
    "arxiv": {
      "published": "2026-09-19",
      "revised_at": "",
      "primary_category": "cs.RO"
    },
    "source_papers": [
      "content/papers/2609.22966.md"
    ]
  },
  {
    "id": "arxiv-2609-11875",
    "title": "UniMPA: A Unified Memory-Prediction-Action Model via Action-Grounded Transition Modeling",
    "authors": [
      "Wei Li",
      "Rui Shao",
      "Jie He",
      "Lingsen Zhang",
      "Ziwei Liu",
      "Liqiang Nie"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本，v1；投稿 TPAMI，非接收状态",
    "arxiv_id": "2609.11875",
    "doi": "10.48550/arXiv.2609.11875",
    "links": {
      "paper": "https://arxiv.org/abs/2609.11875",
      "project": "https://jiutian-vl.github.io/UniMPA-page/",
      "code": "https://github.com/JiuTian-VL/UniMPA",
      "alphaxiv": "https://alphaxiv.org/abs/2609.11875"
    },
    "tags": [
      "World Action Model",
      "扩散与流匹配",
      "自监督与预测表征",
      "长时记忆"
    ],
    "figure": {
      "url": "content/images/2609.11875-representative.webp",
      "alt": "Fig. 2",
      "label": "Fig. 2",
      "paper_title": "UniMPA: A Unified Memory-Prediction-Action Model via Action-Grounded Transition Modeling",
      "source_url": "https://arxiv.org/html/2609.11875v1#S1.F2"
    },
    "summary": "UniMPA将未来预测、经验检索和动作生成统一在“动作支撑的状态转移”上。持续 latent 流跟踪任务进度，像素流只在转移关键时刻启动；预测转移检索历史视觉—动作证据，反向记忆再提供动作原型，流匹配在当前场景中细化。",
    "insight": "UniMPA将未来预测、经验检索和动作生成统一在“动作支撑的状态转移”上。持续 latent 流跟踪任务进度，像素流只在转移关键时刻启动；预测转移检索历史视觉—动作证据，反向记忆再提供动作原型，流匹配在当前场景中细化。",
    "pipeline": {
      "input": "当前视觉、语言、本体，以及离线构建的视觉—动作和动作—视觉记忆库。",
      "process": "World Expert产生未来转移 token；trigger gate选择是否执行像素预测；双向记忆检索可执行经验与动作原型；Prototype-Biased Flow在历史支持的动作区域初始化并经 10 步 Euler 流匹配细化。",
      "output": "未来转移表示、检索证据与连续动作块。",
      "details": "**输入**：当前视觉、语言、本体，以及离线构建的视觉—动作和动作—视觉记忆库。\n\n**过程**：World Expert产生未来转移 token；trigger gate选择是否执行像素预测；双向记忆检索可执行经验与动作原型；Prototype-Biased Flow在历史支持的动作区域初始化并经 10 步 Euler 流匹配细化。\n\n**输出**：未来转移表示、检索证据与连续动作块。"
    },
    "experiments": "官方项目页报告 LIBERO 98.6%、LIBERO-Plus 85.3%、RoboTwin 2.0 Hard 58.2%；GALAXEA R1 Lite 21 项任务的 TSR/CSR 为 77.7%/86.3%，\\(\\pi_{0.5}\\) 为 65.3%/75.6%。LIBERO 共 2,000 次 rollout，Hard 设置每任务 100 次；真实任务每项 25 次。移除记忆使 LIBERO/真实 TSR 分别下降 4.1/13.8 点，支持预测与记忆互补。部分 baseline 标有作者复现，需避免把全部差异视为官方同预算结果。 [正文实验与表格](https://arxiv.org/html/2609.11875v1)。",
    "evidence_notes": "2026-09-14 已核对 arXiv 元数据、正文主要实验与对照；未运行复现实验。",
    "code_data_status": "当前仓库仅见 README 与展示素材，不能认定已公开完整实现。 以上状态核验于 2026-09-14；入口和目录存在不等于已经运行复现实验。",
    "limitations": "记忆只在 rollout 结束后异步扩充，不能在当前执行中即时利用新经验；固定预测时间尺度不适合同时覆盖自由空间运动和快速接触；二值 trigger gate 无法表达连续不确定性。",
    "comments": "",
    "source_reports": [
      "report-37b94c4145"
    ],
    "deleted": false,
    "updated_at": "2026-09-14",
    "discussion": "UniMPA把具身 ICL 式经验检索与 WAM 的未来预测、动作生成紧密耦合，是研究“可执行上下文”的重要候选。",
    "arxiv": {
      "published": "2026-09-10T17:45:03Z",
      "revised_at": "2026-09-10T17:45:03Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2608-04701",
    "title": "UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models",
    "authors": [
      "Haiyang Zhou",
      "Wangbo Yu",
      "Chaoran Feng",
      "Xunyu Zhou",
      "Yonghong Tian",
      "Li Yuan"
    ],
    "year": 2026,
    "publication": "2026，arXiv preprint，v1 于 2026-08-05 提交；截至核验日未发现正式出版页",
    "arxiv_id": "2608.04701",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.04701",
      "project": "https://zhouhyocean.github.io/uniworld-view/",
      "code": "https://github.com/PKU-YuanGroup/UniWorld-View",
      "alphaxiv": "https://alphaxiv.org/abs/2608.04701"
    },
    "tags": [
      "3D/4D",
      "视频生成"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.04701v1/pipeline.png",
      "alt": "UniWorld-View Fig. 2：遮挡感知点云条件与双流视频扩散框架",
      "label": "UniWorld-View，Fig. 2，遮挡感知点云条件与双流视频扩散的新视角合成框架。来源：Fig. 2 原图 PNG",
      "paper_title": "UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models",
      "source_url": "https://arxiv.org/html/2608.04701v1/pipeline.png"
    },
    "summary": "作者的核心动机是把“相机变换”交给显式 3D 渲染，把“孔洞补全与外观生成”交给视频扩散先验，同时在进入扩散模型前消除点云可见性歧义。由此，模型不必仅从相机编码中隐式推断几何，也不必要求输入已经覆盖目标视角。对知域而言，这项工作连接了 feed-forward 几何、生成式新视角合成与单目 4D 重建，但它是相机条件的视觉生成系统，不是可交互物理世界模型。",
    "insight": "作者的核心动机是把“相机变换”交给显式 3D 渲染，把“孔洞补全与外观生成”交给视频扩散先验，同时在进入扩散模型前消除点云可见性歧义。由此，模型不必仅从相机编码中隐式推断几何，也不必要求输入已经覆盖目标视角。对知域而言，这项工作连接了 feed-forward 几何、生成式新视角合成与单目 4D 重建，但它是相机条件的视觉生成系统，不是可交互物理世界模型。",
    "pipeline": {
      "input": "一张图像或一段单目视频、源相机/估计深度与用户指定的目标相机轨迹；训练时还使用静态多视图三元组和动态单目视频对。",
      "process": "先由 feed-forward 几何模型估计深度、相机与点云；再用三次重投影累积源视图可见性掩码，并以表面法线过滤背向点；随后把点云渲染及有效掩码送入 VACE Context Blocks，把完整但与目标视角不对齐的源视频送入参考分支，以双流条件驱动基于 WAN2.1-14B/VACE 的视频扩散。用于 4DGS 时，系统先在冻结时刻生成一组静态视角作为外观锚点，再在固定相机位姿上逐视角生成同步动态视频并更新遮挡内容，最后联合源视频优化动态 3DGS。",
      "output": "沿目标相机轨迹生成的 3D/4D 新视角视频；可进一步输出供动态 3D Gaussian Splatting 优化使用的同步多视图视频与 4DGS 表示。",
      "details": "- **输入：** 一张图像或一段单目视频、源相机/估计深度与用户指定的目标相机轨迹；训练时还使用静态多视图三元组和动态单目视频对。\n- **过程：** 先由 feed-forward 几何模型估计深度、相机与点云；再用三次重投影累积源视图可见性掩码，并以表面法线过滤背向点；随后把点云渲染及有效掩码送入 VACE Context Blocks，把完整但与目标视角不对齐的源视频送入参考分支，以双流条件驱动基于 WAN2.1-14B/VACE 的视频扩散。用于 4DGS 时，系统先在冻结时刻生成一组静态视角作为外观锚点，再在固定相机位姿上逐视角生成同步动态视频并更新遮挡内容，最后联合源视频优化动态 3DGS。\n- **输出：** 沿目标相机轨迹生成的 3D/4D 新视角视频；可进一步输出供动态 3D Gaussian Splatting 优化使用的同步多视图视频与 4DGS 表示。"
    },
    "experiments": "- **实验设置：** 视频统一为 480×832、81 帧。Context Blocks 在 100K 静态多视图三元组上训练 10K iterations；Ref-DiT 在 100K 自监督动态单目视频对上训练 10K iterations；两阶段 batch size 均为 8，使用 32 张 GPU。论文未报告 GPU 型号、总训练时长或能耗。\n- **实验事实：** WorldScore 上，UniWorld-View 的 Static/Dynamic 分数为 85.53/76.09；Static 在表中最高，Dynamic 略低于 WorldScape-0.2 的 76.23。其 Camera Control、Object Control、Content Alignment 分别为 97.72、88.98、86.61，均为表中最高，但 Subjective Quality 63.12、Motion Smoothness 60.42 并非领先。\n- **实验事实：** 在沿用 SEVA 划分的 zero-shot NVS 上，RealEstate10K、CO3D、DL3DV 的 PSNR/SSIM 分别为 21.7261/0.7833、19.9958/0.5787、15.8190/0.4462，三组均为表中最高；LPIPS 只在 CO3D 最优，RealEstate10K 与 DL3DV 均落后于最佳对照，因此“所有感知指标全面领先”不成立。\n- **作者主张：** 遮挡感知点云条件与双流扩散共同改善大基线下的相机可控性、几何一致性和视觉质量。\n- **阅读判断：** 主表支持系统整体优于所列对照，但论文没有独立消融三次重投影、法线过滤、参考分支和混合数据策略，也未报告随机波动；各组件的因果贡献和排行榜差异的稳定性仍待验证。WorldScore 是生成质量/控制评测，不能替代真实 4D 几何误差或物理一致性评测。",
    "evidence_notes": "",
    "code_data_status": "官方仓库已公开推理代码、配置、模型下载脚本和 Gradio demo，项目代码许可证为 Apache-2.0；README 提供 MoSca bundle-adjustment 与 STream3R feed-forward 两种几何前端，并建议至少 60 GB 显存。4D 重建实现位于 `recon` 分支。权重可由脚本从 Hugging Face 下载，但完整 100K+100K 训练数据配对和训练流程是否全部可重建，仓库说明不足，需人工复现核验。",
    "limitations": "- 依赖基础视频扩散模型的生成能力；官方仓库明确指出复杂、超出基座生成分布的场景可能失败。\n- 大基线下新显露区域仍由模型生成，视觉合理不保证几何或语义真实。\n- 论文缺少组件消融、随机种子/置信区间和真实度量 4D 几何评测。\n- 训练使用 32 张 GPU，但未披露 GPU 型号、总时长、能耗及完整数据清单，训练复现成本难以审计。\n- 4D 多视图由逐视角生成与遮挡传播构造，动态前景的跨视角身份/纹理漂移仍是潜在开放问题。",
    "comments": "",
    "source_reports": [
      "report-5a20368080",
      "report-89efbb2378"
    ],
    "deleted": false,
    "updated_at": "2026-08-31",
    "challenges": "稀疏单目图像或视频无法覆盖大幅视角变化中新显露的区域。NeRF/3DGS 一类重建方法依赖密集多视图与逐场景优化；纯相机位姿条件的生成方法又缺少显式几何约束。已有点云条件方法虽然提供深度和相机先验，但大基线下会把前景纹理撕裂到背景、把背景错投到前景，并错误显示背向表面，给扩散模型输入相互矛盾的几何提示。",
    "motivation": "作者的核心动机是把“相机变换”交给显式 3D 渲染，把“孔洞补全与外观生成”交给视频扩散先验，同时在进入扩散模型前消除点云可见性歧义。由此，模型不必仅从相机编码中隐式推断几何，也不必要求输入已经覆盖目标视角。对知域而言，这项工作连接了 feed-forward 几何、生成式新视角合成与单目 4D 重建，但它是相机条件的视觉生成系统，不是可交互物理世界模型。",
    "technical_approach": "- **输入：** 一张图像或一段单目视频、源相机/估计深度与用户指定的目标相机轨迹；训练时还使用静态多视图三元组和动态单目视频对。\n- **过程：** 先由 feed-forward 几何模型估计深度、相机与点云；再用三次重投影累积源视图可见性掩码，并以表面法线过滤背向点；随后把点云渲染及有效掩码送入 VACE Context Blocks，把完整但与目标视角不对齐的源视频送入参考分支，以双流条件驱动基于 WAN2.1-14B/VACE 的视频扩散。用于 4DGS 时，系统先在冻结时刻生成一组静态视角作为外观锚点，再在固定相机位姿上逐视角生成同步动态视频并更新遮挡内容，最后联合源视频优化动态 3DGS。\n- **输出：** 沿目标相机轨迹生成的 3D/4D 新视角视频；可进一步输出供动态 3D Gaussian Splatting 优化使用的同步多视图视频与 4DGS 表示。",
    "discussion": "UniWorld-View 的实质差异不是再增加一种相机编码，而是先把单目观测变成遮挡感知的显式点云渲染，再让大视频扩散模型只在可靠几何锚点与源外观之间补全。它适合大基线 NVS、单目视频重定向和为动态 3DGS制造额外视图；对需要度量几何、可编辑拓扑或物理交互的任务，只能作为视图生成前端，不能把生成一致性等同于真实场景恢复。",
    "arxiv": {
      "published": "2026-08-05T11:10:52Z",
      "revised_at": "2026-08-05T11:10:52Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2609-03153",
    "title": "VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement",
    "authors": [
      "Wenzhuo Xu",
      "Yuchen Zhu",
      "Chongjian Ge",
      "Xuan Shen",
      "Jing Shi",
      "Jason Kuen",
      "Yongxin Chen",
      "Molei Tao",
      "Christopher McComb",
      "Noelia Grande Gutiérrez",
      "Jiuxiang Gu"
    ],
    "year": 2026,
    "publication": "2026，arXiv",
    "arxiv_id": "2609.03153",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2609.03153",
      "alphaxiv": "https://alphaxiv.org/abs/2609.03153"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "流式与自回归",
      "物理建模与仿真",
      "第一视角与人类视频",
      "跨本体迁移"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2609.03153v1/figs/assets/ball_wall_studio_bg_v4.png",
      "alt": "VeriPhy 物理推理与验证示例",
      "label": "VeriPhy 物理推理与验证示例；来源：论文原图",
      "paper_title": "VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement",
      "source_url": "https://arxiv.org/html/2609.03153v1/figs/assets/ball_wall_studio_bg_v4.png"
    },
    "summary": "VeriPhy 将 prompt 编译成类型化物理义务和执行计划，再调用冻结的低层专家进行分割、跟踪、计数、深度、OCR、音频事件和物理测量。每条结果都携带 provenance，最后输出 supported、contradicted 或 unknown 三值判断。",
    "insight": "VeriPhy 将 prompt 编译成类型化物理义务和执行计划，再调用冻结的低层专家进行分割、跟踪、计数、深度、OCR、音频事件和物理测量。每条结果都携带 provenance，最后输出 supported、contradicted 或 unknown 三值判断。",
    "pipeline": {
      "input": "生成视频、文本提示、物理约束。",
      "process": "规划物理义务，执行经过验证的测量，记录证据来源，使用固定 resolver 将证据组合成三值状态。",
      "output": "带证据链的物理可靠性判断和可定位失败记录。",
      "details": "**输入**：生成视频、文本提示、物理约束。\n\n**过程**：规划物理义务，执行经过验证的测量，记录证据来源，使用固定 resolver 将证据组合成三值状态。\n\n**输出**：带证据链的物理可靠性判断和可定位失败记录。"
    },
    "experiments": "摘要报告：\n\n- 1500 个带人工标注缺陷记录的视频；\n- 核心子集 149 个视频、304 条缺陷记录；\n- VeriPhy 覆盖 228 条记录；\n- 对比方法覆盖 164 条记录。\n\n这些数字仍需核验评测协议、人工标注一致性、召回率与误报率。",
    "evidence_notes": "",
    "code_data_status": "尚未确认公开代码和数据。",
    "limitations": "- 固定低层专家的错误会限制上层验证器。\n- 三值判断不能完全描述复杂、连续或多义的物理违规。\n- 物理规则编译质量决定最终覆盖范围。\n\n### 与知域的关系\n\n该工作为知域的物理世界模型、Causal-JEPA、世界模型可靠性和生成视频评测提供了可操作的验证框架。",
    "comments": "",
    "source_reports": [
      "report-0d81d19c6c"
    ],
    "deleted": false,
    "updated_at": "2026-09-08",
    "arxiv": {
      "published": "2026-09-02T20:36:45Z",
      "revised_at": "2026-09-02T20:36:45Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "arxiv": {
      "published": "2026-03-27T16:57:51Z",
      "revised_at": "2026-07-11T20:08:28Z",
      "primary_category": "cs.CV"
    },
    "arxiv_id": "2603.26599",
    "authors": [
      "Zhaochong An",
      "Orest Kupyn",
      "Theo Uscidda",
      "Andrea Colaco",
      "Karan Ahuja",
      "Serge Belongie",
      "Mar Gonzalez-Franco",
      "Marta Tintore Gazulla"
    ],
    "code_data_status": "- **项目页**：提供 arXiv paper 和大量 qualitative comparisons。\n- **代码/模型**：截至本次检索，项目页未显示公开 GitHub / model weights 链接；arXiv 摘要页也未声明代码开放。置信度：中等，以作者后续更新为准。\n- **数据**：未发现单独开放的训练/评测数据链接；论文使用 RealEstate10K 等 benchmark 做分析。",
    "comments": "",
    "deleted": false,
    "doi": "",
    "evidence_notes": "",
    "experiments": "- VGGRPO 在 static/dynamic scenes 中都改善 camera smoothness、geometry consistency 和整体质量。\n- LGM 相比“latent -> RGB -> geometry model”的路径更抗 latent perturbation，说明 latent-space reward 减少了 RGB decoding domain gap。\n- 附录中的 VBench 表显示，VGGRPO 相比 baseline / SFT / Epipolar-DPO / VideoGPA 在 subject/background consistency、motion smoothness、image quality 等维度整体更稳。",
    "figure": {
      "url": "https://zhaochongan.github.io/projects/VGGRPO/VGGRPO_files/pipeline.png",
      "alt": "VGGRPO Fig. 2: method overview",
      "label": "VGGRPO，Fig. 2 \"Method Overview\"，。来源：原图",
      "paper_title": "VGGRPO: Towards World-Consistent Video Generation with 4D Latent Reward",
      "source_url": "https://zhaochongan.github.io/projects/VGGRPO/VGGRPO_files/pipeline.png"
    },
    "id": "arxiv-2603-26599",
    "insight": "VGGRPO 针对的是 RGB-space geometry reward 的成本和鲁棒性问题。作者认为：已有 alignment 方法常在 RGB 解码后再跑几何模型，导致反复 VAE decoding，计算贵；而 RGB-based reward 还容易受生成图像分布偏移影响。\n\n核心 insight：\n\n> 如果 video diffusion latent 已包含足够视觉信息，可以训练一个 Latent Geometry Model，把 diffusion latent 直接接到 4D geometry foundation model，从 latent 中解码 camera pose、depth、point map、scene flow，再在 latent space 做 GRPO reward。\n\n这使几何奖励不必每次回到 RGB pixel space，也能利用 4D reconstruction model 支持 dynamic scenes。",
    "limitations": "论文没有像 GeoFlow 那样集中列出详细 failure cases，但根据方法假设和实验范围，可明确区分：\n\n- **作者明确覆盖**：static + dynamic scene geometry consistency、camera smoothness、latent reward efficiency。\n- **实验未充分证明**：对细粒度物理交互、手物接触、物体可操作状态变化的建模能力。\n- **潜在局限**：\n  - 奖励质量受 LGM 和背后 geometry foundation model 上限影响；\n  - 对严重拓扑变化、细粒度非刚性接触、透明/反光物体等可能仍难；\n  - 不是 action-conditioned world model，不能直接证明“动作导致世界变化”的因果一致性。\n\n## 对 HOI world model 的启发\n\nVGGRPO 对你方向最有价值的是 **latent 4D reward**。如果你做 hand-object interaction，可以借鉴：\n\n- 不必每次 decode RGB 再算 3D reward；\n- 可训练一个 HOI Latent Geometry Model，从 video/action latents 解码 hand pose、object pose、contact map、scene flow；\n- 用 latent reward 对 video world model 做 post-training。\n\n换句话说，VGGRPO 是“4D 几何奖励怎么高效算”的参考，而不是 HOI 任务本身的解决方案。\n\n---",
    "links": {
      "paper": "https://arxiv.org/abs/2603.26599",
      "project": "https://zhaochongan.github.io/projects/VGGRPO/",
      "alphaxiv": "https://alphaxiv.org/abs/2603.26599"
    },
    "pipeline": {
      "input": "text prompt、video diffusion latents。",
      "process": "- Latent Geometry Model (LGM) ：；- 用 VAE encoder 得到 video latents；；- 通过 lightweight connector / transformer layers 接到 geometry foundation model；；- 预测 camera pose、point map、depth map、scene flow 等 4D geometry outputs；；- 用 alignment loss 保留几何 foundation model 的 4D prior。；- VGGRPO post-training ：；- video diffusion model 采样 grouped rollouts；；- LGM 直接从 denoised latents 预测几何；；- 计算 camera motion smoothness reward 与 geometry reprojection consistency reward；；- 在 latent space 中执行 GRPO 更新。",
      "output": "更 world-consistent 的 video diffusion model；论文还给出 training-free latent reward guidance 伪代码。",
      "details": "- **输入**：text prompt、video diffusion latents。\n- **Latent Geometry Model (LGM)**：\n  - 用 VAE encoder 得到 video latents；\n  - 通过 lightweight connector / transformer layers 接到 geometry foundation model；\n  - 预测 camera pose、point map、depth map、scene flow 等 4D geometry outputs；\n  - 用 alignment loss 保留几何 foundation model 的 4D prior。\n- **VGGRPO post-training**：\n  - video diffusion model 采样 grouped rollouts；\n  - LGM 直接从 denoised latents 预测几何；\n  - 计算 camera motion smoothness reward 与 geometry reprojection consistency reward；\n  - 在 latent space 中执行 GRPO 更新。\n- **输出**：更 world-consistent 的 video diffusion model；论文还给出 training-free latent reward guidance 伪代码。"
    },
    "publication": "2026",
    "source_reports": [
      "report-1818b05f33",
      "report-cedaa0825a"
    ],
    "summary": "VGGRPO 针对的是 RGB-space geometry reward 的成本和鲁棒性问题。作者认为：已有 alignment 方法常在 RGB 解码后再跑几何模型，导致反复 VAE decoding，计算贵；而 RGB-based reward 还容易受生成图像分布偏移影响。",
    "tags": [
      "3D/4D",
      "HOI",
      "强化与模仿学习",
      "机器人学习",
      "视频生成"
    ],
    "title": "VGGRPO: Towards World-Consistent Video Generation with 4D Latent Reward",
    "updated_at": "2026-08-31",
    "year": 2026
  },
  {
    "arxiv": {
      "published": "2026-08-09T08:02:49Z",
      "revised_at": "2026-08-09T08:02:49Z",
      "primary_category": "cs.RO"
    },
    "arxiv_id": "2608.08558",
    "authors": [
      "Chenhao Qiu",
      "Ruixiang Wang",
      "Runyi Zhao",
      "Sixu Lin",
      "Songen Gu",
      "Shufeng Nan",
      "Guiliang Liu",
      "Kui Jia",
      "Yanwei Fu",
      "Simo Wu"
    ],
    "code_data_status": "截至来源报告核验时，未记录可确认的官方代码、数据或模型入口；这表示开放状态待核验，不代表资源确定不存在。",
    "comments": "",
    "deleted": false,
    "doi": "",
    "evidence_notes": "",
    "experiments": "RoboTwin novel subset：Vid2WAM 54.7 clean / 55.3 random，Fast-WAM 为 45.0 / 42.8。LIBERO low-data robustness average：Fast-WAM 33.6，Vid2WAM 39.0。真机 3 个完全没有 real expert trajectory 的 novel tasks 上取得非零成功率，并优于或匹配 VLA/WAM baselines。消融显示 future latent supervision 单独有效，pseudo action 进一步提供互补收益；在线直接组合 teacher + IDM 反而更差。结论：大型 video model 最有价值的角色未必是部署时在线 rollout，而可以作为离线 world-dynamics teacher。\n\n---\n\n# 横向脉络与趋势\n\n## A. Future Prediction 的角色被重新定义\n\n早期 WAM 直觉是“先想象未来 RGB，再据此行动”。这批工作普遍把 future prediction 改写为训练期 representation learning objective：\n\n- MECo-WAM：4D geometry 只做训练期约束，推理删除。\n- GeoSem-WAM / DreamWAM：future 不只 RGB，而是 geometry、semantic、motion 等结构化状态。\n- GigaWorld-Policy-0.5 / SG-WAM / SLIM：推理时不 rollout future，只保留 action pathway。\n- Vid2WAM：future 甚至可以来自外部 video diffusion teacher，用于离线蒸馏。\n\n**趋势判断**：WAM 的核心竞争点不再是“生成多像真的视频”，而是“训练出多 action-relevant 的 predictive latent”。\n\n## B. RGB Future 被认为信息过重，Structured Supervision 变成主线\n\nRGB 同时包含任务相关状态变化与大量干扰因素。MECo-WAM、GeoSem-WAM、DreamWAM、GWM-VLA 都在往结构化监督走：\n\n- geometry：深度、点云、4D 几何、cross-view 几何。\n- semantics：DINOv2 / semantic segmentation 类 feature。\n- motion：optical flow、dynamic point map、scene flow。\n- policy-space future：让 future target 与 policy representation 同源。\n\n**趋势判断**：未来 WAM 很可能会从“video latent model”演化为“multi-view / multi-modal state transition model”。\n\n## C. 推理效率成为硬约束\n\nEfficient-WAM、GigaWorld-Policy-0.5、SG-WAM、SLIM 都强调低延迟、少参数、无推理期 world branch。机器人控制不是离线视频生成，部署时要闭环、稳定、低 latency。\n\n**趋势判断**：推理时显式生成 future video 会越来越像训练/诊断工具，而不是主流部署路径。\n\n## D. Representation 本身开始被重做\n\nEmbodiedVAE 从 tokenizer / VAE 层面重做 embodied latent；Discrete-WAM 把视觉和动作都离散化，统一编辑；SLIM 直接学习 observation-action-transition latent，不走 RGB foresight。\n\n**趋势判断**：WAM 的瓶颈不只在 DiT 或 policy head，而在“什么 latent 最适合 action”。Embodied-specific VAE、离散 vision-action token、action-grounded latent 会成为重要分支。\n\n## E. 评测从“像不像”转向“因果对不对”\n\nWorldSimProbe 强调 action-conditioned world model 必须满足 simulator contract：action 要导致 robot motion，motion/contact 要导致 environment response。它补上了现有 FVD、task success、VLM judge 的盲区。\n\n**趋势判断**：未来 ACWM / WAM 评测会更关注 action fidelity、contact grounding、interaction dynamics，而不是只看视频质量。\n\n## 总结\n\n这 13 篇论文共同指向一个清晰变化：\n\n> **World Action Model 正从“推理时生成未来视频的模型”，转向“用结构化未来监督学习动作相关世界表征的模型”。**\n\n更凝练地说：\n\n- 训练期：可以大胆使用 video、geometry、semantics、motion、4D teacher、video diffusion teacher。\n- 推理期：尽量删除 auxiliary branch，只保留快速 action pathway。\n- 表征目标：不是 photorealistic future，而是 action-grounded、geometry-aware、causally faithful 的 predictive latent。\n\n后续建议重点跟踪关键词：**structured future supervision、no-rollout WAM、action-grounded predictive latent、embodied tokenizer、simulator faithfulness**。",
    "figure": {
      "alt": "Vid2WAM method",
      "label": "Vid2WAM 蒸馏框架",
      "paper_title": "Vid2WAM: Distilling Video Diffusion Priors into World Action Models",
      "source_url": "https://arxiv.org/html/2608.08558v1/method.png",
      "url": "https://arxiv.org/html/2608.08558v1/method.png"
    },
    "id": "arxiv-2608-08558",
    "insight": "Vid2WAM 进一步追问：WAM 的 future supervision 是否一定要来自昂贵的 target-task robot expert trajectories？大型 video diffusion model 已经包含大量 world / dynamics prior。Vid2WAM 让 video foundation model 离线“想象 future”，再用 inverse dynamics model 把 visual transition 翻译成 embodiment-specific pseudo action，最后蒸馏给小 WAM。核心是 **world knowledge acquisition 与 robot expert collection 解耦**。",
    "limitations": "来源报告未单列可核验的局限、失败案例或开放问题；在补充原论文正文核验前，不对该工作的泛化性、因果性、复现性或 SOTA 结论作扩大解释。",
    "links": {
      "paper": "https://arxiv.org/abs/2608.08558",
      "project": "https://qch-fa.github.io",
      "alphaxiv": "https://alphaxiv.org/abs/2608.08558"
    },
    "pipeline": {
      "input": "- 离线输入 ：当前 observation + language instruction。",
      "process": "large video diffusion teacher 生成 task-conditioned future rollout；future rollout 直接监督 student future-video branch；同一 rollout 输入 IDM 得到 pseudo action；real demos + synthetic rollout 联合训练 student；Source-Aware Residual Action Adapter 分离 real / pseudo action distribution，降低 noisy IDM action 干扰。",
      "output": "video teacher + IDM 全部删除，只保留 compact WAM student。",
      "details": "- **离线输入**：当前 observation + language instruction。\n- **过程**：large video diffusion teacher 生成 task-conditioned future rollout；future rollout 直接监督 student future-video branch；同一 rollout 输入 IDM 得到 pseudo action；real demos + synthetic rollout 联合训练 student；Source-Aware Residual Action Adapter 分离 real / pseudo action distribution，降低 noisy IDM action 干扰。\n- **推理期输出**：video teacher + IDM 全部删除，只保留 compact WAM student。"
    },
    "publication": "arXiv 2026",
    "source_reports": [
      "report-e81e6bd3a1"
    ],
    "summary": "Vid2WAM 进一步追问：WAM 的 future supervision 是否一定要来自昂贵的 target-task robot expert trajectories？大型 video diffusion model 已经包含大量 world / dynamics prior。Vid2WAM 让 video foundation model 离线“想象 future”，再用 inverse dynamics model 把 visual transition 翻译成 embodiment-specific pseudo action，最后蒸馏给小 WAM。核心是 world knowledge acquisition 与 robot expert collection 解耦 。",
    "tags": [
      "3D/4D",
      "VLA",
      "World Action Model",
      "因果与反事实",
      "机器人学习",
      "自监督与预测表征",
      "视频生成"
    ],
    "title": "Vid2WAM: Distilling Video Diffusion Priors into World Action Models",
    "updated_at": "2026-08-20",
    "year": 2026
  },
  {
    "id": "arxiv-2608-28549",
    "title": "Video Generative Models as Geometry Learner",
    "authors": [
      "Haosen Yang",
      "Jifei Song",
      "Zhensong Zhang",
      "Xiatian Zhu",
      "Jiankang Deng"
    ],
    "year": 2026,
    "publication": "2026，ECCV 2026",
    "arxiv_id": "2608.28549",
    "doi": "10.48550/arXiv.2608.28549",
    "links": {
      "paper": "https://arxiv.org/abs/2608.28549",
      "project": "https://happy-hsy.github.io/projects/GeoNeXt/",
      "code": "https://github.com/Creative-Intelligence-Studio/GeoNeXt",
      "model": "https://huggingface.co/happy0612/GeoNeXt",
      "alphaxiv": "https://alphaxiv.org/abs/2608.28549"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "流式与自回归",
      "物理建模与仿真",
      "第一视角与人类视频",
      "视频生成",
      "跨本体迁移"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.28549v1/fig2_final.png",
      "alt": "GeoNeXt 的图像—深度—法线统一框架",
      "label": "GeoNeXt 的图像—深度—法线统一框架；来源：论文原图 · 官方项目页",
      "paper_title": "Video Generative Models as Geometry Learner",
      "source_url": "https://arxiv.org/html/2608.28549v1/fig2_final.png"
    },
    "summary": "GeoNeXt 把深度和法线视作输入图像之后的“后续帧”，利用视频扩散模型的时间注意力在图像、深度和法线之间传递结构，并沿同一去噪轨迹联合预测几何。",
    "insight": "GeoNeXt 把深度和法线视作输入图像之后的“后续帧”，利用视频扩散模型的时间注意力在图像、深度和法线之间传递结构，并沿同一去噪轨迹联合预测几何。",
    "pipeline": {
      "input": "单张 RGB。",
      "process": "冻结 VAE 将 RGB、深度和法线编码为统一 latent；复制图像 latent 作为几何槽位条件；移除原 SVD 的 CLIP 条件并微调去噪 U-Net；推理联合去噪三类 latent。",
      "output": "仿射不变深度和表面法线，可进一步构建网格。",
      "details": "**输入**：单张 RGB。\n\n**过程**：冻结 VAE 将 RGB、深度和法线编码为统一 latent；复制图像 latent 作为几何槽位条件；移除原 SVD 的 CLIP 条件并微调去噪 U-Net；推理联合去噪三类 latent。\n\n**输出**：仿射不变深度和表面法线，可进一步构建网格。"
    },
    "experiments": "训练使用约 39K Hypersim 和 20K Virtual KITTI 2 样本，并在未见深度和法线数据集测试。NYUv2、KITTI、ETH3D、ScanNet、DIODE 的 AbsRel 为 5.3、8.2、5.6、5.9、22.6，整体优于统一生成式 baseline GeoWizard，但并非每项都超过专用判别模型。",
    "evidence_notes": "",
    "code_data_status": "官方仓库已于 2026-08-31 发布推理代码，并公开 GeoNeXt-Wan 与 GeoNeXt-SVD 权重；仓库注明推理至少约需 24 GB GPU 显存。",
    "limitations": "默认结果使用 5 个去噪步骤并对 5 个随机种子 ensemble，成本高于单次判别前馈；深度为仿射不变而非公制深度；透明、反射和极端遮挡失败案例缺少系统分析。\n\n### 与知域的关系\n\n展示了生成模型与前馈几何的双向迁移，与 VGGT、SAM 3D、Gen3R、PixWorld、UniRecGen 等重建—生成统一路线直接相关。",
    "comments": "",
    "source_reports": [
      "report-0d81d19c6c"
    ],
    "deleted": false,
    "updated_at": "2026-09-08",
    "arxiv": {
      "published": "2026-08-28T17:25:31Z",
      "revised_at": "2026-08-28T17:25:31Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "arxiv": {
      "published": "2026-02-10T10:36:57Z",
      "revised_at": "2026-02-10T10:36:57Z",
      "primary_category": "cs.CV"
    },
    "arxiv_id": "2602.09638",
    "authors": [
      "Hanqing Wang",
      "Mingyu Liu",
      "Xiaoyu Chen",
      "Chengwei MA",
      "Yiming Zhong",
      "Wenti Yin",
      "Yuhao Liu",
      "Zhiqing Cui",
      "Jiahao Yuan",
      "Lu Dai",
      "Zhiyuan Ma",
      "Hui Xiong"
    ],
    "code_data_status": "截至来源报告核验时，未记录可确认的官方代码、数据或模型入口；这表示开放状态待核验，不代表资源确定不存在。",
    "comments": "",
    "deleted": false,
    "doi": "",
    "evidence_notes": "",
    "experiments": "构建 VIDA：38K HOI videos、16 affordance types、38 object categories、22K point clouds。与 3D AffordanceNet、LASO、GREAT、AGPIL 等相比，在 seen/unseen 和 open-world 泛化上更好。\n\n**对你方向的启发**\n\n- 可作为 object affordance prior，为 HOI world model 提供 action-relevant regions。\n- 但它不预测未来视频，也不维护动态世界状态。\n\n---",
    "figure": {
      "alt": "VideoAfford pipeline",
      "label": "VideoAfford pipeline",
      "paper_title": "VideoAfford: Grounding 3D Affordance from Human-Object-Interaction Videos via MLLM",
      "source_url": "https://arxiv.org/html/2602.09638v1/pipeline.png",
      "url": "https://arxiv.org/html/2602.09638v1/pipeline.png"
    },
    "id": "arxiv-2602-09638",
    "insight": "VideoAfford 关注从 HOI videos 中学习 3D affordance grounding。它认为静态图片/语言缺少交互因果线索，而视频中的 pre-contact、contact、post-contact 能揭示物体哪里可操作、如何被操作。",
    "limitations": "- 可作为 object affordance prior，为 HOI world model 提供 action-relevant regions。\n- 但它不预测未来视频，也不维护动态世界状态。\n\n---",
    "links": {
      "paper": "https://arxiv.org/abs/2602.09638",
      "alphaxiv": "https://alphaxiv.org/abs/2602.09638"
    },
    "pipeline": {
      "input": "HOI video、text instruction、3D point cloud。",
      "process": "LanguageBind 编码视频；latent action encoder 提取动作先验；3D encoder 提取 point features；video MLLM 输出 affordance token；decoder 生成 3D affordance mask；spatial-aware loss 增强空间一致性。",
      "output": "3D object affordance mask。",
      "details": "- **输入**：HOI video、text instruction、3D point cloud。\n- **过程**：LanguageBind 编码视频；latent action encoder 提取动作先验；3D encoder 提取 point features；video MLLM 输出 affordance token；decoder 生成 3D affordance mask；spatial-aware loss 增强空间一致性。\n- **输出**：3D object affordance mask。"
    },
    "publication": "arXiv 2026",
    "source_reports": [
      "report-0ad44831eb",
      "report-90041fa2f9"
    ],
    "summary": "VideoAfford 关注从 HOI videos 中学习 3D affordance grounding。它认为静态图片/语言缺少交互因果线索，而视频中的 pre-contact、contact、post-contact 能揭示物体哪里可操作、如何被操作。",
    "tags": [
      "3D/4D",
      "Agent与可执行世界",
      "HOI",
      "对象与可供性",
      "第一视角与人类视频"
    ],
    "title": "VideoAfford: Grounding 3D Affordance from Human-Object-Interaction Videos via Multimodal Large Language Model",
    "updated_at": "2026-08-23",
    "year": 2026,
    "discussion": "- 可作为 object affordance prior，为 HOI world model 提供 action-relevant regions。\n- 但它不预测未来视频，也不维护动态世界状态。\n\n---"
  },
  {
    "id": "arxiv-2607-14088",
    "title": "VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders",
    "authors": [
      "Zhihao Xie",
      "Junfeng Wu",
      "Xinting Hu",
      "Junchao Huang",
      "Li Jiang"
    ],
    "year": 2026,
    "publication": "2026，arXiv preprint，arXiv:2607.14088；DOI 待核验",
    "arxiv_id": "2607.14088",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2607.14088",
      "project": "https://zhxie0117.github.io/VideoRAE/",
      "code": "https://github.com/zhxie0117/VideoRAE",
      "model": "https://huggingface.co/papers/2607.14088",
      "alphaxiv": "https://alphaxiv.org/abs/2607.14088"
    },
    "tags": [
      "3D/4D",
      "World Action Model",
      "动作表征",
      "机器人学习",
      "自监督与预测表征",
      "视频生成"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2607.14088v1/x1.png",
      "alt": "VideoRAE Fig. 1",
      "label": "VideoRAE，Fig. 1，对比传统像素重建驱动的 3D-VAE 与冻结视频基础模型驱动的表示自编码器。来源：Fig. 1 原图",
      "paper_title": "VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders",
      "source_url": "https://arxiv.org/html/2607.14088v1/x1.png"
    },
    "summary": "作者的核心主张是：与其从零训练像素驱动的编码器，不如直接把冻结 VFM 的分层特征变成生成潜空间，使语义与宏观时空结构在生成器训练前就进入 latent。阅读判断是，这项工作主要回答“理解表征能否成为视频生成 tokenizer”，并不证明该 latent 自动获得可控物理状态、因果变量或机器人动作语义。",
    "insight": "作者的核心主张是：与其从零训练像素驱动的编码器，不如直接把冻结 VFM 的分层特征变成生成潜空间，使语义与宏观时空结构在生成器训练前就进入 latent。阅读判断是，这项工作主要回答“理解表征能否成为视频生成 tokenizer”，并不证明该 latent 自动获得可控物理状态、因果变量或机器人动作语义。",
    "pipeline": {
      "input": "视频片段，以及冻结的 V-JEPA 2 或 VideoMAEv2 编码器产生的多尺度时空特征。",
      "process": "聚合 VFM 不同层级特征，以轻量 1D self-attention projector 压缩；连续分支直接服务 DiT，离散分支用 multi-codebook high-dimensional SimVQ 量化；解码器以像素重建、LPIPS、GAN 及局部—全局 representation alignment（REPA）联合训练，连续分支不依赖 KL 正则。",
      "output": "可重建视频的连续 latent 或离散 token，并供扩散式或自回归式视频生成器使用。",
      "details": "- **输入：** 视频片段，以及冻结的 V-JEPA 2 或 VideoMAEv2 编码器产生的多尺度时空特征。\n- **过程：** 聚合 VFM 不同层级特征，以轻量 1D self-attention projector 压缩；连续分支直接服务 DiT，离散分支用 multi-codebook high-dimensional SimVQ 量化；解码器以像素重建、LPIPS、GAN 及局部—全局 representation alignment（REPA）联合训练，连续分支不依赖 KL 正则。\n- **输出：** 可重建视频的连续 latent 或离散 token，并供扩散式或自回归式视频生成器使用。"
    },
    "experiments": "作者在 UCF-101 与 TokenBench 上评估重建，在 UCF-101 上评估类别条件生成，并做 2B 规模文本到视频替换实验。离散 V-JEPA 2 版本在 UCF-101 / TokenBench 获得 rFVD 13 / 28；UCF-101 类别条件生成中，AR 与 DiT 分支分别报告 gFVD 40 与 93。与 LARP 的受控训练曲线相比，VideoRAE 在 400 epoch 达到相近于 LARP 2000 epoch 的 gFVD，支持论文所称约 5 倍收敛加速，但这不是端到端训练成本或跨数据集速度定律。REPA 消融把连续/离散 gFVD 分别从 105/67 降到 93/40；多尺度层 8–24 配置报告 PSNR 29.39、gFVD 40。实验支持“VFM latent 对所测视频生成设置有效”，尚不能外推到具身控制或真实世界因果动力学。",
    "evidence_notes": "",
    "code_data_status": "官方项目页与 GitHub 仓库可访问，仓库标注 MIT License；当前公开内容与权重、训练配置的完整可复现程度仍应以实际 release 文件逐项核验。实验使用 UCF-101、TokenBench、Kinetics-600 等数据，完整文本到视频训练数据组成和许可边界需回到仓库说明核验。",
    "limitations": "- 主要结果来自视频重建和生成基准，没有动作控制或真实交互验证。\n- 与工业级 VAE 的训练数据、算力和预训练来源不完全等价，SOTA 表述只适用于论文给定协议。\n- 约 5 倍是特定收敛曲线比较，不能解释为所有训练流程或推理均加速 5 倍。\n- frozen VFM 的语义偏差、训练数据覆盖及跨领域迁移失败尚未系统展开。\n- 2B 文生视频替换实验支持相对收敛优势，但不足以建立更大模型规模下的普遍规律。",
    "comments": "",
    "source_reports": [
      "report-89efbb2378"
    ],
    "deleted": false,
    "updated_at": "2026-08-26",
    "challenges": "视频生成通常在 3D-VAE 或离散 tokenizer 的压缩空间中训练，但这些编码器主要优化像素重建和对抗损失，可能弱化高层语义及长时空结构，迫使后续生成器重新学习复杂动态。另一方面，V-JEPA 2、VideoMAEv2 等视频基础模型具有强理解表征，但冻结特征能否同时做到高压缩、可重建且适合自回归和扩散生成，此前缺少系统验证。",
    "motivation": "作者的核心主张是：与其从零训练像素驱动的编码器，不如直接把冻结 VFM 的分层特征变成生成潜空间，使语义与宏观时空结构在生成器训练前就进入 latent。阅读判断是，这项工作主要回答“理解表征能否成为视频生成 tokenizer”，并不证明该 latent 自动获得可控物理状态、因果变量或机器人动作语义。",
    "technical_approach": "- **输入：** 视频片段，以及冻结的 V-JEPA 2 或 VideoMAEv2 编码器产生的多尺度时空特征。\n- **过程：** 聚合 VFM 不同层级特征，以轻量 1D self-attention projector 压缩；连续分支直接服务 DiT，离散分支用 multi-codebook high-dimensional SimVQ 量化；解码器以像素重建、LPIPS、GAN 及局部—全局 representation alignment（REPA）联合训练，连续分支不依赖 KL 正则。\n- **输出：** 可重建视频的连续 latent 或离散 token，并供扩散式或自回归式视频生成器使用。",
    "discussion": "VideoRAE 的实质贡献是把 frozen VFM encoder、强压缩 projector、双形态 latent 和解码侧语义对齐组合成统一 tokenizer。值得注意的是，VideoMAEv2 版本有更强像素重建，而 V-JEPA 2 版本有更好 gFVD，说明重建保真并不等同于生成友好性。对知域的直接价值在于为“共享视频表征能否同时服务理解与生成”提供可操作接口；它不是 world-action model，也没有动作条件闭环实验。",
    "arxiv": {
      "published": "2026-07-15T17:59:23Z",
      "revised_at": "2026-08-30T05:28:39Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "arxiv": {
      "published": "2026-02-10T18:58:01Z",
      "revised_at": "2026-02-14T03:00:50Z",
      "primary_category": "cs.RO"
    },
    "arxiv_id": "2602.10098",
    "authors": [
      "Jingwen Sun",
      "Wenyao Zhang",
      "Zekun Qi",
      "Shaojie Ren",
      "Zezhi Liu",
      "Hanxin Zhu",
      "Guangzhong Sun",
      "Xin Jin",
      "Zhibo Chen"
    ],
    "code_data_status": "- 代码、训练说明与 checkpoints 公开；完整数据依赖已有大型数据集。\n- 缺少多 seed/statistical uncertainty；baseline 数据预算不完全一致；真实任务少；细粒度语言 grounding 是明确失败模式；没有验证 learned latent 是否对应可干预因果变量。\n\n---",
    "comments": "",
    "deleted": false,
    "doi": "",
    "evidence_notes": "- **作者明确主张：** latent world modeling 与人类视频能增强 VLA 的 state-transition understanding 和 OOD robustness。\n- **实验实际支持：** 对 LIBERO-Plus 扰动有明显增益；原始 LIBERO 的优势非常小，且缺少方差。\n- **阅读判断：** block-causal predictor 是自回归信息约束，不是 causal discovery。该工作没有 `do`、结构图或反事实指标；应归为 predictive representation learning。",
    "experiments": "- **预训练/后训练数据：** Something-Something-v2 约 220K 人类视频、DROID 约 76K 高质量轨迹、LIBERO 约 2K expert demos；真实任务每项 100 demos。训练使用 8×A100（§4.1）。\n- **LIBERO：** 每 task 50 episodes、每 suite 500；Spatial/Object/Goal/Long 为 **96.2/99.6/97.2/95.8**，平均 **97.2**，OpenVLA-OFT **97.1**、π0.5 **96.9**（Table 1）。优势很小且未报告随机 seed/std，不能称为稳定显著领先。\n- **LIBERO-Plus：** 7 类视觉/空间扰动平均 **79.5**，OpenVLA-OFT **69.6**；去掉人类视频预训练降至 **62.9**（Table 3）。这比原始 LIBERO 更能支持“human video 改善视觉鲁棒性”。\n- **关键消融边界：** 去掉人类视频后原始 LIBERO 平均仍有 **96.1**，部分普通 benchmark 甚至不降；收益主要出现在 LIBERO-Plus，而不是所有设置普遍提升。\n- **公平性：** SimplerEnv 表中的一些 baseline 使用不同训练数据，带星号方法还使用仿真 expert demonstrations；不能把表中排名解释为严格同预算比较。",
    "figure": {
      "url": "https://arxiv.org/html/2602.10098v2/teaser1.svg",
      "alt": "VLA-JEPA Fig. 1：latent world model 与动作学习架构",
      "label": "VLA-JEPA，Fig. 1，使用未来 latent target 训练无信息泄漏的状态预测与机器人动作模型。来源：Fig. 1 原图 SVG",
      "paper_title": "VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model",
      "source_url": "https://arxiv.org/html/2602.10098v2/teaser1.svg"
    },
    "id": "arxiv-2602-10098",
    "insight": "未来帧不必生成像素，只需作为训练期 target 教 VLA 当前表示保留可预测、与动作相关的状态变化。V-JEPA2 的未来 embedding 是 teacher target；机器人推理时可以丢掉 world-model branch，只保留 VLM 与 action head，因而把世界模型当作**训练正则/表征教师**而不是在线规划器。",
    "limitations": "- 代码、训练说明与 checkpoints 公开；完整数据依赖已有大型数据集。\n- 缺少多 seed/statistical uncertainty；baseline 数据预算不完全一致；真实任务少；细粒度语言 grounding 是明确失败模式；没有验证 learned latent 是否对应可干预因果变量。\n\n---",
    "links": {
      "paper": "https://arxiv.org/abs/2602.10098",
      "project": "https://ginwind.github.io/VLA-JEPA/",
      "code": "https://github.com/ginwind/VLA-JEPA",
      "model": "https://huggingface.co/ginwind/VLA-JEPA/",
      "alphaxiv": "https://alphaxiv.org/abs/2602.10098"
    },
    "pipeline": {
      "input": "",
      "process": "",
      "output": "",
      "details": "```text\ncurrent RGB + instruction\n  -> Qwen3-VL / student tokens + latent action tokens\nfuture frames (training only)\n  -> frozen V-JEPA2 target encoder\nstudent tokens + block-causal predictor\n  -> predicted future V-JEPA2 embeddings\nrobot data: joint latent prediction loss + flow-matching action loss\ninference: current observation + language -> action chunk\n```"
    },
    "publication": "arXiv 2026；作者项目/仓库标注 ECCV 2026。ECCV 2026 将于 2026-09 举行，截至检索日 Springer/ECVA proceedings 尚未公开，因此正式出版页待补。",
    "source_reports": [
      "report-ce5d8128c6"
    ],
    "summary": "未来帧不必生成像素，只需作为训练期 target 教 VLA 当前表示保留可预测、与动作相关的状态变化。V-JEPA2 的未来 embedding 是 teacher target；机器人推理时可以丢掉 world-model branch，只保留 VLM 与 action head，因而把世界模型当作 训练正则/表征教师 而不是在线规划器。",
    "tags": [
      "VLA",
      "因果与反事实",
      "对象与可供性",
      "机器人学习"
    ],
    "title": "VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model",
    "updated_at": "2026-08-31",
    "year": 2026
  },
  {
    "id": "arxiv-2604-02296",
    "title": "VOID: Video Object and Interaction Deletion",
    "authors": [
      "Saman Motamed",
      "William Harvey",
      "Benjamin Klein",
      "Luc Van Gool",
      "Zhuoning Yuan",
      "Ta-Ying Cheng"
    ],
    "year": 2026,
    "publication": "2026，arXiv preprint（v1，2026-04-02）；arXiv:2604.02296；正式 DOI 未见",
    "arxiv_id": "2604.02296",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2604.02296",
      "project": "https://void-model.github.io/",
      "code": "https://github.com/Netflix/void-model",
      "alphaxiv": "https://alphaxiv.org/abs/2604.02296"
    },
    "tags": [
      "世界模型",
      "因果与反事实",
      "物理建模与仿真"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2604.02296v1/void.jpg",
      "alt": "VOID Fig. 3",
      "label": "VOID，Fig. 3，方法总览：从目标对象定位、移除到交互补全与背景修复。来源：Fig. 3 原图",
      "paper_title": "VOID: Video Object and Interaction Deletion",
      "source_url": "https://arxiv.org/html/2604.02296v1/void.jpg"
    },
    "summary": "作者把对象删除改写为有成对监督的 counterfactual editing：保持其他初始条件不变，在模拟器中移除目标对象并重新运行。核心差异是同时删除对象及其 interaction effects。这里的“反事实”有明确的配对重模拟语义，但真实视频阶段没有事实反事实真值，依赖生成先验与 VLM 推断 affected regions。",
    "insight": "作者把对象删除改写为有成对监督的 counterfactual editing：保持其他初始条件不变，在模拟器中移除目标对象并重新运行。核心差异是同时删除对象及其 interaction effects。这里的“反事实”有明确的配对重模拟语义，但真实视频阶段没有事实反事实真值，依赖生成先验与 VLM 推断 affected regions。",
    "pipeline": {
      "input": "原视频、用户点击得到的目标对象时序 mask",
      "process": "用 Kubric/HUMOTO 构造有/无目标对象的配对视频；VLM 与分割模型扩展出 object/effect/overlap/unaffected 四区 quadmask；CogVideoX-Fun-5B 首轮生成替代轨迹，必要时以首轮 optical flow 构造 warped noise 做第二轮结构稳定",
      "output": "删除目标对象及其下游物理交互后的 counterfactual video",
      "details": "- **输入：** 原视频、用户点击得到的目标对象时序 mask\n- **过程：** 用 Kubric/HUMOTO 构造有/无目标对象的配对视频；VLM 与分割模型扩展出 object/effect/overlap/unaffected 四区 quadmask；CogVideoX-Fun-5B 首轮生成替代轨迹，必要时以首轮 optical flow 构造 warped noise 做第二轮结构稳定\n- **输出：** 删除目标对象及其下游物理交互后的 counterfactual video"
    },
    "experiments": "训练数据含约 1,900 对 Kubric 刚体视频和约 4,500 对 HUMOTO 人–物交互视频；测试含 75 个真实视频和 30 个合成视频。25 名参与者各评 5 个场景，共 125 次比较，VOID 获 64.8% 首选，Runway 为 18.4%，Generative Omnimatte 为 11.2%。三种 VLM judge 也把 VOID 总分列为最高。证据支持它优于所测 removal/editing baselines；真实数据没有 ground-truth counterfactual，不能将偏好分数解释成动力学准确率。",
    "evidence_notes": "",
    "code_data_status": "官方 Netflix 代码公开；仓库标明基于 CogVideoX-Fun、Generative Omnimatte、Kubric 和 HUMOTO。论文为 CC BY 4.0；代码仓库的具体许可证、训练对下载方式及第三方权重条款仍应在复现前逐项核对。",
    "limitations": "- 真实视频无成对真值，VLM judge 与人类偏好可能奖励视觉合理而非真实因果结果。\n- 首轮新运动会弯曲、拉伸或漂移，第二轮只是缓解而非消除。\n- affected-region 推断错误会直接限制结果。\n- 训练干预主要是“删除对象”，不覆盖连续力、属性或机制干预。",
    "comments": "",
    "source_reports": [
      "report-d2be249044"
    ],
    "deleted": false,
    "updated_at": "2026-09-03",
    "challenges": "传统 video object removal 能补背景、阴影和反射，却不会重写被删除对象造成的下游碰撞、支撑或人体操控。例如移除多米诺骨牌中段后，后续骨牌不应继续倒下；这要求生成新的动力学，而不是空间补洞。",
    "motivation": "作者把对象删除改写为有成对监督的 counterfactual editing：保持其他初始条件不变，在模拟器中移除目标对象并重新运行。核心差异是同时删除对象及其 interaction effects。这里的“反事实”有明确的配对重模拟语义，但真实视频阶段没有事实反事实真值，依赖生成先验与 VLM 推断 affected regions。",
    "technical_approach": "- **输入：** 原视频、用户点击得到的目标对象时序 mask\n- **过程：** 用 Kubric/HUMOTO 构造有/无目标对象的配对视频；VLM 与分割模型扩展出 object/effect/overlap/unaffected 四区 quadmask；CogVideoX-Fun-5B 首轮生成替代轨迹，必要时以首轮 optical flow 构造 warped noise 做第二轮结构稳定\n- **输出：** 删除目标对象及其下游物理交互后的 counterfactual video",
    "discussion": "VOID 是列表中最明确使用 paired counterfactual supervision 的工作，也是与 HOI 因果编辑最直接的相邻论文。它能处理支撑消失、碰撞阻断和移除操作者，但反事实机制主要由模拟配对、VLM mask 和视频先验共同实现，没有显式恢复 SCM 或物理参数。",
    "arxiv": {
      "published": "2026-04-02T17:36:53Z",
      "revised_at": "2026-04-02T17:36:53Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2606-07723",
    "title": "VoLo: A Physical Orchestrator for Open-Vocabulary Long-Horizon Manipulation",
    "authors": [
      "Siyi Chen",
      "Hugo Hadfield",
      "Alex Zook",
      "Mikaela Angelina Uy",
      "Chan Hee Song",
      "Erwin Coumans",
      "Xuning Yang",
      "Faisal Ladhak",
      "Qing Qu",
      "Stan Birchfield",
      "Jonathan Tremblay",
      "Valts Blukis"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本",
    "arxiv_id": "2606.07723",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2606.07723",
      "project": "https://chicychen.github.io/VoLo/",
      "code": "https://github.com/NVlabs/VoLoAgent",
      "data": "https://github.com/NVlabs/RoboVoLo",
      "alphaxiv": "https://alphaxiv.org/abs/2606.07723"
    },
    "tags": [
      "Agent与可执行世界",
      "World Action Model",
      "机器人学习",
      "长时记忆"
    ],
    "figure": {
      "url": "content/images/2606.07723-main.webp",
      "alt": "Figure 3：规划、监视、工具路由和失败恢复组成异步机器人执行闭环",
      "label": "Figure 3 · 规划、监视、工具路由和失败恢复组成异步机器人执行闭环",
      "paper_title": "VoLo: A Physical Orchestrator for Open-Vocabulary Long-Horizon Manipulation",
      "source_url": "https://arxiv.org/html/2606.07723v1/system.png"
    },
    "summary": "VoLo 将 VLA/WAM 当成可中断的工具，与分割、抓取和放置工具一起由 VLM 调度。论文名为 VoLo，系统和官方仓库名为 VoLoAgent；它研究的是物理环境中的能力编排，不是新训练一个视频世界模型。",
    "insight": "VoLo 将 VLA/WAM 当成可中断的工具，与分割、抓取和放置工具一起由 VLM 调度。论文名为 VoLo，系统和官方仓库名为 VoLoAgent；它研究的是物理环境中的能力编排，不是新训练一个视频世界模型。",
    "pipeline": {
      "input": "开放词汇指令、相机观察、当前子目标、执行反馈与外部记忆。",
      "process": "拆解子任务后异步运行 VLA；短上下文监控器约 0.2 Hz 检查进展，在 continue、next subgoal、recovery 中选择；恢复阶段暂停活动工具，调用更完整记忆，选择重规划、改写 VLA 指令或感知驱动的 grasp/place。",
      "output": "机器人动作、工具切换和更新后的任务状态。",
      "details": "**过程**：拆解子任务后异步运行 VLA；短上下文监控器约 0.2 Hz 检查进展，在 continue、next subgoal、recovery 中选择；恢复阶段暂停活动工具，调用更完整记忆，选择重规划、改写 VLA 指令或感知驱动的 grasp/place。\n\n- **输入**：开放词汇指令、相机观察、当前子目标、执行反馈与外部记忆。\n- **过程**：拆解子任务后异步运行 VLA；短上下文监控器约 0.2 Hz 检查进展，在 continue、next_subgoal、recovery 中选择；恢复阶段暂停活动工具，调用更完整记忆，选择重规划、改写 VLA 指令或感知驱动的 grasp/place。\n- **输出**：机器人动作、工具切换和更新后的任务状态。\n\n工具族包含 π0.5/DreamZero 等动作模型、SAM3/Molmo2 等感知模型，以及结合 GraspGen 与 IK 的动作原语。快速监控与完整思考上下文分离，降低每轮推理负担。抓取原语即使没有完全成功，也可能把末端带到更合适的位置，让 VLA 接续完成。[方法 §4](https://arxiv.org/html/2606.07723#S4)\n\n### 方法细节与实现\n\n**系统层次。**VoLoAgent 将长任务分解、工具路由、执行监视和失败恢复放在同一个调度循环中。底层工具既包括 VLA/WAM，也包括感知模型、抓取与放置原语和运动规划器；因此高层输出是“调用哪个技能、给什么目标、是否中止”，而非直接回归每个关节的连续控制。\n\n**闭环运行。**初始计划和最终目标写入记忆，执行中的监视器约以 0.2 Hz 检查进展。底层动作异步运行时，高层仍可根据画面判断任务进度，打断失败行为、更新剩余子任务并切换工具。失败恢复不是简单重复原指令，而是结合当前物体状态重新选择操作路径。\n\n**为什么要保留多种工具。**开放词汇任务同时包含语义识别、几何可达性和接触控制，单一 VLA 并不在每个环节占优。该工作检验的是系统编排能否扩大现有技能的任务覆盖；不同感知、控制工具提供的先验和可用信息，也属于系统能力的一部分，不能把最终成绩解释成某一个端到端策略的能力。\n\n[对应方法原文](https://arxiv.org/html/2606.07723#S3)"
    },
    "experiments": "RoboVoLo 覆盖常识、记忆、复杂指代、世界知识四个套件，15 类、126 个任务，每任务 3 次。表 2 中完整系统成功率为 41.80%，纯 π0.5 为 12.57%，Only VLA 编排为 34.97%，No VLA 为 17.76%，支持工具互补和编排的价值。\n\n真实 Franka FR3 使用 14 任务×3 次：完整系统 42.9%，纯 π0.5 为 14.3%。但 No VLA 为 45.2%、Only VLA 为 40.5%，置信区间高度重叠；不能据此声称实机上全工具组合显著超过全部消融。[实验 §5](https://arxiv.org/html/2606.07723#S5)\n\n**评估单位与代价。**RoboVoLo 的 126 个任务覆盖 15 类操作、4 个测试套件，每任务进行 3 次试验。实机只有 14 个任务、每任务 3 次试验，完整系统 42.9% 与去除 VLA 后的 45.2% 接近，置信区间重叠。模拟中的明显收益与实机中不稳定的模块收益应分别报告；0.2 Hz 是高层监视频率，不是机器人底层控制频率。\n\n[实验与设置原文](https://arxiv.org/html/2606.07723)",
    "evidence_notes": "已核验原文方法、实验与局限；以下数值为作者报告，分析另行标注",
    "code_data_status": "[NVlabs/VoLoAgent](https://github.com/NVlabs/VoLoAgent) 已公开编排代码；[RoboVoLo](https://github.com/NVlabs/RoboVoLo) 提供 126 个 RoboLab 任务与场景资产入口，要求 RoboLab v0.3.0。仓库 README 描述了 ground-truth failure detection 支持，复现实验需区分模拟器诊断/恢复信号与真实视觉监控设置。",
    "limitations": "云端 VLM 每次调用约 1–5 秒，可能错过快速失败；完成判断仍是主要错误源。验证主要针对单臂平行夹爪；其他本体不能仅靠“暂停手臂”实现安全等待。真实实验规模不足以精确区分多个编排变体。",
    "comments": "",
    "source_reports": [],
    "deleted": false,
    "updated_at": "2026-09-24",
    "challenges": "长程开放词汇操作同时需要理解复杂指令、追踪已完成状态、执行接触技能和恢复错误。固定的“VLM 规划 → VLA 执行”层级，往往无法在动作执行中切换能力；真实机器人也不会在模型思考时自动暂停环境。",
    "motivation": "VoLo 将 VLA/WAM 当成可中断的工具，与分割、抓取和放置工具一起由 VLM 调度。论文名为 VoLo，系统和官方仓库名为 VoLoAgent；它研究的是物理环境中的能力编排，不是新训练一个视频世界模型。",
    "technical_approach": "**过程**：拆解子任务后异步运行 VLA；短上下文监控器约 0.2 Hz 检查进展，在 continue、next subgoal、recovery 中选择；恢复阶段暂停活动工具，调用更完整记忆，选择重规划、改写 VLA 指令或感知驱动的 grasp/place。\n\n- **输入**：开放词汇指令、相机观察、当前子目标、执行反馈与外部记忆。\n- **过程**：拆解子任务后异步运行 VLA；短上下文监控器约 0.2 Hz 检查进展，在 continue、next_subgoal、recovery 中选择；恢复阶段暂停活动工具，调用更完整记忆，选择重规划、改写 VLA 指令或感知驱动的 grasp/place。\n- **输出**：机器人动作、工具切换和更新后的任务状态。\n\n工具族包含 π0.5/DreamZero 等动作模型、SAM3/Molmo2 等感知模型，以及结合 GraspGen 与 IK 的动作原语。快速监控与完整思考上下文分离，降低每轮推理负担。抓取原语即使没有完全成功，也可能把末端带到更合适的位置，让 VLA 接续完成。[方法 §4](https://arxiv.org/html/2606.07723#S4)\n\n### 方法细节与实现\n\n**系统层次。**VoLoAgent 将长任务分解、工具路由、执行监视和失败恢复放在同一个调度循环中。底层工具既包括 VLA/WAM，也包括感知模型、抓取与放置原语和运动规划器；因此高层输出是“调用哪个技能、给什么目标、是否中止”，而非直接回归每个关节的连续控制。\n\n**闭环运行。**初始计划和最终目标写入记忆，执行中的监视器约以 0.2 Hz 检查进展。底层动作异步运行时，高层仍可根据画面判断任务进度，打断失败行为、更新剩余子任务并切换工具。失败恢复不是简单重复原指令，而是结合当前物体状态重新选择操作路径。\n\n**为什么要保留多种工具。**开放词汇任务同时包含语义识别、几何可达性和接触控制，单一 VLA 并不在每个环节占优。该工作检验的是系统编排能否扩大现有技能的任务覆盖；不同感知、控制工具提供的先验和可用信息，也属于系统能力的一部分，不能把最终成绩解释成某一个端到端策略的能力。\n\n[对应方法原文](https://arxiv.org/html/2606.07723#S3)",
    "discussion": "**阅读者分析**：适合把已有 WAM 接入长程 Agent，尤其是失败检测和恢复。这里的长期记忆主要是任务/执行记忆；它并不显式维护可渲染 4D 世界。比较时应报告底层策略、感知工具、特权信号和整套系统预算。",
    "arxiv": {
      "published": "2026-06-05",
      "revised_at": "",
      "primary_category": "cs.RO"
    },
    "source_papers": [
      "content/papers/2606.07723.md"
    ]
  },
  {
    "id": "arxiv-2608-26239",
    "title": "WALL-SS: Scaling Long-horizon World Models via Next-Scale Autoregression",
    "authors": [
      "Maeve Zhang",
      "Rain Sun",
      "Xiang Wang",
      "Cyril Zhang",
      "Shalfun Li",
      "Meng Cao",
      "Howard Lu",
      "Ethan Chen",
      "Harry Jhou",
      "KZ Zheng",
      "Lights Shi",
      "Regis Cheng",
      "Lorenzin",
      "Robert Wang",
      "Victor Yao",
      "Gody Li",
      "Elise Mon",
      "Yohann Tang",
      "Ryan Yu",
      "PS Zhang",
      "Vincent Chen",
      "Hang Su",
      "Roy Gan",
      "Hao Wang",
      "Qian Wang"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本（首发 2026-08-26）",
    "arxiv_id": "2608.26239",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.26239",
      "alphaxiv": "https://alphaxiv.org/abs/2608.26239"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "机器人学习",
      "流式与自回归",
      "第一视角与人类视频",
      "长时记忆"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.26239v1/overview.png",
      "alt": "WALL-SS: Scaling Long-horizon World Models via Next-Scale Autoregression 代表图",
      "label": "Figure 1 : Overview of WALL-SS . WALL-SS learns action-grounded visual dynamics from heterogeneous robot and UMI demonstrations. Given a task instruction, an initial multi-view observation, and prescribed robot actions, the model generates visual futures through coarse-to-fine next-scale autoregression and propagates state over streaming time using bounded time–scale memory. Generated observations can be recursively… 来源：论文图",
      "paper_title": "WALL-SS: Scaling Long-horizon World Models via Next-Scale Autoregression",
      "source_url": "https://arxiv.org/html/2608.26239v1/overview.png"
    },
    "summary": "机器人世界模型的统一生成式表述应把动作与后果关联、支持灵活视界与连续交互、并支持奖励驱动优化；但 clip 级未来预测做不到。WALL-SS 用 尺度级自回归（Scale-wise Autoregressive Scaling） 生成视觉未来：把具身轨迹表示为时间上交错的观测与动作的因果序列，让动作依赖的状态转移显式、天然支持变长生成、经可复用因果状态的流式扩展、以及经序列概率的直接优化。为支撑长视界，每个未来观测按 coarse-to-fine 生成，同层级内配三个组件：action-conditioned next-scale prediction（尺度对齐动作表示注入）、跨尺度 action injection、尺度级 residual diffusion。",
    "insight": "机器人世界模型的统一生成式表述应把动作与后果关联、支持灵活视界与连续交互、并支持奖励驱动优化；但 clip 级未来预测做不到。WALL-SS 用**尺度级自回归（Scale-wise Autoregressive Scaling）**生成视觉未来：把具身轨迹表示为时间上交错的观测与动作的因果序列，让动作依赖的状态转移显式、天然支持变长生成、经可复用因果状态的流式扩展、以及经序列概率的直接优化。为支撑长视界，每个未来观测按 coarse-to-fine 生成，同层级内配三个组件：action-conditioned next-scale prediction（尺度对齐动作表示注入）、跨尺度 action injection、尺度级 residual diffusion。",
    "pipeline": {
      "input": "观测 + 动作序列（交错的因果轨迹）。",
      "process": "动作条件 next-scale 预测（coarse→fine）→ 跨尺度 action 注入 → 尺度级 residual diffusion → 可复用因果状态流式扩展。",
      "output": "长视界、动作可控的未来视觉流。",
      "details": "**输入**：观测 + 动作序列（交错的因果轨迹）。\n**过程**：动作条件 next-scale 预测（coarse→fine）→ 跨尺度 action 注入 → 尺度级 residual diffusion → 可复用因果状态流式扩展。\n**输出**：长视界、动作可控的未来视觉流。"
    },
    "experiments": "仅摘要核验：报告动作-未来耦合改善与长视界有效性。证据等级：仅摘要；数字与消融待全文。",
    "evidence_notes": "",
    "code_data_status": "未公开。",
    "limitations": "- 尺度层级数量与计算成本；\n- 流式扩展下的记忆/状态复用误差；\n- 与 action-conditioned 扩散主线的系统性对比。\n\n### 与知域的关系\n与知域 DA-WAM、Discrete-WAM、minWM 的\"变长/流式长视界世界模型\"主线一致，其\"尺度级自回归 + 可复用因果状态\"是对流式生成的又一设计，建议并入流式/长视界专题。",
    "comments": "",
    "source_reports": [
      "report-a141624b1e"
    ],
    "deleted": false,
    "updated_at": "2026-08-31",
    "arxiv": {
      "published": "2026-08-26T17:57:12Z",
      "revised_at": "2026-08-26T17:57:12Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2608-22364",
    "title": "WAM-OPD: On-Policy Distillation for World Action Models",
    "authors": [
      "Liuhaichen Yang",
      "Zhuang Jiang",
      "Chenchao Sheng",
      "Zezhi Tang"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本（首发 2026-08-23）",
    "arxiv_id": "2608.22364",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.22364",
      "alphaxiv": "https://alphaxiv.org/abs/2608.22364"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "流式与自回归",
      "第一视角与人类视频",
      "长时记忆"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.22364v1/figures/wam_opd_method_v0.png",
      "alt": "WAM-OPD: On-Policy Distillation for World Action Models 代表图",
      "label": "Figure 1 : Overview of WAM-OPD . The student alone acts in the environment and determines the history distribution. A frozen teacher labels each student history with coherent video and action targets. The student action branch consumes its own stop-gradient video plan, matching deployment. Video, action, and flow-matching losses update only JointLoRA parameters in the shared student blocks. The precise objective is g… 来源：论文图",
      "paper_title": "WAM-OPD: On-Policy Distillation for World Action Models",
      "source_url": "https://arxiv.org/html/2608.22364v1/figures/wam_opd_method_v0.png"
    },
    "summary": "WAM 加速蒸馏时学生可能丢失任务能力，并随后遇到离线数据覆盖差的状态。WAM-OPD 研究能否用 on-policy 蒸馏（OPD） 修复学生而不依赖稀疏奖励强化学习：学生进入环境执行、决定历史分布；冻结教师为学生历史打上一致的视频与动作目标；学生动作分支在自己的生成视频下训练——让蒸馏分布与部署分布一致。",
    "insight": "WAM 加速蒸馏时学生可能丢失任务能力，并随后遇到离线数据覆盖差的状态。WAM-OPD 研究能否用 **on-policy 蒸馏（OPD）** 修复学生而不依赖稀疏奖励强化学习：学生进入环境执行、决定历史分布；冻结教师为学生历史打上一致的视频与动作目标；学生动作分支在自己的生成视频下训练——让蒸馏分布与部署分布一致。",
    "pipeline": {
      "input": "离线数据（初始）+ 学生部署时采集的历史。",
      "process": "学生 on-policy 执行 → 冻结教师标注学生历史（视频+动作目标）→ 学生动作分支在自生成视频预测下训练 → 部署一致性提升。",
      "output": "被 OPD 修复的加速学生 WAM。",
      "details": "**输入**：离线数据（初始）+ 学生部署时采集的历史。\n**过程**：学生 on-policy 执行 → 冻结教师标注学生历史（视频+动作目标）→ 学生动作分支在自生成视频预测下训练 → 部署一致性提升。\n**输出**：被 OPD 修复的加速学生 WAM。"
    },
    "experiments": "摘要层面：报告 OPD 可在不引入稀疏奖励 RL 下修复蒸馏学生。证据等级：仅摘要核验；样本量与环境数待全文确认。",
    "evidence_notes": "",
    "code_data_status": "未公开。",
    "limitations": "- 教师标注质量决定上限；\n- on-policy 收集的安全与成本；\n- 与稀疏奖励 RL 路线的系统对比。\n\n### 与知域的关系\n属于 WAM 训练配方分支（蒸馏/对齐），与已收录 Self Forcing、Causal Forcing 的蒸馏主线互补，是\"部署一致性蒸馏\"的新证据。",
    "comments": "",
    "source_reports": [
      "report-a141624b1e"
    ],
    "deleted": false,
    "updated_at": "2026-08-31",
    "arxiv": {
      "published": "2026-08-23T11:06:45Z",
      "revised_at": "2026-08-23T11:06:45Z",
      "primary_category": "cs.AI"
    }
  },
  {
    "id": "arxiv-2608-19613",
    "title": "What Matters for Latent Actions in Robot Learning",
    "authors": [
      "Xizhou Bu",
      "Qingda Hu",
      "Lei Zhou",
      "Lingfeng Zhang",
      "Yingbo Tang",
      "Zihao Liu",
      "Xinyi Tao",
      "Zhiqiang Ma",
      "Qingqiu Huang",
      "Chufeng Tang",
      "Hongbo Wang",
      "Jing Zhang",
      "Jiayi Ma",
      "Hangjun Ye",
      "Wei Li",
      "Xiaoshuai Hao"
    ],
    "year": 2026,
    "publication": "2026，arXiv preprint，arXiv:2608.19613；DOI 待核验",
    "arxiv_id": "2608.19613",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.19613",
      "project": "https://carldegio.github.io/latent_action.github.io/",
      "code": "https://github.com/XizoB/What-Matters-for-Latent-Actions-in-Robot-Learning",
      "alphaxiv": "https://alphaxiv.org/abs/2608.19613"
    },
    "tags": [
      "VLA",
      "World Action Model",
      "动作表征",
      "因果与反事实",
      "机器人学习",
      "自监督与预测表征",
      "视频生成"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.19613v1/main.png",
      "alt": "What Matters for Latent Actions in Robot Learning Fig. 1",
      "label": "What Matters for Latent Actions in Robot Learning，Fig. 1，统一的三阶段训练与评测框架。来源：Fig. 1 原图",
      "paper_title": "What Matters for Latent Actions in Robot Learning",
      "source_url": "https://arxiv.org/html/2608.19613v1/main.png"
    },
    "summary": "作者试图把代表性 LAM 统一到同一自编码框架，在相同三阶段流程下系统比较 41 项设计选择，并检验四种代理指标。其价值是控制混杂变量后给出工程优先级，而不是提出一个单一新模块。阅读判断是，论文所说的 latent action 是从观测转移中学习的紧凑表征；其“causal leakage”指未来帧进入 IDM 造成的信息捷径，不等同于 SCM 意义的因果识别或 do(·) 干预。",
    "insight": "作者试图把代表性 LAM 统一到同一自编码框架，在相同三阶段流程下系统比较 41 项设计选择，并检验四种代理指标。其价值是控制混杂变量后给出工程优先级，而不是提出一个单一新模块。阅读判断是，论文所说的 latent action 是从观测转移中学习的紧凑表征；其“causal leakage”指未来帧进入 IDM 造成的信息捷径，不等同于 SCM 意义的因果识别或 `do(·)` 干预。",
    "pipeline": {
      "input": "Stage I 的相邻无标签视频帧，Stage II 的视频—文本数据及自动标注 latent action，Stage III 的机器人观测、语言指令和少量物理动作数据。",
      "process": "在统一 IDM–FDM / consecutive-frame-difference autoencoding 框架中比较 LAPO、LAOF、CoMo、语义差分和光流等范式，以及 AE、VAE、VQ-VAE、Sparsity、SIGReg、不同正则强度与 8–1024 维 latent；随后比较 DAP、LAP、JAP 及混合动作头，并以 Linear/MLP Probe、SSIM Gain、MSE Gain 四项代理指标关联下游结果。",
      "output": "经 latent-action 数据微调的 VLM backbone，以及在 LIBERO、LIBERO-Plus、RoboTwin2.0 和真机任务上输出物理动作的策略。",
      "details": "- **输入：** Stage I 的相邻无标签视频帧，Stage II 的视频—文本数据及自动标注 latent action，Stage III 的机器人观测、语言指令和少量物理动作数据。\n- **过程：** 在统一 IDM–FDM / consecutive-frame-difference autoencoding 框架中比较 LAPO、LAOF、CoMo、语义差分和光流等范式，以及 AE、VAE、VQ-VAE、Sparsity、SIGReg、不同正则强度与 8–1024 维 latent；随后比较 DAP、LAP、JAP 及混合动作头，并以 Linear/MLP Probe、SSIM Gain、MSE Gain 四项代理指标关联下游结果。\n- **输出：** 经 latent-action 数据微调的 VLM backbone，以及在 LIBERO、LIBERO-Plus、RoboTwin2.0 和真机任务上输出物理动作的策略。"
    },
    "experiments": "论文在三套仿真基准中统一评测 41 项选择，并在 7-DoF Franka Panda + 1-DoF UMI gripper 上验证四个任务。作者报告：原始 LAPO 仍是强基线；简单语义特征差分有竞争力，而光流质量并不稳定转化为控制性能；正则强度通常比正则类型更关键；`d_z=32` 是所测设置的较佳折中；JAP 通过并行预测 latent 与物理动作持续约束 backbone，整体优于只在预训练使用 latent 的 DAP。代理指标只适合粗筛，同维度下 FDM 重建指标总体比 probe 指标相关性更强，跨 latent 维度时相关性下降。Stage II 数据从全量的 14.5% 扩到 100% 后三套基准均改善，LIBERO-Plus 最大提升 9.0 个百分点。真机汇总中 LA-Tuned 为 317/400，基线为 259/400，即 79.25% 对 64.75%，提升 14.5 个百分点；这是受控设置中的实验事实，不代表所有 LAM 都有同等收益。",
    "evidence_notes": "",
    "code_data_status": "作者项目页和官方 GitHub 仓库均可访问，项目页提供代码入口；论文使用 LIBERO、LIBERO-Plus、RoboTwin2.0、OXE 组成的视频数据与自采真机示范。仓库许可证、全部训练权重及 59M 视频标注数据的完整可复现性仍需逐项核验。",
    "limitations": "- 结论集中在机械臂操作，尚未验证灵巧手、四足、人形或更长时程任务。\n- 41 项选择虽广，但仍受统一 backbone、数据混合和三阶段训练协议约束。\n- 代理指标对跨 latent 维度排序不可靠，不能替代完整策略评测。\n- IDM 访问未来帧存在信息捷径风险；瓶颈与正则不能保证语义可辨识或因果可解释。\n- 真机只有四项桌面任务、单一平台和固定相机视角，外部有效性有限。\n- 作者明确把更大规模野外视频和跨机器人平台泛化列为未来工作。",
    "comments": "",
    "source_reports": [
      "report-89efbb2378"
    ],
    "deleted": false,
    "updated_at": "2026-08-26",
    "challenges": "潜在动作模型常用无动作视频学习帧间转移，但现有工作在建模范式、正则、latent 维度、动作头和数据规模上各自采用不同设置，难以判断性能来自哪项设计。更实际的障碍是，下游机器人策略评测昂贵，而 probe loss 或重建误差等廉价代理指标是否能可靠预测控制成功率并未得到统一检验。",
    "motivation": "作者试图把代表性 LAM 统一到同一自编码框架，在相同三阶段流程下系统比较 41 项设计选择，并检验四种代理指标。其价值是控制混杂变量后给出工程优先级，而不是提出一个单一新模块。阅读判断是，论文所说的 latent action 是从观测转移中学习的紧凑表征；其“causal leakage”指未来帧进入 IDM 造成的信息捷径，不等同于 SCM 意义的因果识别或 `do(·)` 干预。",
    "technical_approach": "- **输入：** Stage I 的相邻无标签视频帧，Stage II 的视频—文本数据及自动标注 latent action，Stage III 的机器人观测、语言指令和少量物理动作数据。\n- **过程：** 在统一 IDM–FDM / consecutive-frame-difference autoencoding 框架中比较 LAPO、LAOF、CoMo、语义差分和光流等范式，以及 AE、VAE、VQ-VAE、Sparsity、SIGReg、不同正则强度与 8–1024 维 latent；随后比较 DAP、LAP、JAP 及混合动作头，并以 Linear/MLP Probe、SSIM Gain、MSE Gain 四项代理指标关联下游结果。\n- **输出：** 经 latent-action 数据微调的 VLM backbone，以及在 LIBERO、LIBERO-Plus、RoboTwin2.0 和真机任务上输出物理动作的策略。",
    "discussion": "这篇论文最重要的结论不是“某个新 LAM 胜出”，而是 latent action 的收益很大程度来自如何持续塑造 VLM backbone：联合 latent/physical action 目标比把 latent 当一次性预训练标签更有效。它还提醒，低 probe loss 不足以证明下游控制好，像素光流也不是更优动作表征的充分条件。对知域的意义在于提供可证伪的设计轴和统一消融模板；不能把这些相关性结果扩大成 latent action 已恢复真实因果动作变量。",
    "arxiv": {
      "published": "2026-08-20T03:54:51Z",
      "revised_at": "2026-08-20T03:54:51Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2605-27589",
    "title": "What-If World: A Causal Benchmark for General World Models in Embodied Scenarios",
    "authors": [
      "Kunlin Cai",
      "Rui Song",
      "Jinghuai Zhang",
      "Kaiyuan Zhang",
      "Pranav Bodapati",
      "Alicia Yu",
      "Fnu Suya",
      "Mohammad Rostami",
      "Jiaqi Ma",
      "Yuan Tian"
    ],
    "year": 2026,
    "publication": "2026，arXiv preprint；arXiv:2605.27589",
    "arxiv_id": "2605.27589",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2605.27589",
      "alphaxiv": "https://alphaxiv.org/abs/2605.27589"
    },
    "tags": [
      "HOI",
      "世界模型",
      "因果与反事实"
    ],
    "figure": null,
    "summary": "固定共享场景，只改变一个物理细节，以成对输出同时审查 prompt adherence、physics、environment preservation 和 outcome difference。",
    "insight": "固定共享场景，只改变一个物理细节，以成对输出同时审查 prompt adherence、physics、environment preservation 和 outcome difference。",
    "pipeline": {
      "input": "nuScenes/DROID 真实帧与仅一个物理变量不同的 319 对 prompts",
      "process": "九个视频模型分别生成成对未来，以 APEO 四维 rubric 评分",
      "output": "单视频与 paired causal/intervention-following 分数",
      "details": "- **输入：** nuScenes/DROID 真实帧与仅一个物理变量不同的 319 对 prompts\n- **过程：** 九个视频模型分别生成成对未来，以 APEO 四维 rubric 评分\n- **输出：** 单视频与 paired causal/intervention-following 分数"
    },
    "experiments": "九个模型中最高 paired score 不超过 52%，开源模型约聚集在 28%；视觉不显著的干预最低约 14.2%，显著干预可达 40.4%。结果说明单条 plausibility 会掩盖 contrastive failure。",
    "evidence_notes": "",
    "code_data_status": "论文入口可核；319 对样本、评分脚本和模型输出的最终开放状态需人工复核。",
    "limitations": "- prompt pair 与真实可执行干预存在差距。\n- APEO 含模型/人工判分成分，需审计 judge 偏差。\n- 变量 taxonomy 尚未覆盖精细 hand contact、力和对象部件状态。\n- paired intervention 仍不是完整个体反事实识别。",
    "comments": "",
    "source_reports": [],
    "deleted": false,
    "updated_at": "2026-09-02",
    "challenges": "单条视频的逼真度无法判断模型是否对一个物理变量的微小变化产生正确差异。",
    "motivation": "固定共享场景，只改变一个物理细节，以成对输出同时审查 prompt adherence、physics、environment preservation 和 outcome difference。",
    "technical_approach": "- **输入：** nuScenes/DROID 真实帧与仅一个物理变量不同的 319 对 prompts\n- **过程：** 九个视频模型分别生成成对未来，以 APEO 四维 rubric 评分\n- **输出：** 单视频与 paired causal/intervention-following 分数",
    "discussion": "它是重要负结果，但使用两次条件生成评估干预敏感性，未执行同一实例外生变量的 abduction，也不证明模型内部 SCM。对 HOI 选题而言，它设定了最低 paired-evaluation 门槛。",
    "arxiv": {
      "published": "2026-05-26T19:02:26Z",
      "revised_at": "2026-05-26T19:02:26Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2609-24839",
    "title": "When Wider Views Fail: Stress-Testing Feed-Forward 3D Reconstruction",
    "authors": [
      "Daisy Li",
      "Kyle Gao",
      "Quanyun Wu",
      "Hanna Chomko",
      "John S. Zelek",
      "Jonathan Li"
    ],
    "year": 2026,
    "publication": "2026，arXiv",
    "arxiv_id": "2609.24839",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2609.24839",
      "alphaxiv": "https://alphaxiv.org/abs/2609.24839"
    },
    "tags": [
      "3D/4D",
      "适应与泛化"
    ],
    "figure": {
      "url": "content/images/2609.24839-main.webp",
      "alt": "Figure 1：固定输入数量时，视角跨度扩大带来的全局重建差异",
      "label": "Figure 1 · 固定输入数量时，视角跨度扩大带来的全局重建差异",
      "paper_title": "When Wider Views Fail: Stress-Testing Feed-Forward 3D Reconstruction",
      "source_url": "https://arxiv.org/html/2609.24839v1/TRT.png"
    },
    "summary": "固定输入图像数量，只扩大camera angular span，测试feedforward geometry foundation model面对越来越弱view overlap时是否仍保持全局一致。",
    "insight": "固定输入图像数量，只扩大camera angular span，测试feedforward geometry foundation model面对越来越弱view overlap时是否仍保持全局一致。",
    "pipeline": {
      "input": "固定数量、不同angular span的sparse views。",
      "process": "分别送入Pi3X、VGGT、VGGT-Ω等模型 → 与pseudo-reference比较point cloud geometry。",
      "output": "3D reconstruction与F-score / Chamfer / EMD等指标。",
      "details": "**过程**：分别送入Pi3X、VGGT、VGGT-Ω等模型 → 与pseudo-reference比较point cloud geometry。\n\n**输入**：固定数量、不同angular span的sparse views。\n\n**输出**：3D reconstruction与F-score / Chamfer / EMD等指标。\n\n控制视图数量并改变角度跨度，以两个场景的伪参考点云计算 Chamfer、EMD、Precision、Recall 和 F-score。它是一项受控压力测试，不是提出新的重建网络。\n\n[原文方法](https://arxiv.org/html/2609.24839)\n\n### 方法细节与实现\n\n**受控变量。**研究固定输入图像数量，改变相机覆盖的角跨度，从 30° 逐步扩展到 360°，测试 VGGT、Pi3X 和 VGGT-Ω。这样尽量隔离“视角跨度”与“图像更多”这两个常被混淆的因素，检查模型能否将重叠较少、外观差异更大的观察整合到同一场景。\n\n**评价参照。**实验只有两个真实场景、7 个跨度和3个模型，共42个场景—跨度—模型组合；42不是场景数。重建与伪参考对齐后计算精度、完整度和 F-score，因此参考本身的误差、遮挡与对齐选择会影响绝对数值。\n\n**观察到的失败。**扩大视角可能让局部预测更丰富，却让不同区域不能在统一坐标中闭合，表现为重复结构、尺度漂移或空间断裂。结果提示局部深度与匹配质量不充分保证大跨度全局一致性；不同几何监督和训练覆盖产生的差异，仍不能从两个场景中归纳为普遍因果结论。\n\n[对应方法原文](https://arxiv.org/html/2609.24839#S3)"
    },
    "experiments": "两场景42组case中，VGGT和Pi3X随span扩大出现大幅退化和重复建筑结构，而VGGT-Ω明显稳定。例如Scene II 360°时Pi3X、VGGT、VGGT-Ω F-score分别约15.26%、9.44%、94.74%。\n\n\nScene I 的 360° F-score 为 VGGT 23.69%、Pi3X 14.87%、VGGT-Ω 86.05%；Scene II 分别为 9.44%、15.26%、94.74%。两场景趋势一致，但不能把 42 组模型/跨度评测当作 42 个独立场景。伪参考本身及阈值定义也影响绝对分数。\n\n[原文实验与表格](https://arxiv.org/html/2609.24839)\n\n**360° 的对照。**场景 I 三模型 F-score 为 23.69/14.87/86.05，场景 II 为 9.44/15.26/94.74。VGGT-Ω 在本测试显著更稳，但这些是特定场景和阈值下的分数，不是所有广视角任务的排名。更大场景集、统一训练预算和不同参考重建都应作为后续验证。\n\n[实验与设置原文](https://arxiv.org/html/2609.24839)",
    "evidence_notes": "已核验原文方法与实验；关键比较与限制见各节",
    "code_data_status": "本次未核验到可下载的官方实现、独立数据或模型权重；具体开放状态仍待核验。",
    "limitations": "场景数量非常有限，并使用pseudo-reference；因此适合作为stress-test evidence，而不是证明VGGT-Ω对所有wide-baseline场景都绝对更强。",
    "comments": "",
    "source_reports": [],
    "deleted": false,
    "updated_at": "2026-09-24",
    "challenges": "输入图像数量相同，并不意味着几何约束同样强。相机跨度增大时相邻视图重叠减少，前馈模型可能以重复结构替代真实环形布局；常规窄基线测试不容易暴露这种错误。",
    "motivation": "固定输入图像数量，只扩大camera angular span，测试feedforward geometry foundation model面对越来越弱view overlap时是否仍保持全局一致。",
    "technical_approach": "**过程**：分别送入Pi3X、VGGT、VGGT-Ω等模型 → 与pseudo-reference比较point cloud geometry。\n\n**输入**：固定数量、不同angular span的sparse views。\n\n**输出**：3D reconstruction与F-score / Chamfer / EMD等指标。\n\n控制视图数量并改变角度跨度，以两个场景的伪参考点云计算 Chamfer、EMD、Precision、Recall 和 F-score。它是一项受控压力测试，不是提出新的重建网络。\n\n[原文方法](https://arxiv.org/html/2609.24839)\n\n### 方法细节与实现\n\n**受控变量。**研究固定输入图像数量，改变相机覆盖的角跨度，从 30° 逐步扩展到 360°，测试 VGGT、Pi3X 和 VGGT-Ω。这样尽量隔离“视角跨度”与“图像更多”这两个常被混淆的因素，检查模型能否将重叠较少、外观差异更大的观察整合到同一场景。\n\n**评价参照。**实验只有两个真实场景、7 个跨度和3个模型，共42个场景—跨度—模型组合；42不是场景数。重建与伪参考对齐后计算精度、完整度和 F-score，因此参考本身的误差、遮挡与对齐选择会影响绝对数值。\n\n**观察到的失败。**扩大视角可能让局部预测更丰富，却让不同区域不能在统一坐标中闭合，表现为重复结构、尺度漂移或空间断裂。结果提示局部深度与匹配质量不充分保证大跨度全局一致性；不同几何监督和训练覆盖产生的差异，仍不能从两个场景中归纳为普遍因果结论。\n\n[对应方法原文](https://arxiv.org/html/2609.24839#S3)",
    "discussion": "**阅读者分析**：对所有基于VGGT/π³类feedforward backbone做4D HOI的工作都是重要warning：视角更多不代表geometry更可靠。",
    "arxiv": {
      "published": "2026-09-21",
      "revised_at": "",
      "primary_category": "cs.CV"
    },
    "source_papers": [
      "content/papers/2609.24839.md"
    ]
  },
  {
    "id": "arxiv-2608-22421",
    "title": "Where World Models Break: Natural-Input Failure Discovery",
    "authors": [
      "Zhanpeng Shi",
      "Zi Liang",
      "Rong Feng",
      "Shiqin Tang",
      "Xuyang Chen",
      "Hongzong Li"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本（首发 2026-08-23）",
    "arxiv_id": "2608.22421",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.22421",
      "alphaxiv": "https://alphaxiv.org/abs/2608.22421"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "流式与自回归",
      "第一视角与人类视频",
      "长时记忆"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.22421v1/aaai_fig1_failure_discovery.png",
      "alt": "Where World Models Break: Natural-Input Failure Discovery 代表图",
      "label": "Figure 1: Problem, structured search, and independent evidence. Aggregate evaluation can miss a small region of legal inputs (left). BasinLens represents legal conditions as typed coordinates, maintains the evaluated set, forms global-surrogate and typed-frontier proposal pools, and queries their merged acquisition until returning a finite-budget discovery record (center). Held-out-seed re-evaluation and fresh radius… 来源：论文图",
      "paper_title": "Where World Models Break: Natural-Input Failure Discovery",
      "source_url": "https://arxiv.org/html/2608.22421v1/aaai_fig1_failure_discovery.png"
    },
    "summary": "世界模型预测动作条件未来，其灾难性预测失败会沿控制管线传播；但既有评测用\"一般查询下良性生成的均值误差\"聚合，无法压力测试罕见/未见条件-动作组合下的灾难性崩溃。本文把 自然输入失效发现 形式化，针对这类系统性风险设计失效压力测试。",
    "insight": "世界模型预测动作条件未来，其灾难性预测失败会沿控制管线传播；但既有评测用\"一般查询下良性生成的均值误差\"聚合，无法压力测试罕见/未见条件-动作组合下的灾难性崩溃。本文把**自然输入失效发现**形式化，针对这类系统性风险设计失效压力测试。",
    "pipeline": {
      "input": "自然（非合成）输入 + 动作条件。",
      "process": "失效发现协议（采样罕见组合、灾难性阈值判定、失败归因）。",
      "output": "失效模式清单与触发条件。",
      "details": "**输入**：自然（非合成）输入 + 动作条件。\n**过程**：失效发现协议（采样罕见组合、灾难性阈值判定、失败归因）。\n**输出**：失效模式清单与触发条件。"
    },
    "experiments": "仅摘要核验；\"自然输入\"的采集与失败判据待全文。",
    "evidence_notes": "",
    "code_data_status": "未公开。",
    "limitations": "- 罕见组合的采样完备性；\n- 灾难性阈值的主观性；\n- 与 WorldEcho（off-expert 分布）的评测互补而非替代。\n\n### 与知域的关系\n与 WorldSimProbe、WorldEcho 同属\"世界模型失效诊断\"专题，为知域评测方法论补充\"灾难性失效\"视角。",
    "comments": "",
    "source_reports": [
      "report-a141624b1e"
    ],
    "deleted": false,
    "updated_at": "2026-08-31",
    "arxiv": {
      "published": "2026-08-23T13:53:15Z",
      "revised_at": "2026-08-23T13:53:15Z",
      "primary_category": "cs.AI"
    }
  },
  {
    "id": "arxiv-2609-15870",
    "title": "WLA³: World Latent Action Modeling for Semantics, Dynamics, and Kinematics",
    "authors": [
      "Peidong Liu",
      "Zhiyuan Xiang",
      "Mingyang Li",
      "Wenhao Li",
      "Jiale Zhang",
      "Jiahao Sun",
      "Jiawei Li"
    ],
    "year": 2026,
    "publication": "2026，arXiv v1，2026-09-14 提交",
    "arxiv_id": "2609.15870",
    "doi": "10.48550/arXiv.2609.15870",
    "links": {
      "paper": "https://arxiv.org/abs/2609.15870",
      "project": "https://wla-3.github.io/",
      "alphaxiv": "https://alphaxiv.org/abs/2609.15870"
    },
    "tags": [
      "World Action Model",
      "动作表征",
      "第一视角与人类视频",
      "跨本体迁移"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2609.15870v1/overview.png",
      "alt": "WLA³ Fig. 1",
      "label": "WLA³，Fig. 1，方法总览：从异构世界状态转移学习紧凑 latent action。来源：Fig. 1 原图 PNG",
      "paper_title": "WLA³: World Latent Action Modeling for Semantics, Dynamics, and Kinematics",
      "source_url": "https://arxiv.org/html/2609.15870v1/overview.png"
    },
    "summary": "核心问题是异构机器人数据和海量人类第一视角视频缺少统一、低噪声的动作标签。WLA³不尝试把所有 embodiment 的原生 action 映射到同一个机械动作空间，而是把局部时间窗口中的 世界状态变化 编码为共享 latent action，再让机器人控制头把这种共享表示与本体动作共同预测。",
    "insight": "核心问题是异构机器人数据和海量人类第一视角视频缺少统一、低噪声的动作标签。WLA³不尝试把所有 embodiment 的原生 action 映射到同一个机械动作空间，而是把局部时间窗口中的**世界状态变化**编码为共享 latent action，再让机器人控制头把这种共享表示与本体动作共同预测。\n\n最值得关注的是：它把 human-video scaling 的接口从“动作伪标签”转向“transition representation”。这与传统 action tokenizer 不同，因为 supervision 可以来自同步视觉变化以及可用的 embodiment-state change，而机器人轨迹负责把共享 latent grounding 到可执行动作。",
    "pipeline": {
      "input": "同步相机观测、人类第一视角视频，以及数据中可用的机器人/身体状态变化。",
      "process": "WLAM编码局部 world transition，形成紧凑的 32D local latent action 和更丰富的 transition feature；使用 partial-modality reconstruction 与 overlapping-window consistency 约束表示。随后这些表示分别进入 latent-action-conditioned dynamics、SLA 语义监督以及联合预测 latent action 与原生机器人控制的 action expert。",
      "output": "跨本体 latent action、世界转移表征以及对应机器人的可执行动作。",
      "details": "**输入**：同步相机观测、人类第一视角视频，以及数据中可用的机器人/身体状态变化。\n\n**过程**：WLAM编码局部 world transition，形成紧凑的 32D local latent action 和更丰富的 transition feature；使用 partial-modality reconstruction 与 overlapping-window consistency 约束表示。随后这些表示分别进入 latent-action-conditioned dynamics、SLA 语义监督以及联合预测 latent action 与原生机器人控制的 action expert。\n\n**输出**：跨本体 latent action、世界转移表征以及对应机器人的可执行动作。"
    },
    "experiments": "论文摘要报告 LARYBench 32D latent action 平均分类准确率 67.89%；六个 AgiBot G1 真实桌面任务中，WLA³平均成功率为 81.9%，\\(\\pi_{0.5}\\) 为 66.2%。训练数据从约 5K 小时增加到 20K 小时时，实机平均成功率由 57.6% 上升到 81.9%；累计消融中，基础版本 72.1%，加入 LAC-WM 后 76.3%，进一步加入 LARA 为 79.8%，最终加入 SLA 达 81.9%。\n\n官方项目还列出约 84.1K 小时聚合数据，包括约 53,874 小时 human、14,151 小时 real robot、11,676 小时 simulation 和 4,393 小时 UMI 数据。需要注意，项目页面当前显示 LARYBench headline 为 70.75%，与 arXiv 摘要的 67.89% 不一致，应等待作者澄清具体 checkpoint/评测版本。",
    "evidence_notes": "全文已核验",
    "code_data_status": "项目页已公开，但本次未核验到稳定的官方训练代码、可下载数据集或模型权重入口。项目页面的资源状态不应被等同于完整可复现发布。",
    "limitations": "实机证据集中在六个桌面操作任务，尚不足以证明 latent action 对广泛机器人本体、移动操作、长程任务或互联网规模人类视频都具有相同可迁移性。项目页和论文摘要的 latent-action 数字不一致也是当前复核时需要保留的版本风险。",
    "comments": "",
    "source_reports": [
      "report-1b1ffacf7d"
    ],
    "deleted": false,
    "updated_at": "2026-09-16",
    "challenges": "异构机器人、人类第一视角视频与 UMI 数据使用不同动作空间，缺少可跨本体共享且噪声可控的动作监督，直接映射原生机械动作难以扩展。",
    "motivation": "核心问题是异构机器人数据和海量人类第一视角视频缺少统一、低噪声的动作标签。WLA³不尝试把所有 embodiment 的原生 action 映射到同一个机械动作空间，而是把局部时间窗口中的**世界状态变化**编码为共享 latent action，再让机器人控制头把这种共享表示与本体动作共同预测。\n\n最值得关注的是：它把 human-video scaling 的接口从“动作伪标签”转向“transition representation”。这与传统 action tokenizer 不同，因为 supervision 可以来自同步视觉变化以及可用的 embodiment-state change，而机器人轨迹负责把共享 latent grounding 到可执行动作。",
    "technical_approach": "**输入**：同步相机观测、人类第一视角视频，以及数据中可用的机器人/身体状态变化。\n\n**过程**：WLAM编码局部 world transition，形成紧凑的 32D local latent action 和更丰富的 transition feature；使用 partial-modality reconstruction 与 overlapping-window consistency 约束表示。随后这些表示分别进入 latent-action-conditioned dynamics、SLA 语义监督以及联合预测 latent action 与原生机器人控制的 action expert。\n\n**输出**：跨本体 latent action、世界转移表征以及对应机器人的可执行动作。",
    "discussion": "这是本期对“**从人类视频学习具身 WAM**”最直接的工作之一。它与 A4A 的 4D affordance 路线形成有意义对照：A4A显式使用未来 3D 点运动，WLA³使用更抽象的 world-transition latent。后续研究可以直接比较这种抽象 latent 与显式 3D/4D interaction state 在跨本体可执行性上的差异。",
    "arxiv": {
      "published": "2026-09-14T16:59:00Z",
      "revised_at": "2026-09-14T16:59:00Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2609-07002",
    "title": "WM-Craftnet: World Synesthesia Model for Generalizable and Robust Dexterous In-Hand Manipulation",
    "authors": [
      "Jie Yin",
      "Zeyuan Zhao",
      "Xiaojing Tan",
      "Yang Liu",
      "Chiyu Wang",
      "Xinyang Gu"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本，v1；arXiv 作者备注称 CoRL 2026 接收",
    "arxiv_id": "2609.07002",
    "doi": "10.48550/arXiv.2609.07002",
    "links": {
      "paper": "https://arxiv.org/abs/2609.07002",
      "project": "https://wmcraftnet.github.io/",
      "alphaxiv": "https://alphaxiv.org/abs/2609.07002"
    },
    "tags": [
      "HOI",
      "世界模型",
      "触觉与灵巧操作"
    ],
    "figure": {
      "url": "content/images/2609.07002-representative.webp",
      "alt": "Figure 1",
      "label": "Figure 1",
      "paper_title": "WM-Craftnet: World Synesthesia Model for Generalizable and Robust Dexterous In-Hand Manipulation",
      "source_url": "https://arxiv.org/html/2609.07002v1#S3.F1"
    },
    "summary": "通用且鲁棒的 dexterous in-hand 操作需要从部分、噪声观测推断物体姿态、几何、接触与潜在滑动。WM-Craftnet 是 world-model-conditioned 框架：从本体感觉、深度、触觉与动作学习紧凑的 action-conditioned 潜在动态，由多模态重建与奖励预测监督。关键设计：world model 不用作潜在想象或策略优化，而是作为循环任务上下文（World Synesthesia Model, WSM）供非对称 actor-critic 策略使用。WSM 训练时从噪声深度重建干净深度目标，为真机部署提供去噪几何状态。消融显示预测性世界建模、干净深度监督与触觉接触线索共同塑造学习状态；9 物体预训练的 WSM 作为 49 物体下游策略的可复用先验。",
    "insight": "通用且鲁棒的 dexterous in-hand 操作需要从部分、噪声观测推断物体姿态、几何、接触与潜在滑动。WM-Craftnet 是 world-model-conditioned 框架：从本体感觉、深度、触觉与动作学习紧凑的 action-conditioned 潜在动态，由多模态重建与奖励预测监督。关键设计：world model 不用作潜在想象或策略优化，而是作为循环任务上下文（World Synesthesia Model, WSM）供非对称 actor-critic 策略使用。WSM 训练时从噪声深度重建干净深度目标，为真机部署提供去噪几何状态。消融显示预测性世界建模、干净深度监督与触觉接触线索共同塑造学习状态；9 物体预训练的 WSM 作为 49 物体下游策略的可复用先验。",
    "pipeline": {
      "input": "本体感觉 + 深度 + 触觉 + 动作。",
      "process": "WSM 学习 action-conditioned 潜在动态（多模态重建+奖励预测监督，深度去噪）→ 作为循环任务上下文 → 非对称 actor-critic 策略生成动作。",
      "output": "多物体 in-hand 旋转/操作策略，支持扰动恢复与 sim-to-real 迁移。",
      "details": "**输入**：本体感觉 + 深度 + 触觉 + 动作。\n**过程**：WSM 学习 action-conditioned 潜在动态（多模态重建+奖励预测监督，深度去噪）→ 作为循环任务上下文 → 非对称 actor-critic 策略生成动作。\n**输出**：多物体 in-hand 旋转/操作策略，支持扰动恢复与 sim-to-real 迁移。"
    },
    "experiments": "正文表 1 在九物体 z 轴转动中，完整 WSM 的 Return/RotR 为 753.3±3.6/1.293±0.004；从头训练为 414.3±15.7/0.742±0.012。表 2 的噪声深度监督 Return 为 708.0±3.5，完整 WSM 为 753.3±3.6，表中明确 ± 为 95% CI。训练时通过模拟器提供 clean-depth 监督；它优于噪声目标，但需要额外特权信号。全零触觉仍有 724.9 Return，提示该设置中触觉不是收益的唯一来源。 [正文实验与表格](https://arxiv.org/html/2609.07002v1)。",
    "evidence_notes": "2026-09-14 已核对 arXiv 元数据、正文主要实验与对照；未运行复现实验。",
    "code_data_status": "论文或项目列出的代码地址当前返回 404，不能认定已公开可获取代码。论文中资源发布声明保留为作者声明，数据、权重的实际可获取状态待核验。",
    "limitations": "clean-depth 训练目标来自模拟器，存在特权监督和 sim-to-real 差异；深度、循环状态与触觉的收益需通过匹配控制分别解释。",
    "comments": "",
    "source_reports": [
      "report-37b94c4145"
    ],
    "deleted": false,
    "updated_at": "2026-09-14",
    "discussion": "命中 HOI + dexterous + tactile world model 交叉点，与 DeCAL（#13）共享「触觉进入世界模型」趋势。对知域「Hand-Object Interaction World Model」专题是新证据，尤其「世界模型用作上下文而非想象」这一反直觉设计。",
    "arxiv": {
      "published": "2026-09-07T03:48:06Z",
      "revised_at": "2026-09-07T03:48:06Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2609-11548",
    "title": "World in World: Explore the World with World Models",
    "authors": [
      "Chenxi Song",
      "Yanming Yang",
      "Chi Zhang"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本，v1",
    "arxiv_id": "2609.11548",
    "doi": "10.48550/arXiv.2609.11548",
    "links": {
      "paper": "https://arxiv.org/abs/2609.11548",
      "project": "https://chenxi-song.github.io/worldinworld",
      "code": "https://github.com/Westlake-AGI-Lab/WorldinWorld",
      "alphaxiv": "https://alphaxiv.org/abs/2609.11548"
    },
    "tags": [
      "Agent与可执行世界",
      "世界模型",
      "第一视角与人类视频",
      "适应与泛化"
    ],
    "figure": {
      "url": "content/images/2609.11548-representative.webp",
      "alt": "Fig. 2",
      "label": "Fig. 2",
      "paper_title": "World in World: Explore the World with World Models",
      "source_url": "https://arxiv.org/html/2609.11548v1#S2.F2"
    },
    "summary": "自回归视频世界模型支持交互式长程探索，但灵活控制困难：从新视角探索源视频要求 rollout 与记录事件保持同步、在请求视角放置观测内容、合理补全新暴露区域、回访时恢复之前生成的外观。现有方法用任务专用模块或额外训练解决。World in World 提出训练自由的推理期接口：把异构控制证据（源视频观测、目标视角场景投影、引导新暴露区域补全的几何渲染、滚动缓存之外的检索生成状态）转换成相机与时间标注的干净视觉状态，通过冻结因果视频模型的原生 self-attention 读取。每个证据源携带 token 级支持与可用性调度；对应关系路由器处理持久点对应。",
    "insight": "自回归视频世界模型支持交互式长程探索，但灵活控制困难：从新视角探索源视频要求 rollout 与记录事件保持同步、在请求视角放置观测内容、合理补全新暴露区域、回访时恢复之前生成的外观。现有方法用任务专用模块或额外训练解决。World in World 提出训练自由的推理期接口：把异构控制证据（源视频观测、目标视角场景投影、引导新暴露区域补全的几何渲染、滚动缓存之外的检索生成状态）转换成相机与时间标注的干净视觉状态，通过冻结因果视频模型的原生 self-attention 读取。每个证据源携带 token 级支持与可用性调度；对应关系路由器处理持久点对应。",
    "pipeline": {
      "input": "源视频 + 目标相机路径/时间 + 控制证据（观测、投影、几何渲染、历史生成）。",
      "process": "证据→干净视觉状态转换（相机/时间标注）→ 对应关系路由（持久点对应）→ 冻结因果视频模型 self-attention 读取 → 自回归生成。",
      "output": "与源事件同步的新视角长程探索视频。",
      "details": "**输入**：源视频 + 目标相机路径/时间 + 控制证据（观测、投影、几何渲染、历史生成）。\n**过程**：证据→干净视觉状态转换（相机/时间标注）→ 对应关系路由（持久点对应）→ 冻结因果视频模型 self-attention 读取 → 自回归生成。\n**输出**：与源事件同步的新视角长程探索视频。"
    },
    "experiments": "正文表 1 在 DAVIS/OpenVid-1M 的相机控制重渲染中报告 VBench Overall 85.192、旋转误差 2.8326°、PSNR 23.1511；相比 UniWorld-View 的 84.295、4.1958°、22.4735，所测维度有所改善。表 2 中去掉 target-view warp 的旋转误差从 1.7823° 升到 6.1158°，说明几何条件是主要贡献之一。不同模块消融的增益并不均等；这些主要是重渲染与视角控制指标，不能替代真实机器人的长程交互验证。 [正文实验与表格](https://arxiv.org/html/2609.11548v1)。",
    "evidence_notes": "2026-09-14 已核对 arXiv 元数据、正文主要实验与对照；未运行复现实验。",
    "code_data_status": "仓库包含 wiw、lingbot_world、examples 与工具目录，可获取实现。 以上状态核验于 2026-09-14；入口和目录存在不等于已经运行复现实验。",
    "limitations": "长程相机控制、几何条件与外部证据冲突仍会累积误差；重渲染评测未验证接触可执行性。其训练自由属性说明能复用冻结骨干，不能直接推出在所有交互任务上优于训练式方法。",
    "comments": "",
    "source_reports": [
      "report-37b94c4145"
    ],
    "deleted": false,
    "updated_at": "2026-09-14",
    "discussion": "命中「交互式世界模型 + 长程一致性 + 流式生成」，与馆藏 Streaming4D、OctWorld 相关。其「控制证据调度」思想与知域「流式生成」专题直接互补。",
    "arxiv": {
      "published": "2026-09-10T13:42:26Z",
      "revised_at": "2026-09-10T13:42:26Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "arxiv": {
      "published": "2025-12-15T18:37:12Z",
      "revised_at": "2026-03-16T21:03:20Z",
      "primary_category": "cs.RO"
    },
    "arxiv_id": "2512.13644",
    "authors": [
      "Raktim Gautam Goswami",
      "Amir Bar",
      "David Fan",
      "Tsung-Yen Yang",
      "Gaoyue Zhou",
      "Prashanth Krishnamurthy",
      "Michael Rabbat",
      "Farshad Khorrami",
      "Yann LeCun"
    ],
    "code_data_status": "代码链接已记录",
    "comments": "",
    "deleted": false,
    "doi": "",
    "evidence_notes": "",
    "experiments": "训练使用 900+ 小时 human / robot data。DexWM 在 future-state prediction 上超过 text、navigation、full-body action-conditioned world models；在 Franka Panda + Allegro gripper 零样本技能迁移中，在 grasping、placing、reaching 等任务上平均超过 Diffusion Policy 50% 以上。\n\n**对你方向的启发**\n\n- 它很适合连接 human ego video 和 robot dexterous manipulation。\n- 但它不是 photorealistic video generator，而是 latent world model / planning model。\n- 可扩展方向：把 DexWM 的 3D hand action latent 与 EgoSim / EgoHOI 的 video simulator 结合。\n\n---",
    "figure": {
      "alt": "DexWM architecture",
      "label": "DexWM architecture",
      "paper_title": "DexWM: World Models for Learning Dexterous Hand-Object Interactions from Human Videos",
      "source_url": "https://arxiv.org/html/2512.13644v2/Figs/flow.png",
      "url": "https://arxiv.org/html/2512.13644v2/Figs/flow.png"
    },
    "id": "arxiv-2512-13644",
    "insight": "DexWM 认为现有 world models 的 action space 太粗，无法建模 dexterous hand-object interaction。它用从 egocentric videos 中提取的 **3D finger keypoints** 表示细粒度 dexterous actions，并学习 past latent state + hand action -> future latent state 的 dynamics。另一个 insight 是：只预测视觉 latent 不够，需要 auxiliary hand consistency loss 来约束精细手部构型。",
    "limitations": "- 它很适合连接 human ego video 和 robot dexterous manipulation。\n- 但它不是 photorealistic video generator，而是 latent world model / planning model。\n- 可扩展方向：把 DexWM 的 3D hand action latent 与 EgoSim / EgoHOI 的 video simulator 结合。\n\n---",
    "links": {
      "paper": "https://arxiv.org/abs/2512.13644",
      "project": "https://raktimgg.github.io/dexwm/",
      "code": "https://github.com/facebookresearch/dexwm",
      "alphaxiv": "https://alphaxiv.org/abs/2512.13644"
    },
    "pipeline": {
      "input": "过去图像 latent、3D hand keypoint action、camera motion。",
      "process": "DINOv2 编码图像为 latent state；DexWM predictor 根据 hand keypoints 和 camera motion 预测未来 latent state；用 hand consistency loss 约束 dexterity；训练数据包括 EgoDex 和 DROID。",
      "output": "未来 latent state；可用于 planning，并能迁移到 Franka + Allegro gripper。",
      "details": "- **输入**：过去图像 latent、3D hand keypoint action、camera motion。\n- **过程**：DINOv2 编码图像为 latent state；DexWM predictor 根据 hand keypoints 和 camera motion 预测未来 latent state；用 hand consistency loss 约束 dexterity；训练数据包括 EgoDex 和 DROID。\n- **输出**：未来 latent state；可用于 planning，并能迁移到 Franka + Allegro gripper。"
    },
    "publication": "ECCV 2026",
    "source_reports": [
      "report-0ad44831eb"
    ],
    "summary": "DexWM 认为现有 world models 的 action space 太粗，无法建模 dexterous hand-object interaction。它用从 egocentric videos 中提取的 3D finger keypoints 表示细粒度 dexterous actions，并学习 past latent state + hand action - future latent state 的 dynamics。另一个 insight 是：只预测视觉 latent 不够，需要 auxiliary hand consistency loss 来约束精细手部构型。",
    "tags": [
      "3D/4D",
      "HOI",
      "机器人学习",
      "第一视角与人类视频"
    ],
    "title": "World Models for Learning Dexterous Hand-Object Interactions from Human Videos",
    "updated_at": "2026-08-23",
    "year": 2026,
    "discussion": "- 它很适合连接 human ego video 和 robot dexterous manipulation。\n- 但它不是 photorealistic video generator，而是 latent world model / planning model。\n- 可扩展方向：把 DexWM 的 3D hand action latent 与 EgoSim / EgoHOI 的 video simulator 结合。\n\n---"
  },
  {
    "id": "arxiv-2606-13652",
    "title": "World Tracing: Generative Pixel-Aligned Geometry Beyond the Visible",
    "authors": [
      "Hao Zhang",
      "Mohamed El Banani",
      "Jen-Hao Cheng",
      "Paul Zhang",
      "Yi Hua",
      "Ben Mildenhall",
      "Christoph Lassner",
      "Narendra Ahuja",
      "Gengshan Yang"
    ],
    "year": 2026,
    "publication": "2026，World Labs Technical Report；arXiv:2606.13652v1（cs.CV，交叉列于 cs.GR，2026-06-11 提交）。未发现正式会议/期刊版本；DOI 10.48550/arXiv.2606.13652 是 arXiv/DataCite DOI，不代表同行评审出版。",
    "arxiv_id": "2606.13652",
    "doi": "10.48550/arXiv.2606.13652",
    "links": {
      "paper": "https://arxiv.org/abs/2606.13652",
      "project": "https://haoz19.github.io/world-tracing-page/",
      "code": "https://github.com/haoz19/world-tracing",
      "model": "https://huggingface.co/haoz19/object-model-6layer",
      "alphaxiv": "https://alphaxiv.org/abs/2606.13652"
    },
    "tags": [
      "3D/4D",
      "扩散与流匹配"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2606.13652v1/model_v4.png",
      "alt": "World Tracing Fig. 2: generative pixel-aligned geometry model",
      "label": "World Tracing，Fig. 2，从单张图像生成像素对齐、多层遮挡后几何的整体模型。来源：Fig. 2 原图 PNG",
      "paper_title": "World Tracing: Generative Pixel-Aligned Geometry Beyond the Visible",
      "source_url": "https://arxiv.org/html/2606.13652v1/model_v4.png"
    },
    "summary": "作者明确主张： 下游三维编辑、视角变化视频和纹理 mesh 生成真正需要的是相机坐标中既忠实又完整的几何，而不是彼此分离的 depth map 与 canonical asset。核心 Insight 是把每个输入像素对应的相机射线表示为由近到远的 (L) 个三维交点：L0 是可见表面，L1–L5 是后续遮挡表面。于是“重建”与“生成”成为同一个 (L times H times W times3) 张量中的不同层，像素对应由表示本身保证。",
    "insight": "**作者明确主张：** 下游三维编辑、视角变化视频和纹理 mesh 生成真正需要的是相机坐标中既忠实又完整的几何，而不是彼此分离的 depth map 与 canonical asset。核心 Insight 是把每个输入像素对应的相机射线表示为由近到远的 (L) 个三维交点：L0 是可见表面，L1–L5 是后续遮挡表面。于是“重建”与“生成”成为同一个 (L\\times H\\times W\\times3) 张量中的不同层，像素对应由表示本身保证。\n\n这一选择同时改变了三个接口：\n\n- **表征接口：** 从每像素一个深度/点或规范坐标 mesh，改成相机坐标、多层、像素对齐 XYZ pointmaps；无需把相机内参作为输入，必要时可从 L0 的像素—点对应闭式拟合自洽内参。\n- **监督接口：** 对没有第 (L) 个真实交点的射线，用最近的前一有效交点前向填充，取消逐层有效性分类头；单层 RGB-D 样本则只打开 L0 loss mask，使同一架构可混合单层和多层监督。\n- **生成信号：** 用直接作用于 XYZ 像素空间的 flow matching 表达不可见几何的多模态分布，并用混合 timestep 日程分别照顾近似重建的 L0 与更偏生成的深层。\n\n与本知识库 3D/4D 世界建模课题直接相关之处，是它提供了可供编辑、视频新视角和动态几何共享的显式世界状态接口。**阅读者推断：** 该接口可能比单层深度更适合作为生成式世界模型的几何记忆；但论文没有因果干预、反事实识别或长期交互实验，不能据此把 World Tracing 称为因果世界模型。",
    "pipeline": {
      "input": "静态对象/场景版本接收一张 RGBA 图像（场景中 alpha 用于屏蔽天空等无限深度区域）；动态版本接收短单目视频。模型不要求相机内参作为输入。",
      "process": "冻结的 MoGe ViT-L 从图像提取像素对齐特征；含噪的六层 XYZ 张量按 (14 times14) patch 转成逐层 geometry tokens，与对应图像 token 在像素位置上融合。WT-DiT 交替使用层内二维注意力、同射线跨层注意力和全局注意力，并用 layer FiLM 区分层序；WT-D 在全局块后增加时间注意力。训练先用 depth peeling 从三维资产渲染每条射线的前六个交点，缺失深层以前向填充变密；XYZ 经对象 z-score 或场景 median + signed-log 归一化后做 (x 0)-parameterized flow matching，并加入软相邻层单调约束。推理从高斯噪声出发，用 20 个 ODE 步得到多层点图。",
      "output": "(X in mathbb{R}^{L times H times W times3}) 的相机坐标多层 XYZ pointmaps（默认 (L=6)）；L0 对应输入可见表面，更深层给出沿相同像素射线的遮挡几何。公开模型本身不预测颜色或逐层可见性，颜色从输入 RGB 采样，alpha 作为各层共同有效域。",
      "details": "- **输入：** 静态对象/场景版本接收一张 RGBA 图像（场景中 alpha 用于屏蔽天空等无限深度区域）；动态版本接收短单目视频。模型不要求相机内参作为输入。\n- **过程：** 冻结的 MoGe ViT-L 从图像提取像素对齐特征；含噪的六层 XYZ 张量按 (14\\times14) patch 转成逐层 geometry tokens，与对应图像 token 在像素位置上融合。WT-DiT 交替使用层内二维注意力、同射线跨层注意力和全局注意力，并用 layer FiLM 区分层序；WT-D 在全局块后增加时间注意力。训练先用 depth peeling 从三维资产渲染每条射线的前六个交点，缺失深层以前向填充变密；XYZ 经对象 z-score 或场景 median + signed-log 归一化后做 (x_0)-parameterized flow matching，并加入软相邻层单调约束。推理从高斯噪声出发，用 20 个 ODE 步得到多层点图。\n- **输出：** (X\\in\\mathbb{R}^{L\\times H\\times W\\times3}) 的相机坐标多层 XYZ pointmaps（默认 (L=6)）；L0 对应输入可见表面，更深层给出沿相同像素射线的遮挡几何。公开模型本身不预测颜色或逐层可见性，颜色从输入 RGB 采样，alpha 作为各层共同有效域。\n\n三个变体共用表示和主要目标：WT-O 处理静态对象，WT-S 处理静态场景，WT-D 从 WT-O 微调并加入时间注意力处理动态对象。主模型为约 1.7B 参数（1.4B 可训练）、504×504、六层；论文以 64 张 H100、全局 batch 512 训练，WT-D 再从对象 checkpoint 微调。\n\n与最近 baseline 的实质差异是：相对 MoGe-2 / VGGT / Pi3X，它从单可见点扩展到同射线多交点；相对 LaRI，它用生成式 flow matching 和稠密 depth-filling 目标，去掉稀疏 mask head；相对 TRELLIS.2 / SAM 3D 等规范坐标生成器，它把输入相机帧和像素对应保留为原生坐标；相对动态 GVFDiffusion / SS4D / ActionMesh，它保持相同的逐像素多层目标，仅额外加入时间耦合。"
    },
    "experiments": "**数据与划分。** 训练多层数据包括约 30 万个公开对象、约 1700 万渲染视图（Objaverse-XL、Objaverse、3D-FUTURE、Toys4K、GSO、TrueBones 等），3D-FRONT 加一个内部场景语料，以及约 1.68 万个动态资产片段。主表使用仅三维资产训练的 checkpoint：对象测试为 100 个 held-out assets；场景公开测试为 50 个 held-out 3D-FRONT 样本，另以 200 个内部场景样本作泛化探针；动态测试使用 Obj.-Val、Truebone 和 ActionBench。附录另在 NYU Depth V2 的 1,449 帧与 ETH3D 的 454 帧上评估加入 12 个 RGB-D 式数据集混训的 WT-S。内部场景语料与测试集无法由外部完整审计。\n\n**指标与 baseline。** 可见面报告 SSI 对齐后的 MAE、RMSE、AbsRel、δ 阈值；完整几何报告 Chamfer-L1/L2 与 F-score，并区分 L0 和 All-L；动态片段对逐帧误差求均值。baseline 覆盖深度/pointmap（DA3、MoGe-2、VGGT、Pi3X）、分层回归（LaRI）、image-to-3D（TRELLIS.2、SAM 3D、LaS-Comp、ReconViaGen）和动态几何（GVFDiffusion、SS4D、ActionMesh）。随机扩散/生成方法在部分表中取 8 个 seed 的最优几何结果，不能与单次采样成本混为一谈。\n\n**主结果（实验事实）。**\n\n- 对象可见深度中，WT-O 的 MAE / RMSE / AbsRel 为 **0.0149 / 0.0243 / 0.0079**，优于表中 VGGT 的 0.0257 / 0.0370 / 0.0138 和 MoGe-2 的 0.0261 / 0.0368 / 0.0141。100 样本完整几何上，WT-O point cloud 的 Chamfer-L1 **0.0213**、F@0.05 **0.898**，表中 TRELLIS.2 为 0.0566 / 0.598；接入 TRELLIS.2 后的 WT-O* mesh 为 0.0326 / 0.808。\n- 50 个 held-out 3D-FRONT 场景上，WT-S 的可见 AbsRel **0.0114**、L0 CD-L1 **0.0093**、All-L F@0.05 **0.8951**；LaRI-scene 分别为 0.0359、0.0268、0.6671。200 个内部样本上 WT-S 仍在表中最佳，但其 All-L F@0.05 降至 0.6500，显示跨分布退化。\n- 动态全局 CD-L2 中，WT-D 在 Truebone / Obj.-Val 为 **0.0063 / 0.0034**，优于各 baseline；ActionBench 为 **0.0291**，落后 ActionMesh 的 **0.0243**。三组均值 WT-D 为 **0.0105**、ActionMesh 为 0.0162。该例外说明优势取决于 ground truth 与输出表示是否匹配。\n- 真实深度附录中，RGB-D 混训 WT-S 20 步相对仅三维资产版改善 NYU / ETH3D indoor AbsRel（0.0398→0.0382、0.0398→0.0345）；50 步版本为 0.0374 / 0.0332，但 Pi3X 在 NYU 为 0.0341。证据支持混合单层监督能补强可见面，不支持其全面取代专用深度模型。\n\n**消融与诊断。** timestep 日程消融的全层 CD-L2：plateaued logit-normal 0.031、标准 logit-normal 0.027、两者 mixture **0.024**；前者偏好 L0，后者偏好深层，支持混合日程的权衡。联合 depth + mask 早期训练中两任务梯度余弦可接近零或为负（500 iter 示例 -0.19），配合深层有效面积统计，支持去掉 mask head 的优化动机。小规模 LayerScale 消融在 10k iter 降低 loss，但不是最终规模的完整因果归因。论文没有给主表置信区间或多次训练方差。\n\n**证据真正支持的结论。** 在作者构建的几何指标和测试范围内，多层像素对齐生成可以同时改善 L0 忠实度与遮挡面覆盖，并能作为若干下游管线的几何先验。三项下游编辑/视频/mesh 主要是演示与任务相关指标，不足以证明任意真实场景中的长期一致性，也不能把与性能的相关性解释成多层表示是唯一致因。",
    "evidence_notes": "",
    "code_data_status": "- **代码：** [haoz19/world-tracing](https://github.com/haoz19/world-tracing) 公开对象、场景、动态推理、20 步 Euler ODE 采样、Rerun 可视化、内参拟合及 TRELLIS.2 bridge；仓库明确写为 **inference-only release**，不含训练代码。\n- **模型：** 公开对象 `haoz19/object-model-6layer`（1.7B，504²）、场景 `haoz19/scene-model-6layer-840`（1.5B，840²）和动态 `haoz19/dynamic-model-16frame`（2.1B，336²×16 帧）权重，以及 Hugging Face 在线演示。\n- **许可证：** 论文和官方仓库标注 CC BY-NC-ND 4.0；仓库说明代码、权重与演示限非商业研究使用，禁止再分发衍生物。使用前仍应逐项核对所依赖 MoGe、TRELLIS.2 与数据集的各自许可证。\n- **数据：** 训练资产来源列表和渲染流程在论文中给出，但内部场景语料、内部 200 样本测试集、完整渲染产物及训练流水线未公开，因此不能仅凭当前 release 完整复现论文训练和全部表格。",
    "limitations": "- 固定 (L=6) 是工程折中；树叶、笼子、格栅等高穿孔结构可能沿一条射线需要更多交点，需自适应层数或可变深度表示。\n- 训练主要依赖渲染和 depth peeling；无纹理、反光表面仍有 synthetic-to-real artifact，室外天空与复杂背景还依赖额外 mask。\n- 20 步迭代采样不是实时方案；官方单张 A100/H100 推理约 13–17 秒，动态 8 帧约 30 秒，默认四 seed sweep 约再乘四，实时应用需要蒸馏或少步采样。\n- 动态模型只覆盖短片段；长程记忆、持续身份、长期遮挡后重现和大幅相机运动仍未解决，ActionBench 也不是最优。\n- best-of-8 seed 选择、无主结果置信区间和内部场景数据降低了公平比较与独立复现强度；应补单次/期望性能、方差与完全公开测试。\n- 当前公开仓库只有推理代码与权重；完整训练数据、训练代码和内部评测均未开放，无法端到端复现实验主张。",
    "comments": "",
    "source_reports": [
      "report-77695ff321"
    ],
    "deleted": false,
    "updated_at": "2026-08-23",
    "challenges": "**领域长期挑战。** 单张图像到三维存在不可消除的遮挡歧义：观测只约束第一可见表面，背面、被前景遮住的物体和视锥外结构只能依赖先验生成。已有两条路线各自牺牲一端：单目深度/pointmap 方法逐像素对齐、能忠实恢复可见表面，却天然每条射线只给一个点；image-to-3D 生成器能补出完整物体，但通常在规范坐标系生成，可能改变输入中的姿态、前后关系或局部轮廓，后续还要做相机与物体配准。\n\n**本文针对的具体缺口。** 作者要同时保留相机坐标中的像素—三维对应和遮挡后完整几何。最近的分层表示 LaRI / DualPM 虽允许一条射线有多个交点，但回归式深度加逐层有效性 mask 会遭遇两类失败：不可见背面是多模态的，点回归易平均成平滑形状；越深层有效像素越稀疏，本文对象渲染统计从 L0 平均 8.14% 降至 L5 的 0.60%，mask 分类容易塌缩为“无效”。场景和动态方法还常使用不同表示，难以共享同一接口。\n\n评测层面也有长期缺口：视觉上“像真的”mesh/video 指标未必衡量其是否忠实于输入。本文因此以可见深度误差、Chamfer distance 和 F-score 为主，而不是只报美学质量。不过，作者使用随机生成方法 best-of-8 结果，且有 200 个内部场景样本，仍不是完全无选择偏差、完全公开的统一比较。",
    "motivation": "**作者明确主张：** 下游三维编辑、视角变化视频和纹理 mesh 生成真正需要的是相机坐标中既忠实又完整的几何，而不是彼此分离的 depth map 与 canonical asset。核心 Insight 是把每个输入像素对应的相机射线表示为由近到远的 (L) 个三维交点：L0 是可见表面，L1–L5 是后续遮挡表面。于是“重建”与“生成”成为同一个 (L\\times H\\times W\\times3) 张量中的不同层，像素对应由表示本身保证。\n\n这一选择同时改变了三个接口：\n\n- **表征接口：** 从每像素一个深度/点或规范坐标 mesh，改成相机坐标、多层、像素对齐 XYZ pointmaps；无需把相机内参作为输入，必要时可从 L0 的像素—点对应闭式拟合自洽内参。\n- **监督接口：** 对没有第 (L) 个真实交点的射线，用最近的前一有效交点前向填充，取消逐层有效性分类头；单层 RGB-D 样本则只打开 L0 loss mask，使同一架构可混合单层和多层监督。\n- **生成信号：** 用直接作用于 XYZ 像素空间的 flow matching 表达不可见几何的多模态分布，并用混合 timestep 日程分别照顾近似重建的 L0 与更偏生成的深层。\n\n与本知识库 3D/4D 世界建模课题直接相关之处，是它提供了可供编辑、视频新视角和动态几何共享的显式世界状态接口。**阅读者推断：** 该接口可能比单层深度更适合作为生成式世界模型的几何记忆；但论文没有因果干预、反事实识别或长期交互实验，不能据此把 World Tracing 称为因果世界模型。",
    "technical_approach": "- **输入：** 静态对象/场景版本接收一张 RGBA 图像（场景中 alpha 用于屏蔽天空等无限深度区域）；动态版本接收短单目视频。模型不要求相机内参作为输入。\n- **过程：** 冻结的 MoGe ViT-L 从图像提取像素对齐特征；含噪的六层 XYZ 张量按 (14\\times14) patch 转成逐层 geometry tokens，与对应图像 token 在像素位置上融合。WT-DiT 交替使用层内二维注意力、同射线跨层注意力和全局注意力，并用 layer FiLM 区分层序；WT-D 在全局块后增加时间注意力。训练先用 depth peeling 从三维资产渲染每条射线的前六个交点，缺失深层以前向填充变密；XYZ 经对象 z-score 或场景 median + signed-log 归一化后做 (x_0)-parameterized flow matching，并加入软相邻层单调约束。推理从高斯噪声出发，用 20 个 ODE 步得到多层点图。\n- **输出：** (X\\in\\mathbb{R}^{L\\times H\\times W\\times3}) 的相机坐标多层 XYZ pointmaps（默认 (L=6)）；L0 对应输入可见表面，更深层给出沿相同像素射线的遮挡几何。公开模型本身不预测颜色或逐层可见性，颜色从输入 RGB 采样，alpha 作为各层共同有效域。\n\n三个变体共用表示和主要目标：WT-O 处理静态对象，WT-S 处理静态场景，WT-D 从 WT-O 微调并加入时间注意力处理动态对象。主模型为约 1.7B 参数（1.4B 可训练）、504×504、六层；论文以 64 张 H100、全局 batch 512 训练，WT-D 再从对象 checkpoint 微调。\n\n与最近 baseline 的实质差异是：相对 MoGe-2 / VGGT / Pi3X，它从单可见点扩展到同射线多交点；相对 LaRI，它用生成式 flow matching 和稠密 depth-filling 目标，去掉稀疏 mask head；相对 TRELLIS.2 / SAM 3D 等规范坐标生成器，它把输入相机帧和像素对应保留为原生坐标；相对动态 GVFDiffusion / SS4D / ActionMesh，它保持相同的逐像素多层目标，仅额外加入时间耦合。",
    "discussion": "World Tracing 把单目三维的“忠实但不完整”和“完整但不对齐”两端收束到一个清晰接口：输入像素网格上的相机坐标多层点栈。技术上最有价值的不是单个注意力块，而是表示、depth-filling 监督与 flow-matching 生成目标的配套设计。公开对象、3D-FRONT 与动态结果支持这一组合在指定分布内有效，ActionBench 例外、真实深度仍输给部分专用模型、内部数据和 best-of-8 则界定了证据强度。\n\n适用边界包括：输入应能给出可靠前景/天空有效域；固定六层难覆盖高穿孔结构；相机坐标 point cloud 仍需额外管线变成带纹理闭合 mesh；生成的遮挡面是条件先验，不是被输入观测证明的真实背面。官方推理说明还指出，有色背景会被冻结图像编码器当作内容而产生“ghost”几何，室外天空需外部 mask。\n\n阅读判断：适合作为单图到 3D、显式几何世界状态和 4D 几何预测的强基线，也适合作为 canonical image-to-3D 的对照。引用时应写“在所测几何 benchmark 上优于所列 baseline”，不要扩大成普遍 SOTA；下游演示说明接口可组合，不等于编辑或视频系统经过端到端、统计充分的普适验证。",
    "arxiv": {
      "published": "2026-06-11T17:52:48Z",
      "revised_at": "2026-06-11T17:52:48Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2609-02159",
    "title": "World-Coherent Decoding: Self-Verifying Test-Time Planning for World Action Models",
    "authors": [
      "Chuhan Zhang",
      "Seiji Ito",
      "Kenta Hoshino",
      "Satoshi Ikehata",
      "Ikuro Sato"
    ],
    "year": 2026,
    "publication": "2026，arXiv",
    "arxiv_id": "2609.02159",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2609.02159",
      "alphaxiv": "https://alphaxiv.org/abs/2609.02159"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "机器人学习",
      "流式与自回归",
      "物理建模与仿真",
      "第一视角与人类视频",
      "跨本体迁移"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2609.02159v1/hook_pilot.png",
      "alt": "World-Coherent Decoding 测试时规划示例",
      "label": "World-Coherent Decoding 测试时规划示例；来源：论文原图",
      "paper_title": "World-Coherent Decoding: Self-Verifying Test-Time Planning for World Action Models",
      "source_url": "https://arxiv.org/html/2609.02159v1/hook_pilot.png"
    },
    "summary": "WCD 将 WAM 生成的未来视为可证伪的\"未来—动作假设\"，不直接采用单个采样结果，而是：",
    "insight": "WCD 将 WAM 生成的未来视为可证伪的\"未来—动作假设\"，不直接采用单个采样结果，而是：\n\n- 采样多个候选未来；\n- 使用视觉 surprisal 评价未来的生成可信度；\n- 使用动作路径代价评价动作稳定性；\n- 执行后比较想象与真实观测；\n- 在线训练轻量预测器，改进下一次候选选择。\n\n核心观点是：WAM 的测试时扩展不一定是采样更多未来，而是选择更可靠的未来。",
    "pipeline": {
      "input": "当前观测、冻结 WAM、候选动作和未来视频样本。",
      "process": "多候选采样、视觉 plausibility 评分、动作路径评分、执行后误差审计、在线候选选择器更新。",
      "output": "被选择并执行的动作序列。",
      "details": "**输入**：当前观测、冻结 WAM、候选动作和未来视频样本。\n\n**过程**：多候选采样、视觉 plausibility 评分、动作路径评分、执行后误差审计、在线候选选择器更新。\n\n**输出**：被选择并执行的动作序列。"
    },
    "experiments": "摘要报告 RoboTwin 2.0 Hard success 从 55.80% 提升到 60.90%，Horizon-3 任务提升 16.43 个百分点，并在真实 Franka 视觉变化测试中展示定性鲁棒性。\n\n尚未核验：\n\n- 是否使用了额外的真实执行数据；\n- 在线 predictor 的训练预算；\n- 与单纯增加采样数、CEM、reranking baseline 的公平比较；\n- 真实机器人结果是否有统计重复。",
    "evidence_notes": "",
    "code_data_status": "未在 arXiv comments 中发现明确代码或模型链接。",
    "limitations": "- 视觉 surprisal 可能偏好\"像训练分布\"的未来，而不一定是正确未来。\n- 动作路径代价不等价于任务成功概率。\n- 执行后审计存在延迟，失败动作可能已经造成不可逆后果。\n- 在线选择器是否能跨任务和跨本体迁移尚不清楚。\n\n### 与知域的关系\n\n该工作对知域的 WAM 研究提供了重要的测试时推理路线，可与 GlanceWAM、WAM-OPD、FACT 和 WorldSimProbe 形成互补。",
    "comments": "",
    "source_reports": [
      "report-0d81d19c6c"
    ],
    "deleted": false,
    "updated_at": "2026-09-08",
    "arxiv": {
      "published": "2026-09-02T06:21:36Z",
      "revised_at": "2026-09-02T06:21:36Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "arxiv": {
      "published": "2026-04-27T17:59:56Z",
      "revised_at": "2026-05-26T15:39:12Z",
      "primary_category": "cs.CV"
    },
    "arxiv_id": "2604.24764",
    "authors": [
      "Weijie Wang",
      "Xiaoxuan He",
      "Youping Gu",
      "Yifan Yang",
      "Zeyu Zhang",
      "Yefei He",
      "Yanbo Ding",
      "Xirui Hu",
      "Donny Y. Chen",
      "Zhiyuan He",
      "Yuqing Yang",
      "Bohan Zhuang"
    ],
    "code_data_status": "- **代码**：GitHub 已公开，MIT license。仓库包含 `flow_grpo`、`reward_server`、`scripts`、`dataset` 等目录，并给出单机/多机训练、reward server、inference 脚本。\n- **数据**：Hugging Face `microsoft/World-R1` 已公开 prompt-only dataset，包含 `final` 与 `enhanced` 两个 config。数据卡明确说明不包含生成视频、reward annotations、human preference labels 或 model checkpoints。\n- **模型权重**：公开页面主要提供代码和 prompt dataset；是否发布完整 LoRA/model checkpoint 需以官方仓库后续说明为准。",
    "comments": "",
    "deleted": false,
    "doi": "",
    "evidence_notes": "",
    "experiments": "- World-R1-Small / Large 在 3D consistency benchmark 上显著优于 Wan2.1 / Wan2.2 / CogVideoX 等 baseline。\n- 官方技术页报告 World-R1-Large 达 27.67 PSNR / 0.865 SSIM / 0.162 LPIPS；World-R1-Small 相对 Wan2.1-1.3B 有 +10.23 dB PSNR 改善。\n- User study 中，World-R1 相对 Wan2.1 在 geometry/control/overall preference 上有优势。\n- 121-frame long-video evaluation 中，World-R1-Large 将 PSNR 从 18.32 提升到 26.32。\n\n需要注意：这些实验支持的是 **3D consistency / camera control / visual quality preservation**，不是严格意义上的物理仿真或可交互因果 world model。",
    "figure": {
      "url": "https://microsoft.github.io/World-R1/assets/pipeline.jpg",
      "alt": "World-R1 Fig. 2: pipeline overview",
      "label": "World-R1，Fig. 2 / Pipeline Overview，。来源：原图",
      "paper_title": "World-R1: Reinforcing 3D Constraints for Text-to-Video Generation",
      "source_url": "https://microsoft.github.io/World-R1/assets/pipeline.jpg"
    },
    "id": "arxiv-2604-24764",
    "insight": "World-R1 的出发点与 GeoFlow/VGGRPO 接近：video foundation model 已有强视觉合成能力，但缺内在 3D 几何约束。它反对在推理时加重型 3D control modules，主张通过 RL 后训练把几何一致性“内化”到模型中。\n\n核心 insight：\n\n> 用 3D foundation model 和 VLM 作为 reward providers，通过 Flow-GRPO 对 text-to-video 模型做后训练，可以在不改架构、不加推理期 3D 模块的情况下强化 3D consistency。\n\n它还引入 implicit camera conditioning：从 text 中解析 camera motion，将轨迹先验写入 initial latent noise，而不是增加额外控制网络。",
    "limitations": "作者明确指出两点局限：\n\n- RL 用于视频生成仍成本高，因为需要重复 rollout 和 reward evaluation。\n- World-R1 受基础视频模型生成能力限制；dense multi-object composition、fine-grained non-rigid motion、detailed hand dynamics、very long-horizon scene evolution 仍可能继承 base model artifacts。\n\n作者还分析了 reward hacking 风险：如果只优化窄 3D metric，模型可能生成 near-static clips 来方便重建但不遵循 camera motion。World-R1 用 composite reward、trajectory term、periodic dynamic-only training 来缓解，但这不等于完全消除。\n\n## 对 HOI world model 的启发\n\nWorld-R1 特别适合借鉴到 HOI 的后训练框架：\n\n- 用 3D / 4D foundation model 给生成视频打分；\n- 加入 camera trajectory / viewpoint consistency reward；\n- 用 VLM 评估 novel view 或 meta-view plausibility；\n- 通过 periodic dynamic training 避免 reward 过度鼓励“静态化”。\n\n但它对 HOI 最关键的 hand-object contact 没有直接处理。若迁移到 HOI，需要把 reward 改为：\n\n- hand pose / MANO consistency；\n- object 6DoF / articulated state consistency；\n- contact map / affordance alignment；\n- action-conditioned object response；\n- first-person camera 与手部运动解耦。\n\n---",
    "links": {
      "paper": "https://arxiv.org/abs/2604.24764",
      "project": "https://microsoft.github.io/World-R1/",
      "code": "https://github.com/microsoft/World-R1",
      "data": "https://huggingface.co/datasets/microsoft/World-R1",
      "alphaxiv": "https://alphaxiv.org/abs/2604.24764"
    },
    "pipeline": {
      "input": "pure text world-simulation prompt；其中可包含 camera push / pull / pan / orbit 等运动描述。",
      "process": "- Camera conditioning ：；- 解析文本中的 camera motion tokens；；- 转为 deterministic camera extrinsics；；- 投影成 dense optical flow；；- 用 trajectory-guided noise wrapping 注入初始 latent noise。；- Policy rollout ：Wan2.1 T2V backbone 生成 grouped candidate videos。；- Reward design ：；- Depth Anything 3 / DA3 将视频 lifted 到 3DGS；；- meta-view score：用 Qwen3-VL 判断 novel/meta views 是否合理；；- rendering score：用 LPIPS 等衡量重渲染一致性；；- trajectory score：评估 camera trajectory adherence；；- general reward：HPSv3 约束视觉质量。；- Training strategy ：Flow-GRPO-Fast；周期性 decoupled training，每 100 steps 暂时关闭 3D reward，只用 general reward 在 dynamic prompts 上训练，避免过度刚性化。",
      "output": "World-R1-Small / World-R1-Large 这类 3D-consistent T2V 模型。",
      "details": "- **输入**：pure text world-simulation prompt；其中可包含 camera push / pull / pan / orbit 等运动描述。\n- **Camera conditioning**：\n  - 解析文本中的 camera motion tokens；\n  - 转为 deterministic camera extrinsics；\n  - 投影成 dense optical flow；\n  - 用 trajectory-guided noise wrapping 注入初始 latent noise。\n- **Policy rollout**：Wan2.1 T2V backbone 生成 grouped candidate videos。\n- **Reward design**：\n  - Depth Anything 3 / DA3 将视频 lifted 到 3DGS；\n  - meta-view score：用 Qwen3-VL 判断 novel/meta views 是否合理；\n  - rendering score：用 LPIPS 等衡量重渲染一致性；\n  - trajectory score：评估 camera trajectory adherence；\n  - general reward：HPSv3 约束视觉质量。\n- **Training strategy**：Flow-GRPO-Fast；周期性 decoupled training，每 100 steps 暂时关闭 3D reward，只用 general reward 在 dynamic prompts 上训练，避免过度刚性化。\n- **输出**：World-R1-Small / World-R1-Large 这类 3D-consistent T2V 模型。"
    },
    "publication": "2026",
    "source_reports": [
      "report-1818b05f33",
      "report-cedaa0825a"
    ],
    "summary": "World-R1 的出发点与 GeoFlow/VGGRPO 接近：video foundation model 已有强视觉合成能力，但缺内在 3D 几何约束。它反对在推理时加重型 3D control modules，主张通过 RL 后训练把几何一致性“内化”到模型中。",
    "tags": [
      "3D/4D",
      "HOI",
      "对象与可供性",
      "强化与模仿学习",
      "机器人学习",
      "视频生成"
    ],
    "title": "World-R1: Reinforcing 3D Constraints for Text-to-Video Generation",
    "updated_at": "2026-08-31",
    "year": 2026
  },
  {
    "id": "arxiv-2609-24984",
    "title": "WorldCrafter: Consistent Video World Model with Implicit 3D-aware Memory",
    "authors": [
      "Wangbo Yu",
      "Kunhao Liu",
      "Wenbo Hu",
      "Shenghai Yuan",
      "Chaoran Feng",
      "Haiyang Zhou",
      "Yukun Huang",
      "Yiran Wang",
      "Wang Zhao",
      "Yingmin Luo",
      "Ying Shan"
    ],
    "year": 2026,
    "publication": "2026，arXiv",
    "arxiv_id": "2609.24984",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2609.24984",
      "project": "https://drexubery.github.io/WorldCrafter/",
      "code": "https://github.com/TencentARC/WorldCrafter",
      "model": "https://huggingface.co/TencentARC/WorldCrafter-Fast",
      "alphaxiv": "https://alphaxiv.org/abs/2609.24984"
    },
    "tags": [
      "流式与自回归",
      "视频生成",
      "长时记忆"
    ],
    "figure": {
      "url": "content/images/2609.24984-main.webp",
      "alt": "Figure 2：历史潜变量按相机视野检索，并通过位姿查询读出固定大小的隐式几何记忆",
      "label": "Figure 2 · 历史潜变量按相机视野检索，并通过位姿查询读出固定大小的隐式几何记忆",
      "paper_title": "WorldCrafter: Consistent Video World Model with Implicit 3D-aware Memory",
      "source_url": "https://arxiv.org/html/2609.24984v1/pipeline.png"
    },
    "summary": "核心不是显式建图，而是学习camera-queryable implicit 3D-aware memory：目标camera pose决定历史multi-view evidence该如何被压缩成固定数量的target-view tokens。",
    "insight": "核心不是显式建图，而是学习camera-queryable implicit 3D-aware memory：目标camera pose决定历史multi-view evidence该如何被压缩成固定数量的target-view tokens。",
    "pipeline": {
      "input": "initial image或text prompt、历史video chunks、target camera trajectory。",
      "process": "memory encoder整合历史 → pose-conditioned readout提取target-view memory → 与最近temporal context一起送给video generator → few-step distilled streaming generation。",
      "output": "minute-scale camera-controllable video。",
      "details": "**过程**：memory encoder整合历史 → pose-conditioned readout提取target-view memory → 与最近temporal context一起送给video generator → few-step distilled streaming generation。\n\n**输入**：initial image或text prompt、历史video chunks、target camera trajectory。\n\n**输出**：minute-scale camera-controllable video。\n\n把历史视觉组织成隐式 3D-aware memory，再由目标相机查询固定数量的目标视图 tokens，与最近时间上下文一起生成下一块。模型不显式维护可碰撞 mesh，camera-queryable 的隐式结构不等于物理可执行状态。\n\n[原文方法](https://arxiv.org/html/2609.24984)\n\n### 方法细节与实现\n\n**记忆写入与检索。**历史视频潜变量连同相对相机位姿输入由 LagerNVS 初始化的编码器，得到隐式几何感知 token，而不是显式点云。为限制成本，保留最近一帧，再贪心挑选能共同覆盖未来视野的历史帧；这区别于分别挑选与目标最相似的帧，后者可能反复取到冗余视野。\n\n**按目标相机读取。**即将生成的相机轨迹形成 query，从历史表示中读出固定大小记忆 token，接入视频 DiT。固定读出预算使历史长度不直接推高 DiT 注意力成本，也把有限 token 优先分配给目标视野所需信息。记忆编码器、读出器和视频模型最终联合训练，而非一直冻结几何特征。\n\n**训练与蒸馏。**Helios-base 先适配新的上下文窗口，再学习相机条件、热身潜变量记忆编码器，最后联合优化。训练源包括 OSP、DL3DV 和 MIND，位姿由 DA3 标注。快速版以三层空间金字塔、每层两步去噪蒸馏；高噪声模型保留合成运动数据的跟随能力，最后低噪声一步使用偏真实外观的模型以减少纹理涂抹。\n\n[对应方法原文](https://arxiv.org/html/2609.24984#S3)"
    },
    "experiments": "benchmark包含145个static/dynamic scenes，每个5条metric camera trajectories，共725 videos / method；WorldCrafter在long-horizon revisit consistency和camera control上取得明显优势。论文也明确指出超长复杂trajectory仍会break consistency，且重复编码历史有额外latency。\n\n\n145 个初始场景中有 83 个动态 object-centric 场景与 62 个静态场景；每场景 5 条轨迹，长度 528–1648 帧，包含回环重访。725 videos/method 是同一批场景的多轨迹评估，不是 725 个独立真实环境。应分别查看 memory/revisit、camera control 和视觉质量，不把渲染一致性直接视作准确几何。\n\n[原文实验与表格](https://arxiv.org/html/2609.24984)\n\n**一致性与速度有取舍。**725段生成视频上，基础版/快速版重访LPIPS为0.255/0.186，较对照显著改善，但相机旋转误差从13.536增至18.251，视觉质量也并非快速版全面更好。16 FPS 对应4GPU，不能作为单卡性能。Sim(3) 对齐的相机评测和估计几何误差仍不同于真实场景完整3D真值验证。\n\n[实验与设置原文](https://arxiv.org/html/2609.24984)",
    "evidence_notes": "已核验原文方法与实验；关键比较与限制见各节",
    "code_data_status": "GitHub已提供Base/Fast inference，Hugging Face已提供模型资源。",
    "limitations": "3D-awareness是implicit learned memory，不保证metric geometry正确；没有robot action/contact interaction。",
    "comments": "",
    "source_reports": [],
    "deleted": false,
    "updated_at": "2026-09-24",
    "challenges": "视频窗口有限，离开一个区域后再返回时容易改变物体身份和布局。显式几何记忆常依赖深度质量，而纯历史帧记忆又可能太大、难按目标视角检索。",
    "motivation": "核心不是显式建图，而是学习camera-queryable implicit 3D-aware memory：目标camera pose决定历史multi-view evidence该如何被压缩成固定数量的target-view tokens。",
    "technical_approach": "**过程**：memory encoder整合历史 → pose-conditioned readout提取target-view memory → 与最近temporal context一起送给video generator → few-step distilled streaming generation。\n\n**输入**：initial image或text prompt、历史video chunks、target camera trajectory。\n\n**输出**：minute-scale camera-controllable video。\n\n把历史视觉组织成隐式 3D-aware memory，再由目标相机查询固定数量的目标视图 tokens，与最近时间上下文一起生成下一块。模型不显式维护可碰撞 mesh，camera-queryable 的隐式结构不等于物理可执行状态。\n\n[原文方法](https://arxiv.org/html/2609.24984)\n\n### 方法细节与实现\n\n**记忆写入与检索。**历史视频潜变量连同相对相机位姿输入由 LagerNVS 初始化的编码器，得到隐式几何感知 token，而不是显式点云。为限制成本，保留最近一帧，再贪心挑选能共同覆盖未来视野的历史帧；这区别于分别挑选与目标最相似的帧，后者可能反复取到冗余视野。\n\n**按目标相机读取。**即将生成的相机轨迹形成 query，从历史表示中读出固定大小记忆 token，接入视频 DiT。固定读出预算使历史长度不直接推高 DiT 注意力成本，也把有限 token 优先分配给目标视野所需信息。记忆编码器、读出器和视频模型最终联合训练，而非一直冻结几何特征。\n\n**训练与蒸馏。**Helios-base 先适配新的上下文窗口，再学习相机条件、热身潜变量记忆编码器，最后联合优化。训练源包括 OSP、DL3DV 和 MIND，位姿由 DA3 标注。快速版以三层空间金字塔、每层两步去噪蒸馏；高噪声模型保留合成运动数据的跟随能力，最后低噪声一步使用偏真实外观的模型以减少纹理涂抹。\n\n[对应方法原文](https://arxiv.org/html/2609.24984#S3)",
    "discussion": "**阅读者分析**：对StreamingHOI最有启发的是其“persistent world memory + queried local rendering”，可迁移到长期hand-object state。",
    "arxiv": {
      "published": "2026-09-21",
      "revised_at": "",
      "primary_category": "cs.CV"
    },
    "source_papers": [
      "content/papers/2609.24984.md"
    ]
  },
  {
    "id": "arxiv-2608-24885",
    "title": "WorldEcho & WorldSync: Do Robotic World Models Really Follow Actions?",
    "authors": [
      "Sixiang Chen",
      "Jiaming Liu",
      "Jixian Wu",
      "Yichen Guo",
      "Tinghao Wang",
      "Siyuan Qian",
      "Hao Chen",
      "Jiajun Cao",
      "Jian Tang",
      "Shanghang Zhang"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本（首发 2026-08-25）",
    "arxiv_id": "2608.24885",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.24885",
      "alphaxiv": "https://alphaxiv.org/abs/2608.24885"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "机器人学习",
      "流式与自回归",
      "第一视角与人类视频",
      "长时记忆"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.24885v1/figure1.png",
      "alt": "WorldEcho & WorldSync: Do Robotic World Models Really Follow Actions? 代表图",
      "label": "Figure 1: Overview of our diagnose–improve–validate pipeline. WorldEcho probes action-conditioned world models with demonstrated and diverse off-expert queries, jointly evaluating visual integrity and SE ⁡ ( 3 ) mathrm{SE}(3) end-effector alignment to expose visual collapse and action mismatch. Guided by this diagnosis, WorldSync broadens the training distribution over action consequences, grounds intermediate video… 来源：论文图",
      "paper_title": "WorldEcho & WorldSync: Do Robotic World Models Really Follow Actions?",
      "source_url": "https://arxiv.org/html/2608.24885v1/figure1.png"
    },
    "summary": "动作条件世界模型被当作学习模拟器，但\"生成的未来忠实反映任意合法动作\"是个未验证假设；既有评测局限在专家演示内，off-expert 动作服从未被评估。WorldEcho 用更宽动作分布 + 视觉完整性与 SE(3) 轨迹对齐来探测动作服从； 诊断显示：现有世界模型能执行专家动作，但面对多样化 off-expert 轨迹要么忽略命令、要么产出视觉无效 rollout 。WorldSync 从三个正交轴补强：分布覆盖（distributional coverage）、表示 grounding（representational grounding）、干预效果对齐（intervention-effect alignment）。",
    "insight": "动作条件世界模型被当作学习模拟器，但\"生成的未来忠实反映任意合法动作\"是个未验证假设；既有评测局限在专家演示内，off-expert 动作服从未被评估。WorldEcho 用更宽动作分布 + 视觉完整性与 SE(3) 轨迹对齐来探测动作服从；**诊断显示：现有世界模型能执行专家动作，但面对多样化 off-expert 轨迹要么忽略命令、要么产出视觉无效 rollout**。WorldSync 从三个正交轴补强：分布覆盖（distributional coverage）、表示 grounding（representational grounding）、干预效果对齐（intervention-effect alignment）。",
    "pipeline": {
      "input": "RoboTwin 与真实机器人中的 expert/off-expert 动作及对应未来",
      "process": "WorldEcho 评测（动作查询构建、视觉完整性评估、end-effector 轨迹对齐、integrity-gated 评估协议）→ 诊断 → WorldSync 三轴对齐训练（coverage expansion、action-forcing、intervention-effect supervision）。",
      "output": "action-following 指标、对齐后的 world model rollout 与迭代策略",
      "details": "**输入**：状态/观测 + 动作（专家与 off-expert 分布）。\n**过程**：WorldEcho 评测（动作查询构建、视觉完整性评估、end-effector 轨迹对齐、integrity-gated 评估协议）→ 诊断 → WorldSync 三轴对齐训练（coverage expansion、action-forcing、intervention-effect supervision）。\n**输出**：更忠实服从动作的世界模型。"
    },
    "experiments": "基准诊断报告 off-expert 性能缺口、失败分解、扩展评测；对齐后动作服从提升。证据等级：论文实验支持\"现有模型 off-expert 动作服从差\"与\"WorldSync 改善服从\"；各环境推广性待全文确认。",
    "evidence_notes": "",
    "code_data_status": "论文公开；截至检索日未确认代码、完整训练数据与许可证。",
    "limitations": "- 评测协议的覆盖率仍取决于动作分布采样；\n- intervention-effect 对齐是否真正提升真实策略评估仍需下游验证。\n\n### 与知域的关系\n与知域 WorldSimProbe（模拟器忠实度诊断）直接互补，是\"世界模型评测方法论\"分支的关键新作；其 off-expert 视角值得并入知域评测专题。",
    "comments": "",
    "source_reports": [
      "report-a141624b1e"
    ],
    "deleted": false,
    "updated_at": "2026-09-02",
    "arxiv": {
      "published": "2026-08-25T17:59:49Z",
      "revised_at": "2026-08-25T17:59:49Z",
      "primary_category": "cs.RO"
    },
    "challenges": "专家 demonstration 内评测掩盖了模型对任意合法 off-expert 动作忽略、漂移或生成无效视频的问题。",
    "motivation": "WorldEcho 扩大动作分布并测视觉完整性与 SE(3) 对齐；WorldSync 从数据覆盖、表示 grounding 和 intervention-effect alignment 三方面修正动作服从。",
    "technical_approach": "- **输入：** RoboTwin 与真实机器人中的 expert/off-expert 动作及对应未来\n- **过程：** WorldEcho 诊断；Action-Forcing Expert 对齐中间表示；比较动作干预下预测变化与真实未来变化\n- **输出：** action-following 指标、对齐后的 world model rollout 与迭代策略",
    "discussion": "WorldSync 的 intervention-effect alignment 比普通 action conditioning 更接近成对因果效应监督，但仍学习可观察差异，不提供 SCM identification 或同一实例外生变量推断。"
  },
  {
    "arxiv": {
      "published": "2026-08-10T08:48:06Z",
      "revised_at": "2026-08-10T08:48:06Z",
      "primary_category": "cs.RO"
    },
    "arxiv_id": "2608.09298",
    "authors": [
      "Peterson Co",
      "Sicheng Hu",
      "Chunxuan Jiao",
      "Hongyang Cheng",
      "Yulin Luo",
      "Yijie Xu",
      "Sixiang Chen",
      "Zhongxia Zhao",
      "Zihao Wang",
      "DaFeng Chi",
      "Peidong Liu",
      "YuTong Chen",
      "Henghua Liu",
      "Zhihao Yuan",
      "Huizhu Jia",
      "Yuzheng Zhuang",
      "Tianle Zhang",
      "Liang Lin",
      "Huajie Tan",
      "Shanghang Zhang"
    ],
    "code_data_status": "项目/代码入口已公开；各 evaluator 版本和完整输出应随仓库进一步核验。",
    "comments": "",
    "deleted": false,
    "doi": "",
    "evidence_notes": "",
    "experiments": "发现 action trajectory 越偏离训练 task distribution，6 个模型的 action-realization fidelity 普遍越差；trajectory mismatch 与 fidelity 平均 Spearman rho 为 -0.433；存在大量 false contact、unsupported interaction、inconsistent dynamics；普通 VLM 对 OOD action-following 判断过于乐观。WorldSimProbe 指标与人工判断及 downstream synthetic rollout policy performance 更一致。结论：world model 是否像真实 simulator，不能只看 FVD、视觉合理性或最终 task success，必须检查 action -> motion -> interaction -> environment response 的因果链。\n\n---",
    "figure": {
      "alt": "WorldSimProbe operational diagram",
      "label": "WorldSimProbe 操作化评测框架",
      "paper_title": "WorldSimProbe: Diagnosing Simulator Faithfulness in Action-Conditioned World Models for Embodied Manipulation",
      "source_url": "https://arxiv.org/html/2608.09298v1/operational_diagram.png",
      "url": "https://arxiv.org/html/2608.09298v1/operational_diagram.png"
    },
    "id": "arxiv-2608-09298",
    "insight": "WorldSimProbe 指出现有 world model benchmark 的核心问题：生成视频看起来合理、task outcome 正确，并不代表模型真的执行了给定 action。例如机器人动作没有按 action 走，但物体却“自己”到了目标位置，传统 video metric 仍可能给高分。因此它提出 **Observable Simulator Contract**：supplied action 必须导致对应 robot motion；environment response 必须由实际 motion/contact 导致。",
    "limitations": "- 观察契约只覆盖可见结果，不识别隐藏机制。\n- benchmark 动作分布仍不能覆盖全部合法 HOI 干预。\n- 机器人夹爪交互不等于人手高自由度接触。\n- metric 与真实安全/策略长期收益的关系仍需扩展。",
    "links": {
      "paper": "https://arxiv.org/abs/2608.09298",
      "code": "https://evophys.com",
      "data": "https://evophys.com",
      "alphaxiv": "https://alphaxiv.org/abs/2608.09298"
    },
    "pipeline": {
      "input": "RoboTwin、ManiSkill、LIBERO 中局部/全局、跨来源和 OOD 动作轨迹",
      "process": "- 被测对象 ：ACWM 输出 future rollout。；- 五组测试 ：Local Action Calibration；Global Trajectory Coverage；Action-Source Behavior Preservation；Interaction Grounding；Interaction Dynamics。",
      "output": "- 覆盖范围 ：RoboTwin、ManiSkill、LIBERO，约 18K+ instances，测试 6 个开源 ACWM。",
      "details": "- **输入**：当前状态 x_t 与 action sequence a_{t:t+H}。\n- **被测对象**：ACWM 输出 future rollout。\n- **五组测试**：Local Action Calibration；Global Trajectory Coverage；Action-Source Behavior Preservation；Interaction Grounding；Interaction Dynamics。\n- **覆盖范围**：RoboTwin、ManiSkill、LIBERO，约 18K+ instances，测试 6 个开源 ACWM。"
    },
    "publication": "arXiv 2026",
    "source_reports": [
      "report-e81e6bd3a1"
    ],
    "summary": "WorldSimProbe 指出现有 world model benchmark 的核心问题：生成视频看起来合理、task outcome 正确，并不代表模型真的执行了给定 action。例如机器人动作没有按 action 走，但物体却“自己”到了目标位置，传统 video metric 仍可能给高分。因此它提出 Observable Simulator Contract ：supplied action 必须导致对应 robot motion；environment response 必须由实际 motion/contact 导致。",
    "tags": [
      "HOI",
      "World Action Model",
      "世界模型",
      "因果与反事实",
      "机器人学习",
      "自监督与预测表征"
    ],
    "title": "WorldSimProbe: Diagnosing Simulator Faithfulness in Action-Conditioned World Models for Embodied Manipulation",
    "updated_at": "2026-09-02",
    "year": 2026,
    "challenges": "FVD、视觉质量和最终 task success 未直接检查动作是否实现、接触是否由实现的运动引起、环境响应是否正确。",
    "motivation": "提出 Observable Simulator Contract，将 action→agent motion→interaction→environment dynamics 分解诊断。",
    "technical_approach": "- **输入：** RoboTwin、ManiSkill、LIBERO 中局部/全局、跨来源和 OOD 动作轨迹\n- **过程：** 五个 controlled suites 分别测动作敏感性、轨迹一致、false interaction 与 primitive dynamics\n- **输出：** 模拟器忠实度诊断及与人工/下游策略结果的对应",
    "discussion": "该工作直接支持“action-conditioned 不等于 physical intervention faithful”。它未学习因果模型，却为 HOI counterfactual WM 提供分层评测骨架。"
  },
  {
    "id": "arxiv-2609-17372",
    "title": "XPACE: Joint World and Action Modeling from Heterogeneous Experience",
    "authors": [
      "Jiacheng Wei",
      "Jerry Bai",
      "Xiaoyu Yue",
      "Zidong Wang",
      "Xiaoyang Guo",
      "Cheng Chen",
      "Fanqi Pu",
      "Fan Wu",
      "Zhixu Yue",
      "Yizhuo Li",
      "Feng Qiu",
      "Bo Liu",
      "Yuying Ge",
      "Hui Zhou",
      "Chenyi Chen",
      "Yixiao Ge"
    ],
    "year": 2026,
    "publication": "2026，arXiv v1，2026-09-15 提交",
    "arxiv_id": "2609.17372",
    "doi": "10.48550/arXiv.2609.17372",
    "links": {
      "paper": "https://arxiv.org/abs/2609.17372",
      "alphaxiv": "https://alphaxiv.org/abs/2609.17372"
    },
    "tags": [
      "World Action Model",
      "世界模型",
      "第一视角与人类视频",
      "适应与泛化"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2609.17372v1/teaser.png",
      "alt": "XPACE Fig. 1",
      "label": "XPACE，Fig. 1，统一 world-action policy 与 action-conditioned simulator。来源：Fig. 1 原图 PNG",
      "paper_title": "XPACE: Joint World and Action Modeling from Heterogeneous Experience",
      "source_url": "https://arxiv.org/html/2609.17372v1/teaser.png"
    },
    "summary": "XPACE把 world-action policy 与 world simulator 合并进共享视频 backbone。无动作视频负责学习视觉动态；带动作的人类和机器人轨迹共同提供视频与动作 supervision。模型随后不只预测动作，还能以给定动作模拟视觉后果，并利用自己的 simulator 构造偏离专家轨迹后的 recovery experience。",
    "insight": "XPACE把 world-action policy 与 world simulator 合并进共享视频 backbone。无动作视频负责学习视觉动态；带动作的人类和机器人轨迹共同提供视频与动作 supervision。模型随后不只预测动作，还能以给定动作模拟视觉后果，并利用自己的 simulator 构造偏离专家轨迹后的 recovery experience。\n\n关键 Insight 是把 world model 从辅助 loss 提升为**可生成新 policy training data 的闭环组件**。",
    "pipeline": {
      "input": "无动作视频、带动作的人类演示、机器人演示，以及部署时当前视觉/任务上下文。",
      "process": "先以大规模视频学习 visual dynamics，再联合训练 future video 与 robot action；采用 coarse-to-fine curriculum逐渐提高机器人控制比重。world simulator进一步适配自己的 generated context，在专家轨迹附近生成 deviation-recovery rollout，过滤后用于 policy fine-tuning。",
      "output": "可执行机器人动作，以及指定动作条件下的未来视频模拟。",
      "details": "**输入**：无动作视频、带动作的人类演示、机器人演示，以及部署时当前视觉/任务上下文。\n\n**过程**：先以大规模视频学习 visual dynamics，再联合训练 future video 与 robot action；采用 coarse-to-fine curriculum逐渐提高机器人控制比重。world simulator进一步适配自己的 generated context，在专家轨迹附近生成 deviation-recovery rollout，过滤后用于 policy fine-tuning。\n\n**输出**：可执行机器人动作，以及指定动作条件下的未来视频模拟。"
    },
    "experiments": "XPENG IRON 真实机器人实验中，论文报告 XPACE 平均成功率 68.3%，DreamZero 为 40.0%，GR00T 为 6.7%；对应 progress 指标约 0.84、0.68、0.36。需要注意，监督机器人/人类 corpus虽进行了匹配，但 XPACE额外使用 Stage-I video adaptation，因此该表支持的是完整系统方案，而非纯 architecture-controlled 胜负。\n\n使用 simulator 生成恢复数据进行 self-improvement 后，平均 progress 从 0.81 提升至 0.93，成功率从 61.7% 提升到 86.7%；其中 water-pouring 任务由 50% 提升到 95%。",
    "evidence_notes": "全文已核验",
    "code_data_status": "本次未核验到稳定官方代码、模型或数据下载入口，因此不根据第三方索引声称其已经开源。",
    "limitations": "完整方案同时变化数据、预训练和架构，导致部分对比难以隔离“共享 world/action architecture”本身的贡献。simulation-generated recovery 是否会在更长 horizon 下累积模型偏差、过滤器如何处理错误但视觉上合理的 trajectory，也仍是核心开放问题。",
    "comments": "",
    "source_reports": [
      "report-1b1ffacf7d"
    ],
    "deleted": false,
    "updated_at": "2026-09-16",
    "challenges": "无动作视频、带动作的人类轨迹与机器人示范通常由不同模型或训练阶段割裂处理，世界预测难以直接反哺策略，并容易在偏离专家分布后失效。",
    "motivation": "XPACE把 world-action policy 与 world simulator 合并进共享视频 backbone。无动作视频负责学习视觉动态；带动作的人类和机器人轨迹共同提供视频与动作 supervision。模型随后不只预测动作，还能以给定动作模拟视觉后果，并利用自己的 simulator 构造偏离专家轨迹后的 recovery experience。\n\n关键 Insight 是把 world model 从辅助 loss 提升为**可生成新 policy training data 的闭环组件**。",
    "technical_approach": "**输入**：无动作视频、带动作的人类演示、机器人演示，以及部署时当前视觉/任务上下文。\n\n**过程**：先以大规模视频学习 visual dynamics，再联合训练 future video 与 robot action；采用 coarse-to-fine curriculum逐渐提高机器人控制比重。world simulator进一步适配自己的 generated context，在专家轨迹附近生成 deviation-recovery rollout，过滤后用于 policy fine-tuning。\n\n**输出**：可执行机器人动作，以及指定动作条件下的未来视频模拟。",
    "discussion": "XPACE与 Dyna、OpenWAM、FlowWAM 等路线高度相关，但增加了一个重要闭环：**世界模型自己生成 recovery supervision**。它值得与显式 3D/4D simulator 或 contact-aware world model结合，以研究视频上看似合理的恢复轨迹是否真的物理可执行。",
    "arxiv": {
      "published": "2026-09-15T16:07:34Z",
      "revised_at": "2026-09-15T16:07:34Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2608-26103",
    "title": "Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization",
    "authors": [
      "Jiaming Zhou",
      "Qihang Zhang",
      "Gangwei Xu",
      "Cunxin Fan",
      "Yujie Zhao",
      "Ruilin Wang",
      "Yiming Luo",
      "Shuai Yang",
      "Xing Zhu",
      "Yujun Shen",
      "Junwei Liang",
      "Yinghao Xu"
    ],
    "year": 2026,
    "publication": "2026，arXiv 预印本（v1：2026-08-26；v2：2026-08-27）",
    "arxiv_id": "2608.26103",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2608.26103",
      "project": "https://robbyant-research.github.io/Zero-WAM/",
      "alphaxiv": "https://alphaxiv.org/abs/2608.26103"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "机器人学习",
      "流式与自回归",
      "第一视角与人类视频",
      "视频生成",
      "适应与泛化",
      "长时记忆"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.26103v2/data_combine_v1.1.png",
      "alt": "Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization 代表图",
      "label": "Figure 2 : Data construction and in-context human video generation. Top: Task-diverse VA data provide task-balanced robotic video-action pre-training data, while HumanGen contains Pre-train ICL (External), Pre-train ICL (In-house), Simulation ICL, and Real-world ICL pairs. Bottom: the in-context human video generation pipeline converts task-sampled robot videos into human video instructions.。来源：原图",
      "paper_title": "Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization",
      "source_url": "https://arxiv.org/html/2608.26103v2/data_combine_v1.1.png"
    },
    "summary": "Zero-WAM 将具身 ICL 明确定义为：部署时以一段人类操作视频规定未见任务，不更新模型参数，由机器人策略把视频中的目标状态变化翻译为自身 embodiment 下的动作。论文真正解决的是“模型可能无视上下文”的捷径问题：仅做 next-chunk prediction 时，训练任务的局部机器人历史常已足够预测下一步，因此作者加入 in-context future chunk prediction（IFP），迫使主干表示吸收人类视频提供的长程任务信息。",
    "insight": "Zero-WAM 将具身 ICL 明确定义为：部署时以一段人类操作视频规定未见任务，不更新模型参数，由机器人策略把视频中的目标状态变化翻译为自身 embodiment 下的动作。论文真正解决的是“模型可能无视上下文”的捷径问题：仅做 next-chunk prediction 时，训练任务的局部机器人历史常已足够预测下一步，因此作者加入 in-context future chunk prediction（IFP），迫使主干表示吸收人类视频提供的长程任务信息。",
    "pipeline": {
      "input": "人类任务演示视频（可附语言）、当前及历史机器人观测与动作。",
      "process": "先以任务均衡方式整理机器人 video-action 数据；再用 VLM、图像编辑和视频生成模型，把机器人轨迹自动转换成语义匹配但背景、视角、物体和 embodiment 可变化的人类视频，构成 HumanGen；模型以人类视频为 prefix memory，因果预测未来机器人视频块，再由 action Transformer 解码动作；IFP 训练分支从当前主干表示预测多个跨步未来视频块，部署时移除。",
      "output": "未来机器人视频块与可执行动作块。",
      "details": "- **输入**：人类任务演示视频（可附语言）、当前及历史机器人观测与动作。\n- **过程**：先以任务均衡方式整理机器人 video-action 数据；再用 VLM、图像编辑和视频生成模型，把机器人轨迹自动转换成语义匹配但背景、视角、物体和 embodiment 可变化的人类视频，构成 HumanGen；模型以人类视频为 prefix memory，因果预测未来机器人视频块，再由 action Transformer 解码动作；IFP 训练分支从当前主干表示预测多个跨步未来视频块，部署时移除。\n- **输出**：未来机器人视频块与可执行动作块。"
    },
    "experiments": "RoboTwin 2.0 按任务划分 43 个训练任务和 7 个完全未见测试任务，每任务每个随机种子运行 100 次闭环 rollout，共 3 个种子。Zero-WAM 的宏平均成功率为 46.95%±0.72%，LingBot-VA 为 17.45%±1.40%，WAN-Action 为 10.98%±1.07%；7 个任务全部领先，但最难的三块堆叠仍只有 9.00%±2.16%。真实双臂 Franka 上，物体放容器、三物体顺序操作、双桌腿插入分别为 53.3%、33.3%、16.7%，对照 LingBot-VA 为 43.3%、10.0%、0%。作者还做了人类视频条件、IFP 和任务均衡预训练消融；这些结果支持上下文有贡献，但完整模型同时改变预训练数据、条件模态与目标函数，不能把全部增益单独归因于 ICL。",
    "evidence_notes": "",
    "code_data_status": "项目页公开，论文详细披露 HumanGen 构建流程和组成；本轮未核验到 HumanGen、训练代码或模型权重的公开下载。HumanGen 中人类视频由生成模型自动合成并经 VLM 筛选，规模大，但真实性、失败过滤误差和生成模型偏差需要独立审计。",
    "limitations": "训练耗时约 15,360 GPU 小时；HumanGen 依赖闭源或外部生成模型，语义一致性仍可能失真；模拟评测只有 7 个未见任务，真实实验每类 30 次试验且成功率仍有限；“zero-shot”是对测试任务无参数更新，不代表模型没有使用同类任务、目标物或机器人数据。人类视频是否被真正使用，应继续做错配视频、顺序反转视频、相同首帧不同目标视频等反事实测试，而不仅是去掉视频。\n\n### 与知域的关系\n\n这是具身 ICL 与 WAM 的直接交叉：它把人类视频从预训练数据提升为部署时任务接口，并把未来视觉预测作为跨 embodiment 的中介。可与 Vid2Robot、ICRT、ViVLA、SeeTraceAct、RICL 对照：Zero-WAM 更强调完整任务演化和未来世界状态，而不是直接复制示范动作或只提取静态技能向量。",
    "comments": "",
    "source_reports": [
      "report-1950a5754f",
      "report-a141624b1e"
    ],
    "deleted": false,
    "updated_at": "2026-08-31",
    "arxiv": {
      "published": "2026-08-26T17:59:34Z",
      "revised_at": "2026-08-27T13:53:16Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2609-24411",
    "title": "Zeva-Ego: Egocentric Mid-Training with In-Context Causal Learning for Robot Manipulation",
    "authors": [
      "Bingjia Huang",
      "Xin Ding",
      "Fu Chen",
      "Kun Li",
      "Wei Sun",
      "Hao Wu",
      "Yunxin Liu",
      "Ting Cao"
    ],
    "year": 2026,
    "publication": "2026，arXiv v2",
    "arxiv_id": "2609.24411",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2609.24411",
      "alphaxiv": "https://alphaxiv.org/abs/2609.24411"
    },
    "tags": [
      "具身上下文学习",
      "动作表征",
      "第一视角与人类视频",
      "跨本体迁移"
    ],
    "figure": {
      "url": "content/images/2609.24411-main.webp",
      "alt": "Figure 1：人类视频中间训练与部署期动作—效果上下文学习的两阶段框架",
      "label": "Figure 1 · 人类视频中间训练与部署期动作—效果上下文学习的两阶段框架",
      "paper_title": "Zeva-Ego: Egocentric Mid-Training with In-Context Causal Learning for Robot Manipulation",
      "source_url": "https://arxiv.org/html/2609.24411v2/zeva_ego_teaser.png"
    },
    "summary": "ACE把egocentric visual transition转成action-centered supervision用于VLA mid-training；ICCL则在部署时根据多次action-effect observation进行parameter-free in-context adaptation。",
    "insight": "ACE把egocentric visual transition转成action-centered supervision用于VLA mid-training；ICCL则在部署时根据多次action-effect observation进行parameter-free in-context adaptation。",
    "pipeline": {
      "input": "egocentric human video、robot observations/action和部署后的action-effect feedback。",
      "process": "ACE学习transition representation → VLA mid-training → ICCL积累执行结果作为context。",
      "output": "机器人动作及随interaction history改善的行为。",
      "details": "**过程**：ACE学习transition representation → VLA mid-training → ICCL积累执行结果作为context。\n\n**输入**：egocentric human video、robot observations/action和部署后的action-effect feedback。\n\n**输出**：机器人动作及随interaction history改善的行为。\n\nACE 提供面向动作效果的中间监督，ICCL 在测试时累积动作及后果，不更新参数。mid-training 的数据规模收益和部署时多次尝试收益来自不同设置，应分别看待。\n\n[原文方法](https://arxiv.org/html/2609.24411)\n\n### 方法细节与实现\n\n**ACE 第一阶段：提取非动作残差。**冻结 DINOv2 提取两帧特征，编码器同时看到已知物理动作，用 4×128 的环境瓶颈表示动作解释不了的相机移动、遮挡和场景变化；解码器在当前特征、动作和该瓶颈的条件下重建未来特征。相机监督、动作依赖抑制和方差正则进一步约束残差通道。\n\n**ACE 第二阶段：仅从视觉提取动作。**保留环境查询并增加 16 个任务查询，编码器只读取两帧 RGB 特征；冻结的第一阶段环境表示作为教师目标，不直接输入第二阶段。物理动作轨迹先相对初态积分并采样为 8 个点，平移、旋转和夹爪分别归一化，以 KL 邻域匹配让相似动作对应相近的视觉任务 token。标注无动作的人类视频时只需视觉输入。\n\n**ICCL 与策略耦合。**π0.5 的语言视觉骨干预测子任务，动作专家以 flow matching 输出连续动作。ICCL 的历史动作—效果上下文直接条件化动作专家，不进入 VLM 骨干；因此高层子任务判断和低层经验修正有不同的计算路径。在线收益来自上下文积累，而非测试时参数更新或显式结构因果模型估计。\n\n[对应方法原文](https://arxiv.org/html/2609.24411#S3)"
    },
    "experiments": "10K小时Ego video使RoboTwin从63.8%提升到75.3%，约等于2K小时robot demonstration的74.7%；ICCL在四次尝试中从58%提升到89%，无参数更新。\n\n\n还需区分 RoboTwin 设置：原文表 1 的 RoboTwin 2.0 Hard 平均成功率为 58.7%，π0.5 为 51.2%；不能与数据规模实验的 75.3% 混用。LIBERO-PRO 表 2 平均为 57.48%，提升在 Spatial 子集尤为突出，但并非所有子集最高。四次尝试 58%→89% 包含额外环境反馈预算，不是单次零样本性能。\n\n[原文实验与表格](https://arxiv.org/html/2609.24411)\n\n**两个增益不能混为一谈。**10K 小时第一视角数据的 63.8%→75.3% 来自数据规模实验；RoboTwin 2.0 Hard 主表为 58.7%，与 π0.5 的 51.2% 比较；四次尝试的 58%→89% 又引入在线反馈预算。这三组数字回答不同问题，均应保留设置名称，避免读者误认为同一测试上的连续提升。\n\n[实验与设置原文](https://arxiv.org/html/2609.24411)",
    "evidence_notes": "已核验原文方法与实验；关键比较与限制见各节",
    "code_data_status": "本次未核验到可下载的官方实现、独立数据或模型权重；具体开放状态仍待核验。",
    "limitations": "所谓“4–5小时Ego≈1小时Robot”只是本模型、本benchmark下的empirical ratio，不能当成通用scaling law。ICCL中的“causal”也不等于SCM或causal identification。",
    "comments": "",
    "source_reports": [],
    "deleted": false,
    "updated_at": "2026-09-24",
    "challenges": "海量第一视角人类视频无法直接提供机器人动作；而部署后一次错误的 action-effect 经验，通常也无法马上被固定策略利用。该工作分别处理离线人类经验利用与在线上下文适配。",
    "motivation": "ACE把egocentric visual transition转成action-centered supervision用于VLA mid-training；ICCL则在部署时根据多次action-effect observation进行parameter-free in-context adaptation。",
    "technical_approach": "**过程**：ACE学习transition representation → VLA mid-training → ICCL积累执行结果作为context。\n\n**输入**：egocentric human video、robot observations/action和部署后的action-effect feedback。\n\n**输出**：机器人动作及随interaction history改善的行为。\n\nACE 提供面向动作效果的中间监督，ICCL 在测试时累积动作及后果，不更新参数。mid-training 的数据规模收益和部署时多次尝试收益来自不同设置，应分别看待。\n\n[原文方法](https://arxiv.org/html/2609.24411)\n\n### 方法细节与实现\n\n**ACE 第一阶段：提取非动作残差。**冻结 DINOv2 提取两帧特征，编码器同时看到已知物理动作，用 4×128 的环境瓶颈表示动作解释不了的相机移动、遮挡和场景变化；解码器在当前特征、动作和该瓶颈的条件下重建未来特征。相机监督、动作依赖抑制和方差正则进一步约束残差通道。\n\n**ACE 第二阶段：仅从视觉提取动作。**保留环境查询并增加 16 个任务查询，编码器只读取两帧 RGB 特征；冻结的第一阶段环境表示作为教师目标，不直接输入第二阶段。物理动作轨迹先相对初态积分并采样为 8 个点，平移、旋转和夹爪分别归一化，以 KL 邻域匹配让相似动作对应相近的视觉任务 token。标注无动作的人类视频时只需视觉输入。\n\n**ICCL 与策略耦合。**π0.5 的语言视觉骨干预测子任务，动作专家以 flow matching 输出连续动作。ICCL 的历史动作—效果上下文直接条件化动作专家，不进入 VLM 骨干；因此高层子任务判断和低层经验修正有不同的计算路径。在线收益来自上下文积累，而非测试时参数更新或显式结构因果模型估计。\n\n[对应方法原文](https://arxiv.org/html/2609.24411#S3)",
    "discussion": "**阅读者分析**：同时覆盖Egocentric World Model / human-video learning / embodied in-context adaptation，与人类视频学习和在线上下文适配直接相关。",
    "arxiv": {
      "published": "2026-09-21",
      "revised_at": "2026-09-22",
      "primary_category": "cs.RO"
    },
    "source_papers": [
      "content/papers/2609.24411.md"
    ]
  },
  {
    "id": "arxiv-2608-30880",
    "title": "Zeva: In-Context Causal Learning for Generalizable Embodied Manipulation",
    "authors": [
      "Fu Chen",
      "Xin Ding",
      "Bingjia Huang",
      "Xiangyu Li",
      "Mingju Wang",
      "Jiawei He",
      "Kun Li",
      "Wei Sun",
      "Yunxin Liu",
      "Hao Wu",
      "Ting Cao"
    ],
    "year": 2026,
    "publication": "2026，arXiv",
    "arxiv_id": "2608.30880",
    "doi": "10.48550/arXiv.2608.30880",
    "links": {
      "paper": "https://arxiv.org/abs/2608.30880",
      "project": "https://air-embodied-brain.github.io/Zeva/",
      "code": "https://github.com/air-embodied-brain/Zeva",
      "model": "https://huggingface.co/chen123fu/zeva-robocasa",
      "alphaxiv": "https://alphaxiv.org/abs/2608.30880"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "机器人学习",
      "流式与自回归",
      "物理建模与仿真",
      "第一视角与人类视频",
      "跨本体迁移"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2608.30880v1/zeva_v2.png",
      "alt": "Zeva 总体框架与交互记忆流程",
      "label": "Zeva 总体框架与交互记忆流程；来源：论文原图",
      "paper_title": "Zeva: In-Context Causal Learning for Generalizable Embodied Manipulation",
      "source_url": "https://arxiv.org/html/2608.30880v1/zeva_v2.png"
    },
    "summary": "Zeva 让机器人从自身交互中在线学习，同时保持策略模型冻结。它使用 Causal Interaction Extractor 将执行动作及其诱导的状态变化编码成因果交互信号，并存储在双时间尺度记忆中。后续动作通过检索相关交互信号，将经验作为上下文注入冻结策略。",
    "insight": "Zeva 让机器人从自身交互中在线学习，同时保持策略模型冻结。它使用 Causal Interaction Extractor 将执行动作及其诱导的状态变化编码成因果交互信号，并存储在双时间尺度记忆中。后续动作通过检索相关交互信号，将经验作为上下文注入冻结策略。",
    "pipeline": {
      "input": "机器人观测、执行动作、动作后的状态变化、历史交互记忆。",
      "process": "提取动作—状态变化关系，写入短期和长期记忆；根据当前任务检索相关经验，并作为上下文提供给冻结策略。",
      "output": "经过交互经验调节的机器人动作。",
      "details": "**输入**：机器人观测、执行动作、动作后的状态变化、历史交互记忆。\n\n**过程**：提取动作—状态变化关系，写入短期和长期记忆；根据当前任务检索相关经验，并作为上下文提供给冻结策略。\n\n**输出**：经过交互经验调节的机器人动作。"
    },
    "experiments": "摘要声称在仿真和真实机器人操作中优于若干 VLA 和 WAM baseline，并且成功率随交互经验增加而提升。尚未核验：\n\n- 记忆检索是否优于普通轨迹检索；\n- \"causal\"信号是否经过干预实验验证；\n- 在线经验是否跨任务泛化；\n- 真实机器人实验的任务数量、重复次数和失败案例。",
    "evidence_notes": "",
    "code_data_status": "未在 arXiv comments 中发现公开链接。",
    "limitations": "该方法的\"causal\"命名需要谨慎解释。目前摘要支持的是动作导致状态变化的记忆建模，不足以证明结构因果模型、因果识别或反事实推理。\n\n### 与知域的关系\n\n该工作与知域已有 Zero-WAM、S1、VLA-JEPA、Causal World Modeling for Robot Control 和 What-If World 直接相关，适合作为具身 ICL 与因果交互记忆的重点新线索。",
    "comments": "",
    "source_reports": [
      "report-0d81d19c6c"
    ],
    "deleted": false,
    "updated_at": "2026-09-08",
    "arxiv": {
      "published": "2026-08-31T14:39:00Z",
      "revised_at": "2026-08-31T14:39:00Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2609-00188",
    "title": "ZimaBlue: Evolving Generalizable World Action Models through Scalable Video Pre-training",
    "authors": [
      "Xionghao Wu",
      "Yijun Yang",
      "Shiyang Zhou",
      "Haoze Sun",
      "Jianhui Liu",
      "Songsong Yu",
      "Jiyao Zhang",
      "Wenbo Li",
      "Bo Wang",
      "Guoqing Ma",
      "Lin Song",
      "Renjie Liao",
      "Shenghe Zheng",
      "Wei Tang",
      "Xiaojuan Qi",
      "Yanwei Li",
      "Yuan Zhang",
      "Zhuotao Tian",
      "Haoyang Huang",
      "Nan Duan"
    ],
    "year": 2026,
    "publication": "2026，arXiv",
    "arxiv_id": "2609.00188",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2609.00188",
      "alphaxiv": "https://alphaxiv.org/abs/2609.00188"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "World Action Model",
      "世界模型",
      "具身上下文学习",
      "因果与反事实",
      "机器人学习",
      "流式与自回归",
      "物理建模与仿真",
      "第一视角与人类视频",
      "跨本体迁移"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2609.00188v1/teaser.svg",
      "alt": "ZimaBlue 跨具身世界动作模型概览",
      "label": "ZimaBlue 跨具身世界动作模型概览；来源：论文原图",
      "paper_title": "ZimaBlue: Evolving Generalizable World Action Models through Scalable Video Pre-training",
      "source_url": "https://arxiv.org/html/2609.00188v1/teaser.svg"
    },
    "summary": "ZimaBlue 试图利用大规模人类和机器人第一视角视频学习可泛化的 World Action Model。摘要描述了三阶段训练流程：",
    "insight": "ZimaBlue 试图利用大规模人类和机器人第一视角视频学习可泛化的 World Action Model。摘要描述了三阶段训练流程：\n\n1. 因果具身视频预训练；\n2. 视频—动作中训练，将视觉动态与异构机器人轨迹对齐；\n3. 针对目标机器人进行部署适配。\n\n论文还提出 Slow–Fast 双系统：Slow 分支提供高容量世界模型表示，Fast 分支负责实时动作预测。摘要声称 Fast 分支可在 RTX 4090 上达到 30 Hz，但具体动作空间、预测延迟和成功率需要全文核验。",
    "pipeline": {
      "input": "人类第一视角视频、机器人第一视角视频、异构机器人轨迹、目标机器人数据。",
      "process": "先学习大规模视觉动态，再通过统一动作表示将视觉动态对齐到机器人轨迹，最后针对目标机器人进行适配；推理阶段由高容量 Slow 模型和轻量 Fast 动作分支协同工作。",
      "output": "面向目标机器人的动作预测和未来视觉动态表示。",
      "details": "**输入**：人类第一视角视频、机器人第一视角视频、异构机器人轨迹、目标机器人数据。\n\n**过程**：先学习大规模视觉动态，再通过统一动作表示将视觉动态对齐到机器人轨迹，最后针对目标机器人进行适配；推理阶段由高容量 Slow 模型和轻量 Fast 动作分支协同工作。\n\n**输出**：面向目标机器人的动作预测和未来视觉动态表示。"
    },
    "experiments": "摘要明确声称进行了真实机器人零样本评估，并比较了仅使用目标机器人数据与加入大规模视频预训练的方案。但当前尚未核验：\n\n- 使用了哪些机器人、本体和任务；\n- 零样本的具体定义；\n- 是否存在目标任务或场景泄漏；\n- 与哪些 WAM/VLA baseline 比较；\n- 30 Hz 是否包含视觉编码、采样和动作后处理时间。\n\n因此，目前只能确认其研究方向和系统设计，不能据摘要扩大为全面的跨本体泛化结论。",
    "evidence_notes": "",
    "code_data_status": "arXiv 页面未提供明确代码、数据或模型链接，开放状态待人工核验。",
    "limitations": "- 人类视频中的视觉变化如何被转化为可执行动作仍是核心难点。\n- 统一动作表示可能牺牲不同机器人本体的精细控制能力。\n- Slow–Fast 架构的实时性可能依赖硬件、分辨率和缓存策略。\n- 需要检查长时任务、遮挡、接触失败和分布外物体上的表现。\n\n### 与知域的关系\n\n该工作直接连接知域中的 Zero-WAM、FlowWAM、Motus、DreamWAM、LD4WAM 和跨具身世界模型路线，尤其适合用于研究\"人类视频预训练如何转化为机器人动作监督\"。",
    "comments": "",
    "source_reports": [
      "report-0d81d19c6c"
    ],
    "deleted": false,
    "updated_at": "2026-09-08",
    "arxiv": {
      "published": "2026-08-31T18:09:52Z",
      "revised_at": "2026-08-31T18:09:52Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2606-13769",
    "title": "μ₀: A Scalable 3D Interaction-Trace World Model",
    "authors": [
      "Seungjae Lee",
      "Yoonkyo Jung",
      "Jusuk Lee",
      "Jonghun Shin",
      "Amir Hossein Shahidzadeh",
      "Yao-Chih Lee",
      "H. Jin Kim",
      "Jia-Bin Huang",
      "Furong Huang"
    ],
    "year": 2026,
    "publication": "2026，arXiv preprint",
    "arxiv_id": "2606.13769",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2606.13769",
      "project": "https://mu0-wm.github.io/",
      "alphaxiv": "https://alphaxiv.org/abs/2606.13769"
    },
    "tags": [
      "3D/4D",
      "世界模型",
      "动作表征",
      "机器人学习",
      "跨本体迁移"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2606.13769/x1.png",
      "alt": "μ₀ Fig. 1",
      "label": "μ₀，Fig. 1，从异构视频提取语义 3D interaction traces 并复用于 action expert。来源：Fig. 1 原图",
      "paper_title": "μ₀: A Scalable 3D Interaction-Trace World Model",
      "source_url": "https://arxiv.org/html/2606.13769/x1.png"
    },
    "summary": "μ₀ 将 TraceGen 的固定网格升级为语义交互点，把 episode caption 改为事件级语言，并让 action expert 直接消费 trace-denoising features。目标是从无动作视频学可复用运动先验，再以小型本体模块解码动作；与本专题直接相关。",
    "insight": "μ₀ 将 TraceGen 的固定网格升级为语义交互点，把 episode caption 改为事件级语言，并让 action expert 直接消费 trace-denoising features。目标是从无动作视频学可复用运动先验，再以小型本体模块解码动作；与本专题直接相关。",
    "pipeline": {
      "input": "RGB、语言、1–256 个无序 keypoint query，可选深度和 8 步历史 trace。",
      "process": "TraceExtract 用 DINOv2 聚类实体，VGGT+TAPIP3D 做全局 3D 对齐，以运动事件切分并生成层级 caption。SmolVLM2-2.2B 前 20 层与 20 层 Trace Expert 联合条件化；每条未来 32 步 trace 用 10 个三次 B-spline 控制点，经 semantic flow matching、validity 与 rigidity loss 生成，4 步 Euler 解码。冻结 μ₀ 后，action expert 读取一次部分去噪特征并用 flow matching 输出 action chunk。",
      "output": "平滑、可变查询的未来 3D traces，或目标本体动作块。",
      "details": "- **输入：** RGB、语言、1–256 个无序 keypoint query，可选深度和 8 步历史 trace。\n- **过程：** TraceExtract 用 DINOv2 聚类实体，VGGT+TAPIP3D 做全局 3D 对齐，以运动事件切分并生成层级 caption。SmolVLM2-2.2B 前 20 层与 20 层 Trace Expert 联合条件化；每条未来 32 步 trace 用 10 个三次 B-spline 控制点，经 semantic flow matching、validity 与 rigidity loss 生成，4 步 Euler 解码。冻结 μ₀ 后，action expert 读取一次部分去噪特征并用 flow matching 输出 action chunk。\n- **输出：** 平滑、可变查询的未来 3D traces，或目标本体动作块。"
    },
    "experiments": "3D trace、T=32 的 top-5 ADE/FDE/DTW：μ₀ 0.239/0.305/0.223，TraceGen 0.325/0.370/0.299，Dream2Flow 0.336/0.403/0.329。单 A6000 推理 0.29 s，TraceGen 1.20 s、Dream2Flow 106.8 s；μ₀ 为 2.59B。\n\nRoboCasa365 8 任务，每任务 100 demos、50 eval：μ₀ 30.25%，Diffusion Policy 22.75、π0 25.25、π0.5 42、TraceGen+expert 23。真实 UR3 三任务分别 90/80/50 demos、每任务 20 次，μ₀ 平均 91.7%，但仅同一双指夹爪。B-spline 消融的 T=32 top-5 DTW 0.223 vs 0.258；模型 342M→568M→2.59B 为 0.240→0.227→0.223。数据 scaling 并非每个时域严格单调。预训练 2 张未注明型号 GPU、200k steps；RoboCasa expert 为 4×L40S、50k steps。",
    "evidence_notes": "",
    "code_data_status": "项目页与论文公开；未核验代码、checkpoint 或 TraceExtract 数据入口，绝对训练数据规模也未披露。",
    "limitations": "- 聚类、3D 重建、跟踪和 caption 存在级联伪标签误差。\n- trace 没有显式力、触觉与接触模式。\n- 下游集中于桌面操作，移动机器人与灵巧手未验证。\n- RoboCasa 成功率仍低于 π0.5。\n- 真实实验仅 UR3 双指夹爪，跨本体结论有限。",
    "comments": "",
    "source_reports": [
      "report-a77d9a7ad6"
    ],
    "deleted": false,
    "updated_at": "2026-08-21",
    "challenges": "固定网格 trace 浪费预算在背景并漏掉接触点；局部/2D 轨迹混淆相机和物体运动，episode caption 又不能描述局部子目标。原始 waypoint 噪声大，且世界模型视频预训练需要与本体动作监督解耦。",
    "motivation": "μ₀ 将 TraceGen 的固定网格升级为语义交互点，把 episode caption 改为事件级语言，并让 action expert 直接消费 trace-denoising features。目标是从无动作视频学可复用运动先验，再以小型本体模块解码动作；与本专题直接相关。",
    "technical_approach": "- **输入：** RGB、语言、1–256 个无序 keypoint query，可选深度和 8 步历史 trace。\n- **过程：** TraceExtract 用 DINOv2 聚类实体，VGGT+TAPIP3D 做全局 3D 对齐，以运动事件切分并生成层级 caption。SmolVLM2-2.2B 前 20 层与 20 层 Trace Expert 联合条件化；每条未来 32 步 trace 用 10 个三次 B-spline 控制点，经 semantic flow matching、validity 与 rigidity loss 生成，4 步 Euler 解码。冻结 μ₀ 后，action expert 读取一次部分去噪特征并用 flow matching 输出 action chunk。\n- **输出：** 平滑、可变查询的未来 3D traces，或目标本体动作块。",
    "discussion": "μ₀ 在表示、速度与 action-feature interface 上系统升级 TraceGen，但 RoboCasa 绝对成功率仅 30.25%，显著低于 π0.5。真实结果强但本体单一，因此支持视频预训练迁移运动结构，不足以证明广泛跨本体动作泛化。",
    "arxiv": {
      "published": "2026-06-11T17:59:56Z",
      "revised_at": "2026-06-15T06:13:42Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2609-26795",
    "title": "ϕ-RIE: From Photorealistic Reconstruction to Interactive Environments",
    "authors": [
      "Runyi Yang",
      "Deheng Zhang",
      "Xiaoye Wang",
      "Kanzhi Wu",
      "Lei Sun",
      "Ajad Chhatkuli",
      "Kunyu Peng",
      "Luc Van Gool",
      "Danda Pani Paudel"
    ],
    "year": 2026,
    "publication": "2026，arXiv",
    "arxiv_id": "2609.26795",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2609.26795",
      "project": "https://insait-institute.github.io/PhiRIE/",
      "alphaxiv": "https://alphaxiv.org/abs/2609.26795"
    },
    "tags": [
      "3D/4D",
      "Agent与可执行世界",
      "物理建模与仿真"
    ],
    "figure": {
      "url": "content/images/2609.26795-main.webp",
      "alt": "Figure 2：联合构建独立物体和背景高斯，并将视觉资产与物理状态同步",
      "label": "Figure 2 · 联合构建独立物体和背景高斯，并将视觉资产与物理状态同步",
      "paper_title": "ϕ-RIE: From Photorealistic Reconstruction to Interactive Environments",
      "source_url": "https://arxiv.org/html/2609.26795v1/main.png"
    },
    "summary": "普通3DGS能render但不能交互。ϕ-RIE将selected object从reconstruction中拆出来，构建可移动simulation asset，同时完成被对象遮挡的background，使visual state和physical state保持注册。",
    "insight": "普通3DGS能render但不能交互。ϕ-RIE将selected object从reconstruction中拆出来，构建可移动simulation asset，同时完成被对象遮挡的background，使visual state和physical state保持注册。",
    "pipeline": {
      "input": "photorealistic 3DGS scene和selected objects。",
      "process": "Scene Observation收集几何/appearance evidence → coupled asset reconstruction和source removal/background completion → registration retry与physical acceptance → simulator integration。",
      "output": "保留原场景外观、但部分对象可移动/接触的interactive environment。",
      "details": "**过程**：Scene Observation收集几何/appearance evidence → coupled asset reconstruction和source removal/background completion → registration retry与physical acceptance → simulator integration。\n\n**输入**：photorealistic 3DGS scene和selected objects。\n\n**输出**：保留原场景外观、但部分对象可移动/接触的interactive environment。\n\n将对象资产构建与原位置移除/背景补全联合处理；用观察证据选择候选并执行注册重试，物理接受检查后接入模拟器。资产外观、碰撞代理和世界坐标注册承担不同职责，应分别评价。\n\n[原文方法](https://arxiv.org/html/2609.26795)\n\n### 方法细节与实现\n\n**为什么不能直接移动原高斯。**照片重建的3DGS保留了可见表面外观，却可能把物体、背景和遮挡关系混在一起。将某个物体简单抠出并移动，会暴露缺失背面、残留幽灵和背景空洞。ϕ-RIE 因而同时处理独立对象资产与移除对象后的背景。\n\n**耦合场景构建。**对象候选由生成/重建后端产生，并根据观测表面进行注册；候选几何不仅决定对象外观，还影响哪些原高斯应从背景删除。系统据此联合选择对象候选和背景表示，避免对象与背景分别优化却无法组合。TRELLIS、ReconViaGen 等后端提供资产先验，不是从观测中唯一恢复不可见形状。\n\n**视觉与物理状态联动。**对象拥有物理碰撞表示和高斯视觉表示，模拟器推进刚体状态后同步更新渲染姿态，可选外观协调减少新旧资产接缝。MuJoCo/PyBullet承担物理步进，高斯渲染负责视觉；照片级外观与真实物理参数准确性是两个独立要求。\n\n[对应方法原文](https://arxiv.org/html/2609.26795#S3)"
    },
    "experiments": "50个ScanNet++ scenes上，在相同retention下evidence selection + registration retry使matched F1@20mm从0.336提升到0.383；严格筛选可进一步改善质量但会显著减少保留asset数量。\n\n\n表 2 在同样保留 1800 个对象、其中 566 个可匹配评测对象时，固定优先级 F1@20mm=0.336、CD=7.638 cm；完整方法为 0.383、5.720 cm，耗时由 35.68 增至 70.82 分钟/场景。严格 acceptance 使 F1 达 0.425，但仅保留 399 个、匹配 134 个对象，属于质量—覆盖率权衡，不能当作无代价提升。\n\n[原文实验与表格](https://arxiv.org/html/2609.26795)\n\n**保留与匹配口径。**50场景发出1,871个对象请求，保留1,800个、匹配评测566个；严格保留设置则是399个、匹配134个。主F1为0.383、CD为5.72，对照0.336/7.638；严格子集F1升至0.425伴随覆盖缩小。平均约70.82分钟/场景，说明高保真交互转换仍有明显离线成本。\n\n[实验与设置原文](https://arxiv.org/html/2609.26795)",
    "evidence_notes": "已核验原文方法与实验；关键比较与限制见各节",
    "code_data_status": "已核验官方项目页。它链接到 `insait-institute/PhiRIE` 并展示 release 入口，但 2026-09-24 访问该 GitHub 仓库返回 404，当前不能确认代码、权重或资产可公开下载。",
    "limitations": "论文自己的interaction study显示repair与destination reconstruction仍会显著减少可执行成功数量，说明asset compatibility和hidden geometry completion仍是瓶颈。",
    "comments": "",
    "source_reports": [],
    "deleted": false,
    "updated_at": "2026-09-24",
    "challenges": "静态 3DGS 能渲染，不代表能在机器人仿真中移动对象。取出对象会暴露缺失背景，生成补全资产还可能与真实坐标、尺度和碰撞几何失配。",
    "motivation": "普通3DGS能render但不能交互。ϕ-RIE将selected object从reconstruction中拆出来，构建可移动simulation asset，同时完成被对象遮挡的background，使visual state和physical state保持注册。",
    "technical_approach": "**过程**：Scene Observation收集几何/appearance evidence → coupled asset reconstruction和source removal/background completion → registration retry与physical acceptance → simulator integration。\n\n**输入**：photorealistic 3DGS scene和selected objects。\n\n**输出**：保留原场景外观、但部分对象可移动/接触的interactive environment。\n\n将对象资产构建与原位置移除/背景补全联合处理；用观察证据选择候选并执行注册重试，物理接受检查后接入模拟器。资产外观、碰撞代理和世界坐标注册承担不同职责，应分别评价。\n\n[原文方法](https://arxiv.org/html/2609.26795)\n\n### 方法细节与实现\n\n**为什么不能直接移动原高斯。**照片重建的3DGS保留了可见表面外观，却可能把物体、背景和遮挡关系混在一起。将某个物体简单抠出并移动，会暴露缺失背面、残留幽灵和背景空洞。ϕ-RIE 因而同时处理独立对象资产与移除对象后的背景。\n\n**耦合场景构建。**对象候选由生成/重建后端产生，并根据观测表面进行注册；候选几何不仅决定对象外观，还影响哪些原高斯应从背景删除。系统据此联合选择对象候选和背景表示，避免对象与背景分别优化却无法组合。TRELLIS、ReconViaGen 等后端提供资产先验，不是从观测中唯一恢复不可见形状。\n\n**视觉与物理状态联动。**对象拥有物理碰撞表示和高斯视觉表示，模拟器推进刚体状态后同步更新渲染姿态，可选外观协调减少新旧资产接缝。MuJoCo/PyBullet承担物理步进，高斯渲染负责视觉；照片级外观与真实物理参数准确性是两个独立要求。\n\n[对应方法原文](https://arxiv.org/html/2609.26795#S3)",
    "discussion": "**阅读者分析**：它连接Feedforward/3D reconstruction和world simulator，值得关注“从可看3D重建到可交互世界状态”的研究接口。",
    "arxiv": {
      "published": "2026-09-22",
      "revised_at": "",
      "primary_category": "cs.RO"
    },
    "source_papers": [
      "content/papers/2609.26795.md"
    ]
  },
  {
    "id": "arxiv-2508-18269",
    "title": "FlowVLA: Thinking in Motion with a Visual Chain of Thought",
    "authors": [
      "Zhide Zhong",
      "Haodong Yan",
      "Junfeng Li",
      "Xiangchen Liu",
      "Xin Gong",
      "Tianran Zhang",
      "Wenxuan Song",
      "Jiayi Chen",
      "Xinhu Zheng",
      "Hesheng Wang",
      "Haoang Li"
    ],
    "year": 2025,
    "publication": "2025，arXiv preprint；arXiv:2508.18269",
    "arxiv_id": "2508.18269",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2508.18269",
      "project": "https://irpn-lab.github.io/FlowVLA/",
      "alphaxiv": "https://alphaxiv.org/abs/2508.18269"
    },
    "tags": [
      "3D/4D",
      "HOI",
      "VLA",
      "世界模型",
      "因果与反事实"
    ],
    "figure": null,
    "summary": "先预测 optical flow 再预测未来图像，使 motion 成为显式瓶颈，并通过修改 flow 检查未来是否随中间运动变化。",
    "insight": "先预测 optical flow 再预测未来图像，使 motion 成为显式瓶颈，并通过修改 flow 检查未来是否随中间运动变化。",
    "pipeline": {
      "input": "当前视觉观测、语言指令及机器人训练轨迹",
      "process": "单一自回归 Transformer 执行 image→flow→future image ，再用于 VLA policy 学习；对 flow 做内部 intervention",
      "output": "optical flow、未来帧与机器人动作",
      "details": "- **输入：** 当前视觉观测、语言指令及机器人训练轨迹\n- **过程：** 单一自回归 Transformer 执行 `image→flow→future image`，再用于 VLA policy 学习；对 flow 做内部 intervention\n- **输出：** optical flow、未来帧与机器人动作"
    },
    "experiments": "论文在机器人操作 benchmark 报告相对基线更好的预测一致性、控制表现和样本效率；项目页展示固定观测下的 counterfactual flow intervention。因正式表格与统计细节需逐项复现，本报告不扩大其 SOTA 范围。",
    "evidence_notes": "",
    "code_data_status": "项目页公开，代码截至核验日标注 coming soon；使用公开机器人数据的具体版本以论文为准。",
    "limitations": "- 2D flow 难表达遮挡后的 3D 接触与状态变化。\n- 内部 intervention 不等价于环境 `do` 操作。\n- 无 SCM、混杂审计或个体反事实。\n- 开放代码与计算成本仍待核。",
    "comments": "",
    "source_reports": [],
    "deleted": false,
    "updated_at": "2026-09-02",
    "challenges": "直接 next-frame prediction 混合静态外观与运动，视觉合理的未来可能没有执行指令对应的运动。",
    "motivation": "先预测 optical flow 再预测未来图像，使 motion 成为显式瓶颈，并通过修改 flow 检查未来是否随中间运动变化。",
    "technical_approach": "- **输入：** 当前视觉观测、语言指令及机器人训练轨迹\n- **过程：** 单一自回归 Transformer 执行 `image→flow→future image`，再用于 VLA policy 学习；对 flow 做内部 intervention\n- **输出：** optical flow、未来帧与机器人动作",
    "discussion": "Flow 是 Object Motion 的可操控代理，但不是对象状态或接触机制；改变内部 flow 后输出改变，只证明模型机制敏感性，不等于外部物理因果效应被识别。",
    "arxiv": {
      "published": "2025-08-25T17:59:21Z",
      "revised_at": "2025-10-07T12:30:17Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2412-07772",
    "title": "From Slow Bidirectional to Fast Autoregressive Video Diffusion Models",
    "authors": [
      "Tianwei Yin",
      "Qiang Zhang",
      "Richard Zhang",
      "William T. Freeman",
      "Frédo Durand",
      "Eli Shechtman",
      "Xun Huang"
    ],
    "year": 2025,
    "publication": "2025，CVPR 2025（ Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition ，pp. 22963–22974）。Tianwei Yin 与 Qiang Zhang 为共同一作，通讯 tianweiy@mit.edu。预印本 arXiv:2412.07772（v4，cs.CV）。arXiv DOI：10.48550/arXiv.2412.07772。IEEE Xplore 正式 DOI 本次未单独打开核验。模型通称 CausVid 。",
    "arxiv_id": "2412.07772",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2412.07772",
      "publication": "https://openaccess.thecvf.com/content/CVPR2025/html/Yin_From_Slow_Bidirectional_to_Fast_Autoregressive_Video_Diffusion_Models_CVPR_2025_paper.html",
      "project": "https://causvid.github.io/",
      "code": "https://github.com/tianweiy/CausVid",
      "model": "https://huggingface.co/tianweiy/CausVid",
      "alphaxiv": "https://alphaxiv.org/abs/2412.07772"
    },
    "tags": [
      "3D/4D",
      "Agent与可执行世界",
      "因果与反事实",
      "流式与自回归",
      "视频生成"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2412.07772v4/teaser_final.png",
      "alt": "CausVid Fig. 1: bidirectional vs few-step causal streaming generation",
      "label": "CausVid，Fig. 1，双向 50-step 与 4-step 因果流式生成的延迟对比。来源：Fig. 1 原图 PNG",
      "paper_title": "From Slow Bidirectional to Fast Autoregressive Video Diffusion Models",
      "source_url": "https://arxiv.org/html/2412.07772v4/teaser_final.png"
    },
    "summary": "核心 Insight： 不对称蒸馏——用双向 teacher 的分布匹配监督因果学生，而不是先把 teacher 也改成因果再蒸馏。 DMD 在分布层匹配，允许 teacher/student 架构不同；ODE 轨迹初始化用来稳住后续 DMD。这改变的是注意力接口（block-wise causal）和训练信号（分布匹配而非逐步 denoising），不是再训一个更强的双向生成器。",
    "insight": "核心 Insight：**不对称蒸馏——用双向 teacher 的分布匹配监督因果学生，而不是先把 teacher 也改成因果再蒸馏。** DMD 在分布层匹配，允许 teacher/student 架构不同；ODE 轨迹初始化用来稳住后续 DMD。这改变的是注意力接口（block-wise causal）和训练信号（分布匹配而非逐步 denoising），不是再训一个更强的双向生成器。\n\n与本知识库课题 **间接相关**：它是后续 Self Forcing / Causal Forcing 的起点，也把交互视频、游戏渲染、机器人视频奖励列为应用方向，但本文本身不做动作条件世界模型，也不做 \\(do(\\cdot)\\)。可借鉴点是：因果注意力 + KV cache + few-step 蒸馏这一工程接口。",
    "pipeline": {
      "input": "文本 prompt；可选首帧图像或流式视频块。潜空间由 3D VAE 把 16 像素帧压成 5 个 latent 帧。训练分辨率 352× 640、12 FPS、约 10 s。",
      "process": "学生与 teacher 同构，但块内双向、块间因果。先用 bidirectional teacher 生成约 1000 条 ODE 轨迹，对学生做 3000 iter 回归初始化；再用 asymmetric DMD（双向 s data 监督因果 G phi，在线训 s gen）6000 iter。推理每块 4 步，时间步 [999,748,502,247]，用 KV cache；推理时不再需要训练用的 block-causal mask。全流程约 2 天 × 64 H100。数据约 40 万内部有版权单镜头视频 + 图像，按 CogVideoX 配方过滤。",
      "output": "流式视频帧。文中测得首帧延迟 1.3 s、之后约 9.4 FPS（H100，10 s / 120 帧 / 640× 352）。零样本支持 I2V、流式 V2V（SDEdit 式对块加 t 1 噪声再一步去噪）、动态换 prompt。",
      "details": "- **输入：** 文本 prompt；可选首帧图像或流式视频块。潜空间由 3D VAE 把 16 像素帧压成 5 个 latent 帧。训练分辨率 \\(352\\times 640\\)、12 FPS、约 10 s。\n- **过程：** 学生与 teacher 同构，但块内双向、块间因果。先用 bidirectional teacher 生成约 1000 条 ODE 轨迹，对学生做 3000 iter 回归初始化；再用 asymmetric DMD（双向 \\(s_{\\text{data}}\\) 监督因果 \\(G_\\phi\\)，在线训 \\(s_{\\text{gen}}\\)）6000 iter。推理每块 4 步，时间步 \\([999,748,502,247]\\)，用 KV cache；推理时不再需要训练用的 block-causal mask。全流程约 2 天 × 64 H100。数据约 40 万内部有版权单镜头视频 + 图像，按 CogVideoX 配方过滤。\n- **输出：** 流式视频帧。文中测得首帧延迟 1.3 s、之后约 9.4 FPS（H100，10 s / 120 帧 / \\(640\\times 352\\)）。零样本支持 I2V、流式 V2V（SDEdit 式对块加 \\(t_1\\) 噪声再一步去噪）、动态换 prompt。\n\n与最近 baseline 的实质差异：相对 CogVideoX / MovieGen，生成是因果流式而非整段双向；相对把因果 teacher 再蒸馏的朴素路线，teacher 保持双向。作者自己的消融显示：many-step 因果微调会把误差累积传下去；双向 teacher + ODE init 才是最终配置。"
    },
    "experiments": "**作者主张：** 这是首个质量上能与双向扩散竞争的自回归视频生成方法；VBench-Long total 84.27 超过当时所有官方评测模型；相对同规模 CogVideoX 延迟降约 \\(160\\times\\)、吞吐升约 \\(16\\times\\)。\n\n实验实际支持（数字均来自原文表格/正文）：\n\n- **短视频（MovieGen 前 128 prompt，长度尽量贴近 10 s）：** Temporal / Frame / Text = **94.7 / 64.4 / 30.1**，高于 CogVideoX-5B、OpenSORA、Pyramid Flow、MovieGen。\n- **约 30 s 长视频：** Temporal / Frame / Text = **94.9 / 63.4 / 28.9**；成像质量随时间曲线显示因果 teacher 会崩，不对称 DMD 学生能撑住。\n- **效率（H100，10 s / 120 帧）：** CausVid 1.3 s / 9.4 FPS vs CogVideoX-5B 208.6 s / 0.6 FPS、双向 teacher 219.2 s / 0.6 FPS。\n- **消融：** 双向 many-step 94.6/62.7/29.6；因果 many-step 92.4/60.1/28.5；ODE init + 因果 teacher 的 4-step 学生 91.9/61.7/28.2；最终 ODE init + 双向 teacher **94.7/64.4/30.1**。无 ODE init 的双向 teacher 4-step 为 93.4/60.6/29.4。\n- **I2V（VBench-I2V 设定，无额外训练）：** 92.0 / 65.0 / 28.9，高于 CogVideoX-5B 与 Pyramid Flow。\n- **流式 V2V：** 相对 StreamV2V，在 60 条 ≥16 帧的 DAVIS 视频上 Temporal/Frame/Text 为 93.2/61.7/27.7 vs 92.5/59.3/26.9。\n- **附录 VBench-Long（946 prompt，16 指标）：** Total **84.27**，Quality 85.65，Semantic 78.75；Dynamic Degree 92.69。这是完整榜，不是主表 128-prompt 子集。\n- **用户研究：** MovieGenBench 前 29 prompt × 3 评分者；相对 MovieGen / CogVideoX / Pyramid Flow 偏好 >50%。固定 seed=0。\n\n**证据未支持：** 无限长视频无质量下降；DMD 保持 teacher 多样性；该内部 teacher 的数字可直接与后来 Wan2.1-1.3B 上的 CausVid 重实现横比（分辨率、骨干都不同）。",
    "evidence_notes": "",
    "code_data_status": "- **代码：** [tianweiy/CausVid](https://github.com/tianweiy/CausVid)，README 标明 CVPR 2025。\n- **权重：** Hugging Face `tianweiy/CausVid`。\n- **数据：** 约 40 万内部有版权视频，完整预训练语料不能公开复现。后续 Self Forcing 比较用的是官方 Wan-1.3B 重实现，不是这篇内部 teacher 的原权重。",
    "limitations": "- 14 分钟示例已有轻微过曝；作者承认极端长视频质量仍降。\n- 首帧延迟被 5-latent-frame VAE 卡住，要再降一个数量级需 frame-wise VAE。\n- reverse KL / DMD 降低输出多样性。\n- 学生帧质量可超过双向 teacher，但 temporal flickering 与多样性更差。\n- 主表 128-prompt 与附录全量 VBench-Long 不可混引。\n- 训练数据不公开，原始 CausVid 与 Wan 重实现不可直接比分数。\n\n---",
    "comments": "",
    "source_reports": [
      "report-c7ced2c92d"
    ],
    "deleted": false,
    "updated_at": "2026-08-21",
    "challenges": "领域长期问题是：高质量视频扩散依赖双向注意力，单帧生成必须看到未来，延迟与显存随帧数二次增长，无法做流式交互。本文针对的具体缺口是：**如何把已经训好的双向 DiT 变成可 KV cache 的少步因果生成器，同时不把误差累积原样传给学生。**\n\n- **作者明确指出的失败模式：** 双向 DiT 生成 128 帧需整段算完才能看第一帧（文中 teacher 约 219 s）；朴素 AR 视频模型虽降低首帧等待，但仍远达不到交互帧率，且逐步累积误差。\n- **蒸馏缺口：** 当时视频蒸馏几乎都把非因果 teacher 蒸成非因果学生，且多针对 <2 s 短片。把因果 teacher 再蒸成 few-step 学生会继承更弱 teacher 和其误差累积。\n- **评测缺口：** 主表短视频用 MovieGen 前 128 个 prompt 的 VBench 三轴，不是完整 VBench；完整 946-prompt VBench-Long 放在附录。不要把 94.7 的 Temporal Quality 和 84.27 的 Total Score 混成同一套数字。",
    "motivation": "核心 Insight：**不对称蒸馏——用双向 teacher 的分布匹配监督因果学生，而不是先把 teacher 也改成因果再蒸馏。** DMD 在分布层匹配，允许 teacher/student 架构不同；ODE 轨迹初始化用来稳住后续 DMD。这改变的是注意力接口（block-wise causal）和训练信号（分布匹配而非逐步 denoising），不是再训一个更强的双向生成器。\n\n与本知识库课题 **间接相关**：它是后续 Self Forcing / Causal Forcing 的起点，也把交互视频、游戏渲染、机器人视频奖励列为应用方向，但本文本身不做动作条件世界模型，也不做 \\(do(\\cdot)\\)。可借鉴点是：因果注意力 + KV cache + few-step 蒸馏这一工程接口。",
    "technical_approach": "- **输入：** 文本 prompt；可选首帧图像或流式视频块。潜空间由 3D VAE 把 16 像素帧压成 5 个 latent 帧。训练分辨率 \\(352\\times 640\\)、12 FPS、约 10 s。\n- **过程：** 学生与 teacher 同构，但块内双向、块间因果。先用 bidirectional teacher 生成约 1000 条 ODE 轨迹，对学生做 3000 iter 回归初始化；再用 asymmetric DMD（双向 \\(s_{\\text{data}}\\) 监督因果 \\(G_\\phi\\)，在线训 \\(s_{\\text{gen}}\\)）6000 iter。推理每块 4 步，时间步 \\([999,748,502,247]\\)，用 KV cache；推理时不再需要训练用的 block-causal mask。全流程约 2 天 × 64 H100。数据约 40 万内部有版权单镜头视频 + 图像，按 CogVideoX 配方过滤。\n- **输出：** 流式视频帧。文中测得首帧延迟 1.3 s、之后约 9.4 FPS（H100，10 s / 120 帧 / \\(640\\times 352\\)）。零样本支持 I2V、流式 V2V（SDEdit 式对块加 \\(t_1\\) 噪声再一步去噪）、动态换 prompt。\n\n与最近 baseline 的实质差异：相对 CogVideoX / MovieGen，生成是因果流式而非整段双向；相对把因果 teacher 再蒸馏的朴素路线，teacher 保持双向。作者自己的消融显示：many-step 因果微调会把误差累积传下去；双向 teacher + ODE init 才是最终配置。",
    "discussion": "CausVid 把“双向质量 vs 因果流式”收成一套可复现配方：block-causal DiT、ODE 初始化、不对称 DMD、KV cache。CVPR 版与后续 Wan 重实现不是同一套权重，引用时要写清骨干。适用边界是文本/图像条件的流式视频，不是动作条件世界模型。失败与开放问题包括：超长视频仍会过曝/退化；VAE 必须凑满 5 个 latent 帧才出像素，限制首帧延迟；反向 KL 会压多样性。阅读判断：适合作为 AR 视频蒸馏谱系的起点；不要把 84.27 写成击败了所有闭源系统，也不要把“causal student”写成因果世界模型。",
    "arxiv": {
      "published": "2024-12-10T18:59:50Z",
      "revised_at": "2025-09-23T21:08:03Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "arxiv": {
      "published": "2025-07-02T14:13:48Z",
      "revised_at": "2025-10-17T21:23:28Z",
      "primary_category": "cs.CV"
    },
    "arxiv_id": "2507.01737",
    "authors": [
      "Lin Wu",
      "Zhixiang Chen",
      "Jianglin Lan"
    ],
    "code_data_status": "截至来源报告核验时，未记录可确认的官方代码、数据或模型入口；这表示开放状态待核验，不代表资源确定不存在。",
    "comments": "",
    "deleted": false,
    "doi": "",
    "evidence_notes": "",
    "experiments": "在 FullBodyManipulation / 3D-FUTURE 等设置上比较 InterDiff、MDM、OMOMO、CHOIS。HOI-Dyn 在 FID、foot sliding、contact F1、MPJPE、object translation/rotation error 等指标整体更优。定性结果显示它减少物体提前移动、浮空、滑动等问题。作者还把 dynamics loss 作为评估交互因果一致性的 proxy metric。\n\n---",
    "figure": {
      "alt": "HOI-Dyn framework",
      "label": "driver-responder interaction dynamics framework",
      "paper_title": "HOI-Dyn: Learning Interaction Dynamics for Human-Object Motion Diffusion",
      "source_url": "https://arxiv.org/html/2507.01737v3/framework_main.png",
      "url": "https://arxiv.org/html/2507.01737v3/framework_main.png"
    },
    "id": "arxiv-2507-01737",
    "insight": "HOI-Dyn 把 HOI 生成建模为 **driver-responder system**：人体动作是 driver，物体运动是 responder。关键 insight：只联合生成 human motion 和 object motion 不够，必须显式约束“物体应如何响应人体动作”，否则会出现物体提前移动、漂浮、反应夸张等因果错误。",
    "limitations": "- 生成轨迹与可执行物理之间仍有差距。\n- 接触指标不能证明正确的力与机制。\n- 未覆盖开放对象、灵巧手细粒度接触和真实干预。\n- dynamics loss 作为 causal consistency proxy 不能替代 SCM 验证。",
    "links": {
      "paper": "https://arxiv.org/abs/2507.01737",
      "project": "https://wulin97.github.io/hoi-dyn/",
      "alphaxiv": "https://alphaxiv.org/abs/2507.01737"
    },
    "pipeline": {
      "input": "文本/条件、物体几何、初始状态、稀疏 waypoint/contact context。",
      "process": "conditional motion diffusion 生成 human-object trajectory；训练时加入轻量 Transformer interaction dynamics model，预测物体对人体相对运动的响应；residual dynamics loss 约束生成。",
      "output": "3D human motion、object motion、interaction context。",
      "details": "- **输入**：文本/条件、物体几何、初始状态、稀疏 waypoint/contact context。\n- **过程**：conditional motion diffusion 生成 human-object trajectory；训练时加入轻量 Transformer interaction dynamics model，预测物体对人体相对运动的响应；residual dynamics loss 约束生成。\n- **输出**：3D human motion、object motion、interaction context。"
    },
    "publication": "NeurIPS 2025",
    "source_reports": [
      "report-90041fa2f9"
    ],
    "summary": "HOI-Dyn 把 HOI 生成建模为 driver-responder system ：人体动作是 driver，物体运动是 responder。关键 insight：只联合生成 human motion 和 object motion 不够，必须显式约束“物体应如何响应人体动作”，否则会出现物体提前移动、漂浮、反应夸张等因果错误。",
    "tags": [
      "3D/4D",
      "Agent与可执行世界",
      "HOI",
      "世界模型",
      "因果与反事实"
    ],
    "title": "HOI-Dyn: Learning Interaction Dynamics for Human-Object Motion Diffusion",
    "updated_at": "2026-09-02",
    "year": 2025,
    "challenges": "联合生成 human/object motion 会出现对象提前移动、漂浮或反应过强，相关轨迹并未保证“人驱动物体响应”的时序结构。",
    "motivation": "把人体设为 driver、对象设为 responder，并用 interaction dynamics loss 强化接触附近的对象响应。",
    "technical_approach": "- **输入：** 人体动作、对象几何/状态和文本或任务条件\n- **过程：** motion diffusion 联合生成，加入 driver→responder dynamics 与接触相关约束\n- **输出：** 人体运动与对象 6DoF/交互运动序列",
    "discussion": "它把 Object Motion 和 Contact 置于 dynamics loss 中，强于仅做条件生成；但 driver→responder 是归纳偏置/代理因果顺序，未识别隐藏意图、力或对象参数，也未执行反事实查询。"
  },
  {
    "arxiv": {
      "published": "2024-10-25T18:36:37Z",
      "revised_at": "2024-10-25T18:36:37Z",
      "primary_category": "cs.AI"
    },
    "arxiv_id": "2410.19923",
    "authors": [
      "John Gkountouras",
      "Matthias Lindemann",
      "Phillip Lippe",
      "Efstratios Gavves",
      "Ivan Titov"
    ],
    "code_data_status": "- 代码、数据生成脚本和部分预训练模型公开。\n- 仅简单模拟环境；没有真实机器人、开放词汇动作或强视觉域移；长时 rollout 仍累积误差；Pickup/Put 暴露连续空间和多对象关系建模不足。\n\n---",
    "comments": "",
    "deleted": false,
    "doi": "",
    "evidence_notes": "- **作者明确主张：** learned CWM 能减少 LLM 在未知环境中的多步状态推演错误并改善规划。\n- **实验实际支持：** 在两个模拟环境、固定 action vocabulary 和同一 LLM 对照下，短到中等 horizon 明显改善。\n- **阅读判断：** 这是九篇中因果语义最接近 causal representation + simulator 的系统，但不是完全无监督：最终变量命名需要少量标签，并继承 BISCUIT 的可识别性假设。",
    "experiments": "- **数据：** GridWorld 与 iTHOR；训练 10,000 条×100 steps，validation/test 各 1,000×100，另有 100 个 ICL episodes；N-step 评测每个 N 使用 100 episodes（Appendix B.1, Table 5）。autoencoder 另使用约 10 倍无标签随机样本，比较数据预算时不能忽略。\n- **因果状态推演，Table 2：** iTHOR 的 1/2/4-step accuracy 为 **0.824/0.680/0.630**，LM-only 为 **0.482/0.285/0.110**；GridWorld 的 1/2/4/6/8-step 为 **0.954/0.922/0.829/0.797/0.758**，LM-only 为 **0.391/0.220/0.085/0.045/0.005**。\n- **规划，Table 4：** iTHOR 2/4-step success **0.58/0.44 vs. 0.25/0.11**；GridWorld 2/4/6/8-step **0.95/0.73/0.46/0.42 vs. 0.20/0.11/0.08/0.06**。对照使用同一 LLM，但 baseline 范围不宽，表中未报告置信区间。\n- **失败案例：** 扩展 3,000 样本分析中，iTHOR Toggle/Open/NoOp accuracy 为 **0.957/0.926/0.962**，Put/Pickup 仅 **0.506/0.431**。作者归因于 3D 坐标独立性与二元交互机制假设不匹配（§5.3）。\n- 训练使用 A100；autoencoder 约 1–2 天，flow + language head 约 0.5–1 小时（Appendix B.3）。",
    "figure": {
      "url": "content/images/language_agents_cwm_pipeline.png",
      "alt": "Language Agents Meet Causality 方法框架",
      "label": "Language Agents Meet Causality 方法框架",
      "paper_title": "Language Agents Meet Causality: Bridging LLMs and Causal World Models",
      "source_url": "content/images/language_agents_cwm_pipeline.png"
    },
    "id": "arxiv-2410-19923",
    "insight": "这篇工作比很多“causal world model”更接近正式 causal representation learning。\n\n它的核心 idea：\n\n> **LLM 很会高层规划，但其 causal knowledge 来自互联网，可能错误或与当前环境不匹配；因此应该让 agent 自己从环境数据中学习一个 causal world model，再把 causal state / transition 翻译成语言供 LLM 查询。**\n\n因此 world model 不只是一个 future predictor，而是一个 **learned causal simulator**。\n\n方法继承 BISCUIT 的 causal representation learning 思路，从 high-dimensional image observations 中学习 latent causal variables，并通过 action/intervention 信息识别环境 dynamics。",
    "limitations": "作者明确指出：\n\n- 当前 environments 仍较简单；\n- real-world scalability 尚未证明；\n- causal variables 的解释/映射仍有 supervision 成分；\n- 希望未来减少对 labeled causal variables 的依赖。\n\n额外可观察 failure：\n\n- iTHOR 中涉及 position / pickup / put 的 dynamics 明显更困难；\n- 视觉输入虽来自 3D simulator，但不等于真实 3D perception；\n- 没有真实 robot / ego video；\n- 识别条件依赖 intervention diversity。\n\n**阅读判断**：  \n这是“**causal latent simulator 真正用于 counterfactual planning**”最值得看的代表之一，也很适合和 C-JEPA 对比：\n\n- C-JEPA：弱 causal assumption、强 scalable predictive bias；\n- 本文：更正式的 causal representation，但环境和假设更受限。\n\n---",
    "links": {
      "publication": "https://proceedings.iclr.cc/paper_files/paper/2025/hash/5c5bc3553815adb4d1a8a5b8701e41a9-Abstract-Conference.html",
      "paper": "https://arxiv.org/abs/2410.19923",
      "code": "https://github.com/j0hngou/LLMCWM",
      "alphaxiv": "https://alphaxiv.org/abs/2410.19923"
    },
    "pipeline": {
      "input": "BISCUIT 式 causal representation learner；causal transition model；causal mapper / state descriptor；LLaMA 3 + 修改的 RAP/MCTS",
      "process": "学习 causal latent factors 及 action-conditioned transition，进行多步 rollout，并将状态变化交给 LLM 规划",
      "output": "解耦 latent causal variables；下一 latent state；可读状态描述；动作计划",
      "details": "**输入**：\n\n- 当前图像 observation；\n- 自然语言 action description。\n\n**过程**：\n\n1. causal representation learner：\n   \\[\n   I_t\\rightarrow z_t^{causal}\n   \\]\n2. action encoder：\n   \\[\n   a_t^{text}\\rightarrow e(a_t)\n   \\]\n3. causal transition：\n   \\[\n   (z_t^{causal},a_t)\\rightarrow z_{t+1}^{causal}\n   \\]\n4. causal mapper 将 latent variables 映射到可理解的 state descriptors；\n5. LLM 使用 world model rollout 的 state descriptions 做 reasoning；\n6. planning 使用 LLM proposal + CWM simulation + RAP/MCTS-style search。\n\n**输出**：\n\n- next causal world state；\n- rollout state description；\n- 最终 action plan。\n\n## 因果假设\n\n论文依赖 BISCUIT 一类 identifiable causal representation learning 的假设，例如：\n\n- 不同 causal variables 应有可区分的 binary interaction patterns；\n- intervention pattern 随时间具有足够变化。\n\n这比 C-JEPA 的 “causal inductive bias” 更强，但也意味着方法对 intervention richness 有较强假设。"
    },
    "publication": "ICLR 2025",
    "source_reports": [
      "report-554de78a93",
      "report-6fa37648ba",
      "report-ce5d8128c6"
    ],
    "summary": "论文： Language Agents Meet Causality: Bridging LLMs and Causal World Models 作者： John Gkountouras et al. 发表： ICLR 2025 入口： ICLR｜arXiv｜代码",
    "tags": [
      "3D/4D",
      "HOI",
      "世界模型",
      "因果与反事实",
      "对象与可供性",
      "机器人学习"
    ],
    "title": "Language Agents Meet Causality -- Bridging LLMs and Causal World Models",
    "updated_at": "2026-09-02",
    "year": 2025,
    "challenges": "LLM 常识可能与当前环境机制不一致，普通预测 latent 又未必可解释或可用于替代结果查询。",
    "motivation": "从交互数据学习环境特定 causal variables 与 transition，将 rollout 转成语言供 LLM 搜索，比纯语言猜测更可靠。",
    "technical_approach": "- **输入：** GridWorld/iTHOR 图像、动作与交互轨迹\n- **过程：** 学习 causal latent factors 及 action-conditioned transition，进行多步 rollout，并将状态变化交给 LLM 规划\n- **输出：** 替代未来的 causal state、语言化结果与动作计划",
    "discussion": "本期最接近 causal latent simulator+planning 的系统，但仍主要是群体层干预式 rollout；论文没有在真实 HOI 中验证同一实例的外生噪声后验。"
  },
  {
    "id": "arxiv-2507-13340",
    "title": "Latent Policy Steering with Embodiment-Agnostic Pretrained World Models",
    "authors": [
      "Yiqi Wang",
      "Mrinal Verghese",
      "Jeff Schneider"
    ],
    "year": 2025,
    "publication": "2025，arXiv preprint（项目页标记 under review）",
    "arxiv_id": "2507.13340",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2507.13340",
      "project": "https://yiqiwang8177.github.io/LatentPolicySteering/",
      "alphaxiv": "https://alphaxiv.org/abs/2507.13340"
    },
    "tags": [
      "世界模型",
      "动作表征",
      "机器人学习",
      "跨本体迁移"
    ],
    "summary": "作者观察到不同本体执行相似技能时会产生相似视觉运动，因此用光流取代本体专属动作来预训练世界模型；目标本体只需少量数据把同一接口替换成归一化机器人动作。与 FlowWAM 的“预测 flow 再解码动作”不同，本工作把 flow 用作预训练期世界模型的输入动作，并在部署时通过世界模型给 BC 候选排序。",
    "insight": "作者观察到不同本体执行相似技能时会产生相似视觉运动，因此用光流取代本体专属动作来预训练世界模型；目标本体只需少量数据把同一接口替换成归一化机器人动作。与 FlowWAM 的“预测 flow 再解码动作”不同，本工作把 flow 用作预训练期世界模型的输入动作，并在部署时通过世界模型给 BC 候选排序。",
    "pipeline": {
      "input": "跨本体机器人/人类视频、小规模目标机器人专家集，以及 diffusion policy 生成的多个候选动作块。",
      "process": "卷积编码器把相邻帧光流压成与目标动作维数相同的向量，与 Dreamer v3 RSSM 联训；适配时移除光流编码器，直接输入目标动作。价值函数在专家状态及世界模型模拟的 OOD 状态上训练，并以策略轨迹和专家 latent 的余弦偏离作为惩罚。推理对多个候选 rollout，执行价值最高者。",
      "output": "被选中的目标机器人动作计划；世界模型不直接生成动作。",
      "details": "- **输入：** 跨本体机器人/人类视频、小规模目标机器人专家集，以及 diffusion policy 生成的多个候选动作块。\n- **过程：** 卷积编码器把相邻帧光流压成与目标动作维数相同的向量，与 Dreamer v3 RSSM 联训；适配时移除光流编码器，直接输入目标动作。价值函数在专家状态及世界模型模拟的 OOD 状态上训练，并以策略轨迹和专家 latent 的余弦偏离作为惩罚。推理对多个候选 rollout，执行价值最高者。\n- **输出：** 被选中的目标机器人动作计划；世界模型不直接生成动作。"
    },
    "experiments": "Robomimic 的 30/50-demo 设置覆盖 Lift、Can、Square、Transport、3 seeds。50-demo 时 BC 平均 57.3，LPS-mix 63.4；Transport 25.8→34.6。30-demo 时平均仅 33.2→35.5，部分方法下降，说明 base policy 候选缺乏多样性会限制 steering。100-demo 价值消融中 BC 62.9、vanilla 65.2、bootstrap 64.3、完整 LPS 68.7；正文声称两种消融低于 BC 与表格矛盾，应以表为准。\n\n真实 Franka 四任务、每设置 20 次，作者报告 30–50 条示范相对提升 70%、60–100 条提升 44%；可解析表格列有错位，不能可靠重建逐任务数字。Flow 预训练在 50-demo 平均 62.4，EEF 为 59.1。horizon 24 时低于 BC，显示长 rollout 噪声。未报告 GPU、参数规模或实时频率。",
    "evidence_notes": "",
    "code_data_status": "项目页公开，代码仅承诺后续发布；未核验到官方仓库、权重、过滤后的 Open X-Embodiment 子集、人类 play 或 Franka 示范。名称相近的其他 LPS 仓库不是本文实现。",
    "limitations": "- 遮挡、视角变化和移动相机破坏光流动作的一致性。\n- 多候选 imagined rollout 增加推理延迟，未报告频率。\n- horizon 过长时价值与偏离奖励变噪。\n- 低数据 BC 可能近似单峰，使 steering 无候选可选。\n- 真实试验次数有限，缺少置信区间。",
    "comments": "",
    "source_reports": [
      "report-a77d9a7ad6"
    ],
    "deleted": false,
    "updated_at": "2026-08-21",
    "challenges": "目标机器人专家示范昂贵，跨机器人和人类视频又因动作/本体状态不兼容而难以共享。普通 policy steering 的价值函数只在专家状态训练，却要给策略偏离分布后的 imagined states 打分，容易外推过度乐观。",
    "motivation": "作者观察到不同本体执行相似技能时会产生相似视觉运动，因此用光流取代本体专属动作来预训练世界模型；目标本体只需少量数据把同一接口替换成归一化机器人动作。与 FlowWAM 的“预测 flow 再解码动作”不同，本工作把 flow 用作预训练期世界模型的输入动作，并在部署时通过世界模型给 BC 候选排序。",
    "technical_approach": "- **输入：** 跨本体机器人/人类视频、小规模目标机器人专家集，以及 diffusion policy 生成的多个候选动作块。\n- **过程：** 卷积编码器把相邻帧光流压成与目标动作维数相同的向量，与 Dreamer v3 RSSM 联训；适配时移除光流编码器，直接输入目标动作。价值函数在专家状态及世界模型模拟的 OOD 状态上训练，并以策略轨迹和专家 latent 的余弦偏离作为惩罚。推理对多个候选 rollout，执行价值最高者。\n- **输出：** 被选中的目标机器人动作计划；世界模型不直接生成动作。",
    "discussion": "证据支持“跨本体世界模型预训练 + 候选筛选”在中等数据量下有效，但没有证明光流形成通用动作语义。真实实验样本小，模拟方差较大，推理还需多候选 rollout；适合作为低数据 policy enhancement，而非直接替代控制器。",
    "arxiv": {
      "published": "2025-07-17T17:57:57Z",
      "revised_at": "2026-03-22T19:38:07Z",
      "primary_category": "cs.RO"
    },
    "figure": {
      "url": "https://arxiv.org/html/2507.13340v1/x1.png",
      "alt": "Latent Policy Steering Fig. 1",
      "label": "Latent Policy Steering，Fig. 1，光流世界模型预训练与候选策略 steering。来源：Fig. 1 原图",
      "paper_title": "Latent Policy Steering with Embodiment-Agnostic Pretrained World Models",
      "source_url": "https://arxiv.org/html/2507.13340v1/x1.png"
    }
  },
  {
    "arxiv": {
      "published": "2025-11-04T03:35:58Z",
      "revised_at": "2025-11-04T03:35:58Z",
      "primary_category": "cs.LG"
    },
    "arxiv_id": "2511.02225",
    "authors": [
      "Fan Feng",
      "Phillip Lippe",
      "Sara Magliacane"
    ],
    "code_data_status": "截至来源报告核验时，未记录可确认的官方代码、数据或模型入口；这表示开放状态待核验，不代表资源确定不存在。",
    "comments": "",
    "deleted": false,
    "doi": "",
    "evidence_notes": "",
    "experiments": "在 SpritesWorld、Fetch、Franka Kitchen、iGibson、Libero 上比较 DreamerV3、TD-MPC2、DINO-WM、EIT。结果显示 FIOC-WM 在单任务、属性泛化、组合泛化、skill 泛化上整体更优。消融表明 interaction modeling 和 hierarchical policy 是最关键组件。\n\n---",
    "figure": {
      "alt": "FIOC-WM pipeline",
      "label": "FIOC-WM 整体 pipeline",
      "paper_title": "Learning Interactive World Model for Object-Centric Reinforcement Learning",
      "source_url": "https://arxiv.org/html/2511.02225v1/fig2.png",
      "url": "https://arxiv.org/html/2511.02225v1/fig2.png"
    },
    "id": "arxiv-2511-02225",
    "insight": "提出 **Factored Interactive Object-Centric World Model (FIOC-WM)**。多数 object-centric RL 只把状态拆成对象，但交互关系仍是隐式的；本文进一步显式学习对象间 interaction graph，并把每个对象状态拆为动态属性与静态属性。关键 insight：长时程任务可以被分解成一串“对象交互 primitive”，高层策略选择交互图，低层策略执行交互。",
    "limitations": "来源报告未单列可核验的局限、失败案例或开放问题；在补充原论文正文核验前，不对该工作的泛化性、因果性、复现性或 SOTA 结论作扩大解释。",
    "links": {
      "paper": "https://arxiv.org/abs/2511.02225",
      "alphaxiv": "https://alphaxiv.org/abs/2511.02225"
    },
    "pipeline": {
      "input": "像素观测、动作、奖励。",
      "process": "DINO/R3M 等预训练视觉特征 + Slot Attention 得到对象表示；VAE 学 object latents；拆分 static / dynamic factors；学习 interaction graph、transition、reward；再训练层级策略。",
      "output": "可用于规划和策略学习的 object-centric interactive world model，以及高低层策略。",
      "details": "- **输入**：像素观测、动作、奖励。\n- **过程**：DINO/R3M 等预训练视觉特征 + Slot Attention 得到对象表示；VAE 学 object latents；拆分 static / dynamic factors；学习 interaction graph、transition、reward；再训练层级策略。\n- **输出**：可用于规划和策略学习的 object-centric interactive world model，以及高低层策略。"
    },
    "publication": "NeurIPS 2025",
    "source_reports": [
      "report-90041fa2f9"
    ],
    "summary": "提出 Factored Interactive Object-Centric World Model (FIOC-WM) 。多数 object-centric RL 只把状态拆成对象，但交互关系仍是隐式的；本文进一步显式学习对象间 interaction graph，并把每个对象状态拆为动态属性与静态属性。关键 insight：长时程任务可以被分解成一串“对象交互 primitive”，高层策略选择交互图，低层策略执行交互。",
    "tags": [
      "Agent与可执行世界",
      "HOI"
    ],
    "title": "Learning Interactive World Model for Object-Centric Reinforcement Learning",
    "updated_at": "2026-08-20",
    "year": 2025
  },
  {
    "id": "arxiv-2509-22622",
    "title": "LongLive: Real-time Interactive Long Video Generation",
    "authors": [
      "Shuai Yang",
      "Wei Huang",
      "Ruihang Chu",
      "Yicheng Xiao",
      "Yuyang Zhao",
      "Xianbang Wang",
      "Muyang Li",
      "Enze Xie",
      "Yingcong Chen",
      "Yao Lu",
      "Song Han",
      "Yukang Chen"
    ],
    "year": 2025,
    "publication": "2025，arXiv preprint（cs.CV）。arXiv:2509.22622。单位 NVIDIA / MIT / HKUST(GZ) / HKU / THU。尚无 DOI / 正式出版页。arXiv DOI：10.48550/arXiv.2509.22622。",
    "arxiv_id": "2509.22622",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2509.22622",
      "project": "https://hanlab.mit.edu/projects/longlive",
      "code": "https://github.com/NVlabs/LongLive",
      "model": "https://huggingface.co/Efficient-Large-Model/LongLive-1.3B",
      "alphaxiv": "https://alphaxiv.org/abs/2509.22622"
    },
    "tags": [
      "3D/4D",
      "Agent与可执行世界",
      "VLA",
      "因果与反事实",
      "流式与自回归",
      "视频生成"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2509.22622v1/figures/method.png",
      "alt": "LongLive Fig. 2: short-window attention, frame sink, and KV-recache",
      "label": "LongLive，Fig. 2，短窗注意力 + frame sink，以及 prompt 切换时的 KV-recache。来源：Fig. 2 原图 PNG",
      "paper_title": "LongLive: Real-time Interactive Long Video Generation",
      "source_url": "https://arxiv.org/html/2509.22622v1/figures/method.png"
    },
    "summary": "核心 Insight： 在 Self Forcing 式因果 few-step 模型上，用 KV-recache 在切换点用“已生成帧 + 新 prompt”重算 cache；用 streaming long tuning 按 5 s 片段滚动监督（train-long–test-long）；短窗 + 把第一 chunk 当永久 frame sink。 作者发现 sink 只有在长滚动崩坏被 streaming tuning 治住之后才有效。这改变的是 cache 与训练时间窗，不是生成器骨干。",
    "insight": "核心 Insight：**在 Self Forcing 式因果 few-step 模型上，用 KV-recache 在切换点用“已生成帧 + 新 prompt”重算 cache；用 streaming long tuning 按 5 s 片段滚动监督（train-long–test-long）；短窗 + 把第一 chunk 当永久 frame sink。** 作者发现 sink 只有在长滚动崩坏被 streaming tuning 治住之后才有效。这改变的是 cache 与训练时间窗，不是生成器骨干。\n\n与本知识库课题 **间接相关**：Causal Forcing 文中把它列为正交的长视频适配；它支持流式换 prompt，但没有相机/动作条件。可借鉴点是交互时“状态该怎么刷新”。",
    "pipeline": {
      "input": "顺序文本 prompt；骨干 Wan2.1-T2V-1.3B，先 Self Forcing DMD 改成因果 few-step，并打开短窗与 frame sink。",
      "process": "Streaming long tuning：每步只生成并 DMD 监督下一段 5 s，历史 KV detach；序列最长 60 s，每 batch 恰好一次 prompt 切换（5–55 s 均匀采样）。切换时 recache 一次，teacher（Wan-14B）也看新 prompt。短窗约 9 latent 帧，sink 为第一 chunk 的 3 latent 帧。LoRA rank 256（约 27% 参数，350M）。64×H100 约 12 小时，合计约 32 GPU-day。也实现了线性注意力骨干 SANA-Video。",
      "output": "流式长视频；H100 上 20.7 FPS；单卡最长演示 240 s。INT8 PTQ 后模型 1.4 GB，5090 上 16.4 FPS。",
      "details": "- **输入：** 顺序文本 prompt；骨干 Wan2.1-T2V-1.3B，先 Self Forcing DMD 改成因果 few-step，并打开短窗与 frame sink。\n- **过程：** Streaming long tuning：每步只生成并 DMD 监督下一段 5 s，历史 KV detach；序列最长 60 s，每 batch 恰好一次 prompt 切换（5–55 s 均匀采样）。切换时 recache 一次，teacher（Wan-14B）也看新 prompt。短窗约 9 latent 帧，sink 为第一 chunk 的 3 latent 帧。LoRA rank 256（约 27% 参数，350M）。64×H100 约 12 小时，合计约 32 GPU-day。也实现了线性注意力骨干 SANA-Video。\n- **输出：** 流式长视频；H100 上 20.7 FPS；单卡最长演示 240 s。INT8 PTQ 后模型 1.4 GB，5090 上 16.4 FPS。\n\n与最近 baseline 的实质差异：相对 Self Forcing，训练看到自己的长程脏上下文，并且专门训切换；相对 MAGI-1 的手动调 KV 窗换 prompt，recache 是一次前向重写。SkyReels-V2 不能比实时。"
    },
    "experiments": "**作者主张：** 短片质量不掉、长片与交互长片领先，同时最快。\n\n实验实际支持：\n\n- **短片 VBench：** Total/Quality/Semantic **84.87 / 86.97 / 76.47**，20.7 FPS。Quality 高于 Self Forcing chunk-wise（85.07），Semantic **低于** SF 的 81.28。速度得益于短窗。\n- **单 prompt 30 s VBench-Long：** Total **83.52** vs Self-Forcing 81.59、FramePack 81.95、SkyReels-V2 75.29；吞吐 20.7 vs 17.0 / 0.92 / 0.49。FramePack 是 I2V，需先合成首帧。\n- **交互 60 s（自建 160 条，每条 6×10 s prompt）：** Quality 84.38 vs SF 82.46、SkyReels 80.49。分段 CLIP 在 0–10 s 到 50–60 s 上全程高于两对照（末段 24.32 vs SF 23.19）。这不是官方 VBench 交互协议。\n- **KV-recache 消融（10 s、5 s 切换）：** recache 的 Background/Subject/CLIP = 94.81 / 94.04 / 27.87；清 cache 92.75 / 89.59 / 28.95（语义略高但一致性差）；留 cache 94.77 / 93.69 / 25.92（跟不住新 prompt）。\n- **窗与 sink：** 一致性随窗长上升，约 24 帧饱和；9 local + 3 sink 接近 21 帧窗的一致性，端到端时间 −28%、峰值显存 −17%（H100）。\n- **LoRA：** rank 256 的 30 s Total 83.12，接近全量微调 83.52；rank 32 仅 81.08。\n- **INT8：** VBench Total 84.31 vs BF16 84.87。\n- **用户研究：** 48 题 × 26 有效问卷，四维二选一；正文未给胜率表，细节在附录。\n\n**证据未支持：** Semantic 全面超过 Self Forcing；240 s 有完整 VBench；质量上限超过 Wan 基座（作者在局限中明确否定）。",
    "evidence_notes": "",
    "code_data_status": "- **代码：** [NVlabs/LongLive](https://github.com/NVlabs/LongLive)，含训练与推理。\n- **权重：** Hugging Face `Efficient-Large-Model/LongLive-1.3B`。\n- **数据：** 无额外真实视频；prompt 来自 VidProM + Qwen2-72B 写下一镜。作者强调未引入新的外部视频集。",
    "limitations": "- 自监督微调不能修正基座系统性偏差；短片段质量很难超过 teacher。\n- 训练每条长序列只插一次切换，推理多段切换是外推。\n- 交互评测是自建 160 条，CLIP 不等于人类叙事连贯。\n- 短片 Semantic 低于 Self Forcing，存在长程特化的代价。\n- 240 s 主要是展示，缺少与 60 s 同协议的完整表。\n- 依赖 Wan 与 14B teacher，完整蒸馏链仍重。\n\n---",
    "comments": "",
    "source_reports": [
      "report-c7ced2c92d"
    ],
    "deleted": false,
    "updated_at": "2026-08-21",
    "challenges": "CausVid / Self Forcing 能实时短片，但 **分钟级 + 中途换 prompt** 会同时碰到效率与一致性：\n\n- 双向 / Diffusion-Forcing：SkyReels-V2 生成 60 s 约 50 分钟（H100），因为不能 KV cache。\n- 因果 AR 多用 train-short–test-long，自生成历史越来越脏，长视频漂移。\n- 换 prompt 时：清空 KV 则跳变；保留 KV 则新 prompt 不生效或滞后——旧 prompt 已通过交叉注意力写进 cache。\n- 短窗注意力能加速，但丢掉远距线索；先前工作认为 attention sink 挡不住视频长滚动崩坏。\n\n本文针对的是 **交互式长视频的训练–推理对齐与 cache 刷新接口**，不是新的蒸馏理论。",
    "motivation": "核心 Insight：**在 Self Forcing 式因果 few-step 模型上，用 KV-recache 在切换点用“已生成帧 + 新 prompt”重算 cache；用 streaming long tuning 按 5 s 片段滚动监督（train-long–test-long）；短窗 + 把第一 chunk 当永久 frame sink。** 作者发现 sink 只有在长滚动崩坏被 streaming tuning 治住之后才有效。这改变的是 cache 与训练时间窗，不是生成器骨干。\n\n与本知识库课题 **间接相关**：Causal Forcing 文中把它列为正交的长视频适配；它支持流式换 prompt，但没有相机/动作条件。可借鉴点是交互时“状态该怎么刷新”。",
    "technical_approach": "- **输入：** 顺序文本 prompt；骨干 Wan2.1-T2V-1.3B，先 Self Forcing DMD 改成因果 few-step，并打开短窗与 frame sink。\n- **过程：** Streaming long tuning：每步只生成并 DMD 监督下一段 5 s，历史 KV detach；序列最长 60 s，每 batch 恰好一次 prompt 切换（5–55 s 均匀采样）。切换时 recache 一次，teacher（Wan-14B）也看新 prompt。短窗约 9 latent 帧，sink 为第一 chunk 的 3 latent 帧。LoRA rank 256（约 27% 参数，350M）。64×H100 约 12 小时，合计约 32 GPU-day。也实现了线性注意力骨干 SANA-Video。\n- **输出：** 流式长视频；H100 上 20.7 FPS；单卡最长演示 240 s。INT8 PTQ 后模型 1.4 GB，5090 上 16.4 FPS。\n\n与最近 baseline 的实质差异：相对 Self Forcing，训练看到自己的长程脏上下文，并且专门训切换；相对 MAGI-1 的手动调 KV 窗换 prompt，recache 是一次前向重写。SkyReels-V2 不能比实时。",
    "discussion": "LongLive 把实时 AR 视频从 5 s 推到可交互的分钟级：recache 处理提示词切换，streaming tuning 处理自生成历史，sink 让短窗不丢身份。短片 Semantic 下降、长片/交互上升，符合“为长程与切换做了特化”的阅读。适用边界是文本交互长视频，不是动作世界模型。失败来自基座上限和无真实长视频监督。阅读判断：适合作为 CausVid 谱系的长程插件；不要把 20.7 FPS 写成已含复杂 3D 控制。",
    "arxiv": {
      "published": "2025-09-26T17:48:24Z",
      "revised_at": "2025-10-13T22:41:26Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2505-13211",
    "title": "MAGI-1: Autoregressive Video Generation at Scale",
    "authors": [
      "Sand.AI",
      "Hansi Teng",
      "Hongyu Jia",
      "Lei Sun",
      "Lingzhi Li",
      "Maolin Li",
      "Mingqiu Tang",
      "Shuai Han",
      "Tianning Zhang",
      "W. Q. Zhang",
      "Weifeng Luo",
      "Xiaoyang Kang",
      "Yuchen Sun",
      "Yue Cao",
      "Yunpeng Huang",
      "Yutong Lin",
      "Yuxin Fang",
      "Zewei Tao",
      "Zheng Zhang",
      "Zhongshu Wang",
      "Zixun Liu",
      "Dai Shi",
      "Guoli Su",
      "Hanwen Sun",
      "Hong Pan",
      "Jie Wang",
      "Jiexin Sheng",
      "Min Cui",
      "Min Hu",
      "Ming Yan",
      "Shucheng Yin",
      "Siran Zhang",
      "Tingting Liu",
      "Xianping Yin",
      "Xiaoyu Yang",
      "Xin Song",
      "Xuan Hu",
      "Yankai Zhang",
      "Yuqiao Li"
    ],
    "year": 2025,
    "publication": "2025，arXiv preprint（v1，cs.CV）。arXiv:2505.13211。arXiv DOI：10.48550/arXiv.2505.13211。作者列表以 GitHub README / arXiv bibtex 为准；HTML 页未逐人展开署名。尚无会议/期刊版本。",
    "arxiv_id": "2505.13211",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2505.13211",
      "code": "https://github.com/SandAI-org/MAGI-1",
      "alphaxiv": "https://alphaxiv.org/abs/2505.13211"
    },
    "tags": [
      "Agent与可执行世界",
      "因果与反事实",
      "流式与自回归",
      "视频生成"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2505.13211v1/algorithm_v4.png",
      "alt": "MAGI-1 Fig. 1: chunk-wise autoregressive denoising with block-causal attention",
      "label": "MAGI-1，Fig. 1，24 帧 chunk 的流水线自回归去噪与 block-causal mask。来源：Fig. 1 原图 PNG",
      "paper_title": "MAGI-1: Autoregressive Video Generation at Scale",
      "source_url": "https://arxiv.org/html/2505.13211v1/algorithm_v4.png"
    },
    "summary": "核心 Insight： 以固定 24 帧（1 s @ 24 FPS）为自回归单元，块内双向、块间因果，噪声时间步沿时间单调递增；T2V / I2V / 续写只是干净块比例不同。 块尚未完全干净就可以启动下一块，最多四块流水线并行。蒸馏走 shortcut model（可 8/16/32/64 步），不是 CausVid 系 DMD。",
    "insight": "核心 Insight：**以固定 24 帧（1 s @ 24 FPS）为自回归单元，块内双向、块间因果，噪声时间步沿时间单调递增；T2V / I2V / 续写只是干净块比例不同。** 块尚未完全干净就可以启动下一块，最多四块流水线并行。蒸馏走 shortcut model（可 8/16/32/64 步），不是 CausVid 系 DMD。\n\n与本知识库课题 **直接相关于“视频世界模型”这一自称，间接相关于交互控制**。它提供 chunk-wise 换 prompt、续写和物理基准上的 V2V 优势，但开源权重在后续蒸馏论文的 T2V 实时对比中偏慢。作者把 Physics-IQ 优势部分归因于“自回归促进因果推理”；这是机制解释，实验只证明 V2V 续写分数更高，不能当成因果识别。",
    "pipeline": {
      "input": "文本（T5）；可选首帧或前缀视频。Transformer VAE：空间 8×、时间 4× 压缩，潜空间 16 维。",
      "process": "Flow matching；块因果注意力 + 并行空间–时间自注意力与文本交叉注意力 + GQA + QK-Norm + FFN sandwich LN；24B 用 SwiGLU 与 Softcap 调制。4.5B / 24B 三阶段分辨率爬升（4.5B：360p→480p→720p，最长 16 s）。干净块最多加 5% 噪声、不接文本、损失只加在噪声块上。推理用双权重 CFG：w prev=1.5、w text=7.5，长于约 5 s 时再按 t 细调，否则饱和。用户 prompt 用 MLLM 增强。蒸馏为 shortcut，最小 s=1/64 并含 CFG 蒸馏。",
      "output": "流式视频块；峰值算力/显存与总时长无关。产品页提供在线生成。",
      "details": "- **输入：** 文本（T5）；可选首帧或前缀视频。Transformer VAE：空间 8×、时间 4× 压缩，潜空间 16 维。\n- **过程：** Flow matching；块因果注意力 + 并行空间–时间自注意力与文本交叉注意力 + GQA + QK-Norm + FFN sandwich LN；24B 用 SwiGLU 与 Softcap 调制。4.5B / 24B 三阶段分辨率爬升（4.5B：360p→480p→720p，最长 16 s）。干净块最多加 5% 噪声、不接文本、损失只加在噪声块上。推理用双权重 CFG：\\(w_{\\text{prev}}=1.5\\)、\\(w_{\\text{text}}=7.5\\)，长于约 5 s 时再按 \\(t\\) 细调，否则饱和。用户 prompt 用 MLLM 增强。蒸馏为 shortcut，最小 \\(s=1/64\\) 并含 CFG 蒸馏。\n- **输出：** 流式视频块；峰值算力/显存与总时长无关。产品页提供在线生成。\n\n与最近 baseline 的实质差异：相对 Sora 类整段双向，生成是因果流水线；相对 CausVid/Self Forcing，这是从零训的大规模 AR 扩散 + shortcut，而不是把 Wan 蒸成 4-step。后续蒸馏论文把它当慢 AR 基线是因为它默认多步。"
    },
    "experiments": "**作者主张：** I2V 上运动与语义强，Physics-IQ 上 V2V 大幅领先；24B 证明可扩展。\n\n实验实际支持：\n\n- **VAE（H800，169 条 25 帧 256² 视频）：** PSNR 36.55，解码 12.28 ms，参数 614M；解码快于 OpenSoraPlan / CogVideoX / Hunyuan / StepVideo / Wan2.1 表内实现。\n- **VBench-I2V（4 s、24 FPS、16:9）：** Magi-1 2× decoder Total **89.28**，Quality 82.44，I2V Score 96.12，Dynamic Degree **68.21**；1× decoder Total 88.88。作者称当时 leaderboard 第一。对比模型分数来自 leaderboard 汇编，不是全部同代码重跑。\n- **内部 I2V 人评（100 对，双盲 Win/Tie/Lose）：** 总体优于开源 Wan-2.1 与 HunyuanVideo、Hailuo i2v-01，略弱于 Kling1.6 HD；指令跟随与运动较好，视觉质量仍落后头部闭源。长度按对手裁成 5–6 s。Fig. 16 为条形比例，正文未给精确百分比表。\n- **Physics-IQ：** Magi-1 V2V **56.02** vs VideoPoet V2V 29.50；Magi-1 I2V **30.23** 仍高于表中其他 I2V。V2V 看前 3 s（96 帧 @24 FPS）预测后 5 s。作者展示失败：碰撞后球的停止、火柴点燃气球、撕裂后碎片运动等次级效应不对，但常给出另一套看起来合理的运动。\n- **定性：** \\(w_{\\text{prev}}=1.0\\) 时块间错位；过大则静帧。I2V 续写会丢历史速度（笔旋转、遮挡后重现）。\n\n**证据未支持：** T2V 实时 SOTA（Self Forcing 表 4.5B 为 0.19 FPS / 282 s、Total 79.18）；物理直觉等于理解物理定律；开源 4.5B 与论文 24B 评测可互换。",
    "evidence_notes": "",
    "code_data_status": "- **代码 / 权重：** [SandAI-org/MAGI-1](https://github.com/SandAI-org/MAGI-1)；分布式注意力 [SandAI-org/MagiAttention](https://github.com/SandAI-org/MagiAttention)。\n- **产品：** [sand.ai](https://sand.ai)。\n- **数据：** 多阶段内部策展 + MLLM 过滤/caption；训练语料不随仓库完整公开。",
    "limitations": "- 开源对照里 4.5B 多步 AR 延迟远高于蒸馏 1.3B 模型。\n- 视觉质量在内部人评中仍落后 Kling1.6 HD。\n- Physics-IQ 次级碰撞、燃烧、撕裂碎片失败；“合理替代”不是正确物理。\n- 长视频必须细调 guidance，否则饱和/棋盘。\n- 干净块不接文本，续写时用户文本如何注入需看实现。\n- 24B、4M token 的训练基础设施无法从开源推理仓库复现。\n\n---",
    "comments": "",
    "source_reports": [
      "report-c7ced2c92d"
    ],
    "deleted": false,
    "updated_at": "2026-08-21",
    "challenges": "领域长期问题是：大规模视频扩散几乎都在整段上做统一噪声的双向去噪，丢掉时间因果，难以流式、也难以把 T2V / I2V / 续写统一进同一预训练。本文针对的是 **可扩展的 chunk-wise AR 扩散世界模型**，不是 few-step DMD。\n\n- **架构缺口：** 卷积 VAE 在现代 GPU 上慢；标准注意力核难以高效做块因果；超长上下文（文称最多 4M token）需要新的分布式注意力。\n- **任务分裂：** 双向模型通常预训练只做 T2V，I2V 要另改结构或微调。\n- **推理缺口：** 块与块之间错位、长视频饱和/棋盘伪影、用户短 prompt 与训练长 caption 不匹配。\n- **评测立场：** 作者认为产品形态更接近 I2V，因此主客观评测偏 I2V，而不是 T2V 榜。Self Forcing 表里 MAGI-1-4.5B 的 T2V VBench 并不高，两套评测目标不同。",
    "motivation": "核心 Insight：**以固定 24 帧（1 s @ 24 FPS）为自回归单元，块内双向、块间因果，噪声时间步沿时间单调递增；T2V / I2V / 续写只是干净块比例不同。** 块尚未完全干净就可以启动下一块，最多四块流水线并行。蒸馏走 shortcut model（可 8/16/32/64 步），不是 CausVid 系 DMD。\n\n与本知识库课题 **直接相关于“视频世界模型”这一自称，间接相关于交互控制**。它提供 chunk-wise 换 prompt、续写和物理基准上的 V2V 优势，但开源权重在后续蒸馏论文的 T2V 实时对比中偏慢。作者把 Physics-IQ 优势部分归因于“自回归促进因果推理”；这是机制解释，实验只证明 V2V 续写分数更高，不能当成因果识别。",
    "technical_approach": "- **输入：** 文本（T5）；可选首帧或前缀视频。Transformer VAE：空间 8×、时间 4× 压缩，潜空间 16 维。\n- **过程：** Flow matching；块因果注意力 + 并行空间–时间自注意力与文本交叉注意力 + GQA + QK-Norm + FFN sandwich LN；24B 用 SwiGLU 与 Softcap 调制。4.5B / 24B 三阶段分辨率爬升（4.5B：360p→480p→720p，最长 16 s）。干净块最多加 5% 噪声、不接文本、损失只加在噪声块上。推理用双权重 CFG：\\(w_{\\text{prev}}=1.5\\)、\\(w_{\\text{text}}=7.5\\)，长于约 5 s 时再按 \\(t\\) 细调，否则饱和。用户 prompt 用 MLLM 增强。蒸馏为 shortcut，最小 \\(s=1/64\\) 并含 CFG 蒸馏。\n- **输出：** 流式视频块；峰值算力/显存与总时长无关。产品页提供在线生成。\n\n与最近 baseline 的实质差异：相对 Sora 类整段双向，生成是因果流水线；相对 CausVid/Self Forcing，这是从零训的大规模 AR 扩散 + shortcut，而不是把 Wan 蒸成 4-step。后续蒸馏论文把它当慢 AR 基线是因为它默认多步。",
    "discussion": "MAGI-1 说明：不靠 DMD，单靠大规模 chunk-wise AR 扩散也可以做流式世界模型，并在 I2V 与 V2V 物理续写上拿出硬数字。它与 CausVid 谱系是互补基座：一个提供可蒸馏的开源 1.3B 双向教师（Wan），一个提供原生 AR 的大模型。适用边界是块级（1 s）交互粒度，不是帧级实时。阅读判断：Physics-IQ 的 V2V vs I2V 落差支持“历史运动很重要”，不要写成自回归算法已被证明捕捉因果。开源仓库目前主打推理与权重，完整训练栈/数据不能从论文外完全复现。",
    "arxiv": {
      "published": "2025-05-19T14:58:50Z",
      "revised_at": "2025-05-19T14:58:50Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "arxiv": {
      "published": "2025-05-22T12:37:47Z",
      "revised_at": "2025-05-22T12:37:47Z",
      "primary_category": "cs.CV"
    },
    "arxiv_id": "2505.16602",
    "authors": [
      "Bohan Zhou",
      "Yi Zhan",
      "Zhongbin Zhang",
      "Zongqing Lu"
    ],
    "code_data_status": "截至来源报告核验时，未记录可确认的官方代码、数据或模型入口；这表示开放状态待核验，不代表资源确定不存在。",
    "comments": "",
    "deleted": false,
    "doi": "",
    "evidence_notes": "",
    "experiments": "构建 3.35M RGB-D frames、24K interactions、1.2K objects 的统一数据。跨 H2O、HOI4D、HOT3D、OakInk2、TACO 等数据训练，并在 ARCTIC、HOLO 跨域评估，显著降低 wrist translation 和 joint rotation error。\n\n**对你方向的启发**\n\n- 它适合作为 hand action prior，而不是完整 world model。\n- 可与 EgoHOI / Hand2World 结合：先生成/估计 MANO trajectory，再驱动 video world model。\n\n---",
    "figure": {
      "alt": "MEgoHand pipeline",
      "label": "MEgoHand pipeline",
      "paper_title": "MEgoHand: Multimodal Egocentric Hand-Object Interaction Motion Generation",
      "source_url": "https://arxiv.org/html/2505.16602v1/pipeline.png",
      "url": "https://arxiv.org/html/2505.16602v1/pipeline.png"
    },
    "id": "arxiv-2505-16602",
    "insight": "MEgoHand 生成的是 egocentric hand-object interaction 中的 hand motion，而不是完整视频 world model。它认为单靠文本或 RGB 不足以恢复第一视角 HOI motion，需要结合 VLM 语义理解、monocular depth 的 3D 空间推理、初始 MANO hand pose。",
    "limitations": "- 它适合作为 hand action prior，而不是完整 world model。\n- 可与 EgoHOI / Hand2World 结合：先生成/估计 MANO trajectory，再驱动 video world model。\n\n---",
    "links": {
      "paper": "https://arxiv.org/abs/2505.16602",
      "project": "https://beingbeyond.github.io/MEgoHand/",
      "alphaxiv": "https://alphaxiv.org/abs/2505.16602"
    },
    "pipeline": {
      "input": "egocentric RGB、text instruction、initial MANO hand parameters。",
      "process": "VLM 编码语义；depth estimator 提供 object-agnostic spatial reasoning；DiT-based flow-matching policy 生成 fine-grained MANO hand trajectory；Temporal Orthogonal Filtering 提升稳定性。",
      "output": "未来 hand-object interaction 的 3D MANO hand motion sequence。",
      "details": "- **输入**：egocentric RGB、text instruction、initial MANO hand parameters。\n- **过程**：VLM 编码语义；depth estimator 提供 object-agnostic spatial reasoning；DiT-based flow-matching policy 生成 fine-grained MANO hand trajectory；Temporal Orthogonal Filtering 提升稳定性。\n- **输出**：未来 hand-object interaction 的 3D MANO hand motion sequence。"
    },
    "publication": "NeurIPS 2025；arXiv 2025",
    "source_reports": [
      "report-0ad44831eb",
      "report-90041fa2f9"
    ],
    "summary": "MEgoHand 生成的是 egocentric hand-object interaction 中的 hand motion，而不是完整视频 world model。它认为单靠文本或 RGB 不足以恢复第一视角 HOI motion，需要结合 VLM 语义理解、monocular depth 的 3D 空间推理、初始 MANO hand pose。",
    "tags": [
      "3D/4D",
      "Agent与可执行世界",
      "HOI",
      "动作表征",
      "第一视角与人类视频"
    ],
    "title": "MEgoHand: Multimodal Egocentric Hand-Object Interaction Motion Generation",
    "updated_at": "2026-08-23",
    "year": 2025,
    "discussion": "- 它适合作为 hand action prior，而不是完整 world model。\n- 可与 EgoHOI / Hand2World 结合：先生成/估计 MANO trajectory，再驱动 video world model。\n\n---"
  },
  {
    "arxiv": {
      "published": "2025-06-30T17:42:22Z",
      "revised_at": "2025-11-03T02:15:34Z",
      "primary_category": "cs.CV"
    },
    "arxiv_id": "2506.24086",
    "authors": [
      "Bingfan Zhu",
      "Biao Jiang",
      "Sunyi Wang",
      "Shixiang Tang",
      "Tao Chen",
      "Linjie Luo",
      "Youyi Zheng",
      "Xin Chen"
    ],
    "code_data_status": "截至来源报告核验时，未记录可确认的官方代码、数据或模型入口；这表示开放状态待核验，不代表资源确定不存在。",
    "comments": "",
    "deleted": false,
    "doi": "",
    "evidence_notes": "",
    "experiments": "在 motion generation 与 motion understanding benchmark 上达到 SOTA 或竞争性能。训练收敛显著更快：论文报告 training loss 约 2x faster，validation 最多 4x faster。实验结论是连续 motion latent + 双流结构能同时保留动作质量和语言能力。\n\n---",
    "figure": {
      "alt": "MotionGPT3 architecture",
      "label": "dual-stream motion-language architecture",
      "paper_title": "MotionGPT3: Human Motion as a Second Modality",
      "source_url": "https://arxiv.org/html/2506.24086v3/architure-v1.png",
      "url": "https://arxiv.org/html/2506.24086v3/architure-v1.png"
    },
    "id": "arxiv-2506-24086",
    "insight": "MotionGPT3 把 human motion 当成和 text 并列的第二模态，而不是把 motion 强行离散成 token。核心 insight：motion tokenization 会带来量化误差，single-stream text-motion 混训会产生跨模态干扰；因此用连续 VAE latent + 双流 Transformer + shared attention 更适合 motion-language unified modeling。",
    "limitations": "来源报告未单列可核验的局限、失败案例或开放问题；在补充原论文正文核验前，不对该工作的泛化性、因果性、复现性或 SOTA 结论作扩大解释。",
    "links": {
      "paper": "https://arxiv.org/abs/2506.24086",
      "project": "https://motiongpt3.github.io/",
      "alphaxiv": "https://alphaxiv.org/abs/2506.24086"
    },
    "pipeline": {
      "input": "文本序列或 motion sequence。",
      "process": "motion VAE 编码连续 latent；文本分支保留预训练 LLM 参数；motion branch 用 diffusion head 预测 motion latent；双分支通过 shared attention 交互；三阶段 generate-then-align training。",
      "output": "text-to-motion、motion-to-text，以及混合 motion-language 任务输出。",
      "details": "- **输入**：文本序列或 motion sequence。\n- **过程**：motion VAE 编码连续 latent；文本分支保留预训练 LLM 参数；motion branch 用 diffusion head 预测 motion latent；双分支通过 shared attention 交互；三阶段 generate-then-align training。\n- **输出**：text-to-motion、motion-to-text，以及混合 motion-language 任务输出。"
    },
    "publication": "arXiv 2025",
    "source_reports": [
      "report-90041fa2f9"
    ],
    "summary": "MotionGPT3 把 human motion 当成和 text 并列的第二模态，而不是把 motion 强行离散成 token。核心 insight：motion tokenization 会带来量化误差，single-stream text-motion 混训会产生跨模态干扰；因此用连续 VAE latent + 双流 Transformer + shared attention 更适合 motion-language unified modeling。",
    "tags": [
      "Agent与可执行世界",
      "HOI",
      "动作表征"
    ],
    "title": "MotionGPT3: Human Motion as a Second Modality",
    "updated_at": "2026-08-20",
    "year": 2025
  },
  {
    "arxiv_id": "2505.18947",
    "authors": [
      "Zhenhao Zhang",
      "Ye Shi",
      "Lingxiao Yang",
      "Suting Ni",
      "Qi Ye",
      "Jingya Wang"
    ],
    "code_data_status": "截至来源报告核验时，未记录可确认的官方代码、数据或模型入口；这表示开放状态待核验，不代表资源确定不存在。",
    "comments": "",
    "deleted": false,
    "doi": "10.52202/085713-5553",
    "evidence_notes": "",
    "experiments": "论文报告其在 novel object categories、multi-stage tasks、complex language instructions 下优于 SOTA 3D HOI synthesis 方法。\n\n**对你方向的启发**\n\n- 如果你的 world model 要接语言目标、任务分解、affordance，这篇很重要。\n- 它不是视频生成，但可以作为 “language -> 3D affordance/contact plan” 模块。\n\n---",
    "figure": {
      "url": "https://arxiv.org/html/2505.18947v2/pipeline.png",
      "alt": "OpenHOI Fig. 2：开放世界 3D HOI 合成流程",
      "label": "OpenHOI，Fig. 2，3D MLLM 任务分解、affordance grounding、HOI diffusion 与物理优化的整体流程。来源：Fig. 2 原图 PNG",
      "paper_title": "OpenHOI: Open-World Hand-Object Interaction Synthesis with Multimodal Large Language Model",
      "source_url": "https://arxiv.org/html/2505.18947v2/pipeline.png"
    },
    "id": "paper-3cc64741b1",
    "insight": "OpenHOI 面向 open-world 3D hand-object interaction synthesis，解决 closed-set object 和 predefined task 泛化差的问题。它用 3D MLLM 同时做 affordance grounding 和 semantic task decomposition，把复杂语言任务拆成可执行子任务，再用 affordance-driven diffusion 生成 HOI，并用 physics refinement 减少穿透、优化 affordance alignment。",
    "limitations": "- 如果你的 world model 要接语言目标、任务分解、affordance，这篇很重要。\n- 它不是视频生成，但可以作为 “language -> 3D affordance/contact plan” 模块。\n\n---",
    "links": {
      "publication": "https://proceedings.neurips.cc/paper_files/paper/2025/hash/f376f5dff6f6ec6364aea7a46ab49574-Abstract-Conference.html",
      "paper": "https://arxiv.org/abs/2505.18947",
      "project": "https://openhoi.github.io/",
      "alphaxiv": "https://alphaxiv.org/abs/2505.18947"
    },
    "pipeline": {
      "input": "自由语言指令、novel object / 3D object information。",
      "process": "3D MLLM 定位可交互区域并做任务分解；affordance-driven diffusion 生成 hand-object interaction；training-free physics refinement 优化物理合理性。",
      "output": "长程、多阶段、open-world 的 3D HOI sequence。",
      "details": "- **输入**：自由语言指令、novel object / 3D object information。\n- **过程**：3D MLLM 定位可交互区域并做任务分解；affordance-driven diffusion 生成 hand-object interaction；training-free physics refinement 优化物理合理性。\n- **输出**：长程、多阶段、open-world 的 3D HOI sequence。"
    },
    "publication": "NeurIPS 2025",
    "source_reports": [
      "report-0ad44831eb"
    ],
    "summary": "OpenHOI 面向 open-world 3D hand-object interaction synthesis，解决 closed-set object 和 predefined task 泛化差的问题。它用 3D MLLM 同时做 affordance grounding 和 semantic task decomposition，把复杂语言任务拆成可执行子任务，再用 affordance-driven diffusion 生成 HOI，并用 physics refinement 减少穿透、优化 affordance alignment。",
    "tags": [
      "3D/4D",
      "HOI",
      "对象与可供性",
      "第一视角与人类视频"
    ],
    "title": "OpenHOI: Open-World Hand-Object Interaction Synthesis with Multimodal Large Language Model",
    "updated_at": "2026-08-23",
    "year": 2025,
    "arxiv": {
      "published": "2025-05-25T02:48:43Z",
      "revised_at": "2025-12-21T08:11:53Z",
      "primary_category": "cs.CV"
    },
    "discussion": "- 如果你的 world model 要接语言目标、任务分解、affordance，这篇很重要。\n- 它不是视频生成，但可以作为 “language -> 3D affordance/contact plan” 模块。\n\n---"
  },
  {
    "id": "arxiv-2511-13647",
    "title": "Part-X-MLLM: Part-aware 3D Multimodal Large Language Model",
    "authors": [
      "Chunshi Wang",
      "Junliang Ye",
      "Yunhan Yang",
      "Yang Li",
      "Zizhuo Lin",
      "Jun Zhu",
      "Zhuo Chen",
      "Yawei Luo",
      "Chunchao Guo"
    ],
    "year": 2025,
    "publication": "2025 首次预印；ICLR 2026 会议论文",
    "arxiv_id": "2511.13647",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2511.13647",
      "project": "https://chunshi.wang/Part-X-MLLM/",
      "code": "https://github.com/AiEson/Part-X-MLLM",
      "publication": "https://openreview.net/forum?id=WffiETiSeU",
      "alphaxiv": "https://alphaxiv.org/abs/2511.13647"
    },
    "tags": [
      "3D/4D",
      "多模态感知与提示",
      "对象与可供性"
    ],
    "figure": {
      "url": "content/images/2511.13647-main.webp",
      "alt": "Figure 2：双编码器提取结构与外观，统一部件程序连接理解、生成和局部编辑",
      "label": "Figure 2 · 双编码器提取结构与外观，统一部件程序连接理解、生成和局部编辑",
      "paper_title": "Part-X-MLLM: Part-aware 3D Multimodal Large Language Model",
      "source_url": "https://arxiv.org/html/2511.13647v1/pipeline.png"
    },
    "summary": "Part-X-MLLM 用结构化可执行语法统一部件理解、问答、生成和编辑。模型输出部件计划，几何后端负责合成，从而把语言推理和高质量 3D 生成解耦。",
    "insight": "Part-X-MLLM 用结构化可执行语法统一部件理解、问答、生成和编辑。模型输出部件计划，几何后端负责合成，从而把语言推理和高质量 3D 生成解耦。",
    "pipeline": {
      "input": "带 RGB 的点云和自然语言指令。",
      "process": "双编码器分别表示几何结构（XYZ/normal）与外观语义（RGB），融合文字后自回归生成含部件 bbox、持久引用、语义描述和 add/delete/modify 命令的 token 序列；兼容几何引擎执行计划。",
      "output": "结构化部件程序、grounded 问答，或下游生成/局部编辑后的 3D 对象。",
      "details": "**过程**：双编码器分别表示几何结构（XYZ/normal）与外观语义（RGB），融合文字后自回归生成含部件 bbox、持久引用、语义描述和 add/delete/modify 命令的 token 序列；兼容几何引擎执行计划。\n\n- **输入**：带 RGB 的点云和自然语言指令。\n- **过程**：双编码器分别表示几何结构（XYZ/normal）与外观语义（RGB），融合文字后自回归生成含部件 bbox、持久引用、语义描述和 add/delete/modify 命令的 token 序列；兼容几何引擎执行计划。\n- **输出**：结构化部件程序、grounded 问答，或下游生成/局部编辑后的 3D 对象。\n\n模型先进行表示预训练，再用大规模部件指令数据调优。bbox 引用使跨步骤操作可寻址；文本语义聚类允许把细部件合并为较粗粒度。OmniPart 等生成、VoxHammer 等编辑后端仍承担实际几何合成，MLLM 自身不直接保证完整 mesh 质量。[方法 §3](https://arxiv.org/html/2511.13647#S3)\n\n### 方法细节与实现\n\n**表示与接口。**结构分支读取 4,096 个带法向的点，语义分支读取 1,024 个带颜色的点：前者保留局部形状，后者为语言描述提供外观线索。两路特征投影到语言模型的 token 空间后，与指令共同生成结构化序列。这里的“部件”首先是可引用的空间实体，而不是预设的机器人关节。\n\n**程序如何落地。**统一语法把部件框、语义描述和编辑操作绑定起来。理解任务可直接返回部件框与描述；生成任务先规划部件及相对布局，再交由几何生成器；编辑任务把 add/delete/modify 指令作用于明确的部件引用。这个分工使语言模型可以重用同一套寻址语法，但最终几何质量仍受外接后端影响。\n\n**训练设计。**多阶段指令调优先建立点云与文字的对应，再学习细粒度部件定位、描述和结构化操作。语义聚类用于调节部件粒度，解决不同数据源中“椅背整体”与“椅背横杆”等拆分粒度不一致的问题。它没有为部件自动补全动力学参数，也没有训练动作条件的状态转移函数。\n\n[对应方法原文](https://arxiv.org/html/2511.13647#S3)"
    },
    "experiments": "UniPart-Bench 覆盖 11 个任务族，包括 bbox 列举、part grounding、部件问答、对象描述和编辑。双编码器相对单编码器在 box listing 上提升 7.06 个 IoU 点；部件问答相对最佳非本文基线，SBERT/SimCSE/BLEU-1/ROUGE-L/METEOR 分别提高 18.7/25.5/21.3/13.0/14.2 点。\n\n这些指标主要测量结构与文字对应。局部编辑和生成还有定性展示，但不能据此推出任意物体都可获得机械可执行部件、准确关节或真实接触属性。[实验 §4](https://arxiv.org/html/2511.13647#S4)\n\n**读表要点。**部件框 IoU 衡量定位，SBERT/SimCSE 等衡量文字语义，BLEU/ROUGE/METEOR 衡量文本匹配；这些指标不能互相替代。双编码器消融直接检验结构与外观是否互补，而生成/编辑展示更多检验程序能否被后端执行。要用于可交互物体建模，还需独立评测部件身份、连接拓扑和操作后的几何保持。\n\n[实验与设置原文](https://arxiv.org/html/2511.13647)",
    "evidence_notes": "已核验原文方法、实验与局限；以下数值为作者报告，分析另行标注",
    "code_data_status": "[AiEson/Part-X-MLLM](https://github.com/AiEson/Part-X-MLLM) 官方仓库可访问，标注 ICLR 2026，但本次查看的树主要为 README/项目入口，未据此确认完整训练与推理代码、UniPart-Bench 数据及权重下载。会议状态已由 [ICLR OpenReview 原文](https://openreview.net/forum?id=WffiETiSeU) 核对。",
    "limitations": "bbox 只是粗部件定位，不能代替精细边界、拓扑、关节轴和接触面。结构解码错误会传到几何后端；跨步骤部件身份保持以及复杂组合编辑的鲁棒性还需要检验。任务级自动指标提升也不等同于装配或机器人操作可行性。",
    "comments": "",
    "source_reports": [],
    "deleted": false,
    "updated_at": "2026-09-24",
    "challenges": "许多 3D 模型把对象当作整体，缺少持久部件引用；生成和编辑系统又采用不同接口。这样很难执行“只替换左前腿”“删除把手但保留主体”等精细指令。",
    "motivation": "Part-X-MLLM 用结构化可执行语法统一部件理解、问答、生成和编辑。模型输出部件计划，几何后端负责合成，从而把语言推理和高质量 3D 生成解耦。",
    "technical_approach": "**过程**：双编码器分别表示几何结构（XYZ/normal）与外观语义（RGB），融合文字后自回归生成含部件 bbox、持久引用、语义描述和 add/delete/modify 命令的 token 序列；兼容几何引擎执行计划。\n\n- **输入**：带 RGB 的点云和自然语言指令。\n- **过程**：双编码器分别表示几何结构（XYZ/normal）与外观语义（RGB），融合文字后自回归生成含部件 bbox、持久引用、语义描述和 add/delete/modify 命令的 token 序列；兼容几何引擎执行计划。\n- **输出**：结构化部件程序、grounded 问答，或下游生成/局部编辑后的 3D 对象。\n\n模型先进行表示预训练，再用大规模部件指令数据调优。bbox 引用使跨步骤操作可寻址；文本语义聚类允许把细部件合并为较粗粒度。OmniPart 等生成、VoxHammer 等编辑后端仍承担实际几何合成，MLLM 自身不直接保证完整 mesh 质量。[方法 §3](https://arxiv.org/html/2511.13647#S3)\n\n### 方法细节与实现\n\n**表示与接口。**结构分支读取 4,096 个带法向的点，语义分支读取 1,024 个带颜色的点：前者保留局部形状，后者为语言描述提供外观线索。两路特征投影到语言模型的 token 空间后，与指令共同生成结构化序列。这里的“部件”首先是可引用的空间实体，而不是预设的机器人关节。\n\n**程序如何落地。**统一语法把部件框、语义描述和编辑操作绑定起来。理解任务可直接返回部件框与描述；生成任务先规划部件及相对布局，再交由几何生成器；编辑任务把 add/delete/modify 指令作用于明确的部件引用。这个分工使语言模型可以重用同一套寻址语法，但最终几何质量仍受外接后端影响。\n\n**训练设计。**多阶段指令调优先建立点云与文字的对应，再学习细粒度部件定位、描述和结构化操作。语义聚类用于调节部件粒度，解决不同数据源中“椅背整体”与“椅背横杆”等拆分粒度不一致的问题。它没有为部件自动补全动力学参数，也没有训练动作条件的状态转移函数。\n\n[对应方法原文](https://arxiv.org/html/2511.13647#S3)",
    "discussion": "**阅读者分析**：它提供的是静态部件层面的可寻址接口，可以和 FAMOS 的关节估计、AgentSTAR 的状态跟踪衔接。论文里的 executable 指编辑程序可被后端解释执行，不是随时间演化的物理世界模型。",
    "arxiv": {
      "published": "2025-11-17",
      "revised_at": "",
      "primary_category": "cs.CV"
    },
    "source_papers": [
      "content/papers/2511.13647.md"
    ]
  },
  {
    "id": "arxiv-2508-13104",
    "title": "Precise Action-to-Video Generation Through Visual Action Prompts",
    "authors": [
      "Yuang Wang",
      "Chao Wen",
      "Haoyu Guo",
      "Sida Peng",
      "Minghan Qin",
      "Hujun Bao",
      "Xiaowei Zhou",
      "Ruizhen Hu"
    ],
    "year": 2025,
    "publication": "2025，ICCV 2025，pp. 12713–12724",
    "arxiv_id": "2508.13104",
    "doi": "",
    "links": {
      "publication": "https://openaccess.thecvf.com/content/ICCV2025/html/Wang_Precise_Action-to-Video_Generation_Through_Visual_Action_Prompts_ICCV_2025_paper.html",
      "paper": "https://arxiv.org/abs/2508.13104",
      "project": "https://zju3dv.github.io/VAP/",
      "alphaxiv": "https://alphaxiv.org/abs/2508.13104"
    },
    "tags": [
      "3D/4D",
      "世界模型",
      "动作表征",
      "机器人学习",
      "视频生成",
      "跨本体迁移"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2508.13104/x1.png",
      "alt": "Precise Action-to-Video Generation Through Visual Action Prompts Fig. 1",
      "label": "Precise Action-to-Video Generation Through Visual Action Prompts，Fig. 1，骨架 visual action prompt 统一人手与机器人动作。来源：Fig. 1 原图",
      "paper_title": "Precise Action-to-Video Generation Through Visual Action Prompts",
      "source_url": "https://arxiv.org/html/2508.13104/x1.png"
    },
    "summary": "作者把动作“渲染”为相机平面中的主体结构，选择 2D 骨架作为获取成本与几何精度的折中。机器人关节状态和人类 MANO 手部姿态都能被转成同格式视频条件，从而联合学习 ego human video 与 robotic video 的交互动力学。",
    "insight": "作者把动作“渲染”为相机平面中的主体结构，选择 2D 骨架作为获取成本与几何精度的折中。机器人关节状态和人类 MANO 手部姿态都能被转成同格式视频条件，从而联合学习 ego human video 与 robotic video 的交互动力学。",
    "pipeline": {
      "input": "初始图像、动作序列、scene caption 和目标视频；机器人侧使用关节/相机参数，人类侧使用手部视频。",
      "process": "HOI 视频经 WiLoR、SAMURAI 和 OneEuro filter 得到平滑手部骨架；机器人轨迹在模拟器重放并渲染，经 MatchAnything 与 homography 校正。骨架视频由 3D 卷积编码；CogVideoX 前 14 个 block 复制为 ControlNet，零初始化注入控制，并以 LoRA 微调主 DiT。",
      "output": "25 帧、720×480 的动作条件视频；单模型覆盖 EgoVid、RT-1 和 DROID。",
      "details": "- **输入：** 初始图像、动作序列、scene caption 和目标视频；机器人侧使用关节/相机参数，人类侧使用手部视频。\n- **过程：** HOI 视频经 WiLoR、SAMURAI 和 OneEuro filter 得到平滑手部骨架；机器人轨迹在模拟器重放并渲染，经 MatchAnything 与 homography 校正。骨架视频由 3D 卷积编码；CogVideoX 前 14 个 block 复制为 ControlNet，零初始化注入控制，并以 LoRA 微调主 DiT。\n- **输出：** 25 帧、720×480 的动作条件视频；单模型覆盖 EgoVid、RT-1 和 DROID。"
    },
    "experiments": "训练使用 EgoVid 200k、DROID 47k、RT-1 57k clips。DROID 上 text/raw state/skeleton 单域/skeleton 联合的 FVD 为 248.3/151.2/141.8/124.4，ST-IoU 为 0.239/0.365/0.450/0.478；novel lab 的 J&F 为 26.9/33.4/52.5/54.9。RT-1 联合训练的 FVD 优于单域（258.1 vs 288.6），但 PSNR、SSIM、LPIPS、ST-IoU 均略差，因此联合训练并非全面领先。\n\n表示消融中 DROID skeleton/mesh/depth 的 FVD 为 141.8/120.4/119.7，说明骨架不是最精确条件，其优势是易获取和可扩展。去掉 ControlNet 后 FVD 165.2，去掉主分支注入为 146.9，完整为 141.8。EgoVid 测试仅人工选 32 clips；论文未报告 GPU、训练步数或时长，也没有真实机器人闭环成功率。",
    "evidence_notes": "",
    "code_data_status": "论文与项目页公开；未核验到官方训练代码、权重或处理后骨架标注下载。原始 EgoVid、RT-1、DROID 的开放状态不能替代本文处理资产。",
    "limitations": "- 2D prompt 的三维与接触信息有限。\n- 手部恢复、跟踪、标定和 homography 误差会级联。\n- EgoVid 测试集仅 32 clips，存在选择偏差风险。\n- 未报告算力与关键训练超参数。\n- 只验证离线视频指标，没有闭环控制证据。",
    "comments": "",
    "source_reports": [
      "report-a77d9a7ad6"
    ],
    "deleted": false,
    "updated_at": "2026-08-21",
    "challenges": "action-to-video 存在精度—通用性权衡：文本和 primitive 通用但控制粗糙；末端位姿精确却绑定机器人和坐标系；mask 受遮挡影响，mesh 又难从野外视频规模化恢复。长期挑战是高自由度交互生成，本文具体缺口是缺少可同时处理人手和机器人数据的统一动作条件。",
    "motivation": "作者把动作“渲染”为相机平面中的主体结构，选择 2D 骨架作为获取成本与几何精度的折中。机器人关节状态和人类 MANO 手部姿态都能被转成同格式视频条件，从而联合学习 ego human video 与 robotic video 的交互动力学。",
    "technical_approach": "- **输入：** 初始图像、动作序列、scene caption 和目标视频；机器人侧使用关节/相机参数，人类侧使用手部视频。\n- **过程：** HOI 视频经 WiLoR、SAMURAI 和 OneEuro filter 得到平滑手部骨架；机器人轨迹在模拟器重放并渲染，经 MatchAnything 与 homography 校正。骨架视频由 3D 卷积编码；CogVideoX 前 14 个 block 复制为 ControlNet，零初始化注入控制，并以 LoRA 微调主 DiT。\n- **输出：** 25 帧、720×480 的动作条件视频；单模型覆盖 EgoVid、RT-1 和 DROID。",
    "discussion": "最可靠结论是“相机对齐的视觉动作条件优于抽象动作条件”，不是“骨架永远最佳”。VAP 提供了连接人手与机器人视频的实用接口，但 2D 结构缺少深度和接触力学，预处理误差也会直接污染条件。",
    "arxiv": {
      "published": "2025-08-18T17:12:28Z",
      "revised_at": "2025-08-18T17:12:28Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2511-01177",
    "title": "Scaling Cross-Embodiment World Models for Dexterous Manipulation",
    "authors": [
      "Zihao He",
      "Bo Ai",
      "Tongzhou Mu",
      "Yulin Liu",
      "Weikang Wan",
      "Jiawei Fu",
      "Yilun Du",
      "Henrik I. Christensen",
      "Hao Su"
    ],
    "year": 2025,
    "publication": "2025，arXiv preprint",
    "arxiv_id": "2511.01177",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2511.01177",
      "project": "https://alan-heoooh.github.io/dexwm.html",
      "alphaxiv": "https://alphaxiv.org/abs/2511.01177"
    },
    "tags": [
      "3D/4D",
      "世界模型",
      "动作表征",
      "机器人学习",
      "跨本体迁移"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2511.01177/x1.png",
      "alt": "Scaling Cross-Embodiment World Models for Dexterous Manipulation Fig. 1",
      "label": "Scaling Cross-Embodiment World Models for Dexterous Manipulation，Fig. 1，粒子状态与末端粒子位移统一不同手型。来源：Fig. 1 原图",
      "paper_title": "Scaling Cross-Embodiment World Models for Dexterous Manipulation",
      "source_url": "https://arxiv.org/html/2511.01177/x1.png"
    },
    "summary": "作者主张跨本体可共享的不是关节动作，而是对环境产生的物理交互。将人手、机器人手和物体统一成 3D 粒子，动作定义为末端粒子位移，就能把不同 DoF 的控制映射到同一几何接口，并用一个图世界模型加 MPC 部署。",
    "insight": "作者主张跨本体可共享的不是关节动作，而是对环境产生的物理交互。将人手、机器人手和物体统一成 3D 粒子，动作定义为末端粒子位移，就能把不同 DoF 的控制映射到同一几何接口，并用一个图世界模型加 MPC 部署。",
    "pipeline": {
      "input": "手与物体 3D 粒子、候选关节动作、目标物体点云。",
      "process": "前向运动学把动作变为粒子位移；DPI-Net 半径图进行局部消息传播并预测下一粒子状态，仿真用 MSE、无对应真实点云用 Chamfer/EMD。MPC 每次采样 500 个 horizon-4 序列、优化 10 次，执行 2 步后重规划。",
      "output": "物体粒子未来和目标机器人原生关节空间中的控制动作。",
      "details": "- **输入：** 手与物体 3D 粒子、候选关节动作、目标物体点云。\n- **过程：** 前向运动学把动作变为粒子位移；DPI-Net 半径图进行局部消息传播并预测下一粒子状态，仿真用 MSE、无对应真实点云用 Chamfer/EMD。MPC 每次采样 500 个 horizon-4 序列、优化 10 次，执行 2 步后重规划。\n- **输出：** 物体粒子未来和目标机器人原生关节空间中的控制动作。"
    },
    "experiments": "六种模拟手、两类刚体/塑形任务，每手每任务 100 条随机轨迹；真实人类 ThumbPinch/FingersPinch/PalmPress 各 30 分钟。论文以均值和 95% CI 显示训练本体越多，未见手 MSE 与组合方差总体下降，但图中没有精确点值，不宜编造 scaling law 数表。\n\n真实塑形每手 4 字母×5 trials。Ability Hand co-train 18/20、human-only 10/20；XHand 17/20 vs 9/20。平衡约 1:1 sim/human 最好，simulation-only 最差，支持仿真是正则而非真实替代。RTX 4090 每次 MPC 更新约 60 秒，不适合高频闭环；系统还依赖四相机与人工动作原语。",
    "evidence_notes": "",
    "code_data_status": "项目页与论文公开；未核验代码、权重、随机交互数据或 90 分钟人类数据下载。",
    "limitations": "- 半径图对手尺寸与粒子密度敏感。\n- sim-only 表现差，接触参数 reality gap 未解决。\n- MPC 每次约 60 秒，无法实时。\n- 依赖四相机、网格/点云重建和 FoundationPose。\n- 真实任务和手型有限，并依赖人工动作原语。",
    "comments": "",
    "source_reports": [
      "report-a77d9a7ad6"
    ],
    "deleted": false,
    "updated_at": "2026-08-31",
    "challenges": "多指手的自由度、关节定义与控制空间不同，动作标签不能直接合并；接触丰富的刚体/可变形体操作还叠加高维控制与 sim-to-real gap。本文针对既有跨本体工作多局限于抓取、重定向或平行夹爪，缺少真正共享的状态—动作空间。",
    "motivation": "作者主张跨本体可共享的不是关节动作，而是对环境产生的物理交互。将人手、机器人手和物体统一成 3D 粒子，动作定义为末端粒子位移，就能把不同 DoF 的控制映射到同一几何接口，并用一个图世界模型加 MPC 部署。",
    "technical_approach": "- **输入：** 手与物体 3D 粒子、候选关节动作、目标物体点云。\n- **过程：** 前向运动学把动作变为粒子位移；DPI-Net 半径图进行局部消息传播并预测下一粒子状态，仿真用 MSE、无对应真实点云用 Chamfer/EMD。MPC 每次采样 500 个 horizon-4 序列、优化 10 次，执行 2 步后重规划。\n- **输出：** 物体粒子未来和目标机器人原生关节空间中的控制动作。",
    "discussion": "这篇不依赖视频生成，直接证明粒子位移可作为跨手型共享 action abstraction。本体多样性和 sim-real 共训结果有价值，但证据集中在塑形、两种真机手与四个目标，且在线规划极慢；它是“geometry action”的强概念验证，而非通用实时策略。",
    "arxiv": {
      "published": "2025-11-03T03:02:16Z",
      "revised_at": "2026-07-21T02:42:52Z",
      "primary_category": "cs.RO"
    }
  },
  {
    "id": "arxiv-2506-08009",
    "title": "Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion",
    "authors": [
      "Xun Huang",
      "Zhengqi Li",
      "Guande He",
      "Mingyuan Zhou",
      "Eli Shechtman"
    ],
    "year": 2025,
    "publication": "2025，NeurIPS 2025 Spotlight（官方会议页标注 Spotlight Poster）。预印本 arXiv:2506.08009（v2）。Adobe Research + UT Austin。通讯 xuhuang@adobe.com。尚无单独核验的会议 DOI；arXiv DOI：10.48550/arXiv.2506.08009。",
    "arxiv_id": "2506.08009",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2506.08009",
      "project": "https://self-forcing.github.io/",
      "code": "https://github.com/guandeh17/Self-Forcing",
      "alphaxiv": "https://alphaxiv.org/abs/2506.08009"
    },
    "tags": [
      "Agent与可执行世界",
      "因果与反事实",
      "流式与自回归",
      "视频生成"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2506.08009v2/overview.png",
      "alt": "Self Forcing Fig. 1: teacher forcing vs diffusion forcing vs self-rollout training",
      "label": "Self Forcing，Fig. 1，Teacher Forcing / Diffusion Forcing / Self Forcing 三种训练范式。来源：Fig. 1 原图 PNG",
      "paper_title": "Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion",
      "source_url": "https://arxiv.org/html/2506.08009v2/overview.png"
    },
    "summary": "核心 Insight： 训练时按推理配方自 rollout（带 KV cache），再对整段生成视频做 holisitic 分布匹配。 这样 DMD / SiD / GAN 匹配的是真正的 p theta(x^1:N)，而不是 DF 的训练替代分布。梯度截断到每帧最后一步、随机采样中间步 s，并把 KV 从梯度图拆掉，使顺序 unroll 在 post-training 阶段可承受。",
    "insight": "核心 Insight：**训练时按推理配方自 rollout（带 KV cache），再对整段生成视频做 holisitic 分布匹配。** 这样 DMD / SiD / GAN 匹配的是真正的 \\(p_\\theta(x^{1:N})\\)，而不是 DF 的训练替代分布。梯度截断到每帧最后一步、随机采样中间步 \\(s\\)，并把 KV 从梯度图拆掉，使顺序 unroll 在 post-training 阶段可承受。\n\n与本知识库课题 **间接相关但接口关键**：它把交互视频、游戏、世界模拟列为延迟以毫秒计的目标，训练配方被 Causal Forcing / LongLive / minWM 直接继承。它优化的是生成分布对齐，不是动作条件或物理干预。",
    "pipeline": {
      "input": "文本 prompt（VidProM 过滤 + Qwen2.5-7B 扩写）。骨干 Wan2.1-T2V-1.3B，5 s、16 FPS、832× 480。",
      "process": "先按 CausVid 协议用 16k 条 ODE 对做因果初始化。然后 Self Forcing：对每一帧从噪声逐步去噪，条件是自己已生成的 KV；只在随机步 s 打开梯度，其余步 stop-grad；KV 不回传。损失可选 DMD（real score 用 Wan-14B）、SiD 或 R3GAN。实现 chunk-wise（3 latent 帧/块）与 frame-wise 两种。长视频用固定长度 rolling KV，训练时禁止最后一块看见第一块，以模拟 cache 里不再有 image latent 的外推条件。DMD 约 1.5 h × 64 H100。",
      "output": "流式视频。chunk-wise 4-step：17.0 FPS、0.69 s 延迟（H100）；frame-wise：8.9 FPS、0.45 s。",
      "details": "- **输入：** 文本 prompt（VidProM 过滤 + Qwen2.5-7B 扩写）。骨干 Wan2.1-T2V-1.3B，5 s、16 FPS、\\(832\\times 480\\)。\n- **过程：** 先按 CausVid 协议用 16k 条 ODE 对做因果初始化。然后 Self Forcing：对每一帧从噪声逐步去噪，条件是自己已生成的 KV；只在随机步 \\(s\\) 打开梯度，其余步 stop-grad；KV 不回传。损失可选 DMD（real score 用 Wan-14B）、SiD 或 R3GAN。实现 chunk-wise（3 latent 帧/块）与 frame-wise 两种。长视频用固定长度 rolling KV，训练时禁止最后一块看见第一块，以模拟 cache 里不再有 image latent 的外推条件。DMD 约 1.5 h × 64 H100。\n- **输出：** 流式视频。chunk-wise 4-step：17.0 FPS、0.69 s 延迟（H100）；frame-wise：8.9 FPS、0.45 s。\n\n与最近 baseline 的实质差异：相对 CausVid，DMD 的样本来自自 rollout 而非 DF；相对 TF/DF+DMD，上下文来自 \\(p_\\theta\\) 而非 \\(p_{\\text{data}}\\)。作者强调动机是纠暴露偏差，不只是减步数，因此 consistency distillation 这类只缩短步数的方法不适用。"
    },
    "experiments": "**作者主张：** 在相近参数量上同时拿到最高 VBench 与实时吞吐，用户偏好超过初始化用的双向 Wan2.1。\n\n实验实际支持：\n\n- **主表（官方 CausVid Wan-1.3B 重实现对照）：** chunk-wise Self Forcing VBench Total/Quality/Semantic = **84.31 / 85.07 / 81.28**，17.0 FPS / 0.69 s；Wan2.1 84.26 / 85.30 / 80.09 但 0.78 FPS / 103 s；CausVid 重实现 81.20 / 84.05 / 69.80。frame-wise 84.26 / 85.25 / 80.30，8.9 FPS / 0.45 s。\n- **消融：** chunk-wise 上 SF-DMD 84.31 高于 DF+DMD 82.76、TF+DMD 82.32、many-step TF 83.58。frame-wise 差距更大：SF-DMD 84.26 vs DF 77.24 / TF 80.34。SiD / GAN 略低于 DMD 但仍高于 TF/DF 蒸馏。\n- **Rolling KV：** 滑窗重算 KV 生成 10 s 仅 4.6 FPS；训练时挡住首块后 rolling cache 16.1 FPS 且减轻闪烁。\n- **用户研究：** MovieGenBench 全部 1003 prompt，每条 1 名用户二选一；SF 优于含 Wan2.1 在内的对照。这是偏好而非绝对质量标尺。\n- **训练成本：** 与 TF/DF 单步耗时接近；同墙钟下 VBench 更高。作者把它归因于 SF 用 FlashAttention-3 全注意力，而 TF/DF 要 FlexAttention 因果 mask。\n\n**证据未支持：** 训练上下文之外的任意长视频不退化；gradient truncation 不影响长程依赖；项目页“单卡 4090 实时”与文中 H100 测速不是同一套数字，引用时要写硬件。",
    "evidence_notes": "",
    "code_data_status": "- **代码：** [guandeh17/Self-Forcing](https://github.com/guandeh17/Self-Forcing)，基于 Wan2.1 与 CausVid 开源实现。\n- **DMD/SiD：** 作者称可无视频数据，只靠预训练扩散模型；GAN 变体用 14B 模型生成的 70k 视频。\n- **Prompt：** VidProM 过滤后约 25 万条再 LLM 扩写；VBench 评测同样扩写。完整原始视频预训练语料仍依赖 Wan。",
    "limitations": "- 超出训练上下文的长视频仍可见质量下降。\n- 每帧只回传最后一步、KV 切断梯度，长程信用分配受限。\n- 朴素 rolling KV 若不在训练中挡住首块，会因 image latent 统计不匹配而闪烁。\n- frame-wise 比 chunk-wise 动态更强、时序一致性更弱（附录雷达图）。\n- reverse KL 仍可能压多样性；GAN 需要大 batch（768）。\n- 开源实现与 Adobe 内部实验设置若有差异，需以仓库 README 为准。\n\n---",
    "comments": "",
    "source_reports": [
      "report-c7ced2c92d"
    ],
    "deleted": false,
    "updated_at": "2026-08-21",
    "challenges": "领域长期问题仍是暴露偏差：训练时看 ground-truth 上下文，推理时必须吃自己的错。本文针对的不是“再做一个更快的 CausVid”，而是 **CausVid 的 DMD 匹配了错误分布**。\n\n- **作者对 CausVid 的具体批评：** CausVid 用 Diffusion Forcing 生成训练输出，再拿 DMD 去对齐真实视频分布；但 DF 输出并不来自推理时的自回归分布，因此 DMD 在匹配错误对象。\n- **TF / DF 的共同失败：** 两者都能并行训练整段视频，却都在 GT 或噪声上下文上做帧级去噪；推理时上下文是自己生成的干净帧，误差随 AR 步数放大，表现为过饱和、过锐化。\n- **效率缺口：** 真·实时需要吞吐高于播放帧率 **且** 首帧延迟低于感知阈值；只报 FPS 不够。\n- **长视频 KV：** 双向 DF 不能 cache；已有因果实现每次滑窗重算重叠 KV。朴素 rolling cache 会因第一帧统计特性不同而闪烁。",
    "motivation": "核心 Insight：**训练时按推理配方自 rollout（带 KV cache），再对整段生成视频做 holisitic 分布匹配。** 这样 DMD / SiD / GAN 匹配的是真正的 \\(p_\\theta(x^{1:N})\\)，而不是 DF 的训练替代分布。梯度截断到每帧最后一步、随机采样中间步 \\(s\\)，并把 KV 从梯度图拆掉，使顺序 unroll 在 post-training 阶段可承受。\n\n与本知识库课题 **间接相关但接口关键**：它把交互视频、游戏、世界模拟列为延迟以毫秒计的目标，训练配方被 Causal Forcing / LongLive / minWM 直接继承。它优化的是生成分布对齐，不是动作条件或物理干预。",
    "technical_approach": "- **输入：** 文本 prompt（VidProM 过滤 + Qwen2.5-7B 扩写）。骨干 Wan2.1-T2V-1.3B，5 s、16 FPS、\\(832\\times 480\\)。\n- **过程：** 先按 CausVid 协议用 16k 条 ODE 对做因果初始化。然后 Self Forcing：对每一帧从噪声逐步去噪，条件是自己已生成的 KV；只在随机步 \\(s\\) 打开梯度，其余步 stop-grad；KV 不回传。损失可选 DMD（real score 用 Wan-14B）、SiD 或 R3GAN。实现 chunk-wise（3 latent 帧/块）与 frame-wise 两种。长视频用固定长度 rolling KV，训练时禁止最后一块看见第一块，以模拟 cache 里不再有 image latent 的外推条件。DMD 约 1.5 h × 64 H100。\n- **输出：** 流式视频。chunk-wise 4-step：17.0 FPS、0.69 s 延迟（H100）；frame-wise：8.9 FPS、0.45 s。\n\n与最近 baseline 的实质差异：相对 CausVid，DMD 的样本来自自 rollout 而非 DF；相对 TF/DF+DMD，上下文来自 \\(p_\\theta\\) 而非 \\(p_{\\text{data}}\\)。作者强调动机是纠暴露偏差，不只是减步数，因此 consistency distillation 这类只缩短步数的方法不适用。",
    "discussion": "Self Forcing 把 CausVid 的不对称 DMD 补上了缺失的一环：匹配对象必须是推理分布。Wan-1.3B 上的对照支持这一诊断，尤其是 frame-wise 设定下 TF/DF 崩而 SF 不崩。适用边界是 5 s 级训练上下文上的 T2V 流式生成。失败案例是外推显著长于训练长度时质量仍掉；作者也承认截断梯度可能伤长程依赖。阅读判断：后续 Causal Forcing 接受其 DMD 阶段、只改 ODE 初始化，说明这篇的 self-rollout 已被当作标准；不要把 VBench 84.31 写成已经解决世界模拟，也不要把“holistic matching”写成因果识别。",
    "arxiv": {
      "published": "2025-06-09T17:59:55Z",
      "revised_at": "2025-11-10T04:36:27Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2509-09737",
    "title": "World Modeling with Probabilistic Structure Integration",
    "authors": [
      "Klemen Kotar",
      "Wanhee Lee",
      "Rahul Venkatesh",
      "Honglin Chen",
      "Daniel Bear",
      "Jared Watrous",
      "Simon Kim",
      "Khai Loong Aw",
      "Lilian Naing Chen",
      "Stefan Stojanov",
      "Kevin Feigelis",
      "Imran Thobani",
      "Alex Durango",
      "Khaled Jedoui",
      "Atlas Kazemian",
      "Dan Yamins"
    ],
    "year": 2025,
    "publication": "2025，arXiv preprint（v1，2025-09-10）；arXiv:2509.09737；正式 DOI 未见",
    "arxiv_id": "2509.09737",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2509.09737",
      "alphaxiv": "https://alphaxiv.org/abs/2509.09737"
    },
    "tags": [
      "3D/4D",
      "世界模型",
      "因果与反事实",
      "物理建模与仿真"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2509.09737v1/concept_v2.png",
      "alt": "World Modeling with Probabilistic Structure Integration Fig. 1",
      "label": "World Modeling with Probabilistic Structure Integration，Fig. 1，概率结构整合的世界模型循环。来源：Fig. 1 原图",
      "paper_title": "World Modeling with Probabilistic Structure Integration",
      "source_url": "https://arxiv.org/html/2509.09737v1/concept_v2.png"
    },
    "summary": "PSI 提出“概率预测→结构提取→结构回灌”的循环：先学任意变量集合之间的条件分布，再通过模型内条件推断抽取低维结构，最后将这些结构作为新 token 类型加入训练。",
    "insight": "PSI 提出“概率预测→结构提取→结构回灌”的循环：先学任意变量集合之间的条件分布，再通过模型内条件推断抽取低维结构，最后将这些结构作为新 token 类型加入训练。",
    "pipeline": {
      "input": "互联网视频切分的时空 tokens，以及后续抽取的 flow、depth、segmentation 等结构 tokens",
      "process": "random-access autoregressive sequence model 学习广泛条件分布；通过条件/干预式 prompting 抽取中间结构；将结构作为条件和预测目标重新混入训练数据",
      "output": "任意条件视频预测、零样本视觉结构、相机/对象控制与改进后的 world model",
      "details": "- **输入：** 互联网视频切分的时空 tokens，以及后续抽取的 flow、depth、segmentation 等结构 tokens\n- **过程：** random-access autoregressive sequence model 学习广泛条件分布；通过条件/干预式 prompting 抽取中间结构；将结构作为条件和预测目标重新混入训练数据\n- **输出：** 任意条件视频预测、零样本视觉结构、相机/对象控制与改进后的 world model"
    },
    "experiments": "作者训练实例使用 1.4 万亿互联网视频 tokens，报告 optical flow、自监督 depth 和 object segmentation 的强结果，并完成一轮结构回灌后的预测改进。在 WildRGB-D novel-view synthesis 和 3DEditBench object manipulation 上，论文称优于所选专用/编辑基线。由于缺少公开训练语料、代码和可复现算力配置，本报告将这些视为作者自报告，而非独立确认。",
    "evidence_notes": "",
    "code_data_status": "论文公开，arXiv 标注相应许可；未核验到完整训练代码、1.4T-token 数据清单或权重，因此端到端复现性有限。",
    "limitations": "- 训练规模巨大且数据构成不透明。\n- 条件分布丰富不等于因果方向或干预效应可识别。\n- 抽取结构可能继承预测模型的偏差。\n- 未给出机器人闭环、真实力学参数恢复或安全干预验证。",
    "comments": "",
    "source_reports": [
      "report-d2be249044"
    ],
    "deleted": false,
    "updated_at": "2026-09-03",
    "challenges": "视觉模型通常只能沿固定方向预测，特定任务又需要单独监督的 depth、flow、segmentation 或 control encoder，难形成类似语言模型的通用查询接口。",
    "motivation": "PSI 提出“概率预测→结构提取→结构回灌”的循环：先学任意变量集合之间的条件分布，再通过模型内条件推断抽取低维结构，最后将这些结构作为新 token 类型加入训练。",
    "technical_approach": "- **输入：** 互联网视频切分的时空 tokens，以及后续抽取的 flow、depth、segmentation 等结构 tokens\n- **过程：** random-access autoregressive sequence model 学习广泛条件分布；通过条件/干预式 prompting 抽取中间结构；将结构作为条件和预测目标重新混入训练数据\n- **输出：** 任意条件视频预测、零样本视觉结构、相机/对象控制与改进后的 world model",
    "discussion": "PSI 的“causal inference”主要指从完整条件分布做结构查询与提示；它提供灵活 control handles，但不自动满足环境 SCM 的可识别性。对世界模型研究的影响在于：新增单一 depth/flow/segmentation head 很难构成 novelty，必须证明结构回灌或任务机制上的额外价值。",
    "arxiv": {
      "published": "2025-09-10T18:01:04Z",
      "revised_at": "2025-09-10T18:01:04Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "arxiv": {
      "published": "2024-01-23T05:43:15Z",
      "revised_at": "2024-01-23T05:43:15Z",
      "primary_category": "cs.AI"
    },
    "arxiv_id": "2401.12497",
    "authors": [
      "Zizhao Wang",
      "Caroline Wang",
      "Xuesu Xiao",
      "Yuke Zhu",
      "Peter Stone"
    ],
    "code_data_status": "- 截至检索日，论文/AAAI 页面未提供可核实的官方代码链接。\n- 依赖 observed factored state 和变量边界；DMC 的真实 causal graph 本身不完全明确；干扰变量被设计为简单、隔离；没有个体反事实或真实机器人 OOD 评测。\n\n---",
    "comments": "",
    "deleted": false,
    "doi": "10.1609/aaai.v38i14.29507",
    "evidence_notes": "- **作者明确主张：** causal bisimulation 可形成 minimal、task-specific 且 dynamics-reusable 的 state abstraction。\n- **实验实际支持：** 在已知 state factorization 和合成 distractors 下，变量筛选与 RL 学习优于完整 state 和若干抽象 baseline。\n- **阅读判断：** 它解决“从已知变量中选什么”，不解决“从 RGB 中发现变量是什么”。这一输入假设是迁移到视觉世界模型的最大缺口。",
    "experiments": "### 环境\n\n- 两个 Robosuite manipulation environments；\n- 四类 manipulation tasks，包括 Pick、Stack、Tool-use series；\n- 另包含 DMC Cheetah / Walker 类任务分析。\n\n为了系统测试 abstraction，作者加入：\n\n- 20 controllable distractor variables；\n- 20 uncontrollable distractor variables。\n\n### Causal graph learning\n\nImplicit dynamics 相比 explicit predictor 的 causal graph recovery 更准确。\n\n示例：\n\n- Block env：约 90.5 ± 0.4 vs 87.5 ± 0.1\n- Tool-use：约 85.5 ± 0.1 vs 82.6 ± 0.2\n\nstate abstraction accuracy 的差距更明显：\n\n- Pick：implicit 约 95.7 ± 6.0\n- explicit 约 53.2 ± 4.6\n\n### Downstream RL\n\nbaseline：\n\n- CDL；\n- TIA；\n- Denoised MDP；\n- Oracle；\n- Full-state。\n\n结果显示 CBM 的 minimal causal state 在多个任务上达到接近 oracle 的 sample efficiency，并优于保留过多无关变量的方法。\n\n论文在 causal graph/dynamics 实验使用约 3 seeds，task learning 使用约 5 seeds，并报告误差范围。",
    "figure": {
      "url": "https://arxiv.org/html/2401.12497v1/aaai_intro_v2_copy.svg",
      "alt": "CBM Fig. 1：任务相关、最小且可复用的因果状态抽象",
      "label": "Building Minimal and Reusable Causal State Abstractions for Reinforcement Learning，Fig. 1，CBM 相对 CDL、TIA 与 Denoised MDP 的任务最小因果状态抽象。来源：Fig. 1 原图 SVG",
      "paper_title": "CBM：最小、可复用的因果状态抽象",
      "source_url": "https://arxiv.org/html/2401.12497v1/aaai_intro_v2_copy.svg"
    },
    "id": "arxiv-2401-12497",
    "insight": "CBM 关注一个非常重要但常被忽视的问题：\n\n> 一个 good world state 不应该包含所有 observable variables，而应该只保留完成当前任务真正需要的 **causal variables**。\n\n它先学习 environment 的 reusable causal dynamics，再根据具体 reward/task 找出与任务结果有 causal dependency 的变量，构建最小 state abstraction。\n\n所以它区分：\n\n- **environment dynamics**：可跨任务复用；\n- **task reward dependency**：任务相关；\n- **policy state**：只保留当前任务真正需要的变量。\n\n这给 causal world model 一个很重要的思想：\n\n\\[\n\\boxed{\n\\text{Good state representation}\n\\neq\n\\text{maximum reconstruction information}\n}\n\\]\n\n而是：\n\n\\[\n\\text{minimal intervention-relevant state}\n\\]",
    "limitations": "最大限制：\n\n> **输入已经是 factored low-dimensional state，而不是从图像中发现 causal variables。**\n\n因此它解决的是：\n\n\\[\n\\text{known state factors}\n\\rightarrow\n\\text{causal abstraction}\n\\]\n\n而不是：\n\n\\[\nRGB/Video\n\\rightarrow\n\\text{unknown causal state}\n\\]\n\n另外：\n\n- causal graph ground truth 主要存在于 simulator；\n- distractors 是人工构造；\n- 没有 counterfactual visual rollout；\n- 没有 3D/4D representation learning。\n\n**阅读判断**：  \n这篇对你的研究很有启发：真正值得学习的不是 mesh/pose 越多越好，而是学习一个 **minimal causal state**。\n\n---",
    "links": {
      "publication": "https://ojs.aaai.org/index.php/AAAI/article/view/29507",
      "paper": "https://arxiv.org/abs/2401.12497",
      "alphaxiv": "https://alphaxiv.org/abs/2401.12497"
    },
    "pipeline": {
      "input": "implicit energy-based dynamics；causal reward model；ancestor tracing / causal bisimulation；SAC",
      "process": "条件依赖/动态图；reward parents；task-specific state mask；policy/value",
      "output": "条件依赖/动态图；reward parents；task-specific state mask；policy/value",
      "details": "**输入**：\n\n- factored low-dimensional state \\(s_t\\)；\n- action \\(a_t\\)；\n- reward \\(r_t\\)。\n\n**过程**：\n\n1. 学 causal dynamics dependency；\n2. 使用 implicit / energy-based dynamics model，判断哪些输入变量真正影响下一状态变量；\n3. 学 task-specific reward dependency；\n4. 从 causal graph 中回溯与 reward 有关的 ancestors；\n5. 得到 binary state mask；\n6. policy 只在 minimal causal abstraction 上学习。\n\n**输出**：\n\n- reusable causal dynamics model；\n- task-specific minimal state abstraction；\n- downstream policy。"
    },
    "publication": "AAAI 2024",
    "source_reports": [
      "report-554de78a93",
      "report-6fa37648ba",
      "report-ce5d8128c6"
    ],
    "summary": "论文： Building Minimal and Reusable Causal State Abstractions for Reinforcement Learning 方法： Causal Bisimulation Modeling 作者： Zizhao Wang et al. 发表： AAAI 2024 入口： AAAI｜arXiv",
    "tags": [
      "3D/4D",
      "因果与反事实",
      "对象与可供性"
    ],
    "title": "Building Minimal and Reusable Causal State Abstractions for Reinforcement Learning",
    "updated_at": "2026-08-31",
    "year": 2024
  },
  {
    "id": "arxiv-2405-14867",
    "title": "Improved Distribution Matching Distillation for Fast Image Synthesis",
    "authors": [
      "Tianwei Yin",
      "Michaël Gharbi",
      "Taesung Park",
      "Richard Zhang",
      "Eli Shechtman",
      "Frédo Durand",
      "William T. Freeman"
    ],
    "year": 2024,
    "publication": "2024，NeurIPS 2024 Main Conference Track， Advances in Neural Information Processing Systems 37 。MIT / Adobe Research。预印本 arXiv:2405.14867（v2，cs.CV）；正式论文 DOI：10.52202/079017-1505；arXiv DOI：10.48550/arXiv.2405.14867。",
    "arxiv_id": "2405.14867",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2405.14867",
      "publication": "https://proceedings.neurips.cc/paper_files/paper/2024/hash/54dcf25318f9de5a7a01f0a4125c541e-Abstract-Conference.html",
      "project": "https://tianweiy.github.io/dmd2/",
      "code": "https://github.com/tianweiy/DMD2",
      "alphaxiv": "https://alphaxiv.org/abs/2405.14867"
    },
    "tags": [
      "3D/4D",
      "Agent与可执行世界",
      "流式与自回归",
      "视频生成"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2405.14867v2/gan_pipeline_new.png",
      "alt": "DMD2 Fig. 3: distribution matching, TTUR, and GAN loss",
      "label": "DMD2，Fig. 3，TTUR、GAN 判别分支与分布匹配联合训练。来源：Fig. 3 原图 PNG",
      "paper_title": "Improved Distribution Matching Distillation for Fast Image Synthesis",
      "source_url": "https://arxiv.org/html/2405.14867v2/gan_pipeline_new.png"
    },
    "summary": "- fake score 是移动目标，应比 generator 更频繁更新；作者采用 5 次 fake-score 更新 : 1 次 generator 更新 的 two-time-scale update rule（TTUR）。 - teacher score 本身近似真实数据分布；在 fake denoiser bottleneck 加一个轻量 GAN classifier，让真实图像直接校正分布匹配误差。 - 多步学生必须在训练时看到自己前几步产生的 noisy synthetic states，而非只看 real images 加噪；这与后来 Self Forcing 强调的 train–test distribution 对齐在思想上相通，但 DMD2 仍是非 AR 图像生成。",
    "insight": "核心 Insight 有三层：\n\n- fake score 是移动目标，应比 generator 更频繁更新；作者采用 **5 次 fake-score 更新 : 1 次 generator 更新** 的 two-time-scale update rule（TTUR）。\n- teacher score 本身近似真实数据分布；在 fake denoiser bottleneck 加一个轻量 GAN classifier，让真实图像直接校正分布匹配误差。\n- 多步学生必须在训练时看到自己前几步产生的 noisy synthetic states，而非只看 real images 加噪；这与后来 Self Forcing 强调的 train–test distribution 对齐在思想上相通，但 DMD2 仍是非 AR 图像生成。\n\n与本报告 **基础相关**：DMD2 解释了 fake-score 更新频率、GAN 辅助和多步 self-simulation 为什么能稳定蒸馏；后续视频工作主要继承 DMD 主体，但在时序 rollout 上发展出 Self Forcing，而不是直接照搬 DMD2 的图像多步管线。",
    "pipeline": {
      "input": "随机噪声、类标签或文本 prompt；ImageNet 真实图像用于 GAN 项，文本模型基于 SD-v1.5 / SDXL。",
      "process": "删除 DMD 的 ODE LPIPS 回归；每次更新生成器前多次更新 fake diffusion score。fake denoiser 的 encoder/bottleneck 同时接 GAN 分类头，区分加噪后的真实与生成样本；generator 联合优化 distribution matching 与 non-saturating GAN loss。多步版本把 generator 重新参数化为可接受当前噪声状态与时间步的 denoiser，并以 backward simulation 生成接近推理态的训练输入。",
      "output": "1-step ImageNet / SD-v1.5 图像，以及 1–4 step 的 SDXL 百万像素图像。",
      "details": "- **输入：** 随机噪声、类标签或文本 prompt；ImageNet 真实图像用于 GAN 项，文本模型基于 SD-v1.5 / SDXL。\n- **过程：** 删除 DMD 的 ODE LPIPS 回归；每次更新生成器前多次更新 fake diffusion score。fake denoiser 的 encoder/bottleneck 同时接 GAN 分类头，区分加噪后的真实与生成样本；generator 联合优化 distribution matching 与 non-saturating GAN loss。多步版本把 generator 重新参数化为可接受当前噪声状态与时间步的 denoiser，并以 backward simulation 生成接近推理态的训练输入。\n- **输出：** 1-step ImageNet / SD-v1.5 图像，以及 1–4 step 的 SDXL 百万像素图像。\n\n相对 DMD，DMD2 不再需要 teacher ODE 配对集，且允许真实数据把学生质量推过 teacher sampler；相对纯 GAN，它保留 teacher score、CFG 接口和分布匹配约束。"
    },
    "experiments": "**作者主张：** DMD2 在一与少步图像生成上达到新的最佳结果，部分指标超过蒸馏 teacher。\n\n实验实际支持：\n\n- **ImageNet 64×64，一步：** FID **1.28**，相对 DMD 的 2.62 明显改善。\n- **zero-shot COCO 2014，一步 SD-v1.5：** FID **8.35**，比 DMD 的 11.49 改善 3.14；论文以 teacher 的 50-step PNDM 为比较口径，并称推理成本约降 500×，该倍数依赖其 FLOPs/前向设定。\n- **SDXL，4-step：** COCO-10K FID / CLIP 为 **19.32 / 0.332**。人评中，4-step DMD2 在视觉吸引力上有 24% 样本被偏好于 100-step teacher，文本对齐接近；这不是“总体胜率 76%”或全面支配 teacher。\n- **消融：** 直接去回归项，ImageNet FID 退到 3.48；加 TTUR 恢复到 DMD 量级；再加 GAN 项约降 1.1 FID。SDXL 消融显示去 GAN 会过饱和/过平滑，去 distribution matching 的纯 GAN 文本对齐和稳定性更差，去 backward simulation 的 patch FID 变差。\n- **成本边界：** TTUR 提高单次 generator 更新成本；10:1 更稳定但太慢，作者选择 5:1 折中。\n\n**证据未支持：** DMD2 在所有 prompt 上优于 SDXL teacher；1-step SDXL 已达到 4-step 质量；加入 GAN 后仍是完全不依赖真实数据的蒸馏。",
    "evidence_notes": "",
    "code_data_status": "- **代码 / 模型：** [tianweiy/DMD2](https://github.com/tianweiy/DMD2)，项目页声明代码、模型和数据可用。\n- **数据：** ImageNet 实验使用真实训练图像；文本实验涉及 COCO 评测与 SD 系 teacher。GAN 项意味着训练不再是仅从预训练模型取知识。\n- **许可：** 仓库代码与各 SD / SDXL 权重许可需分别遵守，不能由论文开放状态一并推断。",
    "limitations": "- 4-step 才能匹配最大 SDXL teacher 的质量，一步仍有明显差距。\n- 文本到图像多样性相对 teacher 略降，GAN 权重与多样性/对齐存在权衡。\n- TTUR 需要多次 fake-score 更新，提高训练算力与实现复杂度。\n- GAN 项需要真实数据，并引入对抗训练稳定性问题。\n- backward simulation 解决的是图像多步输入错位，不包含 AR 视频的长程暴露偏差。\n\n---",
    "comments": "",
    "source_reports": [
      "report-c7ced2c92d"
    ],
    "deleted": false,
    "updated_at": "2026-08-24",
    "challenges": "DMD 的分布目标有吸引力，但实际稳定性依赖预计算的 ODE 回归对：制作昂贵，而且把学生绑定到 teacher 的特定采样路径，形成质量上限。直接删掉回归项又会因 fake score 跟不上快速变化的生成分布而发生亮度振荡和训练崩坏。扩展到多步生成时，训练若从“真实图像加噪”开始、推理却从“学生上一步输出”开始，还会出现新的输入分布错位。\n\n本文具体要解决三点：**无回归集的稳定纯 DMD、利用真实数据超过 imperfect teacher score、多步训练与推理分布对齐。**",
    "motivation": "核心 Insight 有三层：\n\n- fake score 是移动目标，应比 generator 更频繁更新；作者采用 **5 次 fake-score 更新 : 1 次 generator 更新** 的 two-time-scale update rule（TTUR）。\n- teacher score 本身近似真实数据分布；在 fake denoiser bottleneck 加一个轻量 GAN classifier，让真实图像直接校正分布匹配误差。\n- 多步学生必须在训练时看到自己前几步产生的 noisy synthetic states，而非只看 real images 加噪；这与后来 Self Forcing 强调的 train–test distribution 对齐在思想上相通，但 DMD2 仍是非 AR 图像生成。\n\n与本报告 **基础相关**：DMD2 解释了 fake-score 更新频率、GAN 辅助和多步 self-simulation 为什么能稳定蒸馏；后续视频工作主要继承 DMD 主体，但在时序 rollout 上发展出 Self Forcing，而不是直接照搬 DMD2 的图像多步管线。",
    "technical_approach": "- **输入：** 随机噪声、类标签或文本 prompt；ImageNet 真实图像用于 GAN 项，文本模型基于 SD-v1.5 / SDXL。\n- **过程：** 删除 DMD 的 ODE LPIPS 回归；每次更新生成器前多次更新 fake diffusion score。fake denoiser 的 encoder/bottleneck 同时接 GAN 分类头，区分加噪后的真实与生成样本；generator 联合优化 distribution matching 与 non-saturating GAN loss。多步版本把 generator 重新参数化为可接受当前噪声状态与时间步的 denoiser，并以 backward simulation 生成接近推理态的训练输入。\n- **输出：** 1-step ImageNet / SD-v1.5 图像，以及 1–4 step 的 SDXL 百万像素图像。\n\n相对 DMD，DMD2 不再需要 teacher ODE 配对集，且允许真实数据把学生质量推过 teacher sampler；相对纯 GAN，它保留 teacher score、CFG 接口和分布匹配约束。",
    "discussion": "DMD2 把初版“分布匹配 + 轨迹回归”的妥协改成更纯的分布训练：用更快的 fake-score 内循环解决移动 critic，用真实数据 GAN 项修 teacher score，用推理态模拟解决多步 mismatch。它与 Self Forcing 的关键共同点是训练输入必须接近推理生成分布，但 DMD2 没有历史帧或 AR cache。阅读判断：应把它放在 CausVid 前作为稳定化基础与概念先驱；不能用其图像 FID 为视频 DMD 的时序稳定性背书。",
    "arxiv": {
      "published": "2024-05-23T17:59:49Z",
      "revised_at": "2024-05-24T17:08:32Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2311-18828",
    "title": "One-step Diffusion with Distribution Matching Distillation",
    "authors": [
      "Tianwei Yin",
      "Michaël Gharbi",
      "Richard Zhang",
      "Eli Shechtman",
      "Frédo Durand",
      "William T. Freeman",
      "Taesung Park"
    ],
    "year": 2024,
    "publication": "2024，CVPR 2024。MIT / Adobe Research。预印本 arXiv:2311.18828（v4，cs.CV）；arXiv DOI：10.48550/arXiv.2311.18828。",
    "arxiv_id": "2311.18828",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2311.18828",
      "publication": "https://openaccess.thecvf.com/content/CVPR2024/html/Yin_One-step_Diffusion_with_Distribution_Matching_Distillation_CVPR_2024_paper.html",
      "project": "https://tianweiy.github.io/dmd/",
      "alphaxiv": "https://alphaxiv.org/abs/2311.18828",
      "code": "https://github.com/tianweiy/DMD"
    },
    "tags": [
      "Agent与可执行世界",
      "流式与自回归",
      "视频生成"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2311.18828v4/overview.png",
      "alt": "DMD Fig. 2: distribution matching plus regression regularization",
      "label": "DMD，Fig. 2，分布匹配梯度与 ODE 回归正则的整体训练框架。来源：Fig. 2 原图 PNG",
      "paper_title": "One-step Diffusion with Distribution Matching Distillation",
      "source_url": "https://arxiv.org/html/2311.18828v4/overview.png"
    },
    "summary": "核心 Insight： 在加噪空间中，KL 对生成图像的梯度可以写成 target diffusion score 与 fake diffusion score 的差。 target score 由冻结的 teacher 给出；fake score 由一个在线训练的扩散模型估计学生当前输出分布。梯度再通过一步生成器回传。作者同时保留小权重 LPIPS 回归正则，用 teacher 的确定性采样 noise–image 对固定大尺度结构并抑制 mode collapse。",
    "insight": "核心 Insight：**在加噪空间中，KL 对生成图像的梯度可以写成 target diffusion score 与 fake diffusion score 的差。** target score 由冻结的 teacher 给出；fake score 由一个在线训练的扩散模型估计学生当前输出分布。梯度再通过一步生成器回传。作者同时保留小权重 LPIPS 回归正则，用 teacher 的确定性采样 noise–image 对固定大尺度结构并抑制 mode collapse。\n\n与本报告 **基础相关而非视频直接相关**：CausVid 的 asymmetric DMD、Self Forcing 的 rollout distribution matching，以及后续 CF 系列的 real/fake score 都沿用这一“两个 score 之差”框架；但 DMD 原文没有证明该目标在自回归视频上稳定。",
    "pipeline": {
      "input": "随机噪声；类标签（ImageNet）或文本 prompt（Stable Diffusion v1.5）。",
      "process": "从 teacher 初始化一步生成器 G theta；对生成图像随机加噪，冻结的 real diffusion model 估计 s real，在线 fake diffusion model 在学生样本上学习 s fake，二者之差形成近似反向 KL 梯度。训练中偶尔读取预计算的确定性 ODE noise–image 对，对 G theta(z) 与 teacher 输出施加 LPIPS 回归。作者对梯度作归一化，以控制不同噪声级别的尺度。",
      "output": "一次网络前向的类条件或文本条件图像；SD-v1.5 版本以 FP16 在论文硬件口径下约 20 FPS。",
      "details": "- **输入：** 随机噪声；类标签（ImageNet）或文本 prompt（Stable Diffusion v1.5）。\n- **过程：** 从 teacher 初始化一步生成器 \\(G_\\theta\\)；对生成图像随机加噪，冻结的 real diffusion model 估计 \\(s_{\\text{real}}\\)，在线 fake diffusion model 在学生样本上学习 \\(s_{\\text{fake}}\\)，二者之差形成近似反向 KL 梯度。训练中偶尔读取预计算的确定性 ODE noise–image 对，对 \\(G_\\theta(z)\\) 与 teacher 输出施加 LPIPS 回归。作者对梯度作归一化，以控制不同噪声级别的尺度。\n- **输出：** 一次网络前向的类条件或文本条件图像；SD-v1.5 版本以 FP16 在论文硬件口径下约 20 FPS。\n\n相对 progressive distillation / consistency model，DMD 的主监督不是逐点复制 teacher 轨迹，而是输出分布匹配；但初版仍依赖预计算回归集，这正是 DMD2 要去掉的部分。"
    },
    "experiments": "**作者主张：** 一步学生在大幅减少前向次数的同时，质量接近原扩散模型，并优于当时已发表的 few-step 方法。\n\n实验实际支持：\n\n- **ImageNet 64×64：** 一步 DMD 的 FID **2.62**；论文同时在 CIFAR-10 / ImageNet 的无条件或类条件设置与扩散蒸馏、GAN 基线比较。\n- **zero-shot COCO-30k：** SD-v1.5 一步 DMD 的 FID **11.49**；生成一次约 90 ms，而论文所用 Stable Diffusion 基线约 2590 ms。20 FPS 是批量/FP16 吞吐口径，不等同于单图 50 ms 延迟。\n- **消融结论：** 去掉分布匹配，回归结果更平滑、细节弱；去掉回归正则，训练更容易 mode collapse。两项联合才是初版稳定配方。\n- **训练代价：** 文本到图像版本需先用多步确定性 sampler 制作大量 noise–image 对；DMD2 指出仅这一步的成本已超过其后续完整训练计算的 4 倍。\n\n**证据未支持：** 一步模型与 teacher 在多样性上完全等价；图像 FID 改善能直接外推到视频动态；DMD 的近似 KL 梯度是无偏估计。",
    "evidence_notes": "",
    "code_data_status": "- **代码：** [tianweiy/DMD](https://github.com/tianweiy/DMD)，项目页提供训练/推理入口。\n- **模型：** 项目页提供 ImageNet 与 Stable Diffusion 蒸馏模型入口；具体许可随原始 teacher 与仓库分别核对。\n- **数据：** ImageNet / COCO 为评测或训练来源；文本版还依赖 teacher 生成的预计算 noise–image 回归对，制作成本高且不是纯粹“无数据蒸馏”。",
    "limitations": "- 需要昂贵的多步 teacher ODE 回归数据集，限制大模型扩展。\n- fake score 模型追踪非平稳学生分布，梯度有近似误差。\n- reverse-KL 倾向 mode seeking，作者用回归项换稳定性，可能牺牲分布自由度。\n- 一步学生在复杂文本组合、细节和多样性上仍受 SD-v1.5 teacher 与蒸馏设定限制。\n- 没有视频、长序列或交互控制实验。\n\n---",
    "comments": "",
    "source_reports": [
      "report-c7ced2c92d"
    ],
    "deleted": false,
    "updated_at": "2026-08-24",
    "challenges": "扩散模型质量高但通常要几十至上百次网络前向；直接把确定性 teacher 轨迹回归成一次映射，又会迫使学生复现特定 noise–image 对，在一对多的图像分布上容易平均化或损失细节。本文针对的缺口是：**能否不逐样本模仿 teacher 轨迹，而让一步生成器的整体输出分布逼近预训练扩散模型。**\n\n- 直接最小化生成分布与 teacher 分布的 KL 不可行，因为一步生成器没有显式密度。\n- 仅靠 score distillation 的近似梯度会有 mode collapse / 不稳定；仅靠回归又限制学生只能跟随预计算 ODE 路径。\n- 论文只验证图像生成，不验证视频时序、AR rollout 或 KV cache；其价值是后续 CausVid / Self Forcing 的损失基础。",
    "motivation": "核心 Insight：**在加噪空间中，KL 对生成图像的梯度可以写成 target diffusion score 与 fake diffusion score 的差。** target score 由冻结的 teacher 给出；fake score 由一个在线训练的扩散模型估计学生当前输出分布。梯度再通过一步生成器回传。作者同时保留小权重 LPIPS 回归正则，用 teacher 的确定性采样 noise–image 对固定大尺度结构并抑制 mode collapse。\n\n与本报告 **基础相关而非视频直接相关**：CausVid 的 asymmetric DMD、Self Forcing 的 rollout distribution matching，以及后续 CF 系列的 real/fake score 都沿用这一“两个 score 之差”框架；但 DMD 原文没有证明该目标在自回归视频上稳定。",
    "technical_approach": "- **输入：** 随机噪声；类标签（ImageNet）或文本 prompt（Stable Diffusion v1.5）。\n- **过程：** 从 teacher 初始化一步生成器 \\(G_\\theta\\)；对生成图像随机加噪，冻结的 real diffusion model 估计 \\(s_{\\text{real}}\\)，在线 fake diffusion model 在学生样本上学习 \\(s_{\\text{fake}}\\)，二者之差形成近似反向 KL 梯度。训练中偶尔读取预计算的确定性 ODE noise–image 对，对 \\(G_\\theta(z)\\) 与 teacher 输出施加 LPIPS 回归。作者对梯度作归一化，以控制不同噪声级别的尺度。\n- **输出：** 一次网络前向的类条件或文本条件图像；SD-v1.5 版本以 FP16 在论文硬件口径下约 20 FPS。\n\n相对 progressive distillation / consistency model，DMD 的主监督不是逐点复制 teacher 轨迹，而是输出分布匹配；但初版仍依赖预计算回归集，这正是 DMD2 要去掉的部分。",
    "discussion": "DMD 真正重要的贡献不是“把扩散变成 GAN”，而是提供了可反传的分布匹配梯度：冻结 teacher score 把样本拉向目标分布，在线 fake score 抵消当前生成分布自身的密度方向。它允许 teacher/student 架构不同，因此适合后来把双向视频 teacher 蒸成因果学生。适用边界是单步图像蒸馏；初版的 ODE 回归集、反向 KL 的 mode seeking、fake score 追踪误差都是后续工作的关键欠账。阅读判断：报告 CausVid 时应把 DMD 写成其损失来源，而不能说 DMD 已经解决 AR 暴露偏差。",
    "arxiv": {
      "published": "2023-11-30T18:59:20Z",
      "revised_at": "2024-10-04T04:41:06Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "id": "arxiv-2409-18964",
    "title": "PhysGen: Rigid-Body Physics-Grounded Image-to-Video Generation",
    "authors": [
      "Shaowei Liu",
      "Zhongzheng Ren",
      "Saurabh Gupta",
      "Shenlong Wang"
    ],
    "year": 2024,
    "publication": "2024，ECCV 2024；arXiv:2409.18964；正式 DOI 待核",
    "arxiv_id": "2409.18964",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2409.18964",
      "project": "https://stevenlsw.github.io/physgen/",
      "code": "https://github.com/stevenlsw/physgen",
      "alphaxiv": "https://alphaxiv.org/abs/2409.18964"
    },
    "tags": [
      "世界模型",
      "物理建模与仿真",
      "视频生成"
    ],
    "figure": {
      "url": "https://arxiv.org/html/2409.18964v1/method_v1.png",
      "alt": "PhysGen Fig. 2",
      "label": "PhysGen，Fig. 2，刚体物理引导的图像到视频生成流程。来源：Fig. 2 原图",
      "paper_title": "PhysGen: Rigid-Body Physics-Grounded Image-to-Video Generation",
      "source_url": "https://arxiv.org/html/2409.18964v1/method_v1.png"
    },
    "summary": "PhysGen 采用“感知→显式模拟→生成渲染”：把物理正确性放在 image-space rigid-body simulation 中，用 diffusion refinement 补外观，而不是要求扩散模型自行发现牛顿动力学。",
    "insight": "PhysGen 采用“感知→显式模拟→生成渲染”：把物理正确性放在 image-space rigid-body simulation 中，用 diffusion refinement 补外观，而不是要求扩散模型自行发现牛顿动力学。",
    "pipeline": {
      "input": "单张图像，以及施加到对象的力、力矩、初速度等条件",
      "process": "基础视觉模型/GPT-4V 辅助分解可移动对象并估计几何、材质和物理参数；模拟刚体、碰撞、摩擦与弹性；将运动指导送入视频 diffusion renderer 并细化",
      "output": "可按输入物理条件控制的短视频及中间物理轨迹",
      "details": "- **输入：** 单张图像，以及施加到对象的力、力矩、初速度等条件\n- **过程：** 基础视觉模型/GPT-4V 辅助分解可移动对象并估计几何、材质和物理参数；模拟刚体、碰撞、摩擦与弹性；将运动指导送入视频 diffusion renderer 并细化\n- **输出：** 可按输入物理条件控制的短视频及中间物理轨迹"
    },
    "experiments": "10 张复杂开放世界图像、118 个可移动实例的感知评测在 IoU 0.5 下 precision 0.93、recall 0.82；论文还做视频基线比较和用户研究。单次生成约 3 分钟：感知约 1 分钟、120-step simulation 5 秒、render 1 分钟、generative refinement 35 秒。结果支持刚体场景的可控性，不覆盖通用材质与长期真实预测。",
    "evidence_notes": "",
    "code_data_status": "官方 PyTorch 代码和 Colab 可用；仓库包含 perception、simulation、rendering 与 evaluation 流程。第三方模型、GPT 服务与数据许可证需分别核验。",
    "limitations": "- 聚焦刚体，形变、液体、断裂和复杂关节不在核心模型内。\n- 单图存在尺度、遮挡、质量和摩擦不可辨识性。\n- 约 3 分钟/视频，不适合实时闭环。\n- 生成 refinement 可能掩盖 simulator error。",
    "comments": "",
    "source_reports": [
      "report-d2be249044"
    ],
    "deleted": false,
    "updated_at": "2026-09-03",
    "challenges": "纯数据驱动 I2V 难保证碰撞、摩擦、弹性和力响应；传统 simulator 又缺少从单张开放世界图像恢复场景并生成逼真视频的能力。",
    "motivation": "PhysGen 采用“感知→显式模拟→生成渲染”：把物理正确性放在 image-space rigid-body simulation 中，用 diffusion refinement 补外观，而不是要求扩散模型自行发现牛顿动力学。",
    "technical_approach": "- **输入：** 单张图像，以及施加到对象的力、力矩、初速度等条件\n- **过程：** 基础视觉模型/GPT-4V 辅助分解可移动对象并估计几何、材质和物理参数；模拟刚体、碰撞、摩擦与弹性；将运动指导送入视频 diffusion renderer 并细化\n- **输出：** 可按输入物理条件控制的短视频及中间物理轨迹",
    "discussion": "PhysGen 是此列表的显式 simulator 基线。它能执行真正的力/初态干预，但结果取决于从单图估计的几何和参数；视频生成器的视觉合理性不能反向证明估计参数正确。",
    "arxiv": {
      "published": "2024-09-27T17:59:57Z",
      "revised_at": "2024-09-27T17:59:57Z",
      "primary_category": "cs.CV"
    }
  },
  {
    "arxiv": {
      "published": "2024-02-16T18:29:19Z",
      "revised_at": "2024-07-19T11:12:08Z",
      "primary_category": "cs.AI"
    },
    "arxiv_id": "2402.10877",
    "authors": [
      "Jonathan Richens",
      "Tom Everitt"
    ],
    "code_data_status": "- 主要为理论与 synthetic simulation；\n- 未依赖大型公开数据集；\n- 本报告未确认独立官方代码仓库，因此不声称代码已发布。\n\n## 重要局限\n\n这一点必须特别注意：\n\n论文主定理关注的核心 setting 并**没有覆盖一般意义的 mediated MDP**——即 action 经 environment state 再影响 future state / utility 的复杂 sequential manipulation 情况。\n\n此外：\n\n- 变量主要是离散 / 简化设定；\n- 依赖 causal sufficiency 等理论假设；\n- domain shifts 是特定类别 local interventions；\n- 没有视觉 world model；\n- 没有 robot manipulation。\n\n**阅读判断**：  \n这篇非常适合回答“**为什么 causal world model 有学术必要性？**”，但不能直接作为 HOI architecture baseline。\n\n---",
    "comments": "",
    "deleted": false,
    "doi": "",
    "evidence_notes": "- **作者明确主张：** 对足够丰富局部干预保持鲁棒的 agent 必须包含可提取的 causal knowledge。\n- **论文实际支持：** 在其形式化假设下给出证明，并用小型 synthetic CBN 验证恢复算法随 regret 变化的趋势。\n- **阅读判断：** “robustness implies causality”不能无条件外推到普通 OOD benchmark；关键前提是 shift family 足够丰富且 agent 对这些 shift 真正鲁棒。",
    "experiments": "> causal model error 随 robust adaptation / regret 改善而下降。\n\n但这不是 embodied/visual benchmark。",
    "figure": {
      "url": "https://arxiv.org/html/2402.10877v7/figures/newfig.png",
      "alt": "Robust Agents Learn Causal World Models Fig. 3：鲁棒策略查询与因果层级",
      "label": "Robust Agents Learn Causal World Models，Fig. 3，鲁棒适应所需的策略查询在 Pearl 因果层级中的位置。来源：Fig. 3 原图 PNG",
      "paper_title": "Robust Agents Learn Causal World Models：鲁棒智能为何需要因果模型",
      "source_url": "https://arxiv.org/html/2402.10877v7/figures/newfig.png"
    },
    "id": "arxiv-2402-10877",
    "insight": "这篇论文的价值主要是**理论上解释为什么 robust intelligent agent 需要 causal world model**。\n\n核心结果可以概括为：\n\n> 如果一个 agent 能在足够丰富的 local distribution shifts 下做到低 regret、快速适应，那么它的内部知识必须能够恢复环境的近似 causal model；反过来，拥有 causal model 也足以支持这种 robust adaptation。\n\n随着 regret 接近 0，恢复出的 causal model 也趋近真实 causal model。\n\n它给 Causal WM 提供的是一种理论 justification：\n\n\\[\n\\text{OOD robust adaptation}\n\\Rightarrow\n\\text{causal structure knowledge}\n\\]\n\n而不是一种新的视觉 world-model architecture。",
    "limitations": "- 截至检索日，论文与 DeepMind 页面未链接可核实的官方代码。\n- 原文局限包括：要求几乎所有环境变量的局部干预；regret 较大时关系不可识别；主结果针对 unmediated decision tasks。后续 NeurIPS 2025 工作已扩展到 mediation，见补充推荐。\n\n---",
    "links": {
      "publication": "https://deepmind.google/research/publications/49666/",
      "paper": "https://arxiv.org/abs/2402.10877",
      "alphaxiv": "https://alphaxiv.org/abs/2402.10877"
    },
    "pipeline": {
      "input": "- Theorem 1–3 将对局部机制变化的最优性/低 regret 与 causal graph、utility ancestors 上联合分布的可恢复性联系起来。",
      "process": "- 附录实验在 1,000 个随机二元 causal Bayesian networks 上运行因果发现；两个 binary latent 的简化任务中，normalized regret 约 30% 时方向识别接近 90% ，随机基线约为机会水平。",
      "output": "- 根据 agent 的决策行为与 adaptation properties，分析其是否必须包含 causal model。",
      "details": "```text\nenvironment family under local interventions\n  -> robust/optimal policy oracle\n  -> carefully chosen decision queries\n  -> recover DAG orientation + distributions over utility ancestors\n  -> predict/adapt under new mechanism shifts\n```\n\n输出是可从策略响应中**恢复**的 causal model；定理并不证明神经网络内部显式存储了唯一 SCM。\n\n### 理论与实验支持\n\n- Theorem 1–3 将对局部机制变化的最优性/低 regret 与 causal graph、utility ancestors 上联合分布的可恢复性联系起来。\n- 附录实验在 **1,000 个随机二元 causal Bayesian networks** 上运行因果发现；两个 binary latent 的简化任务中，normalized regret 约 30% 时方向识别接近 **90%**，随机基线约为机会水平。\n- 实验是 theorem 的 sanity check，不是视觉世界模型评测；没有机器人、复杂 MDP 或高维 observation。"
    },
    "publication": "ICLR 2024 Oral",
    "source_reports": [
      "report-554de78a93",
      "report-6fa37648ba",
      "report-ce5d8128c6"
    ],
    "summary": "论文反转了常见问题：不是先给 agent 一个 causal model 看它是否鲁棒，而是问“如果策略能对足够丰富的机制变化保持低 regret，我们能否从策略行为中提取环境因果模型？”在一组 causal influence diagram 假设下，答案近似是肯定的。",
    "tags": [
      "因果与反事实",
      "对象与可供性",
      "机器人学习"
    ],
    "title": "Robust agents learn causal world models",
    "updated_at": "2026-08-31",
    "year": 2024
  },
  {
    "id": "arxiv-2312-06721",
    "title": "Understanding Physical Dynamics with Counterfactual World Modeling",
    "authors": [
      "Rahul Venkatesh",
      "Honglin Chen",
      "Kevin Feigelis",
      "Daniel M. Bear",
      "Khaled Jedoui",
      "Klemen Kotar",
      "Felix Binder",
      "Wanhee Lee",
      "Sherry Liu",
      "Kevin A. Smith",
      "Judith E. Fan",
      "Daniel L. K. Yamins"
    ],
    "year": 2024,
    "publication": "2024，ECCV 2024；arXiv:2312.06721",
    "arxiv_id": "2312.06721",
    "doi": "",
    "links": {
      "paper": "https://arxiv.org/abs/2312.06721",
      "project": "https://neuroailab.github.io/cwm-physics/",
      "code": "https://github.com/neuroailab/cwm_dynamics",
      "alphaxiv": "https://alphaxiv.org/abs/2312.06721"
    },
    "tags": [
      "HOI",
      "世界模型",
      "因果与反事实"
    ],
    "figure": null,
    "summary": "作者用 temporally-factored masking 让预测器接受对事实视频的局部改变，再以预测差异读取中层视觉结构；这里的 counterfactual 是 prompting 操作，不是 SCM 个体反事实。",
    "insight": "作者用 temporally-factored masking 让预测器接受对事实视频的局部改变，再以预测差异读取中层视觉结构；这里的 counterfactual 是 prompting 操作，不是 SCM 个体反事实。",
    "pipeline": {
      "input": "视频帧及时间因子化遮挡/修改后的视觉 prompt",
      "process": "自监督 masked video prediction；比较事实与修改输入的补全，提取 flow、mask、keypoint 等结构",
      "output": "未来预测、可提示的视觉结构和 Physion 物理判断特征",
      "details": "- **输入：** 视频帧及时间因子化遮挡/修改后的视觉 prompt\n- **过程：** 自监督 masked video prediction；比较事实与修改输入的补全，提取 flow、mask、keypoint 等结构\n- **输出：** 未来预测、可提示的视觉结构和 Physion 物理判断特征"
    },
    "experiments": "论文在 Physion 上报告当时领先的物理动态理解结果，并展示无需针对每种结构微调的抽取能力。该证据支持 representation utility，不支持环境干预识别或机器人控制。",
    "evidence_notes": "",
    "code_data_status": "官方代码公开；使用公开/已有视频与 Physion 设置，具体预训练复现成本需按仓库配置核对。",
    "limitations": "- 首发预印本在 2023，正式出版在本报告时间范围内。\n- 无 action、`do` intervention、SCM 或 causal identification。\n- Physion 偏合成物理，开放真实 HOI 未验证。\n- “counterfactual prompting”不可扩大为 Pearl 式反事实推理。",
    "comments": "",
    "source_reports": [],
    "deleted": false,
    "updated_at": "2026-09-02",
    "challenges": "监督式物理理解依赖任务标签，单一视频预测器如何抽取 flow、对象与动态结构仍不清楚。",
    "motivation": "作者用 temporally-factored masking 让预测器接受对事实视频的局部改变，再以预测差异读取中层视觉结构；这里的 counterfactual 是 prompting 操作，不是 SCM 个体反事实。",
    "technical_approach": "- **输入：** 视频帧及时间因子化遮挡/修改后的视觉 prompt\n- **过程：** 自监督 masked video prediction；比较事实与修改输入的补全，提取 flow、mask、keypoint 等结构\n- **输出：** 未来预测、可提示的视觉结构和 Physion 物理判断特征",
    "discussion": "它证明 counterfactual-style input perturbation 能形成物理表征工具，是 HOI 结构抽取的上游候选；Hand、Contact 与 Object State 没有成为明确 dynamics 节点。",
    "arxiv": {
      "published": "2023-12-11T03:07:25Z",
      "revised_at": "2024-07-22T07:51:25Z",
      "primary_category": "cs.CV"
    }
  }
]
