ACT 方法工作台 arXiv.2304.13705
soft mask · 关键公式 · chunk 时序ACT 配置
ACT · Temporal EnsembleZhao et al., 2023
i=0 为最老预测;官方 ACT 代码 temporal aggregation 使用 m=0.01,论文 chunk size k=100。
ACT 参数作用图 重叠 chunk → 指数权重 → 有效观测年龄
可用动作块
归一化权重
当前执行时刻
ACT:m 控制从旧块到新块的指数权重衰减,d / s / H 决定可用重叠块数量与有效观测年龄。
RTC Inference 方法工作台 arXiv.2506.07339
Inference Layer → Application Layer推理层
应用层
frozen d=3
s=25
prefix end H−s=25
soft support H−s−d=22
soft mass ΣW=—
fresh suffix s=25
✓ d ≤ s ≤ H−d
Stop-Gradient Stitching原文 ↗推理层
Wu & Xu · 2026∂¹/∂Aτ ≈ I · gτ = W ⊙ (Y−¹)
停止梯度穿过速度场,直接增强重叠区残差约束。
Smooth-As-Butter原文 ↗推理层
Soare · 2025rτ²=(1−τ)²σ² / ((1−τ)²+σ²τ²) · β=ρn
用较窄的条件动作先验加强引导,并令 β 随去噪步数缩放。
Distributed RTC原文 ↗应用层
Vial · 2026ℓ̂=ℓ̄+Kσ · Oc=ℓ̂Δ+ε · ψ←ψ∨ψ′
JK 延迟估计 + cooldown 重试 + LWW,演示丢包、延迟和重复消息恢复。
RTC 两层时序 Inference → Application
异步推理与执行并行 · A_new 就绪后切换
Wᵢ=1 · 延迟期冻结
0<Wᵢ<1 · soft inpaint
Wᵢ=0 · 新后缀
当前阶段 / 切换位置
推理层 Inference Layer
Inference · Flow + ΠGDMAlgorithm 1
应用层 Application Layer
RTC · Soft MaskEq. (5)
Application · Delay + HorizonAlgorithm 1
ℓ̄k+1=(1−α)ℓ̄k+αℓk σk+1=(1−η)σk+η|ℓk−ℓ̄k| ℓ̂=ℓ̄+Kσ
RTC Training 方法工作台 arXiv.2512.05964 训练式替代 RTC-I
Sample Delay → Clean Hard Prefix → Postfix-only Flow Loss训练条件
当前 d=3
hard prefix=3
postfix H−d=47
✓ 当前延迟在训练支持内
RTC Training 参数作用图 训练期 prefix conditioning → 推理期纯前向生成
clean prefix · τi=1 · no loss
noisy postfix · τ · flow loss
推理时 hard clamp
Training-time Action ConditioningBlack et al., 2025
RTC-I:普通 checkpoint · soft mask H−s · 每个去噪步做 VJP
RTC-T:prefix-conditioned checkpoint · hard prefix d · 仅模型前向
Real:8,000 gradient steps、batch 512、d∼Uniform{0,…,10};50 Hz 下覆盖 200 ms。
Soft RTC 方法工作台 arXiv.2605.25537 动作先验去噪
Hard Prefix → Editable Soft Window → Free Tail先验窗口
当前 d=3
端点 e(d)=5
hard=3
soft=2
free=45
✓ d 在论文训练范围 0…4 内
Action-Prior Denoising 参数作用图 同一 ωj 同时控制训练污染、loss 与推理先验注入
committed · ω=1
editable prior · 0<ω<1
free FM · ω=0
Soft RTC · Prior-guided Flow MatchingLiu et al., 2026
Hard RTC-T:ωj=𝟙[j<d],只有 fixed prefix 与 free postfix
Soft RTC:在二者之间增加可编辑但偏向旧计划 Yt 的 soft window
部署开销:普通 Euler solver + token-wise blend;不使用 RTC-I 的 VJP guidance
论文主配置:Kinetix 12 个 large levels,s=4、d∈{0,…,4}、T=5、线性 g、λ=2、hmax=5;从 released checkpoint 单 epoch 微调。
LiPo 方法工作台 arXiv.2506.05165 独立后优化方法
Chunk Scheduling → Blend → Minimum-jerk QP → Spline后优化层
LiPo 后优化过程 冻结 → 线性融合 → 有界 minimum jerk
冻结延迟区
融合 / εb
路径 / εp
LiPo · Post-optimizationSon & Park, 2025
论文单点:H=50、d=5、tb=10、εb=0.020、εp=0.003 rad。滑条是演示范围,不是论文扫描范围。
不依赖 RTC;论文以 ACT 输出验证,并在 400 Hz 控制端比较 Quintic/Linear。
A2C2 方法工作台 arXiv.2509.23224 独立实时修正方法
Base Chunk + Latest Observation → Per-step Residual修正层
512维 · 8 heads · 6层 · 32M · 4.7 ms/step
A2C2 每步闭环修正 旧观测基础块 + 最新观测残差
基础 Chunk
最新观测修正
A2C2 · Asynchronous Action Chunk CorrectionSendai et al., 2025
LIBERO 实测:d∈{0,1,3,5,10},e∈{1,5,10,30,40,50}(仅表中组合)。
BID 方法工作台 arXiv.2408.17355 独立测试时解码
Sample Chunks → Backward Coherence → Forward Contrast → Execute搜索层
BID 双向搜索 上一决策约束当前候选,再用强/弱策略对比
候选 Chunk
选中 Chunk
strong
weak
BID · Guided Test-Time SamplingLiu et al., 2024
论文默认 N=16、K=3、l=16、ρ=0.5;主实验每步闭环重采样。Forward contrast 需要 strong 与 early weak 两个 checkpoint,但不修改已训练策略。
RDP 方法工作台 arXiv.2503.02881 独立慢—快策略
Slow Latent Diffusion → Fast Tactile Decoder → Closed-loop Action模型配置
HAT=32 · downsample=4 · latent=8 · 论文实机 fast=24 Hz
RDP 慢—快闭环 低频 latent Chunk + 高频触觉逐步解码
慢速 latent Chunk
快速触觉动作
延迟匹配丢弃
RDP · Slow–Fast Visual–Tactile PolicyXue et al., 2025
论文实机:slow 约 1–2 Hz、fast 24 Hz;相对轨迹与 latency matching 会丢弃延迟覆盖的前若干动作。
Diffusion Policy 方法工作台 arXiv.2303.04137 独立生成式策略
Observation History → Conditional Denoising → Receding-Horizon Execution扩散生成
论文:To=2 常用;Ta=8 在多数任务最佳;真实实验 DDIM 16 步
扩散动作块与滚动执行 Tp 预测 · Ta 执行 · 再观测
Diffusion Policy · Closed-loop Action SequenceChi et al., 2023
DEHP 方法工作台 arXiv.2606.11408 独立动态执行方法
Frozen Chunk Policy + Horizon Head → Variable-duration SMDP执行决策
基础策略冻结 · πlen(h | s,A) · h∈{1,…,H} · Chunk-level PPO
网页根据轨迹精细阶段生成动态 h;本方法不使用固定 s
动态执行时域 自由空间长承诺 · 精细阶段短承诺
DEHP · Learned Horizon PolicyZhao et al., 2026
HiPolicy 方法工作台 arXiv.2604.06067 独立多频策略
Hierarchical History → Multi-Frequency Chunks → Entropy Gate熵门控
论文默认:Lh=3 · Lc=8 · M=3;固定 s 与公共 H 不适用
多频 Chunk 与熵门控 低熵精细高频 · 高熵低频长程
HiPolicy · Multi-Frequency ChunkingZhang et al., 2026
ABPolicy 方法工作台 arXiv.2602.23901 独立异步样条策略
Flow Control Points → Cubic B-Spline → BiAP + CCR → Async Dispatch样条策略
论文:cubic p=3 · H=32 · P=8 · 8 control points · 30 Hz
异步 B-Spline 连续拼接 块内 C² · 块间 CCR · 推理执行并行
ABPolicy · Control-Point FlowYang et al., 2026
执行信号 x(t) 平台=停顿 · 跳变=不连续
指标 滚动窗口
| 指标 |
|---|