前言长时域机器人操作不仅要求机器人能够可靠地执行单个技能还要求其在长时间任务中将这些技能连贯地串联起来。大多数分层视觉-语言-动作VLA模型在一次前向传播中就做出每一个此类决策从而缺乏一种在遇到困难或高风险选择时分配额外计算资源的机制本文要介绍的 τ0-VLA是一种分层机器人基础模型将高层子任务的生成通过世界模型引导的测试时计算表述为一个计算可扩展的推理问题(为方便大家更好的理解我画了个架构图可能 很多 你还看不明白没事 看完下文 就了然了)在每个推理步中高层策略利用执行记忆生成一个子任务并在需要时在多个候选方案之间进行搜索然后一个低层策略会在多种机器人形态上执行所生成的子任务第一部分 τ0-VLA: a Hierarchical Robot Foundation Modelwith World-Model-Guided Test-Time Computation1.1 引言、相关工作、预备知识1.1.1 引言如原论文所述视觉-语言-动作Vision-Language-ActionVLA模型通过将预训练视觉-语言模型的语义表示与连续动作生成相结合为长时程机器人控制提供了一种自然的基础 [5, 43, 19, 28, 3, 32]分层 VLA 进一步将子任务作为显式接口暴露出来用于分解和执行多阶段行为 [18, 2, 35, 27, 13, 14, 32, 33]许多分层系统在做每一次高层决策时仍然使用固定的推理预算直接将当前观测和执行历史映射为下一个子任务在这一设定下模型既不会比较备选子任务也不会通过这些子任务预期产生的物理状态来对其进行评估包括有的世界模型 不会针对未来视觉状态 做多种推演也就不涉及到对多种预演进行打分/评估从而选择最好的一种预演近期的一些系统改为使用高层树搜索或递归子目标细化 [30, 40, 42]这引出了作者在此研究的问题如何在一个通用的真实机器人分层体系中将开放式的语言-子任务搜索与视觉结果预测和执行记忆相耦合在缺乏执行前评估的情况下错误决策通常只会在执行已经改变环境之后才被发现此时虽然可以通过重新规划进行响应但无法挽回先前错误承诺所带来的代价因此在长时程执行中核心瓶颈不再是是否具备分层动作接口而是用于生成下一个子任务的推理过程作者将“生成下一个子任务”重新表述为一个推理时inference-time的推理问题从而使计算量能够随每个决策的难度而扩展正如测试时test-time计算在语言模型中所体现的那样 [29, 9]子任务是进行这种推理的自然单元。动作级搜索可以解决局部控制上的歧义但往往只暴露出局部的物理后果[26, 20, 8, 38, 15, 41]。仅依赖语言的推理可以在更长的时间尺度上运作但它是在未将候选方案与其所产生的物理状态相联系的情况下进行比较子任务处于这两种极端之间一方面它们足够稀疏从而值得投入额外计算另一方面它们又在时间上具有足够的延展性可以在环境中引发有意义且可区分的变化因此在执行之前比较候选子任务需要预测每个候选子任务会产生的状态。对未来观测的生成式建模恰好提供了这一能力 [10, 4,11, 12, 24]使得我们可以在下发执行之前通过子任务预期的物理后果来评价这些候选子任务对此来自的研究者提出了τ0 -VLA这是一种层次化的VLA 系统实现了这种方法。在每个推理步骤中一个带有记忆增强的高层策略利用当前观测和执行记忆来生成合适的子任务即如上图所示高层策略在测试时利用由世界模型引导的计算对子任务序列进行搜索在每一步扩展中先后执行P W V一个 VLM 提出候选子任务世界模型预测这些子任务的视觉结果价值模型则对由此产生的任务进度进行评估束搜索保留有前景的分支随后一个反思模型基于保留下来的候选子任务及其预测后果决策并执行下一个子任务图中展示的是在 N 3 情况下的单次候选扩展为了简洁起见省略了深度为 D 的递归束扩展其paper地址为τ0-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation其项目地址为tau0-vla.github.io其GitHub地址为github.com/sii-research/tau-0-vla具体而言当高层策略足够自信时直接采用其生成的子任务提案否则由 token 级置信度统计触发额外的推理过程该过程遵循“提案–预测–评估”的循环提案模型生成开放式的候选子任务世界模型预测每个候选子任务所诱导的终止观测价值模型根据这些预测结果对候选质量进行评分通过束搜索递归扩展有前景的候选使推理预算可以通过分支因子、束宽和搜索深度进行扩展随后一个反思模型在保留的搜索分支上进行条件生成产出最终子任务该输出可以与某个提案重合但并不局限于候选集合本体层策略随后执行生成的子任务————由此产生的真实观测会在下一次推理步骤被写入执行记忆从而闭合预测后果与实际后果之间的循环为支持在长时执行过程中进行可靠推理作者训练记忆机制去修正其自身状态具体而言作者对来自现有演示的记忆进行扰动并训练高层策略去修复那些落后于、超前于或以其他方式错误反映机器人真实进度的记录而这一过程无需任何额外标注一旦子任务被生成每个子任务都由一个通用的低层策略来执行该策略将预训练的视觉-语言主干网络与一个由多个 Transformer 动作专家组成的混合模型Mixture-of-Transformers相结合该策略在一个统一的 40 维状态与动作空间上运行覆盖末端执行器、机械臂关节、夹爪、腰部以及移动底座。借助这种统一表示单一模型即可在多种机器人形态上支持固定基座操作、双臂协同以及移动全身控制。作者在大约 40,000 小时、来源异构的机器人数据上对该策略进行训练并结合多模态协同训练数据从而获得一个以语言为条件的执行接口而无需为各个子任务设计专用控制器且作者宣称他们的实验证明了分层(高层决策-低层执行)的测试时推理大幅提升了任务成功率并提高了下一子任务预测的准确率1.1.2 相关工作τ0-VLA 融合了三条研究路线用于低层次控制的通用 VLA 模型用于子任务级决策的分层机器人策略以及在测试时进行计算以评估候选决策的世界模型首先对于视觉-语言-动作模型视觉-语言-动作Vision-Language-Action, VLA模型将视觉观测和语言指令映射为机器人动作通常通过对预训练的视觉-语言主干网络进行适配来实现连续控制早期工作建立了可扩展的、由语言条件化的机器人学习框架并实现了从视觉-语言预训练到机器人控制的迁移 [5, 43]后续研究将这一范式拓展到更丰富的任务和不同形态的机器人平台 [19, 28]而最新的一些通用模型则以连续控制、开放世界泛化以及跨形态迁移为目标 [3, 32, 27, 39, 1, 14]与之互补的工作则研究了紧凑而高效的部署方案 [36]跨形态策略还必须调和异构的控制接口RDT-1B 提出了一个具有物理可解释性的统一动作空间而Being-H0.5 则将异构控制映射到语义对齐的槽位中[22, 25]这一系列工作主要在改进控制表示、训练规模以及在任务和机器人形态之间的迁移能力。作者的低层策略遵循相同的通用 VLA 范式。而作者的主要关注点是互补的将高层子任务生成显式化并将其设定为一个可按算力扩展的推理问题其次对于分层机器人策略分层策略将时间跨度较长的决策与连续控制相分离先前的工作将语言模型的决策与学习到的机器人可供性相结合 [18]通过语言来表示动作层级结构 [2]并通过显式指令、潜在表征或分阶段推理将较慢的语义推理与较快的视觉—运动控制连接起来 [35, 13, 27, 14, 32]最新的系统更明确地处理长时间跨度的状态跟踪和适应性问题MemER在为低层 VLA 生成指令之前先检索与任务相关的历史关键帧(相当于回顾历史)而 Goal2Skill 则在高层 VLM 与低层 VLA的层级结构中结合了结构化记忆、结果验证与反思机制 [37, 23]Anticipation-VLA 自适应地递归生成子目标而 VISTA 则使用世界模型作为高层策略来生成文本和视觉形式的子目标序列 [42, 24]在通用分层基础模型中π0.7 也将语义高层策略、世界模型和低层策略耦合在一起 [33]。其世界模型会为高层策略已经生成的子任务生成子目标图像在τ0-VLA 中则是在承诺执行之前进行视觉预测并通过价值引导的搜索和反思来支持在多个候选子任务之间进行比较。因此在 π0.7 中视觉预测决定了已生成子任务将如何被执行而在 τ0-VLA 中视觉预测则用于决定应执行哪一个子任务。我们的高层策略同样维持了一种可纠正的执行机制τ₀-WM 管动作级靠谱RCS/LAR 修低层动作τ₀-VLA 管决策级靠谱beam search 修高层子任务理论上可以套娃τ₀-VLA 的高层τ₀-WM 作低层最后对于世界模型与测试时计算世界模型在候选行为下预测未来状态从而支持规划与策略学习 [16, 17]在机器人操作中生成的图像或视频已被用作逆动力学和低层控制的目标[10, 4]与动作进行联合建模 [7, 6]并被纳入搜索或迭代式计划修正中 [11]Reflective Planning 使用想象的未来状态迭代地修订 VLM 规划 [12]与之不同τ0-VLA的搜索方法维护多条语言子任务分支并在进行反思式生成之前通过专门的价值模型对其进行剪枝在动作层面会通过采样、验证或价值引导的选择来分配额外推理预算 [26, 20, 8]FOREWARN 预测低层动作计划的潜在结果并使用VLM 在这些结果中进行选择而 VLA-Reasoner 则在动作轨迹上执行由世界模型引导的蒙特卡洛树搜索 [38, 15]WLA-0 联合预测文本子任务、未来图像和动作并在测试时的扩展模式中利用想象的未来帧和价值模型在动作块之间进行选择 [41]搜索也被应用于高层级的机器人决策。VINE 在二维场景图上提出子目标转换从成功与失败的演示中预测其成功概率并在执行前剪枝可行性较低的分支 [30]Seeing Farther and Smarter 结合了预测视觉动力学、价值引导的束搜索、基于置信度的路由以及对操作规划的多路径反思 [40]这些方法是与τ0-VLA工作最为接近的基于搜索的机制之一VINE 使用可行性评分在结构化场景图转换上进行搜索而 Seeing Farther and Smarter 则在离散操作规划上通过一个学习到的评估器进行搜索相比之下τ0-VLA 搜索开放式的语言子任务并通过其预测的终止图像来评估每个候选方案。它在可纠正的执行记忆上对后续决策进行条件建模然后使用一个反思模型从保留的分支中生成最终子任务1.1.3 预备知识考虑由语言指令ℓ指定的机器人任务。在推理步骤时一个视觉-语言-行动VLA策略将当前的多视角观测本体感受状态以及语言指令映射为一个H 步的动作片段它还接收文本形式的控制元数据用于指定具身形式、控制模式以及全身配置其具体的文本序列化形式在附录C-B 中给出其中θ 表示策略参数H 是动作块的时间范围。在直接执行中完整的任务指令在整个过程中都被使用因此。因此策略必须在生成相应的运动动作时推断任务的当前阶段分层VLA 将高层子任务生成与低层动作生成分离。在每个推理步骤中高层策略首先生成一个子任务然后低层策略在其条件下生成动作令µ 表示高层策略令表示初始的空执行记忆并令。在推理步骤形成高层决策上下文其中是被保留的执行记忆是前一个推理步骤生成的子任务该策略将执行记忆更新至最新状态并为当前观测生成子任务这里总结了截至为止所观察到的执行历史因此尚未包含执行的结果而是为当前观测生成的子任务生成的子任务被用作语言指令从而得到在执行完动作块之后得到的真实观测会在下一次推理步骤中使用。在每一次推理步骤中低层策略都会以生成的子任务为条件进行决策如果它保持与相同则继续执行当前子任务如果发生变化低层策略则开始执行新生成的子任务1.2 τ0-VLA的完整方法论如原论文所述τ0-VLA 在每一个逻辑推理步骤中顺序应用两个组件高层策略负责维护执行记忆、决定何时调用额外的测试时test-time计算并生成当前的子任务低层策略则将当前观测和生成的子任务映射为机器人动作这样的分层结构在不修改底层控制接口的前提下支持长时间跨度的进度跟踪以及具备后果意识的规划。图 2 给出了整体概览a) 在高层推理步骤proposal 模型以最新的多视角观测、任务指令、继承的执行记忆以及先前生成的子任务作为条件它生成与观测对齐的记忆和一个直接 proposalb低层策略以生成的子任务、多视角观测、本体感受状态以及文本控制元数据作为条件一个视觉-语言骨干网络和Mixture-of-TransformersMoT动作专家通过条件流匹配从一个带噪声的动作片段生成在时间范围内的动作片段c在 TTC 路线上针对每个被保留的分支提案模型被调用 N 次以生成 N 个候选方案给定该分支的head-camera图像和某个候选方案世界模型预测其终止时刻的head-camera图像而价值模型在条件化任务指令、候选方案以及预测图像的基础上为该候选方案分配一个质量评分Beam search束搜索根据累计得分在全局范围内保留得分最高的 B 个分支并将其递归扩展到深度 D图中示例展示了在 N 3 且 B 2 时的根节点扩展情形此时局部得分与累计得分相同。为便于说明省略了更深层次的扩展随后反思模型在条件化和最终的分支摘要的基础上生成最终子任务该输出可能与某个被保留的提案相一致但并不局限于保留集合中的提案并会被传递给低层策略以执行接下来的小节将分别定义这两类策略并描述它们的联合推理过程1.2.1 高层策略与传统的固定计算量高层策略不同后者通过一次前向传播就对一个子任务作出承诺这里的高层策略 µ 通过在测试时采用预算自适应的计算TTCtest-timecomputation过程来生成下一个子任务在预测存在不确定性时TTC 会在可能的子任务序列上执行由世界模型引导的束搜索。它会扩展候选分支预测并打分其视觉结果并将保留的 beam 传递给一个反思模型该模型生成最终子任务。该过程通过在测试时分配额外的计算量使策略能够改进对下一子任务的预测相应地高层策略由提案模型 P、世界模型W、价值模型 V 以及反思模型 F 组成。它们的推理接口定义如下第一对于提案模型在推理的第步开始时提案模型接收上节中定义的上下文(即)更新执行记忆并生成一个直接子任务提案提案模型从、先前生成的子任务以及当前观测中更新记忆。通过同一次前向传播产生的token 置信度自适应路由器计算。其中选择快速路径而调用TTC路由规则在附录C-J 中定义第二对于世界模型和值模型对于束搜索中的一个通用候选项令表示头戴相机的RGB 图像表示候选子任务世界模型预测终止时的头戴相机图像而价值模型对该结果进行评分因此世界模型始终基于单个前置摄像头图像运行。价值模型接收全局任务指令、候选子任务以及预测的终止图像并返回一个标量的候选质量第三对于测试时搜索当时高层策略调用算法1 中的SEARCH 操作该操作在候选子任务序列上执行束搜索。正整数N, B 和D 分别表示分支因子、束宽和搜索深度一个分支b 存储一个提议上下文即proposal context提议上下文给提议模型看的输入一个有序的想象子任务序列即这条分支已想象的子任务序列有序路径一个累积分数以及对于非根分支一个终止预测图像即仅非根分支有该分支末端被想象出的头相机图像然后用一个单一的根分支b root 初始化其上下文为即当前真实的多视角观测​ 任务指令 执行记忆 上一步子任务其路径为空序列其得分为ps因为立足真实观测不需要世界模型预测图像所以没有我帮大家解释下这里的根分支是机器人当前的真实处境非根分支是世界模型想象出来的假设未来根分支非根分支视觉输入当前真实观测世界模型想象图像子任务路径空已累积的想象子任务序列初始得分0沿路径累计的价值模型打分数量每步搜索只有 1 个展开产生由 beam width截断保留 top-在每一层深度对每个保留的分支独立地调用提议模型 N 次这里表示提议模型的解码分布。样本索引保持重复的文本提议彼此区分并将每个提议与其分支局部记忆关联起来对于根分支因此提议模型接收当前多视角观测对于每一个非根分支的视觉部分是——世界模型想象图像即为该分支想象的终端头摄像机图像。搜索过程中来自提议调用的路由决策被忽略进一步作者将记作通过将子任务附加到分支而得到的子分支。它的路径是有序序列后接。如此当有了子分支之后可令为当b b root时在中的头部摄像机图像否则为——世界模型想象图像。对于每个带索引的proposal世界模型和值模型计算子节点保留相应的记忆和预测图像。其累积得分和用于下一次扩展的上下文为且在搜索中产生的所有记忆都是分支局部的并且从不会覆盖持久执行记忆在深度 d 处所有子节点的索引集合为在剪枝之前包含N 个子节点而之后的每次扩展最多产生个子节点。top-B 操作根据累积得分对所有子节点进行全局排序。每个被保留子节点的预测图像和分支本地记忆共同定义其下一次扩展的上下文。该过程重复进行直到深度D最终的 beam 由已建立索引的集合汇总得出其中是设想的子任务路径是其终端预测的头戴相机图像第四对于反思模型在推理步骤t 的TTC 路径末端反思模型以保留的分支摘要和与观测对齐的真实上下文为条件。它生成传递给低层策略的最终子任务其输出可能复现某个已保留的提案但并不局限于候选集合。反思模型不会更新持久执行内存1.2.2 低层策略低层策略将视觉-语言骨干网络与一个 Mixture-of-TransformersMoT动作专家耦合在一起。在每一层全注意力层中动作 token 与骨干网络 token 通过联合注意力进行交互同时分别由参数独立的Transformer 分支进行处理该策略在多视角观测、本体感受状态以及语言指令的条件下工作。动作专家通过条件流匹配conditional flow matching进行训练从噪声到动作块分布学习一个速度场在推理阶段通过对该速度场进行积分来生成可执行动作统一的状态与动作空间作者在一个共享的40 维状态与动作空间中表示异构的具身形式。对每个样本的状态和动作使用掩码来选择有效通道而控制元数据则给出控制参数化的具体形式通过这一接口同一个策略即可同时支持定座fixed-base控制和全身whole-body控制而无需具身形式特定的输出头完整的布局和动作编码见附录 C-B掩码流匹配由于不同具身形式在统一动作空间中占据的通道不同作者对流路径及其训练目标都施加掩码设表示动作维度为对角动作掩码矩阵其中当通道 i 处于激活状态时否则对动作块中的每一个动作向量都使用相同的矩阵对每个令其中为维单位矩阵且作者采用 π_0[3] 中线性流路径的反时间参数化方式与本文评估的任务特定checkpoint 保持一致一个流时间在整个动作块中共享其中表示噪声表示干净动作插值后的动作和目标速度为给定完整的含噪声块动作专家联合预测所有H 动作标记的速度。作者仅监督激活的通道并在每次速度场评估之前以及在最终输出时投影未激活的通道。附录C-B 提供了完整的损失和采样细节1.2.3 系统推理在推理时高层策略和低层策略形成一个闭环。在每个逻辑推理步骤中proposal 模型更新执行记忆并生成当时这个直接proposal 成为最终子任务当时测试时搜索产生并且反思模型从与观测对齐的上下文和保留的分支总结中生成然后低层策略在以为条件的情况下生成并执行一个动作块。由此产生的真实观测会在下一个推理步骤被纳入记忆中算法 1 以顺序化过程的形式给出了这些逻辑依赖关系。在部署时高层策略和低层策略以异步方式进行流水线处理更多细节见附录 C-F且跨不同任务使用相同的路由统计量并在留出数据上为各任务校准特定阈值。在直接执行模式下系统绕过高层策略直接以作为条件输入低层策略为方便大家更好的理解我还是再逐行解读下class Tau0VLAAgent: def __init__(self, models, config): self.P models.proposal_model # 高层提案与记忆模型 self.W models.world_model # 视觉世界模型 self.V models.value_model # 视觉价值评估模型 self.F models.reflective_model # 决策反思模型 self.pi models.low_level_policy # 低层VLA动作模型 self.cfg config1. 状态感知与记忆对齐Context Memory Update在每个推理周期开始时def step(self, obs, state, task_inst, memory, last_subtask): # --- 阶段 1构建上下文并更新记忆 --- ctx HighLevelContext(ltask_inst, Mmemory, z_prevlast_subtask, oobs) z_dir, updated_memory, token_stats self.P(ctx) ctx.M updated_memory # 映射 Line 4-5对齐真实视觉后的最新记忆机器人获取当前的多视角视觉图像与关节/末端位姿状态提案模型Proposal Model,结合任务目标即ltask_inst上一时刻的执行记忆即Mmemory上一步执行的子任务即z_prevlast_subtask以及最新视觉即oobs生成最新的对齐记忆即updated_memory和一个直接子任务提案即z_dir这一步确保了高层模型能准确追踪“任务已经做到哪一步”修复潜在的记忆失真(如抓取失败或物体滑落)2. 自适应路由决策快慢思考切换Adaptive Routing算法并不是对所有步骤都消耗巨量算力去“思考”而是通过 Token 置信度进行动态分流提案模型生成时系统会统计其输出 Token 的平均概率与 Logit Margin# --- 阶段 2自适应路由判断快/慢思考分流 --- g_t self.router.should_search(token_stats) # 映射 Line 6快路径Fast Route,若模型对直接提案非常自信则无需搜索直接将作为最终子任务下发给底层# --- 阶段 3高层决策决策生成 --- if g_t 0: # Fast Route模型自信直接采纳提案 (Line 8-9) z_star z_dir慢路径/搜索路径Search Route,若判定当前决策存在歧义或高不确定性(如面对新物体配置、复杂多步骤节点)则触发测试时计算TTCelse: # Search Route启动世界模型引导的束搜索 (Line 10-12) searched_branches self.beam_search(ctx)3. 测试时计算与世界模型预演TTC Consequence-Aware Search当进入慢路径时高层策略启动基于世界模型的束搜索Beam Search展开提案Propose提案模型针对当前状态采样生成个候选子任务def beam_search(self, ctx): # 映射 Line 11 (SEARCH 过程) beam [Branch(contextctx, path[], score0.0)] for depth in range(self.cfg.D): candidates [] for branch in beam: # 1. 提案 N 个候选 subtasks self.P.sample(branch.context, num_samplesself.cfg.N)后果预测Predict视觉世界模型World Model,输入当前图像branch.img和候选子任务z预测该子任务执行完毕后的终端视觉图像即hat_ofor z in subtasks: # 2. 世界模型预测未来视觉终端图像 hat_o self.W(branch.img, z)价值打分Evaluate价值模型Value Model,结合全局目标ctx.l、候选子任务z及预测的终态图像hat_o对其可行性与完成度打分# 3. 价值模型给预测图像打分 score self.V(ctx.l, z, hat_o) candidates.append(branch.expand(z, hat_o, score))束搜索剪枝Beam Pruning全局保留累计得分最高的个分支并递归拓展至指定深度# 4. 保留 Top-B 最佳分支 beam select_top_b(candidates, Bself.cfg.B) return summarize_beam(beam)反思承诺Reflect Commit反思模型Reflective Model,综合分析保留的最佳分支摘要与真实视觉上下文生成最终承诺的子任务指令它可以直接采纳搜索出来的最佳选项也可以在此基础上修正生成更优的指令z_star self.F(ctx, searched_branches) # 反思模型生成最终承诺指令4. 底层动作映射与闭环执行Low-Level Action Execution确定子任务后高层将其下发给底层 VLA 策略底层策略基于 Qwen3.5-2B MoT 动作专家结构结合当前本体状态、多视角图像及控制元数据通过条件流匹配Conditional Flow Matching生成一个步的连续动作块# --- 阶段 4低层动作生成 (Line 14) --- action_chunk self.pi(obsobs, statestate, subtaskz_star, metaself.cfg.meta)机器人物理执行该动作块环境状态随之改变进入下一个周期return action_chunk, updated_memory, z_star// 待更