☰
【pi0.5】整体模型结构和训练流程
2026/10/6 8:08:13 网站建设 项目流程

整体架构:

分为pre-training 和 post-training两个阶段。

注意:后训练阶段不是像RL微调那样,两个阶段是必须的。
两个阶段都是在训练模型,没有微调。因为“知识隔离” action expert 在pre-training中不训练,只在post-training中训练。

pre-training

连续动作会通过 FAST tokenizer 转换成离散 token
然后 VLM 像预测文字一样预测这些动作 token。
这一路径的优点是:

  • 可以使用标准语言模型的 next-token prediction;
  • 训练速度快;
  • 动作序列经过压缩后更短;
  • 可以和文本、视觉问答、机器人指令等任务共同训练。

但缺点是推理时需要逐个 token 自回归生成,动作序列越长,推理延迟越高。因此 FAST 更适合训练,不一定适合实时低层控制。

损失:预训练 PaliGemma + FAST token prediction 两部分组成

post-training 以VLM 产生的多模态隐藏表示为条件生成动作

后训练阶段同时优化: FAST/text loss + Flow matching loss

后训练:
PaliGemma + FAST token prediction
+
action expert + flow matching


即 Action Expert 的输入由三部分组成:

  • VLM 的条件表示(组成共享的 prefix contex)
  • 加噪的连续动作块
  • Flow matching 时间步 τ(把时间步 τ 经过一个 MLP 和正弦位置编码,然后注入 action expert 的各层)。

快慢思考(双系统)

  • System 2 使用 PaliGemma/VLM 的语言和视觉理解能力,将复杂任务拆解成简单子任务;
  • System 1 使用同一 VLM 提供的多模态表示,并通过 Flow Matching Action Expert 生成连续动作;
  • System 2 的子任务会作为 System 1 的语言条件作为输入。

注意

  • fast-token不直接和action expert交互数据。
  • VLM 的条件给action expert,作为条件其实最后实际是self-attention交互
  • 后训练仍然更新FAST/text loss(vla模块),只是只阻断 action expert 的梯度回传。
    权重冻结(通常在微调中):VLM 的参数完全不更新、参数冻结。无论梯度来自 FAST loss、文本 loss 还是 flow loss,最终都不会修改 VLM 权重

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询