← 返回全部笔记

论文写作 · VLA · Excalidraw · 更新于 2026-09-02

VLA 论文框图示例

一个可继续编辑的视觉—语言—动作模型 Method Figure 初稿。

VLA 论文框图

下载 Excalidraw 源文件

图中结构

  1. 多模态输入:视觉观测与语言指令。
  2. 视觉编码器:提取时空视觉 Token。
  3. 多模态融合:完成语言 grounding 与策略上下文建模。
  4. 动作解码器:自回归或扩散式生成 Action Chunk。
  5. 机器人执行:与环境闭环交互。

底部训练监督可替换为具体论文中的数据来源、预训练目标和动作损失。

相关笔记:个人域名基础设施

链接到

反向链接

暂无反向链接