论文写作 · VLA · Excalidraw · 更新于 2026-09-02
VLA 论文框图示例
一个可继续编辑的视觉—语言—动作模型 Method Figure 初稿。
图中结构
- 多模态输入:视觉观测与语言指令。
- 视觉编码器:提取时空视觉 Token。
- 多模态融合:完成语言 grounding 与策略上下文建模。
- 动作解码器:自回归或扩散式生成 Action Chunk。
- 机器人执行:与环境闭环交互。
底部训练监督可替换为具体论文中的数据来源、预训练目标和动作损失。
相关笔记:个人域名基础设施。
链接到
反向链接
暂无反向链接