视觉-语言-动作模型

Vision-Language-Action Model

直接接收视觉与语言输入,输出机器人动作的端到端模型。

01

先用人话理解

传统机器人靠工程师写死「看到什么就动哪里」的规则;VLA 让模型自己看画面、听指令,直接生成该做的动作。

02

为什么重要

VLA 是具身智能的核心技术路线之一,让机器人从感知、理解到执行形成端到端闭环。

常见误解

VLA 不是简单的「图像分类」,而是直接生成连续动作

端到端训练不等同于在所有真实场景都可靠

试试搜索