视觉-语言-动作模型
Vision-Language-Action Model
直接接收视觉与语言输入,输出机器人动作的端到端模型。
先用人话理解
传统机器人靠工程师写死「看到什么就动哪里」的规则;VLA 让模型自己看画面、听指令,直接生成该做的动作。
为什么重要
VLA 是具身智能的核心技术路线之一,让机器人从感知、理解到执行形成端到端闭环。
常见误解
VLA 不是简单的「图像分类」,而是直接生成连续动作
端到端训练不等同于在所有真实场景都可靠
Vision-Language-Action Model
直接接收视觉与语言输入,输出机器人动作的端到端模型。
传统机器人靠工程师写死「看到什么就动哪里」的规则;VLA 让模型自己看画面、听指令,直接生成该做的动作。
VLA 是具身智能的核心技术路线之一,让机器人从感知、理解到执行形成端到端闭环。
VLA 不是简单的「图像分类」,而是直接生成连续动作
端到端训练不等同于在所有真实场景都可靠