BBIPEDAL.WIKIIndependent robotics reference
AI & Autonomy

Vision-language-action models

Models that connect visual observations and language instructions to robot actions.

Overview

RT-2 studies transferring knowledge from vision-language models into robotic control. A model’s benchmark results describe a particular experimental setting; they do not establish reliable performance for every robot or environment.[1]

Related robots

Robot / manufacturerManufacturer countryStatusPurposeHeightPayloadAnnouncedCompare
Figure 03FigureUnknownDevelopmentHome / General Purpose5 ft 8 in20 kg2025Compare

Sources

  1. RT-2: Vision-Language-Action Models
    Google DeepMind · Academic paper · Published 2023-07-28 · Accessed 2026-10-03