본문으로 건너뛰기

GLOSSARY

시각-언어-행동 모델

Vision-Language-Action Model (VLA)고급

시각-언어-행동 모델(VLA)이란 카메라 이미지와 자연어 지시를 함께 입력받아 로봇의 제어 신호를 직접 출력하는 대규모 멀티모달 모델이다. 기존 로봇 정책 네트워크는 특정 환경·작업에 과적합되기 쉬운 반면, VLA는 웹 규모 데이터로 사전학습된 시각-언어 기반 모델의 의미론적 일반화 능력을 행동 생성 단계까지 연장한다. 일반적으로 트랜스포머 디코더가 이미지 패치 토큰과 언어 토큰을 처리한 뒤, 엔드이펙터 위치·자세·그리퍼 개폐 여부 등을 이산 행동 토큰 또는 연속값 시퀀스로 예측하는 구조를 취한다. 구글 딥마인드의 RT-2는 이미지-텍스트 데이터로 학습된 VLM을 로봇 시연 데이터로 파인튜닝하여, 훈련 중 등장하지 않은 물체나 지시에도 행동을 일반화하는 사례를 보여 주었다. 시각-언어 모델(VLM)이 텍스트 또는 이미지 기술(記述)을 출력하는 데 그치는 것과 달리, VLA는 행동 예측 헤드를 추가하거나 행동 자체를 어휘 토큰으로 이산화하여 제어 신호를 모델의 직접 출력으로 삼는다는 점에서 구별된다.