
VLM 에이전트를 활용한 인-컨텍스트 로봇 학습
In-Context Robot Learning with VLM Agents
Dongzhou Cheng, Taoran Yi, Ye Fang, Xingwu Zhang, Fan Feng 외 10명
기존 로봇 정책은 새로운 환경에서 맥락 정보만으로 즉시 적응하는 인-컨텍스트 학습(in-context learning, ICL)을 수행하기 어렵다. 이 연구는 GPT-6 Astra 등 상용 시각-언어 모델(vision-language model, VLM)을 활용한 범용 에이전트 프레임워크 GPT-Policy를 제안한다. GPT-Policy는 과제 관련 시각적 전이를 보존하는 컨텍스트 컴파일러, 행동을 제안하는 VLM, 각 행동을 검증·실행하고 결과를 보고하는 제약 제어기(constrained controller)로 구성된다. 실로봇 실험에서 사람의 시연 영상은 로봇 행동 레이블 없이도 과제 완료율을 향상시켰으며, 정렬된 행동 참조를 추가하면 접촉 민감 과제에서 추가 성능 향상이 나타났다. 이 프레임워크는 그래디언트 업데이트나 과제 특화 파라미터 변경 없이 VLM의 범용 역량을 물리적 행동으로 전환하는 경험적 기반을 제시한다.














