
구성 가능한 파운데이션 프라이어와 일반화 가능한 파지 합성을 통한 적응형 시각-언어 파지
Adaptive Vision-Language Grasping via Composable Foundation Priors and Generalizable Grasp Synthesis
Sixu Yan, Shikang Wang, Binhua Huang, Xuanlai Tang, Guohua Fan 외 9명
AdaRoboVLG는 다양한 로봇 손(robotic hand)에 걸쳐 일반화 가능한 파지 합성을 지원하는 태스크 적응형 시각-언어-파지(VLG) 프레임워크다. 기존 VLG 방식이 파운데이션 모델과 종단간 파지 정책을 강하게 결합하는 것과 달리, 명시적 운동학적 매핑(kinematic mapping)과 힘-폐쇄(force-closure) 기반 안정성 추정으로 물리적으로 실현 가능한 파지 후보를 생성·평가하는 일반화 기반 정책을 학습한다. 태스크 의존적 이해는 전문화된 파운데이션 모델 모듈에 위임하며, 이 모듈들은 기반 파지 정책을 재학습하지 않고도 구성 가능한 프라이어(composable prior)를 파지 합성 과정에 통합한다. 시뮬레이션 및 실환경 실험에서 기반 정책의 효율적 학습과 강한 크로스-핸드(cross-hand) 일반화, 공간·인지·시간적 프라이어의 결합 효과가 확인됐다. 이 결과는 물리적 파지 합성과 태스크 의존적 이해를 분리하는 설계가 확장 가능한 로봇 파지 패러다임임을 시사한다.








