본문으로 건너뛰기

PAPERS

논문 트래커

arXiv cs.RO 신규 논문을 매일 수집해 한국어 요약을 붙입니다. 학회 채택 정보는 저자 코멘트에서 자동으로 추출합니다.

473건학회 채택 2건
Rafael Minguet Delgado / Pexels
2609.15680v1

쿼드로터를 위한 체적 조화장 항법

Volumetric Harmonic Field Navigation for Quadrotors

Shuxiu Jia, Amartya Mukherjee, Yating Yuan, Jun Liu

복잡한 3차원 환경에서의 쿼드로터 항법을 위해 사전 계산된 체적 조화장(volumetric harmonic field)과 구속 예측 플래너를 결합한 방법을 제시한다. 기존의 전역 경로를 추출하는 대신, 예측 위치에서 직접 조화장 값을 쿼리하여 지역 운동 생성을 유도하는 방식을 사용한다. 정형화된 3차원 환경 실험에서 조화장 유도 방식은 Dijkstra 유도 방식보다 최소 통행 여유(clearance)가 크고 RMS 저크(jerk)가 낮았으나, 경로 길이는 더 길었다. 장거리 미로 환경 실험과 Crazyflie를 이용한 실기 비행 실험으로 물리적 실행 가능성을 검증하였다.

HempCrew / Unsplash
2609.15667v1RA-L

지면 추적: 농업 환경에서 로봇 유발 토양 변형의 온라인 라이다 식별

Tracking the Ground: Online Lidar Identification of Robot-Induced Soil Deformation in Agricultural Environments

Tom Montagnon, Johann Laconte, Benoit Thuilot, Wonjae Cho, Roland Lenain

로봇 농업 작업에서 차량-토양 상호작용은 토양 구조를 손상시키고 지면에 원치 않는 변형을 유발하지만, 기존 연구는 토양 상태를 제어 변수로 다루지 않아 왔다. 연구팀은 라이다(lidar) 관측값으로부터 교통 유발 토양 변형을 정량화하고 그 진행을 온라인으로 추정하는 프레임워크를 제안한다. 핵심 방법은 축소차수 매개변수 모델(reduced-order parametric model)로, 물리적으로 해석 가능한 매개변수를 통해 토양 거동을 표현하며 토양 상태를 연속적으로 갱신·관측한다. 다양한 토양 조건에서 수행된 실험에서 로봇 이동으로 유발된 지면 변형을 포착하는 능력이 확인되었다. 이 프레임워크는 추정된 토양 상태를 바탕으로 로봇 행동을 조정해 토양 저하를 줄이는 토양 인식(soil-aware) 로봇 운용의 기반을 마련한다.

Kindel Media / Pexels
2609.15631v1

Flow-Matched Motion Priors: 모방학습을 위한 온라인 최적수송 보상

Flow-Matched Motion Priors: Online Optimal-Transport Rewards for Imitation Learning

Yilin Zou, Chenghua Liu, Chenglong Wu, Fanghua Jiang

적대적 모션 프라이어(AMP)는 정책과 전문가 분포가 멀리 떨어질 때 판별자 보상이 무의미해지는 한계가 있으며, 단순 최적수송(OT) 기반 중심점 목표는 보행 위상에 걸쳐 평균화되어 관절 운동이 약화된다. 이 논문은 롤아웃 이력과 전문가 모션 뱅크를 잇는 경로에서 엔트로픽 최적수송(OT) 결합과 플로우 매칭(FM)으로 스칼라 보상을 온라인 학습하는 Flow-Matched Motion Priors(FMP)를 제안한다. 보상 모델 실험에서 FMP는 값 전용 또는 엔드포인트 전용 피팅보다 피팅 롤아웃 외부 일반화가 크게 향상되는 것으로 나타났다. Unitree G1 로봇의 5천만 트랜지션 실험에서 FMP는 시연 초기화 조건에서 0.727 m/s, 고정 자세 초기화 조건에서 0.338 m/s의 안정적인 전진 보행을 달성했다. 고정 자세 조건의 낙하 횟수는 엔드포인트 전용 제어의 243회 대비 129회였으며, 정적 점수-기울기 교사 대비 오프라인 피팅 시간이 29% 줄었다.

Mikhail Nilov / Pexels
2609.13083v1

ASTRIL-MPC: 언어 유도 신경-기구학 MPC 기반 관절형 궤도 로봇 자율 주행 프레임워크

ASTRIL-MPC: Autonomous Traversal Framework of Articulated Tracked Robots with Language-Guided Neural-Kinematic MPC

Zhenfeng Gan, Yanbo Chen, Lirong Che, Junbo Tan, Xueqian Wang

ASTRIL-MPC는 도시 수색구조 환경에서 관절형 궤도 로봇(ATR)의 자율 주행을 위한 언어 유도 신경-기구학 모델 예측 제어(MPC) 프레임워크다. 학습된 기구학 모델이 높이 시퀀스와 최근 궤적으로부터 단기 작업 상태 증분을 예측하고, NMPC가 다목적 비용 함수와 실행 가능성 제약 조건 하에 계획을 수립한다. 대형 언어 모델(LLM)은 범위 클리핑·변화율 제한·일관성 검사가 포함된 안전 점검 인터페이스를 통해 선택된 가중치와 경계값에 제한적 업데이트를 제안하며, 전체 제어 주기는 100ms 이내에 완료된다. 세 가지 주행 과제 및 다중 높이 일반화 설정에서 비적응형 NMPC 대비 최대 71%, PPO 기준선 대비 최대 67%의 주행 품질 점수 향상을 연구진은 보고한다. 하강 구간에서는 측정 가능한 충돌 충격이 완전히 제거됐다고 밝혔다.

Michael Markhof / Pexels
2609.13053v1

Dynin-Robotics: 옴니모달 통합 확산 시각-언어-행동 모델

Dynin-Robotics: Omnimodal Unified Diffusion Vision-Language-Action Model

Hoeun Lee, Jaeik Kim, Jusang Oh, Jinhyeok Kim, Geon Choi 외 2명

Dynin-Robotics는 언어·시각 관측·목표·행동을 이산 토큰으로 표현하는 옴니모달 마스크 확산 백본 Dynin-Omni 위에 구현된 시각-언어-행동(VLA) 모델이다. 하나의 공유 궤적 모델이 행동 예측, 행동 조건 다음 관측 예측, 최종 목표 상태 예측, 궤적-지시 재구성 등 네 가지 목표를 동시에 학습한다. Open X-Embodiment 데이터셋 48개에서 약 133만 개의 궤적으로 사전학습을 수행했다. Franka Research 3 로봇의 네 가지 조작 조건에서 평균 78.4% 성공률을 기록했으며, LIBERO 및 제로샷 LIBERO-Plus 벤치마크에서도 경쟁력 있는 결과를 보였다. 블록 병렬(block-parallel) 구현으로 보고된 프로파일링 환경 기준 행동 디코딩 속도가 기본 구현 대비 최대 29.2배 빨라졌다.

Thirdman / Pexels
2609.13015v1

다중 모델 전환을 활용한 전역 경로 계획기

Global Path Planner with Multi-Model Switching

Pietro Gori, Francesco Iotti, Eduard Zelenay, Rastislav Marko, Michele Pierallini 외 3명

이 연구는 퓨어 퍼슛(Pure Pursuit) 제어기와 다중 모델 운동학적(kinematic) 전환을 결합한 전역 경로 계획 시스템을 제안한다. 지형 분석을 위한 주행 가능성 그래프(traversability graph), 실현 가능한 경로 생성을 위한 헤딩 인식 A*(Heading-Aware A*) 알고리즘, 동적 추종을 위한 다중 모델 퓨어 퍼슛 제어기로 구성된다. 핵심 기여는 지형 특성과 로봇 상태에 따라 운동학 모델을 실시간으로 전환하는 적응형 운동학 모델링으로, 까다로운 환경에서 경로 효율성과 에너지 사용을 최적화한다. 시뮬레이션 환경에서 Artaban 사족보행 로봇과 X3 쿼드로터 드론에 적용해 표준 기준선(baseline) 대비 향상된 성능과 견고성을 확인하였다.

Bruna Santos / Pexels
2609.13011v1

Comfort by Construction: 학습 기반 주행 정책을 위한 적응형 안락도 제한 행동 공간

Comfort by Construction: Adaptive, Comfort-Bounded Action Spaces for Learned Driving Policies

Anna Rothenhäusler, Daniel Jost, Raghu Rajan, Faris Janjos, Oliver Scheel 외 2명

데이터 기반 주행 시뮬레이터는 고정 격자로 가속도와 조향 각속도를 명령하지만 실현된 저크(jerk)를 제한하지 않아, 강화학습 정책이 급격한 기동으로 안전 지표를 부풀리는 문제가 있다. 단순히 안락도 상한을 적용하면 측면 제한이 속도 제곱에 비례해 축소되어 격자가 포화되는 '격자 붕괴(grid collapse)' 현상이 발생하고 세밀한 제어가 불가능해진다. 저자들은 측면 저크 제약의 폐형 역산(closed-form inversion)을 이용해 매 스텝마다 실현 가능한 제어 집합에 맞게 격자를 재이산화하는 적응형 행동 파라미터화 방법을 제안한다. 실현된 운동역학을 점검하고 까다로운 주행 장면을 저작할 수 있는 브라우저 기반 도구 PufferDrive-Editor도 함께 제시한다. Waymo Open Motion Dataset과 수작업 슬랄롬 경로에서 평가한 결과, 제안 모델은 안락도 위반을 1% 미만으로 유지하면서 클립 격자 및 직접 저크 기준선 대비 주행 가능성(navigability)에서 높은 성능을 보였다.

Daniil Komov / Pexels
2609.12971v1

에너지 효율적 내비게이션을 위한 ROS 2 튜닝: Costmap 2D 설정의 실증적 고찰

Tuning ROS 2 for Energy-Efficient Navigation: Empirical Insights from Costmap 2D Configurations

Michel Albonico, Andreas Wortmann, Ivano Malavolta

이 논문은 로봇 운영 체제 ROS 2(Robot Operating System 2)의 패키지 설정 변경이 이동 로봇 내비게이션의 에너지 효율에 미치는 영향을 실험적으로 분석한다. 소규모·대규모 두 가지 창고형 시나리오에서 장애물 배치와 Costmap 2D 설정을 달리하며 반복 실험을 수행하였다. 측정 지표로는 에너지 소비량, 전력 프로파일, CPU 부하, 메모리 사용량, 내비게이션 성능이 포함된다. 실험 결과, 최적 설정은 로봇이 운용되는 환경에 따라 달라지며, 성능과 에너지 소비에 크게 영향을 미치는 핵심 설정 항목들이 식별되었다.

Pok Rie / Pexels
2609.12959v1

패턴 지향 군집을 위한 분산 확률적 최적 제어

Distributed Stochastic Optimal Control for Pattern-Oriented Swarms

Qingrui Zhang, Chenghao Yu, Feng Xue, Xintong Wang

GRF(가우시안 랜덤 필드)를 시간 영역으로 확장한 확률적 최적 제어 프레임워크를 통해 군집 드론의 기하학적 패턴 형성, 자기조직화, 안전 항법을 단일 확률론적 구조 안에서 다룬다. 집단 조율을 베이즈 추론(Bayesian inference) 과제로 정식화하여 환경 불확실성, 비볼록(non-convex) 제약, 이기종 플랫폼의 이질적 동역학을 동시에 처리한다. 언센티드 변환(unscented transform)으로 동적 장애물과 인접 에이전트의 상태 불확실성을 전파해 충돌 회피를 위한 신뢰 구간을 산출한다. 밀도 안내 패턴 제어(density-guided pattern control)는 기하 패턴을 암묵적 밀도 필드로 인코딩해 에이전트-목표 간 명시적 할당 없이 분산 방식의 자기 치유와 탄력적 재구성을 지원한다. 쿼드로터 15대 실내 실험 및 자체 제작 자율 쿼드로터 4대 야외 배치 실험으로 실기 검증되었으며, 고정익 UAV 군집에도 적용 가능함을 시뮬레이션으로 확인하였다.

Pavel Danilyuk / Pexels
2609.12937v1

사람들 사이의 로봇: 사회적 모방에서 인간 집단의 사회적 형성으로

A Robot Among People:From Social Imitation to the Social Becoming of Human Groups

Victor Tuan Vu Pham, Judith Dörrenbächer, Thomas H. Weisswange, Marc Hassenzahl

이 논문은 집단 중재 로봇이 갈등·비참여·조율 부족 등의 문제를 '수리'하는 해결사로 설계되어 온 경향을 비판한다. 대안으로 로봇을 공유 환경의 상황적 요소, 즉 사람들이 배치·해석·상호작용하는 방식을 통해 의미가 형성되는 존재로 이해하는 관점을 제안한다. 저자들은 선행 연구인 로봇 거리 가구(robotic street furniture) 사례를 근거로, 인간 사회성을 모방하지 않고 집단을 향해 의도적으로 제약된 형태로 기능할 때 집단 차원의 의미 생성이 촉진된다고 주장한다. 공공 공간의 로봇은 자율성이나 지능이 아닌 관계적 역량(relational capacity)으로 개념화되어야 한다고 본다. 이로부터 저자들은 로봇 설계가 인간의 형상이나 효용이 아닌, 함께 존재하고 형성되어 가는 과정에서의 필요에 근거해야 한다는 원칙을 도출한다.

Peter Xie / Pexels
2609.12932v1

ARC: 배치된 자율 시스템을 위한 3계층 거버넌스 아키텍처

ARC: Autonomous Robotics Compliance A Three-Layer Governance Architecture for Deployed Autonomous Systems

Tord Eide, Einar Holt

ARC는 자율 로봇 시스템의 배치 운용을 위해 제안된 3계층 컴플라이언스(compliance) 거버넌스 아키텍처다. 세 계층은 모델 안전 검증(model safety validation), 인지 인증 벤치마크(cognitive certification benchmarks), 운영 승인 기준(operational authorization standards)으로 구성된다. 각 계층은 자율 시스템이 현장에 배치되기까지의 단계별 적합성 판단 기준을 제공하는 것을 목적으로 한다.

Pixabay / Pexels
2609.12927v1

방수 수동 적응형 그리퍼를 이용한 경사면 물체의 수중 파지

Robust Underwater Grasping of Sloped Objects with a Waterproof Passive Adaptive Gripper

Jooyoung Hong, Daewon Hong, Joohyung Kim

평행-조 그리퍼(parallel-jaw gripper)는 경사지거나 비대칭인 물체를 파지할 때 토크 유발 구름 및 전단 미끄러짐으로 성능이 저하되며, 물에 젖거나 잠긴 환경에서는 마찰 감소로 문제가 더욱 심각해진다. 본 논문은 이를 해결하기 위해 수중 환경에서의 파지를 위한 방수 수동 적응형 그리퍼를 제안한다. 제안된 그리퍼는 경사면에서 전체 자기정렬(global self-alignment)을 담당하는 수동 회전 관절과, 국소 표면 적응을 위한 수동 가변 강성(variable-stiffness) 패드를 통합한 완전 방수 설계를 특징으로 한다. 건식 및 수중 조건 모두에서 다양한 원통형·원추형 물체를 대상으로 실험한 결과, 고정 패드 및 고정 관절 기준 그리퍼 대비 우수한 파지 유지력과 강인성을 보였다.

Pavel Danilyuk / Pexels
2609.12898v1

UniPart: 체화 인터랙션을 위한 제로샷 언어 기반 3D 부품 분할

UniPart: Towards Zero-shot Language-Grounded 3D Part Segmentation for Embodied Interaction

Xinqiang Yu, Zekun qi, Jiawei He, Wenyao Zhang, Xuchuan Chen 외 4명

정밀 로봇 조작에는 물체 전체가 아닌 부품 단위의 이해가 필요하지만, 기존 3D 기반 모델은 범용성과 부품 인식 특화 사이에서 균형을 맞추지 못해 제로샷(zero-shot) 전이 성능이 낮다. UniPart는 CLIP 텍스트 임베딩을 조건으로 삼는 피드포워드 크로스모달(cross-modal) 3D 트랜스포머로, 자유형식 텍스트 구문을 입력받아 포인트 클라우드(point cloud)에서 기능적 부품을 선택한다. 학습 규모 확보를 위해 Objaverse 자산 16만 개 이상과 텍스트-부품 쌍 800만 개로 구성된 LangPart-1M 데이터셋을 구축하고, 수동 레이블링한 고품질 서브셋 LangPart-4K를 파인튜닝·평가에 사용한다. UniPart는 오픈 어휘(open-vocabulary) 부품 벤치마크에서 제로샷 성능을 달성하며, 실제 환경의 언어 조건부 부품 파지(grasping) 태스크로의 전이도 확인된다.

Tara Winstead / Pexels
2609.12894v1IROS

Before the Tipping Point: 형상 무관 3D 무게중심 추정을 위한 힘 기반 능동 지각

Before the Tipping Point: Force-Guided Active Perception for Shape-Agnostic Estimation of 3D Centers of Mass

Steven M. Hyland, Jing Xiao, Cagdas D. Onal

이 논문은 형상 정보나 사전 모델 없이 미지 물체의 3D 무게중심(Center of Mass, CoM) 높이와 질량을 추정하는 힘 기반 방법을 제안한다. 로봇 매니퓰레이터가 물체에 준정적(quasistatic) 상승 푸시-리트랙트 동작을 가하고, 6축 힘-토크 센서로 전도(tipping) 과정 중 힘-각도 데이터를 수집해 관성 파라미터를 식별한다. 푸시-리트랙트 사이클을 사용해 마찰 편향(frictional bias)을 완화하고 일반화된 파라미터 피팅을 가능하게 한다. 물체가 넘어지지 않도록 안전 마진을 활용해 임계 전도 구간(sub-critical tipping regime) 안에서 실험을 유지하는 방법도 제안한다. 실험 결과, 다양한 미지 물체에 대해 질량·CoM 높이·전도 각도 모두 상대 오차 5.0% 미만을 달성했다.

Tara Winstead / Pexels
2609.12883v1

이송에서 조작으로: 자기 로봇공학에서 파지 기능 실현

From Transportation to Manipulation: Enabling Grasping in Magnetic Robotics

Lara Bergmann, Noah Greis, Cedric Grothues, Lisa-Marie Weigelt, Klaus Neumann

자기 부상(MagLev) 시스템은 고혼합·저볼륨 제조 환경에서 유연한 물류 재구성을 가능하게 하지만, 파지(grasping) 및 조작 기능은 거의 활용되지 않은 상태다. 연구팀은 세 개의 MagLev 무버를 기계적으로 결합한 저비용 병렬 6자유도(DoF) 매니퓰레이터에 1-DoF 그리퍼를 통합한 Gripper MagBot을 제안한다. 이 장치는 안정성과 작업 공간 요건에 따라 기본 모드와 단일 트랙 모드 두 가지 구성 중 선택할 수 있다. 도킹 스테이션을 활용해 기계 재구성 시 Gripper MagBot의 자율 탈착이 가능하다. 역기구학(inverse kinematics) 제어기를 적용하여 시뮬레이션과 실기 환경 모두에서 픽앤플레이스 동작을 시연하였다.

Lenskachakkar . / Pexels
2609.12871v1

다중 차량 데이터셋: RTK-GNSS 기반 자동 주석화를 위한 카메라·LiDAR·레이더 센서와 스캔 3D 모델

A Multi-Vehicle Dataset with Camera, LiDAR, and Radar Sensors and Scanned 3D Models for Custom Auto-Annotation using RTK-GNSS

Philipp Berthold, Bianca Forkel, Mirko Maehlisch

자율주행 인식 알고리즘 개발을 위한 다중 센서 데이터셋이 제안되었다. 카메라, LiDAR, 레이더 센서 데이터와 함께 대상 차량 전체의 스캔 3D 모델을 포함하며, RTK-GNSS(실시간 이동측위)를 통해 센서 차량 주변 동적 객체의 포즈와 연속적 운동학 정보를 제공한다. 기준 데이터가 완비되어 있어 사용자 정의 세분도(granularity)로 다양한 주석 형식을 사후 생성할 수 있다. 데이터셋은 7대의 대상 차량을 활용한 단일 객체 및 다중 객체 녹화 시나리오를 포함한다. 차량 표면의 법선(normal) 정보가 포함되어 있어 폐색(occlusion)이나 레이더 반사 같은 측정 효과도 정량적으로 평가할 수 있다.

David Bartus / Pexels
2609.12837v1

저고도 비행 환경에서 항공 LiDAR-관성 오도메트리의 파라미터 민감도 분석

Parameter Sensitivity Analysis for Aerial LiDAR-Inertial Odometries in low-altitude flights

Robert Milijas, Jose Ramiro Martinez-de Dios, Stjepan Bogdan

LiDAR 기반 동시 위치추정 및 지도작성(SLAM)과 LiDAR-관성 오도메트리(LIO) 알고리즘은 무인 항공기(UAV) 정밀 항법에 활용되나, 성능이 시나리오·센서·운동 특성에 크게 의존하여 집중적인 파라미터 조정이 요구된다. 본 연구는 EKF 기반 LIO 알고리즘인 FAST-LIO2와 그래프 기반 SLAM 알고리즘 Cartographer의 LIO 모듈을 대상으로, 서로 다른 LiDAR와 환경에서 저~중고도 비행으로 수집한 항공 데이터셋에서 파라미터 영향을 분석하였다. 파라미터 조합은 철저한 격자 탐색(grid search)으로 구성하고, 절대 궤적 오차(ATE)와 파라미터 간 관계는 Pearson 상관계수로, 개별 파라미터의 영향도는 랜덤 포레스트 순열 중요도(random forest permutation importance) 분석으로 평가하였다. 분석을 통해 두 알고리즘 각각에서 성능에 영향이 큰 파라미터를 식별하고 간소화된 조정 절차와 권고안을 도출하였다. 제안된 권고안을 적용하면 분석 데이터셋의 94% 사례에서 ATE가 격자 탐색 최적 성능의 5 cm 이내에 수렴하는 것으로 나타났다.

ThisIsEngineering / Pexels
2609.12831v1

VertexCBF: 꼭짓점 제한 제어 탐색을 통한 신경망 제어 장벽 함수 개선

VertexCBF: Improving Neural Control Barrier Functions via Vertex-Restricted Control Search

Bojan Derajić, Sebastian Bernhard, Wolfgang Hönig

VertexCBF는 신경망 기반 제어 장벽 함수(Control Barrier Function, CBF)를 확장 가능하고 체계적으로 학습하는 프레임워크다. 물리 정보 기반(physics-informed) 학습과 희소 지도 학습을 결합해 정상 상태 Hamilton-Jacobi 가치 함수를 신경망으로 근사한다. 볼록 다면체(convex polytope) 제어 집합과 제어 친화적(control-affine) 동역학을 이용해 해밀토니안이 꼭짓점에서 최대화됨을 활용하고, GPU 병렬 꼭짓점 제한 트리 탐색으로 지도 데이터를 효율적으로 생성한다. 잔차(residual) 아키텍처를 통해 학습된 CBF가 지정된 제약 함수를 초과하지 않음을 구조적으로 보장한다. 15개 시스템 대상 비교 평가에서 기존 기법보다 더 큰 안전 집합을 안정적으로 복원하며, 이동 로봇이 보행자를 회피하는 하드웨어 실험도 수행되었다.

Harrison Kugler / Unsplash
2609.11920v1

EVPeriscope: 이벤트 기반 프로펠러 추적을 통한 공중·지상 로봇 간 확장 인식

EVPeriscope: Extended Perception across Aerial and Ground Vehicles with Event-based Propeller Tracking

Dexter Ong, Vijay Kumar, Pratik Chaudhari

EVPeriscope는 지상 로봇에 장착된 상향식 이벤트 카메라(event camera)로 쿼드로터(quadrotor) 프로펠러의 고주파 시각 신호를 감지해 공중-지상 이종 로봇 간 상대적 위치추정(relative localization)과 제어를 수행하는 시스템이다. 기존 프레임 기반 카메라와 피듀셜 마커(fiducial marker)는 모션 블러·조명 변화·탑재 하중 제약에 취약하지만, 이벤트 카메라는 이러한 조건에서도 안정적으로 동작한다. 지상 로봇의 온보드 센서가 차폐되거나 성능이 저하될 때 쿼드로터가 확장 인식 수단으로 기능하는 유대류형(marsupial) 이종 로봇 구성을 채택한다. 쿼드로터 제어 시스템은 온보드 센싱과 연산만으로 200 Hz에서 동작하며, 풍속 최대 15 mph의 주·야간 환경과 밀집 수풀 속 폐루프 항법 실험을 통해 성능이 검증되었다.

Enchanted Tools / Unsplash
2609.11875v1

UniMPA: 행동 기반 전이 모델링을 통한 통합 메모리-예측-행동 모델

UniMPA: A Unified Memory-Prediction-Action Model via Action-Grounded Transition Modeling

Wei Li, Rui Shao, Jie He, Lingsen Zhang, Ziwei Liu 외 1명

시각-언어-행동 모델(VLA)을 활용한 로봇 조작 연구에서 관측-행동 학습은 전이 실현 가능성 격차(transition realizability gap)라는 근본적인 문제에 직면한다. 이 논문은 전이 모호성, 예측-실행 불일치, 경험-실현 불일치 세 가지 문제를 해결하기 위해 UniMPA를 제안한다. UniMPA는 지속적-선택적 미래 예측(Persistent-Selective Future Prediction)을 통해 태스크 수준 진행 상태를 지속 추적하는 잠재 스트림과 세밀한 상호작용 변화를 선택적으로 처리하는 픽셀 스트림을 함께 운용한다. 시간적 시각-행동 메모리 뱅크(Visual-Action Memory Bank)는 과거 실행 경험을 검색해 예측된 전이의 물리적 실행 가능성을 평가하며, 행동-시각 메모리 뱅크(Action-Visual Memory Bank)와 프로토타입 편향 플로우(Prototype-Biased Flow)는 현재 장면에 맞도록 행동을 문맥 인식 방식으로 적응시킨다.