본문으로 건너뛰기

PAPERS

논문 트래커

arXiv cs.RO 신규 논문을 매일 수집해 한국어 요약을 붙입니다. 학회 채택 정보는 저자 코멘트에서 자동으로 추출합니다.

473건학회 채택 3건
rf43f / Pexels
2610.03717v1NeurIPS

디코더가 적을수록 인코더가 강해진다: 새로운 시점 합성을 통한 기하학적 표현 학습

Less Decoder is More Encoder: Geometric Representation Learning from Novel View Synthesis

Keerthi Kaashyap, Dennis Anthony, Akshay Krishnan, Nhi Ngoc Nguyen, Jeremy Collins 외 3명

이 논문은 새로운 시점 합성(Novel View Synthesis, NVS) 기반 인코더의 기하학적 표현 능력이 낮은 원인을 구조적 측면에서 분석한다. 문제는 지도 신호 부족이 아니라, 공간 표현력이 높은 디코더가 인코더의 표현 능력을 희석시키고 저수준 픽셀 공간 목표가 특징 학습을 방해하는 설계 선택에 있음을 밝혔다. 저자들은 포즈 조건부 로컬 디코더(pose-conditioned local decoder)와 잠재 공간(latent space) 재구성 목표를 결합한 자기지도 인코더-디코더 트랜스포머 SNAP을 제안한다. SNAP은 시각적 위치 추정, 포즈 추정, 점 대응, 깊이 추정, 로봇 조작 등 5가지 과제에서 기하학 감독 방법 및 자기지도 방법과 경쟁력 있는 성능을 나타냈다. 또한 SNAP의 패치 특징은 카메고 시점 변화 시 표준 2D 표현이 실패하는 상황에서도 성능 저하가 완만하게 나타나는 창발적 시점 불변성(emergent viewpoint invariance)을 보였다.

Mandiri Abadi / Pexels
2610.03710v1

EyeRobot 2.0: 손목 카메라 없이 정밀 조작을 위한 능동 시선 제어

EyeRobot 2.0: Active Gaze for Precise Manipulation without Wrist Cameras

Kush Hari, Justin Kerr, Nidhya Shivakumar, Samarth Mahapatra, Carmelo Sferrazza 외 5명

EyeRobot 2.0은 단일 스테레오 카메라만으로 세밀한 양손 조작(bimanual manipulation)을 수행하는 프레임워크로, 두 카메라 시점을 장면 내 3D 고정점으로 물리적으로 향하게 하는 능동 시각 고정(AVF, Active Visual Fixation) 기법을 사용한다. 이미지 중심부에 더 많은 시각 토큰을 할당하는 포비얼(foveal) 처리로 과제 관련 특징에 연산을 집중하며, 그리퍼 정보를 고정점 기준 SE(3) 프레임으로 정규화해 학습해야 할 행동 분포를 압축한다. 저수준 시선 서보잉 정책과 고수준 고정점 목표 선택기를 강화학습(RL)으로 계층적으로 훈련하며, 두 모듈 모두 실세계 데이터로 학습된다. 7개 실세계 과제와 6개 시뮬레이션 과제에서 1,000회 이상의 실물 실험과 1,800회 이상의 시뮬레이션 실험을 진행했다. 손목 카메라를 제거하면 수동 스테레오만으로는 성공률이 52%에서 27%로 하락하지만, EyeRobot 2.0은 수동 스테레오 대비 실세계 40%, 시뮬레이션 20% 높은 성공률을 보였으며, 파지 물체가 손목 카메라를 가리는 상황에서는 손목 카메라 탑재 정책(22%) 대비 두 배 이상의 성공률(48%)을 기록했다.

Clay Banks / Unsplash
2610.03622v1

CORNAV: 가동 중인 공사 현장에서의 로봇 내비게이션을 위한 건설 인식 추론

CORNAV: Construction-Aware Reasoning for Robot Navigation on Active Worksites

Parastoo Ali Pour, Deepak Prakash Kumar, Tommy Zhou, Pramod Khargonekar, Mohammad Abdullah Al Faruque

CORNAV는 빌딩 정보 모델(BIM) 없이 2D CAD 도면과 공정 일정만으로 건설 현장 자율 내비게이션을 수행하는 프레임워크이다. 건축 도면을 계층적 오픈-어휘 3D 장면 그래프(scene graph)와 정합해 객체 쿼리 기반 위치 파악을 수행하고, 공정 일정을 시간 변동 내비게이션 제약으로 변환한다. 대형 언어 모델(LLM) 기반 안전 모듈이 위험 구역 진입 요청을 사전에 차단하며, A* 플래너가 필수 제외 구역을 강제 적용하면서 고위험 구역을 우선 회피한다. 실내 사무소와 실제 건설 현장 실험에서 도면 기반 위치 파악이 과제 성공률을 13.0%에서 72.2%로 높였고, 일정 인식 기능은 하드존 위반을 모두 제거하였다.

History in HD / Unsplash
2610.03620v1

UniIntervene++: 효율적인 실세계 강화학습을 위한 적응형 개입 에이전트

UniIntervene++: An Adaptive Intervention Agent for Efficient Real-World Reinforcement Learning

Yudong Lin, Haoyuan Deng, Zhuoxuan Yuan, Zaijia Yang, Yuanjiang Xue 외 1명

온라인 강화학습(RL)은 로봇이 물리적 상호작용을 통해 정책을 개선하게 하지만, 기존 개입 전략은 고정된 규칙에 기반하여 정책 역량의 변화를 반영하지 못한다. UniIntervene++는 자율 실행과 다양한 보조 행동 간 제어권 배분을 온라인으로 학습하는 적응형 개입 에이전트다. 이 방법은 진화하는 RL 정책, 궤적 보정, CodePolicy를 통합 반마르코프 결정 과정(semi-Markov decision process)의 옵션으로 정식화하고, 비보조 실행을 주기적으로 수행하여 현재 정책 역량에 맞게 개입 빈도를 동적으로 조절한다. 실세계 조작(manipulation) 과제 5가지에서 평균 성공률 89.67%를 기록하여 모든 비교 대상 대비 최소 6 퍼센트포인트 높은 성능을 보였으며, 인간 개입 비율은 0.77%로 최고 비교 대상 대비 최소 94.6% 감소하였다.

Mikhail Nilov / Pexels
2610.03616v1IROS

LLA-MPC on Embedded Hardware: 수천 개의 병렬 모델을 활용한 신속 적응 제어

LLA-MPC on Embedded Hardware: Rapid Adaptive Control with Thousands of Parallel Models

Henry Z. Liao, Maitham F. AL-Sunni, John M. Dolan

LLA-MPC(Look-Back and Look-Ahead Adaptive Model Predictive Control)는 학습 없이 실시간으로 시스템 식별과 제어를 수행하는 적응형 모델 예측 제어(MPC) 프레임워크다. 기존 구현은 고정된 모델 구조의 시뮬레이션 자율 레이싱에만 적용되었으나, 이번 연구는 모듈식 동역학과 적분기를 갖춘 일반화된 구현을 제시한다. F1TENTH 플랫폼에서 제한된 연산 자원과 노이즈가 있는 상태 추정 조건 하에 검증을 수행하였다. 내장형 컴퓨터에서 수천 개의 후보 모델을 실시간으로 평가해 타이어 파라미터를 온라인으로 식별한다. 저마찰 타이어와 노면 변화 조건 실험에서, 고정 공칭 모델이 실패하는 고속 추종 과제를 LLA-MPC가 완료하는 것으로 나타났다.

Tima Miroshnichenko / Pexels
2610.03615v1

프론티어 추론과 로봇 실행의 연결: 자율 시연 생성부터 밀집 언어 감독까지

Bridging Frontier Reasoning and Robot Execution: From Autonomous Demonstration Generation to Dense Language Supervision

Bosung Kim, Alexander Trevithick, Ruiyi Wang, Prithviraj Ammanabrolu

프론티어 모델(frontier model)은 소수의 시연만으로 로봇 조작을 가능하게 하지만, 높은 추론 지연이 실시간 제어에 걸림돌이 된다. 이 연구는 프론티어 추론과 저지연 로컬 실행을 연결하는 두 가지 접근을 제시한다. 첫 번째는 프론티어 모델이 물리적 오류 복구용 교정 세그먼트를 포함한 시연을 자율 생성하여 빠른 로컬 정책(local policy) 학습 데이터를 보완하는 방법으로, 성공 예시가 맥락에 쌓일수록 생성 시간과 비용이 감소한다. 두 번째는 기본(primitive)·원자(atomic)·복합(composite)의 세 가지 중첩 세분성에서 다중 측면 설명을 제공하는 밀집 언어 감독(dense language supervision)으로, 정책의 명령 추종 신뢰성을 높인다. RoboCasa 365와 BEHAVIOR-1K의 장기 과제 평가에서 두 방법을 결합했을 때 오라클 및 프론티어 모델 지시자 조건 모두에서 가장 높은 성능을 달성했다.

Jakub Zerdzicki / Pexels
2610.03607v1

WING: 상호작용 중심 스펙트럼 잠재 안내를 통한 세계 행동 학습

World Action Learning via Interaction-Centric Spectral Latent Guidance

Zhiming Liu, Yikun Miao, Ying Chen, Hongrui Yin, Fangqi Zhu 외 5명

로봇 조작 정책 학습에는 대규모 실세계 상호작용 데이터가 필요하지만 데모 수집 비용이 높아, 자아 중심 영상(egocentric video)을 활용하는 방안이 연구되고 있다. WING은 자아 카메라 움직임으로 발생하는 관찰자 유도 모션을 손-물체 상호작용 성분과 분리하고, 상호작용 중심 잠재 행동(latent action)을 추출하는 프레임워크다. 교차 신체(cross-embodiment) 과제 의미론이 느리게 변하는 시간 구조에 집중된다는 점을 이용해, 스펙트럼 도메인에서 자아 중심 잠재 행동과 로봇 행동의 저주파 공유 성분을 찾아 행동 생성을 안내한다. 시뮬레이션 벤치마크에서 LIBERO 평균 성공률 99.20%, RoboTwin 2.0 93.80%, RoboCasa-GR1 57.7%를 기록했다. 다양한 일반화 조건 하의 실세계 조작 과제 4종에서도 검증을 수행했다.

Anna Shvets / Pexels
2610.03587v1

AVL-JEPA: 결합 임베딩 예측 아키텍처 월드 모델에서 인과 동역학 정보 붕괴 방지

AVL-JEPA: Preventing Causal Dynamics Information Collapse In Joint Embedding Predictive Architecture World Models

Yikang Qiao, Ling Zhang, Ziying Song, Duan Huang

결합 임베딩 예측 아키텍처(JEPA, Joint Embedding Predictive Architecture)는 관측을 재구성하지 않고 미래 잠재 표현을 예측하는 방식으로 월드 모델이 고수준 의미 동역학에 집중할 수 있게 한다. 그러나 JEPA는 고차원 시각 정보를 유지하면서 행동의 물리적 결과에 관한 정보는 버리는 실패 양상을 보일 수 있으며, 저자들은 이를 인과 동역학 정보 붕괴라 정의한다. 이를 방지하기 위해 제안된 AVL(Action-grounded Vision-Invariance Latent)은 실행된 행동을 보조 동역학 앵커로 활용해 동역학 정보 보존을 유도하고, 시각 불변성 경로를 통해 교란된 잠재 예측과 깨끗한 잠재 예측을 정렬한다. TwoRoom, PushT, OGBench Cube, Reacher 등 4가지 로봇 제어 과제에서 평가한 결과, AVL은 시각 교란 환경에서 성공률을 크게 높이면서 교란이 없는 환경의 성능도 유지하는 것으로 나타났다.

Spencer Liao / Unsplash
2610.03563v1

엠파워먼트와 예측 제어를 위한 통합 프레임워크

A Unified Framework for Empowerment and Predictive Control

Wooyoung Chung, Tristan Shah, Volodymyr Makarenko, Stas Tiomkin

샘플링 기반 모델 예측 제어(MPC)는 궤적 최적화에 효과적이지만, 비용 함수 설계에 상당한 도메인 지식이 요구된다. 엠파워먼트(Empowerment)는 에이전트 입력과 미래 상태 간 채널 용량으로 정의되며, 목표 독립적(goal-agnostic) 제어 목적함수를 제공한다. 기존 엠파워먼트 기반 제어기는 탐색 정책과 실행 정책이 분리되고 이차 미분이 필요하다는 두 가지 한계가 있었다. 이 연구는 탐색과 행동에 단일 정책을 사용하는 엠파워먼트 공식화를 제안하며, 일차 미분만으로 표준 MPC 솔버와 호환된다. 고전 제어 과제 실험에서 엠파워먼트와 과제 비용을 결합하면 각 목적함수 단독 사용 대비 성공률이 같거나 높게 나타났다.

Yaroslav Shuraev / Pexels
2610.03538v1

RATE: 접촉 집약적 로봇 조작을 위한 위험 인식 촉각 인코딩

RATE: Risk-Aware Tactile Encoding for Contact-rich Robotic Manipulation

Yuyao Jiang, Haichao Liu, Jiarui Zheng, Zihan Ding, Weihao Yuan 외 1명

접촉 집약적 로봇 조작에서 유사한 촉각 관측값이 센서 노이즈, 과제상 필요한 변동, 불필요한 접촉 등 위험 수준이 전혀 다른 상황에서 발생하여 하위 정책의 판단을 모호하게 한다. 이를 해결하기 위해 위험 인식 촉각 인코딩(RATE, Risk-Aware Tactile Encoding)을 제안하며, 과제 조건부 상호작용 위험을 인코딩하는 촉각 표현을 학습한다. 이력 조건부 예측(history-conditioned prediction)으로 상호작용 맥락을 포착하고, 경보 감독(alert supervision)으로 해당 맥락을 과제 조건부 위험과 연결한다. 학습된 위험 인식 표현은 경량 잔차 어댑터(residual adapter)를 통해 기존 촉각 특징을 보완한다. 시뮬레이션과 실기 실험 모두에서 과제 성공률이 크게 향상되었으며, 제거 실험(ablation)으로 경보 유도 학습과 예측 시계열 모델링의 보완적 효과가 확인되었다.

Google DeepMind / Pexels
2610.03537v1

혈관내 뇌-컴퓨터 인터페이스 접근을 위한 자율 로봇 항법

Autonomous Robotic Navigation for Endovascular Brain-Computer Interface Access

Harry Robertshaw, Weijie Qi, Nikola Fischer, Alejandro Granados, Thomas C. Booth 외 1명

개두술(craniotomy) 없이 뇌에 접근하는 혈관내 뇌-컴퓨터 인터페이스(BCI) 시술은 뇌 정맥의 해부학적 변이로 정밀한 기기 유도가 요구된다. 이 연구는 Soft Actor-Critic(SAC) 기반 강화학습 컨트롤러를 훈련하여 우측 내경정맥에서 상시상정맥동까지 두 단계 경로를 자율 항법하는 시스템을 제시한다. 시뮬레이션(in silico) 평가에서 학습 해부 모델 기준 Task A와 Task B의 성공률은 각각 85.6%와 98.4%였으며, 미학습 해부 모델에서는 42.0%와 91.6%를 기록했다. 형광투시(fluoroscopy) 유도 실물(in vitro) 실험 20회 중 14회(전체 70%)가 성공했으며, 미학습 팬텀 모델의 Task B에서는 80% 성공률을 달성했다. 온라인 실패 예측기는 시뮬레이션에서 99.3~100.0%의 실패 탐지율을 보였으나, 실물 환경으로 전이 후 일부 성공 경로에서 과다 경보가 발생하는 캘리브레이션 저하가 관찰되었다.

Ellie Burgin / Pexels
2610.03530v1

DR-IPC: LiDAR 기반 쿼드로터 탐색을 위한 외란 강인 통합 계획·제어

DR-IPC: Disturbance-Resilient Integrated Planning and Control for LiDAR-Based Quadrotor Navigation

Peng Liu, Jingyan Wang, Qipeng Ye, Wen Li, Jinya Su 외 3명

DR-IPC는 LiDAR 기반 쿼드로터가 복잡한 환경에서 외란에 강인하게 비행할 수 있도록 경량 경로 유도와 비선형 모델 예측 제어(NMPC)를 통합한 계획·제어 프레임워크다. 상호 연결된 확장 칼만 필터(EKF)와 비선형 외란 관측기가 NMPC 예측에 필요한 상태 추정치와 외란 재구성 정보를 함께 제공한다. 이 구조는 쿼드로터 비선형 동역학, 구동기 제약, 국소 경로 생성, 안전 비행 회랑(safe flight corridor) 잔차 패널티를 별도의 궤적 최적화 단계 없이 단일 정식화로 처리한다. Gazebo·MARSIM 시뮬레이션과 실내외 실험에서 바람, 현수 화물, 좁은 통로, 공 충격, 동적 장애물 회피 조건으로 검증하였으며, 다목표 탐색에서 임무 완료 횟수가 Gazebo 기준 1/10에서 9/10로 증가하고 고도 RMSE가 실험 기준 0.34 m에서 0.01 m로 감소하였다. 전체 시스템은 온보드에서 100 Hz로 동작한다.

Pavel Danilyuk / Pexels
2610.03516v1

XGenAct: 교차 과제 생성을 통한 기하학 강화 세계 행동 모델

XGenAct: Geometry-Enhanced World Action Models through Cross-Task Generation

Tingting Du, Ziyao Wang, Guoheng Sun, Ang Li

세계 행동 모델(WAM, World Action Model)은 관찰과 행동의 시간적 변화를 예측해 로봇 제어에 활용되어 왔으나, RGB 기반 예측은 공간적 이해를 명시적으로 다루지 못한다는 한계가 있다. XGenAct는 RGB 영상, 로봇 행동, 미터 단위 깊이(metric depth), 표면 법선(surface normal), 기능적 역할 분할(functional role segmentation)을 결정론적 코덱(deterministic codec)을 통해 모두 RGB 비디오 형태로 표현한다. 단일 비디오 확산 트랜스포머(video diffusion transformer)와 단일 학습 목적 함수만으로 모달리티별 전용 헤드 없이 다양한 지각·행동 과제를 동시에 학습한다. RLBench 보류 과제에서 구조적 지각 학습을 적용한 XGenAct는 5개 과제 외부 비교에서 52% 성공률을 기록했으며, 평가된 베이스라인 중 가장 강력한 모델의 26%를 상회한다. 또한 RGB를 먼저 생성한 뒤 고정된 지각 전문가 모델을 적용하는 파이프라인보다 미래 깊이 및 분할 예측 정확도가 높게 나타났다.

ThisIsEngineering / Pexels
2610.03498v1

Detect and Suppress: VLA 모델의 적대적 패치에 대한 메커니즘 기반 방어

Detect and Suppress: A Mechanistic Defense against Adversarial Patches in VLA Models

Yukiya Horiba, Koshiro Aoki, Shunsuke Yasuki, Bum Jun Kim, Taiki Miyanishi

시각-언어-행동 모델(VLA)은 적대적 패치(adversarial patch)로 시각 입력이 조작될 경우 로봇 제어 실패로 이어질 수 있다. 저자들은 희소 자동 인코더(sparse autoencoder, SAE)로 VLA 내부 표현을 분석해 적대적 패치 존재와 강하게 상관되는 특정 피처를 식별한다. 이 피처를 추론 시점에 선형 탐침(linear probe)이 공격을 감지할 때에만 조건부로 억제하는 방식으로 VLA 전체 재학습 없이 강건성을 높인다. LIBERO-10 벤치마크에서 평가한 결과, 조건부 개입은 간헐적 공격 환경에서 성공률을 향상시키는 반면, 공격 여부와 무관하게 지속 적용하면 정책 성능이 크게 저하된다. 이 결과는 공격과 연관된 내부 표현이 방어 개입의 유효한 표적이 될 수 있으며, 개입 시점 제어가 정상 정책 동작 보존에 중요함을 보여준다.

Harrun Muhammad / Pexels
2610.03476v1CoRL

MobiAgent: 장기 이동 조작을 위한 이중 루프 재귀적 정책 자기 개선

MobiAgent: Dual-Loop Recursive Policy Self-Improvement for Long-Horizon Mobile Manipulation

Chenzhi Liu, Yue Zhang, Jiehong Lin, Jianan Wang, Bo Wang 외 2명

MobiAgent는 장기(long-horizon) 이동 조작 과제에서 실행 오류 누적 및 이동·팔 제어 간 능력 간섭 문제를 해결하기 위한 이중 루프(dual-loop) 에이전트 프레임워크다. 내부 루프(Inner Loop)는 고수준 추론과 저수준 제어를 분리하고, 시각-언어 모델(VLM)을 활용한 후퇴 수평선(receding-horizon) 계획과 시각 반성(visual reflection)으로 강인한 오류 복구를 수행한다. 저수준 제어는 통합 VLM 백본을 공유하는 플로우 매칭(flow-matching) 전문가들이 담당하여 능력 간섭을 완화하면서 재사용성을 높인다. 외부 루프(Outer Loop)는 배포 롤아웃을 자동으로 분절·검증·클러스터링해 원자 스킬(atomic skill)을 발견하고, 인간 주석 없이 스킬 라이브러리를 지속적으로 미세조정한다. RoboCasa, BEHAVIOR-1K 및 실세계 과제 평가에서 BEHAVIOR-1K 기준 π_0.5-TA 대비 22.5%p 향상, RoboCasa 성공률 7.50%→27.50%, Astribot S1 실세계 과제 성공률 32.5%→57.5%로 개선됐다.

Steve A Johnson / Pexels
2610.02204v1

Reconstruct, Practice, Go Real: 체화 에이전트의 가이드 자기 개선

Reconstruct, Practice, Go Real: Guided Self-Improvement for Embodied Agents

Yen-Jen Wang, Haozhe Jiang, Shuying Deng, Haoru Xue, Weirui Ye 외 5명

RPG는 모델 가중치를 업데이트하지 않고 오프라인 데이터셋에서 조작 능력을 식별한 뒤 시뮬레이션에서 연습 과제를 구성하는 로봇 실행 시스템 자율 개선 프레임워크다. 연습 중 실행 피드백, 시뮬레이터 특권 상태(privileged simulator state), 데이터셋 영상을 활용해 실패를 진단하고 재사용 가능한 심볼릭 스킬(symbolic skill)을 개발하거나 기존 스킬을 개선한다. 테스트 시에는 멀티모달 대형언어모델(LLM)이 생성된 시스템 프롬프트와 스킬 라이브러리를 이용해 인식과 로봇 제어를 조율한다. 22개 조작 과제 평가에서 첫 라운드 후 28.6%였던 과제 성공률이 15라운드 후 95.0%로 향상되었으며, ASPIRE(75.5%)와 GPT-6 Astra Pro 기반 CaP-Agent0(60.0%)를 포함한 모든 비교 기준을 상회했다. 캘리브레이션 및 하드웨어 적응 절차를 마친 뒤 3개 과제에서 각 10회씩 총 30회 실물 시험을 모두 성공했다.

Pachon in Motion / Pexels
2610.02198v1

FERPO: 순방향 엔트로피 정규화 정책 최적화

FERPO: Forward Entropy-Regularized Policy Optimization

Sebastian Sanokowski, Alireza Sarmadi, Majid Khadiv

연속 제어 분야의 온라인 강화학습(reinforcement learning)에서 일부 기법은 학습된 크리틱(critic)을 행동에 대해 미분해 정책을 갱신하지만, 정확한 가치 예측이 정확한 행동 미분을 보장하지는 않는다. FERPO는 크리틱을 행동에 대해 미분하지 않고 엔트로피와 쿨백-라이블러(Kullback-Leibler, KL) 발산으로 정규화된 정책 개선 목표에서 최적 목표 행동 분포를 유도하는 온-정책 최대 엔트로피 강화학습 알고리즘이다. 행동자(actor)는 롤아웃 정책에서 추출한 행동에 자기정규화 중요도 샘플링(self-normalized importance sampling, SNIS)을 적용해 순방향 KL 목표를 최소화하는 방식으로 목표 분포에 맞춰 학습된다. 역방향 KL 목표가 목표 분포의 일부 최빈값만 선호하는 경향이 있는 것과 달리, 순방향 KL 목표는 다수의 고가치 최빈값 탐색을 촉진한다. MuJoCo Playground와 ManiSkill 실험에서 경쟁력 있는 성능과 샘플 효율 향상을 보였으며, Relative Entropy Pathwise Policy Optimization(REPPO) 대비 행동자 업데이트 속도도 빠른 것으로 나타났다.

David Thái / Pexels
2610.02196v1

InterEvolve: 휴머노이드 로코-매니퓰레이션을 위한 보상 프로그램의 테스트 시간 진화

InterEvolve: Test-Time Evolution of Reward Programs for Humanoid Loco-Manipulation

Zhuo Lin, Sirui Xu, Liuyu Bian, Yu-Xiong Wang, Liang-Yan Gui

InterEvolve는 재훈련 없이 테스트 시간에 기존 컨트롤러의 스킬을 재활용하여 새로운 로코-매니퓰레이션(loco-manipulation) 과제를 해결하는 프레임워크다. 객체 인식 순방향-역방향(forward-backward, FB) 행동 파운데이션 모델(behavioral foundation model)을 개발하여, 새로운 보상 신호를 테스트 시간에 곧바로 로코-매니퓰레이션 행동으로 변환한다. 과제는 단계별 보상·완료 조건·조정 가능한 상수로 구성된 보상 프로그램(reward program)으로 명세되며, 대형 언어 모델(LLM) 에이전트가 실행 피드백과 검증된 프로그램 라이브러리를 바탕으로 프로그램 구조를 반복 수정하고 수치 최적화기가 상수를 조정한다. 실험에서 사람이 직접 설계한 보상보다 InterEvolve가 진화시킨 프로그램이 FB 모델의 잠재 능력을 더 많이 이끌어내는 것으로 나타났다. 시뮬레이션에서 다양한 과제와 장기 구성을 다루며, 진화된 스킬 일부는 자기중심 온보드 인식(egocentric onboard perception)만으로 Unitree G1 실체 로봇에서도 자율 작동하는 것을 확인했다.

Mikhail Nilov / Pexels
2610.02170v1

Watch, Infer, Coordinate: 제로샷 협력을 위한 로봇 파트너 제약 조건 추론

Watch, Infer, Coordinate: Inferring Robot Partner Constraints for Zero-Shot Coordination

Suyu Ye, Zheyuan Zhang, Vaishnav Tadiparthi, Hossein Nourkhiz Mahjoub, Ehsan Moradi Pari 외 3명

물리적으로 결합된 조작 과제에서 하드웨어 열화나 액추에이터 결함으로 인해 파트너 로봇의 행동 제약이 발생할 수 있지만, 그 제약이 협력 상대 로봇에게는 알려지지 않은 경우가 많다. 이 연구는 관찰자 로봇이 제약이 있는 파트너 로봇이 제3의 로봇과 협력하는 장면을 관찰해 제약을 추론하고, 새로운 과제에서 동일 파트너와 제로샷 협력(zero-shot coordination)을 수행할 수 있는지 탐구한다. 핵심 통찰은 제약이 팀 전체의 공동 행동에 영향을 미치므로 두 로봇 모두의 행동이 파트너 능력에 관한 정보를 제공한다는 점이다. 연구팀은 세 가지 물리적 결합 조작 환경을 포함하는 벤치마크 Watch, Infer, Coordinate를 제안하고, 관측된 공동 행동으로 후보 제약을 점수화하는 추론 방법을 도입했다. 세 환경 모두에서 제안 방법은 제약 추론과 제로샷 협력 성능을 크게 향상시켜 실제 제약 정보를 보유한 오라클에 근접한 결과를 보였다.

cottonbro studio / Pexels
2610.02161v1

DuoMind: 시맨틱 통신을 통한 분산 다중 로봇 협력 지원

DuoMind: Enabling Distributed Multi-Robot Coordination with Semantic Communication

Hanchu Zhou, Dechen Gao, Hang Wang, Brendan Lynch, Boqi Zhao 외 3명

시각-언어 모델(VLM)과 시각-언어-행동 모델(VLA)을 결합한 분산 계층 프레임워크 DuoMind를 제안한다. 각 로봇은 저수준 실행을 담당하는 VLA 기반 행동 모델과 고수준 추론 및 에이전트 간 조율을 맡는 VLM 기반 오케스트레이터로 구성된다. 오케스트레이터는 작업 지시, 로컬 관측, 다른 로봇으로부터 수신한 메시지를 종합해 행동 모델에 저수준 명령을 내리고 동료 로봇에게 시맨틱 메시지를 전송한다. 다중 로봇 협력 벤치마크 부족 문제를 해결하기 위해 분산 제어 환경에서 협조적 폐루프(closed-loop) 실행이 필요한 장기(long-horizon) 조작 과제를 포함하는 RoboPoly 벤치마크를 함께 개발했다. RoboPoly와 RoboTwin에서의 실험 및 절제 연구(ablation study)를 통해 계층적 오케스트레이션과 시맨틱 통신 각각의 기여를 확인했다.