본문으로 건너뛰기

PAPERS

논문 트래커

arXiv cs.RO 신규 논문을 매일 수집해 한국어 요약을 붙입니다. 학회 채택 정보는 저자 코멘트에서 자동으로 추출합니다.

473건학회 채택 3건
ThisIsEngineering / Pexels
2610.12470v1

Dex-One2Many: 단일 인간 시연으로부터 덱스터러스 조작 학습

Dex-One2Many: Learning Dexterous Manipulation from a Single Human Demonstration

Jusuk Lee, Sungha Kim, Yeonsoo Park, Jonguk Cheon, Yoonkyo Jung 외 6명

Dex-One2Many는 단일 인간 비디오 하나로부터 일반화 가능한 덱스터러스 조작(dexterous manipulation) 정책을 학습하는 real-to-sim-to-real 프레임워크이다. 핵심 아이디어는 비디오를 순차적 장면 그래프(scene graph)로 추상화하여 강화학습(RL) 탐색을 안내하는 것으로, 다양한 초기 상태 샘플링과 단계별 밀집 보상(dense reward) 제공을 동시에 실현한다. 장면 그래프는 정확한 자세가 아닌 관계를 제약하기 때문에, 비디오에 등장하지 않은 물체 자세와 파지(grasp) 방식까지 포괄하는 초기 상태를 생성할 수 있다. 시뮬레이션에서만 학습한 정책은 실제 다지(multi-fingered) 핸드에 제로샷(zero-shot)으로 전이된다. 5가지 도구 사용·조작 과제 실험에서 기준 모델 대비 본 적 있는 구성에서는 6.5%, 본 적 없는 시나리오에서는 71% 높은 성공률을 기록했다.

Vladimir Srajber / Pexels
2610.12468v1

DreamTrue: 반사실적 사후학습을 활용한 행동 충실 로봇 월드 모델

DreamTrue: Action-Faithful Robot World Model with Counterfactual Post-Training

Junyan Li, Ruizhi Li, Yu Liu, Xiangshuo Liu, Mingchao Sun 외 4명

DreamTrue는 다시점(multi-view) 및 크로스-에보디먼트(cross-embodiment) 환경에서 행동에 충실하고 물리적으로 타당한 영상 예측을 수행하는 로봇 월드 모델(world model)이다. 기존 로봇 데이터셋의 두 가지 한계—부정확한 캘리브레이션과 실패 상호작용 데이터 부족—를 해결하기 위해, 행동 궤적을 이미지 공간 조건으로 렌더링하는 오프라인 기하 캘리브레이션과 반사실적 사후학습(counterfactual post-training)을 도입했다. 반사실적 사후학습은 기록된 행동 궤적을 수정해 더 넓은 범위의 행동·접촉 구성 하의 미래 영상을 생성한다. 로봇·물체·상호작용 결함을 포함한 인간 주석 영상 데이터셋으로 에보디드 비디오 보상 모델(embodied video reward model)을 학습시키고, 그 점수를 강화학습 사후학습에 활용한다. AgiBot 벤치마크에서 인간 평가 기준 상호작용 결함률이 48.12%에서 6.25%로 감소했으며, AgiBot World Challenge 2026 월드 모델 트랙에서 1위를 기록했다.

Pachon in Motion / Pexels
2610.12465v1CoRL

균형 잡힌 데이터 식단: 로봇 제어 초대규모 강화학습의 탐색 병목 해소

A Balanced Data Diet: Addressing the Exploration Bottleneck in Mega-Scale RL for Robot Control

Octi Zhang, Mateo Guaman Castro, Patrick Yin, Ignacio Dagnino, Abhishek Gupta 외 2명

시뮬레이션-실물 강화학습(sim-to-real RL)에서 다양한 시뮬레이터 리셋을 균일하게 샘플링하면 정책이 이미 숙달했거나 아직 시도할 수 없는 태스크 구성에 학습 경험이 낭비되는 문제가 발생한다. 본 연구는 정책의 현재 능력 경계에 있는 태스크 구성에 집중해 학습하는 적응형 샘플러인 Success Guided Sampling(SGS)을 제안한다. SGS는 최대 2²⁰(약 100만)개의 병렬 환경을 사용한 실험에서 기존 방법이 해결하지 못한 다지형(multi-terrain) 사족보행 이동과 접촉 집약적 조립 과제를 풀어냈다. 학습된 조작 정책은 RGB 기반 정책으로 증류(distillation)되어 실제 하드웨어의 여러 조립 과제에 제로샷(zero-shot) 전이를 시연했다.

Atanas Dzhingarov / Unsplash
2610.12467v1

CSF: 모션 생성기를 위한 맥락적 안전 필터링

CSF: Contextual Safety Filtering for Motion Generators

Lizhi Yang, Yiling Hou, Yao Tang, Junheng Li, Daniel Weng 외 2명

텍스트 조건부 모션 생성기는 장면 맥락에 따라 동일한 동작이 물체를 향하는지 사람을 향하는지 구별하지 못하는 문제가 있다. CSF(맥락적 안전 필터링)는 별도 학습 없이 동작하는 필터로, 자연어 안전 규칙을 생성기가 출력한 안전·위험 참조 궤적에 결합한다. 각 규칙에서 도출된 어파인(affine) 안전 값은 제어 장벽 함수 이차 계획법(CBF-QP)으로 강제된다. 서로 다른 아키텍처를 가진 사전 학습 생성기 4종을 대상으로 실험한 결과, 명시적·장면 유발 위험 상황 모두에서 규칙이 올바르게 활성화되었고 위험 이벤트 발생률이 최대 90% 감소하면서 안전 동작의 88~100%가 보존되었다. Unitree G1 로봇을 이용한 실기 검증에서도 인간 및 물체와의 상호작용 시나리오에서 위험 동작을 차단하였다.

Jakub Zerdzicki / Pexels
2610.12457v1

SpatialHarness: 정밀 로봇 조작을 위한 테스트 시점 공간 스캐폴딩

SpatialHarness: Test-Time Spatial Scaffolding for Fine Robotic Manipulation

Jiayu Wang, Yue Yu, Bin Zhu, Zhiyao Yang, Jingjing Chen

SpatialHarness는 멀티모달 파운데이션 모델(multimodal foundation model)의 정밀 조작 실패 원인을 정책 능력 부족이 아닌 공간 관측성(spatial observability) 부족으로 분석하고, 이를 테스트 시점에 보완하는 프레임워크다. 정책 파인튜닝이나 물리 센서 변경 없이, 실제 실행과 동기화된 온라인 시뮬레이션 씬을 유지하면서 과제에 중요한 공간 관계를 가상 시점으로 고정된 정책에 전달한다. 정적·파지·전이 모드를 구분하는 상호작용 인식 씬 동기화(interaction-aware scene synchronization)를 통해 실행 도중 씬 정렬을 유지한다. 4가지 실제 로봇 조작 과제에서 동일한 GPT-6 Astra 정책을 적용한 결과, 플러그 삽입 성공률이 26.7%에서 66.7%로, 하노이 탑 과제가 0%에서 100%로 향상되었다고 저자들은 보고한다.

Emiliano Vittoriosi / Unsplash
2610.12451v1NeurIPS

VersaCamVLA: 로봇 조작을 위한 카메라 설정 가능 VLA 정책

VersaCamVLA: Camera-Configurable VLA Policies for Robotic Manipulation

Boyao Han, Chen Shi, Jingjing Qian, ZhuoTan Tian, Li Jiang

시각-언어-행동 모델(VLA)은 로봇 조작 분야의 기반으로 자리잡고 있으나, 훈련 시 고정된 카메라 구성에 의존하기 때문에 배포 환경에서 카메라 수나 위치가 달라지면 성능이 저하되는 문제가 있다. VersaCamVLA는 카메라 집합 표현과 행동 학습을 분리하는 프레임워크로, 임의의 가변적 RGB 뷰 집합을 고정 크기 잠재 장면 토큰(scene token)으로 변환하는 통합 인터페이스를 학습한다. 다중 신호 목표 뷰 예측과 손목 증강 자세 샘플링(WAPS, Wrist-Augmented Pose Sampling)을 통해 손목 카메라의 자연스러운 움직임을 활용하여 별도 수집 비용 없이 다양한 카메라 자세 데이터를 확보한다. 배포 단계에서는 경량 공간 인코더가 장면 토큰을 사전 훈련된 VLA에 보조 시각 조건으로 주입하며, 명시적 3D 센싱이나 새로운 뷰 렌더링은 필요하지 않다. RoboTwin, LIBERO, 실제 로봇 플랫폼 실험에서 VersaCamVLA는 카메라 수가 달라지거나 학습에 없던 카메라 자세가 주어지는 환경 모두에서 기존 VLA 방법 및 다중 뷰 기준선 대비 일관되게 높은 성능을 기록했다.

Jakub Zerdzicki / Pexels
2610.12440v1

인간에서 로봇으로의 정교한 조작을 위한 Generative Neural Retargeting

Generative Neural Retargeting for Human-to-Robot Dexterous Manipulation

Dechen Gao, Yue Yang, Ben Abbatematteo, Nathan Godwin, Pengcheng Wang 외 6명

인간 시연 데이터는 로봇 학습의 확장 가능한 공급원이지만, 신체 구조 차이(embodiment gap)로 인해 인간 동작을 로봇에 직접 적용하기 어렵다. 기존의 역기구학(IK)은 동역학을 무시하고, 강화학습(RL)은 샘플 비효율과 보상 설계 부담이 크며, 샘플 기반 모델 예측 제어(MPC)는 궤적마다 독립적으로 최적화를 수행해 데이터셋 규모가 커질수록 비용이 급증한다. 연구팀은 실현 가능한 궤적들이 저차원 다양체(manifold) 위에 집중된다는 가설 아래, 플로우 매칭(flow matching) 모델로 해당 다양체에서 궤적을 샘플링하는 Generative Neural Retargeting(GNR)을 제안한다. GNR은 MPC 대비 8.5%의 샘플만을 사용해 성공률 56.20%를 달성했으며, MPC의 27.20%를 상회한다고 보고된다. 이 방법을 실제-시뮬레이션(real-to-sim) 데이터 엔진에 적용해 밀집 접촉력 레이블을 포함한 223,000개 시연·3,300개 물체 형상 규모의 정교한 조작 데이터셋을 생성했다.

Ярослав Сапрыкин / Pexels
2610.12435v1

VioLA: 인간 데이터로 학습하는 범용 휴머노이드 제어 정책

VioLA: Learning Generalist Humanoid Control Policies from Human Data

Mert Albaba, Jens Beißwenger, Anna Manasyan, Daniel Marta, Michael J. Black 외 4명

VioLA는 관절 명령 대신 신체·손 동작 잠재벡터(motion latent)를 예측하는 범용 휴머노이드 정책으로, 사전 학습된 신체·손 컨트롤러가 이 잠재벡터를 실제 로봇에서 실행한다. 모션 인코더가 인간과 로봇의 동작을 동일한 잠재 공간에 매핑함으로써, 사람의 동작 녹화를 정책의 행동 공간에서 직접 레이블링할 수 있다. 이를 통해 학습 데이터 1억 4,060만 프레임을 구성했으며, 그 중 93.2%가 인간 데이터다. 태스크별 파인튜닝 없이 실제 로봇에서 보행 지시 추종 성공률 100%를 기록했으며, 이는 같은 조건에서 GR00T N1.7의 16.7%, Ψ_0의 0%와 대비된다. 조작 태스크에서도 파인튜닝 없이 88.6% 성공률을 달성했고, 두 종류의 시각-언어-행동 모델(VLA) 백본과 하나의 월드-액션 모델 백본에서 동일한 방식이 유효함을 확인했다.

Wonderlane / Unsplash
2610.12432v1

FAITH: 고차원 시스템을 위한 실현가능성 인식 안전 필터 강화학습

FAITH: Feasibility-Aware Safety-Filtered RL for High-Dimensional Systems

Songyuan Zhang, Baljeet Singh, Sarthak Ranjeet Kaingade, Chuchu Fan, Bryan Trinh

안전 강화학습(safe RL)에서 안전 조건과 과제 성능을 같은 정책 목표에 넣으면 업데이트가 충돌하는 문제가 발생한다. FAITH는 피드포워드 네트워크로 최소 개입 필터링을 근사하는 모델 프리(model-free) 프레임워크로, 안전 조건 평가와 과제 학습을 행동 실행 단계에서 분리한다. 안전 조건을 만족하는 행동이 존재하지 않을 경우, 예측된 최대 피해를 최소화하는 행동을 대신 선택하도록 설계되었다. 29자유도(DoF) 휴머노이드의 Walking-Avoid 과제에서 99.95%의 안전율과 필터 미적용 대비 97%의 과제 수익을 기록했으며, Push-Avoid 과제에서는 비교 방법 중 가장 높은 안전율을 달성했다. 동일한 정책이 실제 Unitree G1 휴머노이드에서도 시연되었다.

Shahabudin Ibragimov / Unsplash
2610.12431v1CoRL

궤적 확산 모델을 위한 실시간 제어용 불확실성 추정

Control-Ready Uncertainty for Trajectory Diffusion

Zhiwei Xue, Jia Yue Kam, Jinhang Qiu, Yifeng Cheng, Ege Gursoy 외 3명

확산 모델(diffusion model)은 복잡한 다중 모드 궤적 분포를 표현할 수 있으나, 불확실성 추출에는 비용이 큰 몬테카를로(Monte Carlo) 샘플링이 필요해 실시간 제어에 적용하기 어렵다. 저자들은 스코어-곡률(score-curvature) 정보를 증류해 각 기준 궤적 주변에 구조화된 정밀도 행렬을 학습하고, 반복 샘플링 없이 보정된 가우시안 튜브(Gaussian tube)를 생성하는 경량 모듈 SCOPE(Score-Curvature for Online Precision Estimation)를 제안한다. SCOPE는 타임스텝별 공분산 추정치를 산출하며, 이동 에이전트의 예측 점유 공간과 로봇 제어의 적응형 탐색 안내에 활용된다. 보행자 예측, 군중 내비게이션, Maze2D 제어, Franka Panda 실기 매니퓰레이션 네 가지 환경에서 평가한 결과, 빠른 불확실성 추정이 폐루프(closed-loop) 성능 향상으로 이어지는 것으로 나타났다.

Mikhail Nilov / Pexels
2610.12424v1

RoboRSI: 복잡한 실환경에서의 안정적·효율적·재사용 가능한 로봇 자기진화

RoboRSI: Stable, efficient, and reusable robot self-evolution in complex real-world environments

Zimo Wen, Yijin Chen, Yuxuan Cao, Wendi Chen, Yanwen Zou 외 6명

RoboRSI는 코드 기반 로봇 에이전트가 실행 경험을 구조화해 능력을 재사용할 수 있도록 설계된 자기개선(self-improvement) 시스템이다. 핵심 기법인 하향식 기술 정제(Top-Down Skill Refinement, TSR)는 과제를 복합·원자·기본 기술로 분해하고, 각 실행 결과를 해당 기술 분기에 귀속시켜 수정 범위를 그 분기로만 제한한다. Manager·Planner·Engineer·Reviewer 네 역할이 계획·실행·진단·기술 배포를 분담하며, 사람은 목표 설정과 수정을 통해 과정에 개입한다. 모바일 매니퓰레이터에서 104회에 걸친 가정용 다중 물체 정리 과제로 실기 실험을 수행하였다. 시뮬레이션 벤치마크인 LIBERO, LIBERO-PRO, LIBERO-Plus, RoboTwin에서는 가장 강력한 비교 기준선 대비 2.7~11.0 퍼센트포인트 높은 성공률을 기록하였다.

Pankaj Biswas / Pexels
2610.12411v1

GLIO2: 강인한 실시간 전역 위치추정 및 지도작성을 위한 GPU 병렬화 밀결합 LiDAR-관성-GNSS 시스템

GLIO2: A GPU-Parallelized Tightly-Coupled LiDAR-Inertial-GNSS System for Robust and Real-Time Global Localization and Mapping

Qi Zhang, Xikun Liu, Qijun Qin, Xiangru Wang, Junzhe Wang 외 3명

GLIO2는 라이다(LiDAR), 관성 측정 장치(IMU), GNSS 측정값을 단일 슬라이딩 윈도우 인자 그래프(factor graph)에서 공동 최적화하는 밀결합(tightly-coupled) 위치추정·지도작성 시스템이다. 기존 스캔-투-맵(scan-to-map) 방식은 퇴화(degeneracy) 발생 시 오차가 누적되어 복구 불가능한 발산으로 이어지는 한계가 있으며, GLIO2는 GPU 병렬 프론트엔드로 스캔-투-멀티스캔(scan-to-multiscan) 정합을 수행해 이를 완화한다. NVIDIA Jetson Orin NX에서 약 25 Hz(스캔당 39.60 ms)로 실시간 동작하며, 오프라인 백엔드는 4.51 km UrbanNav Whampoa 시퀀스를 약 24초 만에 처리한다. 최대 96 km/h로 주행한 5.66 km 교량 구간에서 비교 대상 시스템이 모두 발산하는 조건 아래 수평 정확도 1.6 m를 유지한다고 저자들은 보고한다. 소스코드와 데이터셋은 공개 예정이다.

khezez | خزاز / Pexels
2610.12407v1

LeWAM: 확산 조향 기반 MPC를 갖춘 JEPA 세계 행동 모델

LeWAM: A JEPA World Action Model with Diffusion-Steering-Based MPC

Shashank Hegde, Alexander Popov, Elie Aljalbout, Nikolai Smolyanskiy

세계 행동 모델(WAM)은 행동과 미래 관측을 예측하지만, 재구성 기반 표현은 잡음과 중복 정보를 포함해 하위 예측 품질을 저하시키는 문제가 있다. LeWAM은 디코더 없는 JEPA(Joint-Embedding Predictive Architecture) 잠재 공간 위에서 순방향·역방향·역동역학(inverse dynamics)·정책 예측을 동시에 학습하는 양방향 트랜스포머 모델이다. 잠재 공간 정렬 실험에서 LeWAM은 재구성 기반 WAM보다 로봇 및 객체 상태를 선형 탐침으로 더 정확하게 읽어낼 수 있었으며, 시각적 방해 요소 무시 능력은 순방향 전용 JEPA 세계 모델과 유사한 수준으로 나타났다. 폐루프(closed-loop) 평가에서는 동일 인코더·동일 규모의 흐름 정합(flow-matching) 정책과 동등한 성능을 보이면서도 세계 모델 기능을 함께 제공한다. 계획(planning) 단계에서는 원시 행동 공간 대신 정책 헤드의 노이즈 공간에서 샘플링하는 확산 조향(Diffusion Steering) 기반 MPC(Model Predictive Control)가 역학 모델 오차 악용 문제를 줄이고 폐루프 성능을 향상시키는 것으로 나타났다.

EqualStock IN / Pexels
2610.12404v1

협동 로봇 동작 생성을 위한 물리 정보 기반 충돌 학습 프레임워크

A Physics-Informed Collision Learning Framework for Collaborative Robot Motion Generation

Chen Cai, Steven Liu

PI-UDF는 다관절 로봇 간 충돌 거리를 예측하는 물리 정보 기반 통합 미분 가능 프레임워크(physics-informed unified differentiable framework)로, 해석적 순기구학(forward kinematics)과 학습 가능한 링크 기하 임베딩, 공유 잔차 네트워크를 결합해 로봇 구성으로부터 팔 간 거리를 직접 예측한다. 충돌 경계 근처의 거짓 안전 오류를 강조하는 비대칭 경계 교차 패널티와 쿼터 기반 경계 마이닝을 도입해 안전 임계 정확도를 높인다. 학습된 거리 필드는 비선형 모델 예측 제어(MPC)에 미분 가능한 팔 간 여유 항으로 통합된다. 실제 듀얼 Franka 플랫폼에서 14자유도(DoF) 듀얼 암 스와핑 및 동적 회피 실험을 수행하였으며, Drake/FCL 오프라인 재현을 통해 폐루프 충돌 인식 협동 로봇 동작 생성에 적합함을 확인하였다.

Chengxin Zhao / Pexels
2610.12386v1

ARC: 로봇 파운데이션 모델을 위한 추론 레시피

ARC: A Reasoning Recipe for Robot Foundation Models

Gokul Puthumanaillam, Tao Sun, Elie Aljalbout, Moritz Reuss, Zhaoshuo Li 외 3명

ARC는 로봇 파운데이션 모델(RFM, Robot Foundation Model)의 제로샷(zero-shot) 과제 성능을 추가 로봇 시연 데이터나 대규모 재학습 없이 향상시키는 추론 방법론이다. 세 가지 요소로 구성되는데, 로봇의 다음 행동과 그 인과 구조를 설명하는 추론 흔적(reasoning trace), 기존 시연 데이터에서 이 흔적을 자동 생성하는 레이블링 파이프라인, 사전 학습된 RFM이 흔적을 제어에 활용하도록 적응시키는 전략이 포함된다. DROID 데이터셋에서 새 로봇 데이터 수집 없이 ARC-Trace-DROID를 구축하였으며, π_0.5와 Cosmos3-Nano-Policy 등 최신 시각-언어-행동 모델(VLA) 및 세계 모델 기반 행동 모델(WAM)에 적용했다. 저자들의 실험에 따르면 RoboLab-Reasoning-50 벤치마크에서 최대 50%포인트, 실제 로봇에서 π_0.5의 과제 성공률이 82.2%포인트 향상되었다.

Tanha Tamanna Syed / Pexels
2610.10538v1

Never Look Back: 자아중심 비디오에서의 3D 객체 메모리 지속성 이해

Never Look Back: Understanding Persistence in 3D Object Memory from Egocentric Videos

Shravan Chaudhari, William Paul, Suchi Saria, Rama Chellappa, Homanga Bharadhwaj

Ledger는 자아중심(egocentric) 비디오에서 객체의 위치·이력·맥락 설명을 결합해 지속적인 3D 객체 메모리를 구축하는 시스템이다. 객체가 시야에서 사라진 후에도 위치를 보존하며, 반복 증거가 쌓인 후에만 이동을 기록해 위치 추정 노이즈의 영향을 줄인다. 짧은 설명문으로 객체의 내용물이나 지지면 등 세부 정보를 저장하고, 원본 영상 없이도 공간 질문에 답할 수 있다. HD-EPIC 정확도는 29.7%에서 42.6%로, UCS-Bench 정확도는 33.8%에서 38.5%로 향상됐으며, Ego4D 객체 위치 예측의 중앙값 오차는 0.99 m로 나타났다. 복수 장면을 이어붙인 100개 스트림 실험에서는 장면 변화 시 메모리 구성 실패가 확인됐고, 장면별 구성 방식이 성능 저하를 부분적으로 회복했다.

Evangeline Shaw / Unsplash
2610.10534v1

RoboPrompt: 희소한 인간 입력을 통한 직관적 로봇 정책 조향

RoboPrompt: Intuitive Robot Policy Steering with Sparse Human Input

Yanwen Zou, Chenyang Shi, Guoxuan Xu, Wenye Yu, Wendi Chen 외 3명

RoboPrompt는 모방 학습(imitation learning)으로 훈련된 로봇 정책을 전용 하드웨어나 아키텍처 수정 없이 사용자가 직관적으로 조향할 수 있게 해주는 경량 시스템이다. 사용자는 그린 궤적, 목표 지점, 방향 지시 등 희소한 입력을 제공하며, 시스템은 이를 행동 초안(action draft)으로 변환한 뒤 기반 정책의 확산(diffusion) 또는 플로우 매칭(flow-matching) 동역학으로 정제한다. 노이즈 공간에서 행동 생성을 제어하므로 기반 정책의 재훈련이나 구조 변경이 필요하지 않다. Diffusion Policy, π_0.5, FastWAM을 대상으로 한 실험에서 DAgger 기반 온라인 개선을 2~3회 반복한 결과, Insert Bread 과제에서 세 정책 평균 성공률이 21.3% 상승하였다. 동시에 인간 개입 횟수는 각각 44.0%(2.86→1.60)와 81.9%(2.60→0.47)로 줄었다.

Pixabay / Pexels
2610.10528v1

Long-WAM: 세계-행동 모델의 컨텍스트 확장

Long-WAM: Scaling the Context of World-Action Models

Wei Huang, Bohan Zhang, Chenzhi Liu, Isabella Liu, Shuai Yang 외 11명

Long-WAM은 실시간 제어 제약 하에서 인과적 세계-행동 모델(causal world-action model)의 시각적 이력 컨텍스트를 확장하기 위한 모델-시스템 프레임워크다. 핵심 발견은 긴 이력의 효과를 얻으려면 비디오 기반 모델이 자기회귀(autoregressive, AR) 방식으로 사전학습되어야 한다는 점이며, 양방향 사전학습 초기화는 컨텍스트를 늘려도 순이득이 없는 것으로 나타났다. RoboCasa GR-1 벤치마크에서 컨텍스트를 0.0초에서 19.2초로 늘리면 성공률이 63.3%에서 78.7%로 오르며, LIBERO-Long·RoboTwin 2.0·DOMINO에서도 비교 대상 방법들 중 가장 높은 결과를 기록한다. 스트리밍 관측 인코딩과 비동기 실행을 적용해 RTX 5090에서 미래 비디오 잠재 예측을 포함한 행동 청크 처리에 107.4 ms가 소요된다. Unitree G1 실물 로봇에서 동적 컵 쌓기 과제에 95% 성공률을 달성하며, 동일 과제에서 Pi0.5와 Fast-WAM은 20회 시도 중 성공이 없었다고 보고된다.

Bernard Hermant / Unsplash
2610.10526v1

Rephrase Before You Act: 시각-언어-행동 모델의 언어 민감성 분석 및 완화

Rephrase Before You Act: Characterizing and Mitigating Language Sensitivity in Vision-Language-Action Models

Mikey Watts, Yuchen Cui

시각-언어-행동 모델(VLA)은 지시 문구가 조금만 달라져도 성능이 크게 흔들리며, 기반이 되는 시각-언어 모델(VLM)의 언어 강건성을 계승하지 못한다. 예를 들어 π_0.5는 'switch on the stove' 지시에는 100% 성공하지만 동일한 동작을 가리키는 'switch on the hot plate'에는 2%만 성공하며, 재구성 증강으로 파인튜닝한 π_0 체크포인트에서도 최대 61포인트의 편차가 관찰된다. 연구팀은 이 민감성이 체계적 패턴을 가짐을 분석하고, 소수의 학습 과제에서 대형 언어 모델(LLM)이 10~20개의 재구성 규칙을 도출하도록 한다. 배포 시 이 규칙에 따라 입력 지시를 한 번 재작성하는 방식으로, 정책 재학습 없이 π_0 기준 12개 보류 과제에서 16~27% 상대적 성능 향상을 달성한다. LIBERO 환경에서 π_0.5의 파인튜닝 내 성공률은 93.6%에서 97.8%로 향상된다.

Polina Tankilevitch / Pexels
2610.10515v1

RoboJEPA: 로봇 잠재 세계 모델 스케일링

RoboJEPA: Scaling Robotic Latent World Models

Artem Zholus, Nicolas Beltran-Velez, Jianhao Yuan, Sarath Chandar, Tushar Nagarajan 외 7명

RoboJEPA는 결합 임베딩 예측 아키텍처(JEPA)를 기반으로 12가지 로봇 형태(embodiment)를 아우르는 대규모 데이터셋으로 학습한 세계 모델이다. 잠재 롤아웃의 오차인 상상 오류(imagination error)가 연산량에 대해 2차 거듭제곱 법칙을 따르며, 이를 통해 법칙이 적합된 규모 이상에서도 모델 품질 예측이 가능함을 보였다. 다운스트림 로봇 계획 성능이 연산량에 따라 예측 가능하게 향상되고, 상상 오류가 실제 로봇 평가의 신뢰할 수 있는 대리 지표로 기능함을 확인했다. 단일 목표 이미지를 향한 제로샷(zero-shot) 계획 방식으로 실제 하드웨어에서 장기 계획이 필요한 과제를 수행할 수 있음을 시연했다. 8B 파라미터 규모의 RoboJEPA는 모델 체크포인트와 학습·배포 코드를 함께 공개했다.