본문으로 건너뛰기

PAPERS

논문 트래커

arXiv cs.RO 신규 논문을 매일 수집해 한국어 요약을 붙입니다. 학회 채택 정보는 저자 코멘트에서 자동으로 추출합니다.

473건학회 채택 3건
Pavel Danilyuk / Pexels
2608.27073v1

SpatialCrafter: 생성적 3D 프록시를 활용한 단일 이미지 세계 모델링

SpatialCrafter: Single Image World Modeling with Generative 3D Proxies

Chuan Fang, Lingteng Qiu, Yixun Liang, Rui Chen, Kunming Luo 외 6명

SpatialCrafter는 단일 이미지에서 탐색 가능한 3D 장면을 생성하는 2단계 프레임워크로, 글로벌 3D 프록시(proxy)를 활용해 기존 비디오 확산 모델(VDM)의 기하학적 불일치와 장기 드리프트 문제를 완화한다. 1단계에서는 Point-anchored Sparse Structure(PaSS) Flow 모듈이 공간적으로 정렬된 기하학적 일관성 있는 3D 프록시를 예측하고, 2단계에서는 VDM 기반 Generative Deferred Refiner가 프록시 위에 고주파 포토리얼리스틱 세부 묘사를 합성한다. 프록시와 사전 학습된 VDM의 통합을 위해 Parallel Geometry Injection과 Proxy-Aware Corruption 학습 전략을 도입하여, 프록시 아티팩트에 대한 견고성을 높이면서 기존 생성 모델의 성능을 유지한다. 연구팀은 이 과제에 적합한 데이터셋이 없어 11만 5천 개 장면으로 구성된 대규모 하이브리드 데이터셋을 새롭게 구축했다. 합성 및 실세계 데이터셋 실험에서 급격한 카메라 움직임과 극단적인 시점 변화에도 기존 방법 대비 우수한 3D 일관성을 보인다.

Tope J. Asokere / Pexels
2608.27033v1

Riemann-1.0: 물리적 AI를 위한 체화형 세계 행동 모델

Riemann-1.0: An Embodied World Action Model for Physical AI

Haofeng Sun, Jiangbo Pei, Fei Kang, Zexiang Liu, Yaokun Li 외 11명

Riemann-1.0은 다중 시점 시각 관측, 로봇 상태, 행동을 단일 인과 자기회귀(causal autoregressive) 시퀀스로 통합 모델링하는 세계행동모델(World Action Model, WAM)이다. 기존의 비디오 우선 예측 또는 분리형 모델링 방식과 달리, 온라인 로봇 정책 실행과 행동 조건부 세계 시뮬레이션을 하나의 모델에서 수행한다. 에고센트릭 인간 영상, 핸드헬드 그리퍼 시연, 이기종 로봇 궤적을 아우르는 점진적 구현 사전학습(progressive embodied pretraining) 프레임워크를 적용해 200K 시간 이상의 상호작용 데이터로 학습된다. 시뮬레이션 벤치마크에서 RoboTwin2.0 94.3%, LIBERO 99.0%, 장기 조합 벤치마크 RoboCasa-365에서 62.6%의 성공률을 기록하며, 이전 최고 방법 대비 8.4% 앞선다. 실세계 장기 조작 태스크에서는 성공률(SR) 85.0%, 진행 성공률(PSR) 94.4%를 달성하며, 가장 강력한 오픈소스 기준선보다 SR 기준 15% 높다.

Guille B / Unsplash
2608.27000v1

Hyper-Multidual Quaternions를 통한 강체 운동 제트의 임의 차수 Hermite 보간

Arbitrary-Order Hermite Interpolation of Rigid-Motion Jets via Hyper-Multidual Quaternions

Daniel Condurache

이 논문은 단위 이중사원수(dual quaternion)로 표현된 유한 차수 강체 운동 제트(rigid-motion jet)의 양측 보간 문제를 다룬다. 임의 차수 멀티듀얼(MD) 대수를 계수로 갖는 하이퍼-멀티듀얼(HMD) 사원수를 도입하여, 자세와 그 도함수를 단일 변환 객체로 인코딩한다. 나선 선형 보간법(ScLERP)을 단위 HMD 사원수로 대수적으로 확장하면 끝점 변환은 일치하지만, 임의 끝점 제트에 대해 완전적분가능성(holonomicity)을 일반적으로 만족하지 못함을 보이고 구체적인 결함 기준을 제시한다. 완전적분가능한 대안으로, 끝점 변환을 로그 이중사원수 좌표에 매핑한 뒤 n차 도함수까지 일치시키는 차수 (2n+1) Hermite 다항식을 적용하고 지수사상으로 들어올리는 방법을 제안한다. 이 방법은 dexp의 명시적 미분 없이 고차 강체 운동 가속도 장을 복원하며, 2차까지의 회전 및 SE(3) 검증과 3차 다항식 검증을 통해 이론적 결과를 확인한다.

Tima Miroshnichenko / Pexels
2608.26105v1

VBVR-Pro: 네이티브 시각적 추론을 위한 확장 가능하고 검증 가능한 스위트

VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning

Junxiang Xu, Ruisi Wang, Fanyi Pu, Maijunxian Wang, Ran Ji 외 47명

VBVR-Pro는 시각적 생성(visual generation)을 추론 자체의 매개체로 삼는 네이티브 시각 추론(native visual reasoning)을 위한 폐루프(closed-loop) 테스트베드다. 절차적으로 생성된 300개 태스크로 구성된 제어 가능한 태스크 공간을 제공하며, VBVR-Pro로 학습된 모델은 RISE-Video, MME-CoF-Pro, BabyVision 등 7개 외부 벤치마크에서 전이 성능을 나타냈다. 기존의 대규모 다중모달 언어 모델(MLLM)을 판정자로 활용하는 방식의 반복적 실패 패턴을 규명하고, 결정론적 태스크별 규칙에 기반한 검증 가능한 보상 스코어러(verifiable reward scorer)를 도입해 대규모 강화학습(reinforcement learning) 신호로 활용한다. 30개 이상의 이미지·비디오·인터리브드 생성기를 대상으로 한 분석에서 비디오 생성은 시공간 상태 추적 태스크에 가장 강하고, 인터리브드 생성은 연산 효율적 대안임을 확인했다. 데이터, 모델, 스코어러, 코드 전체를 공개한다.

Pavel Danilyuk / Pexels
2608.26103v1

Zero-WAM: 개방형 태스크 일반화를 위한 인간 비디오 기반 인컨텍스트 세계-행동 모델링

Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization

Jiaming Zhou, Qihang Zhang, Gangwei Xu, Cunxin Fan, Yujie Zhao 외 7명

Zero-WAM은 훈련 중 본 적 없는 조작(manipulation) 과제를 제로샷으로 수행하기 위해 문맥 내 학습(in-context learning, ICL) 패러다임을 로봇 조작에 도입한 인과적 비디오-액션 모델이다. 자연어 대신 인간 동작 영상을 과제 명세로 활용해, 의도된 과제 흐름에 대한 시각적 단서를 직접 제공한다. 인간-로봇 쌍 데이터 부족 문제를 해결하기 위해 로봇 궤적을 의미적으로 대응하는 인간 영상으로 자동 변환하는 파이프라인을 제안하고, 이를 통해 8,600개 과제에 걸친 74,200쌍의 HumanGen 데이터셋을 구축하였다. 훈련 시에는 기존 과제 패턴에 대한 단축 학습을 억제하는 문맥 내 미래 청크 예측(in-context future chunk prediction, IFP) 목적함수를 적용하였다. RoboTwin 2.0 시뮬레이션에서 7개의 미지 과제에 대해 평균 성공률 47.0%를 달성하며, 최강 비디오-액션 기준선 대비 절대 성공률 29.5 퍼센트포인트 향상을 기록하였다.

KJ Brix / Pexels
2608.26076v1

Lie Group 제약 MeanFlow를 통한 고속 생성적 파지

Fast Generative Grasping via Lie Group-Constrained MeanFlow

S. Talha Bukhari, Yi Wei, Ruiqi Ni, Zachary Kingston, Aniket Bera

로봇 파지 합성(grasp synthesis)은 단일 해가 아닌 다봉 분포(multimodal distribution)를 학습해야 하므로, 확산 모델(diffusion model)이나 플로우 기반 생성 모델이 주로 사용되지만 다단계 샘플링으로 인한 추론 지연이 문제였다. 본 연구는 곱 리 군(product Lie group) G = SO(3) × R³ 위에서 MeanFlow를 적용한 Lie Group-constrained MeanFlow 기법을 제안한다. 학습 목표는 대수적 반군(semigroup) 일관성 조건과 리만 조건부 플로우 매칭(Riemannian Conditional Flow Matching)을 결합해 평균 속도를 데이터 분포에 고정한다. 제안 기법은 5회 이하의 네트워크 평가만으로 파지 자세를 생성하며, ACRONYM 데이터셋에서 기존 최신 모델 대비 최대 39배 빠른 밀리초 단위 추론 속도를 달성한다. 추가 학습이나 도메인 적응 없이 실제 로봇 환경에 직접 적용되며 관측 노이즈 하에서도 안정적인 파지 합성 성능을 보인다.

Giant Asparagus / Pexels
2608.26074v1IROS

결정 전 게이팅: 자율주행에서 상호작용 후 의사결정 실패를 방지하기 위한 의도 발산 예측

Gating Before Commitment: Anticipating Intent Divergence to Prevent Post-Interaction Decision Failures in Autonomous Driving

Cong Xu, Ravi Sankar

자율주행 시스템에서 차량 상호작용 중 의도 오해석으로 발생하는 경로 계획 실패를 방지하기 위해, 언어 유도 의도 모듈(language-guided intent module)이 평활화된 의도-기하 발산 점수(intent-geometry divergence score)를 계산하고 코리더 엔벨로프(corridor envelope) 진입 전 기동을 게이팅(gating)하는 결정 레이어를 제안한다. 오프로드 이탈 1건과 충돌 영상 4건의 재생 실험에서 게이팅은 드리프트 발생 72ms 후, 코리더 이탈 161ms 전에 작동하여 10회 전 반복 재생에서 궤적을 코리더 내에 유지시켰다. 초기 보정 단계에서 5.9분간 9건의 오작동이 발생하였으나, 불확실성을 기권(abstention)으로 처리하는 사전 등록된 재설계를 적용한 결과 분당 0.341건으로 줄었다. 절제 실험(ablation) 결과, 전체 점수는 5건의 실패 중 4건에서 가장 빠른 감지를 달성하였으며 신뢰도 항을 제거하면 감지 2건을 손실하는 것으로 나타났다. 동일 허위 양성 조건 하의 인-도메인(in-domain) 트랙 비교에서는 기하 규칙 단독 적용 시 감지율이 3배 이상 높아지는 것으로 확인되었다.

Hyundai Motor Group / Unsplash
2608.26066v1

VirTooS: 자율 이동 로봇의 군집 관리를 위한 ROS 2 - Unity 가상화 툴킷

VirTooS: A ROS 2 - Unity Virtualization Toolkit for Fleet Management of Autonomous Mobile Robots

Andrea Drudi, Lorenzo Pichierri, Andrea Testa, Giuseppe Notarstefano

VirTooS는 자율이동로봇(AMR) 군집의 플리트 관리(fleet management) 작업을 지원하는 Python/C# 툴킷이다. 로봇 운영체제(ROS) 2와 Unity 게임 엔진을 결합해 혼합현실 환경에서 가상 실험 시나리오를 생성·커스터마이징할 수 있다. LiDAR 등 가상·실제 센서를 활용해 혼합현실 환경에서 지도 작성과 자율 주행을 수행한다. 분산 로봇 실험을 위해 ChoiRbot 프레임워크 기반의 루틴을 제공하며, 실제 로봇과 가상 로봇 간의 태스크 할당 실험을 예시로 제시한다. 패키지는 컨테이너화된 배포 환경을 포함하며, 소스 코드는 GitHub에 공개될 예정이다.

Mika Baumeister / Unsplash
2608.26058v1

하나의 정책, 다양한 구현체: 이종 구현 조작을 위한 통합 카메라 중심 행동 기하학 사전학습

One Policy, Many Embodiments: Unified Camera-Centric Action Geometry Pre-training for Heterogeneous Embodied Manipulation

Xiaomi Embodied Intelligence Team, University of Macau, :, Shaoqing Xu, Fang Li 외 19명

UCAG-P는 시각-언어-행동 모델(VLA) 정책의 이종(heterogeneous) 데이터 문제를 해결하기 위해 카메라 중심 통합 행동 표현을 제안한다. 로봇 팔·휴머노이드·사람 손 등 서로 다른 형태의 조작 행동을 카메라 좌표계의 앵커 모션으로 통일 표현하며, 기하학 조건부 행동 변환기(geometry-conditioned action translator)가 이를 각 로봇에 맞는 실행 명령으로 변환한다. 이 분리 구조 덕분에 공유 정책은 형태에 무관한 조작 기하학을 학습하면서 개별 로봇 제어 특성도 유지한다. 모델은 로봇·시뮬레이션 데이터 4,030시간과 인간 시연 2,340시간으로 학습되었다. 벤치마크별 미세 조정 없이 LIBERO에서 98.3%, RoboTwin Easy/Hard에서 88.7%/89.2%, LIBERO-Plus 제로샷에서 82.0%, RoboCasa GR-1에서 62.0%의 성능을 기록했다.

Natalia Dziubek / Unsplash
2608.26053v1

R³: RL을 통한 자연어 추론 로봇 학습

R³: Training Robots to Reason in Natural Language via Reinforcement Learning

Lehong Wu, Yuxiao Qu, Zheyuan Hu, Ivan Zhang, Limin Wei 외 2명

R³는 시각-언어 모델(VLM)을 자연어 추론 기반의 로봇 제어기로 변환하는 사후 학습(post-training) 레시피다. 먼저 전문가가 생성한 추론 흔적(reasoning trace)으로 VLM을 미드-트레이닝해 추론 스타일을 초기화한 뒤, 오프라인 행동 데이터로부터 단일 단계 루브릭 기반 강화학습(RL)을 적용해 추론기를 개선한다. 기존 로봇 추론 방법들이 구조화된 트레이스를 보조 지도 신호로 사용한 것과 달리, R³는 자유 형식 자연어 추론을 학습해 저수준 정책(low-level policy)에 테스트 타임 가이던스를 제공한다. Language Table과 시뮬레이션 기반 양팔 식료품 포장 실험에서 R³는 미관측 태스크로의 탐색·일반화를 개선하고 명령어 전용 모방학습(imitation learning) 기준선을 두 벤치마크 모두에서 크게 상회하는 성능을 보였다.

Annie Spratt / Unsplash
2608.26050v1RA-L

장애물이 휘어질 때: 야외 로봇공학 맥락에서의 식생 변형 모델링

When Obstacles Bend: Modeling Vegetation Deformation in the context of Field Robotics

Muhammad Hsaeeb Zaar Khizar, Tom Montagnon, Roland Lenain, Romuald Aufrère, Johann Laconte

자연환경에서 운용되는 자율 로봇은 식생(vegetation)을 단순히 회피하는 것이 아니라 직접 상호작용해야 하는 경우가 많다. 기존의 통과가능성(traversability) 평가는 특정 플랫폼의 반응을 기준으로 정의되어, 로봇이 달라지면 결과를 재활용하기 어렵고 식생 자체의 물리적 특성을 직접 반영하지 못한다. 본 연구는 특정 로봇에 의존하지 않는 식생 고유의 역학적 특성(intrinsic mechanical properties)을 추정하는 방법을 제안한다. 변형량 측정치와 접촉력(contact force) 데이터를 결합하여 식생의 역학 파라미터를 추정하고 상호작용 응답을 재구성한다. 이를 통해 플랫폼 종속 지표 대신 환경 고유 특성에 기반한 식생 인식 내비게이션(vegetation-aware navigation)이 가능해진다.

Cemrecan Yurtman / Unsplash
2608.26011v1

Phantom Navigator: 실시간 추적과 GPS 스푸핑을 활용한 은밀하고 정밀한 무인 항공기 경로 변경

Phantom Navigator: Stealthy and Precise Unmanned Aerial Vehicle Redirection with Real-Time Tracking and GPS Spoofing

Haocheng Meng, Shaocheng Luo, Songqiao Xie, Miroslav Pajic

이 논문은 무인 항공기(UAV)를 지정된 위치로 은밀하고 정밀하게 경로 재설정하는 공격 시스템 'Phantom Navigator'를 제안한다. 기존의 물리적 포획, 통신 하이재킹, 센서 스푸핑 방식이 각각 비용·전문성·정확도 측면에서 한계를 지닌다는 점을 지적한다. 제안 시스템은 오프라인 도달 가능성 분석(reachability analysis)으로 재설정 가능 범위를 사전 추정하고, 온라인 폐루프(closed-loop) 실행 계층을 통해 실제 환경에서 성공적인 경로 재설정을 수행한다. 물리적 공격 플랫폼은 LiDAR-카메라 기반 탐지·추적 스택을 탑재하여 실시간으로 대상 UAV의 자세를 추정하고 GPS 스푸핑(spoofing) 신호를 계산·송출한다. 실세계 사례 연구를 통해 방법론과 구현의 유효성을 검증하였다.

Denny Müller / Unsplash
2608.26002v1IROS

DESCENT: 공항 지상 이동 예측을 위한 방향성 엣지 장면 인코딩

DESCENT: Directed Edge Scene Encoding for Airport Surface Movement Prediction

Alexander Prutsch, David Schinagl, Horst Possegger

DESCENT은 공항 지상 이동체의 궤적 예측(trajectory forecasting)을 위한 트랜스포머(transformer) 기반 아키텍처로, 이기종 동역학과 엄격한 위상적 제약을 처리하도록 설계되었다. 핵심 구성 요소인 잠재 도달 가능 집합(Potential Reachable Set, PRS) 컨텍스트 샘플링 메커니즘은 다양한 운항 단계에 걸쳐 공항 환경 정보를 적응적으로 수집한다. 디텍션 트랜스포머(detection transformer) 기반 디코더와 결합하여 장기 예측 컨텍스트를 효과적으로 활용한다. Amelia-10 벤치마크 평가에서 기존 최신 기법 대비 성능 향상을 보였으며, 안전 임계 시나리오에서 개선 폭이 두드러졌다. 자율주행 분야에서 활발히 연구된 모션 예측(motion forecasting)을 공항 지상 운영에 적용한 사례로, 지상 교통 밀도 증가에 따른 안전 자동화 수요에 대응한다.

KJ Brix / Pexels
2608.25940v1

피지컬 AI 벤치마크 중복성에 대한 통계적 감사

A Statistical Audit of Physical AI Benchmark Redundancy

Zaruhi Navasardyan, Hrant Davtyan

물리적 AI(Physical AI) 모델 평가에 사용되는 벤치마크 간 정보 중복성을 정량적으로 분석한 연구다. 연구팀은 51개 모델과 12개 벤치마크로 구성된 행렬을 구축하고, 모델 카드·벤치마크 논문·자체 평가 실행 결과를 통합하여 벤치마크 간 정보 공유 수준을 측정했다. 대체 관계에 있는 벤치마크 쌍을 단일 열로 통합하면 51개 모델 중 22개의 순위가 3위 이상 이동하는 것으로 나타났다. 점수 분산과 기선택 집합으로 설명되지 않는 분산을 결합한 유틸리티 기준으로 탐욕적(greedy) 선택을 수행한 결과, 4개 벤치마크 부분집합이 12개 전체 유틸리티의 78.5%를 유지했으며 이 위에 Bradley-Terry 순위 모델을 적합시켰다. 제안된 절차는 벤치마크 수준 점수와 충분한 보고 중복만 있으면 물리적 AI 외 다른 도메인에도 적용 가능하다.

Timo Wielink / Unsplash
2608.25917v1

게임을 현명하게 선택하라: 실제 차량 상호작용에서의 게임 이론적 구조 측정

Choose Your Game Wisely: Measuring Game-Theoretic Structures in Real-World Vehicle Interactions

Yueyuan Li, Rongcheng Nie, Weijie Xi, Mingyang Jiang, Songan Zhang 외 2명

이 논문은 실제 차량 궤적(trajectory) 데이터에서 게임이론(game-theoretic) 상호작용 구조—동시적·순차적·비대칭적—를 측정하는 프레임워크를 제안한다. INTERACTION, highD, inD, rounD, Waymo Open Motion, nuPlan 등 6개 실세계 궤적 데이터셋을 대상으로 행동 변화 시점, 시간적 순서, 반응 역학, 순서 안정성을 정량화하였다. 분석 결과, 차량 추종·합류·상충 상호작용에서 동시적 행동 변화와 순차적 행동 변화가 모두 상당한 비율로 관찰되었다. 순차적 상호작용 중에서는 순서가 교번하는 경우보다 지속적 비대칭 역할(안정적 순서)이 더 빈번하게 나타났다. 시간적 선행이 반드시 측정 가능한 행동 반응과 일치하지는 않는다는 점에서, 특정 게임이론 정식화 하나가 모든 차량 상호작용을 보편적으로 설명하기보다는 상황별 보완적 모델링 도구로 활용되어야 함을 시사한다.

cottonbro studio / Pexels
2608.25874v1

로봇 포장을 위한 저해상도 인식

Low-Resolution Perception for Robotic Packing

Giuseppe Fabio Preziosa, Federico Vignoni, Chiara Castellano, Marco Faroni, Andrea Maria Zanchettin 외 1명

이 연구는 저비용·저해상도 깊이 센싱(depth sensing)을 활용한 로봇 패킹(packing) 인식 문제를 다룬다. 재건(reconstruction) 단서로 다음 관측 시점을 선택하고, 파악(grasp) 증거로 물체별 안정성 추정치를 갱신하는 프레임워크를 제안한다. 저해상도 최적 다음 시점(Next Best View, NBV) 전략은 중복 시점을 명시적으로 회피하면서 작업에 필요한 기하 정보를 보존한다. 효용 함수에 대한 절제 연구(ablation study)와 다양한 정책에 걸친 엔드투엔드 평가 두 단계로 검증을 수행하였다. 실험 결과, 저해상도 인식이 로봇 패킹의 실용적이고 확장 가능한 대안임을 보였다.

Lilian Do Khac / Unsplash
2608.25872v1

VISTA: 접촉이 많은 조작을 위한 시각적으로 추론된 공간적 접촉 어텐션

VISTA: Visually Inferred Spatial ConTact Attention for Contact-Rich Manipulation

Jiayi Chen, Wenlong Dong, Yan Huang, Xianglin Chen, Zijian Lin 외 3명

접촉이 빈번한 조작(contact-rich manipulation) 작업에서 외부 카메라만으로는 그리퍼와 물체의 접촉 상태를 정확히 파악하기 어렵고, 별도의 촉각·힘 센서는 하드웨어 복잡도와 비용을 높인다. 이를 해결하기 위해 연구팀은 유연한 그리퍼의 3D 변위 표현인 시각적 변형장(Visual Deformation Field, VDF)을 고차원 시각-물리 피드백으로 활용하는 모방 학습 패러다임 VISTA-Policy를 제안한다. VISTA-Policy는 실시간 VDF 디코딩을 위한 물리 인식 인코딩 엔진, 실제 상호작용 신호를 분리하는 에너지 집계 노이즈 제거 메커니즘, 폐루프(closed-loop) 보정을 위한 변형 증강 정책 네트워크 세 모듈로 구성된다. 다중 스케일 물체 파지, 뚜껑 열기, 붓글씨 쓰기 과제에서 순수 비전 기반 기준 모델인 3D Diffusion Policy와 촉각 기반 기준 모델을 모두 상회하는 성능을 기록했다. 분포 외(out-of-distribution) 물체 크기와 동적 외란에 대한 강건성도 확인되어, 비정형 환경에서의 정밀 조작을 위한 비용 효율적 접근법으로 평가된다.

Daniel Miksha / Unsplash
2608.25864v1

MA-VLA: 협업 및 구성적 일반화를 위한 다중 팔 VLA 모델

MA-VLA: Multi-Arm Vision-Language-Action Model for Collaboration and Compositional Generalization

Zaibin Zhang, Junlan Xiao, Zhongbo Zhang, Yifan Wang, Li Kang 외 9명

MA-VLA는 다관절(multi-arm) 로봇 협업을 위한 통합 프레임워크로, 시각-언어-행동 모델(VLA)에 팔별 원자적 행동 할당(atomic action assignment) 메커니즘을 결합한다. 협동 행동을 중간 수준의 원자적 프롬프트로 분해하고 각 팔에 배분함으로써 명시적 하위 목표 지정과 태스크 간 구성적 재사용을 가능하게 한다. 학습 시 각 팔의 관측·상태·할당 프롬프트를 무작위로 치환하는 Arm Shuffle 기법을 도입해, 고정된 실행 역할 의존성을 줄이고 학습에 없던 새로운 협조 패턴으로의 재구성을 지원한다. 저자들은 테스트 시점의 협업 패턴이 학습 집합에 존재하지 않는 벤치마크를 별도 구축하였으며, 시뮬레이션과 실환경 평가에서 기존 최고 성능 VLA들이 미지의 협업 패턴에서 대부분 실패한 반면 MA-VLA는 안정적으로 성공하는 결과를 보였다.

Christina @ wocintechchat.com M / Unsplash
2608.24885v1

로봇 월드 모델은 정말로 행동을 따르는가? 정책 학습을 위한 행동 조건부 생성의 진단 및 정렬

Do Robotic World Models Really Follow Actions? Diagnosing and Aligning Action-Conditioned Generation for Policy Learning

Sixiang Chen, Jiaming Liu, Jixian Wu, Yichen Guo, Tinghao Wang 외 5명

행동 조건부 세계 모델(action-conditioned world model)은 로봇 정책 평가·개선용 시뮬레이터로 활용되고 있으나, 생성된 미래 시퀀스가 임의의 유효 행동을 충실히 반영한다는 전제는 그간 검증되지 않았다. 이 연구는 시각적 무결성(visual integrity)과 SE(3) 궤적 정렬 지표를 사용해 더 넓은 행동 분포에서 행동 추종 능력을 평가하는 벤치마크 WorldEcho를 제안한다. 진단 결과, 기존 세계 모델은 전문가 시연 행동은 비교적 잘 수행하지만 비전문가 궤적에 대해서는 명령 행동을 무시하거나 시각적으로 유효하지 않은 롤아웃을 생성하는 경향이 있었다. 이를 개선하기 위해 분포적 커버리지 확장, 표현적 기반화, 개입-효과 정렬의 세 축으로 행동 추종을 강화하는 WorldSync를 제안하며, 행동 유도 로봇 역학에 중간 비디오 표현을 접지시키는 Action-Forcing Expert 모듈을 포함한다. RoboTwin 벤치마크와 실제 로봇 태스크 실험에서 WorldSync는 WorldEcho 지표를 향상시키고 반복적 정책 개선 과정에서 정책의 성공률을 높이는 것으로 나타났다.

Diego Martinez / Pexels
2608.24882v1

의도로서의 잠재 행동이 World Action Models의 효율적인 미래 상상을 가능하게 함

Latent Action as Intention Enables Efficient Future Imagination for World Action Models

Xiang Li, Yupeng Zheng, Songen Gu, Huailiang Ma, Feng Yu 외 8명

세계행동모델(WAM, World Action Model)은 로봇 제어 성능을 높이지만 테스트 시 미래 관측을 생성하는 과정에서 상당한 지연이 발생한다. 이 논문은 미래 관측 생성 없이 효율적인 미래 상상을 가능하게 하는 WAM 아키텍처 LAWA를 제안한다. LAWA는 액션 없는(action-free) 사전 학습으로 강화된 이산 토크나이저(discrete tokenizer)를 통해 조작 중심 코드북 목표를 생성하고, 연속 잠재 상태(latent state)와 실행 가능한 행동 청크(action chunk)를 동시에 디노이징하며 추론 시 미래 비디오 분기를 생략한다. RoboCasa 벤치마크에서 퓨샷 및 전체 데이터 설정 기준 평균 성공률 65.6%와 80.8%를 달성하여 Fast-WAM 기준선 대비 각각 9.6포인트, 4.5포인트 향상되었다. 또한 Joint-WAM 대비 추론 지연을 42.9% 낮추면서 동등한 성능 수준을 유지하며, LIBERO-Plus 제로샷 및 실환경 과제에서도 경쟁력 있는 결과를 보인다.