본문으로 건너뛰기

PAPERS

논문 트래커

arXiv cs.RO 신규 논문을 매일 수집해 한국어 요약을 붙입니다. 학회 채택 정보는 저자 코멘트에서 자동으로 추출합니다.

473건학회 채택 2건
Stanley Masinde / Unsplash
2609.40165v1

PrefPI: 분포 외 행동으로의 선호도 기반 유도

PrefPI: Preference-Guided Steering into Out-of-Distribution Behaviors

Seungeun Rho, Wontaek Kim, Danfei Xu, Sehoon Ha

PrefPI(Preference-Guided Policy Iteration)는 사전학습된 생성형 로봇 정책을 자체 생성 궤적에 대한 상대적 선호도만으로 조정하는 반복 프레임워크다. 기존 선호도 학습 방법이 이미 정책에 표현된 행동 모드를 강화하는 데 집중했다면, PrefPI는 초기 정책에서 거의 관찰되지 않는 분포 외(out-of-distribution) 행동 영역으로 유도하는 것을 목표로 한다. 선호 궤적을 조건부 분포로 정의하고, 분류자 없는 유도(CFG, classifier-free guidance)로 암묵적 선호 신호를 증폭하는 선호 조건부 생성 모델링으로 문제를 재구성한다. 확산 정책(diffusion policy)과 PI0.5 흐름 매칭(flow-matching) 시각-언어-행동 모델(VLA)에 적용한 실험에서 시뮬레이션과 실기 환경 모두 제한된 피드백으로 유의미한 행동 변화를 달성한다. 실기 실험에서는 선호도 레이블 궤적 150개만으로 물체 이송 높이가 10.7 cm에서 19.8 cm로 증가하는 결과를 보였다.

Kindel Media / Pexels
2609.40158v1

소셜 로봇 복도 내비게이션에서의 가독성(Legibility) 재고: 의도 표현 방식과 인간 주의 분산의 영향

Rethinking Legibility in Social Robot Hallway Navigation: Impact of Intent Representation and Human Distraction

Pranav Goyal, Andrew Stratton, Christoforos Mavrogiannis

가독성(legibility)이란 관찰자가 로봇의 의도를 확신 있게 추론할 수 있도록 하는 로봇 동작의 속성이다. 이 연구는 복도 내비게이션 시나리오에서 모델 예측 제어(MPC) 프레임워크 안에 두 가지 가독성 공식화를 구현하고 두 건의 통제 사용자 연구를 통해 비교했다. 연구 1(N=45)에서 적응적으로 갱신되는 통과 방향 기반 가독성은 목적지 기반 및 비가독성 기준 조건에 비해 더 부드러운 보행자 움직임을 이끌어냈고, 더 유능하며 정신적·신체적 부담이 적다고 평가받았다. 연구 2(N=45)에서는 보행자의 주의가 분산된 상황에서도 가독성 있는 동작이 부드러운 인간 움직임을 유지했으나, 이 효과가 주관적 평가에는 일관되게 반영되지 않았다. 두 연구의 결과는 상호작용 수준의 의도 표현이 소셜 내비게이션의 가독성 생성에 유효하며, 주의 분산 상황에서도 일부 효과가 지속됨을 시사한다.

Brecht Corbeel / Unsplash
2609.40153v1

Dream4ACT: 다중 신체 비디오-행동 모델링을 위한 공유 시각 행동 인터페이스

Dream4ACT: A Shared Visual Action Interface for Multi-Embodiment Video-Action Modeling

Xiangyu Zhu, Jin Xu, Yue Guo, Xin Wu, Yifan Sun 외 4명

Dream4ACT는 다양한 로봇 신체(embodiment)에 걸쳐 비디오-행동 공동 모델링을 수행하는 월드 모델이다. 행동 표현을 통일하기 위해 URDF 기반 순기구학(forward kinematics)으로 4개의 가상 카메라에서 목표 관절 구성을 렌더링하는 '행동 뷰(action views)'라는 공유 시각 행동 인터페이스를 도입한다. 이 시각적 표현은 신체별 관절 기하학을 보존하면서 관측·행동 시퀀스가 비디오 오토인코더와 확산 트랜스포머(diffusion transformer)를 공유할 수 있게 한다. 마스크 플로우 매칭(masked flow-matching)을 적용해 단일 공동 훈련 모델 안에서 순방향 다이나믹스, 역방향 다이나믹스, 관측-행동 공동 생성을 모두 지원한다. RoboTwin 2.0에서 평균 성공률 88.98%, TriWorldBench에서 전체 점수 65.66을 기록했다.

Egor Myznik / Unsplash
2609.40137v1

셀프 플레이를 통한 플레이어블 에이전트 제어를 위한 Game-Guided Skill Discovery

Game-Guided Skill Discovery through Self-Play for Playable Agent Control

Seungeun Rho, Jeonghwan Kim, Xue Bin Peng, Sehoon Ha

GGSD(게임 가이드 스킬 발견, Game-Guided Skill Discovery)는 게임 내 셀프 플레이(self-play)를 활용해 인간이 직접 조작 가능한 모터 스킬을 자동으로 학습하는 프레임워크다. 계층적 에이전트가 과거의 자신과 경쟁하는 과정에서 상위 정책은 소수의 이산형 스킬 집합을 선택하고, 스킬 조건부 하위 정책이 해당 행동을 학습한다. 훈련 후 인간이 상위 정책을 대체해 동일한 이산 스킬로 에이전트를 직접 조작할 수 있으며, 스킬 전환 시 개별 원시 행동을 넘어서는 콤보 행동이 자연스럽게 출현한다. Ant, Franka-arm, Unitree G1 환경에서 실험한 결과, 추가 학습 없이 Maze·CubePush 등 미지의 과제를 인간이 스킬 조합으로 해결할 수 있었다.

Yaroslav Shuraev / Pexels
2609.40134v1

촉각 호기심이 이끄는 로봇 상호작용

Tactile Curiosity Drives Robot Interaction

Klemens Iten, Alexander Proshkin, Bhavya Sukhija, Stelian Coros, Andreas Krause 외 2명

강화학습(RL) 기반 로봇 조작 학습은 무작위 행동 탐색에 의존해 샘플 효율이 낮으며, 에이전트가 접촉이 발생하는 구간보다 자유 공간 움직임에 훈련 예산을 낭비하는 문제가 있다. 기존 내재적 동기(intrinsic motivation) 방법들은 모델 불일치나 인식론적 불확실성(epistemic uncertainty)을 활용하지만, 기능적으로 무관한 전환에서도 불확실성 보상이 발생하는 한계를 갖는다. 이 논문은 TacEx 프레임워크를 제안하며, 모델 불확실성을 감각 양식별로 분해해 탐색 호기심을 촉각 채널에 집중시킨다. TacEx는 태스크 보상이나 전문가 시연 없이 로봇이 복잡한 접촉 역학을 발견하고 물체를 조작·파지하는 정책을 학습하도록 유도하며, 탐색 중 수집된 데이터를 활용해 픽앤플레이스(pick-and-place) 정책을 오프라인으로 학습할 수 있다. 나아가 촉각 피드백 없이 사전 학습된 시각-언어-행동 모델(VLA)에 TacEx로 사후 훈련을 적용했을 때 샘플 효율을 유지하면서 성능이 향상되었다고 저자들은 보고한다.

2H Media / Unsplash
2609.38178v1

자율 로봇 정책 향상을 위한 Skill-Space Shooting

Skill-Space Shooting for Autonomous Robot Policy Improvement

Zihang Rui, Renhao Wang, Haoxu Huang, Yang Gao

로봇이 배포 이후 새로운 상황이나 실패를 마주쳤을 때 인간의 추가 시연 없이 스스로 정책을 개선할 수 있는 방법을 다룬다. 이 연구는 재사용 가능한 짧은 행동 단위인 스킬(skill)이 여러 태스크에 걸쳐 반복 등장하며 파운데이션 모델(foundation model)이 장면으로부터 추론할 수 있다는 점에 착안한다. 제안하는 Skill-Space Shooting은 파운데이션 모델의 안내로 스킬 공간을 탐색해 교정 시도를 생성하고, 성공한 시도를 정책 개선을 위한 학습 데이터로 변환한다. 실세계 실험에서 자율 동작하는 정책이 반복적으로 개선되는 결과가 나타났으며, 스킬을 태스크 간에 공유함으로써 새 태스크 학습에 필요한 교시 데이터를 줄일 수 있음을 확인했다.

Nguyen Dang Hoang Nhu / Unsplash
2609.38173v1

In-context Robot Learning Made Simple: 조작 과제를 위한 재현 가능한 ICL 방법론

In-context Robot Learning Made Simple: A Democratized Recipe for Manipulation Tasks

Minxing Li, Minghao Han, Weizhi Zhao, Hanwen Wang, Xiangshuo Liu 외 8명

로봇 인컨텍스트 학습(ICL, in-context robot learning)은 시각적 시연으로부터 로봇이 과제를 추론·실행하는 패러다임이나, 시연 영상이 행동 궤적·객체 의미론·조작 어포던스(affordance)·공간 관계·과제 목표를 동시에 담아 로봇이 무엇을 따라야 하는지 불분명하다는 근본적 문제가 있었다. 이 논문은 로봇 ICL의 학습 목표를 명시적으로 정의해 프롬프트 모호성을 해소하는 문제 정의를 처음으로 제시한다. 이를 바탕으로 시각 프롬프트 인코더와 저비용 데이터 수집 프로토콜로 구성된 최소주의 재현 가능 프레임워크 SimpleICL을 개발하였으며, 대규모 사전학습이나 전용 데이터 인프라 없이 시뮬레이션과 실제 환경 모두에서 성능을 확인했다. 실험을 통해 행동·의미·구성·어포던스 구분 등 로봇 ICL의 핵심 특성도 분석하였으며, 데이터와 학습 파이프라인 전체를 공개할 예정이다.

Steve A Johnson / Pexels
2609.38172v1CoRL

반사실적 비디오 생성을 통한 확장 가능한 휴머노이드 이동-조작 학습

Counterfactual Video Generation Enables Scalable Humanoid Loco-Manipulation

Zihan Wang, Zhen Wu, Pieter Abbeel, Rocky Duan, Jitendra Malik 외 4명

본 논문은 소수의 실제 영상만으로 대규모 다양한 훈련 데이터를 구축하는 real-to-sim-to-real 프레임워크 PRISM을 제안한다. PRISM은 비디오-투-비디오(V2V) 생성 모델을 활용해 소수의 예시 영상으로부터 수백 개의 '반사실적(counterfactual)' 인간-물체 상호작용 영상을 생성한다. 접촉 앵커 기반(contact-anchored) real-to-sim 파이프라인이 이 영상들로부터 인간과 물체의 움직임을 재구성하고, 물리적으로 타당한 궤적으로 변환한다. 반사실적 영상 간 클래스 내 다양성 덕분에 단일 정책(policy)이 학습 중 보지 못한 물체에도 범주 내에서 일반화할 수 있다. 실제 로봇에 별도의 실세계 파인튜닝 없이 배포되었으며, 온보드 깊이(depth) 센서만을 사용해 박스·배럴·빈·공 등 다양한 물체를 집고 운반하고 내려놓는 동작을 수행하였다.

Kindel Media / Pexels
2609.38164v1

Rho: 효율적으로 적응 가능한 VLA 모델의 기반

Rho: A Foundation for Efficiently Adaptable VLA Models

Rho Team, Simran Bagaria, Daphne Chen, Dean Fortier, Jianlong Fu 외 9명

Rho는 양팔 조작(bimanual manipulation)을 위한 오픈 웨이트 시각-언어-행동 모델(VLA) 패밀리로, YAM Box, UR AI Trainer, FR3 Duo 세 가지 로봇 구현체에서 소량의 데이터로 작업 적응을 지원한다. 액션 전문가(action-expert) 아키텍처와 학습 방식을 체계적으로 비교 실험한 결과, 구현체 중간학습(embodiment midtraining)이 하류 작업 적응 성능을 향상시키는 것이 시뮬레이션 및 실제 로봇 실험에서 확인됐다. 각 구현체용 Rho 변형은 평가된 과제와 기준 모델 전반에 걸쳐 기존 오픈 웨이트 VLA들과 동등하거나 높은 성능을 나타냈다. 온라인 적응 기능으로는 내부 잠재 정책(latent policy)이 수정 피드백에서 학습해 동결된 플로우-매칭(flow-matching) 액션 전문가의 관측 조건부 노이즈 입력을 선택하며, 15회의 수정 에피소드만으로도 오프라인 파인튜닝 분포 외곽의 상황에 적응할 수 있다. 기반 모델과 구현체별 체크포인트를 공개해 연구 및 산업 현장 활용을 지원한다.

Brett Jordan / Unsplash
2609.38163v1

월드-액션 모델링을 위한 표현 공간 재고찰

Rethinking Representations for World-Action Modeling

Haoyi Jiang, Liu Liu, Xinjiang Wang, Zhihao Sun, Zequn Chen 외 10명

월드-액션 모델(world-action model)은 로봇 정책 학습과 미래 관측 예측을 동시에 수행하며, 표현 공간(representation space)이 제어와 예측 사이의 인터페이스 역할을 한다. 제어 비교 실험을 통해 재구성 충실도나 사전 학습된 지각 특징 단독으로는 효과적인 정책 학습이 보장되지 않음을 확인했다. 이를 바탕으로 사전 학습된 DINO 특징 기반의 표현 중심 모델 ReWAM을 제안하며, 특징 보정(Feature Calibration)과 시간적 표현 병목(Temporal Representation Bottleneck)을 통해 동역학 모델링에 적합한 압축 세계 상태를 구성한다. 행동-기반 표현 형성(Action-Grounded Representation Shaping)은 행동 손실 기울기만 병목으로 전달하여, 정책이 표현의 내용을 결정하고 세계 모델이 그 변화 방식을 학습하도록 역할을 분리한다. 생성적 비디오 사전 학습 없이 RoboTwin 2.0에서 93.6% 성공률을, 약 600시간 구현 사전 학습 데이터로 RoboDojo에서 평균 점수 12.29·성공률 8.28%를 달성했다.

FOX ^.ᆽ.^= ∫ / Pexels
2609.38133v1

분리형 생성 가이던스를 활용한 다중 에이전트 플로우 매칭

Multi-Agent Flow Matching with Decoupled Generative Guidance

Ruoyu Lin, Magnus Egerstedt, Fabio Pasqualetti

생성 모델은 복잡한 분포에서 다양한 객체를 생성하는 데 널리 쓰이지만, 생성 결과가 하드 제약 조건을 충족한다는 보장이 일반적으로 존재하지 않는다. 이 논문은 다중 에이전트 생성 환경에서 분리형 생성 가이던스를 적용하는 프레임워크 DeGG-Flow를 제안한다. 플로우 매칭(flow matching) 생성 과정을 제어-아핀(control-affine) 동역학 시스템으로 표현하여, 여러 에이전트가 공유하는 요구 조건과 이웃 에이전트에 의존하는 개별 에이전트의 요구 조건 각각에 대한 가이던스 조건을 도출하고, 실현 가능성 조건과 유한 구간 수렴 보장을 수립한다. 가이던스로 인한 분포 편차를 특성화하는 바서스타인(Wasserstein) 경계도 함께 유도한다. 다중 로봇 협동을 통한 공간 간격 횡단 및 어포던스(affordance) 조건이 부과된 다중 객체 장면 생성 과제에서 검증하며, 학습 중 보지 못한 팀 규모에서도 모든 하드 제약 조건을 충족하는 결과를 생성한다.

DANIEL HAY / Unsplash
2609.38105v1

FORM: 직접적 재료 법칙 식별을 통한 로봇 조작

FORM: Robot Manipulation through Direct Material Law Identification

Stepan Tretiakov, Ruihan Zhao, Cheng-Hsi Hsiao, Xingjian Li, Adam Thorpe 외 4명

FORM(From Observed Response to Material laws)은 변형 가능한(deformable) 물체와의 단 한 번의 상호작용만으로 재료의 물리적 특성을 식별하고, 식별된 모델을 새로운 동작 및 형상에 재사용해 조작 계획을 수립하는 방법론을 제시한다. 약형식 운동량 균형(weak-form momentum balance)을 이용해 관측된 물체 운동과 접촉력을 재료 파라미터에 관한 선형 방정식으로 변환하며, 순방향 시뮬레이터와 동일한 물질점법(Material Point Method, MPM) 이산화 구조로 조립해 선형 최소자승법으로 직접 풀 수 있다. 그 결과 반복적 기저선 대비 식별 시간이 약 10~25분에서 2~5초로 단축됐으며, 새로운 동작·초기 조건·형상에서의 예측 정확도는 기저선과 동등한 수준으로 보고됐다. 시뮬레이션 및 실기(hardware) 환경에서 탄성 막대 삽입, 탄성 클럽 골프 퍼팅, 탄소성체(elastoplastic) 성형, 목표 체적 붓기 등 네 가지 조작 과제로 검증했다. 탄성 특성은 3.4%, 탄소성 특성은 2% 이내의 오차로 추정하며, 반죽 성형에서 72.4~77.8% IoU, 붓기 과제에서 평균 3.8 mL 오차를 기록했다.

Enchanted Tools / Unsplash
2609.38087v1

CrossBFM: 휴머노이드 구현체 간 공유 잠재 행동 공간 증류

CrossBFM: Distilling a Shared Latent Behavior Space Across Humanoid Embodiments

Tan-Dzung Do, Tuan Dat Phuong, Nico Bohlinger, Cuc T. Trinh, Siwei Ju 외 4명

CrossBFM은 행동 기반 모델(BFM, Behavior Foundation Model)의 잠재 행동 공간을 여러 휴머노이드 구현체에 공유·전이 가능하도록 증류하는 방법이다. 기존 Forward-Backward 표현 방식은 단일 로봇 훈련에 수백 GPU-시간이 필요하고 로봇마다 별개의 공간을 생성해 이식성이 없었으나, CrossBFM은 로봇 특화 파라미터가 없는 통합 인코더로 이를 해결한다. 인코더 학습은 1 GPU-시간 미만, 이후 잠재-조건부(latent-conditioned) 추적기의 PPO 훈련에 추가 10 GPU-시간이 소요된다. 세 종류의 휴머노이드에서 동작 추적·자세 도달·보상 최적화(41개 프롬프트) 세 가지 프롬프팅 모드가 모두 전이되었으며, 동작 추적 오차는 관절-조건부 대비 0.025 rad에 그쳤다. 훈련에 포함되지 않은 로봇에 대한 평가에서 학습된 로봇 추적 성능의 최대 89%를 회복하였고, 실제 로봇에서도 세 가지 모드가 검증되었다.

Rafael Minguet Delgado / Pexels
2609.38078v1

MotorMind: 제로샷 로봇 조작을 위한 범용 시각-언어 모델 스캐폴딩

MotorMind: Scaffolding General Vision Language Models for Zero-Shot Robot Manipulation

Bingxuan Li, Siqi Song, Yizhuo Wu, Jiarui Yao, Tong Zhang 외 1명

MotorMind는 범용 시각-언어 모델(VLM)을 로봇 조작에 직접 연결하는 실행 프레임워크로, 작업별 정책 학습·코딩 에이전트·SAM3 등 외부 모델 없이 관찰→행동→피드백 루프를 비동기적으로 처리한다. LIBERO-PRO 시뮬레이션 벤치마크에서 기존 제로샷(zero-shot) 방법들이 최대 13.3% 성공률을 기록한 반면, MotorMind는 66.7%를 달성하고 외란(perturbation) 조건에서도 53.8%를 나타냈다. 실기 환경인 xArm6 로봇에서는 직접 조작 및 인간 외란 설정 전반에 걸쳐 평균 95% 성공률을 기록했다. VLM 백본을 교체할수록 성능이 개선되고 시각적 그라운딩·체화 추론 관련 실패 사례가 감소하는 경향이 확인됐다.

Bernd 📷 Dittrich / Unsplash
2609.38059v1

WorldLine: 로봇 조작을 위한 행동 기반 시각 시뮬레이션

WorldLine: Action-Driven Visual Simulation for Robotic Manipulation

Shenghe Zheng, Wenbo Li, Jiyao Zhang, Bin Xia, Haoyang Huang 외 2명

WorldLine은 로봇 조작(manipulation)을 위한 행동 기반 시각 시뮬레이터(visual simulator)로, 전이 가능한 동역학 학습과 이기종 행동 기반화(action grounding)를 분리하는 구조를 채택한다. 행동 정보가 없는 로봇 영상 1만 시간 이상으로 조작 동역학을 학습하고, 10개 이상의 embodiment에서 수집한 2,000시간 이상의 행동 궤적으로 행동을 연결한다. 이미지 공간 행동 표현(image-space action representation)을 공통 제어 인터페이스로 사용해 제어 공간이 다른 로봇 간 호환성을 확보한다. 실패 궤적에서 로봇 마스크 IoU를 가장 강력한 기준선 대비 0.1626 향상시키며, RoboTwin과 AgiBot에서 궤적 성공 예측 정확도 74%를 기록했다. RoboTwin 학습 없이도 직접 정책 실행 대비 태스크 성공률을 최대 21.4 퍼센트포인트 향상시킨다.

Growtika / Unsplash
2609.38057v1

EVO-WAM: 비디오-행동 검증을 통한 월드 액션 모델 진화

EVO-WAM: Evolving World Action Models through Video-Action Verification

Shiyang Zhou, Xionghao Wu, Wenbo Li, Shenghe Zheng, Jiyao Zhang 외 9명

EVO-WAM은 추가적인 전문가 시연 데이터 없이 월드 액션 모델(WAM, World Action Model)을 새로운 과제에 적응시키는 프레임워크다. 외부 환경 실행 없이 모델이 자체 생성한 비디오-행동 궤적에서 학습하며, 상태 예측과 앵커드 다중 프레임 컨텍스트를 추가해 자기회귀 롤아웃을 수행한다. 시각-언어 모델(VLM)로 과제 완료 여부를 판단하고 역동역학 모델(inverse dynamics model)로 비디오-행동 일관성을 검증해 신뢰 가능한 훈련 데이터를 선별한다. RoboTwin 2.0의 7가지 미관찰 과제에서 Cosmos3의 평균 성공률이 26.9%에서 68.0%로, DreamZero는 28.5%에서 46.4%로 향상되었다. 실제 환경의 장기 복합 과제 3가지에서도 Cosmos3의 성공률이 20.0%에서 76.7%로 56.7%포인트 상승했다.

You Le / Unsplash
2609.38054v1

Pow3R-SLAM: 3D 재구성 사전 정보를 활용한 실시간 RGB-D SLAM

Pow3R-SLAM: Real-Time RGB-D SLAM with 3D Reconstruction Priors

Christopher Kolios, Ishaan Mehta, Sasa Janjic, Yeganeh Bahoo, Sajad Saeedi

Pow3R-SLAM은 Pow3R를 기반으로 추적과 지도작성을 수행하는 실시간 RGB-D 동시 위치추정 및 지도작성(SLAM) 시스템이다. 단안 SLAM 연구인 MASt3R-SLAM에서 착안하였으며, 깊이(depth) 정보를 기하학적 융합 대상이 아닌 네트워크 예측의 사전 정보(prior)로 활용해 깊이 이미지의 희소성 문제를 완화한다. TUM, 7-Scenes, Replica 데이터셋 24개 시퀀스에서 MASt3R-SLAM 대비 벽시계 실행 속도 1.6배, 평균 궤적 오차 15% 감소, 비스케일 오차 3.1배 감소, Chamfer 거리 30% 감소로 나타났다. 하이브리드 변형은 초당 25.3 프레임(FPS)으로 MASt3R-SLAM보다 2.1배 빠르게 동작하면서도 추적·지도 정확도를 유지한다. ORB-SLAM3의 RGB-D 모드와 비교해서도 TUM, 7-Scenes, ETH3D-SLAM에서 더 높은 정확도를 보이며, 논문 수락 시 코드를 오픈소스로 공개할 예정이다.

ZMorph All-in-One 3D Printers / Unsplash
2609.38048v1ICRA

검증 가능한 상태 추정을 위한 QCQP 표현 가능 IMU 사전 적분 인자

A QCQP-Representable IMU Pre-Integration Factor for Certifiable State Estimation

Utkarsh Rai, Zhexin Xu, Bang-Shien Chen, David Rosen

관성 측정 장치(IMU) 사전 적분(pre-integration)을 검증 가능 추정(certifiable estimation)에 직접 통합하는 QCQP(이차 제약 이차 계획법, Quadratically Constrained Quadratic Programming) 표현 가능 인자를 제안한다. 기존 IMU 사전 적분은 지수 사상(exponential map)에 의존해 정확한 다항식 표현이 불가능한 반면, 이 연구는 케일리 사상(Cayley map)을 이용해 대수적 구조 요건을 충족시킨다. 반정치 계획법(SDP, Semidefinite Programming) 완화가 느슨해지는 문제는 QCQP 보조 리프팅 변수에 대한 중복 제약 조건을 명시적으로 추가해 해결한다. 제안된 인자를 GNSS-IMU 스무딩에 적용하고 합성 및 실세계 데이터로 평가한 결과, 완화가 충분히 조밀(tight)하며 추정 문제가 검증된 전역 최적해로 수렴함을 확인한다.

Mikhail Nilov / Pexels
2609.38046v1

EgoAlign: 장거리 이동 조작을 위한 인간-휴머노이드 격차 해소

EgoAlign: Bridging the Human-Humanoid Gap for Long-Range Loco-Manipulation

Yiming Jiang, Chen Jin, Chongyang Xu, Yilun Chen, Aimin Hao 외 1명

EgoAlign은 자아중심(egocentric) 인간 시연을 휴머노이드 로봇의 훈련 감독 신호로 변환하는 데이터 구성 프레임워크이다. 실제 로봇 시연 수집 없이, 목표 로봇 모델과 시뮬레이터를 활용해 시연 수집 단계부터 실행 피드백을 제공하여 신체 크기 차이와 컨트롤러 응답 차이를 보정한다. 스케일 정렬과 컨트롤러-인-더-루프(controller-in-the-loop) 정제를 통해 상체 상호작용 기하학을 조정하고, 인과적 재현(causal replay)으로 해당 로봇 상태와 모션 토큰 레이블을 재구성한다. 적응된 인간 시연만으로 미세 조정된 시각-언어-행동 모델(VLA)을 물리 휴머노이드에 제로샷(zero-shot) 배포하여 장거리 물체 이동, 미지 목표 위치 탐색, 발 상호작용 과제를 수행하였다. 운동학적 정렬만 적용한 경우보다 정제 과정을 거쳤을 때 시뮬레이션 손 정렬과 실제 픽업 성공률이 향상되었고, 원격조작 대비 현장 수집 시간도 단축되었다.

Acres of Film / Pexels
2609.38028v1

doPlan: 자율주행의 다단계 언어 조건부 계획을 위한 가변 지평 데이터셋

doPlan: A Variable-Horizon Dataset for Multi-Stage Language-Conditioned Planning in Autonomous Driving

Parthib Roy, Yash Tandon, Marcus Blennemann, Giovanni Tapia Lopez, Angel Martinez-Sanchez 외 2명

doPlan은 자율주행 차량과 승객 간 자연어 상호작용에서 다단계·장기적 승객 의도를 연구하기 위해 설계된 실세계 인간 주석(annotation) 데이터셋이다. nuPlan을 기반으로 구축되었으며, 5,154개의 인간 작성 승객 지시문과 50.9시간의 고유 주행 데이터(누적 169.1시간의 지시 정렬 문맥)를 포함한다. 주석 윈도우는 30.0초에서 508.8초 범위이며, 즉각적·지연된·이벤트 조건부·지속적·다단계 승객 의도를 망라한다. 언어 조건부 주행 모델 4종을 평가한 결과, 승객 언어 민감도가 요청 방향에 부합하는 실제 행동으로 안정적으로 이어지지 않는 것으로 나타났다. 미래 조작(maneuver)이 매칭된 2,161개 예시에서 첫 번째 조작은 평가 시점 기준 중앙값 24.6초 이후에 발생하며, 모델의 일반적인 5초 예측 지평(prediction horizon) 내에서 발생하는 비율은 9.8%에 불과하다.