본문으로 건너뛰기

PAPERS

논문 트래커

arXiv cs.RO 신규 논문을 매일 수집해 한국어 요약을 붙입니다. 학회 채택 정보는 저자 코멘트에서 자동으로 추출합니다.

473건
MART PRODUCTION / Pexels
2609.31434v1

ExoLaN: 외골격을 위한 물리 일관성 문맥 인식 동역학 학습

ExoLaN: Physics-Consistent Context-Aware Dynamics Learning for Exoskeletons

Lucas Schulze, Maximilian Schwarz, Jona Hoppe, Jan Peters, Oleg Arenz

ExoLaN은 인간-외골격(exoskeleton) 상호작용에서 결합 시스템 전체의 동역학을 학습하는 문맥 인식(context-aware) 심층 라그랑지안 네트워크(Deep Lagrangian Network, DeLaN) 기반 모델이다. 기존 물리 일관성 방법은 특정 사용자에게 재학습 없이 적응하지 못하고 보행 중 간헐적 접촉도 처리하지 못했으나, ExoLaN은 시간적 문맥과 힘 감지 인솔(force-sensitive insoles)의 부분 접촉력 측정값을 결합해 잠재 동역학 임베딩(latent dynamics embedding)을 추론하고 일반화된 접촉 토크를 추정한다. 7명의 미경험 사용자가 21가지 미경험 과제를 수행한 실험에서 블랙박스 기준 모델 대비 토크 추정 MSE를 7% 줄였다. 다단계 예측 손실(multi-step prediction loss)로 학습하면 가속도 MSE가 59% 감소하고, 장기 위치·속도 오차가 각각 60%·93% 줄어든다. 학습된 잠재 문맥은 명시적 과제 레이블 없이도 과제 정보를 포착해 과제 인식(task-aware) 보조 제어 신호로 활용 가능하다.

Erik Mclean / Pexels
2609.31418v1

CognitiveReality: 몰입형 협업 VR 원격조작을 위한 LLM 에이전트 기반 로봇 무관 시맨틱 가우시안 매핑

CognitiveReality: Robot-Agnostic Semantic Gaussian Mapping with an LLM Agent for Immersive Collaborative VR Teleoperation

Timofei Kozlov, Dmitrii Maliukov, Andrey Marchenko, Dmitrii Plotnikov, Miguel Altamirano Cabrera 외 1명

CognitiveReality는 로봇의 RGB-D 스트림을 실시간 시맨틱 Gaussian-TSDF 맵으로 변환해 VR 운영자와 언어 에이전트가 공유하는 원격조작(teleoperation) 시스템이다. 단일 매퍼 바이너리가 SLAM 포즈·관절 기구학·모션 캡처 등 다양한 위치 추정 소스를 수용하며, SLAM 신호 단절 시 shadow tracker와 키프레임 기반 PnP(Perspective-n-Point)로 1~8 cm 이내 자세 오차를 유지한다. 오픈 어휘(open-vocabulary) 인스턴스 정체성을 2 Hz로 갱신하고, 운영자의 음성·컨트롤러 레이를 장면 내 영속 객체에 연계해 로봇 행동 명령을 확인 절차를 거쳐 실행한다. 에이전트 평가에서 로컬 배포된 Qwen3-VL-8B 라우터는 도구 정확 매칭(tool exact match) 81.24%를 기록했으며, Gaussian+SDF 베이스라인 대비 2~8 dB 개선을 나타냈다. 두 대의 사족보행 로봇에 실배포해 탐색 요청 30건 중 26건, 재관측 요청 20건 전부를 수행하고 객체 품질을 2~5 dB 향상시켰다.

Kindel Media / Pexels
2609.31412v1

dRVG: 미지 환경에서 다각형 로봇을 위한 쿼드트리 기반 해상도-완전 온라인 모션 플래닝

dRVG: Quadtree-Guided, Resolution-Complete Online Motion Planning for Polygonal Robots in Unknown Environments

Duo Zhang, Hechen Zhang, Junshan Huang, Jingjin Yu

dRVG(dynamic rotation-stacked visibility graph)는 초기 미지의 정적 환경에서 다각형 로봇을 목표 지점까지 안내하는 온라인 모션 플래너(motion planner)이다. 연속 관측으로 얻은 국소 로드맵(local roadmap)을 병합해 균일 위치 격자 없이 충돌 없는 이동 및 회전 경로를 계획한다. 공간 쿼드트리(quadtree)로 감지 목표를 영역별로 분산 배치하여 반복 방문을 줄이면서 모든 방향 설정을 경로 탐색에 유지한다. 정확한 감지·기하 계산 및 별 모양(star-shaped) 로봇 가정 하에서 동일 각도 해상도의 전체 맵 RVG 대비 해상도-완전성(resolution-completeness)이 이론적으로 보장된다. 실험에서 20개 맵·7개 각도 해상도의 140개 사례를 20초 예산 내에 전부 해결하였으며, 360 방향 레이어 기준 중앙값 계획 시간은 1.18초로 나타났다.

Eduardo Rosas / Pexels
2609.31396v1

인간-로봇 협업을 위한 증강현실 인터페이스: ROS 2 기반 센서 스트리밍 프레임워크 개발 및 SLAM 알고리즘을 통한 검증

Augmented Reality Interfaces for Human-Robot Collaboration: Development of a ROS 2-Based Sensor Streaming Framework and Validation via SLAM Algorithms

Alessandro Rubert, Stefano Ghidoni, Matteo Terreran

이 연구는 Magic Leap 2 AR 헤드셋과 ROS 2(Robot Operating System) 생태계를 연결하는 센서 스트리밍 프레임워크를 개발했다. Unity 개발 환경과 ROSTCP-Connector 패키지를 사용해 헤드셋 탑재 애플리케이션을 구현했으며, 포즈 추적·카메라·환경 센서 데이터를 실시간으로 취득해 ROS 2 토픽에 게시한다. 프레임워크의 정확도, 지연 시간, 견고성은 기존 문헌에 알려진 SLAM(동시 위치추정 및 지도작성) 알고리즘을 활용한 실험으로 검증했다. 실험 결과, 제안된 아키텍처가 안정적인 데이터 전송을 보장하는 것으로 나타났으며, 복잡한 인간-로봇 협업(HRC) 환경에서 로봇 시스템 제어 및 감독을 위한 기반을 마련한다고 저자들은 밝혔다.

Zach M / Unsplash
2609.31394v1

InternW0-Δ: 예측 역학과 행동을 연결하는 월드 액션 모델 — 20K+ 시간 공개 데이터 활용

InternW0-Δ: A World Action Model Bridging Predictive Dynamics and Actions with 20K+ Hours of Open Data

Xingyu Miao, Zizun Li, Baole Fang, Kaiwen Song, Tenghui Wang 외 43명

세계 행동 모델(WAM, World Action Model)은 시각적 역학과 행동 생성을 함께 모델링하는 범용 로봇 조작 접근법이다. InternW0-Δ는 혼합 트랜스포머(MoT, Mixture-of-Transformers) 구조 안에서 사전학습된 비디오 전문가와 행동 전문가를 결합하며, 동결된 시각-언어 모델(VLM)의 의미론적 안내 아래 4D 기하·움직임 사전 지식을 학습 시 증류(distillation)로 주입한다. 새로 제안된 Causal Imprint 기법은 훈련 시에만 미래 감독 신호를 활용해 예측적 표현을 학습하며, 추론 시에는 미래 비디오 롤아웃 없이 행동 전문가에 직접 전달된다. 학습 코퍼스는 로봇 시연, UMI 데이터, 자기중심 인간 시연, Ego2Robot 데이터를 포함하는 이종 데이터셋으로 구성되며 처리된 규모는 20,000시간 이상이다. 시뮬레이션 벤치마크와 실제 로봇 플랫폼에서 기존 방법 대비 우수한 성능을 보였으며, 훈련 코드·모델 가중치·데이터 처리 파이프라인을 오픈소스로 공개할 예정이다.

HI! ESTUDIO / Unsplash
2609.31386v1

하중 적응형 중력 평형 메커니즘의 모델링 및 생성형 AI 기반 설계

Modeling and Generative-AI-Based Design of Load-Adaptive Gravity Balancing Mechanisms

Ryotaro Kayawake, Kazuki Abe, Shota Miyake, Masahiro Watanabe, Kenjiro Tadakuma

하중 적응형 중력 평형 메커니즘(LA-GBM)은 페이로드 변화에 수동적으로 반응하여 다양한 부하 조건을 수용하지만, 원하는 메커니즘 운동과 가변 페이로드 하의 정적 평형을 동시에 만족해야 해 설계가 어렵다. 이 연구는 특정 메커니즘 구조나 기계 요소에 의존하지 않는 일반적 LA-GBM 설계 방법론을 제안한다. LA-GBM의 포텐셜 에너지 필드 필요 조건을 정식화하고, 페이로드 질량 효과를 나타내는 아핀(affine) 형태와 하중 적응 및 중력 균형 상태 전이를 나타내는 인수분해(factorized) 형태 두 가지 일반 형식을 도출한다. 이 두 형식을 생성형 AI에 설계 요구사항으로 제공해 후보 포텐셜 함수를 생성하고, 생성된 함수는 두 형식과 유효 LA-GBM 조건에 대한 적합성을 해석적으로 검증한다. 검증된 포텐셜 함수는 개별 항으로 분해되며, 스프링·균형추·함수 생성 링크 메커니즘을 조합해 LA-GBM을 구성하는 예시를 제시한다.

Timo Wielink / Unsplash
2609.31383v1

끝점 제약 궤적 최적화를 활용한 종단간 주행 모델 개선

Guiding End-to-End Driving Models with Endpoint-Constrained Trajectory Optimization

Brayden Zhang, Mahsa Golchoubian, Igor Gilitschenski, Boris Ivanovic, Kashyap Chitta

종단간(end-to-end) 자율주행 정책은 개방 루프(open-loop) 행동 복제로 학습하지만 실제 차량에서는 폐쇄 루프(closed-loop)로 동작해 훈련·실행 간 괴리가 발생한다. 저자들은 이 괴리의 보완적 원인으로, 웨이포인트(waypoint) 기반 지도와 변위 지표가 중간 궤적의 물리적 정합성을 보장하지 못함을 제시한다. 이를 해결하기 위해 ECO(Endpoint-Constrained Optimization)를 제안하며, 지도·시뮬레이터 내부 상태·추가 학습 없이 예측된 끝점을 유지하면서 중간 웨이포인트를 재형성하는 경량 후처리 레이어로 구성된다. HUGSIM 벤치마크에서 ECO는 VaVAM의 HD-Score를 18.1에서 31.0으로 향상시켜 HUGSIM Closed-Loop Driving Challenge 1위를 달성했다. AlpaSim에서는 VaVAM과 DiffusionDrive의 장면 점수를 각각 123%, 22% 높였다.

Santhosh Kanthala / Pexels
2609.31374v1

RECAST: 로그 재생에서 뷰 완전 행위자를 활용한 폐루프 주행 시뮬레이션으로

RECAST: From Log Replay to Closed-Loop Driving Simulation with View-Complete Actors

Zijun Zhao, Liewen Liao, Kang Shen, Songan Zhang, Ming Yang

RECAST(REconstructing Controllable Actors for Simulation and Testing)는 3차원 가우시안 스플래팅(3D Gaussian Splatting) 기반 프레임워크로, 주행 로그의 단일 분할 차량 관측으로부터 뷰 완전(view-complete) 행위자를 생성해 재구성된 장면에 등록한다. 기존 데이터 기반 시뮬레이터는 희소한 관측으로 동적 행위자를 재구성하기 때문에 기록된 궤적을 벗어난 시점 변화에서 렌더링 아티팩트가 발생하는 한계가 있다. 실제 차량에 이미지-3D 사전 지식을 적응시키기 위해 약 2만 대의 실제 차량과 60만 장의 배경 없는 RGBA 이미지로 구성된 RECAR 데이터셋을 추가로 제시한다. 장면 수준에서 로그 궤적을 벗어난 행위자 이동 시, Street Gaussians 대비 FD_incep이 129.35에서 112.10으로 감소하고 CLIP_margin(×1000)이 0.14에서 3.47로 증가한다. 이미지 조건부 플래너 GTRS-Dense와의 폐루프 평가에서 무충돌(NC) 비율이 22.2%(12/54)에서 63.0%(34/54)로, 평균 최소 예측 충돌-여유 시간(TTC)이 0.798초에서 2.150초로 향상된다.

Reuben Hu / Unsplash
2609.31357v1

건설 메시 환경에서의 트랜스포머 기반 Monte Carlo Localization

Transformer-based Monte Carlo Localization in Construction Meshes

Linus Kramer, William Talbot, Olga Vysotska, Marco Hutter

건설 현장 이동 로봇의 전역 재위치 추정(global relocalization)을 위해 건물 메시(mesh) 기준 LiDAR 포즈 추정 시스템을 제안한다. PointNet++ 인코더와 장소 인식(place recognition) 디코더를 결합하고, 그 출력을 몬테카를로 위치추정(Monte Carlo Localization, MCL) 프레임워크의 학습된 관측 모델로 활용한다. 파이프라인은 건물 메시 내 센서 시뮬레이션으로 생성한 합성 LiDAR 스캔만으로 학습되며, 실제 센서 데이터는 학습에 사용되지 않는다. 불확실성 인식 디코더와 모델 가설 주입 방식의 재샘플링 전략을 통해 유사한 실내 구조·저텍스처 표면 환경에서의 파티클 고갈(particle depletion) 문제에 대응한다. 실세계 데이터셋 평가에서 확산 기반(diffusion-based) 및 ScanContext++ 베이스라인을 상회하며, 호출당 추론 시간 18 ms를 기록했다.

Erhan Astam / Unsplash
2609.31337v1

로봇 조작을 위한 표현 유도 기반 실행 프로그램 생성·통합

Representation-Guided Generation and Integration of Executable Programs for Robot Manipulation

Ruixiao Yang, Mingxin Yu, Chuchu Fan

RIVET는 시각-언어 모델(VLM) 코드 생성을 활용해 로봇 조작 시스템 전체를 자동으로 구성하는 프레임워크다. 객체별 6D 자세(pose)와 관계 그래프(relation graph)를 결합한 객체 중심 공유 표현을 기반으로, VLM이 인식·렌더링·관계 추론·계획 프로그램을 협조적으로 생성한다. 생성된 프로그램은 특정 조작 도메인에 대해 한 번만 작성되며, 새로운 시작·목표 구성에도 코드 재생성 없이 재사용된다. 시뮬레이션과 실제 로봇 환경에서 큐브 쌓기, 탱그램 재배치, 3차원 조립 세 가지 과제로 평가하였으며, 오프라인에서 생성된 시스템을 재사용한 실세계 실험에서 전체 성공률 83%를 기록했다.

A Chosen Soul / Unsplash
2609.30264v1

AD-WM: 반사실적 모델 예측 제어를 위한 행동 변별 월드 모델

AD-WM: Action-Discriminative World Models for Counterfactual Model Predictive Control

Jiabin Qiu, Zixuan Chen, Hongye Cao, Jieqi Shi, Jing Huo 외 1명

잠재 월드 모델(latent world model)은 사실적 전이 예측에 최적화될 경우 동일 상태에서 후보 행동을 변별하는 능력이 저하될 수 있다. AD-WM은 잔차 잠재 동역학과 역동역학(inverse dynamics) 기반 행동 복원 정규화를 결합한 행동 변별 조인트-임베딩 월드 모델로, 조건부 상호정보량(conditional mutual information)에서 동기를 얻은 정규화 목적함수를 사용한다. OGBench-Cube 벤치마크에서 하드-스타트 성공률이 LeWM 기준선 3.7%에서 52.0%로 향상되었으며, 5개 시뮬레이션 환경 중 4개에서 평균 성공률도 개선되었다. 동결된 V-JEPA 2 인코더와 DROID 사후 훈련(post-training)을 적용한 제로샷 전이 실험에서는 Franka 로봇 설정의 기본 픽앤플레이스 성공률이 42.2%에서 71.1%로 증가했다. 계획 진단 결과, 사실적 예측 오차와 전체 행동 순위는 폐루프(closed-loop) 성공 순서와 일치하지 않으며, CEM 정렬 엘리트 후회(CEM-aligned elite regret) 지표가 성공률과 더 밀접하게 연관된다.

Snapmaker 3D Printer / Unsplash
2609.30249v1

RAPID: 시연으로부터의 로봇 에이전틱 프로그래밍

RAPID: Robot Agentic Programming from Demonstrations

Yuyao Liu, Jiayuan Mao, David Hsu, Leslie Pack Kaelbling, Tomás Lozano-Pérez

RAPID는 단일 시각적 인간 시연 하나를 입력받아 로봇 프로그램을 자동으로 생성·검증·개선하는 시스템이다. 반복적 에이전틱 루프는 테스트 가능한 과제 명세, 행동 기본요소(action primitives), 프로그램 실행·검증 환경이라는 세 요소를 필요로 하며, RAPID는 이 모두를 시연으로부터 자동 추론한다. 시연 환경 밖에서의 재사용성을 위해 객체 중심 관계형 프로그램 표현(object-centric relational program representation)을 채택하여, 행동 기본요소를 궤적 최적화(trajectory optimization) 프로그램으로 기술하고 실행 시점의 장면 기하를 포착하는 관계적 제약으로 조합한다. 시뮬레이션에서 비파지 조작(nonprehensile manipulation) 8개 과제와 LIBERO-Pro 벤치마크를 평가했으며, 실제 Franka 로봇팔에도 배치하여 8개 비파지 과제를 모두 평가하였다. 실험 전반에서 물체의 자세·형상·재질·환경 변화에 대한 일반화 성능을 보였다.

Ahmed Asaker / Unsplash
2609.30247v1

Rolling-WAM: 롤링 상상을 활용한 월드 액션 모델

Rolling-WAM: World Action Models with Rolling Imagination

Yinghua Zhou, Junjie Ye, Yiqi Zhao, Hao Dong, Celina Shiyu Wang 외 6명

WAM(World Action Models)은 로봇 조작에서 행동 생성과 미래 시각 예측을 결합하는 방식이다. 기존 WAM은 매 재계획 주기마다 비디오-행동 공동 디노이징(denoising)을 처음부터 수행해야 해 지연이 발생하고 폐루프(closed-loop) 응답성이 저하된다. Rolling-WAM은 슬라이딩 윈도우(sliding window) 방식으로 비디오-행동 청크를 서로 다른 노이즈 수준으로 유지하며, 각 단계에서 임박한 행동 청크는 완전히 디노이징하고 원거리 미래 청크는 부분적으로만 정제한다. 이를 통해 연산 비용을 시간에 분산시키면서 청크 경계를 넘어 시각-행동 맥락을 유지한다. LIBERO, RoboTwin, 그리고 실제 Unitree G1 휴머노이드 실험에서 표준 WAM 대비 4.5배의 정상 상태 재계획 속도 향상을 달성했다고 연구팀은 보고한다.

Andrey Matveev / Pexels
2609.30233v1

일반화된 작업·동작 계획 문제를 위한 코딩 에이전트

Coding Agents for Generalized Task and Motion Planning Problems

Matteo Merler, Bowen Li, Josh Roy, Yichao Liang, Qianwei Wang 외 2명

작업·동작 계획(TAMP, Task and Motion Planning) 문제는 이산적 결정과 기하학·운동학·역학 제약이 긴밀히 결합되어 있어, 완전 관측 환경에서도 풀기 어렵다. 연구팀은 코딩 에이전트가 문제 인스턴스 전반에 일반화되는 프로그램을 자동 합성할 수 있는지 조사했다. Claude Code(Opus 5)와 Codex(GPT-5.6 Sol, GPT-6 Astra)를 KinDER 및 PDDLStream 벤치마크의 28개 시뮬레이션 환경에서 평가했으며, 총 980개 생성 프로그램을 각 100개 미공개 인스턴스에 적용해 98,000회 에피소드를 수행했다. 세 에이전트 구성 모두 수작업 설계 플래너(평균 성공률 47%)를 상회하는 56%~95%의 성공률을 기록했다. 물체 수가 증가해도 에이전트 프로그램은 플래너보다 높은 성공률을 유지하면서 인스턴스당 평균 계산량을 약 10배 줄이는 것으로 나타났다.

Enes Beydilli / Pexels
2609.30222v1

TrackEverything: 3D 장면 표현의 중복 제거를 통한 장기 밀집 포인트 추적

TrackEverything: Long Horizon Dense Tracking via De-Duplicating 3D Scene Representations

Ayush Jain, Sreeharsha Paruchuri, Ishita Gupta, Fan Zhang, Tanner Schmidt 외 3명

TrackEverything은 영상을 세계 좌표계의 3D 장면 트랙으로 표현해 희소(sparse) 장기 추적과 밀집(dense) 단기 추적 사이의 트레이드오프를 극복하는 포인트 추적기(point tracker)다. 슬라이딩 윈도우 경계에서 복셀화(voxelization) 기반 중복 제거 메커니즘으로 동일 표면의 반복 관측을 병합하고, 끝점 정제기와 경량 궤적 정제기로 추적을 분해해 동적 포인트에 대해서만 밀집 궤적을 디코딩한다. 4D 상관 볼륨을 대체하는 3D WAFT를 도입해 장면 포인트 클라우드에서 특징을 직접 샘플링함으로써 메모리 사용량을 낮춘다. TAPVid-3D 벤치마크에서 오픈소스 전 프레임 밀집 3D 추적기 대비 APD 기준 20% 이상 높은 성능을 저자들이 보고하며, 1000 프레임을 초과하는 영상에서 모든 가시 포인트를 40 GB GPU 메모리 내에 추적할 수 있다고 주장한다.

Emiliano Arano / Pexels
2609.30214v1

Underwater C3-JEPA: ROV 인양 작업을 위한 객체 중심 다시점 월드 모델

Underwater C3-JEPA: An Object-Centric Cross-View World Model for ROV Salvage

Yuncong Yang, Jinlong Li, Yulong Xue, Feng Wu, Chunwen Zhang 외 2명

Underwater C³-JEPA는 수중 ROV(원격조작 로봇)의 중량물 인양 작업을 위한 객체 중심 다시점 예측 월드 모델(world model)이다. 접촉 센서 없이 동기화된 다시점 RGB 영상과 로봇 제어 신호만으로 잠재 공간(latent space)에서 작업 대상 물체의 상태 변화를 예측한다. 다중 카메라 관측을 작업 객체 토큰과 맥락 토큰으로 인코딩하고, 헬드아웃-뷰 어텐션(held-out-view attention)으로 카메라 간 정보를 융합한 뒤 제어 신호에 조건부로 미래 상태를 직접 예측한다. SIGReg를 통해 기하학적 표현을 강화하며, 재구성 없는 잠재 베이스라인보다 다운스트림 프로브에 더 많은 과제 관련 정보를 전달하는 것으로 실험에서 나타났다. 실제 수중 영상 검증에서도 동일 아키텍처가 가려진 카메라의 객체 상태를 복원하는 성능을 보였다.

Kindel Media / Pexels
2609.30213v1

ReVAMP: 재매개변수화를 통한 기구학적 제약 시스템의 벡터 가속 모션 플래닝

ReVAMP: Vector-Accelerated Motion Planning for Kinematically-Constrained Systems via Reparameterization

Shrutheesh R. Iyer, Thomas Cohn, Zachary Kingston

로봇 모션 플래닝(motion planning)에서 말단 효과기(end-effector) 제약이 존재하면 유효한 배위 공간(configuration space)이 측도 0 부분집합으로 줄어들어, 샘플링 기반 알고리즘은 실행 가능한 샘플을 뽑기 위한 별도 수정이 필요하다. 이 논문은 해석적 역기구학(IK, Inverse Kinematics) 재매개변수화로 계획 공간을 변환하는 새로운 벡터화 축을 제안하며, 기존 투영 기반(projection-based) 벡터화 플래너의 비효율을 해소하고 병렬화 기회를 확장한다. ReVAMP는 최대 20차원 고차원 시스템에서 마이크로초~밀리초 수준의 계획 시간을 달성한다고 저자들이 보고한다. 저자들은 기존 최신 기법 대비 최대 10배 빠른 속도를 주장하며, 이러한 계획 속도가 순차적 조작(manipulation) 파이프라인 재구성에도 활용될 수 있음을 제시한다.

Brecht Corbeel / Unsplash
2609.30187v1

Ego-Exo4D Human Meshes Dataset: 자아중심·외부시점 영상의 4D 인체 동작 복원

Ego-Exo4D Human Meshes Dataset: 4D Human Motion Reconstruction for Ego-Exo Captures

Abhiram Maddukuri, Georgios Pavlakos

Ego-Exo4D는 자아중심(egocentric) 및 다시점 외부시점(exocentric) 영상을 동기화하여 제공하는 대규모 데이터셋으로, 기술 학습·평가, 절차적 활동 이해, 구현 AI(embodied AI) 연구에 사용된다. 그러나 기존 Ego-Exo4D에는 희소한 3D 인체 자세 주석만 포함되어 있어, 다시점 영상으로부터 밀도 높은 인체 동작을 복원하기 어렵다는 한계가 있었다. 이에 연구팀은 Ego-Exo4D 영상 전반에 걸친 4D 인체 동작 복원 결과물을 담은 대규모 데이터셋 Ego-Exo4D-HM을 구축하고, 복원 파이프라인 코드와 문서도 함께 공개한다.

Sian Labay / Unsplash
2609.30140v1

접촉을 결정 변수로: 다리형 로코-매니퓰레이션을 위한 Capability-Tradeoff Contact Selection

Contact as a Decision Variable: Capability-Tradeoff Contact Selection for Legged Loco-Manipulation

Al Jaber Mahmud, Shuai Li, Xuan Wang

이 논문은 다리형 로봇의 로코-매니퓰레이션(loco-manipulation) 과제를 수행할 때 환경 지지 접촉(support contact)과 전신 구성(whole-body configuration)을 함께 최적으로 선택하는 문제를 다룬다. 연구팀은 잔류 렌치(residual wrench), 엔드 이펙터 도달 범위(end-effector reach), 베이스 이동성(base mobility)의 세 가지 능력 지표와 접촉 획득 비용을 균형 있게 고려하는 형태로 문제를 정식화한다. 제안 기법인 Capability-Tradeoff Contact Selection(CTCS)은 후보 접촉을 타당성 기준으로 선별·군집화한 뒤 국소 민감도 분석(local sensitivity analysis)으로 능력값을 예측하고 선별적 정밀 평가를 거쳐 최종 접촉을 고른다. Unitree Go2 사족보행 로봇에 AgileX NERO 팔을 장착한 시스템으로 9개 지지 표면, 392가지 과제 조건에서 시뮬레이션 및 하드웨어 실험을 수행하였다. CTCS는 모든 후보를 정밀 평가하는 기준 방식 대비 약 3배의 연산 속도 향상을 달성하면서 평균 목적 함수값은 유사하게 유지하였다.

Bluestonex / Unsplash
2609.30134v1

학습 없는 행동 복제

Training-free Behavior Cloning

Maximilian Adang, Timothy Chen, Lars Osterberg, Aiden Swann, Mac Schwager

신경망 기반 행동 복제(Behavior Cloning)는 시연 데이터를 대형 모델에 압축하기 때문에 정책 갱신 비용이 크고 개별 행동 추적이 어렵다는 한계가 있다. 연구팀은 엔드투엔드 정책 학습 없이 동작하는 행동 예측 제어(Behavior Predictive Control, BPC)를 제안한다. BPC는 행동 인식 검색 지표, Hankel 기반 행동 연속 사전(prior), 폐쇄형 1단계 잔차 보정을 결합하여 저장된 관측-행동 데이터에서 미래 행동을 예측한다. 시뮬레이션 벤치마크와 실제 로봇 배포 실험에서 π_0.5 등 학습 기반 정책과 경쟁력 있는 성능을 보였으며, 소비자용 GPU에서 정책 적합 시간을 수 시간에서 수 초로 단축하고 Jetson Orin Nano에서 75 Hz 이상의 폐쇄 루프 제어를 지원한다. 시연 데이터를 정책 내에 그대로 유지하므로 예측 결과를 지원 궤적으로 추적할 수 있고 시연 뱅크를 통한 행동 수정도 가능하다.