본문으로 건너뛰기

PAPERS

논문 트래커

arXiv cs.RO 신규 논문을 매일 수집해 한국어 요약을 붙입니다. 학회 채택 정보는 저자 코멘트에서 자동으로 추출합니다.

473건학회 채택 3건
Héctor Berganza / Pexels
2609.17404v1

실행 중 관절 고장 상황에서의 정교한 손내 조작을 위한 잔차 고장 적응

Residual Fault Adaptation for Dexterous In-Hand Manipulation Under Runtime Joint Faults

Linan Deng, Xing Liu, Lin Hong, Feng Hua, Guijun Ma 외 2명

실행 중 발생하는 관절 고장(joint fault)은 정교한 손내 조작(dexterous in-hand manipulation)에 필요한 접촉 구성을 갑작스럽게 무너뜨린다. 이 연구는 숨겨진 명령 채널 고장을 보상하기 위한 교사 고정(teacher-anchored) 프레임워크인 잔차 고장 적응(RFA, Residual Fault Adaptation)을 제안한다. RFA는 동결된 정상 교사 정책으로 기준 동작을 유지하고, 고유감각(proprioceptive) 및 명령-응답 이력으로부터 수정 행동을 추론하는 순환 잔차 정책을 별도로 학습한다. 학습 단계에서는 고장 주입 도메인 무작위화(FIDR, fault-injection domain randomization)로 고장 모드·영향 관절·심각도·발생 시점을 다양화하고, 적응적 샘플링이 최근 성능이 낮은 고장 모드의 학습 빈도를 높인다. 배포 시에는 고장 레이블이나 컨트롤러 전환 신호 없이 동작하며, 시뮬레이션과 소프트웨어 주입 고장을 사용한 실로봇 실험에서 모두 정상 정책 대비 향상된 성능과 제로샷(zero-shot) 배포 가능성을 확인하였다.

Mikhail Nilov / Pexels
2609.17384v1

다중 로봇 능동 추론에서의 정확한 신념 융합과 협력 탐색

Exact Fusion and Coordinated Exploration in Multi-Robot Active Inference

Peng Wu, Mohsen Imani, Amidu Kamara, Md Tamzeed Islam, Seyede Fatemeh Ghoreishi 외 1명

다중 로봇 팀이 공통 환경 모델을 공유하며 학습할 때 두 가지 이중 계산 오류가 발생한다는 점을 분석한다. 첫째, 융합 시 공통 사전(prior)이 로봇 수 n만큼 중복 반영되고, 둘째, 계획 단계에서 모든 로봇이 동일한 신념을 기반으로 탐색 목표를 평가해 같은 미지 영역에 수렴하는 오류가 나타난다. 두 문제를 해결하기 위해 공유 자연 매개변수(natural parameter)에 증거 증분(evidence increment)을 더하는 방식—융합 시에는 실현 증분, 계획 시에는 기대 증분—을 제안한다. 이 기법은 고정 샘플링 경로를 가진 가우시안 신념과 이산 능동 추론(discrete active inference)의 노벨티 근사 하 디리클레(Dirichlet) 신념에 대해 정확하게 성립한다. cooperative RockSample, 채집(foraging), 현장 모니터링 시뮬레이션 실험에서 순차적 헌신(sequential commitment)이 팀 크기에 선형인 비용으로 중앙집중식 공동 계획에 근접하는 성능을 달성하는 것으로 나타났다.

Tara Winstead / Pexels
2609.17372v1

XPACE: 이질적 경험으로부터의 통합 세계-행동 모델링

XPACE: Joint World and Action Modeling from Heterogeneous Experience

Jiacheng Wei, Jerry Bai, Xiaoyu Yue, Zidong Wang, Xiaoyang Guo 외 11명

XPACE는 실행 가능한 로봇 행동과 미래 비디오를 동시에 예측하는 체화된 세계 모델(embodied world model)이다. 행동 레이블이 없는 비디오, 인간 시연, 로봇 시연 등 이질적 데이터를 정책과 시뮬레이터가 공유하는 비디오 백본(backbone)으로 통합 학습한다. 거친 단계에서 세밀한 단계로 진행하는 훈련 커리큘럼이 인간 경험을 유지하면서 로봇 제어에 점진적으로 집중하도록 설계됐다. 시뮬레이터는 전문가 시연 주변의 이탈-복구(deviation-recovery) 궤적을 합성하고, 필터링된 복구 예시로 정책을 추가 미세 조정(fine-tune)한다. XPENG의 IRON 휴머노이드 로봇 실험에서 이질적 학습이 강건성을 높이고 로봇 시연에 포함되지 않은 과제로의 기술 전이를 가능하게 했으며, 시뮬레이터가 생성한 복구 데이터가 실환경 과제 완료율을 추가로 향상시키는 것으로 나타났다.

Christina @ wocintechchat.com M / Unsplash
2609.17349v1

RobResilience: 사이버-물리 구현 시스템을 위한 회복탄력성 프레임워크 구현 및 평가

RobResilience: Implementing and Evaluating a Resilience Framework for Cyber-Physical Embodied Systems

Gysella Imrell, Emanuele Miotto, Mahya Mohammadi Kashani, Mauro Conti, Alberto Giaretta

구현형 사이버-물리 시스템(cyber-physical embodied system)에서 능동적 사이버 공격은 데이터뿐 아니라 물리적 무결성과 인명 안전을 직접 위협한다. 기존 보안 기법은 이상 탐지에는 강하지만, 시스템이 안전한 성능 저하 상태인지 치명적 위험 상태인지 런타임에 판별하는 메커니즘이 부재하여 '점진적 실패 마비(graceful failure paralysis)' 문제가 발생한다. 이 논문은 Webots 시뮬레이션 환경에서 PR2 로봇과 ROS2를 사용하여 RobResilience 프레임워크를 구현하고, 런타임에 허용 가능한 장애(δ)·허용 가능한 성능 저하(γ)·완화 가능성(μ) 세 술어(predicate)를 IDS 신뢰도 점수 기반의 손상 장치 집합에 대해 평가한다. 회복탄력성이 상실되면 프레임워크가 가용한 완화 전략을 자동으로 실행한다. 술어 상태 공간의 모든 조합을 체계적으로 포괄하는 8가지 공격 시나리오 실험에서 런타임 동작이 이론적 정의와 일치함이 확인되었다.

Sven Mieke / Unsplash
2609.17302v1

장면 분해를 통한 온라인 기하학적 변화 감지

Online Geometric Change Detection via Scene Decomposition

David Thorne, Samuel Jia Cong Chua, Nakul Joshi, Aiden Wong, Christa S. Robison 외 2명

CDSD(Change Detection via Scene Decomposition)는 LiDAR 또는 RGB-D 센서를 이용해 동적 환경에서 기하학적 변화를 온라인으로 감지하는 프레임워크다. 기존의 전역 지도 비교 방식은 연산 비용이 크고 단일 세션 실시간 감지를 지원하지 못한다는 한계가 있다. CDSD는 매핑된 환경을 고유한 장면으로 공간 분해하고, 전역 지도의 지역 부분집합인 서브맵(submap)을 비교함으로써 변화를 효율적으로 탐지한다. 논문은 최소 중복 장면 선별, 밀집 서브맵 생성, 시야각이 상이한 서브맵 간 비교, 실시간 지도 재구성의 네 가지 핵심 과제를 정의하고 해결책을 제시한다. 알고리즘은 미국 육군연구소(Army Research Laboratory)의 Graces Quarters 시설 데이터셋과 공개 다중 세션 변화 감지 데이터셋에서 검증되었다.

Mikhail Nilov / Pexels
2609.17300v1

Machine Zygote: 생식세포-체세포 인공 에이전트에서 학습 이전의 인과적 양부모 유전

Machine Zygote: Causal Biparental Heredity Before Learning in a Germline--Soma Artificial Agent

Lyes Saad Saoud

Machine Zygote는 인공 에이전트가 학습 이전에 양부모 유전 효과를 측정 가능하게 나타내는지, 그리고 그 의존성을 부모-자손 유사성 관찰이 아닌 인과적 방법으로 분리할 수 있는지를 검증하기 위한 계산적 생식세포계-체세포(germline-soma) 구조다. 두 부모의 생식세포계를 독립적으로 돌연변이시킨 뒤 접합체로 재조합하여 8모듈 체세포의 발달을 매개변수화하고, 이후 학습 없이 고정·평가한다. 640개 자손을 대상으로 한 사전등록 4×4 다이얼렐(diallel) 실험에서 6가지 행동 특성 중 5가지에서 부(dam)·모(sire) 의존성이 유의미하게 나타났으며, 부모 및 상호작용 요인이 주요 5개 특성 분산의 36~53%를 설명했다. 재조합 배경을 고정한 채 한쪽 부모 생식세포계를 교체하는 개입 실험(n=60)에서도 같은 5가지 특성에서 표현형 변화가 동일 부모 재돌연변이 대조군을 상회했다. 다만 순환 발달 동역학이 유전 발현에 필수적이라는 발달 의존성 가설은 지지되지 않았다.

Pavel Danilyuk / Pexels
2609.17292v1

바디 레이트 제한 하 쿼드로터 안전을 위한 탈출 인식 제어 장벽 함수

Escape-Aware Control Barrier Functions for Quadrotor Safety under Body-Rate Limits

Lei Shi, Haosong Wen, Qichao Liu

입력 제한 시스템에서 제어 장벽 함수(Control Barrier Function, CBF)는 허용 입력 집합을 안전 집합 정의에 내포하지만, 결과 장벽은 거의 항상 상태(state)만의 함수로 표현된다. 쿼드로터에서는 추력 벡터를 재방향(reorientation)하기 전까지 감속이 불가능하고 바디 레이트(body rate)가 제한되므로, 상태만 기반의 장벽은 실제로 탈출할 수 없는 상태까지 안전하다고 인증하는 인증 격차(certification gap)가 발생한다. 이 격차의 크기는 폐쇄형(closed form)으로 도출되며, 접근 속도에 비례하고 바디 레이트 한계에 반비례한다. 저자들은 상태와 직전 적용 입력의 증강 쌍 위에 탈출 장벽(escape barrier)을 정의하여, 추가적인 상태 비용 없이 예측 제어기에 내장할 수 있도록 설계하였다. 13-상태 쿼드로터를 대상으로 한 550개 클로즈드루프 에피소드 실험에서 제안 제어기는 전 시나리오를 완료하였으나, 동일 호라이즌의 정지 거리 기반 장벽은 두 시나리오에서 각각 15%, 25%의 실패율을 나타냈다.

ArtHouse Studio / Pexels
2609.17265v1

한 번의 보정으로 임의 팀 비행: 협동 드론 군집을 위한 잔차 기반 저충실도 학습

Calibrate Once, Fly Any Team: Residual-Grounded Low-Fidelity Training for Cooperative Drone Swarms

Maxim Mednikov, Oren Gal

고충실도(HF) 강체 물리 시뮬레이터에서 다중 에이전트 드론 군집 정책을 직접 학습하면 에이전트 수가 늘어날수록 계산 비용과 시뮬레이션 내 충돌률이 급격히 증가한다. 본 논문은 HF 강화학습을 완전히 배제하고, JAX 기반의 완전 미분 가능한 저충실도(LF) 점질량 시뮬레이터에서 정책을 최적화하는 혼합 충실도(mixed-fidelity) 학습 방식을 제안한다. 시뮬레이터 오차는 드론 한 대의 단거리 비행 데이터로 오프라인에서 한 번만 학습한 에이전트별 잔차 앙상블(residual ensemble)로 보정하며, 보정 데이터 수집 비용은 팀 크기에 비례해 늘지 않는다. 팀 크기 3~18, 협동 과제 4종으로 평가한 결과, 잔차 보정 정책은 보정 없는 LF 기준선 대비 모든 조합에서 우수했고 처음부터 HF로 학습한 정책 대비 24개 조합 중 22개에서 우세했다. HF 미세 조정 정책과의 성능 격차는 팀 크기가 클수록 줄어들며, 대형 팀에서는 계산 비용의 일부만으로 유사한 성능에 도달했다.

Pavel Danilyuk / Pexels
2609.15988v1

ResSafe: 휴머노이드를 위한 잔차 강화학습 기반 안전 필터링 학습

ResSafe: Learning Safety Filtering with Residual Reinforcement Learning for Humanoids

Gechen Qu, Tong Zhang, Bike Zhang, Yen-Jen Wang, Koushil Sreenath 외 2명

휴머노이드 로봇은 고차원 동역학과 접촉이 잦은 환경 특성 때문에 안전 제어가 어렵고, 강화학습 정책이 불안정이나 낙상을 유발하는 행동을 생성할 수 있다. 이 연구는 잔차 강화학습(residual reinforcement learning)을 암묵적 안전 필터로 사용하는 ResSafe를 제안한다. 명목 정책(nominal policy)은 과제 성능에만 집중하고, 잔차 정책(residual policy)이 안전 보정을 별도로 담당하는 방식으로 성능과 안전을 분리한다. 이 분리 구조는 성능-안전 파레토(Pareto) 트레이드오프를 개선하고, 단일 정책 학습 내에서 경쟁하는 여러 보상 항을 세밀하게 조정해야 하는 부담을 줄인다. 저자들은 잔차 정책이 암묵적 안전 필터로 기능함을 보였다고 밝힌다.

Pavel Danilyuk / Pexels
2609.15976v1CoRL

MessyMem: 모바일 매니퓰레이션을 위한 경험 기반 학습 메모리

MessyMem: Learning-from-Doing Memory for Mobile Manipulation

Anuva Banwasi, William Muckelroy, Priya Sundaresan, Linfeng Zhao, Jeannette Bohg 외 1명

MessyMem은 모바일 매니퓰레이터가 작업 경험을 지속적으로 축적하고 이후 작업에서 재활용할 수 있도록 설계된 지속적 메모리(persistent memory) 시스템이다. 공간 기반 3D 장면 그래프(scene graph)에 상호작용을 통해 얻은 속성과 결과를 추가하고, 세밀한 재현을 위해 시각적 관측값을 연결하는 방식으로 동작한다. 기존 시스템은 잠긴 서랍이나 물체 위치 같은 상호작용 유래 지식을 저장하지 못해 매 작업을 처음부터 수행한다는 한계를 가진다. 시뮬레이션과 실제 모바일 매니퓰레이터 양쪽에서 평가하였으며, 3시간 이상에 걸친 25개 연속 작업 시뮬레이션에서 작업 진행률 80.0%를 기록했다. 이는 가장 강력한 절제 실험(ablation) 대비 14.8%p, 외부 베이스라인 대비 28.9%p 높은 수치이며, 수천 개의 키프레임 가운데 1시간 이상 과거의 관련 증거를 검색하는 데 성공했다.

AFINIS Group ® - AFINIS GASKET® Production / Unsplash
2609.15940v1

단일 축 테스트를 넘어서: 시각-언어-행동 정책의 복합 견고성 쌍 평가

Beyond Single-Axis Testing: Paired Evaluation of Compound Robustness in Vision-Language-Action Policies

Hiroki Sawada, Shunichi Kasahara

시각-언어-행동 모델(VLA) 정책은 통상 단일 분포 변화(perturbation)를 하나씩 적용하는 방식으로 평가되지만, 실제 환경에서는 여러 변화가 동시에 발생한다. 연구팀은 이 간극을 분석하기 위해 단일 축 조건과 동시 조건을 초기 상태 단위로 쌍으로 구성한 6축 벤치마크 LIBERO-CTRL을 제안한다. 분석 결과, 단일 축 평가가 모두 성공해도 동시 조건에서 실패하는 '창발적 실패(emergent failure)'와, 단일 축 평가에서 실패해도 동시 조건에서 성공하는 '보상적 성공(compensated success)'이라는 상반된 현상이 공존한다. 두 현상이 집계 통계에서 서로 상쇄되면, 최대 29.0%의 초기 상태에서 결과가 바뀌더라도 전체 성공률은 단일 축 수치와 일관되게 보일 수 있다. 6개 정책·3가지 난이도 조합에서 결과 변화율은 최대 34.5%에 달해, 복합 견고성은 단일 축 집계 성공률만으로는 측정할 수 없다는 결론을 내린다.

Yaroslav Shuraev / Pexels
2609.15921v1CoRL

Touch2Trace: 정교한 케이블 추적을 위한 촉각 기반 모방 학습

Touch2Trace: Tactile-Driven Imitation Learning for Dexterous Cable Tracing

Matteo Grimaldi, David Klee, Ziling Chen, Tong Jian, Wonju Lee 외 3명

Touch2Trace는 엄지와 검지로 케이블을 반복적으로 집고 말아 넣는 정교한 케이블 추적 과제를 위한 촉각 기반 모방 학습(Imitation Learning) 시스템이다. 32×32 압저항식 센서(TacV5)를 자기 지도 학습으로 사전 학습한 촉각 인코더와, 원격조작 시연 데이터로 행동 복제(Behavior Cloning) 훈련된 경량 트랜스포머 정책을 결합해 60 Hz로 Tesollo DG-5F 손에 배포한다. 시각 정보나 케이블 상태 추정 없이 촉각 피드백만으로 고유감각 기반 베이스라인 대비 평균 추적 거리가 0.2 cm에서 20.1 cm로, 성공률이 0%에서 93%로 향상되었다. 학습 시 보지 못한 케이블 종류와 배선 조건에 대한 제로샷 전이도 달성하였다. 본 연구는 인코더 사전 학습, 제어 주기, 시간적 맥락, 공간 해상도가 정책 성능에 미치는 영향을 실기(real-world) 환경에서 체계적으로 수치화한다.

cottonbro studio / Pexels
2609.15910v1CoRL

SlipSense: 저지연 범용 슬립 감지를 위한 멀티모달 촉각 학습

SlipSense: Multimodal Tactile Learning for Low-Latency and Generalized Slip Detection

Tong Jian, Aditya Thurvas Senthil Kumar, Xinyi Li, Ziling Chen, Tianyu Dai 외 5명

SlipSense는 TacV5 센서를 기반으로 한 멀티모달 촉각 슬립 감지(slip detection) 프레임워크다. TacV5는 240 Hz로 동작하는 32×32 압저항(piezoresistive) 어레이와 8 kHz로 동작하는 3축 MEMS 가속도계를 하나의 소형 패키지에 통합한 센서다. 압저항 어레이는 공간 압력 분포를, 가속도계는 마찰 유발 진동을 각각 포착해 상호 보완적인 슬립 단서를 제공하며, 프레임워크는 모달리티별 인코딩과 크로스-모달 어텐션(cross-modal attention)을 240 Hz로 수행한다. 37개 물체에 걸친 140만 프레임 데이터셋 실험에서 Macro F1 96.7%, 오탐률(false-positive rate) 1.6% 미만, 슬립 이벤트의 76%를 23.1 ms 이내에 감지하는 결과를 보였다. UMI 데이터만으로 학습한 모델이 재학습 없이 Tesollo 덱스터러스 핸드에서 미학습 물체와 다른 센서 유닛에 제로샷(zero-shot)으로 동작함을 확인했다.

Pavel Danilyuk / Pexels
2609.15895v1

Physical AI를 위한 목표 지향 통신: 설계와 테스트베드

Goal-Oriented Communications for Physical AI: Design and Testbed

Shutong Chen, Wenkai Zhang, Adnan Aijaz, Miao Guo, Yansha Deng

Physical AI 응용은 지연에 민감한 실시간 영상 스트림을 필요로 해 기존 5G 네트워크로는 대용량 데이터를 충분히 처리하기 어렵다. 이 연구는 목표 지향 통신(GoC, Goal-Oriented Communication) 테스트베드를 구현했으며, RGB-D 카메라와 5G 모뎀을 장착한 PiPER 로봇 팔을 5G OpenAirInterface 네트워크를 통해 NVIDIA Jetson AGX Orin 엣지 서버와 연결했다. 연구팀은 3D 바운딩 박스, 2D 씬 그래프(scene graph), 3D 씬 그래프 세 가지 의미적 표현을 전송하는 GoC 프레임워크를 설계하고, 의미 추출·5G 전송·언어 모델 추론·디지털 트윈(digital twin) 검증·로봇 제어 모듈을 하나의 파이프라인으로 통합했다. 실험 결과, 원시 이미지를 주기적으로 전송하는 기존 방식 대비 작업 완료 시간이 최대 52.6% 단축되고 작업 성공 확률이 최대 45% 향상되는 것으로 나타났다.

raksasok heng / Pexels
2609.15870v1

WLA³: 의미론·역학·기구학을 위한 세계 잠재 행동 모델링

WLA³: World Latent Action Modeling for Semantics, Dynamics, and Kinematics

Peidong Liu, Zhiyuan Xiang, Mingyang Li, Wenhao Li, Jiale Zhang 외 2명

이질적 데이터로 범용 정책 모델을 확장할 때 통합된 저잡음 행동 레이블이 부족하다는 문제를 해결하기 위해 WLA³가 제안됐다. WLA³는 세계 잠재 행동 모델(WLAM, World Latent Action Model)이 학습한 표현을 기반으로, 다중 모달 세계 상태 변화를 로컬 잠재 행동과 전이 특징(transition feature)으로 인코딩한다. 세그먼트 수준 특징은 의미론적 잠재 집계(SLA, Semantic Latent Aggregate)를 통해 시각-언어 모델(VLM)을 직접 지도하며, 행동 전문가 모듈이 잠재 행동과 로봇 제어 명령을 함께 예측한다. LARYBench에서 32차원 잠재 행동의 평균 분류 정확도 67.89%를 기록했고, 6개 실제 로봇 과제에서 평균 성공률 81.9%로 비교 대상인 π_0.5의 66.2%보다 높은 수치를 보였다. 인간 자기중심 영상이 전이 지도로 활용되어 인간-로봇 전이(human-to-robot transfer)를 지원하며, 중간 학습 데이터가 늘어날수록 성능이 향상되는 경향을 확인했다.

Adedotun Adegborioye / Unsplash
2609.15861v1

DuctAM: 고강도 밀기-당기기 상호작용이 가능한 덕트 보조 쿼드로터 기반 공중 조작기

DuctAM: A Duct-Assisted Quadrotor-Based Aerial Manipulator Enabling High-Force Push-and-Pull Interactions

Yi Wang, Rui Jin, Xinhang Xu, Haotian Jin, Ruiyang Liu 외 2명

DuctAM은 쿼드로터의 상호작용 축을 따라 두 개의 덕트 팬을 통합해 수평 방향 힘 발휘 성능을 강화한 소형 공중 조작(Aerial Manipulation) 플랫폼이다. 자세-힘 분리(attitude-force decoupled) 제어 방식을 적용해 기체 자세를 크게 변경하지 않고도 제어 가능한 수평 힘을 생성한다. 8자 궤적 추적 실험으로 쿼드 모드와 덕트 모드 모두에서 안정적인 비행 및 운동 제어를 확인했다. 카트 밀기, 문 닫기, 서랍 열기 등 대표적인 밀기-당기기 작업을 실기(real-world)에서 수행해 실용성을 검증했다. 기존 무인 항공기(UAV) 대비 수평 상호작용 힘이 유의미하게 향상된 것으로 나타났다.

Rafael Minguet Delgado / Pexels
2609.15840v1

행동 청킹 트랜스포머 정책을 위한 불확실성 기반 희소 정제

Uncertainty-Guided Sparse Refinement for Action Chunking Transformer Policies

Chenyang Wang, Yuntian Wang, Xiaoxiong Yang, Dingde Jiang, Siao Liu 외 1명

장기 로봇 조작(long-horizon robot manipulation)을 위한 행동 청킹(action chunking) 정책은 청크 전체에 걸쳐 균일하게 오류가 분포하지 않고 소수의 핵심 타임스텝에서 실패가 집중되는 특성이 있다. 이를 해결하기 위해 UGR(Uncertainty-Guided Refinement)을 제안하며, 전체 행동 청크를 먼저 예측한 뒤 각 타임스텝별 불확실성을 추정하고 이진 마스크로 선별된 고불확실 타임스텝에만 잔차 보정(residual correction)을 적용하는 거친 예측→정제 구조를 따른다. 불확실성 분기(branch)는 기존 행동 예측기와 분리 설계되어 성능 향상이 예측기 용량 증가가 아닌 불확실성 기반 보정에서 비롯됨을 확인할 수 있다. RoboTwin 벤치마크의 5개 양팔 조작 과제 실험에서 UGR은 4개 과제에서 최고 성공률을 기록하였고, ACT 베이스라인 대비 최대 13%포인트 향상을 달성했다.

Kindel Media / Pexels
2609.15770v1

JEPLO: LiDAR 기반 족형 보행을 위한 결합 임베딩 예측 학습

JEPLO: Joint-Embedding Predictive Learning for LiDAR-Based Legged Locomotion

Qihao Yuan, Yixuan Qiu, Ziyu Cao, Ming Cao, Kailai Li

JEPLO는 명시적 지도(mapping) 없이 LiDAR만으로 족형 로봇의 지각 보행을 실현하는 단일 단계 학습 프레임워크다. 자기고유감각·외부수용감각 결합 JEPA(PE-JEPA) 세계 모델을 통해 원시 LiDAR 스캔을 포함한 온보드 관측으로부터 자아중심 지형 표현(egocentric terrain representation)을 예측 학습한다. 동시적 JEPA 교사-학생(CJTS) 파이프라인으로 시뮬레이션 안에서 심층 강화학습(deep reinforcement learning)을 이용해 보행 정책을 훈련하며, 학습된 정책은 실기 환경으로 성공적으로 전이(sim-to-real transfer)된다. 계단·높은 박스 등 다양한 지형을 전방향 주행으로 통과했으며, 폐색(occlusion)·희소성(sparsity)·노이즈로 인해 인식 성능이 저하된 조건에서 기존 지각 보행 프레임워크 대비 높은 강건성을 보였다. 구현 코드, 실험 데이터셋, 하드웨어 설계 정보를 오픈소스로 공개한다.

Tara Winstead / Pexels
2609.15726v1

Bench2Dex: 다양한 손재주 로봇 손에서의 시각-촉각 양손 정밀 조작 벤치마킹

Bench2Dex: Benchmarking Visuo-Tactile Bimanual Dexterous Manipulation Across Dexterous Hands

Zhenjie Yang, Yideng Zhang, Dongjie Zhang, Chenyu Jiang, Xianshuai Liu 외 19명

Bench2Dex는 12종의 손재주 로봇 손(dexterous hand)을 대상으로 시각-촉각(visuo-tactile) 양손 조작을 평가하는 시뮬레이션 벤치마크다. 기존 로봇 모델에 공통 시뮬레이션 촉각 인터페이스를 추가해 접촉 형상을 이미지 형태의 촉각 관측값으로 변환하며, 손 형태가 달라도 일관된 관측 형식을 제공한다. 도구 사용, 관절형 물체 조작, 다단계 조작을 포함한 26개 양손 과제와 약 1,300건의 인간 원격 조작 시연 데이터가 함께 제공된다. 교란(perturbation)은 올바른 행동이 달라지지 않는 불변(invariance) 축과 교란에 따라 행동도 변하는 등변(equivariance) 축으로 나뉘어 7가지 유형을 다룬다. ACT, Diffusion Policy, pi0.5, GR00T N1.5를 벤치마크에서 평가하고 성능 및 실패 사례를 보고한다.

Pavel Danilyuk / Pexels
2609.15716v1

접촉 집약 모방 학습을 위한 연속 매니폴드 분해 임피던스 리타겟팅

Continuous Manifold-Decomposed Impedance Retargeting for Contact-Rich Imitation Learning

Jiahao Liu, Kento Kawaharazuka, Tasuku Makabe, Kei Okada

CMDIR은 고정 임피던스 시연 데이터를 연속 가변 임피던스(variable-impedance) 제어기로 변환하는 프레임워크로, 매니폴드 분해 임피던스 리타겟팅(Manifold-Decomposed Impedance Retargeting, MDIR)을 확장한다. 연속 태스크-매니폴드 임피던스 표현(Continuous Task-Manifold Impedance Representation, TMIR)은 변화하는 태스크 프레임과 제어기 명령을 결합하며, 모방 학습의 구조화된 감독 신호로도 활용된다. 세 가지 실제 접촉 과제에서 225회 실험을 수행한 결과, 이산(discrete) MDIR 대비 평균 태스크-프록시 유지율이 향상되고 자세 편차·힘 변동·최대 힘이 감소하였다. FastMPO는 C-MPO 대비 5.8~9.4배의 속도 향상을 달성하면서 유사한 폐루프(closed-loop) 성능을 보인다. 다운스트림 실험에서 TMIR 감독 인터페이스의 학습 가능성이 확인되었으나, 과제 및 환경에 따라 완료 신뢰성은 고르지 않은 것으로 나타났다.