본문으로 건너뛰기

PAPERS

논문 트래커

arXiv cs.RO 신규 논문을 매일 수집해 한국어 요약을 붙입니다. 학회 채택 정보는 저자 코멘트에서 자동으로 추출합니다.

473건학회 채택 2건
Mikhail Nilov / Pexels
2609.35761v1

DexRoam: 자아중심 전신 인간 시연 기반 이동형 양손 정밀 조작 학습

DexRoam: Learning Mobile Bimanual Dexterous Manipulation from Egocentric Whole-Body Human Demonstrations

Rui Zhou, Yibo Yuan, Junkai Zhao, Fangyuan Zhao, Xiaoguang Zhao 외 2명

DexRoam은 전신 동작의 연속성을 유지하면서 인간 시연을 로봇 정책 학습에 활용하는 이동형 양손 정밀 조작(mobile bimanual dexterous manipulation) 시스템이다. 외부 카메라나 모션 트래커 없이 소비자용 VR 헤드셋과 두부 장착 스테레오 카메라만으로 자아중심(egocentric) 전신 조작 시연을 수집하는 트래커 없는 캡처 시스템을 구성했다. 수집된 모션은 신체화(embodiment)·행동-의미론(action-semantic)·시간(temporal) 세 단계 정렬을 거쳐 로봇 행동 공간에 매핑되며, 인간·로봇 시연을 시각-언어-행동 모델(VLA) 정책으로 공동 학습한다. 실제 환경 실험에서 인간 시연을 추가했을 때 GR00T N1.7 기반 정책의 평균 성공률은 29%에서 56%로, pi0.5 기반 정책은 32%에서 57%로 향상됐다. 또한 로봇 시연 절반만 사용하는 조건에서도 로봇 시연만으로 훈련한 결과와 동등한 성능을 달성했다.

Mikhail Nilov / Pexels
2609.35758v1IROS

복합 적응 제어를 위한 수축 동역학 표현의 통계적 학습

Statistical Learning of Contractive Dynamical Representations for Composite Adaptive Control

Min Kim, José Leonardo Brenes, Fred Hadaegh, Soon-Jo Chung

본 논문은 동적으로 결합된 외란 하에서의 복합 적응 추적 제어(composite adaptive tracking control)를 위한 표현 학습 프레임워크를 제안한다. 고전적 외란 수용 제어(disturbance-accommodating control, DAC)와 최근의 최종층(last-layer) 적응 외란 억제 방법을 연결하며, 칼만 스무서(Kalman smoother)를 E-단계에 활용한 하드 기댓값-최대화(hard-EM) 절차로 잠재 진화가 균일 수축적(uniformly contractive)인 외란 표현을 식별한다. 학습된 잠재 상태에 베이즈 필터링을 결합하면 지수 수렴이 증명된 예측 능력을 갖춘 복합 적응 추적 제어기가 구성된다. 미끄러운 지면을 주행하는 차량(액체 슬로싱 탱크 및 진자 하중 탑재) 실기 실험과 결합 Duffing 진동계에서의 평가를 수행했으며, 고정 감쇠 표현 학습·선형시불변(LTI) 외란 수용·모델 기반 PD 기준선 대비 추적 성능이 향상되었다.

Pachon in Motion / Pexels
2609.35717v1

RoboCompiler: 일관된 모델링·제어·시뮬레이션을 위한 폐쇄 연쇄 로봇의 그래프 네이티브 컴파일

RoboCompiler: Graph-Native Compilation of Closed-Chain Robots for Consistent Modeling, Control, and Simulation

Mehdi Heydari Shahna, Joongheon Kim, Jouni Mattila

RoboCompiler는 운동학적 루프(kinematic loop)·결합 액추에이터·접촉 변화를 가진 로봇을 위해 정규 기구 그래프(canonical mechanism graph)를 단일 공유 역학 인터페이스로 컴파일하는 프레임워크다. 폐쇄 경로와 해석적 잔차 야코비안(residual Jacobian)을 구성하고, 랭크 검사 기반 연속·보정을 통해 실현 가능한 형상(feasible configuration)을 조립한다. 접선 리프트(tangent lift)가 독립 속도를 전체 로봇·작업 운동으로 매핑하고, 액추에이터 포트 쌍이 가상 일(virtual work)의 일관성을 유지한다. Komatsu 굴착기, Unitree Go2, Franka Panda, Kangaroo, 6-UPS 스튜어트 플랫폼을 대상으로 검증했으며, MuJoCo 및 Isaac Sim/PhysX에서 실행하여 네이티브 접촉 하의 모델 재사용성을 확인했다. Kangaroo 플랫폼에서는 잔차·야코비안 연산 시간이 96.7%, 폐쇄 루프 롤아웃 벽시계 시간이 66.8% 단축됐다.

Google DeepMind / Pexels
2609.35715v1

X-Reset: 크로스-엠보디먼트 리셋을 통한 물체 중심 강화학습의 확장

X-Reset: Scaling Object-Centric Reinforcement Learning via Cross-Embodiment Resets

Prithwish Dan, Chenyang Ma, Wei Zhan

X-Reset은 시뮬레이션 기반 강화학습(RL)에서 다양한 물체 조작 시 발생하는 탐색(exploration) 문제를 해결하기 위해 사람의 손-물체 시연을 활용하는 프레임워크다. 인간 동작을 모방하거나 추적하는 대신, 손-물체 상태를 기구학적으로 로봇 상태로 변환(retarget)하고 시뮬레이션에서 불안정한 상태를 걸러낸 뒤 나머지를 RL 훈련의 초기화 분포(reset distribution)로 사용한다. 학습된 정책은 물체 상태와 목표만을 입력으로 받으며, 시연 데이터는 초기화 단계에서만 관여한다. 22자유도(DoF) 핸드 2종과 평행 그리퍼(parallel-jaw gripper)를 포함한 세 가지 로봇 형태(embodiment)에서 20개 물체에 대한 일반화 정책 훈련 결과를 보고하며, 미학습 물체 일반화 및 시뮬레이션-실환경(sim-to-real) 제로샷 전이도 확인하였다.

Mikhail Nilov / Pexels
2609.35709v1

이산형 VLA 모델을 이용한 휴머노이드 로코-매니퓰레이션

Humanoid Loco-Manipulation With Discrete VLA Model

Wenxin Shao, Siqi Chai, Kun Li, Kerou Zhang, Xinzhou Jiang 외 2명

Holo-M은 휴머노이드 로봇의 다리·몸통·팔·손을 통합 제어하는 이산형 시각-언어-행동 모델(VLA)이다. 엔드이펙터, 몸통, 손, 기구학 등 네 가지 신체 부위별 토크나이저로 구성된 통합 행동 토크나이저를 고안하여, 휴머노이드 원격조작·1인칭 인간 영상·시뮬레이션 등 이질적인 데이터 소스에 걸쳐 훈련이 가능하다. 언어 모델의 어휘를 행동 토큰으로 확장함으로써, 별도의 연속 행동 전문가 모델을 사용할 때 발생하는 지식 격리 문제를 회피한다. 실시간 제어 요건을 충족하기 위해 자기회귀 방식 대신 그룹형 이산 확산(grouped discrete diffusion) 디코딩을 채택한다. SIMPLE 휴머노이드 로코-매니퓰레이션 벤치마크의 제너럴리스트·스페셜리스트 평가 모두에서 최고 성공률을 기록하였다고 저자들은 밝히고 있다.

Kindel Media / Pexels
2609.35700v1

LQR-ArUco Fusion: 이륜 로봇의 주행 및 비대칭 조작을 위한 강인한 계층적 제어

LQR-ArUco Fusion: Robust Hierarchical Control for Navigation and Asymmetric Manipulation in Two-Wheeled Robots

Anupam Chatterjee, Arpita Kumari

이륜 역진자(TWIP, Two-Wheeled Inverted Pendulum) 로봇에 측면 장착 로봇팔을 추가할 때 발생하는 비대칭 롤 모멘트와 오도메트리 드리프트 문제를 해결하기 위한 계층적 제어 프레임워크를 제안한다. 상위 계층은 오프보드 비전 시스템이 천장에 부착된 ArUco 마커를 추적해 고지연 전역 경유점 항법을 제공함으로써 오도메트리 오차를 우회한다. 하위 계층은 관성·엔코더 데이터를 이용한 저지연 온보드 LQR(선형 이차 조절기) 루프가 실시간으로 물리적 외란을 억제한다. 실물 실험에서 이 이중 루프 구조를 탑재한 커스텀 제작 로봇은 과속 방지턱 충격 흡수, 동적 시소 경사로 적응, 좁은 휠베이스 유지 상태의 페이로드 운반을 수행하였다.

Werner Pfennig / Pexels
2609.35690v1

Agent Priors 기반 정책 학습

Agent Priors-guided Policy Learning

Puming Jiang, Tianrun Hu, Haozhe Du, Yibo Li, Zhiwei Xue 외 2명

적은 수의 시연으로 학습하는 로봇에게는 기술을 재조합해 새로운 과제를 푸는 구성적 일반화(compositional generalization)와 학습된 정책이 새로운 상황에서도 작동하는 기술 일반화(skill generalization)가 모두 필요하다. 그러나 구성 단계에서 각 기술은 이름·지시문 등 간략한 설명으로만 참조되어 정책의 구조 정보가 유실된다. 이 연구는 각 정책의 구조적 사전지식(structural prior)—예컨대 파지 행동이 그리퍼와 물체의 상대 자세에만 의존한다는 가정—을 구성과 기술 사이의 인터페이스로 활용하는 APPL(Agent Priors-guided Policy Learning)을 제안한다. APPL의 구성 에이전트는 시연을 재사용 가능한 기술로 분할하고 각 기술에 대해 여러 구조적 사전지식을 제안·학습·검증하며, 실행 에이전트는 이 인터페이스를 토대로 정책을 선택·조합해 새로운 과제를 수행한다. MetaWorld와 장기 과제(long-horizon) ManiSkill 벤치마크에서 APPL은 분포 외(out-of-distribution) 기술 일반화를 개선하고 이전에 본 적 없는 기술 조합을 가능하게 했으며, 인터페이스 정보를 제거한 절제 실험(ablation)에서는 성능이 크게 저하되었다.

Boitumelo / Unsplash
2609.35652v1

MM-ABC: 보기·조율·상상을 통한 범용 모바일 매니퓰레이션

MM-ABC: Towards Generalist Mobile Manipulation via Seeing, Coordinating and Imagining

Qiwei Liang, Guangyu Chen, Shaolong Zhu, Zikuan Xiao, Jinxuan Lu 외 4명

모바일 매니퓰레이션(mobile manipulation)은 로봇 베이스가 이동하면서 조작 범위를 확장하지만, 자기 운동 중 공간 인식과 팔·베이스의 이질적 동작 조율이라는 두 가지 과제를 안고 있다. MM-ABC는 희소 다단계 시각-언어 모델(VLM) 특징을 이용한 공간 인식, 학습 단계에서만 사용하는 미래 예측 브랜치(월드 이매지네이션 및 기하학적 의도 감독), 그리고 매니퓰레이션·이동 스트림을 마스크 조인트 어텐션으로 조율하는 MM-APT 모듈을 결합한 파운데이션 모델이다. 5,000시간 이상의 이종 로봇 데이터(400K+ 에피소드, 12개 데이터셋, 17종 로봇)로 사전 학습되었다. EBench에서 44.71%, RoboCasa365에서 61.2%, LIBERO에서 99.1%, LIBERO-Plus에서 섭동(perturbation) 학습 없이 82.8%, 실세계 5개 과제에서 평균 83%의 성공률을 기록했다고 저자들은 보고한다.

David Brown / Pexels
2609.35651v1

다중 로봇 궤적의 확산 잡음제거 계획

Denoising Multi-Robot Trajectories

Yuhao Zhang, Keisuke Okumura, Ajay Shankar, Amanda Prorok

D4orm은 GPU 병렬 연산을 활용한 샘플링 기반 최적화로 다중 로봇의 궤적을 생성하는 동역학 인식 확산-잡음제거(diffusion-denoising) 프레임워크다. 후보 제어 궤적에 대한 변형을 반복 최적화하여 운동역학적으로 실현 가능하고 충돌이 없는 경로를 산출한다. 이를 기반으로 확장성을 위한 분리형(decoupled) 플래너, 피드백 제어를 포함한 온라인 이동 지평선(receding-horizon) 플래너, 자원 제약 환경용 분산(distributed) 플래너 세 가지 아키텍처를 제시한다. 2D·3D 환경에서 차동 구동 및 홀로노믹 로봇을 대상으로 평가한 결과, D4orm 기반 접근법은 MPPI 및 학습 기반 확산 모델 방법보다 더 빠르고 안정적으로 고품질 해를 산출하는 것으로 나타났다. 실기 검증으로는 10대 쿼드로터에 대한 제로샷(zero-shot) 배포, 100대 시뮬레이션 로봇의 충돌 회피, 6대 지상 로봇의 분산 '영구 운용'이 수행되었다.

Kindel Media / Pexels
2609.35619v1

CollisionSplatting: 이미지 조건부 목적 함수와 조절 가능한 보수성을 갖춘 3DGS 장면에서의 충돌 인식 경로 계획

CollisionSplatting: Collision-Aware Motion Planning in 3DGS Scenes with Image-Conditioned Objectives and Adjustable Conservatism

R. Khorrambakht, Joaquim Ortiz-Haro, Stephan Weiss, Ludovic Righetti

CollisionSplatting은 3D 가우시안 스플래팅(3DGS) 장면에서 직접 작동하는 GPU 가속 확률 기반 거리 메트릭으로, 충돌 회피의 민감도를 조절할 수 있는 보수성(conservatism) 파라미터를 제공한다. 학습된 이미지 조건부 보상 함수와 결합하면 기하학적 충돌 비용과 이미지 공간 목적 함수를 통합한 경로 계획이 가능해진다. 모델 예측 경로 적분(MPPI)과 급속 탐색 랜덤 트리(RRT) 계획기에 적용한 결과, 비교 기준 방법 대비 동등하거나 높은 충돌 분류 성능을 보이면서 충돌 검사 처리량은 크게 향상되고 VRAM 사용량은 감소했다. 실제 환경에서의 시각 유도 탐색 및 조작 작업에서도 유효성을 검증했다.

Brecht Corbeel / Unsplash
2609.35575v1

F4R: 지속적 로봇 자기개선을 위한 실패 기반 인식·재구성·정제·재배포

F4R: Failure-Driven Recognition, Reconstruction, Refinement, and Redeployment for Continual Robot Self-Improvement

Zhuoyuan Yu, Jiacheng Wang, Tianle Liu, Yihua Ren, Peng Yu 외 11명

시각-언어-행동 모델(VLA)의 실환경 성능은 전문가 시연 데이터의 범위가 좁고 물리적 상호작용 이해가 부족해 한계를 보인다. F4R(Failure for Rising)은 실환경 실패 사례를 시뮬레이션으로 변환해 정책을 개선하는 실환경-시뮬레이션-실환경 폐루프(closed-loop) 학습 프레임워크다. 에이전트가 롤아웃에서 실패를 자동으로 진단하고, 해당 실패를 태스크 관련 공간·물리 조건을 보존하는 객체 중심 테이블탑 시뮬레이션 환경으로 재구성한다. 재구성된 환경에서 실패 조건 기반 시뮬-실환경 공동 학습(co-training)과 강화학습(RL)으로 정책을 정제한 뒤 재배포하며, 새로 관측된 실패는 다음 학습 사이클에 지속적으로 반영된다. 4가지 조작 태스크 실환경 평가에서 분포 내(In-Distribution) 성공률 93.75%, 분포 외(Out-of-Distribution) 성공률 90.0%를 달성했으며, 추가 실환경 교정 시연 없이 예산을 맞춘 Targeted BC 기준선 대비 OOD 조건에서 18.75%p 높은 성능을 보였다.

Jakub Żerdzicki / Unsplash
2609.35570v1

EdgeVLN: 런타임 인식 기반 양자화 시각-언어 내비게이션 엣지 배포 모델

EdgeVLN: Runtime-Aware Deployment Ready Quantized Vision Language Navigation Model

Rithvik Jonna, Man Namgung, Aakash Gurram, Tinoosh Mohsenin

시각-언어 내비게이션(VLN) 모델은 고성능 플랫폼을 전제로 설계되어 메모리·전력이 제한된 로봇 엣지 디바이스에 직접 올리기 어렵다. 이 연구는 양자화된 StreamVLN 백본과 경량 인과 트랜스포머인 LATTE(Latent Trajectory Termination Extractor)를 결합한 EdgeVLN을 제안한다. LATTE는 정지 행동 검증 순위를 예측해 실시간 정지 판단을 개선하며, 양자화로 확보된 예산 안에서 백본 은닉 상태를 재활용하므로 추가 비전 인코더나 포워드 패스가 필요하지 않다. R2R VLN-CE 비출현 검증 에피소드 1,839개를 대상으로 평가한 결과, 4비트 IQ4 NL 모델에서 성공률(SR) 58.02%를 기록하며 BF16 기준선을 초과했다. NVIDIA Jetson Orin NX 16 GB에서 IQ4 NL은 11.35 GB 상주 메모리를 사용하면서, 스토리지 스트리밍 BF16 대비 20.8배 빠르고 13.3배 적은 에너지를 소비했다.

Kindel Media / Pexels
2609.35516v1

Inspection-SPARS: 점검 계획을 위한 과제 지향 희소 로드맵

Inspection-SPARS: Task-Oriented Sparse Roadmaps for Inspection Planning

Adir Morgan, Oren Salzman, Kiril Solovey

검사(inspection) 계획은 주어진 관심 지점(POI, Points of Interest) 집합을 모두 관측하는 최단 충돌 회피 경로를 구하는 문제다. 샘플링 기반 방법은 밀집 로드맵 위에서 그래프 검사 계획(GIP, Graph Inspection Planning) 문제로 변환해 풀지만, 밀집 로드맵은 조합 탐색 공간이 커져 실용적인 시간 내에 좋은 해를 얻기 어렵다. Inspection-SPARS는 과제 무관(task-agnostic) 희소화 기법인 SPARS 프레임워크를 확장해, POI 커버리지를 연결성·경로 품질과 함께 희소화의 1순위 기준으로 통합한 기법이다. 현실적인 3D 환경 실험에서 정점·간선 수를 4~8배 줄이면서 커버리지를 유지하고, GIP 솔버가 밀집 로드맵 대비 최대 25% 짧은 순회 경로를 계산하도록 했다.

ThisIsEngineering / Pexels
2609.35493v1

사족보행 탐사 로봇의 외수용-고유수용 매핑을 활용한 지형 인식 자율 행성 탐사

Terrain-Aware Autonomous Planetary Exploration for Exteroceptive-Proprioceptive Mapping with Quadruped Scouts

Alberto Sanchez-Delgado, João Carlos Virgolino Soares, Victor Barasuol, Claudio Semini

이 논문은 달 표면과 유사한 환경에서 사족보행 로봇이 미지의 지형을 자율 탐사하는 프레임워크를 제안한다. 온보드 RGB-D 카메라로 로봇 중심 고도 지도를 구축하고 기하학적 통과 가능성(traversability)을 추정해 자율 경로 계획에 활용한다. 외수용(exteroceptive) 정보와 함께 고유수용(proprioceptive) 측정값이 로봇-지형 상호작용 정보를 제공하며, 두 정보는 전역 다층 지도에 통합된다. 탐사 모듈은 미탐사 관심 영역에서 목표 지점을 선정하고, 자율 항법 시스템이 충돌 회피 이동을 수행한다. NVIDIA Isaac Sim 시뮬레이션 결과, 지형 정보 축적 이후의 이동이 초기 탐사보다 평균 수송 비용(Cost of Transport, CoT)이 낮게 나타났다.

Dr Failov / Pexels
2609.35482v1

ForVis: 산림 수관 하부 UAV 비행 기반 VIO 현장 데이터셋 및 벤치마크

ForVis: An In-Field Dataset and Benchmark for VIO Using Under-Canopy UAV Flights in Forests

Arman Kiani, Masoud Ataei, Elvis Gyaase, Jeffrey Eiyike, Aaron Weiskittel 외 2명

ForVis는 산림 환경에서의 UAV 비행 중 시각-관성 동시 위치 추정 및 지도 작성(VI-SLAM) 성능 평가를 위한 현장 데이터셋과 벤치마크다. 데이터셋은 개방 초원·수관 상부·수관 하부 세 가지 조건에서 총 12회 비행을 포함하며, 563.8초 비행과 1,096.8m 궤적으로 구성된다. Intel RealSense D435i와 OAK-D Pro Wide 두 센서로 동시 기록하였고, 관성 및 비행 컨트롤러 데이터도 함께 제공한다. 7개의 오픈소스 VI-SLAM 시스템을 504회 실행하여 벤치마크한 결과, 알고리즘 간 성능 차이보다 센서 선택이 궤적 오차에 더 큰 영향을 미치는 것으로 나타났다. 7가지 방법 모두 D435i보다 OAK-D Pro Wide에서 낮은 중앙값 오차를 기록했다.

ThisisEngineering / Unsplash
2609.31606v1

희소 성공 신호로부터 로봇 정책 학습: STL-Guided Stein Variational Policy Gradient

Learning Robot Policies from Sparse Success Signals via STL-Guided Stein Variational Policy Gradient

Hongrui Zheng, Cristian Ioan Vasile, Antonio Loquercio, Rahul Mangharam

희소 성공 신호 환경에서 로봇 정책을 학습하는 것은 정밀한 접촉 결과나 다중 조건의 동시 충족이 필요한 경우 어렵다. 기존의 보상 형성(reward shaping) 기법은 밀집 피드백을 제공하지만, 지역적 진행이 전체 태스크 완수로 이어지지 않는 문제가 있다. 저자들은 신호 시제 논리(STL, Signal Temporal Logic) 기반 Stein Variational Policy Gradient인 STL-SVPG를 제안하며, 이는 부드러운 STL 강건도(robustness)를 궤적 수준 학습 목표로 사용하는 집단 기반(population-based) 방법이다. 동역학을 통한 목표 미분으로 지역 진행이 아닌 전체 태스크 명세에 따라 각 행동의 기여를 평가한다. 쿼드콥터와 매니퓰레이터를 포함한 6개 태스크 실험에서 비교 방법 대비 5개 벤치마크에서 가장 높은 평균 성공률을 기록했으며, 시뮬레이션 학습 정책이 실환경으로 전이되었다.

Pavel Danilyuk / Pexels
2609.31577v1

Generate, Track, Improve: RL 파인튜닝 모션 생성기를 활용한 인지 기반 멀티스킬 휴머노이드 이동

Generate, Track, Improve: Perceptive Multi-Skill Humanoid Locomotion with RL-Fine-Tuned Motion Generators

Zachary Olkin, William D. Compton, Aaron D. Ames

이 연구는 휴머노이드 로봇의 다기능 이동을 위한 2단계 로코모션(locomotion) 아키텍처를 제안한다. 1단계는 원시 깊이(depth) 이미지에서 전신 궤적을 계획하는 플로우 매칭(flow matching) 모션 생성기이며, 2단계는 제어 가이드 강화학습(RL)으로 훈련된 추적 정책이 생성된 모션을 따른다. 두 정책은 동적으로 최적화된 인간 동작 데이터 기반의 지형 일관성 모션 클립 라이브러리로 훈련된다. 핵심 기여는 어드밴티지 가중 회귀(advantage weighted regression)를 활용한 오프-폴리시(off-policy) RL 파인튜닝 루프로, 온-폴리시 잔차 파인튜닝 대비 샘플 효율이 높고 미지의 지형·기술 조합에서 일관성이 향상된다. Unitree G1 휴머노이드를 대상으로 한 실외 실험에서 지형 통과 성공률이 최대 25 퍼센트포인트, 기술 선택 정확도가 최대 80 퍼센트포인트 개선되었다.

Gustavo Denuncio / Pexels
2609.31507v1NeurIPS

SatNav: 위성 영상 기반 장거리 UAV 시각-언어 내비게이션 확장형 벤치마크

SatNav: A Scalable Benchmark for Long-Horizon UAV Vision-Language Navigation from Satellite Imagery

Jiajun Jiang, Chunliang Hua, Zichun Chen, Yanxing Wu, Zeyuan Yang 외 2명

SatNav는 비용이 높은 3D 재구성 자산 의존도를 줄이기 위해 고해상도 위성 영상을 활용해 구축한 UAV 시각-언어 내비게이션(VLN) 벤치마크다. 자동화된 파이프라인으로 18개 도시 59개 장면에서 118,000개 에피소드를 생성했으며, 평균 궤적 길이는 379m다. 루프 진행 추적, 랜드마크 기반 공간 추론, 계수 단서 포함 경로 추종을 각각 목표로 하는 Boundary·Landmark·Route 세 가지 과제 유형으로 장기 메모리와 지리공간 추론 능력을 평가한다. 전환 가능한 메모리 구성요소를 갖춘 모듈형 프레임워크 SwiftVLN을 함께 제안하고 메모리 설계 절삭(ablation) 실험을 수행했다. 위성 영상으로 훈련한 내비게이션 모델이 실제 UAV 비행 관측 데이터에서도 동작함을 전이(transfer) 실험으로 확인했다.

Dom J / Pexels
2609.31452v1

로봇 천 펼치기를 위한 비전 기반 6-DoF 파지 자세 추정

Vision-Based 6-DoF Grasp Pose Estimation for Robot Cloth Unfolding

Domen Tabernik, Peter Nimac, Jan Jerićević, Danijel Skočaj, Andrej Gams

천 조작은 변형 가능하고 고차원적인 특성으로 인해 폴드·엣지·파지 지점의 잦은 폐색(occlusion)이 발생해 복잡한 지각 문제를 야기한다. 본 연구는 한 매니퓰레이터가 천을 고정하고 다른 쪽이 최적 지점에서 파지해 펼치는 공중 재파지(regrasping-in-the-air) 전략을 적용하며, 관측된 천 형상에서 유효 파지 지점과 6자유도(6-DoF) 파지 자세를 동시에 예측하는 딥러닝 프레임워크 CeDiRNet-6DoF를 제안한다. 밀집 3D 파지 회귀(dense 3D grasp regression)와 분할(segmentation), 사인-코사인 인코딩된 오일러 각도를 결합해 펼쳐진 천 면적을 최대화하는 파지 구성을 추정한다. ICRA 2024 Cloth Competition 프레임워크 기반의 양팔 로봇 실기 환경에서 평가했으며, 공동 분할·배경 무작위화·이미지 크롭의 기여를 절제 연구(ablation study)로 검증했다.

Green odette / Pexels
2609.31439v1

컴플라이언스 활용 학습: 로봇 삽입을 위한 정책-어드미턴스 학습 프레임워크

Learning to Leverage Compliance: A Policy-Admittance Learning Framework for Robotic Insertion

Chongren Wang, Minghe Li, Honghua Dai, Zhicheng Lin, Shiyang Wei 외 1명

LeCo(Leverage Compliance)는 고정 어드미턴스(admittance) 제어 하에서 시각 정책이 실행 중 접촉 상호작용을 활용하도록 학습하는 정책-어드미턴스 학습 프레임워크다. 기존 결합 방식에서는 정책이 접촉 중 계속 힘을 가하는 반면 컨트롤러가 위치를 양보하여 두 요소가 서로 상충되는 문제가 발생한다. 다중주기(multirate) 피드백 메커니즘이 고속 접촉 기록을 정책 전이 보상으로 집계하며, 충돌 비용(conflict cost)과 고하중 꼬리 비용이 비생산적인 하중을 줄이도록 정책을 유도한다. 실기 4종 커넥터 조립 과제에서 통합 성공률 94%를 기록했으며, 합력 피크와 토크 피크가 비교 기준 대비 각각 약 30%, 64% 감소하였다. 충돌 형성(conflict shaping) 보상을 추가하면 성공 시도의 충돌 밀도 중앙값이 약 53% 줄어드는 것으로 나타났다.