본문으로 건너뛰기

PAPERS

논문 트래커

arXiv cs.RO 신규 논문을 매일 수집해 한국어 요약을 붙입니다. 학회 채택 정보는 저자 코멘트에서 자동으로 추출합니다.

473건학회 채택 6건
Google DeepMind / Unsplash
2609.26795v1

φ-RIE: 사진 수준 재구성에서 상호작용 환경으로

φ-RIE: From Photorealistic Reconstruction to Interactive Environments

Runyi Yang, Deheng Zhang, Xiaoye Wang, Kanzhi Wu, Lei Sun 외 4명

3D 가우시안 스플래팅(3D Gaussian Splatting, 3DGS)은 장면을 사실적으로 재구성하지만, 결과 표현은 물리적 상호작용을 지원하지 않는다. φ-RIE는 선택된 객체를 이동 가능한 시뮬레이터 에셋으로 변환하는 동시에 나머지 배경 재구성을 보존하는 Gaussian 기반 파이프라인이다. 핵심 설계 원칙은 에셋 구성과 배경 제거를 결합하는 것으로, 하나의 객체 식별자가 이동 가능한 에셋과 제거·복원할 장면 콘텐츠를 함께 정의한다. ScanNet++ 50개 장면 실험에서 증거 기반 선택과 등록 재시도를 적용한 결과, 20 mm 기준 매칭 F1 점수가 0.336에서 0.383으로 향상되었다. 추가 실험에서는 에셋 실행 가능성과 단일 생성기 기준 대비 조작 성능 향상도 확인되었다.

Steve A Johnson / Pexels
2609.26792v1CoRL

DreamStream: 종단간 주행을 위한 정책 지향 생성 시뮬레이션

DreamStream: Towards Policy-Oriented Generative Simulation for End-to-End Driving

Ziyang Leng, Sicheng Mo, Seth Z. Zhao, Haoyuan Cai, Yu Zeng 외 2명

종단간(end-to-end) 주행 정책을 시뮬레이션에서 평가할 때 기존 플랫폼은 시뮬레이션-실제 시각적 격차(sim-to-real visual gap)로 인해 정책의 폐쇄 루프(closed-loop) 의사결정 평가가 왜곡된다는 문제가 있다. DreamStream은 시뮬레이터 기반 자기회귀 비디오 모델을 활용하는 생성형 폐쇄 루프 시뮬레이터로, 시나리오 레이아웃과 동적 객체의 시간적 일관성 같은 정책 관련 특징을 유지하면서 시각적 외양을 변화시킨다. 기존 FID 등 지각 지표가 이러한 특징 보존을 잘못 순위 매기는 문제를 해결하고자, 공개된 종단간 정책의 장면 맥락 특징에 대한 프레셰 거리(Fréchet distance)로 시뮬레이션-실제 격차를 측정하는 새 지표 FDπ를 제안한다. FDπ 기준으로 DreamStream은 nuScenes에서 기존 최강 폐쇄 루프 시뮬레이터 대비 1.6배, NAVSIM에서 4.7배 개선된 수치를 보인다. 이를 바탕으로 비반응형 실제 세계 벤치마크 NAVSIM을 적대적 주행 행동과 날씨 변화가 있는 상호작용 테스트 환경으로 전환한 Navhard-CL 벤치마크를 구성하며, 기존 벤치마크에서 간과되어 온 스코어러 편향·회복 행동 부재 등 여러 실패 유형을 드러낸다.

Kindel Media / Pexels
2609.26766v1

TM-APR: 해석적 온라인 적응을 통한 열화상 시간적 기억 기반 위치 인식

TM-APR: Thermal Temporal-Memory Localization via Analytic Online Adaptation

Yanshuo Bai, Kanji Tanaka

열화상 시각적 장소 인식(Thermal VPR)은 카메라 관측값을 지도상 좌표에 매핑하는 기술로 자율 주행의 전제 조건이 된다. 기존 방법은 환경 의존성이 높고 온라인 재학습 비용이 크며 비선형 도메인 이동을 처리하지 못해 실시간 배포 단계에서 실패한다. 이 연구는 해석적 클래스 증분 학습(Analytic Class-Incremental Learning, ACIL)을 도메인 불변 VPR에 처음으로 결합하며, 역전파 없이 그래디언트 프리 행렬 업데이트만으로 기존 미세 조정 방법을 능가하는 기준선을 구성한다. 표준 ACIL의 선형 가정으로 인한 비선형 열화상 변동 취약점을 극복하기 위해, ACIL과 현대 제어 이론의 대수적 등가성을 활용해 비선형 언센티드 전파(U-ACIL), 가우시안 혼합 분할(GMM-ACIL), 미니맥스 H∞ 최적화(H∞-ACIL)를 업데이트 루프에 통합한다. 제안 프레임워크는 O(1) 연산 복잡도에서 폐형(closed-form) 행렬 업데이트를 보장하며, 온라인 업데이트 지연 시간이 센서 수집 주기 미만으로 엄격히 유지되어 실시간 SLAM 파이프라인에서 궤적 점프를 제거한다.

Arthur Hinton / Unsplash
2609.26753v1ICRA

단일 센서 유닛의 측정 이력을 활용한 비정상 유동 내 수중 탐색

Underwater Navigation in Unsteady Flows Using Measurement Histories from a Single Sensing Unit

Linhao Jin, Qimin Feng, Peter Gunnarson, Qiang Zhong

분산 유량 센서 배치가 어려운 소형 수중 로봇 환경에서, 인과적 관측기(causal observer)를 이용해 단일 센서 유닛의 유한 측정 이력으로부터 횡방향 속도를 추정하는 방법을 제안한다. 이를 통해 기존 3점 동시 유량 샘플링을 로봇 중심 단일 측정으로 대체한다. 원형 실린더 후류의 레이놀즈수(Re) = 100 조건에서만 학습한 관측기가 재훈련 없이 Re = 205와 240 환경에서 각각 84.4%와 80.6%의 탐색 성공률을 기록하며, 이는 직접 공간 센싱 대비 각각 7.4, 4.6 퍼센트포인트 낮고 단일 시점 유량만 쓰는 기준 관측기보다 30퍼센트포인트 이상 높다. 장애물 형상별 실험에서 정방형 프리즘 후류에서는 성능이 유지되나 삼각형 프리즘 후류에서는 저하되는 경향이 나타났다.

Enchanted Tools / Unsplash
2609.26672v1

ε4P: 고정밀 로봇 조작을 위한 불완전 데이터 업사이클링

Imperfection for Precision: Upcycling Imperfect Data for High-Precision Robotic Manipulation

Hao Wei, Yang Liu, Chao Tang, Shengbao Li, Jiangtao Chen 외 5명

시각-언어-행동 모델(VLA) 기반 고정밀 조작 학습에는 원격조작 등 태스크별 고품질 데이터가 필요해 수집 비용이 크다. 연구팀은 ε4P(varepsilon4P)를 제안하며, 통상 폐기되던 두 종류의 데이터—목표 태스크의 저정밀 데이터와 다른 태스크의 고정밀 데이터—를 업사이클링한다. 플로우 매칭(flow-matching) 궤적에서 고잡음 구간에는 저정밀·목표 태스크 데이터를, 저잡음 구간에는 고정밀·타 태스크 데이터를 각각 할당해 두 데이터의 강점을 분리 활용한다. 실기 로봇 실험에서 불완전 데이터 추가 시 정책 성능이 최대 31.7 퍼센트포인트 향상되었다. 동량의 태스크별 고품질 데이터를 불완전 데이터로 대체할 때 평균 성능 저하는 4.2 퍼센트포인트에 그쳤다.

lin lin / Pexels
2609.26618v1

NavSafe-infty: 포토리얼리스틱 환경에서의 폐루프 주행 안전성 벤치마킹

NavSafe-infty: Benchmarking Closed-Loop Driving Safety in Photorealistic Environments

Yuxin Bao, Hongwei Ruan, Luobin Wang, Seth Z. Zhao, Ziyang Leng 외 5명

NavSafe-infty는 28가지 이벤트 유형을 포괄하는 280개 시나리오로 구성된 포토리얼리스틱 폐루프(closed-loop, CL) 주행 안전 벤치마크로, 교통사고·취약 도로 이용자 충돌·교통 위반·교통 사고 4개 범주의 능력 점수를 산출한다. 20개 종단간(end-to-end, E2E) 주행 정책을 평가한 결과, 개방 루프(open-loop, OL) 벤치마크에서의 성능 향상이 폐루프 안전성으로 신뢰성 있게 전이되지 않는 것으로 나타났다. 수동 시연 교란(passive demonstration perturbation)은 폐루프 롤아웃이 교란된 훈련 상태 근방에 머무를 때만 효과적이었다. OL 강화학습 파인튜닝은 안전 여유를 자아 진행(ego progress)으로 대체하는 보상 해킹(reward hacking) 현상을 보였으며, 폐루프 피드백이 이를 복합 안전 오류로 증폭시켰다. 벤치마크와 커스터마이즈 가능한 이벤트 큐레이션·정책 진단 툴박스는 오픈소스로 공개될 예정이다.

Mikhail Nilov / Pexels
2609.26580v1

심층 Koopman MPC를 이용한 휠로더 V-사이클 자동화

Wheel-loader V-Cycle Automation with Deep Koopman MPC

Armin Abdolmohammadi, Navid Mojahed, Dinesh Kumar, Bahram Ravani, Shima Nazari

이 논문은 토공 작업 중 전진·후진을 반복하는 휠로더(wheel loader)의 V-사이클 기동을 자동화하기 위한 계층적 제어 프레임워크를 제안한다. 상위 계층에서는 저차수 관절형 기구학 모델을 사용해 전진·후진 경로를 공유 중간 상태를 통해 공동 최적화한다. 하위 계층에서는 Algoryx Dynamics 고충실도 시뮬레이션 데이터를 기반으로 전진·후진 각각에 대한 심층 이중선형 쿠프만(Koopman) 모델을 학습한다. 학습된 쿠프만 표현은 모델 예측 제어(MPC, Model Predictive Control) 정식화에 통합되어 50ms 실행 루프 내에서 실시간으로 동작한다. 고충실도 시뮬레이션 실험에서 제안 프레임워크가 정확하고 계산 효율적으로 V-사이클 기동을 수행함이 확인되었다.

Mehmet Turgut Kirkgoz / Pexels
2609.26567v1IROS

최종 과제 성공률을 넘어서: 로봇공학에서 시각적 경험 검색을 감사하는 방법

Beyond End-Task Success: How to Audit Visual Experience Retrieval in Robotics

Eshika Pathak, Leela Krishna

로봇이 과거 경험을 저장하고 새로운 장면에서 재사용할 때 대부분의 시스템은 시각적 유사도로 경험을 선택하며, 기존 평가는 선택된 경험의 과제 성공률만 보고한다. 이 방식은 라이브러리 내 소수의 범용 경험에 의존해 높은 점수를 얻거나, 선택 규칙 자체의 결함을 드러내지 못하는 한계를 가진다. 연구진은 감사(audit) 방법론을 제안해 2가지 조작 과제, 3가지 재사용 메커니즘, K=3·10·50 크기 라이브러리에서 저장된 모든 경험을 모든 쿼리 장면에 실행했다. 실험 결과, 시각적 거리는 특정 경험-장면 쌍의 성공 여부 예측에서 AUROC 최대 0.96을 기록했으나, K=50 조건에서 5개 시각 임베딩(visual embedding) 중 4개는 장면 내 후보 순위를 무작위 수준(AUROC 0.45~0.52)으로만 정렬했다. 완전한 실행이 불가능한 실제 상황을 위해, 선택된 경험의 분포와 사후(hindsight) 최적 단일 경험의 성공률이라는 두 가지 저비용 보고 지표를 제안한다.

Jonas / Unsplash
2609.26564v1

시간적 모드 전환과 지형 횡단 추적을 갖춘 공중-지상 운동 제어 학습

Learning Air-Ground Motion Control with Temporal Mode Switching and Cross-Terrain Tracking

Ruitian Pang, Mingrui Li, Xuanting Liu, Tiancheng Lai, Juncheng Chen 외 8명

본 연구는 수동 휠 기반 지상-공중 이중모드 차량(TABV)을 위한 학습 기반 운동 제어 프레임워크를 제안한다. 단일 포인트 비행시간(ToF, time-of-flight) 측정값·로봇 상태·미래 경로 정보를 조합한 학습된 모드 선택기가 자율적인 공중-지상 전환을 담당한다. 지상 제어에는 다중 지형 훈련과 동역학 무작위화를 적용한 강화학습(RL) 정책을 사용해 다양한 지형에서 강건한 궤적 추적을 구현한다. 시뮬레이션 및 실기 실험 결과, 학습된 모드 선택기는 어려운 전환 구간에서 규칙 기반 선택기를 앞섰고, 지상 제어기는 모든 테스트 조건에서 PID보다 낮은 위치 RMSE를 기록했으며 비선형 모델 예측 제어(NMPC)가 실패한 구간에서도 추적을 유지하였다. 전체 시스템은 여러 차례의 자율 모드 전환을 포함한 101m 공중-지상 궤적을 위치 RMSE 0.08m로 추적하였다.

Jakub Żerdzicki / Unsplash
2609.26561v1IROS

합성 데이터 단독 학습 기반 비전 기초 모델을 활용한 단안 우주선 자세 추정

Vision Foundation Models with Synthetic-Only Training for Monocular Spacecraft Pose Estimation

John Church, Vazghen Nikolian

대규모 자기지도 비전 트랜스포머(ViT) 기초 모델인 DINOv3를 저순위 적응(LoRA, 랭크 64)으로 파인튜닝하여 히트맵 기반 자세 추정 아키텍처의 인코더로 사용했다. 합성 데이터만으로 학습했음에도 SPEED+ 라이트박스와 선램프 테스트 세트에서 평균 회전 오차 각각 1.17°, 1.56°를 기록하여, 기존 EagerNet의 1.75°, 2.66°를 개선했다. 파라미터 수가 300M에서 840M으로 늘어남에 따라 성능이 지속적으로 향상되었으며 포화 현상은 아직 관찰되지 않았다. 840M 모델을 Jetson Orin NX 16GB에서 평가한 결과 크롭당 추론 시간 133.8 ms, 보드 소비 전력 32.0 W를 기록했다. 최종 모델은 3-시드 앙상블과 4-회전 테스트 타임 증강을 함께 적용한 구성이다.

Pavel Danilyuk / Pexels
2609.26520v1

MATE: 휴머노이드 협업 데이터 수집을 위한 멀티 에이전트 가상 원격조작 플랫폼

MATE: Multi-Agent Virtual Teleoperation Platform for Humanoid Collaboration Data Collection

Yichuan Yu, Youzhuo Wang, Yiming Ren, Di Feng, Yexuan Yang 외 4명

MATE는 지리적으로 분산된 여러 조작자가 물리 기반 공유 가상 환경에서 전신 휴머노이드를 동시에 원격 제어할 수 있는 멀티 에이전트 가상 원격조작(teleoperation) 플랫폼이다. 실제 다수의 로봇과 동일 공간 운용 없이도 휴머노이드 간, 물체 및 환경 간의 물리적 결합 상호작용을 유지한다. 이 플랫폼으로 물체 전달, 릴레이 배달, 환경 상호작용, 협력 운반 등 5가지 장기 태스크에 걸쳐 2,500개 공동 에피소드, 총 24.1시간 분량의 다중 휴머노이드 협업 데이터셋을 구축하였다. 상호작용이 풍부한 시연 데이터 학습 효율 향상을 위해 실행 정렬 상호작용 샘플링 전략인 EAIS(Execution-Aligned Interaction Sampling)를 제안한다. 모방학습 및 시각-언어-행동 모델(VLA) 정책 실험에서 가상 시연으로부터 실제 휴머노이드로의 제로샷 전이가 실물 환경 파인튜닝 없이 가능함을 보였다.

Vanessa Loring / Pexels
2609.26499v1

로컬 코딩 에이전트를 활용한 조작 기술 일반화

Generalizing Manipulation Skills with a Local Coding Agent

Raman Talwar, Elias Nijs, Andreas Verleysen, Francis wyffels

로컬 오픈웨이트 시각-언어 모델(VLM)인 Qwen3.8-27B를 코딩 에이전트 프레임워크에 결합해 UR3e 로봇 팔을 제어하는 시스템을 구성했다. 모델은 운동학·안전 제한·컴퓨터 비전 서비스를 호출하는 코드를 스스로 작성·실행하며, 추가 학습이나 별도 프로그래밍 없이 새로운 과제 변형에 원샷(one-shot) 일반화하는지를 검증한다. 색상·크기·형태 등 다양한 특성을 포함한 아동용 장난감 기반 9개 과제(각 5회 시도, 총 45회)에서 30회 성공하였으며, 과제별 소요 시간은 3.4분에서 67.5분이었다. 성공한 과제를 재수행하도록 했을 때 소요 시간이 50% 단축되어 반복에 따른 자기 개선(self-improvement) 경향이 관찰되었다. 논문은 로컬 코딩 에이전트의 한계도 함께 제시하며 실환경 배포를 위한 향후 과제를 논의한다.

Jan van der Wolf / Pexels
2609.26490v1

일상 환경 로봇 벤치마킹: 실험실 실험에서 실세계 운용까지

Benchmarking Robots for Everyday Environments: From Lab Experiments to Real-World Operations

Raphael Memmesheimer, Martina Overbeck, Dominik Beyer, Björn Kral, Sabine Bellmann 외 17명

이 논문은 공공 환경에 배치된 로봇을 평가하기 위한 학제간 벤치마킹(benchmarking) 프레임워크를 제시한다. 2023년부터 2025년까지 3년에 걸쳐 총 7회의 벤치마킹 이벤트(합의 워크숍 1회, 현장 평가 6회)를 진행하였으며, 야외 공원 청소·지하보도 청소·도서관 안내 보조의 세 가지 유스케이스에서 각기 다른 로봇 3종을 평가했다. 로봇공학·인간-로봇 상호작용(HRI)·안전·경제성 분야 전문가 패널이 평가 기준을 체계적으로 개발·정제하여, 기술적 성능뿐 아니라 비구조화된 사람 중심 환경에서의 운용 함의까지 분석했다. 주요 성공 요인으로는 과제 이행률, 상호작용 품질, 안전성, 경제적 실현 가능성이 도출되었다. 연구 결과는 실험실 프로토타입과 실세계 운용 사이의 간극을 좁히려는 연구자 및 실무자에게 구체적 지침을 제공한다.

Opt Lasers from Poland / Pexels
2609.26467v1IROS

RouteRLT: 시각-언어-행동 정책을 제어하는 RL 전문가의 개입 시점과 선택 학습

RouteRLT: Learning When and Which RL Specialist Should Control a Vision-Language-Action Policy

Chongyu Zhu, Jaden Hinds, Hyegang Kim, Juan Sebastian Rojas, Ramy Elmallah 외 1명

시각-언어-행동 모델(VLA)은 커넥터 삽입·케이블 관리 등 접촉이 많은 산업 작업의 정밀 단계에서 성능이 떨어지는 경향이 있다. RouteRLT는 범용 VLA가 어느 시점에, 어떤 강화학습(RL) 전문가 정책에 제어를 넘겨야 하는지를 학습하는 라우팅 프레임워크다. 위상 선택기(phase selector), 일시적 전환을 억제하는 안정화기(stabilizer), 청크 정책 출력 간 전환을 담당하는 행동 경계 관리자(action-boundary manager)의 세 구성 요소로 이루어진다. LIBERO 시뮬레이션 평가에서 학습된 라우팅은 기반 VLA를 상회하며, 배포 시점에 위상 경계 정보 없이도 특권적 경계를 사용한 라우팅에 준하는 성능을 보였다. 실제 로봇 실험에서는 케이블 집기와 포트 삽입 전문가 모두에게 자동으로 제어가 위임됨을 확인했다.

Erik Mclean / Pexels
2609.26423v1

Dr-LiSA: SE(3) 위치추정을 위한 직접 레이더-라이다 스캔 정합

Dr-LiSA: Direct Radar-Lidar Scan Alignment for SE(3) Localization

Alex Zhang, Daniil Lisus, Cedric Le Gentil, Timothy D. Barfoot

Dr-LiSA는 2D 회전형 레이더 강도 측정값을 3D 라이다(lidar) 지도에 대해 SE(3)로 직접 위치추정(localization)하는 방법이다. 레이더는 악천후에 강인하고 라이다는 양호한 환경에서 정밀한 3D 지도를 제공해, 두 센서의 상호 보완적 특성을 결합하는 것이 목표다. 기존 레이더-라이다 위치추정 방법들은 평면 SE(2) 추정에 그쳤고 레이더-레이더 또는 라이다-라이다 시스템 대비 정확도가 낮았다. Dr-LiSA는 후보 자세에서 라이다 서브맵으로부터 레이더 측정을 예측하는 학습 기반 순방향 모델(forward model)을 활용해 예측 스캔과 실측 스캔 간 직접 광도 정합(photometric alignment)을 수행한다. 90km 이상의 실도로 데이터 평가에서 기존 레이더-라이다 방식보다 SE(2) 정확도가 높았고, 평면 정확도는 최신 레이더-레이더 시스템과 유사한 수준으로 보고되었다.

Robin van bienen / Unsplash
2609.24996v1CoRL

인간이 시연 가능한 범위를 넘어서는 학습

Learning Beyond What Humans Can Demonstrate

Yuchen Song, Aditya Mittal, Unnat Jain

행동 복제(behavior cloning) 기반 로봇 조작 학습은 전문가 시연 데이터를 필요로 하지만, 동적 안정성·정밀 접촉 타이밍·정교한 협응이 요구되는 작업에서는 인간 조작자가 시연 데이터를 수집하기 어렵거나 불가능한 경우가 있다. 이 논문은 GLIDE(Guardrails for Learning from Infeasible Demonstrations Efficiently) 프레임워크를 제안하며, 작업 설명과 원격조작(teleoperation) 코드를 입력받아 작업별 실패 원인을 추론하고 이를 실행 가능한 가드레일로 변환한다. 가드레일은 시스템 상태를 활용해 원격조작 및 정책 명령을 필터링하고 실패 유발 행동을 제약하며, 궤적 피드백을 통해 반복적으로 개선된다. 세 가지 조작 작업(토마토 접시 이동, 마커 전달 및 거치, 와인 서빙)에서 데이터 수집 성공률이 0~10%에서 70~90%로 향상되었다. 정책 실행 단계에서는 각 작업에서 70%, 60%, 60%의 성공률을 달성했다.

Vladimir Srajber / Pexels
2609.24995v1

MIGU: 조작 계획을 위한 불확실성 기반 멀티모달 명령 그라운딩

MIGU: Multimodal Instruction Grounding under Uncertainty for Manipulation Planning

Mingke Lu, Anxing Xiao, David Hsu

MIGU는 자연어와 제스처를 상호 보완적 단서로 활용하는 멀티모달 명령 그라운딩(multimodal instruction grounding) 모듈형 프레임워크로, 조작 계획과 직접 연결된다. 시선 방향·깊이 불확실성과 손 방향 추정 오차를 눈-손가락 기하학을 통해 전파하여 3D 기하학적 우도를 구성하고, 시각-언어 모델(VLM)이 생성한 의미론적 사전 확률과 베이즈 방식으로 융합한다. 결합된 신념(belief)을 기반으로 시스템은 하위 계획을 바로 진행하거나 사용자에게 명료화를 요청하는 행동 결정을 내린다. 그라운딩된 목표는 이동 조작(mobile manipulation) 및 탁상 과제-동작 계획(task-and-motion planning)의 목표 정의에 활용된다. 실제 환경 벤치마크에서 평가된 모든 기준선을 상회했으며, 절제 실험(ablation)을 통해 명시적 불확실성 모델링의 효과가 확인되었다.

Jan Antonin Kolar / Unsplash
2609.24976v1

DexTacWAM: 정교한 조작을 위한 시각-촉각 세계-행동 모델

DexTacWAM: A Visuo-Tactile World-Action Model for Dexterous Manipulation

Haoran Yuan, Zekai Wang, Boning Shao, Haoran Lu, Trevor Darrell 외 2명

정교한 조작(dexterous manipulation)은 시각만으로는 부분 관측에 그치는 접촉 역학에 의존하며, 기존 세계-행동 모델(WAM)은 시각 중심이라 이 접촉 역학을 직접 모델링하기 어렵다. DexTacWAM은 각 손가락 끝 촉각 정보를 독립적으로 인코딩하고 손가락·자세 인식 촉각 압축기로 집약한 뒤 비디오 확산 세계 모델(video diffusion world model)에 주입하는 시각-촉각 WAM이다. 22자유도(DoF) 양팔 플랫폼에서 접촉이 많은 6개 과제를 수행한 결과, DexTacWAM은 모든 과제에서 평균 70.6점을 기록해 최강 베이스라인 38.0점을 상회했다. 절제 실험(ablation)에서 촉각 세계 모델링을 제거하면 4개 과제 평균이 74.7에서 26.6으로 하락해, 접촉 진화를 예측 세계 상태의 일부로 모델링하는 것이 성능에 핵심임을 나타냈다. 사전 학습된 시각 VAE를 동결한 채 4시간의 촉각 인코더 적응과 과제당 약 100개의 시연만으로 시각 예측 품질을 시각 전용 대비 0.5 dB 이내로 유지하면서 촉각 인식을 추가할 수 있었다.

Kindel Media / Pexels
2609.24952v1

화성에서의 주행 학습: 지구 외 탐사 항법을 위한 시각 멀티모달 주행 가능성 추정

Learning to Drive on Mars: Visual Multimodal Traversability Estimation for Off-World Navigation

Darren Chiu, Cole Wilson, Andrei Tumbar, Gaurav S. Sukhatme, Steven Myint

이 논문은 Mars 2020 Perseverance 로버가 Jezero Crater 착륙 이후 수집한 500 솔(sol), 45 km 분량의 주행 데이터셋을 공개한다. 데이터셋에는 그레이스케일 스테레오 영상, 자세 정보, 가속도계 측정값, 로커-보기(rocker-bogie) 각도, 틸트 및 휠 슬립 추정치가 포함된다. 연구팀은 이 멀티모달 데이터를 기반으로 불확실성 인식(uncertainty-aware) 주행 가능성 추정(traversability estimation) 프레임워크를 제안한다. Mars 2020 데이터셋에서 제안 방법은 AUROC 0.874, F1 점수 0.758을 달성하며 가장 강력한 기존 방법 대비 각각 0.058, 0.156 향상된 성능을 보였다. 추출된 시각 표현은 탑재 경로 계획기 ENav와 통합되어 지상 로버 테스트베드에서도 동작이 확인됐다.

Rafael Minguet Delgado / Pexels
2609.24906v1

하이브리드 강화학습을 이용한 평면형 과수원의 시각운동 로봇 가지치기

Visuomotor Robotic Pruning in Planar Orchards Using Hybrid Reinforcement Learning

Abhinav Jain, Cindy Grimm, Stefan Lee

이 연구는 V-Trellis 사과·UFO 체리 등 평면형 수형(planar tree training system) 과수원에서 동면기 가지치기를 자동화하는 시각운동(visuomotor) 폐루프 제어기를 제안한다. 합성 데이터와 물리 기반 시뮬레이터만으로 훈련하고, 오프라인 데모와 온라인 롤아웃을 결합한 하이브리드 강화학습(reinforcement learning, RL) 알고리즘으로 정책을 학습한다. 손목 장착 카메라의 광학 흐름(optical flow) 입력만 사용해 완전한 3D 재구성 없이 절단 도구를 목표 절단점까지 안내한다. 3,000개 가지치기 지점에 대한 시뮬레이션 평가에서 V-Trellis 사과 49.9%, UFO 체리 46.0%의 성공률을 달성했다. 상업·실험 과수원 야외 현장 28회와 실내 실험실 10회를 포함한 총 38회의 실물 시험으로 제로샷(zero-shot) 시뮬레이션-실제 전이를 검증했으며, 실험실 시험에서 RRT-Connect 기준선보다 높은 성능을 보였다.