본문으로 건너뛰기

PAPERS

논문 트래커

arXiv cs.RO 신규 논문을 매일 수집해 한국어 요약을 붙입니다. 학회 채택 정보는 저자 코멘트에서 자동으로 추출합니다.

473건학회 채택 3건
cottonbro studio / Pexels
2610.02120v1

SkeleWAM: 효율적인 로봇 조작을 위한 골격 세계-행동 모델링

SkeleWAM: Skeleton World-Action Modeling for Efficient Robotic Manipulation

Juyi Sheng, Hua Wang, Mengyuan Liu

세계-행동 모델(WAM, World Action Model)은 로봇 행동 생성과 미래 상태 예측을 결합하는 방식이지만, 기존 모델들은 영상 또는 학습된 시각 잠재 표현을 사용해 기하 정보를 암묵적으로만 표현한다. SkeleWAM은 로봇 관절·물체 중심·상호작용 점으로 이루어진 희소 3D 골격으로 조작 장면을 표현한다. 골격은 RGB-D 관측과 고유감각(proprioception)으로부터 온라인으로 구성되며, 행동 생성과 미래 골격 예측에 공통 상태 표현으로 사용된다. 미래 골격 예측은 시각 재구성 없이 행동 학습에 추가적인 기하 지도 신호를 제공하며, 추론 시에는 메도이드 행동 합의(MAC, Medoid Action Consensus) 전략이 확률적 행동 샘플의 보조 합의 기제로 작동한다. LIBERO-Plus 벤치마크에서 57.1M 파라미터로 전체 성공률 85.9%를 기록해 Cosmos-Policy 대비 3.7 퍼센트포인트 높은 성능을 보였다.

Дмитрий Никитин / Pexels
2610.02110v1

GlassGuard: 로봇 내비게이션을 위한 검증된 유리 평면 매핑

GlassGuard: Verified Glass Plane Mapping for Robot Navigation

Hanwen Guo, Zhengzhi Lin, Yusen Xie, Ji Zhang

투명·반사 표면은 LiDAR 기반 SLAM에서 레이저가 유리를 통과해 충돌 경계가 지도에서 누락되는 문제를 일으킨다. GlassGuard는 파운데이션 비전(foundation vision) 모델이 제공하는 유리 인스턴스 마스크, 3D 구조 단서 기반 계량적 평면 가설, 그리고 깊이 정보 없이 수행하는 2D 투영 기하학 검증을 결합해 건축용 평면 유리를 전역 지도에 통합하는 프레임워크다. 유리 커버리지와 가용 공간 오염이라는 두 지표를 동시에 최적화하도록 설계되었다. 9개 건물 규모 장면, 총 2.1 km의 실제 로봇 주행 데이터에서 평가한 결과, 파노라마 버전 기준 유리 커버리지 85%를 달성했다. 동일한 핀홀(pinhole) 카메라 입력 조건에서는 비교 베이스라인 최대 61% 대비 82%의 커버리지를 기록하면서 프레임당 오탐 복셀(false voxel)은 5~17배 적게 발생했다.

Vanessa Loring / Pexels
2610.02089v1

HumanoidToolBench: 도구 선택부터 이동 실행까지 휴머노이드 도구 사용 벤치마크

HumanoidToolBench: Benchmarking Humanoid Tool Use from Selection to Mobile Execution

Kyochul Jang, Seohyeon Park, Ohchul Kwon, Sangjun Park, Junhyeok Choi 외 7명

HumanoidToolBench는 휴머노이드 로봇의 도구 사용 능력을 통합 평가하는 18개 과제 벤치마크로, 세 가지 시나리오·실행 수준·도구 세트 모드로 구성된다. 함께 공개된 ToolBook은 시뮬레이션과 실제 Unitree G1에서 수집한 3,100개의 시연 데이터셋이다. 시뮬레이션에서 7개, 실제 로봇에서 3개의 정책을 평가한 결과, 적절한 도구를 선택하는 능력과 최종 과제 완료 사이에 큰 성능 격차가 나타났다. GR00T N1.7을 대상으로 한 집중 실험에서는 학습되지 않은 도구에 대한 선택 정확도가 낮아지고, 관련 없는 지시가 주어져도 과제 실행이 중단되지 않는 현상이 확인됐다.

cottonbro studio / Pexels
2610.02054v1

UniWAM: 통합 월드-액션 모델

UniWAM: Unified World-Action Model

Jiayi Chen, Wenxuan Song, Jingbo Wang, Shuai Zhou, Xicheng Gong 외 11명

UniWAM은 물리적 추론기(physical reasoner), 세계 생성기(world generator), 행동 예측기(action predictor)를 단일 아키텍처로 통합해 시맨틱 이해, 시각 생성, 행동 예측을 공동으로 학습한다. 시각-언어-행동 모델(VLA)의 언어 능력을 체화 과제에 유지하기 위해 저수준 행동을 자연어로 표현하고, VQA 데이터·인간 1인칭 데이터·로봇 시연 데이터를 각 구성 요소에 배분하는 사전학습 방식을 도입한다. 사후학습 단계에서는 미래 시각 노이즈 증강(future visual noise augmentation)과 히스토리 조건부 플로우 매칭(history-conditioned flow matching)을 적용해 디노이징 스텝 수를 줄이면서 성능을 유지한다. 인간 1인칭 데이터와 로봇 데이터 모두에 데이터 정제·주석 파이프라인을 별도로 구축해 학습 데이터 품질을 확보했다. 분포 내 성능, 강건성, 일반화, 장기 과제 수행 등 다수 평가 항목에서 최고 성능을 기록했으며, 인간-로봇 공동 학습에서 로그-선형 스케일링 법칙(log-linear scaling law)이 존재함을 확인했다.

Nemuel Sereti / Pexels
2610.01985v1

H-SPAR: 입자 수송 및 자율 로봇을 위한 수역학 인식 시뮬레이션

H-SPAR: Hydrodynamic-aware Simulation for Particle Transport and Autonomous Robots

Navid Zarrabi, Nariman Yousefi, Sajad Saeedi

H-SPAR는 해양 환경 로봇 샘플링 임무를 통합 평가하기 위한 시뮬레이션 프레임워크다. 시공간적으로 변하는 유속장(velocity field), 라그랑지안(Lagrangian) 입자 수송, 확률적 샘플링, ROS 2/Gazebo 기반 무인 수상 로봇(USV) 자율주행을 하나의 구성으로 결합한다. 경로 계획 실험에서 전류 인식 계획기 SVF-RRT*는 계획 단계에서 기존 RRT* 대비 상류 비용을 69.4% 낮추었으나, 시변 유동 조건의 실행 단계에서는 이 절감 효과가 41.7%로 줄어들었다. 커버리지 실험에서는 스윕 방향 선택에 따라 입자 샘플링 비율이 최대 22.2% 달라지는 것으로 나타났다. 코드는 GitHub에 오픈소스로 공개되어 있다.

Leiada Krözjhen / Unsplash
2610.01972v1

BLT*: 디지털 트윈 불확실성 인식 계획을 위한 Informed Belief Localization Trees

BLT*: Informed Belief Localization Trees for Uncertainty-Aware Planning on Digital Twins

Elliot Preston-Krebs, Abhishek Goudar, Timothy D. Barfoot

Informed BLT*는 포인트 클라우드(point-cloud) 관측을 활용해 대규모 야외 디지털 트윈(digital twin)으로 확장 가능한 샘플링 기반 신뢰 공간 계획(BSP, belief space planning) 알고리즘이다. RRT*와 Informed RRT*를 2-바서스타인(W₂) 거리 메트릭을 사용해 신뢰 공간에 적용하였으며, 등방성 가우시안(isotropic Gaussian) 신뢰 상태를 가정해 관측을 반복 전파하지 않고도 조향(steering)과 재연결(rewiring)이 가능하다. 이를 통해 이전에 계산된 측정 정보를 재사용할 수 있어 계산 효율이 높아진다. 포인트 클라우드 기반 위치 추정에 활용 가능한 의미론적 레이블이 부여된 디지털 트윈 생성 프레임워크도 함께 제시한다. 시뮬레이션 환경과 디지털 트윈에서의 실험에서 대부분의 지도 조건 하에 초기 해 발견 속도가 더 빠르고 비용 수렴도 경쟁력 있는 수준으로 나타났다.

C M / Unsplash
2610.01959v1

해석적 국소 점수를 이용한 학습 불필요 확산 기반 모션 계획

Training-Free Diffusion Planning with Analytical Local Scores

Michael Y. Fatemi, Jinhao Liang, Ferdinando Fioretto

경로 탐색과 다중 로봇 모션 플래닝(motion planning)은 복잡한 기하학적 제약 환경에서 부드럽고 충돌 없는 궤적을 요구하며, 기존 확산(diffusion) 기반 플래너는 대규모 실현 가능 궤적 데이터를 학습해야 해 특정 지도에 종속되는 한계가 있다. 본 논문은 학습된 전역 점수 대신 장애물·부드러움·속도·에이전트 간 실현 가능성 항으로부터 유도한 해석적 국소 점수를 사용하는 학습 불필요 확산 기반 플래너를 제안한다. 핵심 관찰은 궤적의 점수가 인접 웨이포인트(waypoint)와 근접 제약 조건 간의 국소 상호작용만으로 재구성될 수 있다는 것이다. 이 구조를 활용해 고전적 궤적 최적화의 구조와 확산 모델의 반복 정제 특성을 동시에 유지하는 분해된 디노이징 절차를 구성한다. 실험에서는 100개 이상의 장애물이 있는 환경에서 300개 이상의 에이전트에 대한 실현 가능 경로를 GPU로 6초 이내에 생성하며, 학습 기반 및 최적화 기준선보다 높은 성능을 보였다.

Ron Lach / Pexels
2610.01943v1

TouchTherm: 촉각 및 열 렌더링을 위한 객체 멀티모달 디지털 트윈 구축

TouchTherm: Building Multimodal Digital Twins of Objects for Tactile and Thermal Rendering

Yitao Zhang, Hong Ying, Haoran Guo, Xiaoying Zhou, Guanyu Chen 외 1명

TouchTherm은 실제 물체로부터 시각·촉각·열 속성을 통합한 시뮬레이션용 객체 자산을 구축하는 프레임워크다. 시각·촉각 재구성에는 구조광(structured-light) 스캐닝과 포토메트릭 스테레오(photometric stereo)로 얻은 다시점 법선 맵을 결합해 미세 표면 높이장(micro-height field)을 복원한다. 열 재구성에는 제어된 가열 후 자연 냉각 과정을 동기화된 다시점 적외선 영상으로 촬영하고 물리 정규화된 동적 열장(thermal field)을 추정한다. 20개 객체 실험에서 표면 온도 평균절대오차(MAE)는 30초 시점에서 0.465°C, 45초 시점에서 0.592°C로 나타났다. 복원된 촉각 자산은 합성-실제 간 전이(synthetic-to-real) 물체 인식에 활용되었으며, 장갑 기반 가상현실(VR) 시스템을 통해 공간·시간적으로 변화하는 온도 피드백이 구현되었다.

Serg Alesenko / Pexels
2610.01927v1

CLoSeR: 장거리 스트리밍 3D 재구성을 위한 루프 클로저

CLoSeR: Closing the Loop for Long-Context Streaming Reconstruction

Moyang Li, Zihan Zhu, Wei Zhang, Marc Pollefeys, Daniel Barath

피드포워드 기반 모델은 3D 재구성에서 우수한 성능을 보이지만, 긴 시퀀스에서 오류가 누적되어 트래킹 드리프트가 커지는 한계가 있다. CLoSeR는 스트리밍 재구성 기반 모델에 루프 클로저(loop closure)를 적용해 킬로미터 규모의 드리프트 없는 재구성을 구현한다. 전역 디스크립터 검색으로 루프 후보를 탐지하고, 루프 조건 윈도우를 구성해 루프된 프레임 간 상대 포즈를 추정한다. 채택한 백본이 전역적으로 일관된 스케일을 생성한다는 점에 착안해, 기존 연구에서 사용하던 Sim(3) 또는 SL(4) 다양체 대신 SE(3) 다양체 위에서 순차 및 루프 클로저 제약으로 포즈를 최적화한다. 킬로미터 규모 시퀀스 실험에서 드리프트 감소와 기하학적 일관성 향상이 확인되었으며, 코드는 공개되어 있다.

Mikhail Nilov / Pexels
2610.01910v1

이산 곡면 위의 로봇 학습: 이론과 응용

Robot Learning on Discrete Surfaces: Theory and Applications

Matteo Dalle Vedove, Fares J. Abu-Dakka, Luigi Palopoli, Daniele Fontanelli, Matteo Saveriano

대부분의 로봇 학습 및 동작 생성 프레임워크는 곡면의 내재적 기하(intrinsic geometry)를 무시하고 곡면을 단순 제약 조건으로 취급한다. 이 논문은 이산 미분 기하학(discrete differential geometry)을 활용하여 다면체 메시(polyhedral mesh) 위에서 직접 로봇 학습을 수행하는 통합 이산 리만(discrete Riemannian) 프레임워크를 제안한다. 프레임워크는 대수 지도(logarithmic map)·지수 지도(exponential map)·평행 이동(parallel transport)·주변 공간 투영(ambient-space projection)을 면·엣지·꼭짓점 전반에서 일관되게 정의한다. 동적 운동 프리미티브(Dynamic Movement Primitives, DMP), 가우시안 프로세스(Gaussian Process, GP), 리만 플로우 매칭(Riemannian Flow Matching, RFM) 세 가지 학습 패러다임에 적용하여 기존 접근 대비 곡면 간 일반화 성능과 생성 품질을 개선하였다고 보고한다. 시뮬레이션 비교 실험과 함께, 사용자 궤적을 다른 곡면으로 일반화하는 과제와 RGB-D 재구성 곡면 위 연마 동작 계획 두 가지 실기 시나리오에서도 검증하였다.

Zach M / Unsplash
2609.40353v1

AssemblyWorld: 범용 에이전트를 이용한 3D 조립 재검토

AssemblyWorld: Rethinking 3D Assembly with General-Purpose Agents

Jiahao Zhang, Yeying Fan, Moitreya Chatterjee, Suhas Lohit, Bernhard Egger 외 3명

AssemblyWorld는 에이전트가 렌더링된 2D 시점만으로 부품 형상을 파악하고 조립을 수행하는 인터랙티브 3D 환경이다. 에이전트는 메시 정점에 직접 접근하지 않고 2D 뷰와 이미지·조립 매뉴얼을 참조해 조작하며, 결과물은 기하학적으로 평가된다. 이 환경을 기반으로 가구·산업 부품·파손 재조립 등 80개 물체에 걸친 100개 과제로 구성된 벤치마크 AssemblyWorldBench를 구축했다. 8개 에이전트 시스템을 평가한 결과, 최상위 시스템은 부품 정확도(part accuracy) 80.9%, 완전 조립 성공률 59.4%를 기록했다. 오픈소스 시스템은 실행 안정성과 조립 정확도 모두에서 클로즈드소스 시스템에 비해 크게 뒤처지는 것으로 나타났다.

Markus Winkler / Pexels
2609.40341v1

Ego4WAM: 로봇 학습용 자기중심 인간 데이터 확장에서 중요한 것은 무엇인가?

Ego4WAM: What Matters When Scaling Egocentric Human Data for Robot Learning?

Zhihao Sun, Liu Liu, Xinjiang Wang, Haoyi Jiang, Wei Feng 외 4명

Ego4WAM은 로봇 학습을 위한 자기중심(egocentric) 인간 데이터의 어떤 속성이 로봇 성능 향상을 이끄는지 체계적으로 분석한 연구다. 세계-행동 모델(world-action model) 프레임워크 아래 모델 백본을 고정한 채 인간-로봇 정렬도, 데이터 지속시간·과제 다양성, 행동 지도(action supervision), 데이터 활용 전략의 효과를 각각 분리해 분석한다. 연구에 따르면, 정렬된 인간 시연 데이터는 분포 외(out-of-distribution) 일반화를 크게 향상시키고 목표 과제에 필요한 로봇 데이터 양을 줄이는 것으로 나타났다. 행동 레이블 없이 영상만으로 수행하는 지도 학습도 충분히 효과적이며, 이후 영상-행동 공동 학습의 기반이 된다. 실물 로봇 및 RoboDojo에서의 폐루프(closed-loop) 정책 평가를 통해 이 결과를 검증했다.

Brecht Corbeel / Unsplash
2609.40306v1

DynaHarness: 자가 진화 로봇 에이전트를 위한 동적 물리 하네스

DynaHarness: A Dynamic Physical Harness for Self-Evolving Robot Agents

Haoyuan Deng, Jiebin Liu, Tengxiao Zhang, Langning Yan, Hongye Cao 외 1명

DynaHarness는 사전 학습된 로봇 정책의 의미론적 추론과 물리적 실행을 공유 실행 계약(execution contract)으로 결합한 프레임워크다. '느린 두뇌(slow brain)'가 기능과 심볼릭 인수를 제안하면, '빠른 두뇌(fast brain)'가 명령을 실행·감시하고 미해결 동작을 거부하며 필요 시 재계획을 요청한다. 실행 계약은 분석 기술, 복구 기술, 고정된 시각-언어-행동 모델(VLA)에 걸쳐 실행 증거를 기록하며, 실패 귀인(failure attribution)이 결함 위치를 특정해 재사용 가능한 기능을 수정한다. 회귀 검사(regression check)가 수정 사항의 채택 여부를 결정해 자가 진화 루프를 완성한다. LIBERO-Pro 벤치마크에서 새로 샘플링한 800개 초기 상태 기준 성공률 75.2%를 기록했으며, 이는 고정 정책의 17.5%, 단순 재계획 방식의 63.9%와 비교된다.

David Yao / Unsplash
2609.40297v1ICRA

자율 탐색을 위한 GPU 가속 경로 의존적 한계 정보 이득

GPU-Accelerated Path-Dependent Marginal Information Gain for Autonomous Exploration

João Félix Mendes, Rodrigo Ventura, Meysam Basiri

자율 탐색 로봇은 후보 시점(viewpoint)의 예상 정보 이득과 실행 비용을 연속적으로 평가해야 하는데, 기존 샘플링 기반 플래너는 동일 경로상 시점 간 관측 중복을 무시하고 각 후보를 독립적으로 처리했다. 이 연구는 미지 복셀(voxel)을 직접 저장·병합하는 대신 깊이 버퍼(depth buffer)를 이용해 선행 관측과의 중복을 제거하는 경로 의존적 한계 정보 이득(path-dependent marginal information gain) 계산 방법을 제안한다. 플래닝 트리를 깊이 순으로 평가해 시점 간 의존성을 유지하면서, 각 레벨의 후보 노드와 레이는 GPU에서 병렬 처리된다. 복셀 해시맵 기반 정확값 대비 오차 5~10% 이내를 유지하며, 데스크톱 GPU에서 최대 118배, NVIDIA Jetson Orin NX에서 28배의 속도 향상을 달성했다. 실제 환경 실험에서는 95% 탐색 달성 시간이 30% 단축되고 탐색 종료 시점도 앞당겨지는 결과가 나타났다.

Egor Myznik / Unsplash
2609.40269v1

지도 불확실성 하에서의 신념 인식 다중 에이전트 경로 탐색

Belief-Aware Multi-Agent Path Finding under Map Uncertainty

Viraj Parimi, Shao-Hung Chan, Han Zhang, Jingkai Chen, Brian Williams

다중 에이전트 경로 탐색(Multi-Agent Path Finding, MAPF)은 공유 환경에서 여러 에이전트가 충돌 없이 이동하는 경로를 계획하는 문제이다. 기존 MAPF 연구는 모든 정적 장애물을 사전에 알고 있다고 가정하지만, 실제 환경에서는 낙하물·유출물 등으로 지도가 예기치 않게 바뀔 수 있다. 기존 접근법은 직접 관측된 위치만을 활용해 공간적 상관관계를 반영하지 못하므로, 인근 미관측 장애물을 사전에 추론하기 어렵다. 저자들은 MAGIC(Multi-Agent Gaussian belief Inference for Coordination) 프레임워크를 제안하며, 가우시안 마코프 랜덤 필드(Gaussian Markov Random Field)와 가우시안 신념 전파(Gaussian Belief Propagation)를 이용해 에이전트 관측을 기반으로 주행 가능성 신념을 온라인으로 갱신한다. MAPF 벤치마크 실험에서 MAGIC은 최대 800개 에이전트 규모의 96.3%의 인스턴스에서 기존 방법 대비 실행 비용 합계를 줄이는 것으로 나타났다.

Brecht Corbeel / Unsplash
2609.40245v1CoRL

STARS: 인간-로봇 상호작용의 시공간 역학에서 사회적 표현으로

STARS: From Spatiotemporal Dynamics to Social Representations in Human-Robot Interaction

Nathan Tsoi, Michael J. Munje, Tejas Oberoi, Rishab Maheshwari, Pengen Zheng 외 3명

동적인 인간 중심 환경에서 로봇 내비게이션이 안전하게 작동하려면 사회적 장면 이해 능력이 필수적이나, 현재 시각-언어 모델(VLM)이 이를 충족하는지는 체계적으로 검증된 바 없다. 본 연구는 실세계 소셜 로봇 내비게이션 시나리오에서 VLM을 평가하기 위한 시각 질의응답(VQA) 데이터셋 및 벤치마크인 SocialNav-SUB를 제안한다. SocialNav-SUB는 공간·시공간·사회적 추론 과제에서 VLM을 인간 기준선 및 규칙 기반 기준선과 비교 평가하는 통합 프레임워크를 제공한다. 최상위 VLM이 인간 응답과 유사한 수준에 근접하기는 했으나, 단순한 규칙 기반 방법과 인간 합의 기준선 모두에 미치지 못하는 것으로 나타났다.

Tiger Lily / Pexels
2609.40244v1

StreamRig: 리그 내부 기하 구조를 활용한 스트리밍 다중 카메라 오도메트리

StreamRig: Exploiting Intra-Rig Geometry for Streaming Multi-Camera Odometry

Yufei Wei, Shuhao Ye, Qi Wang, Xin Zheng, Qing Huang 외 2명

StreamRig은 보정된 다중 카메라 리그(rig)의 스트리밍 오도메트리(odometry)를 위한 freeze-and-stream 프레임워크로, 동결된 다중 시점 3D 기반 모델(foundation model) 위에 경량 모듈을 추가해 학습한다. Rig-Resampler가 동기화된 카메라들의 특징을 압축하고, CausalBridge가 키-값 캐시를 활용한 인과적 어텐션(causal attention)을 적용하며, 경량 헤드가 리그 포즈를 회귀 추정한다. 학습 가능한 파라미터는 총 74.6M개이며, 상대 포즈만을 단독 지도 신호로 사용한다. 그룹 재지역화(relocalization) 사전학습과 인과 리그 학습을 결합한 2단계 학습 전략을 채용했으며, 학습에는 시뮬레이션 데이터만 사용하고 NCLT·TartanGround·KITTI-360·ZJH 데이터셋에서 제로샷(zero-shot) 실기 평가를 수행했다. 네 데이터셋 전반에 걸쳐 평가 대상 단안(monocular) 스트리밍 모델 및 리그 인식 오프라인 모델보다 평행 이동·회전 드리프트가 낮게 나타났다.

Howard Senton / Pexels
2609.40208v1

단일 UAV 플래너를 활용한 중앙집중식 다중 UAV 탐색 및 3D 재구성

Centralized Multi-UAV Exploration and 3D Reconstruction Using Single-UAV Planners

João Félix Mendes, Meysam Basiri, Rodrigo Ventura

기존 단일 UAV 탐색 플래너를 다중 UAV 환경에서 그대로 활용할 수 있도록 중앙집중식 프레임워크를 제안한다. voxblox 라이브러리를 개조해 여러 UAV의 깊이 측정값을 공유 전역 절단 부호 거리 필드(TSDF, Truncated Signed Distance Field) 맵에 실시간으로 융합한다. UAV 간 충돌 회피와 자기 필터링 메커니즘을 통합해 다른 UAV가 정적 장애물로 재구성되는 문제를 방지한다. RH-NBVP, KRH-NBVP, AEP, KAEP 네 가지 샘플링 기반 플래너를 대상으로 시뮬레이션 실험을 수행했으며, UAV를 서로 다른 위치에서 출발시키는 분리 시작(Separated Start) 방식이 근접 시작(Joint Start) 방식보다 모든 플래너에서 탐색 속도와 커버리지가 일관되게 높게 나타났다.

Anton Trava / Pexels
2609.40178v1

Dronar를 이용한 수로 비침습 점검

Non-Invasive Inspection of Water Canals Using Dronar

Michael Zielinski, Zhizhan Wang, Benjamin Dymond, Reza Razavian, Zhongwang Dou

연구팀은 드론과 소나 기술을 결합한 dronar 시스템을 개발해 미국 피닉스 지역 개방형 콘크리트 수로의 비침습 점검 방법을 제시했다. dronar는 소비자용 소나 시스템을 무인 수상 차량(USV, Unmanned Surface Vehicle)에 탑재해 수로 물을 빼지 않고도 수로 바닥 상태를 측정한다. 피닉스 애리조나 캐널(Arizona Canal)에서 세 차례 수행한 현장 시험에서, 퇴적물이 쌓인 구간의 DownScan 수심 프로파일은 청소 후 동일 구간보다 최대 15 cm 얕게 나타났다. 청소된 구간에서 반복 측정한 수심 프로파일이 거의 일치해 측정 재현성이 확인되었다. 이 연구는 현재 4년 주기로만 이루어지는 수로 점검을 상시화할 수 있는 개념 검증(proof-of-concept) 도구로 dronar를 제안한다.

William Hadley / Pexels
2609.40177v1ICRA

Social-WM: 로봇 사회 내비게이션을 위한 안전 인식 잠재 세계 모델

Social-WM: Safety-Aware Latent World Models for Robot Social Navigation

Zhihao Zheng, Mooi Choo Chuah

Social-WM은 자아 중심(egocentric) RGB 영상 시퀀스로 학습하는 잠재 세계 모델(latent world model) 기반 계획 프레임워크다. 명목 행동(nominal action)과 실현 가능 행동(realizable action) 사이의 체계적 불일치를 핵심 관찰로 삼아, 행동 조건부 미래 예측을 통해 안전 관련 결과를 직접 학습한다. 실현 가능 역방향 역학(realizable inverse-dynamics) 목적 함수를 추가 도입해, 관측된 잠재 전이를 명목 행동이 아닌 실제 실현된 행동과 연결한다. 추론 시 잠재 세계 모델로 후보 행동들을 시뮬레이션하고, 역방향 역학 모델이 각 행동의 실현 가능성을 추정해 실행 전 안전 신호로 활용한다. Social-HM3D 벤치마크에서 성공률 63.77%, 인간 충돌률 21.67%를 기록했으며, Social-MP3D로의 제로샷 전이에서도 보행자 추적·특권 인간 상태·온라인 강화학습 없이 강건한 성능을 유지한다.