본문으로 건너뛰기

PAPERS

논문 트래커

arXiv cs.RO 신규 논문을 매일 수집해 한국어 요약을 붙입니다. 학회 채택 정보는 저자 코멘트에서 자동으로 추출합니다.

473건학회 채택 1건
Tara Winstead / Pexels
2609.04096v1

구성 가능한 파운데이션 프라이어와 일반화 가능한 파지 합성을 통한 적응형 시각-언어 파지

Adaptive Vision-Language Grasping via Composable Foundation Priors and Generalizable Grasp Synthesis

Sixu Yan, Shikang Wang, Binhua Huang, Xuanlai Tang, Guohua Fan 외 9명

AdaRoboVLG는 다양한 로봇 손(robotic hand)에 걸쳐 일반화 가능한 파지 합성을 지원하는 태스크 적응형 시각-언어-파지(VLG) 프레임워크다. 기존 VLG 방식이 파운데이션 모델과 종단간 파지 정책을 강하게 결합하는 것과 달리, 명시적 운동학적 매핑(kinematic mapping)과 힘-폐쇄(force-closure) 기반 안정성 추정으로 물리적으로 실현 가능한 파지 후보를 생성·평가하는 일반화 기반 정책을 학습한다. 태스크 의존적 이해는 전문화된 파운데이션 모델 모듈에 위임하며, 이 모듈들은 기반 파지 정책을 재학습하지 않고도 구성 가능한 프라이어(composable prior)를 파지 합성 과정에 통합한다. 시뮬레이션 및 실환경 실험에서 기반 정책의 효율적 학습과 강한 크로스-핸드(cross-hand) 일반화, 공간·인지·시간적 프라이어의 결합 효과가 확인됐다. 이 결과는 물리적 파지 합성과 태스크 의존적 이해를 분리하는 설계가 확장 가능한 로봇 파지 패러다임임을 시사한다.

0xk / Unsplash
2609.04070v1

이산적 추론에서 연속 행동으로: 엔드-투-엔드 자율주행을 위한 잠재 정렬 계획

Continuous Actions from Discrete Minds: Latent-Aligned Planning for End-to-End Autonomous Driving

Ruoyu Yao, Yusen Xie, Qingzhao Liu, Pei Liu, Zewei Yang 외 3명

LaPla는 이산적 시각-언어 모델(VLM)의 추론과 연속적·물리 제약적 자율주행 행동 공간 사이의 간극을 해소하는 시각-언어-행동 모델(VLA) 프레임워크다. 잔차 벡터 양자화 변분 오토인코더(VQ-VAE)를 기반으로 행동 토크나이저를 설계해 차량 운동학을 캡처하고 궤적 특징을 구조화된 잠재 공간으로 인코딩한다. 다중 뷰 이미지·과거 행동·텍스트 지시를 통합한 멀티모달 입력을 단일 순전파(forward pass)로 처리하며, 은닉 상태를 사전 학습된 VQ-VAE 잠재 공간에 직접 투영해 양자화 오류를 제거하고 자기회귀 생성을 우회한다. nuScenes 벤치마크 개방 루프 평가에서 장거리 L2 오류를 기존 VLA 방법 대비 15.52% 줄였으며, NVIDIA AlpaSim 시뮬레이터 폐쇄 루프 평가에서 성공률을 33.34 퍼센트포인트 향상시켰다.

Pavel Danilyuk / Pexels
2609.04066v1

부분공간 추론을 이용한 선호 기반 능동적 보상 학습의 효율화

Subspace Inference Enables Efficient Active Reward Learning from Preferences

Yutai Zhou, Erdem Bıyık

이 논문은 인간 피드백 강화학습(RLHF)에서 보상 모델 불확실성을 효율적으로 정량화하기 위해 PreferenceEKF를 제안한다. 능동적 선호 학습(active preference learning)을 순차적 베이즈 필터링(sequential Bayesian filtering) 문제로 재정의하고, 전체 신경망 파라미터 공간 대신 저차원 부분공간에서 확장 칼만 필터(extended Kalman filter, EKF)를 적용해 사후 분포를 갱신한다. 이 방식은 능동 학습용 획득 함수(acquisition function) 계산에 필요한 신경망 파라미터 샘플링을 확장 가능하게 만든다. D4RL 및 V-D4RL 벤치마크 실험에서 다른 베이즈 딥러닝 기법 대비 샘플 효율성·실행 시간·확장성·보정(calibration) 모두 우수한 결과를 보였다. 학습된 보상 모델을 사용한 오프라인 강화학습 정책도 경쟁력 있는 성능을 달성한다.

Ludovic Delot / Pexels
2609.03995v1

카탈로그 사진을 콜드 스타트로 활용: 배포 가능한 카바이드 버 인식을 향하여

Catalogue Photography as a Cold Start: Toward Deployable Carbide Burr Recognition

Abilash Philip Madavath, Chandra Yuvesh Aubeeluck, Augustin Raju, Nicolas Pyschny, Felix Hackelöer 외 1명

밀링 공구 및 카바이드 회전 버(carbide rotary burr) 생산 배치를 주문서와 대조하는 품질 검사 작업을 컴퓨터 비전으로 자동화하는 연구다. 현장 촬영 라벨 데이터가 전무한 콜드 스타트(cold start) 조건에서 제조사 카탈로그 사진만을 감독 신호로 사용한다. 메트릭 러닝(metric learning)은 카탈로그 이미지에서 조정 랜드 지수(adjusted Rand index) 0.94~0.97의 비지도 클러스터 발견 성능을 달성하지만, 이 성능의 절반 미만만이 현장 사진으로 전이된다. 전이 성능 향상에 가장 크게 기여한 요소는 모델 규모나 표현 복잡도가 아닌, 이미지 그레이스케일 변환(+0.22)과 주문서를 활용한 헝가리안 할당(Hungarian assignment) 기반 검색 제약(+0.11)이었다. 연구진은 카탈로그 사진을 즉시 배포 가능한 학습 도메인이 아닌 유용한 콜드 스타트로 규정하고, 정밀 공구 제조 분야의 카탈로그-현장 전이를 위한 실험 기준선과 평가 프로토콜을 제시한다.

Vladimir Srajber / Pexels
2609.03984v1IROS

MulDP: 복잡한 지형에서의 자율 사족보행 파쿠르 내비게이션을 위한 다중모달 확산 정책

MulDP: Multimodal Diffusion Policy for Autonomous Quadruped Parkour Navigation across Complex Terrains

Kangmai Hu, Yueqi Zhang, Peng Zhai, Xiaoyi Wei, Jiabin Hu 외 3명

사족보행 로봇의 파쿠르 보행 연구는 진전을 이뤘으나, 고수준 계획 단계에서 인간 개입이 필요한 경우가 많아 완전 자율 파쿠르 내비게이션은 충분히 탐구되지 않았다. 이 논문은 시각 인식, 고유수용감각(proprioception), 목표 정보를 통합해 시간적으로 일관된 내비게이션 속도 명령을 생성하는 다중모달 확산 정책(Multimodal Diffusion Policy) MulDP를 제안한다. MulDP는 인식과 체화 제어를 긴밀하게 결합함으로써 세밀한 속도 조절, 장기 예측 행동, 복잡한 지형 통과를 가능하게 한다. 학습 데이터 확보를 위해 다양한 내비게이션 행동과 복잡한 지형을 포함하는 사족보행 파쿠르 내비게이션 데이터셋(Quadruped Parkour Navigation Dataset, QPND)을 새로 구축하였다. 시뮬레이션과 실제 환경 실험 모두에서 MulDP는 복잡한 지형을 가로지르는 견고한 장거리 자율 내비게이션 성능을 보여주었다.

Nicholas Fuentes / Unsplash
2609.03970v1

사진측량법과 시맨틱 세그멘테이션을 활용한 로봇 후처리용 용접 비드 자동 인식 및 3D 매핑

Automated Weld Seam Recognition and 3D Mapping for Robotic Post Processing Using Photogrammetry and Semantic Segmentation

Augustin Raju, Abilash Madavath, Chandra Yuvesh Aubeeluck, Nicolas Pyschny, Felix Hackelöer 외 1명

이 논문은 연삭·마감·검사 등 로봇 후처리 작업을 위해 용접 비드(weld seam) 형상을 자동으로 인식하고 3D 모델에 투영하는 비전 기반 파이프라인을 제안한다. 대형 공작물의 경우 고정밀 레이저 스캐너나 구조광 센서로 전체 표면을 스캔하면 시간이 오래 걸리고 불필요한 데이터가 대량 발생하는 문제가 있다. 제안 방법은 여러 시점에서 촬영한 이미지에 시맨틱 세그멘테이션(semantic segmentation)을 적용해 용접 비드를 식별하고, 사진측량법(photogrammetry)으로 재구성한 3D 모델에 해당 위치를 투영한다. 이 파이프라인은 고정밀 계측 이전의 사전 단계로서 전체 스캐닝 범위와 데이터 취득량을 줄이는 것을 목표로 한다.

Shane Aldendorff / Pexels
2609.03927v1

통합 로봇 학습을 향하여: 표현 학습, 시각-언어-행동 모델, 월드 모델의 연결

Toward Unified Robot Learning: Bridging Representation, Vision-Language-Action, and World Models

Shaunak A. Mehta, Ananya Hazarika, Haochen Zhang, Fan Yang, Ryo Moriyama 외 3명

이 서베이 논문은 로봇 학습을 표현 학습(representation learning)을 통한 이해, 시각-언어-행동 모델(VLA)을 통한 행동, 월드 모델(world model)을 통한 추론이라는 세 축으로 정리해 통합적 관점을 제시한다. 세 패러다임은 그동안 독립적으로 발전해 왔으며, 그 결과 일반화·장기 시계열 추론·비정형 환경 배치에 어려움을 겪는 분절된 시스템이 만들어졌다고 분석한다. 저자들은 환경 표현, 정책 학습, 예측 모델링의 핵심 설계 선택을 포착하는 구조화된 분류 체계를 도입하고 각 구성 요소 간 상호작용을 분석한다. 불확실성 정량화, 분포 외(out-of-distribution) 일반화, 크로스-임바디먼트(cross-embodiment) 전이, 장기 문맥 이해, 장기 계획을 주요 난제로 꼽으며, 이 문제들이 개별 구성 요소의 한계뿐 아니라 지각·행동·추론 간 통합 부재에서 비롯된다고 주장한다. 논문은 이를 바탕으로 물리적 근거를 갖춘 확률론적 통합 로봇 학습 방향을 제언한다.

Jakub Żerdzicki / Unsplash
2609.03906v1

연속 환경에서 시각-언어 내비게이션의 거시 행동 기반 폐루프 강화학습을 위한 위상 그래프 재고찰

Revisiting Topological Graphs for Macro Action based Closed-loop Reinforcement Learning of Vision Language Navigation in Continuous Environment

Shuhao Ye, Sitong Mao, Yuxiang Cui, Yufei Wei, Xuan Yu 외 5명

연속 환경에서의 시각-언어 내비게이션(VLN-CE)은 에이전트가 자연어 지시를 따라 미지의 환경을 탐색하는 과제로, 기존 모방 학습(IL) 방식은 분포 이동과 궤적 이탈 시 전문가 행동의 모호성 문제를 갖는다. 이 연구는 VLN-CE를 계층적 마르코프 결정 과정(Hierarchical MDP)으로 재정의해 고수준 계획과 저수준 제어를 명시적으로 분리한다. 환경을 위상 그래프(topological graph)로 추상화하여 고수준 정책이 경계 노드(frontier node)의 거시 행동 공간에서 동작하게 하고, 별도 학습 없는 저수준 컨트롤러가 상태 전이를 담당함으로써 결정 지평을 압축하고 폐루프 강화학습(RL)을 현실적으로 적용 가능하게 한다. 동적 경계 행동 공간에서 상태 가치를 평가하는 행동 인식 가치 헤드(action-aware value head)를 도입한 그래프 기반 PPO를 제안한다. 제안 모델은 R2R-CE 및 RxR-CE 벤치마크에서 최고 수준의 성능을 달성했다.

Pavel Danilyuk / Pexels
2609.03892v1

GraFT: 3D 장면 그래프를 활용한 다중모달 대형 언어 모델의 훈련 없는 공간 추론 프레임워크

GraFT: A Training-Free Framework for Spatial Reasoning in Multimodal Large Language Models via 3D Scene Graphs

Junqing Du, Fernando Ropero, Erkin Turkoz, Yanfeng Zhang, Lu Liu

현재 다중모달 대형 언어 모델(MLLM)은 정밀한 기하 측정, 자기중심(egocentric)과 타자중심(allocentric) 시점 변환, 세밀한 외관 파악에서 일관된 성능을 내지 못한다. GraFT는 추가 학습 없이 3D 장면 그래프(3DSG)를 통해 이 한계를 보완하는 프레임워크로, 기존 모델 가중치나 특정 백본에 종속되지 않는다. GraFT는 기호적 도구를 이용한 결정론적 기하 계산, 조감도(BEV) 렌더링을 통한 타자중심 레이아웃 파악, 자기중심 프레임 기반 시각 속성 추론 세 가지 공간 추론 기능을 제공한다. ScanQA 벤치마크에서 동일 백본 기준선 대비 CIDEr 점수를 27% 향상시켰으며, VSI-Bench에서는 동결(frozen) MLLM 성능을 최대 65% 끌어올려 독점 모델 및 다수의 파인튜닝 기반 공간 추론 모델을 상회하는 결과를 보였다.

cottonbro studio / Pexels
2609.03891v1

동적 온톨로지 기반 시맨틱 매핑을 위한 하이브리드 파이프라인

A hybrid pipeline for dynamic ontology-based semantic mapping

Konstantinos Dimitropoulos, Ioannis Hatzilygeroudis

본 논문은 로봇이 복잡한 환경에서 객체와 상호작용하고 탐색하는 데 필요한 시맨틱 매핑(semantic mapping) 하이브리드 파이프라인을 제안한다. 시스템은 단응사상(homography) 투영을 활용한 외부 보정 카메라로 기하학적 매핑과 위치 추정을 수행하며, 객체 탐지·지속적 객체 추적·온톨로지(ontology) 기반 시맨틱 갱신을 결합해 동적 시맨틱 세계 모델을 구축한다. 실세계 좌표 추정값 보정에는 선형 회귀 모델이 사용된다. 시스템은 실시간 센서 데이터를 바탕으로 객체 인스턴스, 공간 속성, 시맨틱 관계를 지속적으로 갱신한다. 지식 표현 방식으로 온톨로지를 채택한 것은 계층적 구조, 시맨틱 표현력, 동적 세계 모델링 지원 특성 때문이라고 저자들은 밝힌다.

Enchanted Tools / Unsplash
2609.03889v1

FWBC-VLA: 접촉 집약적 이동 조작을 위한 힘 인식 전신 보상

FWBC-VLA: Force-Aware Whole-Body Compensation for Contact-Rich Loco-Manipulation

Yutian Zhang, Siyuan Ma, Liwen Yang, Yang Li, Ce Hao 외 4명

FWBC-VLA는 휠-레그(wheeled-legged) 로봇의 접촉 집약적 이동 조작(loco-manipulation)을 위해 시각-언어-행동 모델(VLA)의 태스크 수준 행동 생성과 저수준 전신 보상 제어(WBC)를 연결하는 프레임워크다. 연구팀은 별도의 힘·토크 센서 없이 접촉 강도와 시간적 변화를 추정하는 잔차 토크 추정기 HSR-Force를 제안한다. 추정된 접촉 정보는 토큰으로 인코딩되어 VLA 행동 디코딩 단계에 주입되며, 정책이 접촉 시작·지속·해제를 인식할 수 있도록 한다. 사전 학습된 VLA 백본은 5,000개 이상의 에피소드로 구성된 WL&Arm Dataset으로 파인튜닝되며, 고유감각(proprioceptive) 상태와 야코비안 기반 힘 추정치를 함께 활용한 보상 생성기가 교정 행동을 WBC 정책에 전달한다. 화이트보드 닦기와 도어 클로저가 장착된 문 열기 실제 실험을 통해 접촉 집약적 환경에서의 유효성을 검증했다.

Franck V. / Unsplash
2609.02861v1

신뢰 가능한 자율 로봇을 향하여: 설명 가능한 AI 기반 의사결정 프레임워크

Towards Trustworthy Autonomous Robots: An Explainable AI-Based Decision Framework

Cagri Temel

딥러닝 기반 자율 로봇은 사고 발생 시 의사결정 근거를 재구성하기 어렵다는 감사 가능성(auditability) 문제를 안고 있다. 본 논문은 이를 해결하기 위해 TRACE(Transparent Reasoning Architecture for Credible Execution)라는 의사결정 프레임워크를 제안하며, 모든 자율 행동을 센서 증거까지 인과 사슬로 추적할 수 있도록 설계된다. TRACE는 의미론적 지각(Semantic Perception), 신념 추론(Belief Reasoning), 행동 합성(Action Synthesis), 실행 검증(Execution Verification)의 네 가지 감사 가능 계층으로 구성되며, CNN·트랜스포머 등 학습 기반 지각 모듈과 통합 가능한 모델 비종속(model-agnostic) 구조를 갖는다. 창고 로봇 내비게이션 환경에서 500회 시뮬레이션 의사결정 사이클을 평가한 결과, 증거 추적성 98.6%, 시간적 연속성 99.0%, 의사결정 재구성 가능성 98.1%를 기록하였다. 또한 고위험 시스템 투명성을 규정하는 EU AI Act 요건을 충족하도록 설계되었음을 논문에서 밝히고 있다.

Alex Suprun / Unsplash
2609.02830v1

실제 배포를 위한 강인한 LiDAR 시맨틱 세그멘테이션: 거친 레이블·열악한 환경·도메인 변화 하에서의 평가

Toward Robust LiDAR Semantic Segmentation for Real-World Deployment: Evaluation under Coarse Labels, Adverse Conditions, and Domain Shifts

Samir Abou Haidar, Alexandre Chariot, Mehdi Darouich, Cyril Joly, Jean-Emmanuel Deschaud

이 논문은 자율주행차와 모바일 로봇을 위한 LiDAR 기반 시맨틱 세그멘테이션(semantic segmentation) 모델의 실제 배포 준비도를 평가하는 구조화된 프로토콜을 제안한다. 프로토콜은 세 차원으로 구성되는데, 자율주행 안전 우선순위에 맞춘 거친 레이블 평가, 대기·기하·센서 열화를 모사한 8가지 LiDAR 손상 유형 하에서의 강인성 평가, 그리고 데이터셋 간 적응 없는 도메인 일반화 평가가 포함된다. 추론 속도는 임베디드 플랫폼인 Jetson AGX Orin에서 측정하여 배포 제약을 직접 반영했다. 실험 결과, 세밀한 벤치마크 순위가 안전 관련 성능을 항상 반영하지는 않으며, 모든 모델이 손상 조건에서 상당한 성능 저하를 보이되 아키텍처에 따라 강인성 특성이 다른 것으로 나타났다. 현재의 도메인 일반화 수준은 신뢰할 수 있는 배포에 충분하지 않다는 점도 확인되어, 벤치마크 성능과 실제 배포 준비도 사이의 구체적인 격차가 드러났다.

National Cancer Institute / Unsplash
2609.02811v1

더 나은 가상 롤아웃이 더 나은 로봇 제어를 의미하는가? 피드백 환경에서의 월드 모델 평가 비교 연구

Do Better Imagined Rollouts Mean Better Robot Control? A Controlled Study of World-Model Evaluation Under Feedback

Dharini Raghavan, Amritpal Singh

로봇 제어에서 예측 모델(world model)은 통상 고정 구간 개루프(open-loop) 예측 정확도로 평가되지만, 실제 로봇은 측정·상태 추정·제어를 반복하는 폐루프(closed-loop) 방식으로 동작한다. 이 연구는 편향된 오도메트리(odometry)와 간헐적 랜드마크 센싱 조건의 차동구동(differential-drive) 경로 추적 태스크에서 6가지 상태 추정기를 24개 센싱 조건에 걸쳐 평가했다. 궤적 재생(replay) 방식의 위치 RMSE는 롤아웃 오차보다 폐루프 횡방향 오차(cross-track RMSE)와 더 강한 상관관계를 보였으며(스피어만 rho = 0.923 대 0.774), 롤아웃 지표는 24개 조건 중 18개에서 폐루프 최적 추정기와 다른 선택을 낳았다. 롤아웃 지평(horizon)이 길더라도 측정 업데이트를 유지하면 순위 예측력이 유지되지만, 보정 없이 긴 롤아웃을 수행하면 폐루프 성능과 상이한 추정기 순위가 나타났다. 장기 센싱 단절로 훈련된 GRU-EKF는 복합 센싱 열화 조건에서 횡방향 RMSE를 1.72 m에서 1.06 m로 줄였으나, 효과는 조건과 아키텍처에 따라 일관되지 않았다.

Pavel Danilyuk / Pexels
2609.02717v1

MV-dVRK: 공간적 수술 인식을 위한 다시점 벤치마크

MV-dVRK: A Multi-Viewpoint Benchmark for Spatial Surgical Perception

Guido Caccianiga, Sergey Prokudin, Yutong Chen, Bernard Javot, Rachael L'Orsa 외 7명

MV-dVRK는 다시점 노출 동기화 스테레오 뷰포인트와 정확한 표면 기하학, 카메라 포즈를 결합한 최초의 생체 외(ex-vivo) 수술 데이터셋이다. 벤치마크의 정적 서브셋은 산업용 3D 스캐너로 검증된 밀집 구조-운동 복원(SfM, Structure-from-Motion) 기준 기하학 및 실측 카메라 포즈를 포함한다. 내시경 두 대를 사용할 경우 다중 스테레오 재구성이 가장 높은 커버리지를 달성하며, 세 번째 시점이 추가되면 최적화 기반 다시점 방법이 1 mm 허용 오차 내에서 실측 표면 포인트의 67%를 복원해 가장 우수한 성능을 보인다. 반면 피드포워드 파운데이션 모델은 동일 조건에서 실측 표면의 43%만 커버하는 것으로 나타났다. 데이터셋은 다양한 수술 작업과 조직 변형을 포함하는 10개의 동적 시퀀스도 제공해 향후 다시점 수술 인식 연구의 기반을 마련한다.

Mario Gogh / Unsplash
2609.02688v1

프록시 학습에서 주행 결정으로: 미래 인식 자율주행 플래너 평가를 위한 전이 기반 프레임워크

From Proxy Learning to Driving Decisions: A Transfer-Based Framework for Evaluating Future-Aware Autonomous Driving Planners

Yikai Wu

제안 기반 자율주행 플래너에서 미래 인식 표현과 세계 모델(world model)이 궤적 선택 개선에 활용되고 있으나, 프록시 목표의 개선이 실제 주행 성능 향상으로 이어지는지 검증하는 방법론이 부재하다. 이를 해결하기 위해 Proxy-to-Decision Transfer(PDT) 프레임워크를 제안하며, 학습된 미래 정보가 신뢰할 수 있는 주행 성능 향상을 지지하는지를 체계적으로 평가한다. PDT는 점수 마진·스위치 조건부 유틸리티·지지-선택 후회를 통해 가치 손실을 국소화하는 Decision-Transfer Decomposition Module과, 정확한 쌍 비교·최소 유의 효과·안전 비보상 등 여섯 가지 조건을 요구하는 Reliability-Constrained Validation Module로 구성된다. NAVSIM-v1로 평가한 결과, 대표 미래 인식 플래너에서 BCE는 0.705에서 0.530으로 감소했으나 선택된 PDM(Planning Decision Metric) 점수는 0.963에서 0.961로 거의 변화가 없었다. 검토된 432개 구성 중 어느 것도 두 분할·두 시드 견고성 기준을 통과하지 못해, PDT가 프록시·서브셋·집계·선택 증거 전반에서 결정 전이 실패 또는 미결정 지점을 식별할 수 있음을 보인다.

AFINIS Group ® - AFINIS GASKET® Production / Unsplash
2609.02653v1

HINT: 장기 지평 로봇 조작을 위한 인간 의도 인셉션

HINT: Human-Intent Inception for Long-Horizon Robot Manipulation

Mingyu Mei, Haojie Xu, Shihao Jin, Zibo Dai, Qihao Cheng 외 7명

HINT(Human-INTent INcepTion)는 인간의 조작 원리에서 착안한 에이전틱 프레임워크로, 희소한 언어 지침과 밀도 높은 시각 입력이 공존하는 환경에서 장기 지평 로봇 조작 과제를 다룬다. 시각-언어-행동 모델(VLA) 등 기존 행동 정책은 시각 상관관계가 의미적 의도를 압도해 인간 목표 대신 시각적 지름길을 따르는 경향이 있다는 문제를 제기한다. HINT는 조작 패턴 전환 시점에만 의미 추론을 수행하고, 이후에는 다중 시점 그라운딩과 시각 추적으로 추론된 의도를 유지하는 구조를 취한다. 이미지 공간 의미 강조(image-space semantic highlighting)와 어텐션 사전 주입(attention-prior injection)이라는 두 가지 시각 인터페이스를 통해 기반 행동 모델에 추가 학습 파라미터 없이 의도를 전달하며 저지연 제어를 유지한다. 세 가지 장기 조작 과제 및 분포 외(out-of-distribution) 변형 실험에서 두 가지 기반 정책 모두에 걸쳐 의도 이해, 작업 진행도, 종단간 성공률이 향상되었다.

Opt Lasers from Poland / Pexels
2609.02634v1

시각-언어-행동 모델의 잠재 클러스터 분석

Latent Cluster Analysis for Vision-Language-Action Models

Theodor Wulff, Sergio Lanza, Tamara Bila, Angelo Cangelosi, Stefan Wermter 외 1명

본 논문은 시각-언어-행동 모델(VLA)의 내부 표현을 분석하는 프레임워크 LAVLA를 제안한다. LAVLA는 최신 모델인 GR00T N1.5를 대상으로 레이어별 잠재 공간(latent space) 분석을 수행하며, 특히 행동 디코더에 집중한다. 행동 확산(action diffusion) 과정의 잠재 공간을 더 잘 특성화하기 위해, 관련 특징을 강조하고 비정보적 특징을 억제하는 교차 어텐션(cross-attention) 기반 임베딩 가중치 부여 방법을 도입하였으며, 정량 평가에서 가중 클러스터링이 기준 방법을 일관되게 상회하는 것으로 나타났다. 분석 결과, 잠재 클러스터는 레이어가 깊어질수록 시공간적·운동학적 특징을 점진적으로 분리해 내며, 중간 레이어에서 표현이 가장 정교해지고 출력 쪽으로 갈수록 안정화되는 경향을 보인다. LAVLA는 각 클러스터에 대해 인간이 해석 가능한 개념을 추출함으로써 언어 기반 로봇 시스템의 해석 가능성을 향상시킨다.

USGS / Unsplash
2609.02605v1

접근성 높은 수중 로봇 연구 발전: RAMI 2025에서의 Mini-Girona I-AUV

Advancing Accessible Underwater Robotics: The Mini-Girona I-AUV at RAMI 2025

Taqi Hamoda, Bilal Ahmed, Deborah Ele-Ojo, Thi Tran Ha Bao, Adel Saidani 외 7명

Mini-Girona 개입 자율수중로봇(I-AUV)은 고가의 전문 연구용 자율수중로봇(AUV)과 기본적인 원격조작장치(ROV) 사이의 간극을 줄이기 위해 설계된 플랫폼이다. 약 5만 달러의 가격으로 개발된 이 시스템은 5자유도(DOF) 매니퓰레이터 팔, 스테레오 비전, AI 기반 처리 장치를 탑재하여 자율 항법 및 개입 작업을 수행한다. 본 논문은 Mini-Girona의 설계·개발 과정을 상세히 기술하고 RAMI 2025 학생 경진대회에서의 성능을 보고한다. 열 관리 문제와 팀 접근 제한이라는 어려움에도 비전 기반 인식 및 개입 과제에서 우수한 결과를 나타내며 종합 2위를 달성하였다. 연구진은 이 플랫폼이 수중 로봇공학 연구 및 교육 도구로 활용될 수 있다고 제시한다.

Erik Mclean / Pexels
2609.02575v1

전환기 자율주행차의 차선 변경 전 신호: 통제 실험 결과

Pre-Lane-change Signal in Transitional Autonomous Vehicles: Results from Controlled Experiments

Zeyu Mu, Danjue Chen, Abhinav Sharma, George F. List

이 연구는 양산형 전환기 자율주행차(transitional autonomous vehicle, tAV)가 강제 차선 변경 결정을 어떻게 수립·실행하는지를 NC-tALC 실험의 150회 강제 차선 변경 데이터를 통해 분석한다. 횡방향 이동이 시작되기 전 목표 간격이 관측 가능한지를 확인하기 위해 신호 시간(Signal Time, SigT)을 차선 변경 시작 직전의 운영 기준점으로 정의한다. Firth 로지스틱 회귀 모델은 SigT 시점의 상대 위치·상대 속도를 입력으로 삼아 tAV가 앞 또는 뒤 목표 간격으로 합류할지를 예측하며, 5-겹 교차검증 평균 정확도 0.89를 달성한다. 분석 결과, SigT 시점의 교통 상태에는 최종 목표 간격 선택에 관한 상당한 정보가 담겨 있으며, 횡방향 이동 전에 의미 있는 예측 여유 시간이 확보됨을 보인다. 이를 바탕으로 차선 변경 과정을 'SigT~차선 변경 시작 간의 종방향 준비'와 '횡방향 기동 실행'의 2단계로 설명하는 모형을 제안한다.