본문으로 건너뛰기

PAPERS

논문 트래커

arXiv cs.RO 신규 논문을 매일 수집해 한국어 요약을 붙입니다. 학회 채택 정보는 저자 코멘트에서 자동으로 추출합니다.

473건
Youn Seung Jin / Pexels
2608.24743v1

(DNN)²: 심층 신경망을 위한 이중 비음수 완화

(DNN)²: Doubly Non-Negative Relaxations for Deep Neural Networks

Hanna Jiamei Zhang, Alan Papalia, Michael Everett, David M. Rosen

신경망 검증(neural network verification) 분야에서 기존의 선형 계획법(LP)·반정치 계획법(SDP) 완화는 완화 격차(relaxation gap)가 커 보수적인 안전 보장에 그친다. 이중 비음수 계획법(DNN, doubly non-negative program)은 완전 양수 계획법(CPP)의 가장 저렴한 가해 완화로 SDP보다 엄격한 제약을 유지하지만, 규모가 커지면 내부점법(interior-point method)으로 풀기 어렵다는 한계가 있다. 연구팀은 Burer-Monteiro(BM) 인수분해를 DNN 공식화에 적용해 확장성을 확보하고, 비유일한 쌍대 승수 공간을 탐색하는 고유값 최대화 절차를 통해 전역 최적성 인증을 가능하게 했다. 실험에서 제안 방법 (DNN)²는 표준 SDP보다 일관되게 더 타이트한 경계를 생성하며 종종 정확해(exact solution)에 근접하는 결과를 보였다. 이 연구는 안전 임계 자율 시스템에 신경망 제어기와 인지 모듈을 배포하기 위한 인증 가능한 검증 방법론의 기초를 제시한다.

Testalize.me / Unsplash
2608.24741v1

물리적 상호작용 식별을 통한 접촉이 풍부한 로봇 조작 시연으로부터의 원샷 학습

One-Shot Learning from Demonstration of Contact-Rich Robotic Manipulation by Identifying Physical Interactions

A. H. G. Overbeek, H. van der Kooij, M. Vlutters

이 연구는 시연 학습(LfD, Learning from Demonstration)에서 로봇과 환경 간의 물리적 상호작용—접촉의 생성과 해제—을 명시적으로 모델링하는 방법을 제안한다. 단 한 번의 시연과 사전 지식 없이도 복잡한 순차적 접촉 풍부(contact-rich) 조작 작업을 재현할 수 있으며, 하이브리드 위치-힘 제어기(hybrid position-force controller)가 시연 궤적을 추종하면서 접촉 기반 전환 조건을 판단한다. 실제 로봇 실험으로 문·잠금장치 열기, 볼트 집기 및 체결, 물체 분리, 표면 윤곽 추적 등 다양한 작업에서 방법을 검증하였다. 물리적 상호작용을 명시적으로 모델링함으로써 환경의 기하학적 변형에 대한 강인성, 알려진 변형에 대한 일반화, 작업 재현 중 탐색 정보를 활용한 온라인 적응이 가능해지는 것으로 나타났다. 이 연구는 해석 가능한 소수 사례(few-shot) 시연 학습 분야의 빈틈을 채우는 것을 목표로 한다.

Jeremy Bishop / Unsplash
2608.24724v1

수중 로봇의 생체모방 유체역학 인식을 위한 Fiber Bragg Grating 수염

Fiber Bragg Grating Whiskers for Bioinspired Hydrodynamic Perception on Underwater Robots

Hao Li, Tianyu Tu, Siyue Yao, Ziyang Chang, Juhyun Jung 외 5명

항만물범(harbor seal)의 수염(vibrissae)에서 착안하여, 수중 로봇용 광섬유 브래그 격자(FBG, Fiber Bragg Grating) 수염 센서를 제작하였다. 개발된 수염은 비균일 테이퍼와 타원형 단면을 갖추며, 0.1~0.6 m/s 구간에서 단조로운 유속 응답을 보이고 원통형 기준 형상 대비 자기 유발 진동(self-induced oscillation)을 크게 감소시켰다. 피칭 포일(pitching foil) 실험에서는 정지하거나 이동하는 물체가 방출한 와류(vortex)를 물체가 지나간 후 수 초가 지나도록 감지할 수 있었다. 소형 수중 로봇 전방에 수염 하나를 장착하고 수염 신호만을 이용해 직진·회전을 판별한 결과, 20회 시험 중 17회(85.0%)에서 정확한 경로를 선택하였다.

Werner Pfennig / Pexels
2608.24714v1

GaussianWAM: 3D Gaussian Fields에서 World-Action Models으로의 기하 및 의미론 증류

GaussianWAM: Distilling Geometry and Semantics from 3D Gaussian Fields into World-Action Models

Zijian Zhang, Yuqing Jiang, Weitao Zhou, Minglei Li, Jinhao Zhang 외 4명

GaussianWAM은 로봇 조작을 위한 월드-액션 모델(WAM)의 표현 학습을 훈련 시점에 강화하는 프레임워크다. 동기화된 다시점 관측으로부터 얻은 깊이·카메라 파라미터·밀집 의미 특징을 3D 가우시안 필드에 결합한 뒤, 공간 정렬된 감독 신호를 WAM의 현재 관측 표현에 증류(distillation)한다. 훈련 완료 후 교사 모델·가우시안 구성 요소·보조 예측 헤드를 모두 제거해, 추론 시 추가 모듈이나 연산 없이 원래 WAM 구조를 그대로 유지한다. LIBERO-Plus 벤치마크에서 FastWAM의 성공률을 52.05%에서 71.29%로, Cosmos Policy를 71.52%에서 77.30%로 끌어올렸다. LIBERO 표준 벤치마크·RoboTwin·실제 조작 실험에서도 성능 향상 경향이 확인됐다.

Youn Seung Jin / Pexels
2608.24618v1

VIP: 로봇 내비게이션을 위한 변이 기반 반복 학습 계획

VIP: Variation-based Iterative-learning Planning for Robotic Navigation

Shuli Lv, Pengda Mao, Chen Min, Li Hong, Runxiao Liu 외 2명

이 논문은 단일 로봇과 군집 로봇(robotic swarm)을 위한 변분 기반 반복 학습 계획(VIP, Variation-based Iterative-learning Planning) 프레임워크를 제안한다. 기존 방법이 유한 차원의 이산 궤적 변수를 최적화하는 데 반해, VIP는 무한 차원 함수 공간에서 제어 명령을 연속 함수로 직접 갱신하여 수평선 확장이나 고차원 이산화에 따른 연산 비용 증가를 회피한다. 이 접근법은 공간 이산화 점의 수 n에 대해 반복당 연산 복잡도 O(n)을 유지하며, 오프라인 계획을 위한 model-in-the-loop 방식과 물리적 실행 중 온라인 적용을 위한 robot-in-the-loop 방식 모두를 지원한다. 시뮬레이션과 실험을 통해 다양한 로봇 플랫폼 및 군집 구성에서 계획의 효율성과 확장성을 검증하였다.

Sufyan / Unsplash
2608.24603v1

그리퍼 인식 Vision Language Action Models

Gripper-aware Vision Language Action Models

Hanyi Zhang, Zihong Luo, Tianyu Li, Khang Nguyen, Basu Hela 외 14명

시각-언어-행동 모델(VLA)은 로봇 파지 및 조작에 널리 활용되지만, 기존 모델들은 그리퍼 종류와 무관하게 동일한 전략을 적용하는 그리퍼 불변성을 암묵적으로 가정하는 경우가 많았다. 저자들은 이를 해결하기 위해 평행 조(parallel-jaw), 흡착(suction) 등 5종의 그리퍼 유형에 걸쳐 103,000개의 시연 데이터를 수집한 다중 그리퍼 인식 데이터셋 MiGA를 구축하였다. 또한 다중 그리퍼 토크나이저와 어댑터 기반 정책 라우팅을 결합한 모델 GVLA를 제안하며, 새로운 그리퍼 인코딩 방식은 파라미터 공유와 전략 분화를 균형 있게 조율한다. 레이어별 프로빙(layer-wise probing) 분석을 통해 그리퍼 조건부 표현이 의미 있게 형성됨을 확인하였다. 시뮬레이션 및 실제 로봇 실험에서 GVLA는 기존 베이스라인 대비 우수한 성능을 나타냈으며, 미학습 태스크 및 새로운 객체에 대한 제로샷(zero-shot) 일반화와 퓨샷(few-shot) 적응 능력도 향상되었다.

Pavel Danilyuk / Pexels
2608.24572v1

고성능 정교한 조작 캡처를 위한 광섬유 감지 장갑

Fiber Optic Sensing Glove for High Performance Dexterous Manipulation Capture

J. D. Peiffer, Taylor Niehues, Li Guan, Ziyi Kou, Ergys Ristani

이 논문은 정교한 손 조작 동작을 포착하기 위한 광섬유 감지 장갑을 제안한다. 비전 기반 방식의 가림 취약성과 기존 센서 장갑의 드리프트·자기 간섭 문제를 해결하고자, 멀티코어 형상 감지 광섬유(multi-core shape-sensing fiber)를 사용해 각 광섬유의 완전한 3D 형상을 측정한다. 새로운 파이프라인이 재구성된 광섬유 형상을 공통 손 기준 좌표계에 정합하며, 역기구학(inverse kinematics) 솔버가 곡선 구속 조건을 이용해 60 Hz로 전체 손 자세를 복원한다. 5명의 피험자를 대상으로 2시간 분량의 물체 조작 데이터셋에서 평가한 결과, 손가락 끝 위치 오차 평균 7.2 mm를 달성했으며, 광섬유 라우팅 허브의 일회성 공장 교정을 적용하면 4.9 mm로 감소하고 이 교정값은 사용자와 세션에 걸쳐 공유된다. 논문은 이 장갑이 고충실도 데이터 수집과 양손 가상 원격조작에 활용 가능하다고 밝힌다.

Pavel Danilyuk / Pexels
2608.24563v1

X-MULTI: 요인 인식 이미지 합성을 위한 VLM 기반 이미징 요인 분리

X-MULTI: VLM-based Imaging Factor Disentanglement for Factor-Aware Image Synthesis

Sonali Godavarthy, Matthias Neuwirth-Trapp, Tim-Felix Faasch, Maarten Bieshaar, Michael Moeller 외 2명

X-MULTI는 텍스트-이미지 생성에서 카메라 렌즈 종류, 센서 유형, 시점 등 촬영 인자(imaging factor)를 독립적으로 제어하는 분리 학습 방법론이다. 기존 MULTI는 픽셀 수준 재구성 목표를 사용해 학습 데이터에서 관측된 인자 조합에만 감독 신호를 받으며, 학습 데이터에 없는 새로운 조합(예: 어안 렌즈와 이벤트 센서의 결합)에는 직접적인 신호가 없다는 한계가 있다. X-MULTI는 사전 학습된 시각-언어 모델(VLM)을 활용해 학습 중 생성되는 새로운 인자 조합에도 감독 신호를 부여함으로써 이 문제를 해결한다. 아울러 기존 인자 정렬 정확도(FAA) 지표에서 교차 인자 상관 누수(cross-factor correlation leakage) 현상을 발견하고, 인자별 증강 전략을 적용한 개선 지표 I-FAA를 제안한다. 실험 결과, X-MULTI는 미관측 인자 조합에서 MULTI 대비 향상된 인자 정렬 성능을 보이며, I-FAA는 FAA보다 분리 품질을 더 견고하게 평가하는 것으로 나타났다.

Homa Appliances / Unsplash
2608.24525v1

RoG-DAgger: 엔드투엔드 자율주행을 위한 롤아웃 가이드 사후 학습

RoG-DAgger: Rollout-Guided Post-Training for End-to-End Driving

Liangyu Zhong, Joachim Sicking, Fabian Hueger, Hanno Gottschalk

엔드-투-엔드(end-to-end) 자율주행 시스템은 대부분 고정된 전문가 데이터로 개루프(open-loop) 모방 학습을 수행하기 때문에, 정책이 유발한 상태에서 오류가 누적되는 훈련-추론 불일치 문제가 발생한다. 이를 해결하기 위해 제안된 RoG-DAgger는 단기 지평선 운동학적 롤아웃(short-horizon kinematic rollout)을 활용해 안전 위기 상태에서 고품질 전문가 시연을 구성하는 사후 훈련(post-training) 프레임워크다. 전문가의 궤적·속도 해 공간을 확장하고 롤아웃 해결 가능성(rollout solvability)으로 인계 시점을 복구 불가능 지점 직전에 결정하며, 전문가의 시야를 학습자와 일치시켜 호환 가능한 지도 신호를 제공한다. Bench2Drive 벤치마크에서 기준 모델 SimLingo 대비 주행 점수 5.3점, 성공률 6.2%p가 향상되었으며, Longest6 v2에서는 주행 점수가 22에서 44로 두 배 증가하고, Fail2Drive의 분포 외(out-of-distribution) 성공률은 55%에서 66%로 개선되었다.

Franck V. / Unsplash
2608.24485v1

NeuralParker: 불규칙 주차 환경을 위한 강화학습 플래너

NeuralParker: A Reinforcement Learning Planner for Irregular Parking Environments

Zihan Wang, Bai Huang, Yang Guan, Xiao Li, Haoyu Xu 외 2명

NeuralParker는 표시된 주차 구획이 없는 불규칙한 환경에서 배송·서비스 차량이 운영자가 지정한 임의 자세로 주차할 수 있도록 설계된 강화학습(RL) 기반 하이브리드 플래너다. 기존 학습 기반 주차 플래너가 지역 관측에 의존해 장거리 경로 추론이 어렵다는 한계를 해결하기 위해, 전체 환경의 장애물·경계 형상을 목표 상대 정점(vertex) 표현으로 인코딩해 정책이 접근 전 과정에서 경로 맥락을 유지하도록 한다. 학습된 곡률-길이 호(arc) 정책과, 곡률 정규화 비용으로 다양한 3차 에르미트(cubic Hermite) 연결 중 최적을 선택하는 인루프 터미널 앙상블을 결합한다. 팩토리얼 및 장거리 경로 선택 벤치마크 실험에서 NeuralParker는 비교 기준선 대비 더 높은 계획 성공률과 우수한 궤적 품질을 달성했다. 실제 차량 평가를 통해 실제 배송 차량 인식 환경에 낮은 연산 비용으로 효과적으로 이전됨을 확인했다.

Scott Blake / Unsplash
2608.24366v1

비대칭 센서 열화 환경에서 강건한 엔드투엔드 자율주행을 위한 분산 기반 공간 어텐션 융합

Variance-Guided Spatial Attention Fusion for Robust End-to-End Driving under Asymmetric Sensor Degradation

Weizhi Tao, Zengwang Jin, Xiao Wang, Hailong Huang

카메라와 라이다(LiDAR)를 융합하는 엔드-투-엔드 자율주행 파이프라인은 특정 모달리티 전체 또는 일부 공간 영역이 손상되는 비대칭 센서 열화(asymmetric sensor degradation) 상황에서 취약하다는 문제가 있다. 이를 해결하기 위해 분산-유도 공간 어텐션 융합(Variance-Guided Spatial Attention Fusion, VG-SAF) 프레임워크를 제안한다. VG-SAF는 세 구성 요소로 이루어진다: 물리적 근거 기반 데이터 증강기가 카메라·라이다 고장을 시뮬레이션하고 연속형 공간 마스크를 생성해 추가 레이블 없이 밀집 감독 신호를 제공하고, 모달리티별 전문가 네트워크가 로그 공간 교차 브랜치 밀집 증류를 통해 픽셀 단위 신뢰도를 예측하며, 보정된 신뢰도 맵이 하이브리드 어텐션 메커니즘을 구동해 신뢰도가 낮은 셀을 억제하고 모달리티 간 신뢰도를 크로스-모달 소프트맥스로 조정한다. 또한 Laplace 불확실성 헤드가 경로점(waypoint) 단위의 시스템적 불확실성 척도를 출력해 훈련 범위를 벗어난 고장 조건에서도 경고 신호를 제공한다. CARLA Longest6 벤치마크에서 카메라 단독, 라이다 단독, 복합 열화 시나리오 모두에 걸쳐 주행 점수·경로 완주율·위반 점수가 기준 모델 대비 향상되었다.

Stephen Leonardi / Pexels
2608.24282v1

CARE: 적응형 LiDAR 센싱의 최초 탐지를 위한 카메라 잔차 예비

CARE: Camera-Residual Reserves for First Sightings in Adaptive LiDAR Sensing

Jiachen Gong, Yun Li, Ehsan Javanmardi, Wencan Mao, Manabu Tsukada

CARE(CAmera-REsidual reserve)는 자율주행 환경에서 이력 기반 적응형 라이다(LiDAR) 스캐닝이 처음 등장하는 물체를 늦게 감지하거나 놓치는 문제를 해결하기 위해 제안된 학습 불필요(training-free) 레이 예산 배분 규칙이다. 고정된 레이 예산 중 일부를 이전 추적 예측으로 설명되지 않는 현재 카메라 감지 방향에 예약하고, 나머지는 기존 이력 정책을 따르며 미사용 예약분은 무작위 탐색에 반환한다. nuScenes 데이터셋(150개 장면, 4,148개 이벤트) 평가에서 CARE는 10%, 20%, 35% 예산 조건에 대해 이력 기반 정책 대비 첫 감지(first-sighting) 재현율을 각각 5.2, 5.2, 4.3포인트 향상시켰다. 속도 의존 안전 거리(guard distance)를 적용한 망각 모듈(forgetting module)이 멀어지거나 정적인 물체에 배정된 예산을 회수하며, 가드 없이 망각을 적용하면 근거리 재현율이 크게 저하되는 것으로 나타났다. 실차 및 폐루프 시뮬레이션에서 차폐된 보행자를 이력 기반 스캐닝보다 더 일찍 감지하고 더 안정적으로 제동하는 결과를 보였다.

Franck V. / Unsplash
2608.24242v1

로봇 조작을 위한 내구성 있는 비전 기반 촉각 손끝 센서

A Durable Vision-Based Tactile Fingertip for Robotic Manipulation

F. Richard Cottrell, Megha H. Tippur, Edward H. Adelson

이 연구는 시각 기반 촉각 센서(vision-based tactile sensor)의 내구성 취약 문제를 해결하기 위해 열가소성 폴리우레탄(thermoplastic-polyurethane, TPU) 보호 필름과 교체 가능한 감지 카트리지를 결합한 촉각 핑거팁을 제안한다. 내구성 평가는 회전 드럼 샌딩 테스트와 39.2 N(4.0 kgf) 하중을 분당 45회 반복 가압하는 두 가지 가속 실험으로 수행되었다. 개발된 센서는 샌딩 조건에서 약 2~3시간 후 보호 필름 파손에 도달한 반면, 비교 대상인 GelSight Mini와 DIGIT 상용 센서는 각각 약 24~30초 만에 파손이 시작되었다. 반복 가압 실험에서는 개발된 센서 9개 전부가 최소 5일~최대 8일간 기능을 유지했으나, 두 상용 센서는 25~35분 내에 파손이 발생했다. 정의된 가속 실험 조건 기준으로 내구성이 두 자릿수 이상 향상되었으며, 점진적인 손상 진행과 빠른 카트리지 교체 방식이 유지 관리 가능성을 높인다고 연구진은 밝혔다.