본문으로 건너뛰기

PAPERS

논문 트래커

arXiv cs.RO 신규 논문을 매일 수집해 한국어 요약을 붙입니다. 학회 채택 정보는 저자 코멘트에서 자동으로 추출합니다.

473건학회 채택 2건
Shahabudin Ibragimov / Unsplash
2609.24896v1

세 점 인터페이스를 통한 모듈형 조향·반응형 파지 프레임워크

Steerable and Reactive Grasping Through Modular Design with a Three-Point Interface

Andrew Nguyen, Yonghyeon Lee, Sangbae Kim

본 논문은 정교한 파지(dexterous grasping)를 '어디를 잡을지', '목표 지점에 도달하기', '안정적 접촉 유지'의 세 단계로 분리하고, 이를 컴팩트한 세 점 인터페이스로 연결하는 모듈형 프레임워크를 제안한다. 물체 형상과 선택적 언어 명령을 입력받아 사전 계산된 파지 어포던스 히트맵(grasp-affordance heatmap)에서 세 접촉점 집합을 추출한다. 모델 기반 반응형 제어기는 물체 추적과 충돌 회피를 담당하며, 최종 수 센티미터 구간에서는 강화학습(RL) 정책이 고유감각(proprioceptive) 피드백만으로 파지를 보정·안정화한다. RL 정책은 손가락 관절 상태와 최근 행동만 관측하므로 단일 정책이 다양한 물체와 파지 구성에 공유된다. 시뮬레이션에서 들어올리기 성공률을 비교 기준선 대비 평가하였고, 학습 물체 두 종과 미학습 물체 한 종에 대한 실기(hardware) 시연도 수행하였다.

Daniel Andraski / Pexels
2609.24868v1

DualWAM: 비동기 전역 계획 및 국소 정제를 위한 이중 시스템 세계 행동 모델

DualWAM: Dual-System World Action Models for Asynchronous Global Planning and Local Refinement

Yixin Zheng, Jiangran Lyu, Yuntian Deng, Kai Liu, Yizhou Zhou 외 4명

세계 행동 모델(WAM, World Action Model)은 로봇 행동 생성과 미래 시각 상태 예측을 함께 수행하지만, 높은 연산 비용으로 인해 기존 모델은 긴 행동 청크(action chunk)에 의존해 폐루프(closed-loop) 응답성이 저하되는 한계가 있다. DualWAM은 전역 계획과 국소 정제를 분리한 이중 시스템 구조를 도입해 고주파 폐루프 행동 업데이트를 가능하게 한다. 시스템 2는 넓은 세계-행동 청크에 대해 양방향 노이즈 제거(bidirectional denoising)로 전역 계획을 수립하고, 시스템 1은 손목 카메라 최신 관측값을 이용해 짧은 시간 창에서 저노이즈 국소 정제를 수행하며 두 시스템은 공유 노이즈 제거 궤적을 따라 비동기로 동작한다. Franka 및 Galbot 플랫폼에서의 제로샷(zero-shot) 조작 실험에서 가장 강력한 베이스라인 대비 평균 성공률이 4.5%p 향상되고 크리티컬 패스 속도가 16.6배 빨라지는 결과가 보고되었다. 분리 설계는 에지-클라우드(edge-cloud) 배포를 자연스럽게 지원하며 베이스라인 대비 통신 오버헤드도 크게 낮아지는 것으로 나타났다.

MART PRODUCTION / Pexels
2609.24864v1

SE(3) 신경 포텐셜 필드를 이용한 3D 재구성 없는 이미지 기반 6-DoF 궤적 계획

SE(3) Neural Potential Fields for 6-DoF Trajectory Planning Directly from Images Without Explicit 3D Reconstruction

Jeffrey Eiyike, Masoud Ataei, Elvis Gyaase, Vikas Dhiman

6자유도(6-DoF) 파지 궤적 계획은 통상 3D 장면 재구성 후 경로를 탐색하지만, 이 논문은 포즈 정보가 부여된 RGB 이미지에서 직접 학습한 SE(3) 신경 포텐셜 필드(neural potential field)를 제안한다. 학습 지도 신호로 측지거리(geodesic distance) 기반 항법 함수를 사용해, 고전 인공 포텐셜 필드의 구배 상쇄로 인한 극솟값 문제를 제거한다. UR10 로봇 암을 이용한 두 가지 테이블탑 장면 실험에서, 제안 방법은 모든 시작 위치로부터 파지 목표 3 cm 이내로 수렴하고 지상 진실 기하에 대해 충돌 없는 경로를 실행했다(이미지 단독 감독 시 각 25%·0% 대비). 팔-링크 접촉 비율은 20.6~50.4%에서 2.7~5.5%로 낮아졌고, 평균 여유 간격은 1 cm 미만에서 8.6~8.8 cm로 늘었다. 계획 소요 시간은 약 2초로, 동일 이미지 재구성 기반 RRT*의 67~133초보다 짧다.

Kindel Media / Pexels
2609.24846v1

정확한 방위각 정보를 활용한 거리 보조 SLAM 초기화 방법

Range-Aided SLAM Initialization Exploiting Accurate Heading Information

Isabel Lougheed, James Richard Forbes

이 논문은 거리 보조 동시 위치추정 및 지도작성(RA-SLAM, Range-Aided SLAM)을 위한 새로운 초기화 방법을 제안한다. 자율 수중 로봇(AUV) 항법에서 일반적으로 얻을 수 있는 고정밀 방위각(heading) 정보를 핵심 입력으로 활용하며, 두 단계 절차로 구성된다. 첫 번째 단계에서는 일반화 신뢰 영역 부분 문제(GTRS, Generalized Trust Region Subproblem) 기법으로 비선형 거리 측정값으로부터 트랜스폰더의 상대 위치를 계산하고, 두 번째 단계에서 선형 최소자승(linear least-squares) 문제를 풀어 AUV와 트랜스폰더의 절대 위치를 추정한다. 제안 방법은 관성 항법 시스템(INS)의 방위각 정보와 장기선(LBL, Long Baseline) 거리 측정값이 함께 제공된 실제 AUV 데이터셋을 통해 검증되었다.

Kindel Media / Pexels
2609.24841v1

CAST: 동시 궤적 추정 및 계획을 활용한 건설 로봇의 충돌 인식 조립

CAST: Collision-Aware Assembly with Construction Robots using Simultaneous Trajectory Estimation and Planning

Karthik Shaji, Chisung Kim, John D'Amato, Edvard Bruun, Frank Dellaert

건설 환경에서 다중 로봇 시스템이 마주하는 고차원 구성 공간과 충돌 회피 제약을 다루는 프레임워크 CAST를 제안한다. 단일 팩터 그래프(factor graph)를 사용해 궤적 추정(trajectory estimation)과 계획(planning)을 동시에 수행하며, 로봇 상태 측정값·명시적 충돌 제약·학습된 케이블 제약을 통합한다. 변화하는 작업 공간에 대응하면서 무거운 로봇 시스템의 강성 및 진동 유발 불확실성도 고려한다. 목재 그리퍼 역할의 로봇 암 1대와 못 박기 역할의 로봇 1대를 이용한 기둥-인방보(post-and-lintel) 구조물 시공 실험으로 프레임워크의 동작을 실증했다.

Enchanted Tools / Unsplash
2609.24840v1

PredActor: 조향 가능한 온보드 휴머노이드 제어를 위한 예측적 행동 확산

PredActor: Predictive Action Diffusion for Steerable Onboard Humanoid Control

Lei Ye, Haibo Gao, Yitang Li, Peng Xu, Zetong Jing 외 8명

PredActor는 확산 모델(diffusion model) 기반의 예측적 행동 정책으로, 고유감각(proprioceptive) 관측 이력과 선택적 태스크 맥락을 입력받아 실행 가능한 행동과 내부 미래 상태 궤적을 동시에 생성한다. 별도의 동작 추적기나 외부 추정 전신 상태를 요구하지 않으며, 분류기 없는 가이던스(classifier-free guidance)로 텍스트 조건부 동작을 강화하고 분류기 가이던스(classifier guidance)로 테스트 시점 목표를 향해 예측 상태를 유도한다. 시뮬레이션 평가에서 15개 목적지 목표를 모두 달성했으며, 텍스트 검색 점수는 0.580으로 조건부 행동 확산 방식(0.373) 대비 높은 수치를 기록했다. 롤링 노이즈 제거와 연산 최적화를 통해 Jetson Orin NX 온보드 컴퓨터에서 콜백 시간 중앙값 16.790 ms, p95 19.383 ms를 달성하며 20 ms 제어 주기를 충족한다. Unitree G1 휴머노이드에 실제 탑재하여 텍스트 조건 모션, 외란 응답, 조이스틱 제어, 의미 보간(semantic interpolation)을 실기로 검증했다.

cottonbro studio / Pexels
2609.24832v1

비미끄럼 구속조건 하에서 강성 바퀴로 이동하는 차량형 이동로봇의 최소 시간 궤적

Minimum Time Trajectories for a Car-Like Mobile Robot Moving with Rigid Wheels Under Non-Sliding Constraints

Joseph Ben-Asher, Elon Rimon, Leeor Ravina

이 논문은 장애물 없는 환경에서 차량형(car-like) 이동로봇의 최소 시간 궤적(minimum time trajectories)을 연구한다. 로봇은 앞바퀴 가속도와 조향 속도율에 제한이 있으며 전진·후진이 모두 가능하다. 기존 운동학적(kinematic) 모델은 순수 구름(pure rolling) 가정을 사용했으나, 전·후륜의 비미끄럼 구속조건(non-sliding constraints)은 로봇 동역학(dynamics)으로만 처리할 수 있다는 점에서 한계가 있었다. 이 논문은 동역학 기반으로 비미끄럼 구속조건을 공식화하고, 기존 12개 경로 기본요소(path primitives)에 3개의 새로운 비미끄럼 경로 기본요소를 추가하여 시간 최적 궤적을 완성한다. 비미끄럼 경로 기본요소에 대한 근사 해석해(approximate analytic solutions)도 제공하며, 대표적 기동 예제를 통해 구속조건이 최적 궤적에 미치는 영향을 보인다.

Erik Mclean / Unsplash
2609.24815v1

Uranus: 체화 AI를 위한 차세대 시뮬레이션 인프라 구축

Uranus: Building the Next-Generation Simulation Infrastructure for Embodied AI

Wenkang Qin, Yukun Zhou, Noah Shen, Jisong Cai, Dongxiao Mao 외 3명

Uranus는 관절 궤적 조건부 자기회귀 확산 모델(joint-trajectory-conditioned autoregressive diffusion model)을 기반으로 한 데이터 기반 로봇 시뮬레이터다. 미래 관절 위치 궤적을 온라인으로 입력받아 매 단계마다 잠재 프레임 하나(RGB 프레임 4장에 대응)를 자기회귀적으로 생성하는 스트리밍 개방형 롤아웃(streaming open-ended rollout)을 지원한다. 추론 최적화를 통해 24 FPS의 저지연 생성을 달성하며, 다양한 로봇 형상과 카메라 구성에 대해 동기화된 다중 시점 생성을 위한 통합 인터페이스를 제공한다. 분포 내(in-distribution) 및 분포 외(out-of-distribution) 데이터 모두에 걸쳐 정량·정성 평가를 수행하고, 현재 시스템의 한계를 명시적으로 기술한다. 코드와 모델 가중치는 공개된다.

Jakub Zerdzicki / Pexels
2609.24778v1CoRL

H2RBench: 인간-로봇 전이 평가를 위한 실제-시뮬레이션 벤치마크

H2RBench: A Real-to-Sim Benchmark for Evaluating Human-to-Robot Transfer

Chuyang Xiao, Haotian Zhan, Sriram Krishna, Peilin Meng, Muhammad Zubair Irshad 외 2명

H2RBench는 인간 동영상 시연으로부터 로봇 조작 정책을 학습하는 인간-로봇(H2R) 전이 방법들을 비교 평가하기 위한 Real2Sim 벤치마크다. 실제 인간 시연 영상과 시뮬레이션 로봇 시연을 기반으로 표준화된 프로토콜을 제공하며, 다양한 상호작용 요건을 포괄하는 4가지 조작 과제를 포함한다. 구현체 격차(embodiment gap) 해소 전략이 서로 다른 여러 대표적 H2R 전이 방법을 평가했으며, 인간 시연 데이터 양에 따른 확장성에서 방법들 간 상당한 차이가 확인됐다. 시뮬레이션 성능이 실제 환경 성능을 폭넓게 예측하는 것으로 나타났으며, 방법-과제 조합 전반에서 Pearson 상관계수 r=0.89, Spearman 상관계수 rho=0.85, MMRV(Mean Maximum Rank Violation) 0.06을 기록했다.

Daniel Smyth / Pexels
2609.22085v1

SeeQ: 장기 로봇 조작을 위한 범용 가치 함수 학습

SeeQ: Training Generalist Value Functions for Long-Horizon Robotic Manipulation

Saksham Singh, Zheyuan Hu, Max Sobol Mark, Jeffrey Yu, Zackory Erickson 외 1명

SeeQ는 장기·다단계 로봇 조작 과제에서 정책을 개선하기 위해 서브태스크(subtask) 단위로 Q값을 학습하는 방법이다. 전체 과제의 희소 보상 대신 현재 활성 서브태스크에 대한 Q값을 추정함으로써 가치 예측 지평선을 단축하고 시간차(TD, temporal-difference) 목적함수를 효과적으로 적용한다. 테스트 시 별도의 사람 주석이나 모듈형 서브태스크 예측 시스템 없이 작동하도록, Q함수 아키텍처가 현재 활성 서브태스크를 자연어로 자기회귀적으로 예측한 뒤 그 값을 추정하는 구조를 채택하였다. 시각-언어(vision-language) 기반 모델로 구현해 오픈소스 로봇 조작 데이터로 사전학습 후 하위 과제에 미세조정하였다. 두 양팔 로봇 플랫폼에서 진행한 네 가지 실환경 조작 과제에서 best-of-N 정책 조향 성능을 개선하였다.

ThisIsEngineering / Pexels
2609.22075v1

LIMBO: 민첩하고 안전한 전신 제어를 위한 모델 프리 배리어 목표 학습 및 내재화

LIMBO: Learning and Internalizing Model-Free Barrier Objectives for Agile and Safe Whole-Body Control

Jake Gonzales, Arturo Flores Alvarez, Yu-Ming Chen, Aaron D. Ames, Lillian J. Ratliff 외 1명

LIMBO는 고차원 비선형 동역학 환경에서 충돌 회피와 균형을 동시에 다루기 위해 상태-행동 제어 배리어 함수(Q-CBF, Q-Control Barrier Function)를 학습하고 태스크 정책에 내재화하는 프레임워크다. 고정된 기반 컨트롤러 주변의 잔차 행동(residual action)과 블랙박스 전이 데이터를 활용해 Q-CBF 합성을 전체 제어 차원에서 다루기 쉽게 만든다. 합성 단계에서는 학습된 안전값이 회복 가능성(recoverability) 경계 근방의 위험 유도 샘플링을 구동하고, 태스크 학습 단계에서는 행동 수준의 안전 피드백을 제공하는 교사 역할을 하여 배포 시 온라인 안전 필터를 별도로 두지 않아도 된다. 29 자유도 휴머노이드 로봇을 대상으로 피구공 회피와 낮은 장애물 아래 이동 과제를 수행했으며, 샘플링 집중도에 따라 웅크리기부터 뒤로 젖히는 림보 동작까지 다양한 전략이 도출되었다. 학습된 정책은 동일한 안전 사양 하에 온라인 안전 필터 없이 실제 하드웨어로 전이되었다.

James Coleman / Unsplash
2609.22073v1

보행 유형 전반에 걸쳐 강건한 사족 로봇 보행을 예측하는 듀티 팩터

Duty Factor Predicts Robust Constrained Quadrupedal Locomotion Across Gait Types

James Zhu, David Ologan, George Ortiz, Thomas Chun Fai Lee, Selvin Garcia Gonzalez 외 3명

사족 보행 로봇에서 보행 유형(걷기·트로팅 등)은 보행을 완전히 규정하지 않으며, 듀티 팩터(duty factor)·속도·지지 너비 같은 매개변수가 동일 보행 유형 내에서도 달라질 수 있다. 전신 궤적 최적화(whole-body trajectory optimization)에 LQR 피드백을 결합한 분석에서, 듀티 팩터가 보행 유형보다 국소 오차 수렴의 더 강한 예측 인자로 나타났다. 학습 기반 보행 컨트롤러 실험에서는 듀티 팩터가 좁은 지형 환경에서의 강건성 조정을 위한 저차원 매개변수로 기능할 수 있음을 시사한다. 이러한 경향은 중심 모델 예측 제어(centroidal MPC) 프레임워크에서도 유지됐으며, 실제 사족 로봇을 이용한 좁은 지형 실기 실험을 통해 검증되었다.

Sardar Faizan / Unsplash
2609.22062v1

그리퍼 인식 기반 비정형 물체 자동 고밀도 적재

Gripper-Aware Automatic Dense Packing of Irregular Objects

Tianhao Qin, Connor McCann, Berk Calli, Jing Xiao

창고 작업에서 비정형 물체의 자동 고밀도 적재는 로봇 조작의 핵심 난제로, 기존 연구는 그리퍼를 고려하지 않은 시뮬레이션 환경에 머물러 있었다. 본 연구는 인식, 그리퍼 인식 배치 최적화, 힘 피드백 기반 실행을 통합한 폐루프(closed-loop) 파이프라인을 제안한다. 최적화기는 물체와 그리퍼를 계층적 구 트리(hierarchical sphere tree)로 표현한 복합 물체로 모델링하고, GPU에서 CMA-ES 프레임워크를 통해 5자유도를 탐색한다. 실행 중 힘 감지 수직 하강으로 첫 접촉 시 정지하고, 릴리스 이후 측면 여유를 줄이는 통합 푸시를 수행하며, 배치마다 컨테이너를 재인식해 오차 누적을 방지한다. Franka Emika Panda 로봇에서 3D 프린팅 물체 및 YCB 물체 세트를 대상으로 검증하고, 절제 연구(ablation study)로 각 구성 요소의 기여도를 분석했다.

Pavel Danilyuk / Pexels
2609.22055v1

구성적 과제에서의 지속 학습을 위한 월드 모델 벤치마킹

Benchmarking World Models for Continual Learning on Compositional Tasks

Haoyu Zhou, Joe Watson, Anson Lei, Ingmar Posner

월드 모델(world model)이 새로운 환경에 적응하면서 이전 지식을 잊지 않으려면 과거 경험의 재사용 능력이 핵심이다. 연구팀은 로봇 조작 영역에서 구성적 지속 학습(compositional continual learning) 벤치마크를 제안하며, 각 과제 커리큘럼을 이전에 등장한 과제들의 요소를 조합한 형태로 설계했다. 구성 축을 행동(action)과 지각(perception)으로 분리해 어떤 입력 양식이 지식 재사용의 병목이 되는지를 분석한다. 최신 월드 모델을 대표적 지속 학습 기법과 함께 평가한 결과, 명시적으로 재사용 가능한 구성 요소를 갖춘 모듈형 월드 모델이 망각과 재사용 사이의 균형에서 기존 방법보다 나은 성능을 보였다. 다만 어떤 모델도 문제를 완전히 해결하지 못해, 망각 없이 재사용이 가능한 지속 학습 월드 모델 연구의 여지가 남는 것으로 나타났다.

Oli Liao / Pexels
2609.22040v1

PRIME: VLA 모델에서 상황 메모리 임베딩을 활용한 인지 피드백

PRIME: Perception Feedback with Situational Memory Embeddings in VLA Models

Erik Deinzer, Naya Baslan, Luca Paparusso, Narunas Vaskevicius, Peter Knott 외 1명

자율주행용 시각-언어-행동 모델(VLA)은 인지→추론→계획 계층을 순방향으로만 처리하며, 초기 인지 단계가 하위 추론이나 탐색 목표를 반영하지 못한다는 한계가 있다. 이 논문은 과거 인지·추론·탐색 목표·예측 행동의 잠재 표현을 L-스텝 윈도우에 걸쳐 교차 어텐션(cross-attention)으로 집계하는 Situational Memory를 제안하고, 이를 인지 쿼리에 조건으로 부여하는 피드백 메커니즘 PRIME을 소개한다. PRIME은 7.3B 파라미터 기반 모델에 최대 29.7M 파라미터(0.41%)만 추가해 의도 기반 인지 어텐션을 구현한다. Bench2Drive 폐루프(closed-loop) 벤치마크 평가에서 주행 점수 82.47(ORION 대비 +4.73)과 성공률 60.00%(+5.38%p)를 기록했으며, 이는 Think2Drive 시연으로 학습된 공개 VLA 중 가장 높은 주행 점수다.

Mikhail Nilov / Pexels
2609.21983v1

SkelWAM: 제로샷 이기종 로봇 간 조작을 위한 골격 기반 세계-행동 모델

SkelWAM: A Skeleton-Guided World-Action Model for Zero-Shot Cross-Embodiment Manipulation

Pengjun Niu, Yujia Xie, Rui Peng, Hang Zhao, Ke Liu

SkelWAM은 단일 소스 로봇에서 학습한 조작 경험을 다른 형태의 로봇에 전이하는 골격 기반 세계-행동 모델(world-action model)이다. 팔 중심선 기하, 도구 중심점(TCP) 자세, 병렬 그리퍼 명령으로 구성된 25차원 공유 상태를 정의해 로봇 형태 변화와 무관한 일관된 표현을 사용한다. 비디오-행동 혼합 트랜스포머가 정준 골격 행동 청크를 예측하고, 엠보디먼트별 제약 디코더가 이를 관절 제어 또는 연속체 로봇 제어로 변환하므로 관절 간 일대일 대응이 불필요하다. 저자들이 새로 제안한 LIBERO-Cross10 벤치마크(10개 과제, 10종 대상 로봇, 4개 형태 그룹)에서 Franka 학습 정책이 1,000 에피소드 기준 43.3% 성공률을 기록하며 비교 기준선 대비 36.2%포인트 높은 성능을 보였다. JAKA mini2에서 학습한 정책을 Feagine A03 연속체 로봇에 배포해 테이블 조작 3개 과제에 적용하는 실기 실험도 함께 수행했다.

Jeswin Thomas / Pexels
2609.21982v1

CARF: 실패 유도 플로우 매칭의 대조적 인력-척력

CARF: Contrastive Attraction-Repulsion of Failure-Guided Flow Matching

Shuqi Zhao, Bang Du, Cheng-En Wu, Yichen Xie, Yixiao Wang 외 1명

로봇 시연 수집 과정에서 불가피하게 발생하는 실패 궤적을 보다 포괄적으로 활용하기 위한 학습 프레임워크 CARF를 제안한다. 기존 방법은 실패 궤적에서 과제 진행에 기여하는 구간만 재활용하고, 실패를 직접 유발하는 '실패 임계 구간(failure-critical segment)'은 대체로 무시하였다. CARF는 두 유형의 구간이 비대칭적 감독 신호를 제공한다는 점에 착안하여, 성공 시연과 그 섭동(perturbation) 결과만으로 학습한 진행도 점수기(progress-based importance scorer)를 도입해 각 단계의 기여도를 추정한다. 이 점수를 기반으로 플로우 매칭(flow matching) 목적 함수에 인력-척력(attraction-repulsion) 항을 결합해 정책이 진행 구간을 모방하고 실패 임계 구간을 명시적으로 회피하도록 학습한다. 시뮬레이션과 실제 환경 실험 모두에서 다양한 실패 시나리오에 걸쳐 비교 기준선 대비 일관된 성능 향상이 보고되었다.

Daniel Miksha / Unsplash
2609.21948v1

GALA: 다중 구현체 시각-언어-행동 모델 사전학습을 위한 기하 인식 잠재 행동 모델링

GALA: Geometry-Aware Latent Action Modeling for Vision-Language-Action Model Pretraining across Embodiments

Yichen Liu, Puzhen Yuan, Xiang Zhu, Yanjiang Guo, Jianyu Chen

기존 이미지 기반 잠재 행동 모델(LAM)은 인간 손·정밀 로봇 손의 손가락 수준 기하 변화를 포착하지 못하는 한계가 있다. GALA는 이미지 기반 잠재 행동에 3D 말단 장치(end-effector)의 기하 운동을 결합한 기하 인식 잠재 행동 모델링 프레임워크로, 이 문제를 해결하고자 제안되었다. 핵심 구성 요소인 통합 말단 장치 운동 표현(UEMR, Unified End-effector Motion Representation)은 세밀한 운동 정보를 유지하면서 다중 구현체(cross-embodiment) 일반화를 가능하게 한다. GALA는 장면 수준 동역학을 담은 시각 잠재 행동과 말단 장치 관절 운동을 담은 기하 잠재 행동을 결합해, 행동 라벨 없는 자아 중심(ego-centric) 인간 동영상을 포함한 다중 구현체 데이터로 시각-언어-행동 모델(VLA)을 사전학습한다. RoboCasa-GR1 벤치마크에서 68.3%, 실세계 실험에서 75.5%의 성공률을 기록했다.

Yaroslav Shuraev / Pexels
2609.21942v1IROS

실패한 로봇은 언제 질문해야 하는가? 검증된 센서 증거를 통한 교정적 인간-로봇 대화 시작

When Should a Failing Robot Ask? Initiating Corrective Human-Robot Dialogue from Audited Sensor Evidence

Eshika Pathak, Leela Krishna

로봇이 작업 실패 시 자체 진단·추가 센서 참조·인간 문의 중 어떤 행동을 선택해야 하는지를 3행동 의사결정 문제로 정식화하고, 고장 원인이 직접 주입(injected)된 시뮬레이션 벤치마크를 구축했다. 센서별 진단력을 측정한 결과, 일부 고장은 카메라 영상으로 판별할 수 없었으나 힘 데이터(force data)는 0.99의 정확도를 기록했고 어떤 영상 기반 방법도 0.55를 넘지 못했다. 6개 오픈소스 시각-언어 모델(VLM)을 평가한 결과, 응답이 센서 증거보다 프롬프트의 선택지 순서에 좌우되었으며, 순서 변경만으로 거부(refusal) 비율이 78~100%에서 0~6%로 급락한 사례가 3개 모델에서 확인됐다. 영상 기반 정확도는 모든 프롬프트 변형 조건에서 다수결 기준선(majority-class baseline)을 초과하지 못했고, 모델의 자체 신뢰도 수치는 정답 여부와 무관했다. 힘 데이터를 텍스트 10줄로 제공하자 6개 중 4개 모델에서 처음으로 기준선 이상 진단이 나타났으며, 인간에게 한 번 질문하는 것만으로 정확도가 0.70~0.81 수준으로 향상됐다.

Mikhail Nilov / Pexels
2609.21929v1

MAAP: 협동 매니퓰레이션을 위한 다중 에이전트 능동 인식

MAAP: Multi-Agent Active Perception for Collaborative Manipulation

Bruno N. Y. Chen, Li Kang, Heng Zhou, Xiufeng Song, Zhemeng Zhang 외 2명

MAAP(Multi-Agent Active Perception)는 협동 매니퓰레이션(manipulation) 환경에서 각 로봇 팔이 조작 동작을 수행하는 동시에 손목 카메라를 통해 팀 전체의 이동형 시점(viewpoint)을 제공하도록 설계된 방법론이다. 함께 제안된 RAIL(역할 인식 모방 학습, Role-Aware Imitation Learning)은 각 팔의 현재 역할을 행동 청크(action chunk)와 함께 예측하며, 단일 네트워크 안에서 역할 조건부 행동 생성을 수행한다. 시뮬레이션 4개 과제에서 고정 카메라 기준 평균 성공률 56.5%는 손목 카메라를 전부 활성화할 때 70.0%로, MAAP+RAIL 조합에서는 79.2%로 높아졌다. 3개 팔을 사용하는 Microwave 과제에서는 RAIL 적용 시 성공률이 47%에서 82%로 상승했다. 실제 듀얼암(dual-arm) 플랫폼 배치 실험에서 MAAP+RAIL은 20회 중 14회 성공한 반면, 고정 시점 ACT는 20회 중 0회에 그쳤다.