본문으로 건너뛰기

PAPERS

논문 트래커

arXiv cs.RO 신규 논문을 매일 수집해 한국어 요약을 붙입니다. 학회 채택 정보는 저자 코멘트에서 자동으로 추출합니다.

473건학회 채택 2건
Kinsey Wang / Unsplash
2608.28305v1

PanelShield: 로봇 산업용 패널 조작을 위한 검증 가능한 폐루프 안전 계획

PanelShield: Verifiable Closed-Loop Safe Planning for Robotic Industrial Panel Operation

Guipeng Xin, Jiahe Xu, Chenhui Wan, Jie Liu, Youmin Hu 외 1명

PanelShield는 매뉴얼 기반 산업용 패널 조작을 위한 검증 가능한 폐루프(closed-loop) 안전 계획 프레임워크다. 작업 관련 매뉴얼 근거로부터 매개변수화된 행동 기본(action primitive) 시퀀스를 생성하고, 선형 시제 논리(LTL)와 안전 유한상태기계(Safety FSM)를 이용한 이중 형식 검증으로 단계 간 시제적 정확성과 상태 전이 적법성을 보장한다. 위반 발생 시에는 가장 이른 위반 단계와 원인이 담긴 구조화된 반례(counterexample)를 출력해 목표 지향적 수정 및 재검증을 지원한다. 세 종류의 산업용 장치 패널을 포함한 다층 장기 계획 벤치마크 평가에서, 기반 모델 단독 계획 기준선 대비 복잡한 안전 제약 과제 성능이 향상되었으며 위반율은 2.7%, 전체 지연은 4.1초로 나타났다. 실세계 로봇 실험을 통해 엔드-투-엔드 실행 가능성이 확인되었다.

Kindel Media / Pexels
2608.28300v1

MaCoPlanner: 산업용 패널 로봇 조작을 위한 LLM 기반 매뉴얼 컴파일 작업 계획 및 사전 안전 검증

MaCoPlanner: LLM-Assisted Manual-Compiled Task Planning with Proactive Safety Verification for Robotic Industrial Panel Operation

Guipeng Xin, Jiahe Xua, Mohammad Deghat, Chenhui Wan, Jie Liu 외 2명

MaCoPlanner는 산업용 패널 조작 로봇을 위한 작업 계획(task planning) 프레임워크로, 장비 매뉴얼을 타입이 지정된 중간 표현(typed intermediate representation)으로 변환한 뒤 작업·상태 관련 근거를 검색하여 계획 생성에 활용한다. 실행 전 후보 계획을 기호적으로 시뮬레이션하여 절차 및 상태 전이 제약 위반을 탐지하고, 위반이 발견되면 해당 지점을 국소화하여 수정에 활용하며 해결되지 않은 계획은 거부한다. 독립 평가 기준에서 최종 위반율 2.7%를 달성하였으며, 수정 예산 소진 후 전체 실행의 26.3%가 거부되었다. Raw-Manual 방식 대비 Level-2 작업 성공률은 62.8%에서 84.4%로, Level-3 작업은 25.9%에서 43.2%로 각각 향상되었다. 컨트롤러 패널 시뮬레이터 실험을 통해 산업 부하 없이 대표적인 상호작용 조건에서 통합 실행 가능성을 확인하였으며, 산업 현장 배포 준비 완료는 주장하지 않는다.

ThisisEngineering / Unsplash
2608.28279v1

STEGNav: 멀티모달 평생 객체 탐색을 위한 시공간 이벤트 그래프 추론

STEGNav: Spatio-Temporal Event Graph Reasoning for Multimodal Lifelong Object Navigation

Yang Chen, Zhenyu Huang, Wenbo Fu, Danyang Peng, Shi-Yu Tian 외 2명

STEGNav는 에이전트가 미탐색 환경에서 객체 범주·언어 설명·참조 이미지로 지정된 탐색 과제를 순차적으로 수행하는 학습 불필요(training-free) 프레임워크다. 기존 상태 중심 의미 장면 그래프(semantic scene graph) 방식은 유사 인스턴스 구별, 탐색 전선(exploration frontier) 표현, 기억 재활용 측면에서 한계를 보였다. STEGNav는 공간 축에서 쿼리 조건부 인스턴스 그라운딩과 도달 가능성·경로 비용·탐색 유용성을 고려한 전선 표현을 수행하고, 시간 축에서는 궤적 인식 이중 창(dual-window) 메모리로 최근 결정-궤적 이벤트와 하위 과제 간 탐색 결과를 보존한다. 시공간 이벤트 그래프(spatio-temporal event graph)를 추론하는 VLM 기반 에이전트가 다음 탐색 목표로 타깃 인스턴스 또는 탐색 전선을 선택한다. GOAT-Bench에서 성공률(SR) 66.3%, SPL 39.7을 달성했으며, HM3Dv1과 HM3Dv2에서 각각 64.0%와 69.4%의 SR을 기록했다.

Izzet Sezer / Pexels
2608.28270v1

효율적인 UAV 탐색 작전을 위한 대형 언어 모델 기반 공간-의미 추론

Spatial-Semantic Reasoning using Large Language Models for Efficient UAV Search Operations

Marin Maletic, Marijana Peti, Tamara Petrovic, Stjepan Bogdan

본 논문은 무인 항공기(UAV)의 객체 목표 항법(ObjectNav) 작업에서 임무 시간 효율을 높이기 위한 실시간 의미적 탐색 프레임워크를 제안한다. 대형 언어 모델(LLM)이 사용자의 자연어 명령을 해석하고, 탐지된 객체와 공간 맥락에 대해 의미적 추론을 수행해 탐색 우선순위 영역을 동적으로 결정한다. 실시간 객체 감지, 3차원 공간 매핑, 다항 스플라인 보간(polynomial spline interpolation)을 결합해 부드럽고 실행 가능한 UAV 비행 경로를 생성한다. 시뮬레이션과 실세계 환경 모두에서 수행한 실험 결과, 탐색 정확도를 유지하면서 임무 소요 시간이 단축되는 것으로 나타났다.

Kindel Media / Pexels
2608.28266v1

CoCoBench: 체화 다중 에이전트 작업 계획을 위한 협력 조정 벤치마크

CoCoBench: A Cooperative Coordination Benchmark for Embodied Multi-Agent Task Planning

Yang Chen, Ye-Xin Xie, Lirong Che, Danyang Peng, Yuzhe Yang 외 6명

CoCoBench는 가사 실행 작업 환경에서 다중 에이전트 체화 조정을 평가하기 위한 구성 요소 수준의 벤치마크다. 총 897개의 오라클 검증 인스턴스를 포함하며, 작업 할당(task allocation)·순차 순서(sequential ordering)·상호 배제(mutual exclusion)·인계 조정(handoff coordination)의 네 가지 조정 구성 요소로 구성된다. 기존 벤치마크가 전체 작업 성공률만 집계해 중복 수행·제약 위반·자원 경합 등 조정 실패를 가리는 문제를 지적하며, CoCoBench는 구성 요소별 세부 점수를 추가로 제공한다. 11개의 다중모달 대형 언어 모델(MLLM)을 다양한 조정 모드·관찰 입력·에이전트 수 조건에서 평가한 결과, 전체 성능이 높더라도 조정 유형별 역량은 고르지 않은 것으로 나타났다.

Enchanted Tools / Unsplash
2608.28246v1

시각-언어 모델과 기하학적 표면 스코어링을 이용한 변형 무균 음료 카톤의 학습 없는 흡착 파지 감지

Training-free Suction Grasp Detection for Deformed Aseptic Cartons Using Vision-Language Models and Geometric Surface Scoring

Marin Maletic, Goran Vasiljevic

재활용 음료 카톤은 변형과 형상 불균일로 인해 로봇 분류가 어렵다. 이 연구는 텍스트 프롬프트 기반 오픈 어휘 시각-언어 모델(VLM)로 카톤을 탐지하고, SAM2로 인스턴스 마스크를 정교화한 뒤, 표면 평탄도와 법선 정렬을 결합한 기하학적 스코어링으로 흡착 파지 지점을 선택하는 훈련 없는 시스템을 제안한다. 기하학적 방법으로는 k-최근접 이웃 PCA, Sobel 외적, RANSAC 평면 피팅 세 가지를 비교한다. 실제 로봇을 대상으로 3가지 변형 수준과 35개 혼잡 장면에서 평가한 결과, 단일 물체 파지 성공률은 88.2%, 혼잡 환경에서의 종단간 회수율은 72.6%로 나타났다.

铮 夏 / Unsplash
2608.28214v1

비보정 센서를 이용한 확률적 다중 로봇 가스 원점 탐지: 분산 추정 접근법

Probabilistic Multi-Robot Gas Source Localization with Uncalibrated Sensors: A Distributed Estimation Approach

Wanting Jin, Marc Zoel Arias Mitjà, Alcherio Martinoli

이 논문은 보정되지 않은 이종(heterogeneous) 센서를 장착한 다중 로봇 시스템에서 가스 발생원 위치를 추정하기 위한 분산 확률적 프레임워크를 제안한다. 핵심 아이디어는 각 로봇이 센서 스케일링과 비선형성에 불변하는 순위 기반(rank-based) 특징량으로 로컬 신뢰도(belief)를 독립적으로 추정하는 것이다. 이 로컬 신뢰도들은 전문가의 곱(product of experts) 방식으로 융합되어 팀 전체의 일관된 전역 추정치를 산출한다. 추가로, 탐색 중복을 줄이고 탐색(exploration)과 활용(exploitation)을 균형 있게 조율하는 정보적 영역 할당 및 경로 계획 전략을 도입하였다. 현실적인 가스 센서 모델을 적용한 고충실도 시뮬레이션 검증에서, 표준 측정값 집계 기반 벤치마크 대비 유의미하게 높은 탐지 정확도를 달성하였다.

Vladimir Srajber / Pexels
2608.28213v1

PAMoR: 휴머노이드 로봇을 위한 실시간 파라미터화 감정 동작 생성

PAMoR: Parameterized Affective Motion Generation in Real Time for Humanoid Robots

Yan Pan, Lingfan Bao, Tianhu Peng, Chengxu Zhou

PAMoR은 휴머노이드 로봇의 감정 표현 동작을 정량적으로 제어하며 실시간으로 생성하는 시스템이다. 참조 클립이나 감정 단어 대신, 자세 확장(postural expansion)과 동작 에너지(movement energy)로부터 폐형식(closed form)으로 계산한 valence-arousal(V-A) 좌표를 제어 파라미터로 사용하며 인간 어노테이션이 불필요하다. 행동 사전(action prior) 1개와 감정 사전(affect prior) 2개를 공유 잠재 공간에서 학습하고 각 디노이징 단계에서 합성하여, 무엇을 수행할지는 행동 사전이, 어떻게 수행할지는 감정 사전이 조절한다. 29자유도의 Unitree G1 로봇에서 전신 동작이 자기회귀적으로 실시간 출력되며 행동과 감정을 독립적으로 편집할 수 있다. 지각 연구에서 평가자들은 명령된 감정을 전체 시험의 0.38 비율로 정확히 식별하였으며, 이는 기존 기준선보다 높고 실제 인간 배우 동작에서 보고된 0.44에 근접하는 수치이다.

Pavel Danilyuk / Pexels
2608.27406v1

CLAP: 크로스-구현체 비디오 월드 모델은 제로샷 물리 시뮬레이터이다

CLAP: Cross-Embodiment Video World Models are Zero-Shot Physical Simulators

Kechen Liu, Ola Shorinwa

CLAP은 인간과 로봇을 포함한 다양한 에이전트의 인터넷 규모 영상 데이터를 학습에 활용할 수 있는 크로스-엠보디먼트(cross-embodiment) 행동 조건 영상 생성 프레임워크다. 로봇 플랫폼마다 행동 표현이 상이하고 인간 영상에는 행동 레이블이 없다는 문제를 해결하기 위해, 엔드이펙터(end-effector) 포즈·언어 명령·잠재 행동(latent action) 세 가지 행동 표현을 통합하는 방식을 채택한다. 레이블 없는 영상에서 물리적 사전지식을 먼저 학습한 뒤 엔드이펙터 행동 공간에 기반을 두는 커리큘럼 기반 학습 레시피를 통해, 실제 환경에 제로샷(zero-shot) 배포가 가능하다. DROID 벤치마크에서 단일-엠보디먼트 최신 모델과 동등하거나 그 이상의 성능을 보이며, DROID·Bridge·쌍팔 YAM 로봇·G1 휴머노이드 등 다양한 로봇 형태를 지원한다. 코드와 모델 전체를 오픈소스로 공개한다.

Pavel Danilyuk / Pexels
2608.27384v1

FlashVLA: 빠르고 비동기적인 VLA 추론을 위한 스트리밍 행동 디코딩

FlashVLA: Streaming Action Decoding for Fast and Asynchronous VLA Inference

Zekai Li, Jiaming Tang, Zhijian Liu

FlashVLA는 시각-언어-행동 모델(VLA)의 실세계 배포 시 발생하는 높은 추론 지연과 비동기 실행 불안정 문제를 단일 프레임워크에서 동시에 해결하는 스트리밍 액션 디코딩 방식을 제안한다. 플로우 매칭(flow-matching) 기반 VLA 모델은 액션 디코딩에 다수의 반복 단계가 필요해 지연이 특히 크다는 문제가 있다. FlashVLA는 서로 다른 노이즈 수준의 다중 청크를 담는 스트리밍 액션 버퍼를 유지하고, 청크 단위 인과적 어텐션(chunk-wise causal attention)으로 추론 스텝마다 실행 가능한 액션 청크 하나를 출력한다. 청크 단위 자기회귀(autoregressive) 구조가 액션 연속성을 암묵적으로 보존하므로 별도의 미래 상태 조건화 없이도 매끄러운 비동기 실행이 가능하다. 단일 GPU에서 30 Hz 이상의 제어 주파수를 달성하며, 시뮬레이션 및 실세계 실험에서 높은 태스크 성능을 유지하는 것으로 나타났다.

Kindel Media / Pexels
2608.27371v1RA-L

체화된 장면 재배치 계획

Embodied Scene Rearrangement Planning

Canzhi Chen, Zan Wang, Siqi Zhu, Qi Wu, Yixuan Li 외 1명

이 논문은 체화 에이전트(embodied agent)가 자기중심적(egocentric) 시점 관측과 탑다운(top-down) 목표 레이아웃만을 활용해 3D 실내 장면의 가구를 목표 배치에 맞게 재배치하는 새로운 과제인 체화 장면 재배치 계획(Embodied Scene Rearrangement Planning, ESRP)을 제안한다. 기존 재배치 과제와 달리 ESRP는 전역 상태 접근을 허용하지 않고 객체 간 상호 가림(occlusion) 현상을 도입해 실세계 로봇 배치 환경의 현실적 제약을 반영한다. 연구 지원을 위해 OmniGibson 기반의 벤치마크인 ESRP-Bench를 공개하며, 이 벤치마크는 5,400개 이상의 장면 쌍과 8,200개의 객체로 구성된다. 재배치 품질 평가를 위한 3단계 지표를 정의하고, 계층적 태스크-모션 계획(task-and-motion planning), 시각-언어 모델(VLM) 기반 방법, 모방 학습(IL) 및 강화 학습(RL)의 네 가지 기준 방법을 제공한다. 실험 결과, 현재의 방법들은 과제를 효율적으로 완수하는 데 어려움을 겪는 것으로 나타났다.

Kindel Media / Pexels
2608.27282v1

TADP: 단일 단계 3D 객체 탐지를 위한 태스크 인식 변형 가능 예측

TADP: Task-Aware Deformable Prediction for Single-Stage 3D Object Detection

Su Wang, Yaochen Li, Min Yang, Jiaohao Nie, Chang Liu 외 1명

단일 스테이지 3D 객체 검출(single-stage 3D object detection)에서 서로 다른 태스크를 동일한 특징(feature)으로 처리하면 모든 태스크에 동시에 적합한 공통 공간을 구성하기 어렵다는 문제를 TADP(Task-Aware Deformable Prediction)가 다룬다. TADP는 3단계 특징 정제 집합 모듈(triple feature refinement aggregation module)로 다층 특징을 적응적으로 추출하고, 다중 스케일 특징 집합 블록(multi-scale feature aggregation block)으로 스케일 인식 방식의 특징 융합을 수행한다. 플러그 앤 플레이(plug-and-play) 형태의 태스크 인식 변형 헤드(task-aware deformation head)를 통해 각 태스크의 강조점과 태스크 간 상호작용을 반영한 예측을 생성한다. KITTI 벤치마크에서 자동차 클래스 평균 정밀도(mAP) 80.91%를 기록하였으며, 제안된 변형 헤드는 다른 검출 방법에도 적용 가능한 것으로 확인되었다.

NOAA / Unsplash
2608.27271v1

과학적 영향 극대화를 위한 해양 자율 차량 군집 스케줄링

Marine Autonomous Vehicle Fleet Scheduling to Maximise Scientific Impact

Mehdi El Krari, Jonathan Smith, Maria Fox

해양 자율 이동체(MAV, Marine Autonomous Vehicle) 운용 규모가 커지면서 대규모 함대의 경로 계획을 수작업으로 처리하는 데 한계가 생겼다. 연구진은 혼합 정수 선형 계획법(MILP, Mixed-Integer Linear Programming) 모델을 제안하여 MAV 배치 일정을 자동으로 최적화한다. 모델은 배터리 용량과 데이터 수집 시간 창(time window) 같은 운용 제약을 고려하면서 총 데이터 수집량 극대화와 투입 차량 수·에너지 소비 최소화를 동시에 달성하도록 설계되었다. 모선 항로를 통합해 임무 중 배터리 교환이나 경유지 간 신속한 이동을 지원한다는 점이 이 프레임워크의 주요 특징이다. 계산 실험에서 수십 대 규모의 함대 경로 문제는 수 초 안에, 수백 대 규모는 수 분 안에 풀리는 확장성을 보였다.

Bill Nino / Unsplash
2608.27225v1

STEP: 인간-로봇 협업을 위한 멀티모달 LLM 기반 상태 인식 태스크 추정 및 계획

STEP: State-Aware Task Estimation and Planning with Multi-Modal LLMs for Human-Robot Collaboration

Maitrey Gramopadhye, Prakash Baskaran, Xiao Liu, Songpo Li, Soshi Iba

STEP(State-aware Task Estimator and Planner)은 산업 환경에서의 인간-로봇 협업을 위해 멀티모달 대형 언어 모델(MM-LLM)을 활용한 작업 계획 프레임워크다. 기존 MM-LLM 기반 방법은 시스템 상태를 추적하지 못해 목표에서 벗어난 환각 행동(hallucinated action)을 생성하는 문제가 있었다. STEP은 MM-LLM이 현재 시스템 상태를 명시적으로 추정하고 실행된 행동에 따른 상태 전이를 예측하도록 프롬프트를 설계하여 이 문제를 해결한다. 자연어 계획 생성 시 발생하는 실행 모호성을 줄이기 위해 예측 행동 수행에 필요한 보조 파라미터도 함께 생성한다. 로봇 조립 시뮬레이션 환경에서의 평가 결과, 기존 최고 성능 대비 행동 실행 가능성 32.8%, 최종 상태 오류 14.8% 향상되었다.

Pavel Danilyuk / Pexels
2608.27221v1

텐세그리티 연속체 로봇이 협동 행동을 위한 태스크 적응형 형태를 가능하게 함

Tensegrity Continuum Robots Enable Task-Adaptive Morphologies for Cooperative Behaviors

Mahmud Hasan Saikot, Sydney Spiegel, Sudheera Akalanka Kariyawasam, Andrew Stefka, Josh Chrisler 외 1명

텐세그리티(tensegrity) 기반 유연 구조체와 클로(claw) 기반 연결 메커니즘을 결합한 모듈형 재구성 로봇(MRR)을 제안한다. 각 유닛은 독립적으로 조작 및 이동이 가능하며, 복수의 유닛이 체인·루프·분기 등 다양한 형태로 자가 재구성된다. 텐세그리티 구조를 채택함으로써 기존 강체 모듈 기반 MRR에서 부족했던 구조적 순응성(compliance)을 확보하면서도, 기존 컨티뉴엄 로봇이 갖지 못했던 자가 재구성 능력을 동시에 구현한다. 물체 협동 조작·운반, 다중 이동 방식, 이동-조작 복합(loco-manipulation) 작업 등 실세계 환경에서 다양한 성능을 검증하였다. 제조업, 우주 탐사, 수색·구조 분야 응용을 목표로 적응형 다기능 로봇 집단 연구의 기반을 제시한다.

Tanha Tamanna Syed / Pexels
2608.27186v1

공압 소프트 액추에이터의 태스크 공간 모델 기반 제어

Task-space model-based control of pneumatic soft actuators

Nithin S. Kumar, Joshua Gaston, D. Caleb Rucker, Eric J. Barth

공압 소프트 액추에이터(pneumatic soft actuator)는 강한 비선형성과 분산 변형으로 인해 폐루프 태스크 공간 제어가 어렵다. 본 연구는 홀로노믹 구속 조건을 포함한 절대 좌표계 기반 비최소 좌표 이산 탄성 로드(discrete elastic rod) 모델을 토대로 실시간 동역학 모델 기반 태스크 공간 피드백 및 상태 추정 프레임워크를 제안한다. 희소 시스템 행렬을 활용해 최대 10개의 이산화 로드에서 실시간 제어를 구현하며, 준정적(quasi-static) 피드포워드 역모델과 태스크 공간 PI 제어기, 가상 힘을 융합하는 동적 관측기(observer)를 결합해 희소 센싱 환경에서도 전체 상태 추정이 가능하다. 다양한 기하학적 형상을 가진 세 종류의 평면형 공압 소프트 액추에이터에서 실험 검증을 수행한 결과, 정밀 동작에서 1.5~2.3 mm RMSE, 1~2 Hz 주기 동작 추적에서 5.5~12.4 mm RMSE를 달성한다. 팁 속도는 숫자 필기 작업(0~9) 기준 3~18 mm/s, 주기 운동 추적 시 최대 37 cm/s에 이른다.

Mika Baumeister / Unsplash
2608.27151v1

로봇 분해 단계 전반에 걸친 공유 모듈식 고정 장치 배치 계획

Planning a Shared Modular Fixture Layout Across Robotic Disassembly Stages

Haohui Pan, Takuya Kiyokawa, Kensuke Harada

불규칙한 형상의 제품을 로봇으로 분해할 때, 부품이 제거됨에 따라 지지 조건과 하중 분포가 달라져 치구(fixture) 재배치 없이 전 단계를 안정적으로 지지하기 어렵다. 본 논문은 드라이버와 면도기 분해 전 과정에 걸쳐 단일 공유 배치를 계획하는 모듈형 진공 치구 시스템을 제안한다. 혼합 연속-이산 탐색 공간에서의 최적화를 위해 노이즈 제거 확산 확률 모델(denoising diffusion probabilistic model, DDPM)로 물리 기반 초기 배치를 생성하고, 이를 베이즈 최적화(Bayesian optimization)로 정제한다. 11회의 방향별 하중 시험을 통해 안정성을 정량화한 결과, 드라이버 분해 시 평균 경험적 안정성 여유(stability margin)는 66.9%, 면도기는 81.6%로 나타났다. 실험을 통해 계획된 단일 배치가 전체 분해 순서에 걸쳐 안정적인 지지를 제공함이 검증되었다.

Kindel Media / Pexels
2608.27088v1

식물 스트레스의 이질성 특성화를 위한 능동 센싱

Active sensing to characterize the heterogeneity of plant stress

Ayman Laaroussi, Peter Hanappe, David Colliaux

이 논문은 식물 잎의 엽록소 형광(chlorophyll fluorescence) 측정을 자동으로 수행하는 자율 로봇 플랫폼을 제안한다. 다시점(multi-view) 데이터로 식물의 밀집 3D 모델을 재구성한 뒤, 잎 표면의 방향·접근 가능성·센서 제약 조건을 분석하여 측정 후보 지점을 추출한다. 태스크 수준 계획 프레임워크(task-level planning framework)가 로봇 매니퓰레이터의 끝단을 충돌 없이 접촉 또는 근접 접촉 자세로 유도하여 점 단위 형광 측정을 가능하게 한다. 이로써 수동적 이미징을 넘어 공간 해상도를 갖춘 반복 가능한 생리적 측정이 구현된다. 해당 시스템은 고해상도 식물 표현형 분석(plant phenotyping) 및 자율 농업 검사 분야에 활용될 수 있다.

Guille B / Unsplash
2608.27085v1IROS

Pass the Bucket: 이종 로봇 팀을 위한 효율적이고 견고한 로컬 부하 분산

Pass the Bucket: Efficient, Robust, Local Load Balancing for Teams of Heterogeneous Robots

Tobias Wallner, Dominik Krupke, Arne Schmidt, Sándor P. Fekete

이 논문은 이종(heterogeneous) 로봇 군집이 협력 운반 등 협조적 동작 계획을 요구하는 작업을 수행할 때의 분산·자율 태스크 공유 문제를 다룬다. 제안하는 메커니즘은 버킷 브리게이드(bucket brigade)로, 로봇들이 중앙 제어나 전역 정보 없이 이웃 로봇 또는 벽과의 충돌만을 감지하며 1차원 공간의 작업 구간을 분할한다. 목표는 각 로봇의 속도에 비례한 구간 분할을 통해 전체 처리량(throughput)을 최적화하는 것이다. 혼돈적 시스템 거동을 억제하기 위해 로봇 조우(encounter) 후 일시적으로 감속시키는 '토큰(token)' 기반 안정화 기법을 도입하였으며, 이로써 지속적 진동이 제거되고 안정 상태로 수렴함을 보인다. 이벤트 기반 시뮬레이션 결과, 로봇 삭제·위치·속도 교란 등 다양한 섭동 조건에서도 시스템이 안정적으로 재수렴하는 강건성을 확인하였다.

Asif Al / Unsplash
2608.27079v1

GRAFT: 세밀한 로봇 조작을 위한 기반화되고 효율적인 온라인 강화 적응

GRAFT: Grounded and Efficient Online Reinforcement Adaptation for Fine-Grained Robot Manipulation

Yibo Qiu, Haoliang Ye, Shu'ang Sun, Zan Huang, Ronald X Xu 외 1명

GRAFT는 사전 학습된 시각-언어-행동 모델(VLA)을 생체의학적 정밀 조작 과제에 효율적으로 온라인 적응시키기 위한 프레임워크다. 영역 수준 지도학습(region-level supervision)으로 뷰 특화 시각 앵커를 학습해, 배포 시 별도 영역 제안 없이도 과제 관련 국소 시각 단서에 집중할 수 있다. 단일 스텝 행동 생성과 시각-언어 프리픽스 캐싱을 결합해 VLA 추론 및 리플레이 기반 업데이트의 계산 부담을 줄인다. 4가지 생체의학적 조작 과제 실험에서 동일한 적응 예산 조건 하에 성공률이 25퍼센트포인트 향상되었다.