본문으로 건너뛰기

PAPERS

논문 트래커

arXiv cs.RO 신규 논문을 매일 수집해 한국어 요약을 붙입니다. 학회 채택 정보는 저자 코멘트에서 자동으로 추출합니다.

473건
Enchanted Tools / Unsplash
2609.02546v1

ZETA: 테이블탑 조작을 위한 제로샷 이기종 로봇 VLA 전이 통제 연구

ZETA: A Controlled Study of Zero-Shot Cross-Embodiment VLA Transfer for Tabletop Manipulation

Mi Yan, Wenhao Zhang, Zhiqi Zhang, Yu Peng, Tangxinyu Wang 외 12명

ZETA는 시각-언어-행동 모델(VLA)의 이기종 로봇 간 제로샷 전이를 체계적으로 분석하기 위해 설계된 통제 연구다. 연구진은 목표 로봇이 훈련 데이터에 전혀 없는 '엄격한 제로샷 전이'와 사전학습 단계에만 등장하는 '사전학습-노출 제로샷 전이'를 구분하고, 시뮬레이션과 실환경에서 14개의 목표 로봇을 아우르는 벤치마크를 제시한다. 실험 결과, 국소 엔드이펙터(EEF) 상태-행동 표현, 소스 로봇 다양성, 보조 공동학습 목표는 교차 로봇 전이 성능을 각각 약 15, 18, 7 퍼센트포인트 향상시키는 것으로 나타났다. 사전학습 시 목표 로봇 데이터를 5%만 추가해도 평균 진척도가 13.4 퍼센트포인트 향상되어, 두 전이 유형이 별도로 보고되어야 함을 보인다. 본 연구의 결과는 두 손가락 그리퍼를 사용하는 고정형 테이블탑 조작 환경에서 VLA 전이 평가 및 개선을 위한 실질적인 지침을 제공한다.

Kindel Media / Pexels
2609.02542v1

발판 제약 지형에서의 휴머노이드를 위한 월드 모델 보강 시각 보행

World-Model-Augmented Visual Locomotion for Humanoids on Foothold-Constrained Terrain

Yuxi Liu, Lijun Han, Ziming Wang, Ao Zhang, Cong Yang 외 1명

WM-LOCO(World-Model-Augmented Visual Locomotion)는 징검다리·틈새·좁은 계단처럼 발판이 희소하거나 불연속적인 지형에서의 휴머노이드 보행을 위해 순환 월드 모델(recurrent world model)과 PPO 정책을 공동으로 학습한다. 고유감각(proprioception)과 단일 온보드 깊이 영상을 입력으로 받아, 월드 모델이 생성한 예측 순환 특징(predictive recurrent feature)이 정책을 안내하며, 발판 위치 레이블 없이 동작한다. 시뮬레이션 실험에서 비교 기준선이 완전히 실패하는 틈새·징검다리 지형에서 성공하였고, 계단에서는 동등한 성공률을 유지하면서 보행 효율을 높이고 골반 가속도를 줄였다. 동일한 정책을 실제 Unitree G1 휴머노이드에 탑재하여 온보드 고유감각과 단일 깊이 영상만으로 세 가지 지형 유형을 평균 93.3%의 성공률로 통과하였다.

Mohamed Nohassi / Unsplash
2609.02531v1

기하학적 잠재 확산 기반 공간 인식 World Action Model

Spatially Aware World Action Model via Geometric Latent Diffusion

Javier Alejandro Lopetegui Gonzalez, Paul Pacaud, Cordelia Schmid

WAM(World Action Model)은 대규모 사전학습 비디오 확산 모델을 활용해 미래 관측값과 행동을 공동 예측하는 로봇 정책 학습 패러다임이나, 기존 모델은 RGB 관측값에만 의존해 3D 정보를 활용하지 못한다는 한계가 있다. 저자들은 SA-WAM을 제안하며, 단일 확산 백본 내에서 행동·RGB·깊이(depth)를 공동 예측해 3D 인식 세계 모델링을 가능하게 한다. 비선형 인코딩으로 비제한적인 깊이 신호를 동결된 VAE 토크나이저의 입력 도메인에 맞게 변환함으로써, 3D 특화 미세조정 없이 기하학적 정보를 통합한다. SA-WAM은 RoboCasa 및 LIBERO-Plus 벤치마크에서 최고 수준의 성능을 기록하고, UR5 로봇 팔을 이용한 실세계 평가에서도 무작위 환경에 대한 강인성을 보인다. 아울러 세계 모델 예측 품질과 롤아웃 성공률 사이의 상관관계를 분석해 WAM 성능 개선 방향을 제시한다.

Pi Supply / Unsplash
2609.02493v1

MS-MEM: 불확실성·교란 인식 행동 선택 기반 다중 기술 조작 강화 매핑

MS-MEM: Multi-Skill Manipulation-Enhanced Mapping via Uncertainty- and Disturbance-Aware Action Selection

Yitian Shi, Jesper Mücke, Nils Dengler, Sicong Pan, Rania Rayyes 외 1명

MS-MEM은 선반처럼 협소하고 혼잡한 공간에서 서비스 로봇의 장면 이해를 위한 증거적(evidential) 프레임워크로, 능동적 시점 선택·물체 밀기(pushing)·파지(grasping)를 단일 파이프라인으로 통합한다. 장면 수준 계량-의미적(metric-semantic) 증거 신념 추정기와 불확실성 인식 파지 표현을 결합하며, 파지 어포던스와 방향 불확실성을 동시에 모델링하는 완전 증거적 파지 추정기를 새롭게 제안한다. 각 후보 행동은 공통 정보 이득(information gain) 기준으로 평가되며, 조작 행동에는 확신도가 높은 장면 영역의 과도한 변화를 억제하는 부수적 교란 제약(CDC, Collateral Disturbance Constraint)이 추가로 적용된다. 실험 결과, 단일 기술 기준 모델 및 장면 교란을 고려하지 않는 기준 모델에 비해 매핑 정확도가 높아지고 장면 교란이 크게 감소하는 것으로 나타났다.

Marija Zaric / Unsplash
2609.02487v1

지중해 온실 자율 주행을 위한 경사 및 지형 보상 적응형 제어 아키텍처

An Adaptive Control Architecture for Slope and Terrain Compensation in Autonomous Navigation in Mediterranean Greenhouses

Fernando Cañadas-Aránega, Dirk Wollherr, José L. Guzmán, José C. Moreno, José L. Blanco-Claraco

이 논문은 온실 환경에서 운용되는 이동형 농업 로봇이 다양한 경사와 지면 질감 위에서 안정적으로 주행할 수 있도록 탑재 하중 기반의 지형 적응 제어 전략을 제안한다. 콘크리트, 다짐 모래, 자갈 등 온실에서 흔히 나타나는 지면 유형을 실험적으로 특성화하고, IMU(관성 측정 장치)로 경사각을 직접 측정해 모터 입력에 미치는 힘을 추정한다. 외부 루프에 모델 기반 예측 제어기(MPC), 내부 루프에 PI 제어기를 배치한 캐스케이드 궤적 추적 방식을 설계하였으며, 이득 스케줄링(gain scheduling) 기반의 적응형 피드포워드 제어를 더해 경사 변화와 지면 유형에 따른 외란에 대응한다. 시뮬레이션 결과, 차동 구동(differential-drive) 방식의 로봇에서 오차 지수와 제어 신호 효율 모두 유의미한 개선이 확인되었다.

Akshat Sharma / Unsplash
2609.01596v1

Facet-0: 접촉 집약적 정밀 조작을 위한 로봇 기반 모델

Facet-0: A Robotic Foundation Model for Contact-Rich Precise Manipulation

Haoyuan Deng, Haichao Liu, Wenkai Guo, Yuan Ling, Zaijia Yang 외 4명

Facet-0는 서브밀리미터 허용 오차가 요구되는 로봇 조립 작업을 위한 기반 모델(foundation model)로, 행동의 접촉 결과를 예측하고 평가한다. 다중모달 표현 학습과 강화학습(RL) 사후 훈련을 통합하며, 플로우 매칭(flow matching)으로 행동 청크와 예상 손목-렌치 프로파일을 함께 생성하는 행동-렌치 공동 제안 방식을 사용한다. 분포적 행동-렌치 비평가(distributional Action-Wrench Critic)를 배포 롤아웃에서 훈련해 작업 진행 상황이 유사하더라도 접촉 결과가 다른 동작을 구분한다. 세 가지 구현체와 다수의 제조 셀에 걸쳐 수집한 1,000시간 규모의 힘 동기화 데이터셋 ManuFacet-1K로 훈련되었다. 5가지 서브밀리미터 컴퓨터 조립 작업에서 가장 강력한 기준선 대비 15% 대비 82% 평균 성공률을 달성했으며, 배치 정확도 0.5mm, 명령 지연시간 50ms를 기록했다.

Kindel Media / Pexels
2609.01579v1

SG-AMP: 고추 식물을 위한 장면 그래프 기반 능동 인식 및 의미 인식 동작 계획

SG-AMP: Scene-Graph-Guided Active Perception and Semantics-Aware Motion Planning for Pepper Plants

Rohit Menon, Shiva Rudra Lolla, Niklas Mueller-Goldingen, Gokul Chenchani, Ribana Roscher 외 1명

SG-AMP는 입력 조건부 불확실성을 갖춘 깊이 보완(depth completion), 지속적 파노옵틱 매핑(persistent panoptic mapping), 식물 장면 그래프(scene graph) 추론, 의미 인식 능동 시점·동작 계획을 통합한 고추 식물 검사 프레임워크다. 장면 그래프는 아직 관측되지 않은 고추-꽃자루(peduncle) 연결 부위를 명시적으로 가설화하고, 해당 부위를 향한 근거리 감지 동작을 유도한다. 후보 시점은 기대 정보 이득(expected information gain)을 기준으로 선택되며, 클래스별 이동 비용을 적용해 고추·꽃자루·줄기는 보호 대상으로, 잎은 조건부 통과 가능 구역으로 구분한다. 고추 데이터셋에서 인식 네트워크는 의미론적 mIoU 55.27%, PQ 38.67%, 깊이 RMSE 40.62 mm를 달성했다. 입력 조건부 불확실성 적용 후 NYUv2 NLL이 −1.6518에서 −1.6925로, AUSE가 0.0102에서 0.0087로 개선되었다.

Pavel Danilyuk / Pexels
2609.01518v1

휴머노이드 로봇의 빠르고 견고하며 적응 가능한 로코-매니퓰레이션 행동 시스템

A System for Fast, Resilient, and Adaptable Loco-Manipulation Behaviors on Humanoid Robots

Duncan Calvert, Luigi Penco, Dexton Anderson, Tomasz Bialek, Arghya Chatterjee 외 2명

휴머노이드 로봇이 인간용 공간에서 물리적 작업을 수행하려면 이동, 전신 동작, 인식, 접촉, 운영자 감독을 통합적으로 조율해야 한다. 연구팀은 런타임에서 편집 가능한 행동 저작 및 실행 시스템을 제안하며, 행동 아키텍처가 능력·속도·신뢰성의 핵심 요인이 될 수 있다고 주장한다. 시스템은 객체 중심 어포던스 템플릿(Affordance Templates), 트리 구조 로직, 런타임 편집 가능 인식 기능을 결합하고, 전신 제어기(whole-body controller)를 통해 동시 신체 동작과 보행을 지원한다. Unitree H1-2와 Alex 로봇에서 6가지 태스크를 실증하였으며, 문 밀기 통과는 34초, 인간의 방해 상황에서 색깔별 공 6개 분류는 45초 내에 완료되었다. 저작 세션 측정에서 새로운 로코-매니퓰레이션(loco-manipulation) 행동의 처음부터 생성 및 기존 행동 수정에 각각 수 시간이 소요되었으며, 최근 학습 기반 시스템과 비교해 경쟁력 있는 성능을 보였다.

Mathew Schwartz / Unsplash
2609.01453v1

모방 학습은 정교한 조작에서 시간적 견고성을 보존하는가? 작업 실행 속도에 따른 전문가-학습자 비교

Does Imitation Learning Preserve Temporal Robustness in Dexterous Manipulation? An Expert-Learner Comparison Across Task Execution Speeds

Clinton Enwerem, John S. Baras, Calin Belta

본 연구는 모방 학습(imitation learning)으로 획득한 정교한 조작(dexterous manipulation) 정책이 작업 실행 속도 변화에 대해 전문가 대비 어느 정도의 시간적 견고성(temporal robustness)을 유지하는지 분석한다. 평가 환경으로는 로봇이 소포를 집고 방향을 바꾼 뒤 삽입하는 접촉 집약적 과제인 ParcelStow를 사용하며, 스크립트 기반 전문가와 해당 시연으로 훈련된 행동 청킹 트랜스포머(ACT, Action Chunking with Transformers) 정책을 비교한다. 기준 속도에서 두 정책 모두 100% 성공률을 달성하지만, 최대 시연 속도에서는 전문가 84%, ACT 53%로 성공률이 벌어지며, ACT 두 변형은 기준 속도 대비 각각 34, 48 퍼센트포인트 하락한 반면 전문가는 16 퍼센트포인트 하락에 그쳤다. 단계별 분석에서 최대 시연 속도 기준 ACT의 47회 실패 중 35회는 삽입 정렬 오류로 나타났으며, 힘 잠금(force closure) 없이 집은 414회 시도는 단 한 건도 과제를 완료하지 못했다. 이 결과는 기준 속도에서의 동일한 성공률이 실행 속도 전반에 걸쳐 전문가 수준의 성능을 보장하지 않음을 보여준다.

Julien Goettelmann / Unsplash
2609.01420v1

GPS 취약 환경에서 협동 UAV를 위한 비전 기반 리더-팔로워 편대 제어

Vision-Based Leader-Follower Formation Control for Cooperative UAVs in GPS-Degraded Environments

Deekshitha Angadi, Naveena Budda, Vikas Agarwal, Rojesh Arunkumar Mulasa, Ravi Killamsetty 외 2명

이 논문은 GPS 신호가 저하되거나 차단된 환경에서 다중 무인항공기(UAV) 편대를 유지하기 위한 비전 기반 리더-팔로워(leader-follower) 협동 제어 프레임워크를 제안한다. 팔로워 UAV에 전방 탑재된 RGB-D 카메라로 리더 UAV를 실시간 검출·추적하며, 드론 전용 데이터셋으로 학습한 YOLO 기반 경량 검출기를 온보드에서 구동해 바운딩 박스를 예측한다. 예측 결과는 핀홀 카메라 모델(pinhole camera model)과 깊이 정보를 결합해 리더의 상대 위치를 추정하며, GPS 또는 외부 측위가 불가한 경우 백업 소스로 활용된다. 프레임워크는 ROS 노드 집합으로 구현되었고, 센서 노이즈와 통신 단절 시나리오를 포함한 XTDrone 기반 물리 시뮬레이션에서 검출 정확도, 실행 시간, 편대 유지 오차를 평가하였다. 실험 결과, 제안 프레임워크는 측위 센서 고장 상황에서도 안정적인 편대를 유지하는 것으로 나타났다.

The Lazy Artist Gallery / Pexels
2609.01404v1

드론 제어를 위한 범용 시각-언어-행동 에이전트로서 멀티모달 LLM 평가: 명령·접근·추적·탐색

Evaluating Multimodal LLMs as Generalist Vision-Language-Action Agents for Drone Control: Commanding, Approaching, Tracking and Searching

Jaewoo Park, Minyoung Lee, Sukmin Seo, Moonbin Yim, Hyunwook Yoon 외 9명

DroneCATS-Agent는 멀티모달 대형 언어 모델(MLLM)을 드론 제어 루프에 직접 편입하는 아키텍처로, 전체 행동 공간을 프롬프트만으로 선언한다. DroneCATS 벤치마크는 가시 표적 접근, 이동 표적 추적, 시야 밖 탐색, 다중 드론 플릿 명령의 네 가지 핵심 능력을 평가 축으로 삼으며, 2B 파라미터 소형 모델까지 포함해 파인튜닝 없이 프론티어·오픈 모델을 비교한다. 평가 결과 소형 오픈 모델이 목표 반경 진입 성공률에서 프론티어 모델을 앞서는 경우가 있으나, 도착 선언 시점을 잘못 판단해 에피소드를 실패하는 역설적 현상이 나타났다. 다중 드론 명령 과제에서는 소형 모델이 서로 다른 시점의 좌표를 동일하게 복사하는 오류를 일으켜 성능 격차가 더욱 벌어졌다. 배포 가능한 엣지 모델과 프론티어 모델을 가르는 요인은 항법 능력이 아니라 선언된 프로토콜을 일관되게 유지하고 올바른 종료 행동을 발동하는 능력임이 드러났다.

Cam Bradford / Unsplash
2609.01394v1

에이전트 간 통신 없는 분산 군집 제어를 이용한 자율 로봇 교량 가설

Autonomous robotic bridging using distributed swarm control without inter-agent communication

Vishwaak C. Thamaraiselvan, Cody L. Lundberg, Michail Theofandis, Suhas Chelian, Nicholas R. Gans

SCARAB(Swarm-Capable Autonomous Robotic Aquatic Bridging)는 무인 수상 기체(USV) 군집을 이용해 강 위에 교량을 자율적으로 가설하는 시스템이다. 분산 군집 제어(distributed swarm control)와 다중 모달 센싱을 통해 에이전트들은 GPS 또는 RF 통신 없이 자기 위치를 파악하고 대형을 형성해 목표 위치로 이동할 수 있다. 이 방식은 군 환경에서 예측 불가능한 분산 도하 작전을 지원하고, 기존 Improved Ribbon Bridge 대비 군수 부담을 줄이는 것을 목표로 한다. GPS·RF 통신이 가용한 비경합 환경에서는 홍수 재난 구호 등 민간 용도로도 활용 가능하다. 조류와 바람이 존재하는 환경에서 물리 엔진 기반 시뮬레이션으로 시스템 동작을 검증하였다.

Bibek ghosh / Pexels
2609.01384v1

장애물 인식 기반 야외 로봇 자율 커버리지 및 내비게이션

Obstacle-Aware Autonomous Coverage and Navigation for Outdoor Robots

Leonardo Gargani, Matteo Frosi, Matteo Matteucci

야외 자율 로봇의 장기 커버리지 임무는 개방 공간에서의 위치추정 오차, 장애물, 선회 기동 시 제어기 실현 가능성, 에너지 관리 등 복합적인 과제를 수반한다. 본 연구는 커버리지 계획, 강인한 위치추정, Nav2 기반 실행을 통합한 ROS 2 단일 아키텍처를 제안한다. 이중 안테나 RTK-GNSS를 확장 칼만 필터(EKF)와 융합하여 장기 임무 전반에 걸쳐 로봇의 위치 및 방향 정확도를 유지한다. 행동 트리(Behavior Tree) 기반 임무 관리자는 다중 목표 실행, 계층적 복구, 비용 인식 목표 관리, 복귀 충전을 위한 자율 도킹을 조율한다. 다양한 형태와 장애물 밀도를 가진 야외 환경에서 시뮬레이션 및 실증 실험을 수행한 결과, 계획된 커버리지 면적의 93.1%~96.1%를 완료하는 성능을 나타냈다.

Kindel Media / Pexels
2609.01351v1

고차원 POMDP를 위한 확장 가능한 Rao-Blackwellized 온라인 계획

Scalable Rao-Blackwellized Online Planning for High-Dimensional POMDPs

Jiho Lee, Nisar Ahmed, Kyle Hollins Wray, Zachary Sunberg

부분 관측 마르코프 결정 과정(POMDP)에서의 온라인 계획은 고차원 상태 공간에서 몬테카를로 추정의 높은 분산으로 인해 성능이 저하된다. 이 연구는 Rao-Blackwellized 온라인 POMDP(RB-POMDP) 프레임워크를 혼합 연속-이산 신뢰 표현(hybrid continuous-discrete belief representation)으로 확장하여 고차원 환경에서의 적용 범위를 넓힌다. 트리 기반 계획 과정에서 주변화된 상태 성분의 불확실성을 해석적으로 전파함으로써 가치 추정의 샘플링 유발 분산을 줄인다. FastSLAM 2.0과 결합하여 로봇 수색·구조 과제에 적용한 실험에서, 동일한 계산 예산 조건 하에 순수 샘플링 기반 방법 대비 더 적은 파티클과 계획 시뮬레이션으로 높은 누적 보상을 달성했다.

Enchanted Tools / Unsplash
2609.01281v1

EmbodiedSkills: VLA 에이전트의 조율·학습·배포를 위한 통합 프레임워크

EmbodiedSkills: A Unified Framework for Orchestrating, Training, and Deploying VLA Agents

Wei Wang, Wenqiao Zhang, Yutong Lin, Yuqian Yuan, Tianwei Lin 외 12명

시각-언어-행동 모델(VLA)은 단순 행동 예측을 넘어 장기 과제 수행 시 지각·계획·실행·검증·복구를 통합적으로 조율해야 한다는 문제의식에서 출발한다. EmbodiedSkills는 각 스킬 결정을 '실행 제안'으로 취급하여, 런타임이 실행 전 전제 조건을 확인하고 실행 후 결과를 검증하는 구조를 제안한다. 공유 실행 가능 스킬 인터페이스가 고수준 스킬 선택, 저수준 VLA 실행, 사후 검증을 하나의 에이전트 루프 안에서 연결하며, 인터페이스가 고정되어 있어 저수준 VLA 정책을 교체해도 에이전트 루프를 변경할 필요가 없다. Qwen3-VL과 OpenPI/pi0.5를 활용해 RoboTwin 2.0의 50개 과제에서 평균 성공률 86.20%, LIBERO 4개 스위트에서 97.40%를 기록했다. 메모리 의존적 RMBench 4개 과제에서는 동일 접근법으로 평균 성공률 12.5%를 달성했다.

JUNXUAN BAO / Unsplash
2609.01260v1

이중 프로세스 모션 플래닝

Dual Process Motion Planning

Jiayi Yan, Francesco Fabiano, Alessandro Abate

이 논문은 고전적 제어·계획 방법과 학습 기반 접근법을 결합한 신경-기호(neuro-symbolic) 관점의 비선형 모션 플래닝 프레임워크를 제안한다. 인지과학의 '빠른 사고와 느린 사고(Thinking Fast and Slow)' 패러다임에 착안하여, 기호적 솔버를 '시스템-2' 구성 요소로, 경험 기반 학습 모듈을 '시스템-1'로 통합한 이중 프로세스 구조를 설계하였다. 메타인지 컨트롤러(metacognitive controller)가 두 모듈의 상호작용을 동적으로 조율하며, 상황에 따라 빠른 직관과 정밀한 추론 중 어느 쪽을 활성화할지 결정한다. 다양한 비선형 벤치마크 환경에서 평가한 결과, 계획 효율성·정확도·일반화 성능에서 일관된 향상이 나타났다.

Ludovico Ceroseis / Unsplash
2609.01215v1

REFACTOR-VLA: 타입화된 모터 프로그램의 비지도 라이브러리 학습

REFACTOR-VLA: Unsupervised Library Learning of Typed Motor Programs

Riyaaz Shaik, Chandru Venkataraman

기존 시각-언어-행동 모델(VLA)(OpenVLA, π_0, RT-2, RDT-1B 등)은 재사용 가능한 행동 추상화 없이 원시 모터 명령을 출력하는 단일체 구조로, 장기 과제에서 성능이 저하된다. REFACTOR-VLA는 재사용 가능한 스킬을 학습하는 웨이크/슬립 시스템으로, 슬립 단계에서 학습된 잠재 세계 모델로부터 계산한 행동 동등성 커널(BEK)을 활용해 모터 프로그램 조각을 클러스터링하고, 웨이크 단계에서는 Hindley–Milner 방식에서 착안한 어휘 위의 타입화된 람다 항(lambda term)을 생성해 라이브러리 조건부 정류 흐름(rectified-flow) 행동 디코더에 전달한다. 최소 기술 길이(MDL) 및 리턴 보존 조건을 모두 통과한 추상화만 라이브러리에 등록된다. LIBERO 벤치마크 실험에서 세계 모델 파라미터를 188M에서 430M으로 늘렸을 때 4개 스위트 전체에서 성능이 저하되어, 모델 용량 증가만으로는 충분하지 않음이 확인됐다. 세계 모델 워밍업 시 보조 지도 대조 손실(InfoNCE)을 추가하면 슬립 단계 클러스터링이 크게 개선되어 4개 스위트 모두에서 기존 최강 베이스라인 대비 평균 Δ=+0.184의 정규화 상호 정보량(NMI) 향상을 기록했다.

Guille B / Unsplash
2609.01207v1

고전 PID에 의한 로봇 매니퓰레이터의 전역 조절 가능성에 관하여

On Global Regulatability of Robot Manipulators by Classical PID

Cheng Zhao, Jingru Zhu, Lei Guo

이 논문은 채널별 상대차수(relative degree)가 다를 수 있는 불확실 다입력-다출력(MIMO) 비선형 시스템에 확장 PID(EPID) 제어를 적용하는 방법을 연구한다. 채널별 EPID 제어기를 설계하여 각 제어 입력을 해당 채널의 추적 오차에 대한 비례·적분·미분 항으로 구성하고, 최고 미분 차수를 해당 채널의 상대차수에 맞춰 선택한다. 초기 상태 범위, 불확실성, 기준 신호를 기반으로 EPID 파라미터의 허용 집합을 구성하며, 이 집합 내 임의의 파라미터 선택이 폐루프 시스템의 세미글로벌(semiglobal) 안정성과 목표점 조절을 보장함을 증명한다. 이 결과는 강한 채널 간 결합이 있는 불확실 MIMO 시스템—로봇 매니퓰레이터 및 비행 제어 시스템 포함—에서 채널별 독립 튜닝이라는 공학적 관행에 이론적 근거를 제공한다.

Pavel Danilyuk / Pexels
2608.31167v1

SUN: 언어 기반 제어-학습-실물 정책을 위한 지속 프로그램

SUN: Persistent Programs For Language-Grounded Control-to-Learning-to-Real Policies

Weiqi Wang, Zhi Li, Yudong Lei, David Martinez, Xiaofeng Gao 외 5명

이 논문은 모델 기반 제어와 학습 정책을 통합하기 위해 의미론적으로 통합된(Semantically UNified) SUN 프로그램을 제안한다. SUN 프로그램은 기하학적·접촉 관계를 한 번 정의하면 모델 예측 제어(MPC) 비용, 강화학습(RL) 보상, 전이 조건 등으로 자동 컴파일되는 타입 기반 실행 파일이다. 대형 비전-언어 시스템이 구동하는 시스템 Kuafu는 언어와 장면 의미로부터 SUN 프로그램을 자동 합성하고, MPC로 실현 가능성을 검증한 뒤 단계 조건부 정책을 학습시킨다. 9개 태스크에서 Kuafu는 매크로 성공률 82.03%를 달성해 희소 보상(35.67%) 및 Stage-BC(24.75%) 기준선을 상회했으며, 태스크당 500개 궤적으로 학습한 DP3 정책은 시뮬레이션에서 46.0%, 실물 Franka 및 Kinova 로봇에서 34.7%의 성공률을 기록했다.

Anil Baki Durmus / Unsplash
2608.31029v1

기억으로 주행하기

Driving on Memory

Christian Löwens, Thorben Funke, Alexandru Paul Condurache

엔드-투-엔드(end-to-end) 자율주행 모델은 원시 센서 입력으로부터 미래 궤적을 계획하며, NAVSIM·Bench2Drive 등 최신 벤치마크는 시뮬레이션 기반의 다양한 지표로 이를 평가한다. 연구팀은 모델의 카메라 입력을 동일 위치의 과거 주행 기록(메모리)으로 대체해, 현재 교통 상태 없이 도로 배치와 위치 기반 통계만으로 주행하는 실험을 수행했다. 실제 장면을 전혀 관찰하지 않은 메모리 기반 접근법이 NAVSIM에서 주요 엔드-투-엔드 방법과 동등하거나 오히려 높은 점수를 기록하는 결과가 나타났다. 이는 높은 NAVSIM 점수가 반드시 현재 교통 상황에 대한 반응 능력을 반영하지 않을 수 있음을 시사하며, 해당 벤치마크 결과를 해석할 때 주의가 필요하다. Bench2Drive와 RealEngine에서는 메모리 기반 주행 시 성능 하락이 훨씬 크게 나타나, 이 효과가 벤치마크에 따라 상이함을 보였다.