본문으로 건너뛰기

PAPERS

논문 트래커

arXiv cs.RO 신규 논문을 매일 수집해 한국어 요약을 붙입니다. 학회 채택 정보는 저자 코멘트에서 자동으로 추출합니다.

473건학회 채택 2건
Santhosh Kanthala / Pexels
2610.10510v1

시뮬레이션-실제 조작을 위한 인수분해 촉각 표현 및 제어

Factorized Tactile Representation and Control for Sim-to-Real Manipulation

Siqi Shang, Bianca Aumann, Tye Brady, Joshua Migdal, Taskin Padir

촉각 시뮬레이션-실제 전이(sim-to-real) 학습은 시뮬레이션 접촉과 센서 고유 응답 사이의 간극을 메우면서 제어에 필요한 정보를 보존해야 한다. 이 연구는 법선력(normal force)과 접촉 패치를 유효 접촉 응답으로 매핑하는 인수분해 촉각 표현 및 제어 프레임워크를 제안하며, 응답을 접촉 기하, 힘 분포, 시간적 접촉 변화로 분리해 각각 독립적으로 인코딩하고 랜덤화한다. 촉각 게이트 정책(Tactile Gated Policy)은 이 표현들을 제어 과정에서 독립적으로 유지하고, 재훈련 없이 다양한 마스크 구성에서 동작한다. 시뮬레이션과 실제 환경 평가에서 1 mm 미만의 접촉 위치 추정 정확도와 미학습 기하에서 1.69 N의 힘 추적 오차를 달성했다. 실제 환경의 적대적 핀 삽입(adversarial peg insertion) 과제에서 비분해 응답 대비 35% 성능 향상을 기록했으며, 표현 유형에 따라 상호작용별 효과 차이가 나타났다.

Kindel Media / Pexels
2610.10489v1

HuMBLE: 체화 보행을 위한 인간 동작 기반 행동 학습

HuMBLE: Human Motion-Driven Behavior Learning for Embodied Locomotion

Mike Zhang, Dongho Kang, Kevin Bergamin, Nicola Burger, Robin Deits 외 17명

기존 휴머노이드 보행 연구에서 명령 추적에 최적화된 제어기는 기계적인 보행을 생성하고, 인간 동작 데이터 기반 제어기는 데이터 분포 밖의 명령에 일반화하지 못하는 한계가 있다. HuMBLE은 이 두 목표를 균형 있게 달성하기 위해 교사-학생 증류(teacher-student distillation) 과정을 도입하며, 강화학습(RL)으로 훈련한 전신 참조 조건부 교사 정책을 고유감각(proprioception)과 평면 토르소 속도 조향 명령만을 입력으로 받는 경량 학생 정책으로 증류한다. 이후 다중 태스크 RL 미세 조정 단계에서 임의 명령 추적 태스크와 인간 데이터를 스타일 정규화기로 활용하는 참조 유도 태스크를 함께 학습하여 명령 범위와 강건성을 데이터 분포 밖으로 확장한다. Boston Dynamics Atlas R1, Atlas D1, Unitree G1 세 종의 휴머노이드 로봇에서 실내외 환경 보행과 계층적 제어 스택 통합을 실기 실험으로 검증하였다. 인간 데이터 없이 훈련된 Tabula Rasa RL 정책과의 비교 및 절제 연구(ablation study)를 통해 조향 명령만으로 전신 협응 보행을 재현하는 프레임워크의 효과를 확인하였다.

Mikhail Nilov / Pexels
2610.10479v1

Agentic RSR: 장면 재구성과 실행 기반 로봇 정책을 통한 실세계-시뮬레이션-실세계 전이

Agentic RSR: Real-to-Sim-to-Real through Scene Reconstruction and Execution-Grounded Robot Policies

Yihan Li, Yating Feng, Shengjiu Sun, Jianing Chen, Hao Ren 외 5명

Agentic RSR는 실제 작업 공간 영상에서 장면을 재구성하고 시뮬레이터에서 정책을 개발한 뒤 실로봇에 배포하는 전 과정을 하나의 조작(manipulation) 과제로 연결하는 프레임워크다. 에이전트는 작업 공간 영상·과제 설명·로봇 모델을 입력받아 메트릭 스케일을 복원하고, 시각적 피드백으로 장면을 반복 정제하며 MuJoCo에서 과제 관련 상호작용을 검증한다. 코딩 에이전트는 특권적 객체 자세(privileged object poses)에서 시각적 관측으로 점진적으로 전환하며 실행 가능한 정책을 생성하고, 실행 피드백을 바탕으로 정책을 계속 수정한다. 두 로봇이 포함된 18개 재구성 장면에서 평균 4시점 깊이 MAE는 0.1057 m, 평균 Lab ΔE_76은 11.04, 평균 그레이스케일 SSIM은 0.6990으로 측정됐다. 실로봇 실험에서 과제 성공률은 시뮬레이션 성공률의 80%에 해당해 시뮬레이션 성능이 실제 하드웨어에서도 상당 부분 유지됐다.

Georg Eiermann / Unsplash
2610.10472v1

모델 기반 릴리스 설계를 통한 로봇 부메랑 투척

Robotic Boomerang Throwing via Model-Based Release Design

Yang Liu, Colin Jones, Aude Billard

공기역학적 양력을 생성하는 물체를 투척하면 로봇의 투척 능력을 탄도 비행 이상으로 확장할 수 있다. 이 연구는 관절 속도가 제한된 6자유도(DoF) 매니퓰레이터로 귀환형 부메랑을 던지기 위한 모델 기반 프레임워크를 제시하며, 릴리스(release) 상태 설계를 핵심 축으로 삼는다. 연구팀은 비행 역학을 단계적으로 규명하고, 불확실한 접촉 조건에서 릴리스 스핀을 안정적으로 제어하는 파라미터를 선별하는 방법론을 개발했다. 실험에서 부메랑은 51 rad/s(8.1 rev/s)로 릴리스되어 로봇 베이스로부터 최대 2.03 m까지 비행한 뒤 베이스에서 0.31 m 지점에 귀환 착지했다. 성공적인 릴리스 조건은 측정된 인간 투척 동작과 크게 달라, 로봇이 인간 동작을 모방하지 않고도 귀환 비행을 달성할 수 있음을 보였다.

Pearl Drums / Unsplash
2610.10470v1

CMP-IRRT*: 사족보행 로봇을 위한 인식 보조 높이 적응형 경로 계획기

CMP-IRRT*: A Perception-Assisted Height-Adaptive Planner for Quadruped Robots

Mingfan Zhao, Wendong Mao, Zhongfeng Wang

사족보행 로봇은 낮은 장애물을 넘어갈 수 있지만 기존 2D 경로 계획 파이프라인은 장애물을 이진 점유 영역으로 처리해 이 특성을 활용하지 못한다. 이 연구는 Channel Mamba PointNet 기반의 Informed RRT* 계획기인 CMP-IRRT*를 제안하며, 보정된 탑뷰 RGB 영상에서 장애물 높이 맵을 추정해 높이 조건부 충돌 검사를 수행한다. 높은 장애물은 통과 불가 영역으로, 낮은 장애물은 통과 가능 영역으로 분류해 경로를 계획하며, CMP 가이드를 통해 샘플링을 유망 영역으로 유도한다. 2D 계획 벤치마크에서 기존 고전 방법 및 신경망 기반 기준선 대비 탐색 노드 수와 반복 횟수를 줄였으며, 통과 가능 저장애물이 포함된 시나리오에서는 경로 길이를 최대 16.3% 단축하는 결과를 보였다. Unitree Go2를 이용한 실기 시연에서 장애물 우회 및 통과 동작이 실제로 실행 가능함을 확인했다.

Google DeepMind / Pexels
2610.10465v1

LLA-MPPI: GPU 가속 병렬 시뮬레이션을 활용한 다리형 로봇의 빠른 적응 전신 제어

LLA-MPPI: Rapidly Adaptive Whole-body Control of Legged Robots with GPU-Accelerated Parallel Simulations

Sebin Jung, Maitham F. AL-Sunni, Juan Alvarez-Padilla, Zachary Manchester, Changliu Liu 외 1명

LLA-MPPI는 다리형 로봇의 전신 제어(whole-body control)에서 동역학 변화에 실시간으로 적응하는 모델 예측 경로 적분(MPPI) 기반 제어 프레임워크다. GPU로 병렬 실행되는 접촉 시뮬레이터 집합 가운데 최근 운동 예측 오차가 가장 작은 모델을 선택하는 방식으로 적응을 구현하며, 별도의 오프라인 사전 학습이 필요 없다. 4개의 시뮬레이션 과제에서 성공률 97.5%를 기록했으며, 가장 강력한 비교 기법은 74%, 실제 모델 파라미터를 아는 오라클(oracle)은 98.5%였다. Unitree Go2 하드웨어에서는 주행 중 페이로드 추가, 다리 한쪽 비활성화, 운반 상자 질량 실시간 증가 등 세 가지 조건에서 실기 검증을 수행했다.

Novantri Muhen / Pexels
2610.10462v1

FoldBack: 장기 의류 접기를 위한 자기 교정 마스크 생성 정책

FoldBack: Self-Correcting Masked Generative Policy for Long-Horizon Garment Folding

Lipeng Zhuang, Shiyu Fan, Yingdong Ru, Zhuo He, Florent P. Audonnet 외 2명

FoldBack은 장기 의류 접기 작업에서 그립 실패를 스스로 감지하고 복구하는 마스크 생성 정책(masked generative policy)이다. 기존 장기 궤적 정책은 그립이 빠지거나 미끄러져도 의류가 목표 형상에 도달하지 못한 채 작업을 계속하는 문제가 있었다. FoldBack은 추론 시점에 세 가지 결정—언제 정제·검증할지, 어떻게 롤백할지, 어디서 어떻게 재시도할지—을 구조화해 실패한 동작 구간만 선택적으로 재생성하고, 이전 실패 위치는 회피한다. 복구 시연 데이터나 기반 정책 재학습 없이 동작한다. 6개 카테고리 실제 의류 33벌 실험에서 최종 접기 성공률 75.2%, 최종 마스크 IoU(교집합/합집합 비율) 0.837을 기록해 가장 강력한 비교 기준(45.7%, 0.689)을 앞섰다.

Celeo Sun / Pexels
2610.10453v1

RFPO: 체화 제어를 위한 정류 흐름 정책 최적화

RFPO: Rectified Flow Policy Optimization for Embodied Control

Ting Huang, Lisiyu Pan, Haoyu Wang, Zeyu Zhang, Siyuan Qian 외 4명

흐름 기반 정책(flow-based policy)은 연속 로봇 제어에 표현력이 높지만, ODE 수치 적분을 반복 수행해야 해 추론 비용이 크다. 적분 단계를 줄이면 제어 성능이 저하되는 '소수 단계 이산화 격차(few-step discretization gap)' 문제가 발생한다. RFPO는 보상 인식 온라인 Reflow와 동결된 가우시안 PPO 컨트롤러를 결합해 단일 오일러 스텝만으로 안정적인 정책 실행을 가능하게 한다. Unitree Go2에서 1스텝 실행 시 64스텝 대비 보상의 98.5%를 유지하면서 온보드 평균 추론 지연을 4.39ms에서 0.08ms로 줄여 54.9배의 속도 향상을 달성했다. Unitree Go2, Boston Dynamics Spot, Unitree H1, Unitree G1을 대상으로 한 실기 실험에서도 안정적인 보행이 확인됐다.

Jonathan Cosens Photography / Unsplash
2610.10438v1

ECHO: 인간 물체 운반 장면의 체화 카메라 관측 데이터셋

ECHO: Embodied Camera Observations of Human Object Carrying

Xuefei Sun, Lorin Achey, Kali Hamilton, Alberto Speranzon, Gregory Grebe 외 2명

체화 에이전트(embodied agent)가 실내 환경의 맥락과 거주자 습관을 바탕으로 물체를 적절한 위치에 배치하는 능력을 평가하는 '문맥적 물체 배치(contextual object placement)' 벤치마크 과제를 제안한다. 이를 위해 ECHO 데이터셋을 공개하는데, 실내 공간의 RGB-D 밀집 스캔과 사람이 물체를 운반하는 합성 영상을 쌍으로 구성하였다. ECHO는 115개 HM3D 장면의 159개 층에 걸쳐 총 3,805개 에피소드를 포함하며, 198종의 물체가 등장한다. 각 에피소드에는 동기화된 RGB-D 클립, 6-DoF 카메라·인체·물체 궤적, 출발 및 목적지 표면 정보, 그리고 목적지를 직접 명시하지 않고 거주자 일상을 묘사하는 자연어 문장이 함께 제공된다. 실험 결과, 단일 입력 양식만으로는 목적지 예측이 불충분하며 장면 구조·인간 행동·문맥 지식을 함께 추론해야 함이 확인되었다.

Vitaly Gariev / Pexels
2610.10437v1

Scalar Adjoint Matching을 활용한 Q-러닝

Q-Learning with Scalar Adjoint Matching

Yonghoon Dong, Minsung Yoon, Jaehyuk Kim, Jungwoo Park, Changyeon Kim 외 1명

플로우 정책(flow policy)은 다양한 행동 분포를 포착할 수 있으나, 오프-정책 강화학습(off-policy RL)으로 파인튜닝할 때 각 플로우 스텝마다 벡터-야코비안 곱(vector-Jacobian product)을 계산해야 해 계산 비용이 크다. 저자들은 사전학습된 플로우 정책의 배치 평균 속도 야코비안(velocity Jacobian)이 대각 방향으로 집중된다는 점을 발견하고, 이를 근거로 플로우 시간에 따라 값 그래디언트를 스케일링하는 폐쇄형 스칼라 어드조인트(scalar adjoint)를 도출했다. 이 스칼라 어드조인트와 정책 생성 행동에 대한 가치 페널티(value penalty)를 결합한 SQAM을 제안한다. OGBench의 난이도 높은 4개 도메인에서 SQAM은 각 도메인의 기존 최강 기준선 대비 18~35 퍼센트포인트 높은 성공률을 기록했다. 또한 실제 양손 로봇(bimanual robot)에서 시각-언어-행동 모델(VLA) 파인튜닝에도 적용했으며, 세 가지 과제 모두에서 지도학습 파인튜닝보다 높은 성능을 나타냈다.

Carlos Gil / Unsplash
2610.08789v1

QF3: 필터링된 Q-그래디언트를 이용한 빠른 플로우 강화학습

QF3: Fast Flow RL with Filtered Q-Gradients

Chung Min Kim, Brent Yi, David McAllister, Hongsuk Choi, Himanshu Gaurav Singh 외 5명

QF3는 플로우 매칭(flow matching) 기반 정책을 온라인 오프-폴리시(off-policy) 강화학습으로 훈련하는 알고리즘이다. 비평가(critic)의 행동 그래디언트를 플로우 출력의 1단계 예측에 역전파하되, 리플레이 행동과 가까운 행동 차원에만 그래디언트를 적용해 업데이트 안정성을 확보한다. 저자들에 따르면, 휴머노이드 보행 정책을 처음부터 학습한 뒤 하드웨어에 제로샷(zero-shot) 전이하는 첫 오프-폴리시 플로우 강화학습 방법이다. 온-폴리시(on-policy) 플로우 강화학습 방법인 FPO++와 비교해 보행 및 동작 추적 정책 훈련에서 벽시계 시간(wall-clock time) 기준 10배의 속도 향상을 달성했다. ABC-Sim과 Robomimic 과제에서 사전 훈련된 플로우 기반 조작 정책을 미세 조정하는 데도 적용해, 시연 데이터로 획득한 정책의 개선에도 활용 가능함을 보였다.

Yaroslav Shuraev / Pexels
2610.08784v1

PEARS: 실패 추론과 확산 조향을 통한 촉각 조작의 물리 사전지식 기반 효율적 적응

PEARS: Physical-Prior-Guided Efficient Adaptation via Failure Reasoning and Diffusion Steering for Tactile Manipulation

Kun Song, Yiming Wang, Yilin Chen, Tianyi Ding, Jiaxin Tian 외 3명

PEARS는 배포 시 발생하는 분포 외(OOD) 조건에서의 성능 저하를 해결하기 위해 촉각 피드백을 활용하는 하이브리드 강화학습(RL) 프레임워크다. 물리 사전지식 기반 힘 추론(PFR) 모듈은 시각-언어 모델(VLM)에 인코딩된 물리 사전지식으로 시각적 결과와 촉각 상호작용 이력에서 실패 원인을 진단하고 접촉력 범위를 갱신한다. 촉각 조건부 확산 조향 RL은 기반 모델을 수정하지 않고 동결된 플로우 매칭 정책의 잠재 노이즈를 조정해 자유 공간 동작과 접촉 타이밍 오류를 교정한다. 시뮬레이션에서 과제별 최강 기준선 대비 성공률이 12.4~37.4 퍼센트포인트 향상되었고, 특정 성공 임계값 도달에 필요한 에피소드 수는 최대 53.2% 감소했다. 실제 환경에서는 Whiteboard Erasing 과제에서 95%, Pipette Liquid Aspiration 과제에서 90%의 성공률을 기록했다.

Polina Tankilevitch / Pexels
2610.08780v1CoRL

DepthWorld: 로봇 조작을 위한 3D 월드 모델

DepthWorld: 3D World Model for Robot Manipulation

Jai Bardhan, Josef Sivic, Vladimir Petrik

기존 영상 기반 월드 모델(world model)은 RGB만으로 학습되어 프레임 단위로는 그럴듯해 보이지만 일관된 3D 공간을 구성하지 못한다는 한계가 있다. 연구팀은 학습된 스테레오 깊이와 결합 인자 그래프(joint factor graph)를 결합한 캘리브레이션 파이프라인을 제안해 DROID 데이터셋을 3D 버전인 DROID-3D로 변환했다. DROID-3D는 밀도 있는 메트릭 깊이(metric depth)와 재보정된 다시점 외부 파라미터를 제공하며, 외부 카메라 기준 에피소드의 90%에서 재투영 오차(reprojection error) 0.7 px 미만을 달성했다. DepthWorld는 Stable Video Diffusion 기반 월드 모델로, 사전 학습된 변분 오토인코더(VAE)를 수정하지 않고 공간 잠재 타일링(spatial latent tiling)을 통해 다시점 RGB와 깊이를 동시에 예측한다. 동일한 학습 비용 조건에서 깊이 감독을 추가하면 RGB 전용 기준선 대비 +1.48 dB PSNR의 RGB 예측 성능 향상도 함께 나타났다.

George Sargiannidis / Unsplash
2610.08771v1

시간 제약 자율 행동을 위한 임무 인식형 어테스테이션 엔벨로프: 하드웨어-인-더-루프 V2I 연구

Mission-Aware Attestation Envelopes for Time-Critical Autonomous Action: A Hardware-in-the-Loop V2I Study

Dimitrios Nikou, Nikolaos Kekatos, Sophia Petridou, Stylianos Basagiannis

자율 시스템이 특권적 물리 행동을 요청할 때, 기존의 이진(binary) 인증 게이트는 증거의 신선도와 결정 지연 시간을 고려하지 못한다. 이 논문은 무결성 유효성·증거 신선도·물리 상태 기반 예산 내 결정 완료라는 세 조건을 포함하는 임무 인식형 어테스테이션(attestation)을 런타임 보증 계약으로 정식화한다. 이 계약은 변조·만료 증거·지연 결정에 의한 거부를 각각 구분하는 네 가지 운용 결과를 제공하며, 이는 이진 게이트의 두 가지와 대비된다. 차량 모의주행 시뮬레이터, 마이크로컨트롤러 OBU(On-Board Unit), TPM 기반 리눅스 RSU(Roadside Unit)로 구성된 하드웨어-인-더-루프(Hardware-in-the-Loop, HIL) V2I(차량-인프라 통신) 플랫폼에서 평가하였다. 신선도 상한이 인증 예산을 초과하지 않으면 지연 결정이 항상 만료 증거를 수반해 지연 여부가 관측 불가능해지며, 어테스테이션 주기가 즉시 조정 가능한 핵심 배포 파라미터임을 보인다.

Jessica Lewis 🦋 thepaintedsquare / Pexels
2610.08765v1

LBA-CBF: 병렬 동역학 추론을 통한 빠른 적응형 안전 필터

LBA-CBF: Rapidly Adaptive Safety Filters via Parallel Dynamics Inference

Maitham F. AL-Sunni, Timeea-Andreea Radu, Hassan Almubarak, Henry Z. Liao, Michael Görner 외 2명

제어 장벽 함수(Control Barrier Function, CBF)는 가정된 동역학 모델을 기반으로 명령의 안전성을 보증하는데, 갑작스러운 체제 변화가 발생하면 이 보증이 무너질 수 있다. LBA-CBF는 후보 동역학 모델들의 집합을 유지하고, 짧은 과거 구간 동안의 예측 오차를 기준으로 모델 순위를 매겨 가장 적합한 모델 근방의 모든 후보에 대해 고차 CBF 조건을 동시에 강제한다. 이론적으로는 안전 대표 후보가 집합 내에 유지되는 한 실제 CBF 조건이 만족됨을 증명한다. 쿼드로터 시뮬레이션에서 갑작스러운 풍향 역전과 미지 페이로드 조건 하에 전체 초기 조건에서 목표 도달에 성공한 반면, 비교 기준 방법들은 0~88%의 성공률을 보였다. Crazyflie 2.1과 F1TENTH 실기 실험에서는 바람, 페이로드 분리, 가변 타이어-노면 마찰 조건에서 적응 성능을 검증하였다.

cottonbro studio / Pexels
2610.08761v1

VeriFine: 체화 추론의 자기 개선을 위한 검증 확장

VeriFine: Scaling Verification for Self-Improvement in Embodied Reasoning

Zewei Zhou, Rachel Luo, Yulong Cao, Chaowei Xiao, Chensheng Peng 외 8명

자기 개선 정책은 학습이 진행될수록 새로운 실패 패턴을 지속적으로 생성하는데, 고정된 판단자(judge)는 이에 대응하지 못해 최적화 피드백과 유용한 학습 예제 발굴을 동시에 제약한다. VeriFine은 정책, 훈련 커리큘럼, 판단자를 함께 공진화(co-evolution)시키는 에이전트 하네스 프레임워크로 이 문제를 다룬다. 정책 개선 루프는 루브릭 판단자를 이용해 반복 실패를 진단하고 적응형 커리큘럼을 구성하며, 개선이 정체되면 판단자 개선 루프가 인간 피드백과 공동 교정(coactive calibration)을 통해 판단자를 갱신한다. 갱신된 판단자는 다음 단계의 데이터 선별과 정책 최적화를 유도한다. 주행(driving)과 로봇 내비게이션 과제에서 강화학습 및 지도 미세조정(supervised fine-tuning) 전반에 걸쳐 정책과 판단자 모두 지속적 성능 향상을 보였다.

Trần Toàn / Unsplash
2610.08737v1

PhoneBot: 스마트폰을 재활용한 저비용 오픈 휴머노이드 로봇 플랫폼

PhoneBot: A Low-Cost Open Humanoid Robot Platform Reusing Smartphones

Ruochen Hou, Quanyou Wang, Daniel Koh, Dennis W. Hong

PhoneBot은 시중 스마트폰을 주요 감지·연산 장치로 재활용하는 오픈소스 휴머노이드 로봇 플랫폼이다. 스마트폰의 관성 측정 장치(IMU), 카메라, 무선 통신, 온보드 처리 기능을 그대로 활용해 별도 센서 및 컴퓨팅 하드웨어 비용을 줄이는 구조를 채택한다. 하체는 저가 구동기(actuator) 13개로 이루어진 모듈식 구조이며, 상체에 장착된 스마트폰이 인지, 제어 연산, 사용자 상호작용을 담당한다. 비전 기반 사람 추종, 대화형 상호작용, 촬영, 원격현존(mobile telepresence) 기능을 지원하며, 실험을 통해 안정적인 보행과 인지 기반 상호작용을 확인했다. 하드웨어·소프트웨어 설계를 모두 공개해 교육, 연구, 신속한 프로토타이핑에 활용할 수 있도록 했다.

cottonbro studio / Pexels
2610.08733v1IROS

소셜 로봇과의 음성 대화를 위한 확장 가능한 벤치마크를 향하여

Towards an Extensible Benchmark for Spoken Dialogue with Social Robots

Casey Kennington, Ross Mead, Saad Elbeleidy, Jesse Thomason

언어 모델은 인간과 로봇 사이의 인터페이스를 제공하지만, 음성·대화·빠른 상호작용·협력이 요구되는 상황에서는 해결해야 할 과제가 남아 있다. 이 논문은 명확화 요청, 발화 중단(interruption), 신체 신호(머리 끄덕임, 표정 단서), 시간 제약 등 로봇-인간 음성 대화의 공통 요소를 탐구하기 위한 벤치마크를 제안한다. 벤치마크는 인간-로봇 상호작용(human-robot interaction, HRI)의 다른 측면으로도 확장 가능하도록 설계되었다. 벤치마크 구현을 지원하기 위해 실시간 통신 프레임워크인 Retico를 활용해 로봇의 음성 대화 기능을 구현할 것을 함께 제안한다.

ThisIsEngineering / Pexels
2610.08726v1

EgoLAP: 언어-행동 추론을 통한 1인칭 시점 인간 데이터 학습

EgoLAP: Learning from Egocentric Human Data through Language-Action Reasoning

Lihan Zha, Shresth Grover, Tenny Yin, Samuel M. Bateman, Hengkai Pan 외 5명

EgoLAP은 1인칭 시점(egocentric) 인간 데이터를 로봇 학습에 활용하기 위한 시각-언어-행동 모델(VLA) 사전학습 프레임워크다. 저수준 동작은 구현체마다 다르지만, 동작 의도(motion intent)는 인간과 로봇 간에 전이 가능한 과제 구조를 담고 있다는 점이 핵심 가설이다. EgoLAP은 동작 의도를 구조화된 언어 행동 사고 사슬(chain-of-thought)로 표현하고, 장면 기하·물리·객체 어포던스(affordance)에 기반한 동작 수준 추론과 결합한다. 실세계 및 시뮬레이션 실험에서 평균 실세계 과제 진행률 80.1%를 달성했으며, 대안적 행동 표현 대비 2.3배 성능 향상이 보고되었다. 동작 수준 추론은 하위 과제·객체 박스·시각적 흔적 추론을 조합한 복합 형식보다 높은 성능을 나타냈다.

K15 Photos / Pexels
2610.08695v1

NMPP: 복잡한 환경에서의 민첩한 UAV 비행을 위한 비선형 모델 예측 계획

NMPP: Nonlinear Model Predictive Planning for Agile UAV Flight in Cluttered Environments

Ondřej Procházka, Juraj Pauko, Robert Pěnička, Martin Saska

이 논문은 쿼드로터(quadrotor)가 장애물이 많은 환경을 비행할 때 장애물을 소프트 비용 항목이 아닌 하드 기하 제약(hard geometric constraint)으로 처리하는 비선형 모델 예측 계획(Nonlinear Model Predictive Planning, NMPP)을 제안한다. 계획기는 전상태 참조 궤적(full-state reference trajectory)을 SE(3) 컨트롤러에 전달해 장애물 정보 없이도 정밀한 추적이 가능하도록 설계되었다. 선형 MPC 궤적 계획기 대비 위치 RMSE를 58~67% 낮추고, 다항식 궤적 계획기 대비 41~70% 낮추는 결과를 나타냈다. 숲 환경 비행 실험에서는 최대 9.5 m/s 속도로 충돌 없이 완주하였으며, 공격적인 속도 프로파일 조건에서 비행 성공률 86%를 기록한 반면 비교 대상 계획기는 26%에 머물렀다. 실제 환경 배치 실험에서는 미지의 복잡한 환경을 최대 5.5 m/s로 안정적으로 비행하였다.