본문으로 건너뛰기

PAPERS

논문 트래커

arXiv cs.RO 신규 논문을 매일 수집해 한국어 요약을 붙입니다. 학회 채택 정보는 저자 코멘트에서 자동으로 추출합니다.

473건학회 채택 3건
Jakub Zerdzicki / Pexels
2609.10339v1

산업용 인간-로봇 협업을 위한 신뢰도 인식 다중 모달 융합 프레임워크

A Confidence-Aware Multimodal Fusion Framework for Industrial Human-Robot Collaboration

Xinyu Liu, Qiqi Dong, Boya Jia, Yi Zhang, Binbin Lian

신뢰도 인식 다중 모달 융합 프레임워크(CAMF)는 물체 6D 포즈, 시선(gaze), 골격 동작, 관성 측정 장치(IMU) 기반 손 동작의 4가지 이종 모달리티를 융합해 산업 환경에서 인간 의도를 예측한다. 실시간 모달리티 신뢰도에 따라 양방향 시계열 특징을 적응적으로 조정하는 신뢰도 추세 기반 동적 융합 메커니즘을 BiLSTM에 내장한다. 신뢰도 안내 균형 학습 전략과 신뢰도 동결(confidence freezing) 메커니즘을 결합해 저품질 모달리티의 노이즈를 억제하고 교차 모달 학습 편향을 완화한다. UR3 협동로봇 기반 물리 플랫폼 실험에서 의도 인식 정확도 91.86%를 달성하며 기존 다중 모달 융합 방식 대비 높은 성능과 안정성을 보였다. 저조도 및 부분 가려짐 조건에서도 만족스러운 정확도를 유지하며 실제 조립 작업에서 선제적이고 안정적인 인간-로봇 협업을 가능하게 한다.

Ehaan Dewa / Pexels
2609.10336v1RA-L

OpenStreetMap 차선 형상을 활용한 오도메트리 독립적 드리프트 보정

Odometer-Agnostic Drift Correction Using OpenStreetMap Lane Geometry

Joaquin Caballero, Emilio Garcia-Fidalgo, Alberto Ortiz, Jarno Ralli

오도메트리(odometry) 기반 위치 추정에서 발생하는 장기 드리프트는 대규모 또는 루프 폐합이 없는 환경에서 근본적인 한계로 남아 있다. 기존 지도 보조 방식은 밀집 지도, 센서별 전처리, 복잡한 매칭 파이프라인에 의존하는 경우가 많다. 본 논문은 최근 오도메트리 궤적 세그먼트를 OpenStreetMap(OSM) 차선 중심선에 직접 정렬하는 경량 오픈소스 드리프트 보정 방법을 제안한다. 밀집 사전 정보나 고비용 전처리 없이 희소한 차선 형상과의 직접 정렬로 온라인 동작이 가능하다. LiDAR 및 시각 오도메트리(visual odometry) 백엔드를 이용한 실험에서 일관된 성능 향상이 확인되었으며, 드리프트가 심한 조건에서 특히 뚜렷한 개선이 나타났다.

Mikhail Nilov / Pexels
2609.10308v1

실시간 전체 형상 추정을 통한 부분 관측 환경에서의 변형 가능 물체 조작

Deformable Object Manipulation under Partial Observability via Real-Time Full-Shape Estimation

Kosar Behnia, Ville Kyrki, Gokhan Alcan

cRVAE(조건부 순환 변분 오토인코더, conditional Recurrent Variational AutoEncoder)는 변형 가능 물체(Deformable Object)의 모서리 노드 관측값만으로 전체 형상 상태를 추정한다. 추론 시 물리적 파라미터 입력이나 온라인 파라미터 식별 없이 동작하며, 로프에서 XPBD 모델 대비 약 350배, 천 소재에서 약 1,500배 빠른 속도로 전향 예측을 수행한다. 시뮬레이션에서 전체 형상 추정 정확도는 파라미터 식별된 XPBD 모델과 동등한 수준으로 나타났다. cRVAE는 후퇴 지평선 최적 제어(receding-horizon optimal control) 프레임워크의 전향 모델로 활용되어, XPBD가 짧은 지평선에서도 초과하는 100ms 제어 예산 내에서 장애물 인식 협동 조작을 가능하게 한다. 실제 하드웨어 검증은 Unitree Go2 로봇에서 수행되었다.

Pavel Danilyuk / Pexels
2609.10286v1

입상 지형에서의 지형 적응형 휴머노이드 보행 학습

Learning Terrain-Adaptive Humanoid Locomotion on Granular Terrain

Junnosuke Kamohara, Feiyang Wu, Andy Ningan Zong, Daniel I. Goldman, Yashwanth Nakka 외 2명

이 연구는 3차원 저항력 이론(3D RFT)을 기반으로 한 물리 기반 입상 접촉 모델을 제안하고, 이를 강화학습(RL) 훈련용 입상 지형 시뮬레이션에 적용한다. 기존 강체 접촉 모델이나 휴리스틱 기반 단순화 모델과 달리, 제안된 접촉 솔버는 입상 물질 침투 및 접선 방향 항력을 물리적으로 정확하게 재현한다. 교사-학생 RL 프레임워크에 변분 오토인코더(VAE)를 결합하여 지형 정보를 잠재 표현으로 인코딩하는 지형 적응형 보행 컨트롤러를 학습시킨다. NVIDIA Newton의 물질점법(MPM)을 활용한 시뮬레이션에서 미관측 입상 지형에 대한 제로샷 지형 식별 및 적응 능력이 확인되었다. 현무암, 건조 모래, 해변 모래 등 다양한 실제 입상 지형에서의 하드웨어 실험을 통해 방법론의 유효성을 검증하였다.

Tara Winstead / Pexels
2609.10283v1CoRL

SwingBot: 휴머노이드 로봇을 위한 전신 브라키에이션 학습

SwingBot: Learning Whole-Body Brachiation for Humanoid Robots

Yujie Xiong, Peng Zhai, Taixian Hou, Quancheng Qian, Cunwang Liu 외 4명

SwingBot은 수동형 손목 후크를 이용해 휴머노이드 로봇이 철봉을 연속적으로 이동하는 브라키에이션(brachiation) 학습 프레임워크다. 브라키에이션은 영장류가 지상 경로가 차단될 때 머리 위 지지물을 통해 이동하는 방식으로, 혼잡하거나 위험한 환경에서 운용되는 로봇에 유용한 이동 모드다. 고자유도 휴머노이드에 이를 적용하기 어려운 이유는 릴리스-스윙-캡처의 장기 시퀀스 학습, 전신 모멘텀을 이용한 교번 접촉 조율, 그리고 세그먼트 상대 변위 및 후크 접촉 상태의 측정 불확실성 대처가 동시에 요구되기 때문이다. SwingBot은 생체 모방 키프레임(biomimetic keyframe)으로 초기 탐색 단계에서 드문 전환 시퀀스에 도달하게 하고, 순환 특권 상태 추정(recurrent privileged-state estimation)으로 위치 및 접촉 잠재 변수를 압축 표현한다. 하드웨어 실험에서 연속 철봉 횡단을 달성하였으며, 페이로드 변화·외부 교란·다양한 철봉 간격에 대한 강인성을 확인했다.

Mikhail Nilov / Pexels
2609.10273v1

잡음 지형에서 프레임 부호화를 적용한 족형 로봇 보행

Frame-Coded Legged Locomotion over Noisy Terrain

Lav R. Varshney

이 논문은 다족 로봇의 거친 지형 보행을 소거(erasure)가 있는 양자화 유한 프레임 확장(quantized finite-frame expansion)으로 재정식화한다. d차원 몸체 수준 명령을 N>d개의 이질적 국소 접촉 명령으로 매핑하고, 지형에 의한 접촉 손실을 프레임 계수 소거로 모델링하며, 접촉 게이팅 순응형 형태(contact-gated compliant morphology)가 가중 능동 서브프레임 디코더를 물리적으로 구현한다. 선형-가우시안 모델에서 기계적 평형은 사후 평균(posterior mean)에, 접선 강성(tangent stiffness)은 사후 정밀도(posterior precision)에 정확히 대응됨이 증명된다. 등노름 파세발 프레임(equal-norm Parseval frame)은 단일 접촉 손실에 대해 미니맥스 최적이며, 고조파 프레임(harmonic frame)은 직접 구현 가능한 보행 패밀리를 제공한다. 접촉 생존 확률 q에서 아날로그 차원 전송률 R<q이면 정확 복원이 가능하고 R>q이면 복원이 불가능하다는 아날로그 프레임 코딩 정리(analog frame-coding theorem)와 역방향 정리(converse)가 확립된다.

Pavel Danilyuk / Pexels
2609.10243v1

FolDeX: 장기 지평 변형 가능 물체 로봇 조작을 위한 실세계 벤치마크

FolDeX: A Physical-World Benchmark for Long-Horizon Robotic Manipulation of Deformable Objects

Chenhuan Liu, Yi Xu, Feng Wu, Hanyang Wang, Wenxiao Kuai 외 5명

FolDeX는 변형 가능 물체(deformable objects)의 장기 지평(long-horizon) 양팔 로봇 조작을 평가하기 위해 실제 로봇 데이터만으로 구성한 벤치마크로, 의류 접기(garment folding)를 주요 과제로 삼는다. 기존 실-로봇 벤치마크가 단기 강체 과제 중심으로 편중된 한계를 지적하며, 이종 실세계 데이터의 효율적 재활용 방법을 연구 목표로 설정한다. 벤치마크는 인간 개입·복구 데이터 활용, 과제 간 전이(의류 범주 및 강체→유연체), 조명·배경·배치 변화에 따른 장면 재사용, 로봇 형태(embodiment) 간 전이라는 네 가지 연구 축으로 구성된다. 20개 이상의 과제와 10개 이상의 로봇 형태에 걸쳐 2,000시간 이상의 실제 로봇 데이터를 제공한다. 표준화된 과제 설정, 비공개 물체, 통제된 초기 조건, 통일 실행 프로토콜을 갖춘 공개 평가 플랫폼도 함께 운영한다.

Kindel Media / Pexels
2609.09158v1

TANGO: 전신 시각-언어-행동 모델을 이용한 복잡한 환경에서의 휴머노이드 내비게이션

TANGO: Humanoid Navigation in Cluttered Environments with a Whole-Body Vision-Language-Action Model

Anqi Li, Yuxin Chen, Zhaobo Li, Zhuo Cao, Junli Ren 외 2명

TANGO는 언어 조건부 휴머노이드 이동을 위한 전신(whole-body) 시각-언어 내비게이션 프레임워크로, 자연어 명령과 1인칭 RGB 영상을 입력받아 29자유도(DoF) 관절 공간 행동을 직접 예측한다. 기존 방식이 내비게이션을 2D 경로 계획 문제로 모델링한 것과 달리, TANGO는 팔 배치·상체 조절·보행 조절을 포함한 3D 기하학 인식 전신 적응을 수행한다. 전역 경로 계획, 운동학적 전신 모션 생성, 장애물 인식 모션 편집, 강화학습(RL) 기반 추적을 결합해 시뮬레이션에서만 학습하며, 실제 주행 데이터는 사용하지 않는다. 시뮬레이션 실험에서 장애물 협상이 필요한 복잡한 장면에 대해 강력한 모듈형 베이스라인을 상회하는 성능을 보였다. 이후 Unitree G1 휴머노이드 로봇에 제로샷(zero-shot)으로 배포해 실제 복잡한 환경에서의 언어 기반 이동 가능성을 확인했다.

Marcel Petzold / Unsplash
2609.09148v1

Proxy Policy Steering

Proxy Policy Steering

Chuanruo Ning, Tianrui Wang, Wei-Chiu Ma, Kuan Fang

Proxy Policy Steering(PPS)은 범용 로봇 정책을 새로운 작업에 적응시키는 추론 시점(inference-time) 적응 방법이다. 두 개의 경량 프록시 정책을 학습하여 그 속도 공간(velocity-space) 잔차로 고정된 기반 샘플러를 매 디노이징(denoising) 단계마다 조향한다. 기반 정책의 파라미터를 직접 수정하지 않으므로 시연 데이터에 포함되지 않은 실패 복구 행동 등 기존 광범위 능력이 추론 시에도 그대로 유지된다. 실제 환경 8개 및 시뮬레이션 4개의 조작 작업에서 pi 0.5 기반 정책의 평균 절대 성공률을 53%p 향상시켰다. LoRA 파인튜닝, 처음부터 학습한 전문 정책, 잔차 정책, 기존 추론 시점 조향 방법보다 우수한 성능을 보였다.

taopaodao / Unsplash
2609.09119v1

DeCAL: 접촉 인식 잠재 공동 상상을 통한 물리 기반 손재주 시각-언어-행동 모델

DeCAL: Towards Physically-Grounded Dexterous Vision-Language-Action Models via Contact-Aware Latent Co-Imagination

Yankai Fu, Ning Chen, Junkai Zhao, Heng Zhang, Guocai Yao 외 3명

DeCAL은 접촉이 많은 정밀 손재주 조작(dexterous manipulation)을 위해 이해·상상·행동 생성을 통합한 물리 기반 시각-언어-행동 모델(VLA)이다. 트랜스포머 혼합(Mixture-of-Transformers, MoT) 아키텍처를 기반으로 각 기능에 특화된 전문가 모듈을 두고 모듈 간 효율적인 정보 흐름을 구현한다. 접촉 인식 게이팅 전략으로 촉각 정보를 동적으로 조절하는 적응형 시각-촉각 융합(Adaptive Visuo-Tactile Fusion)을 도입하여 심한 시각적 폐색과 복잡한 접촉 동역학 문제에 대응한다. 시각·촉각 동역학을 공동으로 모델링하는 시각-촉각 잠재 공동 상상(Visuo-Tactile Latent Co-Imagination)을 통해 정책에 암묵적 물리 세계 지식을 부여한다. 실험 결과 전체 태스크에서 평균 성공률 71%, 진행 성공률 83.4%를 달성하였으며 미관측 시나리오에서도 일반화 성능을 보였다.

Kindel Media / Pexels
2609.09073v1

온라인 도달가능성 인식 샘플링 기반 모션 플래닝

Online, Reachability-Aware, Sampling-Based Motion Planning

Brendan Gould, Zhiyuan Zhang, Panagiotis Tsiotras, Samuel Coogan

샘플링 기반 모델 예측 제어(MPC) 알고리즘은 다양한 로봇 시스템의 내비게이션에 활용되지만, 기존 방식은 경성 안전 보장(hard safety guarantee)을 제공하지 못하는 한계가 있었다. 이 연구는 구간 기반(interval-based) 파이프라인을 통해 도달가능 집합 과대근사(reachable-set overapproximation)를 온라인으로 빠르게 산출하여 이 문제를 해결한다. 제안 방법은 고비용의 사전 계산 단계 없이도 기존 도달가능성 기반 플래너와 유사한 성능을 달성하며, 기존 접근법으로는 처리가 어려운 시스템으로 확장이 가능하다. 레이싱 시뮬레이션에서 안전 위반을 99% 이상 감소시켰고, 실제 모형 레이스카 하드웨어 실험에서도 충돌 없이 제어에 성공했다.

MART PRODUCTION / Pexels
2609.09069v1IROS

관측 게이트 필터링을 활용한 자율 능동 매핑의 학습 기반 점유 재검토

Rethinking Learned Occupancy in Autonomous Active Mapping with Observation-Gated Filtering

Jiahui Zhang, Bonian Han, Gongbo Liang, Yu Zhang

자율 3D 능동 매핑(active mapping)에서 학습 기반 점유 완성(learned occupancy completion)은 현재 시야 밖의 공간 정보를 확장하지만, 동일한 예측 지도가 탐색 이득 평가와 충돌 회피 경로 계획이라는 두 역할을 동시에 수행하는 구조적 문제를 안고 있다. 연구팀은 폐루프 벤치마크에서 능동 매핑 시스템을 고정한 채 플래너에 제공되는 점유 조건(관측 전용·학습 기반·오라클 보정·실제 정답)만 달리하여 성능을 비교 분석했다. 25개 시작점 실험 결과, 실제 정답 점유로 계획할 경우 학습 기반 기준선 최종 커버리지의 70%에 평균 12.7 스텝 더 빠르게 도달하지만 최종 커버리지 증가폭은 0.031에 불과해, 점유 정확도 향상이 커버리지를 단조롭게 개선하지 않음을 확인했다. 이 진단을 바탕으로 연구팀은 충분히 관측되지 않은 영역에서는 완성 예측을 유지하고, 인근 RGB-D 지지 없이 절두체(frustum)에 반복 노출된 후에만 예측을 억제하는 관측 게이트 필터(observation-gated filter)를 제안했다. 제안 필터는 재학습 없이 실패가 잦은 시작점에서 성능을 개선하며, 통신 창 사이의 자율 구간에서 플래너 대면 기하 정보를 온라인으로 수정하는 방향성을 제시한다.

Markus Spiske / Pexels
2609.09066v1

자율 수상선을 활용한 목표 추적용 분산 합의 파티클 필터

A Distributed Consensus Particle Filter for Target Tracking using Autonomous Surface Vessels

Carter Noh, Kyle Crandall, Connor Yates, Corbin Wilhelmi

대규모 해상 환경에서의 목표 추적은 중앙 조율 없이 운용되는 다중 에이전트 팀과 단속적 통신 조건을 필요로 한다. 각 에이전트는 독립적인 추정치를 유지해야 하며, 외부 데이터가 없을 경우 지역 추정치가 과도하게 확신(overconfident)되는 문제가 발생할 수 있다. 본 연구는 다른 센서 노드로부터 유효한 업데이트가 없을 때 입자(particle)를 전략적으로 분산시키도록 강제하는 방식으로 고전적 파티클 필터(particle filter)를 보강하는 기법을 제안한다. 제안 방법은 호수에서 무인 수상선(USV, Unmanned Surface Vessel)을 이용한 실험으로 검증되었으며, 기본 성능을 저하시키지 않으면서 일부 엣지 케이스에서 추적 정확도 향상을 나타냈다.

Pavel Danilyuk / Pexels
2609.09023v1

DYAD: 동일 공간 인간 보조를 위한 멀티모달 데이터셋

DYAD: A Multimodal Dataset of Co-Located Human Assistance

Akhil Ajikumar, Mahya Qorbani, Sakib Reza, Sean Andrist, Mohsen Moghaddam

DYAD(DYadic Assistance Dataset)는 기어박스 조립 과정에서 인간 대 인간 보조를 기록한 동기화 멀티모달 데이터셋이다. 20개 세션에 걸쳐 훈련된 도우미가 HoloLens 2 착용 수행자를 보조하며, 528개 작업 단계 구간, 611개 수행자 요청, 851개 유효 보조 기록을 포함한다. 어노테이션은 도움 요청, 보조 트리거, 언어적·신체적 개입, 결과를 하나의 연결 구조로 묶어 기존 절차형 데이터셋과 차별화된다. 세 가지 기준 과제(인과적 단계 이해, 개입 전 모드 예측, 교사 응답 생성)를 제시하며, 최강 모델의 매크로-F1은 0.548이고 인과 메타데이터 활용 시 0.624, 특권 트리거 매핑 시 0.915로 향상되어 사전 개입 RGB 영상에서 회수되지 않는 정보가 존재함을 보인다.

K / Pexels
2609.09012v1

Spheriverse: 야외 구면 관측을 통한 3D 장면 이해

Spheriverse: 3D Scene Understanding from Spherical Observations in the Wild

Fei Teng, Sheng Wu, Mengfei Duan, Guoqiang Zhao, Junhui Ma 외 5명

구면 카메라는 넓은 시야각으로 3D 장면 이해에 유용하지만, 각도 좌표계와 카르테시안 좌표계 간의 표현 불일치가 기하학적 대응과 의미 정보 집계를 어렵게 한다. 이를 다루기 위해 644개 시퀀스, 64,400쌍의 시간 정렬 구면 이미지-LiDAR 데이터셋 Spheriverse를 구축하였으며, 다양한 장면·조명·날씨 조건과 세밀한 의미 분류 클래스를 포함한다. 시맨틱 점유 예측(semantic occupancy prediction), 시맨틱 매핑, 3D 객체 탐지 세 가지 벤치마크를 정립하고 30개 이상의 방법을 평가한다. 제안하는 SphereOcc 프레임워크는 카르테시안-구면 표현 재모델링(CSRR)과 구면 증거 재질의(SER)를 통해 구면 기하학 정보를 카르테시안 복셀 특징에 통합한다. SphereOcc는 mIoU 13.91%, GeoIoU 24.65%를 달성하여 비교 대상인 TPVFormer와 SurroundOcc를 각각 1.70, 2.10 퍼센트포인트 상회하고 전체 다섯 장면에서 모두 1위를 기록하였다.

Giant Asparagus / Pexels
2609.08965v1

PlannerForge: 자율주행 모션 플래너의 시나리오 기반 테스팅을 위한 LLM 에이전트

PlannerForge: LLM Agents for Scenario-Based Testing of Motion Planners in Autonomous Driving

Yuan Gao, Sebastian Müller, Mattia Piccinini, Marc Kaufeld, Yuchen Zhang 외 3명

PlannerForge는 자율주행 시스템(ADS)의 시나리오 기반 테스팅 전 과정을 단일 대규모 언어 모델(LLM) 에이전트 프레임워크로 통합한다. 기존에 별도 도구로 분산 운영되던 시나리오 생성·검색·수정·ADS 실행·결과 분석 단계를 하나로 묶고, ADS 개선 및 벤치마킹 단계를 추가로 포함한다. 10개의 기성 LLM과 5가지 프롬프트 조건에서 평가한 결과, 태스크별 최고 점수는 0.88~1.00 범위로 나타났으며, Qwen3.6:35B 등 오픈소스 20~35B 모델이 5개 태스크 중 3개에서 상용 API와 대등한 성능을 보였다. 자연어 기반 시나리오 생성에서 Scenario Factory 2.0 대비 실행 가능 시나리오 수가 많았고(200개 중 193개 대 144개), 랭크 1 검색 정확도는 BM25 대비 92.0% 대 67.5%로 높게 나타났다. N=400 조건에서 비용 튜닝 적용 시 플래너 성공률이 50.4%에서 70.2%로 향상되고 충돌 발생률이 19.0%에서 8.4%로 감소하였다.

Santhosh Kanthala / Pexels
2609.08958v1

접촉 인식 그래프 신경망 동역학 모델 기반 텐세그리티 로봇의 모델 예측 제어

Model Predictive Control of Tensegrity Robots via Contact-Aware Graph Neural Dynamics Model

Nelson Chen, Patrick Meng, Charles Tang, Angelina Degay, Zachary Brei 외 3명

본 논문은 세 개의 바(bar)로 구성된 텐세그리티(tensegrity) 로봇에 대해, 학습된 그래프 신경망(GNN) 동역학 모델을 기반으로 하는 모델 예측 경로 적분(MPPI) 제어기를 제안한다. 기존 GNN 기반 모델에 미분 가능한 접촉 감지 모듈을 추가하여, 비수평 지형·장애물·자기 충돌을 포함한 접촉 풍부(contact-rich) 환경에서의 동역학 추론이 가능하도록 확장하였다. 학습된 동역학 모델과 MPPI 제어기는 폐쇄 데이터 수집 루프에서 반복 운용되어 모델 정확도와 제어 성능을 점진적으로 향상시키며, MPPI에 회전 동작 기본 요소(turning motion primitives)를 결합한 하이브리드 MPPI 전략도 함께 도입하였다. MuJoCo 시뮬레이터에서 벽 장애물, 경사로, 좁은 통로, 저간격 구조물, 복합 3D 장애물 코스 등 5가지 탐색 과제로 실험한 결과, 하이브리드 MPPI 제어기는 A* 기반 재계획 및 MPPI 단독 방식 대비 우수한 탐색 성능을 나타냈다.

Gilbert Pagunaling / Unsplash
2609.08920v1

동작을 통한 원격 감지 가능 키 기반 통신

Remotely Detectable Keyed Communication through Motion

Benjamin Chang, Michael Amir, Manon Flageat, Amanda Prorok

로봇의 움직임 자체를 통신 채널로 활용하는 동작 기반 통신(motion-based communication) 방법을 제안한다. 사전 학습된 정책(pre-trained policy)의 행동에 임의의 메시지를 노이즈 형태로 인코딩하여, 영상이나 모션 캡처 같은 원격 감지 수단으로 수신 측이 메시지를 복원할 수 있도록 한다. 추가 하드웨어나 직접적인 무선 링크 없이 동작하며, 기존 무선 통신 채널을 보완하는 물리적 채널로 기능한다. 인코딩 방식의 설계 공간을 체계적으로 분석하고 설계 원칙을 도출하여 시뮬레이션 및 실제 로봇에서 검증하였다. 50 Hz로 동작하는 실제 로봇 4대가 협력하여 8비트 메시지를 합산 0.67 bits/s 속도로 복원하는 성능을 나타냈다.

Pavel Danilyuk / Pexels
2609.08905v1

지각 인식 기반 휴머노이드 설계를 위한 가시-도달 가능 작업공간

Visible-Reachable Workspace for Perception-Aware Humanoid Design

Boxi Xia, Zijiang Yang, Ryan Shin, Bokuan Li, Eric Wun-Hao Lu 외 3명

기존 작업공간 분석은 말단부의 도달 가능성만 평가하지만, 시각 기반 조작에서는 운동학적으로 도달 가능한 자세에서도 카메라 시야가 확보되지 않을 수 있다. 이 연구에서는 도달 가능한 자세에서의 가시성을 조건으로 결합한 설계 지표인 가시-도달 가능 작업공간(VRW, Visible-Reachable Workspace)을 제안하며, 공간적으로 분리된 복수 작업 영역의 동시 가시성까지 확장한다. VRW를 31자유도 휴머노이드에 적용하여 독립 구동 RGB-D 카메라를 탑재한 결과, 카메라 구동 관절 추가만으로 가시-도달 가능 커버리지가 38%에서 97%로 증가하였다. 두 개의 구동 카메라를 적용하면 쌍별 커버리지가 0.45에서 0.95로 높아지며, 세 번째 카메라를 추가해도 0.97로 소폭 증가에 그쳤다. 제어된 두 목표물 파지 벤치마크에서 이중 구동 카메라 설계는 고정 카메라 대비 평균 완료 시간을 17%, 기계적 에너지를 19% 줄였으며, 하드웨어 실험에서 토르소 재방향 없이 전후·좌우 목표물 쌍을 동시에 관측·조작하는 것을 실증하였다.

Pavel Danilyuk / Pexels
2609.08886v1

FRAME: 객체 중심 장면 메모리를 위한 속성 판독 기반 분해 검색

FRAME: Factored Retrieval via Attribute Readouts for Object-Centric Scene Memory

Woosang Jeon, Sanghyeok Choi, Minwoo Kim, Taehyun Jung, Taehyeong Kim

언어 지시 기반 로봇이 시간에 걸쳐 만난 물체를 재참조하려면 지속적인 장면 메모리(scene memory)가 필요하다. 본 연구는 자연어 쿼리로 카테고리·재질·크기·표면 외관 등 복수 속성을 조합해 물체를 검색하는 문제를 속성 조합적 검색(attribute-compositional retrieval)으로 정식화한다. 제안 방법인 FRAME은 언어를 쿼리 관련 속성 가중치로 변환하고, 학습된 판독기(readout)로 물체 임베딩에서 속성별 근거를 추정한 뒤 집계해 순위를 매긴다. FRAME은 물체 점수 산정을 경량 행렬-벡터 연산으로 줄이면서 기존 장면 메모리 검색 기준선 대비 높은 성능을 보였다. 또한 고정 장면 메모리와 속성 정의 타깃을 사용하는 제어된 평가 프로토콜을 도입해 검색 능력을 인식 및 주석 모호성과 분리해 측정했다.