본문으로 건너뛰기

PAPERS

논문 트래커

arXiv cs.RO 신규 논문을 매일 수집해 한국어 요약을 붙입니다. 학회 채택 정보는 저자 코멘트에서 자동으로 추출합니다.

473건
RUT MIIT / Unsplash
2610.08653v1

다리형 로봇의 자기장 인식 제어

Magnet-Aware Control of Legged Robots

J. Playan Garai, S. B. Djuve, C. McGreavy, M. Khadiv

입자가속기 등 대형 과학 시설(Big Science facilities)은 자율 로봇을 통한 무인 운용이 필요하지만, 강한 자기장이 센서를 손상시키고 자세에 따른 기계적 렌치(wrench)를 유발해 기존 반응형 제어기로는 안정적인 보행이 어렵다. 이 논문은 공간적으로 변하는 자기 렌치를 모델링·추정·보상하는 제어 프레임워크를 제안한다. MuJoCo 시뮬레이터용 커스텀 물리 플러그인과 역장 추정 프레임워크를 개발해 쿼드러피드(quadruped)의 동적 반응과 센서 데이터로부터 잠재 자기장을 직접 추론한다. Magnet-Aware MPC(모델 예측 제어)와 WBC(전신 제어) 아키텍처를 통해 보행 중 자기 교란을 예측·상쇄한다. 시뮬레이션 및 실물 하드웨어 실험에서 힘 공간 최대 거부 가능 교란이 비보상 시스템 대비 2.5배, 토크 공간에서 1.6~2배 향상되었고 운용 가능 영역은 29.34% 증가했으며, 그중 10.84%는 기존 제어기로는 즉시 넘어졌을 구간이다.

Vanessa Loring / Pexels
2610.08650v1

기하학적 사전 지식을 활용한 빠른 비모수적 이분산 모방 학습

Fast Non-Parametric Heteroscedastic Imitation Learning With Geometric Priors

Maximilian Mühlbauer, Arne Sachtler, Markus Knauer, Cem Küçükgenç, Yanlong Huang 외 2명

이 논문은 인간 시연에서 확률적 정책(probabilistic policy)을 학습할 때 데이터 효율과 새로운 시나리오 적응 속도를 높이기 위한 비모수적(non-parametric) 방법을 제안한다. 로봇공학에서 흔히 등장하는 다양체(manifold) 기하 구조를 반영한 기하학적 사전 지식(geometric prior)을 도입하여, 기존 기하-비인식 방법 대비 데이터 효율을 개선하고 이분산(heteroscedastic) 불확실성 추정을 지원한다. 비분리형 대각 커널(non-separable diagonal kernel)로 자유도(degrees of freedom) 간 불확실성 관계를 포착하며, 위치와 방향을 모두 포함한 궤적의 업데이트를 3 ms 미만으로 처리하는 최적화된 구현을 제시한다. 태스크 파라미터화(task parameterization)를 통해 재훈련 없이 다양한 물체 자세에 적응할 수 있으며, 다양체 값 입력과 출력 모두를 지원한다. 장난감 예제와 실제 로봇 조작 태스크에서 자율 실행 및 공유 제어(shared control) 시나리오를 대상으로 평가가 수행되었다.

David Thái / Pexels
2610.08642v1

HygieneRoboBench: 가정용 로봇의 위생 인식 계획 벤치마킹

HygieneRoboBench: Benchmarking Hygiene-Aware Planning for Household Robots

Yurun Chen, Josh Qixuan Sun, Jason Qin, Chengtai Li, Tianyi Wang 외 2명

HygieneRoboBench는 가정용 로봇이 오염 접촉 이력을 바탕으로 위생 위험을 식별하고 새로운 접촉 이벤트 후에도 안전한 작업 계획을 수립하는 능력을 평가하는 벤치마크로, 134개 태스크 패밀리에 걸쳐 624개 인스턴스로 구성된다. 기존 벤치마크가 접촉 이력 기반 위험 식별과 사후 안전 계획 수립을 동시에 평가하지 못한 한계를 보완한다. 태스크는 두 개의 그리퍼와 공유 물체를 통한 오염 전파, 처리 비용, 사용자 우선순위를 반영한다. 저자들은 LLM 기반 그라운딩(grounding), 접촉 이력 재구성, CP-SAT를 결합한 Hygiene-NSP 플래너를 제안하며, 이 플래너는 안전 해결률 94.4%, 최적 안전 해결률 90.4%를 달성했다. LLM 기반 플래너와 기호적(symbolic) 플래너 평가에서, 작업을 안전하게 완료하는 것이 사용자 우선순위 기준의 최소 실행 비용을 보장하지는 않는 것으로 나타났다.

cottonbro studio / Pexels
2610.08640v1

RIWANav: 도시 탐색을 위한 재귀적 세계-행동 모델 자기개선

RIWANav: Recursive World-Action Models with Self-Improvement for Urban Navigation

Jing Xie, Shouwei Ruan, Yubin Wang, Yuxiang Zhang, Haitao Yang 외 2명

장거리 도시 탐색은 순차적 지역 결정의 오류가 누적될 수 있으며, 모방 학습(IL)은 실패로부터 거의 학습하지 못하고 물리적 강화학습(RL)은 비용이 크다는 한계가 있다. RIWANAV는 행동 조건부 세계 모델(action-conditioned world model)과 행동 모델(정책)을 재귀적 자기개선(RSI, Recursive Self-Improvement) 방식으로 공동 적응시키는 사후 학습 프레임워크다. 각 사이클에서 세계 모델은 상상된 시각적 결과를 통해 정책 행동을 평가하고 그룹 상대 정책 최적화(GRPO, Group-Relative Policy Optimization)를 위한 비교 피드백을 제공한다. 개선된 정책은 행동 참신성과 예측 오류를 기준으로 전문가 일치 행동-영상 쌍을 선택해 자기 커리큘럼을 구성하며, 정제된 세계 모델이 다음 정책 업데이트의 피드백을 담당한다. 실험에서 RIWANAV는 학습 기준선 및 선행 방법보다 높은 성능을 보였으며, 실제 환경 실험에서도 적용 가능성이 확인되었다.

Pixabay / Pexels
2610.08637v1

하중을 느끼며: 탑재물 상호작용 하에서의 순응형 사족보행 로봇 보행

Feeling Through the Load: Compliant Quadruped Locomotion under Payload Interactions

Shaunak A. Mehta, Mayank Mishra, Prajit KrisshnaKumar, Sebastian Scherer, Koichiro Niinuma

이 연구는 사족보행 로봇이 탑재물을 운반하는 중 사람이 해당 탑재물에 직접 힘을 가할 때, 온보드 측정만으로 이를 감지하고 순응적(compliant)으로 반응하는 힘 인식 보행 프레임워크를 제안한다. 핵심 설계는 탑재물 상호작용을 로봇-탑재물 시스템 전체의 운동을 형성하는 명령으로 해석하는 것으로, 힘 인식 보행 정책 학습과 비구속 탑재물에 대한 힘 추정을 분리하여 처리한다. 순응형 탑재물 운반 정책과 인과적 힘 추정기(causal force estimator)를 결합하고, 추정기-루프-내 데이터 집적(estimator-in-the-loop data aggregation) 및 파인튜닝 방식으로 학습한다. 시뮬레이션과 실물 로봇 실험 모두에서 안정적인 탑재물 운반 보행, 외부 상호작용에 대한 순응적 반응, 추정된 힘을 활용한 사람 유도 궤적 변화 지원이 가능함을 보였다.

Tibor Szabo / Pexels
2610.06850v1

InterMimicGen: 자기진화 동작 모방을 통한 휴머노이드 이동-조작 확장

InterMimicGen: Scaling Humanoid Loco-Manipulation through Self-Evolving Motion Imitation

Yucheng Zhang, Sirui Xu, Jinhong Li, Liuyu Bian, Anatulya Nandi 외 6명

InterMimicGen은 모션 캡처된 인간-물체 상호작용 데이터를 전신 협응과 손-물체 관계를 보존하면서 휴머노이드 로봇 참조 동작으로 변환하는 자기진화 동작 모방(motion imitation) 프레임워크다. 물리 기반 제너럴리스트 트래커를 훈련해 덱스터러스 손을 갖춘 휴머노이드가 시뮬레이션에서 다양한 참조 동작을 단일 정책으로 실행한다. 데이터 플라이휠(data flywheel) 구조를 통해 매 라운드마다 상호작용 위치와 신체 동작에 소규모 변화를 적용하고, 시뮬레이션 실행이 성공한 변형만 유지해 다음 라운드 학습 데이터로 활용한다. 반복이 누적될수록 희소한 원본 시연 주변의 커버리지가 넓어지며 과제 의미와 동작 품질은 유지된다. 실험에서 접촉 보존 리타게팅, 단일 제너럴리스트 정책의 광범위한 트래킹, 실제 로봇으로의 전이를 확인했다.

Ludovic Delot / Pexels
2610.06843v1

에이전트 로봇을 위한 Recursive Video In-Context Learning

Recursive Video In-Context Learning for Agentic Robot

Wenrui Bao, Xinxin Liu, Bingxin Xu, Yuzhang Shang

기존 LLM 에이전트는 동결된 시각-언어-행동 모델(VLA) 정책을 텍스트 메모리로 보완하지만, 시연 영상에 담긴 파지 접촉 등 물리적 세부 정보를 포착하지 못한다는 한계가 있다. RV-ICL(Recursive Video In-Context Learning)은 시연 영상을 파지·해제 같은 하위 이벤트 기반의 계층 구조로 변환하는 학습 불필요(training-free) 방법이다. 계층은 전체 과제 키프레임부터 단계, 순간, 짧은 클립까지 세분화되며, 에이전트는 계획 단계에서는 거친 수준을 참조하고 실행 중 세부 정보가 필요할 때만 현재 하위 목표에 해당하는 클립을 선택적으로 로드한다. 과제당 시연 하나만으로 동작하며, RPent 위에 구현된 RV-ICL은 LIBERO-PRO 벤치마크에서 성공률을 92.6%에서 96.5%로, LIBERO-Plus에서 86.7%에서 95.8%로 끌어올렸다.

Kindel Media / Pexels
2610.06814v1

TAPDreamer: 월드 액션 모델을 위한 전이 가능한 적대적 패치

TAPDreamer: Transferable Adversarial Patches for World Action Models

Xuanyu Lu, Fengqing Jiang, Kaiyuan Zheng, Yichen Feng, Yaorui Ding 외 6명

월드 액션 모델(world action model)은 환경 변화를 예측해 로봇 제어의 기반이 되지만, 카메라 입력 조작으로 시각 표현이 손상될 수 있다. TAPDreamer는 공개 인코더만으로 고정된 지역 섭동(perturbation)을 생성하며, 대상 모델 출력에 대한 접근 없이도 다양한 태스크와 정책 구조에 전이된다. 패치가 어텐션(attention) 가중치와 값 벡터 간 상호작용을 통해 패치 영역 밖까지 일관된 표현 변화를 전파하는 것이 핵심 원리다. 입력의 약 6.5%를 덮는 단일 고정 패치로, LIBERO 40개 태스크에서 FastWAM의 성공률을 97.7%에서 0.0%로, RoboTwin 50개 태스크에서 90.8%에서 0.0%로 낮췄으며, 같은 패치가 DreamWAM 두 구성에서 2.1%·0.8%, Motus에서 10.0%로 성공률을 떨어뜨렸다. 이 결과는 월드 액션 모델 방어 시 행동 생성 모듈만 보호하는 것은 불충분하며, 공유 시각 인코더도 지속적 지역 섭동에 대해 보호해야 함을 보인다.

deltaG Ketones / Unsplash
2610.06805v1

H-JEPA: 시각적 계획을 위한 계층적 월드 모델의 엔드투엔드 학습

H-JEPA: End-to-End Learning of Hierarchical World Models for Visual Planning

Wancong Zhang, Basile Terver, Michael Rabbat, Yann LeCun, Randall Balestriero

H-JEPA는 긴 지평선 계획(long-horizon planning)을 위해 행동 조건부 JEPA(Joint Embedding Predictive Architecture)를 계층적으로 구성하고 엔드투엔드로 학습하는 방법을 제안한다. 각 계층은 자체 잠재 공간에서 더 먼 미래를 예측하며, 상위 계층의 예측이 하위 계층 계획기의 하위 목표(subgoal)로 전달되는 하향식 구조로 동작한다. 데이터 내 요인들이 서로 다른 시간 스케일로 변화할 때, 상위 계층은 빠르게 변하는 예측 불가 세부 정보를 버리고 느리게 변하는 과제 관련 상태를 유지한다. 4개의 시뮬레이션 기반 항법·조작 환경 실험에서 계층적 계획이 단일 수준 JEPA보다 우수했으며, Visual AntMaze에서는 3계층 구조가 더 적은 계획기 연산으로 성공률을 18%에서 73%로 높였다. 역 동역학(inverse-dynamics) 감독을 추가하면 DROID 데이터셋의 다양한 실제 로봇 영상에도 적용 가능하며, 오프라인 계획 충실도가 향상되는 것으로 나타났다.

Brice Cooper / Unsplash
2610.06777v1

직교형 부분 관측 협력 감시 Art Gallery에서 최적 코너 학습에 관하여

On Learning Optimal Corners in Orthogonal Partially Observable Cooperative Guard Art Galleries

Yassin Ben Mansour, Edwin Meriaux

CADENCE 알고리즘은 부분 관측 협력 감시 Art Gallery 문제(POCGAGP)를 공식적인 커버리지·연결성 보장과 함께 해결하지만, 각 에이전트를 배치할 코너를 지정하지 않아 효율성에 영향을 미친다. 이 연구는 해당 보장을 그대로 유지하면서 코너 선택을 개선하는 두 가지 학습 기반 휴리스틱을 제안한다: 격자 인코딩으로 후보를 평가하는 합성곱 신경망(CNN)과, 가시성 그래프(visibility graph) 위에서 심층 Q-학습(DQN)으로 훈련된 GATv2 네트워크이다. 50×50에서 250×250 크기의 무작위 직교 환경에서 7,500회 실험한 결과, 두 휴리스틱 모두 전체 커버리지 달성 단계 수와 최대 에이전트 수에서 기본 CADENCE를 상회하였으며, 환경 규모가 커질수록 성능 차이가 확대되는 것으로 나타났다. 증분 자기 배치(ISDA) 기준선 대비 에이전트 활용률도 개선되는 동시에 ISDA가 제공하지 못하는 공식 보장을 유지한다.

Steve A Johnson / Pexels
2610.06643v1

AffordCraft: 단일 이미지로부터 확장 가능한 태스크 준비 시뮬레이션 에셋 구축

AffordCraft: Scalable Construction of Task-Ready Simulation Assets from Single Images

Haoyun Yang, Xueyang Zhou, Ziyi Xie, Yongchao Chen

AffordCraft는 단일 RGB 이미지와 작업 지시를 입력받아 시뮬레이션 학습에 사용 가능한 물리 유효 에셋을 구축하는 방법이다. 생성 모델 대신 검색(retrieval) 방식을 채택해, 관절(joint) 구조가 보존된 에셋 라이브러리에서 이미지에 맞는 항목을 찾아 적합화한다. 2,000장의 사진 중 1,703장(31개 카테고리)에서 물리적으로 유효한 에셋을 생성했으며, 비교 대상 생성 방식 5종은 동일 사진 기준 최대 45%에서만 유효 에셋을 만들었고, GPU 시간도 중앙값 기준 10~78배 더 소요되었다. 라이브러리를 141개에서 11,372개 항목으로 확장하면 카테고리 커버리지가 46%에서 100%로 오르며, 방법 자체 변경은 불필요하다. 구축된 에셋으로 생성한 조작(manipulation) 태스크에서 학습한 정책은 훈련 중 보지 못한 초기 상태에서도 태스크를 완료했다.

George Pagan III / Unsplash
2610.06641v1

장애물 인식 인간-로봇 천 공동 운반을 위한 물리 잔차 동역학 및 축소차수 전신 계획

Physics Residual Dynamics and Reduced Order Whole-Body Planning for Obstacle Aware Human Robot Cloth CoTransportation

Moein Forouhar, Kosar Behnia, Anirvan Dutta, Hamid Sadeghian, Ville Kyrki 외 3명

인간-로봇이 변형 가능한 천 소재 물체를 공동 운반할 때, 장애물 회피에는 파지점뿐 아니라 비구동 내부 형상까지 예측이 필요하다. 본 연구는 물리 잔차 조건부 순환 변이형 오토인코더(p-cRVAE)를 통해 선형화된 물리 모델에 잔차 보정을 학습하여 40단계 계획 구간에서 오차 누적을 억제하면서 천의 전체 형상을 예측한다. 예측된 천 동역학은 비홀로노믹 베이스 제약과 팔 작업 공간 한계를 보존하는 이중 팔 모바일 매니퓰레이터의 축소차수 표현과 결합된 모델 예측 경로 적분(MPPI) 플래너에 통합된다. 축소차수 정식화는 완전한 17 자유도 모델과 유사한 추적 성능을 유지하면서 계산 시간을 약 80% 단축한다. 네 가지 공동 운반 시나리오 실험에서 제안 프레임워크는 천-장애물 간격을 유지했으며, 전신 정제(refinement) 단계를 통해 최종 천 변형을 0.93 m에서 0.28 m로 줄였다.

Mikhail Nilov / Pexels
2610.06617v1

RealtimeWAM: 단일 스텝 비동기 세계 행동 모델

RealtimeWAM: One-Step Asynchronous World Action Models

Chengtao Lv, Jinyang Du, Shuyi Feng, Yang Yong, Shiqiao Gu 외 5명

세계 행동 모델(World Action Model, WAM)은 비디오 생성 백본의 시각 표현을 활용해 로봇 행동 예측을 수행하는 구조다. 기존 효율적 WAM은 Mixture-of-Transformers(MoT) 아키텍처를 채택하지만, 다단계 행동 디노이징으로 인한 반복 연산과 비디오·행동 전문가 모듈의 순차 실행이 추론 속도를 제한한다. RealtimeWAM은 Teacher-Anchored Consistency Distillation(TACD)을 통해 단일 스텝 행동 생성을 구현하고, Cross-Expert Wavefront Pipelining(CEWP)으로 두 전문가 모듈의 실행을 블록 단위로 중첩시켜 대기 시간을 제거한다. LIBERO, LIBERO-Plus, RoboTwin 벤치마크에서 성능 저하 1% 미만을 유지하면서 H100 기준 약 25배의 종단 간 속도 향상을 달성했다고 연구진은 보고한다.

Steve A Johnson / Pexels
2610.06598v1

SimForcing: 시뮬레이션 모션 사전 지식을 실제 도메인 로봇 월드 모델로 증류

SimForcing: Distilling Simulation Motion Priors into Real-Domain Robot World Models

Xiaodong Wang, Tianle Li, Chuanxin Song, Junliang Xie, Zhanmi Zhong 외 2명

SimForcing은 시뮬레이션을 교사 모델로 삼아 실제 도메인 로봇 월드 모델(robot world model)에 모션 사전 지식을 전달하는 프레임워크다. 잠재 공간 모션 증류(latent-motion distillation)를 통해 시뮬레이션의 시간적 변화 패턴을 학습하면서 외관 차이의 영향을 줄인다. 멀티블록 시뮬레이션 조건화(multi-block simulation conditioning)와 조건 드롭아웃(condition dropout)을 함께 도입해 시뮬레이션 예측 정확도에 과도하게 의존하지 않도록 설계되었다. Bridge 데이터셋에서 외부 사전 학습 없이 PSNR·SSIM·LPIPS·FVD 네 지표 모두 비교 방법들 중 가장 높은 수치를 기록했다. 학습된 월드 모델로 시각-언어-행동 모델(VLA)을 초기화하면 LIBERO 성공률이 향상되는 것으로 나타났다.

Nana Dua / Pexels
2610.06511v1

ArtifactArena: 물리 세계에서 구축한 결과물로 AI 모델을 평가하기

ArtifactArena: Evaluating Models by What They Build in the Physical World

Kushagra Tiwary*, David Mayo*, Nikhil Behari, Xiangzhou Sun, Abdulrahman Alabdulkareem 외 3명

ArtifactArena는 AI 모델이 시뮬레이션 아레나에서 경쟁하는 기능적 로봇을 설계·제작하는 하드웨어-소프트웨어 공동설계(hardware-software co-design) 과제를 통해 모델 역량을 평가하는 오픈 플랫폼이다. 세 가지 평가 방식을 제공하는데, 각각 텍스트 설명 기반 제로샷(zero-shot) 생성, 물리 시뮬레이터 피드백을 활용한 점진적 개선, 게임플레이 데이터 기반 설계 최적화로 구성된다. 모델 간 성능은 아티팩트끼리 맞붙는 토너먼트 결과를 Elo 점수로 순위화하여 비교한다. 커뮤니티 제출을 지속적으로 수용하는 구조로 설계되어, 특정 성능 수준에서 포화되지 않는(non-saturating) 벤치마크를 목표로 한다.

cottonbro studio / Pexels
2610.06510v1

MarvisNav: 제로샷 객체 탐색을 위한 경로 선택에서 탐색 메모리 가시화

MarvisNav: Making Memory Visible on Route Choices for Zero-Shot Object Navigation

Jincheng Wang, Chi Pui Chan, Wei Zeng, Shuyang Zhang, Jianhao Jiao 외 1명

MarvisNav는 제로샷 객체 탐색(ZSON) 프레임워크로, 위상 그래프(topological graph)를 유지하며 후보 노드와 탐색 상태를 자아 중심(egocentric) 시점 이미지에 직접 투영해 메모리를 시각화한다. 기존 시각-언어 모델(VLM) 기반 방법들은 탐색 이력을 텍스트나 지도로 별도 표현하여 메모리와 경로 선택 간 대응을 암묵적으로 처리했으나, MarvisNav는 탐색 상태를 각 시각적 경로 후보에 직접 결합한다. 이를 통해 VLM이 목표 관련성과 탐색 상태를 별도의 후처리나 재순위화(reranking) 없이 동시에 평가할 수 있다. 정책 학습 없이 HM3D 벤치마크에서 성공률(SR) 81.2%, SPL 42.5%를 기록했으며, WMNav 대비 VLM 호출 횟수는 7.5% 수준에 그쳤다. 실제 로봇 실험도 다양한 환경에서 수행되어 현장 적용 가능성을 추가로 확인했다.

Erik Mclean / Pexels
2610.06487v1

통행 가능성 인식 기반 인간-UGV 협력 경로 계획을 통한 사상자 후송

Traversability-Aware Cooperative Path Planning for Human-UGV Casualty Evacuation

Kristian Dalland, Prithvi Poddar, Souma Chowdhury, Karthik Dantu, Ehsan T. Esfahani

이 연구는 수색구조 시나리오에서 인간과 무인지상차량(UGV, Unmanned Ground Vehicle)으로 구성된 2인 팀의 공동 경로 계획 문제를 다룬다. 인간 에이전트는 피로도 조절 속도를 반영한 Pandolf-Santee 대사 비용 모델로, UGV는 지형 의존적 속도 한계를 갖는 구름 저항 에너지 모델로 각각 모델링한다. 밀집 식생·얕은 수역에서 강점을 보이는 인간과 개방 지형·도로에서 빠른 UGV의 통행 가능성 상보성을 활용해 사상자 인계 지점(스위치 포인트)을 최적화한다. 1km² 합성 환경 실험에서 최적화 전략은 인간 단독 기준 대비 평균 임무 시간을 5.3%, 스위치 포인트 최적화 없는 단순 인간-UGV 전략 대비 7.0% 단축하고 인간 에너지 소비를 17.8% 절감한다. 반면 단순 전략은 에너지 절감(22.4%)은 더 크지만 임무 시간이 기준 대비 2% 증가해, 시간 단축 효과를 실현하려면 스위치 포인트 최적화가 필수임을 시사한다.

Sergei Skrynnik / Pexels
2610.06469v1

Odyssey: 명시적 내비게이션 경로를 활용한 장기 실세계 주행 폐루프 벤치마크

Odyssey: A Closed-Loop Benchmark for Long-Horizon Real-World Driving with Explicit Navigation Routes

Jungho Kim, Hongjae Shin, Seunghoon Yu, Heecheol Yoo, Myeongjun Kim 외 9명

Odyssey는 장기 주행(long-horizon driving) 평가를 위한 폐루프(closed-loop) 벤치마크로, nuPlan 주행 로그 100초 분량을 재구성한 100개 시나리오로 구성된다. 기존 벤치마크가 짧은 구간만 평가하고 방향 명령이 모호하다는 한계를 극복하기 위해, 방향 명령 대신 표준 정밀도(SD) 지도 경로를 도입해 차량이 따라야 할 도로를 명시적으로 지정한다. 3DGS 렌더링 이미지에 확산(diffusion) 기반 정제를 적용해 자아 궤적 상의 렌더링 아티팩트를 감소시킨다. SD 경로 준수율(SD Route Compliance), 차선 변경 준비 점수(Pre-Lane Change Score), RouteDS 등 세 가지 신규 평가 지표를 제안하며, 시각-언어-행동 모델(VLA)을 포함한 최신 플래너들의 경로 추종 성능을 이 지표로 평가한다. 벤치마크 코드와 적용된 기준 모델은 공개 배포될 예정이다.

Kindel Media / Pexels
2610.06427v1

집단 인식에 관한 분류 체계

A Taxonomy on Collective Awareness

Guillermo GP-Lenza, Miguel Fernandez-Cortizas, Martín Molina, Ricardo Sanz, Pascual Campoy

다중 로봇 시스템 문헌에서 혼용되는 상호 인식(Mutual Awareness, MA), 공유 상황 인식(Shared Situational Awareness, SSA), 팀 상황 인식(Team Situational Awareness, TSA) 세 개념이 서로 대체 불가능하다고 주장한다. 세 개념은 포함 관계의 계층 구조를 형성하며, 완전히 개별화된 이해(MA)부터 완전히 균일한 이해(SSA)까지의 분포 스펙트럼을 이룬다. 논문은 '인식 대상'과 '인식 분포' 두 축으로 구성된 2차원 분류 체계를 제안한다. 이기종 공중·지상 로봇을 활용한 수색·구조(Search and Rescue) 사례 연구를 통해 각 분류 위치에 구체적인 협조 요건을 대응시킨다. 이 분류 체계는 다중 로봇 시스템에서 집단 인식을 명확히 명세하고 비교하기 위한 개념적 기반을 제공한다.

Sinan KRIYA / Pexels
2610.06400v1

심층 강화학습과 진화적 하이브리드 설계를 통한 군집 로봇 시각 항법

Visual Swarm Navigation via Deep Reinforcement Learning and Evolutionary Hybrid Design

Álvaro Díez, Fidel Aznar

이 논문은 군집 로봇(swarm robotics)의 분산 제어기를 자동으로 생성하기 위해 다중 에이전트 강화학습(multi-agent reinforcement learning)과 신경진화(neuro-evolutionary) 전략을 결합한 하이브리드 방법론을 제안한다. 구체적으로 교차 엔트로피 방법(cross-entropy method)과 공분산 행렬 적응 진화 전략(covariance matrix adaptation evolution strategy, CMA-ES)을 활용해 사전 학습된 개별 항법 정책을 최적화한다. 제어기의 심층 신경망은 단안(monocular) 카메라 영상만을 입력으로 사용하며, 저비용·저전력 플랫폼을 겨냥한 경량 설계를 채택한다. 고충실도 물리 시뮬레이터에서 수행한 실험에서 교차 엔트로피 방법으로 학습한 제어기가 CMA-ES 대비 탐색 영역을 36.20% 더 커버하는 것으로 나타났다. 또한 이 시각 기반 정책은 거리 센서 기반 기존 방법과 통계적으로 유사한 탐색 성능을 보이면서 평균 에너지 소비를 31.40% 줄이는 것으로 연구팀은 보고한다.