본문으로 건너뛰기

PAPERS

논문 트래커

arXiv cs.RO 신규 논문을 매일 수집해 한국어 요약을 붙입니다. 학회 채택 정보는 저자 코멘트에서 자동으로 추출합니다.

473건학회 채택 4건
Google DeepMind / Pexels
2609.21909v1ICRA

운동학을 넘어: 근육 기반 모방 학습을 위한 시뮬레이션 충실도 벤치마킹

Beyond Kinematics: Benchmarking Simulation Fidelity for Muscle-Driven Imitation Learning

Ayah G. Ahmad, Claire E. Borden, Maegan Tucker

이 연구는 근골격 운동 모방 강화학습(MIRL) 파이프라인인 SCONE/HyFyDy와 MuJoCo/MyoSim을 공통 인체 동작 캡처 및 근전도(EMG) 데이터를 기준으로 체계적으로 비교한다. 두 파이프라인 모두 인체 운동학을 유사한 정확도로 재현하지만, 근육 활성화 패턴에서는 뚜렷한 차이가 나타났다. HyFyDy의 근육 활성화는 실험 EMG 대비 평균 RMSE 0.164, 상관계수 r=0.4를 기록한 반면, MuJoCo는 RMSE 0.344, r=0.11로 실측과의 일치도가 낮았다. 연구팀은 근건(musculotendon) 모델링의 생리학적 상세도 면에서 HyFyDy가 현재로서는 근골격 모델링에 더 적합하다고 결론 내렸다. 다만 두 파이프라인 모두 GPU 병렬 시뮬레이션 환경에서 생리학적 현실성을 확보하려면 추가 개발이 필요하다고 지적한다.

Brecht Corbeel / Unsplash
2609.21908v1ICRA

CommitFlow: 장기 과제 로봇 조작 VLA 실행을 위한 의미론적 커미트먼트 검증 및 국소 보정

CommitFlow: Semantic Commitment Verification and Local Correction for Long-Horizon Robot Manipulation VLA Execution

Zixiang Zhao, Yansong Feng, Yang Yang, Chaoyu Wang, Haoran Xiao 외 3명

시각-언어-행동 모델(VLA) 정책은 필요한 물리적 조건이 충족되기 전에 다음 단계로 진행하는 '의미론적 커미트먼트(semantic commitment) 불일치' 문제를 지닌다. CommitFlow는 기반 정책을 고정한 채로 커미트먼트 모니터링과 국소 보정을 결합하는 폐루프(closed-loop) 실행 프레임워크다. Semantic Commitment Monitor(SCM)가 단계별 요건 충족 여부를 감시하고, BoundaryFlow가 현재 상태에 조건화된 국소 보정을 생성하며, Relation and Gain Calibration(RGC)이 제약 조건을 만족하는 최소 보정 강도를 선택한다. RoboTwin 2.0 벤치마크 10개 과제에서 평균 성공률 75.9%를 달성하며 기반 정책 π0.5 대비 22.7%p 향상되었다. 여러 정책을 대상으로 한 교차 실험에서도 일관된 성능 향상이 확인되었다.

Pok Rie / Pexels
2609.21883v1

VIRGA: 능동 감지 공중-지상 협조를 위한 가상 에이전트 매개 리만 기하학 프레임워크

VIRGA: Virtual-Agent-Intermediated Riemannian Geometry for Active-Sensing Air-Ground Coordination

Fenghe Guo, Runjie Shen, Chenyang Sun, Junrui Zhang

VIRGA는 무인지상차량(UGV)에 장착된 짐벌 라이다(LiDAR)가 무인항공기(UAV)를 지속적으로 관측해야 하는 공중-지상 협조 문제를 다루는 신경 기하학 기반 제어 프레임워크다. 이중 라이다 관측값을 플랫폼별 리만(Riemannian) 필드로 변환하고, 가상 에이전트(virtual agent)를 통한 상호 탄성 피드백으로 두 플랫폼을 결합한다. 플랫폼 인지 실행 맵이 공유 협조 참조를 UAV·UGV·짐벌 명령으로 변환하며 능동 관측 안전 조건을 유지한다. Ray-RMP, 고밀도 해석적 리만 필드, ColAG 등 세 가지 기준 제어기와 비교했을 때, VIRGA는 창고 시나리오 전 조건을 안전하게 완수하고 재학습 없이 동굴 환경 장거리 스트레스 테스트에서도 협조를 유지하는 것으로 보고됐다. 어블레이션 실험은 온라인 기하학 평가, 가상 에이전트 매개, 상호 피드백 각각의 기여를 확인했다.

Shubham Dhage / Unsplash
2609.21838v1

PopNavShift: 보행자 행동 분포 변화 하의 사회적 내비게이션 스트레스 테스트

PopNavShift: Stress-Testing Social Navigation under Behavioral Population Shift

Kaizhen Tan, Diyu Zheng, Tim Guangyu Wu, ChengHe Guan

PopNavShift는 보행자 행동 분포 변화에 따른 사회적 내비게이션(social navigation) 전략의 강건성을 시험하기 위한 시뮬레이션 프레임워크다. Gemini 3.7 Flash를 이용해 MatrAIx Persona 1M의 600개 합성 페르소나 기록에서 인구 집단 조건별 보행자 움직임 프로필을 생성하고, 이를 한정된 운동 파라미터로 결정론적으로 매핑한다. 반응적 회피, 조기 양보, 상호 충돌 회피(reciprocal collision avoidance) 세 가지 전략을 8개 인구 집단 조건과 7,488개의 매칭된 로봇 실행에서 비교했다. 동일한 202개 페르소나에서 시간 압박 조건만 바꿨을 때 로봇 이동 시간 기준 컨트롤러 순위는 8.6% 역전됐으나, 평균 보행자 지연 기준으로는 22.4%, 최하위 10% 지연 기준으로는 23.9%가 역전됐다. 이 민감도는 공간이 제약된 환경일수록 크게 나타났으며, 두 번째 보행자 동역학 모델에서도 같은 경향이 재현됐다.

Pavel Danilyuk / Pexels
2609.20822v1

안전한 로봇 조작을 위한 장애물 인식 하네스를 갖춘 코딩 에이전트

Coding Agents with an Obstacle-Aware Harness for Safe Robot Manipulation

Bingxin Xu, Yuzhang Shang, Zhen Dong, Emilio Ferrara

코딩 에이전트(coding agent)는 언어 모델이 로봇 제어기를 프로그램으로 작성하는 방식으로, 로봇 특화 학습 없이 로봇을 운용할 수 있다. 연구진은 조작 목표와 접촉 금지 장애물을 함께 제시하는 안전 제약 조건에서 코딩 에이전트를 평가한 결과, 대부분의 경우 장애물 충돌이 발생했다. 원인 분석에서 인식이나 지시 문제가 아닌 계획(planning) 단계에서 안전 제약이 우선순위로 처리되지 않는 것이 근본 원인으로 확인됐다. 이를 해결하기 위해 연구진은 SafeHarness를 제안했으며, 바운딩 박스 기반 웨이포인트 설정·검증·재계획을 수행하는 장애물 인식 경로 계획과 접촉 위치 자체가 장애물을 우회하도록 하는 장애물 인식 접촉 실행 두 가지 하네스를 결합한다. SafeHarness는 태스크 성공률 71.9%, 충돌 회피율 87.5%를 달성했으며, 하네스 미적용 동일 에이전트 대비 각각 2.3배, 1.5배에 해당한다.

Jakub Żerdzicki / Unsplash
2609.20820v1CoRL

Workspace Models: 현저성 기반 지도학습을 통한 경량 로봇 메모리

Workspace Models: Lightweight Robotic Memory via Saliency-Driven Supervision

Nitish Dashora, Douglas Chen, Idan Shenfeld, John Marangola, Pulkit Agrawal 외 1명

복잡한 로봇 조작 과제는 과거 사건·행동에 대한 장기 메모리를 필요로 하지만, 전체 이력을 조건으로 삼으면 허위 상관관계가 생겨 정책 성능이 저하된다. 기존 방법은 배포 루프 안에서 시각-언어 모델(VLM)을 반복 호출해 과제 관련 정보를 추출하는데, 이는 추론 시 계산 비용이 크다. 이 연구는 VLM 쿼리를 학습 시점에만 수행해 경량 잠재 메모리를 사전 학습하는 방법을 제안하며, 이 표현을 워크스페이스 토큰(workspace token)이라 명명한다. VLM이 과제 완료에 필요한 현재·과거 정보를 식별하면, 집합 재구성 디코더 손실(set-reconstruction decoder loss)을 통해 해당 정보를 워크스페이스 토큰에 증류하는 방식으로 학습된다. 시뮬레이션과 실기(hardware) 실험 모두에서 워크스페이스 토큰이 관측값의 대체제로 기능할 수 있으며, 배포 시 VLM 추론 없이도 메모리 집약적 과제를 수행할 수 있음을 보였다.

Pavel Danilyuk / Pexels
2609.20817v1

FAMOS: 희소 관측으로부터의 피드포워드 3D 관절 객체 모델링

FAMOS: Feed-Forward 3D Articulation Modeling from Sparse Observations

Kevin Qu, Tao Sun, Massimiliano Viola, Liyuan Zhu, Zhizhuo Zhou 외 3명

FAMOS는 정렬되지 않은 부분 포인트 클라우드(point cloud) 집합을 입력받아 가동 부품 분할(movable-part segmentation)과 관절 파라미터를 예측하는 피드포워드(feed-forward) 모델이다. 단일 관측에 의존하는 기존 방법과 달리, 여러 관측을 동시에 추론하며 입력 수가 가변적인 경우도 자연스럽게 처리한다. 복수 관측 간 관절 단서를 집계하기 위해 상태별·전역 어텐션을 교대 적용하는 다중 상태 관절 트랜스포머(Multi-state Articulation Transformer)를 도입했다. 기존 데이터셋의 규모와 다양성 한계를 극복하기 위해, 학습 중 자기 주석(self-annotated) 자산을 합성하는 절차적 데이터 생성기를 추가로 제안한다. PartNet-Mobility, ACD, ArtiCraft-10K 벤치마크에서 피드포워드 기반 및 최적화 기반 비교 모델 대비 일관된 성능 향상이 확인되었다.

Pavel Danilyuk / Pexels
2609.20791v1

StageGuard: 에이전틱 증류를 통한 장기 로봇 과제의 단계 전환 학습

StageGuard: Learning Stage Transitions for Long-Horizon Robot Tasks via Agentic Distillation

Jinbang Huang, Yuanzhao Hu, Zhiyuan Li, Ran Qi, Yixin Xiao 외 4명

계층적 계획(hierarchical planning) 프레임워크에서 현재 기술(skill)을 종료하고 다음 하위 과제로 전환할 시점을 판단하는 일은 장기 과제 실행의 핵심 문제다. 기존 방식은 사전 설계된 완료 신호 검사기에 의존하지만 실환경에서 확보하기 어렵고, 대규모 시각-언어 모델(VLM)은 과제 완료 기준과의 정렬 문제 및 클라우드 추론 지연으로 실시간 모니터링에 제약이 있다. StageGuard는 교사 VLM의 추론 결과와 시연 궤적을 결합해 하위 과제 완료·정책 전환에 관한 구조화된 설명을 생성하고, 경량 학생 VLM이 이를 지도 미세조정(supervised fine-tuning)으로 학습하는 에이전틱 증류(agentic distillation) 프레임워크다. 두 개의 벤치마크에서 단계 전환 예측 성능을 평가하고, BEHAVIOR-1K에서의 폐쇄 루프(closed-loop) 과제 성공률과 실물 로봇 검증을 추가로 수행했다. 실험 결과 단계 전환 예측 정확도가 크게 향상되면서 효율적인 온라인 모니터링이 가능한 것으로 나타났다.

Pavel Danilyuk / Pexels
2609.20776v1ICRA

GeoAAC: VLA 정책의 디노이징 궤적에서 추출한 기하학 기반 적응형 행동 청킹

GeoAAC: Geometry-Based Adaptive Action Chunking from Denoising Trajectories in VLA Policies

Xin Chen, Sen Chen, Yujuan Ding, Jian Liu, Guoqing Wang 외 3명

시각-언어-행동 모델(VLA) 정책에서 행동 청킹(action chunking)은 고정된 행동 수평선(action horizon)을 사용하는 것이 일반적이나, 작업 단계마다 요구되는 제어 정밀도와 피드백 빈도가 달라 고정 수평선으로는 대응이 어렵다. GeoAAC는 플로우 매칭(Flow Matching) 디노이징 궤적의 기하학적 특성을 이용해 현재 예측의 신뢰도를 측정하고, 이를 바탕으로 행동 수평선을 동적으로 결정하는 방법이다. 접두사별 기하학적 변화량이 예측 불확실성과 양의 상관관계를 가진다는 점을 활용해, 별도의 추가 학습 없이 단일 생성 과정에서 수평선을 적응적으로 조정한다. GR00T N1.5와 π0.5를 대상으로 LIBERO, LIBERO-Pro, RoboCasa365 및 실기 조작 과제에서 실험한 결과, 고정 수평선 기준선 대비 시뮬레이션에서 최대 8.7 퍼센트포인트 향상, 실기 평균 성공률은 53.3%에서 74.4%로 높아졌다.

cottonbro studio / Pexels
2609.20761v1

Agile-WAM: 접촉 집약적 로봇 제어를 위한 민첩한 촉각 세계 행동 모델

Agile-WAM: An Agile Tactile World Action Model for Contact-Rich Robot Control

Hanchu Zhou, Brendan Lynch, Raman Goyal, Dechen Gao, Begum Kasap 외 2명

세계 행동 모델(WAM, World Action Model)은 미래 환경 상태와 로봇 행동을 함께 예측함으로써 물리적 동역학 학습을 지원하는 정책 방식이다. 본 논문의 ABBR은 시각과 촉각 관측을 공유 잠재 공간으로 인코딩한 뒤, 플로우 매칭(flow-matching) 방식으로 행동 청크와 미래 시각·촉각 잠재 표현을 동시에 생성한다. 시각 신호는 인접 프레임 간 변화가 작고 촉각 신호는 접촉 시 급변한다는 특성을 반영해, 시각 잠재는 더 큰 시간 간격으로, 촉각 잠재는 다음 프레임을 예측하는 다중 수평선 다중 모달(multi-horizon multimodal) 예측 구조를 도입했다. 9개 시뮬레이션 과제와 5개 실제 환경 접촉 조작 과제에서 평가한 결과, 기존 최강 기준선 대비 전체 성공률이 29.4% 향상되었으며 추론 지연 시간은 11.9 ms로 측정되었다.

Mitchell Leach / Unsplash
2609.20756v1

OPTED: 렌더링 없는 교사 모델을 이용한 엔드투엔드 자율주행 온-정책 파인튜닝

OPTED: On-Policy Fine-Tuning for End-to-End Driving using a Render-Free Teacher

Damiano Da Col, Maximilian Igl, Peter Karkus, Kashyap Chitta, Boris Ivanovic 외 3명

엔드투엔드(end-to-end) 자율주행 정책은 인간 시연 데이터로 개방 루프(open-loop) 사전학습을 거치지만, 폐쇄 루프(closed-loop) 배포 시 오류 누적으로 학습 데이터 분포를 벗어날 위험이 있다. 이를 완화하기 위해 연구팀은 OPTED를 제안하며, 강화학습(RL)을 엔드투엔드 정책의 포스트학습과 분리하는 방식을 채택한다. HD 맵과 바운딩 박스 등 벡터화된 입력으로 훈련된 특권 교사(privileged teacher) 모델이 폐쇄 루프 포스트학습 중 사전학습된 학생 모델에 감독을 제공한다. 카메라 기반 모델 TransFuser와 VaVAM에 OPTED를 적용하고 3DGS(3D Gaussian Splatting) 기반 신경 재구성을 활용한 AlpaSim에서 파인튜닝한 결과, 주행 점수가 각각 1.6배, 9.5배 향상되었다. 통제 실험에서 OPTED는 직접 RL 포스트학습 대비 약 1,000배 적은 시뮬레이터 상호작용으로 유사한 폐쇄 루프 성능을 달성하면서 인간 행동 사전(prior)에도 더 가깝게 유지되었다.

karim phenix / Pexels
2609.20747v1

MILER: 비정형 자율주행 환경의 시뮬레이션-실기 강화학습을 위한 의미론적 중간 레벨 표현

MILER: Semantic Mid-Level Representation for Sim-to-Real Reinforcement Learning in Unstructured Autonomous Driving

Thomas Steinecker, Denis Trescher, Alexander Bienemann, Thorsten Luettel, Mirko Maehlisch

MILER은 비정형 환경(unstructured environments) 자율주행을 위한 강화학습(reinforcement learning) 기반 엔드-투-엔드 정책 프레임워크로, 제로샷(zero-shot) 시뮬레이션-실기 이전(sim-to-real transfer)을 목표로 한다. 오프라인 학습 단계에서 커스텀 의미론적 중간 레벨 표현(MLR, Mid-Level Representation) 시뮬레이터를 사용하고, 정책 네트워크의 제어 출력은 자전거 모델(bicycle model)에 적용해 훈련한다. 실차 배포 시에는 카메라와 LiDAR 데이터를 BEVFusion으로 처리해 MLR 시뮬레이터와 일관된 의미론적 조감도(bird's-eye-view) 표현을 생성하며, 정책 출력을 실차에 직접 넣는 대신 궤적 정렬(trajectory-alignment) 전략을 통해 인식과 제어 모두의 도메인 간격을 좁힌다. 두 대의 차량으로 3.0 km 테스트 트랙을 총 17.3 km 인간 개입 없이 주행했으며, 최대 33.6 km/h, 헤어핀 커브, 오프로드 구간을 포함한 다양한 조건에서 평가했다. 전체 소프트웨어 스택은 Jetson AGX Orin 위에서 구동된다.

Janka Jonas / Unsplash
2609.20731v1

표적 특화 깊이 추정과 적응형 모델 융합 예측 제어를 이용한 수중 시각 표적 추적

Underwater Visual Target Tracking with Target-Specific Depth Estimation and Adaptive Model-Fusion Predictive Control

Yuheng Zhou, Haiyang Cheng, Yanqi Feng, Pangkit Fong, Mei Xuan Lee 외 3명

이 논문은 자율수중로봇(AUV)을 위한 스테레오 시각 서보(visual servoing) 기반 수중 표적 추적 프레임워크를 제안한다. 인식 모듈은 색상·시차(disparity)·시간적 단서를 결합한 표적 깊이 마스크를 구성하고 칼만 필터(Kalman filter)를 적용해 신뢰성 있는 3D 상대 상태를 추출한다. 제어 모듈은 요(yaw) 조절과 병진 제어를 분리하여 다자유도 결합 최적화를 피하고 실시간 모델 예측 제어(MPC)를 가능하게 한다. 병진 제어기는 등속 모델과 정지 모델을 결합한 적응형 모델 융합 예측 제어를 사용하며, 과거 예측 오차를 바탕으로 모델 가중치를 갱신하고 구동, 추적 거리, 시야각 제약 조건 하에서 명령을 산출한다. 시뮬레이션과 실환경 실험을 통해 프레임워크를 검증하였다.

Pavel Danilyuk / Pexels
2609.20709v1

MoWAM: 효율적인 World Action Model을 위한 명시적 미래 동작 예측

MoWAM: Explicit Future Motion Prediction for Efficient World Action Models

Jiayu Wang, Bin Zhu, Yue Yu, Jingjing Chen

월드 액션 모델(World Action Model, WAM)은 미래 동역학을 정책 학습에 반영하지만, 추론 시 미래 비디오를 명시적으로 생성하면 연산 부담이 크게 증가한다. MoWAM은 미래 비디오 생성을 명시적 미래 동작 예측으로 대체해, 로봇이 현재 장면과 상호작용 제약 아래 어떻게 움직일지를 컴팩트한 구조화 표현으로 모델링한다. Mixture-of-Transformer 아키텍처는 학습 중 미래 시각 동역학을 함께 학습하면서 동작(motion)과 행동(action)을 공동 예측하고, 추론 시에는 비디오 생성 없이 이 표현만으로 동작한다. 추론 시 스케일링을 위해 동작-행동 쌍의 후보를 여러 개 샘플링한 뒤 동작 인식 태스크 진행도 검증기로 최적 후보를 선택하며, 후보 수가 늘어날수록 성능이 향상된다. LIBERO, LIBERO-Plus, 실세계 조작 과제 실험에서 배포 내(in-distribution) 성능과 배포 외(out-of-distribution) 강건성 모두 대표적인 WAM 기준선보다 높은 성공률을 보인다고 저자들은 보고한다.

RDNE Stock project / Pexels
2609.20694v1

HOPHY: 비도로 경로 및 임무 계획을 위한 계층적 하이퍼그래프 표현

HOPHY: A Hierarchical Hypergraph Representation for Off-Road Path and Mission Planning

Pranay Meshram, Charuvahan Adhivarahan, Prithvi Poddar, Ehsan Tarkesh Esfahani, Chen Wang 외 2명

HOPHY(Hierarchical Off-Road Planning using Hypergraphs)는 재난 대응·수색구조·전술적 무인지상차량(UGV) 운용에서 반복적인 경로·임무 계획을 지원하는 계층적 지형 표현 프레임워크다. 지도 규모의 지형을 기하학적으로 연결된 의미 영역(GSNode), 연결성 보존 핵심 영역(Coarse Region), 지형·에이전트·기상 맥락을 담은 유형화된 하이퍼에지로 구조화하며, 상태 변경 시 계층 전체를 재구성하지 않고 영향받는 영역과 에지만 선택적으로 갱신한다. 실제 킬로미터 규모 오프로드 지도에서 100% 계획 성공률과 픽셀 A* 대비 중앙값 비용 편차 0.01% 미만을 기록했다. 다중 로봇 작업 할당(MRTA) 문제에 적용했을 때 픽셀 A* 대비 총 연산량을 79배, 가장 빠른 추상화 기법 대비 7.2배 줄이면서 임무 완료 시간은 픽셀 A*에 준하는 수준을 유지했다. Clearpath Jackal 실물 로봇에서 혼합 지표면 야외 지형을 대상으로 1.5km, 8개 작업 임무와 장애물 발생 시 경로 재계획을 성공적으로 수행했다.

Vanessa Loring / Pexels
2609.20691v1

자율 공중-수면 복합 임무를 위한 커스텀 PX4 펌웨어

Custom PX4 firmware for autonomous hybrid aerial-marine missions

Andrea Capuozzo, Fabio Ruggiero, Vincenzo Lippiello

수중·수변 환경 매핑에 활용할 수 있는 하이브리드 공중-수상 드론을 위한 PX4 펌웨어 확장을 제안한다. 이 프레임워크는 수동 및 자율 수상 항법(marine navigation) 모드를 표준 PX4 미션 파이프라인과 QGroundControl 인터페이스에 통합한다. 기존 비행 기능과 안전 메커니즘을 그대로 유지하면서, 공중 웨이포인트와 수상 웨이포인트를 구분하여 단일 미션으로 계획·실행할 수 있다. 시뮬레이션 사례 연구를 통해 잔잔한 수면과 파도가 있는 조건 모두에서 안정적인 수상 항법을 확인하였다.

Narno Beats / Unsplash
2609.20680v1

합성 데이터를 활용한 해양 인식 확장 연구

Towards Scaling Marine Perception with Synthetic Data

Haoyu Ma, Onur Bagoren, Anja Sheppard, Elias Fandi, Ashrith Edukulla 외 4명

수중 환경에서의 기계 학습은 레이블된 실세계 훈련 데이터 부족으로 크게 제한된다. 이 연구에서는 IsaacSim 기반 수중 인식 시뮬레이터인 OceanSim에 합성 데이터 생성(SDG, Synthetic Data Generation) 파이프라인을 추가하였다. 제안 파이프라인은 장면 외관·구조·센서 설정을 구성 가능하게 하여 대규모 자동 레이블 포토리얼리스틱 데이터셋 생성을 지원한다. 연구팀은 실제 해양 환경의 성게(sea urchin) 탐지 과제에서 파이프라인을 평가하고, 합성 장면 변형 방식이 시뮬레이션-실제(sim-to-real) 전이 성능에 미치는 영향을 분석하였다. 코드는 오픈소스로 공개되었다.

Kindel Media / Pexels
2609.20673v1

FunArt: 생성형 3D 잠재 표현으로부터 기능 구조와 가동 구조 디코딩

FunArt: Decoding Functional Structure and Articulation from Generative 3D Latents

Dennis Rotondi, Abdelrhman Werby, Kai O. Arras

FunArt는 단일 정적 자세 추정(posed) RGB-D 관측에서 관절 인식 기능 3D 장면 그래프(scene graph)를 구성하는 프레임워크다. 객체 인스턴스를 재구성한 뒤 융합된 기하 정보를 TRELLIS.2의 O-Voxel 표현으로 변환하고, 동결(frozen)된 희소 압축 VAE(Variational Autoencoder)를 구조적 사전 분포로 활용한다. 경량 쿼리 기반 디코더가 컴팩트 객체 수준 잠재 벡터와 표면 정렬 특징을 결합해 가동부·기능 인터랙션 요소를 동시에 분할하고, 운동 유형·축·원점·범위를 추정한다. Articulate3D 데이터셋에서 가동부 분할, 관절 추정, 기능 요소 분할 모두 최고 성능을 기록했다. 종단간(end-to-end) 설정에서 가장 강력한 기준 모델 대비 가동부 AP_50 +1.5점, 관절 원점·축 통합 조건 +2.8점, 기능 요소 +6.7점을 달성했다.

Nishat Samadzai / Unsplash
2609.20670v1

MAGNETAR: 어퍼 미드밴드 송신기 포즈 추론을 위한 멀티패스 기반 공간 사후확률 추정

MAGNETAR: Multipath-Guided Spatial Posteriors for Transmitter Pose Inference in the Upper Mid-Band

Haozhe Lei, Ruibin Chen, Yuhan Jiang, Ali Rasteh, Aditya Dhananjay 외 1명

MAGNETAR는 방 레이아웃과 수신기 포즈가 주어졌을 때, 단일 비동기 무선주파수(RF) 멀티패스(multipath) 스냅샷으로부터 평면 송신기의 위치와 방향에 대한 결합 사후확률(joint posterior)을 추론하는 시스템이다. 입력으로 도착각(angle-of-arrival)과 신호 대 잡음비(SNR) 추정값을 활용하며, 다섯 가지 신경 스코어러 중 후보 방향을 조건으로 하는 공유 2D U-Net을 채택해 이산화된 위치-방향 격자 위에서 점수를 공동 정규화한다. 학습에는 실제-시뮬레이션 교정된 10 GHz 시뮬레이션 데이터와 소규모 실측 데이터 서브셋을 사용한다. 격자 기반 결합 사후확률은 홀드아웃 시뮬레이션에서 파라메트릭 방식보다 높은 성능을 보였으며, 방향 조건부 스코어러는 실제 로봇 측정 환경으로의 전이(transfer) 성능이 가장 우수한 것으로 나타났다.

Kindel Media / Pexels
2609.19142v1

PointZero: 전이 가능한 3D 역학 학습을 위한 3D 포인트 트랙 완성

PointZero: 3D Point Track Completion for Learning Transferable 3D Dynamics

Bardienus P. Duisterhof, Kaifeng Zhang, Adam Hung, Bowen Wen, Stan Birchfield 외 3명

PointZero는 로봇 행동(action) 레이블 없이 전이 가능한 3D 역학(dynamics)을 학습하기 위한 사전학습 목표로 3D 포인트 트랙 완성을 제안한다. 단일 RGB-D 관측과 희소한 부분 3D 궤적을 입력받아 관측된 모든 포인트의 미래 3D 트랙을 예측하며, 로봇 데이터 없이도 웹 동영상을 학습에 활용할 수 있다. 연구팀은 변형 가능한 물체, 관절형 물체, 강체를 포괄하는 290만 프레임 규모의 합성 데이터셋을 구축해 트랜스포머 기반 PointZero를 사전학습했다. 행동 조건부 3D 역학 예측에서 PGND 벤치마크 기준선을 상회하며, 모방학습(imitation learning)에서는 7개의 시뮬레이션·실세계 로봇 조작 태스크 중 6개에서 기준선과 동등하거나 이를 웃돈다.