본문으로 건너뛰기

PAPERS

논문 트래커

arXiv cs.RO 신규 논문을 매일 수집해 한국어 요약을 붙입니다. 학회 채택 정보는 저자 코멘트에서 자동으로 추출합니다.

473건학회 채택 1건
Rafael Minguet Delgado / Pexels
2609.30127v1

Riemannian MeanFlow: 액션 매니폴드에서의 빠른 시각운동 정책 학습

Faster Visuomotor Policy Learning on Action Manifolds via Riemannian MeanFlow

S. Talha Bukhari, Austin Garrett, Yi Wei, Ruiqi Ni, Zachary Kingston 외 1명

확산(diffusion) 및 플로우 매칭(flow matching) 기반 시각운동 정책(visuomotor policy)은 행동 시퀀스의 다중 모드 분포를 표현할 수 있으나, 행동 생성 시 벡터 필드의 다단계 수치 적분이 필요해 실시간 제어에 병목이 된다. 로봇 행동 시퀀스는 매끄럽고 미분 가능한 다양체(manifold) 위에 정의되므로, 학습된 정책이 행동 공간의 내재적 기하 구조를 반영해야 한다는 과제도 있다. 이 논문은 리만 조건부 플로우 매칭(Riemannian Conditional Flow Matching) 앵커에 기반한 플로우 맵 일관성 목적함수를 통해 RMFP를 제안한다. RMFP는 단 한 번의 신경망 함수 평가(NFE)만으로 다양체 위에서 행동 시퀀스를 생성할 수 있다. 구형 LASA, Push-T, Robomimic의 Tool Hang·Transport 과제, Franka Kitchen 과제 및 실제 로봇 조작 실험에서 기존 방법과 경쟁적인 성능을 낮은 샘플링 비용으로 달성하였다.

Kindel Media / Pexels
2609.30092v1

강건한 로봇 배포를 위한 Self-Adaptive VLA

Self-Adaptive VLA for Robust Robot Deployment

Hongxin Zhang, Chunru Lin, Tsun-Hsuan Wang, Zhenjia Xu, Chuang Gan

시각-언어-행동 모델(VLA)은 메모리가 없는 특성상 마모나 캘리브레이션 오차 같은 하드웨어 변화에 취약하며, 현장 재캘리브레이션 없이 적응하는 것이 실용화의 병목으로 지적된다. 이 연구는 Self-Adaptive VLA를 제안하며, 의도적으로 주입된 하드웨어 변화 하에서 수집한 롤아웃을 컨텍스트로 삼아 배포 시점에 정책이 반복적으로 자기 적응하는 사후 학습(post-training) 기법이다. 경량 플러그인 컨텍스트 인코더가 시각 관찰·고유감각(proprioception)·행동을 잠재 컨텍스트 토큰으로 압축하고, 이 토큰이 적응형 레이어 정규화(AdaLN)를 통해 정책을 조절한다. 컨텍스트 토큰을 앙상블하면 정책이 실패를 단계별로 자기 수정할 수 있다. 4개의 정밀도 민감 양팔·정교 조작 과제 실험에서 구동 바이어스 및 조인트 엔코더 오프셋 조건 하에 기본 정책 성능의 80% 이상을 회복하는 것으로 나타났다.

Tara Winstead / Pexels
2609.30082v1

전체 손 정교한 파악을 위한 실시간 힘 조절

Real-Time Force Regulation for Whole-Hand Dexterous Grasping

Sang Min Kim, Alexander Alexiev, Tzu-Yuan Lin, Sangbae Kim, Young Min Kim 외 1명

이 논문은 전체 손(whole-hand)에 걸쳐 동적으로 변화하는 접촉에 대한 실시간 힘 조절(force regulation) 프레임워크를 제시한다. 추적된 물체 모델과 자기수용감각(proprioception)을 이용해 촉각 센서 없이 모든 손 링크의 접촉을 기하학적으로 추정하고, 마찰·구동기·구동 일관성 제약을 반영한 접촉력 분포를 반복적으로 재계산한다. 이 힘 조절 제어기는 반응형 도달 동작과 통합되어 파악 획득, 외란 하 유지, 물체 손실 후 재파악을 지원한다. 무중력 시뮬레이션 실험에서 고정 힘 배분 및 손끝 전용 실행 방식 대비 파악 유지 성능이 향상되는 것으로 나타났다. 27자유도 팔-손 시스템에서의 실제 실험에서는 사람이 가하는 외란 아래 접촉이 전체 손에 걸쳐 변화하는 상황에서도 파악 유지와 복구가 확인되었다.

Wesley Pribadi / Unsplash
2609.30056v1

M3GD: 카메라-LiDAR 새로운 시점 합성을 위한 다중 모달·다중 뷰 기하 확산

M3GD: Multi-Modal Multi-View Geometric Diffusion for Camera--LiDAR Novel View Synthesis

Yang Zhou, Jiuhong Xiao, Shizhao Ye, Long Quang, Carlos Nieto-Granda 외 1명

M3GD는 로봇 플랫폼의 새로운 시점 합성(Novel View Synthesis, NVS)을 위해 카메라와 LiDAR를 결합한 다중 모달 표현 방식이다. 별도의 교차 모달 변환기 사전 학습 없이, 독립적으로 사전 학습된 2D 이미지 기반 모델과 3D 포인트 클라우드(point-cloud) 기반 모델을 조합한다. 카메라 투영 이후 동결된 LiDAR 특징과 이미지 특징이 공간 구조를 공유한다는 점을 활용해, 경량 잔차 어댑터를 통해 다중 뷰 플로우 매칭(flow-matching) 생성기에 LiDAR 정보를 주입하며, 생성기의 잠재 공간·디코더·학습 목표는 그대로 유지한다. GrandTour 데이터셋 실험에서 동일 백본의 이미지 단독 버전 대비 목표 시점 RGB 및 깊이 합성 성능이 향상되었다. 지상 로봇에 배포해 실제 환경에서 동작을 확인했으며, 오일러 적분 스텝 수로 품질과 연산 비용을 조절할 수 있다.

cottonbro studio / Pexels
2609.30036v1

가까이 조준해 멀리 도달하라: 고정된 월드 모델은 생각보다 계획을 잘 한다

Aim Short to Reach Far: Your Frozen World Model Can Plan Better Than You Think

Xvyuan Liu, Jianjie Fang, Chen Gao, Yong Li

시각적 월드 모델(visual world model) 기반 플래너는 예측 결과를 목표 이미지와의 거리로 평가하는데, 이 방식이 제어 성능을 제한할 수 있음을 보인다. 목표 도달 경로가 초반에 목표와 멀어지는 행동을 요구하는 경우, 최종 목표 이미지를 직접 점수 기준으로 삼으면 최적 단기 탐색을 수행하더라도 실패할 수 있다. 이를 해결하기 위해 Anchored Planning을 제안한다. 이 방법은 현재 관측과 목표 관측에 유사한 시작·끝을 가진 기록 구간을 검색하고, 그 시작 직후 관측을 중간 목표로 삼아 행동을 평가한다. 추가 학습 없이 고정된 LeWM 모델에 적용한 결과, Cube·PushT·Reacher·TwoRoom 모든 태스크의 장거리 평가에서 기존 LeWM 플래너를 상회하는 성능을 기록했다. 중간 목표의 위치(얼마나 앞을 바라볼지)와 실행 진행에 따른 검색 범위 축소가 성능에 중요한 요소로 나타났다.

Andrey Matveev / Pexels
2609.28467v1

어디에 합류할까? 언어 기반 목표 예측을 통한 로봇 집단 합류

Where Should I Join? Robot Group Joining via Language-Guided Goal Prediction

Zilin Fang, Zishuo Wang, Gim Hee Lee, David Hsu

소셜 내비게이션(social navigation)은 목적지가 주어진 상태에서 사회적 규범을 지키며 이동하는 데 초점을 맞추지만, 이 연구는 자연어 설명만으로 로봇이 사람 집단에 합류할 위치를 예측하는 문제를 다룬다. 연구팀은 재귀적 스펙트럼 분할(recursive spectral partitioning)로 후보 집단 부분집합을 생성하고, 언어 조건부 이미지-기하 모델로 대상 집단을 식별하는 방식을 제안한다. 식별된 집단에 대해 인간 대형(formation) 사전 지식을 활용한 목표 예측기가 로봇 합류 자세 후보를 다모달 에너지-방향 맵(energy-orientation map) 형태로 출력한다. 대화·줄서기·청중 등 다양한 집단 유형과 규모에 걸친 실험에서 서브초(sub-second) 추론 속도로 모든 베이스라인을 능가하는 합류 자세 예측 성능을 보였다. 실제 로봇을 이용한 실험에서도 정적·동적 상호작용 환경에서 집단 합류가 가능함을 확인했다.

Chethana Muniswamygowda / Unsplash
2609.28431v1

LiMA: 비동기 확산을 통한 장기 상상과 실시간 정밀 조작의 연결

LiMA: Bridging Long-term Imagination to Real-time Dexterous Manipulation via Asynchronous Diffusion

Ning Chen, Yankai Fu, Junkai Zhao, Qianpu Sun, Guocai Yao 외 3명

LiMA는 시각-언어-행동 모델(VLA)의 고수준 추론과 세계-행동 모델(WAM)의 반응 제어를 결합하기 위해 설계된 비동기 이중 시스템 생성 프레임워크다. 느린 시스템이 희소한 장기 시공간 의도 생성을 맡고, 빠른 시스템이 고주파 모션 정제를 수행하는 다중 스케일 계층 구조로 구성된다. 희소한 의도 예측과 밀도 높은 행동 궤적 사이의 정렬을 위해 잠재 슈뢰딩거 브릿지 결합(Latent Schrödinger Bridge Coupling) 메커니즘을 도입해 정제 과정을 엔트로피 정규화 확률 수송 문제로 정식화한다. Cosmos-Policy 대비 추론 지연(inference latency)을 45.8% 줄였으며, 여섯 가지 양팔 정밀 조작 과제에서 전체 성공률 70.8%, 평균 서브태스크 성공률 78.9%를 기록했다.

Harrun Muhammad / Pexels
2609.28429v1CoRL

Watch, Recall, Act: 동시 구현 스트림 속 상시 가동 로봇

Watch, Recall, Act: Always-On Robots in Concurrent Embodied Streams

Ding Yi, Peiwen Sun, Chenchu Rong, Jianan Wang, Xili Dai 외 2명

ARMS(Always-on Robot in Multi-modal Streams)는 지시가 수시로 도착하고 장면이 계속 변하는 개방형 환경에서 동작하는 로봇을 위한 스트리밍 정책(streaming policy)이다. 사전 학습된 π0.5 백본에 세 가지 경량 모듈을 추가해 실시간 인식, 구현 상태(embodied states), 로봇 자신의 과거 행동을 백본이 참조할 맥락 정보로 변환한다. 세 모듈은 비동기적으로 맥락을 갱신하므로 인식·회상 과정이 행동을 지연시키지 않으며, 두 팔이 동시에 독립적으로 작동한다. 실제 양팔 원격조작 데이터에서 구성한 ARMS Dataset으로 학습한 결과, 복합 과제 성공률 45%를 기록해 비교 기준 모델 중 최고치인 28%를 상회했다. 절제 실험(ablation)으로 메모리 모듈, 구현 상태 헤드, 비동기 병렬성 각각이 성능에 필수적임을 확인했다.

jose aljovin / Unsplash
2609.28427v1

외골격 로봇 개인화를 위한 Context-Continuous Preference Learning

Context-Continuous Preference Learning for Exoskeleton Personalization

Sunin Baek, Sungwoo Park, Daekyum Kim

외골격 로봇의 보조 설정을 사용자에게 맞추려면 다양한 운동 조건에서 피드백을 수집해야 하나, 이에 드는 시간과 신체적 부담이 크다. 이 논문은 인접한 운동 조건 간 선호도 관측치를 공유하면서 조건별 효용 추정은 유지하는 가우시안 과정(Gaussian process) 기반 선호 모델 CCPL을 제안한다. 건강한 성인 9명의 발목·팔꿈치 외골격 선호도 데이터를 활용한 시뮬레이션 및 후향적 분석에서, CCPL은 독립 학습 대비 발목 보조의 재구성 상관계수를 0.644에서 0.720으로, 팔꿈치 보조를 0.476에서 0.526으로 향상시켰다. 동일 정확도를 달성하는 데 필요한 피드백 횟수는 발목 기준 약 37%, 팔꿈치 기준 약 17% 감소한 것으로 나타났다. 다만 선호도의 맥락 연속성이 약할 경우 부정적 전이(negative transfer)가 발생할 수 있으며, 실제 온라인 개인화에서의 효과는 추가 검증이 필요하다고 저자들은 밝혔다.

ThisisEngineering / Unsplash
2609.28414v1

Frozen Flows Forget: 잠재 흐름 월드 모델에서 손실된 모션의 진단과 복원

Frozen Flows Forget: Diagnosing and Restoring Lost Motion in a Latent-flow World Model

Xiwen Chen, Rigaudiere Z. Li, Zhiruo Zhou, Xiaojun Zhu, Houde Liu

동결된 자기지도(self-supervised) 잠재 공간에 흐름(flow)을 통합한 잠재 월드 모델(latent world model)은 안정적으로 학습되지만, 조작(manipulation) 과제에서 모션(motion) 정보를 암묵적으로 손실하는 문제가 있다. 사전 학습된 흐름은 조작 대상 객체를 실제로 이동시키지 못하며, 잠재 손실만으로 재학습하면 정지 현상 대신 순간이동식 움직임이 나타난다. 연구진은 이 실패 원인이 표현(representation) 자체가 아니라 앵커가 희소한 잠재 전용 훈련 신호에 있다고 추적했다. DART(Decode-Augmented Rollout Training)는 표현을 동결한 채 디코딩 경로 지도 학습으로 흐름만 재학습해 모션의 시간 구조를 복원하며, 대규모 실험에서 오라클 기반 보간 참조값과의 나머지 격차를 절반 가까이 좁혔다. 아울러 픽셀 오류 단독 평가가 동결 예측에 보상을 줄 수 있다는 평가 지표의 맹점도 함께 보고된다.

Michael Myers / Unsplash
2609.28396v1

시공간 튜브 보상을 활용한 신호 시간 논리 전체 명세 클래스의 효율적 강화학습

Tractable Reinforcement Learning for Full Class of Signal Temporal Logic Specifications Using Spatiotemporal Tube Reward

Vaishnavi Jagabathula, P Sangeerth, Pushpak Jagtap

이 논문은 미지의 동역학과 엄격한 액추에이터 제한 하에서 비홀로노믹(non-holonomic) 및 부족 구동(underactuated) 로봇 플랫폼이 신호 시간 논리(Signal Temporal Logic, STL) 명세를 만족하도록 하는 제어 문제를 다룬다. 기존 분석적 시공간 튜브(Spatiotemporal Tube, STT) 컨트롤러는 입력 제약 조건 적용이 어렵고, 기존 강화학습 방법은 상태 이력에 의존해 메모리 부담이 크다는 한계가 있다. 제안 프레임워크는 STL의 논리적·시간적 복잡성을 시변 기하학적 경계로 변환하고, 상태 공간에 시간 정보를 추가하여 연속적인 기하 인식 보상 함수로 시간 인식 Soft Actor-Critic(SAC) 에이전트를 훈련한다. 이 방법은 실행 중 복잡한 논리 의미론을 명시적으로 평가하지 않아도 되며, 상태 이력 없이 입력 제약을 준수하는 연속 제어 정책을 학습할 수 있다.

Yaroslav Shuraev / Pexels
2609.28393v1

PointCast: 강체·관절체·변형체 조작을 위한 단일 세계 모델

PointCast: One World Model for Rigid, Articulated, and Deformable Object Manipulation

Hantao Ye, Ross Worobel, Zhuoli Xie, Mingen Li, Houjian Yu 외 2명

PointCast는 강체, 관절 객체, 변형 가능 객체 조작을 단일 아키텍처로 처리하는 포인트 집합 기반 세계 모델(world model)이다. 객체와 엔드이펙터(end-effector)의 3D 포인트 집합으로 상태를 표현하며, 메시나 위상 구조에 의존하지 않고 각 포인트의 궤적을 개별 감독한다. 백본은 확산 트랜스포머(diffusion transformer)로, 파라미터 수 1,980만 개의 단일 구조가 강체·천·로프·다관절 캐비닛 네 가지 환경을 각각의 체크포인트로 다룬다. 무작위화 시뮬레이션 학습 후 네 환경 중 세 곳에서 비교 기준 모델을 앞섰으며, 실제 로봇 원격 조작 데이터셋에서는 6개 카테고리 중 4개에서 가장 낮은 평균 오차를 기록하고 나머지 두 카테고리에서도 2위를 차지했다. 샘플링 기반 모델 예측 제어(MPC)에 통합해 시뮬레이션 4개 과제를 64 에피소드에 걸쳐 계획했을 때 비교 모델들과 동등하거나 높은 성능을 보였다.

Ramaz Bluashvili / Pexels
2609.28378v1

ForgetMimic: 강화학습 휴머노이드 제어를 위한 모션 언러닝

ForgetMimic: Motion Unlearning for Reinforcement Learning Humanoid Control

Xukun Luan, Zhongxiang Lei, Chen Gong, Shaowei Li, Yuanguo Bi 외 1명

인간 시연 데이터로 훈련된 강화학습(RL) 기반 휴머노이드 제어 정책에서 특정 모션을 선택적으로 제거하는 방법인 ForgetMimic을 제안한다. 이 방법은 N개 모션으로 훈련된 정책 π_θ에서 K개 대상 모션의 성능만 저하시키되 나머지 N-K개 모션의 성능은 그대로 유지하는 구조로 설계됐다. 악의적·오염된 모션 제거와 GDPR의 '잊혀질 권리' 규정 준수가 주요 개발 동기로 제시된다. 연구팀은 로봇 제어 환경에서 언러닝 실패를 유발하는 두 가지 핵심 훈련 메커니즘을 규명하고 이를 해결했다. Unitree G1 및 H2 휴머노이드 로봇에서 댄스·격투·플립 등 12개 모션을 대상으로 실험한 결과, 지정 모션은 제거되고 나머지 모션은 정상 작동함을 확인했다.

Daniel Miksha / Unsplash
2609.28377v1

Amplify: 로봇공학의 재현 가능한 비선형 프로그래밍 문제를 위한 경량 라이브러리

Amplify: A Lightweight Library for Reproducible Nonlinear Programming Problems in Robotics

Nelson Rosa

Amplify는 로봇 궤적 최적화(trajectory optimization) 문제의 재현성 확보를 목표로 개발된 경량 비선형 프로그래밍(nonlinear programming) 라이브러리다. 전체 코드는 537줄(한 줄 80자)로 구성되며, AMPL 모델링 언어와 텍스트 편집기만 있으면 실행할 수 있다. 핵심 설계 원칙은 동역학 계산·궤적 생성·참조 모션 알고리즘을 최적화 모델의 제약 조건으로 직접 표현하는 선언형 프로그래밍(declarative programming) 패러다임이다. 논문은 이 설계 방식이 재현성을 추구하는 다른 전사(transcription) 라이브러리에도 적용 가능함을 설명한다. 이족 보행(bipedal locomotion)과 파지 계획(grasp planning)을 포함한 벤치마크 최적화 문제에서 기존 3개 라이브러리와 비교 실험을 수행하였다.

Brad / Unsplash
2609.28364v1

LEAP-CBF: 최소 노력 적대적 포텐셜을 활용한 불확실 시스템의 안전 필터

LEAP-CBF: A Safety Filter for Uncertain Systems with Least-Effort Adversarial Potentials

Oswin So, Eric Yu, Chuchu Fan

제어 장벽 함수(CBF, Control Barrier Function)는 비선형 동적 시스템의 안전을 보장하는 안전 필터로 널리 쓰이지만, 외란과 불확실성이 존재할 때 로버스트 CBF 설계는 어렵고 과도하게 보수적인 결과를 낳기 쉽다. 이 연구는 외란이 시스템 실패를 유발하는 데 필요한 '노력(effort)'으로 현재 상태의 강건성을 정량화하는 인증서인 최소 노력 적대적 포텐셜(LEAP, Least-Effort Adversarial Potentials)을 제안한다. LEAP는 외란 없는 시스템에서 CBF로 동작하며, 누적 노력이 유계(bounded)인 외란에 강건한 안전 필터 구성에도 활용된다. LEAP 생성에는 온-폴리시 심층 강화학습(deep reinforcement learning) 기반 방법이 사용된다. 외란이 존재하는 다중 에이전트 시스템 시뮬레이션과 쿼드루페드(quadruped) 및 쿼드로터(quadrotor) 하드웨어 실험을 통해 방법의 유효성을 확인하였다.

cottonbro studio / Pexels
2609.28360v1

고해상도 깊이와 초저해상도 RGB를 활용한 프라이버시 보존 시맨틱 분할

Privacy-Preserving Semantic Segmentation from High-Resolution Depth and Ultra-Low-Resolution RGB

Xuying Huang, Swithinraj Moses Daniel, Sicong Pan, Sebastian Houben, Maren Bennewitz

모바일 로봇의 탑재 카메라로 인한 프라이버시 우려를 줄이기 위해, 고해상도(HR) 깊이(depth)와 초저해상도(ULR) RGB를 결합한 비대칭 감지 설정을 제안한다. 이 설정은 밀도 높은 기하 정보를 유지하면서 세부 시각 정보를 원천에서 제한한다. HR 기하 정보로 의미론적 RGB 재구성을 유도하고 RGB-D 분할을 수행하는 공동 2D 프레임워크를 설계하였으며, 장면 수준의 일관된 이해를 위해 2D 의미론적 특징을 3D 분할로 통합하는 종단간(end-to-end) 파이프라인도 함께 개발하였다. ScanNet 데이터셋 실험에서 프라이버시 보존 방식 중 가장 높은 2D·3D 분할 성능을 기록하였고, SUN RGB-D 및 SceneNN으로의 제로샷(zero-shot) 전이에서도 가장 우수한 결과를 보였다. 실제 로봇 실험에서는 생성된 3D 의미론적 맵이 객체 목표 탐색(object-goal navigation)에 활용 가능함을 확인하였다.

Werner Pfennig / Pexels
2609.28339v1

미래 예측을 넘어서: 로봇 제어를 위한 생성적 적응으로서의 디노이징

Beyond Future Prediction: Denoising as Generative Adaptation for Robot Control

Zanyi Wang, Yuheng Lei, Dengyang Jiang, Ping Luo, Mengdi Wang 외 2명

사전 학습된 생성형 확산 트랜스포머(Diffusion Transformer, DiT)를 로봇 제어에 전이할 때 미래 시각 예측이 반드시 필요한지를 검토한 연구다. 저자들은 NowWAM이라는 미래 타깃 없는 공동 학습(co-training) 방식을 제안하며, 현재 관측을 디노이징하는 동시에 로봇 행동을 예측하는 단일 시각 스트림 구조를 택한다. 통제된 비교 실험에서 과거·미래 시각 타깃의 성능은 유사했으나, 디노이징 궤적 없이 클린 엔드포인트만 사용하면 견고성이 크게 낮아졌다. LIBERO-Plus 벤치마크에서 FLUX2-Klein 백본 기준 87.7% 성공률을 기록했으며, 이는 미래 타깃 공동 학습 기준선 대비 6.1포인트 향상이다. 훈련 시각 토큰 수를 784에서 392로 절반으로 줄이고 스텝 시간을 2.85초에서 1.63초로 단축해 1.8배 속도 향상도 확인했다.

Steve A Johnson / Unsplash
2609.28325v1

모델 예측 경로 적분 제어를 위한 운동뉴런 모방 샘플링

Motoneuron-Inspired Sampling for Model Predictive Path Integral Control

Alexis Poignant, Jan Babič

모델 예측 경로 적분(MPPI, Model Predictive Path Integral) 제어는 확률적 궤적 샘플링에 의존하며, 제한된 롤아웃 예산 조건에서 제안 분포의 구조가 성능을 좌우한다. 이 논문은 운동뉴런(motoneuron) 동역학을 단순화한 모델로 시간적으로 구조화된 교란을 생성하는 Spike-MPPI를 제안한다. Spike-MPPI는 토크 구동 및 길항 구동 MuJoCo Ant 모델에서 표준 가우시안 샘플링과 스펙트럼 매칭 가우시안 기법에 비교 평가되었다. 구조화된 샘플링은 실행 제어의 부드러움(smoothness)을 크게 향상시켰으나, 과제 성능에 대한 효과는 롤아웃 조건과 구동 방식에 따라 달라지는 것으로 나타났다. 스펙트럼 매칭이 관찰 거동의 상당 부분을 재현하는 반면, 완전한 Spike 제안은 2차 스펙트럼 구조를 넘어선 추가적인 효과를 보였다.

Yaroslav Shuraev / Pexels
2609.28317v1

소셜 로봇 중재를 위한 멀티모달 음성 활동 예측: 기대 동작과 배포 제약

Multimodal Voice Activity Projection for Social Robot Mediation: Expected Behavior and Deployment Constraints

Antonio Cano, Guillermo Perez, Luis Merino, Randy Gomez

이 논문은 인간-인간 상호작용의 중재자 역할을 하는 소셜 로봇을 위한 발화 차례 교대(turn-taking) 예측 프레임워크를 제안한다. 멀티모달 음성 활동 예측(MM-VAP, Multimodal Voice Activity Projection) 모델은 동기화된 오디오-비주얼 증거로부터 대화 흐름의 미래 변화를 추정하며, Hold·Shift·Backchannel 예측 등 차례 교대 이벤트를 도출한다. 모델은 사전 학습된 오디오-비주얼 인코더, LoRA 적응(adaptation), 화자 간 어텐션(inter-speaker attention), 미래 음성 활동 예측 기반 제로샷(zero-shot) 이벤트 추론을 활용한다. NoXi, NoXi+J, Haru EDR 데이터셋 실험에서 시선 준비·적극적 청취·보수적 개입과 연결 가능한 발화권 관리 이벤트에 대해 방식의 타당성을 확인한다. 또한 실시간 추론, 전처리 지연, 멀티모달 동기화, 입력 품질 모니터링 등 실제 배포 시 주요 제약 조건을 함께 논의한다.

Sebastian Fränkle / Unsplash
2609.28314v1

TANDEM: 효율적인 시각-언어-행동 모델 파인튜닝을 위한 필요 시 시연 기반 태스크·모션 계획

TANDEM: Task and Motion Planning with As-Needed Demonstrations for Efficient Vision-Language-Action Model Fine-tuning

Samrat Sahoo, Liang Ji, Tom Silver, Yixuan Huang

TANDEM은 태스크·모션 계획(TAMP)과 선택적 인간 원격 조작을 결합하여, 계획기가 처리하지 못하는 단계에서만 사람의 시연을 수집하는 시스템이다. 사전 학습된 시각-언어 모델(VLM)을 활용해 누락된 술어(predicate)와 인간 실행 연산자를 계획 도메인에 동적으로 추가하며, 자율 실행 단계와 인간 개입 단계를 언어 지시·시각 관측에 기반해 교차 수행한다. 각 인간 개입 단계 종료 후 장면을 재인식하여 의도된 효과가 달성되었는지 확인한 뒤 자율 계획을 재개한다. 동일한 인간 개입 시간 기준으로 TANDEM은 전체 태스크 원격 조작 대비 2.9배 많은 시연 데이터를 수집하는 것으로 나타났다. 태스크당 20개의 TANDEM 시연으로 π_0.5-DROID 모델을 파인튜닝한 결과, 5개 장기 조작 태스크의 평균 성공률이 0%에서 60%로 향상되었다.