본문으로 건너뛰기

PAPERS

논문 트래커

arXiv cs.RO 신규 논문을 매일 수집해 한국어 요약을 붙입니다. 학회 채택 정보는 저자 코멘트에서 자동으로 추출합니다.

473건학회 채택 2건
Mikhail Nilov / Pexels
2609.19138v1

VLM 에이전트를 활용한 인-컨텍스트 로봇 학습

In-Context Robot Learning with VLM Agents

Dongzhou Cheng, Taoran Yi, Ye Fang, Xingwu Zhang, Fan Feng 외 10명

기존 로봇 정책은 새로운 환경에서 맥락 정보만으로 즉시 적응하는 인-컨텍스트 학습(in-context learning, ICL)을 수행하기 어렵다. 이 연구는 GPT-6 Astra 등 상용 시각-언어 모델(vision-language model, VLM)을 활용한 범용 에이전트 프레임워크 GPT-Policy를 제안한다. GPT-Policy는 과제 관련 시각적 전이를 보존하는 컨텍스트 컴파일러, 행동을 제안하는 VLM, 각 행동을 검증·실행하고 결과를 보고하는 제약 제어기(constrained controller)로 구성된다. 실로봇 실험에서 사람의 시연 영상은 로봇 행동 레이블 없이도 과제 완료율을 향상시켰으며, 정렬된 행동 참조를 추가하면 접촉 민감 과제에서 추가 성능 향상이 나타났다. 이 프레임워크는 그래디언트 업데이트나 과제 특화 파라미터 변경 없이 VLM의 범용 역량을 물리적 행동으로 전환하는 경험적 기반을 제시한다.

Pavel Danilyuk / Pexels
2609.19137v1

접촉 소리를 꿈꾸다: 비디오·오디오 생성을 활용한 제로샷 힘 인식 조작 및 데이터 생성

Dreaming the Sound of Contact: Leveraging Video and Audio Generation for Zero-Shot Force-Aware Manipulation and Data Generation

Guanhua Ji, Tianyu Li, Dayoon Suh, Yuqian Zhang, Boyan Zhang 외 1명

비디오 생성 기반 로봇 조작 방식은 운동학적(kinematic) 궤적만 제공하고 힘 정보를 포함하지 않아, 적절한 접촉력이 필요한 작업에서 실패하는 문제가 있다. 이 연구는 생성된 접촉 소리의 음량(loudness)을 이용해 시간에 따라 변화하는 목표 힘 프로파일을 구성하는 방법을 제안한다. 자연어 프롬프트를 입력으로 받아 비디오와 오디오를 동시에 생성하고, 이로부터 운동 궤적과 힘 프로파일을 함께 도출하는 파이프라인을 구성하였다. Franka Panda 로봇에서 폐루프(closed-loop) 힘 조절기를 통해 오디오 기반 힘 프로파일을 추종하도록 실행하였으며, 운동학 전용 기준 방법이 실패하는 접촉 작업에서 성공적인 조작을 달성하였다. 동일 파이프라인을 데이터 생성 엔진으로도 활용하여, 폐루프 방식으로 작업을 수행하는 정책을 학습시켰다.

Opt Lasers from Poland / Pexels
2609.19104v1

rMuscle: 효율적인 시각-언어-행동 모델 추론을 위한 로봇 근육 기억

rMuscle: Robotic Muscle Memory for Efficient Vision-Language-Action Model Inference

Kaijun Zhou, Zhiyang Li, Le Chen, Jinyu Gu

rMuscle은 반복적인 공장 작업에 투입된 로봇의 시각-언어-행동 모델(VLA) 추론 지연을 줄이기 위한 실시간 추론 프레임워크다. 이 연구는 동일 과제의 반복 실행 간에 관측값·행동 궤적뿐 아니라 내부 모델 상태에서도 높은 유사성이 존재함을 실증하고, 이를 이중 단계 근육 기억 캐시(muscle-memory cache)로 활용한다. Context Cache는 시각 토큰 출력을 재사용해 연산량을 줄이고, Action Cache는 뉴런 활성화 패턴을 재사용해 가중치 접근 횟수를 낮춘다. 캐시 메모리 사용량과 오버헤드를 관리하기 위해 온라인 캐시 재계산, 슬라이딩 윈도우 검색, 연속 디노이징 단계 간 마스크 공유를 적용한다. LIBERO·RoboTwin 벤치마크 및 실물 조작 과제에서 RTX 4090과 Jetson Thor 기준 1.29~1.42배 속도 향상을 달성하면서 기존 성공률을 유지한다고 보고한다.

cottonbro studio / Pexels
2609.19080v1

ElastiQP: 제약 조건 로봇 제어를 위한 항상 실현 가능한 QP 솔버

ElastiQP: An Always-Feasible QP Solver for Constrained Robot Control

Daniel Morton, Jon Arrizabalaga, Zachary Manchester, Marco Pavone

이차계획법(QP, Quadratic Programming) 기반 컨트롤러는 제약 조건이 늘어날수록 순간적인 충돌이 발생할 수 있으며, 이때 솔버가 '비실현 가능(infeasible)' 상태를 반환하면 컨트롤러가 실행할 명령이 없어지는 문제가 생긴다. ElastiQP는 이중 활성 집합(dual active-set) 방식을 수정한 QP 솔버로, 등식 제약(동역학)은 엄격히 유지하면서 모든 부등식 제약을 제약 조건별 정확한 l1 패널티로 완화한다. 슬랙 변수를 분석적으로 솔버 내부에 통합해 압축 선형 시스템의 크기를 일정하게 유지함으로써 계산 비용 증가를 막는다. 로봇 제어 벤치마크에서 마이크로초 수준의 성능을 달성하며, 실현 가능한 문제에서는 최신 솔버와 동등한 성능을 보였다. 비실현 가능 문제에서는 위반을 충돌하는 부등식 항에만 국한하며, 최선의 대안 솔버 대비 최대 40배 빠르게 사용 가능한 해를 반환한다고 연구팀은 보고한다.

Pavel Danilyuk / Pexels
2609.18930v1

이족 이동 매니퓰레이터를 이용한 전신 이동-조작 통합 학습

Learning Holistic Whole-Body Loco-Manipulation with a Bipedal Mobile Manipulator

Zhongyu Chen, Yuxuan Nai, Qian Chen, Yidong Zhu, Chen Jing 외 6명

이족 보행 로봇이 다리와 팔을 협조시켜 팔의 기본 작업 공간을 넘어서는 이동-조작(loco-manipulation)을 수행하려면 균형을 유지하면서 조작 목표를 전신 동작으로 변환하는 저수준 제어기가 필요하다. 연구팀은 강화학습(reinforcement learning)으로 훈련된 통합 전신 제어기를 제안하며, 6자유도(DoF) 엔드이펙터 목표를 이족 베이스와 로봇 팔의 협조 동작으로 직접 매핑한다. 베이스 속도나 발걸음 명령 없이 엔드이펙터 목표만 주어지면 도달, 자세 적응, 발 내딛기를 자율적으로 조율한다. 학습 중 엔드이펙터 추적·이동·균형 간 균형을 조절하는 보상 게이팅(reward-gating) 전략과, 윈도우 트랜스포머 인코딩·순환 GRU 메모리·보조 동역학 예측을 결합한 시간적 맥락 추정기(temporal context estimator)를 도입했다. 실제 로봇 실험에서 VR 텔레오퍼레이션, 학습된 확산 정책(diffusion policy), 스크립트 궤적 등 다양한 상위 명령 소스 모두에서 동일한 제어기가 작동함을 확인했다.

EnCata PD / Unsplash
2609.18910v1

CaSCo: 연쇄 충돌 인식 소프트-충돌 동작 계획

CaSCo: Cascade-Aware Soft-Collision Motion Planning

Shivaram Kumar, Gaoyuan Liu, Yoonchang Sung

CaSCo는 충돌을 이진 제약이 아닌 의미적 위험도로 처리하는 동작 계획(motion planning) 프레임워크다. 시각-언어 모델(VLM) 또는 언어 모델이 각 물체에 의미적 위험도를 부여하고, 물리 시뮬레이터가 후보 동작의 결과를 예측한다. 로봇이 직접 접촉하거나 연쇄 충돌로 간접 이동시킨 물체의 총 의미적 위험도를 최소화하는 경로를 탐색하며, 충돌에 따른 환경 변화를 반영하고자 로드맵 상태에 예측된 물체 배치와 위험 발생 이력을 포함한다. 허용 가능하고 일관된 연쇄 완화 휴리스틱(cascade-relaxed heuristic)과 캐싱·가지치기 메커니즘을 갖춘 최적 그래프 탐색 알고리즘을 제안하며, 혼잡한 조작 환경과 실물 로봇에서 실험을 수행했다.

Compagnons / Unsplash
2609.18900v1IROS

가상 환경과 실제 환경에서의 인간-로봇 팀협업 간 인간 행동 차이 분석

Examining the Difference in Human Behavior Between Virtual and Real-World Human-Robot Teaming

Sean Dallas, Absalat Getachew, Motaz AbuHijleh, Andrea Macklem-Zabel, Douglas Zytko 외 2명

실세계 인간-로봇 팀협업(HRT) 시나리오를 직접 구성·평가하는 데는 비용이 크기 때문에, 가상 시뮬레이션이 사용자 연구의 대안으로 활용된다. 이 연구는 동일한 HRT 시나리오를 가상 환경과 실제 환경에서 각각 수행하고, 혼합 연구 방법(mixed methods)으로 팀 성과와 인간 요소(human factors)를 비교하였다. 정량 분석 결과, 두 환경 간 작업 부하(workload)에서 유의미한 차이가 나타났다. 정성 분석에서는 참가자들의 과제 전략, 로봇에 대한 심적 모델(mental model), 신뢰의 유형이 환경에 따라 다르게 나타났다.

Vanessa Loring / Pexels
2609.18893v1

SOL-SLAM: 빠른 소나 단독 로컬 SLAM을 위한 역합성 Gauss-Newton 직접 정합

SOL-SLAM: Inverse Compositional Gauss-Newton Direct Registration for Fast Sonar-Only Local SLAM

Kalvik Jakkala, Jason O'Kane

SOL-SLAM은 전방향 소나(Forward-Looking Sonar, FLS)만을 사용하는 수중 로컬 동시 위치추정 및 지도 작성(SLAM) 시스템이다. 기존의 희소 특징점(sparse keypoint) 기반 방법 대신, 소나 강도 스캔 전체를 재귀적으로 갱신되는 로컬 맵에 정렬하는 밀집 직접 정합(dense direct registration) 방식을 채택한다. 역합성 Gauss-Newton 최적화를 통해 실시간 처리가 가능하며, 넓은 변위 구간에서도 1미터 이하의 안정적인 추적 정밀도를 유지한다. 희소 키포인트 기준선 대비 병진 오차에서 유의미한 개선을 보였고, FLS·DVL·IMU를 결합한 다중 센서 융합 파이프라인과 유사한 오도메트리 성능을 나타냈다. AUV(자율수중차량) 현장 실험을 통해 임베디드 제한 컴퓨팅 환경에서의 실기 적용 가능성을 검증하였다.

Mathew Schwartz / Unsplash
2609.18881v1

1인칭 시점 기반 시뮬레이션 공중 군집 로봇의 신체 동작 제어

Body-Motion Control of a Simulated Aerial Swarm from a First-Person View

Yang Chen, Darius Giannoli, Dario Floreano

본 연구는 공중 군집 로봇의 1인칭 시점(FPV) 원격 조종을 위한 상체 인터페이스를 제안한다. 해당 인터페이스는 몸통 기울기, 손 위치, 머리 회전을 5개의 연속 명령 차원에 매핑하며, 각 참가자별로 중립 자세와 동작 범위를 보정한다. 14명의 참가자가 시뮬레이션 환경에서 15기 군집을 3차원 장애물 코스로 조종하는 피험자 내 실험(within-subject study)을 수행했다. 신체 동작 제어는 기존 조종기 대비 완료 시간을 19.4%, 무게중심 이동 경로 길이를 7.0% 단축했으며, 경로 직진성도 향상되었다. 다만 게이트 통과 오차, 수집 성공률, 충돌 횟수, 전체 작업 부하, 사용성에서는 유의한 차이가 없었고, 모든 참가자가 신체 동작 제어 시 더 높은 신체적 부담을 보고했다.

Pavel Danilyuk / Pexels
2609.18869v1

KINO: 휴머노이드 로코-매니퓰레이션에서 VLM 계획과 전신 제어를 위한 키프레임 인터페이스

KINO: A Keyframe Interface for VLM Planning and Whole-Body Control in Humanoid Loco-Manipulation

Sitong Chen, Fatemeh Zargarbashi, Jin Cheng, Tianxu An, Stelian Coros

KINO는 휴머노이드 로코-매니퓰레이션(loco-manipulation)을 위한 계층적 프레임워크로, 시각-언어 모델(VLM) 계획과 강화학습(RL) 제어 사이에 모션 키프레임(motion keyframe)을 중간 표현으로 활용한다. VLM은 언어 지시·장면 관찰·실행 피드백을 바탕으로 사전 정의된 라이브러리에서 작업 관련 키프레임을 순차적으로 선택하고, 선택된 키프레임은 현재 장면의 물체 위치와 크기에 맞게 재타깃팅된다. 키프레임에 조건화된 전신 정책(whole-body policy)이 관절 수준의 행동을 생성하며, 희소한 VLM 키프레임 환경에서 현저성 기반(saliency-based) 키프레임 샘플링 전략을 적용해 종단 간 작업 성공률이 44%에서 92%로 향상됐다. 물체 집기·이동·배치 과제를 시뮬레이션과 Unitree G1 휴머노이드 실기 환경 모두에서 평가했으며, 한 손 및 두 손 조작을 수행하고 학습 참조 데이터 밖의 배치 위치에도 일반화됨을 확인했다.

ThisIsEngineering / Pexels
2609.18853v1

자유에너지 최소화를 통한 인간 피드백 기반 상호작용 조절을 향하여

Towards Interaction Regulation from Human Feedback via Free Energy Minimization

Maria Paula Diaz Monfort, Cinzia Tomaselli, Michael Richardson, Giovanni Russo

이 논문은 계산신경과학의 자유에너지 원리(free energy principle)에서 영감을 받아, 인간의 선호도를 자율 에이전트 정책에 온라인으로 통합하는 제어이론 프레임워크를 제안한다. 프레임워크는 개방형 제어 아키텍처로 구현되며, 온보드 센서로 주행하는 로버(rover)와 원격 인간 참여자를 결합한 인간 참여 루프(human-in-the-loop) 실험 환경에서 검증됐다. 원격 참여자는 가상현실(VR) 헤드셋을 통해 로버와 동일한 감각 정보를 공유하고, 제스처로 선호도를 전달한다. 실험은 에이전트 목표와 인간 선호 간 협력적·경쟁적 상호작용을 모두 포함하며, 두 경우 모두 상호작용이 제안된 프레임워크로 조절됨이 확인됐다.

Allan Rodrigues / Unsplash
2609.18819v1

SEAM: 궤적 변형 환경에서의 장기 LiDAR 매핑을 위한 서브맵 앵커 기반 증거 모델

SEAM: Submap-Anchored Evidence for Lifelong LiDAR Mapping under Trajectory Deformation

Kyuwon Kim

SEAM은 LiDAR 기반 장기(lifelong) 매핑 프레임워크로, 세션 전체를 단일 앵커에 의존하는 기존 방식 대신 서브맵 수준의 앵커로 최적화된 궤적을 기반으로 증거를 생성하고 동적 객체 제거 및 변화 탐지를 수행한다. 서브맵 수준 재투영(submap-level reprojection)을 통해, 이후 세션이 궤적을 수정하더라도 기존에 생성된 증거를 재사용할 수 있어 전체 과정을 처음부터 재계산할 필요가 없다. DOP(Dilution of Precision) 기반 신뢰도 지표를 적용해 기하학적으로 불안정한 세션 간 루프 엣지를 억제함으로써 정합 오차를 줄인다. 방향 인식 복셀 단위 증거 모델(directional voxel-wise evidence model)은 광선 방향에 따라 달라지는 점유 패턴을 반영해 동적 객체와 환경 변화를 더 정밀하게 구분한다. 실제 건설 현장 데이터셋과 장기 다중 세션 데이터셋 실험에서 기존 방법 대비 높은 정확도와 빠른 처리 속도를 달성했다고 저자들은 보고한다.

cottonbro studio / Pexels
2609.18813v1

점근적 최적 다중 로봇 태스크-모션 플래닝

Asymptotically Optimal Multi-Robot Task and Motion Planning

Thi Thuy Ngan Duong, Cheuk Tung Shadow Yiu, Rahul Shome, Yoonchang Sung

다중 로봇 태스크-모션 계획(MR-TAMP)은 여러 로봇이 상호작용하는 환경에서 이산적 태스크 결정과 연속적 충돌 회피 모션을 동시에 최적화해야 하는 문제다. 기존 단일 로봇 TAMP의 점근적 최적(asymptotically optimal) 알고리즘을 다중 로봇 환경으로 확장할 때, 태스크 전환마다 관여하는 로봇 부분집합이 달라져 복합 구성 공간(composite configuration space)의 제약 차원이 전환별로 다르다는 핵심 난제가 발생한다. 본 연구는 이 전환 구조를 형식화하고, 관련 전환의 지속적 탐색과 연결된 실행 가능 영역 내 모션 계획의 점진적 개선을 전역 점근 최적성의 충분 조건으로 제시한다. 제안 알고리즘은 개별 로봇 로드맵(roadmap)과 암묵적 텐서곱 탐색(implicit tensor-product search)을 결합해 복합 로드맵을 명시적으로 구성하지 않고 계획을 수행한다. 여기에 조건부 전환 샘플링, 지연 충돌 검사(lazy collision checking), 모드·해법 수준 유도(guidance) 기법을 더해 유한 시간 내 계획 효율도 함께 높인다.

Pavel Danilyuk / Pexels
2609.17524v1

모달리티 자기회귀 세계-행동 모델

Modality-Autoregressive World-Action Models

Adam Hung, Bardienus P. Duisterhof, Deva Ramanan, Jeffrey Ichnowski

세계-행동 모델(WAM, world-action model)은 미래 관측과 행동을 함께 예측하는 방식으로, 기존에는 주로 RGB 이미지를 예측 대상으로 삼았다. 이 논문은 ModAR를 제안하며, 행동 예측 전에 깊이 맵(depth map), DINO 특징, 포인트 트랙(point track) 등 여러 시각 모달리티를 자기회귀(autoregressive) 방식으로 순차 생성한다. 체계적 비교 실험 결과, 포인트 트랙·DINO 특징·깊이 맵 예측은 성능 향상에 기여한 반면, 미래 RGB를 추가하는 것은 일관된 효과를 나타내지 않았다. ModAR는 비디오 모델로 사전학습된 Flex-π 대비 평균 성공률 75% 대 72%를 달성하면서, 학습 연산량을 약 20배 줄이고 사전학습 없이 처음부터(train from scratch) 학습했다. 실제 환경의 양팔 조작(bimanual manipulation) 3개 과제에서도 비교 기준 모델들을 앞섰으며, 인간 시연 영상 활용 시 성능이 추가로 향상되었다.

Pixabay / Pexels
2609.17499v1

ENCP: 시각-언어 탐색을 위한 에피소드 정규화 적합 예측

ENCP: Episode-Normalized Conformal Prediction for Vision-and-Language Navigation

Vicky Feliren, A. Taufiq Asyhari, Muhamad Risqi U. Saputra

시각-언어 탐색(VLN) 에이전트의 불확실성 추정은 모호하거나 신뢰도가 낮은 예측을 식별해 더 안전한 항법 결정을 지원하는 중요한 과제다. 기존 적합 예측(Conformal Prediction, CP) 프레임워크는 VLN 에피소드가 단계 간 의존성을 지닌 가변 길이 시퀀스로 구성돼 있어 표준 보정 방식으로는 커버리지 보장이 성립하지 않는다. 이 논문에서는 비적합도 점수(nonconformity score)를 정책의 잔여 신뢰도로 재스케일하고 에피소드당 최대 점수 하나를 보정하는 에피소드 정규화 적합 예측(ENCP)을 제안한다. 교환 가능한 보정·테스트 에피소드 조건 하에서 ENCP는 에피소드 내 단계 간 의존성을 허용하면서도 매 단계에서 최소 1−α 확률로 실제 정답을 포함하는 것을 이론적으로 보장한다. R2R 및 REVERIE 데이터셋에서 4가지 VLN 정책과 3가지 비적합도 점수를 대상으로 실험한 결과, ENCP는 학습 환경에서 미학습 환경으로의 평가에서 보고된 모든 단계별 커버리지 목표를 달성했다.

ThisIsEngineering / Pexels
2609.17484v1IROS

데이터 부족 환경에서 로봇 삽입 작업을 위한 모션 사전 정규화 분석

Dissecting Motion-Prior Regularization for Data-Scarce Robotic Insertion

Ning Hu, Shuai Li, Jindong Tan

이 연구는 확산 정책(diffusion policy)을 단 15개의 시연 데이터로 학습할 때, 훈련 시점의 모션 사전(motion prior) 정규화가 삽입 성공률을 개선하는지 실험한다. 최소 저크(minimum jerk) 정규화는 예측된 병진 가속도의 급격한 변화를 억제하고, 속도-곡률(speed-curvature) 정규화는 이동 속도를 경로 형상에 연동한다. 실제 로봇으로 조건별 80회씩 시험한 결과, 두 사전을 결합하거나 최소 저크만 단독 적용한 경우 모두 80회 중 70회(87.5%) 성공을 기록했다. 속도-곡률 단독은 86.3%, 사전 미적용은 82.5%, 일반 평활화(generic smoothness)는 83.8%로 나타났다. 결합 정규화는 미적용 대비 5.0%p 높은 성공률을 보였으나 최소 저크 단독 대비 추가 이득은 관찰되지 않았으며, 두 사전의 상승 효과는 확인되지 않았다.

Mikhail Nilov / Pexels
2609.17463v1

로봇 군집을 활용한 공간 필드 모델링을 위한 가우시안 프로세스

Gaussian Processes for Modelling Spatial Fields with Robot Swarms

Guillermo Legarda Herranz, Gianpiero Francesca, Mauro Birattari

기존 로봇 군집 기반 공간 필드 모델링 방법은 외부 위치 측위 시스템에 의존해 왔다. 본 연구는 위치 비인식 가우시안 프로세스 회귀(LU-GPR)를 제안하여, GPS 등 외부 측위 없이도 수온·풍속·지형 고도 같은 공간 필드를 모델링할 수 있는 방법을 제시한다. 각 로봇은 로컬 센싱과 통신만으로 공간 필드의 사후 평균(posterior mean)과 분산을 추론하면서 동시에 동료 로봇들과 공통 기준 좌표계(frame of reference)를 합의한다. 전문가 곱(product of experts) 모델을 통해 개별 로봇이 주변 로봇의 추정값과 자신의 추정값을 결합해 전역 모델을 구성한다. 실험에서 LU-GPR은 로봇 수가 증가해도 확장성이 유지되고 통신 범위가 제한된 환경에서도 강건함이 확인됐으며, 대피 군중의 흐름 추정 시나리오에도 적용되었다.

Kindel Media / Pexels
2609.17430v1

혼합 동역학 시스템을 위한 Hamilton-Jacobi Reachability: 안전 보장을 갖춘 통합 목표 지향 제어

Hamilton-Jacobi Reachability for Hybrid Systems: Unified Goal-Driven Control with Safety Guarantees

Javier Borquez, Shuang Peng, Somil Bansal

접촉이 빈번한 환경의 로봇을 모델링하는 데 쓰이는 혼합 동역학 시스템(hybrid dynamical system)은 연속 동역학과 이산 모드 전환이 복잡하게 결합되어 안전성 보장이 어렵다. 이 논문은 연속 시간 비선형 시스템의 형식 검증 기법인 해밀턴-야코비(Hamilton-Jacobi, HJ) 도달 가능성 분석을 혼합 동역학 시스템으로 확장하며, 이산·연속 상태 전반에 걸친 일반화 가치 함수(value function)로 안전 집합을 특성화한다. 성능 목표 통합을 위해 두 가지 메커니즘을 제안한다: 불안전 상태에 근접할 때만 이산·연속 제어에 개입하는 혼합 최소 개입 안전 필터(hybrid least-restrictive safety filter)와, 안전성과 목표 도달을 동시에 강제하는 혼합 후방 도달-회피 튜브(hybrid backward reach-avoid tube)이다. 후자는 기존 혼합 HJ 도달 가능성 연구에서 다루지 않았던 확장이라고 논문은 밝힌다. 사족 보행 로봇을 대상으로 시뮬레이션 및 실기 실험을 통해 혼합 모드 계획과 안전 임계 응용에서의 유효성을 검증하였다.

Pavel Danilyuk / Pexels
2609.17414v1

SlotDiT: 확산 트랜스포머를 위한 객체 중심 표현

SlotDiT: Object-Centric Representations for Diffusion Transformers

Gjergj Plepi, Sven Behnke

SlotDiT는 텍스트 조건부 확산 트랜스포머(DiT, Diffusion Transformer)로, 슬롯(slot) 기반 잠재 공간에서 동작하는 영상 생성 모델이다. 참조 이미지와 언어 명령을 입력받아 장면을 객체 단위의 슬롯으로 분해하고, 미래 슬롯 궤적을 자기회귀적(autoregressive)으로 디노이징하여 장면 역학을 예측한다. 기존 픽셀 수준 또는 VAE 기반 잠재 표현이 명시적 의미 구조를 갖지 않는 것과 달리, 슬롯 기반 객체 중심 표현(object-centric representation)은 장면을 구조화된 방식으로 분해한다. 4개의 로봇 데이터셋 실험에서 슬롯 기반 표현은 VAE 기반 대안과 비교해 경쟁력 있는 영상 생성 품질을 유지하면서 과제 완료율을 지속적으로 높이는 것으로 나타났다. 아울러 슬롯의 컴팩트한 표현은 VAE 기반·의미 정렬(semantics-aligned) 잠재 공간보다 계산 효율이 높은 것으로 보고되었다.

Ярослав Сапрыкин / Pexels
2609.17405v1

복잡한 다중 접촉 환경에서 보행 로봇의 실시간 안정성 제어를 위한 최적화된 렌치 폴리토프 분석

Optimized Wrench Polytope Analysis for Real-Time Stability Control of Legged Robots in Complex Multi-Contact Configurations

Friedrich Graaf, Elias Birkefeld, Christian Eichmann, Elias Hofele, Tristan Schnell 외 3명

이 논문은 경사면·동굴·비계(scaffolding) 등 복잡한 지형에서 보행 로봇의 안정성을 실시간으로 제어하기 위한 렌치 폴리토프(wrench polytope) 분석 알고리즘을 제안한다. 제안 알고리즘은 임의의 접촉 시나리오에 대해 완전 구동 가능한 렌치 폴리토프를 평가하며, 각 관절 토크를 49 Hz 제어 주기 내에 계산한다. 이를 통해 기존 제어 루프에 통합하여 다양한 접촉 자세를 실시간으로 구동하는 것이 가능해진다. 연구팀은 시뮬레이션 환경에서 광범위한 평가를 수행한 뒤, 실제 보행 로봇 하드웨어에도 배포하여 적용 가능성을 확인하였다.