본문으로 건너뛰기

GLOSSARY

디퓨전 폴리시

Diffusion Policy고급

디퓨전 폴리시란 확산 모델(Diffusion Model)의 반복적 노이즈 제거 과정을 로봇 행동 생성에 적용한 모방 학습 기반 정책 표현 방식이다. 기존 행동 복제 방식은 단일 가우시안 분포로 행동을 예측하기 때문에, 같은 관측 상황에서 여러 유효한 행동이 공존하는 다봉(multimodal) 분포를 표현하기 어렵다는 한계가 있다. 디퓨전 폴리시는 행동 공간의 임의 잡음에서 시작해 관측값을 조건으로 한 스코어 함수(score function)를 K회 반복 적용함으로써 최종 행동 시퀀스를 복원한다. 예를 들어 로봇팔이 물체를 집는 시범 데이터를 학습할 때, 위쪽 접근과 옆쪽 접근처럼 동등하게 타당한 복수의 궤적 분포를 단일 정책으로 포착할 수 있다. 에너지 기반 모델(EBM)도 유사하게 다봉 분포를 표현하지만, 디퓨전 폴리시는 추론 시 MCMC 샘플링 없이 고정된 역확산 단계만으로 행동을 생성하므로 실시간 제어 루프에 적용하기 더 용이하다.

이 용어가 나온 기사

ROS Discourse기초·제어이론로봇 AI

[GSoC 2026] ros2_control을 위한 Physical AI 추론 및 궤적 업스케일링

[GSoC 2026] Physical AI Inference and Trajectory Upscaling for ros2_control

ACT·확산 정책(diffusion policy)·시각-언어-행동 모델(VLA) 등 학습 기반 조작 정책은 20~50 Hz로 관절 목표값을 출력하고 50~500 ms마다 재계획하지만, 하드웨어 제어 사이클은 500 Hz~2 kHz의 명령을 필요로 한다. 희소 경유점을 그대로 전달하면 새 경유점마다 속도 불연속과 가속도 급등이 발생한다. 이 GSoC 2026 프로젝트는 ros2_controllers 내에서 이 간격을 세 단계로 해소하는 구현을 제출했다. 궤적 교체 블렌딩 개선을 통해 기존 JTC(Joint Trajectory Controller)가 새 궤적 수신 시 이전 궤적을 즉시 폐기하던 방식을 변경, 두 궤적을 수신 시점에 접합(prefix·bridge·suffix)하는 방식으로 대체했다. 전체 구현은 7자유도 AgileX Nero 로봇에서 하드웨어 실증으로 검증됐다.

큐레이터검증이 7자유도 AgileX Nero 단일 플랫폼에서만 이뤄졌으므로, 다른 자유도 구성이나 하드웨어에서의 블렌딩 안정성은 별도 확인이 필요하다; GSoC 제출물인 만큼 ros2_controllers 메인라인 병합 여부는 이후 리뷰 과정에 달려 있다.

hitesh choudhary / Pexels