본문으로 건너뛰기

GLOSSARY

모방학습

Imitation Learning고급

모방학습이란 전문가의 시연(demonstration) 데이터로부터 행동 정책을 학습하는 방법론으로, 보상 함수를 명시적으로 정의하지 않고도 기술을 습득할 수 있다는 특징이 있다. 보상 함수 설계가 어렵거나 환경과의 실시간 상호작용 비용이 클 때 활용도가 높다. 행동 복제(Behavioral Cloning)는 상태-행동 쌍을 지도학습으로 직접 모방하지만, 학습 분포에서 벗어난 상태에서 오류가 누적되는 분포 이동(distribution shift) 문제가 발생한다. 이를 완화하기 위해 DAgger처럼 전문가 쿼리를 반복적으로 수집해 온라인으로 데이터를 집계하는 알고리즘이 제안되었다. 로봇 팔이 사람의 텔레오퍼레이션 궤적 수십 건을 학습해 정밀 조립 동작을 재현하는 것이 대표적 응용 사례다. 역강화학습(Inverse Reinforcement Learning)은 시연으로부터 보상 함수 자체를 복원한 뒤 정책을 도출한다는 점에서, 행동을 직접 복제하는 행동 복제와 구별된다.

이 용어가 나온 기사

로봇신문부품·센서로봇 AI

美 RAI연구소, 정교한 로봇 조작 구현한 '코알라 그리퍼' 공개

미국 RAI연구소(Robotics and AI Institute)가 인간 시연 데이터를 학습해 정밀 조작 능력을 구현하는 그리퍼 '코알라 그리퍼(Koala Gripper)'를 공개했다. 코알라 그리퍼는 기존 로봇이 수행하기 어려웠던 고정밀 작업과 도구 활용을 인간 중심 데이터 수집 방식으로 학습한다. 공개된 영상 시연에서 코알라 그리퍼 탑재 로봇은 전동 드릴·스패너 등 다양한 공구와 일상 물체를 안정적으로 파지하는 것으로 나타났다.

큐레이터공개된 영상은 RAI연구소 자체 시연이며, 파지 안정성에 대한 주장도 연구소 측의 것이므로 다양한 현장 조건에서의 독립 검증 여부가 확인되어야 한다.

Shahabudin Ibragimov / Unsplash
Robohub로봇 AIAI 요약

로봇 정책 훈련 및 평가를 위한 대화형 월드 시뮬레이터

Interactive world simulator for robot policy training and evaluation

Robohub에 게재된 이 기사는 로봇 정책(robot policy) 훈련 및 평가를 위한 상호작용형 월드 시뮬레이터(world simulator)를 소개한다. 기존 로봇 학습의 표준 절차는 실제 로봇으로 수백 건의 전문가 시연(demonstration)을 수집한 뒤 모방 학습(imitation learning) 정책을 훈련하고, 동일한 실제 로봇으로 반복 평가하는 방식이다. 기사는 이 과정에서 시뮬레이터를 활용하는 접근법을 다루며, 테이블 위 물체를 밀어내는 과제를 예시로 제시한다. 본문이 일부만 공개되어 구체적인 시뮬레이터 사양이나 실험 결과는 확인되지 않는다.

Brecht Corbeel / Unsplash