본문으로 건너뛰기

GLOSSARY

모방학습

Imitation Learning고급

모방학습이란 전문가의 시연(demonstration) 데이터로부터 행동 정책을 학습하는 방법론으로, 보상 함수를 명시적으로 정의하지 않고도 기술을 습득할 수 있다는 특징이 있다. 보상 함수 설계가 어렵거나 환경과의 실시간 상호작용 비용이 클 때 활용도가 높다. 행동 복제(Behavioral Cloning)는 상태-행동 쌍을 지도학습으로 직접 모방하지만, 학습 분포에서 벗어난 상태에서 오류가 누적되는 분포 이동(distribution shift) 문제가 발생한다. 이를 완화하기 위해 DAgger처럼 전문가 쿼리를 반복적으로 수집해 온라인으로 데이터를 집계하는 알고리즘이 제안되었다. 로봇 팔이 사람의 텔레오퍼레이션 궤적 수십 건을 학습해 정밀 조립 동작을 재현하는 것이 대표적 응용 사례다. 역강화학습(Inverse Reinforcement Learning)은 시연으로부터 보상 함수 자체를 복원한 뒤 정책을 도출한다는 점에서, 행동을 직접 복제하는 행동 복제와 구별된다.

이 용어가 나온 기사

인더스트리뉴스로봇 AI휴머노이드

뉴로메카, KAIST와 손목 카메라 없이 정밀 작업하는 로봇 AI 개발

뉴로메카가 KAIST 전기및전자공학부 김민준 교수 연구팀과 공동 개발한 SCDP(Spatially Conditioned Diffusion Policy)를 휴머노이드 에이르(EIR)에 적용해 종이컵 분리 작업을 시연했다. 시각 기반 모방학습(imitation learning) 분야에서는 작업 공간 카메라에 손목 카메라를 추가하는 구성이 사실상 표준으로 쓰여 왔다. 손이 물체에 가까워질수록 접촉 부위를 근접 촬영할 수 있어 소형 부품의 위치·삽입 방향 파악에 유리하기 때문이다. SCDP는 손목 카메라 없이도 정밀 조작을 수행할 수 있도록 설계된 정책 모델이다.

큐레이터본문이 중간에 잘려 SCDP의 구체적 동작 원리, 실험 조건(시뮬레이션·실기 여부), 성능 수치가 확인되지 않는다. 전체 원문을 통해 비교 기준과 실험 규모를 확인할 필요가 있다.

Hyundai Motor Group / Pexels
전자신문로봇 AI

평소 하던 일만 해도 추가 수입이? 中서 뜨는 '이색 부업'

중국에서 일반인이 평상시 작업을 하며 로봇 학습용 데이터를 수집하는 부업이 확산되고 있다. 작업자는 머리에 카메라를 착용해 1인칭 작업 영상을 촬영하고, 손목 장비로 손의 각도와 움직임을 함께 기록한다. 수집된 영상과 동작 데이터는 로봇이 요리·청소 등 실제 작업을 학습하는 데 활용된다. 일부 플랫폼에서는 택배 개봉·정리 작업의 데이터도 수집하는 것으로 전해지나, 원문이 중간에 끊겨 전체 현황은 확인되지 않는다.

큐레이터로봇 체화 지능(embodied AI) 학습에 필요한 실세계 시연 데이터를 크라우드소싱으로 확보하려는 시도가 중국에서 대중화되고 있음을 보여주는 사례다. 원문이 중간에 잘려 플랫폼 규모·단가·수집 기업 등 핵심 정보를 확인할 수 없어 사실 검증이 제한적이다.

Brecht Corbeel / Unsplash
로봇신문부품·센서로봇 AI

美 RAI연구소, 정교한 로봇 조작 구현한 '코알라 그리퍼' 공개

미국 RAI연구소(Robotics and AI Institute)가 인간 시연 데이터를 학습해 정밀 조작 능력을 구현하는 그리퍼 '코알라 그리퍼(Koala Gripper)'를 공개했다. 코알라 그리퍼는 기존 로봇이 수행하기 어려웠던 고정밀 작업과 도구 활용을 인간 중심 데이터 수집 방식으로 학습한다. 공개된 영상 시연에서 코알라 그리퍼 탑재 로봇은 전동 드릴·스패너 등 다양한 공구와 일상 물체를 안정적으로 파지하는 것으로 나타났다.

큐레이터공개된 영상은 RAI연구소 자체 시연이며, 파지 안정성에 대한 주장도 연구소 측의 것이므로 다양한 현장 조건에서의 독립 검증 여부가 확인되어야 한다.

Shahabudin Ibragimov / Unsplash
Robohub로봇 AIAI 요약

로봇 정책 훈련 및 평가를 위한 대화형 월드 시뮬레이터

Interactive world simulator for robot policy training and evaluation

Robohub에 게재된 이 기사는 로봇 정책(robot policy) 훈련 및 평가를 위한 상호작용형 월드 시뮬레이터(world simulator)를 소개한다. 기존 로봇 학습의 표준 절차는 실제 로봇으로 수백 건의 전문가 시연(demonstration)을 수집한 뒤 모방 학습(imitation learning) 정책을 훈련하고, 동일한 실제 로봇으로 반복 평가하는 방식이다. 기사는 이 과정에서 시뮬레이터를 활용하는 접근법을 다루며, 테이블 위 물체를 밀어내는 과제를 예시로 제시한다. 본문이 일부만 공개되어 구체적인 시뮬레이터 사양이나 실험 결과는 확인되지 않는다.

Brecht Corbeel / Unsplash