본문으로 건너뛰기

GLOSSARY

강화학습

Reinforcement Learning고급

강화학습이란 에이전트가 환경과 상호작용하면서 누적 보상을 최대화하는 정책(policy)을 스스로 학습하는 기계학습 패러다임이다. 정답 레이블 없이 보상 신호만으로 학습이 이루어지므로, 사전에 규칙으로 명시하기 어려운 복잡한 행동 전략을 자동으로 발견할 수 있다. 로봇공학에서는 벨만 방정식(Bellman equation) 기반의 Q-러닝이나 정책 기울기(policy gradient) 방법이 대표적으로 활용된다. 예를 들어 로봇팔이 다양한 형태의 물체를 파지(grasping)하는 동작을 시뮬레이터 내 반복 시행을 통해 스스로 최적화하는 것이 전형적인 응용이다. 지도학습과의 차이점은, 지도학습이 정답 레이블을 직접 학습하는 반면 강화학습은 행동의 결과로 주어지는 보상 신호를 통해 간접적으로 최적 행동을 찾는다는 점이다.

이 용어가 나온 기사

Robohub로봇 AI기초·제어이론

Robot Talk Episode 164 – Michelle Lu와 함께하는 로봇 학습 가속화

Robot Talk Episode 164 – Accelerating robot learning, with Michelle Lu

Robohub의 팟캐스트 'Robot Talk' 164화에서 진행자 Claire가 Vsim Technology 공동창업자 겸 CEO Michelle Lu와 대화를 나눴다. 이번 에피소드의 주제는 시뮬레이션과 인공지능(AI)을 활용해 로봇에 새로운 기술을 학습시키는 방법이다. Michelle Lu는 NVIDIA에서 시뮬레이션 기술 디렉터로 재직하는 동안 공동창업자와 함께 GPU 가속 강화학습(RL) 프레임워크인 Isaac Gym을 개발한 경력을 갖고 있다.

큐레이터팟캐스트 소개 글 수준의 요약만 공개되어 있어 기술적 세부 내용은 에피소드를 직접 들어야 확인할 수 있다. NVIDIA Isaac Gym 이후 Vsim Technology에서 어떤 방향으로 시뮬레이션 기반 로봇 학습을 발전시키고 있는지가 핵심 관전 포인트다.

Steve A Johnson / Pexels
로봇신문기초·제어이론로봇 AI

스위스 취리히 연방공대, 손가락 끝으로 걷는 로봇 핸드 개발

ETH 취리히(스위스 취리히 연방공대) 산하 소프트 로보틱스 연구실(SRL, Soft Robotics Lab)이 로봇 핸드의 손가락을 이동 수단으로 활용하는 기술을 개발했다. 상용 로봇 핸드에 배터리, 라즈베리 파이(Raspberry Pi) 컴퓨팅 모듈, 관성측정장치(IMU)를 탑재해 별도의 바퀴나 다리 없이 손가락 끝만으로 주행한다. 강화학습(reinforcement learning)을 적용해 자체 무게를 지탱하면서 다양한 지면 특성에서 이동하고 작업을 수행할 수 있도록 했다. 관련 시연 영상은 9월 16일 유튜브에 공개됐다.

큐레이터이동과 조작(manipulation)을 단일 하드웨어로 통합하는 접근이라 별도 이동 플랫폼이 필요 없다는 구조적 장점이 있다. 다만 이 기사에서는 시험 지면 종류·이동 속도·작업 성공률 같은 정량 데이터가 제시되지 않아 성능 수준을 독립적으로 판단하기 어렵다.

Sajad Nori / Unsplash
전자신문기초·제어이론

팔 없이 손가락만으로 움직이는 '로봇 손'

스위스 ETH 취리히 연구진이 다섯 손가락을 다리처럼 사용해 스스로 이동하는 로봇 손을 개발했다. 강화학습(reinforcement learning)을 적용해 전진, 방향 전환, 넘어진 뒤 자세 회복 동작을 학습시켰다. 실제 실험에서 낙하 후 스스로 일어서는 동작의 성공률은 84%로 나타났다. 배터리와 연산 장치를 본체에 내장해 별도의 로봇 팔 없이 독립적으로 동작한다.

큐레이터84% 성공률은 시뮬레이션이 아닌 실기 실험 결과로 보고되었으나, 기사 본문이 중간에 잘려 있어 작업 수행 능력 등 나머지 성능 지표는 확인이 어렵다.

cottonbro studio / Pexels
인더스트리뉴스로봇 AI

로봇도 유치원 다닌다… 타샨·오픈마인드, 베이징에 ’로봇 유치원’ 개원

중국 촉각센서 기업 Tashan Technology(他山科技, 타샨)와 인공지능·강화학습 연구기관 OpenMind(오픈마인드)가 베이징에 '로봇 유치원(Robot Kindergarten)'을 개원했다. 이 시설에서는 로봇이 실제 물리환경에서 직접 경험을 축적하며 학습하는 방식을 실험한다. 강화학습(reinforcement learning) 분야의 선구적 연구자인 리처드 서튼(Richard Sutton) 교수가 이 프로젝트에 참여한다.

큐레이터원문이 중간에 잘려 프로젝트의 구체적인 방법론, 사용 로봇 사양, 실험 규모 등 핵심 정보가 확인되지 않는다. 완전한 기사를 통해 시뮬레이션 대비 실기 학습의 비중과 실험 설계를 추가로 확인할 필요가 있다.

Pavel Danilyuk / Pexels