본문으로 건너뛰기

GLOSSARY

강화학습

Reinforcement Learning고급

강화학습이란 에이전트가 환경과 상호작용하면서 누적 보상을 최대화하는 정책(policy)을 스스로 학습하는 기계학습 패러다임이다. 정답 레이블 없이 보상 신호만으로 학습이 이루어지므로, 사전에 규칙으로 명시하기 어려운 복잡한 행동 전략을 자동으로 발견할 수 있다. 로봇공학에서는 벨만 방정식(Bellman equation) 기반의 Q-러닝이나 정책 기울기(policy gradient) 방법이 대표적으로 활용된다. 예를 들어 로봇팔이 다양한 형태의 물체를 파지(grasping)하는 동작을 시뮬레이터 내 반복 시행을 통해 스스로 최적화하는 것이 전형적인 응용이다. 지도학습과의 차이점은, 지도학습이 정답 레이블을 직접 학습하는 반면 강화학습은 행동의 결과로 주어지는 보상 신호를 통해 간접적으로 최적 행동을 찾는다는 점이다.

이 용어가 나온 기사

로봇신문기초·제어이론로봇 AI

스위스 취리히 연방공대, 손가락 끝으로 걷는 로봇 핸드 개발

ETH 취리히(스위스 취리히 연방공대) 산하 소프트 로보틱스 연구실(SRL, Soft Robotics Lab)이 로봇 핸드의 손가락을 이동 수단으로 활용하는 기술을 개발했다. 상용 로봇 핸드에 배터리, 라즈베리 파이(Raspberry Pi) 컴퓨팅 모듈, 관성측정장치(IMU)를 탑재해 별도의 바퀴나 다리 없이 손가락 끝만으로 주행한다. 강화학습(reinforcement learning)을 적용해 자체 무게를 지탱하면서 다양한 지면 특성에서 이동하고 작업을 수행할 수 있도록 했다. 관련 시연 영상은 9월 16일 유튜브에 공개됐다.

큐레이터이동과 조작(manipulation)을 단일 하드웨어로 통합하는 접근이라 별도 이동 플랫폼이 필요 없다는 구조적 장점이 있다. 다만 이 기사에서는 시험 지면 종류·이동 속도·작업 성공률 같은 정량 데이터가 제시되지 않아 성능 수준을 독립적으로 판단하기 어렵다.

Sajad Nori / Unsplash
전자신문기초·제어이론

팔 없이 손가락만으로 움직이는 '로봇 손'

스위스 ETH 취리히 연구진이 다섯 손가락을 다리처럼 사용해 스스로 이동하는 로봇 손을 개발했다. 강화학습(reinforcement learning)을 적용해 전진, 방향 전환, 넘어진 뒤 자세 회복 동작을 학습시켰다. 실제 실험에서 낙하 후 스스로 일어서는 동작의 성공률은 84%로 나타났다. 배터리와 연산 장치를 본체에 내장해 별도의 로봇 팔 없이 독립적으로 동작한다.

큐레이터84% 성공률은 시뮬레이션이 아닌 실기 실험 결과로 보고되었으나, 기사 본문이 중간에 잘려 있어 작업 수행 능력 등 나머지 성능 지표는 확인이 어렵다.

cottonbro studio / Pexels
인더스트리뉴스로봇 AI

로봇도 유치원 다닌다… 타샨·오픈마인드, 베이징에 ’로봇 유치원’ 개원

중국 촉각센서 기업 Tashan Technology(他山科技, 타샨)와 인공지능·강화학습 연구기관 OpenMind(오픈마인드)가 베이징에 '로봇 유치원(Robot Kindergarten)'을 개원했다. 이 시설에서는 로봇이 실제 물리환경에서 직접 경험을 축적하며 학습하는 방식을 실험한다. 강화학습(reinforcement learning) 분야의 선구적 연구자인 리처드 서튼(Richard Sutton) 교수가 이 프로젝트에 참여한다.

큐레이터원문이 중간에 잘려 프로젝트의 구체적인 방법론, 사용 로봇 사양, 실험 규모 등 핵심 정보가 확인되지 않는다. 완전한 기사를 통해 시뮬레이션 대비 실기 학습의 비중과 실험 설계를 추가로 확인할 필요가 있다.

Pavel Danilyuk / Pexels
로봇신문로봇 AI산업·정책·투자

캐나다 산업자동화 기업 벤션, 몬트리올에 '피지컬 AI 연구소' 개소

캐나다 산업자동화 기업 벤션(Vention)이 몬트리올에 피지컬 AI(Physical AI) 연구소를 개소했다. 연구소는 로봇 제어, 모션 플래닝(motion planning), 컴퓨터 비전(computer vision), 비전 파운데이션 모델, 시연을 통한 학습(Learning from Demonstration), 강화학습을 주요 연구 분야로 삼는다. 산업 현장에서 직접 수집한 데이터를 이용해 로봇용 피지컬 AI 모델을 후학습(post-training)하고, 실제 생산라인에서 검증하는 데 초점을 맞춘다. 지미 리(Jimmy Li) 피지컬 AI 디렉터가 연구소를 이끌며, 현재 팀원은 8명이다.

큐레이터개소 발표 외에 구체적인 연구 성과나 공개 일정이 제시되지 않았으며, 현장 수집 데이터가 외부에 공개될 가능성은 낮아 연구 재현 가능성은 추후 확인이 필요하다.

Opt Lasers from Poland / Pexels