본문으로 건너뛰기

TAG

#강화학습

이 태그가 붙은 기사를 모았습니다. 태그는 AI 분류 단계에서 자동으로 붙고, 검수를 통과한 항목만 노출됩니다.

11
Sajad Nori / Unsplash
로봇신문

스위스 취리히 연방공대, 손가락 끝으로 걷는 로봇 핸드 개발

ETH 취리히(스위스 취리히 연방공대) 산하 소프트 로보틱스 연구실(SRL, Soft Robotics Lab)이 로봇 핸드의 손가락을 이동 수단으로 활용하는 기술을 개발했다. 상용 로봇 핸드에 배터리, 라즈베리 파이(Raspberry Pi) 컴퓨팅 모듈, 관성측정장치(IMU)를 탑재해 별도의 바퀴나 다리 없이 손가락 끝만으로 주행한다. 강화학습(reinforcement learning)을 적용해 자체 무게를 지탱하면서 다양한 지면 특성에서 이동하고 작업을 수행할 수 있도록 했다. 관련 시연 영상은 9월 16일 유튜브에 공개됐다.

큐레이터이동과 조작(manipulation)을 단일 하드웨어로 통합하는 접근이라 별도 이동 플랫폼이 필요 없다는 구조적 장점이 있다. 다만 이 기사에서는 시험 지면 종류·이동 속도·작업 성공률 같은 정량 데이터가 제시되지 않아 성능 수준을 독립적으로 판단하기 어렵다.

cottonbro studio / Pexels
전자신문

팔 없이 손가락만으로 움직이는 '로봇 손'

스위스 ETH 취리히 연구진이 다섯 손가락을 다리처럼 사용해 스스로 이동하는 로봇 손을 개발했다. 강화학습(reinforcement learning)을 적용해 전진, 방향 전환, 넘어진 뒤 자세 회복 동작을 학습시켰다. 실제 실험에서 낙하 후 스스로 일어서는 동작의 성공률은 84%로 나타났다. 배터리와 연산 장치를 본체에 내장해 별도의 로봇 팔 없이 독립적으로 동작한다.

큐레이터84% 성공률은 시뮬레이션이 아닌 실기 실험 결과로 보고되었으나, 기사 본문이 중간에 잘려 있어 작업 수행 능력 등 나머지 성능 지표는 확인이 어렵다.

Pavel Danilyuk / Pexels
인더스트리뉴스

로봇도 유치원 다닌다… 타샨·오픈마인드, 베이징에 ’로봇 유치원’ 개원

중국 촉각센서 기업 Tashan Technology(他山科技, 타샨)와 인공지능·강화학습 연구기관 OpenMind(오픈마인드)가 베이징에 '로봇 유치원(Robot Kindergarten)'을 개원했다. 이 시설에서는 로봇이 실제 물리환경에서 직접 경험을 축적하며 학습하는 방식을 실험한다. 강화학습(reinforcement learning) 분야의 선구적 연구자인 리처드 서튼(Richard Sutton) 교수가 이 프로젝트에 참여한다.

큐레이터원문이 중간에 잘려 프로젝트의 구체적인 방법론, 사용 로봇 사양, 실험 규모 등 핵심 정보가 확인되지 않는다. 완전한 기사를 통해 시뮬레이션 대비 실기 학습의 비중과 실험 설계를 추가로 확인할 필요가 있다.

Opt Lasers from Poland / Pexels
로봇신문

캐나다 산업자동화 기업 벤션, 몬트리올에 '피지컬 AI 연구소' 개소

캐나다 산업자동화 기업 벤션(Vention)이 몬트리올에 피지컬 AI(Physical AI) 연구소를 개소했다. 연구소는 로봇 제어, 모션 플래닝(motion planning), 컴퓨터 비전(computer vision), 비전 파운데이션 모델, 시연을 통한 학습(Learning from Demonstration), 강화학습을 주요 연구 분야로 삼는다. 산업 현장에서 직접 수집한 데이터를 이용해 로봇용 피지컬 AI 모델을 후학습(post-training)하고, 실제 생산라인에서 검증하는 데 초점을 맞춘다. 지미 리(Jimmy Li) 피지컬 AI 디렉터가 연구소를 이끌며, 현재 팀원은 8명이다.

큐레이터개소 발표 외에 구체적인 연구 성과나 공개 일정이 제시되지 않았으며, 현장 수집 데이터가 외부에 공개될 가능성은 낮아 연구 재현 가능성은 추후 확인이 필요하다.

Leftfield Corn / Unsplash
ROS Discourse

Gazebo Gymnasium: Gazebo에 강화학습 통합하기

gazebo_gymnasium은 Gazebo 시뮬레이터와 Gymnasium 강화학습(RL) 라이브러리를 결합한 독립 패키지로, pixi를 통해 설치된다. 브리지 API를 활용해 기존 Gazebo·ROS 패키지와 연동할 수 있으며, 사용자가 Gazebo 내부 라이브러리를 직접 다루지 않아도 RL 환경을 구성할 수 있다. 패키지 검증을 위해 병렬 시뮬레이션 학습과 도메인 랜덤화(domain randomization) 기법을 적용한 라인 팔로워(line follower)를 개발했다. 학습된 정책은 시뮬레이션의 다양한 트랙에서 평가된 후, 연구팀이 직접 제작한 실물 차동 구동(differential drive) 로버에 배포되어 라인 추종에 성공했다.

큐레이터실기 배포 성공은 연구팀 자체 보고이며, 검증 과제가 라인 팔로워 한 종류에 그쳐 더 복잡한 조작·주행 과제로의 범용성은 아직 확인되지 않았다.

Pavel Danilyuk / Pexels
로봇신문

中 아스트리봇, 로봇 온라인 강화학습 기술 ‘스무드RL’ 개발

중국 휴머노이드 로봇 기업 아스트리봇(Astribots, 星尘智能)이 실제 가동 환경에서 로봇을 정지 없이 학습시키는 온라인 강화학습(reinforcement learning) 프레임워크 SmoothRL을 개발했다. 기존 방식과 달리 시뮬레이션 없이 실제 작업 현장에서 직접 강화학습을 수행한다. 시각-언어-행동 모델(VLA) 등 대규모 로봇 모델을 실제 하드웨어에 적용할 때 모델의 행동 계산 시간과 로봇의 실행 시간 사이의 불일치에서 발생하는 비동기 추론(asynchronous inference) 문제를 해결 대상으로 삼는다.

큐레이터아스트리봇 자체 발표로, 어떤 작업 유형·몇 가지 과제·어떤 하드웨어 조건에서 검증했는지 독립적으로 확인된 바가 없어 범용성 판단은 유보가 필요하다. 비동기 추론 문제를 다룬 선행 연구들이 이미 존재하므로, SmoothRL이 기존 접근과 무엇이 구체적으로 다른지 비교가 필요하다.

Pavel Danilyuk / Pexels
로봇신문

日 오사카대·고베대, 감정 표현하는 2족보행 로봇 개발

일본 오사카대와 고베대 공동 연구팀이 강화학습(reinforcement learning) 기반 감정 표현 보행 프레임워크 EmoLo(Emotion-Inspired Expressive Locomotion)를 개발했다. EmoLo를 적용한 오픈소스 2족보행 로봇 Open Duck Mini V2는 '기쁨', '보통', '슬픔' 세 가지 감정 스타일에 맞춰 보행 동작을 수행할 수 있다. 해당 연구 성과는 2026년 8월 24일부터 28일까지 일본 후쿠오카에서 개최된 국제 학술대회에서 발표됐다.

큐레이터세 가지 감정 범주만 다루어 표현 범위가 좁고, 해당 보행 동작이 실제 관찰자에게 의도한 감정으로 지각되는지를 확인하는 인간 평가(perceptual study) 결과가 요약에 언급되지 않아 표현 효과를 독립적으로 판단하기 어렵다.

Árpád Czapp / Unsplash
ROS Discourse

2026년 8월 31일 주간 ROS 뉴스

Bosch가 주최한 ROS By-The-Bay 행사가 마무리되었으며, 다음 대면 행사로 캐나다 토론토에서 ROSCon Global이 예정되어 있다. 스웨덴 대학원생 Fares Espiro가 Gazebo와 ROS 2 기반 실내 추종 로봇의 전체 시뮬레이션 스택 소스코드를 공개했다. Gazebo 핵심 시스템 리셋에 대한 품질 보증 작업이 완료되어 강화학습(RL) 훈련 안정성이 향상되었다. Open-RMF Crossflow 다이어그램 편집기에 UI/UX 개선이 추가되었다.

큐레이터Gazebo 시스템 리셋 품질 보증 완료는 강화학습 훈련 파이프라인에 직접 영향을 주는 변경으로, 해당 워크플로를 사용하는 개발자는 업스트림 변경 사항을 확인할 필요가 있다; 공개된 실내 추종 로봇 스택은 대학원 연구 수준의 시뮬레이션 코드이므로 실기 환경으로의 전이 가능성은 별도로 검토해야 한다.

Brecht Corbeel / Unsplash
ROS Discourse

Bimo: sim-to-real 전이를 지원하는 오픈소스 이족보행 로봇 키트

Bimo는 이족보행 로봇 연구·교육을 위한 오픈소스 플랫폼으로, 완조립 SLS 키트와 직접 출력·조립하는 DIY 키트 두 가지 형태로 제공된다. 높이 45cm, 무게 약 1.6kg의 본체에 8개의 STS-3215 서보, BNO08x 9-자유도(DOF) IMU, 4개의 TOF 센서, 2개의 180° 화각 카메라, 커스텀 RP2040 기반 컨트롤러를 탑재한다. Isaac Lab 기반 sim-to-real 파이프라인을 내장하며, MCU 등 제한된 하드웨어에서 강화학습(RL) 정책을 구동할 수 있는 지식 증류(distillation) 스크립트를 함께 제공한다. 두부 공동에 M3 마운트와 최대 1kg 페이로드 지원 구조를 갖춰 비전·SLAM 모듈 등 추가 하드웨어 장착이 가능하다. 중추 패턴 발생기(CPG, Central Pattern Generator) 기반 기본 보행 알고리즘이 내장되어 있어 별도 학습 없이도 즉시 보행을 시작할 수 있다.

큐레이터sim-to-real 파이프라인이 '내장'되어 있다고 소개하지만, 실제 하드웨어에서 전이 성능이 어느 수준인지는 요약에 제시되지 않았다. 또한 MCU 구동을 위한 지식 증류 과정에서 원본 RL 정책 대비 어느 정도의 성능 손실이 발생하는지가 확인되어야 실용성을 판단할 수 있다.

Steve A Johnson / Pexels
ROS Discourse

[GSoC 2026] Gazebo 핵심 시스템 리셋 QA

Open Robotics 멘토링 하에 진행된 GSoC 2026 프로젝트로, Gazebo 시뮬레이터 핵심 플러그인의 리셋(reset) 경로에 대한 테스트 스위트 구축과 감사(audit)를 수행했다. Gazebo 핵심 플러그인은 Configure·PreUpdate·Update·PostUpdate 흐름을 중심으로 설계됐으며, Reset 기능은 강화학습(RL) 에피소드 재시작 요구에 따라 이후 추가됐다. 그러나 대부분의 플러그인은 Reset 경로에 대한 검증이 이루어지지 않아, 이전 상태가 잔류하면 다음 에피소드가 실제 리셋으로 동작하지 않아 학습 신뢰성이 저하될 수 있다. 개발자는 gz-sim/src/systems 내 고영향 시스템을 배치(batch) 단위로 감사하며, 리셋이 정상이면 테스트만, 문제가 있으면 수정과 테스트를 함께 포함한 풀 리퀘스트(PR)를 순차 제출했다.

큐레이터리셋 경로의 잔류 상태는 에피소드가 겉으로는 재시작된 것처럼 보이면서도 학습 데이터를 오염시키는 조용한 버그여서, 수정 범위와 대상 플러그인 목록이 최종 확정될 때까지 현재 Gazebo 기반 RL 파이프라인의 재현성 평가는 유보가 필요하다.

Brecht Corbeel / Unsplash
로봇신문

中 부스터로보틱스, 휴머노이드 로봇 동적 비전 의사결정 기술 개발

중국의 부스터로보틱스(Booster Robotics, 加速进化)가 로봇 분야 국제 학술지 사이언스 로보틱스(Science Robotics)에 휴머노이드 로봇의 시각 기반 반응형 축구 기술 학습에 관한 논문을 발표했다. 논문 제목은 'Learning Vision-Driven Reactive Soccer Skills for Humanoid Robots'이며, 시각적 불확실성에 대응하기 위한 통합 감지-동작 강화학습(reinforcement learning) 프레임워크를 다룬다. 해당 연구는 중국 로봇 전문 포털 중국로봇망을 통해 소개됐다.

큐레이터요약에는 실험이 시뮬레이션 환경인지 실제 로봇을 대상으로 한 것인지 명시되지 않아, 결과의 현장 적용 가능성을 판단하려면 논문 원문의 실험 조건 확인이 필요하다.