본문으로 건너뛰기

GLOSSARY

로봇 파운데이션 모델

Robot Foundation Model고급

로봇 파운데이션 모델이란 인터넷 이미지·텍스트·로봇 시연 영상 등 대규모 이종 데이터로 사전학습되어, 다양한 로봇 태스크에 전이하거나 파인튜닝만으로 적용할 수 있는 범용 신경망 모델이다. 태스크마다 제어기와 인식 파이프라인을 새로 설계하던 방식과 달리, 단일 사전학습 가중치에서 출발하므로 새로운 태스크에 필요한 시연 데이터 양을 줄일 수 있다. 구현 형태는 주로 트랜스포머 기반의 비전-언어-행동 모델(VLA)이며, 카메라 영상·자연어 지시·고유 감각 신호를 단일 네트워크에서 처리해 관절 명령이나 엔드이펙터 포즈를 직접 출력한다. Google DeepMind의 RT-2는 웹 규모 비전-언어 사전학습 가중치를 로봇 조작 데이터로 추가 학습한 사례로, "사과를 빨간 그릇에 넣어라"와 같은 지시를 별도 객체 인식 모듈 없이 행동 토큰 시퀀스로 변환한다. 비전-언어 모델(VLM)은 언어·이미지 이해와 생성에 그치지만, 로봇 파운데이션 모델은 실세계 행동 토큰(액션 청크)까지 생성한다는 점에서 구분된다.

이 용어가 나온 기사

The Robot Report로봇 AI

Skild AI, S1 로봇 파운데이션 모델 공개

Skild AI unveils S1 flagship robot foundation model

Skild AI가 S1 로봇 파운데이션 모델(robot foundation model)을 공개했다. S1은 작업을 수행하는 영상을 보는 것만으로 로봇이 새로운 작업을 학습할 수 있도록 지원한다고 회사 측은 밝혔다.

큐레이터영상 관찰만으로 새 작업을 학습한다는 주장은 Skild AI 측의 발표이며, 독립적인 검증이나 실기 평가 조건(과제 종류·로봇 플랫폼·성공률 등)은 공개 자료에서 아직 확인되지 않는다.

Pavel Danilyuk / Pexels
로봇신문로봇 AI

美 스킬드 AI, 시연 영상 한번으로 학습하는 로봇 파운데이션 모델 ‘S1’ 공개

미국 로봇 스타트업 스킬드 AI(Skild AI)가 로봇 파운데이션 모델(foundation model) 'S1'을 공개했다. S1은 문맥 내 학습(In-Context Learning, ICL) 기술을 적용해, 사람의 작업 시연 영상 한 번만으로 새로운 로봇 작업을 수행할 수 있도록 설계됐다. 기존 방식은 새 작업마다 수십~수백 시간 분량의 원격조작(teleoperation) 데이터 수집과 작업별 정책 파인튜닝(fine-tuning)이 필요했다. S1은 이러한 별도의 데이터 수집 및 미세조정 절차 없이 영상 시연만으로 작업 적응이 가능하다고 스킬드 AI 측은 밝혔다.

큐레이터이 성능 수치는 스킬드 AI 측이 직접 밝힌 것으로, 독립적인 검증 결과가 아니며 시연 영상의 촬영 조건·과제 종류·범위가 공개되지 않아 실제 현장 적용 범위를 판단하기 어렵다.

Pavel Danilyuk / Pexels
IEEE Spectrum Robotics로봇 AI학회·이벤트

비디오 프라이데이: 초인적 휴머노이드 로봇이 필요한가?

Video Friday: Do We Need Superhuman Humanoid Robots?

IEEE Spectrum의 주간 로봇공학 영상 큐레이션 'Video Friday'에서 로봇 기반 모델(robot foundation model) GEN-1.5의 원샷(one-shot) 학습 능력을 소개한다. GEN-1.5는 경사도 업데이트(gradient update)나 파인튜닝(fine-tuning) 없이 단일 시연 예시만으로 몇 초 안에 새 과제를 학습할 수 있다. 원샷·퓨샷(few-shot) 시연 학습 및 제로샷(zero-shot) 물리적 일반화 능력을 보이며, 현재 수행 가능한 과제는 단순하고 짧은 구간에 한정된다. Unitree 로봇 영상도 함께 수록하며, 서울 Humanoids Summit(2026년 9월 22~23일)·IROS 2026(피츠버그)·CoRL 2026(오스틴) 등 주요 행사 일정도 안내한다.

큐레이터영상 시연 형식이므로 성공률·시도 횟수 등 정량적 조건이 공개되지 않아 원샷 학습 주장을 독립적으로 검증하기 어렵고, 개발팀 스스로 '단순·단구간 과제'에 한정된다고 밝힌 점이 현시점 적용 범위를 가늠하는 핵심 기준이다.

julien Tromeur / Unsplash