월드 모델에서 월드 액션 모델로: 로봇 학습을 위한 실용적인 분류 체계
(dev.to)로봇 학습의 난제인 시각적 예측과 실제 동작 제어 사이의 간극을 메우기 위해, 미래 영상과 행동 시퀀스를 통합적으로 모델링하는 '월드 액션 모델(WAM)'의 새로운 분류 체계와 구현 패러다임이 제시되었습니다.
이 글의 핵심 포인트
- 1월드 액션 모델(WAM)은 미래 시각 정보와 행동 시퀀스의 공동 분포를 학습하여 예측과 실행의 간극을 해소함
- 2'Imagine-Then-Execute' 방식은 모듈성이 높으나 예측 오류가 동작 실패로 이어질 수 있는 위험이 있음
- 3비디오 특징 기반 액션 예측은 연산 비용이 저렴하지만 모델의 내부 판단 과정을 시각적으로 확인하기 어려움