반응형

https://arxiv.org/pdf/2603.19312

2026.6.3
[LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from Pixels]


간결하고 저차원적인 잠재 공간에서 시스템의 동적 진화를 예측하는 세계 모델 학습을 위한 프레임워크

이 연구는 픽셀 데이터로부터 환경의 변화를 예측하는 인공지능 모델인 LeWorldModel(LeWM)을 소개하며, 기존 모델들이 학습 과정에서 표현 붕괴를 막기 위해 복잡한 수식과 보조 장치에 의존하던 문제를 해결하고자 합니다. LeWM은 미래 상태 예측과 잠재 공간의 정규화(SIGReg)라는 단 두 개의 손실 함수만을 사용하여 모델을 안정적으로 종단간(end-to-end) 학습시키는 데 성공했습니다. 이 방식은 조정해야 할 하이퍼파라미터를 단 하나로 줄여 효율성을 극대화했으며, 기존 파운데이션 모델 기반 방식보다 최대 48배 빠른 계획 수립 속도를 구현하면서도 다양한 2D 및 3D 제어 작업에서 뛰어난 성능을 입증했습니다. 결과적으로 본 논문은 복잡한 휴리스틱 없이도 물리적 구조를 이해하는 가볍고 강력한 세계 모델을 구축할 수 있음을 보여줍니다.

 

JEPA(Joint Embedding Predictive Architectures)는 간결한 잠재 공간에서 세계 모델을 학습하기 위한 강력한 프레임워크를 제공하지만, 기존 방법들은 복잡한 다항 손실 함수, 지수 이동 평균, 사전 학습된 인코더, 또는 표현 붕괴를 방지하기 위한 보조 지도 학습에 의존하는 등 여전히 취약합니다.

 

본 연구에서는 원시 픽셀로부터 단 두 개의 손실 함수(차기 임베딩 예측 손실과 가우시안 분포를 따르는 잠재 임베딩을 강제하는 정규화 항)만을 사용하여 안정적으로 엔드투엔드 학습을 수행하는 최초의 JEPA인 LeWorldModel(LeWM)을 소개합니다.

 

이는 기존의 유일한 엔드투엔드 학습 방식과 비교하여 조정 가능한 손실 하이퍼파라미터 수를 6개에서 1개로 줄입니다. LeWM은 단일 GPU에서 몇 시간 만에 약 1,500만 개의 파라미터를 학습할 수 있으며, 다양한 2D 및 3D 제어 작업에서 경쟁력 있는 성능을 유지하면서 파운데이션 모델 기반 세계 모델보다 최대 48배 빠른 학습 속도를 보여줍니다.

 

제어 작업 외에도, LeWM의 잠재 공간이 물리량 분석을 통해 의미 있는 물리적 구조를 인코딩한다는 것을 보여줍니다. 예상치 못한 상황 평가를 통해 해당 모델이 물리적으로 불가능한 사건을 안정적으로 감지한다는 것이 확인되었습니다.

 

 

 

728x90
반응형
Posted by Mr. Slumber
,