반응형

https://arxiv.org/pdf/2604.16503

2026.5.19
[Motif-Video 2B: Technical Report]

이 기술 보고서는 Motif-Video 2B라는 텍스트-비디오 생성 모델의 설계와 훈련 과정을 상세히 다루며, 거대 모델과 방대한 데이터에 의존하는 기존의 추세를 효율적인 아키텍처 전문화를 통해 극복할 수 있음을 입증합니다. 모델의 핵심은 초기 모달리티 융합, 공동 표현 학습, 세부 사항 복원이라는 세 가지 역할을 분리한 3단계 구조에 있으며, 특히 비디오 토큰이 길어질 때 텍스트 정렬이 약화되는 문제를 공유 교차 주의(Shared Cross-Attention) 기법으로 해결했습니다. 연구진은 제한된 예산 내에서 성능을 극대화하기 위해 동적 토큰 라우팅과 초기 단계의 특징 정렬을 결합한 저비용 훈련 레시피를 도입하여 학습 효율을 획기적으로 높였습니다. 그 결과, Motif-Video 2B는 훨씬 더 큰 파라미터를 가진 기존 모델들을 상대로 VBench 벤치마크에서 우수한 성적을 거두며, 정교한 구조적 설계가 단순한 규모의 확장을 효과적으로 대체할 수 있다는 중요한 통찰을 제시합니다.

 

 

728x90
반응형
Posted by Mr. Slumber
,