반응형

https://arxiv.org/abs/2601.03233

2026.1.6
[LTX-2: Efficient Joint Audio-Visual Foundation Model] : 오픈소스 오디오-비주얼 파운데이션 모델

LTX-2는 텍스트를 통해 시각적 요소와 청각적 요소가 완벽하게 결합된 콘텐츠를 생성하는 오픈 소스 시청각 기초 모델입니다. 이 시스템은 고해상도 영상을 담당하는 14B 매개변수의 비디오 스트림과 소리를 생성하는 5B 매개변수의 오디오 스트림이 서로 정보를 교환하는 비대칭 듀얼 스트림 트랜스포머 구조를 채택하여 연산 효율성을 극대화했습니다. 특히 두 매개변수 간의 양방향 교차 주의 메커니즘(Bidirectional Cross-Attention)을 통해 입 모양과 음성이 일치하는 정교한 시청각 동기화를 구현하며, '생각하는 토큰' 기술을 도입해 복잡한 명령어도 정확하게 이해합니다. 결과적으로 이 모델은 기존 유료 모델에 필적하는 높은 품질의 결과물을 훨씬 빠른 속도로 제작할 수 있는 강력하고 효율적인 멀티모달 프레임워크를 제공합니다.

 
14B 파라미터 규모의 비디오 스트림과 5B 파라미터 규모의 오디오 스트림을 결합한 비대칭 듀얼스트림 트랜스포머 구조를 사용하며, 오픈소스 모델 중 최고 수준의 오디오비주얼 품질과 프롬프트 충실도를 달성했고 상용(proprietary) 모델과 비슷한 결과를 훨씬 낮은 연산 비용 소요

 
그림 1 :LTX-2 아키텍처 개요 . 원시 비디오 및 오디오 신호는 인과적 VAE를 통해 모달리티별 잠재 토큰으로 인코딩되고, 텍스트는 정교한 임베딩 파이프라인을 통해 처리됩니다. 이중 스트림 확산 변환기는 양방향 시청각 교차 주의 및 텍스트 컨디셔닝을 통해 오디오 및 비디오 잠재 토큰의 노이즈를 동시에 제거하여 동기화된 시청각 출력을 생성합니다.
 
 

그림 4 :텍스트 이해 파이프라인 개요. 텍스트 프롬프트는 Gemma3에 의해 인코딩되고, 특징 추출기 및 텍스트 커넥터를 통해 정제되어 모달리티별 DiT를 구성합니다.
 

728x90
반응형
Posted by Mr. Slumber
,