월드 모델 (World Model) - 라이트릭스(Lightricks), LTX-2 (text-to-video model)
07.AI/12. AI 모델 2026. 8. 15. 04:41반응형
https://arxiv.org/abs/2601.03233
2026.1.6
[LTX-2: Efficient Joint Audio-Visual Foundation Model] : 오픈소스 오디오-비주얼 파운데이션 모델
LTX-2는 텍스트를 통해 시각적 요소와 청각적 요소가 완벽하게 결합된 콘텐츠를 생성하는 오픈 소스 시청각 기초 모델입니다. 이 시스템은 고해상도 영상을 담당하는 14B 매개변수의 비디오 스트림과 소리를 생성하는 5B 매개변수의 오디오 스트림이 서로 정보를 교환하는 비대칭 듀얼 스트림 트랜스포머 구조를 채택하여 연산 효율성을 극대화했습니다. 특히 두 매개변수 간의 양방향 교차 주의 메커니즘(Bidirectional Cross-Attention)을 통해 입 모양과 음성이 일치하는 정교한 시청각 동기화를 구현하며, '생각하는 토큰' 기술을 도입해 복잡한 명령어도 정확하게 이해합니다. 결과적으로 이 모델은 기존 유료 모델에 필적하는 높은 품질의 결과물을 훨씬 빠른 속도로 제작할 수 있는 강력하고 효율적인 멀티모달 프레임워크를 제공합니다.
14B 파라미터 규모의 비디오 스트림과 5B 파라미터 규모의 오디오 스트림을 결합한 비대칭 듀얼스트림 트랜스포머 구조를 사용하며, 오픈소스 모델 중 최고 수준의 오디오비주얼 품질과 프롬프트 충실도를 달성했고 상용(proprietary) 모델과 비슷한 결과를 훨씬 낮은 연산 비용 소요

그림 1 :LTX-2 아키텍처 개요 . 원시 비디오 및 오디오 신호는 인과적 VAE를 통해 모달리티별 잠재 토큰으로 인코딩되고, 텍스트는 정교한 임베딩 파이프라인을 통해 처리됩니다. 이중 스트림 확산 변환기는 양방향 시청각 교차 주의 및 텍스트 컨디셔닝을 통해 오디오 및 비디오 잠재 토큰의 노이즈를 동시에 제거하여 동기화된 시청각 출력을 생성합니다.

그림 4 :텍스트 이해 파이프라인 개요. 텍스트 프롬프트는 Gemma3에 의해 인코딩되고, 특징 추출기 및 텍스트 커넥터를 통해 정제되어 모달리티별 DiT를 구성합니다.
















728x90
반응형
'07.AI > 12. AI 모델' 카테고리의 다른 글
| AI 네오 랩(Neo Lebs) - 리버 AI (River AI), 개인 AI (0) | 2026.08.13 |
|---|---|
| LLM 추론 최적화 - NVIDIA, 고성능 AI 추론 어텐션 공동 설계 가이드 (0) | 2026.08.10 |
| LLM - 오픈 웨이트(Open Weight) - 강력한 모델을 훈련시킬 수 있는 역량이 급증하고 있습니다. (0) | 2026.08.10 |
| LLM 추론 최적화 - 딥러닝, Residual Networks (ResNet) (0) | 2026.08.09 |
| LLM 추론 최적화 - MemHarness 기억 재구성 시스템 (1) | 2026.08.09 |


