반응형

https://arxiv.org/pdf/2507.13353

2026.3.17
[VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding]

이 논문은 긴 영상에서 사용자의 지시(Instruction)에 따라 핵심 장면을 지능적으로 선택하는 VideoITG 프레임워크를 소개합니다. 기존의 균등 샘플링 방식이 중요한 정보를 놓치는 한계를 극복하기 위해, 연구진은 50만 개의 정교한 주석이 담긴 VideoITG-40K 데이터셋을 구축하고 이를 자동화하는 VidThinker 파이프라인을 개발했습니다. 이 모델은 정적인 사물, 동적인 움직임, 혹은 전체적인 맥락 등 질문의 의도에 맞춰 가변적인 프레임 추출 전략을 구사하며, 적은 수의 프레임만으로도 방대한 데이터를 처리하는 효율성을 보여줍니다. 결과적으로 VideoITG는 다양한 비디오 거대 언어 모델(Video-LLMs)에 즉시 적용 가능한 플러그 앤 플레이 방식으로 설계되어, 복잡한 영상 이해와 논리적 추론 성능을 획기적으로 향상시킵니다.

 

비디오 대규모 언어 모델(Video-LLM)은 멀티모달 이해 및 추론 작업에서 상당한 잠재력을 보여왔지만, 비디오에서 가장 유용한 프레임을 효율적으로 선택하는 방법은 여전히 ​​중요한 과제입니다.

 

기존 방법들은 프레임 간 중복을 줄이거나 비지도 이벤트 위치 파악을 통해 프레임 샘플링을 최적화하려고 시도합니다.

그러나 이러한 접근 방식은 복잡한 지시 추종 작업이나 정확한 시간 모델링이 요구되는 시나리오를 처리하는 데 종종 한계를 보이며, 의미 정렬과 시간 추론 모두에서 성능 저하를 초래합니다.

 

이러한 문제를 해결하기 위해, 사용자 지시에 따라 프레임 샘플링 전략을 적응적으로 조정하는 프레임워크인 비디오 지시 시간적 접지(VideoITG)를 제안합니다. 구체적으로, 지시 조건에 따른 캡션 생성, 관련 비디오 세그먼트 검색, 효율적인 지도 학습을 가능하게 하는 핵심 프레임 선택 등을 통해 주석 작업을 자동화하는 VidThinker 파이프라인을 설계했습니다. VidThinker를 사용하여 4만 개의 비디오와 50만 개의 시간적 접지 주석으로 구성된 VideoITG-40K 데이터셋을 구축했습니다. 플러그 앤 플레이 방식의 VideoITG 모델은 Video-LLM의 시각-언어 정렬 및 추론 기능을 활용하여 프레임을 판별적으로 선택합니다. VideoITG는 여러 멀티모달 비디오 이해 벤치마크에서 지속적으로 성능을 향상시켜 그 효과와 잠재력을 입증합니다.

 

 

 

 

 

 

728x90
반응형
Posted by Mr. Slumber
,