본문으로 건너뛰기

[논문리뷰] OmniAssistBench: Assistant-style Interaction Benchmark for Omni-LLMs

링크: 논문 PDF로 바로 열기

메타데이터

저자: Xianyun Sun, Chaoyou Fu, Zhengye Zhang, Feiyang Duan, Qingyuan Cao, Yonghui Niu, Sihang Yuan, Ge Zhang, Caifeng Shan

1. Key Terms & Definitions (핵심 용어 및 정의)

  • Omni-LLMs: 텍스트, 오디오, 비디오 등 다중 모달 데이터를 동시에 처리하고 실시간으로 상호작용할 수 있는 대규모 언어 모델을 의미합니다.
  • Diverging Interaction Paths: 사용자의 동일한 목표를 달성하기 위해 어시스턴트의 응답에 따라 서로 다른 경로가 생성되는 현상을 지칭하며, 이는 일관된 평가를 방해하는 주요 요인입니다.
  • Proactive Response: 모델이 단순히 질문에 답하는 것을 넘어, 특정 이벤트가 발생할 때까지 기다리거나 자율적으로 대응 여부를 결정해야 하는 고난도 작업입니다.
  • Teacher Forcing: 다중 턴 작업 평가 시 이전 턴의 오류 누적을 방지하기 위해, 과거 모델 응답 대신 정답(Ground Truth)을 입력으로 제공하여 현재 턴의 성능을 측정하는 기법입니다.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 논문은 기존의 수동적인 비디오 이해 평가 방식이 실시간 상호작용 환경에서의 Omni-LLMs 성능을 측정하는 데 한계가 있음을 지적합니다. 기존 벤치마크는 정적 데이터를 활용하지만, 실제 인터랙티브 어시스턴트는 모델의 응답이 사용자의 후속 행동을 변화시키는 동적 상호작용을 수행해야 합니다 [Figure 1]. 이러한 상호작용의 경로 다양성(Path Diversity)은 일관된 정량적 평가를 어렵게 만드는 핵심 병목 현상입니다. 저자들은 이러한 문제를 해결하기 위해 사전 지식(Prior Knowledge)을 활용해 상호작용 경로를 고정하고, 실제 환경을 시뮬레이션할 수 있는 새로운 평가 프레임워크의 필요성을 제안합니다.

Figure 1: 인터랙티브 경로 고정 전략

Figure 1 — 인터랙티브 경로 고정 전략

3. Method & Key Results (제안 방법론 및 핵심 결과)

본 논문은 상호작용 경로를 고정하기 위해 비디오 콘텐츠로부터 도출된 사전 지식을 기반으로 한 OmniAssistBench를 제안합니다 [Figure 1]. 데이터셋은 1,000시간 이상의 전문가 수작업을 통해 구축되었으며, 기초적인 인지 능력을 평가하는 Basic Tier와 복합적인 목표 지향 작업을 평가하는 Advanced Tier의 이원적 구조로 설계되었습니다 [Figure 2, Figure 4].

평가 결과, proprietary 모델인 Gemini-3-Pro가 100점 만점에 66.4점을 기록하며 최고 성능을 보였고, 오픈소스 모델인 Qwen3-Omni-Instruct는 51.2점을 기록했습니다 [Table 2, Table 3]. 주요 발견점으로는 시각적 프롬프트(예: 제스처) 인식 실패, 긴 문맥 처리 중 발생하는 컨텍스트 손실, 그리고 적절한 시점에 반응하지 못하는 지연 응답(Delayed Response) 문제가 모델의 성능을 저하시키는 핵심 요인임이 밝혀졌습니다. 특히 Proactive Response 작업에서 모델들이 배경 소음을 사용자의 명령으로 오인하는 경향이 있음이 실험을 통해 증명되었습니다 [Figure 8].

4. Conclusion & Impact (결론 및 시사점)

본 연구는 Omni-LLMs의 실시간 상호작용 능력을 평가하기 위한 표준화된 OmniAssistBench를 구축함으로써 비디오 어시스턴트 분야의 평가 체계를 정립했습니다. 연구 결과는 현재 모델들이 기초적인 인식은 가능하지만, 장기 기억력(Long-term Memory) 및 복합적인 상황 맥락 이해 능력에서 여전히 상당한 개선이 필요함을 시사합니다. 이 벤치마크는 향후 더욱 신뢰할 수 있는 다중 모달 인터랙티브 AI 모델을 개발하기 위한 중요한 연구 이정표가 될 것입니다.

Figure 4: 데이터 구축 파이프라인

Figure 4 — 데이터 구축 파이프라인

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글