본문으로 건너뛰기

[논문리뷰] Omni-IO Skills: Harnessing Your Agent Omni-Native

링크: 논문 PDF로 바로 열기

저자: Yanlin Li, Mingyang Hao, Shengqiong Wu, et al.

1. Key Terms & Definitions (핵심 용어 및 정의)

본 논문은 범용 에이전트의 멀티모달 역량을 확장하기 위한 Omni-IO Skills 시스템을 제안하며, 이 과정에서 다음과 같은 핵심 용어들을 사용한다.

  • Agent Harness: 범용 에이전트의 추론 코어를 변경하지 않고도 외부 도구 및 기능에 접근하고 조율할 수 있도록 하는 시스템 레이어이다. 이는 에이전트에게 지속적인 실행을 위한 운영 기반을 제공한다.
  • Hierarchical Skills: Atomic Skills, Expert Skills, Scenario Skills의 세 가지 레벨로 구성된 계층적 지식 표현 체계로, 재사용 가능한 절차적 지식을 조직화하여 복잡한 멀티모달 태스크를 추상화하고 실행한다.
  • Declare Execution Graph (DEG): 멀티모달 워크플로우를 구성하는 태스크 노드들과 그들 간의 제어 및 데이터 의존성을 명시적으로 표현하는 방향성 비순환 그래프(DAG)이다. 이를 통해 병렬 실행과 효율적인 자원 조율이 가능해진다.
  • Asset Registry: 사용자 제공, 중간, 그리고 최종 결과물을 위한 공유 데이터 추상화 계층으로, 물리적 파일 경로와 독립적인 고유 asset_id를 통해 자산의 추적성과 재사용성을 보장한다.
  • Semantic–Quality Coupled Score (SQCS): 생성된 응답의 의미적 정확성(semantic correctness)과 생성 품질(generation quality)을 종합적으로 평가하는 지표이다.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

일반적인 목적의 에이전트(General-purpose agents)는 장기적인 계획(long-horizon planning), 추론(reasoning), 그리고 행동(acting) 능력을 가지고 있지만, 텍스트, 이미지, 오디오, 비디오, 문서, 3D 자산, 코드 등 다양한 모달리티(modality)에 걸쳐 생산 능력(production capabilities)이 단편적이라는 한계가 있다. 기존 Foundation Model을 새로운 모달리티로 확장하는 것은 막대한 모델 업데이트 비용을 수반하며, 전문 모델(specialist models)과 도구(tools)를 통합하는 방식은 절차, 의존성, 중간 자산(intermediate assets), 그리고 턴(turn) 간 수정(cross-turn revisions)의 조정 문제를 해결하지 못한다. 저자들은 이러한 한계를 극복하고 이질적이며 지속적으로 진화하는 기능들을 일관된 애플리케이션 수준의 워크플로우로 통합할 수 있는 시스템 레이어, 즉 Omni-modal Agent Harness의 필요성을 강조한다. 본 연구의 핵심 문제는 플러그 앤 플레이 방식의 Harness를 통해 기존 범용 에이전트의 추론 코어(reasoning core)를 변경하지 않고도 에이전트를 omni-native하게 만들 수 있는지 여부이다.

3. Method & Key Results (제안 방법론 및 핵심 결과)

본 논문은 범용 에이전트를 omni-native하게 만드는 플러그 앤 플레이 Agent Harness인 Omni-IO Skills를 제안한다. 이 시스템은 Hierarchical Skills, 표준화된 멀티모달 실행 인터페이스, Dependency-Aware Orchestration, 그리고 영구적인 Asset Registry를 통해 구현된다. 시스템 아키텍처는 Skill Entry, MCP Tool Service, Provider and Configuration, Asset Registry의 네 가지 계층으로 구성되어 있으며 [Figure 3], 이는 태스크 지식, 도구 인터페이스, 서비스 구현 및 영구적 결과물을 분리하여 에이전트가 특정 공급자나 작업 공간 경로에 얽매이지 않고 멀티모달 태스크를 계획할 수 있도록 한다.

Figure 3: Omni-IO Skills 아키텍처 개요

Figure 3 — Omni-IO Skills 아키텍처 개요

Hierarchical Skills는 Atomic Skills, Expert Skills, Scenario Skills로 구성되며 [Figure 4], Scenario Skills는 애플리케이션 수준의 목표를 조정하고, Expert Skills는 재사용 가능한 생산 워크플로우를 캡슐화하며, Atomic Skills는 실행 가능한 기본 기능을 제공한다. 예를 들어, 제품 프로모션 요청 시 S5 Event Material Scenario Skill이 E1 Poster Design과 E2 Complex Video Production을 통해 여러 Atomic Skills로 확장되고, 이들의 의존성이 Declare Execution Graph (DEG)를 형성하여 순차적인 Wave 실행을 결정한다 [Figure 5].

Figure 5: Omni-IO Skills 런타임 워크플로우

Figure 5 — Omni-IO Skills 런타임 워크플로우

실험은 UniM-90 벤치마크에서 GPT-5.6 Sol과 Claude Sonnet 5를 호스트 에이전트로 사용하여 수행되었다. Omni-IO Skills를 적용한 결과, 두 에이전트의 Input-Support Rates는 각각 40.00%와 38.89%에서 100%로 증가했다 [cite: 1, Table 3]. 이는 오디오, 비디오, 문서, 3D 콘텐츠 등 이질적인 멀티모달 입력 및 출력을 처리하는 기본 에이전트의 한계를 효과적으로 해결했음을 보여준다. Semantic–Quality Coupled Score (SQCS)는 GPT-5.6 Sol의 경우 26.99에서 74.94로, Claude Sonnet 5의 경우 27.82에서 77.78로 각각 47.95 및 49.96 퍼센트 포인트 상승했다 [cite: 1, Table 3]. 또한, Strict Structure Score는 GPT-5.6 Sol에서 100.00%, Claude Sonnet 5에서 99.78%에 도달하여, 멀티모달 도구 호출, 자산 조직화, 그리고 출력 구조 제어 측면에서 Omni-IO Skills의 효과를 입증했다 [cite: 1, Table 3].

4. Conclusion & Impact (결론 및 시사점)

본 논문은 범용 에이전트를 omni-native하게 만들면서도 그들의 추론 코어를 변경하지 않는 플러그 앤 플레이 Agent Harness인 Omni-IO Skills를 성공적으로 제안했다. 이 시스템은 계층적 Skills를 통해 멀티모달 기능을 조직하고, 복잡한 요청을 의존성을 인식하는 Declare Execution Graph (DEG)로 매핑하며, 교체 가능한 전문 백엔드(specialist backends)를 통해 태스크를 라우팅하고, 영구적인 Asset Registry를 통해 생성된 결과물을 보존한다. 이러한 접근 방식은 UniM-90 벤치마크에서 GPT-5.6 Sol 및 Claude Sonnet 5와 같은 에이전트의 Input-Support Rates를 100%로 끌어올렸으며, Semantic–Quality Coupled Score와 Strict Structure Score에서 상당한 개선을 보였다 [cite: 1, Table 3]. 이 연구는 Harness 수준의 구성이 Omni capability로 나아가는 실용적인 경로를 제공하며, 절차, 공급자, 자산을 독립적으로 확장할 수 있게 하여 학계 및 산업계에서 이질적인 미디어와 재사용 가능한 결과물을 조정하는 다중 턴(multi-turn) 생산 워크플로우를 위한 애플리케이션 지향적 기반을 제공한다.

Figure 1: Omni-IO Skills 개요

Figure 1 — Omni-IO Skills 개요

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글