본문으로 건너뛰기

[논문리뷰] OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding

링크: 논문 PDF로 바로 열기

메타데이터

저자: Jingbo Zhou, Yusai Zhao, Qi Bao, et al.

1. Key Terms & Definitions (핵심 용어 및 정의)

  • Long-Horizon Tasks: 단순한 요청을 넘어 평균 2시간 이상의 인간 노동력이 소요되는 복잡하고 지속적인 오피스 워크플로우를 의미합니다.
  • Economic Grounding: 각 태스크의 중요도를 정량화하기 위해 인간의 노동 시간(Human Labor Time)과 시장 가격 추정치(Task Price Proxy)를 데이터셋에 결합한 방식입니다.
  • Code-based Verification: 기존의 휴먼 평가나 LLM-as-a-judge의 주관성과 비용 문제를 해결하기 위해, Rubric을 실행 가능한 코드로 변환하여 객관적이고 재현 가능한 방식으로 최종 결과물을 평가하는 프로토콜입니다.
  • Usability Check: 결과물이 실질적으로 사용 가능한지(파일 열람 및 편집 가능 여부 등)를 검증하는 기초 평가 항목입니다.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 논문은 LLM Agent가 단순한 코딩을 넘어 실제 업무 현장에서 긴 시간 소요되는 오피스 워크플로우를 처리하는 능력을 평가하기 위한 표준화된 벤치마크의 부재 문제를 해결하고자 합니다. 기존의 생산성 벤치마크는 태스크의 경제적 가치를 개별적으로 주석(Annotation)하지 않거나, 단기적인 GUI 작업 위주로 구성되어 실무적인 '완성도'를 측정하기 어렵다는 한계가 있습니다. 또한, 모델 성능이 발전함에 따라 고정된 테스트 세트와 객관적인 평가 기준을 제공하는 OmegaUse-OfficeVal의 도입이 시급합니다 [Figure 1]. 저자들은 이를 위해 실제 업무 요구사항을 반영한 100개의 태스크를 구축하고, 경제적 가치와 결합된 새로운 평가 체계를 제안합니다.

Figure 1: 벤치마크 개요 및 파이프라인

Figure 1 — 벤치마크 개요 및 파이프라인

3. Method & Key Results (제안 방법론 및 핵심 결과)

본 논문은 실제 직무 현장에서 수집된 100개의 장기 프로젝트를 기반으로, 엄격한 필터링과 개인정보 보호 조치를 거쳐 구축된 OmegaUse-OfficeVal 프레임워크를 제안합니다 [Figure 5]. 이 프레임워크는 개별 태스크에 Human Labor TimeTask Price Proxy를 할당하여 모델의 경제적 기여도를 분석하며, UsabilityTask Completion을 포함한 정교한 Rubric을 통해 평가를 수행합니다 [Figure 4]. 실험 결과, 현재 최신 LLM(GLM-5.2, Qwen3.7-Plus 등)은 인간 Baseline 대비 약 64% 수준의 점수(최고점 17.91 vs 27.79)를 기록하며 여전히 품질 격차가 존재함을 확인했습니다 [Table 3]. 반면, 모든 LLM Agent는 인간보다 훨씬 저렴하고 빠르게 작업을 수행하여, 효율성 측면에서의 잠재력을 입증했습니다 [Figure 6]. 가치 가중 평가(Time-Weighted Score, Price-Weighted Score) 결과, 단순 평균 점수가 가장 높은 모델이 반드시 경제적으로 가장 중요한 태스크에서 우수한 성능을 보이는 것은 아님이 드러났습니다 [Table 3].

Figure 4: 경제적 주석 분포

Figure 4 — 경제적 주석 분포

Figure 6: 성능, 시간, 비용 비교

Figure 6 — 성능, 시간, 비용 비교

4. Conclusion & Impact (결론 및 시사점)

본 논문은 OmegaUse-OfficeVal을 통해 LLM Agent가 실제 오피스 업무를 수행하는 능력을 경제적 관점에서 종합적으로 평가할 수 있는 표준을 제시합니다. 연구 결과, LLM Agent는 생산성 도구로서의 비용 및 시간 효율성을 증명했으나, 전문가 수준의 결과물 품질을 보장하기까지는 기술적 발전이 더 필요함을 시사합니다. 이 벤치마크는 향후 연구자들이 더 효율적이고 정교한 Agent 아키텍처를 설계하는 데 있어 중요한 기준점으로 활용될 것입니다. 이는 학계뿐만 아니라 실제 기업 생산성 도구의 자동화 수준을 가늠하는 산업계에도 실질적인 가이드라인을 제공합니다.

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글