본문으로 건너뛰기

[논문리뷰] Harness-Zero: Harness Distillation via Agent-as-Harness

링크: 논문 PDF로 바로 열기

저자: Haoran Ye, Yuxing Lu, Haonan Dong, Zhaochen Su, Guojie Song et al.

1. Key Terms & Definitions (핵심 용어 및 정의)

  • Agent Harness (harness): LLM Agent의 모델-환경 상호작용을 중재하는 외부 시스템으로, 툴 사용, Context 및 State 관리, 환경과의 상호작용 제어 등 전반적인 Agent 성능 향상에 필수적인 요소입니다.
  • Agent Harness Distillation: 도메인 또는 인스턴스에 최적화된 Harness가 유도하는 Behavior를 훈련 시 Guidance로 활용하여, 해당 Behavior를 모델 Weight로 전이시키는 프로세스를 의미합니다.
  • Agent-as-Harness: 최적화된 Harness의 Guidance를 기반으로 작동하는 Harnessing Agent가 Student Agent의 Response를 Target Harness의 Action Space에 맞춰 교정함으로써, Harness Guidance를 모델 훈련을 위한 Training Demonstration으로 변환하는 방법론입니다.
  • Target Harness (h): 배포 시 Student Agent가 고정적으로 사용하는 최소한의 기본 운영 Harness입니다.
  • Evolved Student-side Harness (h*): Meta-Harness와 같은 자동화된 Harness 최적화 방법을 통해 훈련 Task에서 진화된 Student Agent 측의 Harness를 지칭합니다.
  • Private Reference Harness (𝒦): **Evolved Student-side Harness (h*)**를 Harnessing Agent가 내부적으로 활용할 수 있도록 Adaptation한 Harness로, Student Agent에게는 직접적으로 노출되지 않습니다.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

LLM Agent의 성능은 기반 모델뿐만 아니라 외부 시스템인 Harness의 설계에도 크게 의존하지만, 기존의 Harness 최적화 기법은 그 이점이 배포 시점에 해당 Harness에 종속된다는 핵심적인 한계를 가집니다. 최적의 Harness는 처리하는 도메인, 특정 인스턴스, 그리고 사용되는 기반 모델에 따라 상이하게 변화하므로, 범용적인 Agent를 구축하기 위해서는 모든 상황에 대해 차선책인 공유 Harness를 수용하거나, 끝없이 증가하는 수많은 특화된 Harness 세트를 유지 관리해야 하는 비효율성에 직면합니다. 이러한 방식은 Harness 개선을 모델의 내재된 역량으로 전환하지 못하며, 결과적으로 Harness 최적화를 통해 얻은 성능 향상이 모델의 파라미터에 통합되지 않고 외부 Scaffold에 머무르게 됩니다. 따라서 본 연구는 Harness의 성능 향상을 모델 자체의 행동 양식으로 전이하여, 배포 시 외부 Harness의 의존성을 줄이고 모델의 내재된 능력을 강화할 수 있는 새로운 접근 방식의 필요성을 강조합니다.

3. Method & Key Results (제안 방법론 및 핵심 결과)

본 논문은 최적화된 Harness의 Behavior를 모델 파라미터에 전이하는 프레임워크인 Harness-Zero를 제안합니다. 이 방법론은 세 가지 주요 단계로 구성됩니다: 첫째, 훈련 Task에서 Student Agent를 위한 **Evolved Student-side Harness (h*)**를 진화시키고, 이를 별도의 Harnessing Agent가 사용할 수 있는 Private Reference Harness (𝒦)로 Adaptation하는 과정입니다. 둘째, Agent-as-Harness 메커니즘을 통해 Training Trajectory를 수집합니다. 여기에서 Harnessing Agent는 Student Agent의 Response Loop를 감싸고, Target Harness (h)의 Action Space 내에서 Student가 제안하는 Response를 검토하여 𝒦의 Guidance에 따라 필요시 교정합니다. 이 교정된 Response만이 Student의 Context에 포함되어 실행되며, Harnessing Agent의 사적인 검토 과정은 Student에게 공개되지 않습니다 [cite: 1, Figure 1]. 셋째, 이렇게 수집된 Reviewed Trajectory를 활용하여 Supervised Fine-Tuning (SFT)을 수행하고, Harness가 유도하는 Behavior를 Student Model의 파라미터에 Internalization합니다. 배포 시에는 Evolved Harness (h*), Private Reference Harness (𝒦), 그리고 Harnessing Agent가 모두 제거된 상태에서, Distilled Student Model이 Target Harness (h)만을 사용하여 작동하도록 합니다.

실험 결과는 Harness-Zero의 효과와 우수성을 명확히 보여줍니다.

  • 첫째, Agent-as-Harness는 Frontier LLM에 대해 Code-as-Harness를 능가하는 성능을 입증했습니다. 세 가지 도메인에 걸친 6가지 벤치마크-모델 설정에서 Agent-as-Harness는 평균 81.1%의 Task Success를 달성하여, Code-as-Harness의 평균 78.1%를 유의미하게 앞섰습니다 [cite: 1, Table 1]. 이는 Agent-as-Harness가 모델 업데이트에 대한 더 나은 Adaptability를 제공하며, Harness Guidance를 Inference 시점에 유연하게 해석하고 적용할 수 있음을 시사합니다.
  • 둘째, Harness Distillation 후 Specialized Harness를 제거한 상태에서도 Harness-Zero는 기본 모델의 성능을 크게 향상시켰습니다. 기본 모델이 Target Harness (h)만으로 23.3%의 Macro-average Task Success를 보인 반면, Harness-Zero를 통해 Distillation된 모델은 44.3%를 달성하여 21.0%p의 절대적 성능 향상을 기록했습니다 [cite: 1, Table 2]. 이는 심지어 **Evolved Harness (h*)**가 부착된 상태의 기본 모델 성능인 41.7%보다도 높은 수치입니다 [cite: 1, Table 2].
  • 셋째, Harness-Zero는 **Evolved Harness (h*)**에 의해 유도되었으나 기본 모델에는 부재했던 행동 패턴들을 성공적으로 Recovery했습니다. SpreadsheetBench, AppWorld, USPTO Retrosynthesis 세 도메인에서 총 28가지 Harness-exclusive Behaviors를 분석한 결과, 평균 82.3%의 높은 Recovery Rate를 보였습니다 [cite: 1, Table 4]. 이는 Harness-Zero가 Memory, Skill, Tool, Middleware 등 다양한 Harness 소스에서 비롯된 복잡한 행동 양식들을 모델의 내부에 효과적으로 Internalization했음을 직접적으로 입증합니다.

4. Conclusion & Impact (결론 및 시사점)

Harness-Zero는 진화된 **Student-side Harness (h*)**를 Training Supervision으로 전환하여, 고정된 Target Harness (h) 하에서 Harness가 유도하는 Behavior를 모델 파라미터에 전이하는 혁신적인 프레임워크를 제시합니다. 본 연구의 Agent-as-Harness 방법론은 Frontier Model에서 Code-as-Harness를 능가하는 성능을 보였으며, Harness가 제거된 배포 환경에서도 Optimized Harness의 이점을 성공적으로 유지할 수 있음을 실증했습니다. 특히, Harness-Zero를 통해 Distilled Model이 Harness-exclusive Behaviors를 높은 Recovery Rate로 Internalization한다는 점은, Harness 최적화를 통해 발견된 지식과 행동 양식들을 모델 자체의 내재된 능력으로 효과적으로 전환할 수 있음을 강력하게 시사합니다. 이 연구는 Agent Harness 분야에서 새로운 패러다임을 제시하며, 다양한 도메인과 Task에 걸쳐 개발된 행동 및 지식들이 외부 Scaffold에 파편화되지 않고 모델 파라미터에 축적될 수 있는 길을 열었습니다. 이는 더 나은 모델이 더 나은 Harness를 구축하고, 각 Harness가 얻은 이점을 모델 Weight에 다시 되돌리는 Recursive Self-Improvement의 확장 가능한 원천이 될 잠재력을 가지며, Agent System의 지속적인 발전에 중대한 영향을 미칠 것으로 기대됩니다.

Figure 1: Harness-Zero 전체 개요

Figure 1 — Harness-Zero 전체 개요

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글