본문으로 건너뛰기

[논문리뷰] Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails

링크: 논문 PDF로 바로 열기

메타데이터

저자: Zhou Yu, Bin Bi, Shiva Kumar Pentyala, Shubham Mehrotra, Sougata Chaudhuri, Shilpa Bhagavath, Zeyuan Chen, Ran Xu, Phil Mui, James Zhu, Sitaram Asur


1. Key Terms & Definitions (핵심 용어 및 정의)

  • Agent Harness: 모델 주위를 감싸는 시스템 프롬프트, 도구 세트, 실행 훅(Execution hooks), 컨텍스트 관리 스캐폴딩 등 에이전트의 관측 및 행동 공간을 결정하는 제어 인프라를 지칭합니다.
  • Harness Evolution: 자동화된 검색을 통해 특정 모델의 성능을 극대화하도록 Harness의 구성 요소(프롬프트, 도구 등)를 반복적으로 최적화하는 과정을 의미합니다.
  • Model–Harness Fit: 모델이 자신의 고유한 Planning 스타일로 Harness가 제공하는 스캐폴딩을 얼마나 효과적으로 활용하여 태스크를 수행하는지에 대한 적합도를 뜻합니다.
  • On-Policy Expert Correction: 모델의 전체 궤적(Trajectory)을 모방(Imitation)하는 대신, 모델이 직접 수행한 Rollout에서 실패한 지점만을 식별하여 전문가 모델이 해당 턴만 수정해 주는 방식입니다.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 논문은 Harness Evolution을 통해 성능을 높인 작은 모델들이 전문가 모델의 궤적을 모방(Imitation)할 때 발생하는 성능 저하 문제를 해결하고자 합니다. 연구진은 Harness와 모델의 가중치를 독립적으로 최적화하는 것이 아니라, 두 레버를 결합하여 Synergistic Gains를 얻는 방법을 모색합니다. 기존 연구들은 단순한 전문가 궤적 모방이 모델의 성능을 향상시킬 것이라 가정했으나, 본 연구에서는 이러한 방식이 Harness와 모델 간의 Planning 스타일 불일치를 야기하여 오히려 성능을 크게 저하시킴을 발견했습니다 [Figure 1]. 특히, Harness가 특정 모델의 고유한 Planning 방식에 맞춰 진화했다는 점을 고려할 때, 외부 지식 주입이 이러한 Fit을 깨뜨리는 것은 매우 치명적인 문제로 작용합니다.

3. Method & Key Results (제안 방법론 및 핵심 결과)

저자들은 모델의 고유한 Planning 방식을 유지하면서 전문가의 지식을 학습할 수 있는 On-Policy Expert Correction 파이프라인을 제안합니다. 이 방법은 Meta-level MLE agent가 모델의 Rollout에서 실패한 턴을 국소적으로 식별하면, 전문가 모델이 해당 턴만 수정하여 학습 데이터를 생성하고, 이를 통해 LoRA-SFT를 수행하는 방식입니다 [Figure 1]. 실험 결과, 기존의 전역적 모방 학습(SFT-imit.)은 7개 기업용 태스크에서 평균 -14.9%p의 성공률 하락을 보였으나, 제안된 SFT-corr. 방식은 오히려 기존 대비 평균 +1.7%p의 성능 향상을 달성했습니다 [Table 1]. 특히, Planning defects 비율이 모방 학습 시 14.6%까지 급증했던 반면, 제안 기법 적용 시 1.8% 수준으로 유지되어 Harness Fit이 성공적으로 보존됨을 입증했습니다 [Table 3]. 이러한 결과는 Harness-Model co-evolution 루프를 안정적으로 구축할 수 있음을 시사합니다.

4. Conclusion & Impact (결론 및 시사점)

본 논문은 에이전트 성능 최적화를 위해 Harness와 모델을 공동 최적화할 때, 모방 학습보다 On-policy 기반의 국소적 교정이 필수적임을 증명했습니다. 연구진은 모델과 Harness 사이의 Fit이 고도로 최적화되어 있을 때 전역적 모방이 이를 방해하는 'Planning-strategy drift' 문제를 명확히 진단했습니다. 이 연구는 산업 현장에서 저비용 소형 모델을 고성능 에이전트로 전환하는 과정에 구체적인 가이드라인을 제공합니다. 향후 연구에서는 RL 기반의 강화 학습과 결합하여 모델 성능을 한계점까지 끌어올리고, Harness Evolution 단계부터 fine-tuning을 고려하는 Co-optimization 기법으로의 확장이 기대됩니다.

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글