[논문리뷰] Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report
링크: 논문 PDF로 바로 열기
메타데이터
저자: TaoLive AIGC LLM Team, Yuhan Sun, Wenhao Lin, Yongdong Luo, Yibo Hu, Meiguang Jin, Junfeng Ma, Weihang Pan, Jiaxin Zhao, Zulong Chen
1. Key Terms & Definitions (핵심 용어 및 정의)
- Harness: 모델 가중치(weights)를 수정하지 않고도 Skills, Hooks, prompts, tools 등을 독립적으로 변경할 수 있게 하여 에이전트의 동작을 진화시키는 모듈형 프레임워크입니다.
- Harness Evolution: 모델 재학습 없이 Harness의 구성 요소를 수정하여 비즈니스 행동을 최적화하는 인간 주도(Human-in-the-loop)의 진화 프로세스입니다.
- HSA (Harness-State Augmentation): 모델이 특정 Harness 구성에 과적합(Overfitting)되지 않도록, 학습 데이터의 Skills, tools, prompt 구조 등을 의도적으로 변형하여 모델의 일반화 능력을 향상시키는 기법입니다.
- HAT (Harness-Aware Training): Harness의 다양한 상태를 학습 분포에 명시적으로 포함하여, 모델이 고정된 환경이 아닌 변화하는 Harness 환경에서도 안정적으로 동작하도록 훈련하는 방법론입니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 연구는 라이브 커머스 환경에서 실시간 대응이 필요한 디지털 아바타 에이전트가 고정된 Harness에 과적합되어 Harness 변화 시 성능이 급격히 저하되는 문제를 해결하고자 합니다. 기존의 작고 빠른 컴팩트 모델들은 특정 환경에 최적화된 채로 학습되어, 비즈니스 규칙이 변경될 때마다 재학습이 필요하거나 성능이 불안정해지는 한계가 있습니다. 반면, 거대 모델은 범용성은 높으나 실시간 서비스에 필요한 latency 요구사항을 충족하지 못합니다. 따라서 모델 가중치의 수정 없이 Harness 변화에 유연하게 대응하면서도 실시간성을 유지하는 에이전트 학습 프레임워크가 필수적입니다 [Figure 1].
3. Method & Key Results (제안 방법론 및 핵심 결과)
본 논문은 Harness 변화를 학습 분포에 통합하는 Harness-Aware Training (HAT) 프레임워크를 제안합니다. 먼저 HSA-SFT 단계를 통해 다양한 변형된 Harness 환경에서 고품질 Trajectory를 학습하여 도구 활용 및 추론 능력을 강화합니다. 이어 General OPD를 통해 범용적인 instruction-following 능력을 보존하고, 마지막으로 HSA-RL을 통해 에이전트가 스스로 변화하는 Harness에 적응하도록 강화학습을 수행합니다 [Figure 4].
실험 결과, 제안된 모델은 Live-Stream QA에서 94.8점을 기록하여 베이스 모델(80.3점) 및 기존 최신 모델 대비 우수한 성능을 입증했습니다. 특히, 기존의 Fixed-Harness SFT가 IFEval 벤치마크에서 일반 성능을 7.7점 하락시키는 것과 달리, HAT는 성능 저하 없이 83.5점의 높은 점수를 유지했습니다. 또한, NVIDIA H20 GPU 환경에서 P50 latency 3.4초, P95 latency 8.1초를 기록하여 실시간 배포 요구사항을 완벽히 충족했습니다 [Figure 2].
4. Conclusion & Impact (결론 및 시사점)
본 연구는 Harness-Aware Training을 통해 에이전트가 정적인 환경에 고착되지 않고 변화하는 비즈니스 요구사항에 맞춰 유연하게 진화할 수 있음을 증명했습니다. 이 프레임워크는 재학습 비용을 획기적으로 절감하면서도 복잡한 인터랙티브 에이전트의 신뢰성과 적응성을 크게 향상시킵니다. 실제 Taobao Live 프로덕션 환경에서의 A/B 테스트를 통해 GMV(Gross Merchandise Volume) 상승을 확인함으로써, 본 연구는 산업계 라이브 커머스 서비스의 AI 에이전트 구현을 위한 실질적인 가이드라인을 제시하였습니다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] Environment Evolution for Terminal Agents
- [논문리뷰] Influence-Directed Distillation: Solving the Diversity Bottleneck in Sampled-Token On-Policy Distillation
- [논문리뷰] Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement
- [논문리뷰] StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments
- [논문리뷰] Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher
Review 의 다른글
- 이전글 [논문리뷰] Thinking on Shots: Consistent Multi-Shot Video Editing with Agentic Reasoning
- 현재글 : [논문리뷰] Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report
- 다음글 [논문리뷰] Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO
댓글