본문으로 건너뛰기

[논문리뷰] RecHarness: A Bandit-Routed Agentic Harness for Self-Evolving Recommender Systems

링크: 논문 PDF로 바로 열기

메타데이터

저자: Haoran Ling, Yuecheng Li, Zeyu Song, et al.


## 1. Key Terms & Definitions (핵심 용어 및 정의)

  • RecHarness: 추천 시스템의 자동화된 모델 최적화와 반복적 개선을 지원하는 Bandit-Routed Agentic Harness입니다.
  • Bandit Router: 검증 데이터(Validation feedback)를 기반으로 탐색(Exploration)과 활용(Exploitation)의 균형을 맞추며, 다음에 시도할 모델 수정 방향을 결정하는 핵심 컨트롤러입니다.
  • Experiment Skill: 추천 모델의 학습 과정에서 얻은 데이터(성공/실패 이력, 검증 패턴 등)를 요약하여 LLM이 더 나은 개선 가설과 코드를 생성하도록 돕는 문맥적 지식 베이스입니다.
  • Jump-basin Mechanism: 모델 최적화가 국소적 개선(Local basin)에 정체되었을 때, 이를 감지하여 구조적 변화(Structural-jump)를 시도하도록 유도하는 메커니즘입니다.
  • Thompson Sampling: 각 arm(수정 방향)의 성공 확률 분포를 관리하며, 불확실성과 과거의 성과를 반영하여 효율적인 trial 할당을 수행하는 확률적 의사결정 기법입니다.

## 2. Motivation & Problem Statement (연구 배경 및 문제 정의) 본 논문은 추천 시스템 개발 과정에서 반복적인 수동 엔지니어링 작업이 소요되는 문제를 자동화된 방식으로 해결하고자 합니다. 기존의 LLM 기반 MLE(Machine Learning Engineering) 에이전트들은 탐색 방향을 무분별하게 선택하거나, 각 실험마다 높은 컴퓨팅 비용과 시간이 소요되는 문제로 인해 탐색 효율이 낮다는 한계가 있습니다. 특히 추천 시스템은 단순히 하나의 모델을 생성하는 것이 아니라 데이터와 평가 지표에 따라 지속적으로 진화해야 하는 특성을 지니고 있으므로, 단순한 스칼라 성능 점수에 의존하는 방식으로는 효과적인 최적화가 불가능합니다. 이를 해결하기 위해 저자들은 성능 검증 결과를 지능적으로 해석하고, 구조적인 엔지니어링 지식을 결합하여 적은 trial 비용으로 모델을 진화시키는 체계적인 프레임워크를 제안합니다 [Figure 1].

## 3. Method & Key Results (제안 방법론 및 핵심 결과) RecHarness는 최적화 과정을 인간이 정의한 arm 내에서 Bandit Router가 효율적인 경로를 할당하고, LLM이 그에 맞는 구체적인 코드 수정안을 생성하는 3단계 계층적 구조로 설계되었습니다. 구체적으로는 Thompson Sampling을 사용하여 과거 성공 확률에 기반해 최적의 편집 방향을 라우팅하며, Experiment Skill을 통해 누적된 학습 로그와 실패 사례를 바탕으로 LLM의 가설 생성을 정교화합니다. 모델이 더 이상 성능 향상을 보이지 않는 정체 구역에 도달하면 Jump-basin Mechanism을 활성화하여 과감한 아키텍처 수정을 유도합니다. 실험 결과, RecHarness는 SASRecHSTU와 같은 강력한 모델 기반 환경에서도 기존 Baseline 대비 압도적인 성능 향상을 보였습니다. 예를 들어, GRU4Rec baseline에서 HR@10 지표가 85.85% 개선되었으며, 다양한 데이터셋과 평가 지표에서 일관된 우위를 점했습니다 [Table 3]. 또한 실제 산업 규모의 단기 영상 광고 시스템에서 7일간의 온라인 A/B 테스트를 진행한 결과, ADVV(Advertiser Value) 2.084%, 수익(Revenue) 0.534%, 노출(Exposure) 0.559%의 유의미한 비즈니스 지표 개선을 달성했습니다 [Table 6].

## 4. Conclusion & Impact (결론 및 시사점) RecHarness는 추천 시스템의 모델 반복 최적화를 Bandit 이론과 LLM 에이전트 프레임워크로 성공적으로 통합한 선도적인 연구입니다. 본 연구는 추천 시스템 엔지니어링이 단순히 무작위적인 시도(Trial-and-error)를 넘어, 과거의 실험 자산을 재사용하고 효율적인 탐색 방향을 스스로 결정하는 'Self-evolving' 시스템으로 나아갈 수 있음을 시사합니다. 이러한 접근 방식은 특히 대규모 추천 시스템을 운영하는 산업계에서 실험 비용을 획기적으로 줄이고, 모델의 비즈니스적 성능을 극대화하는 데 핵심적인 기여를 할 것으로 기대됩니다.


Part 2: 중요 Figure 정보

Figure 1: RecHarness 전체 아키텍처

Figure 1 — RecHarness 전체 아키텍처

Figure 2: SASRec 기반 성능 비교

Figure 2 — SASRec 기반 성능 비교

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글