[논문리뷰] From Proprietary to Open-Source: Bridging the Distribution Gap via Multi-Agent Protocol Distillation in Agentic Search
링크: 논문 PDF로 바로 열기
메타데이터
저자: Junlin Liu, Jiangwang Chen, Zixin Song, Shuaiyu Zhou, Chunji Lv, Hank Wu, Kailin Jiang, Jinyang Wu, Bohan Yu, Chenxi Zhou
1. Key Terms & Definitions (핵심 용어 및 정의)
- Agentic Search: LLM이 다단계 추론과 환경(Wikipedia 등) 탐색을 결합하여 지식 집약적 문제를 해결하는 상호작용 패러다임입니다.
- Structured JSON Protocol: 데이터의 핵심 논리 구조(Task Type, Reasoning Plan, Grounding Facts 등)를 정형화하여, 모델 특유의 문체나 지엽적인 서술을 제거한 중간 표현 계층입니다.
- MAPD (Multi-Agent Protocol Distillation): Proprietary Teacher 모델의 능력을 Open-Source Student 모델로 이전하기 위해, 구조화된 프로토콜을 Privileged Information으로 활용하는 공동 증류 및 강화학습 프레임워크입니다.
- OPSD (Online Policy Self-Distillation): Student 모델의 두 브랜치(기본 브랜치 vs. Privileged 브랜치) 사이의 Per-token 분포를 KL Divergence를 통해 정렬하는 학습 기법입니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 Agentic Search 최적화 시 발생하는 Sparse Supervision 문제와 Proprietary-to-Open-Source 지식 증류의 제약사항을 해결하는 것을 목표로 합니다. [Figure 1] 기존의 RLVR(Reinforcement Learning from Verifiable Rewards)은 최종 결과에만 의존하여 중간 과정에 대한 밀도 높은 지도 신호를 제공하지 못합니다. 또한, 성능이 뛰어난 Proprietary 모델의 지식을 증류할 때 Tokenizer 불일치 및 Logit 접근 불가 문제가 발생하며, 단순한 자연어 궤적 모방은 모델의 Style Drift와 Hallucination을 야기하여 증류 효율을 저하시킵니다 [Figure 1].

Figure 1 — 기존 증류의 한계점
3. Method & Key Results (제안 방법론 및 핵심 결과)
본 논문은 MAPD 프레임워크를 제안하여 구조화된 프로토콜을 통해 Teacher의 핵심 추론 전략만을 Student에게 전달합니다 [Figure 2]. 우선, 오프라인 단계에서 MAS(Multi-Agent System)가 쿼리를 분해하고, 증거를 수집하며, 실패한 탐색을 교정한 후 이를 JSON Protocol로 변환합니다. 학습 단계에서는 이 프로토콜을 Privileged 정보로 사용하여 OPSD를 수행하고, 이와 동시에 GRPO를 통한 Sparse RL 목표를 최적화하여 모델을 정렬합니다. 실험 결과, MAPD는 Qwen3-1.7B 모델에서 39.4%, Qwen3-4B 모델에서 44.4%의 평균 성공률을 기록하며 가장 강력한 Baseline인 SDAR 대비 우수한 성능을 보였습니다 [Table 1]. 또한, λ=0.05의 가중치 설정이 추론 능력과 안정성 사이의 최적 균형을 제공함을 확인하였습니다 [Table 3, Figure 3].

Figure 2 — MAPD 프레임워크 개요
4. Conclusion & Impact (결론 및 시사점)
본 연구는 구조화된 프로토콜 증류를 통해 Proprietary 모델과 Open-Source 모델 간의 분포 격차(Distribution Gap)를 효과적으로 해소하였습니다. 제안된 MAPD는 Teacher의 모델 종류에 구애받지 않는 강건한 전이 능력을 입증하였으며 [Figure 4], 이는 학계와 산업계에서 고가의 모델을 활용해 효율적인 경량화 모델을 구축하는 데 중요한 기술적 토대를 마련합니다. 특히, 데이터 효율성과 추론 정밀도를 동시에 달성함으로써 향후 Agentic 시스템 학습 표준으로서의 가치를 제시합니다.

Figure 3 — 손실 가중치 λ와 성능 관계
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance
- [논문리뷰] Agon: Competitive Cross-Model RL with Implicit Rival Grading of Reasoning
- [논문리뷰] Solvita: Enhancing Large Language Models for Competitive Programming via Agentic Evolution
- [논문리뷰] A Survey of On-Policy Distillation for Large Language Models
- [논문리뷰] Agentic-R: Learning to Retrieve for Agentic Search
Review 의 다른글
- 이전글 [논문리뷰] FilmBench: A Film-Grade Benchmark for Cinematic Video Generation
- 현재글 : [논문리뷰] From Proprietary to Open-Source: Bridging the Distribution Gap via Multi-Agent Protocol Distillation in Agentic Search
- 다음글 [논문리뷰] GNM Head: A Generative aNthropometric Model of the human head
댓글