[논문리뷰] SKT: Skill-Use Training at Scale via Verified Synthetic Data Generation
링크: 논문 PDF로 바로 열기
메타데이터
저자: Zelin Tan, Yiqun Zhang, Hao Li, Zhiyao Cui, Hejia Geng, Shao Zhang, Hangfan Zhang, Yang Chen, Xiaosong Wang, Lilong Wang, Zhenfei Yin, Shuyue Hu, Chen Zhang, Lei Bai
1. Key Terms & Definitions (핵심 용어 및 정의)
- Agent Skill: LLM 에이전트가 외부 도구나 절차적 지식을 활용하기 위해 로드할 수 있는 지침, 메타데이터, 리소스의 패키지입니다.
- SKT (Skill-use Training): 2,000개의 공개 기술(skills)을 활용하여 solvability와 verifiability가 보장된 4,000개의 태스크와 27,164개의 실행 Trajectory를 생성하는 데이터 합성 파이프라인입니다.
- SkillEval: SKT 파이프라인으로 생성된 Held-out executable benchmark로, 모델의 Skill-use 능력을 객관적으로 평가하기 위해 설계되었습니다.
- Verification Pipeline: Rule-based, Agent-based 검증을 통해 태스크의 난이도를 조절하고, 올바른 Skill 사용이 포함된 성공적인 Trajectory만을 필터링하는 단계적 프로세스입니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 LLM이 단순히 Agent Skill을 보유하는 것을 넘어, 이를 적절한 시점에 식별하고, 실행하며, 복합적으로 활용할 수 있게 만드는 것을 목표로 합니다. 기존 연구들은 Skill의 검색이나 내부적 습득(internalization)에 치중하여, 모델이 외부 Skill을 효과적으로 이해하고 조정하는 실무적 능력 향상에는 한계가 있었습니다 [Figure 1]. 따라서 본 연구는 고품질의 합성 데이터를 통해 모델의 Skill-use 역량을 극대화하는 SKT 프레임워크를 제안합니다.

Figure 1 — SKT 파이프라인 개요
3. Method & Key Results (제안 방법론 및 핵심 결과)
본 논문은 Skill Curation, Task Synthesis, Trajectory Synthesis의 3단계로 구성된 SKT 파이프라인을 제안합니다 [Figure 2]. 각 태스크는 rule-based 및 agent-based 검증을 거치며, 통과하지 못한 태스크는 feedback-guided repair 루프를 통해 수정됩니다. 제안된 방법론의 핵심 성과는 다음과 같습니다:
- Qwen3.5-9B와 Gemma 4 E4B-IT 모델을 대상으로 SKT 데이터를 사용하여 SFT를 수행한 결과, 모든 벤치마크에서 기존 모델 대비 성능이 일관되게 향상되었습니다 [Table 1].
- 가장 큰 성능 향상은 SkillEval 벤치마크에서 확인되었으며, Qwen3.5-9B와 DeepAgents 조합의 경우 약 18.91포인트의 점수 상승을 기록했습니다.
- 데이터의 질적인 측면에서, 검증 과정이 없는 Unverified 파이프라인 대비 SKT를 거친 데이터로 학습했을 때 11.91~24.61포인트의 추가적인 성능 격차가 발생하여, 고품질 데이터의 중요성을 입증했습니다 [Figure 4].
- 학습한 Skill-use 행동은 다른 Agent Harness로도 높은 비율로 전이(Transfer)되며, 혼합 Harness 학습을 통해 단일 체크포인트로 다중 환경에 대응 가능함을 확인했습니다 [Figure 5].

Figure 2 — SKT의 전체 프로세스

Figure 4 — 검증 유무에 따른 성능 차이
4. Conclusion & Impact (결론 및 시사점)
본 연구는 고품질의 verified synthetic data generation이 LLM의 Skill-use 역량을 강화하는 데 필수적임을 증명합니다. SKT를 통해 생성된 학습 데이터는 모델이 외부 Skill을 효과적으로 활용하도록 돕고, 학습되지 않은 영역의 Skill 활용 능력까지 확장시킵니다. 이 연구는 범용적인 AI 에이전트의 안정성과 성능을 높이는 실무적인 데이터 합성 방법론을 제공하며, 향후 더 복잡한 에이전트 태스크를 해결하는 기초 연구로서 학계와 산업계에 중요한 기여를 할 것으로 기대됩니다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] Structured Distillation of Web Agent Capabilities Enables Generalization
- [논문리뷰] WebSailor-V2: Bridging the Chasm to Proprietary Agents via Synthetic Data and Scalable Reinforcement Learning
- [논문리뷰] SKILLER: Language-Level Reinforcement Learning for Reusable Skill Extraction in Small Language Models
- [논문리뷰] SkillZip: Contract-Preserving Graph Compression for Scalable Agent Skill Libraries
- [논문리뷰] SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs
Review 의 다른글
- 이전글 [논문리뷰] Roomer: Reflective Object-Grounded Model Editing and Repair for 3D Indoor Layout Synthesis
- 현재글 : [논문리뷰] SKT: Skill-Use Training at Scale via Verified Synthetic Data Generation
- 다음글 [논문리뷰] SWE-Touch: Benchmarking Coding Agents When Users Touch the Code
댓글