[논문리뷰] Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills
링크: 논문 PDF로 바로 열기
메타데이터
저자: Jianlyu Chen, Yuyang Hu, Hongjin Qian, et al.
1. Key Terms & Definitions (핵심 용어 및 정의)
- Operational Knowledge: 연구 모델(Model)과 운영 프레임워크(Harness) 사이의 누락된 계층으로, 특정 방법을 단순히 아는 것을 넘어 실제 구현하고 문제를 해결할 수 있게 만드는 도메인 특화 전문 지식입니다.
- DisCo: 연구 과제를 수행하는 과정에서 스스로 필요한 Skill을 생성(Creator mode)하고, 이를 활용해 연구를 효율적으로 수행(Researcher mode)하는 능동적 연구 에이전트 프레임워크입니다.
- Skill: 연구 도구, 알고리즘 구현 방법, API 사용법 등 특정 과제 수행에 필요한 지식을
SKILL.md(지식 인터페이스),references/(지식 기저),scripts/(실행 인터페이스)로 구조화하여 패키징한 단위입니다. - Skill Graph: 특정 소스(Repository 등)에서 추출된 여러 Skill들의 관계(의존성, 구성 등)를 정의한 네트워크 구조로, Progressive Disclosure 원칙에 따라 필요한 부분만 로드하여 사용할 수 있습니다.
- AREX-Skill Library: 1,000개의 오픈소스 ML Repository로부터 Distillation 과정을 거쳐 생성된 5,000개 이상의 검증된 Skill들이 저장된 라이브러리입니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 자율 연구 에이전트가 수행하는 머신러닝(ML) 연구 과정에서 겪는 도메인 특화 전문 지식 부족 문제를 해결하고자 합니다 [Figure 1]. 현재의 에이전트는 거대 모델(Model)의 추론 능력과 프레임워크(Harness)의 운영 능력에 의존하지만, 실제 연구 성공의 핵심인 '운영 지식(Operational Knowledge)'이 결여되어 있습니다. 이로 인해 에이전트는 반복적인 시행착오(Trial-and-error)에 많은 자원을 낭비하며, 과제 간 발견한 지식을 재사용하지 못하고 매번 새롭게 추론해야 하는 한계를 지닙니다. 저자들은 이러한 지식을 고정된 모델의 일부가 아닌, 외부에서 로드 가능한 Skill 형태로 추출하여 에이전트가 필요할 때 호출할 수 있는 새로운 구조를 제안합니다.
3. Method & Key Results (제안 방법론 및 핵심 결과)
저자들은 DisCo 프레임워크를 통해 Task-agnostic Distillation과 Task-oriented Distillation을 수행하며, 수집된 지식을 AREX-Skill Library에 저장하여 에이전트의 운영 상황(Operating context)으로 제공합니다 [Figure 2]. Task-agnostic Distillation은 미리 검증된 ML Repository들로부터 범용적인 Skill들을 사전에 생성하는 반면, Task-oriented Distillation은 구체적인 연구 과제가 주어졌을 때 필요한 지식을 현장에서 즉각적으로 추출하여 정교한 대응을 가능하게 합니다. 이렇게 생성된 Skill들은 검증 단계를 필수적으로 거쳐 신뢰성을 확보합니다. GPT-5.5 기반의 동일한 환경에서 실험한 결과, Skill을 탑재한 에이전트는 그렇지 않은 에이전트 대비 MLE-bench에서 134.3%, PaperBench에서 34.4%, FrontierCS에서 9.2%, PassNet에서 14.0% 향상된 성능을 기록했습니다 [Figure 3]. 이는 Skill 기반의 운영 문맥 추가가 에이전트의 효율성을 획기적으로 높임을 시사합니다.
4. Conclusion & Impact (결론 및 시사점)
본 논문은 '운영 지식(Operational Knowledge)'을 능동적으로 생성하고 재사용 가능한 Skill로 구조화하는 것이 자율 연구 에이전트의 성능을 최적화하는 핵심임을 입증했습니다. DisCo 프레임워크와 AREX-Skill Library는 모델의 파라미터 업데이트 없이도 실질적인 도메인 전문성을 확장할 수 있는 범용적인 해결책을 제시합니다. 이러한 접근 방식은 향후 자율 연구 에이전트가 복잡한 ML 프로젝트를 독립적으로 수행하는 데 필수적인 기반 기술로 자리 잡을 것으로 기대되며, 연구 생산성을 비약적으로 향상시킬 수 있는 중요한 이정표가 될 것입니다.
Part 2: 중요 Figure 정보

Figure 1 — 자율 연구 에이전트의 운영 지식

Figure 2 — DisCo 프레임워크 흐름도

Figure 3 — AREX-Skill 라이브러리 구조
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] Self-Improvements in Modern Agentic Systems: A Survey
- [논문리뷰] Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence
- [논문리뷰] Learning to Evaluate Before Improving: Automatic Rubric Induction for Automatic Research Agents
- [논문리뷰] Chain-of-Thought Faithfulness of Reasoning Models Varies with Where and How Preference Cues Are Delivered
- [논문리뷰] Looped Language Models Improve Compositional Tool Calling
Review 의 다른글
- 이전글 [논문리뷰] Post-Training Language Models for Gold-Medal Performance in Coding Competitions
- 현재글 : [논문리뷰] Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills
- 다음글 [논문리뷰] S3Gym: Can LLMs Turn Self-Testing and Self-Judging into Self-Improvement?
댓글