[논문리뷰] Self-Improvements in Modern Agentic Systems: A Survey
링크: 논문 PDF로 바로 열기
메타데이터
저자: Zhe Ren, Yimeng Chen, Dandan Guo, et al.
1. Key Terms & Definitions (핵심 용어 및 정의)
- Agentic Systems: Foundation Model을 핵심 엔진으로 삼고, Prompt, Memory, Tool, Control Logic과 같은 Scaffold 컴포넌트를 결합하여 자율적으로 작업을 수행하는 지능형 시스템을 의미합니다.
- Self-Improvement (SI): 시스템이 경험을 통해 얻은 정보를 바탕으로 스스로 파라미터나 구조를 최적화하여 성능을 향상시키는 self-induced update operator를 의미합니다.
- Foundation Model Improvement: 시스템의 근간이 되는 Foundation Model의 파라미터($\theta$)를 직접적으로 수정하여 모델의 성능을 진화시키는 접근 방식입니다.
- Scaffolding Improvement: 모델 자체를 변경하지 않고, Prompt 최적화, Memory 관리, Tool 활용 전략 등 외부 보조 요소(Scaffold)를 수정하여 시스템의 전체적인 역량을 개선하는 방식입니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 현대의 Agentic Systems가 어떻게 인간의 개입을 최소화하면서 경험을 통해 스스로 역량을 확장할 수 있는지에 대한 체계적인 분석을 제공합니다. 기존 연구들은 개별적인 개선 기법에 집중해왔으나, 이러한 기술들을 포괄하는 통합된 프레임워크가 부족했습니다. 이에 저자들은 에이전트를 Foundation Model과 이를 둘러싼 운영 체제인 Scaffold의 결합체로 정의하고, 이 두 영역에서의 Self-Improvement 메커니즘을 명확히 분류하고자 합니다 [Figure 1].
3. Method & Key Results (제안 방법론 및 핵심 결과)
저자들은 Self-Improvement를 파라미터 기반의 Foundation Model Improvement와 비파라미터적인 Scaffolding Improvement라는 두 개의 주된 경로로 분류하는 통합 택소노미를 제시합니다 [Figure 1]. Foundation Model Improvement는 주로 Intrinsic Generative Demonstrations, Intrinsic Evaluative Feedback, 그리고 Extrinsic Exploratory Experience를 사용하여 모델의 파라미터를 업데이트합니다. 반면, Scaffolding Improvement는 시스템의 Prompt, Memory, Tool 사용 능력을 수정하여 적응력을 높입니다. 특히, Scaffolding Improvement 내에서는 Scalar-Feedback Optimization, Qualitative-Feedback Refinement, Population-Based Evolution, Textual Gradient Optimization 등의 기법들이 시스템의 효율성을 높이는 데 활용됨을 확인했습니다. 본 연구는 다양한 도메인(Software Engineering, Web Automation, Games 등)에서 이러한 Self-Improvement 기법들이 어떻게 실질적인 성능 향상으로 이어지는지를 분석하며, 각 기법이 가지는 Trade-offs를 명확히 했습니다.
4. Conclusion & Impact (결론 및 시사점)
본 논문은 현대 Agentic Systems의 Self-Improvement 역량을 정의하고 체계화함으로써, 향후 자율적이고 지능적인 시스템 설계를 위한 이론적 토대를 제공합니다. Foundation Model과 Scaffold의 상호보완적 진화는 에이전트가 더 복잡하고 긴 호흡의 과제를 수행할 수 있게 하는 핵심 동력이 될 것입니다. 본 연구에서 제시한 택소노미와 분류체계는 연구자들이 자신의 모델 아키텍처에 가장 적합한 개선 전략을 선택하고, 차세대 자율 에이전트를 개발하는 데 있어 중요한 가이드라인이 될 것입니다.
Part 2: 중요 Figure 정보

Figure 1 — 에이전트 자가 개선의 개요
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] S1-Omni: A Unified Multimodal Reasoning Model for Scientific Understanding, Prediction, and Generation
- [논문리뷰] DSWorld: A Data Science World Model for Efficient Autonomous Agents
- [논문리뷰] Agon: Competitive Cross-Model RL with Implicit Rival Grading of Reasoning
- [논문리뷰] WanSong v1.0 Technical Report
- [논문리뷰] Tracing Agentic Failure from the Flow of Success
Review 의 다른글
- 이전글 [논문리뷰] Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning
- 현재글 : [논문리뷰] Self-Improvements in Modern Agentic Systems: A Survey
- 다음글 [논문리뷰] ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation
댓글