[논문리뷰] NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness
링크: 논문 PDF로 바로 열기
저자: NeoHorse Team, Guoliang Cao, Guohao Dai, et al.
1. Key Terms & Definitions (핵심 용어 및 정의)
- Recursive Self-Improvement (RSI): AI 시스템이 자신의 역량을 관찰하고 그 증거를 다음 학습 라운드로 전환하여 스스로 개선하는 과정을 반복하는 광범위한 방향을 의미합니다.
- Agentic Post-Training: 대규모 언어 모델(LLM)이 사용자 요청, 모델 추론, 도구 사용, 환경 관찰 및 작업 결과로 구성된 실행 궤적(execution trajectories)을 훈련 데이터로 활용하여 에이전트 역량을 향상시키는 훈련 방법입니다.
- Routing Harness: 에이전트의 컨텍스트, 도구 및 환경과의 상호작용을 관리하는 실행 계층(execution layer)으로, 요청 및 상호작용 상태에 따라 모델을 지능적으로 선택하는 메커니즘을 포함합니다.
- User Turn: 사용자 요청과 이에 따르는 어시스턴트 응답 및 도구 상호작용을 포함하는 기본 훈련 단위로, historical 및 harness context를 보존합니다.
- On-Policy Distillation (OPD): 학생 모델이 자체 생성한 prefixes에 대해 교사 모델이 next-token distribution 형태의 supervision을 제공함으로써, 배포 시 발생하는 distribution gap을 줄이는 지식 증류(knowledge distillation) 기법입니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 AI 시스템이 자신의 역량을 관찰하고 이를 다음 학습에 활용하는 구체적인 메커니즘을 통해 Recursive Self-Improvement (RSI)를 실현하는 데 중점을 둡니다. 기존 연구들은 에이전트 상호작용 기록을 정적인 supervision으로 다루는 경향이 있어, 모델의 강점과 한계를 나타내는 관찰 가능한 증거를 활용하여 학습 방향을 형성하는 기회를 놓쳤습니다. 저자들은 배포된 Routing Harness가 이미 이러한 메커니즘을 내포하고 있다고 주장하며, 이는 단순한 태스크 결과 외에 에이전트의 실행 궤적(execution trajectories)과 모델의 현재 역량을 보여주는 observable evidence를 기록하기 때문입니다. 이러한 한계점을 극복하고 RSI의 비전을 실현하기 위해, NeoHorse-1은 routing-guided agentic training을 통해 에이전트 상호작용에서 발생하는 피드백을 학습에 통합하는 새로운 접근 방식을 제안합니다.
3. Method & Key Results (제안 방법론 및 핵심 결과)
저자들은 Routing Harness를 통해 Recursive Self-Improvement (RSI)를 달성하기 위한 NeoHorse-1 모델 제품군을 제안합니다 [Figure 2]. 이 시스템은 이질적인 모델 풀(heterogeneous model pool)과 지능형 routing을 결합하여, 각 턴(turn)마다 예측된 capability demand, 선택된 서비스 티어(service tier), 그리고 후속 상호작용을 기록합니다. 이러한 기록은 user-turn training examples로 변환되며, 이 과정에서 interleaved reasoning, tool calls, 그리고 harness context가 보존됩니다. 데이터는 structural validation, six-dimensional semantic evaluation, 그리고 subscene-level labeling을 통해 품질을 검증받습니다.
Routing signals은 capability demand를 추정하는 데 사용되며, 이를 바탕으로 Supervised Fine-Tuning (SFT)이 3단계 curriculum learning으로 구성됩니다 [Figure 6]. 또한, 이러한 routing-guided progression은 on-policy distillation (OPD)으로 확장되어, 교사 모델(teacher model)이 학생 모델(student model)이 생성한 응답을 동일한 단계별 진행 방식(staged progression)으로 supervision합니다. 마지막으로, capability-guided allocation 단계는 평가 피드백(evaluation feedback)을 다음 training mixture로 전환하여, 시스템이 무엇을 학습해야 하는지를 스스로 결정하는 evaluation–selection–update loop를 완성합니다.
핵심 결과는 다음과 같습니다. 10개의 벤치마크(harness-based agents, tool use, coding, instruction following)에서 agentic post-training을 통해 모델 성능이 크게 향상되었습니다 [Figure 1]. 4B 모델의 macro-average score는 58.94에서 64.87로, 9B 모델은 65.60에서 69.04로 상승했습니다. 특히, post-trained 4B 모델은 9B base model과의 aggregate gap을 상당히 좁혔습니다. 또한, Routing-harness data는 public agent data인 Toucan보다 5개 벤치마크에서 평균 6.26 포인트 더 높은 성능을 보였으며, 특히 HumanEval에서 +8.54 포인트, τ2-Bench에서 +11.31 포인트의 가장 큰 개선을 달성했습니다. 고품질 agentic supervision의 확장은 개발 스위트 평균 점수를 69.31에서 71.45로 꾸준히 증가시켜, 데이터 규모가 성능에 긍정적인 영향을 미침을 입증했습니다.
4. Conclusion & Impact (결론 및 시사점)
본 논문은 Recursive Self-Improvement (RSI)를 위한 초기 프로토타입인 NeoHorse-1을 제시하며, 배포된 routing harness가 에이전트의 실행 궤적, capability demand를 특성화하는 routing signals, 그리고 모델의 부족한 부분을 드러내는 outcome signals과 같은 재사용 가능한 세 가지 핵심 신호를 제공함으로써 RSI의 구체적인 메커니즘을 제공함을 보여줍니다. 제안된 agentic post-training 방법론은 routing-guided curriculum learning과 on-policy distillation을 통해 4B 모델의 macro-average score를 58.94에서 64.87로, 9B 모델을 65.60에서 69.04로 향상시키는 일관된 성능 향상을 입증했습니다. 이 연구는 평가 피드백을 다음 훈련 혼합물로 전환하는 evaluation–selection–update loop를 구축하여, 시스템이 학습하는 내용이 다음 학습 내용을 결정하는 RSI의 운영 기반을 마련했습니다. 이는 harness-mediated RSI를 설계 단계에서 실제 적용 단계로 전환하는 중요한 시사점을 제공하며, 모델 세대가 진화함에 따라 성능 향상이 지속적으로 축적될 수 있는 가능성을 제시합니다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] SenseNova-U1.5: Towards Native Unified Visual Intelligence
- [논문리뷰] Verify Before You Distill: Prompt-Level Teacher Gating for On-Policy Distillation
- [논문리뷰] Influence-Directed Distillation: Solving the Diversity Bottleneck in Sampled-Token On-Policy Distillation
- [논문리뷰] DiagEvo: Diagnosis-Guided Self-Evolution via Hierarchical Error Memory
- [논문리뷰] Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence
Review 의 다른글
- 이전글 [논문리뷰] Multi-Grid Post-Training for Long-Form Multi-Shot Video Generation
- 현재글 : [논문리뷰] NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness
- 다음글 [논문리뷰] Omni Interaction Agent Technical Report
댓글