[논문리뷰] JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution
링크: 논문 PDF로 바로 열기
본 논문은 LLM 기반 에이전트 시스템에서 에이전트의 성능을 결정짓는 핵심 요소인 Harness를 사전에 최적화된 고정 형태(Ahead-of-Time, AOT)로 사용하는 대신, 과업에 맞춰 즉시 생성 및 진화시키는 JIT-Agent 프레임워크를 제안합니다.
메타데이터
저자: Guibin Zhang, Leo Lu, Fangzhou Xie, et al.
1. Key Terms & Definitions (핵심 용어 및 정의)
- Agent Harness: 에이전트의 메모리 관리, 계획 수립, 동작 프로토콜, 도구 및 기술 조율을 담당하는 실행 환경의 뼈대입니다.
- Harness Intelligence: 주어진 과업과 Backbone 모델에 최적화된 Harness를 생성, 복구, 진화시키는 메타 모델의 능력을 의미합니다.
- HarnessFactory: 13가지의 대표적인 에이전트 스캐폴드를 4개 모듈(Memory, Planning, Action, Capability)로 정형화하여 통합한 코드베이스입니다.
- Evo-GDPO: 실행 피드백을 통해 보상, Latency, 비용을 최적화하며 Harness를 진화시키는 알고리즘입니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 연구는 에이전트의 성능이 모델 가중치뿐만 아니라, 모델을 둘러싼 실행 환경인 Harness에 크게 의존한다는 점에 주목합니다. 기존 연구들은 AOT(Ahead-of-Time) Harness 설계에 의존하여 고정된 아키텍처를 다양한 환경에 적용하려 했으나, 이는 과업별 특수성을 반영하지 못하고 확장성에 한계가 있었습니다 [Figure 1]. 저자들은 Harness 설계가 고정된 엔지니어링의 문제가 아니라, 과업마다 동적으로 생성되어야 하는 Instance-dependent한 작업이라고 정의합니다. 따라서 에이전트가 상황에 맞는 Harness를 즉시(Just-in-Time) 합성하여 실행하는 능력이 필수적임을 주장합니다.

Figure 1 — 에이전트 벤치마크 리더보드
3. Method & Key Results (제안 방법론 및 핵심 결과)
저자들은 에이전트 Harness를 메모리, 계획, 동작, 능력 조율의 4개 모듈로 구조화하고, JIT-Agent를 통해 이를 생성하는 3단계 파이프라인을 구축하였습니다 [Figure 2, Figure 3].
- Stage I (Customizing): 교사 모델을 통해 과업 조건에 맞는 Harness 생성을 학습합니다.
- Stage II (Repairing): 생성된 Harness의 실패 사례를 분석하여 실행 가능한 상태로 복구하는 법을 학습합니다.
- Stage III (Learning to Evolve): Evo-GDPO를 활용하여 실행 피드백으로부터 성능 향상을 꾀합니다.
실험 결과, DeepSeek-V4-Flash에 JIT-Agent를 적용했을 때 DeepSearchQA에서 GPT-5.6을 상대로 +9.1점, OdysseyBench에서 +4.3점의 성능 향상을 기록했습니다. 또한 GLM-5.2와 같은 강력한 모델에서도 xBench-DS 기준 +12.0점의 추가적인 성능 향상을 보이며, 다양한 Backbone 모델군에서 일관된 우위를 증명했습니다 [Figure 1].
4. Conclusion & Impact (결론 및 시사점)
본 논문은 Harness 설계의 패러다임을 AOT에서 JIT로 전환함으로써, 모델의 내재적 능력 외에 'Harness 지능'이라는 새로운 최적화 차원을 제시했습니다. JIT-Agent는 에이전트 시스템의 재귀적 개선과 적응력을 높여, 산업계의 다양한 에이전트 구축 및 연구 분야에서 범용적인 성능 향상을 가져올 것으로 기대됩니다.

Figure 2 — JIT-Agent 모델 개요

Figure 3 — JIT-Agent 훈련 파이프라인
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?
- [논문리뷰] Aspire: Can Models Self-Evolve from Vague Goals?
- [논문리뷰] Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses
- [논문리뷰] Agent Lightning v1.0: Towards Harnessed Agentic RL
- [논문리뷰] ClawGym II: Exploring Black-Box RL on Agent Harness
Review 의 다른글
- 이전글 [논문리뷰] Is Next-Chunk Reasoning RL Really Better than SFT? Revisiting Training Strategies under no-CoT Data
- 현재글 : [논문리뷰] JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution
- 다음글 [논문리뷰] LibriBrain100: One Hundred Hours of Broad and Deep MEG Data for Neural Speech Decoding at Scale
댓글