본문으로 건너뛰기

[논문리뷰] Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA

링크: 논문 PDF로 바로 열기

저자: Vin Bo, Asher Cai, Jingwei Cao, et al.

## 1. Key Terms & Definitions (핵심 용어 및 정의)

  • MoL (Mixture-of-LoRA): 고정된 베이스 모델 위에 학습된 다양한 전문 LoRA 어댑터를 per-turn 단위로 선택 및 구성하여 효율적으로 전문성을 확장하는 아키텍처입니다.
  • RSI (Recursive Self-Improvement): 모델이 버전화된 Harness와 함께 환경 내에서 작업을 수행하고, 수집된 데이터를 통해 다음 세대의 모델과 구성으로 발전하는 순환 최적화 프로세스입니다.
  • HCP (Harness Context Protocol): 에이전트의 런타임 환경(프롬프트, 도구, 세션 상태 등)을 버전화하여 관리하고 배포할 수 있도록 하는 TOML 기반의 표준 계약 프로토콜입니다.
  • UI4A (UI for Agents): Generative UI를 위해 에이전트가 직접 frontend 코드를 작성하도록 지원하는 컴포넌트 기반의 Harness로, 표준화된 인터페이스를 통해 복잡한 인터랙션을 구현합니다.

## 2. Motivation & Problem Statement (연구 배경 및 문제 정의) 본 연구는 대규모 언어 모델이 고정된 환경에서 사전 학습된 후 정체되는 한계를 극복하고, 실제 환경에서 경험을 통해 지속적으로 발전하는 Experiential Intelligence 구현을 목표로 합니다. 기존의 중앙 집중식 post-training 방식은 고정된 작업 범위와 환경에만 최적화되어 있어, 배포 후 새로운 지식이나 도구의 등장에 유연하게 대응하지 못하는 문제를 가집니다. 저자들은 이러한 문제를 해결하기 위해 모델과 Harness가 공동으로 최적화되는 Model-Harness Co-design과 지속적인 학습을 보장하는 구조적 시스템이 필요하다고 지적합니다. [Figure 2]는 MoE, Skills-based, MoL 등 모델 기능을 확장하는 세 가지 접근 방식을 보여주며, 본 논문은 MoL이 지속적인 학습에 최적화된 구현 기판임을 시사합니다.

Figure 2: 모델 기능 확장을 위한 3가지 접근 방식(MoE, Skills, MoL)의 차이를 보여주는 핵심 아키텍처 다이어그램

Figure 2 — 모델 기능 확장을 위한 3가지 접근 방식(MoE, Skills, MoL)의 차이를 보여주는 핵심 아키텍처 다이어그램

## 3. Method & Key Results (제안 방법론 및 핵심 결과) 본 논문은 Frozen base를 공유하면서 Specialist LoRA 어댑터를 선택적으로 구성하는 MoL 아키텍처를 중심으로, RSI 주기를 통한 체계적인 모델 개선 과정을 제안합니다. Macaron-V1-Venti 모델은 744B 파라미터의 GLM-5.2 베이스와 4개의 전문 어댑터를 결합하여 구성되며, 시스템의 효율성을 극대화하기 위해 per-turn 단위의 Routing Loop와 KV Cache Reuse를 수행합니다. 실험 결과, Macaron-V1-VentiUI4A-Bench에서 87.8점으로 비교 모델(Opus 4.8 75.9점, GPT-5.5 72.1점) 대비 압도적인 성능 우위를 보였으며, [Table 8]에서 볼 수 있듯이 Personal Intelligence 벤치마크인 ChatBench(58.3점)와 LivingBench(64.0점)에서도 경쟁력 있는 지표를 기록했습니다. 또한, TerminalBench 2.1에서 87.6점을 획득하여 가장 높은 성능을 보였으며, [Figure 11]을 통해 UI4A를 활용한 인터페이스 생성이 Raw HTML 방식 대비 출력 토큰 수를 약 45% 감소시켰음을 정량적으로 검증하였습니다.

Table 8: 제안 모델과 주요 벤치마크 모델 간의 성능 비교 결과를 종합한 핵심 결과 표

Table 8 — 제안 모델과 주요 벤치마크 모델 간의 성능 비교 결과를 종합한 핵심 결과 표

Figure 11: 기존 방식 대비 UI4A 모델의 토큰 효율성을 보여주는 정량적 분석 그래프

Figure 11 — 기존 방식 대비 UI4A 모델의 토큰 효율성을 보여주는 정량적 분석 그래프

## 4. Conclusion & Impact (결론 및 시사점) 본 논문은 단일 모델 체크포인트를 넘어 지속적으로 업데이트되고 협업 가능한 에이전트 모델 패밀리 Macaron-V1을 통해 Experiential Intelligence의 가능성을 제시합니다. 본 연구가 제안한 MoL 아키텍처와 RSI 프레임워크는 배포 후의 경험이 모델 성능 향상으로 이어지는 루프를 완성하며, 이는 향후 학계와 산업계에서 복합적인 에이전트 시스템을 구축하는 데 있어 중요한 이정표가 될 것입니다. 다만, 저자들은 이 결과가 단일 스냅샷에 대한 시스템적 검증이며, 여러 세대를 거친 지속적인 학습의 증명은 향후 연구 과제로 남겨두었습니다.

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글