본문으로 건너뛰기

[논문리뷰] Exploring Collaboration between a language and a non-language agent

링크: 논문 PDF로 바로 열기

저자: Harini S I, Somesh Singh, Yaman K Singla, et al.

1. Key Terms & Definitions (핵심 용어 및 정의)

본 논문에서 다루는 핵심 용어 및 개념은 다음과 같습니다:

  • Verbalization: 비언어 에이전트(non-language agent)의 풍부한 연속적(continuous) 내부 표현(representations)을 희소한(sparse) 텍스트 요약(textual summaries)으로 압축하여 언어 모델(LLM)에 전달하는 방식입니다.
  • Latent State Internalization: 비언어 서브에이전트(subagent)의 연속적 표현을 학습된 state tokens 형태로 LLM의 토큰 스트림(token stream)에 직접 주입하여 LLM이 이를 통해 추론하도록 하는 패러다임입니다. 환경 상태(environment state)가 진행됨에 따라 동적으로 재인코딩(re-encoding)됩니다 [cite: 1, Figure 2].
  • Verbalization Debt: latent state internalization 방식과 verbalized integration 방식 간의 성능 격차를 의미합니다. 이 격차는 학습이 진행될수록 커지고 LLM 스케일이 증가해도 좁혀지지 않음을 논문에서 정량적으로 보여줍니다 [cite: 1, Figure 3].
  • LLAMIA (Large Language and Action Models with Internal Agents): latent state internalization 패러다임을 사용하여 훈련된 모델로, 두 단계의 학습(supervised projector alignment 및 Reinforcement Learning)을 거쳐 다양한 협업 태스크에서 뛰어난 성능을 보입니다.
  • LLAMIA-Bench: LLM과 비언어 에이전트 간의 협업 연구를 위해 특별히 설계된 6가지의 다양한 협업 체스 태스크(collaborative chess tasks) 벤치마크 스위트(suite)입니다 [cite: 1, Figure 1].

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 연구는 Large Language Models (LLMs)가 전문 서브에이전트들을 조율하여 복잡한 태스크를 해결하는 오케스트레이터(orchestrator)로 활발히 활용되고 있지만, 게임 플레이나 로봇 공학 등 여러 중요한 영역에서 가장 강력한 에이전트들은 language models가 아니라는 근본적인 문제 의식에서 출발합니다. 기존에는 이러한 non-language agentsrich continuous representations를 희소한 텍스트 요약으로 압축하는 Verbalization 방식을 통해 LLM과 통합하려 했으나, 이는 AlphaZeroRT-1 같은 에이전트들의 깊은 내부 지식(internal representations)을 손실시키는 lossy bottleneck이 됩니다. 이러한 Verbalization Debt는 다단계(multi-step) 상호작용에서 오류를 축적시켜 협업의 이점을 감소시키며, LLM 스케일이 증가해도 해소되지 않는 것으로 나타납니다. 또한, LLM은 체스 지식은 풍부해도 게임 자체를 플레이하는 능력은 부족하고, 체스 엔진은 인간을 뛰어넘는 플레이를 할 수 있어도 움직임의 근거를 설명하거나 맥락에 따른 전략을 세우지 못하는 한계가 존재합니다. 따라서 체스 주석(game commentary)이나 퍼즐 설계(puzzle design)와 같이 엔진의 깊은 위치 이해와 LLM의 인간 의도 추론 능력이 모두 필요한 태스크는 기존 방식으로는 해결하기 어렵습니다. 이러한 배경 하에, LLM이 non-language subagents와 효과적으로 협력하고 공동으로 추론할 수 있는 방안을 모색하는 것이 본 연구의 주요 동기입니다.

3. Method & Key Results (제안 방법론 및 핵심 결과)

본 논문은 LLMnon-language agent와 효과적으로 협력하기 위해 latent state internalization이라는 새로운 패러다임을 제안합니다 [cite: 1, Figure 2]. 이 방법론은 non-language subagentcontinuous representationsk=32개의 learned state tokens로 변환하여 LLMtoken stream에 직접 주입합니다 [cite: 1, Figure 2]. 이 latent tokensLLMchain-of-thought, action tokens, language tokens와 함께 추론 과정에 인터리빙(interleave)됩니다 [cite: 1, Figure 2]. latent stateLLM embedding space로 투영(project)하는 LatentBridgeLc0-BT4 체스 엔진의 1024-dimensional latent stateLLMhidden size에 맞는 32개의 embeddings로 매핑하는 3-layer MLP로 구성됩니다. LLAMIA 모델의 훈련은 두 단계로 진행됩니다: 첫 번째 Stage 1: Projector Alignment에서는 LLMfrozen 상태로 유지하고 LatentBridge만을 지도 학습(supervised learning) 방식으로 훈련하여 서브에이전트의 표현을 LLMembedding space에 정렬시킵니다. 이어서 Stage 2: Reinforcement Learning (DAPO)에서는 LLMLatentBridge를 함께 fine-tune하여 엔드투엔드(end-to-end)로 최적화합니다. 이 과정에서 서브에이전트는 계속 frozen 상태로 유지됩니다.

주요 실험 결과로, latent state internalization을 통해 훈련된 LLAMIA-14B 모델은 LLAMIA-Bench의 6가지 협업 태스크 전체에서 task specialistsGPT-5.1을 포함한 frontier models 대비 동등하거나 더 우수한 성능을 달성했습니다 [cite: 1, Figure 1]. 특히, verbalized integration 방식인 LLAMIA-Verb와 비교하여 일관된 Verbalization Debt가 관찰되었는데, 이는 학습 전반에 걸쳐 성능 격차가 커지며 LLM 스케일(4B에서 14B 파라미터)이 증가하더라도 지속적으로 유지되었습니다 [cite: 1, Figure 3]. 예를 들어, puzzle interest 태스크에서 verbalized system들은 Spearman ρ ≤ 0.12에 머물렀지만, LLAMIA-14B0.52의 성능을 기록하여 latent tokensnon-verbalizable signals에 대한 직접적인 접근을 가능하게 함을 입증했습니다. 또한, LLAMIA는 태스크에 특화된 협업 전략(counterfactual queries, multi-step lookahead)을 학습하는 반면, LLAMIA-Verb는 태스크와 무관하게 engine-follow 전략에 수렴하는 차이를 보였습니다 [cite: 1, Figure 4]. 흥미롭게도 LLAMIALLAMIA-Verb보다 서브에이전트 호출 빈도수가 낮아(1.9회 vs. 2.9회) inference cost 측면에서도 cost-neutral하거나 더 효율적인 것으로 나타났습니다 [cite: 1, Table 3]. 이러한 latent state internalization의 이점은 체스뿐만 아니라 Go 태스크에서도 verbalized control 대비 약 10 포인트 더 높은 behavior cloning 성능을 달성하며 일반화 가능성(generalization)을 입증했습니다 [cite: 1, Table 25].

4. Conclusion & Impact (결론 및 시사점)

본 연구는 latent state internalization이라는 새로운 패러다임을 제안하며, LLMnon-language agent 간의 협력을 verbalized communication에서 직접적인 continuous representations 투영으로 전환하는 것이 LLM의 추론 능력을 크게 향상시킬 수 있음을 입증했습니다. LLAMIA 모델은 LLAMIA-Bench 벤치마크의 모든 태스크에서 dedicated task finetunesfrontier models를 능가하는 성능을 보였으며, 이는 verbalization이 특히 puzzle interest와 같이 텍스트로 직렬화(serialization)하기 어려운 신호나 상호작용 깊이가 깊은 태스크에서 성능의 structural bottleneck으로 작용함을 명확히 보여줍니다. Verbalization DebtLLMscale이나 RL budget 증가로 해소되지 않았습니다. 이 연구는 학계에 latent state internalization을 통한 이종(heterogeneous) 에이전트 협업의 새로운 방향을 제시하고, 산업계에서는 closed-weight modelsnon-language agents의 전문 지식에 충실하게 접근할 수 있도록 함으로써 grounded game commentaryopponent-specific preparation과 같은 실제 응용 프로그램의 개발을 가능하게 하는 중요한 시사점을 가집니다.

Figure 2: 잠재 상태 내부화 아키텍처

Figure 2 — 잠재 상태 내부화 아키텍처

Figure 4: 협업 전략 분포

Figure 4 — 협업 전략 분포

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글