본문으로 건너뛰기

[논문리뷰] Multi-Head Latent Control: A Unified Interface for LLM Agent Decision Making

링크: 논문 PDF로 바로 열기

메타데이터

저자: Amirhosein Ghasemabadi, Ruichen Chen, Bahador Rashidi, Di Niu


## 1. Key Terms & Definitions (핵심 용어 및 정의)

  • Multi-Head Latent Control: 고정된(frozen) LLM/VLM의 hidden-state trajectories를 분석하여 실시간으로 모델 결정(model selection) 및 개입(intervention) 신호를 생성하는 경량화된 레이어.
  • Capability Head: 현재 모델이 당면한 과제를 해결할 수 있는지(adequacy)를 예측하여, 더 강력한 모델로의 전환(handoff) 여부를 결정하는 모듈.
  • Resolution Head: 모델이 직접 답변을 수행할지, 아니면 추가 정보 요청, 도구 사용(tool use), 또는 중단(abstention)과 같은 특정 개입이 필요한지를 판단하는 모듈.
  • Routed Execution: Capability Head를 통해 입력된 과제의 난이도에 따라 작은 모델과 큰 모델 사이에서 동적으로 실행 경로를 전환하는 효율적인 추론 방식.

## 2. Motivation & Problem Statement (연구 배경 및 문제 정의) 본 논문은 LLM 기반 에이전트가 모든 과제에 대해 대형 모델을 사용하는 비용 효율성 문제와, 적절한 도구 사용 및 모델 전환을 스스로 결정하지 못하는 자기 인식(self-awareness) 부재 문제를 해결하기 위해 Multi-Head Latent Control을 제안한다. 기존의 prompt-level routing 방식은 입력 데이터에만 의존하여 과제별 모델 적합성(instance-level adequacy)을 정확히 평가하기 어렵고, 매번 대형 모델을 사용하는 것은 높은 Latency와 컴퓨팅 비용을 유발한다 [Figure 1]. 또한, 기존의 multi-agent collaboration 기법들은 외부 오케스트레이션이나 별도의 end-to-end 학습이 필요하여 모델 업데이트 시 유지보수가 어렵다는 한계가 있다.

Figure 1: Multi-head latent control 구조 및 동작 방식

Figure 1 — Multi-head latent control 구조 및 동작 방식

## 3. Method & Key Results (제안 방법론 및 핵심 결과) 본 연구는 고정된 모델 백본을 수정하지 않고도 두 개의 경량화된 제어 헤드(Capability Head, Resolution Head)를 부착하여 추론 과정에서의 latent states를 활용하는 프레임워크를 설계하였다. Capability Head는 최종 레이어의 hidden states를 읽어 모델 교체 여부를 결정하며, Resolution Head는 중간 레이어의 상태를 활용해 clarification, tool use, abstention 중 최적의 액션을 선택한다 [Figure 1]. 정량적 실험 결과, 제안된 방식은 AndroidWorld 벤치마크에서 기존 단일 모델 대비 대형 모델 API 사용 비용을 최대 90.7%까지 절감하면서도 성능을 성공적으로 보존하였다 [Table 1]. 또한, When2Call 벤치마크에서 Resolution Head를 활용했을 때 기존 백본 모델 대비 F1 score가 최대 11.7 포인트, 정확도(Accuracy)가 12.4 포인트 향상되는 성과를 거두었다. 웹 검색 결정과 관련된 TriviaQA 실험에서는 tool-call precision을 크게 개선하고, 필요한 도구 사용을 놓치는 사례를 대폭 줄이는 등 에이전트의 결정 품질이 정성적 및 정량적으로 강화됨을 입증하였다 [Table 4].

## 4. Conclusion & Impact (결론 및 시사점) 본 논문은 LLM 추론 과정의 hidden-state trajectories가 모델의 자기 인식을 위한 핵심적인 제어 신호를 포함하고 있음을 증명하였다. Multi-Head Latent Control은 모델 백본을 미세 조정(fine-tuning)하지 않고도 실시간 에이전트 결정을 지원하는 범용적인 인터페이스를 제공한다. 이 연구는 고가의 모델을 항상 사용하는 대신 상황에 맞는 최적의 리소스를 할당하게 함으로써, 학계 및 산업계에서 LLM 에이전트의 배포 효율성과 신뢰성을 동시에 확보할 수 있는 실용적인 방법론을 제시한다.

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글