본문으로 건너뛰기

[논문리뷰] A Frozen 12B Beats Frontier Models on Verified Work: 100% Accuracy, 0 Tokens, Bit-Exact, Forever

링크: 논문 PDF로 바로 열기

저자: Sietse Schelpe, et al.

## 1. Key Terms & Definitions (핵심 용어 및 정의)

  • Galahad: 본 논문에서 제안하는, 검증된 지식을 저장하고 재사용하는 결정론적(deterministic) 시스템입니다.
  • Merlin: Galahad의 하위 계층으로, Byte-exact 데이터 중복 제거 및 무결성 보장을 담당하는 엔진입니다.
  • Verified Reuse: 모델의 재학습 없이 검증된 지식을 Zero generation tokens 상태로 호출하여 100% 정확도로 답변하는 방식입니다.
  • Answer-key-free gate: 정답 키를 참조하지 않고 머신 체킹, 일관성 검사 등을 통해 후보 솔루션의 무결성을 검증하는 파이프라인입니다.

## 2. Motivation & Problem Statement (연구 배경 및 문제 정의) 본 연구는 기존의 거대 언어 모델이 Retraining을 통해 성능을 개선하는 과정에서 발생하는 비용, 불투명성, 비결정론적 출력 문제를 해결하고자 합니다. 기존의 Frontier APIs는 이미 해결된 문제에 대해서도 매번 Full generation pass를 수행하여 막대한 GPU-months 비용을 낭비하고 있습니다. 이러한 모델들은 답변의 일관성을 보장하지 못해 감사 추적(Audit trail)이나 엄격한 규제가 필요한 환경에서 사용하기 어렵다는 한계가 있습니다. 따라서 본 연구는 모델을 Frozen 상태로 두고, 검증된 지식을 별도의 메모리에 축적하여 재사용하는 방식의 효율성을 입증합니다. 이러한 구조적 효율성은 [Figure 1]에서 제시된 두 가지 답변 regime의 비교를 통해 명확히 드러납니다.

Figure 1: Frontier 모델의 일반적 추론 방식과 Galahad의 Verified-reuse 방식 간의 구조적 차이를 명확히 비교함

Figure 1 — Frontier 모델의 일반적 추론 방식과 Galahad의 Verified-reuse 방식 간의 구조적 차이를 명확히 비교함

## 3. Method & Key Results (제안 방법론 및 핵심 결과) 본 연구는 Frozen 12B 파라미터 모델 옆에 독립적인 검증 파이프라인과 저장소를 배치하여 문제를 해결합니다. 시스템은 Verify-before-store 계약을 따르며, 모든 입력에 대해 100% 정확도를 달성하고, 저장된 항목에 대해서는 0 generation tokens로 답변을 생성합니다. 실험 결과, 180개의 테스트 인스턴스에 대해 4개의 서로 다른 아키텍처(Dense, MoE)가 동일하게 180/180의 성적을 기록했습니다. [Table 1]에 따르면 각 모델은 약 6.3–6.5 Wh의 에너지로 전체 배터리 테스트를 완료했으며, 이는 답변 당 평균 36 mWh에 해당합니다. 또한, Galahad는 [Figure 9]와 같이 단일 46 GB GPU 환경에서 최대 6,000,000 토큰 규모의 이동 가능한 윈도우를 구현하여, 기존 vLLM이나 SGLang의 context 제한을 압도하는 성능을 보였습니다.

Table 1: 다양한 아키텍처에 걸쳐 동일한 모델 독립적 결과(180/180)가 도출됨을 증명하는 핵심 데이터

Table 1 — 다양한 아키텍처에 걸쳐 동일한 모델 독립적 결과(180/180)가 도출됨을 증명하는 핵심 데이터

Figure 9: 기존 serving engine 대비 월등한 context 처리 능력(6M tokens)을 보여주는 성능 지표

Figure 9 — 기존 serving engine 대비 월등한 context 처리 능력(6M tokens)을 보여주는 성능 지표

## 4. Conclusion & Impact (결론 및 시사점) 본 연구는 검증 가능한 워크플로우에서 Frozen 모델이 런타임 비용, 지연 시간, 결정론적 정확도 측면에서 Frontier models를 능가할 수 있음을 성공적으로 입증했습니다. 이는 향후 AI 모델 운영 방식이 단순한 추론에서 지식의 영구적 축적과 검증 기반의 재사용으로 전환될 가능성을 시사합니다. 특히 규제와 신뢰성이 중요한 산업 분야에서 Bit-exact한 답변을 지속적으로 제공할 수 있다는 점은 큰 실무적 가치를 지닙니다. 저자들은 이 시스템이 범용적인 모든 reasoning을 대체하는 것이 아니라, 이미 검증된 연산과 문제 해결 영역에서 압도적인 효율성을 제공하는 최적의 솔루션임을 강조합니다.

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글