[논문리뷰] Sliding-window beats linear attention본 논문은 LLM의 quadratic scaling 문제로 인한 추론 비용 및 메모리 문제를 해결하기 위해, 기존의 Linear Attention 기반 변환 기법들이 Sliding Window Attention (SWA) 보다 효율적인지 검증하고자 합니다.#Review#Sliding Window Attention#Linear Attention#KV Cache#Long-context Reasoning#Model Distillation#Inference Efficiency2026년 8월 30일댓글 수 로딩 중
[논문리뷰] SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context Reasoning본 논문은 강력한 long-context reasoning 능력을 갖춘 교사 모델로부터 단기 컨텍스트(short-context) 학생 모델로 추론 능력을 성공적으로 전수하는 것을 목표로 합니다.#Review#On-policy Distillation#Long-context Reasoning#Tokenizer-agnostic#ProofBench#Policy Alignment#KL Regularization2026년 8월 16일댓글 수 로딩 중
[논문리뷰] SpeContext: Enabling Efficient Long-context Reasoning with Speculative Context Sparsity in LLMs본 논문은 대규모 언어 모델(LLM)의 장문맥(long-context) 추론 시 발생하는 Key-Value (KV) 캐시 관련 문제를 해결하는 것을 목표로 합니다.#Review#LLMs#Long-context Reasoning#KV Cache Optimization#Speculative Sparsity#Knowledge Distillation#Adaptive Memory Management#Throughput2025년 12월 1일댓글 수 로딩 중