[논문리뷰] Why Gated DeltaNet Survives 4-Bit Quantization: NVFP4 W4A4 for the Recurrent Half of a Hybrid 27B LLM본 논문은 Gated DeltaNet (GDN)과 같은 선형 Attention 레이어를 포함하는 Hybrid Large Language Models (LLMs)에 NVFP4 W4A4 4-bit 양자화를 적용하는 과정에서의 근본적인 문제를 다룬다.#Review#NVFP4#W4A4#Gated DeltaNet#LLM Quantization#Hybrid LLM#Recurrent Networks#KV-cache#Post-training Quantization2026년 9월 3일댓글 수 로딩 중
[논문리뷰] LiveAnimate: Stable Long-Form Streaming Human Animation in Real-Time본 논문은 기존의 pose-driven human animation 시스템들이 지닌 실시간성 결여와 장기 생성 시의 품질 저하 문제를 해결하기 위해 LiveAnimate를 제안한다.#Review#Human Animation#Streaming#Real-Time#Diffusion Transformer#Long-Form Generation#KV-cache2026년 8월 13일댓글 수 로딩 중
[논문리뷰] Augmenting Attention with Exponentially Decaying Memory Improves Query-Aware KV Sparsity본 논문은 Long-context LLM의 추론 효율성을 높이기 위한 기존 Query-aware sparse inference 기법들의 성능 한계를 극복하는 것을 목표로 한다.#Review#Efficient Inference#Query-Aware Sparsity#KV-cache#Exponentially Decaying Memory#RAT+#Long-Context LLM2026년 6월 7일댓글 수 로딩 중
[논문리뷰] Echo-Infinity: Learning Evolving Memory for Real-Time Infinite Video Generation본 논문은 autoregressive 비디오 생성 모델에서 발생하는 무제한적인 KV-cache 성장과 시간적 위치 임베딩 오버플로우 문제를 해결하는 것을 목적으로 한다.#Review#Autoregressive Video Generation#KV-cache#Memory Queries#RoPE#Long-term Consistency2026년 6월 3일댓글 수 로딩 중
[논문리뷰] When Cloud Agents Meet Device Agents: Lessons from Hybrid Multi-Agent Systems본 연구는 클라우드 기반의 고성능 Frontier 모델과 에지 장치 기반의 고효율 SLM(Small Language Model)을 통합하는 하이브리드 Multi-Agent System(MAS)의 설계 공간을 체계적으로 탐구합니다.#Review#Multi-Agent Systems#Hybrid AI#Edge Inference#Cloud Agents#Agentic Workflow#KV-cache#Model Routing2026년 5월 28일댓글 수 로딩 중
[논문리뷰] GQLA: Group-Query Latent Attention for Hardware-Adaptive Large Language Model Decoding본 연구는 MLA가 특정 하드웨어(예: NVIDIA H100)의 연산-대역폭 비율에 지나치게 종속되어 있다는 문제를 해결합니다.#Review#Large Language Model#KV-cache#Multi-head Latent Attention#GQLA#Hardware-Adaptive#Roofline Model#Tensor Parallelism2026년 5월 17일댓글 수 로딩 중