[논문리뷰] Fast Weight Attention for Continual Learning본 논문은 Transformer의 KV cache가 시퀀스 길이에 따라 O(N²)의 비용을 소모하며 발생하는 비효율성 및 Continual Learning 환경에서의 파괴적 망각(catastrophic interference) 문제를 해결하고자 합니다.#Review#Continual Learning#Fast Weight#Linear Attention#State Space Models#Online Gradient Descent#Ridge Regression2026년 8월 30일댓글 수 로딩 중
[논문리뷰] How Good Can Linear Models Be for Time-Series Forecasting?본 논문은 시계열 예측 분야에서 모델의 복잡도를 높이는 것이 성능 향상을 보장한다는 기존의 통념을 반박하고, 선형 모델의 한계가 모델 자체의 capacity가 아닌 부적절한 Preprocessing 설정에서 기인함을 증명합니다.#Review#Time-Series Forecasting#Ridge Regression#Preprocessing#Hyperparameter Optimization#Context Length#Normalization#Forecasting Diagnostic2026년 6월 29일댓글 수 로딩 중