[논문리뷰] SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers본 연구는 Looped Transformer의 성능 향상이 아키텍처 자체의 우수성인지, 아니면 반복 실행으로 인해 증가한 FLOPs와 같은 추가 자원 때문인지 규명하고자 한다.#Review#Looped Transformers#Mixture-of-Experts#Scaling Laws#Compute-Matched#Effective Depth#Inductive Bias#Attention Sink2026년 9월 1일댓글 수 로딩 중
[논문리뷰] SiamJEPA: On the Role of Siamese Student Encoders in JEPA본 논문은 JEPA 프레임워크 내에서 Siamese Student Encoders의 역할과 이들이 표현 학습에 미치는 유의미한 영향력을 체계적으로 규명하는 것을 목표로 합니다.#Review#Self-supervised Learning#JEPA#Siamese Student Encoders#Representation Learning#Latent Prediction#Inductive Bias2026년 7월 7일댓글 수 로딩 중
[논문리뷰] Why Can't Transformers Learn Multiplication? Reverse-Engineering Reveals Long-Range Dependency Pitfalls본 논문은 Transformer 기반 언어 모델이 다중 자릿수 곱셈과 같은 겉보기에 간단한 알고리즘 태스크를 학습하는 데 실패하는 이유를 탐구합니다.#Review#Transformers#Multiplication#Long-Range Dependencies#Implicit Chain-of-Thought#Attention Mechanisms#Inductive Bias#Reverse Engineering2025년 10월 2일댓글 수 로딩 중
[논문리뷰] Locality in Image Diffusion Models Emerges from Data Statistics본 연구는 확산 모델(Diffusion Models)의 학습된 지역성(locality)이 모델 아키텍처의 귀납적 편향(inductive bias)보다는 이미지 데이터셋의 통계적 속성 에서 비롯된다는 가설을 검증하고자 합니다.#Review#Diffusion Models#Locality#Data Statistics#Optimal Denoiser#Wiener Filter#Sensitivity Fields#Generative Models#Inductive Bias2025년 9월 16일댓글 수 로딩 중