[논문리뷰] What Does Privileged Information Add to On-Policy Self-Distillation?본 연구는 OPSD 과정에서 Teacher에게 제공되는 Privileged Information이 실제로 distillation 그 이상의 추가적인 학습 이득을 제공하는지, 그 기여도를 명확히 분리하고자 합니다.#Review#On-policy Self-distillation#Privileged Information#Language Model#Reasoning#AMPLE-Math#Knowledge Distillation#Training Dynamics2026년 9월 17일댓글 수 로딩 중
[논문리뷰] One Symptom, Three Levers: A Critical Review of On-Policy Self-Distillation본 논문은 On-Policy Self-Distillation (OPSD) 기반의 학습 기법들이 직면한 collapse 문제를 심층적으로 분석하고 체계화합니다.#Review#On-Policy Self-Distillation#OPSD#Reinforcement Learning#Knowledge Distillation#Language Model#Collapse#Privileged Information2026년 9월 7일댓글 수 로딩 중
[논문리뷰] DFM Mimir v1: An Open HRM Delivering Frontier Performance at 1B Parameters Using Only Permissible Post-Training Data본 논문은 현대 대규모 언어 모델(LLM) 개발이 대규모의 비허가 데이터에 의존함으로써 발생하는 높은 진입 장벽과 윤리적 문제를 해결하는 것을 목표로 합니다.#Review#Language Model#HRM-Text#Permissible Data#Danish Foundation Models#Synthetic Datasets#Instruction Tuning2026년 8월 16일댓글 수 로딩 중
[논문리뷰] SPOT: Sparse Probing and Outcome Calibration for On-Policy Distillation본 논문은 기존 OPD가 교사 모델의 불확실한 토큰에 대해 Reverse-KL 손실 함수를 사용함으로써, 교사가 제시하는 다양한 합리적 대안들을 충분히 포괄하지 못하는 문제(mode-seeking behavior)를 해결하고자 합니다.#Review#On-Policy Distillation#Language Model#Uncertainty-Aware#Sparse Probing#Outcome Calibration#Reasoning Benchmarks#Knowledge Distillation2026년 8월 10일댓글 수 로딩 중
[논문리뷰] MameLoshnLM: Yiddish Language Model and Evaluation Benchmark본 연구는 Yiddish와 같이 역사적으로는 풍부한 문학적 전통을 지녔으나 디지털적으로는 소외된(underrepresented) 언어를 위한 언어 모델 개발의 한계를 해결하고자 한다.#Review#Yiddish#Language Model#Low-Resource#Pretraining#Natural Language Understanding#Benchmark2026년 8월 6일댓글 수 로딩 중
[논문리뷰] Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding본 논문은 기존의 엄격한 순차적 Autoregressive (AR) 디코딩 방식이 가진 낮은 추론 병렬성과 자원 활용도 문제를 해결하기 위해 고안되었습니다.#Review#Language Model#Autoregressive#Diffusion#Self-Speculation#Parallel Decoding#Inference Efficiency#Tri-Mode Decoding2026년 7월 7일댓글 수 로딩 중
[논문리뷰] Dynamic Latent Routing본 연구는 LLM의 post-training 과정에서 기존 discrete latent 주입 방식이 갖는 구조적 파괴와 학습 단계의 비효율성을 해결하고자 합니다.#Review#Dynamic Latent Routing#Markov Decision Processes#General Dijkstra Search#Language Model#Representation Engineering#Policy Composition2026년 5월 14일댓글 수 로딩 중
[논문리뷰] Aryabhata: An exam-focused language model for JEE Math본 논문은 인도 입학 시험(JEE) 수학 영역에 최적화된 7B 파라미터 의 경량 언어 모델인 Aryabhata 1.0 을 제안합니다. 기존 대규모 언어 모델(LLM)이 교육적 활용에 부적합했던 문제를 해결하고, 학생 이해를 돕는 정확하고 투명하며 효율적인 단계별 추론 능력을 제공하는 것을 목표로 합니다.#Review#Language Model#Math Reasoning#JEE#Supervised Fine-Tuning#Reinforcement Learning#Model Merging#Chain-of-Thought#Curriculum Learning2025년 8월 13일댓글 수 로딩 중