[논문리뷰] Reference-Free Post-Training of Open Large Language Models for Multilingual Machine Translation본 논문은 multilingual machine translation에서 고품질의 병렬 데이터(parallel data)가 부족하다는 한계를 극복하기 위해 Reference-Free 포스트 트레이닝 방식을 제안합니다.#Review#Multilingual Machine Translation#Reference-Free#Post-Training#GRPO#Checkpoint Interpolation#On-Policy Distillation#Large Language Models2026년 8월 11일댓글 수 로딩 중
[논문리뷰] SLIME: Stabilized Likelihood Implicit Margin Enforcement for Preference Optimization기존 선호도 최적화 방법론, 특히 DPO 및 SimPO 가 겪는 '언러닝(unlearning)'과 '포맷팅 붕괴(formatting collapse)' 문제를 해결하는 것이 주 목표입니다.#Review#Preference Optimization#LLM Alignment#Direct Preference Optimization#Reference-Free#Likelihood Anchoring#Token Stabilization#Dual-Margin Loss#Unlearning2026년 2월 2일댓글 수 로딩 중