[논문리뷰] On-Policy Delta Distillation for Multilingual Math Reasoning본 논문은 LLM의 수학적 추론 능력을 향상시키기 위한 On-Policy Distillation 기법을 다국어(한국어, 일본어 등) 환경으로 확장하는 것을 목표로 합니다. 기존 연구들은 주로 영어 중심의 추론 벤치마크에 집중되어 있어, 비영어권 언어에서의 OPD 및 OPD^2^ 성능 검증이 미흡한 실정입니다.#Review#On-Policy Distillation#OPD^2^#Multilingual Math Reasoning#LLM Post-training#Reasoning Transfer#English-Korean Performance Gap2026년 8월 6일댓글 수 로딩 중
[논문리뷰] Prompt-Level Distillation: A Non-Parametric Alternative to Model Fine-Tuning for Efficient Reasoning본 논문은 복잡한 추론을 위해 필수적인 Chain-of-Thought (CoT)가 초래하는 높은 Latency와 연산 비용 문제를 해결하기 위해 고안되었습니다.#Review#Prompt-Level Distillation#Non-Parametric#Chain-of-Thought#System Prompt#Reasoning Transfer#Inference Efficiency2026년 6월 15일댓글 수 로딩 중
[논문리뷰] Directional Reasoning Injection for Fine-Tuning MLLMs논문은 멀티모달 대규모 언어 모델(MLLM)의 추론 능력이 텍스트 전용 LLM에 비해 현저히 떨어진다는 문제에 주목합니다. 대규모 멀티모달 추론 데이터셋이나 강화 학습 없이도, 텍스트 전용 추론 전문가 모델 의 추론 지식을 비추론 멀티모달 LLM 으로 효율적으로 전이하는 경량화된 방법을 개발하는 것을 목표로 합니다.#Review#Multimodal LLMs#Reasoning Transfer#Gradient-based Fine-tuning#Model Merging#Parameter-Efficient Learning#Supervised Fine-tuning#Directional Prior2025년 10월 23일댓글 수 로딩 중