[논문리뷰] SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs본 논문은 LLM의 Multi-task 성능 향상을 위한 두 주류 방법론인 SFT와 RL이 Multi-task 환경에서 보이는 극명한 거동 차이를 규명하고자 합니다. 기존 연구들은 SFT와 RL의 단일 태스크 학습 특성을 비교했으나, Multi-stage 학습 상황에서의 근본적인 차이는 명확히 설명하지 못했습니다.#Review#Large Language Models#Supervised Fine-Tuning#Reinforcement Learning#Multi-Task Learning#Gradient Interference#Parallel-RL2026년 8월 9일댓글 수 로딩 중