[논문리뷰] Thinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See본 연구는 저자원 언어(Low-resource language)에서 LLM의 추론 성능을 개선하기 위해 수행되는 SFT와 RL이 모델의 실제 추론 능력에 어떤 영향을 미치는지 규명하고자 한다.#Review#Low-Resource Language#Chain-of-Thought#Supervised Fine-Tuning (SFT)#Reinforcement Learning (RL)#Mixture-of-Experts (MoE)#Training Variance#Language Fidelity2026년 8월 20일댓글 수 로딩 중