[논문리뷰] Spectral Rewiring for Exploration, Purification, and Model Merging본 논문은 LLM의 RL post-training 과정에서 발생하는 dense full-parameter 업데이트의 비효율성과 부작용을 해결하고자 합니다 . 기존의 방식은 reasoning 성능을 오히려 억제하거나, 테스트 타임 스케일링에서의 조기 포화(Early saturation) 문제를 야기합니다.#Review#Reinforcement Learning#Spectral Analysis#Model Merging#Subspace-Aligned Rewiring#Large Language Models#Reasoning Elicitation#Parameter Efficiency2026년 7월 16일댓글 수 로딩 중