[논문리뷰] ISO: An RLVR-Native Optimization Stack본 논문은 현대의 RLVR 학습이 보상 피드백을 모델 가중치로 변환하는 최적화 계층(optimization layer)을 충분히 이해하지 못한 채 사전 학습(pre-training)의 관습을 그대로 따르고 있다는 문제에서 출발합니다.#Review#RLVR#Optimization#Spectral Inheritance#Isospectral Optimization#ISO-Merger#ISO-Optimizer#Singular Frames2026년 7월 21일댓글 수 로딩 중