[논문리뷰] SLPO: Scaling Latent Reasoning via a Surrogate Policy본 연구는 latent reasoner가 명시적 CoT와 달리 결과 기반 RLVR을 활용한 test-time scaling의 이점을 누리지 못하는 문제를 해결하고자 한다.#Review#Latent Reasoning#Reinforcement Learning#Test-Time Scaling#Surrogate Policy#Adaptive Computation#Outcome-Reward RL2026년 7월 22일댓글 수 로딩 중