[논문리뷰] RL^2-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models본 논문은 사전 학습된 VLA 모델이 Out-of-Domain(OOD) 환경이나 도전적인 작업에서 성능이 저하되는 문제를 해결하고자 한다.#Review#Vision-Language-Action Models#Reinforcement Learning#Test-Time Scaling#Compositional Steering#Adaptive Inference#Flow-Matching#Robotics2026년 8월 2일댓글 수 로딩 중