[논문리뷰] StableVLA: Towards Robust Vision-Language-Action Models without Extra Data본 논문은 기존 VLA 모델들이 훈련 데이터에 포함되지 않은 실세계의 다양한 시각적 노이즈(센서 노이즈, 모션 블러 등)에 매우 취약하다는 점을 지적합니다. 현재의 VLA 모델은 주로 깨끗한 환경에서만 평가되며, 실제 배포 시 시각적 왜곡이 발생하면 성능이 급격히 저하되는 'robustness gap'을 보입니다.#Review#Vision-Language-Action Models#Information Bottleneck#Robustness#Modality Alignment#Embodied AI#Adapter Design2026년 5월 18일댓글 수 로딩 중