[논문리뷰] StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models본 논문은 기존 VLA 모델들이 사용하는 single-frame paradigm의 한계를 극복하기 위해 StreamPI를 제안한다. 최신 모델인 π0.5를 포함한 많은 VLA 모델들은 이전 프레임의 맥락을 고려하지 못하여 기억이 필요한 작업이나 정밀한 공간 인식이 요구되는 상황에서 성능이 저하되는 문제를 겪는다 .#Review#Vision-Language-Action (VLA)#Streaming Inference#Temporal Modeling#Instruction-Anchored#Random-Interval Training#Embodied AI2026년 8월 26일댓글 수 로딩 중