[논문리뷰] Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs본 논문은 최신 Vision-Language-Action(VLA) 모델들이 Chain-of-Thought(CoT) Supervision 과정에서 GT 궤적에 과도하게 의존하여 발생하는 인과적 불충실성(causal unfaithfulness) 문제를 해결하고자 합니다.#Review#Autonomous Driving#Vision-Language Models#Chain-of-Thought#Trajectory Anchoring Bias#Verifiable Reasoning#Reinforcement Learning2026년 8월 3일댓글 수 로딩 중