[논문리뷰] Evaluating Multimodal LLMs as Generalist Vision-Language-Action Agents for Drone Control: Commanding, Approaching, Tracking and Searching본 논문은 MLLM의 시각적 인지 능력이 물리적 제어(acting) 영역까지 얼마나 확장될 수 있는지, 그리고 드론 제어 루프에서 MLLM의 역할을 어디까지 부여할 수 있는지 규명하는 것을 목표로 합니다. .#Review#Multimodal Large Language Models#Embodied AI#Drone Control#Vision-Language-Action Agents#Benchmark#Action Protocol2026년 9월 1일댓글 수 로딩 중