[논문리뷰] MintAct: A Unified Visual Agent for Digital Environments본 논문은 다양한 디지털 환경 전반에서 범용적으로 작동하는 통합 에이전트 모델 구축의 어려움을 해결하고자 합니다.#Review#Visual Agent#UI Grounding#Reinforcement Learning#Multimodal#Action Space#Asynchronous RL2026년 9월 20일댓글 수 로딩 중
[논문리뷰] Orion: A Unified Visual Agent for Multimodal Perception, Advanced Visual Reasoning and Execution본 논문은 기존의 단일(monolithic) VLM(Vision-Language Model)이 가진 정밀성, 결정론적 제어 및 복합적 시각 작업 처리 능력의 한계를 극복하고자 합니다.#Review#Visual Agent#Multimodal Perception#Tool-Augmented LLM#Agentic AI#Visual Reasoning#Computer Vision#Structured Outputs#ReAct Framework2025년 11월 18일댓글 수 로딩 중