[논문리뷰] PANORAMA: Panoptic Grounded Captioning via Mask Proposal Selection본 논문은 기존의 Grounded Captioning 모델들이 가지는 정밀한 영역 분할(Segmentation)과 텍스트 생성 간의 불일치 문제를 해결하고자 합니다. 기존 연구들은 주로 Bounding Box에 의존하여 객체의 형태를 정교하게 묘사하지 못하거나, 고정된 객체만을 인식하는 한계가 있었습니다.#Review#Panoptic Grounded Captioning#Mask Proposal Selection#Vision-Language Models#Panoptic Segmentation#Object-Centric Representation#Grounding2026년 9월 16일댓글 수 로딩 중