[논문리뷰] DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution기존 비디오 생성 모델들은 시각적 충실도와 모션 품질에서 상당한 발전을 이루었지만, 오디오를 생략하거나 별도의 단계에서 합성하는 경우가 많아 시각적 역동성과 음향 이벤트 간의 상호 모델링이 제한적이라는 핵심적인 문제에 직면해 있다.#Review#Native Audio-Video Generation#Gated Cross-Modal Attention#Reinforcement Learning#2K Refinement#Open-Weight Model#Multimodal Feedback2026년 8월 31일댓글 수 로딩 중
[논문리뷰] MuScriptor: An Open Model for Multi-Instrument Music Transcription기존의 AMT 연구들은 주로 단일 악기(피아노, 기타 등)에 국한되어 있으며, 다중 악기(Multi-instrument) 환경에서의 실질적인 성능은 매우 저조합니다.#Review#Automatic Music Transcription#Multi-Instrument#Transformer#Synthetic Pre-training#Reinforcement Learning#Open-Weight Model2026년 7월 14일댓글 수 로딩 중
[논문리뷰] CHURRO: Making History Readable with an Open-Weight Large Vision-Language Model for High-Accuracy, Low-Cost Historical Text Recognition본 연구는 역사 문서의 텍스트 인식 정확도를 높이고 비용을 절감하기 위해 오픈-웨이트 대규모 비전-언어 모델(VLM) 인 CHURRO 를 개발하는 것을 목표로 합니다.#Review#Historical Text Recognition#Vision-Language Model#Open-Weight Model#OCR#Cultural Heritage#Low-Cost AI#Dataset Curation#Fine-tuning2025년 9월 29일댓글 수 로딩 중