본문으로 건너뛰기

#End-to-End

16개의 포스트

[논문리뷰] WeVisDoc: From Coverage to Capability for Robust End-to-End Document Parsing

댓글 수 로딩 중

[논문리뷰] Motion-Omni: End-to-End Joint Speech and Full-Body Motion for Spoken Dialogue

댓글 수 로딩 중

[논문리뷰] VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End?

댓글 수 로딩 중

[논문리뷰] DistilVDR: A Compact End-to-End Visual Document Retriever via Dual-Student Distillation

댓글 수 로딩 중

[논문리뷰] HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone

댓글 수 로딩 중

[논문리뷰] Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models

댓글 수 로딩 중

[논문리뷰] WavAlign: Enhancing Intelligence and Expressiveness in Spoken Dialogue Models via Adaptive Hybrid Post-Training

댓글 수 로딩 중

[논문리뷰] MonoArt: Progressive Structural Reasoning for Monocular Articulated 3D Reconstruction

댓글 수 로딩 중

[논문리뷰] ViSAudio: End-to-End Video-Driven Binaural Spatial Audio Generation

댓글 수 로딩 중

[논문리뷰] OmniFusion: Simultaneous Multilingual Multimodal Translations via Modular Fusion

댓글 수 로딩 중