[sglang] sglang, 멀티모달 모델 인코더 병렬 처리 최적화: 전체 복제본 활용으로 성능 향상sglang PR 분석: 멀티모달 모델의 텍스트/이미지 인코더 병렬 처리 방식을 개선하여 전체 GPU 복제본을 활용하고 성능을 극대화합니다.#sglang#병렬 처리#최적화#멀티모달#딥러닝2026년 7월 6일댓글 수 로딩 중
[vllm] vLLM 성능 최적화: token_to_req_indices 캐싱을 통한 6배 성능 향상vLLM에서 중복되던 CPU-GPU 간 데이터 복사를 제거하여 커널 성능을 5~6배 개선한 최적화 사례를 분석합니다.#vLLM#LLM#Performance#Optimization#CUDA2026년 7월 6일댓글 수 로딩 중
[vllm] vLLM Transformers Modeling Backend 성능 최적화: 네이티브 수준의 속도 달성Transformers 모델링 백엔드에 Fused Linear와 MoE 최적화를 도입하여 vLLM 네이티브 수준의 성능을 구현한 기술적 분석.#vLLM#LLM#Optimization#Transformers#PyTorch2026년 7월 6일댓글 수 로딩 중
[논문리뷰] dOPSD: On-Policy Self-Distillation for Diffusion Language Models본 논문은 dLLM의 추론 성능을 향상시키기 위한 효과적인 post-training 방법론의 부재 문제를 다룬다. 기존의 Supervised Fine-Tuning은 off-policy 문제로 인한 exposure bias에 취약하며, RLVR은 보상이 희소하고 sequence-level에 국한된다는 한계가 있다.#Review#Diffusion Language Models#On-Policy Self-Distillation#Privileged Information#Denoising Trajectory#Reasoning2026년 7월 6일댓글 수 로딩 중
[논문리뷰] Wan-Streamer v0.2: Higher Resolution, Same Latency본 논문은 Wan-Streamer v0.1의 핵심인 네이티브 스트리밍 프레임워크를 유지하면서, 기존 192p의 낮은 출력 해상도를 개선하여 실시간 상호작용의 시각적 품질을 높이는 것을 목표로 합니다.#Review#Native-streaming#Audio-visual Interaction#Context-parallel#Latency-preserving#Ulysses-style#Flow-matching#Real-time2026년 7월 6일댓글 수 로딩 중
[논문리뷰] Vision Pretraining for Dense Spatial Perception본 논문은 현대의 비전 파운데이션 모델들이 Semantic Invariance를 우선시하여 고밀도 공간 이해(Dense Spatial Perception) 능력이 부족하다는 문제를 해결하고자 한다 .#Review#Vision Pretraining#Masked Boundary Modeling#Self-Supervised Learning#Dense Spatial Perception#Vision Transformer#Boundary-Forcing Masking#Categorical Reparameterization2026년 7월 6일댓글 수 로딩 중
[논문리뷰] Unified Audio Intelligence Without Regressing on Text Intelligence본 논문은 오디오와 비전 등 다중 모달 능력을 강화한 기존 LLM들이 텍스트 추론 및 지식 처리 능력에서 심각한 성능 퇴보를 보이는 문제를 해결하고자 합니다. 특히 최근의 멀티모달 모델들은 강력한 생성 능력을 갖추었음에도 불구하고, Reasoning 벤치마크에서 원본 모델 대비 눈에 띄는 저하를 보입니다.#Review#Audio-Text LLM#Mixture-of-Experts (MoE)#Multimodal Generation#Cascade RL#Audio Intelligence2026년 7월 6일댓글 수 로딩 중
[논문리뷰] UI-MOPD: Multi-Platform On-Policy Distillation for Continual GUI Agent LearningGUI agent는 단일 플랫폼을 넘어 다양한 환경(데스크탑, 모바일)으로 확장되고 있으나, 플랫폼 간 이질적인 상호작용 방식과 높은 품질의 교차 플랫폼 궤적 부족으로 인해 학습에 어려움을 겪고 있다 .#Review#GUI Agent#Multi-Teacher On-Policy Distillation#Continual Learning#Cross-Platform#Desktop/Mobile#Reinforcement Learning2026년 7월 6일댓글 수 로딩 중
[논문리뷰] Transition-Aware best-of-N sampling for Longitudinal Chest X-ray Reports본 연구는 대부분의 기존 Chest X-ray 보고서 생성 모델 및 Best-of-N 파이프라인이 환자의 이전 검사 이력을 무시하고 단일 이미지에만 의존한다는 한계를 해결합니다.#Review#Chest X-ray#Report Generation#Best-of-N Sampling#Longitudinal Context#Vision-Language Models#Set-to-Set Distance#Clinical Transition2026년 7월 6일댓글 수 로딩 중
[논문리뷰] Taste-aware music retrieval from audio embeddings본 연구는 소리와 맛 사이의 상관관계가 인간의 심리적 연구에서는 잘 확립되어 있음에도 불구하고, 콘텐츠 기반 멀티미디어 검색 분야에서는 거의 다뤄지지 않고 있다는 문제의식에서 출발합니다.#Review#Audio Embeddings#Music Information Retrieval#Crossmodal Correspondence#Multimodal Learning#Taste Prediction2026년 7월 6일댓글 수 로딩 중
[논문리뷰] SynCity 3000: Bootstrapping Scene-Scale 3D Diffusion본 논문은 기존의 3D 장면 생성 모델이 지닌 규모 확장성과 일관성 문제를 해결하기 위해 SynCity 3000을 제안한다. 기존 연구들은 주로 단일 오브젝트 생성에 특화되어 있거나, 장면을 독립적인 타일(tile)들의 집합으로 간주하여 생성함으로써 결과물에서 눈에 띄는 격자(grid-like) 구조적 결함을 야기한다 .#Review#3D Scene Generation#Diffusion Models#Convolutional Inference#Scene-Scale#Synthetic Data Engine#3D Gaussian Splats2026년 7월 6일댓글 수 로딩 중
[논문리뷰] Speaker-Disentangled Chunk-Wise Regression for Syllabic Tokenization본 논문은 기존의 syllabic tokenization 방식인 SD-HuBERT가 음절의 linguisitic content를 정교하게 추출하지 못하고 speaker identity를 과도하게 반영하는 문제를 해결하고자 합니다 .#Review#Syllabic Tokenization#Speaker-Disentangled#Chunk-Wise Regression#Self-Supervised Learning#Speech Language Modeling#Syllable Discovery2026년 7월 6일댓글 수 로딩 중
[논문리뷰] Speaker-Aware Temporal Aggregation Strategies on Segment Representations for Depression Detection in Dyadic Interaction: A Benchmark Study본 논문은 기존의 우울증 감지 연구들이 단일 SSL Backbone과 임의로 선택된 단일 레이어에 의존함으로써 발생하는 편향성 문제를 해결하고자 한다.#Review#Depression Detection#Temporal Aggregation#Self-Supervised Learning#Benchmark#Dyadic Interaction#SSL Backbones2026년 7월 6일댓글 수 로딩 중
[논문리뷰] Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification본 논문은 기존의 LLM 에이전트 안전성 평가 방식이 고정된 규칙과 전문가의 수동 설계에 의존하여, 에이전트의 급격한 진화와 도구 생태계의 복잡성을 따라가지 못하는 한계를 해결하고자 합니다 .#Review#LLM Agents#Safety Testing#Evidence-Grounded Verification#Automated Red-Teaming#Software Engineering#Sandboxed Execution2026년 7월 6일댓글 수 로딩 중
[논문리뷰] ResearchStudio-Reel: Automate the Last Mile of Research from Paper to Poster, Video, and Blog본 논문은 학술 논문을 포스터, 영상, 블로그 글로 변환하는 이른바 'Last Mile' 연구 확산 과정의 비효율성을 해결하기 위해 ResearchStudio-Reel을 제안한다 . 기존 연구(Baseline) 시스템들은 다음과 같은 3가지 주요 한계점을 가진다.#Review#Generative AI#Research Dissemination#Automated Poster Generation#Agent Framework#Multi-modal Workflow#Scientific Communication2026년 7월 6일댓글 수 로딩 중
[논문리뷰] ResearchStudio-Idea: An Evidence-Grounded Research-Ideation Skill Suite from ML Conference Outcomes본 논문은 LLM 기반 연구 에이전트의 발전에도 불구하고, 연구 아이디어의 타당성을 문헌에 근거하여 확보하고 잠재적 실패 가능성을 사전에 검토하는 'first-mile' 단계의 체계적인 지원이 부족하다는 문제를 해결합니다.#Review#Research Ideation#LLM Agent#Evidence-Grounded#Ideation Pattern#Conference Outcomes#Novelty Assessment2026년 7월 6일댓글 수 로딩 중
[논문리뷰] PraMem: Practice-derived Experiential Memory for Long-horizon Behavior Prediction본 논문은 Long-horizon behavior prediction에서 발생하는 잠재적 행동 패턴 유도(Induction)의 어려움과 LLM의 내재적 인지 편향 문제를 해결하기 위해 제안되었습니다.#Review#Long-horizon Behavior Prediction#Large Language Models#Experiential Memory#Dialectical Philosophy#Behavioral Pattern Induction#Cognitive Bias Mitigation2026년 7월 6일댓글 수 로딩 중
[논문리뷰] PixWorld: Unifying 3D Scene Generation and Reconstruction in Pixel Space본 논문은 3D 장면 생성과 복원이라는 두 가지 이질적인 과제를 단일 픽셀 공간 프레임워크 내에서 통합적으로 해결하는 것을 목표로 합니다.#Review#3D Scene Generation#3D Scene Reconstruction#Pixel-Space Diffusion#3D Gaussian Splatting#Geometry Perception Loss2026년 7월 6일댓글 수 로딩 중
[논문리뷰] PixCon: Clean-Positive Contrastive Learning for Foundation-Model Semi-Supervised Segmentation기존의 SSSS 연구들은 주로 Pseudo-label의 신뢰성을 판단하기 위한 confidence filtering 전략에 의존해 왔습니다. 그러나 DINOv2와 같은 강력한 foundation-model backbone이 등장하면서, 단순히 threshold를 높이는 것만으로는 성능 향상에 한계가 있음이 드러났습니다.#Review#Semi-supervised Semantic Segmentation#Foundation Models#Contrastive Learning#Pseudo-labeling#DINOv2#Embedding Space#Consistency Regularization2026년 7월 6일댓글 수 로딩 중
[논문리뷰] Perceptual Flow Matching for Few-Step Generative Modeling본 논문은 기존 Flow Matching 모델이 고품질 출력을 생성하기 위해 수십 번의 샘플링 단계(35~50 steps)를 요구하여 발생하는 높은 추론 Latency 문제를 해결하고자 합니다.#Review#Flow Matching#Few-Step Generation#Perceptual Supervision#Perceptual Feature Space#Generative Modeling#Classifier-free Guidance2026년 7월 6일댓글 수 로딩 중