[논문리뷰] MaskAlign: Token-Subset Representation Alignment for Efficient Diffusion Training본 논문은 기존의 Representation Alignment 기법이 diffusion 모델의 학습 효율성을 개선함에도 불구하고, 노이즈가 포함된 모델 입력과 깨끗한 이미지 기반의 참조 특징 사이에서 발생하는 근본적인 '불일치(mismatch)' 문제를 해결하고자 합니다.#Review#Diffusion Models#Representation Alignment#Token Masking#Efficient Training#Stochastic Interpolants#Transformer2026년 6월 11일댓글 수 로딩 중
[논문리뷰] Leveraging Morphology for Historical Script Metrological Analysis본 연구는 고대 필사본 연구에서 필자의 서체 특성을 객관적으로 정량화하기 위한 자동화된 도구가 부족하다는 점을 해결하고자 합니다. 기존의 수동적인 Paleography 분석은 연구자의 주관에 의존하며, 대규모 데이터를 처리하는 데 한계가 있습니다.#Review#Historical Script#Metrological Analysis#Morphology#Paleography#Feature Extraction#Geometric Analysis2026년 6월 11일댓글 수 로딩 중
[논문리뷰] LabVLA: Grounding Vision-Language-Action Models in Scientific Laboratories본 연구는 기존의 General-purpose VLA 모델들이 정밀한 과학 실험실 환경에서의 특수성과 고도의 Domain-specific 작업 수행 능력 부족 문제를 해결하고자 합니다.#Review#Vision-Language-Action#Robotics#Scientific Laboratory#Multimodal Learning#Embodied AI#Automation2026년 6월 11일댓글 수 로딩 중
[논문리뷰] InterleaveThinker: Reinforcing Agentic Interleaved Generation본 논문은 기존의 Unified Multimodal Models(UMMs)가 장기 시퀀스 생성 과정에서 겪는 Visual Over-reliance와 Step-wise Error Accumulation 문제를 해결하기 위해 고안되었습니다.#Review#Interleaved Generation#Multi-Agent Framework#Reinforcement Learning#GRPO#Visual Over-reliance#Error Accumulation2026년 6월 11일댓글 수 로딩 중
[논문리뷰] IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder본 논문은 VFM 기반의 RAE가 재구성 품질과 의미 보존 사이에서 겪는 근본적인 병목 현상을 해결하고자 합니다. 기존 연구들은 주로 깊은 계층의 의미론적 정보에만 의존하는데, 이는 디테일한 시각적 속성(색상, 텍스트, 로컬 구조 등)을 소실시키는 결과를 초래합니다.#Review#Representation Autoencoder#Vision Foundation Models#Vector Quantization#Autoregressive Generation#Semantic Preservation#Reconstruction Fidelity2026년 6월 11일댓글 수 로딩 중
[논문리뷰] High-Fidelity Two-Step Image Generation via Teacher-Aligned End-to-End Distillation본 연구는 고품질 이미지 생성 모델의 Inference Latency 문제와 다단계 생성 과정에서의 정보 손실을 해결하는 것을 목표로 합니다.#Review#Image Generation#Knowledge Distillation#Diffusion Models#Model Compression#Latent Diffusion#Efficiency2026년 6월 11일댓글 수 로딩 중
[논문리뷰] HarnessBridge: Learnable Bidirectional Controller for LLM Agent Harness본 논문은 기존의 수동으로 설계된(manually engineered) Harness가 복잡하고 긴 호흡의(long-horizon) 과제에서 비효율적인 상호작용을 초래하는 문제를 해결하고자 합니다.#Review#LLM Agent#Harness Engineering#Bidirectional Projection#Observation Projection#Action Projection#Unified Instruction Tuning#Long-Horizon Task2026년 6월 11일댓글 수 로딩 중
[논문리뷰] HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers본 논문은 기존 Multimodal Large Language Models(MLLMs)가 Visual Encoder와 LLM 사이의 불균형 및 정보 정렬(Alignment) 미흡으로 인해 발생하는 성능 저하 문제를 해결합니다.#Review#Multimodal Learning#Visual Tokenizer#Unified Architecture#Large Language Models#Representation Learning#Vision-Language Integration2026년 6월 11일댓글 수 로딩 중
[논문리뷰] From 2D Grids to 1D Tokens: Reforming Shared Representations for Multimodal Image Fusion본 논문은 기존의 Multimodal Image Fusion (MMIF) 기법들이 공유 표현(shared representation)으로 dense 2D feature grid를 사용함으로써 발생하는 구조적 한계를 해결합니다.#Review#Multimodal Image Fusion#1D Tokenizer#Shared Representation#Selective Token Editing#Global Appearance#Local Fidelity2026년 6월 11일댓글 수 로딩 중
[논문리뷰] Flash-GMM: A Memory-Efficient Kernel for Scalable Soft Clustering본 논문은 대규모 데이터셋에 대한 GMM 훈련 시 발생하는 메모리 부족(OOM) 문제와 과도한 HBM 대역폭 요구 사항을 해결합니다.#Review#Gaussian Mixture Models#GMM#Triton#IVF#Approximate Nearest Neighbor#Memory-Efficient#Soft Clustering2026년 6월 11일댓글 수 로딩 중
[논문리뷰] FORT-Searcher: Synthesizing Shortcut-Resistant Search Tasks for Training Deep Search Agents본 연구는 Deep Search Agents가 훈련 과정에서 데이터셋 내의 의도치 않은 패턴인 Shortcut에 과도하게 의존하여 실제 검색 환경에서 성능이 저하되는 현상을 해결합니다.#Review#Deep Search Agents#Shortcut-Resistant#Task Synthesis#Representation Learning#Reinforcement Learning#Information Retrieval#Robustness2026년 6월 11일댓글 수 로딩 중
[논문리뷰] Evoflux: Inference-Time Evolution of Executable Tool Workflows for Compact Agents본 논문은 Compact Language Models 기반의 에이전트가 복잡한 MCP 도구 사용 환경에서 겪는 구조적 취약성과 낮은 실행 성공률 문제를 해결하고자 합니다.#Review#Tool-use#Compact Language Models#Inference-time Evolution#Executable Workflow#MCP-Bench#LLM Agents#Evolutionary Search2026년 6월 11일댓글 수 로딩 중
[논문리뷰] EvoBrowseComp: Benchmarking Search Agents on Evolving Knowledge본 연구는 기존의 정적인 벤치마크 환경이 급변하는 실시간 정보 환경을 제대로 반영하지 못하는 한계를 극복하고자 수행되었습니다. 대다수의 기존 모델들은 학습 데이터에 포함된 과거 정보에 의존하거나, 고정된 문서 데이터셋 내에서만 평가되어 실시간으로 업데이트되는 사실 관계를 추적하는 데 어려움을 겪습니다.#Review#Search Agents#Evolving Knowledge#Benchmarking#Information Retrieval#LLM#Dynamic Environments2026년 6월 11일댓글 수 로딩 중
[논문리뷰] A Stationary (and Therefore Compatible) Representation is All You Need본 논문은 급변하는 모델 생태계에서 개별 모델의 Representation이 변화함에 따라 발생하는 Compatibility 단절 문제를 해결하고자 합니다.#Review#Stationary Representation#Model Compatibility#Representation Learning#Knowledge Distillation#Feature Alignment2026년 6월 11일댓글 수 로딩 중
[onnxruntime] WebGPU 성능 최적화: Graph Capture 재사용을 위한 Session-level Buffer Pool 도입ONNX Runtime WebGPU EP에서 그래프 캡처 시 발생하는 버퍼 재할당 오버헤드를 줄이기 위한 세션 레벨 버퍼 풀링 기법 분석#WebGPU#ONNXRuntime#Performance#GraphCapture#GenAI2026년 6월 10일댓글 수 로딩 중
[sglang] SGLang에서 DP Attention, TBO, Shared Experts Fusion 동시 최적화 구현DP Attention, TBO, Shared Experts Fusion을 통합하여 DeepSeek 모델의 추론 성능을 약 2.5% 향상시킨 기술적 해결 과정.#SGLang#DeepSeek#LLM#Optimization#DistributedInference2026년 6월 10일댓글 수 로딩 중
[flashinfer] FlashInfer Unified MoE API: NVFP4 백엔드 통합 및 자동 튜닝 최적화CuteDSL과 TRTLLM FP4 백엔드를 통합하고, 런타임 자동 튜닝을 통해 최적의 성능을 선택하는 Unified MoE API 설계 및 구현.#FlashInfer#MoE#NVFP4#Autotuning#LLM2026년 6월 10일댓글 수 로딩 중
[vllm] vLLM, DFlash 도입으로 추론 속도 1.2배 향상: MRV2와 CUDAGraph의 시너지vLLM이 DFlash를 도입하여 MRV2 및 CUDAGraph와 결합, 추론 속도를 1.2배 향상시킨 기술적 분석입니다.#vLLM#DFlash#Speculative Decoding#Performance Optimization#CUDAGraph#LLM Inference2026년 6월 10일댓글 수 로딩 중
[loki] Grafana Loki의 Shuffle Sharding 알고리즘 최적화: 성능 향상의 비결Grafana Loki의 Shuffle Sharding 알고리즘이 어떻게 최적화되어 성능을 크게 향상시켰는지 분석합니다.#Grafana Loki#Shuffle Sharding#성능 최적화#Go#알고리즘2026년 6월 9일댓글 수 로딩 중
[sglang] SGLang LTX-2 VAE 디코딩 성능 최적화: channels_last_3d 도입으로 4.5배 속도 향상LTX-2 VAE 디코딩 과정에서 channels_last_3d 메모리 레이아웃을 적용하여 Conv3d 연산 속도를 4.5배 높이고 메모리 사용량을 13.5% 절감했습니다.#SGLang#DeepLearning#Optimization#VAE#CUDA2026년 6월 9일댓글 수 로딩 중