[논문리뷰] Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based SegmentationMLLM 기반 분할 모델은 텍스트 생성 중심의 구조와 dense한 픽셀 예측이라는 목표 사이의 근본적인 불일치로 인해 Trilemma에 직면해 있습니다 .#Review#MLLM#Segmentation#Non-autoregressive#Trilemma#All-Mask Prediction#Spatial Grounding2026년 8월 4일댓글 수 로딩 중
[논문리뷰] Are the Financial Reasoning from LLMs Credible? A Real World Test over Long-Horizon Statements본 논문은 현대의 LLM이 금융 도메인에서 진정한 구조적 추론 능력을 갖추었는지, 아니면 단순한 표면적 패턴 매칭에 의존하는지를 검증하는 것을 핵심 목표로 한다.#Review#FININDICES#Financial Reasoning#Data-processing Fidelity#Long-context LLM#Structure Bottleneck#Knowledge Bottleneck#Table-Index Tabulation2026년 8월 4일댓글 수 로딩 중
[논문리뷰] Any-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space Bridging본 논문은 이질적인 모델 패밀리 간의 on-policy distillation이 불가능하다는 문제점을 해결합니다. 기존의 distillation 방식은 Teacher와 Student가 VAE 잠재 공간, 아키텍처, 그리고 noise schedule을 공유해야 한다는 동질성(Homogeneity) 가정을 전제로 합니다 .#Review#On-policy Distillation#Flow-matching#Heterogeneous#Representation-space Bridging#Latent Generators#Knowledge Distillation#DINOv22026년 8월 4일댓글 수 로딩 중
[논문리뷰] AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling본 연구는 텍스트 생성에서 기존의 이산적 토큰(discrete tokens) 모델링 방식이 가진 구조적 제약을 극복하고, 언어 자체를 연속적인 잠재 공간에서 효과적으로 표현하고 생성하는 방식을 제안합니다.#Review#Continuous-Latent Diffusion#Flow Matching#Block-Causal Denoiser#Query-based Encoder-Decoder#Representation Learning2026년 8월 4일댓글 수 로딩 중
[hermes-agent] Python 백엔드 콜드 스타트 성능 개선: 14초 GIL 스톨 해결하기Windows 환경에서 발생하는 14초 규모의 GIL 스톨을 모듈 사전 로딩과 비동기 처리를 통해 해결한 최적화 사례입니다.#Python#Performance#AsyncIO#GIL#Optimization2026년 8월 3일댓글 수 로딩 중
[flashinfer] FlashInfer: B200용 최적화된 Recurrent KDA Prefill 백엔드 도입NVIDIA B200(SM100a) 아키텍처를 위한 고성능 Recurrent KDA Prefill 백엔드 추가 및 성능 최적화 분석#FlashInfer#B200#CUDA#KDA#Performance2026년 8월 3일댓글 수 로딩 중
[onnxruntime] [CUDA] QMoE MXFP4/NVFP4 가중치 역양자화 성능 최적화: Coalesced Memory Access의 힘ONNX Runtime의 QMoE 가중치 역양자화 커널을 Coalesced Memory Access 패턴으로 최적화하여 MoE 모델의 추론 속도를 대폭 향상시킨 PR 분석.#CUDA#ONNXRuntime#MoE#Optimization#GPU#DeepLearning#FP4#Dequantization#MemoryAccess2026년 8월 3일댓글 수 로딩 중
[sglang] AMD MI350x에서 Qwen3.5의 Long-Context Prefill 성능을 극대화하는 FP8 FMHA 최적화 분석Qwen3.5 모델의 긴 컨텍스트 Prefill 성능을 위한 AMD MI350x 전용 FP8 FMHA 커널 통합 분석.#SGLang#AMD#ROCm#MI350x#Qwen3.5#FMHA#FP8#성능 최적화#Prefill2026년 8월 3일댓글 수 로딩 중
[논문리뷰] WorldExam: Benchmarking World Models from Apparent Appearance to Inherent Reactivity본 논문은 기존의 비디오 생성 모델 평가가 주로 Apparent Appearance와 명시적인 지시 사항 이행에만 집중되어 있어, 모델의 Inherent Reactivity를 충분히 검증하지 못한다는 문제 의식에서 출발합니다.#Review#World Models#Video Generation#Inherent Reactivity#Diagnostic Benchmark#Control Adherence#Spatial Consistency#Interaction2026년 8월 3일댓글 수 로딩 중
[논문리뷰] WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning본 논문은 기존 VLA-RL 환경에서 비평 모델(Critic)이 단일 프레임 관측값에만 의존하여 시스템의 시간적 구조를 포착하지 못하는 문제를 해결하고자 합니다.#Review#VLA-RL#World Critic Model#POMDP#Representation Learning#Robotic Manipulation#Reinforcement Learning2026년 8월 3일댓글 수 로딩 중
[논문리뷰] VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation본 논문은 기존의 다중 모달(multimodal) OPD 방법론들이 교사 모델의 예측 교정을 그대로 증류(distill)함으로써 발생하는 source-mixed 문제를 해결하고자 합니다.#Review#Multimodal On-Policy Distillation#Visual Attribution#Counterfactual Target Reconstruction#Privileged Distillation#Visual Evidence#LLM2026년 8월 3일댓글 수 로딩 중
[논문리뷰] UEmbed: Unified Sparse and Dense Multimodal Embeddings본 연구는 기존 LSR 기법들이 인코더 기반의 양방향 아키텍처에 종속되어 있어 최신 Decoder-only 모델의 효율성을 활용하기 어렵다는 문제점을 해결하고자 합니다. 기존 멀티모달 검색 모델들은 별도의 보조 교차 모달(Cross-modal) 모듈을 사용해야 하므로 모델의 확장성과 배포 효율성이 낮다는 한계가 있습니다.#Review#Multimodal Embedding#Learned Sparse Retrieval#Decoder-only Model#Causal Attention#Retrieval-Augmented Generation#Agentic Search2026년 8월 3일댓글 수 로딩 중
[논문리뷰] SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks본 논문은 애니메이션 더빙, 오디오 드라마, 광고 등 미디어 제작 환경에서 레퍼런스 오디오 없이 음성을 디자인하거나, 자연어 명령으로 화자 스타일을 제어하고, 환경 및 오디오 이펙트를 포함하는 멀티-스피커 음성 및 오디오 생성을 지원하는 통합 시스템의 필요성을 제기한다.#Review2026년 8월 3일댓글 수 로딩 중
[논문리뷰] StyleForge: Indoor Furniture Styling by Counterfactual Reasoning in a Hypergraph Field본 논문은 기존의 독립적인 3D 에셋 검색 방식이 실내 장면 구성 시 발생하는 형태, 재질, 색상 간의 충돌 문제를 해결하지 못하는 한계를 지적한다.#Review#Indoor Furniture Styling#Counterfactual Reasoning#Dynamic Hypergraph#Style Field#Mahalanobis Energy#3D Asset Retrieval#Scene-Level Coherence2026년 8월 3일댓글 수 로딩 중
[논문리뷰] Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models본 논문은 MLLM이 시각적 정보와 사전 지식이 충돌할 때 발생하는 Visual Context Sensitivity의 불안정성 문제를 제기합니다 .#Review#Multimodal Large Language Models#Visual Context Sensitivity#WhatIfVis#Counterfactual Benchmark#Activation Patching#Subspace Intervention#Utilization Failure2026년 8월 3일댓글 수 로딩 중
[논문리뷰] ScrambleToolBench: Agents Search Exhaustively Even When Their Own Map Points to the Next Step본 논문은 현재의 대규모 언어 모델(LLM) 기반 에이전트들이 도구 사용 능력을 평가할 때, 실제적인 행동 추론보다는 API 이름과 같은 의미론적 우선순위(semantic priors)에 과도하게 의존하고 있다는 문제를 제기합니다 .#Review#Autonomous Agents#Tool-Use#Benchmark#Behavioral Reasoning#Semantic Obfuscation#Mapping Drift#Stochastic Failure#Persistent Memory2026년 8월 3일댓글 수 로딩 중
[논문리뷰] SWE-Touch: Benchmarking Coding Agents When Users Touch the Code본 논문은 Coding Agents가 autonomous한 환경에서 impressive performance를 보였음에도 불구하고, real-world collaborative development 상황에서 사용자 intervention에 의해 workspace 상태가 변경될 때 struggle한다는 핵심 문제를 제기합니다.#Review#Coding Agents#Benchmarks#Human-AI Collaboration#Shared Workspace#Interactive Coding#SWE-Touch#Counter-Edit#LLMs2026년 8월 3일댓글 수 로딩 중
[논문리뷰] SKT: Skill-Use Training at Scale via Verified Synthetic Data Generation본 논문은 LLM이 단순히 Agent Skill을 보유하는 것을 넘어, 이를 적절한 시점에 식별하고, 실행하며, 복합적으로 활용할 수 있게 만드는 것을 목표로 합니다.#Review#Agent Skills#Data Synthesis#Skill-Use Training#Synthetic Data#Supervised Fine-Tuning#Language Model Agents2026년 8월 3일댓글 수 로딩 중
[논문리뷰] Roomer: Reflective Object-Grounded Model Editing and Repair for 3D Indoor Layout Synthesis본 논문은 기존의 indoor layout generator가 생성하는 레이아웃의 국소적인 violation(충돌, 경계 이탈, 기능적 차단 등) 문제를 해결하기 위해 Roomer를 제안합니다 .#Review#3D Indoor Layout Synthesis#Model Editing#Reflective Repair#Vision-Language Models#Physical Validity#Spatial Usability2026년 8월 3일댓글 수 로딩 중
[논문리뷰] Relax Within, Balance Across: Geometry-Guided Load Balancing for Vision-Language Mixture-of-Experts본 논문은 Vision-Language MoE 모델에서 토큰 혼합 비율(image-to-text ratio)이 변할 때 발생하는 부하 불균형 문제를 해결하고자 합니다.#Review#Mixture-of-Experts#Load Balancing#Vision-Language Models#Router Geometry#Composition Shift#Expert Parallelism2026년 8월 3일댓글 수 로딩 중