[onnxruntime] ONNX Runtime: AVX2 및 AVX-VNNI를 위한 2-bit 가중치 CPU 커널 최적화AVX2/AVX-VNNI 환경에서 2-bit 가중치 MatMul 성능을 개선하여 기존 dequant+SGEMM 대비 최대 1.56배 성능 향상을 달성했습니다.#ONNX Runtime#MLAS#AVX2#VNNI#Optimization#MatMul2026년 7월 17일댓글 수 로딩 중
[onnxruntime] ONNX Runtime: fpA_intB GEMM 최적화 및 CUDA 그래프 호환성 강화CUDA 환경에서 fpA_intB GEMM을 기본 활성화하고, 프로파일러의 병렬성 및 CUDA 그래프 안정성을 개선한 변경사항을 살펴봅니다.#ONNXRuntime#CUDA#GEMM#Quantization#Performance2026년 7월 17일댓글 수 로딩 중
[sglang] SGLang Kimi K2.5/K2.7 멀티모달 인코더-DP 성능 최적화: 이미지 피처 전송 샤딩 및 배치 처리Kimi K2.5/K2.7 모델의 멀티모달 인코더-DP 모드에서 이미지 피처 전송 및 전처리 성능을 획기적으로 개선한 PR 분석.#SGLang#Kimi#멀티모달#성능 최적화#GPU#CUDA IPC#분산 학습#FlashAttention2026년 7월 16일댓글 수 로딩 중
[cutlass] NVIDIA CUTLASS SM100 GEMM 커널 최적화 및 분산 환경 개선 분석NVIDIA Blackwell(SM100) 아키텍처를 위한 GEMM 커널 튜닝과 분산 환경에서의 메모리 관리 최적화 사례를 살펴봅니다.#NVIDIA#CUTLASS#CUDA#GEMM#Blackwell#HPC2026년 7월 16일댓글 수 로딩 중
[vllm] vLLM MoE 성능 최적화: FlashInfer One-Sided Combine을 활용한 메모리 복사 제거FlashInfer의 one-sided combine 기능을 활용해 MoE 출력 텐서의 불필요한 복사 과정을 제거하고 성능을 개선한 사례를 분석합니다.#vLLM#MoE#FlashInfer#Performance#GPU2026년 7월 16일댓글 수 로딩 중
[sglang] SGLang SM100 CuteDSL Prefill 최적화: State I/O의 커널 퓨전CuteDSL prefill 커널에서 불필요한 state gather/scatter를 제거하고 커널 내에서 직접 I/O를 수행하여 성능을 극대화했습니다.#SGLang#CUDA#Optimization#CuteDSL#SM1002026년 7월 16일댓글 수 로딩 중
[논문리뷰] WanSong v1.0 Technical Report본 논문은 기존의 Autoregressive(AR) 기반 오디오 생성 모델이 가진 낮은 효율성과 장기 오디오 생성 시의 일관성 유지 문제를 해결하기 위해 고안되었습니다. 기존 연구들은 다단계(Cascaded) 파이프라인이나 AR 모델을 주로 채택하여 복잡성이 높고 효율성이 떨어지는 한계가 있습니다.#Review#Diffusion-based Model#Music Generation#Dual-stem Modeling#Hybrid-MMDit#Reinforcement Learning#Foundation Model2026년 7월 16일댓글 수 로딩 중
[논문리뷰] VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding본 논문은 기존 Video MLLM이 겪는 일반화 부족, 높은 연산 비용, 그리고 폐쇄적인 연구 생태계라는 세 가지 한계를 해결하는 것을 목표로 한다. 기존 모델들은 짧은 영상에는 강점을 보이지만, 장시간 영상이나 실시간 스트리밍 환경으로의 확장이 어렵고 연산량이 기하급수적으로 증가하는 문제를 안고 있다.#Review#Video MLLM#I3D-ViT#Adaptive Frame Resolution#Video Understanding#Open Source#Streaming Perception2026년 7월 16일댓글 수 로딩 중
[논문리뷰] Video = World + Event Stream본 논문은 기존의 인터랙션 모델이 단일 응용 분야에 국한된 학습 목적을 가졌던 한계를 극복하기 위해, 비디오 데이터를 World와 Event Stream으로 분해하는 새로운 프레임워크를 제안합니다.#Review#World-Event Decomposition#Native-Streaming Interaction#Multimodal Pretraining#End-to-End Latency#Role-play Interface#Open-vocabulary Behavior2026년 7월 16일댓글 수 로딩 중
[논문리뷰] VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance본 논문은 기존 비디오 이해 모델들이 일반적인 사용자 중심의 환경에만 치우쳐 있어, 실제 시각 장애인의 고유한 환경적 특성과 니즈를 반영하지 못하는 문제를 해결하고자 합니다.#Review#VIABench#Visual Impairment Assistance#Video Understanding#Egocentric Vision#Assistive Technology#Multimodal Evaluation2026년 7월 16일댓글 수 로딩 중
[논문리뷰] UniVR: Thinking in Visual Space for Unified Visual Reasoning본 논문은 현재 AI 모델들이 추론 및 계획 능력을 주로 텍스트 공간 내에서 수행함으로써 발생하는 한계를 지적합니다. 텍스트는 추상적인 표현에 불과하여 물리적 법칙, 복잡한 동적 변화, 공간적 관계를 완벽히 담아내지 못하며, 이로 인해 모델이 실제 시각적 환경에서 일관성 있는 행동을 수행하는 데 어려움을 겪습니다 .#Review#Visual Reasoning#Reinforcement Learning#Unified Generative Model#Long-horizon Planning#Physical Consistency#World Modeling2026년 7월 16일댓글 수 로딩 중
[논문리뷰] Spectral Rewiring for Exploration, Purification, and Model Merging본 논문은 LLM의 RL post-training 과정에서 발생하는 dense full-parameter 업데이트의 비효율성과 부작용을 해결하고자 합니다 . 기존의 방식은 reasoning 성능을 오히려 억제하거나, 테스트 타임 스케일링에서의 조기 포화(Early saturation) 문제를 야기합니다.#Review#Reinforcement Learning#Spectral Analysis#Model Merging#Subspace-Aligned Rewiring#Large Language Models#Reasoning Elicitation#Parameter Efficiency2026년 7월 16일댓글 수 로딩 중
[논문리뷰] Smarter and Cheaper at Once: Byte-Exact KV-Cache Grafting Turns a Frozen Small Model into a Verified-Knowledge Flywheel본 논문은 대규모 언어 모델의 성능 향상을 위해 수행되는 재학습(retraining)과 매번 전체 문맥을 재연산해야 하는 추론 과정의 막대한 비용 문제를 해결하고자 합니다. 기존 방식은 모델 가중치를 변경하거나 매번 동일한 문맥을 반복해서 Prefill하는 비효율적인 자원 소모를 동반합니다.#Review#KV-State Grafting#Byte-Exactness#Inference-time Learning#Flywheel#Galahad#KV Cache#Model Efficiency2026년 7월 16일댓글 수 로딩 중
[논문리뷰] SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration본 논문은 기존의 정보 검색 에이전트들이 장기적인 검색(Long-horizon) 과정에서 수행 상태를 추적하지 못해 발생하는 불확실성과 비효율성 문제를 해결하고자 합니다.#Review#Information-Seeking Agents#Multi-Agent Collaboration#Relational Schema Completion#Search-Oriented Context Management#Pipeline-Parallel Scheduling#Middleware Harness2026년 7월 16일댓글 수 로딩 중
[논문리뷰] SUFLECA: Scaling Up Feature Learning for CAD-to-image Alignment본 논문은 기존 zero-shot CAD-to-image alignment 방식이 가진 외관 중심적(appearance-driven) 피처 학습의 한계를 극복하고자 합니다.#Review#CAD-to-image Alignment#Zero-shot#Feature Learning#NOCs#Geometric Consistency#Robotics2026년 7월 16일댓글 수 로딩 중
[논문리뷰] SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning본 논문은 장기적(Long-horizon) agentic 작업에서 발생하는 sparse trajectory-level reward와 token-level policy learning 사이의 불일치 문제를 해결하고자 합니다.#Review#Agentic Reinforcement Learning#On-Policy Distillation#Hindsight Learning#Large Language Models#Supervised Fine-Tuning#Self-Evolving2026년 7월 16일댓글 수 로딩 중
[논문리뷰] RoboTTT: Context Scaling for Robot Policies본 논문은 최신 로봇 파운데이션 모델들이 단일 스텝 또는 짧은 히스토리에만 의존하여 장기적인 작업 수행 및 맥락 이해에 한계를 보인다는 문제를 해결합니다.#Review#Robot Foundation Models#Test-Time Training#Long-Context Policies#Visuomotor Control#In-Context Imitation#Sequence Modeling2026년 7월 16일댓글 수 로딩 중
[논문리뷰] Partition, Prompt, Aggregate: Statistical Self-Consistency in Language Models본 연구는 LLM의 ICL이 과연 이론적으로 가정한 Conditional Inference로서 엄밀하게 작동하는지 검증하는 것을 목적으로 한다.#Review#In-context Learning#Conditional Inference#Statistical Self-Consistency#Persona Prompting#Macro Fallacy#Binary Conditioning Tree2026년 7월 16일댓글 수 로딩 중
[논문리뷰] MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation본 연구는 기존 비디오 생성 벤치마크들이 단일 참조(single-reference) 기반의 과업에 치중되어 있어, 실제 콘텐츠 제작 현장에서 요구되는 복합적인 다중 참조(multi-reference) 기반의 생성 능력을 충분히 평가하지 못한다는 문제에서 출발한다 .#Review#MultiRef-Compass#MR2AV#Multimodal Generation#Reference Consistency#Instruction Following#Benchmark#MLLM-as-a-Judge2026년 7월 16일댓글 수 로딩 중
[논문리뷰] MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity Generators기존의 Diffusion 및 Flow 모델은 고품질 생성을 위해 많은 반복 연산이 필요하여 Latency 측면에서 비효율적이다.#Review#MeanFlow#Reinforcement Learning#Forward-Process RL#Flow Matching#Few-step Generation#Average Velocity2026년 7월 16일댓글 수 로딩 중