[논문리뷰] Formalizing Latent Thoughts: Four Axioms of Thought Representation in LLMs본 논문은 LLM의 잠재 추론(latent reasoning)이 실제로는 기능적 요건을 충족하지 못할 수 있다는 점을 지적하며, 이를 검증하기 위한 공리적 평가 프레임워크를 제안합니다 .#Review#LLM#Latent Thought Representation#Axiomatic Framework#Causality#Minimality#Separability#Stability#Functional Reasoning2026년 6월 28일댓글 수 로딩 중
[논문리뷰] Cluster, Route, Escalate: Cascaded Framework for Cost-Aware LLM Serving본 논문은 프로덕션 환경에서 LLM 배포 시 발생하는 정확도와 비용(Latency) 간의 트레이드오프 문제를 해결하기 위한 Cascaded Framework를 제안합니다.#Review#LLM Serving#Model Routing#Cost-Aware Inference#Quality Estimation#Cascaded Framework#Pareto Analysis#TPOT2026년 6월 28일댓글 수 로딩 중
[논문리뷰] Boundary-Aware Context Grounding for A Low-Channel EEG Agent본 논문은 일반적인 LLM이 특정 EEG 장치, 기록 프로토콜, 소프트웨어 버전 또는 결과 스키마에 대한 지식이 부족하여 발생하는 '범주 오류(category error)' 문제를 해결하고자 한다.#Review#low-channel EEG#large language models#hardware-aware AI#boundary awareness#reproducibility#scientific software2026년 6월 28일댓글 수 로딩 중
[vllm] vLLM ROCM 최적화: GLM-4 MoE를 위한 Fused Shared Expert(FSE) 도입GLM-4 MoE 모델의 공유 전문가(Shared Expert)를 FusedMoE 커널로 통합하여 추론 성능을 최대 22% 향상시켰습니다.#vLLM#ROCm#MoE#Performance#Optimization2026년 6월 28일댓글 수 로딩 중
[uv] uv 의존성 해결 성능 최적화: PubGrub 반복 작업 재사용으로 8% 이상 속도 향상uv resolver가 PubGrub 반복 과정에서 발생하는 중복 작업을 제거하여 의존성 해결 속도를 최대 8.1% 향상시킨 최적화 기법 분석.#uv#dependency resolution#PubGrub#optimization#Rust#performance#caching2026년 6월 27일댓글 수 로딩 중
[vllm] vLLM ROCm 환경에서 FlyDSL을 활용한 MXFP8 MoE 성능 최적화ROCm gfx950 환경에서 FlyDSL 기반 MXFP8 MoE 커널을 통합하여 추론 성능을 최대 20% 향상하고 백엔드 선택 로직을 개선했습니다.#vLLM#ROCm#MoE#MXFP8#Performance#FlyDSL2026년 6월 27일댓글 수 로딩 중
[sglang] SGLang LTX-2.3 Diffusion 모델 최적화: Residual-Gate 연산 CUDA Fast Path 도입SGLang LTX-2.3 모델의 핵심 연산인 residual-gate update를 CUDA 커널로 최적화하여 성능을 크게 향상시켰습니다.#SGLang#CUDA#Optimization#Diffusion Models#Deep Learning#Performance2026년 6월 27일댓글 수 로딩 중
[vllm] vLLM의 GLM5.2 성능 최적화: Triton 커널 융합을 통한 E2E Throughput 향상Triton 커널 융합으로 Q RoPE, FP8 양자화, 스케일 폴딩을 통합하여 추론 성능을 최대 3.3% 개선했습니다.#vLLM#Triton#LLM#Optimization#FP82026년 6월 27일댓글 수 로딩 중
[sglang] SGLang, CUDA 그래프 재실행 시 호스트-디바이스 동기화 제거로 성능 향상SGLang에서 CUDA 그래프 재실행 시 불필요한 호스트-디바이스 동기화를 제거하여 GPU 활용률을 높이고 응답 속도를 개선했습니다.#SGLang#CUDA#최적화#성능#LLM2026년 6월 27일댓글 수 로딩 중
[vllm] vLLM, DeepSeek V4 모델 성능 최적화: AITER MXFP4 BF16 백엔드 개선vLLM에서 DeepSeek V4 모델의 성능을 향상시키기 위한 AITER MXFP4 BF16 백엔드 최적화 분석#vLLM#DeepSeekV4#LLM#Performance#Optimization#ROCm#AITER#MXFP42026년 6월 26일댓글 수 로딩 중
[vllm] vLLM ROCm 환경에서 Shared-Expert Fusion을 통한 MoE 추론 성능 최적화MiniMax-M3 모델의 공유 전문가(Shared-expert)를 라우팅된 그룹 GEMM에 통합하여 추론 지연 시간을 최대 30% 개선했습니다.#vLLM#ROCm#MoE#Performance#Optimization2026년 6월 26일댓글 수 로딩 중
[onnxruntime] [ONNX Runtime] SGEMM의 함정에서 벗어나기: GQA 전용 GEMV 커널을 통한 디코딩 최적화ONNX Runtime에서 M=1인 디코딩 상황의 SGEMM 오버헤드를 해결하고, 전용 GEMV 커널로 GQA 성능을 최대 1.5배 끌어올린 최적화 사례를 분석합니다.#ONNX Runtime#GQA#Performance Optimization#GEMV#LLM Inference2026년 6월 26일댓글 수 로딩 중
[논문리뷰] Why Multi-Step Tool-Use Reinforcement Learning Collapses and How Supervisory Signals Fix It본 논문은 다단계 도구 사용 태스크에서 RL 기반 최적화가 겪는 학습 불안정성과 성능 정체 문제를 해결하고자 합니다.#Review#Tool Learning#Reinforcement Learning#Structural Collapse#Supervisory Signals#Interleaved Training#Process Reflection Supervision2026년 6월 25일댓글 수 로딩 중
[논문리뷰] When Does Combining Language Models Help? A Co-Failure Ceiling on Routing, Voting, and Mixture-of-Agents Across 67 Frontier Models본 논문은 다양한 LLM 시스템(Routing, Voting, Mixture-of-Agents)의 정확도 향상 잠재력이 일반적으로 알려진 것보다 훨씬 낮다는 문제를 제기한다. 기존 실무에서는 모델 간의 오차 상관관계인 $\rho$를 지표로 활용하여, $\rho$가 낮으면 다양한 모델을 결합하는 것이 효과적이라 판단해왔다.#Review#LLM Orchestration#Model Routing#Co-failure Ceiling#Error Correlation#Mixture-of-Agents#Inference Economics2026년 6월 25일댓글 수 로딩 중
[논문리뷰] ViQ: Text-Aligned Visual Quantized Representations at Any Resolution본 논문은 기존 MLLM에서 시각적 인코더가 사용하는 연속적 표현(continuous representation)과 언어 모델의 이산적 토큰(discrete token) 사이의 표현 불일치 문제를 해결하고자 합니다.#Review#Multimodal Large Language Models#Visual Quantization#Representation Learning#Any-Resolution#Discrete Visual Representations#Text-Aligned#Efficiency2026년 6월 25일댓글 수 로딩 중
[논문리뷰] The Verification Horizon: No Silver Bullet for Coding Agent Rewards본 논문은 최신 Coding Agent의 성능이 발전함에 따라, 생성된 코드의 정확성을 신뢰할 수 있게 검증하는 문제가 생성 자체보다 훨씬 어려워진 현실을 지적합니다.#Review#Coding Agents#Reward Design#Reward Hacking#Alignment#Verification#Systematic Evaluation2026년 6월 25일댓글 수 로딩 중
[논문리뷰] Running the Gauntlet: Re-evaluating the Capabilities of Agents Beyond Familiar Environments본 연구는 기존 에이전트 벤치마크들이 지나치게 단순한 작업이나 친숙한 웹 환경에만 치중하여 현대 에이전트의 잠재적 한계를 적절히 탐지하지 못한다는 문제의식에서 출발한다. 기존 벤치마크는 주로 온라인 쇼핑이나 단순 정보 검색과 같은 소비자 중심의 작업을 대상으로 하므로, 에이전트의 성능이 조기에 포화되는 현상을 보인다.#Review#Agentic Systems#GauntletBench#Temporal Perception#Graphical Understanding#3D Reasoning#Generalization#Multimodal Large Language Models2026년 6월 25일댓글 수 로딩 중
[논문리뷰] Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation본 논문은 기존 Text-to-Image (T2I) 모델이 실세계의 복잡하고 모호한 요청을 처리하는 데 겪는 구조적 한계를 해결하고자 합니다. T2I 모델은 일반적으로 완전히 명시된 프롬프트에 최적화되어 있으나, 실세계의 사용자 요청은 불완전하거나 맥락 정보를 필요로 하는 경우가 많습니다 .#Review#Agentic Image Generation#Context Gap#Context-Aware Planning#Context Grounding#IA-Bench#Multimodal Large Language Model (MLLM)2026년 6월 25일댓글 수 로딩 중
[논문리뷰] PhysiFormer: Learning to Simulate Mechanics in World Space본 연구는 영상 기반의 물리 모델링이 겪는 뷰 의존성과 물리 법칙 위배 문제를 해결하고, 3D Mesh 수준에서 직접 물리 시뮬레이션을 수행하는 PhysiFormer를 제안합니다.#Review#PhysiFormer#Diffusion Transformer#3D Mesh#World Space Simulation#Physically-plausible#Trajectory Prediction2026년 6월 25일댓글 수 로딩 중
[논문리뷰] OpenBioRQ: Unsolved Biomedical Research Questions for Agents본 논문은 기존의 LLM 평가 벤치마크들이 정해진 정답(ground-truth)이 있는 질문들만을 다룸으로써, 실제 환경에서 발생하는 치명적인 오류 유형을 간과하고 있다는 문제를 제기합니다 .#Review#Biomedical Research#Agentic Evaluation#Retrieval-Grounded#Faithfulness#Citation Factuality#Open Questions2026년 6월 25일댓글 수 로딩 중