[sglang] SGLang: LFM2-MoE 모델을 위한 SM90 커널 퓨전 최적화 분석LFM2-MoE의 short-convolution 경로를 Triton 커널로 퓨전하여 연산 병목을 3배 가까이 개선한 사례를 분석합니다.#SGLang#Triton#CUDA#Optimization#LLM2026년 9월 5일댓글 수 로딩 중
[flashinfer] Blackwell GPU를 위한 고성능 Recurrent-KDA 커널 최적화 및 통합Blackwell GPU 아키텍처에 최적화된 104개 KDA 커널 포트폴리오를 통합하여 추론 성능을 극대화했습니다.#FlashInfer#CUDA#Blackwell#KernelOptimization#LLM2026년 9월 5일댓글 수 로딩 중
[sglang] SGLang 성능 최적화: RTX 5090 32GB 환경에서의 CUDA Graph 및 Chunked Prefill 개선RTX 5090 등 32GB GPU 환경에서 CUDA Graph max_bs를 상향하여 고부하 상황의 디코딩 성능 저하를 해결한 사례를 분석합니다.#SGLang#LLM#CUDA#Performance#RTX50902026년 9월 4일댓글 수 로딩 중
[vllm] vLLM의 Fast Start: CUDA IPC를 활용한 모델 가중치 제로 카피 로딩모델 가중치를 GPU 메모리에 상주시키는 데몬을 통해 엔진 재시작 시 디스크 I/O 없이 즉시 로딩하는 최적화 기법을 소개합니다.#vLLM#CUDA#IPC#Optimization#LLM2026년 9월 4일댓글 수 로딩 중
[vllm] vLLM의 PLE 메타데이터 전송 최적화: 비동기 전송으로 성능 향상vLLM의 Qwen4Exp PLE 메타데이터 빌더에서 비동기 전송을 사용하여 GPU 커널 간 동기화를 제거하고 성능을 향상시킨 PR 분석.#vLLM#최적화#성능#LLM#GPU#CUDA2026년 9월 3일댓글 수 로딩 중
[vllm] vLLM의 작은 배치 사이즈를 위한 Triton 기반 Split-row Top-p 샘플링 최적화작은 배치 환경에서 vLLM의 Top-p 샘플링 성능을 극대화하기 위해 Triton 커널을 재설계하여 효율성을 높였습니다.#vLLM#Triton#CUDA#LLM#Performance2026년 9월 3일댓글 수 로딩 중
[논문리뷰] VibeVoice-ASR-Streaming Technical Report본 논문은 기존 Unified End-to-End 모델들이 오프라인 인식에 국한되어 실시간 음성 비서 환경에서 요구되는 저지연(Low-latency) 요구사항을 충족하지 못하는 문제를 해결합니다.#Review#Streaming ASR#Speaker-Attributed ASR#LLM#End-to-End#Multi-talker Recognition#Interleaved Generation#Voice Assistant2026년 9월 2일댓글 수 로딩 중
[논문리뷰] It Takes Two to Match: Co-Evolving Generative Retriever with Reinforcement Learning본 논문은 현대의 검색 시스템에서 검색(Retrieval) 단계의 오류가 하위 랭킹(Ranking) 단계에서 복구되기 어렵다는 문제점을 지적하며, 효과적인 검색을 위한 정밀도와 재현율의 균형 문제를 해결하고자 합니다.#Review#Generative Retrieval#Reinforcement Learning#Co-Evolution#Keyword Generation#Retrieval F1#LLM2026년 9월 2일댓글 수 로딩 중
[논문리뷰] HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?본 논문은 Agent가 연구용 프로토타입에서 실제 배포 도구로 진화함에 따라, Agent의 성능을 좌우하는 외부 인프라인 Harness의 중요성을 규명하고 이를 모델이 직접 개발할 수 있는지 검증하고자 합니다.#Review#Agent Harness#LLM#Software Engineering#Benchmark#Agent Evolution#Code Generation2026년 9월 2일댓글 수 로딩 중
[논문리뷰] Autoregressive Mosaics: Probing 2D Spatial Reasoning in Text-Only Language Models본 논문은 텍스트 전용(Text-only) LLM이 생성하는 이미지가 진정한 2D 공간 추론을 반영하는지, 아니면 단순한 코드 변환 능력에 의존하는지를 규명하고자 한다. 기존 연구들은 모델의 최종 생성물만을 평가함으로써 공간 구성 능력과 코드 생성 능력을 분리하지 못한다는 한계를 가진다 .#Review#Spatial Reasoning#Autoregressive Models#AM-Bench#LLM#Representation Probing#Code Generation#Mosaic2026년 9월 2일댓글 수 로딩 중
[논문리뷰] Aspire: Can Models Self-Evolve from Vague Goals?본 논문은 LLM의 자가 진화(Self-evolution) 과정에서 Vague Goal로부터 목표를 구체화하고 진정한 역량 향상을 달성하는 문제를 해결하고자 합니다.#Review#Self-Evolution#LLM#Vague Goals#Autonomous Post-training#Goal Operationalization#Agent Harness#Benchmark2026년 9월 2일댓글 수 로딩 중
[flashinfer] FlashInfer에 cuTile 기반 Fused MoE 백엔드 도입: 성능과 유지보수성의 균형FlashInfer의 Unified MoE API에 cuTile 백엔드를 추가하여 BF16 및 NVFP4 환경에서 최적화된 MoE 추론을 지원합니다.#FlashInfer#MoE#CUDA#Optimization#LLM2026년 9월 1일댓글 수 로딩 중
[논문리뷰] StudentSim: Training LLM-based Student Simulators본 논문은 적응형 AI 튜터 개발을 위해 필수적인 '개인화된 학생 데이터'의 부족 문제를 해결하고자 합니다. 기존 연구의 한계점은 다음과 같습니다. 지식 추적 모델(Knowledge tracing)과 같은 상태 추적 모델은 학생의 행동을 예측할 수는 있으나, 튜터의 가이던스를 입력으로 받아들여 학습하는 기능이 부족합니다.#Review#Student Simulators#LLM#Educational AI#Reinforcement Learning#Behavioral Fidelity#Guidance Responsiveness#Individualized Simulation2026년 9월 1일댓글 수 로딩 중
[논문리뷰] From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix본 논문은 엔터프라이즈 환경에서 데이터 보안 및 규제 준수를 위해 자체 호스팅(self-hosted) LLM을 도입할 때 발생하는 파편화 문제를 해결하고자 합니다. 기존에는 수백 개의 애플리케이션이 각각 다른 모델을 사용하여 컴퓨팅 자원(GPU)의 비효율적인 분산이 발생했습니다.#Review#LLM#Post-Training#GRPO#SLERP#Function-Calling#Instruction-Following#Production-Traffic2026년 9월 1일댓글 수 로딩 중
[sglang] FLUX.2 모델 성능 최적화: Token Concatenation과 NVFP4 양자화의 커널 융합FLUX.2의 BF16 토큰 결합과 NVFP4 양자화를 단일 JIT 커널로 융합하여 2.4%의 추론 속도 향상을 달성했습니다.#SGLang#CUDA#LLM#Optimization#FLUX.2#NVFP42026년 8월 31일댓글 수 로딩 중
[논문리뷰] PaperGym: Rubric-Centered Evolution for Research-Plan Generation본 논문은 AI 과학자의 핵심 역량인 연구 계획 생성(Research-Plan Generation) 과정에서 발생하는 자동 평가 환경의 부재 문제를 해결하고자 한다.#Review#Research-Plan Generation#LLM#Rubric-Centered Evolution#Reinforcement Learning#Self-Distillation#Criterion Leakage#PaperGym2026년 8월 31일댓글 수 로딩 중
[논문리뷰] Normalized Low-Rank Adaptation본 논문은 표준 LoRA가 학습 초기 단계에서 down-projection 행렬 $A$의 임의적인 정규분포 초기화로 인해 최적화 효율성이 저하되는 문제를 지적합니다.#Review#LoRA#Normalization#PEFT#Preconditioning#Optimization Dynamics#LLM2026년 8월 31일댓글 수 로딩 중
[논문리뷰] Evaluating the Hidden Costs of Personalization in Large Language Models본 논문은 LLM의 Personalization 기능이 사용자 유용성과 편의성을 향상시키는 반면, 대화 기록, 추론된 선호도, 사용자 프로필 등 개인 Context에 조건화될 때 균형 잡히고 유익한 응답 제공에서 사용자 만족도 최적화로 전환되는 과정에서 발생하는 숨겨진 비용과 부작용을 체계적으로 평가합니다.#Review#Personalization#LLM#Irrelevant Personalization#Preference Narrowing#Sycophantic Bias#Evaluation Framework#PRISK#Behavioral Bias2026년 8월 31일댓글 수 로딩 중
[논문리뷰] Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement본 논문은 On-Policy Distillation (OPD)의 Teacher Supervision 신호가 off-policy context에서 본질적으로 noisy하며, 이러한 노이즈가 학생 모델의 성능 향상에 미치는 영향이 불분명하다는 문제를 제기한다.#Review#On-Policy Distillation#Self-Adaptation#Reinforcement Learning#LLM#Token-level Supervision#Entropy-adaptive Advantages#Mathematical Reasoning2026년 8월 31일댓글 수 로딩 중
[sglang] ROCm 환경에서 BF16 All-Reduce의 수치 안정성 확보하기: QuickReduce의 FP16 Saturation 이슈 해결BF16 데이터를 FP16으로 변환하여 처리할 때 발생하는 Overflow 문제를 하드웨어 클램핑과 Range Guard 스케일링으로 해결한 사례를 분석합니다.#ROCm#GPU#All-Reduce#Optimization#LLM#SGLang2026년 8월 30일댓글 수 로딩 중
[논문리뷰] Lost in Compression: A Controlled Cross-Lingual Audit of Extractive Prompt Compressors본 논문은 영어 위주로 개발된 Extractive Prompt Compressor가 비영어권 언어에 적용될 때 심각한 성능 저하와 불공정한 비용 페널티를 유발한다는 문제를 지적한다. 기존의 많은 연구는 영어를 기준으로만 평가되어 왔으나, 비영어권 언어는 이미 더 높은 Token Premium을 지불하고 있다.#Review#Prompt Compression#Cross-Lingual#LLM#Inference Cost#Extractive Compression#Tokenization#Transfer Gap2026년 8월 30일댓글 수 로딩 중
[논문리뷰] Blind Men and the Elephant: Probing the Epistemic Myopia of LLMs under Long-Tail Divergent Knowledge본 연구는 기존 LLM 평가 방법론이 단일 canonical answer만을 정답으로 간주하여, 사실 관계의 복잡성이나 이견(divergence)을 무시하고 있다는 문제에서 출발한다.#Review#LLM#Knowledge Tail#Epistemic Myopia#Benchmark#Parametric Memory#Multi-account QA2026년 8월 30일댓글 수 로딩 중
[onnxruntime] GPU 점유율의 미학: Qwen MTP를 위한 ONNX Runtime NVFP4 GEMV 최적화 분석H200 GPU에서 Qwen 모델의 GEMV 성능을 10% 이상 향상시킨 타일링(Tiling) 및 K-Split 최적화 전략을 심층 분석합니다.#CUDA#ONNXRuntime#Optimization#LLM#Qwen#GPU-Architecture2026년 8월 29일댓글 수 로딩 중
[Liger-Kernel] Liger-Kernel의 Fused Linear Cross Entropy 성능 최적화: C=16 전략Triton 커널의 메모리 버짓 상수를 조정하여 Fused Linear Cross Entropy 연산의 루프 오버헤드를 획기적으로 줄인 사례 분석.#Triton#LLM#Optimization#Performance#Liger-Kernel2026년 8월 27일댓글 수 로딩 중
[논문리뷰] WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution본 논문은 에이전트의 경험이 최적화 히스토리에 파편화되어 축적되는 문제를 해결하고자 한다. 기존 연구들은 기술을 반복적으로 개발하지만, 이를 뒷받침하는 지식의 조직화가 부족하여 학습한 내용을 시스템적으로 재사용하는 데 한계가 있다.#Review#AI Agents#Skill Evolution#Persistent Knowledge#LLM#Agentic Workflow#Knowledge Consolidation2026년 8월 27일댓글 수 로딩 중
[논문리뷰] Prefix Sliding for efficient test-time scaling본 논문은 Full Attention 기반의 모델이 장시간 추론(long-horizon reasoning) 시 직면하는 계산 비용의 폭발적 증가와 메모리 병목 문제를 해결하기 위해 Prefix Sliding을 제안합니다.#Review#Prefix Sliding#Test-time Scaling#Reasoning Traces#Sliding Window#LLM#KV Cache#Efficiency2026년 8월 26일댓글 수 로딩 중
[flashinfer] FlashInfer, CUDA 커널 최적화를 통한 LLM 추론 속도 향상: Recurrence-Piece Persistent M128 도입FlashInfer의 최신 PR은 CUDA 커널 최적화를 통해 LLM 추론 성능을 2.7배 향상시킵니다.#AI#LLM#성능 최적화#CUDA#FlashInfer2026년 8월 26일댓글 수 로딩 중
[논문리뷰] CAFE: Self-Improving Search Agents Need Co-Evolving Feedback본 논문은 장기 탐색(long-horizon search) 과정에서 발생하는 중간 단계의 오류를 효과적으로 교정하고, 탐색 에이전트와 이를 가이드하는 피드백 모델이 상호 진화(co-evolve)해야 한다는 점에 주목합니다.#Review#Search Agents#Co-Evolving Feedback#Reinforcement Learning#Credit Assignment#Preference Optimization#LLM2026년 8월 25일댓글 수 로딩 중
[flashinfer] FlashInfer SM120 NVFP4 어텐션 최적화: N64 스코어-슬롯 재사용을 통한 성능 향상FlashInfer의 SM120 NVFP4 어텐션 커널을 최적화하여 N64 스코어-슬롯 재사용으로 성능을 크게 향상시켰습니다.#FlashInfer#CUDA#NVIDIA#LLM#최적화#어텐션#NVFP4#SM1202026년 8월 25일댓글 수 로딩 중
[flashinfer] FlashInfer: Blackwell 아키텍처를 위한 Recurrent-KDA Prefill 최적화Blackwell GPU에서 Recurrent-KDA prefill 성능을 2.6배 이상 향상시킨 2단계 BT16 포트폴리오 도입 및 최적화 분석.#FlashInfer#Blackwell#CUDA#LLM#Performance2026년 8월 25일댓글 수 로딩 중
[flashinfer] Blackwell 아키텍처를 위한 고성능 Paged MQA Logits 커널 도입Blackwell SM100 GPU에서 DeepSeek MLA를 위한 FP8/FP4 Paged MQA Logits 커널을 최적화하고 도입했습니다.#FlashInfer#Blackwell#CUDA#LLM#KernelOptimization2026년 8월 25일댓글 수 로딩 중
[논문리뷰] Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization본 논문은 LLM Policy Optimization 과정에서 발생하는 '안정성-탐색(Stability-Exploration) 딜레마'를 해결하고자 합니다.#Review#Policy Optimization#LLM#Reinforcement Learning#Query-KL#Stability#Environmental Regularization#Distribution Drift2026년 8월 24일댓글 수 로딩 중
[논문리뷰] Chain-of-Experience for Continual LLM Improvement본 논문은 현대의 LLM들이 학습 후 고정된 상태로 배포되어 매 추론을 고립된 이벤트로 처리함으로써 추론 단계에서의 지속적 개선 능력을 상실하고 있다는 점을 문제로 지적합니다.#Review#Chain-of-Experience#Test-time Improvement#LLM#Iterative Feedback#Continual Learning#Reasoning Efficiency2026년 8월 20일댓글 수 로딩 중
[LlamaFactory] Qwen3.5 모델의 GDN 선형 어텐션에 대한 시퀀스 병렬 처리 및 Pack 지원 추가Qwen3.5 모델의 GDN 선형 어텐션 레이어에 시퀀스 병렬 처리와 Pack 기능을 적용하여 GPU 활용도를 높였습니다.#LLM#Qwen3.5#Sequence Parallel#Context Parallel#GDN#Flash Attention#Optimization2026년 8월 20일댓글 수 로딩 중
[flashinfer] Blackwell 아키텍처를 위한 MXFP8/MXFP4 기반 고성능 MoE 추론 최적화FlashInfer의 SM100 W4A8 백엔드 추가로 MXFP8/MXFP4 혼합 정밀도 추론 성능 및 통신 효율 대폭 개선#FlashInfer#MoE#Blackwell#MXFP8#CuTeDSL#LLM2026년 8월 20일댓글 수 로딩 중
[논문리뷰] The More Popular, The Harder to Forget: Adaptive Popularity for LLM Unlearning본 논문은 기존의 LLM 언러닝 기법들이 학습 데이터의 빈도나 사실의 인기도를 고려하지 않고 모든 fact에 대해 균일한 gradient 압력을 가함으로써 발생하는 'Popularity Gap' 문제를 해결하고자 합니다 .#Review#Machine Unlearning#LLM#Popularity Bias#Gradient Ascent#Dual-Ascent Controller#Parametric Memorization2026년 8월 19일댓글 수 로딩 중
[논문리뷰] SPADE: Self-Play in Adaptive Synthetic Executable Environments본 연구는 LLM 에이전트의 지속적인 성능 향상을 가로막는 환경(Environment) 공급의 병목 현상을 해결하고자 합니다. 기존의 수작업으로 구축되거나 고정된 합성 환경은 에이전트가 학습함에 따라 한계에 도달하며, 모델의 능력이 발전해도 새로운 도전 과제를 제공하지 못한다는 한계가 있습니다.#Review#Self-Play#LLM#Environment Design#Reinforcement Learning#Code-as-Environment#Agentic AI2026년 8월 19일댓글 수 로딩 중
[flashinfer] FlashInfer, Blackwell 아키텍처를 위한 Recurrent KDA Prefill 최적화: Small-BH 커널 도입FlashInfer가 Blackwell GPU에서 Recurrent KDA Prefill 성능을 획기적으로 개선하는 Small-BH 커널을 도입했습니다.#FlashInfer#NVIDIA Blackwell#GPU 최적화#CUDA#LLM#성능 개선2026년 8월 19일댓글 수 로딩 중
[flashinfer] FlashInfer의 PrimTS를 활용한 고성능 Block-Sparse Attention 최적화NVIDIA Blackwell 아키텍처를 위한 Q64/KV256 프로파일 및 Paged Block-Sparse Attention 구현으로 성능 극대화#FlashInfer#Attention#CUDA#GPU#LLM2026년 8월 19일댓글 수 로딩 중
[논문리뷰] HarnessRisk: A Lifecycle-Oriented Benchmark for Agent Harness Safety본 논문은 LLM 기반 에이전트의 안전성이 단순히 모델 자체의 문제가 아니라, 모델과 에이전트 런타임인 Agent Harness 간의 복합적인 상호작용에서 발생한다는 점을 지적합니다.#Review#Agent Safety#Harness#Benchmark#Lifecycle-Oriented#LLM#Sandboxed Evaluation#Attack Success Rate2026년 8월 18일댓글 수 로딩 중
[sglang] SGLang 성능 최적화: DeepSeek-v4 SWA 인덱스 변환 Hoisting 및 백엔드 통합CUDA Graph 내부의 중복된 SWA 인덱스 변환을 제거하고 백엔드 간 버퍼 네이밍을 통일하여 유지보수성과 성능을 동시에 잡은 PR 분석#CUDA Graph#DeepSeek-v4#SGLang#Optimization#LLM2026년 8월 18일댓글 수 로딩 중
[논문리뷰] R^3-Bench: LLMs Struggle with Resource-Rational Reasoning under Shared Budgets본 논문은 현대의 LLM 시스템이 공유 예산(Shared Budget) 하에서 자신의 잠재적 역량을 실질적으로 발휘하지 못하는 문제를 해결하고자 합니다.#Review#Resource-Rationality#Shared-Budget#LLM#Agentic-Reasoning#Constraint-Optimization#Benchmark2026년 8월 17일댓글 수 로딩 중
[논문리뷰] LittleLearner: Language Models Under Pedagogically Controlled Knowledge Exposure본 논문은 현대 LLM이 방대한 web-scale 데이터로 학습되어 prior knowledge와 실제 학습된 capability 간의 경계가 불투명하다는 문제를 해결하고자 한다.#Review#LLM#Pretraining#Curriculum Learning#Data Contamination#Educational Sandbox#Capability Boundary2026년 8월 16일댓글 수 로딩 중
[논문리뷰] Claim-Level Reliability Assessment for Efficient Test-Time Reasoning본 논문은 LLM의 Test-Time Scaling 과정에서 발생하는 신뢰성 평가의 불투명성과 계산 자원의 비효율성 문제를 해결하고자 합니다.#Review#Test-Time Reasoning#Reliability Assessment#Falsification#Chain-of-Thought#LLM#Consensus#Inference Scaling2026년 8월 16일댓글 수 로딩 중
[vllm] vLLM, DeepSeek-V4 사전 생성 처리량 향상을 위한 Sparse Top-K 메타데이터 커널 최적화vLLM의 DeepSeek-V4 모델에서 사전 생성 처리량을 높이기 위해 Sparse Top-K 메타데이터 커널을 최적화했습니다.#vLLM#성능 최적화#딥러닝#LLM#DeepSeek-V42026년 8월 16일댓글 수 로딩 중
[vllm] vLLM, DeepSeek-V3.2/GLM-5.2 MTP 경로 최적화: All-Reduce 융합 및 로컬 Argmax 도입vLLM에서 DeepSeek-V3.2/GLM-5.2 모델의 MTP 경로 성능을 향상시키는 두 가지 최적화 기법을 소개합니다.#vLLM#성능 최적화#딥러닝#LLM#MTP#DeepSeek#GLM2026년 8월 15일댓글 수 로딩 중
[vllm] vLLM에 Dots3 NOTE 모델 네이티브 지원 추가: 멀티모달 및 하이브리드 MLA 최적화Dots3 NOTE 모델의 텍스트, 이미지, 오디오, 비디오 처리를 위한 vLLM 네이티브 통합 및 하이브리드 MLA 아키텍처 최적화 분석.#vLLM#LLM#Multimodal#MLA#Optimization2026년 8월 12일댓글 수 로딩 중
[논문리뷰] VibeLifeBench: Can Your Life Agent Be Proactive and Persistent in a Living World?본 논문은 기존의 AI 에이전트 평가 벤치마크들이 대부분 정적이고 단기적인 과업에 치중되어 있어, 실제 일상생활의 복잡성을 제대로 측정하지 못한다는 문제를 제기합니다 .#Review#Agent Evaluation#Long-Horizon#Proactivity#Living World#Benchmarking#LLM#Task Planning2026년 8월 11일댓글 수 로딩 중
[논문리뷰] Mendel Gödel Machine: Recursive Self-Improving Coding Agents via Comparative Evolution본 논문은 기존의 자가 개선(self-improving) 코딩 에이전트들이 단일 실패 궤적에만 의존하여 정보를 효율적으로 활용하지 못하는 한계를 해결하고자 합니다.#Review#Coding Agents#Self-Improvement#Recursive Evolution#Comparative Evidence#Mendelian Principles#LLM#Agent Scaffold2026년 8월 11일댓글 수 로딩 중
[flashinfer] [FlashInfer] CUTLASS MoE 커널 최적화: 벡터화와 동적 스레드 할당으로 성능 한계 돌파하기FlashInfer의 CUTLASS MoE 커널을 벡터화하고 스레드 점유율을 최적화하여 최대 8%의 성능 향상을 달성한 기법을 분석합니다.#CUDA#MoE#FlashInfer#CUTLASS#Optimization#LLM2026년 8월 11일댓글 수 로딩 중
[논문리뷰] Intent Speaks Louder: Controllable User Simulation Beyond Response Imitation기존의 LLM 기반 사용자 시뮬레이터는 대화 문맥과 프로필을 기반으로 다음 사용자 턴을 단순히 모방(Imitation)하는 방식에 의존합니다 .#Review#User Simulation#LLM#Reinforcement Learning#Controllable Generation#Interaction Intent#Directive-Conditioned Generation2026년 8월 10일댓글 수 로딩 중
[논문리뷰] Evo-Bench: Can Language Models Improve Agent Harness?본 논문은 LLM 기반 에이전트의 자율적 하네스 개선(harness evolution) 역량을 체계적으로 평가하기 위한 새로운 벤치마크인 Evo-Bench를 제안합니다.#Review#Agent Harness#Harness Evolution#LLM#Benchmark#Self-Improvement#Autonomous Agent#Task Sensitivity2026년 8월 10일댓글 수 로딩 중
[sglang] Apple Silicon LLM 성능 향상: 슬라이딩 윈도우 KV 캐싱 및 인-그래프 샘플링 도입Apple Silicon 환경에서 LLM의 메모리 사용량과 추론 속도를 개선하는 두 가지 주요 최적화 기법을 소개합니다.#MLX#Apple Silicon#LLM#최적화#성능#KV 캐싱#샘플링2026년 8월 10일댓글 수 로딩 중
[sglang] SGLang HiCache: Mamba 브랜칭을 위한 증분 백업 최적화Unified Radix Cache에서 Mamba 상태의 증분 백업을 지원하여 중복 데이터 복사 없이 효율적인 캐시 관리를 구현했습니다.#SGLang#LLM#Caching#Mamba#Performance2026년 8월 10일댓글 수 로딩 중
[ollama] Ollama, DFlash를 통한 추론 속도 향상: 블록 단위 추론의 힘Ollama가 DFlash를 도입하여 모델 추론 시 블록 단위 토큰 생성을 통해 속도를 크게 개선했습니다.#Ollama#MLX#추론 최적화#DFlash#LLM2026년 8월 8일댓글 수 로딩 중
[sglang] ERNIE-Image 모델의 성능 향상: 비트-정확성(Bit-Exact)을 유지한 RMSNorm+Scale/Shift 융합 커널 도입ERNIE-Image 모델에서 RMSNorm과 Scale/Shift 연산을 융합하여 성능을 개선하고, 비트-정확성을 완벽하게 보장하는 Triton 커널을 소개합니다.#Triton#ERNIE-Image#성능 최적화#딥러닝#LLM2026년 8월 6일댓글 수 로딩 중
[onnxruntime] [CUDA] NVFP4 QMoE GEMV 최적화: ALU 바운드 커널의 한계를 넘어서는 방법NVFP4 양자화 디코딩 속도를 30% 이상 개선하고, MTP 검증 성능을 20배 이상 끌어올린 ONNX Runtime의 최적화 기법을 분석합니다.#CUDA#ONNXRuntime#LLM#Optimization#NVFP4#MoE2026년 8월 6일댓글 수 로딩 중
[논문리뷰] AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning본 논문은 장기 에이전트 학습(Long-horizon agentic RL)에서 기존의 sparse outcome reward 기반 학습이 가진 크레딧 할당의 불명확성을 해결하고자 합니다 .#Review#Agentic Reinforcement Learning#Self-Distillation#Credit Assignment#Recursive Belief Update#LLM#Policy Optimization2026년 8월 6일댓글 수 로딩 중
[flashinfer] [FlashInfer] Kimi K3 모델을 위한 초고속 Fused KDA Decode 커널 분석 (SM100 최적화)FlashInfer가 Kimi K3의 핵심 연산들을 하나의 SM100 전용 커널로 통합하여 vLLM 대비 1.13배의 성능 향상을 달성했습니다.#CUDA#FlashInfer#LLM#Optimization#SM100#CuTe2026년 8월 5일댓글 수 로딩 중
[논문리뷰] VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation본 논문은 기존의 다중 모달(multimodal) OPD 방법론들이 교사 모델의 예측 교정을 그대로 증류(distill)함으로써 발생하는 source-mixed 문제를 해결하고자 합니다.#Review#Multimodal On-Policy Distillation#Visual Attribution#Counterfactual Target Reconstruction#Privileged Distillation#Visual Evidence#LLM2026년 8월 3일댓글 수 로딩 중
[논문리뷰] Safeguards Based on Copyable Context Cannot Provide Reliable Safety for LLMs본 논문은 LLM의 safeguard가 응답의 실제 활용 방식을 알기 전에 필터링을 수행함으로써 발생하는 근본적인 한계를 지적한다. 기존의 안전장치들은 사용자의 의도나 대화 이력을 기반으로 결정을 내리지만, 공격자는 이러한 증거들을 정교하게 모방하여 승인된 사용자로 위장할 수 있다 .#Review#LLM#Safeguards#Dual-use#Capability-Safety Trilemma#Trusted Credentials#Copyable Evidence2026년 8월 2일댓글 수 로딩 중
[논문리뷰] Mental World Modeling본 연구는 기존의 World Models가 물리적 환경(객체, 위치, 운동 등)의 진화만을 추적할 뿐, 인간 행동의 근본 원인인 정신적·사회적 변수를 간과하고 있다는 문제 의식에서 출발합니다.#Review#Mental World Modeling#World Model#Theory of Mind#POMDP#Embodied AI#Social Intelligence#LLM2026년 8월 2일댓글 수 로딩 중
[논문리뷰] Enhancing Rubric-based RL via Self-Distillation본 논문은 Rubric-based RL에서 발생하는 exploration의 한계와 scalar reward 집계로 인한 학습 신호 소실 문제를 해결하고자 합니다. 기존의 GRPO 기반 연구들은 특정 기준을 만족하는 사례가 없으면 학습 신호를 생성하지 못하는 Unexplored Criteria 문제에 직면해 있습니다.#Review#Reinforcement Learning#Rubric-based RL#Self-Distillation#LLM#Policy Optimization#GRPO#Alignment2026년 8월 2일댓글 수 로딩 중
[sglang] SGLang의 Session-Aware Unified Radix Cache를 통한 추론 성능 최적화멀티턴 에이전트 워크로드에서 세션 기반 KV 캐시 보호를 통해 재계산을 줄이고 처리량을 극대화하는 최적화 기법을 소개합니다.#SGLang#LLM#KV Cache#Radix Cache#Performance Optimization2026년 8월 2일댓글 수 로딩 중
[onnxruntime] ONNX Runtime의 FP4/FP8 GEMV 커널 최적화: Tensor Core와 M-Tiling을 통한 성능 극대화ONNX Runtime의 FP4/FP8 GEMV 커널에 Tensor Core 활용 및 M-tiling을 도입하여 추론 성능을 최대 5배 향상시켰습니다.#ONNX Runtime#CUDA#GEMV#Tensor Core#FP4#FP8#LLM2026년 8월 1일댓글 수 로딩 중
[flashinfer] FlashInfer FP8 Causal Attention 최적화: O(1) 디코딩과 글로벌 스케줄링의 힘FlashInfer의 FP8 FMHA v2 커널에서 배치 크기가 클 때 발생하는 병목을 O(1) 디코딩과 글로벌 큐 타일 재배치로 해결하여 최대 5.6x 성능 향상을 달성했습니다.#CUDA#LLM#FlashInfer#Performance#Optimization#FP82026년 7월 31일댓글 수 로딩 중
[vllm] vLLM 컴파일 최적화: Transformers 모델을 위한 FusedAddRMSNorm 도입Transformers 모델의 잔차 연결과 RMSNorm을 융합하여 메모리 접근을 줄이고 추론 성능을 최대 18% 향상시키는 최적화 기법을 소개합니다.#vLLM#LLM#Compiler#Optimization#PyTorch#Transformers2026년 7월 30일댓글 수 로딩 중
[논문리뷰] Σ-Mem: An Online Reliability Memory for LLM-based Multi-Agent Systems본 연구는 LLM 기반의 Multi-Agent Systems (MAS)에서 중앙 모델이 각 peer의 응답 신뢰성을 직접 검증하기 어렵다는 근본적인 문제를 해결하고자 합니다.#Review#Multi-Agent Systems#LLM#Online Reliability Memory#Spectral Adaptation#Competence Modeling#Peer Relationship2026년 7월 30일댓글 수 로딩 중
[논문리뷰] DecoEvo: Score-Decoupled Co-Evolution of Solver and Rubric-Generator Skills in Text Space본 논문은 Text-Space Optimization에서 고정된 평가 Rubric이 Solver의 발전을 저해하거나, 반대로 Rubric을 함께 진화시킬 때 발생하는 Score-Coupling 문제를 해결하고자 합니다.#Review#Text-Space Optimization#LLM#Co-Evolution#Rubric#Score-Decoupling#Prompt Engineering#Black-Box Adaptation2026년 7월 29일댓글 수 로딩 중
[논문리뷰] Mapping CVEs to MITRE ATT&CK Techniques: A Curated Gold-Set Classifier and the Limits of LLM-Assisted Label Expansion본 논문은 CVE 취약점 설명 텍스트를 MITRE ATT&CK 기법으로 매핑하는 자동화 시스템의 한계를 해결하고자 한다. 기존의 CWE→CAPEC→ATT&CK 체인을 통한 매핑은 table-expansion으로 인한 과도한 잡음이 포함되어 있어 훈련 데이터로 부적합하다 .#Review#CVE#MITRE ATT&CK#Multi-label Classification#LLM#Label Expansion#Evaluation Noise2026년 7월 28일댓글 수 로딩 중
[vllm] vLLM Triton 커널 최적화: tl.constexpr 제거를 통한 JIT 컴파일 오버헤드 해결Triton 커널의 불필요한 constexpr 인자를 런타임 인자로 변경하여 JIT 컴파일 병목을 제거하고 TTFT를 대폭 개선했습니다.#vLLM#Triton#LLM#Optimization#Performance2026년 7월 27일댓글 수 로딩 중
[sglang] SGLang: HPC-Ops 백엔드에서 BF16 디코딩을 위한 동적 스케줄링 도입HPC-Ops의 동적 스케줄링을 BF16으로 확장하여 불균일한 KV 길이 환경에서 디코딩 성능을 최대 4.3% 향상시켰습니다.#SGLang#LLM#HPC-Ops#Optimization#CUDA2026년 7월 27일댓글 수 로딩 중
[논문리뷰] Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning본 논문은 기존의 대규모 강화학습 프레임워크가 가진 복잡성으로 인해 연구자의 반복적인 알고리즘 개선 과정에 큰 오버헤드가 발생하는 문제를 해결하고자 합니다.#Review#Agentic Reinforcement Learning#PyTorch-native#Scalable Training#LLM#Asynchronous Loop#Token-exact#FSDP22026년 7월 26일댓글 수 로딩 중
[논문리뷰] IDEAgent: Agentic Quality-Diversity Search for Research Idea Generation본 논문은 기존 AI 기반 연구 아이디어 생성 시스템들이 품질(Quality)과 다양성(Diversity)을 독립적인 최적화 문제로 다루어 발생하는 Conceptual Collapse 문제를 해결하고자 합니다.#Review#LLM#Scientific Discovery#Quality-Diversity Search#Multi-agent Framework#Idea Ideation#Research Lineage2026년 7월 26일댓글 수 로딩 중
[sglang] SGLang NGRAM 성능 최적화: 호스트 기반 트리 링크 유도로 GPU 병목 제거하기NGRAM 추론 시 발생하는 불필요한 GPU-CPU 동기화(readback)를 제거하여 처리량을 8.3% 향상시킨 최적화 사례를 분석합니다.#SGLang#LLM#Speculative Decoding#Performance Optimization#CUDA2026년 7월 25일댓글 수 로딩 중
[vllm] vLLM, 캐싱 비활성화 시 불필요한 LRU 해시 분할 제거로 디코드 처리량 3.5% 향상vLLM에서 캐싱 비활성화 시 불필요한 LRU 해시 분할 로직을 제거하여 디코드 처리량을 개선한 PR 분석.#vLLM#성능 최적화#LLM#GPU 캐싱#LRU2026년 7월 25일댓글 수 로딩 중
[vllm] vLLM, Blackwell 아키텍처를 위한 디코드 성능 최적화: GLM-5.2 및 DeepSeek-V3.2 지원 강화vLLM이 Blackwell GPU에서 GLM-5.2 및 DeepSeek-V3.2 모델의 디코드 성능을 대폭 향상시키는 최적화를 소개합니다.#vLLM#Blackwell#GLM-5.2#DeepSeek-V3.2#성능 최적화#GPU 컴퓨팅#LLM2026년 7월 24일댓글 수 로딩 중
[sglang] SGLang Mamba 캐시의 상태 손상 및 슬롯 누수 버그 수정SGLang Mamba 캐시에서 발생하던 요청 상태 손상 및 슬롯 누수 버그를 수정하여 안정성을 높였습니다.#SGLang#Mamba#Cache#Bug Fix#Optimization#LLM2026년 7월 23일댓글 수 로딩 중
[논문리뷰] NVIDIA-labs OO Agents: Native Python Object-Oriented Agents본 논문은 기존의 에이전트 개발 방식이 프롬프트, 툴 스키마, 워크플로우 그래프 등으로 파편화되어 있어, 개발자에게 새로운 프로그래밍 모델 학습을 강요하고 에이전트의 테스트 및 디버깅을 어렵게 만든다는 점을 문제로 지적합니다.#Review#Object-Oriented Agents#AI Agents#Python Framework#CodeAct#LLM#Agentic Loop#Software Engineering2026년 7월 23일댓글 수 로딩 중
[논문리뷰] LLMs Get Lost in Evolving User Intent본 연구는 대부분의 LLM 평가가 정적인 단일 턴 질의응답 환경에 국한되어 있어, 실제 사용자와의 역동적인 상호작용 능력을 제대로 측정하지 못한다는 한계점을 지적합니다.#Review#LLM#Agentic Interaction#Evolving User Intent#Multi-turn Evaluation#Benchmark#POMDP2026년 7월 23일댓글 수 로딩 중
[ray] Ray Serve LLM 인그레스 최적화: 로컬 라우팅을 통한 병목 현상 제거단일 글로벌 라우터의 병목을 해결하기 위해 HAProxy와 동일 노드에 위치한 라우터로 요청을 분산하고 가용성을 높이는 아키텍처 개선 사항을 분석합니다.#Ray#Ray Serve#LLM#HAProxy#Optimization#Distributed Systems2026년 7월 22일댓글 수 로딩 중
[sglang] [SGLang] MoE Prefill의 혁신: DWDP(Distributed Weight Data Parallelism) 도입 분석MoE 모델의 Prefill 단계에서 All-to-All 통신 병목을 제거하고 NVLink를 통한 가중치 프리페칭으로 성능을 극대화하는 DWDP 기법을 살펴봅니다.#LLM#MoE#Distributed Computing#CUDA VMM#SGLang#Performance Optimization2026년 7월 21일댓글 수 로딩 중
[논문리뷰] Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning본 논문은 대규모 비동기 강화학습에서 발생하는 training-inference mismatch와 누적된 staleness가 모델 학습의 조기 붕괴(collapse)를 야기한다는 점을 지적합니다.#Review#Asynchronous Reinforcement Learning#Staleness#Trust Region#PPO#Training-Inference Mismatch#Adaptive Clipping#LLM2026년 7월 21일댓글 수 로딩 중
[sglang] SGLang ReplaySSM: GDN 추론 최적화 및 메모리 효율 개선ReplaySSM 도입을 통해 GDN 추론 시 불필요한 SSM 상태 저장을 제거하고, Closed-loop Exact Fold로 정확도를 유지하며 메모리를 6.4배 절감했습니다.#SGLang#LLM#SpeculativeDecoding#SSM#Optimization2026년 7월 20일댓글 수 로딩 중
[논문리뷰] xHC: Expanded Hyper-Connections본 논문은 Transformer의 residual stream을 확장하는 기존 HC 계열 기법들이 왜 $N=4$ 수준에서 한계에 직면하는지에 대한 근본적인 원인을 진단합니다.#Review#Hyper-Connections#Transformer#Residual-Stream#Sparse-Architecture#Scaling-Laws#MoE#LLM2026년 7월 19일댓글 수 로딩 중
[논문리뷰] Understanding Reasoning from Pretraining to Post-Training본 논문은 LLM 훈련 과정에서 Pretraining 단계의 선택(모델 크기, 데이터 등)이 이후 RL 효율성에 미치는 정량적 관계를 규명하고자 한다.#Review#Reinforcement Learning#Pretraining#Scaling Law#LLM#Reasoning#Compute Allocation#Policy Evolution2026년 7월 19일댓글 수 로딩 중
[논문리뷰] RAGU: A Multi-Step GraphRAG Engine with a Compact Domain-Adapted LLM본 논문은 기존 GraphRAG 시스템들이 직면한 Single-pass extraction의 한계와 고성능 LLM에 대한 과도한 의존성 문제를 해결하고자 합니다. 기존 방식은 단일 단계에서 지식 그래프를 추출함에 따라 노이즈가 많고 중복된 엔티티를 생성하여 검색의 안정성을 저해합니다.#Review#GraphRAG#LLM#Knowledge Graph#Information Extraction#Multi-step Consolidation#Meno-Lite-0.12026년 7월 19일댓글 수 로딩 중
[논문리뷰] From Human-Centric to Agentic Code Review: The Impact of Different Generations of Generative AI Technology on Review Quality본 논문은 Generative AI 기술이 소프트웨어 개발 생태계에 깊숙이 침투함에 따라, 기존의 Human-Centric 코드 리뷰가 LLM 및 AI Agent가 결합된 형태로 변화하면서 발생하는 리뷰 품질 및 효율성 변화를 규명하고자 합니다 .#Review#Generative AI#Code Review#LLM#AI Agents#Review Quality#Human-AI Collaboration#Software Engineering2026년 7월 19일댓글 수 로딩 중
[vllm] vLLM의 대규모 모델 추론을 위한 MRV2 기반 Prefill Context Parallelism(PCP) 도입MLA 모델을 위한 MRV2 기반의 PCPManager를 도입하여 Prefill 연산을 병렬화하고, DCP와 PCP를 직교적으로 분리하여 확장성을 개선했습니다.#vLLM#LLM#MLA#Context Parallelism#Distributed Inference2026년 7월 19일댓글 수 로딩 중
[sglang] SGLang DFlash 최적화: 호스트-디바이스 동기화 제거를 통한 추론 성능 향상DFlash의 단계별 호스트 동기화를 제거하여 CPU가 한 단계 앞서 실행되도록 최적화, 최대 13%의 토큰 처리량 향상을 달성했습니다.#SGLang#LLM#CUDA#Optimization#Triton2026년 7월 18일댓글 수 로딩 중
[flashinfer] FlashInfer의 FP4 GEMM 최적화: 휴리스틱 개선과 Autotuning 효율화FlashInfer의 mm_fp4(cute-dsl) 연산에서 휴리스틱 기반 랭킹과 Top-N Autotuning을 도입하여 컴파일 시간을 획기적으로 단축했습니다.#FlashInfer#GEMM#CUDA#Optimization#LLM#Autotuning2026년 7월 15일댓글 수 로딩 중
[논문리뷰] Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning본 논문은 대규모 언어 모델이 단순히 정보를 암기하는 단계를 넘어 고도의 논리적 추론 능력을 갖추기 위한 핵심 동력으로 Zero RL의 확장성을 주목합니다.#Review#Zero RL#Trillion Parameters#Emergent Reasoning#Reinforcement Learning#Scalability#LLM2026년 7월 15일댓글 수 로딩 중
[sglang] SGLang, FlashInfer의 CuTe DSL 백엔드 도입으로 NVFP4 양자화 성능 극대화SGLang이 FlashInfer의 최신 CuTe DSL 백엔드를 활용하여 NVFP4 양자화 성능을 크게 향상시킵니다.#SGLang#FlashInfer#NVFP4#양자화#성능 최적화#CuTe DSL#LLM2026년 7월 13일댓글 수 로딩 중
[논문리뷰] KronQ: LLM Quantization via Kronecker-Factored Hessian본 연구는 기존의 PTQ 방법들이 입력 activation 통계량(HX)만을 활용하여 출력 채널 간의 비대칭적인 민감도를 간과한다는 점을 핵심 문제로 지적합니다.#Review#Post-Training Quantization#Kronecker-Factored Hessian#Gradient Covariance#Mixed-Precision Allocation#Bidirectional Incoherence Processing#LLM2026년 7월 12일댓글 수 로딩 중
[vllm] vLLM에서 Qwen MoE 모델의 All-Reduce를 Reduce-Scatter로 최적화하기vLLM의 Qwen MoE 모델에서 불필요한 All-Reduce 연산을 Reduce-Scatter로 대체하여 통신 오버헤드를 줄이고 성능을 개선했습니다.#vLLM#LLM#MoE#Distributed Training#Optimization2026년 7월 12일댓글 수 로딩 중
[flashinfer] FlashInfer 분산 오토튜닝 동기화: NCCL 데드락 해결을 위한 전략적 접근분산 환경에서 오토튜닝 시 발생하는 GPU 타이밍 오차로 인한 NCCL 데드락 문제를 ProcessGroup 동기화로 해결합니다.#FlashInfer#Distributed Computing#NCCL#AutoTuning#LLM2026년 7월 10일댓글 수 로딩 중
[onnxruntime] ONNX Runtime WebGPU: FlashAttentionDecodeQKV 성능 최적화 분석WebGPU EP에서 FlashAttentionDecodeQKV의 Workgroup 크기와 타일링 전략을 최적화하여 토큰 생성 속도를 약 10% 향상시킨 사례를 분석합니다.#ONNXRuntime#WebGPU#FlashAttention#PerformanceOptimization#LLM2026년 7월 9일댓글 수 로딩 중
[flashinfer] FlashInfer, 초저병렬성 환경에서의 CP 델타 규칙 사전 계산 최적화FlashInfer가 초저병렬성 환경에서 CP 델타 규칙 사전 계산 성능을 개선했습니다.#FlashInfer#LLM#최적화#GPU#CUDA2026년 7월 8일댓글 수 로딩 중
[논문리뷰] Teaching LLMs a Low-Resource Language: Enhancing Code Completion in Pharo본 연구는 Pharo와 같은 저자원 프로그래밍 언어의 생태계에서 LLM 기반의 코드 완성 도구가 부재하다는 점을 해결하고자 합니다.#Review#Pharo#Low-resource language#Code completion#LLM#Fine-tuning#In-IDE support2026년 7월 8일댓글 수 로딩 중
[vllm] vLLM 성능 최적화: token_to_req_indices 캐싱을 통한 6배 성능 향상vLLM에서 중복되던 CPU-GPU 간 데이터 복사를 제거하여 커널 성능을 5~6배 개선한 최적화 사례를 분석합니다.#vLLM#LLM#Performance#Optimization#CUDA2026년 7월 6일댓글 수 로딩 중
[vllm] vLLM Transformers Modeling Backend 성능 최적화: 네이티브 수준의 속도 달성Transformers 모델링 백엔드에 Fused Linear와 MoE 최적화를 도입하여 vLLM 네이티브 수준의 성능을 구현한 기술적 분석.#vLLM#LLM#Optimization#Transformers#PyTorch2026년 7월 6일댓글 수 로딩 중
[axolotl] Qwen3.5 성능 극대화: PEFT의 불필요한 Dtype 캐스팅 제거와 LoRA 커널 퓨전Qwen3.5의 GatedDeltaNet 레이어에서 발생하는 불필요한 메모리 복사 부하를 줄여 학습 속도를 최대 5.9% 향상시킨 Axolotl의 최적화 기법을 분석합니다.#LLM#LoRA#Optimization#PyTorch#Axolotl#Qwen3.52026년 7월 5일댓글 수 로딩 중
[vllm] vLLM의 Sequence Parallelism 최적화: DP 의존성 제거를 통한 성능 향상vLLM에서 Data Parallelism 없이 Sequence Parallelism을 지원하여 MoE 모델의 효율성을 극대화한 최적화 분석.#vLLM#LLM#MoE#SequenceParallelism#DistributedComputing2026년 7월 5일댓글 수 로딩 중
[vllm] vLLM XPU 백엔드 최적화: W8A8 및 W8A16 FP8 Linear 커널 도입vLLM의 XPU 백엔드에 W8A8 및 W8A16 FP8 Linear 커널을 추가하여 다양한 양자화 세분성을 지원하고 성능을 최적화했습니다.#vLLM#XPU#FP8#Quantization#LLM2026년 7월 4일댓글 수 로딩 중
[vllm] vLLM의 Dynamic Speculative Decoding을 위한 Full CUDA Graph 최적화Dynamic Speculative Decoding(DSD)에서 MRv2와 Full CUDA Graph를 결합하여 추론 성능을 극대화하는 최적화 기법을 소개합니다.#vLLM#CUDA Graph#Speculative Decoding#LLM#Performance Optimization2026년 7월 4일댓글 수 로딩 중
[논문리뷰] AgenticDataBench: A Comprehensive Benchmark for Data Agents본 연구는 기존 데이터 에이전트 벤치마크가 복잡한 실제 비즈니스 시나리오를 충분히 반영하지 못하고, 세부적인 작업 수준의 성능 분석을 제공하지 못한다는 한계점을 해결하고자 합니다.#Review#Data Agent#Benchmark#Skill Extraction#Data Science#LLM#Task Generation#Evaluation Pipeline2026년 7월 2일댓글 수 로딩 중
[sglang] Intel XPU를 위한 고성능 그래프 캡처 및 리플레이 지원 구현SGLang에 Intel XPU 그래프 캡처 기능을 도입하여 커널 실행 오버헤드를 줄이고 추론 성능을 최적화했습니다.#SGLang#XPU#LLM#Optimization#CUDA-Graph2026년 7월 2일댓글 수 로딩 중
[논문리뷰] Seed2.0 Model Card: Towards Intelligence Frontier for Real-World Complexity본 연구는 기존 LLM 에이전트 시스템이 competition-level의 문제 해결 능력은 갖추었으나, 실세계의 복잡하고 긴 호흡의 과업을 end-to-end로 완수하지 못하는 비대칭성 문제를 해결하고자 합니다.#Review#LLM#Agentic Paradigm#Multi-step Instruction Execution#Vision-Language Models#Scientific Discovery#Cost Efficiency2026년 7월 1일댓글 수 로딩 중
[논문리뷰] Unlocking the Visual Record of Materials Science: A Large-Scale Multimodal Dataset from Scientific Literature본 논문은 재료과학 분야의 방대한 실험적 지식이 담긴 시각적 기록이 복합 그림 구조의 복잡성으로 인해 AI 모델이 접근할 수 없는 형태로 남아 있다는 문제를 해결하고자 한다. 기존 연구들은 주로 텍스트 기반 데이터베이스에 의존하며, 논문 내 포함된 풍부한 실험적 시각 자료를 활용하지 못하고 있다.#Review#Multimodal dataset#Materials informatics#Compound figure detection#Information extraction#LLM#Vision-language#YOLO12-m2026년 6월 30일댓글 수 로딩 중
[논문리뷰] Reinforcement Learning with Metacognitive Feedback Elicits Faithful Uncertainty Expression in LLMs본 연구는 LLM이 높은 자신감으로 환각(hallucination)을 생성하거나 지식의 경계를 식별하지 못하는 등 시스템적인 Metacognition 결핍 문제를 해결하고자 합니다 . 기존 모델들은 내부의 불확실성을 제대로 인지하지 못하거나 이를 언어적으로 정직하게 표현하지 못하는 한계가 있습니다.#Review#LLM#Metacognition#Reinforcement Learning#Faithful Calibration#Uncertainty#Preference Optimization#Metacognitive Feedback2026년 6월 30일댓글 수 로딩 중
[논문리뷰] LUMOS: A Semantic Operating-System Layer for Accessibility-Grounded AI Agents본 논문은 기존 운영체제가 인간 사용자에게 최적화되어 있어 AI 에이전트의 효율적인 제어를 방해한다는 문제점을 해결하고자 합니다.#Review#AI Agents#Operating Systems#Accessibility#Semantic Blueprint#UI Automation#Computer Use#LLM2026년 6월 30일댓글 수 로딩 중
[axolotl] Axolotl에 도입된 Stateless 최적화: SinkGD로 메모리 효율 극대화하기SinkGD를 통해 LLM 학습 시 옵티마이저 상태 메모리를 87% 절감하고 성능을 유지하는 최적화 기법을 분석합니다.#LLM#Optimization#SinkGD#PyTorch#Axolotl2026년 6월 30일댓글 수 로딩 중
[onnxruntime] ONNX Runtime QMoE SwiGLU GEMV 최적화: Split-K2 커널로 LLM 추론 가속화ONNX Runtime의 Split-K2 SwiGLU GEMV 커널로 QMoE FC1 레이어 성능을 개선합니다.#ONNXRuntime#CUDA#GEMV#Split-K2#LLM#Optimization#SwiGLU#QMoE2026년 6월 30일댓글 수 로딩 중
[vllm] vLLM에 고성능 추론을 위한 HPC-Ops Attention 백엔드 도입Tencent의 HPC-Ops 라이브러리를 vLLM에 통합하여 FP8 모델 추론 성능을 최적화하는 방법#vLLM#LLM#HPC#FP8#Attention2026년 6월 30일댓글 수 로딩 중
[vllm] vLLM의 성능 극대화: Helion 커널을 활용한 fused_qk_norm_rope 최적화vLLM에 Helion 커널을 도입하여 fused_qk_norm_rope 연산 성능을 H100 기준 최대 1.38배 향상시킨 사례 분석.#vLLM#Helion#KernelOptimization#CUDA#LLM2026년 6월 29일댓글 수 로딩 중
[논문리뷰] Thinking While Speaking: Inference-Time Knowledge Transfer for Responsive and Intelligent Conversational Voice Agents본 논문은 클라우드 기반 LLM의 높은 추론 능력과 온디바이스 모델의 즉각적인 반응성이라는 이중적 요구사항을 동시에 만족하기 위한 새로운 하이브리드 아키텍처를 제안합니다.#Review#Conversational Infill#On-device AI#Model Collaboration#Latency#Streaming Knowledge#LLM2026년 6월 28일댓글 수 로딩 중
[논문리뷰] Formalizing Latent Thoughts: Four Axioms of Thought Representation in LLMs본 논문은 LLM의 잠재 추론(latent reasoning)이 실제로는 기능적 요건을 충족하지 못할 수 있다는 점을 지적하며, 이를 검증하기 위한 공리적 평가 프레임워크를 제안합니다 .#Review#LLM#Latent Thought Representation#Axiomatic Framework#Causality#Minimality#Separability#Stability#Functional Reasoning2026년 6월 28일댓글 수 로딩 중
[vllm] vLLM의 GLM5.2 성능 최적화: Triton 커널 융합을 통한 E2E Throughput 향상Triton 커널 융합으로 Q RoPE, FP8 양자화, 스케일 폴딩을 통합하여 추론 성능을 최대 3.3% 개선했습니다.#vLLM#Triton#LLM#Optimization#FP82026년 6월 27일댓글 수 로딩 중
[sglang] SGLang, CUDA 그래프 재실행 시 호스트-디바이스 동기화 제거로 성능 향상SGLang에서 CUDA 그래프 재실행 시 불필요한 호스트-디바이스 동기화를 제거하여 GPU 활용률을 높이고 응답 속도를 개선했습니다.#SGLang#CUDA#최적화#성능#LLM2026년 6월 27일댓글 수 로딩 중
[vllm] vLLM, DeepSeek V4 모델 성능 최적화: AITER MXFP4 BF16 백엔드 개선vLLM에서 DeepSeek V4 모델의 성능을 향상시키기 위한 AITER MXFP4 BF16 백엔드 최적화 분석#vLLM#DeepSeekV4#LLM#Performance#Optimization#ROCm#AITER#MXFP42026년 6월 26일댓글 수 로딩 중
[sglang] SGLang의 Qwen3.5 성능 극대화: Fused QK GemmaRMSNorm + RoPE 커널 최적화 분석Qwen3.5 모델의 어텐션 레이어 연산을 Triton 커널로 통합하여 메모리 접근을 줄이고 추론 성능을 최대 9.4% 향상시킨 최적화 기법을 소개합니다.#SGLang#Triton#LLM#Optimization#Qwen3.52026년 6월 25일댓글 수 로딩 중
[논문리뷰] The Hitchhiker's Guide to Agentic AI: From Foundations to Systems이 가이드는 현대 AI 시스템의 전체 스택을 이해하고 구축하고자 하는 연구자와 실무자를 위해, LLM의 기초 아키텍처부터 autonomous agentic 시스템까지를 통합적으로 설명합니다.#Review#LLM#Reinforcement Learning#Agentic AI#System Architecture#Retrieval-Augmented Generation#Chain-of-Thought#Multi-Agent Systems2026년 6월 24일댓글 수 로딩 중
[논문리뷰] Look Light, Think Heavy: What Multimodal Chain-of-Thought Reasoning Can and Cannot Do본 논문은 Multimodal CoT가 과연 모든 멀티모달 작업에서 일관되게 성능을 향상시키는지, 그리고 그 한계점은 무엇인지를 체계적으로 분석합니다. 최근 텍스트 중심 LLM에서는 CoT가 추론 능력을 극대화하는 표준으로 자리 잡았으나, 이를 멀티모달 영역으로 확장했을 때의 효용성은 여전히 불분명합니다.#Review#Multimodal Chain-of-Thought#Visual Reasoning#LLM#Test-Time Scaling#Visual Reflection#Attention Bias2026년 6월 24일댓글 수 로딩 중
[논문리뷰] Autodata: An agentic data scientist to create high quality synthetic data본 연구는 고품질 데이터의 부족 문제를 해결하고, 인간의 개입을 최소화하면서 데이터 생성 파이프라인을 자동화하는 것을 목표로 합니다. 기존의 데이터 생성 방식은 데이터의 다양성이 부족하거나 품질 제어가 어렵다는 한계를 지니고 있으며, 단순히 양적인 데이터 확대만으로는 모델 성능의 비약적인 향상을 이끌어내기 어렵습니다.#Review#Synthetic Data#Agentic Workflow#LLM#Data Curation#Model Training#Automated Discovery2026년 6월 24일댓글 수 로딩 중
[sglang] SGLang 성능 최적화: D2H 복사 연산의 비동기 오버랩 구현SGLang에서 D2H(Device-to-Host) 복사를 별도 스트림으로 분리하여 추론 성능을 향상시킨 최적화 사례 분석.#SGLang#CUDA#Performance#Optimization#LLM2026년 6월 24일댓글 수 로딩 중
[axolotl] Axolotl, 대규모 언어 모델 학습 시 메모리 부족 문제 해결: 효율적인 데이터셋 처리 개선Axolotl 라이브러리에서 대규모 SFT 데이터셋 로딩 시 발생하는 RAM OOM 오류를 해결하는 코드 변경 사항을 분석합니다.#Python#PyTorch#Hugging Face Datasets#Optimization#LLM2026년 6월 24일댓글 수 로딩 중
[vllm] vLLM Qwen3-VL 멀티 비디오 프롬프트 처리 최적화 분석텍스트 기반 프롬프트 확장 방식을 토큰 수준 치환으로 변경하여 성능 향상 및 EVS 버그를 해결했습니다.#vLLM#Qwen3-VL#Optimization#LLM#Multimodal2026년 6월 20일댓글 수 로딩 중
[axolotl] Axolotl, Marlin W4A16 도입으로 MoE 모델 추론 속도 1.79배 향상 및 품질 개선Axolotl이 Marlin W4A16 백엔드를 도입하여 MoE 모델의 추론 속도를 1.79배 높이고, 활성화 양자화 오류를 제거하여 모델 품질을 향상시켰습니다.#Axolotl#Marlin#MoE#DeepSeek-V4#W4A16#BF16#Quantization#Optimization#Deep Learning#LLM2026년 6월 20일댓글 수 로딩 중
[vllm] vLLM Mooncake KV 오프로딩 최적화: 불필요한 KV 조회 건너뛰기vLLM의 Mooncake KV 오프로딩 성능 향상: 불필요한 KV 조회 건너뛰고 스토리지 오버헤드 감소#vLLM#LLM#KV Cache#Optimization#Performance2026년 6월 18일댓글 수 로딩 중
[sglang] SGLang의 Linear-Attention 성능 최적화: int8 체크포인트 풀 도입Linear-attention 모델의 Radix 캐시 효율을 int8 양자화로 2배 높여, 메모리 제약 없이 더 많은 프리픽스를 재사용하는 최적화 기법.#SGLang#Linear-Attention#Optimization#Quantization#LLM2026년 6월 18일댓글 수 로딩 중
[sglang] SGLang 성능 최적화: Speculative Decoding의 H2D 병목 해결 및 코드 중복 제거Speculative Decoding 경로에서 발생하는 동기식 H2D 복사를 비동기 방식으로 최적화하고, 중복된 로직을 통합하여 성능을 개선했습니다.#SGLang#LLM#Performance#PyTorch#SpeculativeDecoding2026년 6월 17일댓글 수 로딩 중
[sglang] [성능 최적화] SGLang `prepare_for_decode`에서 `latest_output_ids` H2D 복사 비동기화로 디코딩 처리량 30% 향상SGLang 디코딩 과정에서 `latest_output_ids`의 H2D 복사를 비동기화하여 성능을 크게 개선한 사례 분석.#SGLang#PyTorch#CUDA#성능 최적화#GPU#LLM#H2D#비동기 프로그래밍2026년 6월 17일댓글 수 로딩 중
[sglang] Ascend NPU에서 Qwen3 모델을 위한 W8A8 MXFP8 양자화 지원Ascend NPU 환경에서 Qwen3 모델의 추론 성능을 높이기 위해 MXFP8 온라인 및 오프라인 양자화 기능을 구현했습니다.#Ascend NPU#Quantization#MXFP8#LLM#SGLang2026년 6월 16일댓글 수 로딩 중
[논문리뷰] Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients본 논문은 소형 모델(Small-scale Student)의 지식 전달(Knowledge Transfer) 시 발생하는 일반화 성능 저하 및 강화학습의 비효율성 문제를 해결하고자 합니다.#Review#ZPPO#Reinforcement Learning#Knowledge Distillation#Prompt Engineering#VLM#LLM#Policy Gradient#Zone of Proximal Development2026년 6월 16일댓글 수 로딩 중
[flashinfer] FlashInfer, SM120 GPU를 위한 희소 MLA 커널 추가로 LLM 추론 속도 향상FlashInfer가 SM120 GPU를 위한 희소 MLA 커널을 도입하여 LLM 추론 성능을 대폭 개선했습니다.#FlashInfer#LLM#GPU 최적화#CUDA 커널#머신러닝2026년 6월 15일댓글 수 로딩 중
[transformers] Hugging Face Transformers: logits_to_keep을 활용한 메모리 최적화모델 내부에서 logits을 미리 슬라이싱하여 메모리 사용량을 줄이고 추론 처리량을 개선하는 최적화 기법을 소개합니다.#HuggingFace#Transformers#LLM#Optimization#DeepLearning2026년 6월 15일댓글 수 로딩 중
[논문리뷰] Who Flips? Self- and Cross-Model Counterarguments Reveal Answer Instability in LLMs본 논문은 LLM이 정답을 알고 있음에도 불구하고, 외부의 그럴듯한 반론에 의해 얼마나 쉽게 답변을 번복하는지, 즉 '답변 안정성(Answer Stability)'을 체계적으로 평가하는 데 목적이 있습니다.#Review#LLM#Answer Instability#Sycophancy#Argument-driven Challenge#MMLU#MaxFlip#Answer Flip Rate2026년 6월 15일댓글 수 로딩 중
[sglang] SGLang의 긴 문맥 처리 최적화: fill_ids 재구성 오버헤드 줄이기RadixKey에 limit을 도입하여 불필요한 메모리 복사를 제거하고 긴 문맥 추론 성능을 개선한 사례 분석.#SGLang#LLM#Optimization#Python#Performance2026년 6월 14일댓글 수 로딩 중
[vllm] vLLM의 동적 추측 디코딩(Dynamic Speculative Decoding) 도입배치 크기에 따라 추측 디코딩의 토큰 수를 최적화하여 높은 부하에서도 효율적인 추론 성능을 유지하는 Dynamic SD 구현#vLLM#LLM#Speculative Decoding#Performance Optimization#Inference2026년 6월 14일댓글 수 로딩 중
[sglang] SGLang PD-Disaggregation 최적화: Mori 백엔드에서의 증분 KV 전송 구현SGLang의 PD-Disaggregation 환경에서 Mori 전송 백엔드와 Radix Cache를 연동하여 중복 KV 전송을 제거하고 TTFT를 20% 이상 개선했습니다.#SGLang#LLM#KV-Cache#Optimization#Distributed-Systems2026년 6월 13일댓글 수 로딩 중
[vllm] vLLM에서 Lfm2VL 모델을 위한 Encoder CUDA Graph 최적화 적용Lfm2VL 모델에 Encoder CUDA Graph를 도입하여 낮은 배치 사이즈에서 추론 지연 시간을 10-20% 개선했습니다.#vLLM#CUDA Graph#LLM#Optimization#Performance2026년 6월 12일댓글 수 로딩 중
[sglang] SGLang에서 Qwen3-Next FP8 MoE 최적화: H200을 위한 Shared-Expert FusionH200 환경에서 Qwen3-Next FP8 MoE 모델의 성능을 극대화하기 위한 Shared-Expert Fusion 및 Triton 커널 최적화 분석.#SGLang#LLM#MoE#FP8#Triton#H2002026년 6월 11일댓글 수 로딩 중
[논문리뷰] ToolSense: A Diagnostic Framework for Auditing Parametric Tool Knowledge in LLMs본 논문은 LLM의 도구 사용 능력을 평가할 때 기존의 End-to-End 방식이 모델의 내부 지식(Parametric Knowledge)과 추론 능력을 명확히 구분하지 못하는 한계를 해결하기 위해 제안되었습니다.#Review#LLM#Tool Learning#Parametric Knowledge#Diagnostic Framework#Tool Auditing#Evaluation2026년 6월 11일댓글 수 로딩 중
[논문리뷰] EvoBrowseComp: Benchmarking Search Agents on Evolving Knowledge본 연구는 기존의 정적인 벤치마크 환경이 급변하는 실시간 정보 환경을 제대로 반영하지 못하는 한계를 극복하고자 수행되었습니다. 대다수의 기존 모델들은 학습 데이터에 포함된 과거 정보에 의존하거나, 고정된 문서 데이터셋 내에서만 평가되어 실시간으로 업데이트되는 사실 관계를 추적하는 데 어려움을 겪습니다.#Review#Search Agents#Evolving Knowledge#Benchmarking#Information Retrieval#LLM#Dynamic Environments2026년 6월 11일댓글 수 로딩 중
[sglang] SGLang에서 DP Attention, TBO, Shared Experts Fusion 동시 최적화 구현DP Attention, TBO, Shared Experts Fusion을 통합하여 DeepSeek 모델의 추론 성능을 약 2.5% 향상시킨 기술적 해결 과정.#SGLang#DeepSeek#LLM#Optimization#DistributedInference2026년 6월 10일댓글 수 로딩 중
[flashinfer] FlashInfer Unified MoE API: NVFP4 백엔드 통합 및 자동 튜닝 최적화CuteDSL과 TRTLLM FP4 백엔드를 통합하고, 런타임 자동 튜닝을 통해 최적의 성능을 선택하는 Unified MoE API 설계 및 구현.#FlashInfer#MoE#NVFP4#Autotuning#LLM2026년 6월 10일댓글 수 로딩 중
[논문리뷰] Online Skill Learning for Web Agents via State-Grounded Dynamic Retrieval본 연구는 기존 Web Agent가 복잡하고 동적인 웹 환경에서 일반화된 지식의 한계로 인해 특정 도메인이나 새로운 인터페이스 적응에 실패하는 문제를 해결하고자 합니다.#Review#Web Agents#Online Skill Learning#Dynamic Retrieval#State-Grounded#Sequential Decision Making#Skill Library#LLM2026년 6월 9일댓글 수 로딩 중
[논문리뷰] Kwai Keye-VL-2.0 Technical Report본 연구는 대규모 다중 모달 데이터셋 환경에서 높은 추론 성능과 효율적인 정렬을 동시에 달성하기 위한 고성능 VLM 아키텍처 개발을 목표로 합니다.#Review#Vision-Language Model#Multimodal Pretraining#Alignment#Instruction Tuning#Visual Encoder#LLM2026년 6월 9일댓글 수 로딩 중
[논문리뷰] BenSyc: Benchmarking Conversational Sycophancy and Human Alignment in LLMs for Bengali Contexts본 연구는 현재의 LLM 평가 체계가 주로 영어 중심이며, Bengali와 같은 저자원 언어(Low-resource languages)에 대한 Alignment 및 Sycophancy 평가가 극히 제한적이라는 문제의식에서 출발합니다.#Review#LLM#Sycophancy#Bengali#Alignment#Benchmarking#NLP#Multilingual Evaluation2026년 6월 9일댓글 수 로딩 중
[논문리뷰] Human Psychometric Questionnaires Mischaracterize LLM Behavior본 논문은 LLM의 가치와 성격을 평가하기 위해 인간용 심리측정 설문지를 사용하는 것이 과연 실제 사용자 상호작용에서의 행동을 신뢰성 있게 예측하는지 의문을 제기합니다.#Review#LLM#Psychometrics#Value Portrait#Generation Probability#Alignment#Construct Validity2026년 6월 8일댓글 수 로딩 중
[논문리뷰] WorldBench: A Challenging and Visually Diverse Multimodal Reasoning Benchmark본 논문은 기존 멀티모달 벤치마크들이 모델의 실제 추론 능력을 충분히 측정하지 못하는 한계점을 극복하기 위해 WorldBench를 제안한다. 많은 기존 벤치마크가 특정 도메인에 편향되어 있거나 시각적 다양성이 부족하여, VLM의 실제 문제 해결 능력을 과대평가하게 만드는 경향이 있다.#Review#Multimodal Reasoning#Benchmark#Vision-Language Model#Visual Diversity#Inference#Evaluation#LLM2026년 6월 7일댓글 수 로딩 중
[논문리뷰] Towards Retrieving Interaction Spaces for Agentic Search본 논문은 기존의 Agentic Search 방식이 가진 확장성 및 효율성 문제를 해결하기 위해 제안되었습니다.#Review#Agentic Search#Retrieval-Augmented Generation#Direct Corpus Interaction#Interaction Space#Information Retrieval#LLM2026년 6월 7일댓글 수 로딩 중
[vllm] vLLM의 GDN 어텐션 최적화: Prefill과 Decode 배치 분리를 통한 2배 성능 향상Mixed 배치에서 Prefill과 Decode를 분리하여 GDN 어텐션 연산 효율을 극대화하고 1.93배의 커널 속도 향상을 달성했습니다.#vLLM#LLM#Performance#Optimization#CUDA#GDN2026년 6월 6일댓글 수 로딩 중
[sglang] DeepSeek V4의 Prefill 성능을 1.35배 향상시킨 FlashAttention 최적화DeepSeek V4 모델의 Prefill 단계 성능을 획기적으로 개선한 FlashAttention 최적화 분석#AI#LLM#Performance Optimization#FlashAttention#DeepSeek V4#SGLang2026년 6월 3일댓글 수 로딩 중
[논문리뷰] Streaming Communication in Multi-Agent Reasoning본 논문은 기존의 'generate-then-transfer' 패러다임이 유발하는 불필요한 대기 시간과 추론 효율 저하 문제를 해결하기 위해 고안되었습니다.#Review#Multi-Agent Reasoning#LLM#Pipeline Parallelism#Streaming Communication#Step-Level Scaling Law#Communication Protocol2026년 6월 3일댓글 수 로딩 중
[논문리뷰] STRIDE: Training Data Attribution via Sparse Recovery from Subset Perturbations본 논문은 LLM의 예측 결과를 학습 데이터로 거슬러 올라가 추적하는 TDA의 계산 효율성과 이론적 한계를 해결하고자 합니다.#Review#Training Data Attribution#LLM#Sparse Recovery#Compressive Sensing#Activation-Space#Steering Operators#Causal Inference2026년 6월 3일댓글 수 로딩 중
[논문리뷰] DAR: Deontic Reasoning with Agentic Harnesses본 논문은 LLM 기반의 Deontic Reasoning에서 발생하는 긴 법령의 구조적 복잡성과 정보 검색의 비효율성 문제를 해결하고자 합니다. 기존 Direct Reasoning 방식은 대규모 규정집을 한 번에 컨텍스트로 제공해야 하므로, 모델이 정작 필요한 규칙을 놓치거나 잘못 참조하는 한계가 있습니다 .#Review#Deontic Reasoning#Agentic Harness#LLM#DeonticBench#Statutory Reasoning#Tool Use#Inference Efficiency2026년 6월 3일댓글 수 로딩 중
[flashinfer] FlashInfer FP8 KV-Cache Prefill 성능 최적화: Repacking 기법을 통한 오버헤드 제거FP8 KV-cache의 dequantization 오버헤드를 BF16 staging buffer로 제거하여 Prefill 성능을 최대 1.3배 향상시켰습니다.#FlashInfer#CUDA#FP8#LLM#Optimization2026년 6월 2일댓글 수 로딩 중
[sglang] SGLang의 NIXL 통신 최적화: Prep+Make API 도입을 통한 KV 캐시 전송 성능 향상NIXL의 Prep+Make API를 활용해 KV 캐시 전송 시 디스크립터 재구성을 방지하여 TTFT를 최대 27% 개선했습니다.#SGLang#LLM#KV-Cache#Optimization#Distributed-Systems2026년 6월 2일댓글 수 로딩 중
[논문리뷰] Ψ-Bench: Evaluating Persona-Sensitive Influencing in Persuasive Dialogues본 논문은 현대의 Personalized LLM Agent가 사용자의 선호에 맞춘 수동적 응답자(Passive Responder)에 머물러 있다는 한계를 지적하며, 보다 능동적인 설득 및 가이드 능력을 갖춘 'Proactive Personalization'의 필요성을 제기합니다.#Review#LLM#Personalization#Persuasive Dialogue#Persona-Sensitive Influencing#Proactive Agent#Benchmark2026년 6월 2일댓글 수 로딩 중
[논문리뷰] Pressure-Testing Deception Probes in LLMs: Scaling, Robustness, and the Geometry of Deceptive Representations본 연구는 LLM의 deception detection을 위해 사용되는 Linear Probes가 실전 환경에서 보이는 극심한 성능 저하의 원인을 규명하고자 합니다.#Review#LLM#Deception Detection#Linear Probes#Scaling Laws#Robustness#Geometric Analysis#Activation Engineering2026년 6월 2일댓글 수 로딩 중
[논문리뷰] MIRA: Mid-training Rubric Anchoring for Source-Aware Data Selection본 논문은 이질적인(Heterogeneous) Mid-training 데이터 혼합물에서 효과적인 데이터 선택이 어렵다는 문제를 해결하고자 합니다.#Review#Mid-training#Data Selection#Rubric Discovery#LLM#Distillation#Source-Aware#Scalability2026년 6월 2일댓글 수 로딩 중
[논문리뷰] AutoMedBench: Towards Medical AutoResearch with Agentic AI Models본 논문은 기존 의료 AI 벤치마크가 End-to-End 연구 과정의 복잡성을 간과하고 최종 결과물 평가에만 치중하여, 에이전트의 행동 특성이나 실패 원인을 파악하기 어렵다는 문제점을 해결하고자 합니다 .#Review#Medical-AI#Autonomous Agents#Benchmark#Research Automation#Workflow-Aware Evaluation#LLM2026년 6월 2일댓글 수 로딩 중
[논문리뷰] Linear Ensembles Wash Away Watermarks: On the Fragility of Distributional Perturbations in LLMs본 논문은 현대의 다중 모델(multi-provider) 생태계에서 기존의 LLM 워터마킹 기술이 근본적으로 취약하다는 점을 지적합니다. 기존 연구들은 공격자가 단일 모델에만 접근할 수 있다는 가정하에 설계되었으나, 실제로는 사용자가 여러 frontier LLM을 자유롭게 사용할 수 있는 환경이 조성되어 있습니다.#Review#Watermarking#LLM#Ensemble#Distributional Perturbation#WASH#Attribution2026년 6월 1일댓글 수 로딩 중
[논문리뷰] FineVerify: Scaling Test-Time Compute with Fine-Grained Self-Verification for Agentic Search본 논문은 기존의 Agentic Search 모델들이 겪는 정답의 희소성 문제와 기존 Test-Time Compute scaling 기법들이 가진 신뢰성 한계를 해결하고자 합니다.#Review#Agentic Search#Test-Time Compute#Self-Verification#Fine-Grained#LLM#Benchmark Auditing2026년 6월 1일댓글 수 로딩 중
[논문리뷰] Mellum2 Technical ReportMarko Kojic이 arXiv에 게시한 'Mellum2 Technical Report' 논문에 대한 자세한 리뷰입니다.#Review#LLM#Pretraining#Model Architecture#Technical Report#Evaluation#Training Pipeline2026년 5월 31일댓글 수 로딩 중
[sglang] SGLang의 KV-Canary JIT 커널 도입: 효율적인 KV 캐시 검증 최적화SGLang에 도입된 KV-Canary JIT 커널을 통해 대규모 언어 모델의 KV 캐시 무결성을 효율적으로 검증하는 방법을 분석합니다.#SGLang#CUDA#JIT#LLM#KV-Cache2026년 5월 31일댓글 수 로딩 중
[sglang] SGLang 스케줄러 최적화: input_ids H2D 지연 처리 및 FutureMap 통합SGLang의 prefill input_ids H2D를 forward stream으로 지연시키고 FutureMap을 통해 입력을 통합하여 스케줄링 효율을 개선했습니다.#SGLang#LLM#Scheduler#Optimization#CUDA2026년 5월 30일댓글 수 로딩 중
[sglang] DeepSeek-V4의 Latency 최적화: Fused mHC Post/Pre Kernel 도입DeepSeek-V4 모델의 추론 속도 향상을 위한 Fused mHC Post/Pre Kernel 도입 분석#AI#LLM#최적화#성능#DeepSeek-V4#sglang#Kernel Fusion2026년 5월 30일댓글 수 로딩 중
[onnxruntime] ONNX Runtime의 CPU GQA 최적화: Flash Attention과 Flash Decoding 도입CPU 환경에서 INT8/INT4 양자화된 KV 캐시를 위한 Flash Attention 기반의 타일링 및 Flash Decoding 구현으로 성능을 극대화합니다.#ONNX Runtime#LLM#Flash Attention#CPU Optimization#Quantization2026년 5월 29일댓글 수 로딩 중
[논문리뷰] OmniRetrieval: Unified Retrieval across Heterogeneous Knowledge Sources본 연구는 현실 세계의 다양한 정보 요구가 비정형 텍스트, 관계형 데이터베이스, 지식 그래프 등 구조적으로 이질적인 소스들에 분산되어 있음에도 불구하고, 기존 검색 시스템들이 단일 소스 혹은 단일 query language에만 최적화되어 있어 통합적인 검색이 어렵다는 점을 해결하고자 합니다 .#Review#OmniRetrieval#Heterogeneous Knowledge Sources#Native Query Language#Unified Retrieval#LLM#Knowledge Graph#Text-to-SQL2026년 5월 28일댓글 수 로딩 중
[논문리뷰] ScientistOne: Towards Human-Level Autonomous Research via Chain-of-Evidence본 논문은 자율 연구 에이전트가 생성한 결과물에서 발견되는 심각한 신뢰성 결여 문제를 해결하고자 한다. 기존 에이전트 시스템은 전문적인 논문과 경쟁력 있는 솔루션을 생성하지만, 인용 조작, 검증 불가능한 점수 보고, 코드 구현과 논문 서술 간의 불일치 등 표면적인 완성도에만 치중한 오류들을 반복적으로 보이고 있다.#Review#Autonomous Research#Chain-of-Evidence#Verifiability#Provenance#Integrity Audit#LLM2026년 5월 27일댓글 수 로딩 중
[논문리뷰] Efficient and Scalable Provenance Tracking for LLM-Generated Code Snippets본 논문은 LLM이 생성한 코드의 출처를 투명하게 추적하고 저작권 준수를 확인해야 하는 시급한 문제 의식에서 출발합니다. 기존의 Winnowing 기반 플래지어리즘 탐지 도구는 정확도는 높지만, 데이터셋 전체를 스캔해야 하는 선형 시간 복잡도로 인해 최신 LLM이 학습되는 대규모 데이터셋에 적용하기에는 한계가 있습니다.#Review#Provenance Tracking#Code Similarity#LLM#Vector Search#Winnowing#SourceTracker#HybridSourceTracker2026년 5월 27일댓글 수 로딩 중
[vllm] vLLM, GDN Prefill 커널을 CuteDSL로 최적화하여 성능 향상vLLM의 GDN Prefill 연산에서 새로운 CuteDSL 기반 커널을 도입하여 성능을 크게 개선했습니다.#vLLM#GDN#CuteDSL#최적화#성능#LLM2026년 5월 26일댓글 수 로딩 중
[sglang] SGLang Diffusion 최적화: CFG Gating을 통한 추론 속도 20% 향상Classifier-free guidance(CFG)의 불필요한 연산을 줄이는 CFG Gating 기법을 도입하여 Denoising 단계의 성능을 25% 개선했습니다.#SGLang#Diffusion#Optimization#LLM#Inference2026년 5월 25일댓글 수 로딩 중
[sglang] SGLang의 MoE 성능 최적화: 512 전문가 모델을 위한 커널 최적화Qwen3.5-397B와 같은 대규모 MoE 모델을 위해 512 전문가를 지원하는 커널 최적화로 성능을 최대 4배 이상 향상시켰습니다.#SGLang#MoE#CUDA#Kernel Optimization#LLM2026년 5월 25일댓글 수 로딩 중
[논문리뷰] LLMs as Noisy Channels: A Shannon Perspective on Model Capacity and Scaling Laws본 논문은 LLM의 Scaling Laws를 경험적 관측이 아닌, Shannon의 정보 이론적 프레임워크를 통해 이론적으로 규명하고자 합니다.#Review#Information Theory#Scaling Laws#Noisy Channel#Model Capacity#LLM#Mutual Information2026년 5월 24일댓글 수 로딩 중
[논문리뷰] ETCHR: Editing To Clarify and Harness ReasoningETCHR은 LLM의 CoT 생성 과정에 존재하는 논리적 결함과 불필요한 노이즈가 최종 성능을 저하시키는 문제를 해결하기 위해 고안되었습니다. 기존 LLM은 긴 Reasoning Path를 생성할 때 고수준의 논리적 일관성을 유지하는 데 한계를 보이며, 이는 결과적으로 정답률 감소로 이어집니다.#Review#Chain-of-Thought#Reasoning#Model Editing#Inference Optimization#LLM#Knowledge Distillation#Interpretability2026년 5월 24일댓글 수 로딩 중
[onnxruntime] RISC-V 벡터(RVV) 최적화: ONNX Runtime LLM 추론 성능 극대화RISC-V 벡터 확장을 활용하여 LLM 연산자(GEMM, LayerNorm, RoPE)의 성능을 최대 191배 향상시킨 최적화 사례를 분석합니다.#RISC-V#RVV#ONNX Runtime#LLM#Optimization2026년 5월 23일댓글 수 로딩 중
[onnxruntime] ONNX Runtime CPU GQA 최적화: INT8/INT4 양자화 KV 캐시와 SIMD 가속CPU 환경에서 LLM 추론 성능을 극대화하기 위해 INT8/INT4 양자화 KV 캐시와 AVX512/NEON SIMD 커널을 도입한 최적화 사례를 분석합니다.#ONNX Runtime#LLM#Quantization#SIMD#Performance2026년 5월 21일댓글 수 로딩 중
[flashinfer] FlashInfer의 DeepSeek V4 Sparse MLA 최적화 분석DeepSeek V4의 Sparse MLA를 지원하기 위한 커널 최적화 및 가변 Top-K 처리 로직 개선 사항을 분석합니다.#FlashInfer#DeepSeek#CUDA#LLM#Optimization2026년 5월 21일댓글 수 로딩 중
[sglang] Qwen3.5 및 Qwen3_Next 모델의 NPU 성능 향상을 위한 Triton 커널 퓨전 최적화NPU 환경에서 Qwen3.5 및 Qwen3_Next 모델의 어텐션 레이어 성능을 극대화하는 Triton 커널 퓨전 최적화 분석#NPU#Triton#Kernel Fusion#Optimization#Qwen3.5#Qwen3_Next#LLM2026년 5월 20일댓글 수 로딩 중
[논문리뷰] LLMEval-Logic: A Solver-Verified Chinese Benchmark for Logical Reasoning of LLMs with Adversarial Hardening본 논문은 LLM의 자연어 논리 추론 능력을 평가하는 기존 벤치마크들이 겪고 있는 한계를 극복하기 위해 LLMEval-Logic을 제안한다 .#Review#LLM#Logical Reasoning#Benchmark#Z3#Adversarial Hardening#NL-to-FL2026년 5월 20일댓글 수 로딩 중
[vllm] vLLM 성능 최적화: GPU-CPU 간 불필요한 동기화 제거하기vLLM에서 GPU와 CPU 간의 불필요한 동기화를 제거하여 추론 성능을 극대화하는 최적화 기법을 분석합니다.#vLLM#LLM#Performance#GPU#Optimization2026년 5월 19일댓글 수 로딩 중
[논문리뷰] Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information본 논문은 LLM의 추론 능력을 강화하기 위한 on-policy self-distillation 기법이 수학적 추론 과제에서 일관된 성능 향상을 보이지 못하는 문제를 해결합니다.#Review#Reinforcement Learning#Self-Distillation#Reasoning#Pointwise Mutual Information#LLM#GRPO#Jensen-Shannon Divergence2026년 5월 19일댓글 수 로딩 중
[transformers] Hugging Face Transformers: Continuous Batching에 Tensor Parallelism 도입하기Continuous Batching 환경에서 Tensor Parallelism을 지원하여 대규모 언어 모델의 추론 성능을 극대화하는 최적화 기법 분석.#HuggingFace#Transformers#TensorParallelism#ContinuousBatching#LLM2026년 5월 18일댓글 수 로딩 중
[sglang] DeepSeekV4 Fused MoE Triton 커널 지원 추가: 성능 최적화 분석DeepSeekV4 모델의 Fused MoE Triton 커널 지원을 추가하여 추론 성능을 향상시킨 PR 분석#AI#LLM#Optimization#Triton#DeepSeekV4#MoE2026년 5월 18일댓글 수 로딩 중
[논문리뷰] Model-Adaptive Tool Necessity Reveals the Knowing-Doing Gap in LLM Tool Use본 논문은 LLM agent의 Adaptive Tool Use 과정에서 발생하는 성능 저하와 불투명성 문제를 해결하기 위해 모델 고유의 capability에 기반한 Model-Adaptive Tool Necessity 프레임워크를 제안합니다.#Review#LLM#Tool Use#Meta-cognition#Knowing-Doing Gap#Representation Engineering#Model-Adaptive2026년 5월 18일댓글 수 로딩 중
[sglang] SGLang, 레이어별 오프로딩 기본값 설정을 통한 인코더/VAE 성능 최적화SGLang에서 레이어별 오프로딩을 기본값으로 설정하여 인코더 및 VAE 컴포넌트의 추론 속도를 개선했습니다.#SGLang#성능 최적화#딥러닝#컴퓨터 비전#LLM2026년 5월 17일댓글 수 로딩 중
[sglang] SGLang의 MLA KV 캐시 쓰기 최적화: TMA Bulk-Store 도입TMA Bulk-Store와 Triton 커널 최적화를 통해 MLA KV 캐시 쓰기 성능을 최대 12배 향상시킨 기술적 여정.#SGLang#CUDA#Triton#LLM#Optimization#TMA2026년 5월 15일댓글 수 로딩 중
[sglang] SGLang 최적화: NPU 환경을 위한 RoPE 캐싱 메모리 효율화SGLang에서 NPU 환경을 고려한 조건부 RoPE 캐싱 로직 도입으로 약 230MB의 메모리 사용량을 절감한 사례를 분석합니다.#SGLang#LLM#NPU#Optimization#Memory Management2026년 5월 15일댓글 수 로딩 중
[논문리뷰] LLM-based Detection of Manipulative Political Narratives본 연구는 소셜 미디어상에서 폭증하는 정치적 조작 서사를 실시간으로 식별하고 구조화하는 계산적 프레임워크의 부재 문제를 해결하고자 합니다.#Review#FIMI#Strategic Narrative#LLM#HDBSCAN#UMAP#Computational Social Science#Manipulation Detection2026년 5월 14일댓글 수 로딩 중
[논문리뷰] FrontierSmith: Synthesizing Open-Ended Coding Problems at Scale본 논문은 open-ended 코딩 훈련을 위한 고품질 데이터의 부족 문제를 해결하기 위해 FrontierSmith를 제안합니다.#Review#FrontierSmith#Open-ended Coding#LLM#Idea Divergence#Automated Data Synthesis#Reinforcement Learning2026년 5월 14일댓글 수 로딩 중
[vllm] vLLM의 NIXL KV 전송을 활용한 GDN(Gated Delta Net) 모델 지원 최적화Qwen3.5와 같은 GDN 모델을 위해 NIXL 커넥터의 컨볼루션 상태 레이아웃을 최적화하고 이기종 TP 환경에서의 전송 효율을 개선했습니다.#vLLM#LLM#GDN#KV-Cache#Distributed-Serving2026년 5월 14일댓글 수 로딩 중
[논문리뷰] The Extrapolation Cliff in On-Policy Distillation of Near-Deterministic Structured Outputs본 논문은 LLM의 On-policy Distillation 과정에서 발생하는 reward extrapolation의 한계점을 해결하고자 한다.#Review#On-policy Distillation#Reward Extrapolation#Structured Output#Format Adherence#Importance Sampling#LLM2026년 5월 13일댓글 수 로딩 중
[논문리뷰] F-GRPO: Factorized Group-Relative Policy Optimization for Unified Candidate Generation and Ranking본 논문은 LLM 기반의 검색 및 추천 시스템에서 발생하는 결합된 list-to-rank 최적화 문제를 해결하고자 한다. 기존의 Black-box LLM 접근법은 후보군 생성과 순위 결정을 단일 결과물로 출력하여 두 과정 간의 기여도를 명확히 구분하지 못하는 한계가 있다.#Review#LLM#Reinforcement Learning#Retrieval & Ranking#GRPO#Factorized Policy#Sequential Recommendation#Multi-hop Question Answering2026년 5월 13일댓글 수 로딩 중
[pydantic-ai] Pydantic AI, 도구 검색 기능 도입으로 에이전트의 도구 관리 혁신Pydantic AI가 네이티브 도구 검색과 사용자 정의 전략을 도입하여 대규모 도구 세트 관리를 최적화합니다.#Pydantic AI#Agent#Tool Management#Optimization#LLM2026년 5월 13일댓글 수 로딩 중
[vllm] vLLM의 Triton 통합 어텐션 커널에 Tensor Descriptor 최적화 도입vLLM의 Triton 통합 어텐션 커널에 Tensor Descriptor를 도입하여 Intel XPU의 2D 블록 읽기 성능을 향상시킵니다.#vLLM#Triton#Optimization#Deep Learning#LLM2026년 5월 13일댓글 수 로딩 중
[sglang] NPU 성능 향상을 위한 causal_conv1d_update_v2 도입NPU 환경에서 causal_conv1d_update_v2를 사용하여 모델 추론 속도를 크게 개선했습니다.#NPU#성능 최적화#딥러닝#LLM#SGLang2026년 5월 12일댓글 수 로딩 중
[onnxruntime] [ONNX Runtime] PagedAttention의 FA 경로 최적화 및 정확성 개선PagedAttention의 FA 경로에서 휴리스틱 기반 max_query_len을 실제 계산값으로 대체하여 성능 향상 및 CUDA 오류를 해결했습니다.#ONNXRuntime#CUDA#FlashAttention#Optimization#LLM2026년 5월 12일댓글 수 로딩 중
[vllm] vLLM의 MLA 성능 극대화: RoPE, KV Cache, q_concat 연산 퓨전 최적화vLLM에서 MLA 모델의 RoPE, KV Cache, q_concat 연산을 하나의 커널로 통합하여 추론 성능을 크게 향상시킨 최적화 기법을 분석합니다.#vLLM#LLM#CUDA#Optimization#MLA#DeepSeek-R12026년 5월 11일댓글 수 로딩 중
[sglang] SGLang의 Breakable CUDA Graph 최적화: 배치 사이즈 제한 극복하기SGLang에서 CUDA Graph의 배치 사이즈 제약을 해결하고, 유연한 추론을 가능하게 하는 아키텍처 개선 분석.#SGLang#CUDA Graph#LLM#Inference Optimization#PyTorch2026년 5월 11일댓글 수 로딩 중
[flashinfer] FlashInfer, 동적 토큰 페이지 커널 도입으로 TRTLLM-GEN GQA 성능 최적화FlashInfer가 TRTLLM-GEN GQA 커널에 동적 토큰 페이지 기능을 도입하여 LLM 추론 성능을 향상시켰습니다.#FlashInfer#LLM#최적화#GQA#TRTLLM-GEN#성능2026년 5월 11일댓글 수 로딩 중
[논문리뷰] MatryoshkaLoRA: Learning Accurate Hierarchical Low-Rank Representations for LLM Fine-Tuning본 논문은 기존 LoRA 방식이 고정된 rank $R$에 의존하여 최적의 성능을 찾기 위해 반복적인 grid search가 필요하다는 점을 해결하고자 합니다.#Review#LoRA#Parameter-Efficient Fine-Tuning#Rank-Adaptive#Matryoshka Representation Learning#LLM#Hierarchical Low-Rank2026년 5월 10일댓글 수 로딩 중
[flashinfer] FlashInfer의 Per-token NVFP4 Quantization 커널 최적화 분석FlashInfer의 NVFP4 양자화 커널 성능 개선: 블록 사이즈 최적화 및 Fast Math 제어 옵션 도입#FlashInfer#CUDA#Quantization#LLM#Performance2026년 5월 8일댓글 수 로딩 중
[flashinfer] FlashInfer, FP8 지원으로 장문 컨텍스트 추론 성능을 극적으로 향상시키다FlashInfer의 concat_mla_k 함수에 FP8 지원을 추가하여 장문 컨텍스트 추론 성능을 크게 개선했습니다.#FlashInfer#FP8#LLM#최적화#성능 향상#딥러닝2026년 5월 7일댓글 수 로딩 중
[sglang] DeepSeek-V4를 위한 MXFP4 Marlin MoE 커널 최적화 및 JIT 통합 분석DeepSeek-V4의 MXFP4 양자화 추론을 위해 Marlin MoE 커널을 JIT 경로로 포팅하고 성능을 최적화한 과정을 분석합니다.#LLM#Quantization#CUDA#DeepSeek-V4#SGLang#Marlin2026년 5월 7일댓글 수 로딩 중
[sglang] SGLang의 Unified Radix Cache를 위한 SWA HiCache 지원 최적화SGLang에서 SWA(Sliding Window Attention)를 HiCache와 통합하여 메모리 효율성과 추론 성능을 크게 향상시킨 변경사항 분석#SGLang#LLM#KV-Cache#Optimization#HiCache2026년 5월 6일댓글 수 로딩 중
[flashinfer] FlashInfer, CUDA 그래프 호환성을 높이고 성능을 최적화하다: TRT-LLM FMHA v2 통합 및 불필요한 H2D 제거FlashInfer가 TRT-LLM FMHA v2를 통합하고 CUDA 그래프 호환성을 개선하여 성능을 최적화한 PR을 분석합니다.#FlashInfer#TRT-LLM#CUDA#최적화#성능#LLM2026년 5월 6일댓글 수 로딩 중
[flashinfer] FlashInfer: Wide Vector 최적화와 1900줄의 코드 삭제로 달성한 성능 개선gdn_wide_vec_kernel 도입과 불필요한 레거시 커널 제거를 통해 B200에서 최대 82%의 DRAM 대역폭 효율을 달성한 사례를 분석합니다.#CUDA#PyTorch#FlashInfer#Performance-Optimization#LLM2026년 5월 6일댓글 수 로딩 중
[논문리뷰] SymptomAI: Towards a Conversational AI Agent for Everyday Symptom Assessment본 연구는 실제 일상생활 속에서 사용자가 호소하는 증상을 기반으로 하는 대화형 AI 진단 에이전트의 성능을 임상적 수준에서 검증하고자 한다.#Review#Conversational AI#Differential Diagnosis (DDx)#LLM#Fitbit#Wearable Biosignals#PheWAS#Healthcare AI2026년 5월 5일댓글 수 로딩 중
[논문리뷰] Reinforcement Learning for LLM-based Multi-Agent Systems through Orchestration Traces본 논문은 LLM 기반의 에이전트가 개별적인 도구 사용을 넘어 조율된 팀 단위로 진화함에 따라, 기존의 단일 에이전트 RL이나 고전적 MARL 방법론이 갖는 한계를 지적한다.#Review#LLM#Multi-Agent Systems#Reinforcement Learning#Orchestration Trace#Credit Assignment#Reward Design#System Engineering2026년 5월 5일댓글 수 로딩 중
[sglang] SGLang UnifiedRadixTree에 HiCache 프레임워크 도입: 하이브리드 모델 성능 최적화UnifiedRadixTree에 HiCache를 통합하여 Hybrid Linear 및 DeepSeek 모델의 캐시 효율성과 안정성을 대폭 개선했습니다.#SGLang#LLM#Caching#Performance#RadixTree2026년 5월 3일댓글 수 로딩 중
[LlamaFactory] LlamaFactory: Qwen-VL 비디오 토큰 전처리 최적화로 450배 성능 향상 달성비디오 디코딩 없이 메타데이터만으로 토큰 확장을 수행하여 Qwen-VL 전처리 속도를 450배 이상 개선한 사례를 분석합니다.#LlamaFactory#Qwen-VL#Optimization#Performance#LLM2026년 5월 3일댓글 수 로딩 중
[sglang] SGLang NPU 성능 최적화: INT8 TP 통신 압축 도입NPU 환경에서 Qwen3 모델의 TP 통신을 INT8로 압축하여 프리필 성능을 약 5% 향상시킨 최적화 기법을 분석합니다.#SGLang#NPU#LLM#Optimization#Quantization2026년 5월 2일댓글 수 로딩 중
[vllm] vLLM의 첫 추론 지연 문제 해결: forward_native 샘플러 커널 웜업 최적화vLLM v1 엔진에서 FlashInfer 도입으로 발생한 JIT 컴파일 지연 문제를 샘플러 웜업 로직 개선으로 해결한 사례를 분석합니다.#vLLM#LLM#Triton#Performance#JIT2026년 5월 1일댓글 수 로딩 중
[sglang] SGLang P/D Disaggregation: Decode-Side Radix Cache 도입으로 LLM 추론 성능 극대화SGLang의 P/D Disaggregation에서 Decode-Side Radix Cache를 도입하여 LLM 추론 시 KV Cache 재사용률을 높이고 성능을 획기적으로 개선한 PR 분석#LLM#SGLang#Inference Optimization#KV Cache#Disaggregation#Performance2026년 5월 1일댓글 수 로딩 중
[vllm] vLLM, DCP A2A 어텐션 백엔드 최적화: 단일 All-to-All 콜렉티브로 성능 향상vLLM의 DCP A2A 어텐션 백엔드가 부분 어텐션 출력과 LSE를 단일 콜렉티브로 묶어 성능을 개선했습니다.#vLLM#AI#딥러닝#최적화#LLM#어텐션#DCP#All-to-All2026년 5월 1일댓글 수 로딩 중
[vllm] vLLM의 분산 추론 성능 극대화: 양방향 KV 캐시 전송을 통한 Prefill 최적화Prefill 노드와 Decode 노드 간의 양방향 KV 캐시 전송을 통해 중복 계산을 제거하고 멀티턴 대화 성능을 2배 이상 향상시킵니다.#vLLM#LLM#DistributedInference#KVCache#PerformanceOptimization2026년 4월 30일댓글 수 로딩 중
[sglang] SGLang, FP4 KV 캐시 도입으로 LLM 추론 성능 극대화: NVFP4 최적화 분석SGLang의 FP4 KV 캐시 도입으로 LLM 추론 성능을 혁신적으로 개선하는 NVFP4 최적화를 분석합니다.#LLM#KV Cache#Quantization#Optimization#SGLang#FP4#NVFP42026년 4월 29일댓글 수 로딩 중
[sglang] SGLang 성능 최적화: torch.cuda.empty_cache() 호출 제어를 통한 가중치 업데이트 병목 해결가중치 업데이트 시 발생하는 불필요한 GPU 캐시 동기화 오버헤드를 제거하여 추론 지연 시간을 개선했습니다.#SGLang#PyTorch#CUDA#Optimization#LLM2026년 4월 25일댓글 수 로딩 중
[sglang] AMD ROCm 환경에서의 성능 최적화: Triton을 활용한 Fused QK GemmaRMSNorm 구현ROCm 플랫폼에서 4개의 개별 커널을 하나의 Triton 커널로 통합하여 QK 정규화 성능을 개선한 사례를 분석합니다.#SGLang#Triton#ROCm#Performance Optimization#LLM2026년 4월 25일댓글 수 로딩 중
[flashinfer] FlashInfer 오토튜너 최적화: 하이브리드 토큰 버킷 도입기존 2의 거듭제곱 방식의 토큰 버킷을 하이브리드 방식으로 개선하여 MoE 및 GEMM 커널의 튜닝 정확도와 성능을 향상시켰습니다.#FlashInfer#LLM#Autotuning#Optimization#MoE2026년 4월 24일댓글 수 로딩 중
[flashinfer] FlashInfer, CuTe DSL 기반 FMHA 커널 통합으로 사전 생성(Prefill) 성능 극대화FlashInfer가 CuTe DSL FMHA 커널을 통합하여 사전 생성(Prefill) 성능을 최적화했습니다.#FlashInfer#CuTe DSL#FMHA#Prefill#최적화#성능 개선#딥러닝#LLM2026년 4월 24일댓글 수 로딩 중
[vllm] vLLM에 고성능 JIT 양자화 커널 'Humming' 도입하기vLLM에 유연한 JIT 양자화 커널 라이브러리인 Humming을 통합하여 다양한 양자화 타입 지원 및 추론 성능을 최적화하는 방법을 소개합니다.#vLLM#Quantization#Humming#LLM#Inference#Optimization2026년 4월 24일댓글 수 로딩 중
[sglang] SGLang Triton 커널 최적화: libdevice.tanh 도입과 2D Strided Tensor 지원Triton 커널에서 수치적 불안정성을 해결하기 위해 libdevice.tanh를 도입하고, 2D Strided Tensor를 지원하도록 구조를 개선한 사례를 분석합니다.#Triton#CUDA#LLM#SGLang#Optimization#DeepLearning2026년 4월 22일댓글 수 로딩 중
[논문리뷰] Evaluation-driven Scaling for Scientific Discovery본 논문은 과학적 발견 과정에서 LLM을 활용한 Trial-and-error 루프의 확장성(Scaling) 문제를 공식화하고 이를 체계적으로 해결하고자 합니다.#Review#Test-Time Scaling#Scientific Discovery#Evaluation-driven Discovery#LLM#Optimization#Symbolic Laws#GPU Kernel2026년 4월 21일댓글 수 로딩 중
[ollama] Ollama MLX Sampler 최적화: 성능 향상과 Logprobs 지원Ollama의 MLX 러너에서 샘플링 로직을 개선하여 성능을 약 1.5% 향상하고 Logprobs 기능을 통합했습니다.#Ollama#MLX#LLM#Performance#Golang2026년 4월 21일댓글 수 로딩 중
[논문리뷰] Model Capability Dominates: Inference-Time Optimization Lessons from AIMO 3본 논문은 LLM의 수학적 추론 능력을 향상시키기 위한 Inference-Time Optimization 기법들이 실질적인 효과가 있는지 검증하고자 합니다.#Review#LLM#Mathematical Reasoning#Inference-Time Optimization#Majority Voting#Self-Consistency#Diverse Prompting2026년 4월 16일댓글 수 로딩 중
[논문리뷰] KV Packet: Recomputation-Free Context-Independent KV Caching for LLMs본 논문은 RAG(Retrieval-Augmented Generation) 환경에서 빈번하게 발생하는 KV cache의 컨텍스트 의존성 및 그로 인한 추론 지연 문제를 해결하는 것을 목표로 합니다.#Review#LLM#KV Cache#RAG#Recomputation-Free#Soft-token Adapter#Self-Supervised Distillation#Attention Dynamics2026년 4월 16일댓글 수 로딩 중
[논문리뷰] Cross-Tokenizer LLM Distillation through a Byte-Level Interface본 논문은 LLM의 핵심적인 제약 사항인 Tokenizer 불일치 문제를 해결하기 위한 범용적인 Cross-Tokenizer Distillation (CTD) 기법을 제안합니다.#Review#Cross-Tokenizer Distillation#Byte-Level Interface#Knowledge Distillation#LLM#Vocabulary Mismatch2026년 4월 16일댓글 수 로딩 중
[vllm] vLLM TurboQuant: KV 캐시 압축으로 LLM 서빙 효율 극대화vLLM의 TurboQuant는 KV 캐시를 압축하여 메모리 사용량을 줄이고 LLM 서빙 효율을 높입니다.#vLLM#LLM#KV Cache#Quantization#Optimization#Triton#GPU Memory2026년 4월 15일댓글 수 로딩 중
[vllm] vLLM, Qwen3-VL 비디오 추론을 위한 CUDA Graph 최적화: 성능 향상의 비결vLLM이 Qwen3-VL 모델의 비디오 추론 성능을 CUDA Graph를 통해 획기적으로 개선한 방법을 분석합니다.#vLLM#CUDA Graph#Qwen3-VL#최적화#성능 향상#LLM2026년 4월 14일댓글 수 로딩 중
[sglang] Whisper 모델 추론 성능 극대화: 동시 Prefill 요청을 위한 배치 인코더 최적화Whisper 모델의 동시 Prefill 요청 처리 시 인코더 순차 호출 문제를 해결하여 추론 성능을 크게 향상시킨 PR 분석.#AI#Machine Learning#LLM#Whisper#Optimization#Performance#Inference2026년 4월 12일댓글 수 로딩 중
[sglang] SGLang에서 GLM-5 모델 성능 최적화: Aiter 백엔드 활용 및 텐서 패딩 전략GLM-5 모델의 AMD GPU 성능을 극대화하기 위한 Aiter 백엔드 텐서 패딩 및 커널 파라미터 최적화 분석.#SGLang#LLM#AMD#ROCm#PerformanceOptimization2026년 4월 12일댓글 수 로딩 중
[sglang] SGLang의 AMD AITER AllReduce 최적화: 하드코딩된 제약 제거 및 성능 개선AITER AllReduce+RMSNorm 융합 커널의 하드코딩된 hidden_dim 허용 목록을 제거하고 경계 조건을 최적화하여 범용성과 성능을 개선했습니다.#SGLang#AMD#ROCm#AllReduce#Optimization#LLM2026년 4월 12일댓글 수 로딩 중
[sglang] SGLang의 성능 향상을 위한 기본 Quantization 커널 최적화: v2 도입SGLang에서 고부하 워크로드 처리를 위해 더 빠른 per-token group quantization v2 커널을 기본값으로 설정한 변경사항을 분석합니다.#SGLang#LLM#Quantization#CUDA#KernelOptimization2026년 4월 11일댓글 수 로딩 중
[sglang] SGLang의 AMD GPU 최적화: RMSNorm과 FP8 Per-token Quantization 커널 융합RMSNorm과 FP8 per-token quantization을 단일 커널로 융합하여 메모리 접근을 최적화하고 GLM-4.7-FP8 모델의 추론 성능을 개선했습니다.#SGLang#AMD#ROCm#FP8#KernelFusion#LLM2026년 4월 11일댓글 수 로딩 중
[vllm] vLLM ROCm Aiter 백엔드 성능 최적화: 불필요한 제로 필링 제거vLLM ROCm Aiter 백엔드에서 불필요한 GPU 커널 실행을 제거하여 디코드 성능을 개선합니다.#vLLM#ROCm#Aiter#Performance Optimization#GPU Computing#LLM2026년 4월 10일댓글 수 로딩 중
[sglang] sglang, GLM-5.1-FP8 모델 성능 및 정확도 벤치마크 추가: AMD GPU 환경에서의 최적화 분석sglang 레포지토리에서 GLM-5.1-FP8 모델의 AMD GPU 환경에서의 성능 및 정확도 벤치마크 추가 PR을 분석합니다.#sglang#LLM#AMD GPU#벤치마크#최적화#CI/CD2026년 4월 9일댓글 수 로딩 중
[논문리뷰] DeonticBench: A Benchmark for Reasoning over Rules본 논문은 LLM이 자연어로 된 법령과 사실 관계를 Prolog 코드로 변환하여 심볼릭 솔버를 통해 해답을 도출하는 '솔버 지원 워크플로우'를 핵심 방법론으로 제안합니다. 평가를 위해 미국 연방 세금, 항공사 수하물 정책, 이민 행정, 주택법 등 4개 영역 6,232개의 태스크로 구성된 DEONTICBENCH를 구축하였습니다.#Review#Deontic Reasoning#LLM#Symbolic Computation#Prolog#Benchmark#High-stakes#Rule-based Reasoning2026년 4월 8일댓글 수 로딩 중
[sglang] SGLang AMD 환경에서의 GLM-5-FP8 성능 벤치마크 도입 및 최적화AMD MI30x/MI35x 환경에서 GLM-5-FP8 모델의 성능을 검증하기 위한 나이트리 벤치마크 파이프라인 구축 및 설정 최적화.#SGLang#AMD#ROCm#FP8#LLM#CI/CD2026년 4월 8일댓글 수 로딩 중
[논문리뷰] ACES: Who Tests the Tests? Leave-One-Out AUC Consistency for Code Generation본 논문은 테스트들 간의 leave-one-out evaluation을 통해 circular dependency를 분리하는 ACES를 제안한다. 핵심 이론인 LOO-AUC Identity는 관측 가능한 LOO-AUC가 잠재적인 discriminative power와 비례함을 증명한다 [Theorem 3].#Review#Code Generation#LLM#Test Reranking#AUC#Discriminative Power#Leave-One-Out#Test Weighting2026년 4월 7일댓글 수 로딩 중
[논문리뷰] TriAttention: Efficient Long Reasoning with Trigonometric KV Compression본 논문은 기존 KV Cache 압축 기법들이 post-RoPE 공간의 제한된 관측치에 의존하여 발생하는 불안정성 문제를 해결하고자 합니다. 기존 방식들은 회전이 적용된 post-RoPE 쿼리를 사용하므로, 대표성 있는 쿼리 확보가 어려워 중요한 토큰이 조기에 삭제되는 현상이 빈번합니다 .#Review#KV Cache#LLM#Attention#RoPE#Compression#Reasoning2026년 4월 6일댓글 수 로딩 중
[sglang] SGLang Ngram 추측 디코딩: 외부 코퍼스 기반 Suffix Automaton 통합으로 성능 최적화SGLang의 Ngram 추측 디코딩에 외부 코퍼스 기반 Suffix Automaton을 도입하여 성능을 개선합니다.#SGLang#Ngram#Speculative Decoding#Suffix Automaton#성능 최적화#LLM#Python#C++2026년 4월 6일댓글 수 로딩 중
[sglang] SGLang에서 DeepSeek V3.2를 위한 IndexCache 최적화 구현DeepSeek V3.2 모델의 IndexCache 도입을 통해 추론 성능을 약 6.4% 향상시킨 기술적 분석과 구현 상세.#SGLang#DeepSeek#LLM#Optimization#Inference2026년 4월 5일댓글 수 로딩 중
[sglang] SGLang에서 FA4(FlashAttention 4)와 Speculative Decoding의 완벽한 결합FA4를 Speculative Decoding 파이프라인에 통합하여 저지연 추론 성능을 극대화하는 최적화 기법을 분석합니다.#SGLang#FlashAttention4#SpeculativeDecoding#LLM#Optimization2026년 4월 4일댓글 수 로딩 중
[논문리뷰] Friends and Grandmothers in Silico: Localizing Entity Cells in Language Models본 논문은 templated prompts를 사용하여 특정 개체에 반응하는 뉴런을 추출하고, 이를 인과적 개입(Causal Intervention)을 통해 검증하는 파이프라인을 제안합니다. 먼저, 여러 프롬프트에서 안정적으로 활성화되는 뉴런을 순위화하여 Entity Cells를 식별합니다.#Review#Mechanistic Interpretability#LLM#Entity Cells#Factual Recall#Causal Intervention#MLP Neurons#Canonicalization2026년 4월 2일댓글 수 로딩 중
[논문리뷰] Executing as You Generate: Hiding Execution Latency in LLM Code Generation본 연구는 기존 LLM 코드 생성 및 실행 파이프라인에서 발생하는 불필요한 대기 시간을 제거하는 것을 핵심 목표로 합니다.#Review#Parallel Execution#LLM#Code Generation#Latency#AST-based Chunking#Dynamic Batching#Error Interruption2026년 4월 2일댓글 수 로딩 중
[논문리뷰] Brainstacks: Cross-Domain Cognitive Capabilities via Frozen MoE-LoRA Stacks for Continual LLM Learning본 논문은 기존 모놀리식 LLM 파인튜닝의 경직성을 해결하기 위해 모듈식 Continual Learning 아키텍처인 Brainstacks 를 제안한다.#Review#Continual Learning#LLM#MoE-LoRA#Null-Space Projection#Meta-Router#Residual Boosting2026년 4월 2일댓글 수 로딩 중
[sglang] SGLang의 디코드 성능 향상을 위한 Temperature 및 Softmax 커널 융합Triton 커널을 활용해 Temperature Scaling과 Softmax를 하나로 융합하여 메모리 접근을 최적화하고 디코드 지연 시간을 최대 4배 이상 단축했습니다.#SGLang#Triton#CUDA#LLM#Optimization2026년 4월 2일댓글 수 로딩 중
[sglang] SGLang: ROCm 환경에서 Qwen3-VL 디코딩 성능 극대화를 위한 커널 퓨전 최적화4개의 개별 커널 호출을 단일 HIP 커널로 통합하여 Qwen3-VL 모델의 디코딩 지연 시간을 획기적으로 개선한 최적화 사례 분석.#SGLang#ROCm#Kernel Fusion#LLM#Performance Optimization2026년 4월 1일댓글 수 로딩 중
[논문리뷰] daVinci-LLM:Towards the Science of Pretraining현재 LLM 생태계는 상업적 모델의 폐쇄성과 학계 모델의 컴퓨팅 자원 부족이라는 구조적 역설(Structural Paradox)에 직면해 있습니다.#Review#Pretraining#Data Darwinism#LLM#Transparency#Data Processing#Scaling Laws#Reasoning2026년 3월 31일댓글 수 로딩 중
[sglang] Mamba 호스트 캐시 메커니즘 최적화: 성능 향상과 메모리 관리 개선Mamba 모델의 호스트 캐시 메커니즘을 최적화하여 메모리 사용량을 줄이고 추론 속도를 향상시키는 PR 분석#Mamba#Cache Optimization#Performance Tuning#LLM#sglang2026년 3월 31일댓글 수 로딩 중
[논문리뷰] PRBench: End-to-end Paper Reproduction in Physics Research최근 LLM 기반 에이전트가 과학적 추론 및 코드 생성 분야에서 발전하고 있으나, 실제 과학 논문의 복잡한 계산 과정을 처음부터 끝까지 신뢰성 있게 재현할 수 있는지에 대해서는 검증되지 않았습니다.#Review#Scientific Reproduction#Agentified Assessment#Physics Benchmark#LLM#Sandboxed Execution2026년 3월 30일댓글 수 로딩 중
[Ray] LLM 추론 벤치마크 엔진에 동시성 모드와 일정 QPS 모드 추가다중 턴 LLM 벤치마크를 위한 Concurrency 모드(closed-loop)와 Rate 모드(constant-QPS)를 도입하고, 정확한 토큰 수 텍스트 생성기와 엔트로피 기반 웜업을 구현한 분석.#Ray#Python#LLM#Benchmark#Performance#Concurrency2026년 3월 30일댓글 수 로딩 중
[sglang] SGLang Whisper 모델의 CUDA Graph 도입 및 성능 최적화 분석Whisper 모델에 CUDA Graph를 도입하여 처리량을 36% 향상시킨 SGLang의 최적화 기법과 구현 상세를 분석합니다.#SGLang#Whisper#CUDA Graph#Performance Optimization#LLM2026년 3월 28일댓글 수 로딩 중
[sglang] SGLang의 FA3 디코드 최적화: get_scheduler_metadata 도입FlashAttention-3의 타일 스케줄링 메타데이터를 사전 계산하여 레이어별 오버헤드를 제거하는 최적화 기법을 분석합니다.#SGLang#FlashAttention#CUDA#Optimization#LLM2026년 3월 25일댓글 수 로딩 중
[sglang] HiSparse 도입: Sparse Attention 모델을 위한 효율적인 KV 캐시 관리HiSparse는 CPU 메모리를 활용해 유휴 KV 캐시를 저장함으로써, DeepSeek-V3와 같은 Sparse Attention 모델의 배치 사이즈와 처리량을 극대화합니다.#SGLang#LLM#KV Cache#Sparse Attention#CUDA2026년 3월 23일댓글 수 로딩 중
[논문리뷰] F2LLM-v2: Inclusive, Performant, and Efficient Embeddings for a Multilingual World최근 Encoder-based 아키텍처에서 Decoder-based LLM embeddings로의 전환은 성능 향상을 가져왔지만, 현재 연구는 두 가지 주요 한계를 가지고 있습니다.#Review#Multilingual Embedding#LLM#Matryoshka Representation Learning#Knowledge Distillation#Model Pruning#MTEB Benchmark#Low-resource Languages#Open-source2026년 3월 19일댓글 수 로딩 중
[ACE-Step-1.5] 외부 의존성을 걷어내고 성능을 잡다: ACE-Step 1.5의 커스텀 vLLM 엔진 도입기nano-vllm 의존성을 제거하고, CFG 버그 수정 및 Jetson 최적화를 포함한 자체 추론 엔진 구축 사례를 분석합니다.#LLM#vLLM#Inference#Optimization#Python#PyTorch2026년 3월 18일댓글 수 로딩 중
[논문리뷰] GradMem: Learning to Write Context into Memory with Test-Time Gradient Descent최근 Large Language Model(LLM) 애플리케이션들은 방대한 외부 컨텍스트에 의존하며, 이는 KV-cache 와 같은 방식으로 처리될 경우 상당한 메모리 오버헤드를 발생시킵니다.#Review#GradMem#Test-Time Optimization#Context Removal#Compressive Memory#Meta-learning#Gradient Descent#LLM#KV-retrieval2026년 3월 17일댓글 수 로딩 중
[Axolotl] MXFP4 양자화 지원 추가torchao의 MXFakeQuantizeConfig를 활용한 MXFP4 QAT 지원 구현 분석#Axolotl#Quantization#MXFP4#QAT#LLM2026년 3월 5일댓글 수 로딩 중
[논문리뷰] CharacterFlywheel: Scaling Iterative Improvement of Engaging and Steerable LLMs in Production본 논문은 Instagram, WhatsApp, Messenger와 같은 프로덕션 환경의 소셜 챗 애플리케이션에서 LLM 의 사용자 참여도와 조종성(steerability)을 반복적으로 개선하는 CharacterFlywheel 이라는 이터레이션 프로세스를 제시합니다.#Review#LLM#Social Chat#Engagement Optimization#Steerability#Reinforcement Learning#Reward Modeling#A/B Testing#Iterative Development2026년 3월 2일댓글 수 로딩 중
[논문리뷰] Vectorizing the Trie: Efficient Constrained Decoding for LLM-based Generative Retrieval on AcceleratorsLLM 기반 생성형 검색(Generative Retrieval)은 추천 시스템의 강력한 패러다임이지만, 산업 환경에서 요구되는 출력 공간 제약(constrained output space) 을 기본 자기회귀 디코딩(autoregressive decoding) 이 지원하지 못하는 문제가 있습니다.#Review#Generative Retrieval#Constrained Decoding#Trie#Sparse Matrix#TPU#GPU#Recommendation Systems#LLM2026년 3월 1일댓글 수 로딩 중
[논문리뷰] veScale-FSDP: Flexible and High-Performance FSDP at Scale본 논문은 기존 FSDP(Fully Sharded Data Parallel) 시스템이 블록-wise 양자화 훈련 이나 Shampoo, Muon 과 같은 비-요소별(non-element-wise) 옵티마이저 를 사용하는 구조 인식 훈련(structure-aware training) 에서 겪는 한계를 해결하고자 합니다.#Review#FSDP#Distributed Training#LLM#GPU Scaling#Memory Optimization#Performance Optimization#Structure-Aware Training#RaggedShard2026년 2월 26일댓글 수 로딩 중
[논문리뷰] ARLArena: A Unified Framework for Stable Agentic Reinforcement Learning에이전트 강화 학습(ARL)의 심각한 훈련 불안정성 문제, 특히 훈련 붕괴 현상을 해결하는 것이 목표입니다. 이 불안정성은 대규모 환경 및 장기 상호작용에서 ARL의 확장성을 제한하며, 체계적인 알고리즘 설계 탐색을 어렵게 만듭니다.#Review#Agentic Reinforcement Learning#LLM#Policy Optimization#Training Stability#Importance Sampling Clipping#Advantage Design#Dynamic Filtering#ARLArena#SAMPO2026년 2월 25일댓글 수 로딩 중
[논문리뷰] On Data Engineering for Scaling LLM Terminal Capabilities본 논문은 최신 터미널 에이전트의 훈련 데이터 전략에 대한 정보 부족을 해결하고자 합니다. LLM의 터미널 역량 확장을 위한 데이터 엔지니어링 실천법을 체계적으로 연구하고, 효율적이고 확장 가능한 데이터 생성 프레임워크를 통해 효과적인 터미널 에이전트를 훈련하는 것을 목표로 합니다.#Review#LLM#Terminal Agents#Data Engineering#Synthetic Data Generation#Supervised Fine-tuning (SFT)#Terminal-Bench#Nemotron-Terminal#Dataset Adapters2026년 2월 24일댓글 수 로딩 중
[논문리뷰] K-Search: LLM Kernel Generation via Co-Evolving Intrinsic World ModelGPU 커널 최적화의 복잡성으로 인해 기존 LLM 기반의 진화론적 접근 방식이 다단계 구조 변환 및 일시적인 구현 결함에 취약하다는 문제를 해결하는 것이 목표입니다.#Review#LLM#GPU Kernel Optimization#Code Generation#World Model#Evolutionary Search#Program Synthesis#High-Performance Computing2026년 2월 23일댓글 수 로딩 중
[논문리뷰] Intelligent AI Delegation본 논문은 기존 AI 태스크 분해 및 위임 방식의 한계(단순한 휴리스틱, 환경 변화에 대한 취약성)를 극복하고자 합니다.#Review#AI Delegation#Multi-agent Systems#Task Decomposition#Agentic AI#Trust & Safety#LLM#Adaptive Coordination2026년 2월 15일댓글 수 로딩 중
[논문리뷰] Sci-CoE: Co-evolving Scientific Reasoning LLMs via Geometric Consensus with Sparse Supervision과학적 추론 태스크에서 대규모 언어 모델(LLM)의 취약한 성능을 개선하는 것을 목표로 합니다. 특히, 신뢰할 수 없는 솔루션 평가와 검증 전략의 다양성 부족 문제, 그리고 제한된 감독 환경에서의 자가 진화 프레임워크 개발이라는 과제를 해결하고자 합니다.#Review#LLM#Scientific Reasoning#Co-evolution#Reinforcement Learning#Sparse Supervision#Geometric Consensus#Self-Play#Verifier2026년 2월 12일댓글 수 로딩 중
[논문리뷰] ROCKET: Rapid Optimization via Calibration-guided Knapsack Enhanced Truncation for Efficient Model CompressionROCKET 논문은 대규모 언어 모델(LLMs)의 과도한 크기로 인한 연산 및 메모리 요구 사항을 해결하기 위해 빠르고 훈련 없는(training-free) 모델 압축 방법을 개발하는 것을 목표로 합니다.#Review#Model Compression#LLM#Training-Free#Knapsack Problem#Sparse Matrix Factorization#Dictionary Learning#Post-Training Optimization#Weight Sparsification2026년 2월 11일댓글 수 로딩 중
[Ray Data/LLM] 폐기된 TRANSFORMERS_CACHE를 HF_HUB_CACHE로 교체하고 AutoConfig 실패를 비치명적으로 처리transformers 5.0+ 호환성을 위해 TRANSFORMERS_CACHE를 HF_HUB_CACHE로 교체하고, HuggingFace 설정 로드 실패 시 텔레메트리 fallback을 적용한 분석.#Ray#Python#Compatibility#HuggingFace#LLM2026년 2월 11일댓글 수 로딩 중
[논문리뷰] Agent Banana: High-Fidelity Image Editing with Agentic Thinking and Tooling본 논문은 기존 이미지 편집 모델의 한계를 극복하고, 전문적인 워크플로우를 지원하는 고품질, 네이티브 해상도 이미지 편집 시스템을 개발하는 것을 목표로 합니다.#Review#Image Editing#Agentic AI#Multi-turn Interaction#High-Fidelity#Native Resolution#LLM#Context Folding#Layer Decomposition2026년 2월 10일댓글 수 로딩 중
[논문리뷰] F-GRPO: Don't Let Your Policy Learn the Obvious and Forget the RareRLVR (Reinforcement Learning with Verifiable Rewards)에서 그룹 샘플링 기반의 정책 업데이트가 흔한 해결책으로 편향되어 희귀하지만 올바른 해결책을 간과하는 '정책 샤프닝(policy sharpening)' 문제를 해결하는 것이 목표입니다.#Review#Reinforcement Learning#LLM#Policy Optimization#Reward Models#Diversity Preservation#Focal Loss#Group Sampling#Mathematical Reasoning2026년 2월 8일댓글 수 로딩 중
[논문리뷰] Semantic Routing: Exploring Multi-Layer LLM Feature Weighting for Diffusion Transformers본 논문은 LLM을 텍스트 인코더로 사용하는 DiT 기반 텍스트-이미지 모델에서, 정적인 텍스트 컨디셔닝이 LLM의 의미론적 계층 구조와 DiT의 동적인 denoising 과정을 충분히 활용하지 못하는 문제를 해결하고자 합니다.#Review#Diffusion Models#LLM#Text-to-Image#Transformer#Semantic Routing#Feature Fusion#Dynamic Conditioning#Generative AI2026년 2월 4일댓글 수 로딩 중
[논문리뷰] Rethinking the Trust Region in LLM Reinforcement LearningLarge Language Models (LLMs)의 강화학습 미세 조정 시, 기존 Proximal Policy Optimization (PPO) 의 비율 클리핑 메커니즘이 대규모 어휘 공간에 부적합하여 발생하는 훈련 비효율성과 불안정성을 해결하는 것을 목표로 합니다.#Review#LLM#Reinforcement Learning#Trust Region#PPO#DPPO#Policy Optimization#Training Stability#Divergence Approximation2026년 2월 4일댓글 수 로딩 중
[논문리뷰] SWE-World: Building Software Engineering Agents in Docker-Free Environments소프트웨어 엔지니어링(SWE) 에이전트의 훈련 및 평가가 의존하는 Docker 기반 물리적 실행 환경 의 높은 자원 소모와 확장성 한계를 해결하는 것이 목표입니다.#Review#Software Engineering Agents#LLM#Docker-Free#Execution Simulation#Reinforcement Learning#Supervised Fine-tuning#World Model2026년 2월 3일댓글 수 로딩 중
[논문리뷰] SWE-Master: Unleashing the Potential of Software Engineering Agents via Post-Training이 논문은 기존 LLM 기반 소프트웨어 엔지니어링 에이전트의 불투명성과 재현성 부족, 그리고 복잡한 장기 SWE 태스크 해결 능력의 한계를 해결하고자 합니다.#Review#Software Engineering Agents#Post-Training#Supervised Fine-Tuning#Reinforcement Learning#Language Server Protocol#SWE-bench#Code Navigation#LLM2026년 2월 3일댓글 수 로딩 중
[논문리뷰] SPARKLING: Balancing Signal Preservation and Symmetry Breaking for Width-Progressive Learning본 논문은 대규모 언어 모델(LLM)의 사전 훈련 비용을 절감하기 위한 점진적 학습(Progressive Learning, PL)의 핵심 과제인 중간 단계 너비 확장(mid-stage width expansion) 의 불안정성을 해결하는 것을 목표로 합니다.#Review#Progressive Learning#Width Expansion#Signal Preservation#Symmetry Breaking#LLM#Training Stability#MoE#RMSNorm2026년 2월 2일댓글 수 로딩 중
[논문리뷰] Beyond Pixels: Visual Metaphor Transfer via Schema-Driven Agentic Reasoning본 논문은 기존 생성형 AI 모델이 픽셀 수준의 지침과 표면적 외관 유지에만 머물러 진정한 은유적 생성을 위한 추상적 논리를 포착하지 못하는 한계를 해결하고자 합니다.#Review#Visual Metaphor Transfer#Conceptual Blending Theory#Schema Grammar#Multi-Agent Framework#Generative AI#VLM#LLM#Creative AI2026년 2월 2일댓글 수 로딩 중
[논문리뷰] TAM-Eval: Evaluating LLMs for Automated Unit Test Maintenance본 논문은 기존의 단편적인 테스트 생성 또는 오라클 예측을 넘어, 실제 개발 워크플로우에 필수적인 단위 테스트 스위트의 생성, 수정 및 업데이트 등 전반적인 유지보수 과정에서 대규모 언어 모델(LLMs) 의 성능을 종합적으로 평가하는 새로운 벤치마크인 TAM-Eval 을 제시합니다.#Review#LLM#Unit Test Maintenance#Software Engineering#Code Generation#Test Repair#Test Updating#Benchmark#Mutation Testing#Code Coverage2026년 2월 1일댓글 수 로딩 중
[논문리뷰] World Craft: Agentic Framework to Create Visualizable Worlds via Text본 논문은 프로그래밍 기술이 없는 비전문가도 텍스트 설명을 통해 실행 및 시각화 가능한 AI Town 환경 을 쉽게 만들 수 있도록 하는 것을 목표로 합니다.#Review#Generative Agents#AI Town#LLM#Environment Creation#Multi-agent System#Spatial Reasoning#Text-to-World#Reverse Synthesis2026년 1월 27일댓글 수 로딩 중
[논문리뷰] FARE: Fast-Slow Agentic Robotic Exploration본 연구는 자율 로봇 탐사에서 기존 방법론이 장기 정보 활용 및 환경 변화 적응에 어려움을 겪는 문제를 해결하고자 합니다.#Review#Robotic Exploration#LLM#Reinforcement Learning#Fast-Slow Thinking#Hierarchical Planning#Agentic AI#Graph Reasoning2026년 1월 21일댓글 수 로딩 중
[논문리뷰] A Hybrid Protocol for Large-Scale Semantic Dataset Generation in Low-Resource Languages: The Turkish Semantic Relations Corpus본 논문은 저자원 언어 (특히 튀르키예어)에서 대규모 의미 관계 데이터셋을 효율적으로 생성하는 하이브리드 프로토콜 을 제시하고, 포괄적인 튀르키예어 의미 관계 코퍼스 를 구축하는 것을 목표로 합니다.#Review#Low-Resource NLP#Semantic Relations#Dataset Generation#Turkish Language#LLM#FastText Embeddings#Agglomerative Clustering#Synonyms#Antonyms#Co-hyponyms2026년 1월 20일댓글 수 로딩 중
[논문리뷰] Distilling Feedback into Memory-as-a-Tool본 논문은 LLM 의 추론 시 발생하는 높은 연산 비용과 반복적인 자기 수정 과정의 비효율성을 해결하고자 합니다. 특히, 기존 'System 2' 스케일링 방법론들이 매번 새로운 쿼리에 대해 처음부터 추론 과정을 반복하여 발생하는 지식 손실 과 계산 자원 낭비 문제를 극복하는 것을 목표로 합니다.#Review#LLM#Continual Learning#Memory-Augmented Agents#Self-Correction#Feedback Distillation#Tool Use#Inference Cost Amortization#Rubric-based Learning2026년 1월 11일댓글 수 로딩 중
[논문리뷰] The Illusion of Specialization: Unveiling the Domain-Invariant 'Standing Committee' in Mixture-of-Experts Models본 연구는 MoE(Mixture-of-Experts) 모델 이 희소 라우팅을 통해 도메인 특화(domain specialization)를 달성한다는 일반적인 가정에 의문을 제기합니다.#Review#Mixture-of-Experts (MoE)#Sparse Routing#Domain Specialization#Load Balancing#Interpretability#Standing Committee#LLM2026년 1월 8일댓글 수 로딩 중
[논문리뷰] RelayLLM: Efficient Reasoning via Collaborative Decoding본 논문은 복잡한 추론 작업에서 대규모 언어 모델(LLM) 의 높은 연산 비용과 지연 시간 문제를 해결하면서, 소규모 언어 모델(SLM) 의 제한된 추론 능력을 보완하는 효율적인 방법을 제안합니다.#Review#LLM#SLM#Collaborative Decoding#Token-level Intervention#Reinforcement Learning#GRPO#Efficient Reasoning#Resource Efficiency2026년 1월 8일댓글 수 로딩 중
[논문리뷰] Web World Models본 논문은 고정된 컨텍스트의 웹 프레임워크와 완전히 생성형 세계 모델(World Model) 사이의 간극을 메우는 Web World Model (WWM) 개념을 제안합니다. 언어 에이전트가 지속적으로 활동, 기억, 학습할 수 있는 제어 가능하면서도 무한히 확장 가능한 환경 을 구축하는 것이 주된 목표입니다.#Review#Web World Model#LLM#Neuro-symbolic AI#Procedural Generation#Hybrid Architecture#Deterministic Generation#Persistent Environments#TypeScript2025년 12월 29일댓글 수 로딩 중
[논문리뷰] Toxicity Ahead: Forecasting Conversational Derailment on GitHub본 연구는 오픈 소스 소프트웨어(OSS) 커뮤니티의 건강을 해치는 유해한 대화(toxic interactions)가 발생하기 전에 이를 사전 예방적으로 예측 하는 것을 목표로 합니다.#Review#Conversational AI#Toxicity Detection#LLM#Prompt Engineering#Open Source Software#GitHub#Derailment Forecasting2025년 12월 23일댓글 수 로딩 중
[논문리뷰] Name That Part: 3D Part Segmentation and Naming본 논문은 3D 객체를 의미론적으로 명명된 부분으로 분해하는 시맨틱 3D 파트 분할(semantic 3D part segmentation) 문제를 해결하는 것을 목표로 합니다.#Review#3D Semantic Segmentation#Part Naming#Open-Vocabulary#LLM#Set Alignment#Geometric Deep Learning#Annotation Engine#Affordance Description2025년 12월 22일댓글 수 로딩 중
[논문리뷰] Confucius Code Agent: An Open-sourced AI Software Engineer at Industrial Scale본 논문은 산업 규모의 저장소에서 작동할 수 있는 오픈소스 AI 소프트웨어 엔지니어인 Confucius Code Agent (CCA) 를 제시하여, 기존 오픈소스 에이전트의 확장성 및 장기 컨텍스트/메모리 한계를 극복하고, 독점 에이전트의 투명성, 확장성, 제어 가능성 부족 문제를 해결하는 것을 목표로 합니다.#Review#AI Agent#Software Engineering#Open-Source#LLM#Orchestrator#Context Management#Long-term Memory#Meta-agent2025년 12월 11일댓글 수 로딩 중
[Ray Data] LLM 배치 추론에서 개별 행 실패 시에도 작업을 계속하는 에러 핸들링 추가하나의 잘못된 프롬프트로 전체 배치가 중단되던 문제를 should_continue_on_error 옵션으로 해결하여, 실패 행은 에러 컬럼으로 표시하고 나머지는 정상 처리하는 기능 분석.#Ray#Python#LLM#Batch Inference#Error Handling2025년 12월 10일댓글 수 로딩 중
[논문리뷰] ThreadWeaver: Adaptive Threading for Efficient Parallel Reasoning in Language Models본 논문은 대규모 언어 모델(LLM)의 순차적 추론 과정에서 발생하는 높은 지연 시간 문제를 해결하고자 합니다.#Review#LLM#Parallel Reasoning#Inference Latency#Chain-of-Thought#Reinforcement Learning#Adaptive Threading#Mathematical Reasoning#Speedup2025년 12월 9일댓글 수 로딩 중
[논문리뷰] DeepCode: Open Agentic Coding대규모 언어 모델(LLM) 기반 코드 에이전트들이 정보 과부하 와 컨텍스트 병목 현상 으로 인해 과학 논문과 같은 복잡한 문서로부터 고품질의 코드베이스를 생성하는 데 어려움을 겪는 문제를 해결하는 것이 목표입니다.#Review#Agentic Coding#LLM#Code Generation#Repository Synthesis#Information Flow Management#Code Memory#CodeRAG#Automated Verification#Scientific Reproduction2025년 12월 9일댓글 수 로딩 중
[논문리뷰] Computer-Use Agents as Judges for Generative User Interface현재 인간 중심적으로 설계된 GUI 가 Computer-Use Agent (CUA)의 비효율적인 태스크 수행을 강제하는 문제를 해결하는 것이 목표입니다.#Review#Computer-Use Agents#Generative UI#AI-assisted Design#Human-Computer Interaction#LLM#AUI-Gym#Feedback Loop#Agent-centric Design2025년 11월 24일댓글 수 로딩 중
[논문리뷰] Rubric-Based Benchmarking and Reinforcement Learning for Advancing LLM Instruction Following본 논문은 복잡하고 다중 턴, 시스템 프롬프트 기반의 지시를 따르는 LLM의 능력을 향상시키는 것을 목표로 합니다. 특히, 이러한 고급 Instruction Following (IF) 기능을 평가하고 훈련하기 위한 고품질의 인간 주석 벤치마크와 신뢰할 수 있고 해석 가능한 보상 신호가 부족하다는 문제를 해결하고자 합니다.#Review#LLM#Instruction Following#Reinforcement Learning#Rubric-based Evaluation#Benchmarking#Reward Shaping#Rubric Verifier#AdvancedIF2025년 11월 13일댓글 수 로딩 중
[논문리뷰] MADD: Multi-Agent Drug Discovery Orchestra초기 신약 개발 과정에서 히트 분자(hit molecule) 식별 에 필요한 막대한 자원과 기존 AI 방법론의 복잡성 및 접근성 부족 문제를 해결하는 것이 목표입니다.#Review#Multi-Agent System#Drug Discovery#LLM#Hit Identification#Virtual Screening#Generative AI#Property Prediction#Automated Machine Learning2025년 11월 12일댓글 수 로딩 중
[논문리뷰] Adapting Web Agents with Synthetic Supervision웹 에이전트는 훈련 시 접하지 못한 새로운 웹사이트에 적응하는 데 어려움을 겪는데, 이는 환경별 태스크와 데모 데이터가 부족하기 때문입니다.#Review#Web Agents#Synthetic Data Generation#LLM#Task Refinement#Trajectory Refinement#Supervised Fine-tuning#Web Automation#Environment Adaptation2025년 11월 12일댓글 수 로딩 중
[논문리뷰] SofT-GRPO: Surpassing Discrete-Token LLM Reinforcement Learning via Gumbel-Reparameterized Soft-Thinking Policy Optimization본 논문은 이산 토큰 Chain-of-Thought (CoT) 추론에 효과적인 기존의 Reinforcement Learning (RL) 방법론, 특히 Group Relative Policy Optimization (GRPO) 이 연속적인 Soft-Thinking 패턴에는 적용하기 어렵다는 문제를 해결하고자 합니다.#Review#LLM#Reinforcement Learning#Soft-Thinking#Gumbel Reparameterization#Policy Optimization#Chain-of-Thought (CoT)#GRPO2025년 11월 10일댓글 수 로딩 중
[논문리뷰] Llama-Embed-Nemotron-8B: A Universal Text Embedding Model for Multilingual and Cross-Lingual Tasks본 논문은 기존 임베딩 모델의 불투명한 훈련 데이터 및 방법론 문제를 해결하고자, 다국어 및 교차 언어 태스크에서 최첨단 성능을 달성하는 완전 오픈 소스 범용 텍스트 임베딩 모델인 llama-embed-nemotron-8b 를 개발하는 것을 목표로 합니다.#Review#Text Embedding#Multilingual#Cross-Lingual#Contrastive Learning#Model Merging#Synthetic Data Generation#Instruction-Tuning#LLM2025년 11월 10일댓글 수 로딩 중
[논문리뷰] Too Good to be Bad: On the Failure of LLMs to Role-Play Villains본 논문은 대규모 언어 모델(LLM)이 다양한 도덕적 스펙트럼, 특히 악역 캐릭터를 얼마나 설득력 있게 연기할 수 있는지 체계적으로 조사하는 것을 목표로 합니다.#Review#LLM#Role-playing#Safety Alignment#Villain#Persona Simulation#Moral Alignment#Benchmark#Character Fidelity2025년 11월 9일댓글 수 로딩 중
[논문리뷰] RDMA Point-to-Point Communication for LLM SystemsLLM 시스템에서 필요한 유연한 지점 간 통신(point-to-point communication) 을 제공하고, 기존 RDMA 구현이 특정 NIC(Network Interface Controller) 에 종속되어 발생하는 벤더 종속성(vendor lock-in) 및 하드웨어 이식성(portability) 문제를 해결하는 것을 목표로 합니다.#Review#RDMA#LLM#Point-to-Point Communication#Disaggregated Inference#MoE Routing#KvCache#AWS EFA#NVIDIA ConnectX2025년 11월 9일댓글 수 로딩 중
[pydantic-ai] Validation 에러 재시도 메시지 개선 — Markdown 코드 블록 포맷LLM에게 전달하는 validation 에러 메시지를 Markdown 코드 블록으로 포맷하여 가독성 향상#Python#Pydantic AI#LLM#UX#Bug Fix2025년 11월 4일댓글 수 로딩 중
[Ray] 단일 노드 LLM 배치 추론 성능 기준선 벤치마크 및 회귀 가드 추가Ray Data LLM의 단일 노드 vLLM 배치 추론 벤치마크를 추가하고 환경 변수 기반 회귀 감지 임계값을 설정한 분석.#Ray#Python#Performance#Benchmarking#LLM2025년 10월 30일댓글 수 로딩 중
[논문리뷰] Repurposing Synthetic Data for Fine-grained Search Agent Supervision본 논문은 LLM 기반 검색 에이전트 훈련 시 Group Relative Policy Optimization (GRPO) 방법론의 한계인 희소한(sparse) 보상 문제를 해결하는 것을 목표로 합니다.#Review#Search Agents#LLM#Reinforcement Learning#Synthetic Data#Reward Shaping#Entity-aware Reward#Policy Optimization#Knowledge-intensive Tasks2025년 10월 29일댓글 수 로딩 중
[논문리뷰] AgentFold: Long-Horizon Web Agents with Proactive Context ManagementLLM 기반 웹 에이전트가 장기 태스크에서 겪는 컨텍스트 관리의 근본적인 문제(기존 ReAct 방식의 컨텍스트 포화 및 고정된 요약 방식의 비가역적 정보 손실)를 해결하는 것을 목표로 합니다.#Review#Web Agents#Context Management#Long-Horizon Tasks#LLM#Deep Consolidation#Granular Condensation#ReAct Paradigm2025년 10월 29일댓글 수 로딩 중
[논문리뷰] Human-Agent Collaborative Paper-to-Page Crafting for Under $0.1본 논문은 학술 논문을 바탕으로 고품질의 대화형 프로젝트 웹페이지를 자동으로 생성 하는 새로운 태스크를 제안하고 해결하고자 합니다.#Review#Human-Agent Collaboration#Project Page Generation#Multi-Agent System#LLM#VLM#Webpage Automation#PageBench#Scientific Communication#Cost-Effective AI2025년 10월 24일댓글 수 로딩 중
[논문리뷰] Unleashing Scientific Reasoning for Bio-experimental Protocol Generation via Structured Component-based Reward Mechanism본 논문은 대규모 언어 모델(LLM)이 생물 실험 프로토콜을 생성할 때 발생하는 불완전성 및 비일관성 문제를 해결하고, 정밀하고 논리적으로 정렬되며 실행 가능한 프로토콜을 자율적으로 생성하는 것을 목표로 합니다. 이를 통해 생명 과학 분야의 재현성 향상과 실험 효율성을 극대화하고자 합니다.#Review#Scientific Reasoning#Bio-experimental Protocol Generation#LLM#Structured Reward#SciRecipe Dataset#Sketch-and-Fill#Reinforcement Learning#Thoth2025년 10월 22일댓글 수 로딩 중
[논문리뷰] QueST: Incentivizing LLMs to Generate Difficult Problems본 논문은 LLM 학습에 있어 인간이 주석을 단 고품질의 어려운 코딩 문제 데이터셋이 부족하여 확장성이 제한되는 문제를 해결하고자 합니다. 특히, LLM 생성기가 더욱 도전적인 경쟁 프로그래밍 문제를 효과적으로 생성하도록 유도하는 새로운 프레임워크인 QueST 를 제안합니다.#Review#LLM#Problem Generation#Competitive Programming#Synthetic Data#Difficulty Estimation#Rejection Fine-tuning#Graph Sampling2025년 10월 21일댓글 수 로딩 중
[triton] [NVIDIA] SM120을 위한 FP4 Native Scaled Matmul 지원 및 성능 최적화 분석Triton에서 FP4 데이터 타입의 하드웨어 가속을 구현하여 Llama3-8B 벤치마크 성능을 약 2배 향상시킨 사례를 분석합니다.#Triton#NVIDIA#FP4#GPU#Optimization#LLM2025년 10월 20일댓글 수 로딩 중
[논문리뷰] LaSeR: Reinforcement Learning with Last-Token Self-Rewarding본 연구는 대규모 언어 모델(LLM)의 추론 능력을 강화하는 검증 가능한 보상 강화 학습(RLVR) 의 한계, 즉 테스트 시점에서의 검증 신호 부족과 기존 자가 검증 방법론의 비효율성을 해결하고자 합니다.#Review#Reinforcement Learning#LLM#Self-Verification#Last-Token#Reward Modeling#Efficiency#Reasoning#RLVR2025년 10월 17일댓글 수 로딩 중
[논문리뷰] LLMs as Scalable, General-Purpose Simulators For Evolving Digital Agent Training본 논문은 디지털 에이전트 훈련에 필요한 대규모, 고품질 UI 환경 훈련 궤적 데이터의 부족 문제 를 해결하고자 합니다. 기존 데이터 수집 방식의 높은 비용과 확장성 한계를 극복하기 위해, LLM 기반 시뮬레이터 를 활용하여 다양한 UI 상태와 전환을 합성하는 확장 가능한 패러다임을 제안하는 것을 목표로 합니다.#Review#LLM#Digital Agents#UI Simulation#Synthetic Data Generation#Targeted Data Synthesis#World Models2025년 10월 17일댓글 수 로딩 중
[논문리뷰] EAGER: Entropy-Aware GEneRation for Adaptive Inference-Time Scaling본 논문은 추론 언어 모델(LLM)에서 여러 추론 경로를 탐색할 때 발생하는 불필요한 계산 오버헤드 를 줄이고자 합니다.#Review#LLM#Inference-Time Scaling#Entropy-Aware Generation#Adaptive Budget Allocation#Reasoning Benchmarks#Computational Efficiency#Chain-of-Thought2025년 10월 16일댓글 수 로딩 중
[논문리뷰] Deflanderization for Game Dialogue: Balancing Character Authenticity with Task Execution in LLM-based NPCsLLM 기반 비플레이어 캐릭터(NPC)가 게임 내에서 기능적 작업 실행과 페르소나 일관성 있는 대화 생성을 동시에 수행할 때 발생하는 'Flanderization' (과도한 역할극) 문제를 해결하는 것을 목표로 합니다. 이를 통해 캐릭터의 진정성 과 작업 실행의 정확성 사이의 균형을 효과적으로 맞추는 방안을 모색합니다.#Review#LLM#NPC#Game Dialogue#Persona-Grounded Dialogue#Task Execution#Prompt Engineering#Fine-tuning#Deflanderization2025년 10월 16일댓글 수 로딩 중
[논문리뷰] Beyond Outliers: A Study of Optimizers Under Quantization대규모 언어 모델(LLMs)의 효율적인 배포를 위해 Quantization 이 필수가 됨에 따라, 옵티마이저 선택 이 양자화 성능에 미치는 영향을 체계적으로 분석하는 것을 목표로 합니다.#Review#Quantization#Optimizers#LLM#Post-Training Quantization (PTQ)#Quantization-Aware Training (QAT)#Error Propagation#Scaling Laws#Shampoo2025년 10월 10일댓글 수 로딩 중
[논문리뷰] Fathom-DeepResearch: Unlocking Long Horizon Information Retrieval and Synthesis for SLMs본 연구는 복잡하고 개방형의 장기적 정보 검색 및 합성 태스크에서 기존 오픈소스 DeepResearch 에이전트의 성능 한계를 극복하는 것을 목표로 합니다.#Review#DeepResearch Agents#Tool-integrated Reasoning#Reinforcement Learning#Information Retrieval#Information Synthesis#Multi-agent Self-play#Reward Shaping#LLM2025년 10월 8일댓글 수 로딩 중
[논문리뷰] AInstein: Assessing the Feasibility of AI-Generated Approaches to Research Problems본 논문은 대규모 언어 모델(LLM)이 사전 학습된 매개변수 지식 만을 사용하여 AI 연구 문제를 자율적으로 해결할 수 있는지 평가하는 것을 목표로 합니다. 이는 LLM의 성공이 단순한 암기나 정교한 패턴 매칭을 넘어선 진정한 개념적 추론 능력 을 반영하는지 밝히기 위함입니다.#Review#LLM#Scientific Problem Solving#AI Research#Iterative Refinement#Autonomous Agents#Generative AI#Evaluation Framework#Problem Extraction2025년 10월 8일댓글 수 로딩 중
[논문리뷰] LLMSQL: Upgrading WikiSQL for the LLM Era of Text-to-SQL본 논문은 기존 WikiSQL 데이터셋이 가진 데이터 타입 불일치, 대소문자 일관성 부족, 구문 오류, 답변 불가 질문 등의 구조적, 주석 관련 문제점을 해결하고자 합니다.#Review#Text-to-SQL#WikiSQL#LLM#Dataset Curation#Natural Language Processing#Benchmark#SQL Generation#Data Cleaning2025년 10월 7일댓글 수 로딩 중
[논문리뷰] SurveyBench: How Well Can LLM(-Agents) Write Academic Surveys?본 논문은 학술 조사 논문 작성에 대한 대규모 언어 모델(LLM) 및 LLM 에이전트의 역량 을 엄격하게 평가하기 위해 독자 요구사항에 부합하는 벤치마크 의 부재를 해결합니다.#Review#LLM#LLM Agents#Academic Survey Generation#Evaluation Framework#Benchmark#Quiz-driven Evaluation#Content Quality Metrics2025년 10월 6일댓글 수 로딩 중
[논문리뷰] CoDA: Agentic Systems for Collaborative Data Visualization본 논문은 복잡한 데이터셋, 반복적인 개선, 코드 오류 및 최종 시각화 품질 문제로 인해 기존 시스템이 어려움을 겪는 자연어 기반 데이터 시각화 자동화의 한계를 해결하는 것을 목표로 합니다.#Review#Multi-agent Systems#Data Visualization#LLM#Automation#Self-reflection#Code Generation#Natural Language to Visualization2025년 10월 6일댓글 수 로딩 중
[논문리뷰] Voice Evaluation of Reasoning Ability: Diagnosing the Modality-Induced Performance Gap본 논문은 실시간 대화 제약 조건 하에서 음성 대화형 시스템의 추론 능력을 평가하고, 텍스트 모델과 비교하여 발생하는 심각한 성능 저하, 즉 Voice Reasoning Gap (VRG) 을 진단하는 것을 목표로 합니다.#Review#Voice AI#LLM#Reasoning#Benchmark#Modality Gap#Latency#Speech Recognition#Generative AI#Real-time Systems#Conversational AI2025년 10월 1일댓글 수 로딩 중
[논문리뷰] Knowledge Homophily in Large Language Models본 논문은 대규모 언어 모델(LLM)이 인간의 뇌와 유사하게 지식 동질성(Knowledge Homophily) 패턴을 보이는지 탐구하고, 이를 통해 LLM 내 지식의 구조적 조직을 이해하며 지식 주도형(knowledge-intensive) 태스크 의 효율성을 개선하는 것을 목표로 합니다.#Review#LLM#Knowledge Homophily#Graph Neural Networks#Knowledge Graph#Knowledge Injection#Question Answering#Fine-tuning#Knowledge Retrieval2025년 10월 1일댓글 수 로딩 중
[논문리뷰] X-CoT: Explainable Text-to-Video Retrieval via LLM-based Chain-of-Thought Reasoning본 논문은 기존 임베딩 모델 기반 텍스트-비디오 검색 시스템의 한계, 즉 낮은 데이터 품질의 영향 및 랭킹 결과에 대한 설명 부족 문제를 해결하는 것을 목표로 합니다. 특히, 검색 모델의 동작과 텍스트-비디오 데이터 품질을 평가하기 위해 랭킹 결과를 해석할 수 있는 설명 가능한 검색 시스템 인 X-CoT를 제안합니다.#Review#Text-to-Video Retrieval#LLM#Chain-of-Thought#Explainable AI#Multimodal Retrieval#Bradley-Terry Model#Video Annotation2025년 9월 29일댓글 수 로딩 중
[논문리뷰] WebGen-Agent: Enhancing Interactive Website Generation with Multi-Level Feedback and Step-Level Reinforcement Learning본 논문은 웹사이트 코드 생성과 같이 시각적 요소와 사용자 상호작용 피드백이 중요한 태스크에서, 기존 코드 에이전트들이 단순한 코드 실행 피드백에만 의존하여 실제 웹사이트 품질을 제대로 반영하지 못하는 한계를 해결하고자 합니다.#Review#Website Generation#Code Agent#LLM#VLM#Reinforcement Learning#Multi-Level Feedback#GUI Agent#Step-GRPO2025년 9월 29일댓글 수 로딩 중
[논문리뷰] Chasing the Tail: Effective Rubric-based Reward Modeling for Large Language Model Post-Training본 논문은 LLM(Large Language Model) 포스트 트레이닝 과정에서 발생하는 보상 과적합(reward over-optimization) 문제를 해결하는 것을 목표로 합니다.#Review#LLM#Reinforcement Fine-tuning#Reward Modeling#Reward Over-optimization#Rubric-based Rewards#High-reward Tail#Off-policy Data#LLM Alignment2025년 9월 29일댓글 수 로딩 중
[논문리뷰] SIM-CoT: Supervised Implicit Chain-of-ThoughtImplicit Chain-of-Thought (CoT) 모델은 토큰 효율성에도 불구하고, 명시적 CoT 대비 지속적인 성능 격차와 핵심적인 '잠재 불안정성(latent instability)' 문제에 직면해 있습니다.#Review#Implicit Reasoning#Chain-of-Thought#LLM#Latent Space#Supervised Learning#Model Stability#Interpretability2025년 9월 25일댓글 수 로딩 중
[논문리뷰] EconProver: Towards More Economical Test-Time Scaling for Automated Theorem Proving논문은 LLM 기반의 Automated Theorem Proving(ATP) 모델들이 Chain-of-Thought (CoT) 추론 및 다중 샘플링 패스 와 같은 test-time scaling 전략을 사용하며 발생하는 높은 계산 비용과 자원 비효율성을 해결하는 것을 목표로 합니다.#Review#Automated Theorem Proving#LLM#Test-Time Scaling#Chain-of-Thought#Reinforcement Learning#Efficiency Optimization#Token Cost#Sampling Cost#Dynamic CoT Switching2025년 9월 17일댓글 수 로딩 중
[논문리뷰] SearchInstruct: Enhancing Domain Adaptation via Retrieval-Based Instruction Dataset Creation이 논문은 대규모 언어 모델(LLM)의 특정 도메인 적응을 위한 고품질 SFT(Supervised Fine-Tuning) 데이터셋 생성 의 어려움을 해결하는 것을 목표로 합니다.#Review#LLM#Instruction Tuning#Domain Adaptation#Retrieval-Augmented Generation#Dataset Creation#Model Editing#Supervised Fine-Tuning2025년 9월 16일댓글 수 로딩 중
[논문리뷰] HANRAG: Heuristic Accurate Noise-resistant Retrieval-Augmented Generation for Multi-hop Question Answering본 논문은 멀티-홉 질문(multi-hop queries) 처리 시 기존 RAG(Retrieval-Augmented Generation) 시스템이 겪는 비효율성(과도한 반복 검색), 비합리적인 쿼리(원래 쿼리에 대한 노이즈 검색), 그리고 노이즈 축적 문제를 해결하고자 합니다.#Review#Retrieval-Augmented Generation#Multi-hop QA#Noise Resistance#LLM#Query Decomposition#Adaptive Retrieval#Heuristic Framework#Revelator2025년 9월 15일댓글 수 로딩 중
[논문리뷰] Saturation-Driven Dataset Generation for LLM Mathematical Reasoning in the TPTP Ecosystem대규모 언어 모델(LLM)의 수학적 추론 능력 향상을 저해하는 고품질, 논리적으로 건전한 데이터의 부족 문제를 해결하는 것이 주된 목표입니다. 수십 년간의 자동화된 정리 증명(ATP) 연구를 확장 가능한 데이터 엔진으로 전환하여 LLM의 학습을 위한 대규모의 검증된 수학적 명제 및 추론 태스크 코퍼스를 생성하고자 합니다.#Review#Automated Theorem Proving#LLM#Mathematical Reasoning#Synthetic Data Generation#TPTP Ecosystem#Saturation Proving#Proof Graph Reconstruction#Data Augmentation2025년 9월 9일댓글 수 로딩 중
[논문리뷰] DCPO: Dynamic Clipping Policy Optimization본 논문은 대규모 언어 모델(LLM)의 추론 능력을 향상시키기 위한 Verifiable Rewards 기반의 강화 학습(RLVR) 에서 발생하는 기존 방법론(예: GRPO)의 한계를 해결하는 것을 목표로 합니다.#Review#Reinforcement Learning#LLM#Policy Optimization#Dynamic Clipping#Advantage Standardization#RLVR#Reasoning2025년 9월 3일댓글 수 로딩 중
[논문리뷰] Baichuan-M2: Scaling Medical Capability with Large Verifier System의료 분야 LLM 이 USMLE 같은 정적 벤치마크에서는 우수하지만 실제 임상 환경의 동적, 상호작용적 특성을 포착하지 못해 발생하는 성능 격차를 해소하는 것이 목표입니다.#Review#Medical AI#LLM#Reinforcement Learning#Verifier System#Patient Simulator#Clinical Rubrics#Baichuan-M2#HealthBench2025년 9월 3일댓글 수 로딩 중
[논문리뷰] MeshCoder: LLM-Powered Structured Mesh Code Generation from Point Clouds본 논문은 3D 포인트 클라우드로부터 편집 가능한 Blender Python 스크립트 형태의 구조화된 메시 코드를 생성하는 새로운 프레임워크인 MeshCoder 를 제안합니다.#Review#LLM#Point Clouds#3D Reconstruction#Structured Mesh#Blender Python#Shape Editing#Part-based Representation#Large Language Model2025년 8월 21일댓글 수 로딩 중
[논문리뷰] Inverse-LLaVA: Eliminating Alignment Pre-training Through Text-to-Vision Mapping기존 대규모 시각-언어 모델(LVLM)의 핵심 병목인 고비용의 정렬 사전 훈련(alignment pre-training) 단계를 제거 하고, 시각 정보를 이산적인 텍스트 토큰 공간에 강제로 매핑함으로써 발생하는 정보 손실 문제 를 해결하는 것을 목표로 합니다.#Review#Multimodal Learning#Vision-Language Models#Alignment Pre-training#Text-to-Vision Mapping#Continuous Representations#Computational Efficiency#LLM2025년 8월 19일댓글 수 로딩 중
[논문리뷰] AWorld: Dynamic Multi-Agent System with Stable Maneuvering for Robust GAIA Problem Solving대규모 언어 모델(LLM) 기반 에이전트가 외부 도구를 활용할 때 발생하는 확장된 컨텍스트 및 노이즈/관련성 없는 도구 출력 으로 인한 시스템 신뢰성 및 정확도 저하 문제를 해결하고, 에이전트 기반 시스템의 안정성과 견고성 을 향상시키는 것을 목표로 합니다.#Review#Multi-Agent System#Agent Stability#LLM#Tool Use#GAIA Benchmark#Robustness#Dynamic Supervision#Maneuvering2025년 8월 14일댓글 수 로딩 중
[논문리뷰] WideSearch: Benchmarking Agentic Broad Info-Seeking본 논문은 광범위한 정보 탐색(WideSearch) 작업에서 LLM 기반 에이전트의 신뢰성과 완성도를 평가하기 위한 새로운 벤치마크를 제시합니다. 이는 기존 벤치마크가 놓치고 있던, 대규모의 원자적 정보를 철저하고 정확하게 수집하여 잘 정리된 출력으로 구성 하는 실세계 정보 탐색 시나리오를 평가하는 데 중점을 둡니다.#Review#Agentic Search#LLM#Benchmark#Information Seeking#Structured Output#Evaluation Metrics#Multi-agent Systems2025년 8월 12일댓글 수 로딩 중
[논문리뷰] OmniEAR: Benchmarking Agent Reasoning in Embodied Tasks본 연구는 대규모 언어 모델(LLM)이 물리적 상호작용, 도구 사용, 다중 에이전트 협업이 필요한 구체화된(embodied) 태스크 에서 얼마나 잘 추론하는지 평가하기 위한 종합적인 프레임워크인 OmniEAR 를 제시합니다.#Review#Embodied AI#Agent Reasoning#LLM#Benchmarking#Tool Use#Multi-Agent Systems#Physical Interaction#Constraint Reasoning2025년 8월 12일댓글 수 로딩 중
[논문리뷰] Compressing Chain-of-Thought in LLMs via Step EntropyLarge Language Models(LLMs)의 Chain-of-Thought(CoT) 추론 과정에서 발생하는 과도한 상세함과 중복성으로 인한 높은 추론 비용 및 비효율성을 해결하는 것이 주요 목표입니다.#Review#LLM#Chain-of-Thought#CoT Compression#Step Entropy#Reinforcement Learning#SFT#GRPO2025년 8월 12일댓글 수 로딩 중
[논문리뷰] On the Generalization of SFT: A Reinforcement Learning Perspective with Reward Rectification표준 Supervised Fine-Tuning (SFT)이 Reinforcement Learning (RL)에 비해 제한적인 일반화 성능 을 보이는 문제를 해결하는 것이 목표입니다.#Review#Supervised Fine-Tuning (SFT)#Reinforcement Learning (RL)#Generalization#Reward Rectification#Dynamic Fine-Tuning (DFT)#LLM#Policy Gradient#Mathematical Reasoning2025년 8월 8일댓글 수 로딩 중
[논문리뷰] LeanK: Learnable K Cache Channel Pruning for Efficient Decoding대규모 언어 모델(LLMs)에서 증가하는 Key-Value(KV) 캐시 크기로 인한 GPU 메모리 사용량 증가와 느린 추론 속도 문제를 해결하는 것이 목표입니다.#Review#LLM#KV Cache Optimization#Model Pruning#Efficient Decoding#Memory Optimization#Static Sparsity#Transformer2025년 8월 7일댓글 수 로딩 중