[논문리뷰] ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction본 논문은 기업 환경의 복잡하고 방대한 문서 처리 자동화를 위해 필수적인 schema-guided extraction의 성능과 신뢰성을 정량적으로 평가할 수 있는 통합 벤치마크를 제안합니다.#Review#Document Extraction#Schema-Guided Extraction#Benchmark#Large Language Models#Visual Grounding#Enterprise AI#Cost-Efficiency2026년 8월 2일댓글 수 로딩 중
[논문리뷰] Evaluation-Verification Reward for Consistent Multi-Reference Image Editing본 논문은 멀티 레퍼런스 이미지 편집(Multi-Reference Image Editing)에서 요구되는 시각적 일관성과 하모니를 유지하기 위한 효과적인 강화학습 보상 모델의 부재 문제를 해결한다.#Review#Reinforcement Learning#Multi-Reference Image Editing#Diffusion Models#Evaluation-Verification Reward#Multimodal Large Language Models2026년 8월 2일댓글 수 로딩 중
[논문리뷰] Enhancing Rubric-based RL via Self-Distillation본 논문은 Rubric-based RL에서 발생하는 exploration의 한계와 scalar reward 집계로 인한 학습 신호 소실 문제를 해결하고자 합니다. 기존의 GRPO 기반 연구들은 특정 기준을 만족하는 사례가 없으면 학습 신호를 생성하지 못하는 Unexplored Criteria 문제에 직면해 있습니다.#Review#Reinforcement Learning#Rubric-based RL#Self-Distillation#LLM#Policy Optimization#GRPO#Alignment2026년 8월 2일댓글 수 로딩 중
[논문리뷰] EMBL AI Librarian: Life-Sciences Knowledge Layer for AI Agents본 논문은 생명과학 도메인의 AI 에이전트가 최신 문헌을 실시간으로 활용하는 과정에서 겪는 효율성 저하와 지식 접근성 문제를 해결하고자 합니다. 기존 방식은 에이전트가 전체 논문을 읽거나 부정확한 키워드 검색에 의존해야 하므로, 제한된 context window 내에서 고품질의 증거를 추출하기 어렵다는 한계가 있습니다.#Review#Knowledge Layer#AI Agents#Europe PMC#Retrieval-Augmented Generation#Life Sciences#Evidence Extraction2026년 8월 2일댓글 수 로딩 중
[논문리뷰] Beyond Feeling Better: Capability-Sustaining Emotional Dialogue as a Longitudinal Research Paradigm본 논문은 기존의 emotional dialogue 연구가 지나치게 단기적인 'relief' 중심의 성과에 매몰되어, 장기간 대화 모델을 사용할 때 발생할 수 있는 사용자의 심리적 역량 저하 문제를 간과하고 있음을 지적합니다.#Review#Emotional Dialogue#Longitudinal Research Paradigm#User Capability#Lifecycle Governance#Emotional Support#Resilience2026년 8월 2일댓글 수 로딩 중
[논문리뷰] AISPA: User-Centric System Prompt Auditing for Large Language Model Applications본 논문은 상업용 AI 시스템에서 System Prompt의 불투명성과 그로 인한 사용자 신뢰 및 책임성 결여 문제를 해결하고자 합니다. 현재 System Prompt는 모델의 행동을 규정하는 핵심 요소임에도 불구하고, 외부 공개가 제한적이며 독립적인 감사(Audit) 과정이 전무합니다.#Review#System Prompt#AI Auditing#User-Centric#LLM Safety#Transparency#Governance2026년 8월 2일댓글 수 로딩 중
[sglang] SGLang의 Session-Aware Unified Radix Cache를 통한 추론 성능 최적화멀티턴 에이전트 워크로드에서 세션 기반 KV 캐시 보호를 통해 재계산을 줄이고 처리량을 극대화하는 최적화 기법을 소개합니다.#SGLang#LLM#KV Cache#Radix Cache#Performance Optimization2026년 8월 2일댓글 수 로딩 중
[sglang] sglang, MoE 모델 로딩 속도 5.6배 향상: mmap 뷰 최적화 분석sglang에서 MoE 모델 로딩 시 발생하는 병목 현상을 해결하여 로딩 속도를 획기적으로 개선한 PR을 분석합니다.#sglang#MoE#최적화#성능 개선#모델 로딩#AMD GPU2026년 8월 2일댓글 수 로딩 중
[sglang] SGLang, KV VMM 할당자 스텁 최적화를 통한 시작 시간 및 라이브러리 크기 대폭 개선SGLang의 KV VMM 할당자 스텁 빌드 시 불필요한 PyTorch 헤더 포함을 제거하여 시작 시간과 라이브러리 크기를 획기적으로 줄였습니다.#SGLang#최적화#성능#PyTorch#C++#빌드 시스템2026년 8월 1일댓글 수 로딩 중
[sglang] MiniMax-M3 모델을 위한 FP8 Attention GEMM 최적화 및 성능 개선MiniMax-M3 모델의 FP8 Attention GEMM을 SM100 아키텍처에서 최적화하여 프리필 성능을 최대 66% 향상시켰습니다.#SGLang#FP8#Attention#CUDA#Optimization2026년 8월 1일댓글 수 로딩 중
[sglang] DeepSeek-V4 Flash 공식 모델 최적화: H200 및 B200을 위한 SGLang 서빙 전략SGLang v0.5.16에서 DeepSeek-V4 Flash 공식 모델의 H200/B200 최적화 설정과 검증된 벤치마크 결과를 분석합니다.#SGLang#DeepSeek-V4#H200#B200#LLM-Serving#Optimization2026년 8월 1일댓글 수 로딩 중
[onnxruntime] ONNX Runtime의 FP4/FP8 GEMV 커널 최적화: Tensor Core와 M-Tiling을 통한 성능 극대화ONNX Runtime의 FP4/FP8 GEMV 커널에 Tensor Core 활용 및 M-tiling을 도입하여 추론 성능을 최대 5배 향상시켰습니다.#ONNX Runtime#CUDA#GEMV#Tensor Core#FP4#FP8#LLM2026년 8월 1일댓글 수 로딩 중
[sglang] SGLang Diffusion: 2-rank Ulysses를 위한 CUDA-IPC 기반 Zero-Staging All-to-All 최적화2-rank Ulysses 환경에서 NCCL 대신 CUDA-IPC를 사용하여 데이터 복사 오버헤드를 제거하고 전체 성능을 약 10% 향상시킨 최적화 사례.#SGLang#CUDA#NCCL#Ulysses#Performance2026년 7월 31일댓글 수 로딩 중
[flashinfer] FlashInfer FP8 Causal Attention 최적화: O(1) 디코딩과 글로벌 스케줄링의 힘FlashInfer의 FP8 FMHA v2 커널에서 배치 크기가 클 때 발생하는 병목을 O(1) 디코딩과 글로벌 큐 타일 재배치로 해결하여 최대 5.6x 성능 향상을 달성했습니다.#CUDA#LLM#FlashInfer#Performance#Optimization#FP82026년 7월 31일댓글 수 로딩 중
[onnxruntime] ONNX Runtime WebGPU EP: 디바이스 없는 오프라인 컴파일 지원WebGPU EP에서 하드웨어 없이 모델을 최적화하고 직렬화할 수 있는 'Compile-only' 세션 모드를 구현하여 보안 및 샌드박스 환경을 지원합니다.#ONNXRuntime#WebGPU#Optimization#Compiler#Security2026년 7월 31일댓글 수 로딩 중
[vllm] vLLM DeepSeek-V4 성능 최적화: Eager Break 시 Workspace 재사용 개선vLLM DeepSeek-V4 모델에서 Eager Break 시 Workspace 재사용을 최적화하여 TTFT를 3.9% 개선한 PR 분석#vLLM#DeepSeek-V4#성능 최적화#Eager Break#Workspace Reuse#CUDA Kernel2026년 7월 31일댓글 수 로딩 중
[sglang] [성능 최적화] 불필요한 Tree Mask Fill 제거를 통한 Speculative Decoding 가속화SGLang의 Speculative Decoding 과정에서 매 단계 발생하는 대규모 메모리 초기화(memset) 오버헤드를 제거하여 추론 속도를 개선한 PR을 분석합니다.#SGLang#Speculative Decoding#Performance Optimization#PyTorch#LLM Inference2026년 7월 30일댓글 수 로딩 중
[vllm] vLLM DeepSeek-V4 성능 최적화: 불필요한 torch.full 커널 제거로 1.88배 속도 향상DeepSeek-V4의 combine_topk_swa_indices 연산에서 out 텐서를 재사용하여 불필요한 메모리 할당 및 커널 호출을 제거하고 성능을 1.88배 개선했습니다.#vLLM#DeepSeek-V4#CUDA#Performance#Optimization2026년 7월 30일댓글 수 로딩 중
[vllm] vLLM DeepSeek V4 모델의 불필요한 메모리 할당 및 복사 최적화 분석vLLM DeepSeek V4 모델에서 MTP 미사용 시 불필요한 메모리 할당 및 복사를 제거하여 성능을 개선한 PR 분석#vLLM#DeepSeek V4#최적화#메모리 관리#성능 개선2026년 7월 30일댓글 수 로딩 중
[vllm] vLLM 컴파일 최적화: Transformers 모델을 위한 FusedAddRMSNorm 도입Transformers 모델의 잔차 연결과 RMSNorm을 융합하여 메모리 접근을 줄이고 추론 성능을 최대 18% 향상시키는 최적화 기법을 소개합니다.#vLLM#LLM#Compiler#Optimization#PyTorch#Transformers2026년 7월 30일댓글 수 로딩 중