[sglang] SGLang의 Unified Radix Cache를 위한 SWA HiCache 지원 최적화SGLang에서 SWA(Sliding Window Attention)를 HiCache와 통합하여 메모리 효율성과 추론 성능을 크게 향상시킨 변경사항 분석#SGLang#LLM#KV-Cache#Optimization#HiCache2026년 5월 6일댓글 수 로딩 중
[vllm] vLLM, Gemma 4 모델에 양자화된 Speculative Decoding 적용: 성능 향상의 비밀vLLM이 Gemma 4 모델에 Speculative Decoding을 도입하여 추론 속도를 획기적으로 개선한 방법을 분석합니다.#vLLM#Speculative Decoding#Gemma 4#LLM 최적화#양자화2026년 5월 6일댓글 수 로딩 중
[flashinfer] FlashInfer, CUDA 그래프 호환성을 높이고 성능을 최적화하다: TRT-LLM FMHA v2 통합 및 불필요한 H2D 제거FlashInfer가 TRT-LLM FMHA v2를 통합하고 CUDA 그래프 호환성을 개선하여 성능을 최적화한 PR을 분석합니다.#FlashInfer#TRT-LLM#CUDA#최적화#성능#LLM2026년 5월 6일댓글 수 로딩 중
[flashinfer] FlashInfer: Wide Vector 최적화와 1900줄의 코드 삭제로 달성한 성능 개선gdn_wide_vec_kernel 도입과 불필요한 레거시 커널 제거를 통해 B200에서 최대 82%의 DRAM 대역폭 효율을 달성한 사례를 분석합니다.#CUDA#PyTorch#FlashInfer#Performance-Optimization#LLM2026년 5월 6일댓글 수 로딩 중
[논문리뷰] X2SAM: Any Segmentation in Images and Videos본 논문은 MLLM의 강력한 추론 능력과 foundation segmentation model의 정밀한 픽셀 단위 인식 능력을 통합하여 정적 이미지뿐만 아니라 동적 비디오까지 포괄하는 통합된 세분화 프레임워크를 구축하는 것을 목표로 합니다.#Review#MLLM#Segmentation#Video-Understanding#Mask-Memory#Visual-Prompting#Spatio-Temporal-Consistency2026년 5월 5일댓글 수 로딩 중
[논문리뷰] Workspace-Bench 1.0: Benchmarking AI Agents on Workspace Tasks with Large-Scale File Dependencies본 논문은 기존의 에이전트 벤치마크가 실제 업무 환경의 복잡한 파일 의존성(Large-Scale File Dependencies)을 충분히 반영하지 못하는 한계를 해결하기 위해 제안되었다.#Review#AI Agents#Workspace Learning#Benchmark#File Dependency#Large-Scale#Autonomous Agent#Task-File-Driven2026년 5월 5일댓글 수 로딩 중
[논문리뷰] Video Generation with Predictive Latents본 논문은 기존 Video VAE가 단순히 비디오의 시각적 재구성 성능을 최적화하는 것만으로는 우수한 비디오 생성(Generative Performance)을 보장할 수 없다는 문제점을 해결하고자 한다.#Review#Video Generation#Video VAE#Predictive Learning#Latent Diffusion Models#Temporal Dynamics#Motion Prior#Spatiotemporal Compression2026년 5월 5일댓글 수 로딩 중
[논문리뷰] The TTS-STT Flywheel: Synthetic Entity-Dense Audio Closes the Indic ASR Gap Where Commercial and Open-Source Systems Fail본 논문은 상용 및 오픈 소스 STT 시스템이 인도 언어의 특정 엔티티 인식에서 극도로 낮은 성능을 보이는 문제를 해결하고자 한다. 기존 시스템들은 Wikipedia나 뉴스 등 read-prose 중심의 데이터로 학습되어, 실제 현업에서 빈번한 엔티티 데이터에 취약하다.#Review#Indic ASR#TTS-STT Flywheel#Entity-Dense Audio#LoRA#Script Fidelity Rate#Data Augmentation#Entity-Hit-Rate2026년 5월 5일댓글 수 로딩 중
[논문리뷰] TCDA: Thread-Constrained Discourse-Aware Modeling for Conversational Sentiment Quadruple Analysis본 논문은 DiaASQ 작업에서 기존 모델들이 대화의 복잡한 의존 관계를 제대로 모델링하지 못하고 발생하는 구조적 노이즈와 거리 감쇠 문제를 해결하고자 합니다. 기존 GCN 기반 연구들은 불필요한 스레드 간 정보를 여과 없이 전파하여 구조적 노이즈를 야기하는 한계가 있습니다.#Review#DiaASQ#TC-DAG#D-RoPE#Distance Dilution#Sentiment Analysis#Conversational AI#Discourse Modeling2026년 5월 5일댓글 수 로딩 중
[논문리뷰] SymptomAI: Towards a Conversational AI Agent for Everyday Symptom Assessment본 연구는 실제 일상생활 속에서 사용자가 호소하는 증상을 기반으로 하는 대화형 AI 진단 에이전트의 성능을 임상적 수준에서 검증하고자 한다.#Review#Conversational AI#Differential Diagnosis (DDx)#LLM#Fitbit#Wearable Biosignals#PheWAS#Healthcare AI2026년 5월 5일댓글 수 로딩 중
[논문리뷰] StateSMix: Online Lossless Compression via Mamba State Space Models and Sparse N-gram Context Mixing본 논문은 대규모 LLM 기반 압축 기술이 요구하는 엄청난 컴퓨팅 자원과 외부 가중치 전송의 비실용성을 해결하기 위해 완전 online 신경망 압축 방식을 제안한다. 기존의 고성능 신경망 압축 모델들은 수억 개의 파라미터를 외부에서 가져와야 하므로 범용적인 환경에서 사용하기 어렵다.#Review#Lossless Compression#State Space Models#Mamba#Online Learning#Arithmetic Coding#N-gram#BPE Tokenisation2026년 5월 5일댓글 수 로딩 중
[논문리뷰] Skills-Coach: A Self-Evolving Skill Optimizer via Training-Free GRPO본 연구는 LLM 기반 Agent 생태계에서 Skill이 범람함에도 불구하고, 개별 개발자가 특정 목적 위주로 설계하여 기능적 파편화(Fragmentation)와 커버리지 부족 문제를 겪고 있는 현실을 해결하고자 합니다 .#Review#Large Language Model#Agent#Skill Self-Evolution#GRPO#Benchmark#Automation2026년 5월 5일댓글 수 로딩 중
[논문리뷰] SVGS: Enhancing Gaussian Splatting Using Primitives with Spatially Varying Colors본 논문은 기존 Gaussian Splatting 방식이 복잡한 텍스처나 기하학적 형태를 표현할 때 비효율적이라는 문제를 해결하고자 합니다 .#Review#Gaussian Splatting#Novel-view Synthesis#Spatially Varying#Gaussian Surfels#Movable Kernels#3D Reconstruction2026년 5월 5일댓글 수 로딩 중
[논문리뷰] Reinforcement Learning for LLM-based Multi-Agent Systems through Orchestration Traces본 논문은 LLM 기반의 에이전트가 개별적인 도구 사용을 넘어 조율된 팀 단위로 진화함에 따라, 기존의 단일 에이전트 RL이나 고전적 MARL 방법론이 갖는 한계를 지적한다.#Review#LLM#Multi-Agent Systems#Reinforcement Learning#Orchestration Trace#Credit Assignment#Reward Design#System Engineering2026년 5월 5일댓글 수 로딩 중
[논문리뷰] PatRe: A Full-Stage Office Action and Rebuttal Generation Benchmark for Patent Examination본 논문은 기존 특허 관련 연구가 특허 심사를 단순한 이진 분류(Acceptance Prediction)나 정적인 정보 추출 문제로만 취급하여 실제 현장의 반복적이고 상호작용적인 심사 과정을 반영하지 못한다는 한계를 해결하고자 한다.#Review#Patent Examination#Office Action Generation#Rebuttal Generation#Large Language Models#Legal Reasoning#Benchmark2026년 5월 5일댓글 수 로딩 중
[논문리뷰] OpenSeeker-v2: Pushing the Limits of Search Agents with Informative and High-Difficulty Trajectories본 연구는 고성능 search agent 개발이 자본과 컴퓨팅 자원이 막대한 기업 주도의 CPT+SFT+RL 파이프라인에 종속된 현실을 비판적으로 접근합니다. 기존의 복잡한 학습 방식은 학계의 진입 장벽을 높이고 연구 생태계의 폐쇄성을 야기합니다.#Review#Search Agent#SFT#ReAct#Data Quality#Long-horizon Reasoning#Data Synthesis2026년 5월 5일댓글 수 로딩 중
[논문리뷰] HeavySkill: Heavy Thinking as the Inner Skill in Agentic Harness본 논문은 현대의 복잡한 Agentic Harness 설계 이면에 숨겨진 실질적인 성능 구동 메커니즘을 규명하고 이를 단순화하고자 한다. 기존의 오케스트레이션 설계는 시스템이 매우 복잡하여 실질적인 추론 메커니즘을 파악하기 어렵다는 한계가 있었다.#Review#Agentic Harness#Heavy Thinking#Large Language Model#Test-Time Scaling#Sequential Deliberation#Parallel Reasoning#RLVR2026년 5월 5일댓글 수 로딩 중
[논문리뷰] Healthcare AI GYM for Medical Agents본 논문은 의료 AI 에이전트가 복잡한 다단계 임상 추론 환경에서 안정적인 툴 사용 정책을 학습하는 데 한계가 있다는 문제를 해결하고자 합니다. 기존의 단일 턴(single-turn) 기반 의료 QA 연구들은 실제 임상 환경의 핵심인 다단계 상호작용과 툴 활용 능력을 충분히 반영하지 못합니다.#Review#Medical AI Agents#Reinforcement Learning#On-Policy Distillation#Clinical Reasoning#Multi-turn Interaction#Healthcare AI GYM2026년 5월 5일댓글 수 로딩 중
[논문리뷰] ESARBench: A Benchmark for Agentic UAV Embodied Search and Rescue본 논문은 기존의 UAV SAR 연구들이 전통적인 비전 및 경로 계획 방식에 국한되어 있어, 복잡한 환경에서의 자율적 의사결정 능력을 평가할 통합된 벤치마크가 부족하다는 점을 지적합니다.#Review#Embodied AI#Search and Rescue (SAR)#UAV#Multimodal Large Language Models (MLLMs)#Simulation Platform#Benchmark2026년 5월 5일댓글 수 로딩 중
[논문리뷰] Chain of Evidence: Pixel-Level Visual Attribution for Iterative Retrieval-Augmented Generation본 논문은 기존의 text-based iRAG 시스템이 겪는 Coarse-grained attribution과 Visual semantic loss 문제를 해결하기 위해 고안되었습니다.#Review#Iterative Retrieval-Augmented Generation#Visual Attribution#Vision-Language Models#Pixel-level Grounding#Multi-hop Reasoning2026년 5월 5일댓글 수 로딩 중