[논문리뷰] RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources본 논문은 최신 Large Language Model(LLM) 기반 에이전트가 소프트웨어 조작 및 복잡한 아티팩트 생성 작업을 수행할 때 발생하는 Procedural Knowledge 부족 문제를 해결하고자 한다.#Review#Software Agents#Multimodal Skill Wiki#Procedural Knowledge#Distillation#Agentic Harness#Human-Created Resources#Offline-Online Pipeline2026년 7월 19일댓글 수 로딩 중
[논문리뷰] RAGU: A Multi-Step GraphRAG Engine with a Compact Domain-Adapted LLM본 논문은 기존 GraphRAG 시스템들이 직면한 Single-pass extraction의 한계와 고성능 LLM에 대한 과도한 의존성 문제를 해결하고자 합니다. 기존 방식은 단일 단계에서 지식 그래프를 추출함에 따라 노이즈가 많고 중복된 엔티티를 생성하여 검색의 안정성을 저해합니다.#Review#GraphRAG#LLM#Knowledge Graph#Information Extraction#Multi-step Consolidation#Meno-Lite-0.12026년 7월 19일댓글 수 로딩 중
[논문리뷰] Qwen-Music Technical Report본 논문은 음악 생성 시스템에서 발생하는 의미론적 구성(semantic composition)과 음향적 렌더링(acoustic rendering) 사이의 불일치 문제를 해결하고자 합니다. 기존의 대규모 오디오 생성 모델들은 가사, 멜로디, 리듬 등 복잡한 음악적 요소를 장시간 일관성 있게 제어하는 데 한계를 보입니다.#Review#Music Generation#Music Semantic Tokens#Melody-CoT#Diffusion Transformer#Spec-VAE#Post-training Alignment2026년 7월 19일댓글 수 로딩 중
[논문리뷰] On-Policy Delta Distillation본 논문은 기존의 On-Policy Distillation (OPD) 방식이 교사 모델의 전체 출력 분포를 모방하는 데 그쳐, 추론 능력 향상에 필수적인 핵심 학습 궤적을 충분히 전달하지 못한다는 문제를 제기합니다 .#Review#Knowledge Distillation#On-Policy Distillation#Reasoning Capability#Delta Signal#LLM Post-training#Reinforcement Learning2026년 7월 19일댓글 수 로딩 중
[논문리뷰] Loop the Loopies!본 논문은 Looped Transformer가 고정된 컴퓨팅 자원 내에서 Vanilla Transformer보다 우수한 성능을 낼 수 있도록 하는 compute-matched scaling recipe를 정의합니다.#Review#Looped Transformers#Mixture-of-Experts#Layer-Loop#Compute-Matched Scaling#Post-Training#Reasoning Models2026년 7월 19일댓글 수 로딩 중
[논문리뷰] From Human-Centric to Agentic Code Review: The Impact of Different Generations of Generative AI Technology on Review Quality본 논문은 Generative AI 기술이 소프트웨어 개발 생태계에 깊숙이 침투함에 따라, 기존의 Human-Centric 코드 리뷰가 LLM 및 AI Agent가 결합된 형태로 변화하면서 발생하는 리뷰 품질 및 효율성 변화를 규명하고자 합니다 .#Review#Generative AI#Code Review#LLM#AI Agents#Review Quality#Human-AI Collaboration#Software Engineering2026년 7월 19일댓글 수 로딩 중
[논문리뷰] DSWorld: A Data Science World Model for Efficient Autonomous Agents본 논문은 자율형 데이터 과학 에이전트가 반복적인 시행착오 과정에서 겪는 비효율적인 연산 비용 문제를 해결하고자 합니다.#Review#Data Science World Model#Autonomous Agents#Transition Prediction#Reflective Reinforcement Learning#Data Science Workflow#Simulation2026년 7월 19일댓글 수 로딩 중
[논문리뷰] Cura 1T: Specialized Model for Agentic Healthcare본 논문은 환자 상담, 임상 추론, EHR 워크플로우 수행이라는 복합적인 의료 과업을 동시에 해결할 수 있는 특화된 LLM이 부재하다는 문제점을 해결하고자 합니다. 기존 연구들은 각기 다른 의료 하위 도구에 집중해왔으나, 한 영역의 업데이트가 다른 영역의 성능을 저하시키는 '성능 침식' 현상이 발생하기 쉽습니다.#Review#Healthcare LLM#Self-evolution Loop#Data-centered#Agentic Workflow#EHR Tool Use#SDFT2026년 7월 19일댓글 수 로딩 중
[논문리뷰] Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization본 논문은 기존 RLVR 방식의 핵심 한계인 Entropy의 '정확성 인식 능력 부재' 문제를 해결합니다. 기존의 Entropy 기반 방식들은 모델의 불확실성을 측정하지만, 이것이 생산적인 탐색인지 아니면 단순한 오류인지 구분하지 못해 최적화의 모호함을 야기합니다 .#Review#Reinforcement Learning#Advantage Shaping#Contrastive Policy Optimization#RLVR#LLM Reasoning#Token-level Supervision2026년 7월 19일댓글 수 로딩 중
[논문리뷰] Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos본 논문은 오디오-비주얼 정보가 풍부한 장시간의 실세계 비디오를 인간처럼 이해하고 추론하는 범용 AI 모델의 부재를 해결합니다. 기존의 AV-LLM들은 주로 짧은 클립 이해에 국한되어 있으며, 특히 오디오와 비주얼 데이터를 결합하여 추론하는 능력이 부족합니다 .#Review#AV-LLM#Audio-Visual Reasoning#Long-form Video#Chain-of-Thought#Multimodal Learning#Temporal Alignment2026년 7월 19일댓글 수 로딩 중
[논문리뷰] Agon: Competitive Cross-Model RL with Implicit Rival Grading of Reasoning본 논문은 기존 GRPO 기반의 LLM 학습이 '추론 과정(trace)'을 평가하지 못하고 최종 정답에만 의존하여 발생하는 'Length Pathology(불필요한 답변 길이 증가)' 문제를 해결하고자 합니다.#Review#Reinforcement Learning#Large Language Models#Reasoning#GRPO#Competitive Training#Multi-Agent System#Self-Improvement2026년 7월 19일댓글 수 로딩 중
[sglang] DeepSeek-V3.2를 위한 Native FP8 Sparse MLA 최적화: SGLang DSA 백엔드 통합 분석DeepSeek-V3.2의 추론 성능을 극대화하는 Native FP8 Sparse MLA Prefill 커널의 SGLang 통합 과정과 최적화 기법을 분석합니다.#DeepSeek#SGLang#FP8#MLA#CUDA#Performance-Optimization2026년 7월 19일댓글 수 로딩 중
[vllm] vLLM의 대규모 모델 추론을 위한 MRV2 기반 Prefill Context Parallelism(PCP) 도입MLA 모델을 위한 MRV2 기반의 PCPManager를 도입하여 Prefill 연산을 병렬화하고, DCP와 PCP를 직교적으로 분리하여 확장성을 개선했습니다.#vLLM#LLM#MLA#Context Parallelism#Distributed Inference2026년 7월 19일댓글 수 로딩 중
[ultralytics] MuSGD 최적화: Batched Newton-Schulz와 Fused Kernel로 8배 성능 향상MuSGD 옵티마이저의 Newton-Schulz 연산을 배치화하고 PyTorch foreach 연산을 도입하여 커널 실행 오버헤드를 획기적으로 줄였습니다.#PyTorch#Optimization#DeepLearning#CUDA#Performance2026년 7월 19일댓글 수 로딩 중
[openclaw] 프론트엔드 성능 최적화: 엔트리 CSS 번들 다이어트와 코드 스플리팅 전략엔트리 CSS에서 불필요한 스타일을 제거하고 레이지 로딩 모듈로 분리하여 초기 로딩 성능을 42KB에서 36KB로 개선한 사례를 분석합니다.#Frontend#Performance#CSS#CodeSplitting#Optimization2026년 7월 18일댓글 수 로딩 중
[sglang] SGLang 성능 최적화: 과도한 Prefill CUDA Graph Padding 방지로 TTFT 개선SGLang이 과도한 Prefill CUDA Graph Padding을 방지하여 불필요한 연산을 줄이고 TTFT를 크게 개선한 최적화 과정을 분석합니다.#SGLang#CUDA Graph#LLM Serving#Performance Optimization#Prefill#TTFT#Python#Deep Learning2026년 7월 18일댓글 수 로딩 중
[sglang] [SGLang] VLM 추론 성능의 비약적 향상: Cross-request ViT Batching과 Metadata 재사용 기법SGLang에서 여러 VLM 요청의 이미지를 한 번에 처리하고, 불필요한 CPU-GPU 동기화를 제거하여 TTFT를 최대 26% 개선한 최적화 사례를 분석합니다.#VLM#SGLang#LLM-Inference#CUDA#PyTorch#Optimization2026년 7월 18일댓글 수 로딩 중
[sglang] SGLang DFlash 최적화: 호스트-디바이스 동기화 제거를 통한 추론 성능 향상DFlash의 단계별 호스트 동기화를 제거하여 CPU가 한 단계 앞서 실행되도록 최적화, 최대 13%의 토큰 처리량 향상을 달성했습니다.#SGLang#LLM#CUDA#Optimization#Triton2026년 7월 18일댓글 수 로딩 중
[sglang] SM120 Blackwell에서 DeepSeek-V4 모델 서빙 최적화: FlashInfer MXFP4 MoE 도입 및 메모리 절감SM120 GPU에서 DeepSeek-V4 모델 서빙 시 발생하던 문제를 해결하고 성능을 개선한 PR 분석.#sglang#DeepSeek-V4#SM120#Blackwell#FlashInfer#MXFP4#MoE#최적화#성능 개선#메모리 절감2026년 7월 18일댓글 수 로딩 중
[onnxruntime] ONNX Runtime: Arm64 KleidiAI 기반 FP16 GEMM 및 Convolution 최적화Arm64 환경에서 KleidiAI를 활용한 FP16 GEMM 및 Convolution 연산 가속화 및 MLAS API 확장#ONNX Runtime#Arm64#KleidiAI#FP16#Optimization2026년 7월 17일댓글 수 로딩 중