[논문리뷰] MetroLLM-Bench: Evaluating Language Models as Transit Kiosk Runtimes본 논문은 transit kiosk의 정책 레이어로서 언어 모델을 도입할 때 발생하는 운영적 한계를 평가하고 해결하는 것을 목표로 한다.#Review#MetroLLM-Bench#Transit Kiosk Runtimes#Parameter-Efficient Fine-Tuning (PEFT)#Qwen#ReAct#Function Calling#Benchmark2026년 9월 10일댓글 수 로딩 중
[onnxruntime] GPU 점유율의 미학: Qwen MTP를 위한 ONNX Runtime NVFP4 GEMV 최적화 분석H200 GPU에서 Qwen 모델의 GEMV 성능을 10% 이상 향상시킨 타일링(Tiling) 및 K-Split 최적화 전략을 심층 분석합니다.#CUDA#ONNXRuntime#Optimization#LLM#Qwen#GPU-Architecture2026년 8월 29일댓글 수 로딩 중
[sglang] [Diffusion] Qwen 모델의 Varlen Mask 메타데이터 호스트 측 빌드 최적화Qwen Diffusion 모델에서 GPU 동기화를 유발하던 Varlen Mask 메타데이터 생성을 호스트 측으로 옮겨 성능을 개선합니다.#SGLang#Diffusion#Performance Optimization#PyTorch#Varlen Attention#Qwen2026년 8월 7일댓글 수 로딩 중
[논문리뷰] Jina-VLM: Small Multilingual Vision Language Model본 연구는 VLM의 실용적 배포를 저해하는 두 가지 주요 과제를 해결하는 것을 목표로 합니다. 첫째, 비전 적응 과정에서 발생하는 다국어 성능 저하 문제를 극복하고, 둘째, 고품질 VLM 훈련 및 배포의 높은 계산 비용을 줄여 접근성을 높이는 것입니다.#Review#Vision-Language Model#Multilingual VLM#Small VLM#Visual Question Answering#Attention Pooling#Image Tiling#SigLIP#Qwen2025년 12월 3일댓글 수 로딩 중