[transformers] Hugging Face Transformers, GGUF 추론 속도 향상을 위한 대대적인 리팩토링Hugging Face Transformers 라이브러리가 GGUF 모델 추론 속도 향상을 위해 대대적인 리팩토링을 진행했습니다.#transformers#GGUF#inference#optimization#quantization#llama.cpp#kernels2026년 9월 4일댓글 수 로딩 중
[uv] uv의 잠금 파일 의존성 그래프 순회 최적화: 해싱에서 정수 인덱싱으로uv가 잠금 파일 의존성 그래프 순회 시 해싱 비용을 줄이기 위해 정수 인덱싱을 도입한 최적화 분석.#uv#rust#optimization#performance#dependency-resolution#graph-traversal#software-engineering2026년 8월 31일댓글 수 로딩 중
[sglang] LingBot Video 성능 개선: 수동 RMSNorm 체인을 Triton 커널로 최적화하기LingBot Video의 수동 RMSNorm 연산을 Triton 커널로 대체하여 성능을 25% 이상 향상시킨 PR 분석#sglang#diffusion#optimization#Triton#RMSNorm#performance2026년 8월 24일댓글 수 로딩 중
[openclaw] OpenConnect Gateway 성능 최적화: 연결 ID 기반 인덱싱 도입OpenConnect Gateway의 WebSocket 통신 성능을 개선하기 위해 연결 ID 기반 인덱싱을 도입한 PR 분석.#performance#optimization#backend#websocket#golang2026년 8월 23일댓글 수 로딩 중
[cpython] contextlib.contextmanager 최적화: next() 대신 for 루프 사용contextlib.contextmanager에서 next() 호출을 for 루프로 변경하여 성능을 개선한 PR 분석#python#optimization#contextlib#performance2026년 8월 10일댓글 수 로딩 중
[cpython] asyncio 프로토콜 데이터 처리 최적화: O(N^2)에서 O(N)으로asyncio 프로토콜의 데이터 처리 방식 개선으로 성능을 O(N^2)에서 O(N)으로 향상시켰습니다.#python#asyncio#performance#optimization#cpython2026년 7월 25일댓글 수 로딩 중
[uv] uv-pep440: 일반적인 버전 문자열 파싱 2배 가속화 최적화 분석uv-pep440 크레이트에서 `x.y.z` 형태의 버전 문자열 파싱을 최적화하여 성능을 2배 향상시킨 PR 분석.#Rust#uv#pep440#optimization#performance#parsing#software-engineering2026년 7월 7일댓글 수 로딩 중
[uv] uv, 휠 파일명 파싱 최적화: 중복 작업 제거와 성능 향상uv가 휠 파일명 파싱 시 중복되는 패키지 이름 정규화 작업을 제거하여 성능을 개선한 PR을 분석합니다.#uv#performance#optimization#python#wheel2026년 7월 4일댓글 수 로딩 중
[uv] uv의 성능 최적화: BTreeSet에서 Vec으로의 전환을 통한 site-packages 스캔 오버헤드 개선uv의 site-packages 스캔 과정에서 BTreeSet 대신 Vec을 사용하여 메모리 할당 오버헤드를 줄이고 성능을 최적화한 사례를 분석합니다.#uv#rust#performance#optimization#python2026년 7월 3일댓글 수 로딩 중
[uv] uv 의존성 해결 성능 최적화: PubGrub 반복 작업 재사용으로 8% 이상 속도 향상uv resolver가 PubGrub 반복 과정에서 발생하는 중복 작업을 제거하여 의존성 해결 속도를 최대 8.1% 향상시킨 최적화 기법 분석.#uv#dependency resolution#PubGrub#optimization#Rust#performance#caching2026년 6월 27일댓글 수 로딩 중
[sglang] sglang diffusion 모델 성능 향상: Cache-DiT와 torch.compile의 최적화된 적용 순서sglang diffusion 모델의 첫 번째 실제 요청 지연 시간을 43.77% 단축한 Cache-DiT와 torch.compile 적용 순서 최적화 분석#sglang#diffusion#torch.compile#optimization#performance#AI2026년 5월 15일댓글 수 로딩 중
[transformers] Hugging Face Transformers: MoE 및 FP8 커널 최적화를 통한 성능 향상Hugging Face Transformers 라이브러리의 MoE 및 FP8 커널 최적화를 통해 성능을 개선하고 안정성을 높인 PR 분석#transformers#optimization#MoE#FP8#performance#kernel2026년 5월 4일댓글 수 로딩 중
[sglang] LTX2.3 HQ Denoising 성능 최적화: Attention Skip을 활용한 효율적인 모델 호출LTX2.3 HQ 가이드 Denoising 과정에서 불필요한 Attention 계산을 건너뛰어 성능을 개선했습니다.#sglang#optimization#performance#deep learning#denoising#attention2026년 5월 3일댓글 수 로딩 중
[cpython] Python subprocess.communicate() 타임아웃 성능 개선: 느린 자식 프로세스 응답 방식 변경subprocess.communicate()의 타임아웃 테스트에서 발생하는 긴 지연 시간을 해결하여 테스트 속도를 크게 향상시킵니다.#python#subprocess#performance#testing#optimization2026년 4월 26일댓글 수 로딩 중
[cpython] Python `subprocess` 테스트 최적화: `communicate()` 타임아웃 테스트 속도 향상`subprocess.communicate()` 타임아웃 테스트의 런타임을 30초에서 1초 미만으로 단축하는 최적화 분석.#Python#subprocess#testing#optimization#performance#socket2026년 4월 26일댓글 수 로딩 중
[vLLM] Compilation Fusion Passes: 컴파일 퓨전 최적화vLLM의 torch.compile 기반 커널 퓨전 패스를 분석한다. RMSNorm+Quantization 퓨전, 패턴 매칭 기반 최적화의 구현을 살펴본다.#vllm#compilation#fusion#torch-compile#optimization2026년 4월 8일댓글 수 로딩 중
[vLLM] CUDA Graphs: 커널 런칭 오버헤드 제거vLLM이 CUDA Graph를 활용하여 디코드 단계의 커널 런칭 오버헤드를 제거하는 방법을 CUDAGraphWrapper와 GPUModelRunner 코드 레벨에서 분석한다.#vllm#CUDA graphs#optimization#GPU#kernel launch2026년 4월 7일댓글 수 로딩 중
[vLLM] torch.compile 통합: PyTorch 컴파일러vLLM이 torch.compile을 어떻게 통합하여 모델 포워드 패스를 최적화하는지, 커스텀 백엔드와 Piecewise 컴파일 전략을 코드 레벨에서 분석한다.#vllm#torch.compile#compilation#inductor#optimization2026년 4월 7일댓글 수 로딩 중
[sglang] sglang 성능 최적화: torch.compile 퓨전 복원을 통한 TopK 후처리 개선sglang의 TopK 후처리에서 torch.compile 퓨전을 복원하여 성능을 개선한 PR 분석#sglang#performance#optimization#torch.compile#fusion#CUDA2026년 4월 7일댓글 수 로딩 중