[논문리뷰] Trust Region Policy Distillation본 논문은 기존 On-Policy Distillation (OPD) 방식이 가진 구조적 불안정성과 낮은 샘플 효율성 문제를 해결하기 위해 고안되었습니다.#Review#On-Policy Distillation#Trust Region#Policy Gradient#Proximal Teacher#Gradient Variance#Mathematical Reasoning#Post-training2026년 7월 12일댓글 수 로딩 중
[논문리뷰] Towards Mechanistically Understanding Why Memorized Knowledge Fails to Generalize in Large Language Model Finetuning본 논문은 LLM이 새로운 지식을 성공적으로 기억함에도 불구하고, 이를 활용한 downstream 추론 작업에서는 낮은 성능을 보이는 문제를 다룬다 . 기존 연구들은 주로 모델의 파라미터 업데이트나 지식 편집에 집중했으나, 지식 저장과 추론 간의 인과적 단절을 메커니즘적으로 설명하는 데에는 한계가 있었다.#Review#LLM Finetuning#Knowledge Generalization#Mechanistic Interpretability#Self-Patching#Knowing-Using Gap#Knowledge-Circuit Misalignment2026년 7월 12일댓글 수 로딩 중
[논문리뷰] Self-Guided Test-Time Training for Long-Context LLMs본 논문은 긴 문맥을 처리하는 LLM의 성능이 문맥의 길이에 따라 저하되는 현상이 단순히 문맥을 모두 담지 못해서가 아니라, 질문에 필요한 핵심 증거를 식별하고 활용하는 능력이 부족하기 때문임을 지적합니다.#Review#Long-Context LLMs#Test-Time Training (TTT)#Evidence Selection#Parameter Adaptation#Context Reasoning#Signal-to-Noise Ratio2026년 7월 12일댓글 수 로딩 중
[논문리뷰] Scalable Visual Pretraining for Language Intelligence본 연구는 대규모 언어 모델이 문서의 시각적 요소를 평문으로 변환할 때 발생하는 정보 손실을 해결하기 위해 시각적 문서 자체를 직접 학습하는 VP를 제안한다.#Review#Visual Pretraining#Foundation Models#Multimodal Learning#Scientific Reasoning#Representation Alignment#Autoregressive Training2026년 7월 12일댓글 수 로딩 중
[논문리뷰] Phone Segmentation and Recognition through Phonological Activation Mapping본 논문은 현대의 음성학적 분석 모델이 분절(segmentation)과 인식(recognition)을 별도의 복잡한 모델로 다루며, 다량의 라벨링 데이터와 계산 자원을 요구하는 문제를 해결하고자 한다.#Review#Self-supervised Speech Models#Phonological Activation Mapping#Phone Segmentation#Phone Recognition#Gradient-descent-free#Sample-efficiency#Generalization2026년 7월 12일댓글 수 로딩 중
[논문리뷰] PanoWorld: Real-World Panoramic Generation본 논문은 기존 파노라마 월드 모델들이 복잡한 야외 환경에서 공간적·시간적 일관성 및 물리적 정확성을 유지하는 데 한계가 있다는 문제 의식에서 출발한다.#Review#Panoramic Generation#World Model#Diffusion Model#Rotation Equivariance#Dense Panoramic Ray-Conditioning#Geometry-aware Memory#World3602026년 7월 12일댓글 수 로딩 중
[논문리뷰] MedPMC: A Systematic Framework for Scaling High-Fidelity Medical Multimodal Data for Foundation Models본 논문은 의료 AI 모델의 성능을 제한하는 핵심 원인인 대규모 고품질 의료 멀티모달 데이터의 부족 문제를 해결하고자 합니다.#Review#Multimodal Foundation Models#Medical Data Curation#PubMed Central#Image-Text Pairs#Vision-Language Models#Clinical Transfer Validation#High-Fidelity Pipeline2026년 7월 12일댓글 수 로딩 중
[논문리뷰] Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading본 논문은 기존의 에이전트 벤치마크가 지나치게 단기적인 작업에 치중되어 있으며, 평가 방식이 최종 결과에만 의존한다는 한계를 해결하고자 한다.#Review#Autonomous Agents#Long-Horizon Tasks#Terminal Benchmarks#Dense Reward-Based Grading#Subtask-based Evaluation#Failure Analysis#Agentic Workflow2026년 7월 12일댓글 수 로딩 중
[논문리뷰] KronQ: LLM Quantization via Kronecker-Factored Hessian본 연구는 기존의 PTQ 방법들이 입력 activation 통계량(HX)만을 활용하여 출력 채널 간의 비대칭적인 민감도를 간과한다는 점을 핵심 문제로 지적합니다.#Review#Post-Training Quantization#Kronecker-Factored Hessian#Gradient Covariance#Mixed-Precision Allocation#Bidirectional Incoherence Processing#LLM2026년 7월 12일댓글 수 로딩 중
[논문리뷰] From RGB Generation to Dense Field Readout: Pixel-Space Dense Prediction with Text-to-Image Models본 논문은 대규모 T2I 모델의 우수한 사전 학습 지식을 활용하면서도, 불필요한 generative output interface를 제거하는 최적의 dense prediction 구조를 정의하고자 한다 .#Review#Dense Prediction#Text-to-Image Models#Field Readout#LoRA#Vision Transformers#RGB-native2026년 7월 12일댓글 수 로딩 중
[논문리뷰] Flow-ERD: Agent-type Aware Flow Matching with Entropy-Regularized Distillation for Diverse Traffic Simulation본 논문은 자율주행 시뮬레이션에서 realism과 diversity라는 두 핵심 요소가 서로 상충되는 현상을 해결하고자 합니다 .#Review#Multi-Agent Simulation#Flow Matching#Entropy-Regularized Distillation#Autonomous Driving#Traffic Simulation#Realism-Diversity Pareto2026년 7월 12일댓글 수 로딩 중
[논문리뷰] A Sovereign, Open-Source Foundation Model for German and English본 연구는 기존 오픈 소스 모델들이 가진 세 가지 핵심적인 한계를 해결하고자 합니다. 첫째, 상당수의 '오픈' 모델들이 실제로는 가중치만 공개하고 데이터와 학습 레시피를 불투명하게 처리하여 재현성을 저해하고 있습니다.#Review#Foundation Model#Mixture-of-Experts#Mamba-Transformer#Long-context#Sovereign AI#German-English#Open-Source2026년 7월 12일댓글 수 로딩 중
[sglang] SGLang, MoonViT의 최대 시퀀스 길이 메타데이터 재사용으로 성능 개선SGLang의 MoonViT 구현에서 최대 시퀀스 길이 계산 시 GPU-호스트 동기화를 제거하여 성능을 향상시켰습니다.#SGLang#최적화#성능 개선#MoonViT#FlashAttention2026년 7월 12일댓글 수 로딩 중
[axolotl] Axolotl의 SinkGD 최적화: Triton 커널과 스펙트럼 정규화로 성능 극대화SinkGD 옵티마이저에 도입된 Triton 커널, 스펙트럼 정규화, 그리고 MD-sphere 기법을 통한 학습 효율 및 속도 개선 분석.#Axolotl#SinkGD#Triton#DeepLearning#Optimization2026년 7월 12일댓글 수 로딩 중
[vllm] vLLM에서 Qwen MoE 모델의 All-Reduce를 Reduce-Scatter로 최적화하기vLLM의 Qwen MoE 모델에서 불필요한 All-Reduce 연산을 Reduce-Scatter로 대체하여 통신 오버헤드를 줄이고 성능을 개선했습니다.#vLLM#LLM#MoE#Distributed Training#Optimization2026년 7월 12일댓글 수 로딩 중
[vllm] vLLM 하이브리드 모델을 위한 혁신: Partial Prefix Cache Hit 구현 분석vLLM이 하이브리드 모델(Mamba+Attention)에서 물리 블록보다 작은 단위의 캐시 히트를 지원하여 추론 지연시간을 약 30% 단축한 기술적 비결을 살펴봅니다.#vLLM#LLM-Inference#Prefix-Caching#Mamba#Hybrid-Model#Optimization2026년 7월 12일댓글 수 로딩 중
[flashinfer] FlashInfer MoE 최적화: PDL 스케줄링 개선 및 GEMM2 균형 잡힌 스토어 구현FlashInfer의 MoE 커널에서 PDL 시작 지연을 줄이고 GEMM2의 부분 타일 스토어를 워프 간 인터리빙하여 성능을 향상시킨 최적화 분석.#FlashInfer#MoE#CUDA#CuTe#GEMM#Performance2026년 7월 11일댓글 수 로딩 중
[loki] Grafana Loki의 안정성 향상: Circuit Breaker 도입을 통한 트래픽 제어Grafana Loki의 Distributor에 Circuit Breaker를 도입하여 과부하 시 트래픽을 효율적으로 차단하고 시스템 안정성을 확보하는 방법.#Grafana Loki#Go#Circuit Breaker#Distributed Systems#Reliability2026년 7월 10일댓글 수 로딩 중
[ray] [Ray 최적화] 액터 제출 병목 현상 해결: Placement Group 번들 정보 캐싱으로 GCS 부하 줄이기Ray 액터 제출 시 GCS 쿼리 병목을 해결하기 위해 Placement Group 번들 정보를 로컬 캐싱하여 성능을 대폭 개선한 최적화.#Ray#Optimization#Performance#GCS#PlacementGroup#Actor#Scalability#Python2026년 7월 10일댓글 수 로딩 중
[transformers] Hugging Face Transformers의 Flash Attention 성능 회귀(Regression) 해결Flash Attention 유틸리티에서 발생한 성능 저하 문제를 .item() 호출을 통해 해결한 사례 분석#HuggingFace#Transformers#FlashAttention#PerformanceOptimization#PyTorch2026년 7월 10일댓글 수 로딩 중