[논문리뷰] Don't Drop Dropout: Optimizing Layer Sparsity for Efficient LLM Training and Inference본 논문은 LLM pre-training에 막대한 computational resource가 소요되며, time-to-accuracy 개선이 수백만 달러의 비용 절감과 탄소 배출량 감소로 이어질 수 있다는 문제의식에서 출발합니다.#Review#Layer Dropout#Stochastic Depth#LLM Training#Inference Optimization#Structured Sparsity#Hyperparameter Tuning#Early Exit#Self-Speculative Decoding2026년 9월 6일댓글 수 로딩 중