[논문리뷰] Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090본 논문은 대규모 언어 모델(LLM)의 pretraining 비용이 지나치게 높아 학계나 소규모 연구실의 접근성이 떨어진다는 문제 의식에서 출발합니다.#Review#Large Language Models#Pretraining#Cost-Efficiency#RTX 5090#FP8#MuonH#Curriculum Model Averaging2026년 8월 30일댓글 수 로딩 중