[논문리뷰] LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget본 연구는 고정된 GPU 자원 내에서 million-token context를 지원하는 RL post-training의 한계를 극복하고자 수행되었습니다.#Review#Long-Context#GRPO#RL Post-training#Fixed GPU Budget#Tensor Lifetime#Architecture-Aware Execution2026년 7월 16일댓글 수 로딩 중