[논문리뷰] Understanding Reasoning from Pretraining to Post-Training본 논문은 LLM 훈련 과정에서 Pretraining 단계의 선택(모델 크기, 데이터 등)이 이후 RL 효율성에 미치는 정량적 관계를 규명하고자 한다.#Review#Reinforcement Learning#Pretraining#Scaling Law#LLM#Reasoning#Compute Allocation#Policy Evolution2026년 7월 19일댓글 수 로딩 중
[논문리뷰] DataEvolver: Self-Evolving Multi-Agent Data Construction for Text-Rich Image Generation기존의 Text-rich image 데이터 구축 방식은 고정된 텍스트 크롤링 및 필터링(Crawl-filter-freeze paradigm)에 의존하고 있어, 데이터 구축 과정에서 발생하는 다양한 실패 사례를 유의미한 정보로 활용하지 못하는 한계가 있습니다.#Review#Data Construction#Multi-Agent System#Text-Rich Image Generation#Feedback Loop#Policy Evolution2026년 6월 30일댓글 수 로딩 중