[논문리뷰] ASI-Bench: At the Dawn of Artificial Superintelligence본 연구는 기존의 LLM 벤치마크들이 모델의 급격한 성능 향상으로 인해 데이터 오염(Data Contamination)과 평가 포화(Evaluation Saturation) 문제에 직면했다는 점을 해결하고자 합니다.#Review#Artificial Superintelligence#LLM Benchmarking#Cognitive Evaluation#Reasoning Capability#Evaluation Framework2026년 8월 18일댓글 수 로딩 중
[논문리뷰] On-Policy Delta Distillation본 논문은 기존의 On-Policy Distillation (OPD) 방식이 교사 모델의 전체 출력 분포를 모방하는 데 그쳐, 추론 능력 향상에 필수적인 핵심 학습 궤적을 충분히 전달하지 못한다는 문제를 제기합니다 .#Review#Knowledge Distillation#On-Policy Distillation#Reasoning Capability#Delta Signal#LLM Post-training#Reinforcement Learning2026년 7월 19일댓글 수 로딩 중
[논문리뷰] Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards본 논문은 기존 RLVR 패러다임이 가진 sparse binary reward와 weak credit assignment 문제를 해결하여 모델의 추론 능력을 극대화하는 것을 목적으로 합니다.#Review#Reinforcement Learning#Large Language Models#Verifiable Rewards#Policy Optimization#Error Correction#Reasoning Capability2026년 5월 17일댓글 수 로딩 중
[논문리뷰] Every Activation Boosted: Scaling General Reasoner to 1 Trillion Open Language Foundation본 논문은 '모든 활성화가 추론 능력을 향상시킨다'는 원칙 아래, 1조 개의 파라미터를 가진 추론 중심의 개방형 언어 파운데이션 모델(Ling 2.0) 을 개발하는 것을 목표로 합니다.#Review#Large Language Models#Mixture-of-Experts#Reasoning Capability#Sparse Activation#Scaling Laws#FP8 Training#Efficient Training#Instruction Tuning2025년 11월 9일댓글 수 로딩 중