[논문리뷰] FlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning Experience본 논문은 LLM의 reasoning 모델이 스스로의 경험을 통해 개선(self-improvement)할 때 발생하는 '취약한 내부 루프(fragile inner loop)' 문제를 해결하고자 합니다.#Review#FlowBalance#Self-Improvement#Verifier-Grounded#Trajectory Balance#Privileged Hindsight#Reinforcement Learning2026년 9월 7일댓글 수 로딩 중