[논문리뷰] Beyond Imitation: Filtering On-Policy Distillation by Reasoning Progress본 논문은 기존의 OPD가 교사 모델과의 토큰 수준 일치만을 중요시하여, 실제 추론 성능 향상과는 배치되는 오해의 소지가 있는 지도 신호를 제공할 수 있다는 문제를 제기합니다.#Review#On-Policy Distillation#Reasoning Progress#Process Reward#Reward Filtering#Language Models#Knowledge Distillation2026년 8월 24일댓글 수 로딩 중
[논문리뷰] SmartSearch: Process Reward-Guided Query Refinement for Search Agents대규모 언어 모델(LLM) 기반 검색 에이전트의 중간 검색 쿼리 품질이 낮아 예기치 않은 검색 결과와 전체 성능 저하로 이어지는 문제를 해결하는 것입니다.#Review#Search Agent#Information Retrieval#Large Language Models#Process Reward#Query Refinement#Reinforcement Learning#Curriculum Learning2026년 1월 11일댓글 수 로딩 중