[논문리뷰] Multi-Turn On-Policy Distillation with Prefix Replay본 논문은 에이전트 기반 학습(Agentic Tasks)에서 Multi-Turn On-Policy Distillation (OPD)이 겪는 높은 비용과 효율성 문제를 해결하고자 합니다. 기존 OPD는 매 업데이트마다 학생 모델이 환경과 상호작용하고 교사 모델을 조회해야 하므로, 환경 배포 및 추론 비용이 매우 높습니다 .#Review#On-Policy Distillation#Knowledge Distillation#Multi-Turn#Agentic Tasks#Prefix Replay#Distribution Shift2026년 7월 23일댓글 수 로딩 중
[논문리뷰] LLM-as-a-Verifier: A General-Purpose Verification Framework본 논문은 대규모 언어 모델의 성능 향상을 위한 핵심 축으로서 'Verification'이 충분히 탐구되지 않았다는 문제의식에서 출발합니다. 기존의 표준적인 LM Judge 모델은 점수 분포를 단일의 Discrete한 토큰으로 압축함으로써 평가의 변별력이 낮아지고 Tie(동점) 비율이 높아지는 한계가 있습니다 .#Review#Verification Scaling#Probabilistic Formulation#Logit Expectation#Score Granularity#Repeated Evaluation#Criteria Decomposition#Agentic Tasks2026년 7월 6일댓글 수 로딩 중
[논문리뷰] Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic tasks in Real-World Professional Fields본 연구는 기존 에이전트 벤치마크가 지나치게 단순하거나, 실제 전문 업무의 복잡성을 충분히 반영하지 못한다는 한계를 해결하고자 합니다. 기존의 단기적인 작업 위주 평가는 실세계 환경에서 요구되는 고도의 Planning 능력과 Error Correction 능력을 측정하는 데 한계가 있습니다.#Review#Computer-use Agents#Long-Horizon Evaluation#Real-World Workflows#Agentic Tasks#Benchmark Platform#Professional Fields2026년 6월 9일댓글 수 로딩 중