[논문리뷰] onPanda: Efficient Annotation of On-Policy Alignment Data for LLMs and Agents via Token-Level CorrectionLLM alignment 및 agent 학습을 위한 고품질 data 확보는 여전히 핵심적인 bottleneck입니다.#Review#Token-Level Correction#LLM Alignment#Agent Trajectories#On-Policy Data#Fine-grained Supervision#SFT Data#Multimodal Annotation2026년 9월 21일댓글 수 로딩 중