[논문리뷰] Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift본 논문은 LLM이 학습 시 의존한 패턴으로 인해 생성 단계에서 발생하는 환각(hallucination) 문제를 해결하고자 합니다.#Review#Token-Level Off-Policy Learning#Faithful Generation#Distribution Shift#LoRA#Conditional Steering#LLM Alignment#Hallucination2026년 7월 20일댓글 수 로딩 중