[논문리뷰] Beyond Solver Verdicts: Generative Reward Models for Autoformalization본 논문은 신경기호주의(Neurosymbolic) 시스템에서 solver가 코드의 실행 가능성만을 보장할 뿐, 자연어 문제와 공식 언어 간의 정확한 의미적 대응을 보장하지 못한다는 근본적인 취약점을 다룹니다.#Review#Autoformalization#Generative Verification#Verdict-Preserving-Unfaithfulness#SMT Solver#Reward Modeling#Neurosymbolic Systems2026년 9월 10일댓글 수 로딩 중
[논문리뷰] Hindsight Credit Assignment for Long-Horizon LLM Agents본 논문은 Long-Horizon, Multi-Step 태스크에서 희소한 보상(Sparse Rewards) 으로 인해 LLM 에이전트 가 겪는 Credit Assignment 의 어려움을 해결하는 것을 목표로 합니다.#Review#LLM Agents#Reinforcement Learning#Credit Assignment#Hindsight Credit Assignment#Policy Optimization#Sparse Rewards#Long-Horizon Tasks#Generative Verification2026년 3월 11일댓글 수 로딩 중