[논문리뷰] CAST: Critique-Aware Supervision for Training Reliable Long-Horizon Tool-Calling Agents본 논문은 장기적인 상호작용 환경에서 LLM 에이전트의 Reliability가 심각하게 저하되는 문제를 해결하고자 한다 . 기존 에이전트는 복잡한 태스크 수행 중 사소한 실수로 인해 연쇄적인 실패를 경험하며, 일단 발생한 오류는 수정이 어려운 경우가 많다.#Review#LLM Agents#Tool-Calling#Critique-Aware Training#Long-Horizon#Reliability#Agentic Verification#Policy Optimization2026년 8월 31일댓글 수 로딩 중
[논문리뷰] PolicyGuard: A Dialogue-Grounded Sub-Agent Verifier for Policy Adherence in LLM Agents본 논문은 기존의 Safeguarding 기술이 주로 악의적인 콘텐츠나 jailbreak 방지에만 치중하고 있어, 에이전트의 복잡한 절차적 정책 준수(Policy adherence) 문제를 해결하는 데 한계가 있다는 점을 지적합니다 .#Review#LLM Agents#Policy Adherence#Dialogue-Grounded#Verifier#Tool-Calling#Safeguarding#Procedural Compliance2026년 6월 29일댓글 수 로딩 중