#Guardrails

2개의 포스트

[논문리뷰] LiSA: Lifelong Safety Adaptation via Conservative Policy Induction

본 논문은 배포된 AI 에이전트의 안전 가드레일이 고정된 사전 정의(pre-deployment definition)만으로는 변화하는 환경과 개별적인 로컬 맥락의 안전 위험을 효과적으로 제어하지 못하는 문제를 해결합니다.

#Review #Lifelong Safety Adaptation #Guardrails #Conservative Policy Induction #Structured Policy Memory #Confidence-gated Reuse #Conflict-aware Local Refinement #Sparse Feedback

2026년 5월 14일

[논문리뷰] VeriGuard: Enhancing LLM Agent Safety via Verified Code Generation

본 논문은 자율 AI 에이전트, 특히 LLM 기반 에이전트의 배포로 인해 발생하는 안전, 보안, 프라이버시 위험을 해결하고자 합니다.

#Review #LLM Agents #Safety #Formal Verification #Code Generation #Runtime Monitoring #Security #Guardrails #Policy Enforcement

2025년 10월 8일