[논문리뷰] OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution본 논문은 현대의 AI 에이전트가 단발성 작업이 아닌 장기적인(Long-horizon) 워크플로우에서 동작함에 따라 발생하는 누적된 안전성 위협을 규명하고자 합니다 .#Review#Agent Safety#Red Teaming#Environment Evolution#Long-Horizon#Markov Hypergraph#Robustness2026년 8월 12일댓글 수 로딩 중
[논문리뷰] Agent Safety Should Be a Runtime Contract본 논문은 AI 에이전트의 안전성을 모델 학습(RLHF, DPO 등)만으로 확보하려는 기존의 관행이 구조적으로 불충분함을 지적합니다.#Review#Agent Safety#Runtime Contract#Preventive Mechanism#Evidential Mechanism#Evidence-gated Submission#Trajectory Schema#Defense-in-depth2026년 8월 12일댓글 수 로딩 중
[논문리뷰] When Lower Privileges Suffice: Investigating Over-Privileged Tool Selection in LLM Agents본 논문은 LLM 에이전트가 작업 수행 시 불필요하게 높은 권한의 도구를 선택하는 Over-privileged Tool Selection의 심각성과 그 기저의 행동적 원인을 규명합니다 .#Review#LLM Agents#Tool Selection Bias#Least Privilege#Privilege-Aware Post-Training#Agent Safety#ToolPrivBench2026년 6월 24일댓글 수 로딩 중
[논문리뷰] AgentDoG 1.5: A Lightweight and Scalable Alignment Framework for AI Agent Safety and Security본 논문은 현대 에이전트 시스템(예: OpenClaw)의 강력한 실행 능력으로 인해 기존 안전성 프레임워크가 대응하기 어려운 광범위한 위험 요소가 발생하고 있다는 문제의식에서 출발한다. 기존 연구들은 주로 단일 시점의 입력이나 출력만을 평가하여 궤적 전체에 누적되는 복합적인 위험 패턴을 탐지하는 데 한계가 있었다 .#Review#Agent Safety#Alignment Framework#AgentDoG 1.5#Trajectory-level Diagnosis#Reinforcement Learning#Online Guardrail2026년 5월 28일댓글 수 로딩 중
[논문리뷰] Your Agent, Their Asset: A Real-World Safety Analysis of OpenClaw본 논문은 현대 개인용 AI 에이전트가 고도의 자동화와 개인화를 위해 사용하는 Persistent State 가 심각한 보안 취약점을 초래한다는 문제를 해결하고자 합니다.#Review#Personal AI Agents#Persistent State#Security Analysis#CIK Taxonomy#Prompt Injection#Agent Safety#Evolution-Safety Tradeoff2026년 4월 6일댓글 수 로딩 중
[논문리뷰] AgentHazard: A Benchmark for Evaluating Harmful Behavior in Computer-Use Agents저자들은 위험 카테고리(Risk categories)와 공격 전략(Attack strategies)을 포함한 체계적인 분류법을 설계하고, 이를 바탕으로 2,653개의 유해한 작업 인스턴스를 구축하였습니다 . 제안된 AgentHazard는 에이전트가 샌드박스 환경 내에서 작업을 수행하게 한 뒤, 전체 실행 경로를 심사하여 유해성 여부를 판별합니다.#Review#Computer-Use Agents#Agent Safety#Benchmark#Harmful Behavior#Trajectory-level Evaluation#Multi-step Reasoning2026년 4월 5일댓글 수 로딩 중
[논문리뷰] OS-Sentinel: Towards Safety-Enhanced Mobile GUI Agents via Hybrid Validation in Realistic Workflows본 연구는 복잡한 모바일 GUI 환경에서 자율 에이전트의 안전 문제 , 특히 시스템 침해 및 개인 정보 유출과 같은 예상치 못한 위험을 효과적으로 탐지하는 문제를 해결하고자 합니다. 기존의 안전 탐지 인프라와 전략이 미흡한 점을 개선하여, 모바일 에이전트 안전 연구의 체계적인 기반을 마련하는 것이 목표입니다.#Review#Mobile GUI Agents#Agent Safety#Hybrid Detection#Formal Verification#VLM-based Contextual Judgment#Safety Benchmark#Risk Detection2025년 11월 9일댓글 수 로딩 중