[논문리뷰] Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction본 논문은 기존 코딩 에이전트 벤치마크들이 직면한 데이터 오염(Contamination)과 평가의 편향성 문제를 해결하고자 합니다. SWE-bench와 같은 기존 공개 벤치마크는 문제와 해결책이 온라인에 공개되어 있어 에이전트가 이를 기억하여 점수를 높이는 Memorization 문제가 발생합니다.#Review#Coding Agent#Benchmark#Contamination-Resistance#Software Engineering#Web Development#Office Workflow#Security Analysis2026년 7월 23일댓글 수 로딩 중
[논문리뷰] Your Agent, Their Asset: A Real-World Safety Analysis of OpenClaw본 논문은 현대 개인용 AI 에이전트가 고도의 자동화와 개인화를 위해 사용하는 Persistent State 가 심각한 보안 취약점을 초래한다는 문제를 해결하고자 합니다.#Review#Personal AI Agents#Persistent State#Security Analysis#CIK Taxonomy#Prompt Injection#Agent Safety#Evolution-Safety Tradeoff2026년 4월 6일댓글 수 로딩 중