[논문리뷰] AISPA: User-Centric System Prompt Auditing for Large Language Model Applications본 논문은 상업용 AI 시스템에서 System Prompt의 불투명성과 그로 인한 사용자 신뢰 및 책임성 결여 문제를 해결하고자 합니다. 현재 System Prompt는 모델의 행동을 규정하는 핵심 요소임에도 불구하고, 외부 공개가 제한적이며 독립적인 감사(Audit) 과정이 전무합니다.#Review#System Prompt#AI Auditing#User-Centric#LLM Safety#Transparency#Governance2026년 8월 2일댓글 수 로딩 중
[논문리뷰] Eliciting Secret Knowledge from Language Models이 논문은 AI 모델이 명시적으로 표현하지 않는 내재된 지식, 즉 '비밀 지식(secret knowledge)'을 발견하는 문제인 비밀 추출(secret elicitation) 을 다룹니다.#Review#Language Models#Secret Elicitation#Mechanistic Interpretability#Black-box Methods#White-box Methods#AI Auditing#Model Organisms#Prefill Attacks2025년 10월 2일댓글 수 로딩 중