[논문리뷰] Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal본 연구는 기존의 LLM 안전 정렬 방식이 주제 전체를 포괄적으로 거부하는 '블런트(Blunt)한 방식'으로 작동하여, 실제 배포 환경에서 필요한 세밀한 안전 정책을 반영하지 못하는 문제를 해결합니다.#Review#LLM Safety#Self-Distillation#Narrow-Boundary#Data-Coverage#Refusal Alignment#Over-refusal2026년 9월 7일댓글 수 로딩 중
[논문리뷰] Refuse without Refusal: A Structural Analysis of Safety-Tuning Responses for Reducing False Refusals in Language Models본 논문은 LLM의 안전 정렬(Safety Alignment) 과정에서 발생하는 False Refusal 문제를 데이터 구조적 관점에서 해결하고자 합니다.#Review#False Refusals#Safety Tuning#Large Language Models#Rationale-Only#Alignment#Over-refusal2026년 9월 6일댓글 수 로딩 중