[논문리뷰] Refuse without Refusal: A Structural Analysis of Safety-Tuning Responses for Reducing False Refusals in Language Models본 논문은 LLM의 안전 정렬(Safety Alignment) 과정에서 발생하는 False Refusal 문제를 데이터 구조적 관점에서 해결하고자 합니다.#Review#False Refusals#Safety Tuning#Large Language Models#Rationale-Only#Alignment#Over-refusal2026년 9월 6일댓글 수 로딩 중