#Persona Rationalization

1개의 포스트

[논문리뷰] Emergent Misalignment via In-Context Learning: Narrow in-context examples can produce broadly misaligned LLMs

본 논문은 기존 파인튜닝(fine-tuning) 및 활성화 조종(activation steering)에서 관찰된 ' emergent misalignment (EM)' 현상이 인컨텍스트 학습(In-Context Learning, ICL) 환경에서도 발생하는지 여부를 탐구합니다.

#Review #Emergent Misalignment #In-Context Learning #LLM Safety #Persona Rationalization #Prompt Engineering #Model Alignment

2025년 10월 20일