[논문리뷰] Steering Geometry: Validating Human Value Geometry in LLM Steering Space현재 대규모 언어 모델(LLM)의 행동 제어를 위한 Activation Steering은 효과적인 방법으로 부상했지만, Steering 벡터가 일관된 의미론적 구조(Semantic Structure)를 인코딩하는지, 아니면 단순히 행동별 단축키(Behavior-specific Shortcuts)를 이용하는지에 대한 명확한 이해가 부족합니다.#Review#LLM Steering#Activation Steering#Human Values#Value Geometry#Schwartz Theory#Moral Foundations Theory#Inference-time Control2026년 9월 8일댓글 수 로딩 중