[논문리뷰] HarvestBench: Measuring Whether LLM Agents Will Pay to Avoid Killing Animals본 논문은 LLM이 현실 세계의 물리적 시스템을 제어할 때 목표 달성만을 추구하며 발생하는 부작용을 얼마나 고려하는지 정량적으로 측정하고자 합니다.#Review#LLM Agents#AI Safety#Moral Reasoning#HarvestBench#Side Effects#Benchmark2026년 9월 6일댓글 수 로딩 중
[논문리뷰] Beyond Human Judgment: A Bayesian Evaluation of LLMs' Moral Values Understanding본 연구는 대규모 언어 모델(LLMs)이 인간과 비교하여 도덕적 차원을 어떻게 이해하는지 평가하는 것을 목표로 합니다. 특히, 기존의 확정론적 정답(ground-truth) 가정에서 벗어나 어노테이터 불일치를 베이지안 방식으로 모델링 하여 인간의 내재된 불확실성과 모델의 도메인 민감도를 포착하고자 합니다.#Review#Large Language Models#Moral Reasoning#Bayesian Evaluation#Uncertainty Quantification#Natural Language Processing#Soft Labels2025년 8월 20일댓글 수 로딩 중