[논문리뷰] From Reweighting to Rewriting: Unlocking the Intervention Effects of Influential Samples in Training Data AttributionLarge Language Models (LLMs)의 다양한 Capabilities와 Behaviors는 학습 데이터로부터 형성되지만, 어떤 학습 예제가 이러한 Behaviors를 야기하는지에 대한 이해는 부족한 상태입니다.#Review#Training Data Attribution#Influence Functions#Supervised Fine-tuning#Response Rewriting#Reweighting#Language Model Abstention#Safety Refusal#Behavioral Intervention2026년 9월 9일댓글 수 로딩 중
[논문리뷰] Data-Efficient RLVR via Off-Policy Influence Guidance본 논문은 대규모 언어 모델(LLM)의 추론 능력 향상을 위한 Verifiable Rewards를 사용한 강화 학습(RLVR) 에서 데이터 선택의 비효율성을 해결하는 것을 목표로 합니다.#Review#Reinforcement Learning with Verifiable Rewards (RLVR)#Influence Functions#Data Selection#Off-Policy Learning#Curriculum Learning#Large Language Models (LLMs)#Sparse Random Projection#Data Efficiency2025년 11월 9일댓글 수 로딩 중