[논문리뷰] SkillGate: Training In-Policy Skill Selection in Long-Horizon Agents본 논문은 에이전트가 중도에 스스로 스킬을 선택하는 In-policy skill selection 과정에서 발생하는 효율성 저하 문제를 해결합니다. 기존의 보상 기반 RL은 실행 단계의 outcome에만 집중하여, 정작 중요한 선택 단계에 기여하는 토큰들에게는 거의 학습 신호가 전달되지 않는다는 치명적인 한계가 있습니다.#Review#In-Policy Skill Selection#Long-Horizon Agents#Reinforcement Learning#Credit Assignment#Policy Gradient#Agentic Benchmarks2026년 8월 19일댓글 수 로딩 중
[논문리뷰] OpenThoughts-Agent: Data Recipes for Agentic Models본 논문은 에이전트용 모델을 학습시키기 위한 데이터 큐레이션(Data Curation) 방법론이 공개적으로 거의 알려져 있지 않은 문제를 해결하고자 한다.#Review#Agentic Models#Data Curation#Supervised Fine-Tuning#Reinforcement Learning#Scaling Laws#Agentic Benchmarks2026년 6월 23일댓글 수 로딩 중
[논문리뷰] User-Oriented Multi-Turn Dialogue Generation with Tool Use at scale기존 멀티턴 도구 사용(tool-use) 데이터셋의 한계(정적, 사전 정의된 도구셋, 단일 샷 위주)를 극복하고, 실제 인간-에이전트 협업의 반복적이고 점진적인 특성을 반영하는 확장 가능한 고품질 멀티턴 대화 데이터 생성 프레임워크 를 개발하는 것이 목표입니다.#Review#Multi-Turn Dialogue Generation#Tool Use#Autonomous Agents#Large Reasoning Models#User Simulation#Synthetic Data Generation#SQL-based Tools#Agentic Benchmarks2026년 1월 13일댓글 수 로딩 중