[논문리뷰] GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks본 논문은 기존 에이전트 self-evolution 벤치마크가 실질적인 경제적 가치가 높은 도메인을 충분히 다루지 못하며, 학습-테스트 간의 인과 관계가 불분명하여 성과 향상을 신뢰하기 어렵다는 문제점을 해결하고자 합니다.#Review#Agent Self-Evolution#Benchmarking#Enterprise Workflows#Rule Hybridization#Data Contamination#Autonomous Agents2026년 8월 5일댓글 수 로딩 중
[논문리뷰] SkillX: Automatically Constructing Skill Knowledge Bases for Agents저자들은 에이전트의 경험을 계층적으로 구조화하여 재사용성을 극대화하는 SkillX 프레임워크를 제안합니다 . SkillX는 고성능 backbone 에이전트인 GLM-4.6을 사용하여 훈련 태스크를 수행하고, 성공한 trajectory로부터 Planning, Functional, Atomic 단계의 skill을 증류(distill)합니다.#Review#LLM Agents#Skill Knowledge Base#Hierarchical Representation#Autonomous Experience Learning#Agent Self-Evolution#Tool Use2026년 4월 6일댓글 수 로딩 중