[논문리뷰] HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?본 논문은 Agent가 연구용 프로토타입에서 실제 배포 도구로 진화함에 따라, Agent의 성능을 좌우하는 외부 인프라인 Harness의 중요성을 규명하고 이를 모델이 직접 개발할 수 있는지 검증하고자 합니다.#Review#Agent Harness#LLM#Software Engineering#Benchmark#Agent Evolution#Code Generation2026년 9월 2일댓글 수 로딩 중
[논문리뷰] Latent On-Policy Self-Distillation본 논문은 기존 OPSD 방식이 의존하는 수작업(hand-crafted) 방식의 privileged context가 모델의 확장성과 범용적 자가 진화(self-evolving)를 저해하는 핵심 병목임을 지적합니다.#Review#On-Policy Self-Distillation#Latent Context#Agent Evolution#Reinforcement Learning#End-to-End Learning#Privileged-Margin Constraint2026년 8월 16일댓글 수 로딩 중
[논문리뷰] Managing Procedural Memory in LLM Agents: Control, Adaptation, and Evaluation본 연구는 LLM 기반 에이전트가 현실 업무에서 반복적인 절차를 수행할 때 발생하는 Procedural Memory의 재사용성 문제를 해결하고자 한다. 기존 연구들은 로컬 환경에서의 단기 성능 향상에 집중하여, 서로 다른 태스크, 역할(Role), 모델 Backbone 간의 실질적인 전이 성능을 충분히 평가하지 못했다.#Review#LLM Agents#Procedural Memory#Skill Transfer#Benchmark#Agent Evolution#Task Generalization2026년 6월 30일댓글 수 로딩 중