[논문리뷰] HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?본 논문은 Agent가 연구용 프로토타입에서 실제 배포 도구로 진화함에 따라, Agent의 성능을 좌우하는 외부 인프라인 Harness의 중요성을 규명하고 이를 모델이 직접 개발할 수 있는지 검증하고자 합니다.#Review#Agent Harness#LLM#Software Engineering#Benchmark#Agent Evolution#Code Generation2026년 9월 2일댓글 수 로딩 중
[논문리뷰] Aspire: Can Models Self-Evolve from Vague Goals?본 논문은 LLM의 자가 진화(Self-evolution) 과정에서 Vague Goal로부터 목표를 구체화하고 진정한 역량 향상을 달성하는 문제를 해결하고자 합니다.#Review#Self-Evolution#LLM#Vague Goals#Autonomous Post-training#Goal Operationalization#Agent Harness#Benchmark2026년 9월 2일댓글 수 로딩 중
[논문리뷰] JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution본 연구는 에이전트의 성능이 모델 가중치뿐만 아니라, 모델을 둘러싼 실행 환경인 Harness에 크게 의존한다는 점에 주목합니다.#Review#Agent Harness#Just-in-Time (JIT) Generation#Agentic LLMs#Modularized Harness Design#Self-Evolving Agents#Harness Intelligence2026년 8월 26일댓글 수 로딩 중
[논문리뷰] Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses본 논문은 긴 호흡의 에이전트 작업에서 발생하는 재귀적 자기 개선(Recursive Self-Improvement, RSI)의 불투명성과 성능 저하 문제를 해결합니다.#Review#Long-Horizon Agents#Recursive Self-Improvement#Working Memory#Experiential Memory#Failure Localization#Agent Harness2026년 8월 25일댓글 수 로딩 중
[논문리뷰] Agent Lightning v1.0: Towards Harnessed Agentic RL본 논문은 현대 에이전트가 단일 LLM이 아닌 Agent Harness 내에서 작동한다는 점에 주목하여, 기존 RL 프레임워크가 harness의 복잡한 실행 로직을 수용하지 못하는 문제를 해결합니다.#Review#Harnessed Agentic RL#Reinforcement Learning#Agent Harness#LLM Proxy#Retokenization#System Design2026년 8월 18일댓글 수 로딩 중
[논문리뷰] ClawGym II: Exploring Black-Box RL on Agent Harness본 논문은 복잡한 Agent Harness 환경에서 범용 에이전트를 안정적이고 확장 가능하게 최적화하는 Black-Box RL 프레임워크를 제안합니다.#Review#Black-Box RL#Agent Harness#Policy Optimization#Prefix Tree#Reinforcement Learning#Scalable Infrastructure2026년 8월 17일댓글 수 로딩 중
[논문리뷰] Evo-Bench: Can Language Models Improve Agent Harness?본 논문은 LLM 기반 에이전트의 자율적 하네스 개선(harness evolution) 역량을 체계적으로 평가하기 위한 새로운 벤치마크인 Evo-Bench를 제안합니다.#Review#Agent Harness#Harness Evolution#LLM#Benchmark#Self-Improvement#Autonomous Agent#Task Sensitivity2026년 8월 10일댓글 수 로딩 중
[논문리뷰] JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents본 논문은 기존의 Creative AI 시스템이 고립된 단일 단계 생성에 머물러 있어, 복잡한 다단계 창작 작업에서 필요한 맥락(Context)을 유지하지 못하는 문제를 해결하고자 합니다.#Review#Multimodal Agents#Canvas-Native#Creative AI#Agent Harness#Long-Horizon Creation#Project State2026년 7월 27일댓글 수 로딩 중
[논문리뷰] Harness Handbook: Making Evolving Agent Harnesses Readable,Navigable, and Editable본 논문은 대규모 Agent Harness의 구조적 복잡성으로 인해 발생하는 Behavior Localization의 어려움을 해결하는 것을 목표로 합니다.#Review#Agent Harness#Behavior Localization#Static Program Analysis#LLM-assisted Behavioral Structuring#Behavior-Guided Progressive Disclosure#Software Engineering2026년 7월 15일댓글 수 로딩 중
[논문리뷰] MyPCBench: A Benchmark for Personally Intelligent Computer-Use Agents본 논문은 기존의 Computer-Use 에이전트 벤치마크가 실사용 환경과 동떨어진 '개인성(Impersonality)' 결여 문제를 해결하고자 한다.#Review#Computer-Use Agents#Personalization#Benchmark#Linux Desktop#Agent Harness#Cross-App Consistency2026년 6월 17일댓글 수 로딩 중
[논문리뷰] VibeSearchBench: Benchmarking Long-horizon Proactive Search in the Wild본 논문은 LLM 기반 에이전트가 기존 벤치마크에서는 높은 성능을 보임에도 불구하고, 실사용 환경에서는 사용자 만족도가 낮은 'Evaluation–Experience Gap' 문제를 해결하고자 한다.#Review#VibeSearch#Proactive Search#Large Language Models#Agent Harness#Knowledge Graph#Benchmark2026년 5월 27일댓글 수 로딩 중
[논문리뷰] Code as Agent Harness본 논문은 LLM 기반 에이전트 시스템에서 코드가 단순한 생성 대상(target artifact)을 넘어, 시스템의 핵심 운영 인프라로 전환되고 있다는 점을 지적한다.#Review#Agent Harness#Coding Agent#Harness Engineering#Agentic AI#Code-as-Agent-Harness#Executable Verification2026년 5월 18일댓글 수 로딩 중