[논문리뷰] ClawGym II: Exploring Black-Box RL on Agent Harness본 논문은 복잡한 Agent Harness 환경에서 범용 에이전트를 안정적이고 확장 가능하게 최적화하는 Black-Box RL 프레임워크를 제안합니다.#Review#Black-Box RL#Agent Harness#Policy Optimization#Prefix Tree#Reinforcement Learning#Scalable Infrastructure2026년 8월 17일댓글 수 로딩 중
[논문리뷰] EvoCUA: Evolving Computer Use Agents via Learning from Scalable Synthetic Experience본 논문은 정적 데이터 스케일링의 한계로 인해 장기적인 컴퓨터 사용 작업에서 복잡한 인과적 역학을 포착하는 데 어려움을 겪는 네이티브 컴퓨터 사용 에이전트(CUA) 의 문제를 해결하고자 합니다.#Review#Computer Use Agent#Synthetic Experience#Evolutionary Learning#Reinforcement Learning#Direct Preference Optimization#GUI Automation#Scalable Infrastructure#Verifiable Synthesis2026년 1월 22일댓글 수 로딩 중