[논문리뷰] SlimSearcher: Training Efficiency-Aware Web Agents via Adaptive Reward Gating본 논문은 현대의 Deep Research Agents가 성공률만을 극대화하려는 brute-force 학습 전략으로 인해 심각한 연산 비효율성에 직면했다는 문제를 제기합니다.#Review#Web Agents#Training Efficiency#Reward Gating#Adaptive Efficiency Anchoring#Pareto Frontier#Reinforcement Learning#Supervised Fine-Tuning2026년 6월 8일댓글 수 로딩 중
[논문리뷰] Balancing Understanding and Generation in Discrete Diffusion Models이 논문은 이산 확산 모델(Discrete Diffusion Models, DDM) 분야에서 Masked Diffusion Language Models (MDLM) 의 의미 이해 능력과 Uniform-noise Diffusion Language Models (UDLM) 의 고품질 소수 단계 생성 능력 간의 불균형을 해결하는 것을 목표로 합니다.#Review#Discrete Diffusion Models#Language Modeling#Image Generation#Masked Diffusion#Uniform Noise#XDLM#Stationary Noise Kernel#Pareto Frontier2026년 2월 3일댓글 수 로딩 중