[논문리뷰] AgenticDataBench: A Comprehensive Benchmark for Data Agents본 연구는 기존 데이터 에이전트 벤치마크가 복잡한 실제 비즈니스 시나리오를 충분히 반영하지 못하고, 세부적인 작업 수준의 성능 분석을 제공하지 못한다는 한계점을 해결하고자 합니다.#Review#Data Agent#Benchmark#Skill Extraction#Data Science#LLM#Task Generation#Evaluation Pipeline2026년 7월 2일댓글 수 로딩 중
[논문리뷰] Ko-WideSearch: A Korean Breadth-Search Benchmark for Exhaustive Set Enumeration by Web Agents본 논문은 기존의 웹 에이전트 벤치마크가 Depth(단일 정보 탐색) 위주로 편중되어 있으며, 다수의 속성을 포함한 구조적 집합을 완성하는 Breadth 능력에 대한 평가가 부족하다는 점을 지적합니다 .#Review#Web Agents#Breadth-Search#Korean Benchmark#Set Enumeration#Tool Use#Evaluation Pipeline#Difficulty Tiers2026년 6월 28일댓글 수 로딩 중
[논문리뷰] dLLM: Simple Diffusion Language Modeling이 논문은 확산 언어 모델(DLM) 의 훈련, 추론, 평가를 아우르는 통합된 오픈소스 프레임워크인 dLLM 을 제공하는 것을 목표로 합니다. DLM 연구의 진입 장벽을 낮추고, 기존 모델의 재현, 파인튜닝, 비교를 용이하게 하며, 새로운 DLM 설계 통합을 단순화하고자 합니다.#Review#Diffusion Language Models#Open-source Framework#Modular Design#Masked Diffusion#Block Diffusion#Language Model Finetuning#Efficient Inference#Evaluation Pipeline2026년 3월 1일댓글 수 로딩 중