[논문리뷰] ZooWork-ShopRanker: An Open, Preference-Aligned E-Commerce Reranker본 연구는 기존의 범용(general) 웹 리트리버 및 리랭커 모델이 이커머스 환경의 특수성을 고려하지 못해 발생하는 성능 저하 문제를 해결하고자 한다. 단순한 topical relevance를 넘어 소비자 개인의 제약 사항(constraints), 예산, 선호도를 판단하는 능력이 부족한 점이 주요 한계이다.#Review#E-commerce#Reranker#Preference Alignment#Distillation#LLM Judges#SHOPRANK-BENCH2026년 9월 27일댓글 수 로딩 중
[논문리뷰] SWE-rebench V2: Language-Agnostic SWE Task Collection at Scale본 논문은 대규모의 재현 가능한 소프트웨어 엔지니어링(SWE) 태스크 환경 부족 문제를 해결하고, 특히 강화 학습(RL) 기반 LLM 에이전트 훈련을 위한 언어 독립적인(language-agnostic) SWE 태스크 컬렉션 을 대규모로 구축하는 것을 목표로 합니다.#Review#SWE Agents#Reinforcement Learning#Task Collection#Language-Agnostic#Automated Pipeline#Docker#LLM Judges#Reproducibility2026년 3월 2일댓글 수 로딩 중
[논문리뷰] DigiData: Training and Evaluating General-Purpose Mobile Control Agents본 논문은 모바일 제어 에이전트 훈련을 위한 고품질의 대규모 데이터셋 인 DigiData를 구축하고, 에이전트 성능을 평가할 수 있는 강력한 벤치마크 인 DigiData-Bench를 제시하는 것을 목표로 합니다.#Review#Mobile Control Agents#User Interface Automation#Large-Scale Dataset#Benchmarking#LLM Judges#Data Diversity#Task Success Rate2025년 11월 10일댓글 수 로딩 중