[논문리뷰] SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring본 논문은 기존 소프트웨어 엔지니어링 벤치마크가 포화 상태에 도달하고, 다수의 불완전한 테스트 케이스와 데이터 오염 문제로 인해 실제 모델의 능력을 변별하기 어려워짐에 따라 SWE-Bench ProMax를 제안한다.#Review#Code Refactoring#AI Agents#Software Engineering#Multilingual Benchmark#Long-horizon Evaluation#Agentic Workflow2026년 8월 10일댓글 수 로딩 중
[논문리뷰] PluraMath: Extending Mathematical Reasoning Evaluation Beyond High-Resource Languages본 연구는 대규모 언어 모델(LLM) 평가 및 학습 데이터가 영어와 중국어 등 고자원 언어에 과도하게 편향되어 있는 문제를 해결하는 것을 목적으로 합니다.#Review#Multilingual Benchmark#Mathematical Reasoning#Large Language Models#Low-resource Languages#Human-in-the-loop2026년 7월 7일댓글 수 로딩 중
[논문리뷰] ReMMD: Realistic Multilingual Multi-Image Agentic Verification for Multimodal Misinformation Detection본 논문은 실제 소셜 미디어 환경의 복잡한 다중 모달 허위 정보(misinformation)를 탐지하기 위한 기존 벤치마크와 모델들의 한계를 해결하고자 합니다.#Review#Multimodal Misinformation Detection#Agentic Verification#Multilingual Benchmark#Memory-Augmented Retrieval#Evidence Provenance2026년 6월 23일댓글 수 로딩 중
[논문리뷰] WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing저자들은 instruction-based image editing 분야에서 text-centric image editing 이 중요한 응용 잠재력에도 불구하고 아직 충분히 탐구되지 않은 영역임을 지적합니다.#Review#Text-centric Image Editing#Diffusion Models#Glyph-Guided Fine-tuning#Reinforcement Learning#Multilingual Benchmark#Dataset Construction2026년 3월 12일댓글 수 로딩 중
[논문리뷰] mSCoRe: a Multilingual and Scalable Benchmark for Skill-based Commonsense Reasoning본 논문은 기존 상식 추론 벤치마크들이 다국어 및 다문화 환경에서 LLM의 인간 추론 능력 활용 방식을 체계적으로 평가하고, 태스크 난이도를 조절하는 데 한계가 있음을 지적합니다.#Review#Multilingual Benchmark#Commonsense Reasoning#LLM Evaluation#Reasoning Taxonomy#Benchmark Scaling#Data Synthesis#Cultural Nuances2025년 8월 21일댓글 수 로딩 중