[논문리뷰] FinanceComplexQA: Benchmarking Agentic Reasoning on Industrial-grade Financial Documents본 논문은 금융 도메인에서 LLM 기반 시스템의 복잡한 추론 능력을 평가할 수 있는 신뢰성 있는 벤치마크의 부재 문제를 해결하고자 한다. 기존의 금융 QA 벤치마크들은 주로 단편적인 데이터나 단순화된 표 해석에 집중하여, 실제 금융 현장의 복잡한 문서 구조와 고도화된 분석 요구사항을 충분히 반영하지 못하는 한계가 있다.#Review#Agentic Reasoning#Financial Document QA#Benchmark#Finance-LaTeX#Dual-Context Reasoning#Cross-Layout Reasoning#RAG#Agent-as-a-Judge2026년 7월 23일댓글 수 로딩 중
[논문리뷰] Agent-as-a-Judge본 논문은 LLM-as-a-Judge의 한계(내재된 편향, 피상적인 추론, 실제 관찰에 대한 검증 불가능성)를 극복하기 위해 Agent-as-a-Judge 패러다임으로의 전환을 포괄적으로 탐구하는 것을 목표로 합니다.#Review#Agent-as-a-Judge#LLM Evaluation#Multi-Agent Systems#Tool Integration#AI Alignment#Automated Assessment#Survey2026년 1월 8일댓글 수 로딩 중