[논문리뷰] CAST: Critique-Aware Supervision for Training Reliable Long-Horizon Tool-Calling Agents본 논문은 장기적인 상호작용 환경에서 LLM 에이전트의 Reliability가 심각하게 저하되는 문제를 해결하고자 한다 . 기존 에이전트는 복잡한 태스크 수행 중 사소한 실수로 인해 연쇄적인 실패를 경험하며, 일단 발생한 오류는 수정이 어려운 경우가 많다.#Review#LLM Agents#Tool-Calling#Critique-Aware Training#Long-Horizon#Reliability#Agentic Verification#Policy Optimization2026년 8월 31일댓글 수 로딩 중
[논문리뷰] One Success Isn't Reliability: Thinkingbox, a Sandbox and Benchmark for Agents in Stateful Business Workflows본 논문은 기존의 에이전트 벤치마크가 복잡한 비즈니스 환경에서의 신뢰성을 충분히 평가하지 못한다는 문제를 제기합니다 . 많은 연구가 단일 호출의 적절성이나 코드 실행 결과만을 평가하는 데 치중되어 있어, 다중 턴 상호작용이나 상태 변화가 수반되는 실무적 업무의 복잡성을 간과하고 있습니다.#Review#LLM Agents#Stateful Business Workflows#Benchmark#Sandbox#Tool-Agent-User Interaction#Reliability#Executable Evaluation2026년 8월 24일댓글 수 로딩 중
[논문리뷰] Is Deep Research Reliable? Misleading Knowledge Induces False Conclusions본 논문은 Deep Research 시스템이 외부 정보에 포함된 그럴듯한 거짓 정보에 얼마나 취약한지 규명하고자 한다 . 기존 연구들은 단기적인 RAG 환경에서의 신뢰성만을 주로 다루었으나, 긴 연구 흐름 속에서 거짓 정보가 어떻게 중간 단계에 흡수되고 최종 결과물에까지 반영되는지에 대한 분석은 부족했다.#Review#Deep Research#LLM Agents#Misleading Knowledge#Reliability#False Conclusion#Retrieval-Augmented Generation2026년 7월 30일댓글 수 로딩 중
[loki] Grafana Loki의 안정성 향상: Circuit Breaker 도입을 통한 트래픽 제어Grafana Loki의 Distributor에 Circuit Breaker를 도입하여 과부하 시 트래픽을 효율적으로 차단하고 시스템 안정성을 확보하는 방법.#Grafana Loki#Go#Circuit Breaker#Distributed Systems#Reliability2026년 7월 10일댓글 수 로딩 중
[논문리뷰] AGVBench: A Reliability-Oriented Benchmark of Data Augmentation for Vein Recognition본 논문은 정맥 인식 분야에서 자연 이미지용으로 개발된 기존 데이터 증강 기법들이 정맥 구조의 미세한 지형(Topology)과 질감을 훼손할 수 있다는 문제점을 해결하고자 합니다. 기존의 연구들은 특정 모델이나 데이터셋에 한정된 평가를 수행하여, 다양한 신경망 아키텍처와 증강 전략 간의 체계적인 비교가 부족했습니다 .#Review#Vein Recognition#Data Augmentation#Biometrics#Reliability#Deep Learning#Benchmark#Robustness2026년 7월 2일댓글 수 로딩 중
[논문리뷰] $OneMillion-Bench: How Far are Language Agents from Human Experts?기존 벤치마크가 실세계 전문직업의 복잡한 요구사항을 충분히 반영하지 못하고, 언어 에이전트의 실제 경제적 가치 창출 능력을 측정하기 어렵다는 문제점을 해결하고자 합니다.#Review#Language Agents#Benchmarking#Expert Evaluation#Economic Value#Professional Tasks#Rubric-based Evaluation#Multi-step Reasoning#Reliability#Domain Adaptation2026년 3월 9일댓글 수 로딩 중
[Grafana Loki] 검증이 완료될 때까지 accepted stream 캐시를 비활성화확률적 자료구조인 블룸 필터 기반 캐시의 효과를 추가 검증하기 위해 기본값을 비활성으로 변경한 분석.#Grafana Loki#Go#Bloom Filter#Cache#Feature Flag#Reliability2026년 2월 19일댓글 수 로딩 중
[논문리뷰] Towards a Science of AI Agent ReliabilityAI 에이전트의 높은 벤치마크 정확도와 실제 배포 시의 잦은 실패 간의 격차를 해소하는 것이 이 연구의 주요 목표입니다.#Review#AI Agents#Reliability#Evaluation Metrics#Consistency#Robustness#Predictability#Safety#Benchmarks2026년 2월 18일댓글 수 로딩 중
[논문리뷰] DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent SystemsLLM 기반 다중 에이전트 시스템의 복잡한 디버깅 문제를 해결하는 것을 목표로 합니다.#Review#LLM Multi-Agent Systems#Debugging#Intervention-Driven#Failure Attribution#Automated Debugging#Verification#AI Agents#Reliability2025년 12월 8일댓글 수 로딩 중
[논문리뷰] SAKE: Towards Editing Auditory Attribute Knowledge of Large Audio-Language Models본 논문은 기존 텍스트 및 시각 양상에 집중되었던 지식 편집 연구를 확장하여, 대규모 오디오-언어 모델(LALMs) 의 추상적인 청각 속성 지식 을 편집하는 문제를 탐구합니다.#Review#Knowledge Editing#Audio-Language Models#Auditory Attributes#Benchmark#Reliability#Generality#Locality#Portability2025년 10월 24일댓글 수 로딩 중
[논문리뷰] ReFIne: A Framework for Trustworthy Large Reasoning Models with Reliability, Faithfulness, and Interpretability논문은 기존 Long Chain-of-Thought (CoT) 추론 모델 들이 답변 정확도와 토큰 효율성에만 집중하여 신뢰성(trustworthiness) 을 간과하는 문제를 해결하고자 합니다.#Review#Trustworthy AI#Large Reasoning Models (LRMs)#Interpretability#Faithfulness#Reliability#Chain-of-Thought (CoT)#Supervised Fine-tuning (SFT)#GRPO2025년 10월 15일댓글 수 로딩 중
[논문리뷰] When Judgment Becomes Noise: How Design Failures in LLM Judge Benchmarks Silently Undermine Validity본 논문은 LLM Judge 벤치마크 설계에서 발생하는 근본적인 결함이 평가 유효성을 침묵적으로 저해 하는 문제를 다룹니다. 특히, 명확한 목표와 검증 가능한 구성 없이 고신뢰도처럼 보이는 랭킹이 실제로는 대부분 노이즈 일 수 있음을 진단하고, 이를 해결하기 위한 진단 메커니즘과 개선 원칙을 제시하는 것을 목표로 합니다.#Review#LLM Judge#Benchmark Evaluation#Validity#Reliability#Psychometrics#Factor Analysis#Schema Adherence#ELO Ranking2025년 9월 26일댓글 수 로딩 중
[논문리뷰] Neither Valid nor Reliable? Investigating the Use of LLMs as Judges본 논문은 NLG(Natural Language Generation) 시스템 평가에서 LLM(Large Language Model)을 심사관(LLJ) 으로 활용하는 방식의 광범위한 채택이 성급했음을 주장하며, 그 신뢰성(reliability) 과 타당성(validity) 에 대한 엄격한 조사를 목표로 합니다.#Review#LLMs as Judges#NLG Evaluation#Measurement Theory#Validity#Reliability#Evaluation Bias#Scalability#Responsible AI2025년 8월 26일댓글 수 로딩 중