[논문리뷰] What Makes Good Agentic Data? An ACE Lens on Data Generation for LLM Agents본 논문은 LLM 에이전트 학습을 위한 데이터 생성 과정이 직면한 일관성 유지 문제와 데이터의 질적 관리의 모호함을 해결하고자 합니다. 기존 연구들은 도메인별로 파편화되어 있어, 에이전트의 상호작용 데이터 생성 메커니즘을 통합적으로 이해하는 데 어려움을 겪고 있습니다 .#Review#LLM Agents#Agentic Data#Data Generation#Accuracy#Complexity#Diversity#ACE Lens2026년 8월 27일댓글 수 로딩 중
[pytorch] Inductor: CycleGAN CPU 벤치마크 expected accuracy 상태 업데이트PyTorch Inductor의 CPU 벤치마크에서 pytorch_CycleGAN_and_pix2pix 모델의 expected 상태를 pass에서 eager_fail_to_run으로 변경한 사례를 분석합니다.#PyTorch#Inductor#Benchmarks#CI#Accuracy2026년 2월 16일댓글 수 로딩 중
[pytorch] CI: Inductor 테스트에 IoU 기반 accuracy 체크를 추가하여 segmentation 모델 안정화PyTorch Inductor 벤치마크에서 segmentation 모델의 boolean mask 출력에 IoU(Intersection over Union) 메트릭을 적용하여, 부동소수점 차이로 인한 false failure를 방지한 사례를 분석합니다.#PyTorch#Inductor#Benchmarks#IoU#Segmentation#Accuracy#CI2026년 1월 12일댓글 수 로딩 중
[논문리뷰] Mind the Gap: A Closer Look at Tokenization for Multiple-Choice Question Answering with LLMs본 논문은 대규모 언어 모델(LLM)의 객관식 질문 답변(MCQA) 평가 시, 답변 레이블 직전의 공백 문자 토큰화 방식이 모델 성능에 미치는 영향을 규명하는 것을 목표로 합니다.#Review#LLM Evaluation#Multiple-Choice QA#Tokenization#Prompt Sensitivity#Accuracy#Calibration#Model Ranking2025년 9월 19일댓글 수 로딩 중