[논문리뷰] The Tasteful Agent: Measuring and Improving Taste in Long-Horizon TasksLLM agents increasingly engage in long-horizon tasks, where intermediate decisions significantly impact the final outcome.#Review#LLM Agents#Long-Horizon Tasks#Decision Forks#Taste-Bench#Automated Evaluation#Knowledge Distillation#Software Engineering Tasks#Machine Learning Research2026년 9월 22일댓글 수 로딩 중
[논문리뷰] Why LLMs Aren't Scientists Yet: Lessons from Four Autonomous Research Attempts본 논문은 최신 추론형 LLM(Large Language Models)이 최소한의 코드 스캐폴딩과 기본적인 도구를 사용하여 연구 아이디어 구상부터 최종 연구 논문 작성까지 높은 자율성 을 가지고 수행할 수 있는지 탐구하는 것을 목표로 합니다.#Review#Machine Learning Research#Autonomous Research#LLM Agents#Scientific Workflow#Failure Modes#Experimental Design#AI Scientist#Agentic Systems2026년 1월 7일댓글 수 로딩 중