[논문리뷰] CaSKG: Counterfactual-Causal Skill Graphs for Scalable Agent Skill RetrievalLLM 에이전트가 복잡한 태스크를 수행할 때 재사용 가능한 스킬 라이브러리는 필수적이나, 효율적인 스킬 검색(Retrieval) 문제는 여전히 도전 과제로 남아 있습니다.#Review#LLM agents#skill retrieval#graph retrieval#causal validation#counterfactual reasoning2026년 8월 27일댓글 수 로딩 중
[논문리뷰] ExplainBench: Evaluating Code Explanations from Agents본 논문은 LLM 에이전트가 생성하는 코드 설명(Explanation)의 신뢰성을 검증할 수 있는 객관적인 평가 기준이 부재하다는 문제점을 지적합니다. 에서 볼 수 있듯이, 에이전트의 설명은 그럴듯해 보이지만 실제 패치는 테스트 코드조차 통과하지 못하는 등 설명과 실제 동작 간의 불일치(Mismatch)가 발생합니다.#Review#LLM agents#explainability#benchmark#trustworthiness#software engineering#code explanation#evaluation framework2026년 8월 4일댓글 수 로딩 중
[논문리뷰] MetaClaw: Just Talk -- An Agent That Meta-Learns and Evolves in the WildLarge language model (LLM) agent 는 복잡한 multi-step task 에서 강력한 성능을 보여왔지만, 실제 배포 환경에서 사용되는 agent 는 한 번 훈련되면 user 의 요구사항 변화에 관계없이 고정된 상태로 제공됩니다.#Review#LLM agents#continual learning#meta-learning#skill-driven adaptation#policy optimization#reinforcement learning#online adaptation2026년 3월 18일댓글 수 로딩 중