[논문리뷰] SkillCoach: Self-Evolving Rubrics for Evaluating and Enhancing Agentic Skill-Use본 논문은 기존의 LLM Agent 평가 방식이 최종적인 Verifier 성공 여부에만 의존하여, 실제 과정상의 비효율이나 부적절한 Skill 사용 방식을 간과하는 문제를 해결하고자 한다.#Review#Agentic Skill-Use#Self-Evolving Rubrics#Process Supervision#Skill Libraries#Trajectory Evaluation#LLM Agents#SFT2026년 7월 2일댓글 수 로딩 중
[논문리뷰] Representation Distribution Matching for One-Step Visual Generation본 연구는 고품질의 one-step 이미지 생성을 위해 distribution matching 패러다임의 설계 공간(design space)을 체계적으로 규명하고자 합니다. 기존 연구들은 비교 대상(discrepancy)이나 표현 방식(representation)에 대한 선택이 고정되어 있어 품질의 한계가 명확했습니다.#Review#One-step Generation#Distribution Matching#MMD#Nyström#Representation Learning#Constrained Optimization#SWr142026년 7월 2일댓글 수 로딩 중
[논문리뷰] Program-as-Weights: A Programming Paradigm for Fuzzy Functions본 논문은 현대의 복잡한 소프트웨어 작업들이 정교한 규칙으로 정의되기 어렵다는 점에 주목하여, 이를 LLM API에 의존할 때 발생하는 높은 비용, 낮은 로컬리티(locality), 재생산성 문제 등을 해결하고자 한다 .#Review#Fuzzy Functions#Program-as-Weights#Neural Compiler#Parameter-Efficient Fine-Tuning#LoRA#Small Language Models#FuzzyBench2026년 7월 2일댓글 수 로딩 중
[논문리뷰] PACE: A Proxy for Agentic Capability Evaluation본 논문은 Agentic Benchmark 평가의 극심한 비용 및 복잡성 문제를 해결하기 위해 Non-Agentic 데이터를 프록시(Proxy)로 활용하는 방안을 제안한다. 기존 에이전트 벤치마크는 복잡한 인프라와 긴 수행 시간으로 인해 평가 빈도가 제한적이며 접근성이 떨어진다.#Review#LLM Agents#Agentic Evaluation#Benchmark Compression#Instance Selection#Proxy Framework#Model Capabilities2026년 7월 2일댓글 수 로딩 중
[논문리뷰] Optimizing Visual Generative Models via Distribution-wise Rewards본 논문은 시각적 생성 모델의 강화학습 과정에서 발생하는 Reward Hacking과 이로 인한 생성 다양성 저하 및 시각적 결함 문제를 해결하고자 합니다.#Review#Distribution-wise Reward#Reinforcement Learning#Visual Generative Models#Subset-replace Strategy#Model Merging#Flow Matching#FID2026년 7월 2일댓글 수 로딩 중
[논문리뷰] Multi-Resolution Flow Matching: Training-Free Diffusion Acceleration via Staged Sampling본 논문은 최신 diffusion 및 flow matching 모델의 연산 비용이 지나치게 높다는 점을 해결하고자 한다. 기존의 timestep distillation이나 feature caching 방식은 모델 학습이 필요하거나 가속 효율이 제한적이라는 한계가 존재한다.#Review#Diffusion Models#Flow Matching#Training-Free Acceleration#Multi-Resolution Generation#Staged Sampling#Super-Resolution2026년 7월 2일댓글 수 로딩 중
[논문리뷰] Morphing into Hybrid Attention Models본 논문은 하이브리드 Attention 모델 구축 시 핵심적인 레이어 선택(Layer Selection) 과정에서의 비효율성과 비적정성을 해결하는 것을 목표로 합니다. 기존 연구들은 하이브리드 레이어 구성을 고정된 패턴이나 개별 레이어의 중요도를 독립적으로 평가하는 휴리스틱 방식에 의존했습니다 .#Review#Hybrid Attention#Transformer-to-hybrid Conversion#Layer Selection#Joint Optimization#Large Language Models#Long-context Efficiency2026년 7월 2일댓글 수 로딩 중
[논문리뷰] Logit-Contribution Scoring Identifies Non-Literal Retrieval Heads본 논문은 기존의 retrieval head 탐지 방식이 non-literal retrieval의 핵심 메커니즘을 포착하지 못하는 한계를 해결하기 위해 제안되었습니다.#Review#Logit-Contribution Scoring#LOCOS#Non-literal Retrieval#Attention Heads#Mechanistic Interpretability#Transformer Circuits#OV Circuit2026년 7월 2일댓글 수 로딩 중
[논문리뷰] Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs본 논문은 현재 VLA 학습이 겪고 있는 데이터 부족 문제를 해결하기 위해, 대규모 Expert Demonstration 의존성을 탈피하는 새로운 사전 학습 프레임워크를 제안합니다. 기존의 VLA 모델은 고가의 인간 조작 데이터에 과도하게 의존하며, 이는 데이터 수집의 확장성을 저해하는 근본적인 병목 현상으로 작용합니다.#Review#Vision-Language-Action Models#Task-Agnostic Pretraining#Embodied AI#Inverse Dynamics#Physical Grounding#Robotic Manipulation2026년 7월 2일댓글 수 로딩 중
[논문리뷰] InstanceControl: Controllable Complex Image Generation without Instance Labeling본 논문은 기존의 Controllable Image Generation 방법론들이 복잡한 다중 인스턴스 환경에서 겪는 Attribute Confusion 문제를 해결하기 위해 InstanceControl을 제안합니다 .#Review#Controllable Image Generation#Multi-instance#Vision-Language Models#Instance-level Correspondence#Mask Refinement#Diffusion Transformers2026년 7월 2일댓글 수 로딩 중
[논문리뷰] From SRA to Self-Flow: Data Augmentation or Self-Supervision?본 연구는 SRA 기법이 단순한 데이터 증강(Data Augmentation) 메커니즘인지, 혹은 더 근본적인 자기 지도 학습(Self-Supervision)의 형태인지를 규명하는 것을 핵심 문제로 삼습니다.#Review#SRA#Self-Flow#Data Augmentation#Self-Supervision#Representation Learning#Knowledge Distillation2026년 7월 2일댓글 수 로딩 중
[논문리뷰] EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments본 논문은 현대의 자율 에이전트가 단순히 정적인 출력을 생성하는 것을 넘어, 환경 피드백을 통해 실행 가능한 정책을 반복적으로 개선해야 하는 도전 과제를 다룹니다. 기존 벤치마크는 최종 점수만을 평가하거나 복잡한 엔지니어링 작업과 섞여 있어, 에이전트의 '정책 진화' 능력을 독립적으로 측정하기 어렵다는 한계가 있습니다.#Review#Autonomous Policy Evolution#Interactive Environments#Benchmark#Agentic Systems#Policy Optimization#Trajectory Analysis2026년 7월 2일댓글 수 로딩 중
[논문리뷰] Discrete Diffusion Language Models for Interactive Radiology Report Drafting본 논문은 의료 분야의 Radiology Report Generation(RRG)이 여전히 Autoregressive(AR) 기반 모델에 의존하고 있으며, 이로 인해 발생하는 상호작용적 drafting의 한계를 극복하고자 합니다.#Review#Discrete Diffusion Language Models#Radiology Report Generation#Any-Order Infill#Medical Foundation Models#LoRA#Vision-Language Models#Inference Speed2026년 7월 2일댓글 수 로딩 중
[논문리뷰] Denser neq Better: Limits of On-Policy Self-Distillation for Continual Post-Training본 연구는 Continual Post-Training 과정에서 온-폴리시(On-policy) 학습이 망각을 완화한다는 기존의 낙관적 견해를 비판적으로 재검토하고, 특히 SDPO와 같은 토큰 수준의 밀집 증류 기법이 오히려 모델의 성능 저하와 붕괴를 초래할 수 있음을 입증합니다.#Review#Continual Post-Training#Self-Distillation#On-Policy Reinforcement Learning#Catastrophic Forgetting#Policy Optimization#Token-Level Supervision2026년 7월 2일댓글 수 로딩 중
[논문리뷰] Breaking Failure Cascades: Step-Aware Reinforcement Learning for Medical Multimodal Reasoning본 논문은 의료 분야의 MLLM(Multimodal Large Language Model)이 추론 과정에서 겪는 Sparse Credit Assignment 문제와 그로 인한 Failure Cascades 현상을 해결하고자 합니다.#Review#Multimodal Large Language Models#Medical Reasoning#Reinforcement Learning#Process Supervision#Failure Cascades#Advantage Shaping#VQA2026년 7월 2일댓글 수 로딩 중
[논문리뷰] AnyGroundBench: A Specialized-Domain Benchmark for Video Grounding in Vision-Language Models본 논문은 기존의 STVG 평가 방식이 일반적인 일상 데이터에만 국한되어 있어, 실제 산업 현장이나 전문 분야에서 요구되는 고차원적 인식 능력을 측정하지 못한다는 문제를 제기합니다 .#Review#Spatio-Temporal Video Grounding#Vision-Language Models#Domain Adaptation#In-Context Learning#Benchmark#Video Understanding2026년 7월 2일댓글 수 로딩 중
[논문리뷰] AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents본 연구는 Long-Horizon LLM 에이전트가 겪는 'Context Growth' 문제를 해결하고, 에이전트의 메모리 인터페이스를 체계적으로 평가할 수 있는 통제된 환경을 제공하기 위해 수행되었습니다.#Review#Long-Horizon LLM Agents#Bounded-Memory Contract#Typed Retrieval#AgenticSTS#Slay the Spire 2#Loop Engineering2026년 7월 2일댓글 수 로딩 중
[논문리뷰] AgenticDataBench: A Comprehensive Benchmark for Data Agents본 연구는 기존 데이터 에이전트 벤치마크가 복잡한 실제 비즈니스 시나리오를 충분히 반영하지 못하고, 세부적인 작업 수준의 성능 분석을 제공하지 못한다는 한계점을 해결하고자 합니다.#Review#Data Agent#Benchmark#Skill Extraction#Data Science#LLM#Task Generation#Evaluation Pipeline2026년 7월 2일댓글 수 로딩 중
[논문리뷰] AGVBench: A Reliability-Oriented Benchmark of Data Augmentation for Vein Recognition본 논문은 정맥 인식 분야에서 자연 이미지용으로 개발된 기존 데이터 증강 기법들이 정맥 구조의 미세한 지형(Topology)과 질감을 훼손할 수 있다는 문제점을 해결하고자 합니다. 기존의 연구들은 특정 모델이나 데이터셋에 한정된 평가를 수행하여, 다양한 신경망 아키텍처와 증강 전략 간의 체계적인 비교가 부족했습니다 .#Review#Vein Recognition#Data Augmentation#Biometrics#Reliability#Deep Learning#Benchmark#Robustness2026년 7월 2일댓글 수 로딩 중
[논문리뷰] When LLMs Read Tables Carelessly: Measuring and Reducing Data Referencing Errors본 논문은 LLM이 표 기반 작업에서 구조를 이해하더라도 데이터를 인용하는 과정에서 '부주의'하게 오류를 범하는 Data Referencing Errors (DREs) 문제를 해결하고자 합니다 .#Review#Large Language Models#Table Reasoning#Data Referencing Errors#Rejection Sampling#Critic Model#Reinforcement Learning2026년 7월 1일댓글 수 로딩 중