[논문리뷰] GEAR: Guided End-to-End AutoRegression for Image Synthesis본 논문은 현대의 시각적 생성 모델들이 tokenizer와 generator를 2단계로 분리하여 학습함으로써 발생하는 비효율성을 해결하고자 합니다 .#Review#GEAR#Autoregressive#Tokenizer#End-to-End#Representation Alignment#Vector Quantization#Image Synthesis2026년 6월 30일댓글 수 로딩 중
[논문리뷰] FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model본 논문은 기존 Spoken Language Model(SLM)들이 고정된 frame rate(fixed frame rate)를 사용하여 불필요한 연산 자원을 낭비하고, 추론 시 속도와 품질 간의 유연한 조절이 불가능하다는 문제를 해결하고자 한다.#Review#Spoken Language Model#Dynamic Frame Rate#Controllable Generation#Speech Tokenization#Frame Merging#Inference Efficiency2026년 6월 30일댓글 수 로딩 중
[논문리뷰] Evolution Fine-Tuning: Learning to Discover Across 371 Optimization Tasks본 논문은 최적화 작업에서 LLM의 탐색 및 개선 능력이 외부 Scaffold에 의존적이며, 모델 자체에 내재화되지 않는다는 문제를 해결합니다. 기존 연구들은 각 작업을 개별적으로 접근하여 매번 처음부터 탐색을 수행하고, 탐색 경험을 재사용하지 않는다는 한계가 있습니다.#Review#Evolution Fine-Tuning#Large Language Models#Optimization Tasks#Cross-task Generalization#Search Scaffolds#Evolutionary Search#ℱinch2026년 6월 30일댓글 수 로딩 중
[논문리뷰] Dockerless: Environment-Free Program Verifier for Coding Agents본 논문은 기존의 실행 기반(Execution-based) 프로그램 검증기가 가진 과도한 엔지니어링 오버헤드와 비확장성 문제를 해결하기 위해 Dockerless를 제안합니다.#Review#Coding Agents#Environment-Free#Program Verifier#SWE-bench#Reinforcement Learning#Supervised Fine-tuning2026년 6월 30일댓글 수 로딩 중
[논문리뷰] DataEvolver: Self-Evolving Multi-Agent Data Construction for Text-Rich Image Generation기존의 Text-rich image 데이터 구축 방식은 고정된 텍스트 크롤링 및 필터링(Crawl-filter-freeze paradigm)에 의존하고 있어, 데이터 구축 과정에서 발생하는 다양한 실패 사례를 유의미한 정보로 활용하지 못하는 한계가 있습니다.#Review#Data Construction#Multi-Agent System#Text-Rich Image Generation#Feedback Loop#Policy Evolution2026년 6월 30일댓글 수 로딩 중
[논문리뷰] DOPD: Dual On-policy Distillation본 논문은 OPD 환경에서 특권 정보를 주입할 때 발생하는 Privilege Illusion 문제를 해결하고자 합니다.#Review#On-policy Distillation#Privileged Information#Privilege Illusion#Advantage-aware#Dual Distillation#Large Language Model#Vision-Language Model2026년 6월 30일댓글 수 로딩 중
[논문리뷰] BrainJanus: A Unified Model for Understanding and Generation across Brain, Vision, and Language본 논문은 기존의 뇌-기계 인터페이스(BCI) 연구들이 Brain encoding과 decoding을 독립적인 작업으로 간주하고, 모달리티 간 통합이 결여된 단편적인 접근 방식을 취하는 한계를 해결하고자 합니다.#Review#BrainJanus#Unified Model#Brain Encoding#Brain Decoding#Autoregressive#Omni Space#Tokenization2026년 6월 30일댓글 수 로딩 중
[논문리뷰] BlockPilot: Instance-Adaptive Policy Learning for Diffusion-based Speculative Decoding본 논문은 기존의 Diffusion-based Speculative Decoding 방식이 모든 입력 데이터에 대해 동일한 Block Size를 사용하는 정적(static) 전략에 의존하고 있어 비효율적이라는 점을 지적합니다.#Review#Speculative Decoding#Diffusion Language Models#Block-level Diffusion#Instance-Adaptive#Policy Learning#Inference Optimization2026년 6월 30일댓글 수 로딩 중
[논문리뷰] AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation본 논문은 기존 오디오-비디오(AV) 생성 모델들이 겪고 있는 고비용의 Dual-branch 아키텍처 문제와 모달리티 간 Representation Gap을 해결하고자 합니다 .#Review#Audio-Video Generation#Unified Tokenization#1D Latent Representation#Dual-stream Transformer#Hierarchical Training#Multimodal Learning2026년 6월 30일댓글 수 로딩 중
[논문리뷰] ZooClaw-FashionSigLIP2: Distilled Fine-tuning for Robust Fashion Retrieval본 논문은 패션 도메인 특화 미세 조정(fine-tuning) 과정에서 발생하는 Domain-specific Specialization과 OOD Generalization 간의 근본적인 Tradeoff 문제를 해결하는 데 집중합니다.#Review#Vision-Language Encoder#Fashion Retrieval#Knowledge Distillation#WiSE-FT#Contrastive Learning#OOD Generalization#Model Soups2026년 6월 29일댓글 수 로딩 중
[논문리뷰] Walking in the Implicit: Interactive World Exploration via Neural Scene Representation본 논문은 기존의 카메라 제어 기반 상호작용 세계 모델(Interactive World Model)들이 겪는 장기적인 일관성 유지 문제를 해결하고자 합니다.#Review#Interactive World Exploration#Camera-Controlled Generation#Neural Implicit Scene#Neural Scene Representation#Diffusion Transformer2026년 6월 29일댓글 수 로딩 중
[논문리뷰] Video-MME-Logical: A Controlled Diagnostic Benchmark for Video Temporal-Logical Reasoning본 논문은 현재의 MLLMs가 비디오 내의 동적인 시각적 증거를 바탕으로 논리적 추론을 수행하는 데 있어 심각한 한계를 가지고 있음을 지적한다.#Review#Video-MME-Logical#Temporal-Logical Reasoning#MLLMs#Diagnostic Benchmark#Programmatic Generation#Intermediate-State Evaluation2026년 6월 29일댓글 수 로딩 중
[논문리뷰] Trimming the Long-Tail of Visual World Modeling Evaluation본 논문은 현대의 World Models가 물리적 원리를 진정으로 내재화했는지, 아니면 학습 데이터의 통계적 규칙성에 의존하는지에 대한 근본적인 의문을 제기합니다.#Review#Visual World Modeling#Long-Tail Scenarios#Physical Reasoning#Affordance Generalization#Multimodal Generative Models#Benchmark2026년 6월 29일댓글 수 로딩 중
[논문리뷰] TheoremGraph: Bridging Formal and Informal Mathematics현대 수학 연구는 거대하고 파편화되어 있어 수학적 결과들의 의존성 구조를 명확히 파악하기 어렵습니다. 논문 저자들은 informal한 문헌(arXiv 등)이 주로 문서 수준의 인용에 의존하는 반면, formal 라이브러리(Lean 등)는 매우 제한된 범위 내에서만 세밀한 의존성을 관리한다는 한계를 지적합니다.#Review#Formal-Informal Mathematics#Dependency Graph#LeanGraph#Neural Theorem Proving#Cross-modal Retrieval#Autoformalization2026년 6월 29일댓글 수 로딩 중
[논문리뷰] The Surprising Effectiveness of Video Diffusion Models for Hand Motion Reconstruction본 논문은 기존의 egocentric 4D 손 모션 재구성 방법론이 직면한 심각한 병목 현상을 해결하고자 합니다. 기존 방식들은 이미지 기반 탐지기(Detector)에 의존하거나, 제한된 데이터로 학습된 시간적 모듈을 사용하여 심한 은닉 상황에서 성능이 저하되는 한계가 있습니다 .#Review#Video Diffusion Models#Hand Motion Reconstruction#Egocentric Video#4D Reconstruction#Embodied AI#Occlusion Reasoning2026년 6월 29일댓글 수 로딩 중
[논문리뷰] TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents본 논문은 기존 컴퓨터 사용 벤치마크들이 GUI 환경이나 특정 도메인(주로 코딩)에 편향되어 있어, 일반적인 터미널 환경에서의 범용적인 에이전트 능력을 평가하는 데 한계가 있다는 문제 의식에서 출발합니다.#Review#Terminal-Use Agents#General-Purpose Benchmark#Command-Line Interface#Execution-Grounded Evaluation#Scientific Workflows2026년 6월 29일댓글 수 로딩 중
[논문리뷰] TACO: Tool-Augmented Credit Optimization for Agentic Tool Use본 논문은 에이전트의 불필요하거나 오도하는 도구 호출 문제를 해결하기 위해, 도구 호출 자체의 기여도를 정밀하게 평가하는 최적화 프레임워크를 제안한다.#Review#Agentic Tool Use#Reinforcement Learning#Multimodal Models#Credit Assignment#Tool-Augmented Credit Optimization#GRPO#Differential Answer-Probe Reward2026년 6월 29일댓글 수 로딩 중
[논문리뷰] Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent본 논문은 에이전트 모델의 성능을 향상시키기 위한 기존의 파라미터 스케일링 전략이 갖는 높은 비용과 재현성 문제를 해결하기 위해 에이전트 호라이즌(Horizon) 확장을 제안합니다 .#Review#Agents-A1#Long-Horizon#Knowledge-Action Graph#Mixture-of-Experts#On-Policy Distillation#Salient Vocabulary Alignment2026년 6월 29일댓글 수 로딩 중
[논문리뷰] SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing본 논문은 기존의 고정된 위험 분류 체계에 의존하는 Guardrail이 실제 애플리케이션의 가변적인 요구사항을 충족하지 못하는 문제를 해결하고자 합니다 .#Review#In-context Policy Guardrailing#Safety Benchmark#Hierarchical Evaluation#LLM Safety#Rule Dependency#Policy Framework2026년 6월 29일댓글 수 로딩 중
[논문리뷰] ReasoningLens: Hierarchical Visualization and Diagnostic Auditing for Large Reasoning Models본 연구는 LRMs가 생성하는 지나치게 긴 Chain-of-Thought 추론 과정이 야기하는 '투명성 부담(Transparency burden)' 문제를 해결하고자 합니다.#Review#Large Reasoning Models#Chain-of-Thought#Diagnostic Auditing#Hierarchical Visualization#Agentic Diagnosis#Systemic Profiling2026년 6월 29일댓글 수 로딩 중