[논문리뷰] CADENCE: Closing the Reasoning Gap via Coverage-Adaptive On-Policy Distillation본 논문은 소형 모델(Student)이 대형 모델(Teacher)의 복잡한 추론 능력을 전수받는 과정에서 발생하는 세 가지 고질적인 실패 모드(Failure Modes)를 해결하고자 합니다.#Review#Knowledge Distillation#On-Policy Learning#Reasoning Gap#Coverage-Adaptive Scheduling#Per-Token Surrogate#Reward Sparsity#LLM Compression2026년 7월 29일댓글 수 로딩 중
[논문리뷰] Wonder: Video World Model Done Better본 논문은 실시간 상호작용이 가능한 비디오 월드 모델에서 카메라 제어력, 긴 맥락(long-horizon)의 기억력, 그리고 추론 효율성 간의 상충 문제를 해결하기 위해 제안되었습니다 .#Review#Video World Model#Camera-Controllable#Streaming Inference#Sparse Attention#Distillation2026년 7월 28일댓글 수 로딩 중
[논문리뷰] Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization본 논문은 압축된 텍스트 생성 파이프라인에서 발생하는 품질 저하의 근본 원인을 식별하는 문제를 해결합니다 . 2단계 생성 구조에서는 코덱이 정보를 손실하거나 잠재 생성기가 부적절한 코드를 생성하는 등 두 가지 주요 실패 모드가 존재합니다.#Review#Compressed Short-Text Generation#Bottleneck Localization#VQ-VAE-2#Masked Discrete Diffusion#Staged Validation Protocol2026년 7월 28일댓글 수 로딩 중
[논문리뷰] VisualPatchWorld: Code World Models as Latent Structured Representations for Planning본 논문은 기존의 Neural world model이 갖는 불투명성과 Physics engine 기반 모델의 확장성 한계를 극복하기 위해 제안되었습니다 .#Review#World Models#Code Induction#Program Synthesis#Model-Predictive Control#Structured Representation#Visual Abstraction#Two-level Induction2026년 7월 28일댓글 수 로딩 중
[논문리뷰] Visual prompt engineering for video models본 연구는 텍스트 기반의 프롬프트 엔지니어링이 LLM의 성능을 비약적으로 향상시키는 것처럼, 비디오 모델의 고정된 입력 이미지(Visual Prompt)를 수정하여 추론 성능을 개선할 수 있다는 가설에서 출발합니다.#Review#Visual Prompt Engineering#VIPE#Video Models#Visual Reasoning#Realism Bias#Test-Time Scaling2026년 7월 28일댓글 수 로딩 중
[논문리뷰] Towards Robust Reinforcement Learning for Small-Scale Language Model Agents본 연구는 70M~500M 파라미터 규모의 SLM을 대상으로 한 PPO 기반 강화학습이 왜 불안정한지 그 기제를 규명하고 해결책을 제시한다. 기존 연구들은 대규모 언어 모델 중심의 RLHF 기법을 소규모 모델에 그대로 적용하면서 발생하는 성능 하락과 학습 불안정을 겪었으나, 그 원인을 체계적으로 분석하지 않았다.#Review#Reinforcement Learning#Small Language Models#PPO#RLHF#Alignment#Model Stability2026년 7월 28일댓글 수 로딩 중
[논문리뷰] Temporal-Distance JEPA: Plan-Aware Representation Learning for Latent World Model Predictive Control기존의 LeWM(LeWorldModel)과 같은 JEPA 기반 모델들은 학습 시에는 효율적인 표현력을 제공하지만, 테스트 시 계획(planning) 단계에서는 단순히 latent space 내의 Euclidean Distance를 목표 점수(cost)로 사용한다 .#Review2026년 7월 28일댓글 수 로딩 중
[논문리뷰] Shieldstral본 논문은 기존 안전 모델(guardrail models)이 가진 고정된 분류 체계의 한계를 해결하기 위해 Shieldstral을 제안합니다 . 기존 모델들은 파편화된 데이터셋의 서로 다른 Taxonomy로 인해 범용적인 적용이 어렵고, 배포 환경에 따라 달라지는 유연한 안전 정책을 반영하지 못한다는 문제가 있었습니다.#Review#Multimodal Safety#Content Moderation#Policy-Adaptive#Question-Answering#Model Merging#Data Unification2026년 7월 28일댓글 수 로딩 중
[논문리뷰] ReDesign: Recovering Editable Design Structures from Images via Agentic Decomposition본 논문은 라스터 이미지로부터 편집 가능한 디자인 파일(예: Figma, Adobe Illustrator)을 복구하는 것이 현대 디자인 워크플로우의 고비용 병목 구간임을 지적합니다 .#Review#Agentic Decomposition#Editable Design#Layer Hierarchy#Raster-to-Editable#VLM#Graceful Verification#Figma Edit Replay Benchmark2026년 7월 28일댓글 수 로딩 중
[논문리뷰] Projection Pursuit CPCANet for Domain Generalization본 논문은 기존 CPCANet이 직면한 미니배치(mini-batch) 기반 공분산 추정의 한계인 랭크 결핍(rank-deficiency) 문제를 해결하고자 합니다. 기존 방식은 특징 차원이 배치 사이즈를 초과할 경우 공분산 행렬의 랭크가 제한되어, 도메인 불변 정보를 충분히 복원하지 못하는 치명적인 단점이 있습니다.#Review#Domain Generalization#CPCA#Projection Pursuit#Stiefel Manifold#Deep Unfolding#Robust Statistics2026년 7월 28일댓글 수 로딩 중
[논문리뷰] PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models본 논문은 기존 MLLM 벤치마크가 시각적 인식 능력(Perception)과 고차원적 추론/지식(Reasoning & Knowledge)을 구분하지 못해 발생하는 불명확한 평가 문제를 해결하고자 한다 .#Review#Multimodal Large Language Models#Visual Perception#Benchmark#Atomic Capability#Error Taxonomy#Failure-driven Discovery2026년 7월 28일댓글 수 로딩 중
[논문리뷰] Pass the Baton: Trajectory-Relayed On-Policy Distillation본 논문은 OPD 과정에서 발생하는 Prefix Failure 문제를 해결하기 위해 고안되었습니다.#Review#On-Policy Distillation#Prefix Failure#Speculative Decoding#Mathematical Reasoning#Knowledge Distillation#Language Model Post-training2026년 7월 28일댓글 수 로딩 중
[논문리뷰] Parallel Decoding Distillation for Fast Image and Video Generation본 논문은 대규모 Diffusion 및 Flow 모델의 높은 계산 비용과 긴 추론 지연 시간을 해결하기 위해 PDD를 제안합니다 . 기존의 고성능 생성 모델들은 반복적인 Sampling 과정으로 인해 수백 번의 네트워크 평가가 필요하며, 이는 실시간 서비스에 심각한 병목 현상을 유발합니다.#Review#Parallel Decoding Distillation#Diffusion Models#Flow Matching#Trajectory-based Distillation#Video Generation#NFE#Fast Inference2026년 7월 28일댓글 수 로딩 중
[논문리뷰] OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMs본 논문은 OmniLLM의 긴 오디오-비디오 토큰 시퀀스로 인한 높은 Latency와 메모리 비용 문제를 해결하기 위해, 기존의 고정된 토큰 예산 할당 방식의 한계를 지적합니다 .#Review#OmniLLM#Token Compression#Budget Allocation#Skill-Driven#Multimodal Inference#Efficiency#Token Pruning2026년 7월 28일댓글 수 로딩 중
[논문리뷰] Novel Claim or Déjà Vu? Rethinking 'Contamination-Free'' Dynamic Evaluation for Multimodal Automated Fact-Checking본 논문은 기존의 Static Benchmark가 시간 경과에 따른 정보 노후화로 인해 LLM의 사전 학습 데이터와 중첩되는 Contamination 문제를 겪고 있으며, 이것이 실제 MAFC 성능을 왜곡한다는 점을 문제로 제기합니다 .#Review#Multimodal Automated Fact-Checking#Dynamic Evaluation#Contamination#Large Language Models#Evidence Retrieval#Benchmark2026년 7월 28일댓글 수 로딩 중
[논문리뷰] Mapping CVEs to MITRE ATT&CK Techniques: A Curated Gold-Set Classifier and the Limits of LLM-Assisted Label Expansion본 논문은 CVE 취약점 설명 텍스트를 MITRE ATT&CK 기법으로 매핑하는 자동화 시스템의 한계를 해결하고자 한다. 기존의 CWE→CAPEC→ATT&CK 체인을 통한 매핑은 table-expansion으로 인한 과도한 잡음이 포함되어 있어 훈련 데이터로 부적합하다 .#Review#CVE#MITRE ATT&CK#Multi-label Classification#LLM#Label Expansion#Evaluation Noise2026년 7월 28일댓글 수 로딩 중
[논문리뷰] Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model본 논문은 기존 VLM들이 오프라인 추론에서는 우수한 성능을 보이나, 연속적인 비디오 스트림 처리 시 발생하는 Moravec’s paradox를 해결하고자 합니다. 기존 연구들은 고정된 프레임 샘플링 방식을 사용하여 배경과 같은 중복 정보를 반복적으로 인코딩함으로써 컴퓨팅 효율성을 저하시키고 실시간 반응성을 제한합니다.#Review#Multimodal Foundation Model#Codec-Native#Streaming Perception#Video-Language Model#Visual Tokenization#Efficiency#AI4AI Data Pipeline2026년 7월 28일댓글 수 로딩 중
[논문리뷰] MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities본 논문은 기존의 Any-to-Any 모델들이 Encoder-Decoder나 Diffusion 아키텍처에 의존하여 대규모 사전 학습된 Decoder-only 모델의 강력한 성능을 활용하지 못하는 한계를 해결하고자 합니다.#Review#Any-to-Any#Decoder-Only#Multimodal Generation#Flow Matching#Chained Generation#Unified Tokenization#Multimodal Modeling2026년 7월 28일댓글 수 로딩 중
[논문리뷰] Keep It InMind: Benchmarking the Implicit-Association Blind Spot in Agent Memory본 논문은 검색 기반 메모리 시스템이 사용자의 중요 정보를 저장하고 있음에도 불구하고, 실제 추론 시점에 해당 정보를 활용하지 못하는 Implicit-Association Blind Spot 문제를 해결하고자 합니다.#Review#Implicit-Association#Agent Memory#Retrieval-Based Memory#Benchmark#InMind#Routing#Blind Spot2026년 7월 28일댓글 수 로딩 중
[논문리뷰] HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone본 연구는 로봇 학습의 핵심 병목 현상인 '고품질 조작 데이터의 부족' 문제를 해결하고자 합니다. 기존 방식은 로봇 직접 조작(Teleoperation)을 통해 데이터를 수집하지만, 이는 비용이 매우 많이 들고 확장이 어렵다는 근본적인 한계가 있습니다.#Review#Robot Learning#Manipulation Policy#UMI#End-to-End#Data-Production#Deployability2026년 7월 28일댓글 수 로딩 중