[논문리뷰] Scalable Visual Pretraining for Language Intelligence본 연구는 대규모 언어 모델이 문서의 시각적 요소를 평문으로 변환할 때 발생하는 정보 손실을 해결하기 위해 시각적 문서 자체를 직접 학습하는 VP를 제안한다.#Review#Visual Pretraining#Foundation Models#Multimodal Learning#Scientific Reasoning#Representation Alignment#Autoregressive Training2026년 7월 12일댓글 수 로딩 중
[논문리뷰] Phone Segmentation and Recognition through Phonological Activation Mapping본 논문은 현대의 음성학적 분석 모델이 분절(segmentation)과 인식(recognition)을 별도의 복잡한 모델로 다루며, 다량의 라벨링 데이터와 계산 자원을 요구하는 문제를 해결하고자 한다.#Review#Self-supervised Speech Models#Phonological Activation Mapping#Phone Segmentation#Phone Recognition#Gradient-descent-free#Sample-efficiency#Generalization2026년 7월 12일댓글 수 로딩 중
[논문리뷰] PanoWorld: Real-World Panoramic Generation본 논문은 기존 파노라마 월드 모델들이 복잡한 야외 환경에서 공간적·시간적 일관성 및 물리적 정확성을 유지하는 데 한계가 있다는 문제 의식에서 출발한다.#Review#Panoramic Generation#World Model#Diffusion Model#Rotation Equivariance#Dense Panoramic Ray-Conditioning#Geometry-aware Memory#World3602026년 7월 12일댓글 수 로딩 중
[논문리뷰] MedPMC: A Systematic Framework for Scaling High-Fidelity Medical Multimodal Data for Foundation Models본 논문은 의료 AI 모델의 성능을 제한하는 핵심 원인인 대규모 고품질 의료 멀티모달 데이터의 부족 문제를 해결하고자 합니다.#Review#Multimodal Foundation Models#Medical Data Curation#PubMed Central#Image-Text Pairs#Vision-Language Models#Clinical Transfer Validation#High-Fidelity Pipeline2026년 7월 12일댓글 수 로딩 중
[논문리뷰] Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading본 논문은 기존의 에이전트 벤치마크가 지나치게 단기적인 작업에 치중되어 있으며, 평가 방식이 최종 결과에만 의존한다는 한계를 해결하고자 한다.#Review#Autonomous Agents#Long-Horizon Tasks#Terminal Benchmarks#Dense Reward-Based Grading#Subtask-based Evaluation#Failure Analysis#Agentic Workflow2026년 7월 12일댓글 수 로딩 중
[논문리뷰] KronQ: LLM Quantization via Kronecker-Factored Hessian본 연구는 기존의 PTQ 방법들이 입력 activation 통계량(HX)만을 활용하여 출력 채널 간의 비대칭적인 민감도를 간과한다는 점을 핵심 문제로 지적합니다.#Review#Post-Training Quantization#Kronecker-Factored Hessian#Gradient Covariance#Mixed-Precision Allocation#Bidirectional Incoherence Processing#LLM2026년 7월 12일댓글 수 로딩 중
[논문리뷰] From RGB Generation to Dense Field Readout: Pixel-Space Dense Prediction with Text-to-Image Models본 논문은 대규모 T2I 모델의 우수한 사전 학습 지식을 활용하면서도, 불필요한 generative output interface를 제거하는 최적의 dense prediction 구조를 정의하고자 한다 .#Review#Dense Prediction#Text-to-Image Models#Field Readout#LoRA#Vision Transformers#RGB-native2026년 7월 12일댓글 수 로딩 중
[논문리뷰] Flow-ERD: Agent-type Aware Flow Matching with Entropy-Regularized Distillation for Diverse Traffic Simulation본 논문은 자율주행 시뮬레이션에서 realism과 diversity라는 두 핵심 요소가 서로 상충되는 현상을 해결하고자 합니다 .#Review#Multi-Agent Simulation#Flow Matching#Entropy-Regularized Distillation#Autonomous Driving#Traffic Simulation#Realism-Diversity Pareto2026년 7월 12일댓글 수 로딩 중
[논문리뷰] A Sovereign, Open-Source Foundation Model for German and English본 연구는 기존 오픈 소스 모델들이 가진 세 가지 핵심적인 한계를 해결하고자 합니다. 첫째, 상당수의 '오픈' 모델들이 실제로는 가중치만 공개하고 데이터와 학습 레시피를 불투명하게 처리하여 재현성을 저해하고 있습니다.#Review#Foundation Model#Mixture-of-Experts#Mamba-Transformer#Long-context#Sovereign AI#German-English#Open-Source2026년 7월 12일댓글 수 로딩 중
[논문리뷰] Why Can't I Open My Drawer? Mitigating Object-Driven Shortcuts in Zero-Shot Compositional Action Recognition본 논문은 ZS-CAR 모델이 진정한 의미의 compositional generalization을 수행하지 못하고, Verb 예측 시 Object 정보에 의존하는 object-driven shortcuts에 빠지는 문제를 해결하고자 합니다 .#Review#Zero-Shot Compositional Action Recognition#Object-driven Shortcuts#Co-occurrence Prior Regularization#Temporal Order Regularization#Compositional Generalization#Video Understanding2026년 7월 9일댓글 수 로딩 중
[논문리뷰] Vidu S1: A Real-Time Interactive Video Generation Model본 논문은 기존의 오프라인 생성 패러다임이 가진 상호작용성 부재와 실시간 응답성 결여 문제를 해결하기 위해 Vidu S1을 제안합니다. 대부분의 기존 비디오 생성 모델은 전체 프레임을 한 번에 생성하는 one-shot 방식에 의존하여, 사용자가 생성 과정에 실시간으로 개입할 수 없는 한계가 있습니다.#Review#Real-time Video Generation#Speech-Guided Control#Infinite-Length Inference#TurboDiffusion#TurboServe#Autoregressive Generation2026년 7월 9일댓글 수 로딩 중
[논문리뷰] Video-Oasis: Rethinking Evaluation of Video Understanding본 논문은 현대 Video-LLM 벤치마크들이 모델의 진정한 시공간적 추론 능력을 측정하지 못하고 있다는 근본적인 문제를 지적한다.#Review#Video-LLM#Diagnostic Suite#Spatio-Temporal Reasoning#Benchmark Audit#Video-Native Challenges2026년 7월 9일댓글 수 로딩 중
[논문리뷰] UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks본 논문은 현대의 Proactive Agents를 평가하기 위한 기존 벤치마크들의 구조적 한계를 해결하기 위해 UniClawBench를 제안한다. 기존 연구들은 샌드박스화된 고립 환경과 단일 턴(Single-turn) 평가 방식에 의존하여, 실제 환경의 복잡성과 반복적인 사용자 피드백 루프를 반영하지 못한다 .#Review#Proactive Agents#Capability-Oriented Benchmark#Closed-loop Evaluation#Real-World Tasks#Multimodal Understanding#Tool Usage#Docker-based Environment2026년 7월 9일댓글 수 로딩 중
[논문리뷰] UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma본 연구는 기존 RL 프레임워크가 사용하는 Importance Sampling (IS) 기반의 클리핑 메커니즘이 LLM의 복잡한 추론 경로 탐색을 구조적으로 제한한다는 문제를 해결합니다.#Review#Reinforcement Learning#Large Language Models#Exploration-Stability Dilemma#Importance Sampling#Asymmetric Optimization#Probability Capacity2026년 7월 9일댓글 수 로딩 중
[논문리뷰] PhyMRI-SR: Toward Physics-Aware MRI Image Super-Resolution본 논문은 기존 MRI Super-Resolution(SR) 연구가 저해상도 입력을 고정된 목표로 간주하고 결정론적 매핑만을 수행한다는 한계를 지적합니다. 하지만 실제 MRI 획득 과정에서 해상도와 SNR은 물리적으로 긴밀하게 결합되어 있어, 고정된 입력이 항상 최적의 정보를 담고 있는 것은 아닙니다 .#Review#MRI Super-Resolution#Physics-Aware Reconstruction#2D Gaussian Splatting#Resolution-SNR Trade-off#Meta-Learning#Biophysical Constraints2026년 7월 9일댓글 수 로딩 중
[논문리뷰] OpenCoF: Learning to Reason Through Video Generation본 논문은 기존 비디오 생성 모델들이 시각적 사실성(Visual Realism)은 뛰어나지만, 정교한 논리적 추론(Reasoning) 능력이 부족하다는 문제점을 해결하고자 합니다.#Review#Chain-of-Frame#Video Generation#Reasoning#OpenCoF-17K#Wan-CoF#Visual Reasoning Tokens#Textual Reasoning Tokens2026년 7월 9일댓글 수 로딩 중
[논문리뷰] LongE2V: Long-Horizon Event-based Video Reconstruction, Prediction, and Frame Interpolation with Video Diffusion Models본 논문은 기존 event-based vision 모델들이 겪는 성능 한계와 작업별 파편화 문제를 해결하기 위해 LongE2V를 제안한다.#Review#Event-based Vision#Video Diffusion Models#Video Reconstruction#Long-horizon Prediction#Frame Interpolation#Autoregressive Unrolling2026년 7월 9일댓글 수 로딩 중
[논문리뷰] Linear Attention Architectures: Mechanisms, Trade-offs, and Cross-Layer Routing본 논문은 Transformer의 self-attention이 긴 컨텍스트에서 가지는 $O(T^2)$ 연산 비용 문제를 해결하기 위해, Recurrent-memory 기반 Linear Attention 아키텍처들의 구조적 특성을 체계적으로 분석합니다.#Review#Linear Attention#Recurrent Associative Memory#DeltaNet#Cross-Layer Routing#Architecture Trade-offs#CLVR#CLER2026년 7월 9일댓글 수 로딩 중
[논문리뷰] Jet-Long: Efficient Long-Context Extension with Dynamic Bifocal RoPE기존의 Zero-shot context extension 방법들은 고정된 하나의 리스케일링 팩터를 사용하므로, 짧은 컨텍스트에서의 충실도와 긴 컨텍스트에서의 외삽(extrapolation) 성능 사이에서 불가피한 트레이드오프를 겪습니다.#Review#Long-Context Extension#Zero-shot#RoPE#Bifocal RoPE#Inclusion–Exclusion Attention#CuTe Kernel2026년 7월 9일댓글 수 로딩 중
[논문리뷰] Ideas Have Genomes: Benchmarking Scientific Lineage Reasoning and Lineage-Grounded Idea Generation본 연구는 현행 AI 시스템이 논문 생성 및 연구 지원 시 혈통적 계승 구조를 이해하지 못하고 표면적인 topical proximity에 의존하는 문제를 해결하고자 한다.#Review#Scientific Lineage#Idea Genome#GenomeDiff#IG-Bench#Automated Research#Lineage Competence2026년 7월 9일댓글 수 로딩 중