[논문리뷰] NeoMME: A Single-Tower Multimodal-Native Multilingual Foundation Encoder for Efficient Fine-Tuning and Inference본 논문은 기존 multimodal 모델들이 지나치게 복잡한 아키텍처를 사용하여 비효율적인 추론 및 fine-tuning 구조를 가진 문제를 해결하고자 합니다.#Review#Multimodal Encoder#Bidirectional Transformer#Visual Document Retrieval#Masked Discrete-Diffusion#Late-Interaction#Efficient Inference#Dynamic Resolution2026년 9월 2일댓글 수 로딩 중
[논문리뷰] MULTI3IR: A Benchmark for Multi-perspective Multi-domain Multi-modal Information Retrieval본 논문은 현대의 Open-ended Query 검색이 특정 단일 관점에 치우쳐(Single-perspective bias) 다양한 측면의 정보를 제공하지 못하는 문제를 해결하고자 합니다.#Review#Information Retrieval#Multi-modal#Benchmark#Perspective-guided Learning#Retrieval Diversification#Multi-vector Retrieval2026년 9월 2일댓글 수 로딩 중
[논문리뷰] Language Models Can Control Their Own AttentionLong-context Language Model (LLM) Inference 과정에서 Transformer 아키텍처는 매 Decoding Step마다 모든 이전 토큰에 대해 Attention을 계산하므로, KV Cache 메모리 접근 Latency가 전체 Decoding Time의 상당 부분을 차지하며 이는 Long-context Regime에서 특히 심화됩니다.#Review2026년 9월 2일댓글 수 로딩 중
[논문리뷰] Kirin: Animal Motion Generation from In-the-Wild Video본 논문은 야생 동물의 동작 데이터를 확보하기 어려운 환경에서, 실제 동물의 다양하고 생동감 있는 동작을 생성하는 데 한계가 있다는 문제점을 해결하고자 한다 . 기존 연구들은 소규모의 인위적인 데이터나 게임용 데이터에 의존하여 실세계 동물 동작의 다양성을 포착하지 못하는 단점이 있다.#Review#Animal Motion Generation#In-the-Wild Video#3D Motion Reconstruction#Diffusion Models#Text-Image Conditioned Generation#AiM3D Dataset2026년 9월 2일댓글 수 로딩 중
[논문리뷰] It Takes Two to Match: Co-Evolving Generative Retriever with Reinforcement Learning본 논문은 현대의 검색 시스템에서 검색(Retrieval) 단계의 오류가 하위 랭킹(Ranking) 단계에서 복구되기 어렵다는 문제점을 지적하며, 효과적인 검색을 위한 정밀도와 재현율의 균형 문제를 해결하고자 합니다.#Review#Generative Retrieval#Reinforcement Learning#Co-Evolution#Keyword Generation#Retrieval F1#LLM2026년 9월 2일댓글 수 로딩 중
[논문리뷰] Institutional Newspapers Pipeline: Deriving billions of high quality tokens from historical newspapers본 연구는 역사적 신문 자료의 불규칙한 레이아웃과 낮은 OCR 품질로 인해 학계의 계산적 접근이 제한되는 문제를 해결하고자 합니다. 기존의 전통적인 OCR 엔진은 복잡한 다단 구성이나 장식적 헤딩을 파싱하는 데 한계가 있으며, 대규모 데이터 처리에 필요한 비용 효율성을 확보하기 어렵습니다.#Review#Historical Newspapers#OCR#Vision-Language Models#Pipeline#Data Pipeline#Digital Humanities#Structured Datasets2026년 9월 2일댓글 수 로딩 중
[논문리뷰] Influence-Directed Distillation: Solving the Diversity Bottleneck in Sampled-Token On-Policy Distillation본 논문은 Sampled-Token OPD가 효율적임에도 불구하고 pass@kk 성능이 정체되는 Diversity Distillation Failure 문제를 해결합니다. 기존 방법론들은 무분별하게 엔트로피를 높이거나, 비용이 높은 Forward-KL을 사용하여 효율성을 저해하는 한계가 있습니다.#Review#On-Policy Distillation#Sampled-Token OPD#Diversity Bottleneck#Entropy Influence#First-Order Analysis#Divergence-Adaptive Shrinkage2026년 9월 2일댓글 수 로딩 중
[논문리뷰] Ignorance or Incompetence? Constructing Knowledge-Gated, Verifiable Tasks for LLM Agents본 논문은 전문 분야의 Agent 과제를 설계할 때 발생하는 지식 가용성(Knowledge Availability)과 검증 가능성(Verifiability)의 불균형 문제를 해결하고자 한다.#Review#Synthetic task construction#Knowledge gating#Task validation#Verifiable rewards#Agent evaluation2026년 9월 2일댓글 수 로딩 중
[논문리뷰] HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?본 논문은 Agent가 연구용 프로토타입에서 실제 배포 도구로 진화함에 따라, Agent의 성능을 좌우하는 외부 인프라인 Harness의 중요성을 규명하고 이를 모델이 직접 개발할 수 있는지 검증하고자 합니다.#Review#Agent Harness#LLM#Software Engineering#Benchmark#Agent Evolution#Code Generation2026년 9월 2일댓글 수 로딩 중
[논문리뷰] FoldingAgent: Inferring Parametric Origami Procedures from Demonstration Videos본 논문은 인간의 직관적인 종이 접기 비디오와 기계 해석을 위한 구조적 표현 사이의 근본적인 의미론적 격차(Semantic gap)를 해소하기 위해 제안되었다. 기존 연구들은 주로 정적인 Crease Pattern을 입력으로 요구하지만, 실제 사용자들은 주로 비구조적인 비디오 데모를 통해 지식을 공유한다.#Review#Origami#Vision-Language Model#Agentic Framework#Procedural Inference#PurelandFold#Parametric Representation#Physical Simulation2026년 9월 2일댓글 수 로딩 중
[논문리뷰] Exploring Collaboration between a language and a non-language agent본 연구는 Large Language Models (LLMs)가 전문 서브에이전트들을 조율하여 복잡한 태스크를 해결하는 오케스트레이터(orchestrator)로 활발히 활용되고 있지만, 게임 플레이나 로봇 공학 등 여러 중요한 영역에서 가장 강력한 에이전트들은 language models가 아니라는 근본적인 문제 의식에서 출발합니다.#Review#LLMs#Non-language Agents#Collaboration#Verbalization Debt#Latent State Internalization#Chess#Reinforcement Learning#LLAMIA-Bench2026년 9월 2일댓글 수 로딩 중
[논문리뷰] ExecRetrieval: Measuring the Functional-Correctness Gap in Code-Embedding Retrieval기존 코드 Retrieval 벤치마크들은 Lexical 또는 Topical Similarity에 중점을 두어, 코드 임베딩 모델이 기능적으로 올바른 코드와 미묘하게 버그가 있는 코드를 구별하는 능력을 측정하지 못하는 문제를 안고 있습니다.#Review#Code Retrieval#Code Embeddings#Functional Correctness#Code Benchmarking#Buggy Variants#Execution-based Evaluation#LLM Generation2026년 9월 2일댓글 수 로딩 중
[논문리뷰] EarlyEval: Cheaper Agent Evaluation via Early Outcome Prediction본 논문은 LLM 에이전트 평가 비용이 기하급수적으로 증가하는 문제를 해결하기 위해 고안되었습니다. 기존의 벤치마크 평가 방식은 복잡한 다단계 에이전트 실행을 필요로 하여, 단일 개발 주기당 수백에서 수천 달러에 달하는 높은 컴퓨팅 비용을 발생시킵니다 .#Review#LLM Agents#Evaluation Efficiency#Early Outcome Prediction#Benchmark Distillation#LightGBM2026년 9월 2일댓글 수 로딩 중
[논문리뷰] Debias-SparseGPT: Bias-Aware Pruning for Large Language Models본 연구는 LLM 압축 기술인 Pruning이 모델의 연산 효율성을 높이지만, 이 과정에서 모델 내부에 존재하는 인구통계학적 편향을 심화시키는 부작용을 해결하고자 한다.#Review#Large Language Models#Model Compression#Pruning#Debiasing#Hessian#SparseGPT#Fairness2026년 9월 2일댓글 수 로딩 중
[논문리뷰] Cliff: Learning Process Rewards from the First Mistake본 논문은 기존 RLVR 방식이 최종 결과만을 평가하는 coarse-grained 보상 체계를 사용하여 중간 추론 과정에 대한 충분한 학습 지침을 제공하지 못한다는 문제점을 해결하고자 합니다.#Review#Reinforcement Learning#LLM Post-training#Process Supervision#Reward Shaping#Reasoning#Credit Assignment2026년 9월 2일댓글 수 로딩 중
[논문리뷰] CRISP: Cliff-awaRe Input-adaptive Sparse Prefilling with Structural-Mass-Motivated Routing본 논문은 long-context LLM의 prefilling 단계에서 발생하는 이차 시간 복잡도(Quadratic Scaling) 문제를 해결하기 위한 동적 희소 어텐션(Dynamic Sparse Attention) 기법의 구조적 한계를 다룹니다.#Review#Long-Context LLM#Sparse Attention#Dynamic Routing#Mass Cliff#Prefilling#Structural-Mass Proxy#Sink-Aware Thresholding2026년 9월 2일댓글 수 로딩 중
[논문리뷰] Beyond Visual Similarity: Entity-Aligned Retrieval for Knowledge-Based Visual Question Answering본 연구는 기존 KB-VQA 파이프라인에서 사용하는 CLIP 스타일의 듀얼 인코더가 지닌 표면적 시각적 유사성(surface-level visual similarity) 기반 검색의 한계를 해결하고자 합니다.#Review#Knowledge-Based VQA#Retrieval Augmented Generation#Multimodal Large Language Models#Entity-Aligned Retrieval#Semantic Distillation#Hard Negative Sampling2026년 9월 2일댓글 수 로딩 중
[논문리뷰] Autoregressive Mosaics: Probing 2D Spatial Reasoning in Text-Only Language Models본 논문은 텍스트 전용(Text-only) LLM이 생성하는 이미지가 진정한 2D 공간 추론을 반영하는지, 아니면 단순한 코드 변환 능력에 의존하는지를 규명하고자 한다. 기존 연구들은 모델의 최종 생성물만을 평가함으로써 공간 구성 능력과 코드 생성 능력을 분리하지 못한다는 한계를 가진다 .#Review#Spatial Reasoning#Autoregressive Models#AM-Bench#LLM#Representation Probing#Code Generation#Mosaic2026년 9월 2일댓글 수 로딩 중
[논문리뷰] Aspire: Can Models Self-Evolve from Vague Goals?본 논문은 LLM의 자가 진화(Self-evolution) 과정에서 Vague Goal로부터 목표를 구체화하고 진정한 역량 향상을 달성하는 문제를 해결하고자 합니다.#Review#Self-Evolution#LLM#Vague Goals#Autonomous Post-training#Goal Operationalization#Agent Harness#Benchmark2026년 9월 2일댓글 수 로딩 중
[논문리뷰] A Glance Is All You Need: Single-Pass Fine-Grained Image Captioning with SimLoss본 연구는 고수준의 캡셔닝 모델이 유창한 텍스트를 생성함에도 불구하고, 정작 이미지의 속성, 질감, 수량, 공간적 관계 등 세밀한 세부 정보를 놓치는 현상을 해결하고자 합니다.#Review#Fine-Grained Image Captioning#SimLoss#Contrastive Objective#Single-Pass Inference#Embedding-Space Supervision#Vision-Language Models#Latency2026년 9월 2일댓글 수 로딩 중