[논문리뷰] Accurate, Interdisciplinary and Transparent Structure-property Understanding with Deep Native Structural Reasoning본 연구는 단백질, 화학 물질, 무기 결정 등 과학적 구조(Structure)와 물성(Property) 간의 복잡한 관계를 해석하는 과정에서 기존 AI 시스템이 겪는 표현력과 추론의 한계를 해결하고자 합니다.#Review#Foundation Model#Structure-property Relationship#Multimodal Reasoning#Scientific AI#Chain-of-thought#Native Structural Reasoning2026년 7월 8일댓글 수 로딩 중
[논문리뷰] Where to cut, how deep: BPE and Unigram-LM on chemistry SMILES본 논문은 화학 언어 모델에서 당연하게 여겨지는 BPE 토큰화 방식이 최선의 선택인지 의문을 제기하며, 화학적 특수 환경에서 BPE와 Unigram-LM이 서로 다른 어휘 사전을 구축하는지 검증합니다.#Review#Chemistry SMILES#Tokenizer#BPE#Unigram-LM#Subword Algorithm#Vocabulary#Granularity2026년 7월 7일댓글 수 로딩 중
[논문리뷰] When Classic Cache Policies Fail: Learning-Augmented Replacement for Semantic Retrieval Buffers본 논문은 기존의 FIFO, LRU, LFU 등 고전적인 캐시 정책이 LLM 에이전트의 semantic 워크로드에서 체계적으로 실패한다는 문제를 정의한다.#Review#Semantic Caching#LLM Agents#Cache Replacement#Online Learning#Thompson Sampling#Regret Bounds2026년 7월 7일댓글 수 로딩 중
[논문리뷰] Vision as Unified Multimodal Generation본 논문은 기존 컴퓨터 비전 분야가 각 작업(task)별로 최적화된 아키텍처와 독립적인 손실 함수(loss function)를 사용하는 파편화된 시스템에 의존하고 있다는 문제점을 지적합니다. 이로 인해 다양한 시각적 감독 신호를 통합, 재사용 및 결합하는 데 구조적인 한계가 발생합니다.#Review#Unified Multimodal Generation#Computer Vision#Foundation Models#Instruction Tuning#Dense Prediction#SenseNova-Vision#Multimodal Learning2026년 7월 7일댓글 수 로딩 중
[논문리뷰] TurnOPD: Making On-Policy Distillation Turn-Aware for Efficient Long-Horizon Agent Training본 논문은 장기 계획 및 에이전트 환경에서 OPD가 겪는 자원 비효율성과 최적화 불균형 문제를 해결하기 위해 고안되었습니다.#Review#On-Policy Distillation#Long-Horizon Agents#Turn-Aware#Rollout-Depth Budgeting#Efficiency#Reinforcement Learning2026년 7월 7일댓글 수 로딩 중
[논문리뷰] TREK: Distill to Explore, Reinforce to Refine본 논문은 GRPO 학습 중 발생하는 핵심적 한계인 '탐색 공간의 부족(Inadequate exploration)' 문제를 해결하고자 합니다.#Review#GRPO#Reinforcement Learning#Distillation#Exploration#Reasoning#Language Models#Policy Optimization2026년 7월 7일댓글 수 로딩 중
[논문리뷰] SkillOpt-Lite: Better and Faster Agent Self-evolution via One Line of Vibe본 논문은 기존의 Agent Skill 최적화 프레임워크들이 과도하게 복잡해지고 있다는 점을 지적하며, 이론적·실증적으로 정당화 가능한 Minimal Viable Pipeline의 필요성을 제기합니다.#Review#Agent Self-evolution#Skill Optimization#Zeroth-Order Optimization#PAC-Learning#Harness Optimization#Minimal Viable Pipeline2026년 7월 7일댓글 수 로딩 중
[논문리뷰] SiamJEPA: On the Role of Siamese Student Encoders in JEPA본 논문은 JEPA 프레임워크 내에서 Siamese Student Encoders의 역할과 이들이 표현 학습에 미치는 유의미한 영향력을 체계적으로 규명하는 것을 목표로 합니다.#Review#Self-supervised Learning#JEPA#Siamese Student Encoders#Representation Learning#Latent Prediction#Inductive Bias2026년 7월 7일댓글 수 로딩 중
[논문리뷰] SIEVE: Structure-Aware Data Selection for Imitation Learning with VLA Models본 논문은 대규모 로봇 데모 데이터셋에 존재하는 중복성, 노이즈, 불균일한 작업 커버리지 문제를 해결하기 위해 구조적 데이터 선택 프레임워크인 SIEVE를 제안한다 .#Review#Vision-Language-Action Models#Imitation Learning#Data Selection#Primitive Discovery#Structural Exposure#Behavior Cloning2026년 7월 7일댓글 수 로딩 중
[논문리뷰] RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation본 논문은 로봇 학습을 위한 대규모 데이터 수집이 물리적 teleoperation의 물리적 제약과 자원 한계로 인해 병목 현상을 겪고 있다는 문제를 해결하고자 합니다.#Review#Digital Teleoperation#World Model#Robotic Learning#Video Diffusion Transformer#Action-Conditioned Generation#Sim2Real Transfer#Imitation Learning2026년 7월 7일댓글 수 로딩 중
[논문리뷰] RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation기존의 로봇 조작을 위한 월드 모델들은 주로 2D 픽셀 기반의 비디오 생성에 의존하고 있어, 실제 로봇 시스템이 요구하는 정밀한 3D 공간 관계나 물리적 일관성을 확보하는 데 한계가 있습니다.#Review#4D Embodied World Models#Robotic Manipulation#Generative Video Models#RGB-DF Representation#Flow Matching#Joint Cross-Modal Attention#Embodied AI2026년 7월 7일댓글 수 로딩 중
[논문리뷰] Rank-Then-Act: Reward-Free Control from Frame-Order Progress일반적인 강화학습 에이전트 학습에 필요한 외적 보상(Extrinsic Reward) 설계는 매우 복잡하거나, 환경의 특성에 따라 보상 기획이 불가능한 경우가 많습니다.#Review#Reward-Free Control#Vision-Language Models#Ordinal Progress#Spearman Correlation#GRPO#Reinforcement Learning2026년 7월 7일댓글 수 로딩 중
[논문리뷰] Quantifying and Expanding the Theoretical Capacity of Late-Interaction Retrieval Models본 논문은 Late-Interaction 모델의 핵심 연산인 MaxSim이 왜 기존의 단일 벡터 기반 dense 또는 sparse retrieval 모델보다 성능이 우수한지 그 이론적 근거를 규명하고자 합니다.#Review#Late-Interaction#MaxSim#Information Retrieval#Neural Retrieval#Representation Learning#Inner Product2026년 7월 7일댓글 수 로딩 중
[논문리뷰] PointDiT: Pixel-Space Diffusion for Monocular Geometry Estimation본 요청에 대해 제공해주신 논문 URL(https://arxiv.org/html/2607.02515)에 직접적인 접근이 현재 기술적 제약으로 인해 불가능하여, 해당 논문의 내용을 정확히 분석할 수 없습니다.#Review2026년 7월 7일댓글 수 로딩 중
[논문리뷰] PluraMath: Extending Mathematical Reasoning Evaluation Beyond High-Resource Languages본 연구는 대규모 언어 모델(LLM) 평가 및 학습 데이터가 영어와 중국어 등 고자원 언어에 과도하게 편향되어 있는 문제를 해결하는 것을 목적으로 합니다.#Review#Multilingual Benchmark#Mathematical Reasoning#Large Language Models#Low-resource Languages#Human-in-the-loop2026년 7월 7일댓글 수 로딩 중
[논문리뷰] Parallelized Autoregressive Decoding for Omni-Modal Dense Video Captioning본 논문은 기존 Autoregressive Video-LLM 기반의 Dense Video Captioning 모델들이 겪는 높은 추론 지연(Latency)과 확장성 문제를 해결하고자 합니다.#Review#Dense video captioning#Parallel decoding#Latent planning#Omni-modal#Video-LLM#Dependency restructuring2026년 7월 7일댓글 수 로딩 중
[논문리뷰] Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding본 논문은 기존의 엄격한 순차적 Autoregressive (AR) 디코딩 방식이 가진 낮은 추론 병렬성과 자원 활용도 문제를 해결하기 위해 고안되었습니다.#Review#Language Model#Autoregressive#Diffusion#Self-Speculation#Parallel Decoding#Inference Efficiency#Tri-Mode Decoding2026년 7월 7일댓글 수 로딩 중
[논문리뷰] MuseBench: Benchmarking Intent-Level Audiovisual Arts Understanding in MLLMs본 논문은 최신 MLLMs가 일반적인 인식 및 추론 태스크에서는 높은 성능을 보이나, 예술적 창작 의도를 해석하는 전문 영역에서는 여전히 유의미한 한계를 보인다는 문제의식에서 출발합니다.#Review#Multimodal Large Language Models#Audiovisual Arts#Benchmark#Intent-Level Understanding#Video Essay#Interpretation Plurality2026년 7월 7일댓글 수 로딩 중
[논문리뷰] MentalThink: Shaping Thoughts in Mental SVG World본 논문은 기존의 언어 중심 Multimodal CoT가 가진 시각적 접지(Visual Grounding)의 취약성과 할루시네이션(Hallucination) 문제를 해결하고자 합니다.#Review#Multimodal LLMs#Spatial Reasoning#Scalable Vector Graphics#Chain-of-Thought#Reinforcement Learning#Mental Imagery2026년 7월 7일댓글 수 로딩 중
[논문리뷰] Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory본 논문은 기존 비디오 에이전트 모델들이 롱폼 비디오를 처리할 때 의존하는 '탐정 스타일'의 반복적 추론(Iterative Reasoning)이 초래하는 과도한 비용과 레이턴시 문제를 해결하고자 합니다 .#Review#Multimodal Long-Term Memory#Agentic Video Understanding#Dual-State Design#Reflexive Response#Retrieval-Augmented Generation#Video-LLM2026년 7월 7일댓글 수 로딩 중