[논문리뷰] HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone본 연구는 로봇 학습의 핵심 병목 현상인 '고품질 조작 데이터의 부족' 문제를 해결하고자 합니다. 기존 방식은 로봇 직접 조작(Teleoperation)을 통해 데이터를 수집하지만, 이는 비용이 매우 많이 들고 확장이 어렵다는 근본적인 한계가 있습니다.#Review#Robot Learning#Manipulation Policy#UMI#End-to-End#Data-Production#Deployability2026년 7월 28일댓글 수 로딩 중
[논문리뷰] GLI-AL: A Multi-Modal Glioma MRI Label Resource with Unified Anatomy-Lesion Labels본 논문은 BraTS-GLI 데이터셋의 기존 종양 중심 라벨링 체계가 가진 공존 병변(WMH) 미반영 및 라벨 노이즈 문제를 해결하기 위해 통합적인 Anatomy-Lesion 라벨 자원인 GLI-AL을 제안한다.#Review#Anatomy-Lesion Segmentation#Label Noise#BraTS-GLI#White Matter Hyperintensities#Joint Supervision#Data Resource2026년 7월 28일댓글 수 로딩 중
[논문리뷰] Edge-Aware Thermal Infrared UAV Swarm Tracking본 논문은 리소스가 제한된 Edge 환경에서 TIR 기반 UAV 군집 추적 시 발생하는 정확도와 컴퓨팅 효율성 간의 불균형 문제를 해결합니다.#Review#Thermal Infrared#UAV Swarm Tracking#Adaptive Kinematic Kalman Filter#Edge-Aware#Multi-Object Tracking#Computational Efficiency2026년 7월 28일댓글 수 로딩 중
[논문리뷰] CodeNib: A Multi-View Data System for Serving Repository Context to Coding Agents본 논문은 코딩 에이전트가 리포지토리의 컨텍스트를 파악하는 과정에서 발생하는 비효율적인 반복 탐색과 생명주기 관리 비용 문제를 해결하기 위해 CodeNib을 제안합니다 . 기존의 에이전트 시스템은 리포지토리를 탐색할 때마다 인덱스, 언어 서버, 로컬 히스토리를 매번 새로 발견하거나 구성해야 하는 중복 비용이 발생합니다.#Review#Coding Agents#Repository Context#Multi-View Data System#Incremental Maintenance#Agent Runtime2026년 7월 28일댓글 수 로딩 중
[논문리뷰] A New Role for Relevance: Guiding Corpus Interaction in Agentic Search본 논문은 기존의 검색 에이전트가 Relevance를 단순히 상위 k개 문서를 선택하는 필터로만 사용하여, 증거의 국소화나 검증이라는 에이전트의 핵심 작업에서 한계를 보인다는 점을 문제로 지적합니다.#Review#Agentic Search#Relevance-Aware#Direct Corpus Interaction#RipGrep#Information Retrieval#Search Convergence2026년 7월 28일댓글 수 로딩 중
[논문리뷰] dRAE: Representation Autoencoder with Hyper-Spherical Codes본 논문은 시각적 이해와 생성을 통합하는 과정에서 발생하는 고차원 표현의 이산화 문제와 기존 Vector Quantization (VQ) 방식의 한계를 해결하고자 합니다.#Review#Representation Autoencoder#Vector Quantization#Hyper-Spherical Quantization#Multimodal Foundation Models#Codebook Collapse#Image Reconstruction#Feature Anisotropy2026년 7월 27일댓글 수 로딩 중
[논문리뷰] The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation본 연구는 고차원 의사결정이 필요한 Long-Horizon 환경에서 LLM 기반 에이전트가 겪는 계획 수립의 불확실성과 긴 문맥 유지의 어려움을 해결하는 것을 목표로 한다.#Review#Multi-Turn Planning#Long-Horizon#Agentic Distillation#On-Policy Learning#Pre-training#Post-training2026년 7월 27일댓글 수 로딩 중
[논문리뷰] TRACE: Business Rule-Grounded Reasoning Curriculum for Knowledge-Preserving Parametric Tool Retrieval in Enterprise LLMs본 논문은 Enterprise 환경에서 복잡한 비즈니스 규칙을 고려해야 하는 도구 검색(Tool Retrieval)의 한계와 기존 모델의 지식 파괴 문제를 해결하고자 합니다.#Review#Parametric Tool Retrieval#Enterprise LLMs#Chain-of-Thought#Business Rule Grounding#Knowledge Preservation#Reasoning Curriculum2026년 7월 27일댓글 수 로딩 중
[논문리뷰] StateAct: Program State, before Pixels, for Long-Horizon Computer-Use Agents본 논문은 기존 컴퓨터 사용 에이전트가 화면의 Pixels 정보에만 의존할 때 발생하는 손실 정보 문제와 장기 작업(Long-Horizon Task)에서의 성능 한계를 해결하고자 합니다.#Review#Computer-Use Agents#State-Grounding#Long-Horizon Execution#Program State#GUI Delegation#Self-Verification#Agentic Architecture2026년 7월 27일댓글 수 로딩 중
[논문리뷰] Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification본 논문은 대규모 비디오 생성 모델에서 긴 토큰 시퀀스로 인해 발생하는 quadratic complexity의 self-attention 병목 현상을 해결하고자 합니다.#Review#Diffusion Transformers#Video Generation#Attention Sparsification#Online Softmax#Training-free#On-the-fly#Proxy-score Reuse2026년 7월 27일댓글 수 로딩 중
[논문리뷰] Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation기존의 CFG 기반 OPD는 긍정/부정 브랜치를 각각 학습시키지 않고, 이들의 합산된 결과물(composed velocity)만을 일치시키려 한다 . 이러한 방식은 긍정 브랜치 에러와 부정 브랜치 에러가 서로 상쇄(cancel)될 여지를 주어, 모델이 근본적인 에러를 해결하지 못하게 한다 .#Review#Diffusion Models#On-Policy Distillation#Classifier-Free Guidance#Branch-Aware OPD#Video Control#Negative Branch Asymmetry#Knowledge Transfer2026년 7월 27일댓글 수 로딩 중
[논문리뷰] Reasoning Denoiser: Denoising Reasoning Traces for Hallucination Detection in Large Reasoning Models본 논문은 LRM이 생성하는 긴 추론 과정에 포함된 노이즈가 오히려 Hallucination 탐지를 방해한다는 문제를 해결하고자 합니다. 기존 연구들은 전체 추론 흔적을 그대로 사용하거나 단순한 통계적 방식을 적용하여 이러한 노이즈를 걸러내지 못했습니다.#Review#Large Reasoning Models#Hallucination Detection#Reasoning Traces#Denoising#Representation Learning#Attention Mechanism2026년 7월 27일댓글 수 로딩 중
[논문리뷰] Progress Reward Modeling for Robotic Learning: A Comprehensive Survey본 논문은 Robotic Learning에서 기존의 Terminal Success Signal이 가진 정보 부족 문제를 해결하기 위해 Progress Reward Modeling의 통합된 프레임워크를 제시합니다.#Review#Robotic Learning#Progress Reward Modeling#Foundation Models#Task Execution#Reinforcement Learning#Instruction Tuning2026년 7월 27일댓글 수 로딩 중
[논문리뷰] Oxygen-TryOn: Fashion-Native Foundation Model for Any-item Virtual Try-On본 논문은 기존 가상 착용(Virtual Try-On) 시스템이 가진 범용성의 한계와 정밀도 부족 문제를 해결하기 위해 Oxygen-TryOn을 제안한다. 기존 모델들은 주로 상의와 같은 특정 카테고리에 한정되거나, 스튜디오 환경의 깨끗한 제품 이미지만을 처리할 수 있는 제약이 있었다 .#Review#Virtual Try-On#Foundation Model#Multi-Reference#Multimodal Diffusion Transformer#Reinforcement Learning#Fashion-Native#AIGC2026년 7월 27일댓글 수 로딩 중
[논문리뷰] OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation본 논문은 기존의 독립적인 오디오-비디오 VAE 학습 방식이 초래하는 교차 모달 정렬(cross-modal alignment) 부족 문제를 해결하고자 합니다.#Review#OmniVAE#Cross-modal Alignment#Audio-Video Generation#Latent Diffusion#Contrastive Learning#Semantic Distillation2026년 7월 27일댓글 수 로딩 중
[논문리뷰] Leveraging External Knowledge for Historical Document Restoration via Retrieval-Augmented Large Language Models본 연구는 물리적 훼손으로 판독이 어려운 역사 기록물을 복원하기 위해 LLM과 외부 지식을 결합하는 새로운 접근 방식을 제안합니다.#Review#Historical Document Restoration#Retrieval-Augmented Generation (RAG)#Large Language Models (LLMs)#Named Entity Recognition#Hanja#Domain-specific Fine-Tuning#Textual Contextualization2026년 7월 27일댓글 수 로딩 중
[논문리뷰] Kimi K3: Open Frontier Intelligence본 논문은 기존 오픈소스 모델들이 1T 파라미터 규모에 정체되어 있는 반면, 상업적 모델들은 더 큰 규모와 복잡한 추론 능력을 갖추며 격차가 벌어지는 문제를 해결하고자 합니다. 특히 long-context와 agentic tasks를 동시에 처리하기 위한 모델의 확장성과 효율성이 부족하다는 점이 핵심 배경입니다.#Review#Mixture-of-Experts#Kimi Delta Attention#Long-context#Reinforcement Learning#Multimodal#Scaling Efficiency#Agentic Intelligence2026년 7월 27일댓글 수 로딩 중
[논문리뷰] JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents본 논문은 기존의 Creative AI 시스템이 고립된 단일 단계 생성에 머물러 있어, 복잡한 다단계 창작 작업에서 필요한 맥락(Context)을 유지하지 못하는 문제를 해결하고자 합니다.#Review#Multimodal Agents#Canvas-Native#Creative AI#Agent Harness#Long-Horizon Creation#Project State2026년 7월 27일댓글 수 로딩 중
[논문리뷰] IndicTalk: A Large-Scale Persona-Based Multilingual Conversational Corpus for Indic Languages본 연구는 다국어 및 코드 혼용 대화 시스템 구축에 필수적인 고품질 대규모 말뭉치가 부족한 문제를 해결합니다. 기존의 Indic 언어 데이터셋은 주로 감성 분석이나 개체명 인식과 같은 식별 작업(Discriminative tasks)에 치우쳐 있어, 생성 모델의 instruction tuning에 부적합합니다.#Review#Indic Languages#Code-mixed Conversation#LLM-based Generation#Persona-conditioned Dialogue#Multilingual NLP#Corpus Construction2026년 7월 27일댓글 수 로딩 중
[논문리뷰] GNM Head: A Generative aNthropometric Model of the human head본 논문은 기존의 3DMM들이 가진 해부학적 폐쇄성 문제를 해결하고자 합니다. 기존의 모델들(예: FLAME, BFM)은 인간의 머리를 속이 빈 껍데기 형태로 간주하여 치아나 혀 같은 중요한 내부 기관을 생략해 왔습니다. 이러한 구조적 한계는 생성형 AI나 실시간 렌더링 시 시각적 품질을 저하시키는 원인이 됩니다.#Review#3D Morphable Model (3DMM)#Human Head#Parametric Model#Computer Vision#Neural Rendering#Facial Reconstruction#Anatomy2026년 7월 27일댓글 수 로딩 중