[논문리뷰] GigaChat Audio: Time-aware Large Audio Language Model본 논문은 오디오 기반 LLM이 장시간(최대 120분) 기록에서 신뢰할 수 있는 Temporal Grounding을 수행하지 못하는 문제를 해결하고자 한다.#Review#Large Audio Language Models#Audio Question Answering#Long-form Speech Processing#Temporal Grounding#Synthetic Supervision#Time-aware Modeling2026년 7월 20일댓글 수 로딩 중
[논문리뷰] GigaAM Multilingual: Foundation Model for Underrepresented Languages본 논문은 다국어 ASR(Automatic Speech Recognition)의 고질적인 문제인 데이터 불균형과 그로 인해 발생하는 저자원 언어의 성능 저하를 해결하고자 한다.#Review#Speech Recognition#Self-supervised Learning#Multilingual#Low-resource Languages#Data Balancing#Foundation Model2026년 7월 20일댓글 수 로딩 중
[논문리뷰] FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry본 연구는 고비용의 수작업 데이터셋 의존도를 낮추고 범용적인 비디오 편집 능력을 확보하기 위해, 이미지 편집 데이터로부터 실시간으로 비디오 편집 샘플을 생성하는 새로운 데이터 패러다임을 제안합니다.#Review#Video Editing#Flow Matching#Modality Mimicry#Pixel-pair Warped Flow Field#Referring Expression Segmentation#Visual Editing2026년 7월 20일댓글 수 로딩 중
[논문리뷰] FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications본 논문은 실시간 멀티모달 애플리케이션의 복잡한 파이프라인을 효율적으로 서비스하기 위한 최적화 자동화 문제를 해결합니다. 기존의 서비스 시스템이나 자동 병렬화 컴파일러는 특정 워크로드에 고정되어 있거나, 오퍼레이터 수준의 최적화에만 국한되어 다양한 멀티모달 파이프라인의 구조적 요구사항을 충족하지 못합니다 .#Review#Multimodal Applications#Real-Time Inference#Coding Agents#Chain-of-Program#Deployment Optimization#Multi-GPU Deployment2026년 7월 20일댓글 수 로딩 중
[논문리뷰] EvolvingWorld: An Open-Schema Framework for Co-Evolving Role-Play Agents and World Model in Interactive Literary World본 논문은 기존의 문학적 세계 시뮬레이션이 정적인 페르소나 모방이나 단절된 장면 생성에 그쳐 장기적 관점의 일관성을 유지하지 못하는 문제를 해결하기 위해 EvolvingWorld를 제안합니다.#Review#Role-Play Agents#World Model#Open-Schema#Co-Evolution#Long-Horizon Simulation#LLM-as-Judge2026년 7월 20일댓글 수 로딩 중
[논문리뷰] Environment-free Synthetic Data Generation for API-Calling Agents본 논문은 API-calling 에이전트를 위한 대규모 고품질 학습 데이터 수집의 병목 현상을 해결하고자 합니다. 기존 방식은 실행 가능한 환경과 구축된 백엔드 데이터베이스에 의존해야 하므로, 새로운 API 도메인으로 확장하는 데 막대한 인프라 비용과 시간이 소요됩니다.#Review#API-Calling Agents#Synthetic Data Generation#LLM Simulator#Digital World Model#Agentic Trajectories#Supervised Fine-Tuning#Environment-free2026년 7월 20일댓글 수 로딩 중
[논문리뷰] Do Language Models Dream of Binding Molecules? Benchmarking LLMs under Spatial Constraints본 연구는 범용 LLM이 복잡한 3D 공간 제약 조건 속에서 리간드를 정확히 설계하고 추론할 수 있는지 체계적으로 검증하는 것을 목표로 합니다.#Review#3D Molecule Generation#Large Language Models#Spatial Constraints#3D-Fit Benchmark#Drug Discovery#Simplified SDF#Protein-Ligand Binding2026년 7월 20일댓글 수 로딩 중
[논문리뷰] Distilled Reinforcement Learning for LLM Post-training본 논문은 기존 RL과 OPD가 가진 한계를 해결하기 위해 Distilled RL을 제안합니다. RL은 결과 중심의 coarse-grained 보상을 사용하여 credit assignment 문제를 겪으며 새로운 지식 습득에 한계가 있습니다.#Review#LLM Post-training#Reinforcement Learning#Knowledge Distillation#On-Policy Distillation#Credit Assignment#Policy Gradient#Cross-family Distillation2026년 7월 20일댓글 수 로딩 중
[논문리뷰] DiffGI: Differentiable Geometry Images for High-Fidelity Thin-Shell 3D Generation본 논문은 기존의 implicit volumetric 표면 표현 방식이 가지는 watertight topology의 제약을 극복하고, 가먼트(Garment)와 같은 박막(thin-shell) 및 비다양체(non-manifold) 구조를 효율적으로 생성하는 것을 목표로 합니다.#Review#3D Generation#Geometry Images#Differentiable Rendering#TSDF#Thin-shell#Latent Diffusion#Mesh Reconstruction2026년 7월 20일댓글 수 로딩 중
[논문리뷰] Diagnosing and Calibrating Tool-Call Boundary Drift in Multi-Teacher On-Policy Distillation본 논문은 Multi-Teacher On-Policy Distillation 과정에서 발생하는 Tool-Call Boundary Drift 문제를 해결하고자 합니다.#Review#Multi-Teacher On-Policy Distillation#Tool-Call Boundary Drift#Soft Clamp#Behavior Leverage#Generalized Knowledge Distillation2026년 7월 20일댓글 수 로딩 중
[논문리뷰] DiFA: Inference-Time Forward-Process Alignment for Diffusion Models본 논문은 기존 Diffusion model의 inference 과정이 numerical integration에만 치중하여 모델 고유의 예측 불확실성을 간과하고 있다는 문제점을 지적합니다.#Review#Diffusion Models#Inference-Time Rectification#Forward-Process Alignment#Kalman Filtering#Temporal Consensus#Training-Free2026년 7월 20일댓글 수 로딩 중
[논문리뷰] DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment본 논문은 기존의 도구 사용 에이전트들이 겪는 자기 개선의 한계인 정적인 모방 학습의 고착화와 강화 학습의 희소 보상 문제를 해결하고자 합니다. 기존 방식들은 고정된 교사 모델의 궤적에 의존하거나, 보상이 희소하여 복잡한 long-horizon 작업에서 성공적인 행동을 학습하는 데 어려움을 겪습니다.#Review#Self-Distillation#Deep Search Agents#Verifiable Environment#Scaffold Process Supervision#ReAct#Self-Evolving2026년 7월 20일댓글 수 로딩 중
[논문리뷰] Can Multimodal Large Language Models Understand OCT?본 논문은 현재의 MLLM들이 실제 임상 현장에서 요구되는 고도화된 OCT 영상 해석 및 추론 능력을 갖추고 있는지 검증하는 데 그 목적이 있다. 기존의 평가 방식은 주로 일반적인 자연 영상(Natural Image)에 초점을 맞추거나, OCT 해석을 단순히 질병 분류와 같은 단편적인 작업으로만 간주하는 경계가 있었다 .#Review#Multimodal Large Language Models#Optical Coherence Tomography#Medical Image Analysis#Benchmark#Clinical Reasoning#Visual Perception2026년 7월 20일댓글 수 로딩 중
[논문리뷰] Apple-π: Benchmarking Thinking with Video Towards Law-Grounded Physical Intelligence현대 비디오 생성 모델은 대규모 데이터를 통해 물리적 지식을 암묵적으로 학습하며 차세대 World Models로 주목받고 있으나, 기존 벤치마크들은 출력물의 시각적 그럴듯함(Plausibility)만을 평가할 뿐 모델이 물리 법칙을 진정으로 이해하고 추론하는지는 검증하지 못합니다 .#Review#Physical Intelligence#Video Generation#World Models#Benchmarking#Scientific Reasoning#Chain-of-Frames#Classical Mechanics2026년 7월 20일댓글 수 로딩 중
[논문리뷰] xHC: Expanded Hyper-Connections본 논문은 Transformer의 residual stream을 확장하는 기존 HC 계열 기법들이 왜 $N=4$ 수준에서 한계에 직면하는지에 대한 근본적인 원인을 진단합니다.#Review#Hyper-Connections#Transformer#Residual-Stream#Sparse-Architecture#Scaling-Laws#MoE#LLM2026년 7월 19일댓글 수 로딩 중
[논문리뷰] Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories본 논문은 대규모 데이터 학습을 통해 범용 로봇 정책을 구축하고자 하는 Scaling Laws의 가능성을 실현하는 데 초점을 맞춥니다.#Review#Vision-Language-Action Models#Scaling Laws#Real-World Trajectories#Robot Foundation Models#Flow Matching#Auto-labeling#Cross-embodiment Learning2026년 7월 19일댓글 수 로딩 중
[논문리뷰] When Does Muon Help Agentic Reinforcement Learning?본 논문은 Muon 최적화 기법이 대규모 사전 학습(Pre-training)에서는 성공적이나, Reinforcement Learning(RL) 기반의 사후 학습(Post-training) 단계에서는 성능 향상이 불확실하고 때로는 불안정하다는 문제를 해결하고자 합니다.#Review#Muon#Agentic Reinforcement Learning#GiGPO#Advantage Estimator#Credit Assignment#Qwen2.5#ALFWorld2026년 7월 19일댓글 수 로딩 중
[논문리뷰] VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders본 논문은 기존의 3D-VAE 기반 비디오 토크나이저가 픽셀 단위의 복원(MSE)에 과도하게 최적화되어 고차원적인 의미론적 구조를 포착하지 못한다는 문제점을 해결하고자 합니다.#Review#Video Foundation Models#Representation Autoencoders#Generative Modeling#Representation Alignment#Latent Spaces#Diffusion Transformers#Autoregressive Models2026년 7월 19일댓글 수 로딩 중
[논문리뷰] Understanding Reasoning from Pretraining to Post-Training본 논문은 LLM 훈련 과정에서 Pretraining 단계의 선택(모델 크기, 데이터 등)이 이후 RL 효율성에 미치는 정량적 관계를 규명하고자 한다.#Review#Reinforcement Learning#Pretraining#Scaling Law#LLM#Reasoning#Compute Allocation#Policy Evolution2026년 7월 19일댓글 수 로딩 중
[논문리뷰] See like a Robot: Robot-Centric Pointmaps for Vision-Language-Action Models본 논문은 대규모 데이터셋을 활용하는 VLA 모델 학습 시, 카메라 뷰포인트 변화에 따른 성능 저하 문제를 해결하고자 합니다. 기존 모델들은 카메라 프레임의 RGB 데이터를 입력으로 사용하므로, 실제 로봇 동작이 정의되는 Robot-frame과의 Frame mismatch가 발생합니다 .#Review#VLA#Manipulation#3D Geometry#Pointmap#Robot-Centric#Viewpoint Variation#End-to-End Learning2026년 7월 19일댓글 수 로딩 중