[논문리뷰] S1-Omni: A Unified Multimodal Reasoning Model for Scientific Understanding, Prediction, and Generation본 논문은 기존의 AI for Science(AI4S) 연구들이 Domain-specific models, Tool-augmented LLMs, 그리고 Scientific language models로 파편화되어 있다는 문제점을 해결하고자 합니다 .#Review#AI4S#Multimodal Reasoning#Scientific Modeling#Foundation Model#S1-Omni#Knowledge Alignment2026년 7월 19일댓글 수 로딩 중
[논문리뷰] Recursive Harness Self-Improvement본 논문은 foundation model과 harness의 공동 진화(co-evolution) 과정에서, 수작업으로 생성된 harness의 최적화가 어렵고 비용이 많이 든다는 문제를 해결하고자 합니다.#Review#Recursive Harness Self-Improvement#RHI#Agentic Workflow#Test-time Scaling#Prompt-level Optimization#Co-evolution2026년 7월 19일댓글 수 로딩 중
[논문리뷰] RecGPT-V3 Technical Report본 논문은 대규모 산업용 추천 시스템에서 LLM을 활용할 때 발생하는 세 가지 핵심적인 병목 현상을 해결하고자 합니다. 기존 RecGPT 시리즈와 같은 LLM 기반 추천 모델들은 사용자 전체 행동 이력을 매번 재처리하는 Stateless behavior modeling으로 인해 불필요한 연산이 발생합니다 .#Review#Large Language Models#Recommender Systems#Memory Hub#Semantic IDs#Latent Intent Reasoning#Hybrid-modal Foundation Model#Instruction Tuning2026년 7월 19일댓글 수 로딩 중
[논문리뷰] RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources본 논문은 최신 Large Language Model(LLM) 기반 에이전트가 소프트웨어 조작 및 복잡한 아티팩트 생성 작업을 수행할 때 발생하는 Procedural Knowledge 부족 문제를 해결하고자 한다.#Review#Software Agents#Multimodal Skill Wiki#Procedural Knowledge#Distillation#Agentic Harness#Human-Created Resources#Offline-Online Pipeline2026년 7월 19일댓글 수 로딩 중
[논문리뷰] RAGU: A Multi-Step GraphRAG Engine with a Compact Domain-Adapted LLM본 논문은 기존 GraphRAG 시스템들이 직면한 Single-pass extraction의 한계와 고성능 LLM에 대한 과도한 의존성 문제를 해결하고자 합니다. 기존 방식은 단일 단계에서 지식 그래프를 추출함에 따라 노이즈가 많고 중복된 엔티티를 생성하여 검색의 안정성을 저해합니다.#Review#GraphRAG#LLM#Knowledge Graph#Information Extraction#Multi-step Consolidation#Meno-Lite-0.12026년 7월 19일댓글 수 로딩 중
[논문리뷰] Qwen-Music Technical Report본 논문은 음악 생성 시스템에서 발생하는 의미론적 구성(semantic composition)과 음향적 렌더링(acoustic rendering) 사이의 불일치 문제를 해결하고자 합니다. 기존의 대규모 오디오 생성 모델들은 가사, 멜로디, 리듬 등 복잡한 음악적 요소를 장시간 일관성 있게 제어하는 데 한계를 보입니다.#Review#Music Generation#Music Semantic Tokens#Melody-CoT#Diffusion Transformer#Spec-VAE#Post-training Alignment2026년 7월 19일댓글 수 로딩 중
[논문리뷰] On-Policy Delta Distillation본 논문은 기존의 On-Policy Distillation (OPD) 방식이 교사 모델의 전체 출력 분포를 모방하는 데 그쳐, 추론 능력 향상에 필수적인 핵심 학습 궤적을 충분히 전달하지 못한다는 문제를 제기합니다 .#Review#Knowledge Distillation#On-Policy Distillation#Reasoning Capability#Delta Signal#LLM Post-training#Reinforcement Learning2026년 7월 19일댓글 수 로딩 중
[논문리뷰] Loop the Loopies!본 논문은 Looped Transformer가 고정된 컴퓨팅 자원 내에서 Vanilla Transformer보다 우수한 성능을 낼 수 있도록 하는 compute-matched scaling recipe를 정의합니다.#Review#Looped Transformers#Mixture-of-Experts#Layer-Loop#Compute-Matched Scaling#Post-Training#Reasoning Models2026년 7월 19일댓글 수 로딩 중
[논문리뷰] From Human-Centric to Agentic Code Review: The Impact of Different Generations of Generative AI Technology on Review Quality본 논문은 Generative AI 기술이 소프트웨어 개발 생태계에 깊숙이 침투함에 따라, 기존의 Human-Centric 코드 리뷰가 LLM 및 AI Agent가 결합된 형태로 변화하면서 발생하는 리뷰 품질 및 효율성 변화를 규명하고자 합니다 .#Review#Generative AI#Code Review#LLM#AI Agents#Review Quality#Human-AI Collaboration#Software Engineering2026년 7월 19일댓글 수 로딩 중
[논문리뷰] DSWorld: A Data Science World Model for Efficient Autonomous Agents본 논문은 자율형 데이터 과학 에이전트가 반복적인 시행착오 과정에서 겪는 비효율적인 연산 비용 문제를 해결하고자 합니다.#Review#Data Science World Model#Autonomous Agents#Transition Prediction#Reflective Reinforcement Learning#Data Science Workflow#Simulation2026년 7월 19일댓글 수 로딩 중
[논문리뷰] Cura 1T: Specialized Model for Agentic Healthcare본 논문은 환자 상담, 임상 추론, EHR 워크플로우 수행이라는 복합적인 의료 과업을 동시에 해결할 수 있는 특화된 LLM이 부재하다는 문제점을 해결하고자 합니다. 기존 연구들은 각기 다른 의료 하위 도구에 집중해왔으나, 한 영역의 업데이트가 다른 영역의 성능을 저하시키는 '성능 침식' 현상이 발생하기 쉽습니다.#Review#Healthcare LLM#Self-evolution Loop#Data-centered#Agentic Workflow#EHR Tool Use#SDFT2026년 7월 19일댓글 수 로딩 중
[논문리뷰] Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization본 논문은 기존 RLVR 방식의 핵심 한계인 Entropy의 '정확성 인식 능력 부재' 문제를 해결합니다. 기존의 Entropy 기반 방식들은 모델의 불확실성을 측정하지만, 이것이 생산적인 탐색인지 아니면 단순한 오류인지 구분하지 못해 최적화의 모호함을 야기합니다 .#Review#Reinforcement Learning#Advantage Shaping#Contrastive Policy Optimization#RLVR#LLM Reasoning#Token-level Supervision2026년 7월 19일댓글 수 로딩 중
[논문리뷰] Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos본 논문은 오디오-비주얼 정보가 풍부한 장시간의 실세계 비디오를 인간처럼 이해하고 추론하는 범용 AI 모델의 부재를 해결합니다. 기존의 AV-LLM들은 주로 짧은 클립 이해에 국한되어 있으며, 특히 오디오와 비주얼 데이터를 결합하여 추론하는 능력이 부족합니다 .#Review#AV-LLM#Audio-Visual Reasoning#Long-form Video#Chain-of-Thought#Multimodal Learning#Temporal Alignment2026년 7월 19일댓글 수 로딩 중
[논문리뷰] Agon: Competitive Cross-Model RL with Implicit Rival Grading of Reasoning본 논문은 기존 GRPO 기반의 LLM 학습이 '추론 과정(trace)'을 평가하지 못하고 최종 정답에만 의존하여 발생하는 'Length Pathology(불필요한 답변 길이 증가)' 문제를 해결하고자 합니다.#Review#Reinforcement Learning#Large Language Models#Reasoning#GRPO#Competitive Training#Multi-Agent System#Self-Improvement2026년 7월 19일댓글 수 로딩 중
[논문리뷰] WanSong v1.0 Technical Report본 논문은 기존의 Autoregressive(AR) 기반 오디오 생성 모델이 가진 낮은 효율성과 장기 오디오 생성 시의 일관성 유지 문제를 해결하기 위해 고안되었습니다. 기존 연구들은 다단계(Cascaded) 파이프라인이나 AR 모델을 주로 채택하여 복잡성이 높고 효율성이 떨어지는 한계가 있습니다.#Review#Diffusion-based Model#Music Generation#Dual-stem Modeling#Hybrid-MMDit#Reinforcement Learning#Foundation Model2026년 7월 16일댓글 수 로딩 중
[논문리뷰] VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding본 논문은 기존 Video MLLM이 겪는 일반화 부족, 높은 연산 비용, 그리고 폐쇄적인 연구 생태계라는 세 가지 한계를 해결하는 것을 목표로 한다. 기존 모델들은 짧은 영상에는 강점을 보이지만, 장시간 영상이나 실시간 스트리밍 환경으로의 확장이 어렵고 연산량이 기하급수적으로 증가하는 문제를 안고 있다.#Review#Video MLLM#I3D-ViT#Adaptive Frame Resolution#Video Understanding#Open Source#Streaming Perception2026년 7월 16일댓글 수 로딩 중
[논문리뷰] Video = World + Event Stream본 논문은 기존의 인터랙션 모델이 단일 응용 분야에 국한된 학습 목적을 가졌던 한계를 극복하기 위해, 비디오 데이터를 World와 Event Stream으로 분해하는 새로운 프레임워크를 제안합니다.#Review#World-Event Decomposition#Native-Streaming Interaction#Multimodal Pretraining#End-to-End Latency#Role-play Interface#Open-vocabulary Behavior2026년 7월 16일댓글 수 로딩 중
[논문리뷰] VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance본 논문은 기존 비디오 이해 모델들이 일반적인 사용자 중심의 환경에만 치우쳐 있어, 실제 시각 장애인의 고유한 환경적 특성과 니즈를 반영하지 못하는 문제를 해결하고자 합니다.#Review#VIABench#Visual Impairment Assistance#Video Understanding#Egocentric Vision#Assistive Technology#Multimodal Evaluation2026년 7월 16일댓글 수 로딩 중
[논문리뷰] UniVR: Thinking in Visual Space for Unified Visual Reasoning본 논문은 현재 AI 모델들이 추론 및 계획 능력을 주로 텍스트 공간 내에서 수행함으로써 발생하는 한계를 지적합니다. 텍스트는 추상적인 표현에 불과하여 물리적 법칙, 복잡한 동적 변화, 공간적 관계를 완벽히 담아내지 못하며, 이로 인해 모델이 실제 시각적 환경에서 일관성 있는 행동을 수행하는 데 어려움을 겪습니다 .#Review#Visual Reasoning#Reinforcement Learning#Unified Generative Model#Long-horizon Planning#Physical Consistency#World Modeling2026년 7월 16일댓글 수 로딩 중
[논문리뷰] Spectral Rewiring for Exploration, Purification, and Model Merging본 논문은 LLM의 RL post-training 과정에서 발생하는 dense full-parameter 업데이트의 비효율성과 부작용을 해결하고자 합니다 . 기존의 방식은 reasoning 성능을 오히려 억제하거나, 테스트 타임 스케일링에서의 조기 포화(Early saturation) 문제를 야기합니다.#Review#Reinforcement Learning#Spectral Analysis#Model Merging#Subspace-Aligned Rewiring#Large Language Models#Reasoning Elicitation#Parameter Efficiency2026년 7월 16일댓글 수 로딩 중