[논문리뷰] MBA: Multimodal Benchmark and Agents for Real-World Business Ideation본 연구는 기존 비즈니스 아이디어 생성 연구들이 텍스트 데이터에만 의존하여 실세계의 다중 모달 맥락을 충분히 반영하지 못하는 한계를 해결하고자 합니다.#Review#Multimodal Business Ideation#Agentic AI#Benchmark#Reinforcement Learning#GRPO#SFT#MLLM-as-a-Judge2026년 8월 12일댓글 수 로딩 중
[논문리뷰] Hand Visibility Detector: Per-Keypoint Visibility Estimation for Hands본 논문은 기존 HPE 모델들이 관절 위치를 추정할 때 관절의 가시성(visibility)을 명시적으로 평가하지 않는 문제를 해결하고자 합니다. 대다수 기존 연구에서 visibility는 HPE 성능 향상을 위한 보조적 신호로만 사용될 뿐, 그 자체로 시스템적 연구가 이루어지지 않았습니다.#Review#Hand Pose Estimation#Visibility Estimation#Occlusion#Vision Transformers#Triangulation#Annotation#Keypoint2026년 8월 12일댓글 수 로딩 중
[논문리뷰] From Synthesis to Removal: Physics-Grounded Reflection Simulation and Diffusion-Based Video Dereflection본 논문은 유리창 너머 촬영된 비디오에서 반사를 제거하기 위한 체계적인 비디오 복원 프레임워크를 제안합니다. 기존 비디오 반사 제거 연구는 한 쌍의 데이터(Paired Data) 부족과 시간적 일관성(Temporal Coherence)을 확보할 수 있는 모델 설계의 어려움으로 인해 크게 발전하지 못했습니다.#Review#Video Dereflection#Diffusion Models#Physics-Grounded Simulation#Reflection Removal#Video Synthesis#Temporally Coherent2026년 8월 12일댓글 수 로딩 중
[논문리뷰] Can LLM Agents Stick to the Script? A Benchmark for Long-Horizon Consistency in Interactive Narratives본 논문은 최신 LLM 기반 Narrator Agent들이 유창한 스토리를 생성함에도 불구하고, 장기적인 이야기의 논리적 일관성과 제약 조건을 유지하는 데 심각한 취약성을 보인다는 문제를 제기한다.#Review#Interactive Narrative#Benchmark#Long-Horizon Consistency#Narrative Commitment Preservation#Large Language Models#AI for Games2026년 8월 12일댓글 수 로딩 중
[논문리뷰] AutoWorldModel-Bench: A State-Centric Benchmark for Automated World-Model Research본 논문은 world-model 연구 분야가 방대한 설계 공간(Design Space)을 가지고 있음에도 불구하고, 표준화된 평가 도구가 부족하여 연구의 진전이 어렵다는 문제를 해결하고자 한다.#Review#World-Model#Benchmark#Autonomous-Agent#Entity-Component-System#State-Centric#AI-Research2026년 8월 12일댓글 수 로딩 중
[논문리뷰] AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models본 논문은 기존 Reactive VLA 모델들이 단일 손목 카메라(wrist-mounted camera) 환경에서 겪는 치명적인 인식 및 추론의 한계를 해결하기 위해 제안되었습니다.#Review#Vision-Language-Action Models#Persistent World State Memory#Ego-Working Memory#Embodied AI#Long-horizon Manipulation#Diffusion Transformer#Wrist-camera2026년 8월 12일댓글 수 로딩 중
[논문리뷰] Agent Safety Should Be a Runtime Contract본 논문은 AI 에이전트의 안전성을 모델 학습(RLHF, DPO 등)만으로 확보하려는 기존의 관행이 구조적으로 불충분함을 지적합니다.#Review#Agent Safety#Runtime Contract#Preventive Mechanism#Evidential Mechanism#Evidence-gated Submission#Trajectory Schema#Defense-in-depth2026년 8월 12일댓글 수 로딩 중
[논문리뷰] AVA-Encoder: Towards Agent-Native Video Representation Learning본 논문은 기존의 비디오 표현 방식이 에이전트의 복잡한 추론 및 수정 작업에 부적합하다는 문제 의식에서 출발합니다. 기존의 저수준(Pixel/Latent) 표현은 에이전트가 직접 해석하거나 수정하기 어렵고, 텍스트 캡션 기반의 표현은 영화 제작에 필요한 풍부한 구조적 정보를 상실하기 쉽습니다.#Review#Agentic Video Encoder#Knowledge Graph#Video Representation Learning#Textual-Gradient#Self-Evolution#Multimodal Reconstruction2026년 8월 12일댓글 수 로딩 중
[논문리뷰] AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses본 연구는 모델의 내재적 능력을 향상시키는 기존의 데이터 증류(Data Distillation) 방식이 아닌, 모델이 직면한 과제의 복잡성을 제어하여 추론 성능을 개선하는 새로운 접근 방식을 제안합니다.#Review#Strong-to-Weak Scaffolding#Inference-Time Harness#Test-Time Compute#Model Distillation#Theory-of-Mind#Automated Agentic Systems2026년 8월 12일댓글 수 로딩 중
[논문리뷰] iFAN: Inference-Aware Learning for Plain Mask Transformers본 논문은 현대의 query-based mask transformer가 가진 추론 과정의 불일치 문제를 해결하기 위해 iFAN(Inference-Aware Learning)을 제안합니다 .#Review#Mask Transformers#Inference-Aware Learning#Query-based Segmentation#APMR#CLSD#Self-Distillation#Computer Vision2026년 8월 11일댓글 수 로딩 중
[논문리뷰] VibeLifeBench: Can Your Life Agent Be Proactive and Persistent in a Living World?본 논문은 기존의 AI 에이전트 평가 벤치마크들이 대부분 정적이고 단기적인 과업에 치중되어 있어, 실제 일상생활의 복잡성을 제대로 측정하지 못한다는 문제를 제기합니다 .#Review#Agent Evaluation#Long-Horizon#Proactivity#Living World#Benchmarking#LLM#Task Planning2026년 8월 11일댓글 수 로딩 중
[논문리뷰] UniMoMo: Expert Merging-Based MoE Acceleration for Large Recommendation Models본 논문은 대규모 추천 모델을 위한 Sparse MoE가 학습된 이후, 실제 배포 단계에서 요구되는 제한된 자원(Expert Budget)에 맞춰 체크포인트를 효율적으로 축소하는 문제인 Expert-budgeted deployment를 해결한다.#Review#Recommender Systems#Mixture of Experts#Model Compression#Expert Merging#Adaptive Routing2026년 8월 11일댓글 수 로딩 중
[논문리뷰] TSDS-Toolbox: A Toolbox for Measuring Time-Series Dataset Similarity본 논문은 시계열 데이터 분석 및 Foundation Model 개발의 급격한 발전에도 불구하고, 연구자들이 활용할 수 있는 표준화된 데이터셋 유사도 측정 도구가 부족하다는 점을 해결하고자 합니다. 기존의 연구들은 유사도 지표를 서로 다른 실험 환경에서 평가하여 재현성과 비교 가능성이 낮은 파편화된 상태에 놓여 있습니다.#Review#Time-series dataset similarity#Benchmarking framework#Similarity metrics#Transfer learning#Foundation models#Downstream evaluation2026년 8월 11일댓글 수 로딩 중
[논문리뷰] SkillZip: Evaluation-Free Skill Compression for Self-Evolving Agents by Discovering Reusable Structure본 논문은 에이전트가 학습을 거듭할수록 Skill이 불필요하게 비대해지는 textual growth 문제를 해결하고자 합니다.#Review#Agent#Skill Compression#Self-Evolving#Minimum Description Length#Prompt Engineering#Typed Contract2026년 8월 11일댓글 수 로딩 중
[논문리뷰] SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information본 논문은 LLM이 모바일 비서로 활용될 때, 여러 애플리케이션에 분산된 개인 정보를 종합하여 사용자의 복잡한 지시를 해결해야 하는 도전 과제를 해결하고자 합니다.#Review#Large Language Models#Mobile Assistants#Personal Information#Benchmark#Information Retrieval#Tool Use#Cognitive Capabilities2026년 8월 11일댓글 수 로딩 중
[논문리뷰] Reference-Free Post-Training of Open Large Language Models for Multilingual Machine Translation본 논문은 multilingual machine translation에서 고품질의 병렬 데이터(parallel data)가 부족하다는 한계를 극복하기 위해 Reference-Free 포스트 트레이닝 방식을 제안합니다.#Review#Multilingual Machine Translation#Reference-Free#Post-Training#GRPO#Checkpoint Interpolation#On-Policy Distillation#Large Language Models2026년 8월 11일댓글 수 로딩 중
[논문리뷰] Power law graph attention: exact generalization of scaled dot-product attention, empirical collapse at inference본 연구는 표준 Transformer 모델의 핵심인 SDPA(Scaled Dot-Product Attention)가 고정된 bilinear form을 사용함에 따라 모델의 표현력과 학습 역학이 제한된다는 문제를 해결하고자 합니다.#Review#Large Language Models#Attention Mechanisms#Power Law Graph Attention#Learned Bilinear Operators#Perron-Frobenius Theory#Self-Organized Criticality2026년 8월 11일댓글 수 로딩 중
[논문리뷰] Not Worth Another Token: Marginal Value Estimation for Efficient Deep Research Agents본 논문은 Deep Research 에이전트가 수행하는 반복적인 Retrieval 과정에서 누적되는 방대한 Context가 유발하는 비효율성 문제를 해결하고자 합니다.#Review#Deep Research#Marginal Value Estimation#Context Pruning#Retrieval-Augmented Generation#Efficiency#Agentic Systems#Pipeline Optimization2026년 8월 11일댓글 수 로딩 중
[논문리뷰] Mendel Gödel Machine: Recursive Self-Improving Coding Agents via Comparative Evolution본 논문은 기존의 자가 개선(self-improving) 코딩 에이전트들이 단일 실패 궤적에만 의존하여 정보를 효율적으로 활용하지 못하는 한계를 해결하고자 합니다.#Review#Coding Agents#Self-Improvement#Recursive Evolution#Comparative Evidence#Mendelian Principles#LLM#Agent Scaffold2026년 8월 11일댓글 수 로딩 중
[논문리뷰] JigShape: Evaluating Visual-Geometric Reasoning in VLMs through Jigsaw Puzzles본 연구는 기존 VLMs가 복잡한 공간 추론(Spatial Reasoning)을 수행할 수 있는지 검증하기 위해 수행되었습니다. 기존 벤치마크들은 단순한 사각형 패치를 사용하여 텍스처가 반복되는 영역에서 레이블이 모호해지는 문제와 낮은 그리드 밀도로 인한 변별력 저하라는 한계가 있습니다 .#Review#Vision-Language Models#Spatial Reasoning#Jigsaw Puzzles#Geometric Constraints#Visual-Geometric Reasoning#Benchmark2026년 8월 11일댓글 수 로딩 중