[논문리뷰] SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information본 논문은 LLM이 모바일 비서로 활용될 때, 여러 애플리케이션에 분산된 개인 정보를 종합하여 사용자의 복잡한 지시를 해결해야 하는 도전 과제를 해결하고자 합니다.#Review#Large Language Models#Mobile Assistants#Personal Information#Benchmark#Information Retrieval#Tool Use#Cognitive Capabilities2026년 8월 11일댓글 수 로딩 중
[논문리뷰] Reference-Free Post-Training of Open Large Language Models for Multilingual Machine Translation본 논문은 multilingual machine translation에서 고품질의 병렬 데이터(parallel data)가 부족하다는 한계를 극복하기 위해 Reference-Free 포스트 트레이닝 방식을 제안합니다.#Review#Multilingual Machine Translation#Reference-Free#Post-Training#GRPO#Checkpoint Interpolation#On-Policy Distillation#Large Language Models2026년 8월 11일댓글 수 로딩 중
[논문리뷰] Power law graph attention: exact generalization of scaled dot-product attention, empirical collapse at inference본 연구는 표준 Transformer 모델의 핵심인 SDPA(Scaled Dot-Product Attention)가 고정된 bilinear form을 사용함에 따라 모델의 표현력과 학습 역학이 제한된다는 문제를 해결하고자 합니다.#Review#Large Language Models#Attention Mechanisms#Power Law Graph Attention#Learned Bilinear Operators#Perron-Frobenius Theory#Self-Organized Criticality2026년 8월 11일댓글 수 로딩 중
[논문리뷰] Not Worth Another Token: Marginal Value Estimation for Efficient Deep Research Agents본 논문은 Deep Research 에이전트가 수행하는 반복적인 Retrieval 과정에서 누적되는 방대한 Context가 유발하는 비효율성 문제를 해결하고자 합니다.#Review#Deep Research#Marginal Value Estimation#Context Pruning#Retrieval-Augmented Generation#Efficiency#Agentic Systems#Pipeline Optimization2026년 8월 11일댓글 수 로딩 중
[논문리뷰] Mendel Gödel Machine: Recursive Self-Improving Coding Agents via Comparative Evolution본 논문은 기존의 자가 개선(self-improving) 코딩 에이전트들이 단일 실패 궤적에만 의존하여 정보를 효율적으로 활용하지 못하는 한계를 해결하고자 합니다.#Review#Coding Agents#Self-Improvement#Recursive Evolution#Comparative Evidence#Mendelian Principles#LLM#Agent Scaffold2026년 8월 11일댓글 수 로딩 중
[논문리뷰] JigShape: Evaluating Visual-Geometric Reasoning in VLMs through Jigsaw Puzzles본 연구는 기존 VLMs가 복잡한 공간 추론(Spatial Reasoning)을 수행할 수 있는지 검증하기 위해 수행되었습니다. 기존 벤치마크들은 단순한 사각형 패치를 사용하여 텍스처가 반복되는 영역에서 레이블이 모호해지는 문제와 낮은 그리드 밀도로 인한 변별력 저하라는 한계가 있습니다 .#Review#Vision-Language Models#Spatial Reasoning#Jigsaw Puzzles#Geometric Constraints#Visual-Geometric Reasoning#Benchmark2026년 8월 11일댓글 수 로딩 중
[논문리뷰] InSight-doc: Agentic Visual Perception for Long-Document Understanding본 논문은 긴 문서(Long-document) 이해 작업에서 발생하는 과도한 추론 비용과 Context Rot 문제를 해결하고자 합니다. 기존의 MLLM 기반 접근 방식은 전체 문서를 고해상도로 입력받아 처리하는데, 이는 O(N^2) 수준의 시간 복잡도를 야기하며 매우 비효율적입니다 .#Review#Long-Document Understanding#Multimodal Large Language Models#Agentic Visual Perception#Chain-of-Thought#Reinforcement Learning#Visual Search2026년 8월 11일댓글 수 로딩 중
[논문리뷰] Ex-Omni-2D: Expressive Omni-Modal Dialogue Models with Native Visual Presence본 논문은 기존의 omni-modal 대화 모델들이 텍스트와 음성 이해에는 능숙하지만, 시각적 실체가 결여된 'visually disembodied' 상태라는 문제를 해결하기 위해 Ex-Omni-2D를 제안합니다.#Review#Omni-modal Dialogue#Visual Thought Plan#Streaming Student#Multi-codebook Speech Units#Prefix Streaming#Audio-Video Generation2026년 8월 11일댓글 수 로딩 중
[논문리뷰] DistilVDR: A Compact End-to-End Visual Document Retriever via Dual-Student Distillation본 논문은 기존의 고성능 VDR 시스템이 요구하는 막대한 컴퓨팅 자원과 인덱싱 비용 문제를 해결하고자 합니다. 현재 최첨단 VDR 모델들은 수십억 개의 파라미터를 사용하며, Multi-vector 기반의 복잡한 연산으로 인해 메모리 사용량과 검색 레이턴시가 지나치게 높습니다.#Review#Visual Document Retrieval#Distillation#Single-Vector#End-to-End#Multimodal#Encoder-only2026년 8월 11일댓글 수 로딩 중
[논문리뷰] Decoding-Level Taboo: A Diagnostic Stress Test for LLM Robustness본 논문은 기존의 LLM 평가 방식이 Nominal 조건에서의 성능만을 측정하여 모델의 실제 운영 환경에서의 강건성을 과대평가하는 '능력의 환상(illusion of capability)'을 만든다는 문제의식에서 출발합니다.#Review#Large Language Models#Robustness#Diagnostic Stress Test#Logit Interventions#Decoding-Level Taboo#Injected Surprisal#Reasoning Resilience2026년 8월 11일댓글 수 로딩 중
[논문리뷰] DSAgentBench: Can Agents Automate End-to-End Data-Science Workflows in Real Computer Environments?본 논문은 현재의 AI 에이전트가 단편적인 코드 생성 능력은 뛰어나지만, 실제 컴퓨터 환경에서 복잡한 데이터 과학 워크플로우를 End-to-End로 수행하는 데에는 명확한 한계가 있다는 점을 지적합니다.#Review#Data Science#Agentic Systems#Benchmark#End-to-End Workflow#GUI Interaction#Long-horizon Reasoning#Tool Orchestration2026년 8월 11일댓글 수 로딩 중
[논문리뷰] ComBodied Agents: a New Paradigm of Human-Centric Agentic AI본 논문은 기존의 Agentic AI가 과업 수행 효율성만을 중시하여 인간의 장기적인 역량과 자율성을 저해하는 구조적 한계를 해결하고자 합니다.#Review#Combodied Agents#Human-Centric AI#Personal World Model#Agentic AI#Human Agency#Longitudinal Memory2026년 8월 11일댓글 수 로딩 중
[논문리뷰] Co-Evolution in Agentic Systems: Toward Self-Directed Evolution Beyond Human Design본 논문은 단일 개체 기반의 Self-Evolution이 고정된 학습 컨텍스트라는 제약에 갇혀 있는 문제를 해결하고자 합니다 . 기존 연구들은 주로 고정된 환경이나 사전에 정의된 피드백 구조 하에서 모델을 개선하는 데 치중해 왔으며, 이는 정체된 학습 환경으로 인해 진화의 속도가 둔화되는 한계를 가집니다.#Review#Agentic Systems#Co-Evolution#Self-Evolution#Open-Endedness#Multi-Agent Reinforcement Learning#Evolutionary Optimization2026년 8월 11일댓글 수 로딩 중
[논문리뷰] Beyond Pixels: From Video Priors to 4D Worlds본 논문은 기존의 4D 생성 방식이 가진 RGB 인터페이스의 한계를 극복하고, 비디오 생성 모델의 사전 지식(video priors)을 보다 효율적으로 4D 생성에 전이하는 방법을 탐구합니다.#Review#4D Generation#Video Diffusion Models#Latent Space#L4AR#Spatiotemporal Attention#3D Reconstruction#DiT2026년 8월 11일댓글 수 로딩 중
[논문리뷰] Articulated Object Reconstruction from Rest-State Observation본 논문은 움직임 정보가 부재한 닫힌 상태의 관측으로부터 다중 파트 articulated 객체를 정확하게 재구성하는 Rest2Art 프레임워크를 제안합니다 . 기존 연구들은 주로 여러 관절 상태를 직접 관측하거나 사전 학습된 데이터에 의존하는 등, 정적인 단일 관측 환경에서는 정확도가 떨어지는 한계가 있습니다 .#Review#Articulated Object#Rest-State Reconstruction#Mesh Segmentation#Video Diffusion Model#Digital Twin#Joint Parameter Estimation2026년 8월 11일댓글 수 로딩 중
[논문리뷰] AdvFD: Boosting Visual Generation via Adversarial Fr'echet Distance Loss본 논문은 생성 모델의 사후 학습(Post-training) 과정에서 발생하는 Fréchet hacking 문제를 해결하는 것을 목표로 합니다.#Review#Generative Models#Fréchet Distance#Adversarial Learning#Distribution Matching#Objective Hacking#Feature Whitening2026년 8월 11일댓글 수 로딩 중
[논문리뷰] 360CityArena: A Realistic Virtual Urban Navigation Benchmark for Embodied Agents본 논문은 기존의 실외 탐색 벤치마크들이 갖는 photorealism 부족 및 복잡성 결여 문제를 해결하고, 실제 도시 환경과 유사한 환경에서 에이전트의 탐색 및 추론 능력을 평가하기 위해 제안되었습니다.#Review#Embodied AI#Urban Navigation#Benchmark#Photorealistic Virtual Environments#LMM#Spatial Reasoning2026년 8월 11일댓글 수 로딩 중
[flashinfer] [FlashInfer] CUTLASS MoE 커널 최적화: 벡터화와 동적 스레드 할당으로 성능 한계 돌파하기FlashInfer의 CUTLASS MoE 커널을 벡터화하고 스레드 점유율을 최적화하여 최대 8%의 성능 향상을 달성한 기법을 분석합니다.#CUDA#MoE#FlashInfer#CUTLASS#Optimization#LLM2026년 8월 11일댓글 수 로딩 중
[flashinfer] FlashInfer의 GDN 커널 런칭 오버헤드 80% 절감하기: 호스트 측 최적화 전략FlashInfer의 GDN 커널 런칭 오버헤드를 캐싱 전략을 통해 434.7us에서 98.2us로 80% 개선한 사례를 분석합니다.#FlashInfer#CUDA#Optimization#Performance#CUTE2026년 8월 11일댓글 수 로딩 중
[sglang] ERNIE-Image의 RoPE와 GELU-mul 융합 및 RoPE cos/sin 호이스팅을 통한 성능 최적화ERNIE-Image 모델에서 RoPE와 GELU-mul 연산을 융합하고 RoPE cos/sin 계산을 최적화하여 H100/H200에서 상당한 성능 향상을 달성했습니다.#ERNIE-Image#PyTorch#Triton#Optimization#RoPE#GELU#Performance2026년 8월 11일댓글 수 로딩 중