[논문리뷰] ExplainBench: Evaluating Code Explanations from Agents본 논문은 LLM 에이전트가 생성하는 코드 설명(Explanation)의 신뢰성을 검증할 수 있는 객관적인 평가 기준이 부재하다는 문제점을 지적합니다. 에서 볼 수 있듯이, 에이전트의 설명은 그럴듯해 보이지만 실제 패치는 테스트 코드조차 통과하지 못하는 등 설명과 실제 동작 간의 불일치(Mismatch)가 발생합니다.#Review#LLM agents#explainability#benchmark#trustworthiness#software engineering#code explanation#evaluation framework2026년 8월 4일댓글 수 로딩 중
[논문리뷰] Decoding Children's Gait Behavior본 논문은 아동의 보행 이상을 정밀하게 분석하기 위한 자동화된 컴퓨터 비전 프레임워크가 부재하다는 문제를 해결하고자 합니다. 기존의 3D 모션 캡처 시스템은 고가의 장비와 넓은 공간이 필요하여 임상 현장에서의 보급이 어렵고, IMU 센서 기반 방식은 아동의 자연스러운 움직임을 저해할 수 있습니다.#Review#Pediatric Gait#Visual Gait Score#Foundation Models#CGV Dataset#ChildGait-Video#Clinical Gait Analysis2026년 8월 4일댓글 수 로딩 중
[논문리뷰] ContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities?본 논문은 LLM 에이전트가 외부 스킬 라이브러리를 활용할 때, 자율적으로 자신의 스킬을 효과적으로 진화시키고 확장할 수 있는지에 대한 의문을 제기합니다.#Review#LLM Agents#Continual Learning#In-Context Learning#Skill Evolution#Agentic Benchmarking#Skill Library2026년 8월 4일댓글 수 로딩 중
[논문리뷰] ChronoLens: Measuring Language Change Across Time, Languages, and Linguistic Levels본 논문은 기존의 역사적 언어 변화 연구들이 서로 다른 데이터셋과 측정 방식을 사용하여 morphology, syntax, semantics, pragmatics 간의 상관관계를 직접 비교할 수 없다는 문제점을 해결하고자 합니다.#Review#Language Change#Sparse Autoencoders#Crosscoders#Diachronic Analysis#Multilingual Language Models#Interpretability#Linguistic Levels2026년 8월 4일댓글 수 로딩 중
[논문리뷰] CAPEval: A Decoupled Caption Evaluation across Understanding and Generation기존의 Caption Quality Evaluation 방식은 Caption 품질을 단일 Scalar Objective로 간주하여, Caption이 담는 Visual information의 범위(Coverage)와 주장하는 내용의 Factual correctness (Precision)라는 두 가지 distinct property를 혼동하는 문제점을 안고 있었다.#Review#Caption Evaluation#Multimodal Understanding#Text-to-Image Generation#Coverage#Precision#Downstream Utility#Vision-Language Models#Dataset Curation2026년 8월 4일댓글 수 로딩 중
[논문리뷰] Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based SegmentationMLLM 기반 분할 모델은 텍스트 생성 중심의 구조와 dense한 픽셀 예측이라는 목표 사이의 근본적인 불일치로 인해 Trilemma에 직면해 있습니다 .#Review#MLLM#Segmentation#Non-autoregressive#Trilemma#All-Mask Prediction#Spatial Grounding2026년 8월 4일댓글 수 로딩 중
[논문리뷰] Are the Financial Reasoning from LLMs Credible? A Real World Test over Long-Horizon Statements본 논문은 현대의 LLM이 금융 도메인에서 진정한 구조적 추론 능력을 갖추었는지, 아니면 단순한 표면적 패턴 매칭에 의존하는지를 검증하는 것을 핵심 목표로 한다.#Review#FININDICES#Financial Reasoning#Data-processing Fidelity#Long-context LLM#Structure Bottleneck#Knowledge Bottleneck#Table-Index Tabulation2026년 8월 4일댓글 수 로딩 중
[논문리뷰] Any-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space Bridging본 논문은 이질적인 모델 패밀리 간의 on-policy distillation이 불가능하다는 문제점을 해결합니다. 기존의 distillation 방식은 Teacher와 Student가 VAE 잠재 공간, 아키텍처, 그리고 noise schedule을 공유해야 한다는 동질성(Homogeneity) 가정을 전제로 합니다 .#Review#On-policy Distillation#Flow-matching#Heterogeneous#Representation-space Bridging#Latent Generators#Knowledge Distillation#DINOv22026년 8월 4일댓글 수 로딩 중
[논문리뷰] AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling본 연구는 텍스트 생성에서 기존의 이산적 토큰(discrete tokens) 모델링 방식이 가진 구조적 제약을 극복하고, 언어 자체를 연속적인 잠재 공간에서 효과적으로 표현하고 생성하는 방식을 제안합니다.#Review#Continuous-Latent Diffusion#Flow Matching#Block-Causal Denoiser#Query-based Encoder-Decoder#Representation Learning2026년 8월 4일댓글 수 로딩 중
[논문리뷰] WorldExam: Benchmarking World Models from Apparent Appearance to Inherent Reactivity본 논문은 기존의 비디오 생성 모델 평가가 주로 Apparent Appearance와 명시적인 지시 사항 이행에만 집중되어 있어, 모델의 Inherent Reactivity를 충분히 검증하지 못한다는 문제 의식에서 출발합니다.#Review#World Models#Video Generation#Inherent Reactivity#Diagnostic Benchmark#Control Adherence#Spatial Consistency#Interaction2026년 8월 3일댓글 수 로딩 중
[논문리뷰] WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning본 논문은 기존 VLA-RL 환경에서 비평 모델(Critic)이 단일 프레임 관측값에만 의존하여 시스템의 시간적 구조를 포착하지 못하는 문제를 해결하고자 합니다.#Review#VLA-RL#World Critic Model#POMDP#Representation Learning#Robotic Manipulation#Reinforcement Learning2026년 8월 3일댓글 수 로딩 중
[논문리뷰] VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation본 논문은 기존의 다중 모달(multimodal) OPD 방법론들이 교사 모델의 예측 교정을 그대로 증류(distill)함으로써 발생하는 source-mixed 문제를 해결하고자 합니다.#Review#Multimodal On-Policy Distillation#Visual Attribution#Counterfactual Target Reconstruction#Privileged Distillation#Visual Evidence#LLM2026년 8월 3일댓글 수 로딩 중
[논문리뷰] UEmbed: Unified Sparse and Dense Multimodal Embeddings본 연구는 기존 LSR 기법들이 인코더 기반의 양방향 아키텍처에 종속되어 있어 최신 Decoder-only 모델의 효율성을 활용하기 어렵다는 문제점을 해결하고자 합니다. 기존 멀티모달 검색 모델들은 별도의 보조 교차 모달(Cross-modal) 모듈을 사용해야 하므로 모델의 확장성과 배포 효율성이 낮다는 한계가 있습니다.#Review#Multimodal Embedding#Learned Sparse Retrieval#Decoder-only Model#Causal Attention#Retrieval-Augmented Generation#Agentic Search2026년 8월 3일댓글 수 로딩 중
[논문리뷰] SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks본 논문은 애니메이션 더빙, 오디오 드라마, 광고 등 미디어 제작 환경에서 레퍼런스 오디오 없이 음성을 디자인하거나, 자연어 명령으로 화자 스타일을 제어하고, 환경 및 오디오 이펙트를 포함하는 멀티-스피커 음성 및 오디오 생성을 지원하는 통합 시스템의 필요성을 제기한다.#Review2026년 8월 3일댓글 수 로딩 중
[논문리뷰] StyleForge: Indoor Furniture Styling by Counterfactual Reasoning in a Hypergraph Field본 논문은 기존의 독립적인 3D 에셋 검색 방식이 실내 장면 구성 시 발생하는 형태, 재질, 색상 간의 충돌 문제를 해결하지 못하는 한계를 지적한다.#Review#Indoor Furniture Styling#Counterfactual Reasoning#Dynamic Hypergraph#Style Field#Mahalanobis Energy#3D Asset Retrieval#Scene-Level Coherence2026년 8월 3일댓글 수 로딩 중
[논문리뷰] Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models본 논문은 MLLM이 시각적 정보와 사전 지식이 충돌할 때 발생하는 Visual Context Sensitivity의 불안정성 문제를 제기합니다 .#Review#Multimodal Large Language Models#Visual Context Sensitivity#WhatIfVis#Counterfactual Benchmark#Activation Patching#Subspace Intervention#Utilization Failure2026년 8월 3일댓글 수 로딩 중
[논문리뷰] ScrambleToolBench: Agents Search Exhaustively Even When Their Own Map Points to the Next Step본 논문은 현재의 대규모 언어 모델(LLM) 기반 에이전트들이 도구 사용 능력을 평가할 때, 실제적인 행동 추론보다는 API 이름과 같은 의미론적 우선순위(semantic priors)에 과도하게 의존하고 있다는 문제를 제기합니다 .#Review#Autonomous Agents#Tool-Use#Benchmark#Behavioral Reasoning#Semantic Obfuscation#Mapping Drift#Stochastic Failure#Persistent Memory2026년 8월 3일댓글 수 로딩 중
[논문리뷰] SWE-Touch: Benchmarking Coding Agents When Users Touch the Code본 논문은 Coding Agents가 autonomous한 환경에서 impressive performance를 보였음에도 불구하고, real-world collaborative development 상황에서 사용자 intervention에 의해 workspace 상태가 변경될 때 struggle한다는 핵심 문제를 제기합니다.#Review#Coding Agents#Benchmarks#Human-AI Collaboration#Shared Workspace#Interactive Coding#SWE-Touch#Counter-Edit#LLMs2026년 8월 3일댓글 수 로딩 중
[논문리뷰] SKT: Skill-Use Training at Scale via Verified Synthetic Data Generation본 논문은 LLM이 단순히 Agent Skill을 보유하는 것을 넘어, 이를 적절한 시점에 식별하고, 실행하며, 복합적으로 활용할 수 있게 만드는 것을 목표로 합니다.#Review#Agent Skills#Data Synthesis#Skill-Use Training#Synthetic Data#Supervised Fine-Tuning#Language Model Agents2026년 8월 3일댓글 수 로딩 중
[논문리뷰] Roomer: Reflective Object-Grounded Model Editing and Repair for 3D Indoor Layout Synthesis본 논문은 기존의 indoor layout generator가 생성하는 레이아웃의 국소적인 violation(충돌, 경계 이탈, 기능적 차단 등) 문제를 해결하기 위해 Roomer를 제안합니다 .#Review#3D Indoor Layout Synthesis#Model Editing#Reflective Repair#Vision-Language Models#Physical Validity#Spatial Usability2026년 8월 3일댓글 수 로딩 중