[논문리뷰] What to Edit Next: Visually Aligned Image-Editing Follow-Up Suggestions in Conversational Systems본 연구는 대화형 AI 시스템에서 이미지 생성 과제의 후속 편집 제안이 기존의 텍스트 기반 시스템을 넘어 시각적 맥락(Visual Context)을 이해해야 한다는 점을 다룬다.#Review#Multimodal Recommendation#Image Editing#Visual Grounding#Preference Learning#Reinforcement Learning#Industrial Applications2026년 8월 10일댓글 수 로딩 중
[논문리뷰] WeClawArena: An Auditable Sandbox and Benchmark for Cross-User Agents Collaboration and Security in Human-Centered Agent Networks본 논문은 에이전트가 단일 환경을 벗어나 Personal Workspace를 기반으로 다자간 협업을 수행할 때 발생하는 보안 및 거버넌스 문제를 해결하고자 합니다.#Review#Agent Network#Personal Workspace#Tool-Use Collaboration#Security Audit#Benchmark#Human-Centered AI2026년 8월 10일댓글 수 로딩 중
[논문리뷰] Vision-Language Grounding as Bidirectional Concept Correspondence기존의 Vision-Language Grounding 연구는 주로 주어진 텍스트 구문이나 카테고리 이름을 이미지 내 특정 영역에 국한하여 매핑하는 일방향성 localization 문제로 접근해 왔습니다 .#Review#Vision-Language Grounding#Bidirectional Concept Correspondence#Bridge Tokens#Instance-level Segmentation#Multimodal Learning2026년 8월 10일댓글 수 로딩 중
[논문리뷰] The Loss Does Not See the Basis, but Adam Does본 논문은 Factored Model에서 Gradient Descent가 보여주는 저차원(low-rank) 학습 유도 편향(Implicit bias)이 왜 Adam과 같은 적응형 최적화 기법에서는 발현되지 않는지를 규명한다.#Review#Gauge Equivariance#Implicit Bias#Adam#Low-rank Recovery#Matrix Factorization#Optimizer Zoo#Symmetry2026년 8월 10일댓글 수 로딩 중
[논문리뷰] Stealing Reasoning Traces from Proprietary LLM APIs본 연구는 API 제공자들이 지적 재산 보호를 위해 CoT 추론 과정을 암호화하여 클라이언트 측에 저장하도록 하는 아키텍처의 구조적 취약점을 제기한다. 기존의 stateless 설계는 암호화된 블록이 세션, 사용자, 심지어 모델 간에 완벽하게 호환되고 상호 교환될 수 있다는 치명적인 보안 결함을 가진다.#Review#Chain-of-Thought#API Security#Model Distillation#Encrypted Reasoning#Prompt Injection#Privacy Leakage2026년 8월 10일댓글 수 로딩 중
[논문리뷰] Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains본 논문은 현재의 비디오 생성 모델들이 시각적 사실성(visual realism)은 향상되었으나, 과학적 메커니즘이나 인과적 법칙을 정확히 반영하는지 검증하기 어렵다는 문제점을 제기한다.#Review#Video Generation#Scientific Reasoning#Benchmark#Evaluation Protocol#Mechanistic Fidelity#MLLM-as-Judge2026년 8월 10일댓글 수 로딩 중
[논문리뷰] Scaling Inherently Interpretable Language Models본 논문은 현대의 고성능 AI 시스템이 가진 극도의 불투명성(opacity)을 해결하기 위해, 해석 가능성을 훈련 과정의 핵심 제약 조건으로 통합하는 새로운 패러다임을 제안합니다.#Review#Inherent Interpretability#Diffusion Language Models#Concept Bottleneck#Atlas#Scaling Laws2026년 8월 10일댓글 수 로딩 중
[논문리뷰] SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring본 논문은 기존 소프트웨어 엔지니어링 벤치마크가 포화 상태에 도달하고, 다수의 불완전한 테스트 케이스와 데이터 오염 문제로 인해 실제 모델의 능력을 변별하기 어려워짐에 따라 SWE-Bench ProMax를 제안한다.#Review#Code Refactoring#AI Agents#Software Engineering#Multilingual Benchmark#Long-horizon Evaluation#Agentic Workflow2026년 8월 10일댓글 수 로딩 중
[논문리뷰] SPOT: Sparse Probing and Outcome Calibration for On-Policy Distillation본 논문은 기존 OPD가 교사 모델의 불확실한 토큰에 대해 Reverse-KL 손실 함수를 사용함으로써, 교사가 제시하는 다양한 합리적 대안들을 충분히 포괄하지 못하는 문제(mode-seeking behavior)를 해결하고자 합니다.#Review#On-Policy Distillation#Language Model#Uncertainty-Aware#Sparse Probing#Outcome Calibration#Reasoning Benchmarks#Knowledge Distillation2026년 8월 10일댓글 수 로딩 중
[논문리뷰] RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance본 논문은 기존 로봇 학습에서 보상 체계(Reward Supervision)의 불투명성과 낮은 일반화 성능 문제를 해결하기 위해 Temporal Distance 기반의 새로운 가치 평가 프레임워크를 제안합니다 .#Review#Robotic Foundation Model#Temporal Distance#Value Function#Reward Interface#Embodied AI#Reinforcement Learning#Shortcut Suppression2026년 8월 10일댓글 수 로딩 중
[논문리뷰] RoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility States본 논문은 self-evolving LLM 에이전트의 메모리 시스템이 경험 누적에 따른 utility 상태 공간의 무한 확장과 이로 인한 MRT 문제라는 이중고에 직면해 있음을 지적합니다.#Review#LLM Agents#Memory Reinforcement Learning#Memory-Reward Trap#Reduced-Order Utility States#Feedback Density#Self-Evolving Memory2026년 8월 10일댓글 수 로딩 중
[논문리뷰] Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution본 논문은 기존 Coding Agent들이 고정된 Harness 하에서만 동작하여 성능 향상에 한계가 있다는 문제점을 해결하고자 한다.#Review#Self-evolving Agents#Coding Agent#Agentic Workflow#Frontier Model#Operational Safety#Recursive Evolution#Version Control2026년 8월 10일댓글 수 로딩 중
[논문리뷰] OasisKV: Scaling In-Decode KV Cache Beyond HBM with Lookahead Sparse Prefetching본 논문은 대규모 언어 모델(LLM)의 long-context 및 agentic workloads가 증가함에 따라 발생하는 HBM의 용량 병목 현상을 해결하고자 한다 .#Review#LLM Inference#KV Cache#Sparse Prefetching#Memory Wall#Speculative Decoding#Lookahead Attention#PD Disaggregation2026년 8월 10일댓글 수 로딩 중
[논문리뷰] Motif 3: Technical Report본 논문은 대규모 모델의 파라미터 확장과 효율적인 컴퓨팅 자원 활용 사이의 간극을 해결하기 위해 Motif 3를 제안합니다. 기존의 일반적인 LLM들은 모델 크기가 커짐에 따라 추론 비용과 메모리 소모가 비효율적으로 증가하며, 특히 학습 과정에서의 expert 쏠림 현상이나 고차원 정보 처리의 안정성 문제가 발생합니다.#Review#Large Language Model#Mixture-of-Experts#Grouped Differential Latent Attention#Multi-token Prediction#Inference Efficiency#Training Stability2026년 8월 10일댓글 수 로딩 중
[논문리뷰] Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA본 연구는 대규모 언어 모델이 고정된 환경에서 사전 학습된 후 정체되는 한계를 극복하고, 실제 환경에서 경험을 통해 지속적으로 발전하는 Experiential Intelligence 구현을 목표로 합니다.#Review#Experiential Intelligence#Mixture-of-LoRA#Continual Learning#Recursive Self-Improvement#Agent Model2026년 8월 10일댓글 수 로딩 중
[논문리뷰] MMOOC: A Comprehensive Benchmark for Out-of-Context Evaluation in Multimodal Large Language Models본 논문은 MLLM이 불완전한 시각적 맥락(Imperfect Context) 하에서 거부와 답변 능력을 적절히 균형 잡지 못하는 신뢰성 문제를 해결하고자 합니다.#Review#Multimodal Large Language Models#Out-of-Context#Benchmark#Refusal#Robust Answering#Shifted In-Context#Model Reliability2026년 8월 10일댓글 수 로딩 중
[논문리뷰] Intent Speaks Louder: Controllable User Simulation Beyond Response Imitation기존의 LLM 기반 사용자 시뮬레이터는 대화 문맥과 프로필을 기반으로 다음 사용자 턴을 단순히 모방(Imitation)하는 방식에 의존합니다 .#Review#User Simulation#LLM#Reinforcement Learning#Controllable Generation#Interaction Intent#Directive-Conditioned Generation2026년 8월 10일댓글 수 로딩 중
[논문리뷰] Factorized Hypothesis Search for Evidence-to-Taxonomy Retrieval본 논문은 많은 NLP 작업에서 발생하는 입력 데이터와 대상 개념 간의 모호성 문제를 해결하고자 합니다.#Review#Evidence-to-Taxonomy Retrieval#Factorized Hypothesis Search#Retrieval Readiness Gap#Semantic Dimension#Candidate-Level Verifier#Financial Tagging#Clinical Coding2026년 8월 10일댓글 수 로딩 중
[논문리뷰] Evo-Bench: Can Language Models Improve Agent Harness?본 논문은 LLM 기반 에이전트의 자율적 하네스 개선(harness evolution) 역량을 체계적으로 평가하기 위한 새로운 벤치마크인 Evo-Bench를 제안합니다.#Review#Agent Harness#Harness Evolution#LLM#Benchmark#Self-Improvement#Autonomous Agent#Task Sensitivity2026년 8월 10일댓글 수 로딩 중
[논문리뷰] Evidence-RL: Towards Evidence-intensive Visual Reasoning본 논문은 Vision-Language Models (VLMs)가 시각적 증거에 기반하지 않고 언어적 편향(language priors)이나 학습 데이터의 지름길(shortcuts)에 의존하여 답변하는 문제를 해결하고자 한다.#Review#Vision-Language Models#Reinforcement Learning#Counterfactual Evidence Disentanglement#Visual Grounding#Causal Reasoning#Post-training2026년 8월 10일댓글 수 로딩 중