[논문리뷰] GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks본 논문은 기존 에이전트 self-evolution 벤치마크가 실질적인 경제적 가치가 높은 도메인을 충분히 다루지 못하며, 학습-테스트 간의 인과 관계가 불분명하여 성과 향상을 신뢰하기 어렵다는 문제점을 해결하고자 합니다.#Review#Agent Self-Evolution#Benchmarking#Enterprise Workflows#Rule Hybridization#Data Contamination#Autonomous Agents2026년 8월 5일댓글 수 로딩 중
[논문리뷰] FocusMem: Factorizing Content, Readout, and Trust in Latent GUI MemoryGUI 에이전트(agents)는 과거 태스크의 유용한 경험과 현재 인터랙션의 미완성된 진행 상황을 효과적으로 기억해야 하지만, 기존 잠재 메모리(latent memory) 방식은 중요한 세부 정보 손실, 다양한 의사결정 단계에 대한 부적합성, 그리고 불필요한 정보로 인한 오도(misleading)와 같은 한계를 가지고 있습니다.#Review#GUI agents#latent memory#episodic memory#working memory#content basis#state-conditioned readout#trust gate#multimodal trajectories2026년 8월 5일댓글 수 로딩 중
[논문리뷰] Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data본 논문은 일반적인 로봇 조작(Manipulation) 정책을 학습하기 위한 대규모 데모 데이터 부족 문제를 해결하고자 한다. 기존의 로봇 데이터 수집 방식은 비용이 많이 들고 노동 집약적이며, 데이터의 다양성 또한 하드웨어 제약으로 인해 제한적이다.#Review#Robot Data Synthesis#Egocentric Data#Generalization Evaluation#Vision-Language-Action#Embodiment#Robot Learning2026년 8월 5일댓글 수 로딩 중
[논문리뷰] Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher GuidanceLLM의 추론 능력 향상을 위한 RLVR(Reinforcement Learning with Verifiable Rewards) 방법 중 GRPO (Group Relative Policy Optimization)는 단순하고 안정적이지만, 희소한 보상 신호(sparse reward signals)와 Negative Zero-Variance Prompts에서 그래디언트 소실(vanishing gradients) 문제를 겪습니다.#Review#Reinforcement Learning#On-Policy Distillation#Large Language Models#GRPO#Knowledge Distillation#Adaptive Teacher Guidance#Zero-Variance Prompts#Supervised Fine-Tuning2026년 8월 5일댓글 수 로딩 중
[논문리뷰] DRIFT: Derailing Denoising Trajectories of Flow-Matching VLAs with Adversarial Patch Attack본 연구는 최근 Flow-Matching 기반의 VLA 모델들이 기존의 autoregressive 모델들에 비해 adversarial 공격에 강인하다는 주장이 실제로는 오해일 수 있음을 지적한다.#Review#Vision-Language-Action Models#Flow-Matching#Adversarial Patch Attack#Denoising Velocity Field#Robustness#Gradient Conflict2026년 8월 5일댓글 수 로딩 중
[논문리뷰] Consistency-Driven Co-Evolution for Self-Supervised Cross-Representation Learning본 논문은 차트 이미지, 테이블 데이터, 시각화 코드 간의 cross-representation understanding에서 AI 시스템이 직면하는 근본적인 문제를 해결하고자 합니다.#Review#Cross-Representation Learning#Self-Supervised Learning#Consistency-Driven Co-Evolution#Multimodal Reasoning#Chart Understanding#Code Generation2026년 8월 5일댓글 수 로딩 중
[논문리뷰] BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation기존의 3D Vision-Language-Action(VLA) 모델들은 대규모 데이터셋에 과도하게 의존하며, 작업 수행 중 발생하는 시야 가림(occlusion)이나 과거 상태에 의존해야 하는 작업(memory-dependent task)을 해결하는 데 한계를 보입니다.#Review#Vision-Language-Action Models#3D Manipulation#Spatio-Temporal Memory#Heatmap Prediction#Data-Efficient#Robot Learning2026년 8월 5일댓글 수 로딩 중
[논문리뷰] Agent Against Agent: An Agentic System for Automatic Prompt Injection Red Teaming본 논문은 LLM 기반 에이전트의 취약점을 탐지하기 위한 기존 레드팀 방식의 낮은 효율성과 제한적인 전이 가능성을 해결하고자 합니다. 기존의 RL-based 방식은 특정 타겟 모델에 대한 방대한 학습 데이터와 수만 번의 쿼리가 필요하여 비용이 높고 새로운 모델에 대한 적응력이 떨어집니다.#Review#Prompt Injection#Red Teaming#Agentic System#Hierarchical Memory#Strategy Library#LLM Security2026년 8월 5일댓글 수 로딩 중
[논문리뷰] AVE-Compass: Towards Holistic Evaluation for Audio-Video Editing Abilities본 논문은 지시 기반(instruction-based) 비디오 편집 모델의 평가에 있어 중요한 격차를 해결하고자 한다. 특히, 오디오와 시각 신호가 밀접하게 결합된 실제 비디오를 다루는 모델의 능력 평가에 초점을 맞춘다.#Review#Audio-Video Editing#Holistic Evaluation#Benchmark#MLLM-as-Judge#Fidelity Preserving#Instruction Following#Realism#AVE-Agent2026년 8월 5일댓글 수 로딩 중
[논문리뷰] ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment본 논문은 기존의 Long-horizon search agent 학습 방식이 가진 궤적 단위(Trajectory-level) 보상의 불명확성 문제를 해결하고자 합니다.#Review#Long-Horizon Search#Credit Assignment#Reinforcement Learning#Process Supervision#Information Retrieval#Agentic Search2026년 8월 5일댓글 수 로딩 중
[flashinfer] Blackwell NVFP4 양자화 최적화: TMA OOB Zero-fill을 이용한 메모리 복사 오버헤드 제거TMA의 하드웨어 기능을 활용해 비정렬 데이터의 패딩 복사 오버헤드를 제거하고 성능을 72% 개선한 FlashInfer의 최적화 사례를 분석합니다.#FlashInfer#NVIDIA Blackwell#NVFP4#TMA#CUDA#Performance Optimization2026년 8월 4일댓글 수 로딩 중
[sglang] Diffusion DiT 모델의 FFN 성능 최적화: cublasLt GELU Epilogue 융합Diffusion DiT 모델의 FFN 연산에서 GEMM과 GELU를 융합하여 커널 호출 오버헤드를 줄이고 HBM 접근을 최적화했습니다.#Diffusion#CUDA#Optimization#SGLang#Performance2026년 8월 4일댓글 수 로딩 중
[triton] Triton FPSAN의 MMA 에뮬레이션 오버헤드 최적화 분석Triton FPSAN에서 불필요한 스크래치 메모리 복사를 제거하여 컴파일 및 런타임 성능을 15-25% 향상시킨 사례를 분석합니다.#Triton#Compiler#Optimization#GPU#FPSAN2026년 8월 4일댓글 수 로딩 중
[논문리뷰] When Attention Goes Blind: Numerical Failure in ALiBi Positional Encodings본 논문은 ALiBi positional encoding이 학습 과정에서 발생하는 Softmax Underflow로 인해 의도치 않은 'Attention Blindness'를 유발한다는 점을 최초로 규명합니다.#Review#ALiBi#Positional Encoding#Softmax Underflow#Attention Mechanism#Floating-Point Precision#Length Extrapolation#Associative Retrieval2026년 8월 4일댓글 수 로딩 중
[논문리뷰] When Agents Learn to Be You: Benchmarking Privacy Leakage, Impersonation Risk, and Defenses in Persona Skills본 논문은 Persona Skills 파이프라인에서 발생하는 구조적 안전성 위협을 규명하고 이를 체계적으로 평가하고자 합니다.#Review#Persona Skills#Agentic Systems#Privacy Leakage#Impersonation Risk#AntiSkillBench#Distillation Strategy#Defense Evaluation2026년 8월 4일댓글 수 로딩 중
[논문리뷰] Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent본 논문은 현재의 Multimodal Agent들이 비디오 기반의 심층 연구(Video-DR) 환경에서 직면한 두 가지 핵심 문제를 해결하고자 한다. 첫째, 에이전트들이 시각적 도구 사용을 회피하고 텍스트 검색에 의존하는 Modality Bias가 심각하다는 점이다 .#Review#Video-DeepResearch#Multimodal Agent#Spatiotemporal Grounding#GRPO#Modality Bias#Parametric Knowledge Leakage#Tool-augmented Execution2026년 8월 4일댓글 수 로딩 중
[논문리뷰] UniWorld-Design: From Pixel Generation to Layer-Native Design본 논문은 기존의 이미지 생성 모델이 픽셀 수준의 단일 평면(Flat RGB canvas)으로 결과를 출력하여, 이후의 창의적인 편집과 재구성이 어렵다는 근본적인 문제를 해결하고자 한다.#Review#Layer-Native Design#RGBA Generation#Image-to-Layer#Semantic Decomposition#Instruction-Addressable#Flow Matching#DiffusionNFT2026년 8월 4일댓글 수 로딩 중
[논문리뷰] TurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated Reasoning본 논문은 Tool-Integrated Reasoning(TIR) 환경에서 발생하는 불명확한 temporal credit-assignment 문제를 해결하기 위해 TurnSight를 제안합니다.#Review#Tool-Integrated Reasoning#Reinforcement Learning#Self-Distillation#Hindsight Credit Assignment#Multi-turn Interaction#Agentic RL2026년 8월 4일댓글 수 로딩 중
[논문리뷰] SkillJack: Persistent Skill Backdoors in Self-Evolving Agents본 연구는 자가 진화형 에이전트가 경험을 Skill로 변환하는 과정에서 발생하는 새로운 보안 위협을 다룬다.#Review#Self-evolving Agents#Skill Extraction#Backdoor Attack#Experience Poisoning#LLM Security#Transformation-Resilient Payload#Persistence Isolation2026년 8월 4일댓글 수 로딩 중
[논문리뷰] ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts본 논문은 기존의 WAMs가 픽셀 기반의 미래 예측 방식에 과도하게 의존하여 시각적 분포 변화(Visual Distribution Shifts) 환경에서 취약하다는 점을 해결하고자 합니다 .#Review#World Action Models#Robotic Manipulation#Visual Distribution Shifts#DINOv3#Flow Matching#Robustness#Semantic-Temporal2026년 8월 4일댓글 수 로딩 중