[논문리뷰] AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces본 논문은 LLM 기반 에이전트가 긴 호흡의 과제(Long-horizon tasks)에서 작은 오류가 누적되어 전체 실패로 이어지는 'jagged intelligence' 문제를 해결하고자 한다.#Review#LLM Agents#Harness Optimization#Automatic Programming#Failure Diagnosis#Structured Intervention#Offline Learning#EvoDAG2026년 8월 25일댓글 수 로딩 중
[논문리뷰] Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs본 논문은 Video MLLM의 후속 학습(Post-training) 과정에서 발생하는 표본 효율성 저하와 확장성 문제를 해결하고자 합니다. 기존 강화학습 방식인 GRPO는 어노테이션을 단순한 스코어링 참조용으로만 사용하여 정작 모델이 학습해야 할 정확한 정답 지점(예: 시간, 좌표, 마스크)을 찾는 데 한계를 보입니다.#Review#Multimodal Large Language Models#Video Perception#Reinforcement Learning#Sample Efficiency#Oracle#Advantage Inversion#Annotation-as-Rollout2026년 8월 25일댓글 수 로딩 중
[flashinfer] FlashInfer SM120 NVFP4 어텐션 최적화: N64 스코어-슬롯 재사용을 통한 성능 향상FlashInfer의 SM120 NVFP4 어텐션 커널을 최적화하여 N64 스코어-슬롯 재사용으로 성능을 크게 향상시켰습니다.#FlashInfer#CUDA#NVIDIA#LLM#최적화#어텐션#NVFP4#SM1202026년 8월 25일댓글 수 로딩 중
[flashinfer] FlashInfer: Blackwell 아키텍처를 위한 Recurrent-KDA Prefill 최적화Blackwell GPU에서 Recurrent-KDA prefill 성능을 2.6배 이상 향상시킨 2단계 BT16 포트폴리오 도입 및 최적화 분석.#FlashInfer#Blackwell#CUDA#LLM#Performance2026년 8월 25일댓글 수 로딩 중
[flashinfer] Blackwell 아키텍처를 위한 고성능 Paged MQA Logits 커널 도입Blackwell SM100 GPU에서 DeepSeek MLA를 위한 FP8/FP4 Paged MQA Logits 커널을 최적화하고 도입했습니다.#FlashInfer#Blackwell#CUDA#LLM#KernelOptimization2026년 8월 25일댓글 수 로딩 중
[논문리뷰] WorldToken: Time-First Sequence Modeling for Robotic Imitation Learning본 연구는 로봇 정책 모델링에서 입력 데이터의 이질성을 어떻게 구조화할 것인가에 대한 근본적인 문제를 해결하고자 합니다. 기존의 로봇 학습 모델들은 다중 모달 입력(카메라, proprioception, 언어 등)과 시간적 흐름을 다루는 방식이 제각기 다르며, 이로 인해 일관된 시퀀스 조직화가 부족한 실정입니다.#Review#Robotic Imitation Learning#Sequence Modeling#WorldToken#Time-First#Multimodal Encoding#Causal Transformer#Diffusion Action Head2026년 8월 24일댓글 수 로딩 중
[논문리뷰] Unlocking the Potential of Image Editing via Concept Scaling and Dense Supervision본 논문은 현재 instruction-based image editing 분야가 직면한 Edit Concept Granularity의 부족과 Sparse Supervision으로 인한 학습 비효율성 문제를 해결하고자 한다.#Review#Image Editing#Diffusion Models#Concept Scaling#Dense Supervision#Hierarchical Taxonomy#ConceptEdit-12M#ConceptEdit-Bench2026년 8월 24일댓글 수 로딩 중
[논문리뷰] Towards a Densing Law for User Representation Learning at Billion-Scale Capacity본 논문은 실산업 환경의 Billion-scale 사용자 표현 학습에서 발생하는 Raw behavioral scaling wall 문제를 해결하고자 합니다 .#Review#User Representation Learning#Scaling Law#Behavioral Densing#RQ-VAE#Information Density#Industrial Recommendation#Billion-Scale Capacity2026년 8월 24일댓글 수 로딩 중
[논문리뷰] Tomatoes, Potatoes, and Onions: Questioning the Need for Faces in Face Presentation Attack Detection본 논문은 기존 PAD 연구가 지나치게 얼굴 중심의 문제로 정의되어 왔다는 점에 의문을 제기합니다. 기존 방식은 특정 얼굴 데이터셋에 과도하게 의존하여 개인정보 보호 및 데이터 수집의 한계에 직면해 있습니다.#Review#Face Presentation Attack Detection#Face Anti-Spoofing#Foundation Models#Domain Generalization#Privacy-Preserving#Representation Learning2026년 8월 24일댓글 수 로딩 중
[논문리뷰] TileMix: Tile-Centric Mixed-Precision Attention for LLM Inference Acceleration본 논문은 LLM의 Long-context prefill 단계에서 발생하는 쿼리-키 간 Quadratic 연산과 메모리 병목 문제를 해결하기 위해 TileMix를 제안한다.#Review#LLM Inference#Mixed-Precision Attention#Tile-Centric#Online Softmax#Quantization#Long-Context#Kernel Optimization2026년 8월 24일댓글 수 로딩 중
[논문리뷰] Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection본 논문은 자동화된 harness optimization 과정에서 발생하는 과도한 평가 비용과 비효율적인 평가 방식을 해결하는 것을 목표로 한다. 기존 연구들은 매 iteration마다 고정된 전체 검증 작업 세트를 평가하는데, 이는 long-horizon 작업처럼 비용이 큰 환경에서 심각한 계산적 병목을 야기한다.#Review#LLM Harness Optimization#Adaptive Validation Task Selection#Task-CoEvolve#Sample-Efficient Evaluation#Automated Harness Evolution#Full-Set Performance Estimation2026년 8월 24일댓글 수 로딩 중
[논문리뷰] TLive-Omni: An Omni-Modal Understanding Model for E-Commerce Live Streaming본 논문은 e-commerce 라이브 스트리밍 환경에서의 복잡한 멀티모달 정보 이해 문제를 해결하기 위해 TLive-Omni를 제안합니다.#Review#Omni-modal#E-commerce#Live Streaming#Faithful-RFT#Per-vGrid#GRPO#Multimodal Alignment2026년 8월 24일댓글 수 로딩 중
[논문리뷰] Same Agent, Different Answers: A Repeat-Aware Audit of Corpus-Induced Answer Churn in Retrieval-Augmented QA본 연구는 RAG 시스템에서 corpus를 업데이트하거나 인덱스를 확장할 때, 모델의 aggregate 성능(accuracy)이 유지되더라도 시스템의 개별 응답 수준에서의 일관성(compatibility)이 훼손될 수 있다는 문제를 제기한다.#Review#Retrieval-Augmented Generation#RAG Evaluation#Answer Churn#Snapshot Compatibility#Corpus Updates#Regression Testing#LLM Evaluation2026년 8월 24일댓글 수 로딩 중
[논문리뷰] ReWorld: An Interactive World Model with Long-Horizon Memory본 논문은 인터랙티브 월드 모델이 직면한 제어(Control)와 기억(Memory) 간의 구조적 긴장 문제를 해결하고자 합니다. 사용자의 입력에 즉각 반응해야 하는 제어 작업은 짧은 히스토리를 선호하는 반면, 공간적 일관성을 유지해야 하는 기억 작업은 무제한적인 과거 정보를 필요로 합니다.#Review#Interactive World Model#Long-Horizon Memory#Streaming Video Generation#Pose-Indexed Attention#Camera Control#Chunk-drop Training2026년 8월 24일댓글 수 로딩 중
[논문리뷰] RISE: Adaptive Imagination for World Action Models본 논문은 기존 World Action Models(WAMs)가 모든 시나리오에 대해 고정된 '미래 상상(Imagination) 예산'을 할당함으로써 발생하는 비효율성 문제를 해결하고자 합니다.#Review#World Action Models#Autonomous Driving#Adaptive Imagination#Future Planning Gain#Counterfactual Dataset#Inference Efficiency2026년 8월 24일댓글 수 로딩 중
[논문리뷰] RIBOSPAN: A Long-Context RNA Foundation Model for Versatile RNA Modeling본 논문은 기존 RNA Foundation Model들이 full-length mRNA와 같은 긴 서열을 다룰 때 발생하는 문맥적 한계를 해결하고자 합니다.#Review#RNA Foundation Model#Long-Context Modeling#Bidirectional Transformer#mRNA Design#Representation Learning#Native Pretraining#Single-Nucleotide Tokenization2026년 8월 24일댓글 수 로딩 중
[논문리뷰] Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs본 논문은 구조적 압축과 4-bit 양자화가 순차적으로 적용된 대규모 언어 모델(LLM)에서 발생하는 성능 저하 문제를 해결하고자 합니다. 기존의 QAT 방식은 학습 과정에서 수렴이 느리고, 최적 지점을 지나치게 되면 모델 성능이 급격히 붕괴하는 불안정성을 보입니다.#Review#Large Language Models#Model Compression#Quantization-Aware Training#Knowledge Distillation#MXFP4#Model Healing2026년 8월 24일댓글 수 로딩 중
[논문리뷰] Prime Agent: A Self-Improving RLM Harness본 논문은 LLM이 단순히 시퀀스를 생성하는 것을 넘어, 장기적 목표를 달성하기 위해 필요한 외부 정보 및 계산 능력을 효과적으로 제공하지 못하는 한계를 해결하고자 합니다. 기존의 에이전트 시스템은 harness가 상태 관리에 실패하거나, 유연하지 못한 workflow로 인해 모델의 잠재력을 제한하는 경우가 많았습니다.#Review#Long-horizon Agency#Recursive Language Model (RLM)#Continual Harness#Test-time Compute#Agentic Workflow#Programmatic Execution2026년 8월 24일댓글 수 로딩 중
[논문리뷰] One Success Isn't Reliability: Thinkingbox, a Sandbox and Benchmark for Agents in Stateful Business Workflows본 논문은 기존의 에이전트 벤치마크가 복잡한 비즈니스 환경에서의 신뢰성을 충분히 평가하지 못한다는 문제를 제기합니다 . 많은 연구가 단일 호출의 적절성이나 코드 실행 결과만을 평가하는 데 치중되어 있어, 다중 턴 상호작용이나 상태 변화가 수반되는 실무적 업무의 복잡성을 간과하고 있습니다.#Review#LLM Agents#Stateful Business Workflows#Benchmark#Sandbox#Tool-Agent-User Interaction#Reliability#Executable Evaluation2026년 8월 24일댓글 수 로딩 중
[논문리뷰] One Polluted Page Is Enough: Evaluating Web Content Pollution in LLM Recommenders본 논문은 검색 증강 LLM이 웹상의 오염된 콘텐츠를 소비함으로써 발생하는 새로운 형태의 추천 시스템 취약성을 다룹니다. 기존 연구들은 주로 직접적인 프롬프트 주입이나 학습 데이터 오염에 집중했으나, 본 연구는 SEO를 통해 검색 결과에 숨어든 허위 리뷰가 LLM의 의사결정을 어떻게 왜곡하는지에 주목합니다 .#Review#LLM Recommender#Generative Engine Optimization#Web Content Pollution#FORGE Benchmark#Indirect Prompt Injection#Robustness2026년 8월 24일댓글 수 로딩 중