[논문리뷰] LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget본 연구는 고정된 GPU 자원 내에서 million-token context를 지원하는 RL post-training의 한계를 극복하고자 수행되었습니다.#Review#Long-Context#GRPO#RL Post-training#Fixed GPU Budget#Tensor Lifetime#Architecture-Aware Execution2026년 7월 16일댓글 수 로딩 중
[논문리뷰] GRASP: GRanularity-Aware Search Policy for Agentic RAG본 논문은 Agentic RAG 시스템에서 발생하는 불필요한 노이즈와 잘못된 검색 결정을 방지하고, 다중 단계 추론의 정확도를 높이는 문제를 해결한다. 기존의 Static RAG는 단일 검색으로 인한 정보 부족과 coarse-grained 문맥으로 인한 hallucination 문제에 취약하다.#Review#Agentic RAG#Reinforcement Learning#Retrieval Policy#Context Granularity#Multi-hop Reasoning#Information Foraging2026년 7월 16일댓글 수 로딩 중
[논문리뷰] From Pixels to States: Rethinking Interactive World Models as Game Engines본 논문은 최근 비디오 생성 모델이 interactive world를 구현하는 데이터 기반 방법론으로 부상하고 있으나, 실제 게임 엔진이 갖는 엄격한 논리적 구조를 완전히 재현하지 못한다는 문제를 제기한다.#Review#Interactive World Models#Game Engines#Video Generation#Game State Dynamics#Action Control#Long-horizon Consistency2026년 7월 16일댓글 수 로딩 중
[논문리뷰] Demystifying On-Policy Distillation: Roles, Pathologies, and Regulations본 논문은 최신 LLM post-training의 표준이 된 OPD의 학습 동역학이 여전히 불투명하다는 점을 지적한다. OPD는 때때로 성능 향상을 이끌지만, 많은 경우 불안정성을 보이거나 탐색 붕괴를 초래하며 심지어 outcome-based RL보다 성능이 저하되기도 한다 .#Review#On-Policy Distillation#LLM Post-training#Reinforcement Learning#Exploration Catalyst#Pathology#Signal Regulation2026년 7월 16일댓글 수 로딩 중
[논문리뷰] DeepLoop: Depth Scaling for Looped Transformers본 논문은 Looped Transformer 환경에서 기존의 DeepNorm 스케일링 규칙이 최적화 안정성을 보장하지 못하는 문제를 해결합니다.#Review#Looped Transformer#Depth Scaling#DeepNorm#Residual Scaling#Parameter Tying#Recurrent Depth2026년 7월 16일댓글 수 로딩 중
[논문리뷰] Concurrent Image Understanding and Generation: Self-Correcting Coupled Markov Jump Processes기존의 다중 모달 생성 시스템은 텍스트와 이미지 생성이 상호 독립적이거나 비동기적으로 이루어져, 모달리티 간의 심각한 불일치(contradiction)가 발생하고 이를 사후 수정할 수 없다는 한계가 있습니다.#Review#Masked Diffusion Models#Multimodal Generation#Coupled Markov Jump Processes#Self-Correction#Remasking#Visual Reasoning2026년 7월 16일댓글 수 로딩 중
[논문리뷰] BadWAM: When World-Action Models Dream Right but Act Wrong본 논문은 WAM이 미래 상태를 예측하는 능력을 갖추고 있음에도 불구하고, 이러한 결합 구조가 오히려 새로운 형태의 보안 취약점이 될 수 있음을 지적합니다.#Review#World-Action Models#Embodied AI#Adversarial Attack#World-Action Drift#Closed-Loop Execution#Robotics2026년 7월 16일댓글 수 로딩 중
[논문리뷰] AsySplat: Efficient Asymmetric 3D Gaussian Splatting for Long-Sequence Scene Modeling본 논문은 일반화된 3DGS 모델이 긴 시퀀스(long-sequence)의 장면을 다룰 때 발생하는 과도한 연산 중복 문제를 해결하는 것을 목표로 합니다. 기존 연구들은 기하학적 정보와 외관 정보 모델링을 구분하지 않고 동일한 방식으로 고해상도 패치 토큰들을 처리하여 불필요한 계산 비용을 발생시켰습니다 .#Review#3D Gaussian Splatting#Long-sequence Scene Modeling#Generalizable NVS#Asymmetric Architecture#Sparse Attention#Computational Efficiency2026년 7월 16일댓글 수 로딩 중
[flashinfer] FlashInfer의 FP4 GEMM 최적화: 휴리스틱 개선과 Autotuning 효율화FlashInfer의 mm_fp4(cute-dsl) 연산에서 휴리스틱 기반 랭킹과 Top-N Autotuning을 도입하여 컴파일 시간을 획기적으로 단축했습니다.#FlashInfer#GEMM#CUDA#Optimization#LLM#Autotuning2026년 7월 15일댓글 수 로딩 중
[ultralytics] [Ultralytics] NDJSON 변환 최적화: 보안과 성능을 동시에 잡는 설계 전략NDJSON 데이터셋 변환 시 발생하던 경로 보안 취약점과 성능 병목을 해결하고, 8배 빠른 속도를 달성한 Ultralytics의 최적화 기법을 분석합니다.#Python#Ultralytics#Optimization#Security#PathTraversal#Performance2026년 7월 15일댓글 수 로딩 중
[sglang] SGLang에 KDA FlashInfer 백엔드 도입: Blackwell 아키텍처에서의 효율적인 추론FlashInfer KDA 커널을 도입하여 KDA 모델의 추론 성능을 개선하고 MTP(Speculative Decoding)를 위한 target_verify 경로를 구현했습니다.#SGLang#FlashInfer#KDA#Speculative Decoding#LLM Optimization2026년 7월 15일댓글 수 로딩 중
[sglang] SGLang MoE All-Reduce 최적화: NCCL Symmetric Memory 활용으로 지연 시간 50% 단축SGLang MoE 레이어의 all-reduce 성능을 NCCL symmetric memory로 최적화하여 TPOT 6.55% 개선.#SGLang#MoE#AllReduce#NCCL#SymmetricMemory#DeepSeek-V4#성능최적화#GPU2026년 7월 15일댓글 수 로딩 중
[논문리뷰] Vinci2: Providing Proactive Assistance in Continuous Egocentric Videos본 논문은 기존 Egocentric assistant가 수동적인 Reactive 방식이나 특정 이벤트 발생 시에만 응답하는 Semi-proactive 방식에 머물러 있다는 한계를 지적합니다.#Review#Egocentric Video#Proactive Assistance#Retrieval-Augmented Reasoning#Streaming Memory#Video-LLM#Benchmarking2026년 7월 15일댓글 수 로딩 중
[논문리뷰] Tracing Agentic Failure from the Flow of Success본 논문은 LLM 기반 에이전트 시스템의 실패를 자동으로 진단할 때 발생하는 비용과 비효율성 문제를 해결하기 위해 Oat를 제안한다.#Review#LLM Agents#Failure Attribution#Unsupervised Learning#Neural CDE#One-Class Learning#Anomaly Detection#Agentic Systems2026년 7월 15일댓글 수 로딩 중
[논문리뷰] ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation본 논문은 구조적 프루닝(Structured Pruning)이 적용된 LLM이 객관식 벤치마크에서는 성능을 유지하지만, 실제 배포 시 요구되는 자유 형식 생성(Free-form generation)에서는 심각하게 붕괴하는 현상을 해결하고자 합니다.#Review#Structured Pruning#On-Policy Distillation#LLM Compression#Model Recovery#Repetition Control#Token-level Supervision2026년 7월 15일댓글 수 로딩 중
[논문리뷰] Self-Improvements in Modern Agentic Systems: A Survey본 논문은 현대의 Agentic Systems가 어떻게 인간의 개입을 최소화하면서 경험을 통해 스스로 역량을 확장할 수 있는지에 대한 체계적인 분석을 제공합니다. 기존 연구들은 개별적인 개선 기법에 집중해왔으나, 이러한 기술들을 포괄하는 통합된 프레임워크가 부족했습니다.#Review#Agentic Systems#Self-Improvement#Foundation Model#Scaffolding#Meta-Learning#Autonomous Agents2026년 7월 15일댓글 수 로딩 중
[논문리뷰] Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning본 논문은 대규모 언어 모델이 단순히 정보를 암기하는 단계를 넘어 고도의 논리적 추론 능력을 갖추기 위한 핵심 동력으로 Zero RL의 확장성을 주목합니다.#Review#Zero RL#Trillion Parameters#Emergent Reasoning#Reinforcement Learning#Scalability#LLM2026년 7월 15일댓글 수 로딩 중
[논문리뷰] Registers Matter for Pixel-Space Diffusion Transformers본 논문은 Register Tokens가 기존 ViTs에서의 고질적인 문제인 '고 norm 아웃라이어(high-norm patch-token outliers)'를 해결하는 것과 달리, DiTs에서의 구체적인 역할과 효과는 미비하게 탐구되었다는 점에 주목합니다.#Review#Diffusion Transformers#Register Tokens#Pixel-Space#Feature Norms#Attention Sinks#Dual-Stream Architecture2026년 7월 15일댓글 수 로딩 중
[논문리뷰] PolicyShiftGuard: Benchmarking and Improving Policy-Adaptive Image Guardrails본 논문은 기존의 이미지 가드레일이 고정된 안전 정책하에서만 작동하며, 실제 산업 현장에서 요구되는 정책적 유연성을 결여하고 있다는 문제를 해결하고자 합니다.#Review#Image Guardrail#Policy-Adaptive#PolicyShiftBench#PolicyShiftGuard#Boundary-Pair Policy Adaptation#Multimodal Safety2026년 7월 15일댓글 수 로딩 중
[논문리뷰] PalmClaw: A Native On-Device Agent Framework for Mobile Phones본 논문은 기존 모바일 에이전트가 주로 의존하는 GUI 기반 조작의 한계를 극복하고, 모바일 기기 환경에서 더 효율적이고 제어 가능한 에이전트 프레임워크를 구축하는 것을 목표로 한다.#Review#Mobile Agent#On-Device#LLM Agent#Device Tools#Execution Boundary#Agent Framework2026년 7월 15일댓글 수 로딩 중