[flashinfer] FlashInfer, CUDA 커널 최적화를 통한 LLM 추론 속도 향상: Recurrence-Piece Persistent M128 도입FlashInfer의 최신 PR은 CUDA 커널 최적화를 통해 LLM 추론 성능을 2.7배 향상시킵니다.#AI#LLM#성능 최적화#CUDA#FlashInfer2026년 8월 26일댓글 수 로딩 중
[sglang] SGLang: LongCat-Image DiT의 FFN 연산 최적화 - Tanh-GELU 퓨전 적용LongCat-Image 모델의 FFN up-projection과 Tanh-GELU를 커널 퓨전하여 추론 성능을 1.5% 개선했습니다.#SGLang#DeepLearning#Optimization#KernelFusion#CUDA2026년 8월 26일댓글 수 로딩 중
[vllm] vLLM, Pixtral 모델의 멀티모달 인코더 어텐션 최적화: Packed Sequence Metadata 도입vLLM이 Pixtral 모델에서 멀티모달 인코더 어텐션의 성능과 메모리 효율성을 개선합니다.#vLLM#Pixtral#멀티모달#어텐션#최적화#성능 개선2026년 8월 26일댓글 수 로딩 중
[vllm] vLLM MoE 성능 최적화: flashinfer_nvlink_one_sided 도입vLLM의 MoE 통신 백엔드를 flashinfer_nvlink_one_sided로 기본 설정하여 처리량(Throughput)을 최대 8% 향상시켰습니다.#vLLM#MoE#FlashInfer#NVLink#Performance2026년 8월 26일댓글 수 로딩 중
[논문리뷰] WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report본 논문은 현대 AI 시스템에서 이기종 멀티모달 데이터의 통합 표현 문제를 해결하기 위해 고성능의 범용 Multimodal Embedding 모델군을 제안합니다. 기존의 CLIP 스타일 모델은 모달리티별로 분리된 인코딩 경로를 가져 복합적인 입력을 처리하는 데 한계가 있으며, 특정 태스크에만 편향되는 경향이 있습니다.#Review#Multimodal Embedding#Large Language Models#Contrastive Learning#Matryoshka Representation Learning#Representation Learning#Retrieval2026년 8월 25일댓글 수 로딩 중
[논문리뷰] TorchMorph: CUDA-accelerated Morphological Transforms본 논문은 현대의 GPU 기반 딥러닝 파이프라인에서 기존 CPU 전용 Morphological Transform 라이브러리인 scipy.ndimage가 초래하는 성능 저하와 비효율성을 해결하기 위해 개발되었습니다.#Review#Morphological Transforms#Distance Transform#Optimal Transport#CUDA#PyTorch#Open Source2026년 8월 25일댓글 수 로딩 중
[논문리뷰] Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses본 논문은 긴 호흡의 에이전트 작업에서 발생하는 재귀적 자기 개선(Recursive Self-Improvement, RSI)의 불투명성과 성능 저하 문제를 해결합니다.#Review#Long-Horizon Agents#Recursive Self-Improvement#Working Memory#Experiential Memory#Failure Localization#Agent Harness2026년 8월 25일댓글 수 로딩 중
[논문리뷰] On-policy Distillation with Verifiable Reward본 연구는 RLVR의 희소한 보상 신호와 OPD의 순수 분포적 목표 사이의 근본적인 한계를 해결하는 것을 목표로 합니다.#Review#On-policy Distillation#Verifiable Reward#Reinforcement Learning#Reasoning Tasks#ReLU Gating#GRPO2026년 8월 25일댓글 수 로딩 중
[논문리뷰] MoTE: Mixture of Task Experts for Multi-Task Video Understanding본 논문은 멀티태스킹 비디오-언어 학습에서 발생하는 작업 간 간섭(Task conflict)과 컴퓨팅 효율성 문제를 해결하기 위해 고안되었습니다.#Review#Multi-Task Video Understanding#Mixture-of-Experts#Decoder Architecture#Task Routing#Instruction Tuning#Procedural Video#VideoLLM2026년 8월 25일댓글 수 로딩 중
[논문리뷰] Meta^n: Recursive Self-Improvement through Emergent Depth현재 LLM 에이전트는 답변을 수정하는 수준의 Self-Refinement에 그치며, 답변을 생성하는 프로세스 자체를 근본적으로 개선하는 데는 한계가 있습니다. 기존의 메타 개선 시스템은 안정성을 위해 Driver 계층을 고정해야 하므로 Meta-depth가 약 2.5 수준에서 제한되는 병목 현상을 겪습니다 .#Review#Meta-Reasoning#Self-Improvement#Large Language Models#Recursive Architecture#Evolutionary Orchestration2026년 8월 25일댓글 수 로딩 중
[논문리뷰] Length-Adaptive Decoding for Masked Diffusion Machine Translation본 논문은 Fixed Canvas masked diffusion 모델이 머신 트랜잭션(MT) 환경에서 타겟 길이를 결정하는 과정의 불투명성과 비효율성을 해결합니다.#Review#Masked Diffusion#Machine Translation#Entropy-Valley#Length-Adaptive Decoding#Decoding Strategy#LLaDA2026년 8월 25일댓글 수 로딩 중
[논문리뷰] Latent Action as Intention Enables Efficient Future Imagination for World Action Models본 논문은 WAM에서 미래 예측(Future Imagination)이 로봇 조작 성능에 기여함에도 불구하고, 관측 공간에서의 비디오 생성 과정이 심각한 Latency 병목을 야기한다는 문제를 해결하고자 합니다.#Review#World Action Models#Latent Action#Future Imagination#Robotic Manipulation#Egocentric Pre-training#Inference Efficiency2026년 8월 25일댓글 수 로딩 중
[논문리뷰] LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training대규모 오픈 비디오-언어 리소스는 텍스트 및 이미지 코퍼스에 비해 상대적으로 작다는 핵심적인 문제가 존재합니다. 기존의 가장 큰 비디오 데이터셋인 InternVid는 7백만 개의 비디오를 포함하지만, 이는 현대 텍스트 및 이미지 코퍼스와 비교하면 규모가 미미합니다.#Review#Multimodal Pre-training#Video Dataset#Audio Dataset#Image-Text Pairs#Scaling Laws#ViCLIP#CLAP#CLIP2026년 8월 25일댓글 수 로딩 중
[논문리뷰] GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture기존 VLA 모델들은 복잡한 환경에서 동작하는 일반적인 로봇 제어에는 성공했으나, 데이터가 다양한 로봇 형태로 확장될 때 서로 다른 액션 공간과 실행 조건으로 인해 학습 효율이 떨어지고 지식이 충돌하는 문제에 직면해 있습니다 .#Review#Vision-Language-Action (VLA)#Embodied Foundation Models#Three-System Architecture#World Model#Flow Matching#Multi-Embodiment#Soft Knowledge Insulation2026년 8월 25일댓글 수 로딩 중
[논문리뷰] Game2World Engine: Unlocking In-the-Wild Gameplay Videos for World Model Training본 논문은 다양한 환경과 상호작용 정보를 포함하는 게임 영상이 월드 모델 학습의 핵심 데이터임에도 불구하고, 화면에 포함된 HUD(Head-Up Display)와 같은 비물리적 요소가 학습에 방해가 된다는 문제를 해결합니다 .#Review#World Model#Gameplay Video#UI Removal#Video Editing#Data Engine#HUD#Mask-free2026년 8월 25일댓글 수 로딩 중
[논문리뷰] From Seeing to Acting: Smart Glasses as First-Person Intelligence Platforms본 논문은 스마트 글래스가 단순한 주변기기에서 능동적인 지능형 플랫폼으로 진화함에 따라 발생하는 연구의 파편화 문제를 해결하고자 합니다.#Review#Smart Glasses#First-Person Intelligence#Egocentric Perception#Multimodal Interaction#Physical AI#Embodied Intelligence2026년 8월 25일댓글 수 로딩 중
[논문리뷰] DREAM Technical Report산업용 추천 시스템은 일반적으로 Retrieval, Ranking, Re-ranking으로 이어지는 다단계 파이프라인 구조를 갖추고 있으나, 시스템의 파편화와 실시간 사용자 의도 파악 능력 부족이라는 한계에 직면해 있습니다 .#Review#Agentic AI#Recommender Systems#Intent Engine#Meta Engine#Offline RL#User Intent Perception#Strategy Orchestration2026년 8월 25일댓글 수 로딩 중
[논문리뷰] CyberFactory: Scaling Cyber Security Capabilities with Instances from the Wild본 논문은 오픈소스 진영에서 대규모 사이버 보안 모델 학습을 위한 재현 가능한 에이전트 데이터 파이프라인의 부재라는 핵심 문제를 해결하고자 합니다.#Review#Cybersecurity#Large Language Models#Agentic Data#Vulnerability Repair#Proof-of-Concept#CyberGym#OpenAegis2026년 8월 25일댓글 수 로딩 중
[논문리뷰] CAFE: Self-Improving Search Agents Need Co-Evolving Feedback본 논문은 장기 탐색(long-horizon search) 과정에서 발생하는 중간 단계의 오류를 효과적으로 교정하고, 탐색 에이전트와 이를 가이드하는 피드백 모델이 상호 진화(co-evolve)해야 한다는 점에 주목합니다.#Review#Search Agents#Co-Evolving Feedback#Reinforcement Learning#Credit Assignment#Preference Optimization#LLM2026년 8월 25일댓글 수 로딩 중
[논문리뷰] Best Practice Critic Optimization본 논문은 LLM RL 학습에서 Critic-based 접근 방식이 가지는 고질적인 불안정성과 성능 저하 문제를 해결하고자 한다. 기존의 Group-based methods는 여러 응답을 샘플링하여 비교함으로써 Critic 학습을 피하지만, 이는 높은 컴퓨팅 자원을 소모하며 토큰 레벨의 정밀한 학습을 제한한다.#Review#Reinforcement Learning#Large Language Models#Critic-Based Methods#Best Practice Critic Optimization#Generalized Advantage Estimation#Privileged Information2026년 8월 25일댓글 수 로딩 중