[openclaw] 대규모 세션 카탈로그 업데이트 성능 최적화: 전체 비교에서 부분 비교로불필요한 전체 카탈로그 직렬화 및 비교를 제거하여 UI 스톨을 95% 개선한 사례를 분석합니다.#Performance#TypeScript#Optimization#Frontend2026년 8월 22일댓글 수 로딩 중
[flashinfer] SM120(Blackwell)을 위한 초고속 KDA Prefill 커널: FlashInfer의 CuTe DSL 백엔드 분석SM120 아키텍처에서 CuTe DSL을 활용해 KDA Prefill 성능을 3.2배 향상시킨 최적화 기법과 안정성 개선 사항을 살펴봅니다.#FlashInfer#CUDA#Blackwell#KDA#Performance-Optimization#CuTe-DSL2026년 8월 22일댓글 수 로딩 중
[onnxruntime] ARM NEON 최적화: LinearAttention 커널 융합으로 3배 성능 향상Microsoft ONNX-Runtime의 LinearAttention 연산에 ARM NEON 최적화 커널을 추가하여 성능을 3배 향상시킨 PR을 분석합니다.#ONNX Runtime#ARM NEON#성능 최적화#MLAS#Linear Attention2026년 8월 22일댓글 수 로딩 중
[onnxruntime] ONNX Runtime의 ARM SVE i8mm QGEMM 최적화: 휴대용 머신 코드 전략ARM SVE i8mm 명령어를 활용한 고성능 QGEMM 커널 구현과 휴대용 머신 코드(Portable Machine Code)를 통한 이식성 확보 전략을 분석합니다.#ONNX Runtime#ARM#SVE#QGEMM#Optimization#AArch642026년 8월 22일댓글 수 로딩 중
[vllm] [vLLM] DFlash2: Speculative Decoding의 새로운 지평 - Local Conv와 Candidate Selector 분석vLLM에 도입된 DFlash2의 핵심 최적화 기법인 Grouped Conv와 Candidate Selector를 심층 분석합니다.#vLLM#Speculative Decoding#Triton#CUDA#LLM Serving2026년 8월 21일댓글 수 로딩 중
[ultralytics] Ultralytics 체크포인트 로딩 최적화 및 스레드 안전성 강화Restricted checkpoint 로딩의 스레드 안전성을 확보하고, RLE prior 계산을 최적화하여 성능을 40% 향상시켰습니다.#PyTorch#Performance#Concurrency#Optimization#Ultralytics2026년 8월 21일댓글 수 로딩 중
[onnxruntime] ONNX Runtime MLAS, AVX-512 최적화로 MobileClip-S0 모델 추론 속도 향상ONNX Runtime MLAS가 AVX-512 명령어셋을 활용하여 Erf 커널과 NCHWc 재정렬 트랜스포즈를 최적화했습니다.#ONNX Runtime#MLAS#AVX-512#최적화#성능#CPU 추론2026년 8월 21일댓글 수 로딩 중
[Liger-Kernel] Liger-Kernel의 RMSNorm 최적화: cuTile 도입과 CuTe DSL 성능 개선Liger-Kernel에 네이티브 cuTile RMSNorm을 추가하고, CuTe DSL의 동기화 및 연산 효율을 최적화하여 H100 성능을 극대화했습니다.#CUDA#RMSNorm#Liger-Kernel#CuTe#H100#Performance2026년 8월 21일댓글 수 로딩 중
[논문리뷰] WithEveryone: Unified Planning and Identity Grounding for Group Image Generation본 논문은 5~10명의 다수 인물이 포함된 그룹 이미지 생성 시 ID 보존 및 일관성이 크게 저하되는 문제를 해결하고자 한다. 기존 모델들은 인원수가 증가함에 따라 개별 ID 신호가 희석되거나, 복제된 얼굴(copy-paste) 오류, 혹은 ID 혼선 현상이 발생하는 한계가 있다.#Review#Group Image Generation#Identity-Preserving#Layout Planning#Multimodal Models#Representation Forcing#Flow Matching2026년 8월 20일댓글 수 로딩 중
[논문리뷰] Towards Quantifying Benchmark Optimization in ASR Models본 논문은 ASR(Automatic Speech Recognition) 모델이 공개 벤치마크에서 기록하는 높은 성능이 실제 세계의 일반적인 전사 능력과 괴리되어 있을 가능성을 제기한다.#Review#ASR#Benchmark Optimization#Mechanistic Interpretability#Generalization#Transcription Policy#Reference Disagreement2026년 8월 20일댓글 수 로딩 중
[논문리뷰] Thinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See본 연구는 저자원 언어(Low-resource language)에서 LLM의 추론 성능을 개선하기 위해 수행되는 SFT와 RL이 모델의 실제 추론 능력에 어떤 영향을 미치는지 규명하고자 한다.#Review#Low-Resource Language#Chain-of-Thought#Supervised Fine-Tuning (SFT)#Reinforcement Learning (RL)#Mixture-of-Experts (MoE)#Training Variance#Language Fidelity2026년 8월 20일댓글 수 로딩 중
[논문리뷰] SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn Interaction Feedback본 논문은 기존 LLM 기반 Agent가 상호작용 실패로부터 지속적으로 학습하지 못하는 한계점을 해결하고자 한다. 기존의 Single-turn 기반 평가 방식은 초기 단계의 결함만을 수정할 뿐, 이후 단계에서 발생하는 복합적인 결함을 식별하지 못해 진화 그래디언트가 쉽게 소멸하는 문제를 가진다 .#Review#Agent Skill#Multi-Turn Interaction#Self-Evolution#Trustworthy Feedback#Controllable Governance#Knowledge Evolution2026년 8월 20일댓글 수 로딩 중
[논문리뷰] SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?본 연구는 과학 소프트웨어의 결함이 단순한 프로그램 오류를 넘어 과학적 결론의 신뢰성 자체를 훼손할 수 있다는 문제의식에서 출발합니다.#Review#Scientific Software Engineering#Coding Agents#Benchmark#Repository-level#Fault Analysis#Chain-of-Evidence Protocol2026년 8월 20일댓글 수 로딩 중
[논문리뷰] Repo0: Design-Driven Zero-to-All Code Generation본 논문은 기존 Code Generation 모델들이 소프트웨어 아키텍처를 사전에 정의된 정적 아티팩트로 간주한다는 한계를 해결하고자 합니다. 기존 방식은 개발 도중 드러나는 아키텍처상의 결함(낮은 응집도, 과도한 결합 등)을 실시간으로 수정하지 못하여, 복잡한 프로젝트 구축 시 성능이 저하되는 문제가 발생합니다 .#Review#Code Generation#Software Engineering Agents#Repository Generation#Structural Evolution#Dual-DAG#Modularity Metrics#Test-Driven Development2026년 8월 20일댓글 수 로딩 중
[논문리뷰] PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents본 논문은 고객 서비스 LLM 에이전트가 비즈니스 정책을 준수하지 못하는 문제를 해결하기 위해 제안되었습니다.#Review#LLM Agents#Policy Compliance#Workflow Enforcement#Runtime Safeguards#Process Monitoring#Proactive Verifier2026년 8월 20일댓글 수 로딩 중
[논문리뷰] NARU: A Benchmark for NARrative Evolution and Cultural Nuance Understanding in Japanese Extreme Long Video본 논문은 기존의 비디오 벤치마크가 단순한 이벤트 인식이나 짧은 클립 이해에 국한되어 있어, 장시간 영상에서 발생하는 서사 진화와 고맥락 문화적 함의를 이해하는 데 한계가 있다는 문제를 지적합니다 .#Review#Long-form Video Understanding#Multimodal Large Language Models#Narrative Intelligence#Cultural Nuance Understanding#Benchmark#Japanese Media2026년 8월 20일댓글 수 로딩 중
[논문리뷰] MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use본 논문은 LLM의 메모리 활용 과정에서 발생하는 Cognitive Traps가 모델의 추론 및 성능을 왜곡하는 문제를 제기합니다 .#Review#Large Language Models#Memory Frameworks#Cognitive Traps#Reasoning Fixation#Belief Distortion#Benchmarking#AdaptiveMem2026년 8월 20일댓글 수 로딩 중
[논문리뷰] Listening Forward: Next Patch Embedding Prediction Enables Scalable Audio Learners본 논문은 오디오 표현 학습에서 사용되는 기존의 복잡한 SSL(Self-Supervised Learning) 방법론들이 가진 과도한 의존성 문제를 해결하고자 합니다.#Review#Self-Supervised Learning#Audio Representation Learning#Causal Transformer#Next-Patch-Embedding Prediction#Autoregressive#NAPE2026년 8월 20일댓글 수 로딩 중
[논문리뷰] Inject, Align, Recover: Staged Post-Training for Retrieval-Free Document Knowledge Internalization본 논문은 RAG(Retrieval-Augmented Generation)를 사용할 수 없는 환경에서 대규모 언어 모델이 특정 문서 정보를 Parametric Knowledge로 보유하도록 하는 '문서 지식 내재화' 문제를 다룬다.#Review#Document Knowledge Internalization#Retrieval-Free QA#Post-Training#Model Merging#Catastrophic Forgetting#Domain Adaptation2026년 8월 20일댓글 수 로딩 중
[논문리뷰] ForgeWM: Progressive Causal Training for Few-Step Action-Conditioned Video World Models본 논문은 대화형 비디오 월드 모델에서 실시간성을 확보하기 위해 요구되는 소수 단계(Few-step) 생성과 게임 제어 정확도 유지 사이의 기술적 난제를 해결하고자 한다.#Review#Video World Models#Few-Step Generation#Causal Training#Action-Conditioning#Distribution Matching#Replay-Time Refinement2026년 8월 20일댓글 수 로딩 중