[논문리뷰] Towards Faithful Simulation of Human Shopping Behavior본 논문은 e-commerce 환경에서 인간의 쇼핑 행동을 충실하게 모사(Faithful Simulation)하는 Agent를 구축하는 데 있어 발생하는 두 가지 핵심 난제를 해결하고자 합니다.#Review#User Simulation#GUI Agents#Recommender Systems#Reinforcement Learning#Memory System#Human-Computer Interaction2026년 8월 23일댓글 수 로딩 중
[논문리뷰] ParaTempo: Efficient Parallel Reasoning via Temporal Confidence본 논문은 대규모 추론 모델(Large Reasoning Models)의 Parallel Reasoning 과정에서 발생하는 과도한 컴퓨팅 비용과 고정된 자원 할당 문제를 해결하고자 합니다.#Review#Parallel Reasoning#Temporal Confidence#Test-Time Scaling#Asynchronous Branch Control#Inference Efficiency#Large Reasoning Models2026년 8월 23일댓글 수 로딩 중
[논문리뷰] OmniAssistBench: Assistant-style Interaction Benchmark for Omni-LLMs본 논문은 기존의 수동적인 비디오 이해 평가 방식이 실시간 상호작용 환경에서의 Omni-LLMs 성능을 측정하는 데 한계가 있음을 지적합니다. 기존 벤치마크는 정적 데이터를 활용하지만, 실제 인터랙티브 어시스턴트는 모델의 응답이 사용자의 후속 행동을 변화시키는 동적 상호작용을 수행해야 합니다 .#Review#Omni-LLMs#Video Assistant#Benchmark#Interaction Path#Multi-modal#Action Recognition#Long-term Memory2026년 8월 23일댓글 수 로딩 중
[논문리뷰] Llama-Mobile: Efficient 2.7-Bit Quantization of VLMs본 논문은 VLM을 모바일 및 자원 제약 환경에 배포할 때 발생하는 막대한 메모리 및 컴퓨팅 자원 요구 문제를 해결하고자 합니다.#Review#Vision-Language Models#Quantization-Aware Training#Model Compression#Numerical Formats#Mobile Inference#Arm CPU2026년 8월 23일댓글 수 로딩 중
[논문리뷰] Let's Scale Step by Step: Compute-Efficient Hyperparameter Transfer for Large-Scale Mixture-of-Experts본 논문은 대규모 MoE 모델 훈련 시 필수적인 하이퍼파라미터, 특히 Learning Rate 최적화의 높은 비용과 복잡성 문제를 해결합니다. 기존의 2D 하이퍼파라미터 스윕(모델 규모 및 토큰 수 탐색)은 모델이 커질수록 계산 비용이 기하급수적으로 증가하여 실행 불가능한 수준입니다 .#Review#Mixture-of-Experts#Hyperparameter Transfer#Maximal Update Parameterization#Scaling Laws#Foundation Model2026년 8월 23일댓글 수 로딩 중
[논문리뷰] InfinityEdit: Infinite Video Editing with a Lightweight Edit-Ignition Adapter본 논문은 기존의 고정된 프레임 범위에서만 작동하는 in-place 편집 방식의 한계를 극복하고, 개방형 스트리밍 환경에서 무제한으로 이어지는 비디오 편집을 수행하는 Infinite Video Editing을 제안합니다.#Review#Infinite Video Editing#Streaming Video Generation#Edit-Ignition Adapter#Diffusion Transformer#Flow-Matching#Temporal Consistency2026년 8월 23일댓글 수 로딩 중
[논문리뷰] Human-Centric Intelligence in the Era of Foundation Models: A Survey본 논문은 Foundation Model 시대에 분산되어 있는 인간 중심 지능(Human-Centric Intelligence) 연구들을 통합적인 관점에서 체계화하고자 합니다.#Review#Foundation Models#Human-Centric Intelligence#Human Context Taxonomy#Embodied Agency#Visual Appearance#Spatial Geometry#Interaction Modeling2026년 8월 23일댓글 수 로딩 중
[논문리뷰] Hadith computational science in the age of large language models: a critical narrative review본 논문은 급변하는 Transformer 및 LLM 시대에 Hadith 계산 과학(Hadith computational science)의 현주소를 비판적으로 재검토하고자 한다.#Review#hadith computation#hadith NLP#large language models#Islamic scholarship#expert-in-the-loop AI#narrative review2026년 8월 23일댓글 수 로딩 중
[논문리뷰] Graph Engineering in the Era of LLM Agents: From Individual Intelligence to System Intelligence본 논문은 LLM 기반 에이전트가 단일 개체의 한계를 넘어 복잡한 시스템 수준의 과업을 수행할 수 있도록 지원하는 새로운 패러다임인 Graph Engineering을 제안한다.#Review#LLM Agents#System Intelligence#Graph Engineering#Task Organization#Agent Coordination#Runtime State Management#Individual Intelligence2026년 8월 23일댓글 수 로딩 중
[논문리뷰] FlavourBench: Ranking Frontier Language Models with Executable Culinary Ground Truth본 논문은 기존의 언어 모델 평가가 모델 judge나 인간의 주관적 선호도에 의존하여 발생하는 불투명성과 비일관성 문제를 해결하기 위해 FlavourBench를 제안한다.#Review#Language Model Benchmark#Culinary Ground Truth#Executable Evaluation#Frontier LLMs#Common-core Evaluation#Statistical Inference2026년 8월 23일댓글 수 로딩 중
[논문리뷰] EviRank: Structured Relevance Evidence for Multimodal Image Re-ranking본 논문은 기존 멀티모달 re-ranker들이 쿼리의 복합적이고 세밀한 의미론적 제약 조건을 충분히 처리하지 못하는 문제를 해결하고자 합니다.#Review#Multimodal Retrieval#Image Re-ranking#Evidence-Conditioned Verification#Semantic Constraint Satisfaction#Knowledge Distillation#Chain-of-Thought2026년 8월 23일댓글 수 로딩 중
[논문리뷰] Every Coin Has Two Sides: On the Dual Nature of Generalization in On-Policy Distillation of Large Language Models본 논문은 On-Policy Distillation (OPD)의 Generalization 행동이 현재 잘 이해되지 않고 있다는 문제의식에서 출발합니다.#Review#On-Policy Distillation (OPD)#Multi-Teacher OPD (MOPD)#Generalization#Model Origin#Cross-Domain Transfer#Reasoning Behavior#Seesaw Effect2026년 8월 23일댓글 수 로딩 중
[논문리뷰] Daedalus-150M: A Convolution-Attention Hybrid Designed for CPU Inference본 논문은 GPU용으로 설계된 거대 모델을 단순히 경량화하여 CPU에 적용하는 방식의 비효율성을 해결하고자 합니다.#Review#CPU Inference#Language Models#Hybrid Architecture#Memory Bandwidth#Quantization#Convolution#Attention#Efficiency2026년 8월 23일댓글 수 로딩 중
[논문리뷰] CLEAR: Continuous Latent Adapter Routing for Utility-Preserving LLM Safety Alignment본 논문은 LLM의 안전 정렬 시 발생하는 Alignment Tax 문제를 해결하기 위해, 입력을 조건부로 처리하는 새로운 프레임워크를 제안합니다.#Review#LLM Alignment#Safety-Utility Trade-off#Parameter-Efficient Fine-Tuning#LoRA#Latent Routing#Adversarial Robustness2026년 8월 23일댓글 수 로딩 중
[논문리뷰] Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs본 논문은 현대의 Hybrid-Thinking MLLM 인터페이스에서 발생하는 모드별 응답 품질의 불균형 문제를 해결하는 것을 목표로 합니다.#Review#Hybrid-Thinking#MLLMs#Response-Pattern Alignment#PatternEval#PatternRM#PatternRL#Chain-of-Thought Leakage2026년 8월 23일댓글 수 로딩 중
[논문리뷰] AgentMercury: Your Agent Can Synthesize Verifiable Environments for Business Scenarios at scale본 논문은 기존 에이전트 연구가 태스크 중심으로 환경을 구성함에 따라, 현실적인 워크플로우를 반영한 다양한 환경으로 확장이 어렵다는 근본적인 문제를 해결하고자 합니다 .#Review#AgentMercury#Executable Environments#Reinforcement Learning#Scenario-grounded#World Construction#Policy Optimization#Business Workflows2026년 8월 23일댓글 수 로딩 중
[openclaw] OpenConnect Gateway 성능 최적화: 연결 ID 기반 인덱싱 도입OpenConnect Gateway의 WebSocket 통신 성능을 개선하기 위해 연결 ID 기반 인덱싱을 도입한 PR 분석.#performance#optimization#backend#websocket#golang2026년 8월 23일댓글 수 로딩 중
[flashinfer] FlashInfer의 SM100/SM103 최적화: CAKE 기반 블록 희소 어텐션(VSA) 도입CAKE IR을 활용한 SM100/SM103 아키텍처용 고성능 블록 희소 어텐션(VSA) 커널 도입 및 성능 최적화 분석#FlashInfer#CUDA#Attention#Optimization#SM100#CAKE2026년 8월 23일댓글 수 로딩 중
[starlette] 신뢰할 수 있는 성능 측정을 위한 전략: Starlette의 벤치마크 안정화 기법PYTHONHASHSEED 고정과 전략적 Warmup을 통해 벤치마크의 노이즈를 제거하고 측정 정밀도를 높이는 방법을 분석합니다.#Python#Starlette#Benchmark#Optimization#CodSpeed2026년 8월 23일댓글 수 로딩 중
[starlette] 벤치마크 일관성 확보: glibc CPU Dispatch 최적화로 GitHub Actions Runner 분산 줄이기GitHub Actions 벤치마크의 일관성을 위해 glibc CPU dispatch를 AVX2로 고정하여 측정 분산을 줄이는 방법을 알아봅니다.#GitHub Actions#Benchmark#glibc#AVX512#AVX2#Performance Optimization#CI/CD2026년 8월 23일댓글 수 로딩 중