[논문리뷰] FoldingAgent: Inferring Parametric Origami Procedures from Demonstration Videos본 논문은 인간의 직관적인 종이 접기 비디오와 기계 해석을 위한 구조적 표현 사이의 근본적인 의미론적 격차(Semantic gap)를 해소하기 위해 제안되었다. 기존 연구들은 주로 정적인 Crease Pattern을 입력으로 요구하지만, 실제 사용자들은 주로 비구조적인 비디오 데모를 통해 지식을 공유한다.#Review#Origami#Vision-Language Model#Agentic Framework#Procedural Inference#PurelandFold#Parametric Representation#Physical Simulation2026년 9월 2일댓글 수 로딩 중
[논문리뷰] Exploring Collaboration between a language and a non-language agent본 연구는 Large Language Models (LLMs)가 전문 서브에이전트들을 조율하여 복잡한 태스크를 해결하는 오케스트레이터(orchestrator)로 활발히 활용되고 있지만, 게임 플레이나 로봇 공학 등 여러 중요한 영역에서 가장 강력한 에이전트들은 language models가 아니라는 근본적인 문제 의식에서 출발합니다.#Review#LLMs#Non-language Agents#Collaboration#Verbalization Debt#Latent State Internalization#Chess#Reinforcement Learning#LLAMIA-Bench2026년 9월 2일댓글 수 로딩 중
[논문리뷰] ExecRetrieval: Measuring the Functional-Correctness Gap in Code-Embedding Retrieval기존 코드 Retrieval 벤치마크들은 Lexical 또는 Topical Similarity에 중점을 두어, 코드 임베딩 모델이 기능적으로 올바른 코드와 미묘하게 버그가 있는 코드를 구별하는 능력을 측정하지 못하는 문제를 안고 있습니다.#Review#Code Retrieval#Code Embeddings#Functional Correctness#Code Benchmarking#Buggy Variants#Execution-based Evaluation#LLM Generation2026년 9월 2일댓글 수 로딩 중
[논문리뷰] EarlyEval: Cheaper Agent Evaluation via Early Outcome Prediction본 논문은 LLM 에이전트 평가 비용이 기하급수적으로 증가하는 문제를 해결하기 위해 고안되었습니다. 기존의 벤치마크 평가 방식은 복잡한 다단계 에이전트 실행을 필요로 하여, 단일 개발 주기당 수백에서 수천 달러에 달하는 높은 컴퓨팅 비용을 발생시킵니다 .#Review#LLM Agents#Evaluation Efficiency#Early Outcome Prediction#Benchmark Distillation#LightGBM2026년 9월 2일댓글 수 로딩 중
[논문리뷰] Debias-SparseGPT: Bias-Aware Pruning for Large Language Models본 연구는 LLM 압축 기술인 Pruning이 모델의 연산 효율성을 높이지만, 이 과정에서 모델 내부에 존재하는 인구통계학적 편향을 심화시키는 부작용을 해결하고자 한다.#Review#Large Language Models#Model Compression#Pruning#Debiasing#Hessian#SparseGPT#Fairness2026년 9월 2일댓글 수 로딩 중
[논문리뷰] Cliff: Learning Process Rewards from the First Mistake본 논문은 기존 RLVR 방식이 최종 결과만을 평가하는 coarse-grained 보상 체계를 사용하여 중간 추론 과정에 대한 충분한 학습 지침을 제공하지 못한다는 문제점을 해결하고자 합니다.#Review#Reinforcement Learning#LLM Post-training#Process Supervision#Reward Shaping#Reasoning#Credit Assignment2026년 9월 2일댓글 수 로딩 중
[논문리뷰] CRISP: Cliff-awaRe Input-adaptive Sparse Prefilling with Structural-Mass-Motivated Routing본 논문은 long-context LLM의 prefilling 단계에서 발생하는 이차 시간 복잡도(Quadratic Scaling) 문제를 해결하기 위한 동적 희소 어텐션(Dynamic Sparse Attention) 기법의 구조적 한계를 다룹니다.#Review#Long-Context LLM#Sparse Attention#Dynamic Routing#Mass Cliff#Prefilling#Structural-Mass Proxy#Sink-Aware Thresholding2026년 9월 2일댓글 수 로딩 중
[논문리뷰] Beyond Visual Similarity: Entity-Aligned Retrieval for Knowledge-Based Visual Question Answering본 연구는 기존 KB-VQA 파이프라인에서 사용하는 CLIP 스타일의 듀얼 인코더가 지닌 표면적 시각적 유사성(surface-level visual similarity) 기반 검색의 한계를 해결하고자 합니다.#Review#Knowledge-Based VQA#Retrieval Augmented Generation#Multimodal Large Language Models#Entity-Aligned Retrieval#Semantic Distillation#Hard Negative Sampling2026년 9월 2일댓글 수 로딩 중
[논문리뷰] Autoregressive Mosaics: Probing 2D Spatial Reasoning in Text-Only Language Models본 논문은 텍스트 전용(Text-only) LLM이 생성하는 이미지가 진정한 2D 공간 추론을 반영하는지, 아니면 단순한 코드 변환 능력에 의존하는지를 규명하고자 한다. 기존 연구들은 모델의 최종 생성물만을 평가함으로써 공간 구성 능력과 코드 생성 능력을 분리하지 못한다는 한계를 가진다 .#Review#Spatial Reasoning#Autoregressive Models#AM-Bench#LLM#Representation Probing#Code Generation#Mosaic2026년 9월 2일댓글 수 로딩 중
[논문리뷰] Aspire: Can Models Self-Evolve from Vague Goals?본 논문은 LLM의 자가 진화(Self-evolution) 과정에서 Vague Goal로부터 목표를 구체화하고 진정한 역량 향상을 달성하는 문제를 해결하고자 합니다.#Review#Self-Evolution#LLM#Vague Goals#Autonomous Post-training#Goal Operationalization#Agent Harness#Benchmark2026년 9월 2일댓글 수 로딩 중
[논문리뷰] A Glance Is All You Need: Single-Pass Fine-Grained Image Captioning with SimLoss본 연구는 고수준의 캡셔닝 모델이 유창한 텍스트를 생성함에도 불구하고, 정작 이미지의 속성, 질감, 수량, 공간적 관계 등 세밀한 세부 정보를 놓치는 현상을 해결하고자 합니다.#Review#Fine-Grained Image Captioning#SimLoss#Contrastive Objective#Single-Pass Inference#Embedding-Space Supervision#Vision-Language Models#Latency2026년 9월 2일댓글 수 로딩 중
[flashinfer] FlashInfer의 NVFP4 KV 캐시 성능 최적화: FP4 연산의 병목 현상 해소FlashInfer의 NVFP4 KV 캐시 연산에서 발생하는 심각한 성능 병목 현상을 분석하고, CUDA 하드웨어 기능을 활용하여 최적화하는 방법을 기술합니다.#CUDA#GPU#Performance Optimization#FlashInfer#FP4#NVFP4#KV Cache2026년 9월 1일댓글 수 로딩 중
[onnxruntime] ONNX Runtime의 CPU int4 가중치 프리패킹 최적화: 병렬 처리 효율성 개선ONNX Runtime에서 int4 양자화 모델 로딩 시 CPU 프리패킹 병렬화를 개선하여 세션 생성 속도를 약 25% 향상시켰습니다.#ONNX Runtime#Performance Optimization#CPU#Quantization#Parallelization2026년 9월 1일댓글 수 로딩 중
[cpython] CPython `PyFloat_Pack/Unpack2` 최적화: 네이티브 `_Float16` 활용으로 성능 향상CPython의 `double`과 `_Float16` 변환 함수가 네이티브 `_Float16` 지원으로 최적화되었습니다.#Python#CPython#Optimization#CAPI#Float16#Performance2026년 9월 1일댓글 수 로딩 중
[flashinfer] FlashInfer에 cuTile 기반 Fused MoE 백엔드 도입: 성능과 유지보수성의 균형FlashInfer의 Unified MoE API에 cuTile 백엔드를 추가하여 BF16 및 NVFP4 환경에서 최적화된 MoE 추론을 지원합니다.#FlashInfer#MoE#CUDA#Optimization#LLM2026년 9월 1일댓글 수 로딩 중
[ray] Ray RDT NIXL 메모리 풀 최적화: 불필요한 복사 제거와 전송 효율 극대화Ray의 RDT NIXL 메모리 풀 개선을 통해 텐서 뷰 복사 비용을 줄이고, 전송 디스크립터 병합으로 대규모 텐서 전송 성능을 100배 향상시킨 사례를 분석합니다.#Ray#PyTorch#Memory Management#Performance Optimization#Distributed Computing2026년 9월 1일댓글 수 로딩 중
[논문리뷰] ZimaBlue: Evolving Generalizable World Action Models through Scalable Video Pre-training본 연구는 로봇 학습의 핵심 병목인 '확장 가능한 embodied 경험의 부족'을 해결하고자 합니다.#Review#World Action Models#Scalable Video Pre-training#Embodied AI#Dual-System Architecture#Zero-Shot Generalization#Robotics2026년 9월 1일댓글 수 로딩 중
[논문리뷰] Uncovering Understanding-Generation Synergy in Native Unified Multimodal Models: From Representation, Task to System본 논문은 통합 멀티모달 모델(UMM) 내에서 이해와 생성이라는 두 기능이 공존할 때 발생하는 상호작용의 실체를 규명하고자 한다. 기존 모델들은 두 기능을 통합하여 제공하지만, 이러한 기능적 통합이 반드시 내재적 학습 시너지로 이어지는지는 불분명하며 때로는 컴퓨팅 자원이나 표현 공간을 두고 경쟁하거나 충돌하기도 한다.#Review#Unified Multimodal Models#Native Multimodal#Understanding-Generation Synergy#Task-decoupled MoT#Parameter Sharing#Spatial Intelligence#Representation Learning2026년 9월 1일댓글 수 로딩 중
[논문리뷰] UI-Venus-2 Technical Report본 논문은 기존 GUI 에이전트가 벤치마크 점수 향상에는 성공했으나, 실제 환경에서의 신뢰성(Dependability)과 범용성(Generalization) 측면에서 여전히 한계를 가지고 있다는 점을 지적합니다 .#Review#GUI Agents#Multimodal Foundation Models#Reinforcement Learning#System Scalability#Trajectory Verification#Computer Use2026년 9월 1일댓글 수 로딩 중
[논문리뷰] The Mechanics of Democratic Dominance: A System Dynamics Paradigm for Dynamic Consent Engineering본 논문은 기존의 정치적 커뮤니케이션 분석이 선형적이고 사건 중심적인 모델에 의존하여 시스템적 피드백과 지연(Delay)을 간과하고 있다는 문제를 제기합니다. 이러한 정적 접근은 정치 조직이 유권자의 피로도, 정치적 변동성, 기관 신뢰도 저하를 예측하고 대응하는 데 한계를 갖게 합니다 .#Review#Dynamic Democratic Consent#System Dynamics#Political Communication#S-E-E-D Framework#Feedback Loops#Institutional Trust#4M Paradigm2026년 9월 1일댓글 수 로딩 중