[논문리뷰] FRAUDSkill: Structured Frozen-Weight Skill Optimization for Audio Anti-Fraud Detection본 논문은 대규모 오디오-언어 모델을 활용한 오디오 anti-fraud 시스템이 실무 환경의 Predefined Label Ontology 및 Decision Protocol과 충돌하는 문제를 해결하고자 한다.#Review#Audio Anti-Fraud#Frozen-Weight Adaptation#Skill Optimization#Structured Prediction#Multi-path Inference2026년 9월 20일댓글 수 로딩 중
[논문리뷰] EvoOntology: A Self-Evolving Ontology Layer for Data Agents데이터 에이전트가 다양한 이기종 데이터 소스를 처리해야 함에 따라, 에이전트와 데이터 간의 심각한 Agent–Data Gap 문제가 발생하고 있습니다 . 기존의 방식은 에이전트가 원시 데이터를 무작위로 탐색하거나, 정적인 시맨틱 정보를 컨텍스트에 삽입하는 데 의존합니다.#Review#Data Agents#Ontology Layer#Model Context Protocol#Self-Evolving#Agent-Data Gap#Evidence-Grounded#Semantic Layer2026년 9월 20일댓글 수 로딩 중
[논문리뷰] Designer-RSI: Evolving Procedural Memory from User Traffic for Agentic Graphic Design본 논문은 전문적인 그래픽 디자인 에이전트가 겪는 장기적 작업(Long-horizon)의 복잡성과 결과물의 불명확한 성공 기준 문제를 해결하기 위해, 고정된 모델 가중치(Frozen foundation model)를 유지하면서 외부적인 절차적 기억을 지속적으로 진화시키는 프레임워크를 제안한다.#Review#Agentic Graphic Design#Procedural Memory#Continual Adaptation#Skill Evolution#User Traffic#Foundation Models#Replay Gate2026년 9월 20일댓글 수 로딩 중
[논문리뷰] DeformSmith: Physics Harness-Guided Hierarchical Generation of Deformable Assets for Robot Manipulation본 논문은 텍스트나 단일 이미지로부터 로봇 조작에 적합한 물리적으로 신뢰할 수 있는 Deformable Assets를 자동 생성하는 문제를 해결합니다.#Review#Deformable Assets#Robot Manipulation#Physics-Grounded Harness#Hierarchical Agentic Construction#Material Point Method#Simulation Feedback2026년 9월 20일댓글 수 로딩 중
[논문리뷰] CodeMidas: Scaling Agentic Coding RL Environments from Code Itself본 논문은 기존의 코딩 에이전트 학습 데이터가 이슈 리포트, 커밋, 혹은 특정 테스트 케이스와 같은 개발 아티팩트에 지나치게 의존하여 학습 태스크 확장에 한계가 있다는 문제를 해결하고자 한다.#Review#Agentic Coding#Reinforcement Learning#Codebase Adaptation#Execution-grounded Testing#Environment Scaling#Self-verification2026년 9월 20일댓글 수 로딩 중
[논문리뷰] Calibrating Teacher--Student Discrepancy for On-Policy Distillation본 연구는 On-Policy Distillation에서 교사와 학생 간의 discrepancy가 교사 모델 자체의 변동성인 TSD를 포함하고 있어 효율적인 학습을 방해한다는 점을 문제로 제기합니다 .#Review#Knowledge Distillation#On-Policy Distillation#Teacher Self-Deviation#Calibration#Mathematical Reasoning#Privileged Information2026년 9월 20일댓글 수 로딩 중
[논문리뷰] CADWorld: Computer-Use Benchmark for Long-Horizon Computer-Aided Design본 논문은 일반적인 GUI 작업에 특화된 기존 Computer-Use Benchmark들이 기계공학 분야의 전문적인 CAD 워크로드를 충분히 다루지 못한다는 문제의식에서 출발합니다.#Review#Computer-Use Agents#CADWorld#Mechanical-CAD#Artifact-Grounded Evaluation#Long-Horizon#GUI Interaction2026년 9월 20일댓글 수 로딩 중
[논문리뷰] BI-Agent and BI-Bench: Towards Automating End-to-End Business Intelligence본 논문은 현대 엔터프라이즈의 핵심 의사결정 수단인 BI 워크로드가 데이터 준비 단계의 복잡성으로 인해 자동화하기 어렵다는 문제를 해결하고자 합니다.#Review#Business Intelligence#LLM Agents#Data Management#End-to-End Analysis#Benchmarking#Post-training2026년 9월 20일댓글 수 로딩 중
[논문리뷰] APort Vault: Benchmarking AI Agent Payment Authorization with the Open Agent Passport본 논문은 기존의 LLM 안전성 벤치마크가 대부분 '모델의 거부 여부'에만 초점을 맞추어, 실제 배포 환경에서의 잔여 위험(Residual Risk)을 적절히 측정하지 못한다는 한계를 지적합니다.#Review#AI Agents#Payment Authorization#Open Agent Passport#Adversarial Benchmarking#Tool-using Agents#LLM Security2026년 9월 20일댓글 수 로딩 중
[논문리뷰] When2Think: Learning Difficulty-Aware Length Control for Efficient Hybrid Reasoning Models본 논문은 대형 추론 모델(LRMs)에서 발생하는 인지적 불균형인 Overthinking과 Underthinking 문제를 해결하고자 합니다.#Review#Hybrid Reasoning#Instance-Adaptive Computation#Reinforcement Learning#Reasoning Depth Control#Efficiency Tax#Large Reasoning Models (LRMs)2026년 9월 17일댓글 수 로딩 중
[논문리뷰] When EOS Tokens Disagree: Understanding Length Inflation in On-Policy Distillation본 논문은 On-policy distillation 과정에서 발생하는 심각한 Length Inflation 현상의 원인을 규명하고 이를 완화하는 것을 목표로 합니다 .#Review#On-Policy Distillation#Length Inflation#Termination-Token Mismatch#Semantic EOS Aggregation#LLM Post-training#Generation Pathology2026년 9월 17일댓글 수 로딩 중
[논문리뷰] What Does Privileged Information Add to On-Policy Self-Distillation?본 연구는 OPSD 과정에서 Teacher에게 제공되는 Privileged Information이 실제로 distillation 그 이상의 추가적인 학습 이득을 제공하는지, 그 기여도를 명확히 분리하고자 합니다.#Review#On-policy Self-distillation#Privileged Information#Language Model#Reasoning#AMPLE-Math#Knowledge Distillation#Training Dynamics2026년 9월 17일댓글 수 로딩 중
[논문리뷰] WeVisDoc: From Coverage to Capability for Robust End-to-End Document Parsing본 논문은 기존 document parser들이 방대한 데이터에도 불구하고 여전히 다양한 문서 레이아웃과 열화(Degradation) 조건에서 구조적, 의미적 오류를 범한다는 문제점을 해결하고자 합니다 .#Review#Document Parsing#End-to-End#Data-Centric Framework#Model-Aware Refinement#Visual-Structural Degradation#Supervised Training#OmniDocBench2026년 9월 17일댓글 수 로딩 중
[논문리뷰] VākQA: A Benchmark and Evaluation Study for Telugu Spoken Factoid Question Answering본 연구는 텔루구어 Spoken Question Answering (SQA) 분야의 벤치마크 부재와 자동 평가의 신뢰성 문제를 해결하고자 합니다. 기존 Question Answering (QA) 연구는 주로 영어와 같은 고자원 언어에 집중되어 있으며, 텔루구어 SQA 벤치마크는 거의 탐색되지 않았습니다.#Review#Spoken Question Answering#Telugu#Low-resource Languages#Benchmark#LLM-as-a-judge2026년 9월 17일댓글 수 로딩 중
[논문리뷰] Video DeltaNet: A Video-Native Hybrid Attention for Livestream Video Generation본 논문은 긴 시공간 토큰 시퀀스를 처리하는 비디오 생성 모델에서 Softmax attention이 차지하는 높은 연산 비용 문제를 해결하고자 합니다. 기존의 Dense Softmax는 시퀀스 길이에 따라 연산량이 이차함수적으로 증가하여 대규모 비디오 생성을 저해하는 주요 병목이 됩니다.#Review#Video Generation#Hybrid Attention#Linear Attention#Delta Rule#Diffusion Transformers#Efficient Inference#Distillation2026년 9월 17일댓글 수 로딩 중
[논문리뷰] VABench: Measuring Embodied Spatial Intelligence through Visual Demonstrations, Active Perception, and Metric Control기존 연구들은 공간 추론(spatial reasoning), 조작 실행(manipulation execution), 또는 능동적 지각(active perception)을 개별적으로 평가하는 경향이 있었지만, 실제 Embodied AI 에이전트는 이 모든 능력을 통합하여 observe–reason–act–revise 루프를 닫아야 한다.#Review#Embodied AI#Spatial Intelligence#MLLMs#Robot Manipulation#Active Perception#Benchmarking#Metric Control#Demonstration Learning2026년 9월 17일댓글 수 로딩 중
[논문리뷰] UFO: Chain-of-Evaluation for Omni-Condition Alignment in Multi-Modal Image Generation본 논문은 기존의 멀티모달 이미지 생성 모델 평가 방식이 모델의 실제 성능과 인간의 판단을 제대로 반영하지 못하는 'isolated evaluation'의 한계에 봉착했음을 지적합니다.#Review#Multi-modal Image Generation#Subject-driven Customization#Evaluation Metric#Chain-of-Evaluation#Atomic Evaluation Units (AEUs)#Omni-condition Alignment2026년 9월 17일댓글 수 로딩 중
[논문리뷰] Srijika: OpenType-Layout-Reusing Font Restyling for Nine Indic Scripts본 논문은 9개의 Brahmic scripts(Devanagari, Tamil, Bengali 등)를 대상으로 설치 가능한 OpenType 폰트를 생성하는 시스템인 Srijika를 제안한다.#Review#Brahmic Scripts#Font Restyling#OpenType#Glyph Diffusion#Template Replacement2026년 9월 17일댓글 수 로딩 중
[논문리뷰] SoL-Pi: Recursively Scaling Auto-Research Loops for Efficient Agent Harness본 논문은 장시간 실행되는 에이전트 환경에서 발생하는 과도한 토큰 소모와 비효율적인 시스템 설계 문제를 해결하기 위해 SoL-Pi를 제안합니다. 기존 에이전트 harness는 복잡한 도구 사용과 긴 컨텍스트로 인해 토큰 비용이 급증하는 경향이 있으나, 이를 수동으로 최적화하는 과정은 막대한 인간의 노력을 요구합니다.#Review#Auto-Research#Token Efficiency#Agent Harness#Recursive Self-Improvement#Agent Swarms#Context Management2026년 9월 17일댓글 수 로딩 중
[논문리뷰] Sample Count Is Not Enough: Candidate-Generation Strategy Shapes the Energy and Performance of LLM Test-Time Scaling본 논문은 LLM의 Test-Time Scaling 연구에서 흔히 사용하는 Candidate Count ($N$) 만으로는 추론의 실제 시스템 비용을 충분히 설명할 수 없다는 문제를 제기합니다.#Review#Test-Time Scaling#Candidate-Generation#LLM Inference#GPU Energy#Inference Efficiency2026년 9월 17일댓글 수 로딩 중