[논문리뷰] Graph Engineering in the Era of LLM Agents: From Individual Intelligence to System Intelligence본 논문은 LLM 기반 에이전트가 단일 개체의 한계를 넘어 복잡한 시스템 수준의 과업을 수행할 수 있도록 지원하는 새로운 패러다임인 Graph Engineering을 제안한다.#Review#LLM Agents#System Intelligence#Graph Engineering#Task Organization#Agent Coordination#Runtime State Management#Individual Intelligence2026년 8월 23일댓글 수 로딩 중
[논문리뷰] FlavourBench: Ranking Frontier Language Models with Executable Culinary Ground Truth본 논문은 기존의 언어 모델 평가가 모델 judge나 인간의 주관적 선호도에 의존하여 발생하는 불투명성과 비일관성 문제를 해결하기 위해 FlavourBench를 제안한다.#Review#Language Model Benchmark#Culinary Ground Truth#Executable Evaluation#Frontier LLMs#Common-core Evaluation#Statistical Inference2026년 8월 23일댓글 수 로딩 중
[논문리뷰] EviRank: Structured Relevance Evidence for Multimodal Image Re-ranking본 논문은 기존 멀티모달 re-ranker들이 쿼리의 복합적이고 세밀한 의미론적 제약 조건을 충분히 처리하지 못하는 문제를 해결하고자 합니다.#Review#Multimodal Retrieval#Image Re-ranking#Evidence-Conditioned Verification#Semantic Constraint Satisfaction#Knowledge Distillation#Chain-of-Thought2026년 8월 23일댓글 수 로딩 중
[논문리뷰] Every Coin Has Two Sides: On the Dual Nature of Generalization in On-Policy Distillation of Large Language Models본 논문은 On-Policy Distillation (OPD)의 Generalization 행동이 현재 잘 이해되지 않고 있다는 문제의식에서 출발합니다.#Review#On-Policy Distillation (OPD)#Multi-Teacher OPD (MOPD)#Generalization#Model Origin#Cross-Domain Transfer#Reasoning Behavior#Seesaw Effect2026년 8월 23일댓글 수 로딩 중
[논문리뷰] Daedalus-150M: A Convolution-Attention Hybrid Designed for CPU Inference본 논문은 GPU용으로 설계된 거대 모델을 단순히 경량화하여 CPU에 적용하는 방식의 비효율성을 해결하고자 합니다.#Review#CPU Inference#Language Models#Hybrid Architecture#Memory Bandwidth#Quantization#Convolution#Attention#Efficiency2026년 8월 23일댓글 수 로딩 중
[논문리뷰] CLEAR: Continuous Latent Adapter Routing for Utility-Preserving LLM Safety Alignment본 논문은 LLM의 안전 정렬 시 발생하는 Alignment Tax 문제를 해결하기 위해, 입력을 조건부로 처리하는 새로운 프레임워크를 제안합니다.#Review#LLM Alignment#Safety-Utility Trade-off#Parameter-Efficient Fine-Tuning#LoRA#Latent Routing#Adversarial Robustness2026년 8월 23일댓글 수 로딩 중
[논문리뷰] Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs본 논문은 현대의 Hybrid-Thinking MLLM 인터페이스에서 발생하는 모드별 응답 품질의 불균형 문제를 해결하는 것을 목표로 합니다.#Review#Hybrid-Thinking#MLLMs#Response-Pattern Alignment#PatternEval#PatternRM#PatternRL#Chain-of-Thought Leakage2026년 8월 23일댓글 수 로딩 중
[논문리뷰] AgentMercury: Your Agent Can Synthesize Verifiable Environments for Business Scenarios at scale본 논문은 기존 에이전트 연구가 태스크 중심으로 환경을 구성함에 따라, 현실적인 워크플로우를 반영한 다양한 환경으로 확장이 어렵다는 근본적인 문제를 해결하고자 합니다 .#Review#AgentMercury#Executable Environments#Reinforcement Learning#Scenario-grounded#World Construction#Policy Optimization#Business Workflows2026년 8월 23일댓글 수 로딩 중
[논문리뷰] WithEveryone: Unified Planning and Identity Grounding for Group Image Generation본 논문은 5~10명의 다수 인물이 포함된 그룹 이미지 생성 시 ID 보존 및 일관성이 크게 저하되는 문제를 해결하고자 한다. 기존 모델들은 인원수가 증가함에 따라 개별 ID 신호가 희석되거나, 복제된 얼굴(copy-paste) 오류, 혹은 ID 혼선 현상이 발생하는 한계가 있다.#Review#Group Image Generation#Identity-Preserving#Layout Planning#Multimodal Models#Representation Forcing#Flow Matching2026년 8월 20일댓글 수 로딩 중
[논문리뷰] Towards Quantifying Benchmark Optimization in ASR Models본 논문은 ASR(Automatic Speech Recognition) 모델이 공개 벤치마크에서 기록하는 높은 성능이 실제 세계의 일반적인 전사 능력과 괴리되어 있을 가능성을 제기한다.#Review#ASR#Benchmark Optimization#Mechanistic Interpretability#Generalization#Transcription Policy#Reference Disagreement2026년 8월 20일댓글 수 로딩 중
[논문리뷰] Thinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See본 연구는 저자원 언어(Low-resource language)에서 LLM의 추론 성능을 개선하기 위해 수행되는 SFT와 RL이 모델의 실제 추론 능력에 어떤 영향을 미치는지 규명하고자 한다.#Review#Low-Resource Language#Chain-of-Thought#Supervised Fine-Tuning (SFT)#Reinforcement Learning (RL)#Mixture-of-Experts (MoE)#Training Variance#Language Fidelity2026년 8월 20일댓글 수 로딩 중
[논문리뷰] SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn Interaction Feedback본 논문은 기존 LLM 기반 Agent가 상호작용 실패로부터 지속적으로 학습하지 못하는 한계점을 해결하고자 한다. 기존의 Single-turn 기반 평가 방식은 초기 단계의 결함만을 수정할 뿐, 이후 단계에서 발생하는 복합적인 결함을 식별하지 못해 진화 그래디언트가 쉽게 소멸하는 문제를 가진다 .#Review#Agent Skill#Multi-Turn Interaction#Self-Evolution#Trustworthy Feedback#Controllable Governance#Knowledge Evolution2026년 8월 20일댓글 수 로딩 중
[논문리뷰] SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?본 연구는 과학 소프트웨어의 결함이 단순한 프로그램 오류를 넘어 과학적 결론의 신뢰성 자체를 훼손할 수 있다는 문제의식에서 출발합니다.#Review#Scientific Software Engineering#Coding Agents#Benchmark#Repository-level#Fault Analysis#Chain-of-Evidence Protocol2026년 8월 20일댓글 수 로딩 중
[논문리뷰] Repo0: Design-Driven Zero-to-All Code Generation본 논문은 기존 Code Generation 모델들이 소프트웨어 아키텍처를 사전에 정의된 정적 아티팩트로 간주한다는 한계를 해결하고자 합니다. 기존 방식은 개발 도중 드러나는 아키텍처상의 결함(낮은 응집도, 과도한 결합 등)을 실시간으로 수정하지 못하여, 복잡한 프로젝트 구축 시 성능이 저하되는 문제가 발생합니다 .#Review#Code Generation#Software Engineering Agents#Repository Generation#Structural Evolution#Dual-DAG#Modularity Metrics#Test-Driven Development2026년 8월 20일댓글 수 로딩 중
[논문리뷰] PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents본 논문은 고객 서비스 LLM 에이전트가 비즈니스 정책을 준수하지 못하는 문제를 해결하기 위해 제안되었습니다.#Review#LLM Agents#Policy Compliance#Workflow Enforcement#Runtime Safeguards#Process Monitoring#Proactive Verifier2026년 8월 20일댓글 수 로딩 중
[논문리뷰] NARU: A Benchmark for NARrative Evolution and Cultural Nuance Understanding in Japanese Extreme Long Video본 논문은 기존의 비디오 벤치마크가 단순한 이벤트 인식이나 짧은 클립 이해에 국한되어 있어, 장시간 영상에서 발생하는 서사 진화와 고맥락 문화적 함의를 이해하는 데 한계가 있다는 문제를 지적합니다 .#Review#Long-form Video Understanding#Multimodal Large Language Models#Narrative Intelligence#Cultural Nuance Understanding#Benchmark#Japanese Media2026년 8월 20일댓글 수 로딩 중
[논문리뷰] MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use본 논문은 LLM의 메모리 활용 과정에서 발생하는 Cognitive Traps가 모델의 추론 및 성능을 왜곡하는 문제를 제기합니다 .#Review#Large Language Models#Memory Frameworks#Cognitive Traps#Reasoning Fixation#Belief Distortion#Benchmarking#AdaptiveMem2026년 8월 20일댓글 수 로딩 중
[논문리뷰] Listening Forward: Next Patch Embedding Prediction Enables Scalable Audio Learners본 논문은 오디오 표현 학습에서 사용되는 기존의 복잡한 SSL(Self-Supervised Learning) 방법론들이 가진 과도한 의존성 문제를 해결하고자 합니다.#Review#Self-Supervised Learning#Audio Representation Learning#Causal Transformer#Next-Patch-Embedding Prediction#Autoregressive#NAPE2026년 8월 20일댓글 수 로딩 중
[논문리뷰] Inject, Align, Recover: Staged Post-Training for Retrieval-Free Document Knowledge Internalization본 논문은 RAG(Retrieval-Augmented Generation)를 사용할 수 없는 환경에서 대규모 언어 모델이 특정 문서 정보를 Parametric Knowledge로 보유하도록 하는 '문서 지식 내재화' 문제를 다룬다.#Review#Document Knowledge Internalization#Retrieval-Free QA#Post-Training#Model Merging#Catastrophic Forgetting#Domain Adaptation2026년 8월 20일댓글 수 로딩 중
[논문리뷰] ForgeWM: Progressive Causal Training for Few-Step Action-Conditioned Video World Models본 논문은 대화형 비디오 월드 모델에서 실시간성을 확보하기 위해 요구되는 소수 단계(Few-step) 생성과 게임 제어 정확도 유지 사이의 기술적 난제를 해결하고자 한다.#Review#Video World Models#Few-Step Generation#Causal Training#Action-Conditioning#Distribution Matching#Replay-Time Refinement2026년 8월 20일댓글 수 로딩 중