[논문리뷰] Poor Man's Agentic Modeling: Simulating Large LLM-Agent Societies on a Laptop본 논문은 대규모 LLM agent 사회를 시뮬레이션하는 데 발생하는 과도한 계산 비용 문제를 해결하기 위해, 저비용의 Surrogate 모델링 기법을 제안합니다.#Review#LLM multi-agent systems#agent-based modelling#mean-field theory#finite-size scaling#surrogate models#behavioural cloning#sociophysics2026년 8월 12일댓글 수 로딩 중
[논문리뷰] Persistent Recursive Worlds Enable Autonomous Software Evolution본 논문은 장기적인 소프트웨어 개발 과정에서 개별 agent의 수명이 시스템의 수명보다 짧음으로써 발생하는 '연속성 문제'를 해결하고자 합니다.#Review#Autonomous Software Evolution#Persistent Recursive Worlds#Recursive Delegation#LLM Agent#Software Engineering#Codebase Formation#Model-Agnostic2026년 8월 12일댓글 수 로딩 중
[논문리뷰] Parameter Exploration for RLVR via Variational Learning본 논문은 RLVR 환경에서 발생하는 정책의 정체(Stall)와 탐색의 한계를 해결하기 위해 파라미터 공간에서의 탐색 기법을 제안합니다.#Review#RLVR#Parameter-Space Exploration#Variational Learning#IVON#GRPO#LLM Alignment#Chunked Noising2026년 8월 12일댓글 수 로딩 중
[논문리뷰] OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution본 논문은 현대의 AI 에이전트가 단발성 작업이 아닌 장기적인(Long-horizon) 워크플로우에서 동작함에 따라 발생하는 누적된 안전성 위협을 규명하고자 합니다 .#Review#Agent Safety#Red Teaming#Environment Evolution#Long-Horizon#Markov Hypergraph#Robustness2026년 8월 12일댓글 수 로딩 중
[논문리뷰] NeuPAT: Neuron-aware Plasticity Allocation Tuning for Language-Preserving MLLMs본 논문은 MLLM으로의 확장 과정에서 발생하는 언어 성능 저하 문제를 해결하기 위해, 사전 학습된 LLM 내부의 뉴런 단위 적응 역학을 조사합니다 . 기존의 Vanilla Tuning 방식은 모델 전체를 균일하게 학습시켜, 언어 처리에 필수적인 뉴런의 기능까지 불필요하게 훼손하는 문제를 야기합니다 .#Review#Multimodal Large Language Models#Language Preservation#Plasticity Allocation#Neuron-level Adaptation#Instruction Tuning2026년 8월 12일댓글 수 로딩 중
[논문리뷰] Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence본 논문은 AI 모델의 지능적 역량과 잠재적 위험을 규명하는 기제적 이해(Mechanistic Understanding)가 모델의 발전 속도를 따라가지 못하는 격차 문제를 해결하고자 합니다.#Review#Mechanistic Interpretability#Agentic Framework#Belief-state Reasoning#Scientific Discovery#Causal Intervention#Subliminal Learning2026년 8월 12일댓글 수 로딩 중
[논문리뷰] MBA: Multimodal Benchmark and Agents for Real-World Business Ideation본 연구는 기존 비즈니스 아이디어 생성 연구들이 텍스트 데이터에만 의존하여 실세계의 다중 모달 맥락을 충분히 반영하지 못하는 한계를 해결하고자 합니다.#Review#Multimodal Business Ideation#Agentic AI#Benchmark#Reinforcement Learning#GRPO#SFT#MLLM-as-a-Judge2026년 8월 12일댓글 수 로딩 중
[논문리뷰] Hand Visibility Detector: Per-Keypoint Visibility Estimation for Hands본 논문은 기존 HPE 모델들이 관절 위치를 추정할 때 관절의 가시성(visibility)을 명시적으로 평가하지 않는 문제를 해결하고자 합니다. 대다수 기존 연구에서 visibility는 HPE 성능 향상을 위한 보조적 신호로만 사용될 뿐, 그 자체로 시스템적 연구가 이루어지지 않았습니다.#Review#Hand Pose Estimation#Visibility Estimation#Occlusion#Vision Transformers#Triangulation#Annotation#Keypoint2026년 8월 12일댓글 수 로딩 중
[논문리뷰] From Synthesis to Removal: Physics-Grounded Reflection Simulation and Diffusion-Based Video Dereflection본 논문은 유리창 너머 촬영된 비디오에서 반사를 제거하기 위한 체계적인 비디오 복원 프레임워크를 제안합니다. 기존 비디오 반사 제거 연구는 한 쌍의 데이터(Paired Data) 부족과 시간적 일관성(Temporal Coherence)을 확보할 수 있는 모델 설계의 어려움으로 인해 크게 발전하지 못했습니다.#Review#Video Dereflection#Diffusion Models#Physics-Grounded Simulation#Reflection Removal#Video Synthesis#Temporally Coherent2026년 8월 12일댓글 수 로딩 중
[논문리뷰] Can LLM Agents Stick to the Script? A Benchmark for Long-Horizon Consistency in Interactive Narratives본 논문은 최신 LLM 기반 Narrator Agent들이 유창한 스토리를 생성함에도 불구하고, 장기적인 이야기의 논리적 일관성과 제약 조건을 유지하는 데 심각한 취약성을 보인다는 문제를 제기한다.#Review#Interactive Narrative#Benchmark#Long-Horizon Consistency#Narrative Commitment Preservation#Large Language Models#AI for Games2026년 8월 12일댓글 수 로딩 중
[논문리뷰] AutoWorldModel-Bench: A State-Centric Benchmark for Automated World-Model Research본 논문은 world-model 연구 분야가 방대한 설계 공간(Design Space)을 가지고 있음에도 불구하고, 표준화된 평가 도구가 부족하여 연구의 진전이 어렵다는 문제를 해결하고자 한다.#Review#World-Model#Benchmark#Autonomous-Agent#Entity-Component-System#State-Centric#AI-Research2026년 8월 12일댓글 수 로딩 중
[논문리뷰] AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models본 논문은 기존 Reactive VLA 모델들이 단일 손목 카메라(wrist-mounted camera) 환경에서 겪는 치명적인 인식 및 추론의 한계를 해결하기 위해 제안되었습니다.#Review#Vision-Language-Action Models#Persistent World State Memory#Ego-Working Memory#Embodied AI#Long-horizon Manipulation#Diffusion Transformer#Wrist-camera2026년 8월 12일댓글 수 로딩 중
[논문리뷰] Agent Safety Should Be a Runtime Contract본 논문은 AI 에이전트의 안전성을 모델 학습(RLHF, DPO 등)만으로 확보하려는 기존의 관행이 구조적으로 불충분함을 지적합니다.#Review#Agent Safety#Runtime Contract#Preventive Mechanism#Evidential Mechanism#Evidence-gated Submission#Trajectory Schema#Defense-in-depth2026년 8월 12일댓글 수 로딩 중
[논문리뷰] AVA-Encoder: Towards Agent-Native Video Representation Learning본 논문은 기존의 비디오 표현 방식이 에이전트의 복잡한 추론 및 수정 작업에 부적합하다는 문제 의식에서 출발합니다. 기존의 저수준(Pixel/Latent) 표현은 에이전트가 직접 해석하거나 수정하기 어렵고, 텍스트 캡션 기반의 표현은 영화 제작에 필요한 풍부한 구조적 정보를 상실하기 쉽습니다.#Review#Agentic Video Encoder#Knowledge Graph#Video Representation Learning#Textual-Gradient#Self-Evolution#Multimodal Reconstruction2026년 8월 12일댓글 수 로딩 중
[논문리뷰] AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses본 연구는 모델의 내재적 능력을 향상시키는 기존의 데이터 증류(Data Distillation) 방식이 아닌, 모델이 직면한 과제의 복잡성을 제어하여 추론 성능을 개선하는 새로운 접근 방식을 제안합니다.#Review#Strong-to-Weak Scaffolding#Inference-Time Harness#Test-Time Compute#Model Distillation#Theory-of-Mind#Automated Agentic Systems2026년 8월 12일댓글 수 로딩 중
[논문리뷰] iFAN: Inference-Aware Learning for Plain Mask Transformers본 논문은 현대의 query-based mask transformer가 가진 추론 과정의 불일치 문제를 해결하기 위해 iFAN(Inference-Aware Learning)을 제안합니다 .#Review#Mask Transformers#Inference-Aware Learning#Query-based Segmentation#APMR#CLSD#Self-Distillation#Computer Vision2026년 8월 11일댓글 수 로딩 중
[논문리뷰] VibeLifeBench: Can Your Life Agent Be Proactive and Persistent in a Living World?본 논문은 기존의 AI 에이전트 평가 벤치마크들이 대부분 정적이고 단기적인 과업에 치중되어 있어, 실제 일상생활의 복잡성을 제대로 측정하지 못한다는 문제를 제기합니다 .#Review#Agent Evaluation#Long-Horizon#Proactivity#Living World#Benchmarking#LLM#Task Planning2026년 8월 11일댓글 수 로딩 중
[논문리뷰] UniMoMo: Expert Merging-Based MoE Acceleration for Large Recommendation Models본 논문은 대규모 추천 모델을 위한 Sparse MoE가 학습된 이후, 실제 배포 단계에서 요구되는 제한된 자원(Expert Budget)에 맞춰 체크포인트를 효율적으로 축소하는 문제인 Expert-budgeted deployment를 해결한다.#Review#Recommender Systems#Mixture of Experts#Model Compression#Expert Merging#Adaptive Routing2026년 8월 11일댓글 수 로딩 중
[논문리뷰] TSDS-Toolbox: A Toolbox for Measuring Time-Series Dataset Similarity본 논문은 시계열 데이터 분석 및 Foundation Model 개발의 급격한 발전에도 불구하고, 연구자들이 활용할 수 있는 표준화된 데이터셋 유사도 측정 도구가 부족하다는 점을 해결하고자 합니다. 기존의 연구들은 유사도 지표를 서로 다른 실험 환경에서 평가하여 재현성과 비교 가능성이 낮은 파편화된 상태에 놓여 있습니다.#Review#Time-series dataset similarity#Benchmarking framework#Similarity metrics#Transfer learning#Foundation models#Downstream evaluation2026년 8월 11일댓글 수 로딩 중
[논문리뷰] SkillZip: Evaluation-Free Skill Compression for Self-Evolving Agents by Discovering Reusable Structure본 논문은 에이전트가 학습을 거듭할수록 Skill이 불필요하게 비대해지는 textual growth 문제를 해결하고자 합니다.#Review#Agent#Skill Compression#Self-Evolving#Minimum Description Length#Prompt Engineering#Typed Contract2026년 8월 11일댓글 수 로딩 중