[논문리뷰] StudentSim: Training LLM-based Student Simulators본 논문은 적응형 AI 튜터 개발을 위해 필수적인 '개인화된 학생 데이터'의 부족 문제를 해결하고자 합니다. 기존 연구의 한계점은 다음과 같습니다. 지식 추적 모델(Knowledge tracing)과 같은 상태 추적 모델은 학생의 행동을 예측할 수는 있으나, 튜터의 가이던스를 입력으로 받아들여 학습하는 기능이 부족합니다.#Review#Student Simulators#LLM#Educational AI#Reinforcement Learning#Behavioral Fidelity#Guidance Responsiveness#Individualized Simulation2026년 9월 1일댓글 수 로딩 중
[논문리뷰] Safin-1: Safety from Within through Memory-Native State Evolution본 논문은 장기적인 상호작용과 복잡한 작업을 수행하는 모델에서 안전성과 기억 유지가 분리되어 있는 기존 모델의 구조적 한계를 해결하고자 합니다.#Review#Foundation Models#Long-horizon Intelligence#Memory-Native State Evolution#Safety from Within#Recurrent Neural Networks#State-Space Models#MARCH2026년 9월 1일댓글 수 로딩 중
[논문리뷰] SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers본 연구는 Looped Transformer의 성능 향상이 아키텍처 자체의 우수성인지, 아니면 반복 실행으로 인해 증가한 FLOPs와 같은 추가 자원 때문인지 규명하고자 한다.#Review#Looped Transformers#Mixture-of-Experts#Scaling Laws#Compute-Matched#Effective Depth#Inductive Bias#Attention Sink2026년 9월 1일댓글 수 로딩 중
[논문리뷰] Recursive Criticality of AI Self-Improvement본 논문은 AI 시스템이 차세대 AI를 개발하는 R&D 과정에 참여함에 따라 발생하는 Recursive self-improvement(RSI)가 언제 자기 증폭(self-amplifying) 상태로 진입하는지를 규명하고자 합니다.#Review#Recursive AI self-improvement#Recursive criticality#Recursive reproduction number#Research frontier#AI R&D system#Feedback loop#Frontier hardening2026년 9월 1일댓글 수 로딩 중
[논문리뷰] ReFlowSET: Representation-Aligned Latent Flow Matching for SAR-to-EO Image Translation본 논문은 기존의 SAR-to-EO Translation(SET) 연구들이 모델의 근간이 되는 VAE(Autoencoder)의 적합성을 고려하지 않고 자연 이미지용 pretrained codec을 고정적으로 사용한다는 문제점을 해결하고자 합니다.#Review#SAR-to-EO Translation#Latent Flow Matching#Diffusion Transformer#Representation Alignment#Autoencoder Selection2026년 9월 1일댓글 수 로딩 중
[논문리뷰] Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving본 논문은 자율주행을 위한 통합 비전-언어 파운데이션 모델인 Qwen-Drive-1.0을 제안하여, 기존 모듈형 파이프라인의 한계를 극복하고자 한다.#Review#Vision-Language Foundation Model#Autonomous Driving#3D Perception#Motion Planning#Bird’s-Eye-View (BEV)#Visual Question Answering#Flow Matching2026년 9월 1일댓글 수 로딩 중
[논문리뷰] Learning Where Outcomes Change:Credit-Addressable Reasoning for Multimodal Geometry본 연구는 다중 모달 기하 추론에서 발생하는 Representation Gap과 Credit Gap 문제를 해결하는 것을 목표로 합니다.#Review#Multimodal Geometry#Credit-Addressable Reasoning#Code-CoT#CE-GRPO#Reinforcement Learning#VLM2026년 9월 1일댓글 수 로딩 중
[논문리뷰] InternReviewer & InternAdvocate: Objective Reward and Evaluation for Agentic Reinforcement Learning in Peer Review and Rebuttal본 연구는 학술 리뷰의 자동화 과정에서 발생하는 hallucination과 비전문적인 리뷰 생성을 해결하기 위해 수행되었습니다. 기존의 LLM 기반 리뷰 생성 모델들은 문체만 모방하거나, 존재하지 않는 문헌을 인용하는 등 사실관계 확인이 부족한 sycophantic한 리뷰를 생성하는 한계가 있습니다 .#Review#Agentic Reinforcement Learning#Peer Review#Rebuttal#Hallucination Suppression#Evidence-grounded Search#Objective Reward Function2026년 9월 1일댓글 수 로딩 중
[논문리뷰] Hi-Q: Hierarchical Evidence-guided Query Refinement for Multi-Hop Question Answering본 논문은 Multi-hop Question Answering(QA)에서 발생하는 핵심 병목인 'Query-Evidence Granularity Mismatch' 문제를 해결하고자 한다 .#Review#Multi-hop Question Answering#Retrieval-Augmented Generation#Query Refinement#Granularity#Hierarchical Decomposition#Evidence-guided2026년 9월 1일댓글 수 로딩 중
[논문리뷰] Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement본 논문은 LLM-based Coding Agents를 활용한 Autonomous Software Development라는 ambitious한 목표를 달성하기 위한 Continual Improvement의 필요성을 제기한다.#Review#Autonomous Software Development#LLM-based Agents#Continual Improvement#Agent Harnesses#Iterative Development#Software Quality#Planning–Coding–Testing#Long-Horizon Tasks2026년 9월 1일댓글 수 로딩 중
[논문리뷰] H3-World: Turning Language Understanding into World Control본 논문은 사전 학습된 대규모 비디오 생성 모델을 별도의 복잡한 제어 모듈 추가 없이 상호작용 가능한 월드 모델로 전환하는 것을 목표로 합니다.#Review#World Models#Video Generation#Language Interface#Temporal Grounding#Low-Rank Adaptation#Interactive Control2026년 9월 1일댓글 수 로딩 중
[논문리뷰] From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix본 논문은 엔터프라이즈 환경에서 데이터 보안 및 규제 준수를 위해 자체 호스팅(self-hosted) LLM을 도입할 때 발생하는 파편화 문제를 해결하고자 합니다. 기존에는 수백 개의 애플리케이션이 각각 다른 모델을 사용하여 컴퓨팅 자원(GPU)의 비효율적인 분산이 발생했습니다.#Review#LLM#Post-Training#GRPO#SLERP#Function-Calling#Instruction-Following#Production-Traffic2026년 9월 1일댓글 수 로딩 중
[논문리뷰] Evaluating Multimodal LLMs as Generalist Vision-Language-Action Agents for Drone Control: Commanding, Approaching, Tracking and Searching본 논문은 MLLM의 시각적 인지 능력이 물리적 제어(acting) 영역까지 얼마나 확장될 수 있는지, 그리고 드론 제어 루프에서 MLLM의 역할을 어디까지 부여할 수 있는지 규명하는 것을 목표로 합니다. .#Review#Multimodal Large Language Models#Embodied AI#Drone Control#Vision-Language-Action Agents#Benchmark#Action Protocol2026년 9월 1일댓글 수 로딩 중
[논문리뷰] EM^2Mem: Event-Centric Multimodal Memory for Large Language Models본 논문은 기존의 long-video 이해 방식이 가진 정보 파편화와 인퍼런스 시점의 복잡한 정렬 문제를 해결하기 위해 EM^2^Mem을 제안합니다.#Review#Multimodal Memory#Large Language Models#Long-Video Question Answering#Event-Centric#Memory Construction#Evidence Alignment#Inference Efficiency2026년 9월 1일댓글 수 로딩 중
[논문리뷰] E-Commerce Bench: Evaluating LLM Agents on Long-Horizon Autonomous Business Operation본 논문은 기존의 에이전트 벤치마크들이 장기적 의존성과 복잡한 시장 역학을 가진 '지속적인' 비즈니스 환경을 제대로 평가하지 못한다는 문제를 해결하고자 합니다. 대부분의 기존 연구는 과업이 종료되는 에피소드 중심이거나, LLM의 확률적 생성에 의존하여 재현성이 부족한 시뮬레이션을 제공하는 한계가 있습니다.#Review#LLM Agents#Long-Horizon#E-Commerce#Deterministic Benchmarking#Autonomous Business Operation#Multi-Store Management2026년 9월 1일댓글 수 로딩 중
[논문리뷰] DramaChain Bench: An End-to-End Benchmark for Short-Drama Generation본 논문은 기존 short-drama 생성 벤치마크가 전체 생산 파이프라인의 상호의존성을 평가하지 못하고 단일 단계의 isolated 성능 측정에만 국한되는 문제를 해결합니다 .#Review#Short-drama Generation#End-to-End Benchmark#Production Pipeline#Agentic Evaluation#Spatio-temporal Attribution#Automated Metric2026년 9월 1일댓글 수 로딩 중
[논문리뷰] DiagEvo: Diagnosis-Guided Self-Evolution via Hierarchical Error Memory본 논문은 기존의 자기 주도적 학습(Self-Play) 방식이 외부 자원 없이 학습을 진행할 때 성능 향상이 정체되거나 수렴하지 않는 문제를 해결하고자 한다. 기존의 Label-free 방식은 solver의 실패 이력을 종합적으로 분석하지 못해 단순히 문제의 표면적 복잡도만 증가시키는 경향이 있다.#Review#Self-Evolution#Self-Play#Large Language Models#Curriculum Learning#Error Memory#Diagnosis-Guided#Reinforcement Learning2026년 9월 1일댓글 수 로딩 중
[논문리뷰] Control-Data Flow Separation: Stable Prompt Optimization in Multi-Agent LLMs본 논문은 multi-agent LLM 시스템에서 프롬프트 최적화가 수행될 때 발생하는 구조적인 프로토콜 붕괴 문제를 해결합니다.#Review#Multi-Agent LLMs#Prompt Optimization#Control-Data Flow Separation#Protocol Stability#Python Library2026년 9월 1일댓글 수 로딩 중
[논문리뷰] Agents in the Large: Perception-Centered Architecture for Persistent Agents본 논문은 기존의 Cognitive language agents가 사용자 중심의 단기적인 episodic task에만 집중되어 있어, 장기적인 환경에서의 지속적인 서비스 제공 능력이 부족하다는 문제를 해결하고자 한다.#Review#Persistent Agents#Active Perception#Lifecycle Tasks#Language Agents#Cognitive Architecture#Software Engineering2026년 9월 1일댓글 수 로딩 중
[논문리뷰] Adapting Without Gradients: Affine Statistics Transport and What Its Certificate Can Tell You본 연구는 기존의 TTA 방법론들이 Backpropagation과 모델 파라미터의 변경을 전제로 한다는 점이 실제 배포 환경에서 가지는 제약 사항을 해결하고자 합니다.#Review#Test-Time Adaptation#Frozen-model Deployment#Affine Statistics Transport#Transportability Certificate#Gradient-free#Domain Adaptation2026년 9월 1일댓글 수 로딩 중