[논문리뷰] Skill Issue: Are Skills Language-Invariant in LLMs?본 논문은 LLM이 서로 다른 언어 환경에서 상호작용할 때, 단순히 지식의 접근성뿐만 아니라 근본적인 기술(Skill) 수준까지 달라지는지 규명하고자 합니다.#Review#Multilingual LLMs#TextArena#Cross-lingual Skill Inconsistency#Self-play#Language Interface#Agentic Gameplay2026년 8월 26일댓글 수 로딩 중
[논문리뷰] SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration?본 논문은 현대 소프트웨어 생태계의 고질적인 문제인 기술 부채(Technical debt) 해결을 위해 코딩 에이전트가 리포지토리 단위의 마이그레이션을 자율적으로 수행할 수 있는지 검증합니다.#Review#Coding Agents#Software Migration#Technical Debt#Evaluation Protocol#Agentic Verification#Blindness2026년 8월 26일댓글 수 로딩 중
[논문리뷰] Rubrics as Visual-Repair Context for Self-Evolving UI-to-Code Generation본 논문은 UI-to-Code 생성 과정에서 테스트 타임(Test-time) Self-Evolution이 겪는 불안정성을 해결하는 것을 목표로 합니다.#Review#UI-to-Code#Self-Evolution#Visual Repair Coupling#Rubric-guided#Vision-Language Models#Visual Fidelity#Test-time Refinement2026년 8월 26일댓글 수 로딩 중
[논문리뷰] RetrievalRouter: Joint Modality and Architecture Selection for Document Retrieval본 논문은 현대의 문서 검색 시스템이 높은 정확도와 낮은 Latency 사이에서 고정된 선택만을 강요받는 문제를 해결하고자 합니다.#Review#Document Retrieval#Multimodal Retrieval#Query-aware Routing#Accuracy-Latency Trade-off#Late-interaction#Dense Retrieval2026년 8월 26일댓글 수 로딩 중
[논문리뷰] Real-TurnTurk: A Multimodal Turkish Corpus for Turn-Taking Prediction본 연구는 자연스러운 동기식 대화 시스템에서 Turn-taking을 모델링하는 어려움과 터키어 Turn-taking Dynamics를 다루는 자연주의적 대화 코퍼스의 부족 문제를 해결하고자 합니다.#Review#turn-taking prediction#predictive modeling#multimodal#data generation#rule optimization#genetic algorithms2026년 8월 26일댓글 수 로딩 중
[논문리뷰] Pushing the Limits of High-Resolution Weather Forecasting through Data Scaling본 논문은 0.1° 해상도의 고해상도 기상 예측 모델 개발이 데이터 부족으로 인해 심각한 병목 현상을 겪고 있다는 문제를 해결하고자 합니다.#Review#Weather forecasting#Scaling law#High-resolution#Super-resolution#Data-centric#BaguanHR2026년 8월 26일댓글 수 로딩 중
[논문리뷰] Prefix Sliding for efficient test-time scaling본 논문은 Full Attention 기반의 모델이 장시간 추론(long-horizon reasoning) 시 직면하는 계산 비용의 폭발적 증가와 메모리 병목 문제를 해결하기 위해 Prefix Sliding을 제안합니다.#Review#Prefix Sliding#Test-time Scaling#Reasoning Traces#Sliding Window#LLM#KV Cache#Efficiency2026년 8월 26일댓글 수 로딩 중
[논문리뷰] Open-MOPD: Diagnosing and Fixing Capability Imbalance in Multi-Teacher On-Policy Distillation본 논문은 멀티 도메인 전문가 모델들을 하나의 범용 모델로 통합하는 M-OPD가 실제로는 성능 저하와 불균형을 겪는다는 사실을 규명하고 이를 해결하고자 합니다.#Review#Multi-Teacher On-Policy Distillation#Capability Integration Gap#Token-Share Balancing#Gap-Following Allocation#Reward Refresh#Reinforcement Learning2026년 8월 26일댓글 수 로딩 중
[논문리뷰] MA-VLA: Multi-Arm Vision-Language-Action Model for Collaboration and Compositional Generalization본 논문은 기존의 VLA 모델들이 다중 로봇 팔 협업 시 고수준 명령어만을 사용하여 역할 분담을 암묵적으로 추론함에 따라, 학습 데이터에 없는 새로운 협업 패턴에 취약하다는 문제를 해결하고자 한다 .#Review#Multi-arm collaboration#Compositional generalization#Vision-language-action#Atomic action assignment#Arm Shuffle2026년 8월 26일댓글 수 로딩 중
[논문리뷰] Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds본 논문은 기존 비디오 생성 모델이 가진 고정된 시간적 윈도우의 한계를 극복하고, 장시간의 내러티브와 상호작용 가능한 세계를 일관되게 생성하기 위한 JoyAI-Echo-1.5를 제안합니다.#Review#Audio-Visual Generation#Long-Horizon#World Modeling#Memory Conditioning#Self-Gradient Forcing#Action Interface#6-DoF2026년 8월 26일댓글 수 로딩 중
[논문리뷰] LibriBrain100: One Hundred Hours of Broad and Deep MEG Data for Neural Speech Decoding at Scale본 논문은 비침습적 신경 언어 decoding 기술의 표준화된 평가와 데이터 규모 확장을 위해 LibriBrain100 데이터셋을 제안한다.#Review#MEG#Speech Decoding#Brain-Computer Interface#Within-Subject Data#Cross-Subject Generalization#Neural Decoding#Benchmark2026년 8월 26일댓글 수 로딩 중
[논문리뷰] JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution본 연구는 에이전트의 성능이 모델 가중치뿐만 아니라, 모델을 둘러싼 실행 환경인 Harness에 크게 의존한다는 점에 주목합니다.#Review#Agent Harness#Just-in-Time (JIT) Generation#Agentic LLMs#Modularized Harness Design#Self-Evolving Agents#Harness Intelligence2026년 8월 26일댓글 수 로딩 중
[논문리뷰] Is Next-Chunk Reasoning RL Really Better than SFT? Revisiting Training Strategies under no-CoT Data본 논문은 No-CoT 데이터를 활용한 추론 모델 학습 시, 최근 제안된 Next-Chunk Reasoning 기반의 Reinforcement Learning(RL) 방식이 기존의 Supervised Fine-Tuning(SFT) 전략보다 진정으로 우월한지 의문을 제기합니다 .#Review#Large Language Models#Reinforcement Learning#Supervised Fine-Tuning#Reasoning#No-CoT#Post-Training#RLVR2026년 8월 26일댓글 수 로딩 중
[논문리뷰] Gated Recurrent Transformers: Expressive Depth through Recurrent Modulation본 논문은 대규모 Transformer 모델의 파라미터 수 증가가 메모리 및 학습 비용의 병목으로 이어지는 문제를 해결하고자 합니다. 기존의 표준 Transformer는 깊이를 늘릴 때마다 새로운 가중치 텐서를 생성하여 모델의 파라미터 footprint를 기하급수적으로 증가시킵니다.#Review#Transformer#Recurrent Depth#Weight Sharing#Gated Recurrent Transformer#Memory Efficiency#Model Scaling#Adaptive Computation2026년 8월 26일댓글 수 로딩 중
[논문리뷰] GUI-Primitives: Diagnosing Spatial Reasoning Failures in Vision-Language GUI GroundingComputer-use agents는 screenshot을 기반으로 natural-language instructions를 GUI에 grounding하여 interface elements를 찾아냅니다.#Review#GUI Grounding#Spatial Reasoning#Vision-Language Models#Minimal-Pair Evaluation#Computer-Use Agents#Diagnostic Benchmark#Inference-Time Interventions2026년 8월 26일댓글 수 로딩 중
[논문리뷰] FrontierChallenge: Evaluating Scientific Workflow Completion본 논문은 현재 AI 에이전트 벤치마크가 Final Answers, Isolated Programs 또는 단일 도메인에 초점을 맞추고 있어, 복잡하고 이기종(Heterogeneous)적인 과학적 워크플로우를 End-to-End로 완료하는 에이전트의 능력을 충분히 특성화하지 못한다는 문제점을 제기한다.#Review#Scientific Workflow Completion#Large Language Model Agents#Cross-domain Benchmark#End-to-End Evaluation#Pass Rate Metric#Scientific Deliverables2026년 8월 26일댓글 수 로딩 중
[논문리뷰] FIRM-Video: Check Before You Score for Reliable Text-to-Video Reward Modeling본 논문은 기존 T2V 모델 평가용 Reward Model이 지닌 불완전한 평가, 비논리적 근거 제시, 평가 항목 간 중복 문제 등을 해결하고자 한다 .#Review#Text-to-Video#Reward Modeling#Checklist-driven#World Coherence#Instruction Following#Perceptual Quality2026년 8월 26일댓글 수 로딩 중
[논문리뷰] D^3-MOPD: Adaptive Dynamic Domain ScheDuling for Efficient Multi-Teacher Distillation본 논문은 기존 MOPD 방식이 고정된 도메인 데이터 혼합(Fixed Domain Mixture) 비율을 사용하여 훈련 효율성이 저하되는 문제를 해결합니다.#Review#Multi-teacher Distillation#On-policy Distillation#Domain Scheduling#Reverse-KL Divergence#Training Efficiency#Dynamic Mixture#LLM Alignment2026년 8월 26일댓글 수 로딩 중
[논문리뷰] Code World Model: Coding Agent as World Brain본 논문은 기존 video-based world model들이 시각적 관측치에만 의존하여 세계의 내부 메커니즘과 장기적인 인과관계를 학습하는 데 한계가 있다는 문제를 해결하고자 합니다.#Review#World Model#Coding Agent#Video Generation#Proxy Representation#Executable State#Spatiotemporal Control2026년 8월 26일댓글 수 로딩 중
[논문리뷰] Are Android GUI Agents Robust Against Runtime Anomalies? AnTrap: Evaluating Agents in Dynamic Adversarial Environments본 논문은 Android GUI agents가 실제 배포 환경에서 겪는 동적 runtime anomalies에 대한 robustness 부족 문제를 해결하고자 합니다.#Review#Android GUI Agents#Runtime Anomalies#Robustness Evaluation#Dynamic Adversarial Environments#AnTrap#Taxonomy#Reinforcement Learning#Mobile Agents2026년 8월 26일댓글 수 로딩 중