[논문리뷰] AskChem: Claim-Centered Infrastructure for Chemistry Literature Synthesis본 논문은 화학 문헌 검색 시스템이 논문 리스트 중심의 정보를 제공함에 따라, 과학자와 AI 에이전트가 정보를 직접 수집하고 검증해야 하는 비효율성을 해결하고자 합니다 .#Review#Chemistry Informatics#Literature Synthesis#Claim-Centered#Evidence Graph#Faceted Taxonomy#Provenance#Large Language Models2026년 7월 30일댓글 수 로딩 중
[논문리뷰] AMRD: Adaptive Multi-Teacher Relational Distillation for Lightweight Speech Emotion Recognition본 논문은 실시간 On-device Speech Emotion Recognition(SER)을 위한 효율적인 경량화 모델 학습의 어려움을 해결하고자 합니다. 기존의 대규모 SSL 모델은 성능은 우수하지만 파라미터 규모가 커서 엣지 디바이스에 배포하기에는 실용적이지 않습니다.#Review#Speech Emotion Recognition#Knowledge Distillation#Multi-Teacher#Relational Distillation#Edge Computing#Adaptive Weighting2026년 7월 30일댓글 수 로딩 중
[논문리뷰] AI Tour Meeting: Group Travel Planning by LLM Agents본 논문은 다수의 인간이 복잡한 선호도를 조율해야 하는 그룹 여행 계획 수립 과정을 모의하기 위한 전문적인 LLM-based multi-agent 시뮬레이션 프레임워크의 필요성을 제기합니다.#Review#LLM Agents#Group Travel Planning#Multi-Agent Simulation#Consensus Building#Persona-based Simulation#Framework2026년 7월 30일댓글 수 로딩 중
[논문리뷰] ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine본 연구는 Embodied AI 모델 학습에 필수적인 고품질의 Human-Centric 데이터가 절대적으로 부족하다는 문제를 해결하고자 한다. 기존의 데이터셋은 제한된 환경에서 수집되거나 인위적인 환경 설정으로 인해 실제 일상 생활의 복잡성과 자연스러운 상호작용을 충분히 반영하지 못하는 한계가 있다.#Review#Embodied AI#Data Engine#Human-Centric#Ambient Capture#Action Trajectory#Multimodal Dataset2026년 7월 30일댓글 수 로딩 중
[논문리뷰] TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM본 논문은 기존 LLM-centric VLA 모델이 가진 방대한 연산량과 메모리 오버헤드가 실시간 로봇 제어의 병목 현상을 유발한다는 문제를 해결하고자 합니다.#Review#Vision-Language-Action Models#Real-Time Control#Robotic Manipulation#Efficient Inference#Continuous Action Chunking#Cross-Attention2026년 7월 29일댓글 수 로딩 중
[논문리뷰] StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents본 논문은 기존의 자율형 보안 에이전트들이 기능적 성공(태스크 해결)에는 집중하지만, 운영상의 은밀함(Stealth)을 심각하게 결여하고 있다는 문제를 제기합니다 .#Review#Autonomous Security Agents#Operational Stealth#OPSEC#LLM-as-a-Judge#StealthBench#Vulnerability Exploitation2026년 7월 29일댓글 수 로딩 중
[논문리뷰] StatePlay: State-Aware Game World Models for Mechanics-Consistent Generation본 논문은 기존의 게임 월드 모델이 시각적 현실성은 뛰어나지만, 게임의 핵심인 규칙(Mechanics)을 위반하는 Mechanics Inconsistency 문제를 해결하는 것을 목표로 합니다.#Review#Game World Models#Mechanics-Consistent Generation#State-Aware#Mixture-of-Transformers#Flow Matching#Game States2026년 7월 29일댓글 수 로딩 중
[논문리뷰] SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution본 논문은 표준적인 에이전트 강화학습이 각 작업을 독립적인 에피소드로 처리하여, 작업 간 재사용 가능한 해결 패턴을 활용하지 못하는 한계를 해결하고자 합니다. 기존 연구들은 기술 추출, 검색, 실행을 복잡한 다단계 파이프라인으로 구현하여 계산 효율성이 낮고 성과에 대한 책임 귀속이 어렵다는 문제를 안고 있습니다.#Review#Agentic Reinforcement Learning#Cross-Task Skill Evolution#Decoupled Credit Assignment#Skill Curation#LLM Agents#Transferable Skills#Test-Time Scaling2026년 7월 29일댓글 수 로딩 중
[논문리뷰] SecRespond: Benchmarking AI Agents for Real-World Post-Compromise Incident Response본 논문은 기존의 사이버 보안 벤치마크가 대부분 pre-compromise(공격 이전의 이상적 환경)에 치중되어 있다는 한계를 극복하기 위해 SECRESPOND를 제안합니다.#Review#LLM Agents#Incident Response#Post-Compromise#Cybersecurity#Benchmarking#Forensics2026년 7월 29일댓글 수 로딩 중
[논문리뷰] OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding본 논문은 LLM Agent가 단순한 코딩을 넘어 실제 업무 현장에서 긴 시간 소요되는 오피스 워크플로우를 처리하는 능력을 평가하기 위한 표준화된 벤치마크의 부재 문제를 해결하고자 합니다.#Review#LLM Agents#Office-Suite Tasks#Long-Horizon#Economic Grounding#Benchmark#Productivity#Code-based Verification2026년 7월 29일댓글 수 로딩 중
[논문리뷰] Memory for Large Language Models본 연구는 LLM이 지닌 고질적인 Context Window 제약과 학습 데이터에만 의존하는 정적인 지식 구조의 한계를 해결하는 것을 목표로 합니다.#Review#Large Language Models#Memory Augmentation#Retrieval-Augmented Generation#Context Window#Knowledge Persistence2026년 7월 29일댓글 수 로딩 중
[논문리뷰] HumanCLAW: Can Vision-Language Models Act Through a Body?본 논문은 기존 VLM이 신체를 가진 에이전트로서 물리적 환경에서 행동할 때, 단순한 시각적 추론을 넘어 실제 수행 능력을 갖추고 있는지 검증하는 것을 목표로 합니다.#Review#Vision-Language Models#Embodied AI#Human Motion Generation#Action Intelligence#Closed-loop Control#Egocentric Perception#Physical Simulation2026년 7월 29일댓글 수 로딩 중
[논문리뷰] Grading the Narrators: An Isnad-Rijal Framework for Claim-Level Provenance in Multi-Agent Knowledge Systems본 논문은 현대의 Multi-agent knowledge systems에서 지식의 출처가 불투명하고, 클레임의 신뢰성을 판단할 체계적인 근거가 부족한 문제를 해결하고자 합니다.#Review#Provenance#Multi-agent systems#Knowledge bases#Trust#Epistemology#Isnād#Hadith science#Claim verification2026년 7월 29일댓글 수 로딩 중
[논문리뷰] GPT-Red: Automated Red Teaming via Self-Play at Scale본 논문은 현대의 agentic LLM이 복잡한 환경에서 외부 공격으로부터 안전하게 작동하기 위한 확장 가능한 자동 red-teaming 프레임워크의 부재를 해결합니다.#Review#GPT-Red#Self-Play#Red Teaming#Prompt Injection#Adversarial Robustness#Reinforcement Learning2026년 7월 29일댓글 수 로딩 중
[논문리뷰] Explicit Layer Modeling for Video Object Insertion and Layer Decomposition본 논문은 기존 비디오 편집 모델들이 명시적인 레이어 표현(Foreground-Background 분리) 없이 동작하여 복합적인 비디오 조작에 한계가 있다는 문제를 해결합니다 .#Review#Video Object Insertion#Layer Decomposition#Diffusion Models#TriLayer Dataset#Dual-Branch Architecture#RGBA Foreground2026년 7월 29일댓글 수 로딩 중
[논문리뷰] DecoEvo: Score-Decoupled Co-Evolution of Solver and Rubric-Generator Skills in Text Space본 논문은 Text-Space Optimization에서 고정된 평가 Rubric이 Solver의 발전을 저해하거나, 반대로 Rubric을 함께 진화시킬 때 발생하는 Score-Coupling 문제를 해결하고자 합니다.#Review#Text-Space Optimization#LLM#Co-Evolution#Rubric#Score-Decoupling#Prompt Engineering#Black-Box Adaptation2026년 7월 29일댓글 수 로딩 중
[논문리뷰] CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization본 논문은 Rubric-based RL에서 발생하는 구조적 피드백과 토큰 단위 최적화 사이의 불일치 문제를 해결합니다. 기존의 GRPO는 구조화된 rubric 평가 결과를 최종적으로 하나의 scalar advantage로 축소한 뒤, 이를 응답 내 모든 토큰에 균등하게 분산시킵니다 .#Review#Reinforcement Learning#Language Models#Credit Assignment#Counterfactual Replay#Rubric-Guided Policy Optimization#GRPO#Instruction Following2026년 7월 29일댓글 수 로딩 중
[논문리뷰] Can AI agents conduct open-ended AI research? Early evidence from two case studiesAI agent가 open-ended AI research를 자율적으로 수행할 수 있는지에 대한 증거가 부족하다는 점이 본 연구의 핵심 문제입니다. 기존 AI R&D 평가 방식은 크게 두 가지로 나뉘며, 각각 명확한 한계점을 가지고 있습니다.#Review#AI R&D Automation#Shadow Evaluations#LLM Agents#Open-ended Research#AI Failure Modes#Research Engineering#NeurIPS2026년 7월 29일댓글 수 로딩 중
[논문리뷰] CLBench-V: Evaluating Multimodal Context Learning from Grounding to Knowledge Acquisition본 논문은 현대의 멀티모달 모델들이 실제 환경에서 제공되는 다중 모달 컨텍스트를 얼마나 효과적으로 학습하고 활용하는지 측정하기 위한 표준화된 벤치마크가 부재하다는 문제 의식에서 출발합니다.#Review#Multimodal Context Learning#Benchmark#Context Grounding#Information Application#Knowledge Acquisition#Multimodal LLMs#Long-context2026년 7월 29일댓글 수 로딩 중
[논문리뷰] CAST: Game Solvers as Turn-Level Teachers for LLM Agents본 논문은 장기적 계획이 필요한 게임 환경에서 LLM Agents의 학습 효율성과 성공률을 높이기 위해 제안되었습니다. 기존의 RLVR 방식은 최종 결과물에만 보상을 부여하기 때문에, 어떤 행동이 성공을 결정지었는지 파악하기 어려운 '신용 할당(Credit Assignment)'의 한계를 갖습니다 .#Review#LLM Agents#Reinforcement Learning#Credit Assignment#Game Solvers#On-policy Distillation#RLVR#Process Supervision2026년 7월 29일댓글 수 로딩 중