[논문리뷰] NOLLI: A Difficulty-Calibrated Puzzle Benchmark for Diagnosing the English-Korean Performance Gap본 논문은 LLM이 단순 pattern matching을 넘어 진정한 logical reasoning 능력을 갖추고 있는지에 대한 불확실성과 multilingual evaluation에서 language-specific failure가 단일 performance gap으로 뭉뚱그려지는 문제를 해결하고자 한다.#Review#Puzzle Benchmark#Cross-Lingual Evaluation#Performance Gap#Hangul Jamo#Difficulty Calibration#Procedural Generation#LLM Reasoning#Korean NLP2026년 8월 5일댓글 수 로딩 중
[논문리뷰] Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning본 논문은 기존의 시각적 추론 학습 방식이 대규모 데이터셋에 의존하거나 특정 도메인에 국한되어, 범용적이고 재현 가능한 추론 데이터의 부족이라는 한계에 직면해 있음을 지적합니다. 특히 복잡한 시각적 과제에서 학습 데이터의 다양성과 정확한 검증 가능성을 동시에 확보하는 것이 현재 VLM 연구의 핵심 병목 구간입니다 .#Review#Visual Reasoning#Reinforcement Learning#Verifiable Rewards#Multidomain#Taxonomy-Guided#Procedural Generation2026년 7월 22일댓글 수 로딩 중
[논문리뷰] PaintBench: Deterministic Evaluation of Precise Visual Editing본 논문은 최신 멀티모달 모델들이 일반적인 시각 편집에는 능숙하지만, 정확한 단일 결과가 요구되는 정밀 편집 작업(Precise Visual Editing) 수행에는 한계를 보인다는 문제 의식에서 출발합니다.#Review#Multimodal Models#Image Editing#Benchmark#Deterministic Evaluation#Pixel-level#Procedural Generation2026년 6월 3일댓글 수 로딩 중
[논문리뷰] 3DCodeBench: Benchmarking Agentic Procedural 3D Modeling Via Code본 논문은 현대 3D 생성 분야에서 Procedural Code 생성을 통한 모델링의 중요성이 커지고 있으나, 이를 객관적으로 평가할 수 있는 표준화된 벤치마크가 부재하다는 문제점을 해결하고자 합니다 .#Review#3D Modeling#Procedural Generation#Vision-Language Models#Agentic Workflow#Benchmark#Human-Preference#Blender2026년 6월 1일댓글 수 로딩 중
[논문리뷰] ScaleEnv: Scaling Environment Synthesis from Scratch for Generalist Interactive Tool-Use Agent Training본 논문은 일반 목적의 도구 사용 에이전트 훈련에 필요한 대규모의 사실적이고 검증 가능한 인터랙티브 환경 이 부족하다는 문제를 해결하고자 합니다.#Review#Environment Synthesis#Tool-Use Agents#Reinforcement Learning#Generalization#Procedural Generation#LLM Agents#Interactive Environments#Data Scaling2026년 2월 10일댓글 수 로딩 중
[논문리뷰] Endless Terminals: Scaling RL Environments for Terminal Agents본 논문은 자체 개선 에이전트 훈련을 위한 환경이 부족하다는 문제점을 해결하고, 확장 가능한 RL 환경을 제공하는 것을 목표로 합니다.#Review#Reinforcement Learning#Procedural Generation#Terminal Agents#Environment Scaling#Language Models (LLMs)#PPO#Task Generation#Automated Verification2026년 1월 25일댓글 수 로딩 중
[논문리뷰] Web World Models본 논문은 고정된 컨텍스트의 웹 프레임워크와 완전히 생성형 세계 모델(World Model) 사이의 간극을 메우는 Web World Model (WWM) 개념을 제안합니다. 언어 에이전트가 지속적으로 활동, 기억, 학습할 수 있는 제어 가능하면서도 무한히 확장 가능한 환경 을 구축하는 것이 주된 목표입니다.#Review#Web World Model#LLM#Neuro-symbolic AI#Procedural Generation#Hybrid Architecture#Deterministic Generation#Persistent Environments#TypeScript2025년 12월 29일댓글 수 로딩 중
[논문리뷰] SimWorld: An Open-ended Realistic Simulator for Autonomous Agents in Physical and Social Worlds본 논문은 기존 시뮬레이터들의 한계(제한된 환경, 비현실적인 물리/사회 규칙, LLM/VLM 에이전트 미지원)를 극복하고, 현실적이고 개방적인 환경에서 자율 에이전트의 개발 및 평가를 위한 SIMWORLD 시뮬레이터를 제시합니다.#Review#Autonomous Agents#Realistic Simulator#Unreal Engine 5#LLM/VLM Agents#Procedural Generation#Multi-Agent Systems#Physical Simulation#Social Interaction2025년 12월 2일댓글 수 로딩 중
[논문리뷰] SPHINX: A Synthetic Environment for Visual Perception and Reasoning본 논문은 기존 벤치마크들이 시각적 인식보다 추론을 강조하거나 대칭, 정신적 회전 등 핵심 인지 원시 요소들을 체계적으로 평가하지 못하는 한계를 지적합니다.#Review#Visual Reasoning#Synthetic Environment#LVLM Evaluation#Reinforcement Learning#Cognitive Primitives#Procedural Generation#Multimodal AI2025년 11월 26일댓글 수 로딩 중
[논문리뷰] WorldGen: From Text to Traversable and Interactive 3D Worlds본 논문은 텍스트 프롬프트로부터 대규모의 인터랙티브 3D 월드를 자동으로 생성하는 시스템 WorldGen 을 소개합니다.#Review#3D World Generation#Text-to-3D#Generative AI#Procedural Generation#Scene Decomposition#Navmesh#Game Engines#Interactive Environments2025년 11월 23일댓글 수 로딩 중
[논문리뷰] RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments언어 모델(LM)의 강화 학습(RL) 훈련이 정적 데이터셋에서 포화되고, 검증 가능한 학습 데이터를 수집하는 높은 비용 문제를 해결하고자 합니다.#Review#Reinforcement Learning#Language Models#Adaptive Environments#Verifiable Environments#Procedural Generation#Curriculum Learning#Generalization2025년 11월 10일댓글 수 로딩 중