[논문리뷰] Second Thought: Reasoning in Parallel as LLM Agents Act and Observe
링크: 논문 PDF로 바로 열기
메타데이터
저자: Zhensu Sun, Chengran Yang, Yunbo Lyu, Jieke Shi, David Lo
1. Key Terms & Definitions (핵심 용어 및 정의)
- Reasoning Idle Window: ReAct 루프에서 Action을 직렬화하고 환경의 Observation을 대기하는 동안, 명시적인 추론(Reasoning)이 중단되는 구간을 의미합니다.
- Atomic Thoughts: 중단 시에도 손실 없이 재사용 가능한, XML 태그로 구분된 개별적이고 독립적인 추론 단위입니다.
- Second Thought: Reasoning Idle Window를 활용하여 추가적인 병렬 추론을 수행하는 Training-free 추론 프레임워크입니다.
- Forking/Harvesting: 메인 스레드와 병렬로 보조 추론 브랜치를 생성하고, 추론 결과를 수집하여 다음 턴의 맥락으로 통합하는 메커니즘입니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 ReAct 기반 LLM 에이전트의 워크플로우에서 발생하는 Reasoning Idle Window가 활용되지 않는 비효율성을 해결하고자 합니다. 기존의 에이전트는 Thought 페이즈 이후 대기 상태에 빠지며, 이는 추가적인 추론 자원이 낭비되는 구간입니다. 기존 연구들이 Thought 페이즈 내에서 수평적으로 추론을 병렬화하는 것과 달리, 본 연구는 메인 스레드의 직렬 경로를 벗어난 유휴 시간에 보조 추론을 수행하여 에이전트의 성능을 최적화하고자 합니다 [Figure 1]. 이러한 방식은 Latency 증가 없이 에이전트의 의사결정 품질을 향상시키는 것을 목표로 합니다.
3. Method & Key Results (제안 방법론 및 핵심 결과)
본 논문이 제안하는 Second Thought는 Thought 페이즈 종료 직후 4개의 보조 브랜치를 생성하여 Action 및 Observation 대기 시간 동안 병렬 추론을 수행합니다 [Figure 2]. 각 브랜치는 Check, Recall, Rehearse, Alternative라는 4가지 차원에서 보완적인 추론을 제공하며, Atomic Thoughts 형태로 출력을 생성하여 예측 불가능한 환경 대기 시간 내에서도 안전한 중단 및 병합을 보장합니다. 실험 결과, SWE-Bench Pro, Terminal-Bench 2.1, τ3-bench 등 3개 벤치마크에서 Pass@1 성능을 개선하거나 유지하면서 메인 스레드의 Decoding 토큰 수를 최대 43%까지 감소시켰습니다 [Table 1]. 특히 Terminal-Bench 2.1에서는 기존 Base 모델 대비 Pass@1이 최대 12.4점 상승하는 성과를 보였습니다. 정량적인 분석 결과, 보조 추론을 통한 병렬 처리는 실제 태스크 실행의 Latency를 10.9% 낮추는 데 기여하는 것으로 확인되었습니다.
4. Conclusion & Impact (결론 및 시사점)
본 연구는 ReAct 루프의 Reasoning Idle Window를 성공적으로 활용하여 에이전트의 효율성과 정확도를 동시에 향상하는 새로운 병렬 추론 패러다임을 정립했습니다. Second Thought는 학습 없이 즉시 적용 가능한 Training-free 프레임워크로서, 에이전트 개발자가 추가적인 컴퓨팅 비용 대비 효율적인 성능 최적화를 달성할 수 있는 실용적인 해결책을 제시합니다. 본 연구는 대규모 LLM 에이전트의 대기 시간을 실질적인 추론 자산으로 변환함으로써 향후 보다 복잡하고 지능적인 에이전트 시스템 구현에 중요한 가이드라인을 제공할 것으로 기대됩니다.
Part 2: 중요 Figure 정보

Figure 1 — Second Thought의 에이전트 최적화 비교

Figure 2 — Second Thought의 전체 워크플로우
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] AlphaQuanter: An End-to-End Tool-Orchestrated Agentic Reinforcement Learning Framework for Stock Trading
- [논문리뷰] ReSum: Unlocking Long-Horizon Search Intelligence via Context Summarization
- [논문리뷰] An Empirical Study of Training Pixel-Space Text-to-Image Diffusion Models
- [논문리뷰] Agentic Transaction: Towards ACID-Compliant Agent Systems
- [논문리뷰] Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning
Review 의 다른글
- 이전글 [논문리뷰] Scaling Domain Data Repetition in LLM Pretraining
- 현재글 : [논문리뷰] Second Thought: Reasoning in Parallel as LLM Agents Act and Observe
- 다음글 [논문리뷰] Self-Supervised Visual On-Policy Distillation
댓글