본문으로 건너뛰기

[논문리뷰] EvolveTrade: Experience-Driven Policy Refinement for Self-Evolving LLM Trading Agents

링크: 논문 PDF로 바로 열기

저자: Sehee Kim, Yumin Choi, Minki Kang, Sung Ju Hwang

1. Key Terms & Definitions (핵심 용어 및 정의)

  • Tool-Using Trading Agent: 시장 데이터, 뉴스, 코드 해석기(Python Interpreter) 등의 외부 도구(Tools)를 활용하여 포트폴리오 비중을 결정하는 LLM 기반 에이전트입니다.
  • Policy Agent: Trading Agent의 시스템 프롬프트(System Prompt)를 하나의 Text-parameterized Policy로 간주하고, 누적된 거래 경험을 바탕으로 이를 수정 및 개선하는 별도의 LLM 에이전트입니다.
  • Policy Self-Evolution: 매 업데이트 주기마다 거래 경험(Decision Traces)과 실현 수익(Realized Feedback)을 바탕으로 기존의 정책을 최신화하여 에이전트의 의사결정 절차를 점진적으로 개선하는 프레임워크입니다.
  • Refinement Step: Trading Agent의 정책을 수정한 후, 다음 배치의 거래 의사결정에 반영하는 구체적인 언어 기반 최적화 과정을 지칭합니다.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 논문은 기존의 LLM 기반 트레이딩 에이전트가 배포 전 설정된 Static Policy에 의존함으로써 변화하는 시장 환경에 적절히 대응하지 못하는 문제를 해결하고자 합니다. 대다수 기존 연구는 도구 활용 방식이나 프롬프트를 사전에 고정(Fixed)해두어, 실제 시장 데이터나 거래 결과로부터 학습하지 못하는 한계가 있습니다. 결과적으로 이러한 에이전트들은 강세장, 횡보장, 급락장 등 다양한 Market Regimes에서 동일한 정보 수집 및 분석 절차만을 반복 수행하게 됩니다 [Figure 1]. 이러한 정적인 접근 방식은 에이전트가 시장의 특수성을 반영한 지표(예: VaR, EMA, RSI)를 상황에 맞게 활용하는 것을 저해하는 핵심 병목 현상으로 작용합니다.

Figure 1: EvolveTrade 개념도

Figure 1 — EvolveTrade 개념도

3. Method & Key Results (제안 방법론 및 핵심 결과)

저자들은 에이전트 스스로 거래 경험을 통해 도구 사용 정책을 진화시키는 EvolveTrade 프레임워크를 제안합니다 [Figure 1]. 이 방법론은 거래 배치(Batch)가 종료될 때마다 Policy Agent가 거래 흔적(Decision Traces)과 포트폴리오 피드백을 분석하여 시스템 프롬프트를 수정함으로써, 별도의 모델 재학습 없이도 에이전트의 정보 수집 및 위험 관리 절차를 최적화합니다. 실험 결과, EvolveTrade는 GPT-5-mini 및 Gemini-2.5-Flash 백본 모델 환경에서 고정 정책 베이스라인 대비 유의미한 성능 향상을 보였습니다 [Table 1]. 특히, 2025년 9월 데이터 기준 EvolveTrade는 6.84%의 Cumulative Return(CR)을 달성하며 우수한 성과를 기록했습니다. 또한, 정성적 분석을 통해 기존 베이스라인이 활용하지 않던 VaR, EMA, RSI 등 시장 상황별 핵심 지표를 EvolveTrade가 스스로 활성화하여 의사결정에 반영함을 확인하였습니다 [Figure 3].

Figure 3: 지표 활성화 비교

Figure 3 — 지표 활성화 비교

4. Conclusion & Impact (결론 및 시사점)

본 논문은 트레이딩 에이전트의 정책을 실시간으로 업데이트하는 것이 금융 시장의 비정상성(Non-stationarity)을 극복하는 강력한 해결책임을 입증했습니다. EvolveTrade는 고정된 프롬프트를 사용하는 기존 에이전트보다 유연한 도구 활용 능력과 위험 대응력을 보여주었으며, 이는 LLM 기반 에이전트 연구가 고정된 아키텍처를 넘어 지속적으로 경험을 내재화하는 방향으로 나아가야 함을 시사합니다. 향후 연구에서는 시장 변화를 감지하여 업데이트 주기를 동적으로 조절하는 방식 등을 통해 더욱 강건한 금융 의사결정 시스템을 구축할 수 있을 것으로 기대됩니다.

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글