[논문리뷰] Asking for What Was Never Requested: Horizontal and Vertical Proactivity in Agents
링크: 논문 PDF로 바로 열기
저자: Ido Levy, Asaf Yehudai, Segev Shlomov, Asaf Adi, et al.
Part 1: 요약 본문
1. Key Terms & Definitions (핵심 용어 및 정의)
- Horizontal proactivity: 에이전트가 현재 Context에서 이미 식별할 수 있는(stated) 정보 중 명시적으로 요청되지 않은 것을 탐색하는 능력. 예를 들어, 고객이 제공한 이름과 ZIP code를 통해 계정을 찾는 행위.
- Vertical proactivity: 에이전트가 이전에 발견된 Evidence를 통해서만 식별 가능해지는(unstated) Need를 추적하는 능력. 예를 들어, 계정 정보를 찾은 후 해당 계정에 연결된 주문을 찾는 행위.
- Need graph: 각 Task에 필요한 Evidence 단위(Needs)와 그들 간의 전제 조건(prerequisite) 관계를 나타내는 그래프. 하나의 Need는 다른 Need가 해결된 후에야 식별 가능해질 수 있으며, 에이전트에게는 노출되지 않고 Run 평가 및 훈련 데이터 라벨링에 사용된다.
- Q&D (questioner and drafter): 본 논문에서 제안하는 훈련 알고리즘으로, 에이전트의 Questioner가 질문의 결과(consequences)로부터 학습하여 Reward model이나 Judge 없이 Proactive하게 정보를 탐색하도록 훈련한다. [cite: 1, Figure 1]
- Equal retrieval spend: 에이전트들의 성능을 비교할 때, 질문의 수를 동일하게 제한하여 Questioner가 더 많은 질문을 했다는 이유만으로 더 나은 성능을 보이는 것을 방지하는 공정한 평가 기준이다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
LLM 기반 에이전트들은 일반적으로 사용자의 명시적인 요청에 반응하도록 설계되어 있으나, 실제 Task를 성공적으로 완료하기 위해서는 사용자가 명시적으로 요청하지 않은 추가 정보가 필요한 경우가 많다. 기존 Proactive agent 연구들은 주로 에이전트가 언제, 어떻게 자율적으로 행동할 것인지(whether and when an agent should act on its own)에 초점을 맞추었으며, 에이전트가 어떤 정보(content of proactivity)를 능동적으로 탐색해야 하는지에 대한 연구는 부족했다. 또한, Agentic search 방법론들은 종종 질문 자체에서 명시된 추론 체인만을 따르거나, 최종 답변의 정확성(answer correctness)만을 기준으로 학습되어 각 질문이 추구하는 정보의 내용이나 효율성을 측정하거나 보상하지 못하는 한계가 있었다. 이러한 제약으로 인해 에이전트는 필요한 정보를 스스로 탐색하지 못하고 Task 수행에 실패하거나, 사용자에게 반복적인 Follow-up 질문을 하게 되는 문제가 발생할 수 있다 [cite: 1, Figure 1].
3. Method & Key Results (제안 방법론 및 핵심 결과)
저자들은 에이전트의 Proactive information-seeking 능력을 향상시키기 위해 Q&D (questioner and drafter)라는 새로운 알고리즘을 제안한다 [cite: 1, Figure 1]. Q&D는 에이전트를 Questioner와 Frozen Drafter로 분리하여, Questioner가 필요한 정보를 탐색하기 위한 질문을 생성하거나 탐색을 중단할지 결정하고, Drafter는 검색된 Evidence를 기반으로 현재 Draft를 갱신하도록 한다 [cite: 1, Figure 1]. 특히, Questioner는 Reward model이나 외부 Judge 없이 질문의 '결과(consequences)'에 따라 훈련된다. 이 훈련 과정에서는 특정 상태에서 여러 Candidate 질문을 샘플링하고, 각 질문이 이후 Run에서 얼마나 많은 Required evidence를 성공적으로 검색하는지에 따라 선호도를 부여한다. 이 방식으로, Task에 명시되지 않은 Need를 조기에 찾아내는 질문이 학습 과정에서 보상을 받게 된다.
실험은 세 가지 Multi-hop Question-Answering 벤치마크(MuSiQue, StrategyQA, 2WikiMultiHopQA)의 Held-out Split에서 진행되었으며, Equal retrieval spend 기준으로 Q&D의 효과를 측정했다. 훈련된 8B Questioner는 동일 모델의 Prompted 버전 대비 모든 Suite에서 더 많은 Required evidence를 Recovery했으며, 특히 MuSiQue에서는 Prompted 모델의 78.3% 대비 89.5%의 Required-evidence coverage를 달성했다 [cite: 1, Table 2]. 또한, Depth-weighted recall은 MuSiQue에서 77.9%에서 90.5%로, StrategyQA에서 51.2%에서 56.6%로 향상되어 Vertical proactivity 측면에서 큰 개선을 보였다 [cite: 1, Table 2]. 이는 에이전트가 Task의 깊은 의존성(deep dependencies)을 더 효과적으로 탐색할 수 있음을 의미한다. 더 나아가, Q&D의 8B Questioner는 동일한 역할을 수행하는 15배 더 큰 GPT-OSS-120B prompted 모델을 MuSiQue와 StrategyQA 두 Suite에서 각각 7.0%p 및 4.3%p의 Coverage 차이로 능가하는 결과를 보여주었다 [cite: 1, Table 2]. 이러한 성능 향상은 단순히 질문의 수나 길이가 아닌, Questioner가 '무엇을(what it asks)' 질문하는 능력에 기인한다. Q&D는 추가적인 훈련 없이 Customer-service agent 시나리오에도 성공적으로 일반화되어, Retail Task 성공률을 1312%에서 3432%로 두 배 이상 향상시켰으며, GPT-OSS-120B 모델보다 적은 Follow-up turns로 더 많은 Task를 완료했다 [cite: 1, Figure 3].
4. Conclusion & Impact (결론 및 시사점)
본 연구는 에이전트의 Proactivity를 기존의 '언제 행동할 것인가'라는 차원을 넘어, '무엇을 능동적으로 탐색할 것인가'라는 Content axis로 확장하고, 이를 Need graph를 통해 Horizontal 및 Vertical 형태로 측정 가능하게 했다. 저자들은 Questioner가 질문의 결과로부터 학습하여 Reward model이나 Judge 없이 Proactive하게 정보를 탐색하도록 훈련하는 Q&D 알고리즘을 제안했다. Q&D로 훈련된 8B Questioner는 Equal retrieval spend 조건에서 Prompted 모델 대비 더 많은 Required evidence를 Recovery하고, Task의 깊은 의존성을 탐색하며, 더 큰 규모의 prompted 모델을 능가하는 효율성을 입증했다. 특히, 이러한 이득은 질문의 양이 아닌 질문의 '질(what it asks)'에서 비롯된다. Q&D의 Proactive questioning 능력은 Customer-service agent와 같은 Real-world Application에서도 효과적으로 Task를 완료하고, 사용자에게 필요한 Follow-up 질문을 줄여 상호작용 비용을 절감하는 중요한 시사점을 제공한다. 이 연구는 LLM 기반 에이전트의 자율적이고 지능적인 정보 탐색 능력을 발전시키는 데 기여하며, 에이전트 디자인 및 평가에 대한 새로운 관점을 제시한다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] Harness-Zero: Harness Distillation via Agent-as-Harness
- [논문리뷰] CaSKG: Counterfactual-Causal Skill Graphs for Scalable Agent Skill Retrieval
- [논문리뷰] ExplainBench: Evaluating Code Explanations from Agents
- [논문리뷰] MetaClaw: Just Talk -- An Agent That Meta-Learns and Evolves in the Wild
- [논문리뷰] LLMs4All: A Review on Large Language Models for Research and Applications in Academic Disciplines
Review 의 다른글
- 이전글 [논문리뷰] Anisotropic Representations Improve Planning in JEPA World Models
- 현재글 : [논문리뷰] Asking for What Was Never Requested: Horizontal and Vertical Proactivity in Agents
- 다음글 [논문리뷰] AutoRef: Harness Optimization for Agentic Multi-Reference Image Generation
댓글