вернуться в раздел "Научные труды"
Автор перевода: Н.Н. Дворник
Источник: Karthikeyan K., Michelle Yuan, Elman Mansimov, Katerina Margatina, Anurag Pratik, Daniele Bonadiman, Monica Sunkara, Yi Zhang, Yassine Benajiba. 2025. A Study on Leveraging Search and Self-Feedback for Agent Reasoning. arXiv preprint arXiv:2502.12094. DOI: 10.48550/arXiv.2502.12094 .

DOI: 10.48550/arXiv.2502.12094

Исследование использования поиска и самоотклика для рассуждений агентов

Karthikeyan K., Michelle Yuan, Elman Mansimov, Katerina Margatina, Anurag Pratik, Daniele Bonadiman, Monica Sunkara, Yi Zhang, Yassine Benajiba

Department of Computer Science, Duke University; Amazon Web Services

E-mail: karthikeyan.k@duke.edu, miyuan@amazon.com

Аннотация

Недавние работы показали, что внедрение поиска во время инференса (вывода) может значительно улучшить способности языковых агентов к рассуждению. Некоторые подходы могут использовать эталонные данные (ground truth) или полагаться на собственную обратную связь модели. Алгоритм поиска использует эту обратную связь для генерации значений, которые обновляют критерий исследования и эксплуатации различных путей рассуждения. В этом исследовании мы изучаем, как поиск и самоотклик модели (self-feedback) могут быть использованы для задач рассуждения. Во-первых, мы исследуем различия между эталонной обратной связью и самооткликом во время поиска для математических рассуждений. Во-вторых, мы наблюдаем ограничения в применении методов поиска к более сложным задачам, таким как вызов инструментов, и разрабатываем предметно-ориентированные подходы для устранения этих пробелов. Наши эксперименты выявляют проблемы, связанные с обобщением, при использовании исключительно самоотклика во время поиска. Для эффективной работы поиска требуется либо доступ к эталонным данным, либо механизмы обратной связи должны быть тщательно спроектированы под конкретную задачу.

1 Введение

Алгоритмы поиска традиционно полагались на эталонную обратную связь, особенно в таких областях, как игры, где условия победы/поражения дают четкие сигналы для принятия решений [8]. Некоторые недавние работы показали потенциал внедрения поиска во время инференса модели для улучшения рассуждений [5], [18], [15]. Обычно процесс поиска требует обратной связи о правильности кандидатов решений. В то время как такая обратная связь традиционно поступала от внешней верификации, в недавних работах изучалось использование собственной оценки модели в качестве обратной связи во время поиска. Использование самоотклика мотивировано появляющимися доказательствами способности агента к самокоррекции и самоусовершенствованию [13], [1]. Это направление особенно интересно, так как оно предполагает потенциал для моделей направлять свой собственный процесс поиска и развиваться, не полагаясь на внешнюю проверку, приближая нас к более обобщенным, автономным агентам [10].

Однако при реализации поиска для рассуждений возникает критический вопрос: насколько ценна собственная обратная связь модели для направления процесса поиска? Хотя модели могут быть компетентными судьями в некоторых сценариях [16], их способность надежно оценивать собственные выходные данные во время поиска остается под вопросом. Это становится особенно важным, когда эталонная обратная связь недоступна, как это часто бывает в реальных приложениях. В этом исследовании мы изучаем этот вопрос на примере двух различных задач: математическое рассуждение (GSM8K [2]) и вызов инструментов (ToolTalk [3]). Наш анализ на GSM8K показывает, что, хотя поиск сам по себе ценен, использование самоотклика модели для направления поиска может быть неоптимальным. Вместо этого другие стратегии, такие как голосование большинства по нескольким узлам во время поиска, оказываются более эффективными. Затем мы расширяем наше исследование на вызов инструментов — более сложную область, включающую стратегическое принятие решений и выбор параметров. Здесь мы обнаруживаем, что поиск с самооткликом может фактически ухудшить производительность. Это приводит нас к изучению предметно-ориентированных подходов для дополнения механизмов обратной связи, включая примеры в контексте (in-context examples) и специализированные модули верификации.

Хотя перспектива самосовершенствующихся моделей через обратную связь и поиск остается привлекательной, текущая реальность использования самоотклика в поиске требует тщательного переосмысления. Это подчеркивает разрыв между ранее продемонстрированными способностями моделей к самокоррекции в некоторых сценариях и их надежностью в направлении процессов поиска для рассуждений. В целом, это указывает на необходимость более проработанных механизмов обратной связи, адаптированных к конкретным задачам [17], или альтернативных подходов для использования самоотклика вне поиска [1]. Эти выводы согласуются с недавними прорывами в генеративном ИИ, которые также упоминают ограничения поиска и самоотклика для рассуждений агентов [4].

2 Связанные работы

Недавние исследования широко изучали методы повышения производительности LLM с помощью передовых подходов к вычислениям во время тестирования (test-time compute). Wu et al. [14] исследуют поведение масштабирования стратегий выборки, в то время как Muennighoff et al. [9] показывают положительные результаты с простым подходом масштабирования во время тестирования, называемым budget forcing. Недавние работы подчеркивают растущий потенциал самоотклика [13], [1]. Аналогично, существует критика относительно того, могут ли модели действительно оценивать и исправлять свои собственные выходные данные [12], [7].

Помимо выборки и итеративного улучшения, другие работы предлагают использовать поиск по дереву Монте-Карло (MCTS) в качестве более структурированного подхода к улучшению рассуждений [5], [18], [15]. MCTS может эффективно исследовать пространство поиска, балансируя между исследованием (exploration) и эксплуатацией (exploitation) с использованием критерия UCT:

UCT a = Q s , a + w log N s log N c s , a
(1)

где Q(s, a) — это Q-значение выполнения действия a из узла s. N(s) и N(c(s, a)) — это количество посещений узла s и его дочерних элементов c(s, a) соответственно. На этапах расширения и симуляции (rollouts) создается новый узел, и Q-значение, соответствующее действию, создавшему узел, инициализируется вознаграждениями и обновляется во время обратного распространения. Эти вознаграждения будут основаны на каком-либо источнике обратной связи, будь то эталонные данные или другой источник верификации. Таким образом, качество этой обратной связи имеет решающее значение для успешной работы поиска.

3 Поиск без эталонной обратной связи

В этом разделе мы исследуем использование собственной обратной связи модели для поиска в наборе данных математического рассуждения GSM8K. Мы опираемся на фреймворк MCTSr (MCTS with Self-Refine) [15], который вычисляет Q-значение на основе отклика модели на ее сгенерированное решение. Один нюанс с MCTSr заключается в том, что метод изначально предполагает доступ к эталонной обратной связи для ранней остановки и выбора ответа. Доступ к эталонной обратной связи уместен для таких игр, как шахматы и Го. В других сценариях доступ к эталонной обратной связи может отсутствовать. Возникает вопрос: можем ли мы по-прежнему использовать самоотклик модели или другие сигналы для эффективного направления поиска? Чтобы ответить на это, мы исследуем альтернативные стратегии выбора ответа и оцениваем их производительность в отсутствие эталонной обратной связи.

3.1 Экспериментальная установка

Мы оцениваем наши подходы на наборе данных GSM8K, который стал стандартным бенчмарком для оценки способностей к математическому рассуждению в языковых моделях. Наши эксперименты включают как модели с закрытым исходным кодом, так и открытые языковые модели, включая Llama 3 Instruct (70B), Mistral v0.3 (7B), Claude 3 Haiku и Claude 3 Sonnet.

Для каждой модели мы сначала устанавливаем базовую производительность посредством прямой генерации без каких-либо механизмов поиска. Затем мы запускаем MCTSr с эталонной проверкой, чтобы установить верхнюю границу производительности, представляющую наилучший сценарий, где доступна эталонная обратная связь. Наконец, мы запускаем MCTS, используя наши предложенные стратегии выбора, которые не требуют эталонной обратной связи:

  1. Случайный выбор: Узел из дерева поиска выбирается случайным образом в качестве окончательного ответа. Этот подход служит базовой линией для измерения эффективности более сложных методов выбора.
  2. Голосование большинства: Мы группируем окончательные числовые ответы из всех узлов в дереве поиска и выбираем ответ, который встречается наиболее часто. Эта стратегия агрегирует предсказания модели, предполагая, что наиболее частый ответ, вероятно, является правильным.
  3. Максимальное вознаграждение: Узел с наивысшим баллом вознаграждения от самоотклика выбирается в качестве окончательного ответа. Этот подход полагается на способность модели оценивать собственные решения, предполагая, что более высокие баллы вознаграждения соответствуют лучшим ответам.

Для предложенных стратегий выбора мы не выполняем раннюю остановку и вместо этого проводим поиск в течение максимум 10 итераций MCTS. В Таблице 1 мы приводим точность на GSM8K с базовой линией без поиска, MCTSr с доступом к эталонной обратной связи и предложенными альтернативами, обсужденными выше. В Приложении A мы приводим подробные результаты вместе с другими стратегиями агрегации, например, основанными на средних вознаграждениях или взвешенном голосовании большинства.

Таблица 1 – Результаты экспериментов на наборе данных математического рассуждения GSM8K

Llama 3 Mistral v0.3 Haiku 3 Sonnet 3
Без поиска 0.813 0.426 0.866 0.757
MCTS: Эталонная обратная связь 0.958 0.82 0.964 0.923
MCTS: Случайный выбор 0.751 0.45 0.864 0.680
MCTS: Голосование большинства 0.883 0.608 0.905 0.786
MCTS: Максимальное вознаграждение 0.776 0.469 0.854 0.685

3.2 Анализ

В Таблице 1 проверка по эталону играет огромную роль. Во всех моделях наблюдается улучшение точности как минимум на ? 10% при использовании оригинальной реализации MCTSr с эталонной проверкой по сравнению с отсутствием поиска. Однако без доступа к эталонной обратной связи наиболее перспективной альтернативой, по-видимому, является голосование большинства, а не выбор ответа с максимальным вознаграждением, полученным от самоотклика. Стратегии, основанные на вознаграждении и случайном выборе, похоже, немного улучшают производительность для некоторых моделей и ухудшают для других. Это указывает на то, что самоотклик не может быть надежным источником для предоставления вознаграждений для выбора ответов во время поиска.

4 Поиск с дополненной обратной связью

В этом разделе исследуется применение поиска в более сложной области вызова инструментов, конкретно используя набор данных ToolTalk [3]. В отличие от задач математического рассуждения, где есть один ответ и проверка относительно проста, ToolTalk представляет собой значительно более тонкую задачу. Набор данных состоит из многоходовых диалогов, где агенты должны понимать намерения пользователя, решать, когда вызывать инструменты, а когда просить разъяснений, и гарантировать, что все параметры инструментов обоснованы контекстом разговора. Оценка ToolTalk выполняется с использованием принудительного обучения (teacher forcing), где мы обуславливаем историю разговора на основе эталонного разговора и оцениваем ответ агента. В каждом ходе может быть от нуля до нескольких вызовов инструментов, и оценка ToolTalk последовательно декодирует один вызов инструмента за раз. Если ответ агента содержит текст без вызовов инструментов, это считается завершением хода; если он содержит вызов инструмента, инструмент выполняется с предоставленными параметрами, и результат возвращается агенту для продолжения генерации.

Сложность ToolTalk проистекает из его открытого характера и стратегических решений, требуемых на каждом ходе. Агенты должны не только понимать, какие инструменты доступны, но и определять подходящий момент для их использования. Успешный ответ часто требует поддержания связности на протяжении нескольких ходов, при этом избегая распространенной ошибки: галлюцинации параметров, когда модели фабрикуют правдоподобные, но неверные параметры инструментов. Это представляет собой фундаментальное отличие от задач математического рассуждения, где проблема заключается преимущественно в вычислительной логике, а не в стратегическом принятии решений.

4.1 Пробелы в поиске для вызова инструментов

Мы следуем той же настройке оценки, что и в ToolTalk. Мы сравниваем базовую линию без поиска с использованием MCTS с самоусовершенствованием (self-refine). В этой настройке каждый узел представляет собой полное решение, сгенерированное агентом с функциональностью вызова инструментов, сопровождаемое собственной обратной связью с использованием общего системного промпта для получения обратной связи. Обратите внимание, что мы не выполняем инструменты во время процесса поиска, так как некоторые выполнения инструментов в реальных сценариях могут иметь необратимые последствия. После завершения поиска мы проходим по всем узлам в дереве и выбираем тот, у которого наивысшее вознаграждение.

Анализ: В Таблице 2 мы сравниваем базовую линию без поиска с поиском self-refine. Мы наблюдаем, что базовая линия без поиска работает лучше, чем поиск, что указывает на то, что self-refine может быть вредным [6]. Мы наблюдаем галлюцинации параметров инструментов как основную причину ошибок (пожалуйста, обратитесь к Приложению D для примеров). В частности, когда пользователь просит агента выполнить задачу с недостаточной информацией, вместо того чтобы задать уточняющий вопрос, агент проявляет склонность к преждевременным запросам на вызов инструментов с неполными или галлюцинированными параметрами [11]. Например, когда пользователь просит зарегистрировать аккаунт, агент часто галлюцинирует фиктивные учетные данные, такие как "newuser" или "newpassword". Более того, даже модель обратной связи и вознаграждения не улавливает эти галлюцинации в параметрах инструментов.

Таблица 2 – Сравнение использования и неиспользования поиска для набора данных вызова инструментов ToolTalk

Sonnet 3 Haiku 3
Precision Recall F1 Precision Recall F1
Без поиска 0.656 0.765 0.706 0.588 0.698 0.638
MCTS 0.502 0.630 0.559 0.567 0.648 0.605

4.2 Дополнение обратной связи большим количеством источников

Чтобы смягчить низкое качество обратной связи в поиске, мы исследуем три стратегии:

  1. Дополнение руководствами: Мы уточняем системный промпт модели обратной связи и инструктируем ее специально наказывать за галлюцинации.
  2. Дополнение примерами ICL: Мы вручную аннотируем несколько примеров в контексте (ICL) для модели обратной связи, где эти примеры иллюстрируют как галлюцинированные, так и фактические ответы агента, наряду с их соответствующими вознаграждениями.
  3. Дополнение модулем обнаружения галлюцинаций: Мы дополняем обратную связь отдельным модулем обнаружения галлюцинаций. Этот модуль проходит по каждому параметру инструмента и спрашивает модель, предоставлен ли параметр пользователем. Если ответ отрицательный, то параметр считается галлюцинированным. После того как мы пройдем по всем параметрам индивидуально, мы агрегируем их, чтобы сформировать решение о галлюцинации. Наконец, мы передаем ответ агента вместе с этим решением о галлюцинации модели обратной связи для генерации общей оценки.

Мы приводим показатели точности (precision), полноты (recall) и F1 для всех трех стратегий (Таблица 3). Пожалуйста, обратитесь к Приложению C для системных промптов.

Анализ: Таблица 3 показывает, что уточнение системного промпта неэффективно, так как результаты ухудшились по сравнению с общим системным промптом. Включение примеров в контексте помогает, особенно с точностью. Наконец, с модулем обнаружения галлюцинаций точность значительно возрастает, но полнота также значительно падает. При внимательном рассмотрении мы наблюдаем меньше галлюцинаций, но выбранные ответы склонны просить пользователя о подтверждении или ненужной информации. Например, когда пользователь просит удалить аккаунт, даже если вся необходимая информация присутствует, модель просит пользователя подтвердить. Пожалуйста, обратитесь к Приложению D за несколькими примерами, иллюстрирующими это поведение.

Таблица 3 – Стратегии создания лучших механизмов обратной связи на ToolTalk

Дополнение руководствами Дополнение ICL Дополнение модулем
P R F1 P R F1 P R F1
Sonnet 3 0.532 0.606 0.566 0.708 0.671 0.689 0.754 0.544 0.632
Haiku 3 0.547 0.622 0.582 0.622 0.608 0.615 0.623 0.709 0.663

5 Заключение

В этой работе мы проводим исследование по интеграции самоотклика в поиск для рассуждений агентов. В то время как поиск остается ценным методом для повышения производительности модели, наши результаты показывают, что полагаться на самоотклик может быть неоптимально или даже вредно в определенных контекстах. Эти идеи имеют значение для разработки обобщенных, автономных агентов. Вместо того чтобы преследовать чисто самонаправляемые подходы, наша работа указывает на то, что успешные реализации поиска могут потребовать тщательно спроектированных, предметно-ориентированных механизмов обратной связи или гибридных подходов, сочетающих самоусовершенствование с другими стратегиями верификации.

6 Ограничения

Будучи короткой статьей, мы ограничили наш объем конкретными методами поиска (MCTS) и областями (математическое рассуждение и вызов инструментов). Этот сфокусированный подход позволяет провести углубленный анализ в рамках выбранных нами контекстов. Будущие исследования могут опираться на эти выводы, исследуя дополнительные области рассуждений, алгоритмы поиска и наборы данных, потенциально раскрывая больше закономерностей в самоотклике в различных задачах рассуждения. Также можно провести больше исследований по дополнению самоотклика для поиска с помощью других подходов.

References

  1. Jiefeng Chen, Jie Ren, Xinyun Chen, Chengrun Yang, Ruoxi Sun, and Sercan ? Ar?k. 2025. Sets: Leveraging self-verification and self-correction for improved test-time scaling. arXiv preprint arXiv:2501.19306.
  2. Karl Cobbe, Vineet Kosaraju, Mohammad Bavarian, Mark Chen, Heewoo Jun, Lukasz Kaiser, Matthias Plappert, Jerry Tworek, Jacob Hilton, Reiichiro Nakano, Christopher Hesse, and John Schulman. 2021. Training verifiers to solve math word problems. arXiv preprint arXiv:2110.14168.
  3. Nicholas Farn and Richard Shin. 2023. Tooltalk: Evaluating tool-usage in a conversation setting. arXiv preprint arXiv:2311.10775.
  4. Daya Guo, Dejian Yang, Haowei Zhang, Junxiao Song, Ruoyu Zhang, Runxin Xu, Qihao Zhu, Shirong Ma, Peiyi Wang, Xiao Bi, et al. 2025. Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning. arXiv preprint arXiv:2501.12948.
  5. Shibo Hao, Yi Gu, Haodi Ma, Joshua Hong, Zhen Wang, Daisy Wang, and Zhiting Hu. 2023. Reasoning with language model is planning with world model. In Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing, pages 8154–8173, Singapore. Association for Computational Linguistics.
  6. Jie Huang, Xinyun Chen, Swaroop Mishra, Huaixiu Steven Zheng, Adams Wei Yu, Xinying Song, and Denny Zhou. 2024. Large language models cannot self-correct reasoning yet. Preprint, arXiv:2310.01798.
  7. Subbarao Kambhampati, Karthik Valmeekam, Lin Guan, Mudit Verma, Kaya Stechly, Siddhant Bhambri, Lucas Paul Saldyt, and Anil B Murthy. 2024. Position: LLMs can’t plan, but can help planning in LLM-modulo frameworks. In Forty-first International Conference on Machine Learning.
  8. Donald Knuth. 1998. The Art of Computer Programming: Sorting and Searching, volume 3. Addison-Wesley Professional, Boston.
  9. Niklas Muennighoff, Zitong Yang, Weijia Shi, Xiang Lisa Li, Li Fei-Fei, Hannaneh Hajishirzi, Luke Zettlemoyer, Percy Liang, Emmanuel Cand?s, and Tatsunori Hashimoto. 2025. s1: Simple test-time scaling. arXiv preprint arXiv:2501.19393.
  10. Pranav Putta, Edmund Mills, Naman Garg, Sumeet Motwani, Chelsea Finn, Divyansh Garg, and Rafael Rafailov. 2024. Agent q: Advanced reasoning and learning for autonomous ai agents. arXiv preprint arXiv:2408.07199.
  11. Omar Shaikh, Kristina Gligoric, Ashna Khetan, Matthias Gerstgrasser, Diyi Yang, and Dan Jurafsky. 2024. Grounding gaps in language model generations. In Proceedings of the 2024 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (Volume 1: Long Papers), pages 6279–6296, Mexico City, Mexico. Association for Computational Linguistics.
  12. Kaya Stechly, Karthik Valmeekam, and Subbarao Kambhampati. 2024. On the self-verification limitations of large language models on reasoning and planning tasks. Preprint, arXiv:2402.08115.
  13. Yixuan Weng, Minjun Zhu, Fei Xia, Bin Li, Shizhu He, Shengping Liu, Bin Sun, Kang Liu, and Jun Zhao. 2023. Large language models are better reasoners with self-verification. In The 2023 Conference on Empirical Methods in Natural Language Processing.
  14. Yangzhen Wu, Zhiqing Sun, Shanda Li, Sean Welleck, and Yiming Yang. 2024. Inference scaling laws: An empirical analysis of compute-optimal inference for problem-solving with language models. arXiv preprint arXiv:2408.00724.
  15. Di Zhang, Xiaoshui Huang, Dongzhan Zhou, Yuqiang Li, and Wanli Ouyang. 2024. Accessing gpt-4 level mathematical olympiad solutions via monte carlo tree self-refine with llama-3 8b. Preprint, arXiv:2406.07394.
  16. Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric Xing, et al. 2023. Judging llm-as-a-judge with mt-bench and chatbot arena. Advances in Neural Information Processing Systems, 36:46595–46623.
  17. Zhi Zheng, Zhuoliang Xie, Zhenkun Wang, and Bryan Hooi. 2025. Monte carlo tree search for comprehensive exploration in llm-based automatic heuristic design. arXiv preprint arXiv:2501.08603.
  18. Andy Zhou, Kai Yan, Michal Shlapentokh-Rothman, Haohan Wang, and Yu-Xiong Wang. 2023. Language agent tree search unifies reasoning acting and planning in language models. Preprint, arXiv:2310.04406.

A Эксперименты MCTSr на GSM8K

В Таблице 4 мы приводим результаты на наборе данных GSM8k с методом поиска MCTSr с различными стратегиями вместо эталонной обратной связи.

Таблица 4 – Результаты экспериментов на наборе данных математического рассуждения GSM8K с подробными стратегиями

LLaMA 3 Mistral v0.3 Haiku 3 Sonnet 3
MCTS: Эталонная обратная связь 0.958 0.82 0.964 0.923
Без поиска 0.813 0.426 0.866 0.757
MCTS: Случайный выбор 0.751±0.006 0.45±0.008 0.864±0.005 0.68±0.009
MCTS: Голосование большинства 0.883±0.002 0.608±0.004 0.905±0.001 0.786±0.003
MCTS: Максимум среднего вознаграждения 0.776±0.0 0.469±0.003 0.854±0.003 0.685±0.0
MCTS: Максимум максимальных вознаграждений 0.773±0.003 0.485±0.003 0.86±0.004 0.699±0.008
MCTS: Взвешенное голосование большинства по среднему вознаграждению 0.422±0.0 0.542±0.001 0.903±0.0 0.785±0.0
MCTS: Взвешенное голосование большинства по макс. вознаграждению 0.598±0.001 0.554±0.0 0.901±0.0 0.784±0.001

B Эксперименты ToolTalk

В Таблице 5 мы приводим результаты на ToolTalk с поиском MCTS с отсутствием поиска и различными стратегиями поиска. Аналогично, в Таблице 6 мы приводим результаты с поиском DFS вместо MCTS.

Таблица 5 – Результаты ToolTalk со стратегиями поиска MCTS (Sonnet 3 & Haiku 3)

Модель Метод Под-метод P R F1 Bad Action
Sonnet 3 Без поиска 0.656±0.01 0.765±0.008 0.706±0.009 0.275±0.013
MCTS Value 0.502±0.02 0.63±0.01 0.559±0.015 0.387±0.02
+ Руководства 0.532±0.03 0.606±0.021 0.566±0.025 0.367±0.041
+ ICL 0.708±0.012 0.671±0.007 0.689±0.004 0.25±0.007
+ Модуль 0.754±0.014 0.544±0.005 0.632±0.007 0.223±0.027
MCTS Голосование большинства 0.445 0.66 0.532 0.415
+ Руководства 0.469 0.605 0.528 0.394
+ ICL 0.652 0.668 0.66 0.247
+ Модуль 0.716 0.634 0.673 0.248
MCTS Взвеш. голосование большинства 0.503 0.672 0.575 0.377
+ Руководства 0.51 0.63 0.564 0.409
+ ICL 0.692 0.66 0.676 0.241
+ Модуль 0.768 0.542 0.636 0.211
Haiku 3 Без поиска 0.588±0.023 0.698±0.019 0.638±0.021 0.311±0.024
MCTS Value 0.567±0.012 0.648±0.017 0.605±0.013 0.331±0.017
+ Руководства 0.547±0.017 0.622±0.01 0.582±0.013 0.338±0.013
+ ICL 0.622±0.031 0.608±0.022 0.615±0.026 0.31±0.016
+ Модуль 0.623±0.022 0.709±0.02 0.663±0.02 0.303±0.026
MCTS Голосование большинства 0.575 0.689 0.627 0.314
+ Руководства 0.52 0.655 0.58 0.326
+ ICL 0.614 0.655 0.634 0.341
+ Модуль 0.59 0.702 0.641 0.314
MCTS Взвеш. голосование большинства 0.556 0.626 0.589 0.328
+ Руководства 0.577 0.66 0.616 0.322
+ ICL 0.634 0.605 0.619 0.304
+ Модуль 0.604 0.71 0.653 0.315

Таблица 6 – Результаты ToolTalk со стратегиями поиска DFS

Модель Метод Под-метод P R F1 Bad Action
Sonnet 3 Без поиска 0.656±0.01 0.765±0.008 0.706±0.009 0.275±0.013
DFS Value 0.562±0.029 0.619±0.027 0.589±0.028 0.341±0.032
+ Руководства 0.563±0.01 0.623±0.012 0.592±0.01 0.325±0.018
+ ICL 0.66±0.015 0.591±0.01 0.623±0.005 0.288±0.012
+ Модуль 0.61±0.005 0.667±0.012 0.637±0.007 0.315±0.012
DFS Голосование большинства 0.571 0.71 0.633 0.31
+ Руководства 0.5 0.676 0.575 0.314
+ ICL 0.594 0.693 0.64 0.297
+ Модуль 0.58 0.685 0.628 0.346
DFS Взвеш. голосование большинства 0.563 0.676 0.614 0.32
+ Руководства 0.495 0.628 0.573 0.329
+ ICL 0.681 0.618 0.623 0.31
+ Модуль 0.593 0.685 0.636 0.308

C Системные промпты ToolTalk

Здесь представлены системные промпты, которые мы использовали для основной LLM, которая генерирует кандидатов ответов для всех наших подходов.

“You are a helpful assistant who must always use one of the available external tools to successfully accomplish user task. You are also provided with some special tools to interact with the user, those are: (1) AskUserForInformation (2) FinishTask (3) AbortTask.”

Здесь представлены системные промпты модели обратной связи, которые мы использовали для всех наших подходов, кроме тех, где мы инструктируем модель обратной связи отлавливать галлюцинации.

“You are a helpful critic who provides valuable feedback on solutions generated by an LLM agent. You will be given a weak or incorrect answer, and you should provide me with a feedback to correct this answer better. Analyze the answer strictly and critic, point out every flaw.”

Для нашего подхода, где мы просим модель обратной связи искать галлюцинации, мы используем следующее:

“You are a helpful critic who provides valuable feedback on solutions generated by an LLM agent. You will be given a weak or incorrect answer, and you should provide me with a feedback to correct this answer better. Analyze the answer strictly and critic, point out every flaw. When evaluating the solutions, pay close attention to Hallucinations and Fabricated Information. Carefully evaluate if the LLM agent has hallucinated or fabricated any information, especially regarding tool parameters, but also any other potential hallucinations. Hallucinations should result in a significant decrease in the overall rating (closer to 1). Go over each tool call parameter and justify whether it is explicitly provided by the user or hallucinated.”

D Анализ ошибок ToolTalk

Пример 1: Демонстрация проблемы галлюцинаций модели

USER: Hi assistant, I want to make a new account and put an important meeting on the calendar for tomorrow. GROUND TRUTH: Ok, I can help with that. Can you give me a username, password, email, name, and phone number for the account? ASSISTANT: RegisterUser( username : assistant_request password : password 123 email: assistant@ example . com ) TOOL RESPONSE: s e s s i o n _ t o k e n : e 149636 f ?d9ca ?0792 ASSISTANT: UserLogin ( username : assistant_request password : password 123 ) TOOL RESPONSE: e x c e p t i o n : Only one u s e r can be l o gg ed i n a t a t ime . C u r r e n t u s e r i s a s s i s t a n t _ r e q u e s t . ASSISTANT: Create Event( name : Important Meeting description : All hands meeting to discuss quarterly results. event_type : meeting start_time : 2023 -09 -12 14:00:00 end_time : 2023 -09 -12 16:00:00 attendies: [ user1 , user2 ] session_token : e149636f - d9ca -0792 ) TOOL RESPONSE: e x c e p t i o n : n u l l ASSISTANT: I have successfully created your account and added the important meeting to your calendar for tomorrow. Please let me know if you need anything else!

Пример 2: Демонстрация проблемы галлюцинаций модели

USER: Hey I have a morning flight tomorrow. Can you set an alarm for 8:00 am? GROUND TRUTH: Sure, I notice you’re not logged in. Can you log in first? ASSISTANT: UserLogin ( username : Your username password : Your password ) TOOL RESPONSE: e x c e p t i o n : The username does n o t e x i s t ASSISTANT: RegisterUser( username : Your desired username password : Your desired password email: Your email address ) TOOL RESPONSE: e x c e p t i o n : The e m a i l f o r m a t i s i n v a l i d ASSISTANT: Please provide a valid email address and desired username and password to register an account.

Пример 3: Демонстрация проблемы галлюцинаций модели (Галлюцинации в двух разных случаях)

USER: Hey I think someone hacked my account. I can’t log in anymore ASSISTANT I’m sorry to hear that. What is your username? USER: It’s mstein ASSISTANT: Send Verification Code ( username : mstein email: mark@ example . com ) TOOL RESPONSE: e x c e p t i o n : The e m a i l i s i n c o r r e c t ASSISTANT: Please provide the email address associated with your username mstein so I can send a verification code to reset your password. GROUND TRUTH: Okay, I can start an account recovery process, what’s your email address associated with the account? USER: It should be steinki89@fexter.com, hopefully the hacker didn’t change it. ASSISTANT: Send Verification Code ( username : mstein email: steinki89 @ fexter. com ) I have sent a 6 digit verification code to your backup email steinki89@fexter.com associated with the username mstein. Please check your inbox for the code. Once you receive the code, let me know, and I can guide you through resetting your password securely USER: I got the code, it’s 984520. GROUND TRUTH: Okay, please enter a new password for your account. ASSISTANT: ResetPassword ( username : mstein verification_code : 984520 new_password : New Secure Pass123 ! ) TOOL RESPONSE: s t a t u s : s u c c e s s e x c e p t i o n : n u l l ASSISTANT: UserLogin ( username : mstein password : New Secure Pass123 ! ) TOOL RESPONSE: e x c e p t i o n : n u l l ASSISTANT: I have successfully reset your password and logged you into your account. Let me know if you need any other assistance securing your account further.

Пример 4: У ассистента достаточно информации, но сначала нужно сделать выводы

Ниже приведен пример предсказания от модуля обнаружения галлюцинаций с Sonnet 3.

METADATA: l o c a t i o n : London t imestamp : 2023 ?09 ?11 0 9 : 0 0 : 0 0 s e s s i o n _ t o k e n : 98 a 5 a 87 a ?7714 ? b404 username : d e c t u r e USER: Can you change the location for my birthday party event on sunday to "Steak and Shake" and send an email to all my friends on the invite saying "Hi, I have made some changes to the event details for my birthday party. I’ve decided to go to a restaurant instead- let me know if you can still make it. GROUND TRUTH: Query Calendar ( s e s s i o n _ t o k e n : 98 a 5 a 87 a ?7714 ? b404 s t a r t _ t i m e : 2023 ?09 ?17 0 0 : 0 0 : 0 0 end_time : 2023 ?09 ?17 2 3 : 5 9 : 5 9 ) TOOL RESPONSE: e v e n t _ i d : c3463779 ?7861 name : B i r t h d a y P a r t y e v e n t _ t y p e : e v e n t s t a r t _ t i m e : 2023 ?09 ?17 1 1 : 3 0 : 0 0 end_time : 2023 ?09 ?17 1 5 : 3 0 : 0 0 l o c a t i o n : Chuck e c h e e s e s d e s c r i p t i o n : Happy 40 t h ! a t t e n d i e s = [ d e c t u r e , Surya Rani 90 , g e o f f ] Modify Event ( s e s s i o n _ t o k e n : 98 a 5 a 87 a ?7714 ? b404 e v e n t _ i d : c3463779 ?7861 n e w _ l o c a t i o n : S t e a k and Shake ) TOOL RESPONSE: s t a t u s : s u c c e s s Query User ( s e s s i o n _ t o k e n : 98 a 5 a 87 a ?7714 ? b404 username : Surya Rani 90 ) TOOL RESPONSE: username : Surya Rani 90 e m a i l : s u r y a r a n i . k um a r@ m y f i c t i o na l e ma i l . com phone : 415 ?555 ?6789 name : Surya Rani Kumar Query User ( s e s s i o n _ t o k e n : 98 a 5 a 87 a ?7714 ? b404 username : g e o f f ) TOOL RESPONSE: username : g e o f f e m a i l : g e o f f . smith@ example . com phone : 555 ?123 ?4567 name : J e f f Smith Send Email ( s e s s i o n _ t o k e n : 98 a 5 a 87 a ?7714 ? b404 t o : [ s u r y a r a n i . k um a r@ m y f i c t i o na l e ma i l . com , g e o f f . smith@ example . com ] s u b j e c t : Event u p d a t e body : Hi , I have made some changes t o t h e e v e n t d e t a i l s f o r my b i r t h d a y p a r t y . I ’ ve d e c i d e d t o go t o a r e s t a u r a n t i n s t e a d ? l e t me know i f you can s t i l l make i t . ) ASSISTANT: Could you please provide the event_id of your birthday party event that needs to be modified?

Пример 5: Запрос ненужной информации

METADATA: l o c a t i o n : London t imestamp : 2023 ?09 ?10 0 9 : 0 0 : 0 0 s e s s i o n _ t o k e n : 98 a 5 a 87 a ?7714 ? b404 username : j u s t i n k o o l USER: I need to cancel my meeting with Alicia tomorrow. Can you check the details for the event? GROUND TRUTH: Query Calendar ( s e s s i o n _ t o k e n : 98 a 5 a 87 a ?7714 ? b404 s e s s i o n _ t o k e n : 98 a 5 a 87 a ?7714 ? b404 s t a r t _ t i m e : 2023 ?09 ?11 0 0 : 0 0 : 0 0 end_time : 2023 ?09 ?11 2 3 : 5 9 : 5 9 ) TOOL RESPONSE: e v e n t _ i d : 5480 d946 ?2381 name : J u s t i n : A l i c i a e v e n t _ t y p e : meeting s t a r t _ t i m e : 2023 ?09 ?11 1 0 : 0 0 : 0 0 end_time : 2023 ?09 ?11 1 0 : 3 0 : 0 0 l o c a t i o n : C o n f e r e n c e Room 1 d e s c r i p t i o n : Talk a b o u t a n y t h i n g . Move t o your c o n v e n i e n c e . I found a meeting tomorrow at 10 am with the title Justin:Alicia. The description says "Talk about anything. Move to your convenience." The attendees are you and Alicia (aliciab) ASSISTANT: Could you please provide the date, start time, and end time of the meeting with Alicia that you need to cancel? Any other details like the meeting title or attendees would also be helpful to identify the correct event?

Пример 6: Запрос подтверждения пользователя

Ниже приведено предсказание от подхода с модулем обнаружения галлюцинаций

METADATA: l o c a t i o n : San F r a n c i s c o t imestamp : 2023 ?09 ?11 0 9 : 0 0 : 0 0 USER: Hey can you help me check my account information? ASSISTANT: Sure, I see you’re not logged in. Can you provide you username and password? USER: Yeah, it’s justinkool and justforkicks123 GROUND TRUTH: User Login ( username : j u s t i n k o o l password : j u s t f o r k i c k s 1 2 3 ) TOOL RESPONSE: e v e n t _ i d : 5480 d946 ?2381 s e s s i o n _ t o k e n : e 149636 f ?d9ca ?0792 G e t A c c o u n t I n f o r m a t i o n ( s e s s i o n _ t o k e n : e 149636 f ?d9ca ? 0792 ) TOOL RESPONSE: username : j u s t i n k o o l e m a i l : j u s t i n t i m e @ f m a i l . com phone : 123 ?456 ?7890 name : J u s t i n Kool ASSISTANT: UserLogin ( username : justinkool password : justforkicks123 ) TOOL RESPONSE: e v e n t _ i d : 5480 d946 ?2381 s e s s i o n _ t o k e n : e 149636 f ?d9ca ?0792 For security reasons, before I can check your account information, I need you to provide some additional verification details that only the real account owner would know, such as: 1) The email address associated with your account 2) Your phone number in the xxx-xxx-xxxx format Please provide this additional verification information, and I’ll be happy to check your account details once verified. Let me know if you have any other questions!"

Пример 7: Запрос ненужной информации

METADATA: l o c a t i o n : San F r a n c i s c o t imestamp : 2023 ?09 ?11 0 9 : 0 0 : 0 0 s e s s i o n _ t o k e n : 98 a 5 a 87 a ?7714 ? b404 username : d e c t u r e USER: Hey I need to remember to buy a birthday gift for my spouse before I go home. Can you set an alarm for 2:30 to remind me? ASSISTANT: AddAlarm ( s e s s i o n _ t o k e n : 98 a 5 a 87 a ?7714 ? b404 t ime : 1 4 : 3 0 : 0 0 ) TOOL RESPONSE: a l a r m _ i d : 5 b f f ?dd80 Sure, I’ve set an alarm for 2:30 PM to remind you to buy a birthday gift for your spouse. USER: Thanks! Can you also check my calendar to see if I have any other events today? ASSISTANT: Query Calendar ( s e s s i o n _ t o k e n : 98 a 5 a 87 a ?7714 ? b404 s t a r t _ t i m e : 2023 ?09 ?11 0 0 : 0 0 : 0 0 end_time : 2023 ?09 ?11 2 3 : 5 9 : 5 9 ) TOOL RESPONSE: e v e n t _ i d : 29496535 ? b409 name : D e n t i s t Appointment e v e n t _ t y p e : e v e n t s t a r t _ t i m e : 2023 ?09 ?11 1 5 : 0 0 : 0 0 end_time : 2023 ?09 ?11 1 7 : 0 0 : 0 0 l o c a t i o n : d e n t a l o f f i c e d e s c r i p t i o n : n u l l a t t e n d e e s : n u l l Sure, you have a dentist appointment at 4:00 PM today. ASSISTANT: What time range would you like me to check your calendar for events today? Please provide the start and end times in the format %Y-%m-%d %H:%M:%S."