DOI: 10.48550/arXiv.2502.12094
Исследование использования поиска и самоотклика для рассуждений агентов
Karthikeyan K., Michelle Yuan, Elman Mansimov, Katerina Margatina, Anurag Pratik, Daniele Bonadiman, Monica Sunkara, Yi Zhang, Yassine Benajiba
Department of Computer Science, Duke University; Amazon Web Services
E-mail: karthikeyan.k@duke.edu, miyuan@amazon.com
Аннотация
Недавние работы показали, что внедрение поиска во время инференса (вывода) может значительно улучшить способности языковых агентов к рассуждению. Некоторые подходы могут использовать эталонные данные (ground truth) или полагаться на собственную обратную связь модели. Алгоритм поиска использует эту обратную связь для генерации значений, которые обновляют критерий исследования и эксплуатации различных путей рассуждения. В этом исследовании мы изучаем, как поиск и самоотклик модели (self-feedback) могут быть использованы для задач рассуждения. Во-первых, мы исследуем различия между эталонной обратной связью и самооткликом во время поиска для математических рассуждений. Во-вторых, мы наблюдаем ограничения в применении методов поиска к более сложным задачам, таким как вызов инструментов, и разрабатываем предметно-ориентированные подходы для устранения этих пробелов. Наши эксперименты выявляют проблемы, связанные с обобщением, при использовании исключительно самоотклика во время поиска. Для эффективной работы поиска требуется либо доступ к эталонным данным, либо механизмы обратной связи должны быть тщательно спроектированы под конкретную задачу.
1 Введение
Алгоритмы поиска традиционно полагались на эталонную обратную связь, особенно в таких областях, как игры, где условия победы/поражения дают четкие сигналы для принятия решений [8]. Некоторые недавние работы показали потенциал внедрения поиска во время инференса модели для улучшения рассуждений [5], [18], [15]. Обычно процесс поиска требует обратной связи о правильности кандидатов решений. В то время как такая обратная связь традиционно поступала от внешней верификации, в недавних работах изучалось использование собственной оценки модели в качестве обратной связи во время поиска. Использование самоотклика мотивировано появляющимися доказательствами способности агента к самокоррекции и самоусовершенствованию [13], [1]. Это направление особенно интересно, так как оно предполагает потенциал для моделей направлять свой собственный процесс поиска и развиваться, не полагаясь на внешнюю проверку, приближая нас к более обобщенным, автономным агентам [10].
Однако при реализации поиска для рассуждений возникает критический вопрос: насколько ценна собственная обратная связь модели для направления процесса поиска? Хотя модели могут быть компетентными судьями в некоторых сценариях [16], их способность надежно оценивать собственные выходные данные во время поиска остается под вопросом. Это становится особенно важным, когда эталонная обратная связь недоступна, как это часто бывает в реальных приложениях. В этом исследовании мы изучаем этот вопрос на примере двух различных задач: математическое рассуждение (GSM8K [2]) и вызов инструментов (ToolTalk [3]). Наш анализ на GSM8K показывает, что, хотя поиск сам по себе ценен, использование самоотклика модели для направления поиска может быть неоптимальным. Вместо этого другие стратегии, такие как голосование большинства по нескольким узлам во время поиска, оказываются более эффективными. Затем мы расширяем наше исследование на вызов инструментов — более сложную область, включающую стратегическое принятие решений и выбор параметров. Здесь мы обнаруживаем, что поиск с самооткликом может фактически ухудшить производительность. Это приводит нас к изучению предметно-ориентированных подходов для дополнения механизмов обратной связи, включая примеры в контексте (in-context examples) и специализированные модули верификации.
Хотя перспектива самосовершенствующихся моделей через обратную связь и поиск остается привлекательной, текущая реальность использования самоотклика в поиске требует тщательного переосмысления. Это подчеркивает разрыв между ранее продемонстрированными способностями моделей к самокоррекции в некоторых сценариях и их надежностью в направлении процессов поиска для рассуждений. В целом, это указывает на необходимость более проработанных механизмов обратной связи, адаптированных к конкретным задачам [17], или альтернативных подходов для использования самоотклика вне поиска [1]. Эти выводы согласуются с недавними прорывами в генеративном ИИ, которые также упоминают ограничения поиска и самоотклика для рассуждений агентов [4].
2 Связанные работы
Недавние исследования широко изучали методы повышения производительности LLM с помощью передовых подходов к вычислениям во время тестирования (test-time compute). Wu et al. [14] исследуют поведение масштабирования стратегий выборки, в то время как Muennighoff et al. [9] показывают положительные результаты с простым подходом масштабирования во время тестирования, называемым budget forcing. Недавние работы подчеркивают растущий потенциал самоотклика [13], [1]. Аналогично, существует критика относительно того, могут ли модели действительно оценивать и исправлять свои собственные выходные данные [12], [7].
Помимо выборки и итеративного улучшения, другие работы предлагают использовать поиск по дереву Монте-Карло (MCTS) в качестве более структурированного подхода к улучшению рассуждений [5], [18], [15]. MCTS может эффективно исследовать пространство поиска, балансируя между исследованием (exploration) и эксплуатацией (exploitation) с использованием критерия UCT:
где Q(s, a) — это Q-значение выполнения действия a из узла s. N(s) и N(c(s, a)) — это количество посещений узла s и его дочерних элементов c(s, a) соответственно. На этапах расширения и симуляции (rollouts) создается новый узел, и Q-значение, соответствующее действию, создавшему узел, инициализируется вознаграждениями и обновляется во время обратного распространения. Эти вознаграждения будут основаны на каком-либо источнике обратной связи, будь то эталонные данные или другой источник верификации. Таким образом, качество этой обратной связи имеет решающее значение для успешной работы поиска.
3 Поиск без эталонной обратной связи
В этом разделе мы исследуем использование собственной обратной связи модели для поиска в наборе данных математического рассуждения GSM8K. Мы опираемся на фреймворк MCTSr (MCTS with Self-Refine) [15], который вычисляет Q-значение на основе отклика модели на ее сгенерированное решение. Один нюанс с MCTSr заключается в том, что метод изначально предполагает доступ к эталонной обратной связи для ранней остановки и выбора ответа. Доступ к эталонной обратной связи уместен для таких игр, как шахматы и Го. В других сценариях доступ к эталонной обратной связи может отсутствовать. Возникает вопрос: можем ли мы по-прежнему использовать самоотклик модели или другие сигналы для эффективного направления поиска? Чтобы ответить на это, мы исследуем альтернативные стратегии выбора ответа и оцениваем их производительность в отсутствие эталонной обратной связи.
3.1 Экспериментальная установка
Мы оцениваем наши подходы на наборе данных GSM8K, который стал стандартным бенчмарком для оценки способностей к математическому рассуждению в языковых моделях. Наши эксперименты включают как модели с закрытым исходным кодом, так и открытые языковые модели, включая Llama 3 Instruct (70B), Mistral v0.3 (7B), Claude 3 Haiku и Claude 3 Sonnet.
Для каждой модели мы сначала устанавливаем базовую производительность посредством прямой генерации без каких-либо механизмов поиска. Затем мы запускаем MCTSr с эталонной проверкой, чтобы установить верхнюю границу производительности, представляющую наилучший сценарий, где доступна эталонная обратная связь. Наконец, мы запускаем MCTS, используя наши предложенные стратегии выбора, которые не требуют эталонной обратной связи:
- Случайный выбор: Узел из дерева поиска выбирается случайным образом в качестве окончательного ответа. Этот подход служит базовой линией для измерения эффективности более сложных методов выбора.
- Голосование большинства: Мы группируем окончательные числовые ответы из всех узлов в дереве поиска и выбираем ответ, который встречается наиболее часто. Эта стратегия агрегирует предсказания модели, предполагая, что наиболее частый ответ, вероятно, является правильным.
- Максимальное вознаграждение: Узел с наивысшим баллом вознаграждения от самоотклика выбирается в качестве окончательного ответа. Этот подход полагается на способность модели оценивать собственные решения, предполагая, что более высокие баллы вознаграждения соответствуют лучшим ответам.
Для предложенных стратегий выбора мы не выполняем раннюю остановку и вместо этого проводим поиск в течение максимум 10 итераций MCTS. В Таблице 1 мы приводим точность на GSM8K с базовой линией без поиска, MCTSr с доступом к эталонной обратной связи и предложенными альтернативами, обсужденными выше. В Приложении A мы приводим подробные результаты вместе с другими стратегиями агрегации, например, основанными на средних вознаграждениях или взвешенном голосовании большинства.
Таблица 1 – Результаты экспериментов на наборе данных математического рассуждения GSM8K
| Llama 3 | Mistral v0.3 | Haiku 3 | Sonnet 3 | |
|---|---|---|---|---|
| Без поиска | 0.813 | 0.426 | 0.866 | 0.757 |
| MCTS: Эталонная обратная связь | 0.958 | 0.82 | 0.964 | 0.923 |
| MCTS: Случайный выбор | 0.751 | 0.45 | 0.864 | 0.680 |
| MCTS: Голосование большинства | 0.883 | 0.608 | 0.905 | 0.786 |
| MCTS: Максимальное вознаграждение | 0.776 | 0.469 | 0.854 | 0.685 |
3.2 Анализ
В Таблице 1 проверка по эталону играет огромную роль. Во всех моделях наблюдается улучшение точности как минимум на ? 10% при использовании оригинальной реализации MCTSr с эталонной проверкой по сравнению с отсутствием поиска. Однако без доступа к эталонной обратной связи наиболее перспективной альтернативой, по-видимому, является голосование большинства, а не выбор ответа с максимальным вознаграждением, полученным от самоотклика. Стратегии, основанные на вознаграждении и случайном выборе, похоже, немного улучшают производительность для некоторых моделей и ухудшают для других. Это указывает на то, что самоотклик не может быть надежным источником для предоставления вознаграждений для выбора ответов во время поиска.
4 Поиск с дополненной обратной связью
В этом разделе исследуется применение поиска в более сложной области вызова инструментов, конкретно используя набор данных ToolTalk [3]. В отличие от задач математического рассуждения, где есть один ответ и проверка относительно проста, ToolTalk представляет собой значительно более тонкую задачу. Набор данных состоит из многоходовых диалогов, где агенты должны понимать намерения пользователя, решать, когда вызывать инструменты, а когда просить разъяснений, и гарантировать, что все параметры инструментов обоснованы контекстом разговора. Оценка ToolTalk выполняется с использованием принудительного обучения (teacher forcing), где мы обуславливаем историю разговора на основе эталонного разговора и оцениваем ответ агента. В каждом ходе может быть от нуля до нескольких вызовов инструментов, и оценка ToolTalk последовательно декодирует один вызов инструмента за раз. Если ответ агента содержит текст без вызовов инструментов, это считается завершением хода; если он содержит вызов инструмента, инструмент выполняется с предоставленными параметрами, и результат возвращается агенту для продолжения генерации.
Сложность ToolTalk проистекает из его открытого характера и стратегических решений, требуемых на каждом ходе. Агенты должны не только понимать, какие инструменты доступны, но и определять подходящий момент для их использования. Успешный ответ часто требует поддержания связности на протяжении нескольких ходов, при этом избегая распространенной ошибки: галлюцинации параметров, когда модели фабрикуют правдоподобные, но неверные параметры инструментов. Это представляет собой фундаментальное отличие от задач математического рассуждения, где проблема заключается преимущественно в вычислительной логике, а не в стратегическом принятии решений.
4.1 Пробелы в поиске для вызова инструментов
Мы следуем той же настройке оценки, что и в ToolTalk. Мы сравниваем базовую линию без поиска с использованием MCTS с самоусовершенствованием (self-refine). В этой настройке каждый узел представляет собой полное решение, сгенерированное агентом с функциональностью вызова инструментов, сопровождаемое собственной обратной связью с использованием общего системного промпта для получения обратной связи. Обратите внимание, что мы не выполняем инструменты во время процесса поиска, так как некоторые выполнения инструментов в реальных сценариях могут иметь необратимые последствия. После завершения поиска мы проходим по всем узлам в дереве и выбираем тот, у которого наивысшее вознаграждение.
Анализ: В Таблице 2 мы сравниваем базовую линию без поиска с поиском self-refine. Мы наблюдаем, что базовая линия без поиска работает лучше, чем поиск, что указывает на то, что self-refine может быть вредным [6]. Мы наблюдаем галлюцинации параметров инструментов как основную причину ошибок (пожалуйста, обратитесь к Приложению D для примеров). В частности, когда пользователь просит агента выполнить задачу с недостаточной информацией, вместо того чтобы задать уточняющий вопрос, агент проявляет склонность к преждевременным запросам на вызов инструментов с неполными или галлюцинированными параметрами [11]. Например, когда пользователь просит зарегистрировать аккаунт, агент часто галлюцинирует фиктивные учетные данные, такие как "newuser" или "newpassword". Более того, даже модель обратной связи и вознаграждения не улавливает эти галлюцинации в параметрах инструментов.
Таблица 2 – Сравнение использования и неиспользования поиска для набора данных вызова инструментов ToolTalk
| Sonnet 3 | Haiku 3 | |||||
|---|---|---|---|---|---|---|
| Precision | Recall | F1 | Precision | Recall | F1 | |
| Без поиска | 0.656 | 0.765 | 0.706 | 0.588 | 0.698 | 0.638 |
| MCTS | 0.502 | 0.630 | 0.559 | 0.567 | 0.648 | 0.605 |
4.2 Дополнение обратной связи большим количеством источников
Чтобы смягчить низкое качество обратной связи в поиске, мы исследуем три стратегии:
- Дополнение руководствами: Мы уточняем системный промпт модели обратной связи и инструктируем ее специально наказывать за галлюцинации.
- Дополнение примерами ICL: Мы вручную аннотируем несколько примеров в контексте (ICL) для модели обратной связи, где эти примеры иллюстрируют как галлюцинированные, так и фактические ответы агента, наряду с их соответствующими вознаграждениями.
- Дополнение модулем обнаружения галлюцинаций: Мы дополняем обратную связь отдельным модулем обнаружения галлюцинаций. Этот модуль проходит по каждому параметру инструмента и спрашивает модель, предоставлен ли параметр пользователем. Если ответ отрицательный, то параметр считается галлюцинированным. После того как мы пройдем по всем параметрам индивидуально, мы агрегируем их, чтобы сформировать решение о галлюцинации. Наконец, мы передаем ответ агента вместе с этим решением о галлюцинации модели обратной связи для генерации общей оценки.
Мы приводим показатели точности (precision), полноты (recall) и F1 для всех трех стратегий (Таблица 3). Пожалуйста, обратитесь к Приложению C для системных промптов.
Анализ: Таблица 3 показывает, что уточнение системного промпта неэффективно, так как результаты ухудшились по сравнению с общим системным промптом. Включение примеров в контексте помогает, особенно с точностью. Наконец, с модулем обнаружения галлюцинаций точность значительно возрастает, но полнота также значительно падает. При внимательном рассмотрении мы наблюдаем меньше галлюцинаций, но выбранные ответы склонны просить пользователя о подтверждении или ненужной информации. Например, когда пользователь просит удалить аккаунт, даже если вся необходимая информация присутствует, модель просит пользователя подтвердить. Пожалуйста, обратитесь к Приложению D за несколькими примерами, иллюстрирующими это поведение.
Таблица 3 – Стратегии создания лучших механизмов обратной связи на ToolTalk
| Дополнение руководствами | Дополнение ICL | Дополнение модулем | |||||||
|---|---|---|---|---|---|---|---|---|---|
| P | R | F1 | P | R | F1 | P | R | F1 | |
| Sonnet 3 | 0.532 | 0.606 | 0.566 | 0.708 | 0.671 | 0.689 | 0.754 | 0.544 | 0.632 |
| Haiku 3 | 0.547 | 0.622 | 0.582 | 0.622 | 0.608 | 0.615 | 0.623 | 0.709 | 0.663 |
5 Заключение
В этой работе мы проводим исследование по интеграции самоотклика в поиск для рассуждений агентов. В то время как поиск остается ценным методом для повышения производительности модели, наши результаты показывают, что полагаться на самоотклик может быть неоптимально или даже вредно в определенных контекстах. Эти идеи имеют значение для разработки обобщенных, автономных агентов. Вместо того чтобы преследовать чисто самонаправляемые подходы, наша работа указывает на то, что успешные реализации поиска могут потребовать тщательно спроектированных, предметно-ориентированных механизмов обратной связи или гибридных подходов, сочетающих самоусовершенствование с другими стратегиями верификации.
6 Ограничения
Будучи короткой статьей, мы ограничили наш объем конкретными методами поиска (MCTS) и областями (математическое рассуждение и вызов инструментов). Этот сфокусированный подход позволяет провести углубленный анализ в рамках выбранных нами контекстов. Будущие исследования могут опираться на эти выводы, исследуя дополнительные области рассуждений, алгоритмы поиска и наборы данных, потенциально раскрывая больше закономерностей в самоотклике в различных задачах рассуждения. Также можно провести больше исследований по дополнению самоотклика для поиска с помощью других подходов.
References
- Jiefeng Chen, Jie Ren, Xinyun Chen, Chengrun Yang, Ruoxi Sun, and Sercan ? Ar?k. 2025. Sets: Leveraging self-verification and self-correction for improved test-time scaling. arXiv preprint arXiv:2501.19306.
- Karl Cobbe, Vineet Kosaraju, Mohammad Bavarian, Mark Chen, Heewoo Jun, Lukasz Kaiser, Matthias Plappert, Jerry Tworek, Jacob Hilton, Reiichiro Nakano, Christopher Hesse, and John Schulman. 2021. Training verifiers to solve math word problems. arXiv preprint arXiv:2110.14168.
- Nicholas Farn and Richard Shin. 2023. Tooltalk: Evaluating tool-usage in a conversation setting. arXiv preprint arXiv:2311.10775.
- Daya Guo, Dejian Yang, Haowei Zhang, Junxiao Song, Ruoyu Zhang, Runxin Xu, Qihao Zhu, Shirong Ma, Peiyi Wang, Xiao Bi, et al. 2025. Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning. arXiv preprint arXiv:2501.12948.
- Shibo Hao, Yi Gu, Haodi Ma, Joshua Hong, Zhen Wang, Daisy Wang, and Zhiting Hu. 2023. Reasoning with language model is planning with world model. In Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing, pages 8154–8173, Singapore. Association for Computational Linguistics.
- Jie Huang, Xinyun Chen, Swaroop Mishra, Huaixiu Steven Zheng, Adams Wei Yu, Xinying Song, and Denny Zhou. 2024. Large language models cannot self-correct reasoning yet. Preprint, arXiv:2310.01798.
- Subbarao Kambhampati, Karthik Valmeekam, Lin Guan, Mudit Verma, Kaya Stechly, Siddhant Bhambri, Lucas Paul Saldyt, and Anil B Murthy. 2024. Position: LLMs can’t plan, but can help planning in LLM-modulo frameworks. In Forty-first International Conference on Machine Learning.
- Donald Knuth. 1998. The Art of Computer Programming: Sorting and Searching, volume 3. Addison-Wesley Professional, Boston.
- Niklas Muennighoff, Zitong Yang, Weijia Shi, Xiang Lisa Li, Li Fei-Fei, Hannaneh Hajishirzi, Luke Zettlemoyer, Percy Liang, Emmanuel Cand?s, and Tatsunori Hashimoto. 2025. s1: Simple test-time scaling. arXiv preprint arXiv:2501.19393.
- Pranav Putta, Edmund Mills, Naman Garg, Sumeet Motwani, Chelsea Finn, Divyansh Garg, and Rafael Rafailov. 2024. Agent q: Advanced reasoning and learning for autonomous ai agents. arXiv preprint arXiv:2408.07199.
- Omar Shaikh, Kristina Gligoric, Ashna Khetan, Matthias Gerstgrasser, Diyi Yang, and Dan Jurafsky. 2024. Grounding gaps in language model generations. In Proceedings of the 2024 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (Volume 1: Long Papers), pages 6279–6296, Mexico City, Mexico. Association for Computational Linguistics.
- Kaya Stechly, Karthik Valmeekam, and Subbarao Kambhampati. 2024. On the self-verification limitations of large language models on reasoning and planning tasks. Preprint, arXiv:2402.08115.
- Yixuan Weng, Minjun Zhu, Fei Xia, Bin Li, Shizhu He, Shengping Liu, Bin Sun, Kang Liu, and Jun Zhao. 2023. Large language models are better reasoners with self-verification. In The 2023 Conference on Empirical Methods in Natural Language Processing.
- Yangzhen Wu, Zhiqing Sun, Shanda Li, Sean Welleck, and Yiming Yang. 2024. Inference scaling laws: An empirical analysis of compute-optimal inference for problem-solving with language models. arXiv preprint arXiv:2408.00724.
- Di Zhang, Xiaoshui Huang, Dongzhan Zhou, Yuqiang Li, and Wanli Ouyang. 2024. Accessing gpt-4 level mathematical olympiad solutions via monte carlo tree self-refine with llama-3 8b. Preprint, arXiv:2406.07394.
- Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric Xing, et al. 2023. Judging llm-as-a-judge with mt-bench and chatbot arena. Advances in Neural Information Processing Systems, 36:46595–46623.
- Zhi Zheng, Zhuoliang Xie, Zhenkun Wang, and Bryan Hooi. 2025. Monte carlo tree search for comprehensive exploration in llm-based automatic heuristic design. arXiv preprint arXiv:2501.08603.
- Andy Zhou, Kai Yan, Michal Shlapentokh-Rothman, Haohan Wang, and Yu-Xiong Wang. 2023. Language agent tree search unifies reasoning acting and planning in language models. Preprint, arXiv:2310.04406.
A Эксперименты MCTSr на GSM8K
В Таблице 4 мы приводим результаты на наборе данных GSM8k с методом поиска MCTSr с различными стратегиями вместо эталонной обратной связи.
Таблица 4 – Результаты экспериментов на наборе данных математического рассуждения GSM8K с подробными стратегиями
| LLaMA 3 | Mistral v0.3 | Haiku 3 | Sonnet 3 | |
|---|---|---|---|---|
| MCTS: Эталонная обратная связь | 0.958 | 0.82 | 0.964 | 0.923 |
| Без поиска | 0.813 | 0.426 | 0.866 | 0.757 |
| MCTS: Случайный выбор | 0.751±0.006 | 0.45±0.008 | 0.864±0.005 | 0.68±0.009 |
| MCTS: Голосование большинства | 0.883±0.002 | 0.608±0.004 | 0.905±0.001 | 0.786±0.003 |
| MCTS: Максимум среднего вознаграждения | 0.776±0.0 | 0.469±0.003 | 0.854±0.003 | 0.685±0.0 |
| MCTS: Максимум максимальных вознаграждений | 0.773±0.003 | 0.485±0.003 | 0.86±0.004 | 0.699±0.008 |
| MCTS: Взвешенное голосование большинства по среднему вознаграждению | 0.422±0.0 | 0.542±0.001 | 0.903±0.0 | 0.785±0.0 |
| MCTS: Взвешенное голосование большинства по макс. вознаграждению | 0.598±0.001 | 0.554±0.0 | 0.901±0.0 | 0.784±0.001 |
B Эксперименты ToolTalk
В Таблице 5 мы приводим результаты на ToolTalk с поиском MCTS с отсутствием поиска и различными стратегиями поиска. Аналогично, в Таблице 6 мы приводим результаты с поиском DFS вместо MCTS.
Таблица 5 – Результаты ToolTalk со стратегиями поиска MCTS (Sonnet 3 & Haiku 3)
| Модель | Метод | Под-метод | P | R | F1 | Bad Action |
|---|---|---|---|---|---|---|
| Sonnet 3 | Без поиска | 0.656±0.01 | 0.765±0.008 | 0.706±0.009 | 0.275±0.013 | |
| MCTS Value | 0.502±0.02 | 0.63±0.01 | 0.559±0.015 | 0.387±0.02 | ||
| + Руководства | 0.532±0.03 | 0.606±0.021 | 0.566±0.025 | 0.367±0.041 | ||
| + ICL | 0.708±0.012 | 0.671±0.007 | 0.689±0.004 | 0.25±0.007 | ||
| + Модуль | 0.754±0.014 | 0.544±0.005 | 0.632±0.007 | 0.223±0.027 | ||
| MCTS Голосование большинства | 0.445 | 0.66 | 0.532 | 0.415 | ||
| + Руководства | 0.469 | 0.605 | 0.528 | 0.394 | ||
| + ICL | 0.652 | 0.668 | 0.66 | 0.247 | ||
| + Модуль | 0.716 | 0.634 | 0.673 | 0.248 | ||
| MCTS Взвеш. голосование большинства | 0.503 | 0.672 | 0.575 | 0.377 | ||
| + Руководства | 0.51 | 0.63 | 0.564 | 0.409 | ||
| + ICL | 0.692 | 0.66 | 0.676 | 0.241 | ||
| + Модуль | 0.768 | 0.542 | 0.636 | 0.211 | ||
| Haiku 3 | Без поиска | 0.588±0.023 | 0.698±0.019 | 0.638±0.021 | 0.311±0.024 | |
| MCTS Value | 0.567±0.012 | 0.648±0.017 | 0.605±0.013 | 0.331±0.017 | ||
| + Руководства | 0.547±0.017 | 0.622±0.01 | 0.582±0.013 | 0.338±0.013 | ||
| + ICL | 0.622±0.031 | 0.608±0.022 | 0.615±0.026 | 0.31±0.016 | ||
| + Модуль | 0.623±0.022 | 0.709±0.02 | 0.663±0.02 | 0.303±0.026 | ||
| MCTS Голосование большинства | 0.575 | 0.689 | 0.627 | 0.314 | ||
| + Руководства | 0.52 | 0.655 | 0.58 | 0.326 | ||
| + ICL | 0.614 | 0.655 | 0.634 | 0.341 | ||
| + Модуль | 0.59 | 0.702 | 0.641 | 0.314 | ||
| MCTS Взвеш. голосование большинства | 0.556 | 0.626 | 0.589 | 0.328 | ||
| + Руководства | 0.577 | 0.66 | 0.616 | 0.322 | ||
| + ICL | 0.634 | 0.605 | 0.619 | 0.304 | ||
| + Модуль | 0.604 | 0.71 | 0.653 | 0.315 |
Таблица 6 – Результаты ToolTalk со стратегиями поиска DFS
| Модель | Метод | Под-метод | P | R | F1 | Bad Action |
|---|---|---|---|---|---|---|
| Sonnet 3 | Без поиска | 0.656±0.01 | 0.765±0.008 | 0.706±0.009 | 0.275±0.013 | |
| DFS Value | 0.562±0.029 | 0.619±0.027 | 0.589±0.028 | 0.341±0.032 | ||
| + Руководства | 0.563±0.01 | 0.623±0.012 | 0.592±0.01 | 0.325±0.018 | ||
| + ICL | 0.66±0.015 | 0.591±0.01 | 0.623±0.005 | 0.288±0.012 | ||
| + Модуль | 0.61±0.005 | 0.667±0.012 | 0.637±0.007 | 0.315±0.012 | ||
| DFS Голосование большинства | 0.571 | 0.71 | 0.633 | 0.31 | ||
| + Руководства | 0.5 | 0.676 | 0.575 | 0.314 | ||
| + ICL | 0.594 | 0.693 | 0.64 | 0.297 | ||
| + Модуль | 0.58 | 0.685 | 0.628 | 0.346 | ||
| DFS Взвеш. голосование большинства | 0.563 | 0.676 | 0.614 | 0.32 | ||
| + Руководства | 0.495 | 0.628 | 0.573 | 0.329 | ||
| + ICL | 0.681 | 0.618 | 0.623 | 0.31 | ||
| + Модуль | 0.593 | 0.685 | 0.636 | 0.308 |
C Системные промпты ToolTalk
Здесь представлены системные промпты, которые мы использовали для основной LLM, которая генерирует кандидатов ответов для всех наших подходов.
Здесь представлены системные промпты модели обратной связи, которые мы использовали для всех наших подходов, кроме тех, где мы инструктируем модель обратной связи отлавливать галлюцинации.
Для нашего подхода, где мы просим модель обратной связи искать галлюцинации, мы используем следующее:
D Анализ ошибок ToolTalk
Пример 1: Демонстрация проблемы галлюцинаций модели
Пример 2: Демонстрация проблемы галлюцинаций модели
Пример 3: Демонстрация проблемы галлюцинаций модели (Галлюцинации в двух разных случаях)
Пример 4: У ассистента достаточно информации, но сначала нужно сделать выводы
Ниже приведен пример предсказания от модуля обнаружения галлюцинаций с Sonnet 3.
Пример 5: Запрос ненужной информации
Пример 6: Запрос подтверждения пользователя
Ниже приведено предсказание от подхода с модулем обнаружения галлюцинаций
Пример 7: Запрос ненужной информации