вернуться в раздел "Научные труды"
Автор перевода: Н.Н. Дворник
Источник: Jiaxuan You, Mingjie Liu, Shrimai Prabhumoye, Mostofa Patwary, Mohammad Shoeybi, and Bryan Catanzaro. 2024. LLM-Evolve: Evaluation for LLM’s Evolving Capability on Benchmarks. In Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing, pages 16937–16942, Miami, Florida, USA. Association for Computational Linguistics. DOI: 10.18653/v1/2024.emnlp-main.940 .

DOI: 10.18653/v1/2024.emnlp-main.940

LLM-Evolve: Оценка развивающихся способностей LLM на бенчмарках

Jiaxuan You, Mingjie Liu, Shrimai Prabhumoye, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro

NVIDIA

E-mail: jiaxuany@nvidia.com, mingjiel@nvidia.com, sprabhumoye@nvidia.com, mpatwary@nvidia.com, mshoeybi@nvidia.com, bcatanzaro@nvidia.com

Аннотация

Развитие больших языковых моделей (LLM) расширило область их применения до динамических и интерактивных реальных задач, где модели непрерывно взаимодействуют с окружающей средой и потенциально улучшают свою производительность с течением времени. Большинство существующих бенчмарков LLM оценивают модели на независимых и одинаково распределенных (i.i.d.) задачах, упуская из виду их способность итеративно учиться на прошлом опыте. Наша статья устраняет этот пробел в оценке, предлагая новую структуру, LLM-Evolve, которая расширяет установленные бенчмарки до сценариев последовательного решения задач. LLM-Evolve оценивает LLM в течение нескольких раундов, предоставляя обратную связь после каждого раунда для создания памяти демонстраций, к которой модели могут обращаться в будущих задачах. Мы применили LLM-Evolve к бенчмаркам MMLU, GSM8K и AgentBench, протестировав 8 современных моделей с открытым и закрытым исходным кодом. Результаты показывают, что LLM могут достигать улучшения производительности до 17%, обучаясь на прошлых взаимодействиях, при этом качество алгоритмов поиска и обратной связи существенно влияет на эту способность. Эти выводы говорят в пользу необходимости более глубокого понимания и создания бенчмарков для производительности LLM в развивающихся интерактивных сценариях.

1 Введение

Быстрое развитие LLM расширило их применение до динамических и интерактивных реальных сценариев, известных как агенты на базе LLM. В этих контекстах LLM непрерывно взаимодействуют со своей средой, и их производительность может развиваться на основе этих взаимодействий. Несмотря на эти достижения, стандартные бенчмарки для оценки LLM, такие как бенчмарк MMLU (Hendrycks et al., 2020), рассматривают каждую задачу как выборку i.i.d. Этот традиционный подход не позволяет оценить способность LLM учиться на прошлом опыте и улучшать свою производительность с течением времени.

Наше исследование решает эту проблему, изучая, можно ли адаптировать существующие бенчмарки для оценки способностей LLM в сценариях итеративного решения задач. Хотя разработка совершенно новых бенчмарков могла бы дать представление о самоэволюции LLM, этот процесс часто является ресурсоемким и дорогостоящим. В качестве альтернативы, объединение или выборка из существующих бенчмарков, как это видно в недавних работах (Sakaguchi et al., 2021; Wang et al., 2023; Gema et al., 2024), обеспечивает более осуществимое решение, но все же требует обширных вычислительных ресурсов для повторного проведения оценок для всех участвующих LLM. Вместо этого мы выбрали другой подход: изменение настроек установленных бенчмарков, таких как MMLU, без изменения их наборов тестов и метрик. Этот метод предлагает гибкость, удобство и прямую сопоставимость с результатами существующих бенчмарков, позволяя глубже понять, как LLM улучшаются, используя предыдущие взаимодействия.

В этой статье мы представляем LLM-Evolve, новую структуру оценки, которая трансформирует популярные бенчмарки LLM в формат последовательного решения задач. В рамках LLM-Evolve LLM оцениваются в течение нескольких раундов, где среда предоставляет обратную связь по результатам каждого раунда для информирования последующих оценок LLM. В частности, структура сохраняет входные данные, выходные данные и обратную связь данной LLM в память демонстраций, к которой модель затем может обращаться в будущих раундах для извлечения релевантного опыта для обучения на нескольких примерах (few-shot learning) при решении новых задач. Этот итеративный процесс позволяет нам измерить, насколько эффективно LLM может использовать свой прошлый опыт для развития своих возможностей с течением времени.

Мы применяем структуру LLM-Evolve к трем известным бенчмаркам: MMLU для общих языковых задач, GSM8K для решения математических задач (Cobbe et al., 2021) и AgentBench (Liu et al., 2023), который оценивает способности LLM к многораундовому взаимодействию. Наши эксперименты включают модели с закрытым исходным кодом, в том числе семейство GPT, и модели с открытым исходным кодом, включая семейство Llama, Mistral и Qwen2, с фиксированной температурой генерации 0, чтобы исключить влияние случайного угадывания. Результаты показывают постоянный прирост прогностической производительности на 1-17% по всем бенчмаркам, демонстрируя эффективность LLM в обучении на своем прошлом опыте.

Дальнейший анализ показывает, что качество алгоритма поиска и сигналов обратной связи существенно влияет на развивающиеся способности LLM, и что более способные LLM, как правило, получают меньше пользы от многораундовых взаимодействий. Эти интересные выводы подчеркивают потенциал адаптации существующих бенчмарков для обеспечения более систематической оценки LLM в динамических и интерактивных средах.

Overview of LLM-Evolve pipeline

Рисунок 1 – Обзор конвейера LLM-Evolve. В каждом раунде оценки пары вход-выход LLM с положительной обратной связью будут сохранены в память демонстраций, которая может быть извлечена с помощью плотного ретривера (dense retriever) в качестве демонстрации (few-shot) в следующем раунде оценки LLM-Evolve.

2 Связанные работы

Внутриконтекстное обучение на основе поиска. Большинство бенчмарков LLM оценивают способность модели в режиме few-shot, где фиксированные демонстрации предоставляются в качестве контекста для данного запроса (Hendrycks et al., 2020; Cobbe et al., 2021; Liu et al., 2023). (Xu et al., 2024) предоставляют всесторонний обзор алгоритмов для поиска релевантных демонстраций, адаптированных для каждого входного запроса. Мы расширяем эту идею, чтобы адаптировать известные бенчмарки LLM к интерактивной настройке и получить представление о производительности современных LLM.

Бенчмарки LLM, полученные из существующих. Исследователи расширили существующие бенчмарки LLM для изучения различных свойств LLM. Например, Winogrande (Sakaguchi et al., 2021) был представлен для уменьшения предвзятости в Winograd (Levesque et al., 2012). MMLU-Redux (Gema et al., 2024) — это подмножество из 3000 вручную переаннотированных вопросов MMLU, используемое для изучения расхождений с метриками производительности модели, о которых сообщалось изначально. MMLU-Pro (Wang et al., 2024) делает оригинальный MMLU более надежным, особенно в вопросах, ориентированных на рассуждения. Наша работа расширяет настройки существующих бенчмарков LLM для изучения интерактивных развивающихся способностей LLM. Она также выявляет корреляции между проблемами бенчмарка, что может помочь создать более разнообразные и надежные бенчмарки LLM в будущем.

Саморазвивающиеся LLM. В связи с ростом размера и возможностей LLM, недавние усилия позволили улучшить точность модели в нисходящих задачах с использованием методов, основанных на выводе, таких как уточнение сгенерированного результата с помощью обратной связи (Madaan et al., 2024; Shinn et al., 2023), и обучение на ошибках в ICL (in-context learning) путем понимания основных принципов (Zhang et al., 2024). Мы отличаемся от этих подходов, фокусируясь на понимании развивающихся способностей LLM в стандартных бенчмарках.

3 Структура LLM-Evolve

Предварительные сведения о бенчмарках LLM. Мы используем pθ для обозначения предварительно обученной LLM с параметром θ, x как входные данные задачи, и y как выходные данные. В стандартной настройке бенчмарка LLM предоставляются фиксированные пары вход-выход (IO) для облегчения вывода LLM, что может быть представлено как:

y lm i = p θ x i , { x demo , y demo }
(1)

где ylm — это выход LLM, а {xdemo, ydemo} — это few-shot демонстрации, которые фиксированы для всех входных данных x, предоставляемых бенчмарком.

Настройки LLM-Evolve. Ключевое предположение LLM-Evolve заключается в том, что языковые модели (LM) могут постепенно достигать лучшей производительности в бенчмарках, используя лучшие пары few-shot IO, основанные на их развивающейся истории взаимодействий. В частности, мы расширяем существующие настройки бенчмарка LLM, создавая память демонстраций D в LLM-Evolve.

D = { ( x lm i , y lm i , f i ) }
(2)

где каждый кортеж включает вход xlm и выход ylm для LLM, а также бинарную обратную связь fi от среды, указывающую, является ли опыт желательным. Учитывая бенчмарк, обратная связь fi может быть получена из эталонной метки (ground truth) в бенчмарке. В качестве альтернативы, обратная связь может быть предоставлена LLM; в этом случае настройка LLM-Evolve сводится к структуре саморефлексии (Shinn et al., 2023), предположим, что та же LLM используется для предоставления обратной связи, или структуре мульти-агента LLM, если для предоставления обратной связи используется другая LLM (Wu et al., 2023). В нашей текущей реализации только опыт с положительной обратной связью сохраняется в память демонстраций D, а негативный опыт отбрасывается. На основе памяти демонстраций D, LLM, оцениваемая с помощью LLM-Evolve, может использовать ретривер rφ, например, BERT (Devlin et al., 2018) или Contriever (Izacard et al., 2021), для извлечения релевантного опыта из памяти демонстраций и замены изначально фиксированных промптов {xdemo, ydemo} в стандартной настройке бенчмарка. В частности, учитывая новые входные данные задачи x, мы извлекаем top-k наиболее релевантных положительных опытов из памяти D, чтобы получить выход yLLM-Evolve:

y LLM-Evolve = p θ x , { x lm j , y lm j }
(3)

и модуль поиска будет извлекать многораундовые демонстрации на основе первого входа xlm.

Многораундовый LLM-Evolve. Мы описали шаги применения 1 раунда оценки LLM-Evolve в обсуждениях выше. После получения нового выхода LLM yLLM-Evolve на основе Уравнения 3, мы можем обновить память демонстраций D на основе нового опыта. Обновленная D затем может быть использована для инициирования нового раунда оценки LLM-Evolve. Рисунок 1 предоставляет обзор LLM-Evolve в настройках многораундовой оценки LLM.

4 Эксперименты

Бенчмарки. Мы применяем структуру LLM-Evolve к трем известным бенчмаркам: (1) MMLU для общих языковых задач, включая 14K задач с множественным выбором в 57 предметных областях, обычно рассматриваемый как золотой стандарт в оценке LLM; (2) GSM8K, содержащий 8.5K высококачественных лингвистически разнообразных математических текстовых задач школьного уровня, требующих от LLM точной генерации численного ответа; (3) AgentBench, который оценивает способности LLM к многораундовому взаимодействию при решении реальных задач, таких как решение реальных проблем в операционной системе. Мы расширяем эти бенчмарки с помощью LLM-Evolve в 4 раунда экспериментов: все LLM начинают со стандартной настройки оценки бенчмарка, затем применяются 3 дополнительных раунда экспериментов LLM-Evolve. Мы сообщаем о точности во всех трех бенчмарках. Из-за ограниченных ресурсов мы фокусируемся на наборе данных os-std в AgentBench, где LLM требуется в среднем 8 ходов для решения каждой задачи.

Расширение LLM-Evolve до многоходовых (multi-turn) настроек. Обсуждения выше предполагают одноходовую оценку LLM с помощью бенчмарка. LLM-Evolve может быть расширен до многоходовых настроек, таких как MT-bench (Zheng et al., 2024) и AgentBench, сохраняя полные многоходовые взаимодействия в памяти:

D = { ( x lm i 1 , y lm i 1 , ... , x lm i t , y lm i t , f i ) }
(4)

Модели. Мы рассматриваем современные LLM с открытым исходным кодом разного масштаба, включая семейство моделей Llama (Touvron et al., 2023a,b), Llama2-7B, Llama2-70B, Llama3-8B и Llama3-70B, Mistral-7B-v0.2 (Jiang et al., 2023) и Qwen2-72B (Bai et al., 2023). Мы также экспериментировали с LM с закрытым исходным кодом, включая GPT-4 (Achiam et al., 2023) и GPT-3.5-turbo, предоставляемые сервисом Azure OpenAI. Для всех моделей мы установили температуру генерации на 0, чтобы избежать любого нежелательного поведения из-за случайности. Мы запускаем модели 7B/8B на 1 графическом процессоре NVIDIA A100, а модели 70B на 8 графических процессорах NVIDIA A100; прохождение каждого раунда LLM-Evolve для 1 LLM занимает примерно 1 час. Мы используем Contriever (Izacard et al., 2021) в качестве ретривера в LLM-Evolve из-за его популярности.

Результаты на MMLU. Результаты на MMLU показаны в Таблице 1. В целом, LLM-Evolve предлагает впечатляющий прирост точности на 1-6% на MMLU, указывая на то, что LLM может получить значительную пользу от обратной связи по своим сгенерированным результатам. Примечательно, что основной прирост точности получен в первом раунде LLM-Evolve; последующий прирост от дополнительных раундов LLM-Evolve находится в пределах 1%. Интересно, что мы обнаружили, что более крупные модели, как правило, получают меньше пользы от своего прошлого опыта; наше объяснение заключается в том, что более крупные модели способны хранить необходимые знания для решения проблем в своих весах, поэтому меньше полагаются на демонстрации few-shot во входных данных. Еще один интересный вывод заключается в том, что современная модель Qwen2-72B получает наименьшую пользу от LLM-Evolve; такие наблюдения не сообщались в стандартных настройках бенчмарка LLM и заслуживают дальнейшего изучения.

Таблица 1 – LLM, оцененные в настройках LLM-Evolve на MMLU

MMLU (все 57 предметов) Llama2-7B Mistral-7B-v0.2 Llama3-8B Llama2-70B Llama3-70B Qwen2-72B
Стандартный 47.19 58.90 65.35 63.08 78.97 84.00
LLM-Evolve раунд 1 52.04 63.05 70.36 67.48 82.42 84.79
LLM-Evolve раунд 2 53.17 63.99 71.02 68.00 82.82 85.33
LLM-Evolve раунд 3 52.93 63.75 71.08 68.06 82.82 84.92
LLM-Evolve Прирост 5.74 4.85 5.73 4.98 3.85 1.33

Результаты на AgentBench os-std. AgentBench сложнее, чем MMLU, как с точки зрения задачи (написание многоходовых скриптов Linux для решения реальных проблем ОС), так и с точки зрения формата оценки (вместо множественного выбора LLM должна получить точно правильный вывод консоли). Как показано в Таблице 2, LLM-Evolve предлагает значительный прирост точности на 7-13% на AgentBench. Наше объяснение заключается в том, что сложный характер задач AgentBench делает очень полезным для LLM использование своего успешного прошлого опыта при решении проблем. Примечательно, что Llama3-70B, будучи на 11% менее точной по сравнению с GPT-4 при стандартной настройке, может превзойти стандартный GPT-4 после 3 раундов аугментации LLM-Evolve. Мы обнаружили, что дополнительные раунды LLM-Evolve не помогают в дальнейшем улучшении производительности LLM после 3 раундов.

Таблица 2 – LLM, оцененные в настройках LLM-Evolve на AgentBench os-std

AgentBench (os-std) Llama3-8B Llama3-70B GPT-3.5 GPT-4
Стандартный 18.8 32.6 32.7 43.8
LLM-Evolve раунд 1 21.5 38.9 41.7 47.2
LLM-Evolve раунд 2 24.3 42.4 43.8 47.2
LLM-Evolve раунд 3 27.1 45.1 43.8 50.7
LLM-Evolve раунд 4 25.7 45.1 43.8 50.0
LLM-Evolve Прирост 8.3 12.5 11.1 6.9

Результаты на GSM8K. Как показано в Таблице 3, LLM-Evolve предлагает значительный прирост точности на 12-17% на GSM8K. Как и в AgentBench, GSM8K требует от LLM проведения математических рассуждений и генерации точно правильных числовых выходных данных. Результаты дополнительно подтверждают наш вывод о том, что чем сложнее задачи бенчмарка, тем полезнее для LLM использовать успешный прошлый опыт для решения ранее неудачных задач.

Таблица 3 – LLM, оцененные в настройках LLM-Evolve на GSM-8K

GSM-8K Llama2-7B Llama2-70B Llama3-8B
Стандартный 23.28 46.78 52.99
LLM-Evolve раунд 1 29.80 55.19 64.97
LLM-Evolve раунд 2 33.43 57.70 68.91
LLM-Evolve раунд 3 36.39 58.38 70.28
LLM-Evolve Прирост 13.11 11.60 17.29

Абляционное исследование дизайна LLM-Evolve. Мы проводим всестороннее абляционное исследование для LLM-Evolve с Llama3-8B на полном наборе данных MMLU, показанное в Таблице 4. (1) Что касается выбора конкретного плотного ретривера, мы обнаружили, что переключение с Contriever на BERT дает очень незначительное падение точности, указывая на то, что любой разумный плотный ретривер может хорошо служить цели LLM-Evolve. (2) Мы также обнаружили, что высококачественные данные обратной связи, которые используются для фильтрации и выбора релевантного опыта из памяти демонстраций, имеют решающее значение; в частности, мы переключили источник обратной связи с использования меток ground-truth, предоставленных в бенчмарке MMLU, на использование модели Llama3-70B, и наблюдали падение точности примерно на 2% при оценке модели Llama-8B на MMLU. (3) Наконец, мы демонстрируем эффективность модуля поиска; здесь мы случайным образом перемешиваем порядок оригинального фиксированного few-shot промпта в наборах данных MMLU и сообщаем о том, что задача успешно решена, если любой из ответов является правильным в предыдущих раундах; это сильный базовый уровень — предположим, что LLM всегда генерирует 4 разных ответа в 4 раундах, модель имела бы 100% точность; эта настройка действительно повышает точность LLM, но все же на 2% менее точна по сравнению с настройкой LLM-Evolve.

Таблица 4 – Абляционное исследование

MMLU (все 57 предметов) раунд 0 раунд 1 раунд 2 раунд 3
Стандартный 65.35 65.35 65.35 65.35
LLM-Evolve 65.35 70.36 71.02 71.08
(-) От Contriever к BERT 65.35 70.34 71.00 71.04
(-) Обратная связь от Llama-70B 65.35 68.27 68.53 68.57
(-) Нет плотного поиска 65.35 67.77 68.90 69.61

5 Заключение

Мы представили LLM-Evolve, структуру, которая трансформирует стандартные бенчмарки LLM в формат последовательного решения задач, позволяя оценивать способность LLM учиться и улучшаться посредством итеративных взаимодействий, и прокладывая путь для будущих исследований по разработке более сложных методов оценки и улучшению способностей к развивающемуся обучению LLM в реальных приложениях.

Ограничения

Хотя наше исследование обеспечивает относительно всесторонний анализ по трем бенчмаркам и восьми LLM, существуют заметные области, где дальнейшее изучение могло бы повысить обобщаемость и глубину наших выводов. Расширение LLM-Evolve для охвата дополнительных бенчмарков и более широкого спектра LLM, вероятно, предложит более богатые идеи ценой дополнительных вычислительных ресурсов.

Наше исследование включает абляционное исследование, которое изучает влияние различных источников обратной связи при построении памяти демонстраций. В частности, мы сравниваем обратную связь, полученную из меток ground-truth бенчмарка, с обратной связью, сгенерированной самими LLM. Несмотря на это исследование, наши основные результаты сосредоточены на обратной связи, полученной из бенчмарков. Этот выбор практичен и полезен в контролируемых экспериментальных условиях, но он не отражает сложности реального развертывания LLM, где метки ground-truth часто недоступны.

Мы исследовали различные методы извлечения прошлого опыта из памяти демонстраций, включая использование опыта как с положительной, так и с отрицательной обратной связью в качестве демонстраций few-shot, и маскировку опыта, непосредственно относящегося к текущей задаче. Наши первоначальные выводы свидетельствуют о том, что эти альтернативные настройки не так идеальны, как текущая структура LLM-Evolve. Тем не менее, эти области заслуживают дальнейшего изучения в будущих исследованиях для уточнения и улучшения структуры LLM-Evolve.

Учитывая ограничения короткой статьи, мы отдали приоритет простоте нашего подхода, который подчеркивает важность понимания развивающихся способностей LLM в интерактивных средах. Будущие исследования могут быть сосредоточены на более сложных стратегиях улучшения внутриконтекстного обучения и генерации адаптивных ответов.

Таким образом, хотя LLM-Evolve обеспечивает новое понимание развивающихся способностей LLM на стандартных бенчмарках LLM, существуют дополнительные возможности для будущих исследований по расширению этих выводов в более разнообразных и реалистичных сценариях.

Этические соображения

Разработка и оценка LLM-Evolve в этом исследовании полностью основаны на бенчмарках, что по своей сути минимизирует прямые этические проблемы. Однако, поскольку LLM с возможностями саморазвития все чаще внедряются в реальные приложения, становится крайне важным заранее предвидеть и решать потенциальные этические последствия.

Хотя наша текущая реализация LLM-Evolve полагается исключительно на обратную связь от бенчмарков и других LLM, будущие итерации этой структуры могут включать обратную связь от человека. В таких сценариях согласование развивающихся способностей LLM с человеческими ценностями и социальными нормами становится решающим. Это согласование необходимо для того, чтобы гарантировать, что LLM работают способами, которые являются полезными, справедливыми и безвредными для пользователей и общества в целом.

Список литературы

  1. Josh Achiam, Steven Adler, Sandhini Agarwal, Lama Ahmad, Ilge Akkaya, Florencia Leoni Aleman, Diogo Almeida, Janko Altenschmidt, Sam Altman, Shyamal Anadkat, et al. 2023. Gpt-4 technical report. arXiv preprint arXiv:2303.08774.
  2. Jinze Bai, Shuai Bai, Yunfei Chu, Zeyu Cui, Kai Dang, Xiaodong Deng, Yang Fan, Wenbin Ge, Yu Han, Fei Huang, et al. 2023. Qwen technical report. arXiv preprint arXiv:2309.16609.
  3. Karl Cobbe, Vineet Kosaraju, Mohammad Bavarian, Mark Chen, Heewoo Jun, Lukasz Kaiser, Matthias Plappert, Jerry Tworek, Jacob Hilton, Reiichiro Nakano, et al. 2021. Training verifiers to solve math word problems. arXiv preprint arXiv:2110.14168.
  4. Jacob Devlin, Ming-Wei Chang, Kenton Lee, and Kristina Toutanova. 2018. Bert: Pre-training of deep bidirectional transformers for language understanding. arXiv preprint arXiv:1810.04805.
  5. Aryo Pradipta Gema, Joshua Ong Jun Leang, Giwon Hong, Alessio Devoto, Alberto Carlo Maria Mancino, Rohit Saxena, Xuanli He, Yu Zhao, Xiaotang Du, Mohammad Reza Ghasemi Madani, et al. 2024. Are we done with mmlu? arXiv preprint arXiv:2406.04127.
  6. Dan Hendrycks, Collin Burns, Steven Basart, Andy Zou, Mantas Mazeika, Dawn Song, and Jacob Steinhardt. 2020. Measuring massive multitask language understanding. arXiv preprint arXiv:2009.03300.
  7. Gautier Izacard, Mathilde Caron, Lucas Hosseini, Sebastian Riedel, Piotr Bojanowski, Armand Joulin, and Edouard Grave. 2021. Unsupervised dense information retrieval with contrastive learning. arXiv preprint arXiv:2112.09118.
  8. Albert Q Jiang, Alexandre Sablayrolles, Arthur Mensch, Chris Bamford, Devendra Singh Chaplot, Diego de las Casas, Florian Bressand, Gianna Lengyel, Guillaume Lample, Lucile Saulnier, et al. 2023. Mistral 7b. arXiv preprint arXiv:2310.06825.
  9. Hector Levesque, Ernest Davis, and Leora Morgenstern. 2012. The winograd schema challenge. In Thirteenth international conference on the principles of knowledge representation and reasoning.
  10. Xiao Liu, Hao Yu, Hanchen Zhang, Yifan Xu, Xuanyu Lei, Hanyu Lai, Yu Gu, Hangliang Ding, Kaiwen Men, Kejuan Yang, et al. 2023. Agentbench: Evaluating llms as agents. arXiv preprint arXiv:2308.03688.
  11. Aman Madaan, Niket Tandon, Prakhar Gupta, Skyler Hallinan, Luyu Gao, Sarah Wiegreffe, Uri Alon, Nouha Dziri, Shrimai Prabhumoye, Yiming Yang, et al. 2024. Self-refine: Iterative refinement with self-feedback. Advances in Neural Information Processing Systems, 36.
  12. Keisuke Sakaguchi, Ronan Le Bras, Chandra Bhagavatula, and Yejin Choi. 2021. Winogrande: An adversarial winograd schema challenge at scale. Communications of the ACM, 64(9):99–106.
  13. Noah Shinn, Beck Labash, and Ashwin Gopinath. 2023. Reflexion: an autonomous agent with dynamic memory and self-reflection. arXiv preprint arXiv:2303.11366.
  14. Hugo Touvron, Thibaut Lavril, Gautier Izacard, Xavier Martinet, Marie-Anne Lachaux, Timoth?e Lacroix, Baptiste Rozi?re, Naman Goyal, Eric Hambro, Faisal Azhar, et al. 2023a. Llama: Open and efficient foundation language models. arXiv preprint arXiv:2302.13971.
  15. Hugo Touvron, Louis Martin, Kevin Stone, Peter Albert, Amjad Almahairi, Yasmine Babaei, Nikolay Bashlykov, Soumya Batra, Prajjwal Bhargava, Shruti Bhosale, et al. 2023b. Llama 2: Open foundation and fine-tuned chat models. arXiv preprint arXiv:2307.09288.
  16. Xingyao Wang, Zihan Wang, Jiateng Liu, Yangyi Chen, Lifan Yuan, Hao Peng, and Heng Ji. 2023. Mint: Evaluating llms in multi-turn interaction with tools and language feedback. arXiv preprint arXiv:2309.10691.
  17. Yubo Wang, Xueguang Ma, Ge Zhang, Yuansheng Ni, Abhranil Chandra, Shiguang Guo, Weiming Ren, Aaran Arulraj, Xuan He, Ziyan Jiang, et al. 2024. Mmlu-pro: A more robust and challenging multi-task language understanding benchmark. arXiv preprint arXiv:2406.01574.
  18. Qingyun Wu, Gagan Bansal, Jieyu Zhang, Yiran Wu, Shaokun Zhang, Erkang Zhu, Beibin Li, Li Jiang, Xiaoyun Zhang, and Chi Wang. 2023. Autogen: Enabling next-gen llm applications via multi-agent conversation framework. arXiv preprint arXiv:2308.08155.
  19. Xin Xu, Yue Liu, Panupong Pasupat, Mehran Kazemi, et al. 2024. In-context learning with retrieved demonstrations for language models: A survey. arXiv preprint arXiv:2401.11624.
  20. Tianjun Zhang, Aman Madaan, Luyu Gao, Steven Zheng, Swaroop Mishra, Yiming Yang, Niket Tandon, and Uri Alon. 2024. In-context principle learning from mistakes. arXiv preprint arXiv:2402.05403.
  21. Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric Xing, et al. 2024. Judging llm-as-a-judge with mt-bench and chatbot arena. Advances in Neural Information Processing Systems, 36.