вернуться в раздел "Научные труды"
Автор перевода: Н.Н. Дворник
Источник: Yunfan Zhao, Niclas Boehmer, Aparna Taneja, Milind Tambe. Towards Foundation-model-based Multiagent System to Accelerate AI for Social Impact // arXiv preprint arXiv:2412.07880. – 2024. DOI: 10.48550/arXiv.2412.07880 .

DOI: 10.48550/arXiv.2412.07880

На пути к мультиагентной системе на основе фундаментальных моделей для ускорения ИИ для социального воздействия

Yunfan Zhao, Niclas Boehmer, Aparna Taneja, Milind Tambe

Harvard University, GE Healthcare, Hasso Plattner Institute, Google Deepmind

Аннотация

ИИ для социального воздействия (AI4SI) обладает значительным потенциалом для решения сложных общественных проблем в таких областях, как общественное здравоохранение, сельское хозяйство, образование, охрана природы и общественная безопасность. Однако существующие исследования в области AI4SI часто являются трудоемкими и требуют больших ресурсов, что ограничивает их доступность и масштабируемость; стандартный подход заключается в разработке (базовой) системы, адаптированной под конкретную задачу AI4SI. Мы предлагаем разработку новой мета-уровневой мультиагентной системы, предназначенной для ускорения создания таких базовых систем, тем самым снижая вычислительные затраты и нагрузку на экспертов в области социального воздействия и исследователей ИИ. Используя достижения в области фундаментальных моделей и больших языковых моделей, наш предлагаемый подход фокусируется на проблемах распределения ресурсов, обеспечивая помощь на всем протяжении конвейера AI4SI: от формулировки проблемы и разработки решения до оценки воздействия. Мы выделяем этические соображения и проблемы, присущие развертыванию таких систем, и подчеркиваем важность подхода с участием человека (human-in-the-loop) для обеспечения ответственного и эффективного применения систем ИИ.

1 Введение

Искусственный интеллект (ИИ) для социального воздействия (AI4SI), который фокусируется на использовании ИИ для решения общественных проблем, набирает популярность как в академических кругах, так и в промышленности Bondi et al. [2021]; Perrault et al. [2020]; Cowls et al. [2021]; Ji et al. [2024c]; Foffano et al. [2023]. Благодаря достижениям в области ИИ и мультиагентных систем появляется возможность применять эти технологии к сложным проблемам в таких областях, как общественная безопасность, сохранение дикой природы и общественное здравоохранение Kwok and others [2019]; Wang and Preininger [2019]; Floridi et al. [2018]; Ji et al. [2024b]. Ранее исследования AI4SI были очень трудоемкими, так как зачастую необходимо разрабатывать индивидуальные подходы, выходящие за рамки традиционных методов, чтобы решить проблемы, характерные для этих областей, такие как нехватка ресурсов и зашумленные или скудные данные. Это ограничивает общее влияние исследований AI4SI, поскольку каждое отдельное усилие требует нетривиальных затрат времени, опыта и финансовых вложений. Мы представляем формирование нового подхода к AI4SI, который является менее трудоемким, настраиваемым неспециалистами и, таким образом, может стать более широко доступным. Мы полагаем, что многообещающий прогресс в этом видении может быть достигнут за счет использования последних методологических достижений в исследованиях компьютерных наук, задействуя значительный, в настоящее время неиспользуемый потенциал.

В этой статье мы будем использовать проблемы распределения ресурсов, которые часто возникают в доменах AI4SI Kruk et al. [2018]; Ayer et al. [2019]; Perrault et al. [2020]; Wang and Preininger [2019]; Baltussen and Niessen [2006]; Nishtala et al. [2021]; Deo et al. [2013] в качестве нашего сквозного примера, хотя наши общие идеи применимы и более широко. Некоторые примеры ранее изученных проблем распределения ресурсов в AI4SI включают стратегическое планирование патрулей в охраняемых природных зонах Gatmiry et al. [2021]; Golovin et al. [2011]; Gordon et al. [2024]; Xu et al. [2016] и распределение дефицитных ресурсов здравоохранения для оптимизации показателей здоровья людей Shaikh [2020]; Mizan and Taghipour [2022]; Verma et al.; Zhao et al. [2024a].

Мы представляем мета-уровневую мультиагентную систему, которая помогает нам ускорить разработку систем базового уровня, решающих конкретные проблемы AI4SI. Мета-уровневая система поможет некоммерческим организациям и исследователям ИИ в областях социального воздействия использовать ИИ без необходимости вкладывать значительные объемы труда и ресурсов для создания специализированной базовой системы с нуля. Наша предполагаемая система использует фундаментальные модели, которые обычно разрабатываются путем предварительного обучения на доступных наборах данных и могут быть использованы для различных последующих задач или новых вызовов Bommasani et al. [2021]; Kenton and Toutanova [2019]; Zhao et al. [2024b]; Viswanathan et al. [2023]. Наш предлагаемый подход включает: (i) использование мета-агентов на основе LLM для общения с лицами, принимающими решения, на человеческом языке, чтобы понять проблему с их точки зрения; (ii) использование мета-агентов и фундаментальных моделей для проблем AI4SI с целью проектирования систем базового уровня; и (iii) использование мета-агентов для полевого тестирования решений с целью подтверждения их воздействия.

Важно отметить, что вместо того, чтобы брать на себя весь конвейер AI4SI, мета-уровневая система ускорит процесс, улучшит обобщение и обеспечит тщательную оценку, при этом участие человека требуется в каждой части системы. Мы обсудим и выделим основные проблемы и наше видение для каждой фазы этой системы, подчеркивая мультиагентный аспект. Мы также обсудим аспекты этики и справедливости.

Нынешняя эра фундаментальных моделей привела к размышлениям о проблемах и возможностях, которые такие модели могут предложить в различных областях, от медицинского ИИ Moor et al. [2023] до автономных цепочек поставок Xu et al. [2023], автономной добычи полезных ископаемых Li et al. [2023b] и робототехники Wang et al. [2024b]. По сравнению с этими предыдущими работами, данная статья фокусируется на использовании фундаментальных моделей в AI4SI. Более того, даже в рамках AI4SI мы в качестве примера фокусируемся на оптимизации распределения ограниченных ресурсов, предоставляя анализ проблем в конкретном аспекте AI4SI. Кроме того, в отличие от предыдущих работ, мы больше фокусируемся на агентах на основе фундаментальных моделей на мета-уровне для помощи системам базового уровня, которые оптимизируют эти ограниченные ресурсы, а не на полной замене системы базового уровня. Это позволяет задействовать существующие хорошо разработанные инструменты оптимизации ресурсов по мере необходимости, позволяя фундаментальным моделям вместо этого настраивать инструменты по мере необходимости.

2 Предварительные сведения

Мы формально определяем ключевые концепции систем мета-уровня и базового уровня, к которым мы будем обращаться на протяжении всей работы.

Определение 1 (Системы мета-уровня и базового уровня). Система AI4SI базового уровня — это фактически развернутая система, которая будет решать проблему на месте. Система мета-уровня помогает нам ускорить разработку системы базового уровня или ускорить её модификацию по мере необходимости для новой цели.

Примечательно, что система мета-уровня фактически не решает проблему AI4SI. Система мета-уровня может включать несколько мета-агентов, каждый из которых отвечает за различные задачи в разработке системы базового уровня, и которые могут взаимодействовать друг с другом. В контексте вариантов использования, на которых мы фокусируемся в этой статье, сама базовая система будет мультиагентной системой или такой, которая моделирует мультиагентные взаимодействия, например, социальную сеть. Агенты базового уровня, присутствующие в системе базового уровня, определяются следующим образом:

Определение 2 (Агенты базового уровня). В системе базового уровня агенты базового уровня моделируют или служат абстрактными представлениями индивидуумов или сущностей в реальном мире.

Хотя идея архитектуры мета-уровня была предложена в архитектурах агентов, там идея заключается в непосредственной помощи агентам в их немедленном решении проблем Corkill and Lesser [1983]; Rosenbloom et al. [1988]; Genesereth and Smith [1983]; Wang et al. [2020c]. В нашей работе мета-уровень относится к принятию решений о том, каких агентов и сколько выбрать, как оценить их производительность и другие подобные задачи. Другое отличие заключается в том, что, по крайней мере в нынешнем представлении, наши мета-агенты сосредоточены на помощи людям в создании агентов базового уровня.

Еще одна ключевая концепция, к которой мы будем часто обращаться, — это агенты на основе фундаментальных моделей (FM-агенты), используемые в системе мета-уровня.

Определение 3 (Агенты на основе фундаментальных моделей (FM-агенты)). В системе мета-уровня мы используем мета-агентов, которые применяют фундаментальные модели, включая LLM. Мы будем называть этих агентов FM-агентами.

Конвейер AI4SI обычно включает три фазы Perrault et al. [2020]; Bondi et al. [2021]:

Примечательно, что каждый шаг в конвейере AI4SI создает свои проблемы Sinha et al. [2018], подразумевая, что работа в области AI4SI часто требует значительно больше усилий, чем чисто исследовательская работа по улучшению алгоритмов ИИ. В частности, формулировка проблемы и сбор подробной информации (например, потенциальные доступные решения и их влияние на каждого из индивидуумов) могут быть трудоемкими и дорогостоящими Sambasivan and Veeraraghavan [2022]. Более того, разработка методов решения может потребовать значительного времени от экспертов по ИИ и экспертов в области социального воздействия Tomasev et al. [2020], которые должны работать вместе, чтобы разработать индивидуальный метод решения для каждого сценария применения. Тщательное тестирование и оценка перед развертыванием часто требуют значительных ручных усилий, так как часто необходимы детальные имитационные исследования (например, в соответствии с правилами или в качестве мер предосторожности) Behari et al. [2024], и эксперты по ИИ обычно проектируют каждое имитационное исследование вручную с нуля.

Для нашего сквозного примера мы рассматриваем распределение ограниченных вмешательств (в частности, звонков живых операторов, совершаемых работниками здравоохранения) в ARMMAN, некоммерческой организации в Индии, занимающейся повышением осведомленности о здоровье будущих и молодых матерей Zhao et al. [2024b]; Seow et al. [2024]. Их работники здравоохранения совершают сервисные звонки для повышения вовлеченности матерей, зарегистрированных в их информационной программе здравоохранения. Они показали, что решения на базе ИИ могут снизить падение вовлеченности примерно на 30% при реальном развертывании Mate et al. [2022]; Wang et al. [2023].

3 Формулировка проблемы

На этом этапе мы обсуждаем, как сформулировать проблему AI4SI. Существующие работы требуют, чтобы исследователи и эксперты-люди в области ИИ общались с сотрудничающими некоммерческими организациями, чтобы понять, кто принимает решения в рамках проблемы, и собрать ключевую информацию об агентах, такую как демографические данные Wang and Preininger [2019]; Wang et al. [2024d]. Этот процесс является дорогим и трудоемким, и у некоммерческих организаций может не быть персонала, обученного ИИ, для помощи в этом, что затрудняет обеспечение точной адаптации решений ИИ к сложностям реальной проблемы. Таким образом, предыдущие работы часто требуют, чтобы исследователи ИИ проводили многочисленные раунды обсуждений с некоммерческими организациями и организовывали поездки на места, чтобы поговорить с ключевыми заинтересованными сторонами в программах социального блага. Хотя эти обсуждения являются фундаментальными для AI4SI, некоторая часть работы, направленная на формулировку правильной модели базового уровня, является повторяющейся. Чтобы ускорить эту работу, мы предлагаем следующее видение:

Видение 1. Использовать FM-агентов для (i) идентификации задействованных агентов базового уровня, (ii) поиска адекватного формального описания для обстановки (например, как марковский процесс принятия решений - MDP), и (iii) определения ключевых компонентов обстановки (например, пространство состояний, пространство действий и функция вознаграждения в MDP).

FM-агенты могут использовать большие языковые модели для общения с партнерской некоммерческой организацией, чтобы сформулировать социальную проблему как проблему ИИ и понять, кто принимает решения в рамках проблемы. Мировые знания LLM могут помочь FM-агенту выявить смешивающиеся переменные и незадокументированную информацию Hu et al. [2024]; Wang et al. [2024a]; He et al. [2023]; Xu et al. [2024c]; Ji et al. [2024a]; Li et al. [2024]. FM-агент должен определить, какой информацией обладают индивидуумы или сущности в реальном мире, чтобы руководствоваться ею при принятии решений. Затем FM-агент должен определить агентов базового уровня для моделирования индивидуумов или сущностей и сделать правильные предположения об информации, доступной им.

FM-агент может собирать данные из прошлых взаимодействий, включая эффекты действий, наблюдаемые затраты или вознаграждения, и взаимодействия между агентами Roh et al. [2019]; Zhao et al. [b]; Elmachtoub et al. [2023b]. FM-агент, потенциально на основе LLM, мог бы напрямую общаться с бенефициарами, зарегистрированными в программе некоммерческой организации, на их родном языке, чтобы получить более четкую перспективу, и не имел бы временных ограничений.

Сквозной Пример 1. В ARMMAN агенты базового уровня представляют зарегистрированных бенефициаров, а пространство состояний и действий соответствуют уровням вовлеченности бенефициаров и возможным графикам сервисных звонков соответственно. FM-агент должен провести беседы с экспертами предметной области в ARMMAN, чтобы выяснить, что один из способов подойти к этому сценарию применения — моделировать бенефициаров как агентов, которые следуют марковским процессам принятия решений. После этого FM-агент должен определить пространство состояний, пространство действий и другие ключевые части MDP.

Overview of our proposed AI for social impact (AI4SI) workflow

Рисунок 1 – Обзор предлагаемого нами рабочего процесса ИИ для социального воздействия (AI4SI)

4 Разработка методов решения

На этом этапе мы подробно описываем, как разработать метод решения для проблем AI4SI. Существующие подходы часто требуют ручной разработки методов решения, адаптированных к каждому сценарию применения Xu et al. [2022]; Aqajari et al. [2024]; Mao et al. [2022b,a]; Wang et al. [2024e]; Xiong et al. [2024b]. Этот подход не позволяет легко адаптироваться к новым сценариям применения или знаниям и данным из предыдущих сценариев, что мотивирует разработку фундаментальных моделей для ускорения подходов к решению проблем в AI4SI. Помимо способности к адаптации, другими аспектами, имеющими особое значение при разработке методов решения в проблемах AI4SI, являются этика, справедливость и сотрудничество между агентами базового уровня. Мы обоснуем каждый из этих аспектов и предложим наши видения для их решения.

Адаптация имеет решающее значение в доменах ИИ для социального воздействия из-за динамичной и развивающейся природы этих сред. Социальные проблемы часто сложны и многогранны, а приоритеты со временем меняются Blumenstock [2018]; De-Arteaga et al. [2018]; Behari et al. [2024]. Системы ИИ должны адаптироваться к новой информации и обстоятельствам, приспосабливаясь к быстро меняющимся потребностям и условиям. Системы ИИ в доменах социального воздействия могут обслуживать разнообразные группы населения с различными потребностями, происхождением и опытом, подчеркивая необходимость в системах ИИ с сильными способностями к адаптации и обобщению, которые могут подстраивать свои ответы под конкретные подгруппы, обеспечивая инклюзивное принятие решений.

Фундаментальная модель для распределения ресурсов могла бы ускорить разработку решений для различных сценариев применения без повторных затрат на разработку, делая их более доступными по цене и досягаемыми для сообществ с ограниченными ресурсами Bommasani et al. [2021]; Zhao et al. [2024b]. Например, фундаментальная модель, разработанная для анализа медицинских данных, может быть адаптирована к различным заболеваниям, состояниям здоровья или группам населения, улучшая показатели здоровья в большем масштабе Li et al. [2023a]. Основываясь на достижениях в области фундаментальных моделей и адаптации, мы предлагаем следующее видение:

Видение 2. Создать фундаментальную модель для проблем распределения ресурсов в доменах AI4SI, которая может быть адаптирована и дообучена (finetuned) на конкретных сценариях применения. Для каждого нового сценария применения AI4SI использовать FM-агента для задействования фундаментальной модели и предоставления методов решения.

Сквозной Пример 2. Конкретный пример фундаментальной модели для задач распределения ресурсов приведен в работе Zhao et al. [2024a], которые разрабатывают предварительно обученную модель «restless bandit» (многорукий бандит с изменяющимся состоянием), которую можно дообучить на различных сценариях применения распределения ресурсов, с которыми может столкнуться ARMMAN. В настоящее время сценарии применения имеют разное количество агентов базового уровня и разную величину сдвигов распределения. Здесь наша исследовательская идея состоит в том, чтобы начать с такой фундаментальной модели и позволить FM-агенту адаптировать и специализировать её для более новых сценариев, которые могут включать большие изменения, чем просто различия в количестве агентов базового уровня. Это может включать новые сценарии применения, которые могут потребовать изменения состояний и действий в модели restless bandit.

Чтобы справиться с присущей социальным проблемам сложностью, мы также можем использовать FM-агентов в форме Больших Языковых Моделей (LLM) для обработки и понимания человеческих инструкций, запросов и обратной связи от заинтересованных сторон с целью изменения приоритетов в процессе распределения ресурсов Sun et al. [2023]; Wang et al. [2024c]; Xiao et al. [2024]; Xu et al. [2024b]. Например, в домене ARMMAN менеджер программы может предложить уделить приоритетное внимание определенному сегменту недостаточно обслуживаемого населения, например, пожилым людям, что LLM может интерпретировать и соответствующим образом скорректировать модель распределения ресурсов restless bandit путем изменения её функции вознаграждения Behari et al. [2024]; Verma et al. [2024].

Помимо аспекта адаптации, развитие эффективного сотрудничества между несколькими агентами базового уровня играет важную роль в исследованиях AI4SI. Напомним, что агент базового уровня служит абстрактным представлением индивидуума или сущности в реальном мире. В некоторых задачах несколько агентов базового уровня могут коллективно планировать противодействие противнику, такому как браконьер или террористы Shieh et al. [2012]; Gordon et al. [2024]; Xiong and Li [2024]. В других задачах несколько агентов базового уровня могут общаться, чтобы смягчить влияние ошибок данных, которые часто возникают в реальных ситуациях из-за таких факторов, как непоследовательные методы сбора данных и преднамеренный шум, вводимый для дифференциальной приватности Dubrow [2022]; Paulus et al. [2023]; Dong et al. [2023]; Zhao et al. [2024c]; Dwork et al. [2014]; Dong et al. [2022].

Однако предыдущие работы в AI4SI часто требуют, чтобы эксперты-люди в области ИИ вручную создавали способы сотрудничества между агентами базового уровня для конкретных доменов AI4SI. FM-агент может помочь в этом процессе, чтобы ускорить работу ИИ для социального воздействия:

Видение 3. FM-агент при разработке методов решения для систем базового уровня должен проектировать эффективные каналы связи и стратегии для агентов базового уровня. В частности, эти каналы должны позволять агентам базового уровня учиться на опыте друг друга и улучшать принятие решений.

Хотя приведенное выше видение развития сотрудничества может показаться простым для экспертов (человек-ИИ), создающих методы решения, FM-агентам это нелегко выяснить из-за сложных взаимоотношений между агентами базового уровня Wang et al. [2020a,b]; Kang et al. [2022]. FM-агент может использовать мировые знания LLM, чтобы понять, какие коммуникации могут быть потенциально полезными и должны быть включены в разработку методов решения Chen et al. [2024]. Здесь каналом связи может быть то, что индивидуум или сущность разговаривает с другим через сотовую сеть или другую существующую инфраструктуру. Например, FM-агент может обнаружить, что рейнджеры, работающие вместе для патрулирования охраняемых территорий, таких как национальный парк, на предмет незаконной деятельности, могут делиться своими наблюдениями, чтобы улучшить понимание горячих точек браконьерства и оптимизировать назначения для будущих патрулей Gordon et al. [2024].

4.1 Этика и Справедливость

В сценариях распределения ресурсов с высокими ставками, таких как здравоохранение, власти часто отдают приоритет определенным группам на основе чувствительных атрибутов, стремясь удовлетворить потребности наиболее обездоленных Amon [2020]; Verma et al.. Например, правительства могут предписывать отсутствие дискриминации на основе чувствительных атрибутов, в то время как некоммерческие организации могут отдавать приоритет группам с низким доходом. Учитывая важность справедливости в проектировании системы базового уровня и ощутимое влияние метода решения на жизнь людей, мы предлагаем следующую идею:

Видение 4. Обеспечить, чтобы FM-агент рекомендовал дизайн системы базового уровня, который не дискриминирует какую-либо подгруппу и не приводит к неблагоприятным результатам для обездоленных групп.

При ускорении проектирования систем базового уровня FM-агент должен обеспечивать наличие гарантий справедливости или проверок справедливости. Это можно сделать путем явного включения справедливости в проектирование систем базового уровня для приложений социального воздействия Zehlike et al. [2017]; Verma et al.. Однако эта добавленная сложность трудна для обработки FM-агентами, из-за того, что ИИ может нелегко понимать демографическую информацию, доступную в тексте, или абстрактные концепции справедливости, потенциально основанные на демографии. Слепое применение ограничений справедливости или оптимизация исключительно цели справедливости может сильно скомпрометировать общую эффективность метода решения. Таким образом, вопросы справедливости требуют инновационных стратегий, чтобы гарантировать, что FM-агенты проектируют системы базового уровня, которые балансируют справедливость и полезность.

Сквозной Пример 3. В ARMMAN конкретным примером ограничений справедливости является обеспечение отсутствия дискриминации на основе чувствительных атрибутов и приоритезация групп с низким доходом и низким уровнем образования для сокращения социально-экономического неравенства. В контексте ARMMAN доступна демографическая информация для зарегистрированных бенефициаров. При проектировании системы базового уровня FM-агент может применять ограничения справедливости, такие как требование, чтобы каждый бенефициар получал достаточное количество ресурсов в течение определенного времени. Кроме того, FM-агент должен отдавать приоритет обездоленным группам путем явной оптимизации цели справедливости (например, Max Nash Welfare или Maximin Reward) в методе решения.

5 Тестирование и Развертывание

На этом этапе мы объясняем, как тщательно оценивать и развертывать модели ИИ для доменов социального воздействия. Мы используем FM-агентов для улучшения тестирования моделей и облегчения реального развертывания.

Развертывание модели ИИ в реальных доменах социального воздействия без достаточных имитационных исследований может привести к плохому принятию решений по важнейшим общественным ресурсам. Таким образом, тщательное тестирование и оценка алгоритмов ИИ или обученных моделей является важным аспектом ускорения ИИ для социального воздействия. Основываясь на вышесказанном, мы предлагаем следующую исследовательскую идею:

Видение 5. Использовать FM-агентов на основе LLM для симуляции поведения агентов. Здесь мы хотим создать мощный симулятор, который служит хорошим прокси для реальной среды развертывания и может эффективно оценивать производительность обученных моделей.

Симуляторы на основе LLM в последнее время вызывают большой интерес, и есть продемонстрированные успехи в использовании LLM для симуляции человеческого поведения в таких областях, как образование, здравоохранение и социальные науки Cheng et al. [2023]; Santurkar et al. [2023]; Argyle et al. [2023]; Xu et al. [2024a]; Markel et al. [2023]. Чтобы создать такой симулятор/оценщик LLM для проблем AI4SI, мы должны представлять наблюдения и возможные решения таким образом, чтобы LLM могла их понять, и потенциально использовать текстовые описания в сочетании со структурированными данными, чтобы помочь симулятору LLM генерировать контекстуально подходящее (например, подходящее для домена) индивидуальное поведение. Кроме того, текстовые описания характеристик индивидуума, таких как демографическая информация (возраст, пол, географическое положение и т.д.), могут помочь LLM лучше понять, как состояние индивидуумов будет меняться со временем. Для конкретной проблемы AI4SI нам может потребоваться дообучить LLM на собранных исторических данных, чтобы лучше симулировать траектории индивидуумов.

Сквозной Пример 4. В приложении ARMMAN нам необходимо тщательно тестировать алгоритмы перед реальным развертыванием. FM-агент может использовать LLM для выполнения агентного моделирования для оценки алгоритмов обучения Park et al. [2023]; Guo et al. [2024], или использовать когнитивные модели для дополнения подходов к оценке на основе ML Gonzalez et al. [2003]; Seow et al. [2024].

Обсудив оценку перед реальным развертыванием, мы переходим к проблемам в развертывании. Во время развертывания моделей ИИ могут происходить сдвиги в пользовательской базе или сдвиги в поведении людей Elmachtoub et al. [2023a]. В отличие от способности к адаптации, учитываемой при разработке и обучении модели, сдвиги распределения при тестировании могут быть неожиданными, и необходимость справляться с этими сдвигами может быть срочной. Это приводит к следующей исследовательской идее:

Видение 6. Иметь FM-агента, который мог бы (i) вовлекать человека в контур управления (human-in-the-loop) и внедрять мониторинг в реальном времени для отслеживания производительности модели и обнаружения сдвигов в поведении пользователей или распределении данных; (ii) использовать обратную связь от человека или ИИ для корректировки модели (например, повышения справедливости модели при неожиданных сдвигах распределения).

В частности, мы можем использовать цикл обратной связи для сбора данных о прогнозах модели и взаимодействиях с пользователем, что позволяет оперативно обнаруживать сдвиги в поведении Behari et al. [2024]; Xiong et al. [2024a]. Как только обнаружены существенные сдвиги в поведении пользователей, мы можем привлечь экспертов-людей, потенциально из партнерских некоммерческих организаций, для обзора и предоставления обратной связи по прогнозам и решениям модели. Эта обратная связь затем может быть использована для корректировки модели и улучшения ее реакции на изменения распределения. Мы можем переобучить или дообучить модель, используя вновь собранные данные, потенциально придавая больший вес недавним данным, чтобы лучше соответствовать текущим тенденциям и поведению пользователей Bommasani et al. [2021]; Choromanski et al. [2023]; Peng and Cao [2024]; Kong et al. [2024]; Zhao et al. [a].

Благодарности

Эта работа поддержана Harvard Data Science initiative.

Список литературы

  1. Joseph J Amon. Ending discrimination in healthcare. Journal of the International AIDS Society, 23(2), 2020.
  2. Seyed Amir Hossein Aqajari, Ziyu Wang, Ali Tazarv, Sina Labbaf, Salar Jafarlou, Brenda Nguyen, Nikil Dutt, Marco Levorato, and Amir M Rahmani. Enhancing performance and user engagement in everyday stress monitoring: A context-aware active reinforcement learning approach. arXiv preprint arXiv:2407.08215, 2024.
  3. Lisa P Argyle, Ethan C Busby, Nancy Fulda, Joshua R Gubler, Christopher Rytting, and David Wingate. Out of one, many: Using language models to simulate human samples. Political Analysis, 31(3):337–351, 2023.
  4. Turgay Ayer, Can Zhang, Anthony Bonifonte, Anne C Spaulding, and Jagpreet Chhatwal. Prioritizing hepatitis c treatment in us prisons. Operations Research, 67(3):853– 873, 2019.
  5. Rob Baltussen and Louis Niessen. Priority setting of health interventions: the need for multi-criteria decision analysis. Cost effectiveness and resource allocation, 4:1–9, 2006.
  6. Nikhil Behari, Edwin Zhang, Yunfan Zhao, Aparna Taneja, Dheeraj Nagaraj, and Milind Tambe. A decision-language model (dlm) for dynamic restless multi-armed bandit tasks in public health. Neural Information Processing Systems, 2024.
  7. Joshua Blumenstock. Don’t forget people in the use of big data for development, 2018.
  8. Elizabeth Bondi, Lily Xu, Diana Acosta-Navas, and Jackson A Killian. Envisioning communities: a participatory approach towards ai for social good. In Proceedings of the 2021 AAAI/ACM Conference on AI, Ethics, and Society, pages 425–436, 2021.
  9. Rishi Bommasani, Drew A Hudson, Ehsan Adeli, Russ Altman, Simran Arora, Sydney von Arx, Michael S Bernstein, Jeannette Bohg, Antoine Bosselut, Emma Brunskill, et al. On the opportunities and risks of foundation models. arXiv preprint arXiv:2108.07258, 2021.
  10. Weize Chen, Ziming You, Ran Li, Yitong Guan, Chen Qian, Chenyang Zhao, Cheng Yang, Ruobing Xie, Zhiyuan Liu, and Maosong Sun. Internet of agents: Weaving a web of heterogeneous agents for collaborative intelligence. arXiv preprint arXiv:2407.07061, 2024.
  11. Myra Cheng, Tiziano Piccardi, and Diyi Yang. Compost: Characterizing and evaluating caricature in llm simulations. In Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing, pages 10853– 10875, 2023.
  12. Krzysztof Marcin Choromanski, Arijit Sehanobish, Han Lin, Yunfan Zhao, Eli Berger, Tetiana Parshakova, Alvin Pan, David Watkins, Tianyi Zhang, Valerii Likhosherstov, et al. Efficient graph field integrators meet point clouds. In International Conference on Machine Learning, pages 5978– 6004. PMLR, 2023.
  13. Daniel D Corkill and Victor R Lesser. The use of meta-level control for coordination in a distributed problem solving network. In IJCAI, volume 83, page 748, 1983.
  14. Josh Cowls, Andreas Tsamados, Mariarosaria Taddeo, and Luciano Floridi. A definition, benchmark and database of ai for social good initiatives. Nature Machine Intelligence, 3(2):111–115, 2021.
  15. Maria De-Arteaga, William Herlands, Daniel B Neill, and Artur Dubrawski. Machine learning for the developing world. ACM Transactions on Management Information Systems (TMIS), 9(2):1–14, 2018.
  16. Sarang Deo, Seyed Iravani, Tingting Jiang, Karen Smilowitz, and Stephen Samuelson. Improving health outcomes through better capacity allocation in a community-based chronic care model. Operations Research, 61(6):1277– 1294, 2013.
  17. Heng Dong, Tonghan Wang, Jiayuan Liu, and Chongjie Zhang. Low-rank modular reinforcement learning via muscle synergy. Advances in Neural Information Processing Systems, 35:19861–19873, 2022.
  18. Heng Dong, Junyu Zhang, Tonghan Wang, and Chongjie Zhang. Symmetry-aware robot design with structured subgroups. In International Conference on Machine Learning, pages 8334–8355. PMLR, 2023.
  19. Jason Xiaotian Dou, Runxue Bao, and Wenxin Wei. Clinical decision system using machine learning and deep learning: a survey. 2022.
  20. Jason Xiaotian Dou, Minxue Jia, Nika Zaslavsky, Mark Ebeid, Runxue Bao, Shiyi Zhang, Ke Ni, Paul Pu Liang, Haiyi Mao, and Zhi-Hong Mao. Learning more effective cell representations efficiently. In NeurIPS 2022 Workshop on Learning Meaningful Representations of Life, 2022.
  21. Joshua K Dubrow. Local data and upstream reporting as sources of error in the administrative data undercount of covid 19. International Journal of Social Research Methodology, 25(4):471–476, 2022.
  22. Cynthia Dwork, Aaron Roth, et al. The algorithmic foundations of differential privacy. Foundations and Trends® in Theoretical Computer Science, 9(3–4):211–407, 2014.
  23. Adam Elmachtoub, Vishal Gupta, and Yunfan Zhao. Balanced off-policy evaluation for personalized pricing. In International Conference on Artificial Intelligence and Statistics, pages 10901–10917. PMLR, 2023.
  24. Adam N Elmachtoub, Henry Lam, Haofeng Zhang, and Yunfan Zhao. Estimate-then-optimize versus integrated-estimationoptimization: A stochastic dominance perspective. arXiv preprint arXiv:2304.06833, 2023.
  25. Luciano Floridi, Josh Cowls, Monica Beltrametti, Raja Chatila, Patrice Chazerand, Virginia Dignum, Christoph Luetge, Robert Madelin, Ugo Pagallo, Francesca Rossi, et al. Ai4people—an ethical framework for a good ai society: opportunities, risks, principles, and recommendations. Minds and machines, 28:689–707, 2018.
  26. Francesca Foffano, Teresa Scantamburlo, and Atia Cortes. Investing in ai for social good: an analysis of european national strategies. AI & society, 38(2):479–500, 2023.
  27. Zohreh S Gatmiry, Ashkan Hafezalkotob, Roya Soltani, et al. Food web conservation vs. strategic threats: A security game approach. Ecological Modelling, 442:109426, 2021.
  28. Michael R Genesereth and D Smith. An overview of meta-level architecture. In AAAI, pages 119–124, 1983.
  29. Daniel Golovin, Andreas Krause, Beth Gardner, Sarah Converse, and Steve Morey. Dynamic resource allocation in conservation planning. In Proceedings of the AAAI Conference on Artificial Intelligence, volume 25, pages 1331– 1336, 2011.
  30. Cleotilde Gonzalez, Javier F Lerch, and Christian Lebiere. Instance-based learning in dynamic decision making. Cognitive Science, 27(4):591–635, 2003.
  31. Lucia Gordon, Esther Rolf, and Milind Tambe. Combining diverse information for coordinated action: Stochastic bandit algorithms for heterogeneous agents. arXiv preprint arXiv:2408.03405, 2024.
  32. T Guo, X Chen, Y Wang, R Chang, S Pei, NV Chawla, O Wiest, and X Zhang. Large language model based multi-agents: A survey of progress and challenges. In 33rd International Joint Conference on Artificial Intelligence (IJCAI 2024). IJCAI; Cornell arxiv, 2024.
  33. Nan He, Hanyu Lai, Chenyang Zhao, Zirui Cheng, Junting Pan, Ruoyu Qin, Ruofan Lu, Rui Lu, Yunchen Zhang, Gangming Zhao, et al. Teacherlm: Teaching to fish rather than giving the fish, language modeling likewise. arXiv preprint arXiv:2310.19019, 2023.
  34. Shengding Hu, Yuge Tu, Xu Han, Chaoqun He, Ganqu Cui, Xiang Long, Zhi Zheng, Yewei Fang, Yuxiang Huang, Weilin Zhao, et al. Minicpm: Unveiling the potential of small language models with scalable training strategies. arXiv preprint arXiv:2404.06395, 2024.
  35. Yuelyu Ji, Zhuochun Li, Rui Meng, and Daqing He. Reasoningrank: Teaching student models to rank through reasoning-based knowledge distillation. arXiv preprint arXiv:2410.05168, 2024.
  36. Yuelyu Ji, Wenhe Ma, Sonish Sivarajkumar, Hang Zhang, Eugene Mathew Sadhu, Zhuochun Li, Xizhi Wu, Shyam Visweswaran, and Yanshan Wang. Mitigating the risk of health inequity exacerbated by large language models. arXiv preprint arXiv:2410.05180, 2024.
  37. Yuelyu Ji, Zeshui Yu, and Yanshan Wang. Assertion detection in clinical natural language processing using large language models. In 2024 IEEE 12th International Conference on Healthcare Informatics (ICHI), pages 242–247, 2024.
  38. Yipeng Kang, Tonghan Wang, Qianlan Yang, Xiaoran Wu, and Chongjie Zhang. Non-linear coordination graphs. Advances in Neural Information Processing Systems, 35:25655–25666, 2022.
  39. Jacob Devlin Ming-Wei Chang Kenton and Lee Kristina Toutanova. Bert: Pre-training of deep bidirectional transformers for language understanding. In Proceedings of naacL-HLT, volume 1, page 2, 2019.
  40. Lingkai Kong, Haorui Wang, Wenhao Mu, Yuanqi Du, Yuchen Zhuang, Yifei Zhou, Yue Song, Rongzhi Zhang, Kai Wang, and Chao Zhang. Aligning large language models with representation editing: A control perspective. Advances in Neural Information Processing Systems, 2024.
  41. Margaret E Kruk, Anna D Gage, Catherine Arsenault, Keely Jordan, Hannah H Leslie, Sanam Roder-DeWan, Olusoji Adeyi, Pierre Barker, Bernadette Daelmans, Svetlana V Doubova, et al. High-quality health systems in the sustainable development goals era: time for a revolution. The Lancet global health, 6(11):e1196–e1252, 2018.
  42. Roberta Kwok et al. Ai empowers conservation biology. Nature, 567(7746):133–134, 2019.
  43. Yinghao Li, Lingkai Kong, Yuanqi Du, Yue Yu, Yuchen Zhuang, Wenhao Mu, and Chao Zhang. Muben: Benchmarking the uncertainty of molecular representation models. Transactions on Machine Learning Research, 2023.
  44. Yuchen Li, Siyu Teng, Lingxi Li, Zhe Xuanyuan, and Long Chen. Foundation models for mining 5.0: Challenges, frameworks, and opportunities. In 2023 IEEE 3rd International Conference on Digital Twins and Parallel Intelligence (DTPI), pages 1–6, 2023.
  45. Shuoqiu Li, Han Xu, and Haipeng Chen. Focused react: Improving react through reiterate and early stop. arXiv preprint arXiv:2410.10779, 2024.
  46. Haiyi Mao, Minxue Jia, Jason Xiaotian Dou, Haotian Zhang, and Panayiotis V Benos. Coem: cross-modal embedding for metacell identification. arXiv preprint arXiv:2207.07734, 2022.
  47. Haiyi Mao, Hongfu Liu, Jason Xiaotian Dou, and Panayiotis V Benos. Towards cross-modal causal structure and representation learning. In Machine Learning for Health, pages 120–140. PMLR, 2022.
  48. Julia M Markel, Steven G Opferman, James A Landay, and Chris Piech. Gpteach: Interactive ta training with gpt- based students. In Proceedings of the tenth acm conference on learning@ scale, pages 226–236, 2023.
  49. Aditya Mate, Lovish Madaan, Aparna Taneja, Neha Madhiwalla, Shresth Verma, Gargi Singh, Aparna Hegde, Pradeep Varakantham, and Milind Tambe. Field study in deploying restless multi-armed bandits: Assisting non- profits in improving maternal and child health. In Proceedings of the AAAI Conference on Artificial Intelligence, volume 36, pages 12017–12025, 2022.
  50. Tasquia Mizan and Sharareh Taghipour. Medical resource allocation planning by integrating machine learning and optimization models. Artificial Intelligence in Medicine, 134:102430, 2022.
  51. Michael Moor, Oishi Banerjee, Zahra Shakeri Hossein Abad, Harlan M Krumholz, Jure Leskovec, Eric J Topol, and Pranav Rajpurkar. Foundation models for generalist medical artificial intelligence. Nature, 616(7956):259–265, 2023.
  52. Siddharth Nishtala, Lovish Madaan, Aditya Mate, Harshavardhan Kamarthi, Anirudh Grama, Divy Thakkar, Dhyanesh Narayanan, Suresh Chaudhary, Neha Madhiwalla, Ramesh Padmanabhan, et al. Selective intervention planning using restless multi-armed bandits to improve maternal and child health outcomes. arXiv preprint arXiv:2103.09052, 2021.
  53. Joon Sung Park, Joseph O’Brien, Carrie Jun Cai, Meredith Ringel Morris, Percy Liang, and Michael S Bernstein. Generative agents: Interactive simulacra of human behavior. In Proceedings of the 36th annual acm symposium on user interface software and technology, pages 1–22, 2023.
  54. Sarita Paudel, Benjamin E Warner, Renwei Wang, Jennifer Adams-Haduch, Alex S Reznik, Jason Dou, Yufei Huang, Yu-Tang Gao, Woon-Puay Koh, Alan Backerholm, et al. Serologic profiling using an epstein-barr virus mammalian expression library identifies ebna1 iga as a prediagnostic marker for nasopharyngeal carcinoma. Clinical Cancer Research, 28(23):5221–5230, 2022.
  55. David Paulus, Gerdien de Vries, Marijn Janssen, and Bartel Van de Walle. Reinforcing data bias in crisis information management: The case of the yemen humanitarian response. International Journal of Information Management, 72:102663, 2023.
  56. Dazhi Peng and Hangrui Cao. E-tamba: Efficient transformer-mamba layer transplantation. In NeurIPS 2024 Workshop on Fine-Tuning in Modern Machine Learning: Principles and Scalability, 2024.
  57. Andrew Perrault, Fei Fang, Arunesh Sinha, and Milind Tambe. Artificial intelligence for social impact: Learning and planning in the data-to-deployment pipeline. AI Mag., 41(4):3–16, 2020.
  58. Yuji Roh, Geon Heo, and Steven Euijong Whang. A survey on data collection for machine learning: a big data-ai integration perspective. IEEE Transactions on Knowledge and Data Engineering, 33(4):1328–1347, 2019.
  59. Paul S Rosenbloom, John E Laird, and Allen Newell. Meta- levels in soar. In Meta-Level Architectures and Reflection, pages 227–240. Elsevier Science Publishers BV Amsterdam, 1988.
  60. Nithya Sambasivan and Rajesh Veeraraghavan. The deskilling of domain expertise in ai development. In Proceedings of the 2022 CHI Conference on Human Factors in Computing Systems, pages 1–14, 2022.
  61. Shibani Santurkar, Esin Durmus, Faisal Ladhak, Cinoo Lee, Percy Liang, and Tatsunori Hashimoto. Whose opinions do language models reflect? In International Conference on Machine Learning, pages 29971–30004. PMLR, 2023.
  62. Roderick Seow, Yunfan Zhao, Duncan Wood, Milind Tambe, and Cleotilde Gonzalez. Improving the prediction of individual engagement in recommendations using cognitive models. Workshop on Health Recommender Systems co-located with ACM RecSys 2024, 2024.
  63. Sonia Jawaid Shaikh. Artificial intelligence and resource allocation in healthcare: The process-outcome divide in perspectives on moral decision-making. In AI4SG@ AAAI Fall Symposium, 2020.
  64. Zheyuan Ryan Shi, Claire Wang, and Fei Fang. Artificial intelligence for social good: A survey. arXiv preprint arXiv:2001.01818, 2020.
  65. Eric Shieh, Bo An, Rong Yang, Milind Tambe, Craig Baldwin, Joseph DiRenzo, Ben Maule, and Garrett Meyer. Protect: A deployed game theoretic system to protect the ports of the united states. In Proceedings of the 11th international conference on autonomous agents and multiagent systems-volume 1, pages 13–20, 2012.
  66. Arunesh Sinha, Fei Fang, Bo An, Christopher Kiekintveld, and Milind Tambe. Stackelberg security games: Looking beyond a decade of success. IJCAI, 2018.
  67. Haotian Sun, Yuchen Zhuang, Lingkai Kong, Bo Dai, and Chao Zhang. Adaplanner: Adaptive planning from feedback with language models. Advances in Neural Information Processing Systems, 2023.
  68. Nenad Tomasev, Julien Cornebise, Frank Hutter, Shakir Mohamed, Angela Picciariello, Bec Connelly, Danielle CM Belgrave, Daphne Ezer, Fanny Cachat van der Haert, Frank Mugisha, et al. Ai for social good: unlocking the opportunity for positive impact. Nature Communications, 11(1):2468, 2020.
  69. Shresth Verma, Yunfan Zhao, Sanket Shah, Niclas Boehmer, Aparna Taneja, and Milind Tambe. Group fairness in predict-then-optimize settings for restless bandits. In The 40th Conference on Uncertainty in Artificial Intelligence.
  70. Shresth Verma, Niclas Boehmer, Lingkai Kong, and Milind Tambe. Balancing act: Prioritization strategies for llm- designed restless bandit rewards. 2024.
  71. Vijay Viswanathan, Chenyang Zhao, Amanda Bertsch, Tongshuang Wu, and Graham Neubig. Prompt2model: Generating deployable models from natural language instructions. In Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing: System Demonstrations, pages 413–421, 2023.
  72. Fei Wang and Anita Preininger. Ai in health: state of the art, challenges, and future directions. Yearbook of medical informatics, 28(01):016–026, 2019.
  73. Tonghan Wang, Heng Dong, Victor Lesser, and Chongjie Zhang. Roma: Multi-agent reinforcement learning with emergent roles. In Proceedings of the 37th International Conference on Machine Learning, 2020.
  74. Tonghan Wang, Tarun Gupta, Anuj Mahajan, Bei Peng, Shimon Whiteson, and Chongjie Zhang. Rode: Learning roles to decompose multi-agent tasks. In International Conference on Learning Representations, 2020.
  75. Yanan Wang, Yong Ge, Li Li, Rui Chen, and Tong Xu. M3rec: An offline meta-level model-based reinforcement learning approach for cold-start recommendation. In Proceedings of the 33th International Conference on Neural Information Processing Systems, NIPS, volume 20, 2020.
  76. Ziyu Wang, Nanqing Luo, and Pan Zhou. Guardhealth: Blockchain empowered secure data management and graph convolutional network enabled anomaly detection in smart healthcare. Journal of Parallel and Distributed Computing, 142:1–12, 2020.
  77. Kai Wang, Shresth Verma, Aditya Mate, Sanket Shah, Aparna Taneja, Neha Madhiwalla, Aparna Hegde, and Milind Tambe. Scalable decision-focused learning in restless multi-armed bandits with application to maternal and child health. In Proceedings of the AAAI Conference on Artificial Intelligence, volume 37, pages 12138–12146, 2023.
  78. Haorui Wang, Marta Skreta, Cher-Tian Ser, Wenhao Gao, Lingkai Kong, Felix Streith-Kalthoff, Chenru Duan, Yuchen Zhuang, Yue Yu, Yanqiao Zhu, et al. Efficient evolutionary search over chemical space with large language models. arXiv preprint arXiv:2406.16976, 2024.
  79. Jiaqi Wang, Zihao Wu, Yiwei Li, Hanqi Jiang, Peng Shu, Enze Shi, Huawen Hu, Chong Ma, Yiheng Liu, Xuhui Wang, et al. Large language models for robotics: Opportunities, challenges, and perspectives. arXiv preprint arXiv:2401.04334, 2024.
  80. Ziyu Wang, Anil Kanduri, Seyed Amir Hossein Aqajari, Salar Jafarlou, Sanaz R Mousavi, Pasi Liljeberg, Shaista Malik, and Amir M Rahmani. Ecg unveiled: Analysis of client re-identification risks in real-world ecg datasets. arXiv preprint arXiv:2408.10228, 2024.
  81. Ziyu Wang, Hao Li, Di Huang, and Amir M Rah- mani. Healthq: Unveiling questioning capabilities of llm chains in healthcare conversations. arXiv preprint arXiv:2409.19487, 2024.
  82. Ziyu Wang, Zhongqi Yang, Iman Azimi, and Amir M. Rah- mani. Differential private federated transfer learning for mental health monitoring in everyday settings: A case study on stress detection. In Proceedings of the 46th Annual International Conference of the IEEE Engineering in Medicine and Biology Society (EMBC), 2024.
  83. Chaojun Xiao, Zhengyan Zhang, Chenyang Song, Dazhi Jiang, Feng Yao, Xu Han, Xiaozhi Wang, Shuo Wang, Yufei Huang, Guanyu Lin, et al. Configurable foundation models: Building llms from a modular perspective. arXiv preprint arXiv:2409.02877, 2024.
  84. Guojun Xiong and Jian Li. Provably efficient reinforcement learning for adversarial restless multi-armed bandits with unknown transitions and bandit feedback. arXiv preprint arXiv:2405.00950, 2024.
  85. Guojun Xiong, Shufan Wang, Gang Yan, and Jian Li. Reinforcement learning for dynamic dimensioning of cloud caches: A restless bandit approach. IEEE/ACM Transactions on Networking, 31(5):2147–2161, 2023.
  86. Guojun Xiong, Ujwal Dinesha, Debajoy Mukherjee, Jian Li, and Srinivas Shakkottai. Dopl: Direct online preference learning for restless bandits with preference feedback, 2024.
  87. Guojun Xiong, Shufan Wang, Jian Li, and Rahul Singh. Whittle index-based q-learning for wireless edge caching with linear function approximation. IEEE/ACM Transactions on Networking, 2024.
  88. Haifeng Xu, Long Tran-Thanh, and Nick Jennings. Playing repeated security games with no prior knowledge. In AAMAS’16: Proceedings of the 2016 International Conference on Autonomous Agents & Multiagent Systems, pages 104–112. ACM Press, 2016.
  89. Lily Xu, Arpita Biswas, Fei Fang, and Milind Tambe. Ranked prioritization of groups in combinatorial bandit allocation. arXiv preprint arXiv:2205.05659, 2022.
  90. Liming Xu, Sara Almahri, Stephen Mak, and Alexandra Brintrup. Multi-agent systems and foundation models enable autonomous supply chains: Opportunities and challenges. Available at SSRN 4695075, 2023.
  91. Han Xu, Xingyuan Wang, and Haipeng Chen. Towards real- time and personalized code generation. In Proceedings of the 33rd ACM International Conference on Information and Knowledge Management, page 5568–5569, 2024.
  92. Han Xu, Jingyang Ye, Yutong Li, and Haipeng Chen. Can speculative sampling accelerate react without compromising reasoning quality? In The Second Tiny Papers Track at ICLR 2024, 2024.
  93. Han Xu, Ruining Zhao, Jindong Wang, and Haipeng Chen. Restful-llama: Connecting user queries to restful apis. In Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing: Industry Track, pages 1433–1443, 2024.
  94. Meike Zehlike, Francesco Bonchi, Carlos Castillo, Sara Hajian, Mohamed Megahed, and Ricardo Baeza-Yates. Fa* ir: A fair top-k ranking algorithm. In Proceedings of the 2017 ACM on Conference on Information and Knowledge Management, pages 1569–1578, 2017.
  95. Chenyang Zhao, Xueying Jia, Vijay Viswanathan, Graham Neubig, and Tongshuang Wu. Self-guide: Better task- specific instruction following via self-synthetic finetuning. In First Conference on Language Modeling.
  96. Yunfan Zhao, Alvin Pan, Krzysztof Marcin Choromanski, Deepali Jain, and Vikas Sindhwani. Implicit two-tower policies. In 5th Workshop on practical ML for limited/low resource settings.
  97. Yunfan Zhao, Nikhil Behari, Edward Hughes, Edwin Zhang, Dheeraj Nagaraj, Karl Tuyls, Aparna Taneja, and Milind Tambe. Towards a pretrained model for restless bandits via multi-arm generalization. IJCAI, 2024.
  98. Yunfan Zhao, Nikhil Behari, Edward Hughes, Edwin Zhang, Dheeraj Nagaraj, Karl Tuyls, Aparna Taneja, and Milind Tambe. Towards zero shot learning in restless multi-armed bandits. In Proceedings of the 23rd International Conference on Autonomous Agents and Multiagent Systems, pages 2618–2620, 2024.
  99. Yunfan Zhao, Tonghan Wang, Dheeraj Nagaraj, Aparna Taneja, and Milind Tambe. The bandit whisperer: Communication learning for restless bandits. arXiv preprint arXiv:2408.05686, 2024.