Источник: Science Advances (Research Article)
DOI: 10.1126/sciadv.adr1443
Выходные данные: Sci. Adv. 11, eadr1443 (2025), 21 November 2025
Оригинальное название: Benchmarking retrieval-augmented large language models in biomedical NLP: Application, robustness, and self-awareness
Страница журнала (DOI): https://www.science.org/doi/10.1126/sciadv.adr1443
PubMed: https://pubmed.ncbi.nlm.nih.gov/41270181/
PDF (PMC): https://pmc.ncbi.nlm.nih.gov/articles/PMC12637297/pdf/sciadv.adr1443.pdf
Лицензия оригинала: Creative Commons Attribution License 4.0 (CC BY).
Данный HTML-файл представляет собой неофициальный перевод статьи на русский язык, выполненный для учебных/научно-образовательных целей. Перевод не является публикацией авторов оригинала.

БЕНЧМАРКИНГ RETRIEVAL-AUGMENTED БОЛЬШИХ ЯЗЫКОВЫХ МОДЕЛЕЙ В БИОМЕДИЦИНСКОМ NLP: ПРИМЕНЕНИЕ, УСТОЙЧИВОСТЬ И САМООСОЗНАННОСТЬ

Первоисточник: Li M., Zhan Z., Yang H., Xiao Y., Zhou H., Huang J., Zhang R. Benchmarking retrieval-augmented large language models in biomedical NLP: Application, robustness, and self-awareness. Sci. Adv. 11, eadr1443 (2025), 21 Nov 2025. DOI: 10.1126/sciadv.adr1443.

Mingchen Li1

Zaifu Zhan2

Han Yang3

Yongkang Xiao3

Huixue Zhou3

Jiatan Huang1

Rui Zhang1*

1 Division of Computational Health Sciences, Department of Surgery, University of Minnesota, Minneapolis, MN, USA.
2 Department of Electrical and Computer Engineering, University of Minnesota, Minneapolis, MN, USA.
3 Institute for Health Informatics, University of Minnesota, Minneapolis, MN, USA.
* Corresponding author: ruizhang@umn.edu

Аннотация

Чтобы снизить уровень «галлюцинаций» в больших языковых моделях (LLM), retrieval-augmented LLM (RAL) извлекают подтверждающие знания из внешних баз данных. Однако их эффективность в задачах биомедицинской обработки естественного языка (NLP) остаётся недостаточно изученной. Мы представляем Biomedical Retrieval-Augmented Generation Benchmark — комплексный фреймворк оценки, предназначенный для анализа RAL в пяти задачах биомедицинского NLP и на 11 наборах данных, с использованием четырёх тестовых стендов: устойчивость к неразмеченным данным (unlabeled robustness), контрфактуальная устойчивость (counterfactual robustness), устойчивость к разнообразию сценариев (diverse robustness) и самоосознанность (self-awareness). Для повышения устойчивости RAL и их «негативной осведомлённости» (negative awareness) мы предлагаем стратегию «обнаружить и исправить» (detect-and-correct) и подход контрастивного обучения (contrastive learning). Экспериментальные результаты показывают, что RAL в целом превосходят стандартные LLM в большинстве биомедицинских задач, однако по-прежнему испытывают трудности с устойчивостью и самоосознанностью, особенно в контрфактуальных и разнообразных сценариях. Предложенные нами методы существенно повышают показатели устойчивости к неразмеченным и контрфактуальным данным, а также усиливают способность модели выявлять и избегать неверных предсказаний. Эти результаты подчёркивают ключевые ограничения современных RAL и указывают на необходимость дальнейшего совершенствования для обеспечения надёжности и точности в высокорисковых биомедицинских приложениях.

Введение

В последнее время был достигнут существенный прогресс в области больших языковых моделей (LLM). Для адаптации LLM к биомедицинскому домену были разработаны специализированные биомедицинские LLM, такие как MedLLaMA-13B (1) и Med-PaLM 2 (2). Несмотря на впечатляющие универсальные возможности (3), эти модели по-прежнему сталкиваются с заметными проблемами, включая фактические «галлюцинации» (4) и отсутствие доступа к недавно появившимся знаниям (5).

Retrieval-augmented языковые модели (RAL) (3, 6–8), напротив, при необходимости могут извлекать знания из внешнего хранилища данных, потенциально снижая «галлюцинации» и улучшая способность к адаптации к новым знаниям. Наиболее распространённый подход заключается в том, что специализированный модуль извлечения (retriever) подбирает знания, релевантные входному предложению; затем извлечённые сведения вместе с исходным предложением подаются в LLM, помогая ей сформировать ожидаемый выход.

В задаче ответов на вопросы (question answering, QA) RAL может получать знания из неразмеченного корпуса, который выступает извлекаемой базой знаний, например PubMed. Формат QA позволяет неразмеченному корпусу потенциально предоставлять ответы на вопросы. Однако для задач вроде извлечения триплетов включение неразмеченного корпуса может давать нежелательные эффекты. Контрфактуальная информация, например ошибочные аннотации, распространена в размеченных корпусах и создаёт сложности для retriever-модулей при получении полезных сведений. Кроме того, LLM по-прежнему сталкиваются с проблемой генерации ненадёжной информации, если извлечённые данные были получены некорректно.

Интеграция разнообразных знаний выглядит перспективной для улучшения качества моделей. Например, в QA извлечение ответа может опираться на обширный контекст, что потенциально влияет на результативность извлечения информации. При этом влияние извлечённой информации из различных задач или наборов данных на качество RAL остаётся недостаточно изученным. Для RAL критически важна самоосознанность (self-awareness): если RAL может различать «позитивные» извлечённые знания и «негативные» знания, то у неё появляется возможность корректировать свои действия.

Перечисленные сложности мешают RAL стабильно выдавать надёжные и точные ответы. К сожалению, в биомедицинском домене лишь немногие исследования, такие как Almanac (9), изучали эффективность RAL в QA, что оставляет пробел в понимании того, как эти факторы влияют на RAL в различных задачах биомедицинской обработки естественного языка (NLP). Следовательно, существует насущная потребность в комплексной оценке RAL с различными LLM на широком спектре биомедицинских NLP-задач.

В этой работе проводится комплексная оценка RAL для разных LLM на пяти биомедицинских NLP-задачах по 11 наборам данных. Для этого мы создаём новый бенчмарк RAL для биомедицинского NLP — Biomedical Retrieval-Augmented Generation Benchmark (BioRAB), показанный на рис. 1, а также формируем четыре тестовых стенда для оценки упомянутых фундаментальных способностей.

Схема BioRAB: запрос пользователя, retrieval-инструмент, LLM и разные типы корпусов (размеченный, неразмеченный, контрфактуальный и разнообразный)
Рисунок 1. Возможности BioRAB при запросах к различным типам корпусов для проверки способности осознания (awareness) и способности генерации (generation) у RAL.
  1. Устойчивость к неразмеченным данным (unlabeled robustness) обозначает способность RAL извлекать полезную информацию из неразмеченного корпуса для извлечения, особенно в задачах, требующих разметки, таких как извлечение триплетов и классификация. Например, в задачах извлечения отношений корпус может быть размеченным набором данных (например, обучающим набором) либо неразмеченным (обучающий набор без меток). Если RAL достигает сопоставимой или более высокой результативности, извлекая данные из неразмеченного набора по сравнению с извлечением из размеченного набора, это указывает, что для RAL размеченные базы данных могут быть не обязательны. В тестовом стенде устойчивости к неразмеченным данным корпус содержит примеры без меток.
  2. Контрфактуальная устойчивость (counterfactual robustness) отражает, способна ли RAL извлечь корректную информацию из контрфактуального корпуса; в нашей работе контрфактуальный пример означает ошибочно размеченную аннотацию. В тестовом стенде контрфактуальной устойчивости корпус состоит из примеров, содержащих определённую долю неверных меток.
  3. Устойчивость к разнообразию (diverse robustness) оценивает, может ли RAL улучшать качество, интегрируя информацию из нескольких задач. Например, корпус для задачи классификации может быть сформирован из данных задач извлечения отношений и QA. В тестовом стенде устойчивости к разнообразию корпус включает примеры из различных задач.
  4. Негативная осведомлённость (negative awareness) относится к способности RAL определять, влияет ли извлечённое знание на итоговый результат положительно или отрицательно. В тестовом стенде негативной осведомлённости корпус состоит из примеров, которые на 100% являются контрфактуальными.

Используя BioRAB, мы оцениваем эффективность по пяти задачам (извлечение триплетов, предсказание связей, классификация текста, QA и вывод в естественном языке) на 11 биомедицинских NLP-наборах данных. Кроме того, BioRAB применяется для оценки пяти широко используемых LLM: LLaMA2-13B (10), MedLLaMA-13B (1), LLaMA3-8B (11), Phi4-14B (12) и Qwen2.5 32B (13), с использованием трёх распространённых retriever-модулей: BM25 (14), Contriever (15) и MedCPT (16).

Мы обнаружили, что хотя RAL могут повышать точность ответов в большинстве рассмотренных биомедицинских NLP-задач, они сталкиваются с заметными трудностями. В частности, в задаче QA мы отмечаем, что RAL не обеспечили существенных улучшений на использованных наборах данных. Мы предполагаем, что это может быть связано с ограничениями корпуса, применяемого для извлечения: поскольку обучающий набор (корпус, используемый для извлечения) может предоставлять недостаточный объём информации по сравнению с использованием Wikipedia или PubMed. Кроме того, RAL испытывают трудности при генерации ожидаемого результата, когда корпус лишён меток, по сравнению с размеченным корпусом.

Интересное наблюдение состоит в том, что на наборах данных ChemProt и Hetionet RAL демонстрируют улучшение качества при использовании неразмеченных корпусов по сравнению с исходной LLM. Вместе с тем RAL в целом не способны извлекать полезную информацию из контрфактуальных корпусов и испытывают трудности при выборе наиболее релевантных сведений. Мы также отмечаем, что это не является универсальным случаем: на некоторых наборах данных, например ADE и Hetionet, RAL способны справляться с контрфактуальными примерами.

Дополнительно, при наличии разнообразного размеченного корпуса RAL не достигают оптимальной результативности по всем задачам, за исключением задачи вывода в естественном языке. Наконец, мы обнаружили, что даже при предоставлении контрфактуальных примеров в ходе обучения LLM всё ещё способна генерировать корректные выходы в некоторых случаях. Однако RAL испытывают трудности с самоосознанностью, поскольку не обладают способностью определять, какие примеры могут помочь улучшить качество модели.

Чтобы решить эти проблемы, мы предлагаем метод detect-and-correct, направленный на усиление способности RAL выявлять и исправлять ошибки в корпусе извлечения, тем самым повышая общую надёжность. Кроме того, мы представляем подход контрастивного обучения (contrastive learning), который уточняет негативную осведомлённость RAL, усиливая её способность различать отличия между примерами. Интеграция этих двух техник существенно повышает устойчивость и способности осознания RAL, делая её более эффективной при обработке сложных retrieval-сценариев. В совокупности эти улучшения способствуют созданию более устойчивой и точной модели для биомедицинских приложений.

Наши вклады заключаются в следующем:

  1. Мы предлагаем четыре способности, необходимые для оценки RAL в биомедицинском домене, и вводим бенчмарк BioRAB для их измерения. Насколько нам известно, это первый бенчмарк, специально предназначенный для оценки этих четырёх способностей RAL в биомедицинской области.
  2. Мы предлагаем метод detect-and-correct и подход контрастивного обучения для повышения устойчивости RAL (к неразмеченным и контрфактуальным данным) и негативной осведомлённости.
  3. Мы оценили LLM при использовании retrieval-augmented подхода и выявили ограничения по четырём ключевым способностям.
  4. Мы оцениваем RAL на пяти различных биомедицинских задачах по 11 наборам данных, используя пять LLM и три retriever-модуля.

Результаты RAL и базовых LLM

Сначала мы провели бенчмаркинг различных LLM и RAL на 11 наборах данных; результаты представлены в табл. 1. В задаче извлечения триплетов мы наблюдали, что RAL превосходят LLM (в частности, RAL без модуля извлечения) на LLaMA2-13B, MedLLaMA-13B, LLaMA3-8B и Phi4 14B, демонстрируя более высокую результативность. Например, RAL (MedLLaMA 13B с Contriever) улучшили исходную MedLLaMA 13B на 22.37% по F1-мере на наборе ADE. Ещё один вывод состоит в том, что для Qwen2.5-32B использование разных извлекателей не приводит к значимому улучшению качества.

Также было показано, что RAL эффективно повышают качество LLM в задачах предсказания связей, классификации текста и вывода в естественном языке. RAL (LLaMA2 13B с Contriever) улучшили исходную LLaMA2 13B на 0.40% по F1-мере на наборе PharmKG; RAL (MedLLaMA 13B с BM25) улучшили исходную MedLLaMA 13B на 11.86% по F1-мере на наборе Hetionet; RAL (LLaMA2 13B с MedCPT) улучшили исходную LLaMA2 13B на 0.40% по F1-мере на наборе Ade-corpus-v2; RAL (LLaMA2 13B с Contriever) улучшили исходную LLaMA2 13B на 1.67% по F1-мере на наборе SemClass; RAL (LLaMA2 13B с MedCPT) улучшили исходную LLaMA2 13B на 6.59% по Macro-avgF1 на наборе BioNLI.

Таблица 1. Результаты Micro-F1 для извлечения троек, предсказания связей и классификации текста, а также Macro-average F1 для QA и BioNLI на 11 датасетах (подчёркивание — лучший результат для соответствующего датасета).
LLM Approach Triple extraction Link prediction Classification QA NL inference
ADE ChemProt GIT PharmKG Hetionet DS Ade-corpus-v2 SemClass SDoH classification MedM-CQA BioNLI
LLaMA2-13B BM25 (14) 30.93 49.11 57.61 97.60 82.37 75.86 95.40 75.50 63.71 40.42 45.10
Contriever (15) 36.06 85.40 73.55 98.00 77.00 76.50 96.60 79.33 61.18 35.52 35.12
MedCPT (16) 30.81 85.82 74.52 97.40 81.60 78.01 96.80 78.33 68.77 36.80 69.21
No Retriever 34.86 77.48 58.99 97.60 80.80 77.15 96.40 77.66 72.57 41.52 62.62
MedLLaMA-13B BM25 (14) 33.77 52.02 57.89 95.00 90.04 71.33 95.60 72.67 65.40 37.86 48.81
Contriever (15) 34.58 85.69 65.88 97.00 77.20 75.64 95.60 77.66 56.96 29.77 53.07
MedCPT (16) 31.41 80.70 75.24 97.40 84.40 72.84 95.40 76.16 66.66 33.88 53.68
No Retriever 12.21 50.52 42.05 97.20 78.54 80.38 95.40 64.00 67.71 46.47 61.07
LLaMA3-8B BM25 (14) 27.79 70.10 62.65 96.80 81.80 75.43 94.80 75.50 71.30 37.79 19.17
Contriever (15) 32.70 86.91 70.96 96.60 73.40 78.01 94.60 75.83 72.57 28.11 63.85
MedCPT (16) 29.19 84.81 57.59 97.00 83.00 76.29 95.40 74.67 71.72 31.56 56.89
No Retriever 7.05 21.32 74.27 97.20 81.80 80.38 93.80 73.16 57.00 55.91 6.71
Phi4 14B BM25 (14) 36.23 81.26 60.61 97.20 88.80 60.75 88.20 74.67 78.90 35.49 67.65
Contriever (15) 27.66 69.70 74.84 31.60 74.20 53.58 90.80 75.17 81.43 33.89 56.65
MedCPT (16) 26.35 79.48 72.55 96.80 82.80 57.38 90.60 75.00 80.16 27.72 85.45
No Retriever 16.56 77.23 30.09 97.60 82.20 54.05 89.20 72.50 74.68 66.18 82.50
Qwen2.5 32B BM25 (14) 40.56 86.24 65.51 97.20 82.00 72.44 94.20 78.50 78.05 28.39 81.29
Contriever (15) 45.65 87.16 73.12 97.60 75.80 77.37 94.20 76.33 80.16 28.10 89.99
MedCPT (16) 42.62 87.72 69.46 96.20 82.80 71.78 95.00 76.83 72.99 28.22 91.19
No Retriever 26.76 88.09 68.50 90.40 81.00 76.93 94.80 48.00 74.26 20.91 63.20

Примечание: для полного набора результатов в оригинале предлагается обращаться к Supplementary Materials.

На MedMCQA наши выводы отличаются от других работ (17): мы наблюдали, что LLM превосходят RAL в достижении наилучшего качества, и предполагаем, что причина этого расхождения связана с природой «нечувствительных к разметке» задач, в которых RAL способны извлекать большие корпуса, такие как PubMed (18), или другие релевантные наборы данных. В нашем исследовании, однако, корпус формировался исключительно из обучающего набора, что может ограничивать широту знаний, доступных RAL.

Результаты тестовых стендов 1, 2 и 3

Мы оцениваем качество модели на основе неразмеченного корпуса; результаты представлены в табл. 2. Мы делаем следующие наблюдения:

  1. RAL, использующая неразмеченный корпус, демонстрирует более низкое качество по сравнению с RAL, использующей размеченный корпус. RAL показали сильную зависимость от размеченного корпуса, особенно в задачах, требующих разметки. Например, при использовании размеченного корпуса качество RAL превосходит качество RAL без размеченного корпуса на 26.41% на наборе ADE.
  2. Даже без неразмеченного корпуса RAL всё равно способствует улучшению качества LLM в некоторых задачах. Как показано в табл. 2, на ChemProt и Hetionet RAL, использующая неразмеченный корпус, улучшает качество исходной LLM на 30.16 и 0.06% соответственно. Мы предполагаем, что LLM может обладать достаточными знаниями, чтобы повышать качество на специфических наборах данных.
Таблица 2. Результаты Micro-F1 (и Macro-average F1 для BioNLI) на восьми датасетах для testbed 1–3 при разных типах корпуса. Подчёркивание — лучший результат для соответствующего датасета.
Corpus Triple extraction Triple extraction Link prediction Classification NL inference
ADE GIT PHarmKG Hetionet Ade-corpus-v2 SemClass SDoH classification BioNLI
Unlabeled corpus 14.39 1.01 97.20 78.60 93.00 6.83 72.99 61.38
Counterfactual corpus (20%) 45.06 73.03 97.40 94.80 95.80 73.33 75.50 87.62
Counterfactual corpus (80%) 30.07 74.84 97.80 85.26 95.00 75.66 13.34 60.09
Counterfactual corpus (100%) 39.98 74.81 97.60 76.60 96.80 77.66 0 58.52
Diverse corpus 10.08 69.80 97.20 75.41 96.20 75.33 83.90 80.32
Labeled corpus 45.65 75.24 98.00 90.40 96.80 79.33 81.43 91.19
None 26.76 42.05 97.60 78.54 96.40 77.66 74.68 63.20

Мы оцениваем качество модели при разных долях контрфактуальных примеров; результаты приведены в табл. 2. Мы делаем следующие наблюдения:

  1. Контрфактуальный корпус является сложным для RAL. На ADE контрфактуальные примеры существенно влияют на качество модели. Например, когда доля контрфактуальных примеров установлена на уровне 80%, Micro-F1 для извлечения триплетов падает примерно до 10%, что демонстрирует значимый разрыв по сравнению с результатом на размеченном корпусе. Аналогичные наблюдения отмечаются на GIT, PharmKG, Ade-corpus-v2, SemClass и BioNLI. Это указывает, что RAL может легко вводиться в заблуждение контрфактуальным корпусом.
  2. Более низкая доля контрфактуальных примеров может оказывать меньший негативный эффект на RAL. На Hetionet мы наблюдали, что при доле контрфактуальных примеров 20% качество модели выше, чем на фактическом корпусе. Мы предполагаем, что при меньшей доле контрфактуальных примеров извлекатель имеет больше шансов получить полезную информацию.
  3. Контрфактуальный корпус всё же может способствовать улучшению качества LLM. На ADE, GIT, PharmKG, Hetionet, Ade-corpus-v2, SemClass и BioNLI интересное наблюдение заключается в том, что даже при контрфактуальном корпусе качество RAL часто превосходит качество исходной LLM. Мы предполагаем, что контрфактуальный корпус может оказывать положительное влияние на LLM. Несмотря на то что содержимое примеров является контрфактуальным, предоставленные шаблоны всё же помогают генерации.
  4. Доли контрфактуальных примеров и качество модели не находятся в обратно пропорциональной зависимости. Этот вывод противоречит человеческой интуиции. На некоторых наборах данных, таких как SemClass, при более высокой доле контрфактуальных примеров качество модели также повышается. Это указывает, что RAL обладает определённой способностью обрабатывать контрфактуальные факты.

Мы оцениваем устойчивость к разнообразию (diverse robustness); результаты приведены в табл. 2. Мы делаем следующие наблюдения:

Разнообразный размеченный корпус создаёт сложности для улучшения качества RAL. Мы обнаружили, что RAL рассматривает знания из разнообразного корпуса как шум, что потенциально ухудшает качество RAL, особенно заметно на ADE. Однако на BioNLI разнообразный размеченный корпус может способствовать улучшению качества модели. Мы предполагаем, что одна из причин состоит в том, что использованный нами извлекатель не смог получить полезную информацию, тогда как другая причина может заключаться в том, что корпус не содержит необходимой информации.

В дополнение к публичным наборам данных мы также использовали наш частный размеченный набор данных Social Determinants of Health (SDoH) Classification, сформированный на основе данных реального мира. Мы наблюдали тот же вывод, что и для публичных наборов: неразмеченный набор данных и контрфактуальный корпус влияют на качество RAL. Мы не включали наш частный размеченный набор данных DS, поскольку RAL без извлекателей демонстрировали более высокое качество.

Результаты тестового стенда 4: негативная осведомлённость

Мы оцениваем качество модели по метрике негативной осведомлённости; результаты приведены в табл. 3. Мы делаем следующие наблюдения: RAL испытывает трудности с негативной осведомлённостью. Истинная доля негативной осведомлённости на PharmKG и BioNLI равна нулю, и лишь 1.07% на ADE. В целом показатель «ложной» негативной осведомлённости выше, чем показатель истинной негативной осведомлённости. Это указывает, что RAL по-прежнему испытывают трудности с самоосознанностью, то есть с пониманием того, какие примеры могут предоставить полезную информацию для генерации.

Таблица 3. Показатели RAL на testbed 4 (negative awareness): истинная доля negative awareness и доля ложной negative awareness.
Task Dataset True negative awareness rate Fake negative awareness rate
Triple extraction ADE 5.75 94.24
GIT 27.73 69.75
Link prediction PHarmKG 0.00 63.11
Hetionet 1.71 31.33
Text classification Ade-corpus-v2 68.75 70.45
SemClass 1.49 99.35
SDoH classification 11.18 86.22
Natural language inference BioNLI 0.00 0.38

Результаты нашего метода на неразмеченной базе данных

В табл. 4 представлены результаты нашего метода detect-and-correct в сравнении с RAL при различных настройках корпуса извлечения для задачи классификации текста на Ade-corpus-v2 и SemClass. Наш метод достигает F1 = 94.00% на Ade-corpus-v2 и F1 = 75.17% на SemClass, демонстрируя конкурентоспособные результаты. RAL с размеченным корпусом обеспечивает наивысшие значения: 96.80 и 79.33% по F1 соответственно, тогда как RAL с неразмеченным корпусом показывает слабый результат на SemClass (F1 = 6.83%). Примечательно, что наш метод detect-and-correct превосходит RAL с неразмеченным корпусом, демонстрируя эффективность в повышении устойчивости. Эти результаты подчёркивают влияние подходов, основанных на исправлении, в задачах классификации текста.

Примечание: для обеспечения корректности сравнения мы используем лучшую по качеству RAL из табл. 3 в качестве «backbone» для каждой задачи.

Таблица 4. Результаты метода detect-and-correct на задаче классификации текста (Ade-corpus-v2 и SemClass) при разных настройках корпуса.
Corpus Ade-corpus-v2 SemClass
Precision Recall F1 Precision Recall F1
Unlabeled corpus 93.00 93.00 93.00 6.83 6.83 6.83
Labeled corpus 96.80 96.80 96.80 79.33 79.33 79.33
None 96.40 96.40 96.40 77.66 77.66 77.66
Detect-and-correct 94.00 94.00 94.00 75.17 75.17 75.17

Примечание: для обеспечения сопоставимости авторы используют один и тот же RAL при разных настройках корпуса.

Результаты нашего метода на контрфактуальной базе данных

В табл. 5 приведены значения F1 для RAL при пяти настройках корпуса на двух биомедицинских бенчмарках: PharmKG и BioNLI.

Таблица 5. Результаты detect-and-correct на PharmKG и BioNLI (F1).
Corpus PharmKG (F1) BioNLI (F1)
Counterfactual corpus (100%) 97.60 58.52
Unlabeled corpus 78.60 61.38
Labeled corpus 98.00 91.19
None 97.60 63.20
Detect-and-correct 97.80 72.77

Предложенная нами схема detect-and-correct улучшает извлечение, используя GPT4 для исправления извлечённых контрфактуальных примеров перед инференсом модели. Этот метод существенно повышает качество на BioNLI, достигая F1 = 72.77%, превосходя все остальные конфигурации извлечения. На PharmKG, хотя RAL с размеченным корпусом обеспечивает наивысший F1 (98.00%), наш метод демонстрирует сопоставимый результат (97.80%), подтверждая эффективность контрфактуального исправления в снижении влияния шума извлечения.

Результаты нашего метода по осведомлённости

Рассчитав долю истинной негативной осведомлённости (true negative awareness rate) и долю ложной негативной осведомлённости (fake negative awareness rate) для лучших RAL в задаче классификации SDoH, мы обнаружили, что наш метод, который предварительно обучает модель с использованием RAL, улучшая её способность различать положительные и отрицательные примеры, достигает уровня осведомлённости 49.56% по сравнению с 48.70% для RAL без дополнительных методов. Эти результаты показывают, что наш подход повышает способность модели дифференцировать классы. Улучшение указывает, что включение механизмов различения усиливает устойчивость классификации.

Смещение выборки

Чтобы исследовать, как смещение выборки влияет на оценивание, мы провели имитационные исследования на задаче бинарной классификации. Мы сформировали наборы данных с разными соотношениями положительных и отрицательных примеров (1:1 и 1:5) и представили результаты по метрикам взвешенной точности (weighted precision), взвешенной полноты (weighted recall), F1-меры (F1 score), AUROC (area under the receiver operating characteristic curve) и AUPRC (area under the precision–recall curve). В этих экспериментах мы использовали лучшую по качеству RAL: LLaMA2-13B + MedCPT для Ade-corpus-v2 и LLaMA2-13B + Contriever для SemClass соответственно. Таблица 6 показывает метрики качества на разных датасетах (Ade-corpus-v2 и SemClass) при разных соотношениях положительных и отрицательных примеров (1:1 против 1:5).

Таблица 6 – Метрики качества для разных датасетов и соотношений положительных/отрицательных примеров

Dataset Positive/Negative ratio Micro precision Micro recall Micro F1 Weighted precision Weighted recall Weighted F1 AUROC AUPRC
Ade-corpus-v2 1:1 93.40 93.40 93.40 93.39 93.40 93.52 93.91 90.23
Ade-corpus-v2 1:5 93.60 93.60 93.60 93.66 93.60 93.63 92.58 90.38
SemClass 1:1 66.50 66.50 66.50 68.86 66.50 66.08 67.40 77.47
SemClass 1:5 48.50 48.50 48.50 63.38 48.50 35.04 51.75 66.62

Для Ade-corpus-v2 модель демонстрирует стабильное качество как на сбалансированном наборе (1:1), так и на несбалансированном (1:5), с минимальными колебаниями по F1 и AUROC. Для SemClass наблюдается существенное падение качества при переходе от сбалансированного соотношения 1:1 (F1: 66.50%, AUROC: 67.40%) к несбалансированному 1:5 (F1: 48.50%, AUROC: 51.75%). Это указывает, что дисбаланс классов заметно влияет на качество в SemClass и приводит к снижению устойчивости классификации.

Деградация качества SemClass при дисбалансе свидетельствует, что модели сложно обобщать, когда один из классов недопредставлен в обучающих данных. Хотя AUROC остаётся высоким для Ade-corpus-v2, в SemClass при дисбалансе 1:5 наблюдается резкое падение AUROC (67.40% → 51.75%), что подчёркивает трудность различения положительных и отрицательных примеров. Аналогичный тренд наблюдается и для Weighted F1, который падает с 66.08 (1:1) до 35.04 (1:5), показывая, что перепредставление отрицательного класса приводит к смещённым предсказаниям.

Анализ ошибок

Testbed 1

В этой части мы используем ADE, GIT и BioNLI в качестве примеров для анализа ошибок. Чтобы лучше понять влияние неразмеченного корпуса на генерацию модели, данная часть преимущественно анализирует качество RAL на ADE, GIT и BioNLI, которые показали худшие результаты среди девяти датасетов, используемых в исследовании. Мы в основном суммируем два типа ошибок, как показано в таблице 7. Мы наблюдали, что при использовании неразмеченного корпуса RAL склонна генерировать избыточную информацию и испытывает трудности с точным предсказанием ожидаемого вывода, например, головной сущности (head entity) или типа отношения (relation type) в задаче извлечения триплетов.

Testbed 2

В этой части мы используем PharmKG и SemClass в качестве примеров для анализа ошибок. Для запроса “What is the relationship between ethanol and GABRA1?” в PharmKG правильная метка (ground truth label) — “Interactions”. Однако, когда извлечённый корпус содержит 80% шума, сгенерированный ответ — “Chemical-Gene”, что показывает, что избыточный шум при извлечении может ввести модель в заблуждение и привести к неправильным предсказаниям. Например, в SemClass модель должна определить, корректно ли триплет (nitrous acid, INHIBITS, protein) выводится из предложения “Inactivation of protein in poliovirus by nitrous acid”. Правильная метка — True, то есть связь существует. Однако модель предсказывает False, что указывает, что она не распознаёт ингибирующее отношение, выраженное в предложении. Эта ошибка классификации может быть связана с тем, что модель испытывает трудности с неявными лингвистическими сигналами, неверно интерпретирует пассивные конструкции или недостаточно хорошо обобщает термины, связанные с ингибированием.

Testbed 3

В этой части мы используем ADE и MedMCQA в качестве примеров для анализа ошибок. На ADE мы обнаружили, что Diversity-labeled corpus также приводит к избыточности генерации RAL: например, в предложении “easily reversible hypoxemia and hypotension induced by nimodipine.” ожидаемая tail-сущность — “hypotension”, тогда как RAL рассматривает “hypoxemia and hypotension induced by nimodipine” как сущность. Также возникают трудности с извлечением сложных сущностей. Например, в предложении “clinical, spectroscopic, and imaging abnormalities resolved with discontinuation of metronidazole.”, “clinical, spectroscopic, and imaging abnormalities” считается эталонной сущностью (ground truth), тогда как RAL рассматривает всё предложение “clinical, spectroscopic, and imaging abnormalities resolved with discontinuation of metronidazole” как единую сущность. В целом мы обнаружили, что основная проблема заключается в распознавании сущностей, особенно при распознавании tail-сущностей. На MedMCQA мы наблюдали, что генерация ошибок в основном была обусловлена неверным суждением. Например, в предложении “Question: All of the following muscles are elevators of the mandible EXCEPT: Options: (A) Digastric; (B) Masseter; (C) Medial pterygoid; (D) Temporalis,” правильный ответ — “A”, тогда как RAL генерирует “D”.

Обсуждение

Тестовые стенды и наши методы

Результаты показывают, что опора на размеченные по сравнению с неразмеченными корпусами существенно влияет на качество модели, особенно в задачах, требующих большого объёма разметки, таких как ADE, где размеченные данные улучшают результаты на 26.41%. Несмотря на это, RAL всё же повышает качество LLM даже при опоре на неразмеченный корпус, как видно на ChemProt и Hetionet, что указывает на наличие у LLM полезных внутренних знаний. Контрфактуальные корпуса создают сложности: при высокой доле контрфактуальных примеров (80%) значения F1 падают примерно до 10%, что свидетельствует о восприимчивости модели к вводящей в заблуждение информации. Иногда контрфактуальные корпуса повышают качество, как наблюдалось на SemClass, что позволяет предположить: даже некорректные примеры могут вносить вклад в виде полезных шаблонов для генерации. Это явление означает, что RAL способны в некоторой степени работать с контрфактуальной информацией, что противоречит первоначальным ожиданиям. Кроме того, разнообразие внутри размеченных корпусов создаёт проблему для RAL, особенно в ADE, где модели трудно отличать «шум» от действительно ценных знаний.

Таблица 7 – Примеры ошибок при оценке устойчивости на неразмеченном корпусе. В BioNLI входное предложение в таблицу не включено из-за чрезмерной длины предложений.

Тип ошибки Датасет Входное предложение Ожидаемый ответ Ошибочный ответ
Избыточная информация ADE The fourth patient showed rls symptoms that were initially caused by a 20-mg daily olanzapine dosage and were later mitigated when olanzapine was reduced and ropinirole was administered. {Olanzapine, dosage, 20 mg daily} {Olanzapine, dosage, rls symptoms that were initially caused by a 20-mg dail}
GIT Inactivation kinetics of bacterial glycerol dehydratase (ec 4.2.1.30) in the course of its reaction with adenosylcobalamin (adocbl) and its analogs were investigated. Glycerol dehydratase Adenosylcobalamin.. retrieved sentence: glycerol dehydratase
BIONLI Negative Negative retrieved sentence...
Генерация ошибки ADE Four patients receiving high-dose tamoxifen for greater than 1 year have demonstrated similar retinal changes. (Tamoxifen, dosage, high-dose) (Tamoxifen, effect, retinal changes.)
GIT Inactivation of serum alkaline phosphatase by adrenaline and related substances (Adrenaline, inhibits, alkaline phosphatase) (Alkaline phosphatase, interacts with, adrenaline)
BIONLI Positive Negative

Негативная осведомлённость (negative awareness) остаётся слабым местом: RAL демонстрирует низкое качество при различении ложных отрицаний, что видно на PharmKG и BioNLI. Однако наш метод detect-and-correct значительно повышает устойчивость текстовой классификации, превосходя вариант с неразмеченным корпусом на SemClass. Эти результаты подчёркивают важность подходов, основанных на исправлении ошибок, и адаптированных механизмов извлечения для оптимизации качества модели на разных датасетах. Кроме того, используя методы контрастивного обучения, RAL могут улучшить способность различать положительные и отрицательные примеры, тем самым повышая осведомлённость и общее качество.

Будущая работа

Чтобы улучшить устойчивость на неразмеченных данных, мы планируем исследовать способы повышения качества генерации меток за счёт предобучения, дообучения (fine-tuning) или retrieval-ориентированных методов, чтобы усилить способность модели к разметке. Ещё одно перспективное направление — обучение моделей извлечения, которые могут быстро адаптироваться к новым задачам, требующим разметки, при минимальном объёме надзора, тем самым улучшая обобщающую способность в условиях дефицита данных (low-resource). Эти усилия дополнительно укрепят устойчивость RAL при работе с неразмеченными данными и сделают их более эффективными для реальных биомедицинских приложений.

Чтобы улучшить способность RAL работать с контрфактуальными корпусами, мы планируем развивать следующие направления. Во-первых, мы намерены разработать стратегии извлечения, включающие оценку неопределённости (uncertainty estimation), позволяя RAL взвешивать извлечённые фрагменты с учётом вероятности того, что они являются контрфактуальными. Во-вторых, мы предлагаем использовать контрастивные целевые функции (contrastive objectives) для обучения RAL различать фактические и контрфактуальные примеры, тем самым повышая устойчивость механизма извлечения к вводящим в заблуждение данным.

Для повышения устойчивости извлечения (retrieval robustness) фильтрация с учётом неопределённости и гибридное извлечение (dense + sparse) могут помочь снизить зависимость от вводящей в заблуждение информации. Решение проблемы негативной осведомлённости требует контрастивного обучения для фильтрации извлечения и состязательного обучения (adversarial training) на контрфактуальных данных, чтобы улучшить способность модели распознавать ложные отрицания. Кроме того, доменно-специфическую адаптацию можно улучшить предобучением на биомедицинских корпусах и дообучением с использованием структурированных графов знаний, чтобы повысить фактическую согласованность. В дальнейших работах следует исследовать эти стратегии, чтобы сделать RAL более надёжными в сложных биомедицинских задачах.

Чтобы количественно оценивать галлюцинации, тестовые стенды для оценки должны включать биомедицинские бенчмарки факт-чекинга, измеряющие точность фактических утверждений. Метрики вроде retrieval grounding score могут оценивать, насколько хорошо ответы модели согласуются с извлечёнными доказательствами, тогда как hallucination rate может отслеживать долю ответов, содержащих непроверяемые или неверные утверждения. Реализация фильтрации извлечения с учётом неопределённости дополнительно снизит включение низко-доверительных или вводящих в заблуждение фрагментов. Дальнейшие исследования также могут рассмотреть многошаговое извлечение (multihop retrieval reasoning), при котором RAL извлекают несколько подтверждающих документов для валидации сложных биомедицинских утверждений. Эти техники могут существенно повысить надёжность RAL в задачах поддержки клинических решений, анализа биомедицинской литературы и исследования лекарств.

Наконец, хотя наше исследование развивает методы retrieval-augmented learning в биомедицинских доменах, оно не включает сравнительные оценки с другими продвинутыми LLM. Устранение этого ограничения в будущих работах будет важно для оценки более широкой применимости и обобщаемости наших выводов.

Материалы и методы

В этой части мы оцениваем эффективность RAL в различных задачах биомедицинского NLP, анализируем результаты на четырёх предложенных тестовых стендах и обсуждаем соответствующие способности моделей.

Настройки и наборы данных

Мы оценивали пять современных LLM — LLaMA2-13B, MedLLaMA-13B, LLaMA3-8B, Phi4 14B и Qwen2.5 32B — вместе с тремя ретриверами: BM25, Contriever и MedCPT. Рассматривались пять задач биомедицинского NLP: извлечение триплетов, предсказание связей, классификация текста, ответы на вопросы (QA) и вывод по естественному языку (natural language inference) — суммарно на 11 датасетах: ADE, ChemProt, GIT, PHarmKG, Hetionet, Ade-corpus-v2, SemedClass, MedMCQA, BioNLI, DS и SDoH. Статистика по датасетам приведена в табл. 8. Эксперименты выполнялись на GPU A100.

Три ретривера

Три ретривера — BM25, Contriever и MedCPT — используют структурированный процесс извлечения наиболее релевантных примеров для повышения качества предсказаний LLM. Процесс включает три основных шага:

  1. Ретриверы сначала вычисляют векторное представление входного предложения с использованием своих retrieval-моделей. BM25 использует term-based взвешивание, тогда как Contriever и MedCPT опираются на dense-эмбеддинги, получаемые нейросетевыми моделями.
  2. Затем каждый ретривер вычисляет векторное представление для каждого экземпляра в retrieval-корпусе. BM25 основывается на традиционном лексическом сопоставлении, тогда как Contriever и MedCPT применяют deep learning-эмбеддинги для кодирования семантической информации.
  3. Наконец, ретриверы измеряют сходство между вектором входного предложения и векторами экземпляров в корпусе. Наиболее релевантные экземпляры (с максимальными значениями сходства) отбираются и подаются в LLM вместе со входом в качестве примеров, помогая модели генерировать более точные предсказания.

Датасеты для извлечения триплетов

В этой работе в качестве базовых датасетов для извлечения триплетов использовались ADE, ChemProt и GIT.

  1. ADE. ADE расширен от задачи извлечения отношений до задачи извлечения триплетов. Все предложения либо описывают эффект препарата, либо дозировку препарата. Поэтому триплеты имеют вид (головная сущность: drug, тип отношения: effect, хвостовая сущность: effect_description) и (головная сущность: drug, тип отношения: dosage, хвостовая сущность: dose_description). Среди всех триплетов есть только два типа отношений: effect и dosage.
  2. ChemProt. Chemical Protein Interaction Corpus включает 2432 аннотации абстрактов PubMed по взаимодействиям «химическое вещество — белок», охватывая 23 различных типа взаимодействий. Опираясь на предыдущие исследования (19), корпус рассматривает только экземпляры уровня предложения и фокусируется на пяти наиболее значимых типах взаимодействий для классификации: CPR3, CPR4, CPR5, CPR6 и CPR9.
  3. GIT. GIT — высококачественный биомедицинский датасет извлечения триплетов для не-препаратных терапий, характеризующийся точной разметкой и широким покрытием типов отношений. Он включает 22 типа отношений из SemMedDB.

Предсказание связей

В задаче предсказания связей мы использовали PHarmKG и Hetionet как базовые датасеты.

  1. PHarmKG — knowledge graph, описывающий связи между генами, препаратами и заболеваниями. В этой работе мы предсказываем четыре типа отношений (Interactions, Disease-Gene, Disease-Chemical и Chemical-Gene) между двумя сущностями. Из большого количества триплетов PHarmKG мы случайно выбираем 4000 примеров из training-set для обучения, 500 примеров из testing-set для тестирования и 500 примеров из validation-set для валидации.
  2. Hetionet — интегративная сеть заболеваний, включающая 46 типов отношений. Мы случайно выбираем 4000 примеров из training-set для обучения, 500 примеров из testing-set для тестирования и 500 примеров из validation-set для валидации.
  3. Dietary supplement (DS). Эта задача определяет, положительно или отрицательно связан диетический (пищевой) добавочный продукт с конкретным событием, либо прямой связи нет. Она облегчает идентификацию причинно-следственных связей или терапевтических эффектов диетических добавок. Например, задача может выявлять отрицательную ассоциацию между «ginseng» и «nausea».

Классификация текста

В задаче классификации текста в работе использовались Ade-corpus-v2 и SemdClass как базовые датасеты.

  1. Ade-corpus-v2. Датасет предназначен для классификации: связано ли предложение с нежелательным лекарственным событием (ADE) (true) или нет (false). Мы случайно выбираем 4000 экземпляров для обучения, 500 для тестирования и 500 для валидации.
  2. SemdClass направлен на определение того, относится ли заданный триплет к предоставленному предложению. Датасет содержит два класса: false и true.
  3. SDoH фокусируется на классификации фрагментов Social and Behavioral Determinants of Health. Датасет содержит 2364 аннотированных заметки, сгруппированных в 20 широких категорий SDoH, охватывающих социальные факторы, влияющие на исходы здоровья: статус занятости, условия труда, доступ к еде, жилищные условия, уровень дохода, медицинская история, страховой статус, доступ к транспорту, жестокое обращение, экологические условия, качество жилья, безопасность района, история преступности/заключения, социальная дискриминация, социальная изоляция, социальная поддержка, иммиграционный статус, злоупотребление веществами, физическая активность и качество сна.

QA и вывод по естественному языку

  1. MedMCQA — датасет QA с множественным выбором, разработанный для вопросов медицинских вступительных экзаменов. В этой работе использовалась версия с пятью вариантами ответа (A, B, C, D и E).
  2. BioNLI предназначен для определения, согласуется ли гипотеза с посылкой или противоречит ей.
Таблица 8. Статистика по датасетам, использованным в работе.
Задача Датасет Train Test Dev
Извлечение триплетов ADE (21) 4970 2130
ChemProt (22) 4001 3355 2366
GIT (23) 3734 465 492
Предсказание связей PHarmKG (24) 4000 500 500
Hetionet (25) 4000 500 500
SDoH 3964 464
Классификация текста Ade-corpus-v2 (21) 4000 500 500
SemdClass (26) 2400 600 600
DS 2127 237
Ответы на вопросы MedMCQA (27) 34,994 4183 4183
Вывод по естественному языку BioNLI (28) 5544 6308 12,807

Biomedical Retrieval-Augmented Generation Benchmark

Далее мы описываем операционный процесс RAL. Затем вводим четыре предложенные способности и процесс построения четырёх соответствующих тестовых стендов. В завершение приводим метрики оценки, используемые для измерения качества.

Рабочий процесс RAL

Для снижения галлюцинаций RAL предлагает извлекать внешние знания из корпуса и тем самым улучшать качество LLM. В общем случае (см. рис. 2A) retrieval-корпус должен быть изначально построен; во многих QA-моделях RAL корпус формируется из неразмеченных открытых источников, таких как PubMed и Textbook. Однако для некоторых задач, чувствительных к разметке (например, извлечение триплетов), такой неразмеченный open-source корпус может быть невалиден. В нашей работе корпус определяется как training-set для соответствующей задачи. Например, как показано на рис. 2A, если n обозначает PHarmKG, то каждому ключу соответствует запрос-предложение вида «какова связь между головной сущностью и хвостовой сущностью?» из training-set, а соответствующее значение задаёт целевую метку отношения (relationship) для данного ключа. На втором шаге ретривер извлекает из корпуса релевантные пары (key, value) по входному предложению. На последнем шаге извлечённые пары (key, value) вместе с входным предложением подаются в LLM для генерации ожидаемого вывода.

Для каждого экземпляра X и каждого n используются три компонента: инструкция I, контекст C и ответ R. Например, в training-датасете Ade-corpus-v2 (задача классификации), если метка предложения S: «She had been administered tacrolimus for prophylaxis of graft-versus-host reaction» равна False, то I = «You are an excellent linguist. The task is to predict whether this sentence is True or False. Examples: context: The hemangioma regressed markedly 6 weeks after the procedure and the serous retinal detachment showed marked resolution response: False», C = S, R = False.

Четыре способности BioRAB

Несмотря на успех RAL в снижении галлюцинаций, в биомедицинском домене его свойства изучены недостаточно. Во-первых, не все задачи имеют большие размеченные retrieval-корпуса. Во многих исследованиях training-set используется как корпус, но он всё равно ограничен по сравнению с более крупными корпусами. Если RAL показывает сопоставимое качество с вариантом, использующим размеченный корпус, это демонстрирует способность работать без зависимости от разметки. Во-вторых, RAL может легко быть введён в заблуждение неверной разметкой (см. рис. 2C). В-третьих, RAL потенциально способен извлекать полезные сведения из размеченных корпусов других задач (см. рис. 2D), однако такие сведения могут быть шумными и ухудшать генерацию. Наконец, когда ретривер извлекает неверно размеченную (контрфактуальную) информацию, RAL может быть способен распознавать, что такие знания не способствуют правильному выводу (см. рис. 2E). Для этого мы построили BioRAB для оценки RAL в биомедицинском домене и предложили четыре тестовых стенда.

Обзор четырёх тестовых стендов BioRAB
Рис. 2. Обзор четырёх тестовых стендов BioRAB. n соответствует «специальному» датасету для каждой задачи (например, Ade-corpus-v2 для классификации текста и PHarmKG для предсказания связей). (A) — RAL-схема с размеченным retrieval-корпусом; (B) — неразмеченный retrieval-корпус; (C) — корпус с контрфактуальными (ошибочными) метками. В (D) корпус для n включает датасеты других задач и исключает training-set самого n. В (E) различаются «Output» и «True/False»: «Output» — ожидаемый вывод (например, для извлечения триплетов это триплет), а «True/False» — суждение «извлечённый пример является негативным» или «извлечённый пример не является негативным». В нашей работе corpus of n — это training-set n.

Устойчивость к неразмеченным данным (Unlabeled robustness). Поскольку не все задачи имеют большие размеченные retrieval-корпуса, ретривер может извлекать информацию из неразмеченных корпусов, при этом RAL всё равно должен уметь генерировать ожидаемый вывод. Для оценки мы вводим тестовый стенд unlabeled robustness (см. рис. 2B): корпус для n определяется как training-set без value (меток) для n.

Контрфактуальная устойчивость (Counterfactual robustness). Построение высококачественного корпуса разметки затруднено, так как часто встречается неверная разметка. В нашей работе такие неверно размеченные экземпляры называются контрфактуальными. Для тестового стенда counterfactual robustness (см. рис. 2C) при построении корпуса для n мы задаём долю ошибочно размеченных экземпляров 20%, 80% или 100%. Например, в датасете классификации с метками True и False, если истинная метка экземпляра True, то ошибочная разметка будет False. Затем ретривер извлекает информацию из такого корпуса и подаёт её вместе со входом в LLM.

Устойчивость к разнообразию (Diverse robustness). Diverse robustness оценивает способность RAL улучшать качество, интегрируя информацию из корпусов разных задач. С одной стороны, корпус других задач может содержать полезные сведения для генерации. Например, в задаче извлечения триплетов при отсутствии подходящего корпуса извлечения, QA-корпус может помочь извлечь нужную информацию. С другой стороны, разные задачи могут добавлять шум и ухудшать качество. Для тестового стенда diverse robustness (см. рис. 2D) при построении корпуса n он включает корпуса других задач. Например, если n соответствует ChemProt (извлечение триплетов), корпус n включает корпуса таких задач, как GIT (извлечение триплетов), PHarmKG (предсказание связей) и т. д. Затем ретривер должен извлечь релевантную информацию из разнообразного корпуса, после чего извлечённые сведения вместе с входным предложением подаются в LLM.

Негативная осознанность (Negative awareness). Negative awareness оценивает способность LLM распознавать, что извлечённая информация является «негативной» (то есть не способствует получению ожидаемого вывода). В реальных сценариях, если ретривер извлекает негативную информацию и LLM способна это определить, модель может искать более полезные сведения, используя такую обратную связь. В тестовом стенде negative awareness (см. рис. 2E) мы считаем все значения в корпусе n некорректными метками. После извлечения документов модель должна сформировать два типа вывода: (1) task-based output (например, триплет), и (2) суждение о том, является ли извлечённое знание негативным.

Метрики оценки

Метрики, зависящие от задачи

В задаче извлечения триплетов, как и в Biomed-RAG (20), триплет считается корректным, если верны тип отношения, головная сущность и хвостовая сущность. Например, в предложении «Infusion of prostacyclin (PGI2) reportedly attenuates renal ischemic injury in the dog and the rat» триплет <Infusion, treats, rat> считается корректным, тогда как <injury, treats, rat> — нет. Мы оценивали модели и сообщали метрики: Micro Precision, Recall и F1 score. Для задач классификации текста, предсказания связей и QA использовались те же метрики, что и для извлечения триплетов. Для задачи natural language inference применялась метрика Macro F1 (как в BioNLI).

Метрики негативной осознанности

Для оценки negative awareness в нашей работе «негативный» экземпляр определяется как неверно размеченный экземпляр. Во-первых, мы оцениваем качество модели на данных с ошибочной разметкой. Например, в данных Ade-corpus-v2 (классификация) с двумя метками True и False такая оценка измеряет качество предсказаний True/False.

Обычно в RAL-схеме, если извлечённый пример содержит входное предложение и ожидаемый вывод, LLM должна достигать 100% качества при тестировании на этом входе. Несмотря на то, что все экземпляры в retrieval-корпусе являются ошибочно размеченными, LLM всё же может сгенерировать корректный вывод, используя такие примеры. В экспериментах мы также исследуем этот аспект. На основе этого наблюдения мы выделяем два типа «негативных» экземпляров:

  1. True negatives. Негативный экземпляр подаётся в LLM вместе с входным предложением и приводит к некорректному выводу. В этом сценарии число входных предложений обозначается как \(I^{t}\).
  2. False negatives. Негативный экземпляр подаётся в LLM вместе с входным предложением, но модель всё же выдаёт корректный вывод. В этом случае число входных предложений обозначается как \(I^{f}\).

Одновременно мы ожидаем, что LLM сможет вывести «True — the retrieved example is negative example» или «False — the retrieved example is not a negative example» по специальной инструкции: «Please determine whether the retrieved example constitutes negative information. If it is negative, please output False; if it is not negative, please output True» для каждого входного предложения.

Для входного предложения с false-negative примерами, если LLM выводит «False — the retrieved example is not a negative example», это означает распознавание false negative. После такого суждения количество входных предложений с «false negative examples» обозначается как \(f\). Для входного предложения с true-negative примерами, если LLM выводит «True — the retrieved example is a true negative example», это означает распознавание true negative. После такого суждения количество входных предложений с «true negative examples» обозначается как \(t\). Таким образом, доля true negative awareness вычисляется как \(t / I^{t}\), а доля false negative awareness — как \(f / I^{f}\).

Улучшение устойчивости и осознанности RAL

В этом подразделе описывается предложенный метод повышения устойчивости RAL (контрфактуальной и к немаркированным данным), а также способности negative awareness.

Улучшение контрфактуальной устойчивости RAL

Для снижения влияния ошибочно размеченных примеров в корпусе извлечения предлагается двухшаговый подход: этап обнаружения (detection) и этап исправления (correction). Такая методология систематически выявляет и корректирует ошибки, внесённые при аннотации данных или извлечении, повышая качество корпуса для последующих задач. В работе делается акцент на построении testbed и используется простой базовый подход; более продвинутые методы оставлены для будущих исследований.

На первом шаге разрабатывается детектор ошибочно размеченных примеров, который выявляет некорректные метки. На втором шаге корректирующий модуль изменяет ошибочные метки. В частности, в задаче классификации текста используется in-context learning (ICL) с LLM (например, GPT-4), чтобы оценивать корректность присвоенной метки и, опираясь на внутренние знания, исправлять её. Используемый промпт:

“This is a text classification task. Please determine whether the label assigned to the input sentence is correct. If the label is incorrect, please provide the correct label.”

Благодаря этому механизму модель систематически проверяет каждый размеченный пример и помечает те, где метка вероятно неверна; далее некорректные метки исправляются на основании оценки LLM.

Улучшение устойчивости к немаркированным данным

В случае немаркированного корпуса, чтобы повысить устойчивость при отсутствии меток, также применяется ICL с LLM для назначения меток по инструкциям, специфичным для задачи. Пример подробного промпта (для классификации текста):

“This is a text classification task aimed at determining whether a given sentence is related to an Adverse Drug Event (ADE). Please assign a label to each provided sentence to support this task.”

Улучшение осознанности (awareness) RAL

Для повышения negative awareness ключевым направлением является развитие способности модели различать позитивные примеры в корпусе (которые способствуют генерации правильного ответа) и негативные (которые не способствуют).

Для каждого входного предложения x в корпусе могут находиться сотни или тысячи примеров, не связанных с генерацией ответа. Исходя из этого наблюдения, конструируется модель S, помогающая различать примеры, полезные для финальной генерации по x. На вход S подаются: (i) входное предложение x; (ii) множество позитивных примеров CP = {ep}, сформированное на основе релевантности к x (в общем случае само x рассматривается как наиболее информативный позитивный пример); (iii) множество негативных сущностей Cn = {en}, полученное случайной выборкой примеров корпуса, не входящих в CP.

Для различения позитивных и негативных сущностей S использует LLM-модель f(·) (например, модели семейства Llama) для извлечения семантических представлений f(x), f(ep) и f(en) соответственно, а затем выбирает позитивные примеры по расстоянию до входных предложений. Модель S оптимизируется триплетной функцией потерь:

\[ \max\bigl[ \lVert f(x)-f(e^{p}) \rVert - \lVert f(x)-f(e^{n}) \rVert + \alpha,\ 0 \bigr] \]

где \(\lVert\cdot\rVert\) — евклидова норма, а \(\alpha\) — параметр зазора (margin), который по умолчанию устанавливается равным 1. В процессе обучения триплетная потеря уменьшает расстояние между \(f(x)\) и \(f(e^{p})\), одновременно увеличивая расстояние между \(f(x)\) и \(f(e^{n})\).

После обучения f(·) используется для instruction tuning в целевых (downstream) задачах. Например, в задаче классификации SDoH обученная \(f(·)\) на основе Phi4 применяется для дообучения модели на классификационном датасете.

Список литературы и примечания

REFERENCES AND NOTES

  1. C. Wu, W. Lin, X. Zhang, Y. Zhang, W. Xie, Y. Wang, PMC-LLaMA: Toward building open-source language models for medicine. J. Am. Med. Inform. Assoc. 31, 1833–1843 (2024).
  2. K. Singhal, T. Tu, J. Gottweis, R. Sayres, E. Wulczyn, M. Amin, L. Hou, K. Clark, S. R. Pfohl, H. Cole-Lewis, D. Neal, Q. M. Rashid, M. Schaekermann, A. Wang, D. Dash, J. H. Chen, N. H. Shah, S. Lachgar, P. A. Mansfield, S. Prakash, B. Green, E. Dominowska, B. A. y Arcas, N. Tomašev, Y. Liu, R. Wong, C. Semturs, S. S. Mahdavi, J. K. Barral, D. R. Webster, G. S. Corrado, Y. Matias, S. Azizi, A. Karthikesalingam, V. Natarajan, Toward expert-level medical question answering with large language models. Nat. Med. 31, 943–950 (2025).
  3. M. Li, H. Zhou, H. Yang, R. Zhang, RT: A retrieving and chain-of-thought framework for few-shot medical named entity recognition. J. Am. Med. Inform. Assoc. 31, 1929–1938 (2024).
  4. Z. Ji, N. Lee, R. Frieske, T. Yu, D. Su, Y. Xu, E. Ishii, Y. J. Bang, A. Madotto, P. Fung, Survey of hallucination in natural language generation. ACM Comput. Surv. 55, 1–38 (2023).
  5. O. Ovadia, M. Brief, M. Mishaeli, O. Elisha, Fine-tuning or retrieval? Comparing knowledge injection in LLMs. arXiv:2312.05934 [cs.AI] (2023).
  6. P. Lewis, E. Perez, A. Piktus, F. Petroni, V. Karpukhin, N. Goyal, H. Küttler, M. Lewis, W. Yih, T. Rocktäschel, S. Riedel, D. Kiela, Retrieval-augmented generation for knowledge-intensive NLP tasks. Adv. Neural Inf. Process. Syst. 33, 9459–9474 (2020).
  7. M. Li, L. Huang, Understand the dynamic world: An end-to-end knowledge informed framework for open domain entity state tracking, in Proceedings of the 46th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR), Association for Computing Machinery (ACM) (2023), pp. 842–851.
  8. J. Huang, M. Li, Z. Yao, Z. Yang, Y. Xiao, F. Ouyang, X. Li, S. Han, H. Yu, RiteK: A dataset for large language models complex reasoning over textual knowledge graphs. arXiv:2410.13987 [cs.CL] (2024).
  9. C. Zakka, R. Shad, A. Chaurasia, A. R. Dalal, J. L. Kim, M. Moor, R. Fong, C. Phillips, K. Alexander, E. Ashley, J. Boyd, K. Boyd, K. Hirsch, C. Langlotz, R. Lee, J. Melia, J. Nelson, K. Sallam, S. Tullis, M. A. Vogelsong, J. P. Cunningham, W. Hiesinger, Almanac—retrieval-augmented language models for clinical medicine. NEJM AI 1, AIoa2300068 (2024).
  10. H. Touvron, T. Lavril, G. Izacard, X. Martinet, M.-A. Lachaux, T. Lacroix, B. Rozière, N. Goyal, E. Hambro, F. Azhar, A. Rodriguez, A. Joulin, É. Grave, G. Lample, LLaMA: Open and efficient foundation language models. arXiv:2302.13971 [cs.CL] (2023).
  11. A. Grattafiori, A. Dubey, A. Jauhri, A. Pandey, A. Kadian, A. Al-Dahle, A. Letman, A. Mathur, A. Schelten, A. Vaughan, A. Yang, A. Fan, A. Goyal, A. Hartshorn, A. Yang, A. Mitra, A. Sravankumar, A. Korenev, A. Hinsvark, A. Rao, A. Zhang, A. Rodriguez, A. Gregerson, A. Spataru, B. Roziere, B. Biron, B. Tang, B. Chern, C. Caucheteux, C. Nayak, C. Bi, C. Marra, C. M. Connell, C. Keller, C. Touret, C. Wu, C. Wong, C. C. Ferrer, C. Nikolaidis, D. Allonsius, D. Song, D. Pintz, D. Livshits, D. Wyatt, D. Esiobu, D. Choudhary, D. Mahajan, D. Garcia-Olano, D. Perino, D. Hupkes, E. Lakomkin, E. A. Badawy, E. Lobanova, E. Dinan, E. M. Smith, F. Radenovic, F. Guzmán, F. Zhang, G. Synnaeve, G. Lee, G. L. Anderson, G. Thattai, G. Nail, G. Mialon, G. Pang, G. Cucurell, H. Nguyen, H. Korevaar, H. Xu, H. Touvron, I. Zarov, I. A. Ibarra, I. Kloumann, I. Misra, I. Evtimov, J. Zhang, J. Copet, J. Lee, J. Geffert, J. Vranes, J. Park, J. Mahadeokar, J. Shah, J. Van der Linde, J. Billock, J. Hong, J. Lee, J. Fu, J. Chi, J. Huang, J. Liu, J. Wang, J. Yu, J. Bitton, J. Spisak, J. Park, J. Rocca, J. Johnstun, J. Saxe, J. Jia, K. V. Alwala, K. Prasad, K. Upasani, K. Plawiak, K. Li, K. Heafield, K. Stone, K. El-Arini, K. Iyer, K. Malik, K. Chiu, K. Bhalla, K. Lakhotia, L. Rantala-Yeary, L. Van der Maaten, L. Chen, L. Tan, L. Jenkins, L. Martin, L. Madaan, L. Malo, L. Blecher, L. Landzaat, L. de Oliveira, M. Muzzi, M. Pasupuleti, M. Singh, M. Paluri, M. Kardas, M. Tsimpoukelli, M. Oldham, M. Rita, M. Pavlova, M. Kambadur, M. Lewis, M. Si, M. K. Singh, M. Hassan, N. Goyal, N. Torabi, N. Bashlykov, N. Bogoychev, N. Chatterji, N. Zhang, O. Duchenne, O. Çelebi, P. Alrassy, P. Zhang, P. Li, P. Vasic, P. Weng, P. Bhargava, P. Dubal, P. Krishnan, P. S. Koura, P. Xu, Q. He, Q. Dong, R. Srinivasan, R. Ganapathy, R. Calderer, R. S. Cabral, R. Stojnic, R. Raileanu, R. Maheswari, R. Girdhar, R. Patel, R. Sauvestre, R. Polidoro, R. Sumbaly, R. Taylor, R. Silva, R. Hou, R. Wang, S. Hosseini, S. Chennabasappa, S. Singh, S. Bell, S. S. Kim, S. Edunov, S. Nie, S. Narang, S. Raparthy, S. Shen, S. Wan, S. Bhosale, S. Zhang, S. Vandenhende, S. Batra, S. Whitman, S. Sootla, S. Collot, S. Gururangan, S. Borodinsky, T. Herman, T. Fowler, T. Sheasha, T. Georgiou, T. Scialom, T. Speckbacher, T. Mihaylov, T. Xiao, U. Karn, V. Goswami, V. Gupta, V. Ramanathan, V. Kerkez, V. Gonguet, V. Do, V. Vogeti, V. Albiero, V. Petrovic, W. Chu, W. Xiong, W. Fu, W. Meers, X. Martinet, X. Wang, X. Wang, X. E. Tan, X. Xia, X. Xie, X. Jia, X. Wang, Y. Goldschlag, Y. Gaur, Y. Babaei, Y. Wen, Y. Song, Y. Zhang, Y. Li, Y. Mao, Z. D. Coudert, Z. Yan, Z. Chen, Z. Papakipos, A. Singh, A. Srivastava, A. Jain, A. Kelsey, A. Shajnfeld, A. Gangidi, A. Victoria, A. Goldstand, A. Menon, A. Sharma, A. Boesenberg, A. Baevski, A. Feinstein, A. Kallet, A. Sangani, A. Teo, A. Yunus, A. Lupu, A. Alvarado, A. Caples, A. Gu, A. Ho, A. Poulton, A. Ryan, A. Ramchandani, A. Dong, A. Franco, A. Goyal, A. Saraf, A. Chowdhury, A. Gabriel, A. Bharambe, A. Eisenman, A. Yazdan, B. James, B. Maurer, B. Leonhardi, B. Huang, B. Loyd, B. de Paola, B. Paranjape, B. Liu, B. Wu, B. Ni, B. Hancock, B. Wasti, B. Spence, B. Stojkovic, B. Gamido, B. Montalvo, C. Parker, C. Burton, C. Mejia, C. Liu, C. Wang, C. Kim, C. Zhou, C. Hu, C.-H. Chu, C. Cai, C. Tindal, C. Feichtenhofer, C. Gao, D. Civin, D. Beaty, D. Kreymer, D. Li, D. Adkins, D. Xu, D. Testuggine, D. David, D. Parikh, D. Liskovich, D. Foss, D. Wang, D. Le, D. Holland, E. Dowling, E. Jamil, E. Montgomery, E. Presani, E. Hahn, E. Wood, E.-T. Le, E. Brinkman, E. Arcaute, E. Dunbar, E. Smothers, F. Sun, F. Kreuk, F. Tian, F. Kokkinos, F. Ozgenel, F. Caggioni, F. Kanayet, F. Seide, G. M. Florez, G. Schwarz, G. Badeer, G. Swee, G. Halpern, G. Herman, G. Sizov, Guangyi (Jack)Zhang, G. Lakshminarayanan, H. Inan, H. Shojanazeri, H. Zou, H. Wang, H. Zha, H. Habeeb, H. Rudolph, H. Suk, H. Aspegren, H. Goldman, H. Zhan, I. Damlaj, I. Molybog, I. Tufanov, I. Leontiadis, I.-E. Veliche, I. Gat, J. Weissman, J. Geboski, J. Kohli, J. Lam, J. Asher, J.-B. Gaya, J. Marcus, J. Tang, J. Chan, J. Zhen, J. Reizenstein, J. Teboul, J. Zhong, J. Jin, J. Yang, J. Cummings, J. Carvill, J. Shepard, J. M. Phie, J. Torres, J. Ginsburg, J. Wang, K. Wu, Kam Hou U, K. Saxena, K. Khandelwal, K. Zand, K. Matosich, K. Veeraraghavan, K. Michelena, K. Li, K. Jagadeesh, K. Huang, K. Chawla, K. Huang, L. Chen, L. Garg, Lavender A, L. Silva, L. Bell, L. Zhang, L. Guo, L. Yu, L. Moshkovich, L. Wehrstedt, M. Khabsa, M. Avalani, M. Bhatt, M. Mankus, M. Hasson, M. Lennie, M. Reso, M. Groshev, M. Naumov, M. Lathi, M. Keneally, M. Liu, M. L. Seltzer, M. Valko, M. Restrepo, M. Patel, M. Vyatskov, M. Samvelyan, M. Clark, M. Macey, M. Wang, M. J. Hermoso, M. Metanat, M. Rastegari, M. Bansal, N. Santhanam, N. Parks, N. White, N. Bawa, N. Singhal, N. Egebo, N. Usunier, N. Mehta, N. P. Laptev, N. Dong, N. Cheng, O. Chernoguz, O. Hart, O. Salpekar, O. Kalinli, P. Kent, P. Parekh, P. Saab, P. Balaji, P. Rittner, P. Bontrager, P. Roux, P. Dollar, P. Zvyagina, P. Ratanchandani, P. Yuvraj, Q. Liang, R. Alao, R. Rodriguez, R. Ayub, R. Murthy, R. Nayani, R. Mitra, R. Parthasarathy, R. Li, R. Hogan, R. Battey, R. Wang, R. Howes, R. Rinott, S. Mehta, S. Siby, S. J. Bondu, S. Datta, S. Chugh, S. Hunt, S. Dhillon, S. Sidorov, S. Pan, S. Mahajan, S. Verma, S. Yamamoto, S. Ramaswamy, S. Lindsay, S. Lindsay, S. Feng, S. Lin, S. C. Zha, S. Patil, S. Shankar, S. Zhang, S. Zhang, S. Wang, S. Agarwal, S. Sajuyigbe, S. Chintala, S. Max, S. Chen, S. Kehoe, S. Satterfield, S. Govindaprasad, S. Gupta, S. Deng, S. Cho, S. Virk, S. Subramanian, S. Choudhury, S. Goldman, T. Remez, T. Glaser, T. Best, T. Koehler, T. Robinson, T. Li, T. Zhang, T. Matthews, T. Chou, T. Shaked, V. Vontimitta, V. Ajayi, V. Montanez, V. Mohan, V. S. Kumar, V. Mangla, V. Ionescu, V. Poenaru, V. T. Mihailescu, V. Ivanov, W. Li, W. Wang, W. Jiang, W. Bouaziz, W. Constable, X. Tang, X. Wu, X. Wang, X. Wu, X. Gao, Y. Kleinman, Y. Chen, Y. Hu, Y. Jia, Y. Qi, Y. Li, Y. Zhang, Y. Zhang, Y. Adi, Y. Nam, Yu (Sid)Wang, Y. Zhao, Y. Hao, Y. Qian, Y. Li, Y. He, Z. Rait, Z. de Vito, Z. Rosnbrick, Z. Wen, Z. Yang, Z. Zhao, Z. Ma, The LLaMA 3 herd of models. arXiv:2407.21783 [cs.AI] (2024).
  12. M. Abdin, J. Aneja, H. Behl, S. Bubeck, R. Eldan, S. Gunasekar, M. Harrison, R. J. Hewett, M. Javaheripi, P. Kauffmann, J. R. Lee, Y. T. Lee, Y. Li, W. Liu, C. C. T. Mendes, A. Nguyen, E. Price, G. de Rosa, O. Saarikivi, A. Salim, S. Shah, X. Wang, R. Ward, Y. Wu, D. Yu, C. Zhang, Y. Zhang, Phi-4 technical report. arXiv:2412.08905 [cs.CL] (2024).
  13. A. Yang, B. Yang, B. Zhang, B. Hui, B. Zheng, B. Yu, C. Li, D. Liu, F. Huang, H. Wei, H. Lin, J. Yang, J. Tu, J. Zhang, J. Yang, J. Yang, J. Zhou, J. Lin, K. Dang, K. Lu, K. Bao, K. Yang, L. Yu, M. Li, M. Xue, P. Zhang, Q. Zhu, R. Men, R. Lin, T. Li, T. Tang, T. Xia, X. Ren, X. Ren, Y. Fan, Y. Su, Y. Zhang, Y. Wan, Y. Liu, Z. Cui, Z. Zhang, Z. Qiu, Qwen2.5 technical report. arXiv:2412.15115 [cs.CL] (2024).
  14. S. E. Robertson, K. Spärck Jones, Relevance weighting of search terms. J. Am. Soc. Inf. Sci. 27, 129–146 (1976).
  15. G. Izacard, M. Caron, L. Hosseini, S. Riedel, P. Bojanowski, A. Joulin, É. Grave, Unsupervised dense information retrieval with contrastive learning. arXiv:2112.09118 [cs.IR] (2021).
  16. Q. Jin, W. Kim, Q. Chen, D. C. Comeau, L. Yeganova, W. J. Wilbur, Z. Lu, MedCPT: Contrastive pre-trained transformers with large-scale PubMed search logs for zero-shot biomedical information retrieval. Bioinformatics 39, btad651 (2023).
  17. G. Xiong, Q. Jin, Z. Lu, A. Zhang, “Benchmarking retrieval-augmented generation for medicine,” in Findings of the Association for Computational Linguistics: ACL 2024 (Association for Computational Linguistics, 2024), pp. 6233–6251.
  18. E. W. Sayers, J. Beck, K. Brister, E. Bolton, S. Canese, D. Comeau, R. Funk, K. Kim, J. Kim, W. Klimke, W. Lee, J. Lu, T. Madden, A. Marchler-Bauer, V. Ostell, B. Phan, S. Rangwala, L. Schneider, F. Wang, D. Ye, Y. Zhang, Z. Zhao, PubMed: The NCBI database of biomedical literature. Nucleic Acids Res. 49, D1388–D1395 (2021).
  19. C. Sun, Z. Yang, L. Wang, Y. Zhang, H. Lin, J. Wang, MRC4BioER: Joint extraction of biomedical entities and relations in the machine reading comprehension framework. J. Biomed. Inform. 125, 103956 (2022).
  20. M. Li, H. Kilicoglu, H. Xu, R. Zhang, BiomedRAG: A retrieval-augmented large language model for biomedicine. J. Biomed. Inform. 162, 104–769 (2025).
  21. H. Gurulingappa, A. M. Rajput, A. Roberts, J. Fluck, M. Hofmann-Apitius, L. Toldo, Development of a benchmark corpus to support the automatic extraction of drug-related adverse effects from medical case reports. J. Biomed. Inform. 45, 885–892 (2012).
  22. O. Taboureau, S. K. Nielsen, K. Audouze, N. Weinhold, D. Edsgård, F. S. Roque, I. Kouskoumvekaki, A. Bora, R. Curpan, T. S. Jensen, S. Brunak, T. I. Oprea, ChemProt: A disease chemical biology database. Nucleic Acids Res. 39, D367–D372 (2010).
  23. M. Li, H. Zhou, R. Zhang, Benchmarking large language models in biomedical triple extraction. arXiv:2310.18463 [cs.CL] (2023).
  24. S. Zheng, J. Rao, Y. Song, J. Zhang, X. Xiao, E. F. Fang, Y. Yang, Z. Niu, PharmKG: A dedicated knowledge graph benchmark for biomedical data mining. Brief. Bioinform. 22, bbaa344 (2021).
  25. D. S. Himmelstein, A. Lizee, C. Hessler, L. Brueggeman, S. L. Chen, D. Hadley, A. Green, P. Khankhanian, S. E. Baranzini, Systematic integration of biomedical knowledge prioritizes drugs for repurposing. eLife 6, e26726 (2017).
  26. J. A. Vasilakes, R. Rizvi, R. Zhang, Annotated Semantic Predications from SemMedDB (University of Minnesota Digital Conservancy, 2018); https://conservancy.umn.edu/handle/11299/194965.
  27. A. Pal, L. K. Umapathi, M. Sankarasubbu, MedMCQA: A large-scale multi-subject multi-choice dataset for medical domain question answering, Proceedings of Machine Learning Research (PMLR) (2022), pp. 248–260.
  28. M. Bastan, M. Surdeanu, N. Balasubramanian, BioNLI: Generating a biomedical NLI dataset using lexico-semantic constraints for adversarial examples, in Findings of the Association for Computational Linguistics: EMNLP 2022, Association for Computational Linguistics (ACL) (2022), pp. 5093–5104.
  29. F. Schroff, D. Kalenichenko, J. Philbin, “FaceNet: A unified embedding for face recognition and clustering,” in Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (IEEE, 2015), pp. 815–823.

Примечания

Acknowledgments: The authors acknowledge the use of GPT-4. More details are available in the Materials and Methods section.

Funding: This work was supported by the National Institutes of Health’s National Center for Complementary and Integrative Health grant number R01AT009457, National Institute on Aging grant number R01AG078154, National Cancer Institute grant number R01CA287413, and Food and Drug Administration grant number U01FD008720. The content is solely the responsibility of the authors and does not represent the official views of the National Institutes of Health.

Author contributions: M.L.: Digging for ideas, doing related work, experiments (PharmKG, Ade-corpus-v2, semclasss, and BioNL), coding, methodology, model design, writing—original draft, and paper revision. Z.Z.: Experiments (Ade, chemProt, and Git) and experiment discussion. H.Y.: Experiments (MedMCQA) and experiment discussion. Y.X.: Experiments (Hetionnet) and experiment discussion. H.Z.: Experiments (Ade-corpus-v2 and semclasss) and experiment discussion. J.H.: Experiments (Semclass); code, data, and model organization; and experiment discussion. R.Z.: Supervision, idea and method exploration, writing—original draft, and writing—review and editing.

Competing interests: The authors declare that they have no competing interests.

Data and materials availability: All data needed to evaluate the conclusions in the paper are present in the paper and/or the Supplementary Materials. The code and data are available at GitHub: https://github.com/toneLi/toneLi-evaluating-Retrival-LLM-in-Biomedical-domain and Zenodo: https://zenodo.org/records/17398149.

Submitted 17 June 2024
Accepted 20 October 2025
Published 21 November 2025

DOI: 10.1126/sciadv.adr1443