Modification of the method for modeling the thematic environment of terms using the LDA approach
- Authors: Zolotarev O.V.1, Yurchak V.A.1
-
Affiliations:
- Russian New University
- Issue: Vol 12, No 2 (2025)
- Pages: 19-27
- Section: ARTIFICIAL INTELLIGENCE AND MACHINE LEARNING
- URL: https://journals.eco-vector.com/2313-223X/article/view/688951
- DOI: https://doi.org/10.33693/2313-223X-2025-12-2-19-27
- EDN: https://elibrary.ru/QPYWFS
- ID: 688951
Cite item
Full Text
Abstract
Thematic modeling is an essential tool for analyzing large volumes of textual data, enabling the identification of latent semantic patterns. However, conventional approaches such as Latent Dirichlet Allocation (LDA) encounter difficulties when dealing with multi-valued and unigram tokens, resulting in reduced accuracy and clarity in the outcomes. This study aims to develop a technique for constructing a thematic structure based on refined LDA, which incorporates contextual features, vector representations of words, and external vocabularies. The objective is to address terminological ambiguity and enhance the clarity of thematic groups. The paper employs a mathematical model that integrates probabilistic thematic modeling with vector representations, facilitating the differentiation of word meanings and the establishment of precise connections between them. Using the corpus of Dimensions AI and PubMed publications, the study demonstrates an improved distribution of terms within thematic clusters. This involves frequency analysis and vector similarity, which are essential components of the study. The results emphasize the effectiveness of an integrated approach to dealing with complex linguistic structures in automated text analysis.
Keywords
Full Text
ВВЕДЕНИЕ
Тематическое моделирование является ключевым инструментом для анализа больших текстовых данных, позволяя выявлять скрытые смысловые структуры. Однако традиционные методы, такие как LDA, сталкиваются с проблемами при работе с многозначными и монолексемными токенами, что снижает точность и интерпретируемость результатов. Например, термин вроде «chest» (грудь/сундук) требует учета контекста для корректного определения его значения.
Актуальность данного исследования обусловлена необходимостью преодоления ограничений стандартного LDA (чувствительности к гиперпараметрам распределения тем в документах и распределения терминов в темах) за счет интеграции современных методов NLP, таких как векторные представления слов и внешние лингвистические ресурсы.
Кроме этого, для представления слов, фраз или документов в виде числовых векторов, сохраняя их смысловые и контекстуальные связи, используется подход векторного представления в обработке естественного языка.
Использование тезаурусов (UMLS, MeSH) позволяет проверить вхождение терминов в словарь терминов и улучшить их интерпретацию в специализированных областях, таких как медицина.
Цель работы – использование математической модели с учетом контекстных признаков на основе алгоритма LDA для расширения тематического окружения терминов в специализированных областях. Основные задачи включают:
1) анализ и классификацию терминов;
2) модификацию метода LDA для учета контекстной информации и для векторного сходства терминов;
3) валидацию модели на реальных данных (публикации Dimensions AI и PubMed).
1. МАТЕРИАЛЫ И МЕТОДЫ
Моделирование тематического окружения терминов на основе метода LDA задействует модель сокращения пространства тем путем оценки качества модели через метрику перплексии [8; 10]. Метрика перплексии отражает насколько хорошо вероятностная модель предсказывает новое множество данных: чем ниже значение перплексии, тем выше согласованность модели с наблюдаемыми данными.
При построении тематического окружения терминов с использованием метода LDA важно учитывать особенности языка, такие как многозначность токенов (например, chest), а также наличие монолексемов (однословных токенов). Эти аспекты могут существенно повлиять на качество формирования тематического окружения.
В контексте построения тематического окружения на основе метода LDA учет многозначных токенов требует использования контекстных признаков, а именно: n-грамм для уточнения значения токена. Однако метод LDA объединяет лексемы с различной семантикой в единый тематический кластер, особенно в условиях ограниченного объема данных или полисемии. Это приводит к снижению интерпретируемости моделей, поскольку термины с разнородными значениями визуально представлены в рамках одной темы. Для минимизации указанного ограничения в текущем исследовании предложен комбинированный подход, интегрирующий анализ контекстных признаков через n-граммы с технологиями векторного представления слов (Word2Vec).
2. ПРЕДОБРАБОТКА МНОГОЗНАЧНЫХ И МОНОЛЕКСЕМНЫХ ТОКЕНОВ
Монолексемные токены (состоящие из одного слова) могут быть слишком общими и встречаться в нескольких темах, что снижает их информативность. Исходя из этого, в текущем исследовании была использована процедура лемматизации текста с последующим исключением слишком частых токенов, которые могут быть неинформативными.
Для обработки многозначных токенов было использовано объединение подходов:
- выделение n-грамм (устойчивых словосочетаний от 1 до 3 слов) в процессе векторизации текста;
- сравнение выделенных n-грамм с терминами из международных словарей (тезаурусов), таких как UMLS1 и MESH2 [6].
Приведенный выше подход к обработке токенов включает следующие этапы. Сначала из текстовых данных выделяются все n-граммы заданной длины (от 1 до 3 слов) с учетом нормализации, а именно: приведения всех терминов к нижнему регистру, лемматизации и удаления стоп-слов. Для каждой найденной n-граммы отправляется запрос к UMLS REST API3 или к MESH RDF Lookup API4, после чего результатом становится привязка к уникальному идентификатору (CUI в UMLS или Descriptor UI в MESH).
При совпадении нескольких n-грамм используется приоритет более длинных шаблонов. После фиксации совпадения на отрезке текстовых данных этот фрагмент исключается из дальнейшей генерации n-грамм, чтобы не было дублирования. Общую архитектурную схему подхода к обработке токенов можно увидеть на рис. 1.
Рис. 1. Архитектурная схема подхода к обработке токенов
Fig. 1. Architectural scheme of the token processing approach
В рамках данной статьи используется математическая модель, описывающая моделирование тематического окружения на основе метода LDA. Анализ проводился на базе 3046 публикаций из PubMed и 635 публикаций из Dimensions AI.
В результате выгрузки публикаций формируется следующая структура в базе данных: источник (Source), идентификатор (Article ID), название (Title), аннотация (Abstract) и год публикаций (Year).
3. ТЕМАТИЧЕСКОЕ МОДЕЛИРОВАНИЕ НА ОСНОВЕ МЕТОДА LDA
В рамках данной статьи используется математическая модель, описывающая моделирование тематического окружения на основе метода LDA. В результате моделирования по публикациям Dimensions AI и PubMed присваивается основная тема. Для каждой темы подбираются термины из полученных на этапе предобработки n-грамм, прошедших сверку с тезаурусами UMLS и MESH. Результатом данной процедуры является формирование выделенных тем в прошедших предобработку данных.
Выделенные темы отображаются в числовом пространстве в виде точек, а сам процесс преобразования этих тем в векторные представления называется векторизацией. В рамках построения тематического окружения векторизация выполняет преобразование каждой выделенной темы в точку в многомерном числовом пространстве, что позволяет количественно оценивать семантические связи между топиками и визуализировать их взаимное расположение в виде облака точек [6]. В качестве основного формата векторных представлений используются k-мерные векторы, полученные посредством латентно-семантического анализа (LSA) на основе TF-IDF-матрицы.
Алгоритм латентно-семантического анализа (LSA) для преобразования тем в векторные представления использует взвешенную матрицу «термин × документ» (term–document matrix), где строки соответствуют n-граммам (терминам), столбцы – тематическим документам, а значения ячеек рассчитываются по схеме TF-IDF (term frequency–inverse document frequency) [6]. К полученной TF-IDF-матрице затем применяется сингулярное разложение (SVD) для выявления информативных латентных факторов и снижения размерности исходного пространства. Общую архитектурную схему процесса векторизации выделенных тем в данных со сформированными тематическими окружениями с помощью алгоритма LSA можно увидеть на рис. 2.
Рис. 2. Архитектурная схема процесса векторизации выделенных тем в данных со сформированными тематическими окружениями с помощью алгоритма LSA
Fig. 2. An architectural diagram of the vectorization process of selected topics in data with generated thematic environments using the LSA algorithm
В рамках данного исследования для построения 3D-модели тематического окружения терминов по публикациям Dimensions AI и PubMed на основе метода LDA была проведена процедура векторизации выделенных тем в данных со сформированными тематическими окружениями с помощью алгоритма LSA [6]. Результатами процедуры векторизации стала подготовка файлов модели vectors.tsv (векторного представления) и metadata.tsv (списка тем) на основе данных с выделенными темами из Dimensions AI и PubMed.
Файл metadata.tsv содержит информацию о списке тем, представленную в текстовом формате. Файл vectors.tsv содержит векторные представления, отображенные в формате списка чисел. Файлы metadata.tsv и vectors.tsv используются для визуализации смоделированных тематических кластеров с помощью облачного средства визуализации данных Embedding Projector5.
4. МОДИФИКАЦИЯ МЕТОДА LDA
Основная модель LDA задается как сумма произведений вероятностей вхождения слов в темы на вероятности вхождения тем в документ. Математически данное утверждение записывается следующим образом:
где w – слово;
d – документ;
t – тема (T – общее количество тем);
P(w|t) – вероятность слова w в теме t;
P(t|d) – вероятность темы t в документе d [6].
Индекс t в сумме означает, что для вычисления P(w|d) учитываются все возможные темы. Каждая тема вносит вклад, пропорциональный двум величинам:
- P(w|t) – насколько слово w характерно для темы t;
- P(t|d) – насколько тема t важна в документе
Для учета контекстных признаков (n-грамм – одного или нескольких слов, одно из которых является существительным, а остальные – определителями к нему) и векторных представлений терминов, необходимо модифицировать P(w|t), добавив вес, зависящий от близости векторов слов в контексте. Например,
P(w|t) = P(w|t) Sim (w, C),
где Sim – функция сходства вектора слова w с контекстом C (n-граммы) [3; 4].
Метод LDA использует сложные представления (такие как n-граммы) для модификации модели посредством предварительной обработки данных. Обработка данных позволяет адаптировать модель для конкретных задач и улучшить ее качество за счет учета более сложных структур в тексте.
По этой причине объединенная целевая функция, которая включает компоненты LDA, векторные представления, фильтрацию и тезаурусы (UMLS и MESH) представлена функцией максимизации логарифмического правдоподобия с регуляризационными членами:
log(P(D|θ)) + αSim(W) + βF(L) + γS(T),
где Sim(W) – сходство векторов слов в контексте;
F(L) – фильтрация лемматизированных терминов;
S(T) – соответствие тезаурусу;
α, β, γ – гиперпараметры [15].
Высокие значения гиперпараметров α и γ совместно усиливают семантическую согласованность, но могут конкурировать: векторы слов могут предлагать связи, противоречащие тезаурусу. Гиперпараметр (β) очищает данные, позволяя Sim(W) и S(T) работать с более релевантными терминами. Например, удаление стоп-слов (высокое β) помогает точнее вычислять сходства векторов (Sim(W)).
Параметр θ в выражении log P(D|θ) представляет собой параметры модели, которые оптимизируются в процессе обучения.
В контексте NLP [3] параметр θ может включать:
- веса нейронной сети;
- параметры распределений;
- векторные представления слов.
Объединенная целевая функция позволяет находить новые семантические связи и отношения между терминами [3].
5. ПРЕДСТАВЛЕНИЕ РЕЗУЛЬТАТОВ ИССЛЕДОВАНИЯ
В ходе работы с публикациями Dimensions AI и PubMed было построено тематическое пространство, применяя LDA-моделирование для выявления значимости и близости тем. Для отображения близости тем (тема может состоять из одного или нескольких терминов, называемых группой терминов) в данном исследовании использовалось облачное средство визуализации данных Embedding Projector. Были построены тематические пространства, включающие в себя выделенные термины из полученных на этапе предобработки n-грамм, прошедших сверку с тезаурусами UMLS и MESH. На представленном ниже рис. 3 отображена 3D-модель тематического окружения темы «pandemiс, taiwan, coronavirus, henan, epidemic, COVID» на основе метода LDA.
Рис. 3. Тематическое окружение по публикациям Dimensions AI и PubMed на основе метода LDA с выделенными терминами из словарей (тезаурусов) без учета гиперпараметров
Fig. 3. Thematic environment for Dimensions AI and PubMed publications based on the LDA method with selected terms from dictionaries (thesauri) excluding hyperparameters
Исходя из проведенного моделирования тематического окружения темы групп терминов «pandemiс, taiwan, coronavirus, henan, epidemic, COVID» (тема может состоять из одного или нескольких терминов, называемых группой терминов) видно, что следующими по векторному приближению группами терминов являются «cancer, immunization, oncology, disease, vaccination, veterans». В табл. 1 приводятся результаты расчета евклидового расстояния без учета гиперпараметров α и γ по пяти ближайшим темам для темы «pandemiс, taiwan, coronavirus, henan, epidemic, COVID».
Таблица 1. Результаты расчета Евклидового расстояния без учета гиперпараметров α и γ [The results of calculating the Euclidean distance without considering the hyperparameters α and γ]
Группы терминов ближайшие к группе «pandemiс, taiwan, coronavirus, henan, epidemic, COVID» [Groups of terms closest to the group “pandemiс, taiwan, coronavirus, henan, epidemic, COVID”] | Евклидово расстояние до ближайших групп терминов [Euclidean distance to the contents of terms of a group] |
hypoglycemia, diseases, loewenstein, policy, doubt, sicknesses, ailments | 0,678 |
cancer, behaviours, immunization, oncology, disease, vaccination | 0,707 |
behaviors, diseases, hearts, taiwan, ailments, conditions, policy | 0,804 |
cancer, immunization, oncology, disease, vaccination, chest | 0,862 |
cancer, immunization, oncology, disease, vaccination, veterans | 0,876 |
Однако данные тематические группы терминов (темы) были построены без учета гиперпараметров. В представленных ниже результатах при расширении тематического окружения групп терминов важную роль играют гиперпараметры α и γ. Данные гиперпараметры позволяют строить связи между векторами групп терминов, которые явно не соотносятся с терминами в тезаурусе.
Тематическое окружение выделенной темы можно расширить за счет синонимии, что позволит обнаружить дополнительные неявные связи для искомой темы и существенно увеличит релевантную выборку публикаций, связанных с данной темой. Механизм построения связей между векторами групп терминов с использованием гиперпараметров α и γ накладывает свои условия фильтрации на группы терминов, а именно:
- если гиперпараметр α ? γ (доминируют векторные представления), то синонимы, не учтенные в тезаурусе, будут объединяться на основе контекстной схожести;
- если гиперпараметр γ ? α (доминирует тезаурус), то синонимы, явно указанные в тезаурусе, будут жестко связаны, даже если их векторы далеки друг от друга.
При расширении тематического окружения групп терминов задействовалась калибровка гиперпараметров α и γ. Для специализированных областей, таких как медицина был увеличен гиперпараметр γ и предварительно дополнен синонимами тезаурус. На представленном ниже рис. 4 отображен результат по расширенной модели тематического окружения групп терминов публикаций Dimensions AI и PubMed на основе метода LDA. Результат по расширенной модели тематического окружения групп терминов, представленный на рис. 4, отображает две ключевые группы тем: одна связана с COVID-19 и эпидемиями (большой красный узел), другая – с онкологией и иммунизацией (желтые узлы). Представленные на рис. 4 результаты были получены следующим образом:
- извлечены термины из двух источников: баз Dimensions AI (где собраны данные по статьям и грантам) и PubMed (где собраны статьи, по ключевым словам, «pandemic», «covid» и т. д.);
- статьи преобразованы с помощью алгоритма LDA в распределения по темам;
- с помощью алгоритма LDA выделены n тем, где каждая тема – это набор терминов с весами;
- расширено пространство тем посредством синонимии;
- полученные векторы в результате косинусного сходства между TF-IDF-векторами тем дополнительно редуцированы с помощью PCA до трех измерений;
- применен алгоритм кластеризации (Gaussian Mixture), чтобы выявить самостоятельные «островки» близких по смыслу групп терминов.
Рис. 4. Тематическое окружение по публикациям Dimensions AI и PubMed на основе метода LDA и гиперпараметров α и γ из функции максимизации логарифмического правдоподобия (расширенная модель)
Fig. 4. Subject environment for Dimensions AI and PubMed publications based on the LDA method and hyperparameters α and γ from the log-likelihood maximization function (extended model)
Интерпретация результатов, представленных на рис. 4:
- красная точка «pandemic, taiwan, coronavirus, henan, epidemic, COVID», – это центр тематического кластера, отражающего узкоспециализированные эпидемиологические исследования;
- желтые точки – наиболее близкие темы к центру кластера, включают тематические следующие группы: cancer, immunization, oncology, disease, vaccination; здесь обнаруживается связь с онкологическими заболеваниями и иммунным ответом;
- серые точки – это более удаленные от центра кластера темы.
В расширенной модели для темы «pandemiс, taiwan, coronavirus, henan, epidemic, COVID» видно, что следующей по векторному приближению является тема «cancer, immunization, oncology, disease, vaccination, sadness». В табл. 2 приводятся результаты расчета Евклидового расстояния с учетом гиперпараметров α и γ по 10 ближайшим темам.
Таблица 2. Результаты Евклидового расстояния с учетом гиперпараметров α и γ [Results of Euclidean distance given hyperparameters α and γ]
Группы терминов ближайшие к группе «pandemiс, taiwan, coronavirus, henan, epidemic, COVID» [Groups of terms closest to the group “pandemiс, taiwan, coronavirus, henan, epidemic, COVID”] | Евклидово расстояние до ближайших групп терминов [Euclidean distance to the contents of terms of a group] |
hypoglycemia, diseases, loewenstein, policy, doubt, sicknesses, ailments | 0,678 |
cancer, behaviours, immunization, oncology, disease, vaccination | 0,707 |
behaviors, diseases, hearts, taiwan, ailments, conditions, policy | 0,804 |
cancer, immunization, oncology, disease, vaccination, chest | 0,862 |
cancer, immunization, oncology, disease, vaccination, veterans | 0,876 |
cancer, immunization, oncology, sex | 1,217 |
cancer, immunization, oncology, disease, vaccination, aids | 1,222 |
cancer, immunization, oncology, disease, vaccination, scenario | 1,259 |
cancer, immunization, oncology, disease, vaccination, sleep | 1,260 |
cancer, immunization, oncology, disease, vaccination, sadness | 1,262 |
Совместное использование LDA, векторных представлений и тезаурусов (UMLS/MESH) позволяет выявлять как темы, полученные с помощью стандартного метода LDA, так и новые (дополнительные) семантические связи между терминами за счет β-фильтрации, что улучшает расчет векторного сходства (гиперпараметр α) и строгого соответствия тезаурусу (гиперпараметр γ). В модели, сформированной по пяти ближайшим группам терминов (темам) без учета гиперпараметров α и γ, основную значимость приобретают онкология и иммунизация (семантически близкие к центральной теме). В модели, сформированной по 10 ближайшим группам терминов с учетом гиперпараметров α и γ основную значимость приобретают специализированные термины (сон, СПИД и др.). Высокие значения гиперпараметра α (α ? γ) позволяют выявить новые контекстные связи вне тезауруса, тогда как высокие значения гиперпараметра γ (γ ? α) уже известные термины из словарей.
Результаты моделирования тематического окружения терминов по публикациям Dimensions AI и PubMed на основе метода LDA представлены в таблице сравнения двух моделей тематического окружения терминов (табл. 3).
Таблица 3. Результаты сравнения двух моделей построения тематического окружения групп терминов [Results of comparison of two models for constructing thematic environment of groups of terms]
Модель [Model] | Число кластеров | Ближайшие тематические группы | Примечания |
Базовая модель тематического окружения терминов без учета гиперпараметров (рис. 1) | 5 |
| Доминируют общие медицинские темы |
Расширенная модель тематического окружения терминов с учетом гиперпараметров (рис. 2) | 10 |
| Появляются узконаправленные медицинские категории |
Исходя из результатов, представленных в табл. 3, в обеих моделях рядом с группой терминов (темой) «pandemiс, taiwan, coronavirus, henan, epidemic, COVID» появляются термины, связанные с онкологией и вакцинацией: «cancer, immunization, oncology, disease, vaccination» и их варианты.
В специализированных корпусах (Dimensions AI, PubMed) правильная калибровка гиперпараметра γ и расширение тезауруса (добавление синонимов) позволяет системе учитывать редкие, но важные медицинские понятия (например, «aids» (СПИД)), что ценно для задач построения автоматического обзора литературы и создания тематических карт.
ЗАКЛЮЧЕНИЕ
В ходе исследования используется математическая модель тематического окружения терминов, объединяющая метод LDA с векторными представлениями терминов и внешними тезаурусами. Кроме того, были сформулированы следующие ключевые выводы:
- Использование n-грамм и обучение эмбеддингов в рамках модификации метода LDA позволило корректно различать многозначные токены и учитывать порядок слов.
- В результате использования UMLS и MeSH тезаурусов удалось выделить устоявшиеся словосочетания, что повысило точность обнаружения тематических кластеров.
- Включение в функцию максимизации членов регуляризации Sim(W), F(L) и S(T) позволило учесть и частоту терминов, и семантическую связность векторных представлений и соответствие терминов тезаурусам.
- При сравнении расширенной модели с базовой были выявлены дополнительные связи между эпидемиологическими и онкологическими темами («pandemic, … COVID, covid» ↔ «cancer, immunization, oncology, …»), что подтверждает семантическую устойчивость выделенных групп терминов (тем).
- Доработка алгоритма LDA с учетом внешних тезаурусов позволила сделать тематические карты более понятными: предложенный подход снижает долю «шумовых» токенов и облегчает тематический анализ.
Практическая значимость работы заключается в возможности применения предложенной модели для автоматизированного построения тезаурусов, анализа научных публикаций и семантического поиска в крупных текстовых корпусах.
1 URL: https://uts-ws.nlm.nih.gov/rest
2 URL: https://id.nlm.nih.gov/mesh/lookup/descripto
3 URL: https://documentation.uts.nlm.nih.gov/rest/home.html
4 URL: https://id.nlm.nih.gov/mesh/swagger/ui
5 URL: https://projector.tensorflow.org/
About the authors
Oleg V. Zolotarev
Russian New University
Author for correspondence.
Email: ol-zolot@yandex.ru
ORCID iD: 0000-0001-6917-9668
SPIN-code: 5231-7243
Scopus Author ID: 57203129675
ResearcherId: AAR-4461-2021
Cand. Sci. (Eng.), Associate Professor; Head, Department of Information Systems in Economics and Management
Russian Federation, MoscowVladimir A. Yurchak
Russian New University
Email: yurchak.vladimir.1998@mail.ru
ORCID iD: 0000-0002-1362-802X
ResearcherId: GZG-2909-2022
postgraduate student, lecturer, Department of Information Systems in Economics and Management
Russian Federation, MoscowReferences
- Angelov D. Top2Vec: Distributed representations of topics. arXiv:2008.09470. 2020. URL: https://arxiv.org/abs/2008.09470 (дата обращения: 12.05.2025).
- Grootendorst M. BERTopic: Neural topic modeling with a class-based TF-IDF procedure. arXiv:2203.05794. 2022. URL: https://arxiv.org/abs/2203.05794 (дата обращения: 12.05.2025).
- Dieng A.B., Ruiz F.J.R., Blei D.M. Topic modeling in embedding spaces. Transactions of the Association for Computational Linguistics. 2020. Vol. 8. Pp. 439–453.
- Bianchi F., Terragni S., Hovy D. Pre-training is a hot topic: Contextualized document embeddings improve topic coherence. Findings of EMNLP. 2024. Pp. 2346–2359.
- Biggio M., Crippa F., Fumagalli A. et al. Joint document-token embeddings for hierarchical topic modeling. In: Contextualized-Top2Vec. Proceedings of the 2024 Conference on Neural Information Processing Systems. 2024. Pp. 10234–10246.
- Bianchi F., Terragni S., Hovy D. Combined Topic Model (CTM): Integrating contextualized embeddings into LDA. In: Findings of ACL. 2021. Pp. 1175–1188.
- Maheshwari K., Roberts M.E., Stewart B.M. Evaluating contextualized topic coherence for neural topic models. Journal of Machine Learning Research. 2022. Vol. 23. Pp. 1–20.
- Angelov D., Inkpen D. Hierarchical topic modeling with contextual token representations. In: Contextualized-Top2Vec. Proceedings of the 2024 Conference on Neural Information Processing Systems. 2024. URL: https://github.com/ddangelov/Top2Vec (дата обращения: 12.05.2025).
- Lee J., Yoon W., Kim S. et al. BioBERT: A pre-trained biomedical language representation model for biomedical text mining. Bioinformatics. 2020. Vol. 36. No. 4. Pp. 1234–1240.
- Zaheer M., Guruganesh G., Dubey K.A. et al. Big Bird: Transformers for longer sequences. In: NeurIPS. 2020. Pp. 17283–17297.
- Reimers N., Gurevych I. Sentence-BERT: Sentence embeddings using siamese BERT-Networks. In: Proceedings of EMNLP. 2019. Pp. 3980–3990.
- Pethe M., Joshi S., Kulkarni P. et al. SciBERT: A pretrained language model for scientific text. In: Proceedings of EMNLP. 2019. Pp. 3615–3620.
- McInnes L., Healy J., Melville J. UMAP: Uniform manifold approximation and projection for dimension reduction. arXiv:1802.03426. 2018. URL: https://arxiv.org/abs/1802.03426 (дата обращения: 12.05.2025).
- Fraley C., Raftery A.E. Model-based clustering, discriminant analysis, and density estimation. Journal of the American Statistical Association. 2002. Vol. 97. No. 458. Pp. 611–631.
- Bodenreider O. The Unified Medical Language System (UMLS): Integrating biomedical terminology. Nucleic Acids Research. 2004. Vol. 32. Suppl. 1. Pp. D267–D270.
- Lowe H.J., Barnett G.O. Understanding and using the Medical Subject Headings (MeSH) vocabulary to perform literature searches. JAMA. 1994. Vol. 271. No. 14. Pp. 1103–1108.
- Zolotarev O.V., Hakimova A.Kh., Agraval S. et al. Removing terms from biomedical publications-an approach based on n-grams. In: Civilization of Knowledge: Russian realities. 2023. Pp. 136–160. EDN: IRLOBR.
Supplementary files




