Effective data model selection for infological entities in multimodel database systems
- Authors: Mishin N.S.1, Afanasyev G.I.1, Khayrullin R.Z.1,2
-
Affiliations:
- Bauman Moscow State Technical University
- Moscow State University of Civil Engineering (National Research University)
- Issue: Vol 12, No 2 (2025)
- Pages: 58-67
- Section: MATHEMATICAL AND SOFTWARE OF COMPUTЕRS, COMPLEXES AND COMPUTER NETWORKS
- URL: https://journals.eco-vector.com/2313-223X/article/view/689213
- DOI: https://doi.org/10.33693/2313-223X-2025-12-2-58-67
- EDN: https://elibrary.ru/QIICSF
- ID: 689213
Cite item
Full Text
Abstract
The article addresses the problem of selecting effective data models for infological entities in the context of designing multimodel databases. The focus is placed on the need for a systematic approach when modeling heterogeneous entities whose structure and behavior require different forms of representation. The study analyzes the characteristics of three widely used models – relational, graph, and multidimensional – in terms of their applicability to various types of infological entities. Key criteria influencing model selection are described, including data structure, interconnectivity, query patterns, mutability, scalability, and consistency requirements. A decision-making algorithm is proposed, based on analyzing entity characteristics and the system’s non-functional requirements. Particular attention is given to the advantages and challenges of multimodel solutions, as well as principles of coordinating different models within a unified architectural framework. The work aims to provide a methodological foundation for rational model selection and for enhancing the adaptability and sustainability of information systems.
Full Text
ВВЕДЕНИЕ
В условиях стремительного развития информационных технологий и роста объемов данных возрастает сложность проектирования баз данных, способных эффективно отражать разнообразные аспекты предметных областей. Одной из важнейших задач в этом контексте становится обоснованный выбор моделей данных для представления инфологических сущностей – концептуальных образов объектов и процессов реального мира, служащих связующим звеном между предметной областью и структурой информационной системы.
Традиционные подходы, основанные на выборе единой модели данных, все чаще оказываются недостаточными для современных информационных систем, которые характеризуются высокой изменчивостью, сложной взаимосвязью сущностей и необходимостью обработки как оперативных, так и аналитических данных. Это приводит к необходимости использования мультимодельных решений, а также к более тонкому подходу к выбору моделей на основе анализа характеристик инфологических сущностей [2; 11].
Целью данной статьи является исследование критериев и подходов к выбору эффективных моделей данных в базах данных с несколькими моделями. В ходе работы рассматриваются особенности инфологических сущностей, характеристики реляционных, графовых и многомерных моделей данных, формулируются критерии выбора и описывается алгоритм принятия проектных решений. Такой системный подход позволяет повысить обоснованность архитектурных решений и адаптивность баз данных к изменяющимся требованиям.
ИНФОЛОГИЧЕСКИЕ СУЩНОСТИ И ИХ ОСОБЕННОСТИ
Одной из фундаментальных задач проектирования баз данных является построение модели, адекватно отражающей особенности предметной области. Ключевую роль в этом процессе играет понятие инфологической сущности, под которой понимается абстрактное описание объекта реального мира или явления, представленное в терминах, понятных специалистам предметной области и независимое от способов физического хранения данных.
Инфологические сущности служат основой для последующего перехода к логическому и физическому моделированию. Их корректная формализация позволяет обеспечить соответствие информационной системы реальным процессам, минимизируя потери семантической информации [18].
В зависимости от характера представляемых объектов, инфологические сущности можно классифицировать на несколько типов.
- Простые сущности – объекты с ограниченным набором атрибутов и минимальной структурой связей. Их характерной чертой является статичность структуры и высокая предсказуемость изменений.
- Сложные сущности – объекты, обладающие множеством атрибутов и сложными взаимосвязями. Часто такие сущности содержат атрибуты, зависящие от контекста или состояния, что требует более гибких моделей данных.
- Иерархические сущности – структуры, в которых связи между объектами подчинены строгой иерархии. Примеры включают организационные схемы или классификацию товаров.
- Сетевые сущности – характеризуются множественными пересекающимися связями между объектами без строгой иерархии. Они особенно актуальны для моделирования социальных взаимодействий или сложных взаимосвязанных систем.
Особого внимания требует вопрос изменчивости инфологических сущностей. Под изменчивостью понимается склонность структуры или свойств сущностей к изменениям под воздействием внешних факторов или эволюции предметной области. Игнорирование этого аспекта на этапе моделирования может привести к значительным трудностям при развитии информационной системы. Поэтому необходимо заранее оценивать потенциальные сценарии эволюции сущностей и выбирать модели данных, способные адаптироваться к изменениям без радикальной переработки всей структуры.
ХАРАКТЕРИСТИКА ОСНОВНЫХ МОДЕЛЕЙ ДАННЫХ
В процессе проектирования баз данных одним из ключевых этапов является выбор модели данных, которая будет наиболее полно отражать особенности предметной области и специфику инфологических сущностей. Модель данных представляет собой формализованную структуру для организации, хранения и управления информацией, определяющую способ описания данных и их взаимосвязей. Разные модели по-разному подходят для решения различных задач, что делает их осознанный выбор критически важным для построения эффективных информационных систем.
Наиболее широко распространенными являются реляционная, графовая и многомерная модели данных, каждая из которых предлагает свой способ интерпретации инфологических сущностей и связей между ними.
Реляционная модель данных оперирует концепцией хранения информации в виде отношений, представленных в табличной форме. Каждое отношение состоит из строк и столбцов, где строки отображают экземпляры сущностей, а столбцы соответствуют их атрибутам. Такая организация обеспечивает высокую степень формализации и четкую поддержку целостности данных через механизмы ключей и ограничений [9; 17].
Эта модель хорошо подходит для представления инфологических сущностей с фиксированной структурой и явно выраженными связями один-к-одному или один-ко-многим. Она позволяет эффективно реализовывать сложные запросы, поддерживает транзакционность и обеспечивает строгую согласованность данных. Вместе с тем, при необходимости моделировать структуры с множественными динамическими связями или частыми изменениями схемы данных, реляционные системы могут демонстрировать недостаточную гибкость. Усложнение структуры базы за счет многочисленных вспомогательных таблиц и внешних ключей нередко приводит к снижению производительности и увеличению трудозатрат на поддержку [4].
Графовая модель данных предлагает иной способ представления информации, ориентированный на взаимосвязи между сущностями. В графовой модели объекты описываются в виде узлов, а отношения между ними – в виде ребер, при этом как узлы, так и ребра могут иметь собственные свойства. Такая структура интуитивно отражает сложные сетевые взаимосвязи и позволяет эффективно работать с динамическими структурами данных.
Гибкость графовой модели проявляется в возможности легко добавлять новые типы связей и атрибутов без необходимости модифицировать всю систему. Особенно эффективной она оказывается в сценариях, где критичен анализ путей, взаимосвязей и кластеров, таких как моделирование социальных сетей, рекомендательных систем или сложных организационных структур. Однако в приложениях, где требуется строгая транзакционная целостность или обработка больших объемов однотипных данных, графовые модели могут уступать реляционным по производительности [5].
Многомерная модель данных строится вокруг концепции измерений и фактов. Измерения описывают контекст анализа, а факты содержат агрегированные значения, характеризующие определенные аспекты деятельности. Эта модель находит свое применение в системах поддержки принятия решений и бизнес-аналитике, где необходимо быстро получать срезы данных по различным признакам [6; 19].
Преимущество многомерной модели заключается в ее способности обеспечивать высокую скорость выполнения агрегированных запросов и удобную навигацию по данным. Она отлично подходит для инфологических сущностей, связанных с накоплением и анализом показателей деятельности, таких как продажи, финансовые показатели или данные о производительности. Однако изменения в структуре измерений или пересмотр аналитических показателей требуют переработки схемы данных, что ограничивает гибкость многомерных систем в условиях постоянно меняющихся требований.
Понимание фундаментальных особенностей каждой модели позволяет осознанно сопоставлять их возможности с характером инфологических сущностей и требованиями к системе в целом. Это понимание становится отправной точкой для дальнейшего анализа критериев выбора подходящей модели данных, что будет рассмотрено в следующем разделе.
КРИТЕРИИ ВЫБОРА МОДЕЛИ ДАННЫХ ДЛЯ ИНФОЛОГИЧЕСКИХ СУЩНОСТЕЙ
Одним из базовых критериев является структура данных, отражающая организацию атрибутов и взаимосвязей между экземплярами сущностей. Для сущностей с четко определенной табличной структурой, где связи легко выражаются через внешние ключи, реляционные модели остаются оптимальным выбором. Напротив, для сущностей, характеризующихся множественными, динамическими и разнородными связями, более естественным способом представления становится графовая модель, способная выразить сложные отношения без чрезмерной усложненности.
Не менее важным является уровень связности данных. Высокосвязные инфологические сущности требуют моделей, способных эффективно работать с множественными отношениями, поддерживая быструю навигацию между связанными объектами. В таком случае использование графовой модели обеспечивает прирост производительности при выполнении сложных запросов на поиск путей и взаимосвязей, что в реляционных системах потребовало бы множественных операций объединения таблиц.
Иерархичность также оказывает влияние на выбор модели. Сущности, естественно укладывающиеся в древовидные структуры, могут быть эффективно реализованы как в реляционных системах с использованием рекурсивных связей, так и в специализированных графовых или иерархических моделях. Однако в реляционной модели реализация иерархий зачастую требует дополнительных механизмов, таких как иерархические запросы или материализованные пути, что увеличивает сложность поддержки данных.
Динамичность структуры инфологических сущностей – еще один фактор, который необходимо учитывать. В условиях, где изменения в структуре данных происходят часто и непредсказуемо, предпочтение отдается моделям, минимизирующим затраты на адаптацию. Графовые базы данных и некоторые мультимодельные решения позволяют добавлять новые типы узлов и связей без необходимости изменения схемы, тогда как реляционные базы требуют пересмотра схем и потенциально сложных миграций.
Объем и динамика данных также должны приниматься во внимание. Для систем, работающих с постоянно растущими объемами информации и требующих горизонтального масштабирования, предпочтительны модели, поддерживающие шардирование и репликацию без потери целостности данных. Здесь мультимодельные системы могут предложить дополнительные возможности за счет гибкости выбора оптимальных моделей хранения под разные типы сущностей в рамках одной архитектуры [8].
Требования к целостности и транзакционной поддержке являются определяющим фактором для критичных бизнес-приложений. Высокий уровень требований к согласованности данных диктует использование реляционных моделей, предоставляющих механизмы строгой транзакционности и контроля целостности. В то время как графовые и многомерные системы могут поддерживать базовую целостность, в критичных к ошибкам сценариях они уступают реляционным решениям [14].
Важную роль играет характер запросов к базе данных. Оперативные системы, где преобладают транзакционные запросы на создание, чтение, обновление и удаление данных (CRUD-операции), традиционно эффективнее реализуются на реляционных моделях [13]. В противоположность этому, аналитические системы, ориентированные на получение агрегированной информации и выполнение сложных аналитических операций, выигрывают от использования многомерных моделей данных, оптимизированных для работы с большими массивами предобработанных данных.
Отдельно стоит отметить критерий масштабируемости [12]. При проектировании систем, ориентированных на масштабирование, важно учитывать характер нагрузки: если система должна обеспечивать быструю обработку множества параллельных запросов к взаимосвязанным данным, графовые модели обеспечивают масштабируемость по числу связей, тогда как реляционные модели масштабируются за счет оптимизации запросов и распределения данных.
Наконец, критерием выбора служит потребность в интеграции разных моделей данных [10; 20]. В современных условиях часто возникает необходимость в гибридном подходе, где разные части системы используют разные модели для оптимального решения своих задач. Мультимодельные базы данных, поддерживающие одновременную работу с реляционными, графовыми и документно-ориентированными структурами, предоставляют возможности для более тонкой настройки архитектуры под конкретные особенности инфологических сущностей.
Осмысленное сопоставление всех этих критериев с особенностями проектируемой системы позволяет значительно повысить качество проектных решений и избежать последующих сложностей, связанных с недостаточной гибкостью или производительностью базы данных.
СПЕЦИФИКА ПРОЕКТИРОВАНИЯ В МУЛЬТИМОДЕЛЬНЫХ БАЗАХ ДАННЫХ
В контексте нашей задачи выбора эффективных моделей данных особую значимость приобретают мультимодельные базы данных, способные интегрировать в себе разные парадигмы представления информации. Использование мультимодельных решений позволяет более точно соответствовать разнообразным требованиям к моделированию сущностей, что особенно актуально при работе с комплексными информационными системами, включающими неоднородные структуры данных.
Мультимодельная база данных – это система управления данными, поддерживающая одновременное использование нескольких моделей хранения и обработки информации, таких как реляционные таблицы, графовые структуры, документы или пары ключ-значение. Применение мультимодельного подхода оказывается особенно полезным в случаях, когда инфологические сущности существенно различаются по своим характеристикам и нуждаются в специфичных способах представления.
Одной из ключевых особенностей проектирования мультимодельных баз данных является необходимость осознанного выбора уровня интеграции моделей. На практике можно выделить два основных подхода: слабую интеграцию, при которой различные модели существуют параллельно и используются независимо, и тесную интеграцию, предполагающую взаимодействие между данными, представленными в разных моделях, на уровне запросов и транзакций. Каждый из этих подходов накладывает свои требования на архитектуру системы и влияет на сложность проектирования.
В условиях слабой интеграции проектировщик получает возможность разрабатывать отдельные подсистемы для каждой модели данных, минимизируя взаимное влияние изменений. Такой подход упрощает локальную оптимизацию и позволяет использовать специализированные механизмы обработки данных для каждой модели. Однако при необходимости объединения информации из разных моделей возникает проблема согласования данных, требующая дополнительных усилий на уровне логики приложения или промежуточных слоев интеграции [7].
При тесной интеграции мультимодельная база данных должна обеспечивать единый механизм обработки запросов, поддерживая возможность обращения к данным разных моделей в рамках одной транзакции. Это значительно повышает гибкость системы, но предъявляет строгие требования к согласованности схемы данных, унификации идентификаторов сущностей и стандартизации описания связей. В проектировании таких систем особое внимание уделяется созданию единого инфологического пространства, в котором разные модели дополняют друг друга без противоречий.
При выборе модели данных для конкретной инфологической сущности в мультимодельной системе необходимо учитывать не только характеристики самой сущности, но и ее взаимодействие с другими элементами системы. Например, сущность, хорошо укладывающаяся в реляционную модель по своей внутренней структуре, может быть перенесена в графовую модель, если ее основная роль в системе заключается во взаимодействии с многочисленными связанными объектами.
Проектирование мультимодельных баз данных также связано с вопросами управления целостностью данных. Поскольку разные модели данных могут иметь различные механизмы обеспечения целостности, возникает необходимость в разработке единой политики поддержания согласованности. Это может включать как использование встроенных средств каждой модели, так и внедрение внешних механизмов контроля на уровне приложения [15; 16].
Отдельную сложность представляет вопрос оптимизации производительности в мультимодельных системах. Разные модели данных предъявляют различные требования к индексированию, шардированию, кэшированию и другим аспектам управления данными. В результате проектировщику приходится находить баланс между оптимизацией каждой отдельной модели и поддержанием общей эффективности системы.
Не менее важным аспектом является обеспечение эволюции схемы данных в мультимодельных системах. Поскольку изменения в одной модели могут косвенно затрагивать другие, необходимо строить архитектуру таким образом, чтобы обеспечить максимальную изоляцию изменений или предусмотреть механизмы координации изменений между различными моделями.
Мультимодельные базы данных открывают широкие возможности для адаптивного моделирования инфологических сущностей, позволяя учитывать их разнообразие и изменчивость. Однако использование таких систем требует более высокого уровня зрелости проектных решений, глубокого понимания особенностей каждой модели данных и внимательного отношения к вопросам целостности, производительности и развития архитектуры.
ВЫБОР ЭФФЕКТИВНОЙ МОДЕЛИ: АЛГОРИТМ ПРИНЯТИЯ РЕШЕНИЙ
Анализ особенностей инфологических сущностей и моделей данных позволяет подойти к вопросу выбора наиболее подходящей модели не как к интуитивному действию, а как к последовательной процедуре, основанной на формализованных критериях. Для целей системного проектирования особенно важно разработать алгоритм принятия решений, который обеспечит обоснованность и воспроизводимость выбора модели данных на разных этапах проектирования информационной системы.
Первая стадия алгоритма связана с идентификацией ключевых характеристик инфологической сущности. На этом этапе производится анализ структуры данных (табличной, сетевой или агрегированной), степени связности между объектами, наличия иерархий, изменчивости атрибутов и требуемой устойчивости к изменениям. Выявление этих признаков позволяет задать начальные ориентиры для выбора модели.
Следующим шагом является оценка характера использования данных, который включает в себя прогнозируемые типы операций (оперативные или аналитические), предполагаемую нагрузку на систему, требования к скорости выполнения запросов и поддержке транзакционной целостности. Характер данных и операций напрямую влияет на предпочтение той или иной модели: для транзакционных систем с четкой структурой эффективнее реляционные модели, для сетевых систем – графовые, для аналитических – многомерные.
На третьем этапе проводится сопоставление выявленных характеристик сущностей и операций с возможностями моделей данных. Этот процесс может быть представлен в виде матрицы соответствий, где по строкам перечисляются основные свойства инфологической сущности, а по столбцам – возможности каждой модели данных. Для каждого сочетания оценивается степень соответствия: высокая, средняя или низкая [1].
Такой подход позволяет избежать субъективности выбора и сделать его максимально обоснованным. В случае, если одна из моделей демонстрирует устойчивое преимущество по большинству критериев, она принимается в качестве основной. Однако на практике нередко возникает ситуация, когда разные части инфологической сущности лучше соответствуют разным моделям. В этом случае стоит рассмотреть возможность разделения данных на подмножества с последующим размещением в разных моделях, либо использовать мультимодельное решение, если оно допустимо архитектурно.
Четвертая стадия алгоритма связана с анализом перспектив изменений структуры данных. Даже если текущая характеристика сущности предполагает оптимальное использование определенной модели, важно учитывать потенциальную динамику развития системы. Модели, допускающие более легкую адаптацию к изменениям (например, графовые), могут быть предпочтительнее в условиях высокой неопределенности требований.
На заключительном этапе осуществляется проверка выбранной модели на соответствие нефункциональным требованиям: масштабируемости, надежности, скорости восстановления после сбоев, интеграции с другими системами. Иногда именно эти факторы становятся решающими при окончательном выборе модели, особенно в случаях, когда технические ограничения инфраструктуры или специфика бизнес-процессов диктуют особые условия эксплуатации базы данных [3].
Разработка и применение алгоритма выбора моделей данных способствует стандартизации проектных решений и снижению риска ошибок, связанных с несоответствием модели требованиям предметной области. Такой подход особенно ценен при проектировании сложных систем с несколькими моделями данных, где обоснованный выбор архитектуры критически важен для обеспечения долгосрочной устойчивости и эффективности системы.
ЭКСПЕРИМЕНТАЛЬНАЯ ОЦЕНКА ВРЕМЕНИ ВЫПОЛНЕНИЯ ЗАПРОСОВ КАК КРИТЕРИЯ ВЫБОРА МОДЕЛИ ДАННЫХ
Целью данного экспериментального исследования является представление способа для эмпирической проверки одного из ключевых критериев, заложенных в предложенном ранее алгоритме выбора моделей данных, – а именно времени выполнения запросов. Гипотеза заключается в том, что разные модели данных (реляционная, графовая, многомерная) обладают разной эффективностью обработки запросов в зависимости от структуры данных и характера операций. Для оценки этой зависимости была реализована стратегия раздельного хранения, при которой каждой инфологической сущности сопоставляется та модель, которая демонстрирует минимальное время отклика. Такой подход позволяет снизить суммарные затраты на обслуживание системы и сократить необходимость в синхронизации между моделями в условиях мультимодельной архитектуры.
Идентичные данные были размещены в каждой из этих моделей, чтобы обеспечить возможность непосредственного сравнения производительности запросов. Для каждой группы данных gk был определен набор типовых запросов, отражающих реальные операции, выполняемые с данными этого типа. Каждый запрос выполняется на всех трех моделях данных, и фиксируется время выполнения на каждой из них (рис. 1).
Рис. 1. Методология эксперимента
Fig. 1. Experimental methodology
Таким образом, для группы данных gk можно построить матрицу времен выполнения, где строки представляют каждый запрос к данным группы, а столбцы – модели данных. Элементы матрицы Tij обозначают время выполнения запроса ni на модели j. Матрица времен выполнения для группы данных gk будет иметь вид:
где Tij – это время выполнения запроса Ni на модели Ji.
Например, T11 может быть временем выполнения первого запроса на реляционной модели, T12 – на графовой, и так далее. Каждый элемент матрицы указывает, сколько времени занимает выполнение конкретного запроса на каждой модели, что позволяет проводить сравнительный анализ по каждой группе данных и выявлять наиболее эффективные модели для ее хранения.
На основе собранных данных о времени выполнения запросов для каждой группы данных в различных моделях необходимо провести многоплановую оценку производительности. Для наглядного анализа производительности было решено использовать метод кластеризации, представив данные в трехмерном пространстве (рис. 2).
Рис. 2. Кластеризация данных в трехмерном пространстве
Fig. 2. Clustering of data in three-dimensional space
Три оси в этой модели представляют:
- модель данных (реляционная, графовая или многомерная);
- тип запроса (например, выборка данных, аналитический запрос или построение связей);
- относительное время выполнения запросов (по вертикальной оси), где время выполнения каждого запроса нормализовано относительно среднего времени для этого типа запроса.
Нормализация времен позволила нивелировать различия в сложности и частоте запросов. Это важно, так как разные группы данных могут требовать различных операций (например, простые выборки данных или сложные аналитические запросы). Сравнивая запросы по относительному времени, мы получили более объективное представление о том, какая модель лучше справляется с запросами определенного типа.
На пересечении модели данных и типа запроса в трехмерной плоскости выстраиваются «столбики» разной высоты, отражающие относительное время выполнения. Низкие столбики указывают на быстрое выполнение запросов на данной модели, а высокие столбики – на задержки. Таким образом, появляется возможность визуально оценить, как различные модели данных справляются с тем или иным типом запросов, что существенно облегчает определение оптимальной модели для каждой группы данных.
После анализа данных в трехмерном пространстве необходимо произвести полиномиальную аппроксимацию времени выполнения для каждой модели данных. Использование полиномов позволяет смоделировать зависимости между типом запроса и временем выполнения на разных моделях данных. Аппроксимация каждого типа запроса с помощью полинома позволяет сделать выводы о характере изменения времени выполнения запросов с увеличением их сложности и количественно оценить поведение каждой модели данных для каждого типа запросов.
Каждая модель данных (реляционная, графовая, многомерная) представляется своей полиномиальной функцией (рис. 3), описывающей зависимость времени выполнения от характеристик запроса. Визуально эти зависимости выглядят как кривые, имеющие минимумы, которые указывают на точки наибольшей эффективности для данной модели. Минимумы полиномиальных кривых представляют собой оптимальные точки для выполнения запросов определенного типа, поскольку здесь время выполнения минимально.
Рис. 3. Полиномиальные функции для каждой модели данных
Fig. 3. Polynomial functions for each data model
Для каждой группы данных определяется модель, где эта минимальная точка достигается быстрее всего, что позволяет точно выбрать модель для хранения конкретных данных.
Для формального описания предлагаемого подхода сформулируем задачу оптимизации модели данных в мультимодельной базе в математических терминах, учитывая при этом затраты на поддержку и синхронизацию данных, если их хранение будет требовать использования нескольких моделей.
Рассмотрим множество запросов Nk = {n1, n2, ... , nz}, относящихся к группе данных gk. Для каждой модели данных j ∈ J можно вычислить общее время выполнения запросов из группы gk при их хранении в этой модели. Суммарное время выполнения запросов для группы gk на модели j будет иметь вид:
где S(Jj, gk) – общее время выполнения всех запросов к группе gk в модели Jj;
T(Nk, Jj) – время выполнения одного запроса Nk к группе gk в модели Jj.
Наша цель – найти такую модель данных, которая минимизирует S(Jj, gk) и делает хранение группы данных максимально производительным.
Так как база мультимодельная и задача состоит в том, чтобы использовать несколько моделей данных, необходимо математически описать и этот вариант. В сумме времен для двух моделей данных учитывается сумма минимальных времен запросов по каждой группе данных в двух моделях и будет иметь вид:
Очевидно, по такой же логике, можно расписать и сумму времени для трех моделей и более. Однако использование нескольких моделей имеет свои затраты, например, на синхронизацию и поддержку данных между этими моделями. Поэтому применение более одной модели для хранения данных будет оправдано только в том случае, если разница между временем выполнения для одной модели и для двух модель превышает затраты на их синхронизацию и поддержку.
ЗАКЛЮЧЕНИЕ
Выбор модели данных для представления инфологических сущностей является одним из ключевых этапов проектирования эффективных информационных систем. Правильное соответствие между особенностями сущностей и характеристиками моделей определяет не только производительность и надежность базы данных, но и ее способность к адаптации в условиях изменения предметной области.
Рассмотрение реляционных, графовых и многомерных моделей данных позволило выявить их сильные и слабые стороны в контексте различных типов инфологических сущностей. При этом особую актуальность приобретает использование мультимодельных баз данных, предоставляющих возможности для более точного соответствия структуры данных реальным требованиям системы.
Формализация критериев выбора и разработка алгоритма принятия решений обеспечивают системность проектирования, снижают риски ошибок и позволяют учитывать как функциональные, так и нефункциональные требования к системе. Применение таких подходов становится особенно важным при создании сложных и долгоживущих информационных систем, где устойчивость архитектуры и возможность ее эволюции являются определяющими факторами успеха.
В рамках данной работы также предложена методология экспериментальной оценки моделей данных, основанная на сравнении времени выполнения запросов к разным типам инфологических сущностей. Разработанный подход включает построение матрицы времен, кластеризацию результатов и полиномиальную аппроксимацию, что позволяет определить модель, минимизирующую время отклика системы.
Таким образом, переход к осознанному и методологически выверенному выбору моделей данных открывает перспективы для построения более гибких, эффективных и надежных интеграционных баз данных.
About the authors
Nikita S. Mishin
Bauman Moscow State Technical University
Author for correspondence.
Email: stancuem@yandex.ru
ORCID iD: 0009-0008-3076-8076
SPIN-code: 2572-3667
postgraduate student, Department of Information Processing and Control Systems
Russian Federation, MoscowGennady I. Afanasyev
Bauman Moscow State Technical University
Email: gaipcs@bmstu.ru
Cand. Sci. (Eng.), Associate Professor; associate professor
Russian Federation, MoscowRustam Z. Khayrullin
Bauman Moscow State Technical University; Moscow State University of Civil Engineering (National Research University)
Email: zrkzrk@list.ru
ORCID iD: 0000-0002-0596-4955
SPIN-code: 6631-0932
Dr. Sci. (Eng.), Senior Scientific Worker; Professor
Russian Federation, Moscow; MoscowReferences
- Aguilar Vera R. et al. NoSQL database modeling and management: A systematic literature review. Revista Facultad de Ingeniería. 2023. Vol. 32. No. 65 (32). Art. e16519. doi: 10.19053/01211129.v32.n65.2023.16519.
- Daniel G. et al. NeoEMF: A multi-database model persistence framework for very large models. Science of Computer Programming. 2017. No. 149. Pp. 9–14. doi: 10.1016/j.scico.2017.08.002.
- Gabrielsen R.H., Olesen O. The Concept of lineaments in geological structural analysis; Principles and methods: A review based on examples from Norway. Geomatics. 2024. No. 2 (4). Pp. 189–212. doi: 10.3390/geomatics4020011.
- Gerasimov V.R., Dusheba V.V. Analysis of optimizing database performance methods // Èlektronnoe modelirovanie. 2024. No. 6 (46). Pp. 43–54. doi: 10.15407/emodel.46.06.043.
- Gupta S., Pal S., Chakraborty M. A Study on various database models: Relational, graph, and hybrid databases. Singapore: Springer, 2019. Pp. 141–149. doi: 10.1007/978-981-15-0361-0_11.
- Jiri H. et al. Multidimensional database for crime prevention. IEEE, 2016. Pp. 242–247. doi: 10.1109/carpathiancc.2016.7501102.
- Labiadh M. et al. A microservice-based framework for exploring data selection in cross-building knowledge transfer. Service Oriented Computing and Applications. 2020. No. 2 (15). Pp. 97–107. doi: 10.1007/s11761-020-00306-w.
- Larson D., Chang V. A review and future direction of agile, business intelligence, analytics and data science. International Journal of Information Management. 2016. No. 5 (36). Pp. 700–710. doi: 10.1016/j.ijinfomgt.2016.04.013.
- Lebedev I.I., Ogorodnikov S.S. Storage and analysis of remote sensing data // Russian Engineering Research. 2024. No. 4 (44). Pp. 597–599. doi: 10.3103/s1068798x24700485.
- Lou J. et al. Willingness to pay for well-being housing attributes driven by design layout: Evidence from Hong Kong. Building and Environment. 2024. No. 251. Art. 111227. doi: 10.1016/j.buildenv.2024.111227.
- Margara A. et al. A model and survey of distributed data-intensive systems. ACM Computing Surveys. 2023. No. 1 (56). Pp. 1–69. doi: 10.1145/3604801.
- Molka-Danielsen J., Engelseth P., Wang H. Large scale integration of wireless sensor network technologies for air quality monitoring at a logistics shipping base. Journal of Industrial Information Integration. 2018. No. 10. Pp. 20–28. doi: 10.1016/j.jii.2018.02.001.
- Murri S. Optimising data modeling approaches for scalable data warehousing systems. International Journal of Scientific Research in Science, Engineering and Technology. 2023. Pp. 369–382. doi: 10.32628/ijsrset2358716.
- Pekaric I. et al. A systematic review on security and safety of self-adaptive systems. Journal of Systems and Software. 2023. No. 203. Art. 111716. doi: 10.1016/j.jss.2023.111716.
- Petkov Y.I., Chikalanov A.I. Innovative proposals for database storage and management. Mathematics and Informatics. 2022. No. 1 (LXV). Pp. 45–52. doi: 10.53656/math2022-1-6-inn.
- Sarawagi S. Models and indices for integrating unstructured data with a relational database. Berlin; Heidelberg: Springer, 2005. Pp. 1–10. doi: 10.1007/978-3-540-31841-5_1.
- Shah K., Patel K.S. A Survey on relational database based multi relational classification algorithms. International Journal of Scientific Research in Computer Science, Engineering and Information Technology. 2024. No. 2 (10). Pp. 140–147. doi: 10.32628/cseit2390656.
- Shahidinejad J., Kalantari M., Rajabifard A. 3D cadastral database systems – a systematic literature review. ISPRS International Journal of Geo-Information. 2024. No. 1 (13). P. 30. doi: 10.3390/ijgi13010030.
- Tan Z., Yue P., Gong J. An array database approach for earth observation data management and processing. ISPRS International Journal of Geo-Information. 2017. No. 7 (6). P. 220. doi: 10.3390/ijgi6070220.
- Zhang J. et al. Public cloud networks oriented deep neural networks for effective intrusion detection in online music education. Computers and Electrical Engineering. 2024. No. 115. Art. 109095. doi: 10.1016/j.compeleceng.2024.109095.
Supplementary files



