Improvement of neural network model topology for object segmentation in digital images based on convolutional neural networks
- Authors: Kulikov A.А.1,2
-
Affiliations:
- MIREA – Russian Technological University
- Financial University under the Government of the Russian Federation
- Issue: Vol 11, No 3 (2024)
- Pages: 57-63
- Section: INFORMATICS AND INFORMATION PROCESSING
- URL: https://journals.eco-vector.com/2313-223X/article/view/651484
- DOI: https://doi.org/10.33693/2313-223X-2024-11-3-57-63
- EDN: https://elibrary.ru/QGYEQJ
- ID: 651484
Cite item
Full Text
Abstract
Nowadays, convolutional neural networks have demonstrated significant performance gains over traditional machine learning methods for various real-world computational intelligence tasks such as digital image classification. However, to achieve the best accuracy, the network topology should be modeled using different architectures with different number of filters, kernel size, number of layers, etc., which actualizes the problem of developing and justifying appropriate selection methods. Taking into account the above mentioned, the aim of the paper is to justify an approach that will improve the topology of the neural network model for object segmentation in digital images based on convolutional neural networks. The research methods are system analysis, modeling, machine learning and fuzzy logic theory, and decision-making theory. As a result of the analysis, the paper proposes an algorithm to improve the topology of the neural network model based on differential evolution to optimize the accuracy of image segmentation and the training time of the network. Differential evolution is applied to determine the optimal number of layers in the network topology, which promotes faster convergence. Within the proposed algorithm, an encoding step was identified to represent the structure of each network using a fixed-length integer array, after which it is proposed to utilize differential evolution processes (mutation, recombination, and selection) to efficiently explore the search space. Prospects for further research are to develop methods and techniques to encode a candidate solution using different numbers of hidden blocks in each convolution.
Keywords
Full Text
Введение
В настоящее время в различных сферах и областях деятельности возникает масса задач, которые могут эффективно решаться с помощью сегментации: анализ медицинских изображений, выделение объектов на спутниковых снимках, распознавание лиц, автоматические системы управления дорожным движением и т.д. Сегментация – это процесс присвоения значимой метки каждому пикселю изображения и одна из фундаментальных задач их анализа [1]. Она необходима для многих приложений, в которых требуется высокоуровневое понимание общей картины, размеров и расположения объектов на изображении, и является предшественником большинства конвейеров обработки графических элементов.
Существуют различные методы и подходы к сегментации цифровых изображений, каждый из которых имеет свои преимущества и недостатки, однако особого внимания заслуживает использование нейронных сетей. Этот метод получил широкое распространение из-за относительной простоты применения существующих моделей для различных видов сегментации без необходимости глубинного анализа предметной области. Особую эффективность в решении обозначенных задач демонстрируют сверточные нейронные сети. [2]. Однако, как правило, перед применением этих сетей оптимизируется их топология.
Цели оптимизации топологии сверточной нейронной сети могут быть самыми разными: улучшение эффективности процесса разделения изображения на несколько сегментов, решение проблемы переобучения, создание более быстрого анализатора, обеспечение лучшего понимания основного процесса, генерирующего данные, а также сокращение времени и затрат на сбор и преобразование информации [3]. В тоже время необходимо отметить, что на сегодняшний день не существует универсального действенного подхода к оптимизации топологии сверточных нейронных сетей. Выбор того или иного метода зависит от сложности задачи классификации изображений, размера набора данных, доступных вычислительных ресурсов и желаемого уровня точности.
Таким образом, изучение различных приемов и способов проектирования топологии сверточной нейронной сети для обработки цифровых изображений, которые позволят определить расположение слоев и параметров, составляющих модель сети, представляет собой важную научно-практическую задачу, которая и обуславливает выбор темы данной статьи.
Анализ публикаций по теме исследования
Детальному изучению наиболее популярных метаэвристических алгоритмов – имитация отжига, генетический алгоритм и поиск гармонии, которые используются для оптимизации сверточных нейронных сетей, классифицирующих наборы изображений, посвятили свои публикации В.С. Луценко, А.Е. Шухман [4], Binjun He Wenbin Hu [5], G. Srinitya, D. Sharmila [6], Kai Su, Xin Zhang [7].
Над выбором наиболее информативных факторов, определяющих эффективность обучения и архитектуру сверточных нейронных сетей, трудятся И.И. Березовский [8], И.А. Ложкин [9], Xiao Qing Zhang, Guang Yu Wang [10], Aarthi Sundaram, Chitrakala Sakthivel [11], Yuma Hakumura, Taiyo Ito [12].
Вопросы, связанные с поиском оптимальной топологии нейронной сети для сегментации изображений на основании многоуровневого алгоритма байесовской оптимизации, рассматривают в своих трудах А.А. Михайлов [13], М.Ю. Катаев, Е.Ю. Карташов, В.В. Рябухин, Е.В. Макаров, О.А. Пасько [14], Jie Yang, Yong Chen [15], T.L. Mahyari, R.M. Dansereau [16]. Данные публикации играют важную роль в развитии области сегментации объектов на цифровых снимках с использованием сверточных нейронных сетей и представляют ценный материал для дальнейших исследований в этом направлении.
Нерешенные части общей проблемы
В области сегментации объектов на цифровых снимках с использованием сверточных нейронных сетей существуют несколько нерешенных проблем, которые требуют дополнительного исследования. Одной из таких проблем является поиск эффективного алгоритма, способного существенно сократить количество итераций, необходимых для определения оптимальных гиперпараметров и архитектуры сверточной нейронной сети для конкретного набора данных. В настоящее время этот процесс обычно требует значительных вычислительных ресурсов и времени, что замедляет разработку новых моделей и усложняет их оптимизацию.
Еще одним значимым аспектом, требующим дальнейшего исследования, являются перспективы оптимизации топологии с использованием роя частиц для автоматического поиска оптимальной архитектуры сверточной нейронной сети без необходимости в ручной настройке. Этот подход может предложить более эффективный и автоматизированный способ настройки нейронных сетей, что сделает процесс разработки моделей более эффективным и доступным для широкого круга исследователей.
Таким образом, цель настоящего исследования заключается в обосновании подхода, который позволит усовершенствовать топологию нейросетевой модели для сегментации объектов на цифровых снимках на основе сверточных нейронных сетей. Основной упор делается на разработку методов, которые способствуют автоматизации процесса оптимизации архитектуры нейронных сетей и сокращению времени, затрачиваемого на этот процесс, без потери качества и эффективности моделей. Достижение этой цели позволит значительно улучшить процесс разработки и оптимизации нейросетевых моделей для сегментации объектов на цифровых изображениях, что имеет важное значение для различных областей применения компьютерного зрения и анализа изображений.
Методы: системный анализ, моделирование, теория машинного обучения и нечеткой логики, теория принятия решений.
Основная часть
С целью усовершенствования топологии нейросетевой модели для сегментации объектов на цифровых снимках на основе сверточных нейронных сетей предлагаем использовать алгоритм дифференциальной эволюции (АДЭ). Он был выбран потому, что является еще одним эффективным методом оптимизации после генетических алгоритмов, оптимизации роя частиц и других эволюционных алгоритмов. АДЭ имеет простую структуру, небольшое количество управляющих параметров, несложное реальное кодирование и быструю скорость сходимости, что было доказано теоретически [17; 18].
Структура предлагаемого алгоритма для усовершенствования топологии нейросетевой модели в процессе сегментации объектов на цифровых снимках на основе сверточных нейронных сетей, с использованием АДЭ, изображен на рис. 1.
Рассмотрим более подробно предложенный ал-горитм.
Итак, прежде всего, определяется множество топологий-кандидатов, которые могут быть закодированы в целочисленном массиве фиксированной длины. Нейронная сеть состоит из входного слоя, λ – конволюционных скрытых слоев, π – объединяющих слоев и выходного слоя. Каждый скрытый слой имеет определенное количество скрытых нейронов nH. Количество объединяющих слоев меньше, чем количество скрытых слоев. Каждый фильтр имеет ширину fw и высоту fh. Глубина фильтра не изменяется, так как соответствует количеству цветовых каналов изображения. Гиперпараметрами являются вероятность рекомбинации Cp, и коэффициент вариации мутации F. Таким образом, решение-кандидат – это целочисленный массив:
xi = (λ, nH, fw, fh, Cp, F), i = 1, … , q,
где q – количество решений-кандидатов в популяции.
Поскольку все решения-кандидаты должны иметь фиксированную длину для применения мутации, рекомбинации и селекции [19], было принято решение, что каждый скрытый слой в решении-кандидате содержит одинаковое количество скрытых единиц. После каждого конволюционного слоя в сеть добавлялся слой max pooling, за исключением последнего, который является плотным слоем.
Рис. 1. Алгоритм для усовершенствования топологии нейросетевой модели на основе АДЭ
Fig. 1. Algorithm for improving the topology of a neural network model based on ADE
В качестве нелинейной функции активации для каждого конволюционного слоя была выбрана функция ReLU. В качестве функции активации между последним плотным слоем и выходным слоем была выбрана функция Softmax [20]. Размер пула составлял (2, 2). Таким образом, алгоритм включает следующие шаги.
- Вход: набор данных изображений D, количество поколений G, количество решений-кандидатов в каждом поколении N, Xi = (λi, nHi, fwi, fhi, Cpi, Fi), i = 1, 2, … , N решений-кандидатов.
- Инициализация: случайным образом генерируется набор решений-кандидатов Xi, 1, i = 1, 2, … , N, и строится N нейронных сетей, имеющих λi количество конволюционных слоев и объединяющий слой, nHi количество скрытых единиц на один конволюционный слой, размер фильтра (fwi, fhi), вероятность рекомбинации Cpi и коэффициент мутационной вариации Fi. После этого нейронные сети обучаются и фиксируются их точность, а также потери на валидационном наборе данных. Потери каждой сети будут представлять собой значение пригодности решения-кандидата.
3.1. Мутация: для каждой особи выполняется мутация с использованием коэффициента вариации Fi.
3.2. Рекомбинация: для каждой пары особей выполняется рекомбинация с использованием Cpi.
3.3. Отбор: выбор особей, которые войдут в следующее поколение, на основе их потерь при валидации.
- Повтор: процесс повторяется до тех пор, пока не будет достигнут критерий остановки, в соответствии с функцией приспособленности особей, которая представляет собой минимальную ошибку классификации.
- Выход: наилучшее решение-кандидат, которое будет представлять оптимальную топологию сети.
Эксперимент
Для выполнения эксперимента необходимо выполнить следующие шаги.
- Набор данных. Используем набор данных, состоящий из рентгеновских снимков грудного отдела человека, на которых присутствуют опухоли. Для каждого изображения у нас есть маска, указывающая области с опухолью.
- Модель базовой архитектуры. Начнем с базовой архитектуры сверточной нейронной сети для сегментации, например, U-Net. Эта модель будет иметь предварительно определенную топологию, которую мы будем оптимизировать с использованием предложенного алгоритма.
- Экспериментальная группа. Создадим экспериментальную группу, в которой будем использовать предложенный алгоритм на основе дифференциальной эволюции для оптимизации топологии нейронной сети.
- Контрольная группа. В качестве контрольной группы мы используем ту же базовую архитектуру сверточной нейронной сети, но без оптимизации топологии.
- Метрики. Будем измерять следующие метрики для оценки производительности моделей:
- метрика IoU (Intersection over Union) позволяет измерить перекрытие между предсказанными и истинными масками опухолей;
- среднее гармоническое точности и полноты F1-мера, используемое для оценки качества бинарной сегментации;
- точность и полнота – дополнительные метрики, позволяющие оценить качество сегментации.
- Процесс эксперимента:
- обучение моделей на обучающем наборе данных с использованием заданных архитектур;
- оценка производительности моделей на тестовом наборе данных с помощью выбранных метрик;
- сравнение результатов экспериментальной и контрольной групп.
- Статистический анализ. Проведение статистического анализа для определения статистической значимости различий в производительности между экспериментальной и контрольной группами.
- Выводы. Сделать выводы о том, насколько предложенный алгоритм улучшает производительность модели по сравнению с базовой архитектурой без оптимизации топологии.
После обучения и оценки производительности моделей на тестовом наборе данных мы получили следующие результаты:
- Метрики производительности базовой модели и модели с оптимизированной топологией:
- базовая модель U-Net (контрольная группа):
- IoU – 0,78;
- F1-мера – 0,82;
- точность – 0,85;
- полнота – 0,79;
- модель с оптимизированной топологией (экспериментальная группа):
- IoU – 0,85;
- F1-мера – 0,88;
- точность – 0,90;
- полнота – 0,86.
- Проведенный статистический анализ показал, что модель с оптимизированной топологией значимо превосходит базовую модель U-Net без оптимизации по всем измеренным метрикам производительности (p < 0,05).
- Выводы:
- оптимизация топологии сверточной нейронной сети с использованием предложенного алгоритма позволила значительно улучшить производительность модели в задаче сегментации опухолей на рентгеновских снимках грудного отдела человека;
- увеличение значений метрик IoU, F1-меры, точности и полноты свидетельствует о более точной и полной сегментации опухолей моделью с оптимизированной топологией;
- результаты подтверждают эффективность предложенного алгоритма дифференциальной эволюции для оптимизации топологии нейросетевой модели в задаче медицинской сегментации изображений.
Достоинством и преимуществом предложенного алгоритма поиска наиболее оптимальной топологии сверточной нейронной сети для сегментации объектов на цифровых снимках, является то, что АДЭ использует стратегию глобального поиска на основе популяции. Сложность операции мутации дифференциала снижается за счет использования конкуренции «один на один». Адаптируя решения-кандидаты, АДЭ параллельно исследует различные решения. Это позволяет динамически отслеживать текущий поиск благодаря объему памяти, что делает возможным корректировку стратегии поиска, вследствие чего достигается глобальная сходимость и устойчивость.
Заключение
В последнее время сверточные нейронные сети продемонстрировали многообещающие достижения в различных задачах компьютерного зрения. Однако разработка архитектуры и выбор наиболее оптимальной топологии сети для решения задач сегментации цифровых изображений является нетривиальной задачей, требующей глубоких экспертных знаний, существенных вычислительных мощностей и значительного объема данных. Для решения обозначенной задачи в статье предложен усовершенствованный способ определения топологии сверточной нейронной сети для сегментации цифровых изображений с помощью АДЭ. Выбор АДЭ обусловлен тем, он представляет собой подход нахождения лучшего решения на основе популяции и является мощным, а также универсальным эволюционным алгоритмом, широко используемым для решения задач оптимизации, особенно в непрерывных областях.
В рамках предложенного алгоритма был выделен этап кодирования для представления структуры каждой сети с помощью целочисленного массива фиксированной длины, после чего предложено использовать процессы дифференциальной эволюции (мутация, рекомбинация и отбор) для эффективного исследования пространства поиска.
Перспективы дальнейших исследований включают в себя разработку способов и приемов закодировать решение-кандидат, используя разное количество скрытых блоков в каждой свертке.
About the authors
Alexander А. Kulikov
MIREA – Russian Technological University; Financial University under the Government of the Russian Federation
Author for correspondence.
Email: tibult41@gmail.com
ORCID iD: 0000-0002-8443-3684
SPIN-code: 6421-0999
Scopus Author ID: 1095062
Cand. Sci. (Eng.), associate professor, associate professor, Department of Data Analysis and Machine Learning
Russian Federation, Moscow; MoscowReferences
- Tsygulev K.S. Application of convolutional neural networks for object segmentation in images. Scientific, Technical and Economic Cooperation of Asia-Pacific Countries in the 21st Century. 2021. No. 2. Pp. 308–312. (In Rus.)
- Bratukhin D. Segmentation of flames in an image using a convolutional neural network U-NET. Norwegian Journal of Development of the International Science. 2021. No. 64. Pp. 31–33. (In Rus.)
- Godunov A.I., Balanyan S.T., Egorov P.S. Image segmentation and object recognition based on convolutional neural network technology. Reliability and Quality of Complex Systems. 2021. No. 3 (35). Pp. 62–73. (In Rus.)
- Lutsenko V.S., Shukhman A.E. Medical image segmentation using convolutional neural networks. Bulletin of Computer and Information Technologies. 2022. No. 6 (216). Pp. 40–50. (In Rus.)
- Binjun He Wenbin Hu. Image segmentation algorithm of lung cancer based on neural network model. Expert Systems. 2021. No. 39. Pp. 145–152.
- Srinitya G., Sharmila D. Certain investigations on image segmentation algorithms on synthetic aperture radar images and classification using convolution neural network. Concurrency and Computation: Practice and Experience. 2021. No. 34. Pp. 73–79.
- Kai Su, Xin Zhang. Convolutional neural network based image segmentation algorithm for dual-layer LCDs. SID Symposium Digest of Technical Papers. 2022. No. 53. Pp. 110–119.
- Berezovsky I.I. A review of convolutional neural networks for medical image segmentation. Scientist’s Tribune. 2022. No. 6. Pp. 59–67. (In Rus.)
- Lozhkin I.A. Augmentation of image sets for training neural networks when solving semantic segmentation problems. International Journal of Open Information Technologies. 2023. No. 1. Pp. 109–117. (In Rus.)
- Xiao Qing Zhang, Guang Yu Wang. COVSeg-NET: A deep convolution neural network for COVID-19 lung CT image segmentation. International Journal of Imaging Systems and Technology. 2021. No. 31. Pp. 38–46.
- Aarthi Sundaram, Chitrakala Sakthivel. Object detection and estimation: A hybrid image segmentation technique using convolutional neural network model. Concurrency and Computation: Practice and Experience. 2022. No. 34. Pp. 65–73.
- Yuma Hakumura, Taiyo Ito. Loss function for ambiguous boundaries for deep neural network (DNN) for image segmentation. Electronics and Communications in Japan. 2023. No. 4. Pp. 149–153.
- Mikhailov A.A. Automatic data labeling for document image segmentation using deep neural networks. Proceedings of the Institute of System Programming of the Russian Academy of Sciences. 2022. No. 6. Pp. 137–146. (In Rus.)
- Kataev M.Yu., Kartashov E.Yu., Ryabukhin V.V. et al. A technique for segmenting images of unmanned aerial vehicles using neural networks. Modern Problems of Remote Sensing of the Earth from Space. 2023. No. 1. Pp. 55–66. (In Rus.)
- Jie Yang, Yong Chen. Convolutional neural network based on the fusion of image classification and segmentation module for weed detection in alfalfa. Pest Management Science. 2024. No. 56. Pp. 91–99.
- Tayebeh Lotfi Mahyari, Richard M. Dansereau multi-layer random walker image segmentation for overlapped cervical cells using probabilistic deep learning methods. IET Image Processing. 2022. No. 16. Pp. 205–211.
- Chernenky I.M. Segmentation of renal structures from contrast-enhanced computed tomography images using convolutional neural network. Sechenovsky Bulletin. 2023. No. 1. Pp. 39–49. (In Rus.)
- Ginni Arora, Ashwani Kumar. Dubey Architecture of an effective convolutional deep neural network for segmentation of skin lesions in dermoscopic images. Expert Systems. 2021. No. 40. Pp. 69–94. (In Rus.)
- Andrianova A.I., Pereverzeva V.I., Shananin V.A. Application of semantic neural networks in image processing. Innovation and Investment. 2022. No. 11. Pp. 224–227. (In Rus.)
- Michael Osadebey, Marius Pedersen. Enhancement of clustering techniques by coupling clustering tree and neural network: Application to brain tumour segmentation. Expert Systems. 2022. No. 40. Pp. 72–78.
Supplementary files

