Algorithm for identifying abnormal actions

Cover Page

Cite item

Full Text

Abstract

The study is devoted to the problem of recognition of human activity recognition and the definition of normal and abnormal behavior (activity) depending on the action scene. Automated detection of abnormal activity using computer vision technologies and rapid response makes it possible to improve the work of rapid response services, thereby saving human lives or stopping offenses. The paper presents a comprehensive review of methods for recognizing human activity and detecting abnormal human activity based on deep learning. Various classifications of abnormal activity are investigated, and then deep learning methods and neural network architectures used to detect abnormal activity are discussed and analyzed. Based on the comparative analysis of various approaches, an algorithm for recognizing human activity has been proposed and a neural network has been developed that determines violent and nonviolent actions with an accuracy of 92,22% in 150 epochs.

Full Text

Введение

Реакции человека на стимулы, исходящие изнутри или из окружающего мира, характеризуют его поведение. Внешние раздражители могут исходить из социального взаимодействия, тогда как внутренние связаны с мыслями, воспоминаниями, восприятиями или личными убеждениями. Под поведением понимаются такие действия, которые не ожидаются в определенной ситуации. В области компьютерного зрения под аномальным действием понимают данные, отклоняющиеся от нормы, которые могут проявляться как нестандартные, необычные, редкие, ошибочные, поврежденные, обманные, враждебные, искусственные или просто странные действия [10]. Обнаружение аномальных действий используется во многих областях видеонаблюдения для обнаружения действий, таких как бег, лазание, падение, драки и грабежи [4]; насилие, вандализм [5]; неосторожное вождение [25]; также обнаружение используется в специфических обстоятельствах и локациях, например, где присутствует столпотворение народу [18] и в лифтах [12].

Как было отмечено ранее, аномальным действием называют ситуацию, которая выходит за рамки обыденности в конкретный момент и в конкретном месте. Например, для анализа ситуации берется рыночная площадь: ежедневная суета здесь в порядке вещей, но та же самая сцена во время комендантского часа уже выглядит необычно. В качестве другого примера берется марафон: скопление людей на его протяжении не вызывает удивления, в отличие от столпотворения у здания. Таким образом, понятие аномальных действий подвержено изменениям, и восприятие нормы и отклонений от нее может со временем искажаться. Более того, такие факторы, как многообразие ситуаций, помехи на видео, редкая вероятность ненормальных событий, а также ограниченное проявление и дефицит размеченных данных по аномальным действиям, делают задачу распознавания аномальных действий сложной проблемой для искусственного интеллекта. Научная значимость данной статьи состоит в исследовании современных подходов по распознаванию человеческой деятельности и в их сравнительном анализе. Практическая значимость данной статьи состоит в разработке алгоритма обнаружения сцен насилия и ненасилия.

Данная статья имеет следующую структуру:

  • обзор наиболее значимых работ, посвященных глубокому обучению применительно к проблеме обнаружения аномальных действий;
  • классификация существующих методов в обнаружении аномальных действий путем группировки подходов в соответствии с конкретными методами глубокого обучения и архитектурными моделями для обнаружения аномальных действий;
  • сравнительный анализ существующих подходов для распознавания человеческой деятельности;
  • разработка и тестирование алгоритма выявления аномальных действий в облачном инструментарии Kaggle;
  • анализ полученных результатов.

1. Классификация обнаружения аномальных действий

1.1. Обнаружение на основе изображений и видео

Системы распознавания аномальных действий можно разделить на две основные группы: одни работают с отдельными снимками (анализ на уровне изображений), другие анализируют серии кадров (анализ на уровне видео) [6].

Первая группа систем фокусируется на обработке статических кадров для выявления визуальных особенностей и определения действий объекта, таких как падение или взаимодействие с оружием. Однако такие системы часто сталкиваются с проблемами неверных выводов из-за невозможности учитывать динамику действий. Отсутствие данных о последовательности движений затрудняет точное распознавание намерений. Вторая группа систем анализирует цепочку кадров, что позволяет уловить и пространственные, и временные аспекты сцены, обеспечивая более точное определение таких действий, как агрессия, кража или физические столкновения. Благодаря своей высокой эффективности и адаптивности, вторая группа систем получила широкое распространение и активно используется в системах видеонаблюдения для изучения человеческого поведения.

1.2. Индивидуально-аномальные и коллективно-аномальные действия

Аномальные действия в сценариях можно классифицировать как индивидуально-аномальные и коллективно-аномальные действия. В первом случае [19] аномальное действие связано с действиями одного объекта, что также называется объектно-ориентированным аномальным действием (когда данные одной точки резко отличаются от остальных, примером чему может служить бездействие). В случае с коллективно-аномальными действиями [20] речь идет об нестандартном поведении групп, таких как массовые драки или дорожно-транспортные происшествия. Сравнение индивидуально-аномальных и коллективно-аномальных действий показывает, что последние представляют большую сложность и требуют больше времени для их выявления и точного определения.

2. Методы глубокого обучения для обнаружения аномальных действий

Особенности входных данных является основным фактором, определяющим, какая глубокая нейронная сеть используется в задаче обнаружения аномальных действий. Методы глубокого обучения, используемые для обнаружения аномальных действий, могут быть классифицированы по следующим категориям, описанным в статье далее.

2.1. Обнаружение аномальных действий на основе обучения с учителем для потоковой передачи видео

В методе на основе обучения с учителем применяются размеченные данные для тренировки модели. Обучение с учителем в нейросетях инициируется с исходных настроек, после чего параметры модели последовательно корректируются с помощью алгоритма обратного распространения ошибки, что позволяет достичь более точного прогнозирования желаемых исходов [24]. Пример архитектуры обнаружения на основе обучения с учителем для потоковой передачи видео представлен на рис. 1.

В широком смысле такая модель классификации состоит из сетей извлечения признаков и классификационных сетей. В приложениях для выявления необычных ситуаций, которые базируются на методе обучения с примерами, применяются два вида обучаемых систем: одноклассовые и многоклассовые. Первый тип, одноклассовый, работает с данными, в которых четко разграничены обычные и необычные случаи. Второй же тип, многоклассовый, в процессе обучения использует размеченные данные, включающие в себя как стандартные, так и различные виды аномальных действий. Существует множество реализаций метода обучения с учителем, которое используется для обнаружения аномальных действий, например, сверточные нейронные сети и рекуррентные нейронные сети. Известными архитектурами сверточных нейронных сетей являются VGG, ResNet, MobileNet, EfficientNet и пр., известными моделями рекуррентных нейронных сетей являются долгая краткосрочная память (LSTM) и управляемые рекуррентные блоки (GRU). Основное достоинство данного метода заключается в возможности эффективно собирать информацию и делать обоснованные выводы, опираясь на уже имеющиеся знания. Более того, метод обучения с учителем отличается простотой и обеспечивают более высокую эффективность в сравнении с другими методами машинного обучения. Однако среди недостатков стоит выделить риск получения необоснованно строгих критериев для принятия решений, что может произойти, если в учебном наборе данных не хватает примеров из определенного класса. Также стоит отметить, что данный метод требует точного определения для разнообразных нормальных и аномальных действий, доступ к которым зачастую ограничен.

2.2. Обнаружение аномальных действий на основе обучения с частичным привлечением учителя для потоковой передачи видео

В методе с частичным привлечением учителя в процессе обучения используются наборы данных со слабо размеченными экземплярами, где предполагается, что все обучающие экземпляры имеют одну метку класса. Данный метод создает различительную границу вокруг обычных экземпляров. Таким образом, тестовые экземпляры помечаются как аномальные, если они не принадлежат к классу большинства. На рис. 2 представлен пример обнаружения аномальных действий на основе обучения с частичным привлечением учителя для потоковой передачи видео.

 

Рис. 1. Обучение с учителем [24]

Fig. 1. Supervised learning [24]

 

Рис. 2. Обучение с частичным привлечением учителем на примере GAN

Fig. 2. Semi-supervised learning on GAN example

 

Генеративно-состязательные сети, алгоритмы долгой краткосрочной памяти и закрытых рекуррентных блоков используются для обучения с частичным привлечением учителя в моделях обнаружения аномальных действий. Одним из преимуществ этого метода является то, что он требует наименьшего объема размеченных данных. С другой стороны, ключевым минусом данного метода является его склонность к переобучению, а также риск того, что неактуальные входные параметры, выявленные в процессе обучения, могут стать причиной ошибок в классификации [19].

2.3. Обнаружение аномальных действий на основе обучения без учителя для потоковой передачи видео

Данный метод позволяет осуществлять обнаружение аномальных действий без использования размеченного набора данных. Он анализирует особенности данных, включая параметры вроде расстояния или плотности для того, чтобы отличать стандартные и аномальные данные, упрощая тем самым выявление аномальных действий через определение общих особенностей в наборе данных. Технологии глубокого обучения такие как автоэнкодеры, ограниченные Больцмановские машины (RBMs), глубокие сети доверия (DBNs), глубокие сверточные сети, а также алгоритмы рекуррентных блоков и долгой краткосрочной памяти использовались для разработки моделей, основанных на обучении без учителя в приложениях обнаружения аномальных действий. Эффективность обнаружения аномальных действий без учителя обусловлена возможностью использования обширных массивов видеоинформации и мощных вычислительных ресурсов. Преимущество такого метода заключается в его экономичности для выявления необычных явлений, ведь алгоритмам не требуется обучение на основе размеченных данных [4]. На рис. 3 представлен пример обнаружения аномальных действий на основе обучения без учителя для потоковой передачи видео.

 

Рис. 3. Обучение без учителя [4]

Fig. 3. Unsupervised learning [4]

 

2.4. Обнаружение аномальных действий на основе трансферного обучения для потоковой передачи видео

Суть трансферного обучения заключается в переносе знаний, приобретенных в процессе решения одной задачи, для усовершенствования подхода к аналогичной задаче. Для достижения этого используются веса и параметры, полученные в результате работы над первой задачей, которые служат базой для начала работы над следующей задачей. На рис. 4 представлен пример трансферного обучения.

Применение такого метода может значительно уменьшить объем необходимых данных для обучения и вычислительных мощностей для достижения высокого уровня производительности [3]. С другой стороны, использование трансферного обучения может быть небезопасным – переобученная нейронная сеть может быть вредоносной (BadNets) [8].

2.5. Обнаружение аномальных действий на основе глубокого активного обучения для потоковой передачи видео

Глубокое активное обучение изучает массивы данных и исходит из предположения, что вклад каждого отдельного элемента в обновление модели может варьироваться в рамках одного набора данных. Примеры, набравшие наибольшее количество баллов, имеют приоритет для включения в обучающий набор. Это делается для повышения производительности модели, уменьшения количества ложных срабатываний. Глубокое активное обучение уменьшает неоднозначность аномальных действий в системе обнаружения аномальных действий путем введения подходящих предварительных данных с помощью эксперта в предметной области. Более того, при требовании минимального количества меток для увеличения производительности модели обучение также решает проблемы несбалансированного набора данных, когда структуры данных постоянно меняются [21]. На рис. 5 представлен метод обнаружения аномальных действий на основе глубокого активного обучения для потоковой передачи видео.

 

Рис. 4. Трансферное обучение на примере распознавания аномальных действий [3]

Fig. 4. Transfer learning on example of anomaly detection действий [3]

 

Рис. 5. Глубокое активное обучение [21]:

re – внешнее вознаграждение; ri – внутреннее вознаграждение; s – наблюдение; a – действие

Fig. 5. Deep active learning [21]:

re – external reward; ri – intrinsic reward; s – observation; a – action

 

2.6. Обнаружение аномальных действий на основе глубокого обучения с подкреплением

Метод, основанный на глубоком обучении с подкреплением, активно отслеживает новые классы аномальных действий, которые попадают за рамки размеченных обучающих данных. На рис. 6 представлен метод обнаружения аномальных действий на основе глубокого обучения с подкреплением.

Основной принцип использования глубокого обучения с подкреплением заключается в возможности агента учиться на основе взаимодействия с окружающей средой и получения вознаграждения за успешные действия. Этот принцип навеян способностью человека учиться, исходя из собственного опыта. Глубокое обучение с подкреплением используется для решения более сложных проблем, которые предполагают работу с многоаспектными данными, редкими сигналами об успехе и неопределенностями, возникающими в процессе наблюдений агента. В частности, метод обнаружения аномальных действий, основанный на глубоком обучении с подкреплением, использует размеченные данные об аномальных действиях для повышения точности обнаружения, не ограничивая набор искомых аномальных действий теми, которые представлены в качестве примеров. Данный метод осуществляет свои цели через активное взаимодействие с окружением, которое формируется на основе данных для обучения [1].

2.7. Обнаружение аномальных действий на основе глубоких гибридных моделей для видео

Гибридные модели сочетают в себе различные методы для повышения эффективности выявления необычных событий в потоках видеотрансляции. Эти модели также хорошо работают с входными данными больших размеров, такими как видеоданные. Глубокие гибридные модели в основном используют глубокие нейронные сети в качестве процесса извлечения признаков и традиционные алгоритмы машинного обучения для обнаружения аномальных действий. На рис. 7 представлен пример обнаружения аномальных действий на основе глубоких гибридных моделей для видео.

 

Рис. 6. Глубокое обучение с подкреплением [1]

Fig. 6. Deep reinforcement learning [1]

 

Рис. 7. Пример обнаружения аномальных действий на основе глубоких гибридных моделей [3] (на нижних снимках – аномальное поведение толпы)

Fig. 7. Example of deep hybrid models-based on anomaly detection [3] (below – abnormal crowd activity)

 

Например, в работе [3] предложен гибридный метод обнаружения аномальных действий в видео на основе сверточных нейронных сетей и метода опорных векторов. Сверточная нейронная сеть используется для извлечения описательных признаков. Затем вектор признаков передается в двоичный опорный вектор для построения модели обнаружения аномальных событий. В работе [29] использовались методы 3D-ConvNet и автоэнкодеры. 3D-ConvNet используется для автоматического изучения представления видео и извлечения объектов как из пространственных, так и из временных измерений, а автоэнкодеры используются для прогнозирования будущих кадров. Затем на основе ошибки реконструкции вычисляется оценка аномального действия.

3. Архитектуры глубокого обучения для обнаружения аномальных действий

Многообразие структур нейронных сетей определяется их многослойностью, шириной, глубиной, разнообразием связей и спецификой нейронов. Разработано множество архитектур для обнаружения аномальных действий. В контексте анализа видео глубокие нейронные сети должны оперировать не только пространственными данными, как это происходит в системах, ориентированных на обработку изображений. Отсутствие анализа временной последовательности делает невозможным различить, например, процесс открытия и закрытия двери, поскольку они визуально похожи. Эффективность распознавания действий в видео существенно возрастает, когда в расчет принимается информация о временных изменениях.

3.1. Двухпоточная сверточная архитектура (двухпоточные сверточные нейронные сети)

В работе [22] предложена двухпоточная сверточная нейронная сеть захвата пространственной и временной информации. Эта модель состоит из двух сетей (как показано на рис. 8) для захвата пространственной и временной информации видео. Одна сеть принимает на вход однокадровое изображение, а затем получает информацию о пространственно-временной области путем извлечения скрытых в изображении признаков, в то время как на вход другой сети в видео представлен один кадр и последовательно следующие за ним n-кадровые изображения. Этот фрагмент видео отвечает за анализ оптического потока, используя метод сложения последовательных кадров для выявления временных особенностей. В итоге результаты деятельности обеих сетей накапливаются, что дает возможность сформировать конечную классификацию.

 

Рис. 8. Архитектура двухпоточной сети [22]

Fig. 8. Two-stream network architecture [22]

 

3.2. Архитектура 3D-свертки (3D-ConvNet)

В 2015 г. в работе [25] предложен метод для извлечения пространственно-временных признаков с использованием глубоких трехмерных сверточных сетей (3D-ConvNet), обученных на крупномасштабном наборе контролируемых видеоданных. Кроме того, они продемонстрировали, что производительность функций 3D-ConvNet превосходит производительность функций 2D-ConvNet в широком спектре задач видеоанализа.

Используя технологии трехмерной свертки и пулинга, 3D-ConvNet анализирует одновременно пространственные и временные характеристики для выявления объектов в видео. В методах выявления аномальных действий с применением 3D-ConvNet традиционное сверточное ядро преобразуется в трехмерное, что позволяет обрабатывать временные данные. Так, 3D-свертка объединяет несколько последовательных кадров в один объемный блок, после чего применяет трехмерное сверточное ядро для анализа полученного объема.

 

Рис. 9. Операция 3D-свертки для обнаружения аномальных действий [16]

Fig. 9. 3D-convolution operation for anomaly detection [16]

 

Главное преимущество архитектуры 3D-ConvNet – ее высокая скорость обработки данных, что делает ее популярным выбором среди исследователей в сфере обнаружения аномальных действий [16]. На риc. 9 показаны операции 3D-свертки.

3.3. Архитектура ConvLSTM

ConvLSTM – это сверточная нейронная сеть, объединенная с LSTM-сетью. Она похожа на LSTM, но сверточные операции выполняются во время переходов между слоями [27]. ConvLSTM работает с данными, зависящими от времени, например, видео.

Сеть обладает способностью выявлять зависимости в данных, как во времени, так и в пространстве. ConvLSTM предсказывает будущее состояние определенного участка сети, анализируя текущую информацию в сочетании с предыдущими данными его ближайших точек. Интеграция свойств CNN и LSTM дает возможность выявления аномальных действий в различных аспектах, в том числе пространственном и временном, а также в других значимых для задачи параметрах. При анализе данных сразу по нескольким направлениям можно выявить аномальные образования в контексте, которые в отдельности по каждому измерению могут не проецировать признаков аномальных действий. В данном исследовании была использована сверточная нейронная сеть для изучения пространственных характеристик входного изображения. После изучения данные передавались в LSTM для определения характеристик во временной области, и затем принималось решение о том, демонстрирует ли каждый отдельный кадр аномальное действие.

На рис. 10 представлена архитектура ConvLSTM. Архитектура представленной модели ConvLSTM включает в себя два слоя Conv2D и один слой ConvLSTM. Каждый из двух Conv2D-слоев обладает равным количеством размера ядра и числа фильтров. Входными данными для первого Conv2D-слоя служат изображения размером 50 × 50 × 3 (высота, ширина, количество каналов). Conv2D-слои оборудованы 16 фильтрами с ядром размером 3 × 3, при этом первый Conv2D-слой интегрирован в временной слой. Следующим этапом является ConvLSTM-слой, оснащенный 64 фильтрами и ядром размера 3 × 3. В структуру модели также входят слои Dropout, Flatten и Dense. В завершение сети расположены еще два Dropout-слоя и два Dense-слоя, где оба Dropout-слоя имеют значение 0,5.

 

Рис. 10. Архитектура ConvLSTM [27]

Fig. 10. ConvLSTM architecture [27]

 

3.4. Использование данных о ключевых точках человеческого тела

Текущие методы по выявлению аномальных действий сталкиваются с проблемами, связанными с идентификацией паттернов в сложных ситуациях, включая перемены в окружающей среде, освещении, одежде прохожих и ограниченные данные о масштабах объектов. Эти факторы оказывают отрицательное воздействие на функционирование систем, предназначенных для мониторинга поведения. Информация о строении человеческого скелета представляет собой высокий уровень абстрагирования от тела и обладает способностью эффективно противостоять различным помехам [15]. В частности, методы, которые фокусируются на ключевых точках человеческого тела, применяются для выявления необычных событий в видеозаписях, благодаря их способности успешно отфильтровывать ненужные элементы заднего плана и выявлять основные точки даже в переполненных сценах [17]. Для обнаружения и распознавания действий было предложено множество библиотек, основанных на человеческом скелете, таких как OpenPose, Mediapipe и AlphaPose. В исследовании [14] использовалась библиотека OpenPose для извлечения и распознавания человеческого тела, чтобы обеспечить хорошую основу для обнаружения действий на видео.

Библиотека OpenPose представляет собой первую технологию для мгновенного распознавания ключевых местоположений на теле человека, включая ноги, руки и лицо. Этот инновационный алгоритм был интегрирован в известную библиотеку компьютерного зрения OpenCV. Рис. 11 демонстрирует схему работы алгоритма распознавания человеческой деятельности при использовании библиотеки OpenPose.

 

Рис. 11. Схема работы алгоритма с помощью OpenPose [14]

Fig. 11. The scheme of the algorithm using OpenPose [14]

 

Библиотеки Mediapipe и Alphapose были использованы в работе [2], соответственно, для извлечения и обнаружения ключевых точек на теле человека. MediaPipe –– это сквозной кроссплатформенный скелетный программный инструмент, работающий в режиме реального времени [28]. MediaPipe работает путем преобразования обнаружения 2D-изображений из обычных просмотров с камеры в 3D-изображения.

Возможности MediaPipe включают:

  1. Точное распознавание и отслеживание за человеческой позой, позволяющее идентифицировать более 25 ключевых точек движения верхней части тела в двумерном пространстве через обычные RGB-камеры.
  2. Трехмерное моделирование лица с использованием 468 точек, способное работать сразу с несколькими лицами.
  3. Трехмерное отслеживание движений руки, включая 21 точку, с возможностью одновременного распознавания движений нескольких рук благодаря передовой технологии распознавания ладони и точек руки.
  4. Интегрированное отслеживание, которое обеспечивает синхронизацию отслеживания 33 поз тела, 21 позы каждой руки и 468 точек на лице.
  5. Сегментация и гиперреалистичное изменение цвета волос в реальном времени.
  6. Выявление и отслеживание за объектами в кадре.
  7. Распознавание лиц с определением 6 ключевых точек и возможностью работы с несколькими лицами одновременно.
  8. Отслеживание за радужкой глаза и оценка глубины сцены, обеспечивающее точное определение положения радужки, зрачка и контура глаза без использования специализированного оборудования.
  9. Обнаружение трехмерных объектов и определение их позиции в пространстве, например, мебели вроде шкафов и комодов.

На рис. 12–14 представлена работа MediaPipe.

Особенность человеческого скелета может быть хорошим способом распознать человеческое поведение.

4. Сравнительный анализ методов обнаружения человеческой деятельности

На рис. 15 представлены виды аномалий, которые анализировались различными способами. Аномальные действия брались из набора данных UCF-Crime Dataset [23].

В табл. 1 изображены показатели точности обнаружения аномальных действий у 5 существующих методов глубокого обучения.

 

Рис. 12. Исходное изображение

Fig. 12. Original image

 

Рис. 13. Выходное изображение с метками

Fig. 13. Output image with labels

 

Рис. 14. Скелет, полученный из изображения в трехмерном пространстве

Fig. 14. A skeleton obtained from an image in 3D space

 

Таблица 1. Методы глубокого обучения, применяемые для обнаружения аномальных действий в видео [Deep learning methods applied to anomaly detection for video]

Тип метода

[Type of method]

Архитектура

[Architecture]

Точность, %

[Accuracy, %]

Комбинация методов сверточной нейронной сети и рекуррентной нейронной сети

[A combination of CNN & RNN methods]

Сверточная долгая краткосрочная память [ConvLSTM]

93,75

Комбинация методов сверточной нейронной сети и генеративно-состязательной сети

[A combination of CNN & GAN methods]

3D-свертка [3D-ConVNet]

88,26

Сверточная нейронная сеть [CNN]

3D-свертка [3D-ConVNet]

91,75

Комбинация методов управляемых рекуррентных блоков и сети прямого распространения [A combination of GRU & FFN methods]

Комбинация архитектур человеческого скелета, управляемых рекуррентных блоков и сети прямого распространения [A combination of human skeleton & GRU-FFN architectures]

91,71

Рекуррентная нейронная сеть [RNN]

Комбинация архитектур долгой краткосрочной памяти и управляемых рекуррентных блоков [A combination of LSTM & GRU architectures]

84,16

Комбинация методов сверточной нейронной сети и долгой краткосрочной памяти

[A combination of CNN & LSTM methods]

Комбинация архитектур человеческого скелета и сверточной долгой краткосрочной памяти [A combination of human skeleton & ConvLSTM architectures]

73,19

 

Рис. 15. Примеры различных аномалий

Fig. 15. Examples of different anomalies

 

Как видно по результатам, полученными при тестировании в облачном инструментарии Kaggle, наилучший показатель у комбинации методов CNN и RNN, точность после обучения составила 93,75%. Наихудший результат показала комбинация метода CNN с LSTM, точность составила 73,1%.

Для создания модели по распознаванию человеческой деятельности необходимо использовать трансферное обучение. В качестве модели для трансферного обучения взята нейросеть Resnet50v2 [9].

5. Тестирование модели по распознаванию человеческой деятельности

На рис. 16 представлена архитектура Resnet50v2 для нейросетевой системы, распознающей аномальные действия.

На рис. 17 продемонстрирована схема работы алгоритма по распознаванию человеческой деятельности на основе нейросети Resnet50v2.

Работа данного алгоритма заключается в следующем. Для работы алгоритма используется набор данных Real Life Violence Situations Dataset [7] для определения сцен насилия. Далее дается пример воспроизведения видео для выявления случаев насилия, после происходит разделение видео на кадры для анализа, затем создается набор данных о насилии и ненасилии с использованием 200 изображений, далее изменяется форма изображения и используется стратифицированное разделение в случайном порядке, далее идет настройка обучения модели в течение 150 эпох и использованием нейросети ResNet50v2, весов imagenet и оптимизатора adam. Предусмотрена преждевременная остановка обучения, если точность больше или равна 99%. Данные сбалансированы. После настройки используется функция обратного вызова для сохранения весов. Далее происходит обучение модели и применение модели для распознавания аномальных действий. После демонстрации работы идет построение результатов о потерях и точности при обучении в сценах насилия и ненасилия.

Тестирование модели проводится в облачном инструментарии Kaggle, конфигурация оборудования следующая:

  • двухъядерный процессор Intel Xeon с частотой 2 ГГц;
  • 13 Гб оперативной памяти;
  • 2 видеокарты Nvidia Tesla T-4 с 16 Гбайтами видеопамяти в сумме с версией драйверов 550.90.07 с час-тотой 1,32 ГГц;
  • жесткий диск на 73 Гб.

В табл. 2 представлены данные о параметрах обучения. Всего параметров – 23 566 849, параметров для обучения 23 564 800, а необучаемых параметров – 2049.

В табл. 3 показаны результаты метрик после обучения, где указаны параметры потерь, точности, потерь и точности валидации.

По результатам, приведенным в табл. 3, точность классификации на обучающем наборе данных составляет 92,22%. В табл. 4 продемонстрированы итоговые показатели точности и потерь при обучении и точность и потерь при тестировании.

 

Рис. 16. Архитектура Resnet50v2 [9]

Fig. 16. Resnet50v2 architecture [9]

 

Рис. 17. Алгоритм распознавания аномальных действий

Fig. 17. The algorithm for anomaly detection

 

Итоговая точность при обучении на тестовом наборе данных составила 91,7%, а точность при тестировании – 88,98%. На рис. 18 показаны графические результаты потерь обучения и валидации и точность обучения и валидации.

На рис. 19 продемонстрирована матрица ошибок. Из данных матрицы видно, что модель правильно предсказала 2089 действий, а неправильно – 253.

На рис. 21 и 22 показан пример обнаружения насилия и ненасилия, используя предложенный алгоритм.

 

Таблица 2. Параметры обучения [Training parameters]

Параметры

[Parameters]

Значение

[Value]

Всего параметров [Total parameters]

23 566 849

Обучаемые параметры [Trainable parameters]

23 564 800

Необучаемые параметры [Non-trainable parameters]

2049

 

Таблица 3. Результаты обучения модели [Results of model training]

Результаты

[Results]

Значение

[Value]

Потеря [Loss]

0,2106

Точность [Accuracy]

0,9222

Потеря валидации [Val_loss]

0,2560

Точность валидации [Val_accuracy]

0,8898

 

Таблица 4. Результаты обучения модели [The final indicators of accuracy and loss]

Результаты

[Results]

Значение

[Value]

Точность при обучении [Accuracy on train]

0,91706335544586180

Точность при тестировании [Accuracy on test]

0,88983774185180660

Потери при обучении [Loss on train]

0,22201022505760193

Потери при тестировании [Loss on test]

0,25603705644607544

 

Рис. 18. Графики потерь и точности на обучающей и валидационной выборке

Fig. 18. Loss and accuracy graphs on the training and validation sample

 

Рис. 19. Матрица ошибок

Fig. 19. Confusion matrix

 

На рис. 20 показан отчет о классификации обученной модели.

 

 

precision

recall

fl-score

support

NonViolence

0,87

0,90

0,89

1091

Violence

0,91

0,88

0,90

1251

accuracy

  

0,89

2342

macro avg

0,89

0,89

0,89

2342

weighted avg

0,89

0,89

0,89

2342

 

Рис. 20. Отчет о классификации

Fig. 20. Classification report

 

Рис. 21. Обнаружение насильственных действий

Fig. 21. Detection of violent acts

 

6. Заключение

В данной статье проведено исследование различных подходов к обнаружению разного рода аномальных действий при распознавании человеческой деятельности на основе:

  • обучения с учителем для потоковой передачи видео;
  • обучения с частичным привлечением учителя для потоковой передачи видео;
  • обучения без учителя для потоковой передачи видео;
  • трансферного обучения для потоковой передачи видео;
  • глубокого активного обучения для потоковой передачи видео;
  • глубокого обучения с подкреплением;
  • глубоких гибридных моделей для видео.

Отмечены их преимущества и недостатки.

Также рассмотрены различные существующие архитектуры нейросетевых систем для обнаружения аномальных действий, таких, как:

  • архитектура двухпоточных сверточных нейронных сетей;
  • архитектура 3D-ConvNet;
  • архитектура ConvLSTM;

Рассмотрен подход на основе использования ключевых точек человеческого тела.

Проведен сравнительный анализ существующих методов распознавания человеческой деятельности на примере 6 методов, где наилучший результат показала комбинация методов CNN и RNN с показателем точности 93,75%.

 

Рис. 22. Обнаружение ненасильственных действий

Fig. 22. Detection of nonviolent acts

 

Для распознавания человеческой деятельности разработан алгоритм, основанный на нейросети Resnet50v2. При тестировании в облачном инструментарии Kaggle с использованием двух графических ускорителей Nvidia Tesla T-4 разработанная модель показала точность в 92,22% с использованием набора данных о 2000 изображениях. Полученный результат превосходит рассмотренные ранее комбинации методов GRU и FFN, CNN и GAN, CNN и LSTM, однако на данный момент уступает комбинации методов CNN и RNN.

×

About the authors

Namir Mohamed Khadi

MIREA – Russian Technological University

Author for correspondence.
Email: hadi@mirea.ru
ORCID iD: 0009-0000-7122-5942
SPIN-code: 4079-2513
ResearcherId: LEM-0157-2024

assistant lecturer, Department of Computer and Information Security

Russian Federation, Moscow

Dmitry G. Andryushenkov

MIREA – Russian Technological University

Email: andryushenkov@mirea.ru
ORCID iD: 0009-0004-5927-9795
SPIN-code: 4113-2967

assistant lecturer, Department of Computer and Information Security

Russian Federation, Moscow

Alexander N. Chesalin

MIREA – Russian Technological University

Email: chesalin@mirea.ru
ORCID iD: 0000-0002-1154-6151
SPIN-code: 4334-5520
Scopus Author ID: 57210931888
ResearcherId: D-8080-2019

Cand. Sci. (Eng.), Head, Department of Computer and Information Security

Russian Federation, Moscow

References

  1. Aberkane S., Elarbi M. Deep reinforcement learning for real-world anomaly detection in surveillance videos. URL: https://sci-hub.ru/10.1109/ispa48434.2019.8966795 (data of accesses: 28.01.2024).
  2. Agahian S., Negin F., Köse С. An efficient human action recognition framework with pose-based spatiotemporal features. URL: https://www.sciencedirect.com/science/article/pii/S2215098618312345?via%3Dihub (data of accesses: 02.02.2024).
  3. Al-Dhamari A., Sudirman R., Mahmood N.H. Transfer deep learning along with binary support vector machine for abnormal behavior detection. URL: https://www.researchgate.net/publication/340145184_Transfer_Deep_Learning_Along_With_Binary_Support_Vector_Machine_for_Abnormal_Behavior_Detection#fullTextFileContent (data of accesses: 24.01.2024).
  4. Amrani H., Micucci D., Paolo N. Unsupervised deep learning-based clustering for human activity recognition. URL: https://www.researchgate.net/publication/365337299_Unsupervised_Deep_Learning-based_clustering_for_Human_Activity_Recognition#fullTextFileContent (data of accesses: 27.01.2024).
  5. Contardo P., Tomassini S., Falcionelli N. et al. Combining a mobile deep neural network and a recurrent layer for violence detection in videos. URL: https://ceur-ws.org/Vol-3402/paper05.pdf (data of accesses: 25.01.2024).
  6. Duong H.-T., Le V.-T., Hoang V. Deep learning-based anomaly detection in video surveillance: A survey. URL: https://typeset.io/papers/deep-learning-based-anomaly-detection-in-video-surveillance-29l7zb9s (data of accesses: 26.01.2024).
  7. Elesawy M., Hussein M., El Massih M.A. Real life violence situations dataset. URL: https://www.kaggle.com/datasets/mohamedmustafa/real-life-violence-situations-dataset (data of accesses: 03.02.2024).
  8. Gu T., Dolan-Gavitt B., Garg S. BadNets: Identifying vulnerabilities in the machine learning model supply chain. URL: https://arxiv.org/abs/1708.06733 (data of accesses: 03.02.2024).
  9. Haq Qazi E.U., Zia T., Almorjan A. Deep learning-based digital image forgery detection system. URL: https://www.researchgate.net/publication/359153551_Deep_Learning-Based_Digital_Image_Forgery_Detection_System (data of accesses: 03.02.2024).
  10. Jayaswal R., Dixit M. Framework for anomaly classification using deep transfer learning approach. URL: https://iieta.org/journals/ria/paper/10.18280/ria.350309 (data of accesses: 24.01.2024).
  11. Jia C., Yi W., Wu Y. et al. Abnormal activity capture from passenger flow of elevator based on unsupervised learning and fine-grained multi-label recognition. URL: https://arxiv.org/abs/2006.15873 (data of accesses: 28.01.2024).
  12. Jia J.-G., Zhou Y.-F., Hao X.-W. et al. Two-stream temporal convolutional networks for skeleton-based human action recognition. URL: https://sci-hub.ru/10.1007/s11390-020-0405-6 (data of accesses: 30.01.2024).
  13. Lathifah N., Lin H.-I. A brief review on behavior recognition based on key points of human skeleton and eye gaze to prevent human error. In: Proceedings of the 2022 13th Asian Control Conference (ASCC). Jeju Island, Republic of Korea, 2022. Pp. 1396–1403.
  14. Lin C.-B., Dong Z., Kuan W.-K., Huang Y.-F. A framework for fall detection based on openpose skeleton and LSTM/GRU models. URL: https://www.researchgate.net/publication/348142284_A_Framework_for_Fall_Detection_Based_on_OpenPose_Skeleton_and_LSTMGRU_Models (data of accesses: 29.01.2024).
  15. Lin F.-C., Ngo H.-H., Dow C.-R. et al. Student behavior recognition system. for the classroom environment based on skeleton pose estimation and person detection. URL: https://www.researchgate.net/publication/353746430_Student_Behavior_Recognition_System_for_the_Classroom_Environment_Based_on_Skeleton_Pose_Estimation_and_Person_Detection (data of accesses: 30.01.2024).
  16. Maqsood R., Bajwa UI., Saleem G. et al. Anomaly recognition from surveillance videos using 3D convolutional neural networks. URL: https://arxiv.org/pdf/2101.01073 (data of accesses: 03.02.2024).
  17. Naik A., Gopalakrishna M. Deep-violence: Individual person violent activity detection in Video. URL: https://www.researchgate.net/publication/349393071_Deep-violence_individual_person_violent_activity_detection_in_video (data of accesses: 29.01.2024).
  18. Nauman M.A., Shoaib M. Identification of anomalous behavioral patterns in crowd scenes. URL: https://www.techscience.com/cmc/v71n1/45453/html (data of accesses: 29.01.2024).
  19. Pang G., Shen C., Cao L., Hengel A. Deep learning for anomaly detection: A review. URL: https://ink.library.smu.edu.sg/cgi/viewcontent.cgi?article=8019&context=sis_research (data of accesses: 26.01.2024).
  20. Pawar K., Attar V. Deep learning approaches for video-based anomalous activity detection. URL: https://www.sci-hub.ru/10.1007/s11280-018-0582-1 (data of accesses: 26.01.2024).
  21. Pimentel T., Monteiro M., Veloso A., Ziviani N. Deep active learning for anomaly detection. URL: https://sci-hub.ru/10.1109/ijcnn48605.2020.9206769 (data of accesses: 27.01.2024).
  22. Simonyan K., Zisserman A. Two-stream convolutional networks for action recognition in videos. URL: https://arxiv.org/pdf/1406.2199 (data of accesses: 28.01.2024).
  23. Sultani W., Chen C., Shah M. Real-world anomaly detection in surveillance videos. URL: https://paperswithcode.com/paper/real-world-anomaly-detection-in-surveillance (data of accesses: 03.02.2024).
  24. Tomar S., Sharma A.K., Tina, Gupta K. Pose based activity recognition using supervised machine learning algorithms. URL: https://www.ijert.org/research/pose-based-activity-recognition-using-supervised-machine-learning-algorithms-IJERTV10IS120084.pdf (data of accesses: 27.01.2024).
  25. Tran D., Bourdev L., Fergus R. et al. Learning spatiotemporal features with 3D convolutional networks. URL: https://arxiv.org/pdf/1412.0767 (data of accesses: 28.01.2024).
  26. Tran D.A., Fischer P., Smajic A., So Y. Real-time object detection for autonomous driving using deep learning. URL: https://www.researchgate.net/publication/350090136_Real-time_Object_Detection_for_Autonomous_Driving_using_Deep_Learning (data of accesses: 26.01.2024).
  27. Vrskova R., Hudec R., Kamencay P., Sykora P. A new approach for abnormal human activities recognition based on ConvLSTM architecture. URL: https://www.researchgate.net/publication/360159604_A_New_Approach_for_Abnormal_Human_Activities_Recognition_Based_on_ConvLSTM_Architecture (data of accesses: 28.01.2024).
  28. Zhang F., Bazarevsky V., Vakunov A. et al. Mediapipe hands: On-device real-time hand tracking. URL: https://arxiv.org/pdf/2006.10214.pdf (data of accesses: 01.02.2024).
  29. Zhao Y., Deng B., Shen Ch. et al. Spatio-temporal autoencoder for video anomaly detection. URL: https://sci-hub.ru/10.1145/3123266.3123451 (data of accesses: 28.01.2024).

Supplementary files

Supplementary Files
Action
1. JATS XML
2. Fig. 1. Supervised learning [24]

Download (899KB)
3. Fig. 2. Semi-supervised learning on GAN example

Download (794KB)
4. Fig. 3. Unsupervised learning [4]

Download (1MB)
5. Fig. 4. Transfer learning on example of anomaly detection действий [3]

Download (544KB)
6. Fig. 5. Deep active learning [21]: re – external reward; ri – intrinsic reward; s – observation; a – action

Download (377KB)
7. Fig. 6. Deep reinforcement learning [1]

Download (1MB)
8. Fig. 7. Example of deep hybrid models-based on anomaly detection [3] (below – abnormal crowd activity)

Download (1MB)
9. Fig. 8. Two-stream network architecture [22]

Download (174KB)
10. Fig. 9. 3D-convolution operation for anomaly detection [16]

Download (1MB)
11. Fig. 10. ConvLSTM architecture [27]

Download (505KB)
12. Fig. 11. The scheme of the algorithm using OpenPose [14]

Download (1MB)
13. Fig. 12. Original image

Download (704KB)
14. Fig. 13. Output image with labels

Download (750KB)
15. Fig. 14. A skeleton obtained from an image in 3D space

Download (340KB)
16. Fig. 15. Examples of different anomalies

Download (2MB)
17. Fig. 16. Resnet50v2 architecture [9]

Download (997KB)
18. Fig. 17. The algorithm for anomaly detection

Download (1MB)
19. Fig. 18. Loss and accuracy graphs on the training and validation sample

Download (357KB)
20. Fig. 19. Confusion matrix

Download (264KB)
21. Fig. 20. Classification report

Download (231KB)
22. Fig. 21. Detection of violent acts

Download (2MB)
23. Fig. 22. Detection of nonviolent acts

Download (2MB)

Copyright (c) 2024 Yur-VAK

License URL: https://journals.eco-vector.com/2313-223X/about/editorialPolicies