Analysis and evaluation of algorithms for personalization of interaction with the user for the development of a social network
- Authors: Mingaleev R.R.1, Mangusheva A.R.1
-
Affiliations:
- Kazan National Research Technological University
- Issue: Vol 11, No 4 (2024)
- Pages: 19-24
- Section: ARTIFICIAL INTELLIGENCE AND MACHINE LEARNING
- URL: https://journals.eco-vector.com/2313-223X/article/view/658302
- DOI: https://doi.org/10.33693/2313-223X-2024-11-4-19-24
- EDN: https://elibrary.ru/FTISLK
- ID: 658302
Cite item
Full Text
Abstract
This article analyzes personalization algorithms for social networks, with key objectives being the enhancement of user interaction and the improvement of recommendation relevance. The goal of this work is to evaluate various personalization approaches, such as recommendation systems and machine learning algorithms, as well as to assess the accuracy of these algorithms. Personalization approaches based on recommendation systems and machine learning methods are discussed, along with the application of artificial intelligence to improve recommendation accuracy. Three primary recommendation system algorithms are presented: collaborative filtering, content-based filtering, and hybrid models. Collaborative filtering was selected as the main personalization method, using the Python Library Surprise, which includes algorithms such as Singular Value Decomposition, Slope One, and K-Nearest Neighbors. A comparative analysis of Root Mean Squared Error and Mean Absolute Error metrics revealed that the K-Nearest Neighbors algorithm showed the best results, making it the preferred choice for further implementation. The final model, trained on the full dataset, demonstrated strong accuracy and potential for practical use in real products. The results presented could be valuable for social network developers in choosing optimal algorithms to enhance user experience, as well as for future research in personalization and recommendation systems.
Full Text
ВВЕДЕНИЕ
На сегодняшний день популярность социальных сетей растет быстрыми темпами, и они стали занимать неотъемлемую часть повседневной жизни миллионов людей во всем мире. Их развитие позволило создать интернет-платформу, предназначенную для коммуникации, обмена информацией и контентом, а также прочих социальных взаимодействий между пользователями [1].
Социальная сеть позволяет пользователям создавать и просматривать профили, публиковать и взаимодействовать с контентом других пользователей (просматривать ленту, ставить лайк, делать репост или комментировать его). Каждая подобная система содержит в себе большое количество информации, и не вся она может заинтересовать конкретного пользователя. В связи с этим возникает проблема в необходимости персонализации всего этого огромного количества информации.
На помощь в решении данной проблемы приходят технологии искусственного интеллекта (ИИ), развитие которых так же не стоит на месте. Использование ИИ является ключевым и перспективным решением, направленным на повышение функциональности и улучшение пользовательского опыта. При разработке социальных сетей ИИ-технологии могут использоваться для различных целей, например, для персонализации и рекомендации контента, его дальнейшей модерации и анализа [2].
В рамках данной работы будет произведен анализ и оценка существующих ИИ-технологий в области персонализации и управления контентом в социальных сетях.
Целью исследования является проведение анализа и оценка точности алгоритмов ИИ с помощью сравнительного тестирования. Для достижения данной цели необходимо решить ряд задач:
- провести анализ предметной области;
- изучить рынок ИИ-технологий, применяемых в целях персонализации;
- провести сравнительный анализ выбранных алгоритмов и выбрать лучший.
МАТЕРИАЛЫ И МЕТОДЫ ИССЛЕДОВАНИЯ
ИИ представляет собой область компьютерной науки, направленную на создание систем, способных решать задачи, обычно требующие уровня интеллекта, если бы они были решены человеком. В контексте социальных сетей, применение технологий искусственного интеллекта может значительно улучшить функциональность и эффективность платформы.
Для реализации алгоритмов персонализации существует несколько подходов, например, коллаборативная фильтрация, фильтрация, основанная на контенте или гибридные системы [3].
Коллаборативная фильтрация – этот алгоритм используется для рекомендации контента на основе истории взаимодействия пользователя и других пользователей с аналогичными интересами (рис. 1).
Рис. 1. Пример коллаборативной фильтрации
Fig. 1. Example of collaborative filtering
Фильтрация, основанная на контенте – алгоритм рекомендует контент на основе анализа самого контента и предпочтений пользователя (рис. 2).
Рис. 2. Пример фильтрации, основанной на контенте
Fig. 2. Example of content-based filtering
Гибридные системы – объединяют в себе все виды рекомендательных алгоритмов, описанных ранее, и позволяют использовать их вместе и подключать в разных последовательностях [4].
В рамках данной работы в качестве ключевого алгоритма персонализации была выбрана коллаборативная фильтрация [5; 6], для реализации которой было решено использовать Python-библиотеку Surprise, а именно модели Singular Value Decomposition, Slope One, K-Nearest Neighbors. Далее рассмотрим каждый из этих алгоритмов отдельно.
Принцип работы алгоритма Singular Value Decom-position (SVD) заключается в разложении исходной матрицы рейтингов пользователей на три матрицы меньшего ранга.
Допустим R – это матрица рейтингов пользователей по объектам размерности m на n, где m – количество пользователей, а n – количество объектов. Тогда матрица R может быть представлена в следующем виде:
R = USVT,
где U – матрица, содержащая латентные факторы пользователей;
S – матрица, описывающая силу каждого латентного фактора;
V – матрица, содержащая латентные факторы объектов.
Предсказание рейтинга пользователя u для объекта i строится по следующей формуле:
r̂ui = μ + bu + bi + XiTYu,
где μ – средний рейтинг всех объектов;
bi – средний рейтинг объекта i минус μ;
bu – средний рейтинг, данный пользователем u минус μ;
XiT – вектор, описывающий объект;
Yu – вектор, описывающий пользователя.
Алгоритм Slope One предсказывает рейтинг, исходя из средней разницы между оценками объектов, которые были оценены одним и тем же пользователем. Предсказание рейтинга производится по формуле
где μu – среднее значение всех оценок, данных пользователем u;
Ri(u) – это набор соответствующих объектов j, т.е. набор элементов j с рейтингом от u, у которых также есть хотя бы один общий пользователь с i;
dev(i, j) – средняя разница между рейтингами объектов i и j.
Средняя разница между рейтингами объектов i и j рассчитывается по формуле
где Uij – набор всех пользователей, которые оценили оба элемента i и j.
Алгоритм K-Nearest Neighbors (KNN) использует сходство между пользователями или элементами для прогнозирования, а именно расстояние между векторами, описывающими каждого пользователя [7; 8].
С помощью этого алгоритма можно делать предсказания, основанные как на сходстве пользователей, так и на сходстве объектов, которые описаны формулами
где Nik(u) – множество, состоящее из k ближайших соседей пользователя, которые оценили элемент i и
i
где Nik(i) – множество, состоящее из k ближайших соседей элемента i, которым присвоен рейтинг пользователем u.
Перед тем как провести сравнительный анализ этих алгоритмов, сначала рассмотрим входные данные (рис. 3), в качестве которых был использован набор данных, состоящий из информации о взаимодействии пользователей с публикациями, содержащий в себе 70511 записей.
Рис. 3. Входные данные взаимодействий пользователей
Fig. 3. Input data of user interactions
По рис. 3 можно заметить, что тип взаимодействия пользователя с публикацией храниться в виде: VIEW, LIKE или REPOST. Поэтому перед тем, как производить анализ, необходимо перевести эти данные в числовой формат рейтинга. Для этого сначала переведем все данные в числовой формат по следующем принципу: VIEW будет равен 1, а LIKE и REPOST – 2 и 3 соответственно.
Так как пользователь может взаимодействовать с публикациями тремя способами, необходимо произвести группировку входного набора данных по столбцам userId и postId, а затем использовать агрегирующую функцию sum(). Результаты данной группировки записать в таблицу, после чего для удобства переименовать столбец type на rating (рис. 4).
Рис. 4. Результат группировки
Fig. 4. Grouping result
Таким образом, получен новый набор данных, содержащий рейтинги пользователей для публикаций. В данном случае рейтинг будет лежать в диапазоне от 1 до 6.
РЕЗУЛЬТАТЫ ИССЛЕДОВАНИЯ И ИХ ОБСУЖДЕНИЕ
После того как все данные преобразованы, можно приступить к сравнительному анализу выбранных моделей. Для оценки точности алгоритмов будет использована метрика Root Mean Squared Error (RMSE) – представляется из себя корень из среднеквадратичной разницы между фактическими и прогнозируемыми значениями и рассчитывается по следующей формуле
где ri – фактический рейтинг;
r̂i – предсказанный рейтинг;
n – количество элементов.
Метрика Mean Absolute Error (MAE) – средняя ошибка по модулю, которая рассчитывается по формуле
где ri – фактический рейтинг;
r̂i – предсказанный рейтинг;
n – количество элементов.
После этого к каждой модели была применена k-блочная перекрестная проверка – процедура, разбивающая исходный набор данных на k частей и рассчитывающая метрики RMSE и MAE. Для сравнительного тестирования было принято решение использовать k = 5, то есть разбивать набор данных на 5 равных частей. Результаты всех тестов были отсортированы в порядке возрастания значений RMSE и MAE и отображены в табл. 1.
Таблица 1
Результаты тестов [Test results]
Название алгоритма [Algorithm name] | RMSE | MAE | Время обучения [Training time] | Время тестирования [Testing time] |
KNN | 0,771761 | 0,651748 | 0,031180 | 0,814592 |
SVD | 0,825288 | 0,688629 | 1,069131 | 0,293483 |
Slope One | 0,853301 | 0,706906 | 0,693469 | 1,457769 |
Проанализировав полученную таблицу, можно заметить, что алгоритм KNN показал лучшие результаты, поэтому он был выбран для реализации алгоритма коллаборативной фильтрации. После этого к выбранной модели была применена k-блочная перекрестная проверка – процедура, разбивающая исходный набор данных на k частей и рассчитывающая метрики RMSE и MAE. Результаты данной проверки отображены в табл. 2. На рис. 5 показаны ошибки модели, измеренные с помощью метрик RMSE и MAE, на пяти итерациях кросс-валидации (CV).
Таблица 2
Результаты проверки [Verification results]
Метрика [Metric] | Группа 1 [Group 1] | Группа 2 [Group 2] | Группа 3 [Group 3] | Группа 4 [Group 4] | Группа 5 [Group 5] | Среднее [Average] |
RMSE | 0,7997 | 0,7974 | 0,7993 | 0,7993 | 0,7964 | 0,7984 |
MAE | 0,6705 | 0,6696 | 0,6715 | 0,6717 | 0,6681 | 0,6703 |
Рис. 5. Результаты k-блочной перекрестной проверки
Fig. 5. Results of k-block cross-validation
Результаты тестирования показали следующие значения: RMSE – 0,7984, MAE – 0,6703. Таким образом, была получена модель, которая может быть улучшена и в дальнейшем использована в реальном продукте.
ЗАКЛЮЧЕНИЕ
В ходе выполнения данной работы было проведено исследование рынка социальных сетей и алгоритмов искусственного интеллекта для персонализации взаимодействия с пользователем. Исследования позволило выявить слабые и сильные стороны уже имеющихся технологий, также было проведено сравнительное тестирование и оценка точности нескольких моделей ИИ. Представленные результаты могут быть полезны разработчикам социальных сетей при выборе оптимальных алгоритмов для улучшения пользовательского опыта, а также для дальнейших исследований в области персонализации и рекомендательных систем [9; 10].
About the authors
Ruslan R. Mingaleev
Kazan National Research Technological University
Author for correspondence.
Email: neoch56@mail.ru
postgraduate student, Department of Intelligent Systems and Information Resource Management
Russian Federation, Kazan, Republic of TatarstanAlina R. Mangusheva
Kazan National Research Technological University
Email: alinamr@mail.ru
Scopus Author ID: 57442238900
associate professor, Department of Intelligent Systems and Information Resource Management
Russian Federation, Kazan, Republic of TatarstanReferences
- Monastyrev V.V., Drobintsev P.D. Recommendation system based on user actions in the social network. Proceedings of the Institute for System Programming of the RAS. 2020. Vol. 32. No. 3. Pp. 101–108. doi: 10.15514/ISPRAS-2020-32(3)-9.
- Kukitz P.V. Application of machine learning for personalization of recommendations in the foodtech industry. Journal of Advanced Research in Technical Science. 2024. No. 42. Pp. 31–41. (In Rus.). doi: 10.26160/2474-5901-2024-42-31-41.
- Kruglik A.S., Lakman I.A. Hybrid Approach of Content-Enhanced Collaborative Filtering in Recommender Systems. Information Technologies. 2020. Vol. 26. No. 9. Pp. 523–528. (In Rus.) doi: 10.17587/it.26.523-528.
- Lyalikova V.G., Bezryalin M.M. Construction of a Hybrid Recommender System. Bulletin of Voronezh State University. Series: Systems Analysis and Information Technologies. 2021. No. 4. Pp. 121–129. (In Rus.)
- Tretyakov D.A. Development of a Recommender System Based on the Collaborative Filtering Method with the Possibility of Using Custom Modifiers. In: Scientific creativity of youth. Mathematics. Computer science. Proceedings of the XIX All-Russian Scientific and Practical Conference (Anzhero-Sudzhensk, May 15–16, 2015). Anzhero-Sudzhensk: Branch of Kemerovo State University, 2015. Pp. 54–57.
- Makarov M.P., Novikov A.M. Modeling and forecasting content in social networks using machine learning algorithms. Bulletin of Moscow University. Series 15: Computational Mathematics and Cybernetics. 2020. Vol. 2. Pp. 45–63. (In Rus.)
- The k-nearest neighbors algorithm. URL: http://datascientist.one/k-nearest-neighbors-algorithm (data of accesses: 18.11.2024).
- Mangusheva A.R., Kvaratskhelia A.G., Rakhimov D.F., Grigoryan K.A. Service for automatic classification of citizens’ appeals. In: Proceedings of the XXII International Conference on Computational Mechanics and Modern Applied Software Systems (VMSPPS’2021) (Alushta, September 4–13, 2021). Moscow: Moscow Aviation Institute (National Research University), 2021. Pp. 131–133.
- Gibadullin R.F., Maksimov A.A., Novikov A.A., Perukhin M.Yu. Reconstruction of tomographic images using multiprocessor systems. Bulletin of the Technological University. 2017. Vol. 20. No. 12. P. 87–89. (In Rus.)
- Gibadullin R.F., Mullayanov B.I., Perukhin M.Yu. Optimization of water supply by the method with model predictive // International Multi-Conference on Industrial Engineering and Modern Technologies FarEastCon 2020 (Vladivostok, October 6–9, 2020). Vladivostok, 2020. P. 9271134. doi: 10.1109/FarEastCon50210.2020.9271134.
Supplementary files





