The Possibilities of Using Big Data Technologies in Solving Problems of Processing Data on Atmospheric Air Pollution
- Authors: Bogomolov D.N.1, Plotnikov S.B.1
-
Affiliations:
- MIREA – Russian Technological University
- Issue: Vol 11, No 1 (2024)
- Pages: 162-170
- Section: INFORMATICS AND INFORMATION PROCESSING
- URL: https://journals.eco-vector.com/2313-223X/article/view/631303
- DOI: https://doi.org/10.33693/2313-223X-2024-11-1-162-170
- ID: 631303
Cite item
Full Text
Abstract
The main objective of the article is to substantiate the possibility of using Big Data technologies in the field of atmospheric air monitoring. In the form of a diagram, a model for processing big data obtained from measuring meteorological gas analysis stations using the PySpark library for further experimental studies is presented. The factors accompanying the use of Big Data in the field of atmospheric air monitoring are derived, and the performance of the Pandas and PySpark libraries is compared. The obtained results will allow us to further rely on the derived factors and use the most optimal data processing technologies to build predictive machine learning models in the field of analyzing the level of atmospheric air pollution. Consistent use of big data and machine learning methods will ensure clean and healthy air for future generations through more effective predictive analytics. This article is valuable for students and specialists in the field of information technology, in particular, in the field of data processing and machine learning.
Full Text
ВВЕДЕНИЕ
Загрязнение воздуха является одной из самых актуальных современных экологических проблем. Большинство из этих проблем связаны с агрессивным воздействием человеку на природу [7: 169].
Увеличение количества стационарных постов контроля загрязнения атмосферы в каждом конкретном городе, расширение списка городов, где ведутся постоянные измерения концентраций загрязняющих веществ, увеличение перечня контролируемых примесей – одна из актуальных задач развития экологического мониторинга.
Для контроля качества воздуха необходимы эффективные инструменты и методы мониторинга. В последние годы технологии Big Data стали широко применяться в различных областях, где требуется обработка и анализ больших объемов данных. В контексте мониторинга атмосферного воздуха, использование технологии Big Data может предоставить значительные преимущества в сборе, обработке и анализе данных, что позволит улучшить качество мониторинга и принимать более эффективные экологические меры.
В последние годы исследования, направленные на улучшение прогноза экологической обстановки за счет применения методов машинного обучения, описанные в трудах отечественных [4; 6; 7; 9; 10] и зарубежных [3; 8; 11; 13] научных групп, позволили выявить основные преимущества и недостатки применения искусственного интеллекта в данной предметной области. Одним из узких мест является постоянно растущий объем статистических данных, необходимых для построения более точных моделей прогноза.
1. ПОСТАНОВКА ЗАДАЧИ
В рамках исследований предполагается, что совместное использование аппаратных средств в виде измерительных станций, алгоритмов больших данных (Big Data) и машинного обучения позволит улучшить существующие методы прогнозирования уровня загрязнения воздуха. Для проведения исследований используются статистические данные по городу Москве ввиду наибольшего уровня покрытия измерительными станциями на территории РФ.
2. ФАКТОРЫ, СОПУТСТВУЮЩИЕ ИСПОЛЬЗОВАНИЮ BIG DATA В ОБЛАСТИ МОНИТОРИНГА АТМОСФЕРНОГО ВОЗДУХА
Для формирования факторов были проанализированы основные задачи экологического мониторинга, принципы построения автоматизированных систем мониторинга загрязнения воздуха, представленные в монографии [12].
Факторами, способствующими использованию технологий Big Data при решении задач по обработке данных о загрязнении атмосферного воздуха, являются:
- повышение точности и достоверности данных. Использование технологий Big Data позволяет собирать и анализировать огромные объемы информации из различных источников, таких как датчики, атмосферные модели и спутниковые данные;
- обнаружение и прогнозирование загрязнений. Благодаря анализу больших объемов данных и использованию алгоритмов машинного обучения, можно выявить паттерны и тренды загрязнения воздуха;
- решение сложных проблем. Big Data позволяет анализировать данные из различных источников, включая географическую и климатическую информацию т.е. позволяет решать более сложные проблемы, например, определение источников загрязнения или предсказание влияния погодных условий на качество воздуха;
- быстрая обработка данных. Big Data позволяет обрабатывать и анализировать большие объемы данных в реальном времени. Это особенно важно для мониторинга атмосферного воздуха, где быстрая реакция на изменения состояния воздуха может быть критически важна;
- оптимизация ресурсов. С использованием Big Data можно оптимизировать использование ресурсов, например, для более точного мониторинга;
- оптимизация принятия решений. Big Data помогает принимать более обоснованные и эффективные решения;
- адаптация к изменениям климата. Одной из важных задач мониторинга атмосферного воздуха является адаптация к изменениям климата. Анализ данных Big Data помогает прогнозировать возможные изменения с целью разработки мероприятий по адаптации;
- разработка стратегии по охране природы и биоразнообразия. Мониторинг атмосферного воздуха с использованием технологий Big Data позволяет не только контролировать загрязнение, но и изучать влияние загрязнения на экосистему;
- автоматизация процессов. Big Data позволяют автоматизировать многие процессы, связанные с мониторингом атмосферного воздуха, например, сбор и анализ данных, генерация отчетов и т.д.
3. ХАРАКТЕРИСТИКИ BIG DATA, ПРИМЕНИМЫЕ К ЗАДАЧЕ МОНИТОРИНГА АТМОСФЕРНОГО ВОЗДУХА
Описание предметной области, а именно, мониторинг уровня загрязнения атмосферного воздуха, можно представить, опираясь на основные характеристики больших данных, также известных как «The 10 Vs model of Big data» [15: 4–5]:
Объем
Объем информации, обрабатываемой в течении дня, недели и месяца, представлен в табл. 1.
Таблица 1
Объем информации, обрабатываемой из выбранных источников [The amount of information processed from selected sources]
Название источника [Name of the source] | Формат данных [Data format] | Объем данных за день (Мб) [The amount of data per day (MB)] | Количество параметров [Number of parameters] |
devices center community | CSV, JSON | 240 | 9 |
Air CMS | CSV | 100 | 6 |
World Air Quality Index | JSON, XML | 100 | 9 |
mosecom.mos.ru | JSON | 100 | 20 |
SILAM | NC4 | 400 | 14 |
Скорость накопления
Скорость накопления данных определяется двумя факторами.
- Скоростью накопления от одного источника данных. Также учитывается, что разные параметры, полученные от одного и того же источника, могут обновляться с разной частотой.
- Количеством источников данных. Скорость накопления данных зависит от количества точек, генерирующих новую информацию. Исходя из поставленной задачи, источниками данных служат измерительные станции. Так как наличие «народных» станций часто меняется, количество станций оценивалось округленно до десятков.
Таблица 2
Факторы скорости накопления данных [Factors of data accumulation rate]
Параметр, источник [Parameter, source] | Devices center community | Air CMS | World Air Quality Index | mosecom | SILAM |
Скорость накопления [Accumulation rate] | 1 раз в 5 мин [Every 5 minutes] | В реальном времени [In real time] | В реальном времени [In real time] | 1 раз в час [Every hour] | В реальном времени [In real time] |
Количество станций [Number of stations] | 50 | 70 | 10 | 20 | 10 |
Факторы скорости накопления данных по каждому из представленных источников представлена в табл. 2.
Разнообразие
Данные могут отличаться как по контенту, так и по типу данных:
- структурированные;
- слабоструктурированные;
- неструктурированные.
В представленных источниках структурированными данными являются CSV-файлы, также используются слабоструктурированные данные в виде JSON-файлов и XML-файлов.
Преимущества и недостатки работы с тем или иным типом данных проявляются при постановке задачи (например, обработка данных в реальном времени с минимальным временем на предобработку или исследование скрытых зависимостей в данных за период в несколько лет).
Достоверность
Достоверность данных может быть подвергнута сомнению при ручном вводе параметров наблюдения, либо при большом количестве статистических выбросов после автоматического сбора информации с аппаратуры. Стопроцентная достоверность не всегда важна.
В большинстве случаев, когда скорость накопления данных больше тысячи записей в секунду, то одна или даже десять ошибочных записей не создадут проблемы. Ведь после них последуют еще 900 записей хорошего качества.
Изменчивость
Потоки данных могут изменяться по разным причинам: из-за социальных явлений, сезонов, внешнего воздействия и т.п. Когда собирают, например, данные температуры производственного оборудования или вычислительного сервера, информация постоянно изменяется, если измерять температуру достаточно точно.
Распространенным сценарием изменения частоты получения данных является временное отключение измерительных станций, которое бывает штатным и нештатным (табл. 3). К штатным отключениям относятся случаи, когда рядом со станцией производятся строительные работы, локально повышающие уровень атмосферного воздуха. Нештатные ситуации более характерны для домашних измерительных станций. В связи с этим, в настоящее время разрабатываются новые концепции компактных измерительных станций, учитывающих проблемы низкой отказоустойчивости и энергонезависимости [5: 243].
Таблица 3
Процент пустых значений в данных, полученных с домашних станций за календарный месяц [Percentage of empty values in data received from home stations for a calendar month]
Параметр [Parameter] | Описание параметра [Description of the parameter] | Процент пустых значений [Percentage of empty values] |
sensor_id | Идентификатор датчика [Sensor ID] | 0,000 |
sensor_type | Тип датчика [Sensor type] | 0,000 |
location | Территориальное расположение [Location] | 0,000 |
timestamp | Момент времени [Timestamp] | 0,000 |
pressure | Давление [Pressure] | 0,767 |
temperature | Температура [Temperature] | 1,054 |
humdity | Влажность [Humdity] | 1,845 |
pm2.5 | Концентрация частиц PM2.5 [The concentration of PM2.5 particles] | 2,294 |
pm10 | Концентрация частиц PM10 [The concentration of PM10 particles] | 1,921 |
При разработке моделей машинного обучения важно «натренировать» модель так, чтобы как можно точнее различать случаи изменчивости и нарушения достоверности в данных.
Ценность
Ценность аномальных значений концентрации тех или иных вредных веществ в воздухе должна быть выше, чем в других предметных областях, так как скачок значений может означать разовый выброс вредных веществ в атмосферу и помочь с дальнейшей классификацией источника загрязнения. Так как домашние измерительные станции обладают меньшей отказоустойчивостью по сравнению с городскими, то целесообразно это учитывать при распределении весов наблюдений при обучении.
4. ПРАКТИЧЕСКОЕ ОБОСНОВАНИЕ ИСПОЛЬЗОВАНИЯ ТЕХНОЛОГИЙ BIG DATA ДЛЯ РАБОТЫ С ДАННЫМИ ИЗМЕРИТЕЛЬНЫХ СТАНЦИЙ
Для практического обоснования использования технологий Big Data было проведено сравнение библиотеки для обработки и анализа данных Pandas и библиотеки для работы с большими данными PySpark по двум параметрам:
- размер файла с данными (от 0,1 до 50ГБ);
- время выполнения запроса (в секундах).
Было проведено сравнение по двум стандартным вариантам SQL-запроса: COUNT (рис. 1) и SUM (рис. 2).
Рис. 1. Время выполнения запроса COUNT
Fig. 1. The execution time of the COUNT request
Рис. 2. Время выполнения запроса SUM
Fig. 2. The execution time of the SUM request
По результатам сравнения можно утверждать, что библиотеку Pandas целесообразно использовать при обработке небольших объемов информации (до 15 ГБ). Чем больше объем обрабатываемой информации, тем сильнее заметна разница в скорости работы. В связи с тем, что набор исторических данных собирается для последующего решения задачи прогнозирования и классификации источников загрязнения, потребуется использование данных измерительных станций, накопленных за несколько лет (объем свыше 50 ГБ). Данное обстоятельство является преимуществом использования PySpark по сравнению с Pandas. PySpark также предлагает два модуля для машинного обучения – ML и MLlib. Модули машинного обучения в PySpark содержат разнообразные инструменты для построения моделей [2: 748–749].
При выполнении более сложного запроса эффективность библиотеки PySpark была выше на всех участках сравнения.
Стоит отметить, что при проведении сравнительного анализа на отметках 30 ГБ и 35 ГБ использование ресурсов компьютера было максимальным и сопровождалось ошибками, представленными на рис. 3.
Рис. 3. Снимок экрана. Переполнение ОЗУ при обработке набора данных размером более 30 ГБ
Fig. 3. Screenshot. RAM overflow when processing a data set larger than 30GB
Подобных проблем не возникло при использовании библиотеки для работы с большими данными PySpark, что позволило обработать порядка 50 ГБ информации о загрязнении атмосферного воздуха за календарный месяц (август 2023 г.).
5. МОДЕЛЬ ОБРАБОТКИ БОЛЬШИХ ДАННЫХ, ПОЛУЧЕННЫХ С ИЗМЕРИТЕЛЬНЫХ СТАНЦИЙ
При помощи средств Big Data разнородные данные (такие как концентрация вредных веществ, температура, влажность, ветер, координаты измерительных станций) поступают на вход программного комплекса в виде временного ряда, обрабатываются с учетом сезонной составляющей и подаются на вход модели машинного обучения для осуществления прогноза.
Модель обработки больших данных, полученных с измерительных станций, можно представить в виде функциональной модели (рис. 4).
Рис. 4. Модель обработки больших данных, полученных с измерительных станций
Fig. 4. Model of processing big data received from measuring stations
Данную модель можно использовать с целью масштабирования тренировочной выборки и ускорения процесса обработки информации в рамках решения задач кластеризации, представленных в [7], а также для моделей прогноза, представленных в [4; 8].
Преимущества использования схожей по концепции модели, состоящей из уровня приложения, сетевого и сенсорного уровня описываются в статье [15: 6–7].
Исходя из рекомендаций Всемирной Организации Здравоохранения (ВОЗ), в табл. 5 представлены выбранные для последующего анализа параметры по причине их регулярного возникновения в городских условиях.
Наиболее важными параметрами в оценке уровня загрязнения атмосферного воздуха являются частицы мелкодисперсной пыли PM10 и PM2.5. Важность этих параметров при решении задачи прогнозирования также отмечается в работах [8; 14; 16].
Основную часть вклада в загрязнение атмосферного воздуха в крупных городах с развитой промышленностью и транспортной сетью составляют: оксид азота, диоксид азота, оксид углерода, диоксид серы, взвешенные частицы диаметром менее 10 мкм (РМ10), взвешенные частицы диаметром менее 2,5 мкм (РМ2,5), а также озона [1: 103].
Для выбранных параметров была составлена матрица корреляций Пирсона (рис. 5) для выявления скрытых зависимостей между анализируемыми параметрами и определения целесообразности построения модели прогноза на основе выбранного набора параметров.
Рис. 5. Матрица корреляций Пирсона
Fig. 5. Pearson Correlation Matrix
Обнаружено высокое значение корреляции между параметрами PM2,5, PM10 и СО, что говорит о благоприятном выборе веществ для информационной модели прогноза.
Таблица 5
Параметры из набора данных. Источник: Сайт Мосэкомониторинг (https://mosecom.mos.ru) [Parameters from the dataset. Source: Mosecomonitoring Website (https://mosecom.mos.ru)]
Параметр [Parameter] | Источники попадания в атмосферу [Sources of atmospheric exposure] | Примечание [Notation] |
PM 10 | Глобальный трансграничный перенос, автотранспорт, промышленность, вынос с подстилающих поверхностей (незадернованные почвы, дороги), теплоэнергетика (при использовании резервного топлива) [Global cross-border transport, motor transport, industry, removal from underlying surfaces (unpaved soils, roads), thermal energy (when using reserve fuel)] | Мелкодисперсные частицы сверхмалого размера (меньше 10 мкм) [Fine particles of ultra-small size (less than 10 microns)] |
PM 2,5 | Глобальный трансграничный перенос, автотранспорт, промышленность, пожары [Global cross-border transport, motor transport, industry, fires] | Представляют собой мелкодисперсные частицы сверхмалого размера (менее 2,5 мкм) [They are fine particles of ultra-small size (less than 2.5 microns)] |
H2S (сероводород) [H2S (hydrogen sulfide)] | Теплоэнергетика (при сжигании резервного топлива), переработка нефти; автотранспорт [Thermal power engineering (burning of reserve fuel), oil refining; motor transport] | Бесцветный газ с запахом протухших яиц [A colorless gas with the smell of rotten eggs] |
SO2 (диоксид серы) [SO2 (sulfur dioxide)] | Полигоны захоронения отходов (в том числе на прилегающей областной территории), очистные сооружения, переработка нефти [Landfills (including in the adjacent regional territory), sewage treatment plants, oil refining] | В чистом виде – бесцветный газ с характерным запахом. В концентрациях, наблюдаемых в Москве, не имеет запаха [In its pure form, it is a colorless gas with a characteristic odor. In concentrations observed in Moscow, it has no odor] |
NO (оксид азота) [NO (nitric oxide)] | Теплоэнергетика (при сжигании резервного топлива), предприятия нефтехимической отрасли, автотранспорт [Thermal power engineering (burning of reserve fuel), enterprises of the petrochemical industry, motor transport] | Инертный газ, не обладает запахом и цветом [An inert gas, has no odor and color] |
NO2 (диоксид азота) [NO2 (nitrogen dioxide)] | Теплоэнергетика (при сжигании резервного топлива), предприятия нефтехимической отрасли, автотранспорт [Thermal power engineering (burning of reserve fuel), enterprises of the petrochemical industry, motor transport] | В чистом виде – газ желто-бурого цвета с характерным запахом. В концентрациях, наблюдаемых в Москве, не имеет запаха [In its pure form, it is a yellow-brown gas with a characteristic odor. In concentrations observed in Moscow, it has no odor] |
CH4 (метан) [CH4 (methane)] | Естественные природные факторы, глобальный трансграничный перенос (вулканы, гниение органики), очистные сооружения, переработка нефти, полигоны захоронения отходов [Natural factors, global transboundary transport (volcanoes, organic decay), sewage treatment plants, oil refining, landfills] | Бесцветный газ без запаха [A colorless, odorless gas] |
O3 (озон приземный) [O3 (ground-level ozone)] | Естественные природные факторы, глобальный трансграничный перенос (вулканы, гниение органики), автотранспорт, переработка нефти, авиатранспорт [Natural factors, global transboundary transport (volcanoes, organic decay), motor transport, oil refining, air transport] | Бесцветный газ, сильный окислитель [Colorless gas, strong oxidizer] |
ЗАКЛЮЧЕНИЕ
Включение технологий Big Data в область мониторинга атмосферного воздуха является перспективным и существенным шагом в борьбе с атмосферным загрязнением. Благодаря возможности обработки и анализа больших объемов данных, эти технологии позволяют более точно предсказывать и оценивать качество воздуха, а также определять и анализировать источники загрязнения. Это позволяет эффективно принимать меры по уменьшению загрязнения и разрабатывать более точные стратегии мониторинга и регулирования качества воздуха. Однако, для успешной реализации технологий Big Data в этой области, требуется продолжение исследований и разработка инновационных методов сбора, передачи и обработки данных.
В рамках статьи была обоснована целесообразность и эффективность применения технологий Big Data, а именно, библиотеки PySpark в выбранной предметной области, была представлена в виде схемы Модель обработки больших данных, полученных с измерительных станций. Для решения последующих задач прогноза и классификации источников загрязнения атмосферного воздуха была построена матрица корреляций Пирсона.
Последовательное использование больших данных и методов машинного обучения позволит обеспечить чистый и здоровый воздух для будущих поколений.
About the authors
Dmitry N. Bogomolov
MIREA – Russian Technological University
Author for correspondence.
Email: bogomolov.d.n@edu.mirea.ru
graduate student, Department of Instrumental and Application Software
Russian Federation, MoscowSergey B. Plotnikov
MIREA – Russian Technological University
Email: plotnikovsb@mail.ru
Cand. Sci. (Eng.), associate professor, Department of Instrumental and Application Software
Russian Federation, MoscowReferences
- Azemov D.T. Assessment of the quality of atmospheric air in St. Petersburg based on the results of the operation of the automated air monitoring system in 2019. In: Modern problems of hydrometeorology and environmental monitoring in the CIS: A collection of abstracts of the International Scientific and Practical Conference dedicated to the 90th anniversary of the Russian State Hydrometeorological University (St. Petersburg, October 22–24, 2020). St. Petersburg: Russian State Hydrometeorological University, 2020. Pp. 103–104. EDN: BTHHCS.
- Borisov I.D., Semenov V.A., Bychkova Ya.A., Zhao M.N. Apache Spark и Pyspark. In: Young Russia: Collection of materials of the XIV All-Russian scientific and practical conference of young scientists with international participation (Kemerovo, April 18–21, 2023). Kemerovo: Kuzbass State Technical University named after T.F. Gorbachev, 2023. Pp. 31603.1–31603.3. EDN: UMSNKI.
- Bosubabu S. Air pollution monitoring and prediction system using the Internet of things. International Journal of Research and Development in Engineering Sciences. 2020. Vol. 2. Issue 3. Pp. 144–150.
- Vinogradova E.A., Dmitriev M.M., Kudryavets A.S. Air eco-monitoring using technological solutions to process data from automatic online air quality monitoring systems using machine learning, artificial intelligence and big data analytics approaches. In: Modern technologies: Problems and development trends: Monograph. Petrozavodsk: International Center for Scientific Partnership “New Science” (Individual Entrepreneur Ivanovskaya I.I.), 2021. Pp. 174–189. EDN: FKJEWT.
- Gusak D.V. Device concept for organization of monitoring network. Bulletin of the Peoples’ Friendship University of Russia. Series: Ecology and Life Safety. 2023. Vol. 31. Issue 2. Pp. 241–250. (In Rus.) doi: 10.22363/2313-2310-2023-31-2-241-250. EDN: HCKTOL.
- Egorov G.G. The use of big data technology for environmental protection. In: Ecophilosophy in the design of a noospheric city: A collection of articles based on the results of the Third Russian Round Table with international participation (Moscow, May 18, 2023. E.V. Barkova, O.M. Buzskaya (eds.). Moscow: Ruscience Limited Liability Company, 2023. Pp. 42–48.
- Igonina E.I. Application of machine learning for clustering of Russian regions on population health and ecology. In: I. Lipanov’s scientific readings: Materials of the regional scientific conference (Izhevsk, June 15–16, 2021). Izhevsk: Izhevsk State Technical University named after M.T. Kalashnikov, 2021. Pp. 169–175. EDN: HURYBU.
- Johansson C., Zhang Z., Engardt M. et al. Improving 3-day deterministic air pollution forecasts using machine learning algorithms. Atmos. Chem. Phys. Discus. 2023. doi: 10.5194/acp-2023-38.
- Kaplenkova P.A., Sivova A.N. Prediction of atmospheric air pollution using machine learning and PySpark. Science and Business: Ways of Development. 2020. No. 10 (112). Pp. 54–56. (In Rus.) EDN: LTZEYE.
- Kostromin N.S., Sivova A.N. Application of machine learning methods for solving environmental problems. Modern Science. 2019. No. 5-3. Pp. 144–148. (In Rus.) EDN: YLPWAT.
- Nandi B.P., Singh G., Jain Tayal D.K. Evolution of neural network to deep learning in prediction of air, water pollution and its Indian context. Int. J. Environ. Sci. Technol. 2023. doi: 10.1007/s13762-023-04911-y.
- Panarin V.M., Maslova A.A., Savinkova S.A. Automated monitoring of atmospheric air pollution in industrially developed territories. Tula: Tula State University, 2021. 219 p. ISBN: 978-5-7679-4817-8. EDN: ZDKTXH.
- Parkavi P., Rathi S. Deep learning model for air quality prediction based on big data. International Journal of Scientific Research in Computer Science, Engineering and Information Technology (IJSRCSEIT). 2021. Vol. 7. Issue 3. Pp. 170–175. ISSN: 2456-3307. doi: 10.32628/CSEIT217332.
- Samad A., Garuda S., Vogt U., Yang B. Air pollution prediction using machine learning techniques – an approach to replace existing monitoring stations with virtual monitoring stations, atmospheric environment. International Journal of Computational Intelligence Studies. 2023. Issue 310. P. 119987. ISSN: 1352-2310. doi: 10.1016/j.atmosenv.2023.119987.
- Sossi Alaoui S., Aksasse B., Farhaoui Y. Air pollution prediction through internet of things technology and big data analytics. International Journal of Computational Intelligence Studies. 2020. No. 8. P. 177. doi: 10.1504/IJCISTUDIES.2019.102525.
- Shih D.-H., To T.H., Nguyen L.S.P. et al. Design of a spark big data framework for PM2.5 air pollution forecasting. Int. J. Environ. Res. Public Health. 2021. Vol. 18. No. 7087. 15 p. doi: 10.3390/ijerph18137087.
Supplementary files





