Development of a Cryptocurrency Trading Strategy Using Machine Learning Methods
- Authors: Mikhaiylova S.S.1, Sabirova S.A.1
-
Affiliations:
- Financial University under the Government of the Russian Federation
- Issue: Vol 11, No 2 (2024)
- Pages: 11-21
- Section: ARTIFICIAL INTELLIGENCE AND MACHINE LEARNING
- URL: https://journals.eco-vector.com/2313-223X/article/view/635808
- DOI: https://doi.org/10.33693/2313-223X-2024-11-2-11-21
- EDN: https://elibrary.ru/MGSSER
- ID: 635808
Cite item
Full Text
Abstract
This article presents the results of a study aimed at forecasting signals for buying and selling Bitcoin cryptocurrency using machine learning models. The conducted analysis included the study of cryptocurrency features and markets, technical analysis, development of trading strategies, application of mathematical methods based on moving averages, and building classification models for buy or sell signals. The results demonstrate the effectiveness of applying machine learning models in modern trading strategies in the cryptocurrency market.
Full Text
1. Введение в торговые стратегии на рынке криптовалют
С каждым годом криптовалюты становятся все более важным и влиятельным компонентом мировой экономики. Их высокая волатильность, комплексные зависимости от множества факторов, а также быстрое развитие создают уникальные вызовы для инвесторов, трейдеров и аналитиков. В этом контексте методы машинного обучения предоставляют возможность анализа крупных объемов данных, идентификации скрытых паттернов и повышения точности прогнозирования в условиях высокой неопределенности.
Исследование, направленное на разработку моделей классификации для оптимальной торговой стратегии на рынке криптовалюты Биткоин, представляет высокую актуальность в контексте современной финансовой среды. С ростом популярности криптовалют и увеличением числа инвесторов на этом рынке возникает потребность в эффективных инструментах анализа и прогнозирования. В условиях высокой волатильности и быстрого изменения трендов разработка точных торговых стратегий становится важной для успешного управления инвестициями.
Внедрение методов машинного обучения и нейронных сетей в анализ криптовалютного рынка открывает новые перспективы для выявления закономерностей и создания адаптивных стратегий. Этот подход позволяет эффективно использовать доступные данные, включая исторические котировки, технические индикаторы и данные о рыночной активности, для создания более точных прогнозов и принятия обоснованных торговых решений. Таким образом, исследование в области разработки моделей машинного обучения для анализа рынка криптовалюты Биткоин представляет собой актуальное и перспективное направление, отвечающее вызовам современной финансовой индустрии.
Криптовалюты аналогично деньгам выступают посредническим инструментом в процессе рыночного обмена. Так, основная функция криптовалют на сегодняшний день – это оплата товаров и услуг или осуществление перевода средств (то есть как средство платежа или обмена). При этом несмотря на то, что большое количество игроков рынка криптовалют используют их в качестве средства платежа или обмена при покупке продаже товаров и услуг, расчетной единицей его признают немногие из них [2].
Мировая рыночная капитализация криптовалют на сегодня составляет примерно $2,5 триллиона (рис. 1)1. Годовой прирост криптовалют составил впечатляющие 108,39%. Эти данные свидетельствуют о значительном увеличении интереса и инвестиций в рынок криптовалют на протяжении последнего года.
Рис. 1. Мировая рыночная капитализация криптовалют
Fig. 1. Global market capitalization of cryptocurrencies
Рынок криптовалют представляет собой сложную и многоуровневую систему, включающую разнообразные криптовалюты и платформы их обращения. Классификация криптовалют представлена в табл. 1.
Таблица 1
Типы криптовалют [Types of cryptocurrencies]
Тип криптовалюты [Cryptocurrency type] | Основные характеристики [Main characteristics] | Примеры [Examples] |
Биткойн [Bitcoin] | Первая криптовалюта, работает на собственном блокчейне, служит цифровым золотом [The first cryptocurrency, running on its own blockchain, serves as digital gold] | Биткойн [Bitcoin] (BTC) |
Альткойны [Altcoins] | Вариации криптовалют, предлагающие различные функции или возможности по сравнению с биткойном [Variations of cryptocurrencies that offer different features or capabilities compared to bitcoin] | Ethereum (ETH), Litecoin (LTC), Ripple (XRP) |
Токены на основе смарт-контрактов [Tokens based on smart contracts] | Цифровые активы, созданные на существующих блокчейн-платформах, часто представляют активы или утилиты [Digital assets created on existing blockchain platforms often represent assets or utilities] | ERC-20 токены (например, DAI, LINK) [ERC-20 (DAI, LINK)] |
Стейблкойны [Stablecoins] | Криптовалюты, привязанные к стабильным активам, например, к фиатным валютам, для минимизации волатильности [Cryptocurrencies pegged to stable assets, such as fiat currencies, to minimize volatility] | Tether (USDT), USD Coin (USDC) |
Приватные криптовалюты [Private cryptocurrencies] | Сосредоточены на повышении приватности и анонимности транзакций [Focused on increasing privacy and anonymity of transactions] | Monero (XMR), Zcash (ZEC) |
Bitcoin (BTC), являясь первопроходцем и наиболее узнаваемой криптовалютой, занимает доминирующую позицию на рынке с рыночной капитализацией в $1,3 триллиона. Это составляет 51,12% от общей мировой капитализации криптовалют, подчеркивая его значимость и влияние на криптовалютный сектор.
Основные рынки представлены крупнейшими криптовалютными биржами, такими как Binance, Coinbase, и Kraken, где проводятся основные объемы торгов. Второстепенные рынки включают меньшие биржи и специализированные платформы, которые могут специализироваться на определенных видах активов или предлагать уникальные торговые пары.
Основными участниками рынка криптовалют являются инвесторы, трейдеры, майнеры, разработчики и регуляторы.
Торговая стратегия на криптовалютных рынках часто базируется на краткосрочных операциях, направленных на извлечение прибыли из волатильности цен. Одним из популярных подходов является технический анализ, основанный на анализе графиков цен и использовании различных технических индикаторов для выявления трендов и точек входа и выхода с позиции.
На протяжении всей истории торгов на фондовом рынке люди искали все новые и новые закономерности в движении цен на финансовые инструменты с целью опередить конкурентов на бирже и извлечь максимум прибыли. В результате накопилось огромное количество индикаторов, пригодных для самого разного рода задач и любого типа рынка или ценной бумаги, и каждый из них внес свой вклад в развитие технического анализа [3].
Технический анализ привлекает своих приверженцев тем, что на основании изучения сравнительно небольшого объема рыночной информации и используя достаточно несложные и наглядные методы обработки данных он позволяет выработать рекомендации поведения для инвестора на конкретном финансовом рынке [1]. Поскольку технический анализ финансовых рынков ставит своей задачей разработку прибыльных торговых стратегий, использующих изменения цен финансовых инструментов, то как метод финансового анализа он ориентирован прежде всего на спекулянтов, т.е. участников рынка, использующих курсовые изменения активов [1].
Определим технический анализ как совокупность методов финансового анализа, основанных на изучении динамики изменений состояний рынков в предшествующие моменты [1: 36]. Главной целью технического анализа является прогнозирование направления дальнейших изменений цен финансовых инструментов и определение рекомендаций по выбору стратегии работы на рынках данных инструментов с целью повышения доходности операций и снижения риска, обусловленных этими изменениями [1: 37].
Анализируя работу А.В. Авдеева «Сравнение видов индикаторов технического анализа и выбор оптимальной категории индикаторов для дальнейшего использования в алгоритмах системы торговли на биржах», мы можем выделить три основных вида технического анализа, которые могут быть применены на криптовалютных рынках.
Первый вид – это использование индикаторов, на основе скользящих средних. Эти индикаторы, основанные на усредненных значениях цен, позволяют определить оптимальные моменты для входа и выхода из позиций на рынке. Преимущества таких индикаторов – их простота в понимании и применении. Однако они могут запаздывать по отношению к реальным изменениям на рынке.
Второй вид – инструменты, определяющие направление тренда. Эти индикаторы помогают выявить длительные тренды на рынке и обладают устойчивостью. Однако, они могут также запаздывать из-за усредненной природы тренда.
Третий вид – это осцилляторы, которые предсказывают развороты тренда рынка. Они оперируют понятиями «перекупленности» и «перепроданности» и могут дать сигналы о возможном изменении направления движения цены. Преимущества осцилляторов – их надежность и меньшая подверженность ложным сигналам. Однако они могут быть менее эффективны в условиях сильного тренда.
В итоге, выбор оптимального индикатора для анализа криптовалютных рынков зависит от конкретных условий рынка и предпочтений трейдера.
На рынке криптовалют существует множество торговых стратегий, включая торговлю на основе двух скользящих средних, стратегии на основе индикаторов, таких как RSI (индекс относительной силы) и MACD (скользящее среднее сходимости/расхождения), арбитражные стратегии, которые ищут ценовые различия между разными биржами, и стратегии на основе новостей, реагирующие на события, влияющие на рынок.
Среди всех этих подходов стратегия на основе двух скользящих средних часто выделяется благодаря своей простоте, эффективности в идентификации трендов и сигналов для входа или выхода, а также способности адаптироваться к различным рыночным условиям. Этот метод минимизирует риски, связанные с волатильностью рынка, и предоставляет четкие критерии для принятия решений, что делает его идеальным выбором для как начинающих, так и опытных трейдеров. Для применения правила нужно вычислить скользящее среднее цены того инструмента, с которым придется работать. Сигналом к покупке будет поднятие цены над уровнем скользящего среднего, а к продаже – падение цены ниже уровня скользящего среднего [4].
Применение методов машинного обучения к инвестиционной стратегии на основе скользящих средних значительно усиливает ее эффективность, позволяя точнее прогнозировать моменты для покупки или продажи криптовалют. Это достигается за счет анализа исторических данных и обнаружения сложных зависимостей, которые могут не быть очевидны при стандартном использовании скользящих средних.
2. Материалы и методы исследования
Для анализа и построения торговых стратегий на криптовалютном рынке выбран исторический набор данных, который содержит информацию о торгах биткоина на бирже Bitstamp2 с января 2019 г. по апрель 2024 г. Данные представлены с интервалом в одну минуту, что предоставляет детальное представление о динамике цен и объемах торгов.
Данные включают следующие характеристики:
- Open (цена открытия)
- High (максимальная цена)
- Low (минимальная цена)
- Close (цена закрытия)
- Volume_(BTC) (объем торгов в биткоинах)
- Volume_(Currency) (объем торгов в валюте)
- Weighted_Price (взвешенная цена)
Временные метки в наборе данных представлены в формате UNIX timestamp. Для удобства анализа и визуализации временные метки были преобразованы в стандартный временной формат с использованием библиотеки pytz и функции datetime, обеспечивая корректное отображение во всех временных зонах.
Исходные данные были загружены из CSV-файла с использованием библиотеки pandas, при этом временные метки были установлены в качестве индекса DataFrame. Период данных для анализа был ограничен интервалом с 1 января по 15 апреля 2024 г., чтобы сфокусироваться на актуальных торговых данных перед началом практического анализа.
DataFrame содержит более 4,8 миллионов записей, что указывает на высокую гранулярность и глубину данных, необходимых для детального анализа рыночного поведения и тестирования различных инвестиционных стратегий.
В процессе построения и тренировки моделей машинного обучения для анализа и прогнозирования криптовалютных рынков часто возникает необходимость обработки больших объемов данных. Полный набор данных может содержать миллионы записей, что существенно увеличивает время тренировки моделей, особенно при использовании кросс-валидации. Рассмотрим подход к работе с уменьшенным подмножеством данных для ускорения процесса тренировки моделей.
Для упрощения и ускорения обработки данных было решено использовать последние 100 000 точек из доступного массива данных. Это количество считается достаточным для отражения наиболее актуальных трендов и позволяет сократить время обработки без значительной потери в качестве модели. Такое количество данных обычно охватывает период в несколько месяцев и позволяет уловить основные тренды рынка, несмотря на то что оптимальный объем данных может варьироваться в зависимости от конкретной задачи и возможностей оборудования.
Важной предварительной задачей перед анализом данных и построением инвестиционных стратегий является очистка данных. Неполные или отсутствующие данные могут существенно повлиять на качество моделирования и привести к некорректным выводам.
Проанализировав данные, было обнаружено, что пропущенные значения распределены среди различных признаков довольно систематически. Это указывает на моменты времени, когда торги не происходили или данные не были записаны.
В данных, где не происходило торгов, все признаки (Open, High, Low, Close, Volume_(BTC), Volume_(Currency), Weighted_Price) имеют пропущенные значения. В контексте данного исследования было решено использовать метод прямого заполнения (forward filling), который позволяет сохранить последнее известное значение до момента возникновения следующего значения. Этот метод подходит для временных рядов, где важно сохранить предыдущее состояние данных до появления новой информации.
После применения прямого заполнения, в данных все еще могут оставаться строки с пропущенными значениями, например, если первые строки в наборе данных содержат пропуски. В таком случае применяется удаление таких строк.
Чистота и точность данных – ключевые аспекты успешного анализа и прогнозирования на рынке криптовалют. Предварительная очистка данных позволяет уменьшить искажение в модели и повысить вероятность того, что разработанные торговые стратегии будут реалистичными и эффективными.
3. Разработка торговой стратегии на основе двух скользящих средних
Торговая стратегия, основанная на скользящих средних, является популярным методом технического анализа на финансовых рынках. Этот метод использует статистические индикаторы для определения потенциальных моментов покупки и продажи активов на основе их исторических ценовых трендов. Скользящие средние позволяют сгладить ценовые данные для выявления трендов.
В данной работе стратегия строится с использованием двух типов скользящих средних: краткосрочной (SMA1) и долгосрочной (SMA2).
Целевая переменная signal создается путем сравнения значений SMA1 и SMA2:
- SMA1 > SMA2, это может указывать на восходящий тренд, и стратегия рекомендует покупку (Signal = 1);
- SMA1 < SMA2, это может указывать на нисходящий тренд, и стратегия рекомендует продажу (Signal = 0).
Этот подход позволяет инвесторам принимать решения на основе предположения, что краткосрочные изменения в ценах могут предвещать долгосрочные тренды.
Далее визуализируем как менялись скользящие средние (SMA1 и SMA2) и как они влияли на торговые сигналы в течение обучающего периода (рис. 2).
Рис. 2. Визуализация скользящих средних и сигналов
Fig. 2. Visualization of moving averages and signals
На основе данных визуализаций можно сделать вывод о высокой волатильности актива, что подчеркивается частыми пересечениями коротких и длинных скользящих средних. Это указывает на динамичность рынка и важность использования адаптивных стратегий для торговли. Преимущество использования такой стратегии заключается в автоматизации процесса торговых решений и возможности постоянного адаптирования к изменяющимся рыночным условиям.
После определения целевой переменной было установлено, что распределение сигналов покупки и продажи примерно равномерно, что говорит о хорошем балансе классов и позволяет избежать дополнительных методов балансировки классов в модели. Это также подтверждает, что выбранные периоды для скользящих средних являются оптимальными и хорошо адаптированы к текущим рыночным условиям.
4. Инженерия признаков
В рамках подготовки данных для построения торговой стратегии на рынке криптовалют был проведен анализ корреляции между существующими признаками, такими как Open, High, Low, Close, Volume и Weighted_Price, и целевой переменной Signal (рис. 3). Низкие значения корреляции могут указывать на высокую нелинейность данных, стабильные колебания относительно стационарного значения или на то, что текущие признаки не идеально подходят для моделирования целевой переменной. Это наблюдение подчеркивает необходимость перехода к инженерии признаков для улучшения модели.
Рис. 3. Корреляция признаков и сигнала
Fig. 3. Correlation of features and signal
С учетом указанных выше выводов, в исследовании особое внимание уделено разработке технических индикаторов в рамках подхода к инженерии признаков. Технические индикаторы включают:
1) скользящие средние (Moving Averages, MA), которые помогают определить общий тренд цены, сглаживая ежедневные колебания;
2) экспоненциально взвешенные скользящие средние (Exponential Moving Averages, EMA) акцентируют внимание на более недавних ценах, реагируя на изменения быстрее, чем простые скользящие средние;
3) индекс относительной силы (Relative Strength Index, RSI) помогает определить, находится ли актив в зоне перекупленности или перепроданности, что может предложить стратегии для покупки или продажи на основе предполагаемых разворотов;
4) осцилляторы стохастики (%K и %D) измеряют текущую цену закрытия относительно диапазона цен за определенный период;
5) скорость изменения (Rate of Change, ROC) и Моментум (Momentum, MOM) измеряют скорость изменения цены или объема.
Добавление технических индикаторов с разными временными окнами в набор данных позволяет более точно анализировать и прогнозировать рыночное поведение, опираясь на проверенные временем методы технического анализа. Эти новые признаки не только улучшают понимание текущих рыночных условий, но и предоставляют возможность для создания более сложных и точных торговых стратегий. Это особенно важно в контексте высокой волатильности и непредсказуемости рынка криптовалют.
После интеграции новых технических признаков в модель, важно изучить, как эти признаки коррелируют с целевой переменной Signal (рис. 4). Это поможет понять, насколько эффективно новые данные могут помочь в прогнозировании целевых значений.
Рис. 4. Анализ корреляций расширенного набора признаков
Fig. 4. Analysis of correlations of an expanded set of features
Анализ показывает, что новые признаки имеют значительно более высокую линейную корреляцию с Signal по сравнению с базовыми признаками датасета. Это указывает на то, что введение технических индикаторов может значительно улучшить модельные прогнозы. Базовые признаки, такие как Open, High, Low, и Volume_(Currency), показали низкую корреляцию и, вероятно, мало влияют на вариации целевой переменной.
5. Моделирование торговой стратегии методами машинного обучения
В рамках подготовки к моделированию проводится следующие этапы: определение исходных данных и разработка функции оценки, которая позволит оценить, насколько хорошо модели справляются с задачей предложения торговой стратегии на основе скользящих средних.
Для исследования используются два типа наборов данных: обучающий и тестовый наборы, содержащие базовые признаки и обучающие и тестовые данные с признаками, разработанными на этапе инженерии признаков.
Функция оценки создана для проверки эффективности моделей через различные подходы к разделению данных и оценке. Функция принимает набор данных с матрицей признаков X и целевой переменной y, что позволяет оценить взаимодействие признаков и их влияние на целевой результат. Данные делятся на обучающий набор train_df и оценочный набор eval_df, что обеспечивает возможность независимой оценки производительности моделей.
Перекрестная проверка (5-Fold Cross Validation) используется для оценки модели на различных подвыборках обучающего набора, что дает представление о ее устойчивости и надежности. Двухэтапное разделение проводится разделение на обучающую и оценочную выборки без перемешивания данных, что критично для анализа временных рядов.
Функция позволяет визуализировать обучающие и тестовые данные, что важно для наглядного представления распределения целевой переменной Signal.
Различные модели оцениваются с помощью перекрестной проверки, а также на обучающем и тестовом наборах данных. Модели включают как базовые алгоритмы (LDA, KNN, Decision Tree, Gaussian NB), так и более сложные методы (Gradient Boosting, XGBoost, CatBoost, Random Forest). Эти модели были выбраны для оценки на основе их разнообразия, применимости в различных условиях данных и способности обрабатывать большие объемы информации.
Модели оцениваются на основе их способности предсказывать целевую переменную Signal, что дает представление о директивности рынка. Результаты оценки моделей могут включать различные метрики, такие как точность, F1-мера и другие, в зависимости от конкретных требований задачи.
Для оценки эффективности базовых признаков использовалась функция modelEval (рис. 5).
Рис. 5. Результаты моделирования на основе исходных признаков
Fig. 5. Modeling results based on initial features
Результаты показывают, что точность перекрестной проверки колеблется около 0.5, что свидетельствует о том, что использование только базовых признаков криптовалюты Биткоин не подходит для точной классификации сигнала. Большинство моделей показали более высокие результаты на обучающих данных по сравнению с результатами перекрестной проверки.
- Модели деревьев DecisionTree и RandomForest продемонстрировали высокие результаты на обучающих данных, что может свидетельствовать о переобучении, несмотря на небольшое количество оценщиков.
- Модели GBM, XGB и CATBoost показали высокую производительность с относительно низким временем обучения, что указывает на их хорошую оптимизацию для использования «из коробки».
- RandomForest, хотя и аналогичен по типу модели XGB, работает значительно медленнее.
Оценим, как технические индикаторы, добавленные в ходе инженерии признаков способны улучшить прогнозные свойства модели (рис. 6).
Рис. 6. Результаты моделирования на основе расширенного набора признаков
Fig. 6. Simulation results based on an extended set of features
Результаты показывают значительное улучшение в точности моделей по сравнению с базовыми признаками.
- LDA (Линейный дискриминантный анализ) выделяется высокой точностью как на обучающем наборе, так и при перекрестной проверке, что делает его одним из наиболее эффективных подходов для работы с большими наборами данных.
- Продвинутые модели, такие как GBM, XGB, CAT и RF, также показывают высокие результаты, подтверждая их способность эффективно работать с комплексными признаками.
- Модели kNN и GaussianNB, хотя и относятся к классу неконтролируемых методов, показывают несколько худшие результаты по сравнению с контролируемыми методами.
Использование обновленных признаков значительно улучшило способность моделей точно прогнозировать целевую переменную. Это подчеркивает важность инженерии признаков в процессе построения эффективных предиктивных моделей. Результаты также подтверждают, что более сложные модели хорошо справляются с задачей, особенно при наличии дополнительных информативных признаков, что открывает путь для дальнейшего улучшения и оптимизации моделей.
6. Оптимизация моделей с помощью уменьшения размерности
В контексте разработки торговых стратегий на рынке криптовалют, важным аспектом является понимание важности отдельных признаков модели, что позволяет оптимизировать процесс анализа и сократить вычислительные затраты. Для оценки важности признаков применяются различные методы, позволяющие выявить, какие из признаков оказывают наибольшее влияние на прогностическую способность модели.
Большое количество признаков увеличивает риск переобучения и ведет к более высоким вычислительным затратам. Это особенно критично при работе с данными о криптовалютных транзакциях, где каждая минута генерирует новые данные. Сокращение количества признаков помогает уменьшить время обучения и повысить общую производительность модели.
Один из подходов сокращения размерности признаков – это сокращение через оценку важности признаков. Этот процесс может включать в себя использование различных моделей машинного обучения для оценки значимости каждого признака. Оценка может проводиться через анализ корреляций, SHAP-значений, важности признаков в моделях случайного леса и бустинга.
Один из методов оценки важности – это корреляционный анализ – оценка линейной связи между признаками и целевой переменной. Также есть методы машинного обучения: использование SHAP, RandomForest, XGBoost и CatBoost для определения вклада каждого признака в предсказания модели и SelectKBest – выбор наиболее значимых признаков на основе их статистической связи с целевой переменной. Результаты оценки важности признаков из различных источников объединяются и нормализуются с использованием метода MinMaxScaler, что позволяет получить единую шкалу важности.
На рис. 7 значения важности отображаются по оси Y, где высшие значения указывают на большую важность, а по оси X располагаются соответствующие признаки из исходного набора данных.
Рис. 7. Оценка важности признаков
Fig. 7. Assessing the importance of features
На основе полученных результатов проводится их сокращение, что позволяет уменьшить вычислительную нагрузку и повысить эффективность моделей (рис. 8).
Рис. 8. Построение моделей после сокращения размерности признаков
Fig. 8. Building models after reducing the dimensionality of features
В процессе оптимизации модели и анализа важности признаков были выявлены следующие ключевые результаты.
- Наблюдается значительная связь между малыми значениями корреляции (по Пирсону) и низкими значениями важности признаков в различных методах оценки. Аналогично, признаки с высокой корреляцией часто имеют высокие значения важности в этих же методах. Это подчеркивает последовательность и надежность применяемых методов оценки важности.
- Несмотря на общую тенденцию, существуют исключения, такие как признаки %D10 и MOM10, которые показывают неоднозначные результаты по разным методам. Это указывает на возможную уникальность или специфическую роль этих признаков в контексте исследуемой модели.
- Интересное наблюдение касается признаков с идентичными характеристиками, таких как MOM10 и MOM30. Анализ этих признаков дает возможность рассмотреть введение новых признаков, таких как MOM20, которые могли бы улучшить производительность модели.
- Многие признаки показывают очень низкую относительную важность по большинству методов, что говорит о их малой или нулевой влиянии на прогнозируемую переменную. Это подтверждает возможность их удаления без ущерба для качества модели.
- Удаление примерно 50% признаков, которые оказались малоэффективными, позволяет значительно повысить эффективность всего подхода к моделированию. Это освобождает ресурсы для более глубоких исследований и оптимизации модели, включая поиск оптимальных гиперпараметров, что в перспективе может значительно улучшить точность моделирования.
Сокращение размерности позволяет не только ускорить обучение и предсказание моделей, но и повысить их точность за счет уменьшения шума и переобучения. Эффективное применение представленных методов сокращения размерности способствует созданию более простых, но при этом высокоэффективных моделей машинного обучения.
После сокращения размерности признаков построим модели с помощью функции modelEval (рис. 8) и посмотрим, что изменилось.
Из полученных результатов можно сделать выводы о производительности различных моделей машинного обучения на наборе данных.
Время на кросс-валидацию большинства моделей существенно сократилось относительно моделей, которые были построены с помощью всего ряда признаков. Время увеличилось только у моделей деревьев RF и TREE, которые по-прежнему показывают высокую точность на тренировочном наборе, что может свидетельствовать о переобучении. Время реализации крайне важно в условиях волатильного рынка криптовалют.
Точность моделей после сокращения признаков сильно изменилась только у модели KNN, которая значительно увеличила показатель кросс-валидации, при этом остальные модели показывают относительно такую же точность.
Рекомендации, которые можно дать инвесторам для определения торговой стратегии: если важна высокая точность и быстрая скорость, рассмотрите модели XGB или CAT, а для баланса между скоростью и точностью хорошим выбором может быть модель LDA. Если модель используется в среде, где возможно регулярное переобучение и обновление, RF и TREE могут показать хорошие результаты. Нужно учитывать риск переобучения, особенно с KNN и TREE, которые показали высокую точность на обучающих данных, но могут не так хорошо работать на новых данных.
7. Заключение
В проведенном исследовании были построены модели для прогнозирования сигнала к покупке и продаже криптовалюты биткоин, которая является первой и самой популярной криптовалютой с наибольшей рыночной капитализацией. В ходе исследования также были изучены особенности криптовалют и их рынков, технический анализ и торговые стратегии, а также применение методов машинного обучения.
Разработка торговой стратегии на основе скользящих средних показала возможности применения математических методов для создания эффективных торговых сигналов. Комплекс разработанных моделей машинного обучения успешно справился с задачей классификации сигналов к покупке и продаже, что демонстрирует важность машинного обучения в современных торговых стратегиях. Для валидации моделей использовалась пятиступенчатая кросс-валидация, а оценка проводилась на основе точности (accuracy) и скорости.
Важно помнить, что прошлые результаты не гарантируют будущую доходность, и использование моделей машинного обучения для прогнозирования торговых стратегий требует осторожности и дополнительного анализа. Тем не менее, с помощью правильно настроенной и обученной модели можно получить ценные знания для принятия решений на рынке криптовалют.
1 См.: https:/Avww.co
2 Криптовалюта биткоин // Bietstamp URL: https://www.bietstamp.net/markets/ (дата обращения: 04.10.2023).
About the authors
Svetlana S. Mikhaiylova
Financial University under the Government of the Russian Federation
Author for correspondence.
Email: ssmihajlova@fa.ru
ORCID iD: 0000-0001-9183-8519
Dr. Sci. (Econ.), Associate Professor, Professor, Department of Data Analysis and Machine Learning, Faculty of Information Technologyand and Big Data Analysis
Russian Federation, MoscowSabina A. Sabirova
Financial University under the Government of the Russian Federation
Email: 202617@edu.fa.ru
Faculty of Information Technology and Big Data Analysis
Russian Federation, MoscowReferences
- Belova E., Okorokov D. Technical analysis of financial markets. Tutorial. Litrov, 2021.
- Safiullin M.A., Elshin L.A., Abdukaeva A.A. Development of a stochastic model for medium-term forecasting of the cryptocurrency exchange rate (according to the scenario). Finance and Credit. 2018. Vol. 24. Issue 17. Pp. 1046–1060. (In Rus.)
- Avdeev A.V. Comparison of types of technical analysis indicators and selection of logical categories of indicators for further use in algorithms of the stock exchange trading system. News of Tula State University. Economic and Legal Sciences. 2019. No. 2. Pp. 12–18.
- Ostrinskaya L.I., Stragis A.Yu. Optimization of strategies when working in financial markets. Omsk Scientific Bulletin. 2005. No. 2 (31). Pp. 194–197. (In Rus.)
- Pershin A.D. Development of trading thirds of cryptocurrencies to determine entry and exit points of trading positions based on machine learning algorithms. Moscow, 2023.
- Bolshakov S.N., Kim O.L. Trading strategies of digital currencies on cryptobexchanges. Regional Problems of Economic Transformation. 2022. No. 2 (136). Pp. 82–90. (In Rus.)
- John K., O'Hara M., Saleh F. Bitcoin and more. Annual Review of Financial Economics. 2022. Vol. 14. Pp. 95–115. (In Rus.)
- Ferdiansyah. Research on Bitcoin stock market forecasting: Methods, techniques and tools. Annual research seminar for graduate students. April 10–11, 2019, Universiti Teknologi Malaysia, Johor Bahru, Skudai.
- Giudici G., Milne A., Vinogradov D. Cryptocurrencies: market analysis and prospects. Journal of Economics, Industry and Business. 2020. No. 47. P. 118. URL: https://doi.org/10.1007/s40812-019-00138-6.
Supplementary files








