Application of NLP Models to Extract Pricing Information from Unstructured Dialogues
- Authors: Bokarev D.V.1, Nikishov S.I.1
-
Affiliations:
- Russian Academy of National Economy and Public Administration under the President of the Russian Federation
- Issue: Vol 12, No 1 (2025)
- Pages: 182-193
- Section: MANAGEMENT IN ORGANIZATIONAL SYSTEMS
- URL: https://journals.eco-vector.com/2313-223X/article/view/679163
- DOI: https://doi.org/10.33693/2313-223X-2025-12-1-182-193
- EDN: https://elibrary.ru/NDXMJR
- ID: 679163
Cite item
Full Text
Abstract
Goal. This article discusses the theoretical and practical aspects of applying natural language processing (NLP) models in business processes of organizations of various scales. The purpose of the research is to systematize and analyze the main directions of NLP models’ application in modern business, as well as to develop practical recommendations for their effective implementation. Model. The research is based on the work of foreign authors who conceptually studied the application of NLP models in relation to various business processes. The research methodology is based on a systematic analysis of scientific publications and industry reports, a comparative analysis of technological solutions and a structural and functional approach to the systematization of NLP applications. Conclusions. The analysis of the main tasks solved using NLP models in business is carried out, among which are the generation of text content, text classification, automation of customer support, information summarization, machine translation and personalization of marketing interaction. The technological pipeline for creating and training NLP models is studied with a detailed examination of tokenization processes, vector representation of data, and the application of the attention mechanism. The research results demonstrate the high potential of NLP technologies for optimizing business processes. It has been revealed that, despite the growing interest in these technologies, their full-fledged implementation into the business processes of domestic companies remains limited. Practical significance. Practical recommendations on a strategic approach to the implementation of NLP technologies are formulated, including step-by-step integration with measurable results, focus on solving specific business problems and the need for investments in staff training. An example of the application of the model to solve the problem of extracting information from text in Russian is shown. Social consequences. The widespread introduction of NLP technologies in business leads to significant changes in the employment structure, requiring the retraining of specialists and the creation of new competencies in the labor market. Originality/value. The study is valuable for business leaders, IT specialists and digital transformation specialists, and offers a comprehensive analysis of the possibilities of using NLP technologies in various sectors of the economy. The novelty of the work lies in the systematization of NLP models in business, taking into account Russian specifics and current market trends.
Full Text
ВВЕДЕНИЕ
Бизнес представляет собой высококонкурентную экономическую среду, в которой достижение лидирующих позиций и их последующее удержание требует систематического внедрения и адаптации инновационных инструментов и технологий, появляющихся на современном рынке. Одним из актуальных решений в текущий момент являются NLP (Nature Language Processing) модели обработки естественного языка. NLP – направление в машинном обучении, относящееся к распознаванию, обработке и генерации устной и письменной речи. По исследованию Авито, в 2023 г. более половины (53%) компаний планировали внедрять в свою работы технологии ИИ в течение 2–3 лет1. При этом, согласно последним исследованиям, 94% компаний, внедривших данные технологии (среди которых присутствуют и NLP-решения) – отмечают сокращение операционных затрат, при этом 70% из них фиксируют рост EBITDA на 1–5%2. В связи с этим, целью настоящего исследования является систематизация и анализ основных направлений применения NLP-моделей в современном бизнесе, а также разработка практических рекомендаций по их эффективному внедрению в корпоративную среду с учетом технологических особенностей и текущих рыночных тенденций.
ЛИТЕРАТУРНЫЙ ОБЗОР
Обработка естественного языка (Natural Language Processing, NLP) как область исследований зародилась в 1950-х гг., когда Алан Тьюринг предложил свой знаменитый тест для определения интеллектуальности машины [19]. Первые значимые попытки создания автоматизированных систем для анализа текста были предприняты в 1960-х гг. в рамках проекта ALPAC (Automatic Language Processing Advisory Committee), который, несмотря на скептические выводы относительно возможностей машинного перевода того времени, заложил основу для дальнейших исследований [13]. Ранние системы NLP опирались на правила и лингвистические теории. Значительный прогресс произошел в 1980-х гг. с появлением статистических методов обработки языка, что позволило разрабатывать более гибкие и масштабируемые решения [14]. Однако революционный прорыв наступил с развитием методов машинного обучения и, в частности, нейронных сетей в начале 2000-х гг. [8]. В частности, современная эра NLP-моделей началась с появления распределенных представлений слов (word embeddings), среди них отметим Word2Vec [16] и GloVe [17]. Эти методы позволили представлять слова в виде векторов в многомерном пространстве, что существенно улучшило результаты в различных задачах обработки текста. В дальнейшем произошло крайне важное появление архитектуры Transformer, предложенной исследователями из Google Brain в работе “Attention is All You Need” [20]. Данная архитектура – за счет и, прежде всего, разработанного механизма внимания (attention) – преодолела ограничения рекуррентных нейронных сетей в обработке длинных последовательностей и параллельных вычислениях. На основе ее архитектуры были разработаны модели предварительного обучения – BERT (Bidirectional Encoder Representations from Transformers) [9], GPT (Generative Pre-trained Transformer) и их последующие версии – тем самым, был заложен крепкий фундамент для развития языковых моделей нового поколения, которое наблюдается сегодня, на этапе второй четверти XXI в.
Обозревая принцип работы современных NLP-моделей, необходимо отметить, что они работают по принципу предварительного обучения на больших объемах неразмеченных данных с последующим дообучением на конкретных задачах. Такой подход, иначе известный как “pre-training and fine-tuning”, позволяет моделям извлекать общие языковые закономерности из неразмеченных данных и затем адаптировать их к специфическим задачам [12]. В общем случае можно отметить следующие компоненты в работе современных NLP-моделей, рассматриваемые нами в качестве основных [15]:
- токенизация – разбиение текста на элементарные единицы (токены);
- векторное представление – преобразование токенов в векторы фиксированной размерности;
- механизм «внимания» (attention mechanism) – определение важности различных частей входного текста относительно друг друга;
- выходной слой – генерация результатов в зависимости от конкретной задачи.
Методологическая разработка прикладного применения NLP-моделей представляет собой задачу, которая является не менее сложной, чем их техническое развитие. Эффективная интеграция языковых моделей, к примеру, в бизнес-процессы требует не только понимания технических аспектов, но и глубокого знания предметной области, а также учета организационных, этических и экономических факторов. NLP-модели сегодня разрабатываются применительно к разным сферам (здравоохранение, национальная безопасность, производство и логистика, розничная торговля и электронная коммерция и пр.), ниже мы рассмотрим принцип работы и специфику применительно к бизнесу.
Применение NLP-моделей в бизнес-контексте активно исследуется целым рядом авторов. Так, вопросы использования NLP для анализа отзывов клиентов об организациях или продуктах и извлечения ценной информации из неструктурированных данных в отечественном научном дискурсе детально рассматривались И.Р. Мартыновой и Е.Н. Платоновой, а также В.В. Атоевым и А.Ф. Чувенковым, которые, акцентируясь на важности понимания удовлетворенности клиентов в бизнесе, пришли к выводу, что инструменты NLP значительно повышают точность анализа клиентского опыта, способствуют разработке персонализированных стратегий компании [1; 3]. Аналогичным образом практические аспекты применения NLP-технологий в сфере клиентского обслуживания освещены в работе А.В. Рогаткина [4] – автор анализирует возможности современных языковых моделей для «понимания» запросов клиентов, сформулированных на естественном языке. Рассматриваемые в исследовании модели (типа GPT-3 и BERT), как отмечает автор, успешно справляются с задачами машинного перевода, генерации текстов, ответов на вопросы и анализа тональности обращений – совокупно это обеспечивает оперативную маршрутизацию запросов к профильным специалистам и раннюю идентификацию потенциальных проблемных зон в обслуживании клиентов.
Более комплексный анализ достижения бизнес-целей посредством использования NLP-технологий представлен в исследовании А.В. Батищева, Р.С. Мамедова, Н.А. Кондратенко и А.В. Волкова [2]. Авторы систематизируют применение технологий обработки естественного языка в различных сферах бизнеса, при этом особый акцент отводится маркетинговым стратегиям российских компаний. В работе отмечается, что отечественные бизнес-лидеры, среди которых отмечены Сбер, Яндекс и VK, активно внедряют NLP-решения для генерации «лидов» с помощью чат-ботов, организации голосового поиска через интеллектуальных ассистентов (Алиса, Маруся и др.), анализа тональности пользовательских отзывов и автоматического реферирования контента. В качестве перспективных направлений развития NLP-технологий указаны, в частности, «распознавание эмоций, звуков, диаризации и биометрии» [2: 599], а также последовательное освоение новых отраслей – от передовых IT-компаний и банков к розничной торговле, страхованию, транспорту и сфере гостеприимства – таким образом, отмечается, что NLP-модели в последствии займут определенную нишу в каждом секторальном разрезе бизнес-среды.
Проблематика интеграции NLP-систем в корпоративные информационные экосистемы исследована, в свою очередь, в работах зарубежных исследователей – Дж. Кэппела и Ф. Чейзина [7], где авторы представили структурированный подход к оценке готовности организации к внедрению языковых технологий, а также собственно разработанную интегрированную платформу, которая помогает организациям связать цифровые представления имеющихся у них знаний с большими языковыми моделями (LLM) [7].
Кроме того, в зарубежной литературе отмечается, что применение NLP-моделей может быть особенно релевантным и целесообразным в вопросах оптимизации внутренних бизнес-процессов [18], автоматизированной обработка корпоративной документации с целью сокращения временных затрат на рутинные операции [11], в финансовом секторе (например, для анализа финансовых новостей и отчетов с целью прогнозирования рыночных трендов) [10].
МАТЕРИАЛЫ И МЕТОДЫ
Ранее исследуемая нами тема была детально изучена, прежде всего, зарубежными исследователями, среди которых наиболее известны И. Фишер и др. (финансовое прогнозирование, бухгалтерский учет, аудит), А. Фельстад, В. Ариф (автоматизация системы обслуживания клиентов), К. Синторис и К. Вергидис (модель управления бизнес-процессами), М. Бахджа (цифровизация процесса принятия решений) – именно они заложили фундаментальные принципы интеграции NLP-технологий в корпоративную среду и определили главные направления их практического использования в бизнесе [1; 2; 5; 6; 13]. Суммируя концептуальные разработки данных исследователей, ниже нами представлены обобщенные результаты исследования того, как функционируют и какие задачи решают NLP-модели в контексте бизнес-процессов.
РЕЗУЛЬТАТЫ
Анализируя, можно утверждать, что NLP-модели могут эффективно применяться для решения широкого спектра практических задач в современной бизнес-среде: от оптимизации внутренних процессов, минимизации затрат до повышения конкурентоспособности предприятия во внешней среде, причем отраслевая специфика здесь не имеет определенных ограничений. Самое простое и понятное применение, как нам представляется, – это генерация текста посредством NLP-моделей. Для бизнеса это может быть, к примеру, генерация карточек товара, полного описания по фотографиям товара или по кратким заметкам о нем3. Не менее важной задачей, которая решается применением NLP-моделей, является и классификация текстов. Таким образом возможно давать качественную оценку текста, помещая его в определенный класс по усмотрению пользователя. Это может быть эмоциональный окрас (положительный/отрицательный отзыв) или, например, анализ переписки покупателя и продавца на предмет итоговой договоренности о сделке. Такой подход широко применяется на торговых площадках для отслеживания основных метрик бизнеса, а именно целевых/нецелевых контактов. Также с помощью NLP можно автоматически из отзывов извлекать главные проблемы клиентов и присылать владельцу бизнеса в виде сгенерированного отчета или в целом мониторить репутацию бренда в интернете.
Комплексные подходы (обработка, генерация текста) применяются при обслуживании клиентов компании посредством создания чат-ботов для компании4. Данные системы обучаются на публичных данных о продуктах, сервисах, инструкциях и могут вместо живого оператора консультировать одновременно большое число клиентов компании, значимо сокращая расходы на поддержку. Системы также можно обучать и на внутренних данных, и использовать для онбордингов (от англ. onboarding – «введение в должность») новых сотрудников, сохраняя тем самым ресурс опытных коллег.
Кроме того, NLP-модели находят применение и в качестве инструмента саммаризации текстов5. Такое может потребоваться при длинных разговорах в чате или на звонке, модель собирает текст, выделяет главное, и присылает короткую выжимку после звонка, чтобы никто не забыл ключевые обсужденные темы и дальнейшие шаги, если такие были.
Автоматический перевод текстов и локализация клиентских приложений также возможны с помощью NLP-моделей. Локализация помогает компаниям более быстро, дешево и просто масштабировать свои услуги и продукты на международные рынки. Модели позволяют с минимальными затратами переводить контент приложений, а также обеспечивают мультиязычную поддержку клиентов каждый день.
NLP-модели могут применяться, чтобы персонализировать маркетинговое взаимодействие с клиентами с учетом анализа их покупок, предпочтений, поведения на ресурсах кампании. Такие данные можно применять для сегментации клиентов для более точного таргетинга, также использовать для персонализации рассылок по email и в социальных сетях, рекомендациях, а также настраивать рекламные компании на основании контента, который вызывает больший отклик у клиентов.
Итак, обобщая, основные сферы применения NLP в бизнесе таковы:
- автоматизация клиентской поддержки (чат-боты, виртуальные ассистенты);
- аналитика клиентского опыта (анализ отзывов, мониторинг бренда);
- оптимизация контент-маркетинга (генерация и анализ текстов);
- бизнес-аналитика и извлечение инсайтов из неструктурированных данных;
- автоматизация документооборота и обработки юридических документов;
- персонализация взаимодействия с клиентами;
- интеллектуальный поиск.
Далее рассмотрим пайплайн построения NLP-модели. Для создания собственной модели необходимо сделать 2 основных шага – собрать данные для обучения (или подготовить эти данные) и обучить на их основе модель. Для сбора данных в основном используются 2 подхода – сбор из открытых источников (веб-сайтов, социальных сетей), либо сбор из данных компании, – например внутренняя документация, история заказов, база клиентов, история пользовательских действий (посещение страниц веб-сайтов компании, прохождение опросов, добавление в избранное).
На следующем этапе необходимо обработать и подготовить данные для обучения модели. Для этого сперва нужно очистить данные от информации, которая дублируется или просто не нужна для работы. Очевидно, что, если при обучении будет достаточно много «лишних» данных, модель не сможет понять, какие из них представляют собой важную для учета информацию, а какие – нет. На последующем этапе осуществляется процесс токенизации, представляющий собой алгоритмическое разделение исходного текста на элементарные семантические единицы (токены). Токенизация может осуществляться по-разному, основные виды и соответствующие им примеры приведены в таблице ниже (табл. 1).
Таблица 1. Сравнительный анализ методов сегментации текста на лексические единицы (процесс токенизации)
Table 1. Comparative analysis of methods of text segmentation into lexical units (tokenization process)
Тип [Type] | Текст [Text] | Токены [Tokens] |
Деление на слова [Split by words] | Я люблю читать книги [I like to read books] | [Я, люблю, читать, книги] [I, like, to, read, books] |
Деление на символы [Split by symbols] | Любить [Like] | [Л, ю, б, и, т, ь] [l, i, k, e] |
Деление на фразы [Split by phrase] | При покупке шампуня, вы получаете гель в подарок [When you buy shampoo, you get gel as a gift] | [При покупке шампуня, вы получаете гель, в подарок] [When you buy shampoo, you get gel, as a gift] |
После завершения процесса токенизации происходит формирование структурированных текстовых корпусов, которые подлежат дальнейшей морфологической нормализации посредством алгоритмов лемматизации. В лингвистической системе русского языка присутствуют разные формы одних и тех же слов в зависимости от рода, падежа, времени или числа (например, красивая/красивое/красивый заменится на общее «красивый»). В дополнение к процедуре токенизации, в рамках предварительной обработки текстовых данных возможно применение алгоритмов стемминга, представляющего собой альтернативный метод морфологической редукции лексических единиц до их основы. Посредством стемминга производится алгоритмическое отсечение аффиксальных элементов (префиксов и суффиксов) с целью выделения корневой морфемы или основы слова (например, красивая/красивое/красивый заменится на общее «красив»). После этого необходима семантическая разметка подготовленных ранее данных. К примеру, может потребоваться определить язык, на котором написано слово или обозначить части речи.
Далее рассмотрим способы представления данных для обучения. Среди простых способов можно выделить: одномерное кодирование (One-hot encoding), мешок слов (Bag-of-Words), TF-IDF (Term Frequency-Inverse Document Frequency).
При одномерном кодировании (one-hot encoding) каждому слову в словаре присваивается уникальный вектор, состоящий преимущественно из нулей с единственной единицей на позиции, соответствующей индексу данного слова. Таким образом, создается вектор размерностью, равной общему количеству уникальных слов в корпусе, где единица указывает на присутствие конкретного слова, а все остальные позиции заполняются нулями. Данный подход отличается легкой реализацией и плохой масштабируемостью (размер вектора увеличивается с каждым новым словом).
Пример: словарь: [“дом”, “ананас”, “машина”]; “машина” кодируется [0, 0, 1]
С помощью метода «мешок слов» документ или предложение кодируется вектором, который показывает частотность слово в документе без учета порядка слов. Из преимуществ – аналогичная по простоте реализация, однако при этом – и это является не достатком – не учитывается порядок слов, без чего не получается корректной смысловой интерпретации.
Пример: словарь: [“Артем”, “хочет”, “есть”, “Алена”, “пить”];
Предложение 1: «Артем хочет есть» кодируется [1, 1, 1, 0, 0];
Предложение 2: «Алена хочет пить» кодируется [0, 1, 0, 1, 1];
Предложение 3: «Артем хочет есть, Алена хочет пить» кодируется [1, 2, 1, 1, 1].
Для выделения важности редких слов подходит метод TF-IDF. Данный метод сочетает два показателя: TF (Term Frequency) – измеряет, как часто слово встречается в конкретном документе, а IDF (Inverse Document Frequency) – показывает, насколько редко это слово встречается во всей коллекции документов, тем самым придавая большее значение уникальным терминам. Тем не менее, в методе все еще не учитывается порядок слов, что является недостатком. TF-IDF рассчитывается по формулам, представленным далее, при этом итоговый показатель TF-IDF представляет собой произведение двух количественных параметров:
Более сложным методом представления данных является векторное представление (Word Embeddings), например, Word2Vec или FastText. В данном методе слово преобразуется в вектор фиксированной длины, а близкие по семантике слова имеют похожие представления. Среди методов вроде Word2Vec существуют две разновидности, одна из которых предсказывает текущее слова, исходя из текущего контекста, а другая – предугадывает следующие слова, используя текущие. FastText – улучшенная версия Word2Vec, в которой слова разбиваются на n-граммы, позволяя при этом учитывать морфологию слов – например слово “собака” представляется как n-граммы “соб”, “оба”, ”бак”, “ака”. Модель же обучается на n-граммах и лучше понимает внутреннюю структуру слов, однако все еще не учитывает порядок слов в предложениях.
Более совершенным методом векторного представления лексических единиц выступают контекстно-зависимые векторные модели (Contextual Embeddings), которые, в отличие от статических представлений, учитывают семантическое окружение слова и способны отразить полисемию языковых единиц в зависимости от контекста их употребления. В BERT текст обрабатывается слева-направо и справа-налево, модель обучается на восстановлении пропущенных слов или предсказании следующих фраз. В таком подходе учитывается контекст каждого слова, и это делает модель более точной при решении сложных задач. GPT, в свою очередь, использует архитектуру трансформеров, обучается на больших корпусах текстов, а в дальнейшем дообучается на более мелких датасетах под конкретные задачи. Данные модели требуют больших вычислительных мощностей для обучения, однако отлично подходят под задачи генерации текстов, переводов, диалогов.
Недавний рост GPT-моделей показал готовность людей к использованию данных моделей даже для решения повседневных задач из-за простоты интерфейса (чат на сайте / в приложении). Для решения бизнес-задач есть корпоративные тарифы с платой за число использованных токенов. Получив доступ, можно через API-интерфейс отправлять запросы к модели и решать задачи, описанные выше.
Для более простого, бюджетного решения (или для более безопасного локального) можно использовать модели локально. Для этого есть возможность скачать необходимую модель с сервиса ollama6 – к примеру, одной из популярных моделей на данной платформе является llama3; также есть модели дополнительно дообученные на корпусах текстов на русском языке. После установки на локальный ПК можно через python-библиотеку ollama посылать батчевые (массовые) запросы к модели, и решать тем самым вышеописанные задачи.
Для более полного понимания перспектив использования NLP-технологий в бизнесе необходимо рассмотреть текущее состояние и тенденции развития соответствующего рынка как в глобальном, так и в национальном масштабе. Глобальный рынок NLP, оцениваемый в $13,2 млрд в 2022 г., к 2030 г., как показывают прогнозы, достигнет не менее 73 млрд долларов при среднегодовом темпе роста 20,1%. В мировом масштабе крупнейшим рынком будут США (2,85 млрд долларов США в 2025 г.), однако рынок NLP-моделей развивается и в России – по прогнозам, в 2025 г. объем национального рынка NLP на основе текста достигнет 250,99 млн долларов США7. Сама обработка естественного языка (NLP) занимает доминирующую позицию на российском рынке искусственного интеллекта и составила в 2023 г. 61,3% от общего объема рынка (рис. 1)8.
Рис. 1. Структура рынка искусственного интеллекта в России в 2023 г.:
1 – обработка естественного языка; 2 – анализ данных; 3 – генеративный ИИ; 4 – компьютерное зрение; 5 – финансовые технологии; 6 – реклама; 7 – промышленность; 8 – робототехника; 9 – распознавание речи
Fig. 1. Structure of the artificial intelligence market in Russia in 2023:
1 – NLP; 2 – data analysis; 3 – generative AI; 4 – CV; 5 – FinTech; 6 – promotion; 7 – industry; 8 – robotics; 9 – speech recognition
Это свидетельствует о высоком спросе на технологии анализа и обработки текстовой информации среди российских компаний. NLP-решения применяются преимущественно для аналитических задач, что подтверждается общей тенденцией рынка, где 95% всех ИИ-решений направлены именно на анализ данных, а не на исполнительные функции или распознавание9. Российские компании, ведущие разработки в области NLP, представлены на рынке в нескольких категориях. Прежде всего, это поисковики и компании, которые уже много лет занимаются текстовыми технологиями: «Яндекс» («Яндекс.Переводчик», «Алиса» и др.), ABBYY (продукты, внедренные в систему мониторинга Сбербанка), Mail.ru («Прометей», «Маруся»), PROMT (PROMT Translation Server), RCO (часть группы Rambler) и др. При этом структура применения NLP-технологий варьируется в зависимости от сектора экономики. В здравоохранении 17% организаций используют NLP для анализа медицинских записей и научных публикаций, тогда как в IT-секторе 16% компаний применяют эти технологии для автоматизации тестирования ПО и обработки технической документации. Финансовые институты (7% внедрений) активно задействуют NLP в риск-менеджменте, анализируя новостные потоки и отчеты для прогнозирования рыночных колебаний10. В функциональном разрезе лидером внедрения остаются маркетинг и продажи – 66% компаний используют генеративный ИИ для персонализации рекламы и создания контента11. Клиентский сервис занимает второе место (54%) за счет внедрения чат-ботов и систем анализа обратной связи.
ПРАКТИЧЕСКАЯ РЕАЛИЗАЦИЯ
Для демонстрации практической реализации описанных ранее техник был проведен эксперимент по решению конкретной бизнес-задачи. Рассматривалась торговая площадка, где заказчики и исполнители могут находить друг друга и договариваться о выполнении работ. Проблема заключается в том, что через площадку не производятся финансовые транзакции (оплата), следовательно, платформа не обладает структурированными данными о стоимости услуг. Это приводит к тому, что нельзя оценить долю рынка, которую занимает компания, и долю среднего чека. Задача была сформулирована следующим образом: на основе обезличенных данных переписки между заказчиками и исполнителями необходимо извлечь информацию о стоимости заключаемых сделок. Общий объем анализируемых данных составил 5000 диалогов. Далее будут представлены шаги реализации в решении данного вопроса – прежде всего, требовалось следовать от простой методологии к более сложной – по итогу нами были опробованы 3 метода решения поставленной задачи и проведено их аналитическое сопоставление. Для количественной оценки качества использовались следующие метрики:
- точность определения цены (Accuracy) – процент случаев, когда алгоритм определил цену с отклонением не более чем на 5% от фактической;
- полнота – доля диалогов, для которых алгоритм смог извлечь какую-либо ценовую информацию.
- погрешность – отклонение средней цены от эталона;
- время обработки – 1000 диалогов.
Первый подход основывался на применении регулярных выражений, разработанный для данного случая шаблон, способный обнаруживать различные форматы указания цены в текстах, представлен далее:
(?<!\d)(\d{1,3}(?:[ \t]?\d{3})*(?:[.,]?\d{1,2})?)\
s?(?:₱|руб\.?|р\.?)(?!\w)
Данный подход имеет как положительные, так и отрицательные характерные особенности. Из достоинств можно выделить высокую скорость обработки исходных данных (около 300 диалогов в секунду). Из недостатков – малую точность (порядка 22% точности на тестовом датасете) из-за невозможности обработать несколько появлений цен, составные цены, а также неявные указания валюты (без «р», «руб», «рублей», «₱»).
Для повышения точности был применен второй подход к решению задачи: была использована библиотека Natasha12 для извлечения именованных сущностей для корпусов русскоязычных текстов. Библиотека реализует алгоритмы для распознавания различных типов данных, в том числе денежные суммы. В нашем случае был реализован следующий алгоритм:
from natasha import MoneyExtractor, MorphVocab
def extract_price(text):
extractor = MoneyExtractor(MorphVocab())
spans = list(extractor(text))
return [{"integer": span.fact.integer, "currency": span.fact.currency}
for span in spans]
Здесь библиотека Natasha анализирует русскоязычный текст, используя специализированный MoneyExtractor, который находит упоминания денежных сумм с учетом особенностей языка. Для каждой найденной суммы извлекается числовое значение ("integer") и валюта ("currency"), что позволяет структурировать финансовую информацию из неформатированного текста в удобный для дальнейшего анализа JSON-формат. Подход оказался более качественным в отношении результата выходных данных по сравнению с регулярными выражениями, но при этом все еще демонстрировал недостаточное понимание контекста, что приводило к ошибкам в идентификации итоговой согласованной цены при наличии нескольких упоминаний различных сумм в диалоге.
Третьим подходом к решению вышеозвученной задачи стало применение большой языковой модели llama3-7b13, локально развернутой на тестовом стенде с процессором Apple M1 Max (10 ядер). Для этого на устройство была установлена предобученная модель и развернута локально в среде разработки. Далее к модели был разработан промпт, ориентированный на целостный анализ диалога с учетом контекста:
def process_dialog(dialog_text):
prompt = f"""
Проанализируй диалог между заказчиком и исполнителем:
{dialog_text}
Определи итоговую согласованную цену услуги в рублях.
Результат представь в формате JSON: {{"price": число или null}}
"""
response = model.generate(prompt)
return parse_response(response)
Видно, что в текущем случае используется структурированный запрос, который подается модели вместе с текстом диалога, чтобы извлечь информацию о цене с учетом полного контекста общения. Модель анализирует весь диалог целиком, выявляя согласованную итоговую цену, а затем возвращает структурированный ответ в формате JSON, который далее проходит через систему постобработки для исправления типичных ошибок интерпретации.
Итого было обработано 5000 контактов за 90 минут (≈ 1,08 секунд на диалог). В 28% диалогов модель смогла определить цену, в остальных 72% цена не была обнаружена.
Анализ результатов выявил ряд специфических проблем. Модель хуже справляется с составной ценой в диалоге в сравнении с тем, если она заранее посчитана исполнителем и названа единоразово (например, «будет стоить три пятьсот»). Также затруднения возникли при интерпретации выражений типа «5 рублей» в контексте, подразумевающем 5000 рублей. Это потребовало разработки системы постобработки результатов, а именно домножения однозначных и двузначных цен на 1000 (предполагая, что цены менее 100 рублей маловероятны), а также установления экспертно определенных пороговых значений цены (например, от 1500 до 60 000 рублей).
Результаты применения всех трех подходов (третий метод был представлен в двух вариантах) представлены в сводной табл. 2, где отображены итоговые метрики анализа.
Таблица 2. Сравнительный анализ методов извлечения ценовой информации
Table 2. Comparative analysis of price information extraction methods
Метрика [Metric] | Регулярные выражения [Regular expressions] | Natasha | llama3-7b | llama3-7b с постобработкой [llama3-7b with post-processing] |
Точность определения цены, % [Price determination accuracy, %] | 22,4 | 41,8 | 55,0 | 75,0 |
Полнота (% диалогов с извлеченной ценой) [Completeness (% of dialogs with extracted price)] | 31,2 | 35,3 | 28,0 | 28,0 |
Средняя выявленная цена [Average detected price] | 4600 | 4970 | 5090 | 5140 |
Отклонение средней цены от эталона, % [Deviation of average price from benchmark, %] | 11,4 | 4,3 | 2,0 | 1,0 |
Время обработки 1000 диалогов, с [Processing time for 1000 dialogs, sec] | 3,2 | 47,5 | 1080 | 1082 |
Как видно из результатов, большая языковая модель с последующей постобработкой обеспечивает наиболее высокую точность (75%), значительно превосходя как базовый подход с регулярными выражениями (22,4%), так и специализированную NLP-библиотеку (41,8%). При этом средняя цена, определенная с использованием оптимизированного метода (5140 рублей), максимально приближена к фактической средней цене тестового датасета (5192 рубля), с отклонением всего в 1%. Важно отметить компромисс между точностью и вычислительными затратами: наиболее точный метод требует значительно больше времени обработки по сравнению с базовым подходом. Однако в контексте данной бизнес-задачи, где приоритетом является точность оценки рыночных показателей, а не скорость обработки данных в реальном времени, такой компромисс представляется оправданным.
Итак, результаты эксперимента наглядно демонстрируют практическую ценность NLP-моделей в решении конкретных бизнес-задач, что подтверждает теоретические положения, изложенные в предыдущих разделах исследования.
ВЫВОДЫ
Анализ результатов проведенного исследования показывает, что технологии обработки естественного языка демонстрируют высокий потенциал для трансформации бизнес-процессов в различных отраслях экономики. Эксперимент по извлечению ценовой информации наглядно продемонстрировал практическую применимость NLP-моделей для решения конкретных бизнес-задач, требующих глубокого понимания контекста и семантики естественного языка. Выявленные направления применения NLP-моделей подтверждают их универсальность и гибкость, а структура российского рынка ИИ с доминирующей долей NLP-технологий (61,3%) свидетельствует о растущем признании их ценности бизнес-сообществом. Однако, несмотря на значительную долю технологий обработки естественного языка на российском рынке искусственного интеллекта, фактическое внедрение и применение NLP-решений в бизнес-процессах отечественных компаний пока не демонстрирует масштабного распространения. Большинство организаций находятся на начальной стадии цифровой трансформации, экспериментируя с отдельными элементами искусственного интеллекта, но не интегрируя их цельно в бизнес-процессы, что существенно ограничивает потенциальный экономический эффект от данных технологий.
Представляется в ходе обсуждения целесообразным выделить несколько рекомендаций по применению NLP в бизнесе.
- Стратегический подход к внедрению. Компаниям рекомендуется разработать четкую стратегию цифровой трансформации, где NLP-технологии будут интегрированы не как отдельные инструменты, а как часть комплексной системы автоматизации бизнес-процессов.
- Поэтапное внедрение с измеримыми результатами. Целесообразно начинать с небольших пилотных проектов с четко определенными метриками успеха. Например, автоматизация обработки входящих клиентских обращений может сократить время реакции на 40–60%, что напрямую отразится на удовлетворенности клиентов.
- Фокус на решении конкретных бизнес-задач. Вместо внедрения «технологий ради технологий», компаниям следует ориентироваться на решение реальных бизнес-проблем – к примеру, анализ потребительских отзывов с помощью NLP может выявить систематические проблемы в продуктах или услугах и тем самым позволит оперативно вносить улучшения.
- Инвестиции в обучение персонала. Даже самые продвинутые NLP-решения требуют компетентных сотрудников для их настройки и управления. Компаниям рекомендуется инвестировать в обучение технических специалистов и бизнес-пользователей для эффективного использования этих технологий.
- Интеграция с существующими системами. NLP-решения должны бесшовно интегрироваться с существующими информационными системами компании (CRM, ERP, системы документооборота).
- Мониторинг и оптимизация. После внедрения NLP-решений необходимо постоянно отслеживать их эффективность и вносить корректировки, поскольку технологии машинного обучения, лежащие в основе современных NLP-систем, требуют регулярного обновления моделей на основе новых данных.
ЗАКЛЮЧЕНИЕ
Итак, проведенное исследование демонстрирует, что технологии обработки естественного языка представляют собой перспективное направление развития искусственного интеллекта, имеющее значительный потенциал для трансформации бизнес-процессов в современных компаниях. NLP-модели видятся особенно перспективными для бизнеса, поскольку органично вписываются в общий тренд «цифровизации» экономики и открывают новые возможности для автоматизации процессов, повышения эффективности и создания конкурентных преимуществ. Пожалуй, главным фактором успешного внедрения NLP-технологий является систематический подход, учитывающий как технологические аспекты (выбор модели, методы предобработки и представления данных), так и организационные вопросы интеграции с существующими бизнес-процессами и ИТ-инфраструктурой.
1 Половина российских компаний готовы инвестировать во внедрение ИИ. 2023. URL: https://plusworld.ru/articles/52847/ (дата обращения: 15.01.2025).
2 Искусственный интеллект в бизнесе: где и как можно использовать // AWG. URL: https://www.awg.ru/news/iskusstvennyy-intellekt-v-biznesegde-i-kak-mozhno-ispolzovat/ (дата обращения: 15.01.2025).
3 Beyond ChatGPT: The future of generative AI for enterprises. 2023. URL: https://www.gartner.com/en/articles/beyond-chatgpt-the-future-of-generative-ai-for-enterprises (data of accesses: 20.02.2025
4 Революция AI 2.0. LLM + GPT: история, типы и влияние на мир вокруг нас. URL: https://just-ai.com/wp-content/uploads/2023/10/Revolution_AI_2-0_part1_2023.pdf (дата обращения: 15.01.2025).
5 Artifcial intelligence index report. 2023. URL: https://www.tadviser.ru/images/8/8b/HAI_AI-Index-Report_2023.pdf (data of accesses: 18.01.2025).
6 Ollama. URL: https://ollama.com/ (data of accesses: 10.02.2025).
7 Text-based NLP – Russia // Statista. URL: https://www.statista.com/outlook/tmo/artificial-intelligence/natural-language-processing/text-basednlp/russia (data of accesses: 18.01.2025).
8 Альманах «Искусственный интеллект» // МФТИ. URL: https://www.aireport.ru/ai_index_russia-2023 (дата обращения: 20.02.2025).
9 Альманах «Искусственный интеллект» // МФТИ. URL: https://www.aireport.ru/ai_index_russia-2023 (дата обращения: 18.01.2025).
10 Применение NLP растет, но технология должна стать проще и понятнее // itWeek. URL: https://www.itweek.ru/ai/article/detail.php?ID=220389 (дата обращения: 20.01.2025).
11 Искусственный интеллект в бизнесе: где и как можно использовать // AWG. URL: https://www.awg.ru/news/iskusstvennyy-intellekt-v-biznesegde-i-kak-mozhno-ispolzovat/ (дата обращения: 27.01.2025).
12 Проект Natasha – набор Python-библиотек для обработки текстов на естественном русском языке. URL: https://natasha.github.io/ (дата обращения: 20.01.2025).
13 llama3. URL: https://github.com/meta-llama/llama3 (data of accesses: 20.01.2025).
About the authors
Dmitry V. Bokarev
Russian Academy of National Economy and Public Administration under the President of the Russian Federation
Author for correspondence.
Email: dbokarevv@gmail.com
ORCID iD: 0009-0005-9883-9772
Postgraduate Student
Russian Federation, MoscowSergey I. Nikishov
Russian Academy of National Economy and Public Administration under the President of the Russian Federation
Email: nikishov-si@ranepa.ru
ORCID iD: 0000-0001-7407-2515
SPIN-code: 2004-3380
Dr. Sci. (Econ.), Associate Professor, Head of the Department of System and Software Engineering
Russian Federation, MoscowReferences
- Atoev V.V., Chuvenkov A.F. Application of artificial intelligence technologies to analyze customer satisfaction in the field of food delivery. In: Scientific vector: Collection of scientific works. Rostov-on-Don: Rostov State University of Economics “RINH”, 2024. Pp. 304–306. EDN: NVZEPI.
- Batishchev A.V., Mamedov R.S., Kondratenko N.A., Volkov A.A. Achieving business goals through the use of NLP. Natural-humanitarian Studies. 2023. No. 6 (50). Pp. 596–600. (In Rus.). EDN: PGNTXJ.
- Martynova I.R., Platonov E.N. Semantic analysis of reviews about organizations using machine learning methods. Modeling and Data Analysis. 2024. Vol. 14. No. 1. Pp. 7–26. (In Rus.). doi: 10.17759/mda.2024140101. EDN: FWXPLF.
- Rogatkin A.V. The use of artificial intelligence technologies to automate customer service processes and improve the quality of service. Bakery of Russia. 2024. Vol. 68. No. 2. Pp. 100–107. (In Rus.). EDN: OGCJXG.
- Arif W. Leveraging Natural Language Processing (NLP) for automated customer support systems. 2024. URL: https://www.researchgate.net/publication/384678656_Leveraging_Natural_Language_Processing_NLP_for_Automated_Customer_Support_Systems
- Bahja M. Natural Language Processing applications in business. 2021. doi: 10.5772/intechopen.92203. URL: https://www.intechopen.com/chapters/71990
- Cappel J., Chasin F. Bridging enterprise knowledge management and Natural Language Processing – integration framework and a prototype. In: Design Science research for a resilient future. Proceedings of 19th International Conference on Design Science Research in Information Systems and Technology, DESRIST 2024 (Trollhättan, Sweden, June 3–5, 2024). 2024. Pp. 278–294. doi: 10.1007/978-3-031-61175-9_19.
- Collobert R., Weston J. A unified architecture for natural language processing: Deep neural networks with multitask learning. In: Proceedings of the 25th international conference on machine learning. 2008. Pp. 160–167.
- Devlin J., Chang M.W., Lee K., Toutanova K. BERT: Pre-training of deep bidirectional transformers for language understanding. In: Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies. 2019. Pp. 4171–4186.
- Fisher I.E., Garnsey M.R., Hughes M.E. Natural language processing in accounting, auditing and finance: A synthesis of the literature with a roadmap for future research. Intelligent Systems in Accounting, Finance and Management. 2016. No. 23 (3). Pp. 157–214.
- Følstad A., Nordheim C.B., Bjørkli C.A. What makes users trust a chatbot for customer service? An exploratory interview study. In: International Conference on Internet Science. 2018. Pp. 194–208.
- Howard J., Ruder S. Universal language model fine-tuning for text classification. In: Proceedings of the 56th Annual Meeting of the Association for Computational Linguistics. 2018. Pp. 328–339.
- Hutchins J. Machine translation: Past, present, future. N.Y.: Ellis Horwood, 1986. 382 p. (Ellis Horwood Series in Computers and their Applications)
- Jelinek F. Self-organized language modeling for speech recognition. In: Readings in speech recognition. 1990. Pp. 450–506.
- Liu Y., Ott M., Goyal N. et al. RoBERTa: A robustly optimized BERT pretraining approach. arXiv preprint arXiv:1907.11692. 2019.
- Mikolov T., Chen K., Corrado G., Dean J. Efficient estimation of word representations in vector space. arXiv preprint arXiv:1301.3781. 2013.
- Pennington J., Socher R., Manning C.D. GloVe: Global vectors for word representation. In: Proceedings of the 2014 conference on empirical methods in natural language processing (EMNLP). 2014. Pp. 1532–1543.
- Sintoris K., Vergidis K. Extracting business process models using Natural Language Processing (NLP) techniques. 2017. Pp. 135–139. doi: 10.1109/CBI.2017.41.
- Turing A.M. Computing machinery and intelligence. Mind. 1950. No. 59 (236). Pp. 433–460.
- Vaswani A., Shazeer N., Parmar N. et al. Attention is all you need. In: Advances in neural information processing systems. 2017. Pp. 5998–6008.
Supplementary files

