An Overview of Existing Methods for Automatic Generation of Test Tasks in Natural Language
- Authors: Maslova M.A.1
-
Affiliations:
- Volzhsky Polytechnic Institute (branch) of Volgograd State Technical University
- Issue: Vol 10, No 4 (2023)
- Pages: 46-55
- Section: SYSTEM ANALYSIS, INFORMATION MANAGEMENT AND PROCESSING, STATISTICS
- URL: https://journals.eco-vector.com/2313-223X/article/view/626631
- DOI: https://doi.org/10.33693/2313-223X-2023-10-4-46-55
- ID: 626631
Cite item
Full Text
Abstract
Recently, in the field of education, much attention has been paid to the use of multiple choice questions as a tool for assessing knowledge. The development of test tasks requires a lot of time and is highly labor intensive. It is difficult to perform such a task manually, so many researchers offer various ways and approaches to automate the creation of test tasks in natural language. In this paper, we present an overview of scientific achievements in the field of automatic question generation, which examines the classification of question generation systems by dividing them into five groups: machine learning-based methods, neural network-based, tree-based, rule-based or template-based and hybrid methods.
Full Text
ВВЕДЕНИЕ
В последнее время в сфере образования большое внимание уделяется использованию вопросов с несколькими вариантами ответов в качестве инструмента оценки знаний. Преимуществами использования тестовых заданий можно назвать: возможность определить уровень знаний или когнитивных навыков, легкость в оценке, возможность применять в больших группах. Благодаря этим преимуществам тестирование стало широко использоваться для принятия решений при устройстве на работу и поступлении в вуз. Кроме того, с помощью тестовых заданий можно оценить, достигнуты ли соответствующие результаты обучения по определенному курсу, что может помочь при необходимости пересмотреть и скорректировать учебные мероприятия.
Несмотря на все перечисленные преимущества разработка тестовых заданий требует затрат большого количества времени и имеет высокую трудоемкость. Вручную такую задачу сложно выполнить, поэтому многие исследователи предлагают различные способы и подходы для автоматизации создания тестовых заданий на естественном языке.
1. КЛАССИФИКАЦИЯ МЕТОДОВ ГЕНЕРАЦИИ ТЕСТОВЫХ ЗАДАНИЙ
Методы и подходы в области автоматической генерации тестовых заданий можно разделить на пять групп:
- методы и подходы, основанные на машинном обу-чении;
- методы и подходы, основанные на нейронных сетях;
- методы и подходы, основанные на деревьях;
- методы и подходы, основанные на правила или шаблона;
- гибридные методы и подходы.
Были рассмотрены научные работы с 2019 по 2023 гг. До 2022 г. включительно многие рассматривали методы и подходы, основанные на деревьях и на правила или шаблонах. В 2023 г. предпочтение отдали методам и подходам, основанных на нейронных сетях и гибридным.
1.1. Методы и подходы, основанные на машинном обучении
В работе [Das et al., 2019] используют тегирование частей речи (POS) и метод точечной взаимной информации (PMI). В данной работе отбирают информативные предложения с использованием грубозернистого набора тегов части речи Penn Treebank. Далее из избранных предложений удаляются все знаки препинания удалили стоп-слова, которые не важны для данной области. Снова вводим новую строку, если в предложении присутствует стоп-слово. После этого с помощью тегера части речи отфильтровали слова, имеющие определенные теги, не меняя последовательности слов в строке. Далее с помощью метода PMI получили набор ключей-кандидатов. На следующем этапе для извлечения ключа-ответа применяется подход, основанный на сопоставлении ключевых слов. Для формирования вопроса или стебля опускается многозначное слово в информативном предложении, имеющее максимальное количество слов (триграмм или биграмм) и наибольшую оценку PMI в наборе. Если в информативном предложении нет ни одного многозначного слова, то выбирается однозначное слово, частота которого наиболее высока в наборе. Для определения категорий дистракторов обработали корпус и разделили близкородственные n-граммы на различные группы. Из подготовленного ранее списка дистракторов выбрали три объекта в качестве дистракторов вопроса по сходству длины слов, близких или равных ключу ответа.
В работе [Agarwal et al., 2022] используется глубокое обучение (DL). Весь процесс состоит из трех этапов:
- предварительно обученная современная DL-модель резюмирует абзац текста для получения релевантной информации;
- лингвистические признаки генерируют пары основ вопросов и ответов;
- генерация дистрактора происходит по ключевому или правильному ответу.
В работе [Riza et al., 2023] применяются тегирование частей речи (POS) и метод k-ближайших соседей (KNN). Сначала происходит сбор статей, из которых будут извлечены несколько вопросов, пригодных для использования в качестве вопросов с кратким ответом. Следующим шагом является разделение предложений. Далее производится предварительная обработка каждого предложения, полученного из абзаца: удаление символов и знаков. Далее происходит извлечение элементарных предложений или простых предложений из сложных предложений. Затем предложения группируются на пять заранее определенных классов: человек, местоположение, сущность, время и счет. На этом этапе определяются типы вопросов, которые могут быть сгенерированы. Затем на этом же этапе формируется вопросительное предложение и соответствующий ответ на него. Далее происходит составление вопросительных предложений в соответствии с типом вопроса. Полученные вопросительные предложения необходимо еще обработать, отсортировав или очистив от местоимений вопросительных предложений и ответов от местоимений, так как в вопросительных предложениях и ответах, содержащих местоимения ответами, содержащими местоимения, возникнет неоднозначность в ответе на вопрос. Затем происходит преобразование его в POS-тег и определение количества слов в вопросительном предложение-кандидат. Прежде чем использовать формулу KNN, POS-тег сначала преобразуется в числовое значение. Вопросительные предложения сортируются в соответствии с расстоянием до обучающих данных. Далее следует этап замены некоторых определенных слов их синонимами. К словам в предложении, которые будут заменены синонимами, относятся слова имеющие теги прилагательных, наречий и глаголов. Предложения кандидата на вопрос проверяется на грамматику и при наличии ошибок они исправляются. На финальном этапе происходит отбор или отбрасывание вопросов-кандидатов, которые исходят из одного и того же предложения.
1.2. Методы и подходы, основанные на нейронных сетях
В работе [Kim et al., 2019] применяются двунаправленные рекуррентная нейронные сети с долгой краткосрочной памятью (bi-LSTM) и механизм внимания. В качестве кодера они используют два однослойных двунаправленных LSTM. Они сначала выделяют целевой ответ внутри отрывка и заменяют соответствующий целевой ответ специальной лексемой <a>. В результате вероятность того, что сгенерированный вопрос содержит целевой ответ, снижается. Для кодирования целевого ответа они используют еще одну однослойную bi-LSTM. На последнем временном шаге кодирования ответа скрытое состояние каждой LSTM объединяется для формирования конечного скрытого состояния, которое представляет собой общую характеристику ответа. Извлекается ключевую информацию из целевого ответа, чтобы идентифицировать цель вопроса. На каждом этапе декодирования авторы используют модуль, основанный на внимании, называемый сетью ключевых слов, для извлечения ключевой информации из целевого ответа. Далее используем архитектуру, которая может генерировать слова путем запроса распределенного представления слов, с целью захвата семантической информации соответствующих слов.
В работе [Fung et al., 2020] используется языковая модель, основанная на механизме внимания (T5). Для генерации специальных вопросов использует предварительно обученную модель понимания естественного языка, Text-To-Text Transfer Transformer (T5), а также адаптированную версию набора данных для машинного понимания чтения SQuAD 2.0. SQuAD 2.0. Генерация вопросов включает в себя определение регулярных глаголов в тексте и использование лексем глагола в качестве вариантов ответа вариантов ответа.
В работе [Астрашаб и др., 2020] используется рекуррентная нейронная сеть (RNN). Предложенная модель состоит из двух частей: рекуррентная нейронная сеть (RNN), которая обнаруживает слова, которые с наибольшей вероятностью являются ответами на потенциальные вопросы, кодирующая-декодирующая нейронная сеть (encoder-decoder), которая генерирует вопросы к словам, выбранным RNN как наиболее вероятные ответы.
В работе [Steuer et al., 2020] применяется двунаправленные рекуррентная нейронные сети с долгой краткосрочной памятью (bi-LSTM). Наше исследование обусловлено тем, что системы нейронной генерации вопросов (NQG) без учета ответов превосходят системы, основанные на правилах, на образовательных наборах данных, а системы NQG с учетом ответов превосходят все остальные системы на не образовательных наборах данных. Предполагается, что при использовании различных стратегий грамматическая сторона вопроса не изменяется, а полезность генерируемых вопросов и соответствующих им типов вопросов (например, «что» и «почему») зависит от различных стратегий выбора ответа. Полезным считается вопрос, охватывающий основные понятия или способствующий пониманию текста, в то время как бесполезный вопрос не способствует лучшему пониманию текста.
В работе [Wang et al., 2020] используют языковая модель, основанная на архитектуре трансформер (BERT), механизм внимания и механизм копирования. С помощью модели BERT преобразуется входная последовательности истории разговора и релевантного отрывка в непрерывную последовательность представлений. Применяются три различных механизма упорядочивания диалога истории и релевантного отрывка. После комплексного объединения в BERT-модели последовательности представлений преобразуются в семантические представления текста отрывка и истории диалога. Подслой самовнимания в декодере модифицируется таким образом, чтобы не обращать внимания на последующие позиции, обеспечивая прогнозирование только в зависимости от известных выходов. Далее применяется точечно-производное внимание к скрытым состояниям декодера с кодированными представлениями, чтобы получить посещаемые представления лексем и соответствующее распределение веса внимания. В дальнейшем распределение лексики вычисляется с помощью нейронной сети с прямолинейным движением.
В работе [Aithal et al., 2021] применяется нейронная сеть прогнозирования временных рядов (ProphetNet) и языковая модель, основанная на архитектуре трансформер (BERT). Система автоматического формирования пар вопрос-ответ использует предварительно обученные веса современной системы ProphetNet для генерации вопросов и модель BERT для генерации ответов на сгенерированные вопросы. Если системе задаются дополнительные вопросы, то перед передачей их в систему ответов на вопросы они идентифицируются либо как вопросы, на которые можно ответить, либо как вопросы, на которые нельзя ответить и которые не являются релевантными. Для идентификации вопросов вводится механизм, называемый механизмом сходства вопросов. Этот механизм вычисляет косинусоидальное сходство между сгенерированными вопросами и заданным вопросом.
В работе [Murugan et al., 2022] используют модель векторного представления слов (word2vec), модель обучения ранжированию (LTR) и метода обучения ранжированию (IR-LISTWISE). Кандидаты в дистракторы собираются на основе комбинированного подхода к сходству (как семантическому, так и орфографическому), связанному с целевым словом, с помощью модели word2vec. Чтобы избежать использования более одного правильного ответа в качестве дистрактора, процесс фильтрации осуществляется методом обучения ранжированию. Для обучения функции ранжирования были исследованы модели LTR, основанные на характеристиках. На основе метода обучения ранжированию IR-LISTWISE для фильтрации и ранжирования дистракторов были использованы списочные подходы.
В работе [Rodriguez-Torrealba et al., 2022] используется языковая модель, основанная на механизме внимания (T5). При получении ссылки на статью Википедии происходит генерация списка абзацев. Далее генерируются пары вопросов со своим правильным ответом, используя один из абзацев, полученных на предыдущем шаге. Для генерации этих пар используется модель, получившая название QAPModel (Question/Answer Pairs Model), использующая дуализм генерации вопросов (QG) и генерации ответов (QA). Реализация состоит из набора предварительно обученных моделей T5 на задачах QG и QA в сочетании с конвейером обработки. Постепенно берется каждая из пар вопросов и правильных ответов, полученных на предыдущем этапе, и вместе с абзацем (информационным контекстом) формирует список неправильных ответов (дистракторов). Для решения этой задачи предлагается модель DGModel, основанная на одной языковой модели T5, настроенной на преобразование правильного ответа в неправильный с помощью связанного с ним вопроса и контекста. После того как дистракторы получены, выполняется расчет на основе косинусоидального сходства между векторами слов дистрактора (неправильного ответа) и правильного ответа, при этом стоп-слова удаляются. Результатом этого шага является набор дистракторов и их оценки. Наконец, происходит координация и сбор результатов каждого этапа, а затем выполняется форматирование анкеты тестового задания и формируется конечный результат в виде структурированного JSON, включающего список вопросов для данного параграфа, каждый вопрос сопровождается набором ответов, идентифицированных как правильные или нет, и включает оценку сходства.
В работе [Wang et al., 2023] используется языковая модель, основанная на механизме внимания (T5). На этапе предварительной обработки данных собранные материалы курса обрабатываются отдельно для последующего сравнения сопоставления текста с текстом и генерации тестовых вопросов. В предлагаемом методе для генерации ответа используется предварительно обученная модель T5. Для генерации вопросов проводится тонкую настройку другой предварительно обученной модели T5. В сетевой архитектуре T5 цель модели – объединить последовательность слов в предложение. Авторы комбинируют генерацию ответов и предварительное обучение T5 для генерации вопросов.
В работе [Shuai et al., 2023] используется модель данных RACE. В данной работе выявляется, что дистракторы так или иначе связаны с фоновыми статьями, путем подавления этих связанных частей, что позволяет сгенерированным вопросам быть лучше сфокусированными на соответствующих частях правильных ответов.
В работе [Guan et al., 2023] используется нейронные сети с закрытой последовательностью графов (GGNN). Для решения этой проблемы в данной работе рассматриваются возможность сочетания обучения с подкреплением и семантически богатой информацией для генерации глубоких вопросов. В частности, предлагается модель глубокой генерации вопросов на основе семантического обучения с подкреплением (SRL-DQG), которая лучше использует семантические графы представлений документов на основе нейронной сети Gated Graph Neural Network (GGNN). Для генерации высококачественных вопросов также оптимизируются конкретные задачи с помощью обучения с подкреплением, учитывая четыре фактора оценки: естественность, релевантность, возможность ответа и сложность.
1.3. Методы и подходы, основанные на правилах или шаблонах
В работе [Leo et al., 2019] применяют EMMeT-OWL. В представленной системе реализованы четыре шаблона медицинских вопросов. Каждый шаблон имеет свой конструктор сущностей, отвечающий за предоставление набора сущностей, соответствующих строке вопроса. При задании специальности, ключа и демографических данных пациента построители стволов получают из EMMeT-OWL набор допустимых стволовых сущностей, которые могут быть использованы в стволе вопроса. Построители стеблей реализуют необходимые правила для каждого шаблона вопроса. Каждому шаблону назначается разработчик вариантов, отвечающий за предоставление набора сущностей, которые могут быть использованы в качестве возможных ответов в шаблоне. При задании специализации, ключа, демографических данных пациента и списка сущностей-стеблей каждый создатель вариантов будет искать в EMMeT-OWL сущности, которые являются допустимыми по правилам шаблона. Кроме того, работая с калькулятором сложности, создатель варианта присваивает сложность каждому объекту варианта в зависимости от текущего содержания вопроса. Каждый шаблон имеет свой генератор текста вопроса. Несмотря на то, что правила шаблона фиксированы, способ появления в вопросе сущностей-стеблей будет отличаться в зависимости от их типа (общего суперкласса, к которому они относятся).
В работе [Ли, 2020] применяется технология OSTIS. Сгенерированные вопросы хранятся в базе знаний подсистемы автоматической генерации вопросов в виде представления SC-кода. В работе используются следующие стратегии: стратегия генерации на основе элементов, стратегия генерации на основе классов, стратегия генерации на основе идентификаторов, стратегия генерации на основе аксиом, стратегия генерации на основе свойств отношений, стратегия генерации на основе примеров изображений, стратегия генерации субъективных вопросов. Вопросы, которые автоматически генерируются с использованием стратегий, перечисленных выше, могут содержать повторяющиеся и неправильные вопросы. Следовательно, чтобы обеспечить качество сгенерированных вопросов, вы должны сначала сохранить эти автоматически сгенерированные вопросы в базе знаний подсистемы автоматической генерации вопросов, а затем использовать ручной или автоматический подход для фильтрации повторяющихся и неправильных вопросов. Основой базы знаний любой системы OSTIS является иерархическая система предметных областей и соответствующих им онтологий.
В работе [Li et al., 2020] используется технология OSTIS и подход SPICE. В работе используются следующие стратегии: стратегия генерации на основе элементов, стратегия генерации на основе классов, стратегия генерации на основе идентификаторов, стратегия генерации на основе аксиом, стратегия генерации на основе свойств отношений, стратегия генерации на основе примеров изображений, стратегия генерации субъективных вопросов. Используя предложенные выше подходы, можно автоматически генерировать вопросы с выбором, вопросы с заполнением пустого места, вопросы с суждениями, вопросы с объяснением определений, и т.д. Когда пользователю необходимо пройти тестирование, система извлекает из онтологии вопросов конкретные типы вопросов в соответствии с требованиями пользователя, а затем преобразует их в естественно-языковую форму с помощью естественно-языкового интерфейса. На основе подхода SPICE предлагается подход к автоматической проверке ответов на субъективные вопросы с использованием технологии OSTIS. Подходы к проверке ответов на основе фактических знаний и логических знаний схожи, ответы, описываемые семантическим графом, разбиваются на подструктуры в соответствии с определенными подходами, а затем сравнивается их схожесть.
В работе [Десятириков, 2021] используются шаблоны вопросов. Для хранения банка вопросов был выбран текстовый формат JSON. Реализация проекта потребовала выполнения следующих этапов: создание графической модели в формате .xml, создание основных классов, используемых в проекте, создание логической модели, объявление и создание основных методов, тестирование промежуточного результата, интеграция медиаплеера, добавление структур json для хранения вопросов.
В работе [Li, 2022] используется технология OSTIS. Основной принцип автоматической генерации тестовых вопросов различных в ostis-системах заключается в том, что сначала из базы знаний извлекаются соответствующие семантические фрагменты с использованием ряда стратегий генерации тестовых вопросов, обобщенных на основе подхода представления знаний и структуры описания знаний в рамках технологии OSTIS, затем к извлеченным семантическим фрагментам добавляется информация об описании тестового вопроса, и, наконец, семантические фрагменты, описывающие полные тестовые вопросы, сохраняются в соответствующем разделе универсальной подсистемы. Поэтому в данной работе на основе существующих методов и систем отображения онтологий предлагается подход к установлению отношений отображения потенциально эквивалентных пар переменных scnode между семантическими графами в соответствии с семантическими структурами (различными sc-конструкциями).
В работе [Kusuma et al., 2022] используется SPARQL. В данном исследовании выделяются шесть основных процессов: процесс создания онтологии, процесс создания шаблона, определение уровня сложности вопроса, определение SPARQL-запроса для получения информации, генерация вопроса и оценка.
1.4. Методы и подходы, основанные на деревьях
В работе [Conejo et al., 2022] используется техника построения нисходящего синтаксического анализатора (LL(1)). Данная статья посвящена одному из таких случаев – конструированию грамматики LL(1) конструкции. Это хорошо известная техника построения нисходящего синтаксического анализатора.
1.5. Гибридные методы и подходы
В работе [Chen et al., 2019] используются модель для распределенного представления слов (GloVe), языковая модель, основанная на архитектуре трансформер (BERT), технология распознавание именованных сущностей (NER), тегирование частей речи (POS), двунаправленные рекуррентные нейронные сети с долгой краткосрочной памятью (bi-LSTM), двунаправленные рекуррентные нейронные сети с закрытой последовательностью графов (bi-GGNN). Сначала выполняется мягкое выравнивание между отрывком и ответом на основе их предварительно обученных вкраплений GloVe и вычисляются итоговые вкрапления отрывка путем вкрапления GloVe, вкрапления BERT и вкрапления лингвистических признаков (т.е. падежей, NER и POS) в текст отрывка, соответственно. Затем к итоговым вложениям отрывков применяется двунаправленная LSTM для получения контекстуализированных вложений отрывков. Строится направленный невзвешенный граф отрывка на основе синтаксического анализа зависимостей. Для эффективного обучения вкраплениям графов из построенного текстового графа предлагается нейронная сеть Bidirectional Gated Graph Neural Network (BiGGNN. В работе применяется декодер на основе LSTM, основанный на внимании, с механизмами копирования и покрытия. Декодер принимает в качестве начальных скрытых состояний вложение на уровне графа, затем два отдельных полносвязных слоя, а в качестве памяти внимания – вложения узлов, и генерирует выходное равенство по одному слову за раз.
В работе [Azevedo et al., 2020] используют тегирование частей речи (POS), распознавание именованных сущностей (NER) и дерево синтаксического разбора зависимостей. Первый этап генерации вопросов непосредственно связан с отбором предложений, содержащих один или несколько сомнительных фактов. Для решения этой задачи используется POS-тегирование в сочетании с NER. Следующим этапом является выбор слова или набора слов, которые будут являться ответом (подбор ключа) на сформированный вопрос. Эти слова представляют собой сомнительные факты и могут относиться к людям, местам, датам, суммам, организациям и событиям. Последний этап отвечает за выполнение необходимых преобразований исходного предложения для создания вопросительного предложения. Правила трансформации учитывают положение местоимений, вспомогательных и основных глаголов, а также фраз, находящихся в активной и пассивной форме. Для анализа вопроса выполняется NER. Производится извлечение всех субъектов и всех объектов с помощью Stanford CoreNLP, которая позволяет получить дерево синтаксического разбора зависимостей, а также POS-теги. Полученные сущности, субъекты и объекты будут упоминаться как ключевые слова.
В работе [Das et al., 2019] применяют алгоритм кластеризации K-means, метод RAKE, распознавание именованных сущностей (NER) и дерево разбора. Сначала отделяются все существующие простые предложения от других предложений по признаку наличия в предложении одной независимой клаузы. Для идентификации ключевых слов из корпуса используется метод RAKE. После того как ключ ответа определен, для определения категории ключа ответа используется Стэндфордский распознаватель именованных сущностей (NER). Стебель формируется путем замены ключа ответа на подходящее вопросительное слово. Структура дерева разбора идентифицированного информативного предложения опрашивается на предмет размещения вопросительного слова в соответствующей позиции или длины предложения до его усечения. В данной работе предложен метод выявления многословных дистракторов с помощью алгоритма кластеризации K-means.
В работе [Kumar et al., 2023] используют онтологический метод и технологию машинного обучения. Входной PDF-файл подвергается автоматической предварительной обработке с помощью программы для получения текстового файла. Далее текстовый файл отправляется на последующие этапы OBT и MBT одновременно. Онтологический метод (OBT), позволяющий генерировать вопросы специального типа, включает три этапа: моделирование онтологии, создание дерева экземпляров, последний этап – представление переменных и преобразование вопросов специального типа. Полученный текстовый файл после предварительной обработки передается в MBT (Технология машинного обучения) для генерации вопросов с заполнением пропусков (cloze). Составление вопросов сloze происходит в три этапа: Выбор предложений, извлечение ключевых предложений и выбор ключевых слов.
В работе [Chomphooyod et al., 2023] применяются тегирование частей речи (POS) и языковая модель, основанная на механизме внимания (T5). Система состоит из двух этапов: обучения и генерации. На этапе обучения в модель машинного обучения вводятся предварительно обработанные обучающие данные для оптимальной настройки весов и смещений для задачи генерации текста. Далее обученная модель используется на этапе генерации. На этапе генерации происходит создание тестовых вопросов по заданным требованиям пользователя. Эта фаза начинается с того, что пользователь вводит в систему ключевое слово и грамматическую тему. Далее извлекаются все POS-последовательности, релевантные информации, предоставленной пользователем. Затем с помощью коэффициента совпадения ключевых слов, находится наиболее релевантная POS-последовательность. Далее POS-последовательность подвергается предварительной обработке и поступает на вход модели генерации текста. После получения сгенерированного предложения выбирается правильный ключ ответа и генерируются дистракторы в соответствии с заданной грамматической темой.
2. СРАВНЕНИЕ МЕТОДОВ И ПОХОДОВ
В табл. 1 приведено сравнение групп методов генерации тестовых заданий. В ней представлены выявленные общие для группы положительные и отрицательные качества. Но у ряда рассмотренные систем присутствуют также достоинства и недостатки не присущие всем остальным подходам в их группе.
Таблица 1
Сравнение групп методов [Comparison of groups of methods]
Наименование группы методов [Name of method group] | Достоинства [Advantages] | Недостатки [Disadvantages] | Ссылка на источник [Source link] |
Методы и подходы, основанные на машинном обучении [Methods and approaches based on machine learning] | · Модель не опирается на какие-либо разработанные вручную правила или специальные стратегии и полностью поддается сквозному обучению [The model does not rely on any manually developed rules or ad-hoc strategies and is fully trainable end-to-end] · Приемлемое качество вопросов [Acceptable quality of questions] | · Системе для генерации вопросов требуется большой корпус [System requires a large corpus to generate questions] · Требуются большие вычислительные мощности [Requires a lot of computing power] | [Das et al., 2019; Agarwal et al., 2022; Riza et al., 2023] |
Методы и подходы, основанные на нейронных сетях [Methods and approaches based on neural networks] | · Модель не опирается на какие-либо разработанные вручную правила или специальные стратегии и полностью поддается сквозному обучению [Model does not rely on any manually developed rules or specific strategies and is fully trainable end-to-end] · Быстро генерируются вопросы [Questions are generated quickly] · Обладает хорошей способностью генерировать текст в рамках контекста при значительной вариативности слов, включаемых в результат [Has a good ability to generate text within context with considerable variation in the words included in the output] | · Контекст вопроса может не совпадать с контекстом начального предложения [The context of the question may not be the same as the context of the initial sentence] · Сгенерированные дистракторы не очень точны [Generated distractors are not very accurate] | [Kim et al., 2019; Fung et al., 2020; Астрашаб и др., 2020; Steuer et al., 2020; Wang et al., 2020; Aithal et al., 2021; Murugan, Ramakrishnan, 2022; Rodriguez-Torrealba et al., 2022; Wang et al., 2023; Shuai et al., 2023; Guan et al., 2023] |
Методы и подходы, основанные а деревьях [Tree-based methods and approaches] | Хорошее качество вопросов [Good quality questions] | · Необходимо разработать вручную грамматику [Need to develop a manual grammar] · Модель сложно адаптировать под другие предметные области [Model is difficult to adapt to other subject areas] | [Conejo et al., 2022] |
Методы и подходы, основанные на правилах или шаблонах [Rule- or pattern-based methods and approaches] | Хорошее качество вопросов [Good quality questions] | · Необходимо наличие хорошей базы знаний по требуемой предметной области [It is necessary to have a good knowledge base in the required subject area] · Невозможно контролировать качество и частоту повторений автоматически сгенерированных вопросов в онтологии вопросов [It is not possible to control the quality and repetition rate of automatically generated questions in the question ontology] | [Leo et al., 2019; Ли, 2020; Li, 2020; Десятириков, 2021; Li, 2022; Kusuma et al., 2022] |
Гибридные методы и подходы [Hybrid methods and approaches] | · Модель не опирается на какие-либо разработанные вручную правила или специальные стратегии и полностью поддается сквозному обучению [Model does not rely on any manually developed rules or specific strategies and is fully trainable end-to-end] · Простые специальные вопросы могут быть сформулированы без каких-либо затруднений [Simple special questions can be formulated without any difficulty] · Высока грамотность сгенерированных вопросов [The literacy of the generated questions is high] | Могут генерироваться семантически неверные вопросы [Semantically incorrect questions may be generated] | [Chen et al., 2019; Azevedo et al., 2020; Das et al., 2021; Kumar et al., 2023; Riza et al., 2023; Chomphooyod et al., 2023] |
В работе [Das et al., 2019] для генерации вопросов требуется большой корпус и генерируются только вопросы для заполнения пропусков. В системах [Kim et al., 2019] и [Steuer et al., 2020] представлены модифицированная модели и точность данных моделей ниже оригинальных. Метод [Chen et al., 2019] на основе Graph2Seq учитывает больше информации о скрытой структуре, например, семантическое сходство между любыми парами слов, которые не связаны напрямую, или синтаксические отношения между двумя словами, зафиксированные в дереве разбора зависимостей. Но использование GCN в качестве граф-кодера и преобразование входного графа в неориентированный граф не дает хорошей производительности системы. В системах [Ли, 2020] и [Kumar et al., 2023] отсутствует генерация дистракторов. В работе [Wang et al., 2020] модель позволяет генерировать более связные и информативные высказывания, но отсутствует рассуждения по нескольким отрывкам или источникам знаний для выделения наиболее релевантного текстового контента знаний. Модели из работ [Das et al., 2021; Murugan et al., 2022] генерирует только дистракторы. В системах [Rodriguez-Torrealba et al., 2022] и [Wang et al., 2023] сгенерированные дистракторы не очень точны. В работе [Guan et al., 2023] GGNN использует одни и те же параметры в итерации.
ЗАКЛЮЧЕНИЕ
В данной работе представлен обзор литературы по автоматической генерации вопросов. Были классифицировали методики генерации вопросов по пяти группам: основанные на машинном обучении, основанные на нейронных сетях, основанные на деревьях, основанные на правила или шаблона и гибридные методы. Существует ряд аспектов, которые пока не нашли своего отражения. Например, генерируемые вопросы недостаточно естественны и иногда не имеют смысла с точки зрения информационного поиска. Можно добиться определенных улучшений в генерации семантически значимых и релевантных вопросов для информационного поиска. Необходимо разрабатывать модели, представляющие собой комбинацию нескольких методик, учитывающих каждый аспект и в то же время подходящих для решения поставленной задачи.
About the authors
Maria A. Maslova
Volzhsky Polytechnic Institute (branch) of Volgograd State Technical University
Author for correspondence.
Email: miss.mari.m@inbox.ru
ORCID iD: 0000-0003-3845-3972
senior teacher at the Department of Computer Science and Programming Technology
Russian Federation, VolzhskyReferences
- Agarwal R., Negi V., Kalra A., Mittal A. Deep learning and linguistic feature based automatic multiple choice question generation from text. In: International Conference on Distributed Computing and Intelligent Technology. 2022. Vol. 13145. Pp. 260–264. URL: https://doi.org/10.1007/978-3-030-94876-4_18
- Aithal S.G., Rao A.B., Singh S. Automatic question-answer pairs generation and question similarity mechanism in question answering system. Applied Intelligence. 2021. No. 51. Pp. 8484–8497. URL: https://doi.org/10.1007/s10489-021-02348-9
- Azevedo P., Leite B., Cardoso H.L. et al. Exploring NLP and information extraction to jointly address question generation and answering. In: International Conference on Artificial Intelligence Applications and Innovations. 2020. Vol. 584. Pp. 396–407. URL: https://doi.org/10.1007/978-3-030-49186-4_33
- Chen Y., Wu L., Zaki M.J. Reinforcement learning based graph-to-sequence model for natural question generation. In: International Conference on Learning Representations. 2019. URL: https://arxiv.org/abs/1908.04942
- Chomphooyod P., Suchato A., Tuaycharoen N., Punyabukkana Pr. English grammar multiple-choice question generation using Text-to-Text Transfer Transformer. Computers and Education: Artificial Intelligence. 2023. Vol. 5. URL: https://doi.org/10.1016/j.caeai.2023.100158.
- Conejo R., del Campo-Ávila J., Barros B. First steps towards automatic question generation and assessment of LL(1) grammars. In: International Conference on Artificial Intelligence in Education. Posters and Late Breaking Results, Workshops and Tutorials, Industry and Innovation Tracks, Practitioners’ and Doctoral Consortium. 2022. Vol. 13356. Pp. 271–275. URL: https://doi.org/10.1007/978-3-031-11647-6_50
- Das B., Majumder M., Phadikar S., Ahmed Sk.A. Automatic generation of fill-in-the-blank question with corpus-based distractors for E-assessment to enhance learning. Computer Applications in Engineering Education. 2019. No. 27. Pp. 1485–1495.
- Das B., Majumder M., Phadikar S., Sekh A.A. Multiple-choice question generation with auto-generated distractors for computer-assisted educational assessment. Multimedia Tools and Applications. 2021. No. 80. Pp. 31907–31925. URL: https://doi.org/10.1007/s11042-021-11222-2
- Fung Y., Kwok J.C., Lee L. et al. Automatic question generation system for English reading comprehension. ICTE: Technology in Education. Innovations for Online Teaching and Learning. 2020. Pp. 136–146.
- Guan M., Mondal S.K., Dai H.N., Bao H. Reinforcement learning-driven deep question generation with rich semantics. Information Processing and Management. 2023. Vol. 60. No. 2. URL: https://doi.org/10.1016/j.ipm.2022.103232
- Kim Ya., Lee Hw., Shin J., Jung K. Improving neural question generation using answer separation. In: The Thirty-Third AAAI Conference on Artificial Intelligence. 2019. Pp. 6602–6609.
- Kumar A.P., Nayak A., K M.S. et al. A Novel Framework for the Generation of Multiple Choice Question Stems Using Semantic and Machine-Learning Techniques. International Journal of Artificial Intelligence in Education. 2023. URL: https://doi.org/10.1007/s40593-023-00333-6
- Kusuma S.F., Siahaan D.O., Fatichah Ch. Automatic question generation with various difficulty levels based on knowledge ontology using a query template. Knowledge-Based Systems. 2022. Vol. 249. URL: https://doi.org/10.1016/j.knosys.2022.108906
- Leo J., Kurdi G., Matentzoglu N. et al. Ontology-based generation of medical, multi-term MCQ. International Journal of Artificial Intelligence in Education. 2019. No. 29. Pp. 145–188.
- Li W. A semantics-based approach to automatic generation of test questions and automatic verification of user answers in the intelligent tutoring systems. Open Semantic Technologies for Intelligent Systems Design. 2022. No. 6. Pp. 381–394.
- Li W., Grakova N., Qian L. Ontological approach to automating the processes of question generation and knowledge control in intelligent learning systems. Open Semantic Technologies for Designing Intelligent Systems. 2020. No. 4. Pp. 215–224.
- Murugan Sh., Ramakrishnan B.S. Automatic morpheme-based distractors generation for fill-in-the-blank questions using listwise learning-to-rank method for agglutinative language. Engineering Science and Technology. 2022. Vol. 26. URL: https://doi.org/10.1016/j.jestch.2021.04.012
- Riza L.S., Firdaus Y., Sukamto R.A., Samah W.Kh.A.F.A. Automatic generation of short-answer questions in reading comprehension using NLP and KNN. Multimedia Tools and Applications. 2023. No. 82. Pp. 41913–41940. URL: https://doi.org/10.1007/s11042-023-15191-6
- Rodriguez-Torrealba R., Garcia-Lopez E., Garcia-Cabot A. End-to-end generation of multiple-choice questions using text-to-text transfer transformer models. Expert Systems with Applications. 2022. Vol. 208. URL: https://doi.org/10.1016/j.eswa.2022.118258
- Shuai P., Li L., Liu S., Shen J. QDG: A unified model for automatic question-distractor pairs generation. Applied Intelligence. 2023. No. 53. Pp. 8275–8285. URL: https://doi.org/10.1007/s10489-022-03894-6
- Steuer T., Filighera A., Rensing Ch. Remember the Facts? Investigating Answer-Aware Neural Question Generation for Text Comprehension. In: International Conference on Artificial Intelligence in Education. 2020. Vol. 12163. URL: https://doi.org/10.1007/978-3-030-52237-7_A
- Wang H.C., Maslim M., Kan C.H. A question–answer generation system for an asynchronous distance learning platform. Education and Information Technologies. 2023. No. 28. Pp. 12059–12088. URL: https://doi.org/10.1007/s10639-023-11675-y
- Wang Y., Rong W., Zhang J. et al. Multi-turn dialogue-oriented pretrained question generation model. Complex & Intelligent Systems. 2020. No. 6. Pp. 493–505. URL: https://doi.org/10.1007/s40747-020-00147-2
- Astrashab V.V., Kalugina M.A., Klebanov D.A. et al. Neural network for generating questions to the text. In: International scientific practice. conf. “BIG DATA and Advanced Analytics. BIG DATA and high-level analysis”. 2020. No. 6. Pp. 363–369. (In Rus.)
- Desyatirikov F.A. A systematic approach to the organization of automatic testing of students of musical educational institutions. In: XXV International Scientific and Educational-Practical Conference. 2021. Vol. 3. Pp. 452–458.
- Lee V. An ontological approach to automatic question generation in intelligent learning systems. Reports of BGUIR. 2020. Vol. 18. No. 5. Pp. 44–52. (In Rus.)
Supplementary files
