Разработка системы автоматической проверки рукописных ответов (blue books) с помощью NLP: руководство для ВКР

В 2026 году колледжи по всему миру возвращаются к бумажным экзаменам – «синим книжкам» – из-за активного использования студентами генеративных нейросетей. Эта ситуация открывает новую нишу для ИТ-специалистов: автоматизация ручной проверки рукописных ответов, детекция списывания и интеграция таких систем в образовательные платформы. В этой статье вы узнаете, как превратить этот тренд в актуальную и защищаемую тему ВКР, какие технологии использовать и как не провалить защиту.

Возможные темы ВКР на основе тренда blue books

Все три темы опираются на реальную проблему, описанную в статье, и предполагают создание прототипа либо аналитического исследования.

ТемаАктуальностьЦельЗадачи (3–4)Структура глав
1. Разработка модуля автоматического оценивания рукописных ответов на основе NLP и компьютерного зрения Рост объёмов рукописных экзаменов требует замены ручной проверки – снижение нагрузки преподавателей до 60% Создать прототип, который распознаёт текст из изображений «синих книжек», извлекает ключевые понятия и сравнивает с эталоном 1) Обзор методов OCR и NLP (Tesseract, LayoutLM, BERT).
2) Проектирование архитектуры (микросервисы + база эталонов).
3) Реализация пайплайна: предобработка → распознавание → семантический анализ.
4) Оценка точности (F1-score, accuracy) на размеченном датасете.
Гл.1 – Анализ существующих решений и стандартов (ISO/IEC 25010, ГОСТ 34).
Гл.2 – Проектирование и реализация (диаграммы C4, UML).
Гл.3 – Тестирование и метрики эффективности.
2. Детекция использования ИИ в рукописных экзаменах: методы и реализация Преподаватели не могут отличить ответ, сгенерированный нейросетью и переписанный от руки, от самостоятельного – нужна автоматическая проверка стиля Разработать классификатор, который определяет, написан ли ответ человеком или ИИ, на основе стилистических и статистических признаков 1) Анализ методов стилометрии (Burrows’s Delta, n-граммы).
2) Сбор датасета: рукописные ответы студентов + ответы, переписанные с GPT.
3) Обучение модели (SVM / Random Forest / BERT).
4) Валидация на реальных экзаменационных бланках.
Гл.1 – Теоретические основы детекции машинного текста.
Гл.2 – Разработка архитектуры решения (Kubernetes для масштабирования, OpenTelemetry для мониторинга).
Гл.3 – Эксперименты и метрики (precision, recall, F1).
3. Интеграция AI-ассистента проверки экзаменов в LMS Moodle: архитектура и безопасность Университеты переходят на смешанное обучение, но существующие LMS не поддерживают автоматическую проверку рукописных работ Спроектировать и реализовать подключаемый плагин для Moodle, который запускает NLP-модуль проверки blue books 1) Анализ API Moodle и требований безопасности (OWASP Top 10).
2) Проектирование микросервисной архитектуры (Docker, Kubernetes).
3) Разработка адаптера для передачи изображений и получения оценок.
4) Нагрузочное тестирование и оценка времени отклика.
Гл.1 – Обзор LMS и стандартов защиты данных (152-ФЗ).
Гл.2 – Проектирование плагина (диаграммы последовательности UML, диаграмма развёртывания).
Гл.3 – Результаты интеграции и рекомендации.

Как использовать статью в каждой главе диплома

Глава 1. Аналитическая часть

Приведите цитату из статьи: “As AI threatens white-collar work, colleges debate old-school tests”. Это отличный крючок для обоснования актуальности. Далее опишите проблему: преподаватели тратят до 40% времени на проверку рукописных работ, а студенты всё чаще маскируют ответы нейросетей под рукописный текст. Сформулируйте объект и предмет исследования. Обязательно сошлитесь на стандарты качества – ISO/IEC 25010 (характеристики: функциональность, надёжность, производительность) и ГОСТ 34.601-90 (стадии создания автоматизированных систем).

Глава 2. Проектная / реализационная часть

Постройте диаграмму C4 (уровень Container) системы. Например:

Container: Web App (Moodle Plugin) -> API Gateway -> Microservice: OCR (Tesseract + LayoutLM)
              -> Microservice: NLP Analyzer (BERT) -> Database: Answers & Scores

Добавьте UML-диаграмму компонентов для взаимодействия с внешними системами. Приведите фрагмент конфигурации пайплайна обработки изображения:

# Псевдокод пайплайна
def process_blue_book(image_path):
    img = preprocess(image_path)          # улучшение контраста, устранение шума
    text = ocr_recognize(img)             # LayoutLM + Tesseract
    tokens = tokenize(text)               # WordPiece
    features = extract_features(tokens)   # эмбеддинги BERT
    score = similarity_model(features, teacher_answers)
    return score, detected_latex

if score < 0.7:
    trigger_human_review()

Глава 3. Тестирование и оценка эффективности

Используйте метрики поддомена AI/ML: accuracy, precision, recall, F1-мера. Для распознавания рукописного текста – CER/ WER (Character/Word Error Rate). Приведите таблицу сравнения моделей:

МодельCER (%)F1 (семантическое совпадение)Время обработки (сек)
Tesseract 518.30.520.8
LayoutLMv34.10.872.5
GPT-4o (с дообучением)2.80.947.1

Сделайте вывод, что LayoutLMv3 – оптимальный баланс скорости и качества для дипломного проекта.

FAQ: Частые вопросы студентов

1. Как выбрать стоп-слова и токенизатор для рукописных ответов?

Используйте русский WordPiece от предобученных моделей (RuBERT). Специфическая лексика экзаменов (термины, формулы) потребует дообучения. Для начала возьмите готовый датасет RRC или соберите 200–300 реальных бланков (с согласия вуза).

2. Какие требования вуза к оформлению алгоритмов и схем?

Обычно требуют диаграммы в нотации UML или BPMN, выполненные в Visio/PlantUML. Для архитектуры – C4 (уровень System и Container). Уточните в методичке кафедры – многие принимают скриншоты из draw.io. ГОСТ 34.601 не требует конкретной нотации, главное – однозначность.

3. Где взять данные для обучения, если нет доступа к экзаменационным работам?

Используйте открытые датасеты: IAM Handwriting Database, Russian Handwriting Dataset (RUS). Для имитации рукописных ответов ИИ можно сгенерировать текст нейросетью (GPT, YandexGPT) и написать от руки или использовать шрифты (например, Segoe Print). В дипломе обязательно укажите, что результаты ограничены синтетическими данными – это нормально для исследовательской работы.

4. Как считать экономическую эффективность системы?

Оцените временные затраты преподавателя: средняя проверка одной работы – 15 минут. Ваша система обрабатывает 1 работу за 3 минуты, но требует проверки 20% случаев (ручной ревью). Посчитайте human-in-the-loop: (0.2*15 + 0.8*0) = 3 минуты на работу вместо 15 – экономия 80%. Переведите в часы и зарплату.

Чек-лист: что проверить перед сдачей

  • ✔ Ссылка на статью из Axios (2026) во введении – обоснуйте актуальность.
  • ✔ Диаграммы C4/UML или BPMN – не менее 3-х (контекст, контейнеры, компоненты).
  • ✔ Экспериментальная часть с метриками – минимум две модели (baseline + ваша).
  • ✔ Соответствие задач выводам: каждая задача должна быть отражена в заключении.
  • ✔ Оформление кода и таблиц по ГОСТ 7.32-2017 (шрифт, выравнивание, нумерация).
  • ✔ Приложения: скриншоты работы прототипа, фрагменты датасета (первые 10 строк).
  • ✔ Проверка уникальности через Антиплагиат.вуз – не менее 70% (для технических тем 60% допустимо).

Типичные ошибки студентов

  • Игнорирование человеческого фактора. Многие предлагают полностью автоматизировать проверку, но статья подчёркивает: «old-school tests» возвращаются именно для аутентификации. В дипломе обязательно запроектируйте режим human-in-the-loop (ручное ревью при низкой уверенности модели).
  • Слабая валидация метрик. Измеряют только accuracy, не учитывая дисбаланс классов (большинство ответов – правильные). Используйте F1 и precision/recall для каждого класса (правильно/частично правильно/неправильно).
  • Отсутствие оценок безопасности. Если система интегрируется с LMS, проверьте OWASP Top 10 (особенно A03:2021 – Injection, A04:2021 – Insecure Design). В главе 2 добавьте раздел «Требования к информационной безопасности».

Чему вы научитесь, работая над такой ВКР

Нужна помощь с дипломом? Если вы не уверены в выборе стека или у вас ограничено время – наши эксперты готовы провести бесплатную консультацию (до 30 минут) и помочь с любой темой, включая полное сопровождение до защиты. Закажите обратный звонок на сайте, и мы подберём оптимальный план поддержки.

Материал подготовлен экспертами компании «ВКР-Профи». Мы помогаем студентам с 2010 года. Если вам нужна помощь в разработке темы или оформлении работы, наши специалисты готовы подсказать.

Последнее обновление: 2026-07-21

Источник: Blue books make an "out of step" campus comeback in the AI era (опубликовано 2026-03-14)