Опубликовано: 28.09.2026 | Источник: Xakep.ru
ИИ-агенты для мониторинга даркнета в ВКР: от OSINT-конвейера до метрик качества
Google добавила в Threat Intelligence новый модуль на базе Gemini: агент сканирует даркнет и теневые площадки, выискивая упоминания конкретных организаций — утечки, продажу доступов, обсуждения эксплойтов. Режим — публичное превью, то есть заявка на новый стандарт корпоративного threat-мониторинга, а не разовая фича. Для выпускника ИТ-направления это подарок: тема на стыке LLM, OSINT и информационной безопасности, где ещё нет устоявшихся методичек и легко показать собственную архитектуру. Ниже — как превратить этот тренд в защищаемую ВКР, а не в реферат «про ИИ в безопасности».
Семантический разбор темы (для тех, кто пишет ТЗ и ключевые слова)
Прежде чем браться за главы, зафиксируйте понятийный аппарат — он попадёт в введение, глоссарий и выводы.
Три темы ВКР, которые реально защитить
1. «Разработка прототипа ИИ-агента для сбора угроз из открытых и теневых источников»
Актуальность: Google выводит на рынок коммерческий продукт такого класса — значит, задача переходит из научной в инженерную, и вузовская работа уместна.
Цель: сформировать конвейер «сбор → нормализация → классификация → оповещение» с оценкой качества.
- Задача 1: обзор источников (форумы, IRC-логи, Telegram-каналы, paste-сайты) и правовые ограничения.
- Задача 2: проектирование схемы данных на STIX/TAXII.
- Задача 3: реализация LLM-классификатора с RAG по базе знаний MITRE ATT&CK.
- Задача 4: замер Precision/Recall/F1 и латентности на тестовом наборе.
Структура: Гл.1 — анализ источников и аналогов (Google TI, Recorded Future, DarkOwl); Гл.2 — архитектура сервиса, схемы, выбор стека; Гл.3 — эксперименты, метрики, экономика внедрения.
2. «Сравнительный анализ LLM для задач threat intelligence в дипломном проекте»
Актуальность: Google выбрала Gemini, но это не значит, что выбор оптимален для всех сценариев — сравнение и есть научная новизна.
Цель: оценить пригодность открытых и проприетарных моделей на корпусе текстов теневых площадок.
- Сформировать датасет (анонимизированный, синтетический — если реальные данные недоступны).
- Определить метрики: F1 по типам угроз, устойчивость к опечаткам и сленгу, стоимость токена.
- Провести нагрузочное тестирование через OpenTelemetry-трейсинг.
Структура: анализ моделей → методика эксперимента → воспроизводимые результаты и рекомендации.
3. «Интеграция ИИ-модуля мониторинга даркнета с корпоративным SIEM»
Актуальность: разрозненный агент бесполезен, ценность — в потоке инцидентов внутри SOC.
Цель: спроектировать и развернуть связку «агент → нормализатор → SIEM» с заданным RTO/RPO.
- Проектирование очереди сообщений и отказоустойчивой схемы в Kubernetes.
- Написание парсера STIX → SIEM-схема.
- Проверка восстановления после отказа (chaos-тесты).
Структура: теория SIEM/интеграций → архитектура и диаграммы → тесты и расчёт TCO.
Как статья ложится в конкретные разделы ВКР
Аналитическая глава: сравнение решений и обоснование стека
Не пишите «возьмём Python, потому что популярен». Стройте таблицу с критериями из ISO/IEC 25010: функциональная полнота, производительность, сопровождаемость, безопасность. Пример сравнения:
Отсылку к статье используйте как аргумент «рынок двинулся»: если вендор такого уровня вкладывается в направление, у задачи есть производственная перспектива.
Проектная часть: схемы, алгоритмы, интеграция
Минимум — три диаграммы: контекстная (C4 Level 1), компонентная (Level 2), последовательности для сценария «найдено упоминание → алерт в SIEM». Опишите алгоритм обработки псевдокодом:
for source in sources:
raw = collector.fetch(source)
doc = normalize(raw, schema="STIX 2.1")
if classifier.score(doc) >= threshold:
enriched = rag.enrich(doc, kb="MITRE ATT&CK")
notifier.push(enriched, channel="SIEM")
Обязательно опишите развёртывание: Docker-образы, Helm-чарты, CI/CD-пайплайн (GitHub Actions / GitLab CI), секреты через Vault или sealed secrets.
Тестирование и метрики: где брать цифры
Три группы измерений, каждая — с методикой:
- Качество модели: Precision, Recall, F1, матрица ошибок. Датасет — минимум 500 размеченных документов.
- Производительность: латентность p50/p95/p99, пропускная способность (docs/sec), потребление RAM/GPU. Снимайте трейсы через OpenTelemetry и складывайте в Prometheus.
- Надёжность: RTO и RPO для очереди и хранилища, результаты chaos-экспериментов (отключение брокера, падение модели-инференса).
Если сроки поджимают, а тема требует не только кода, но и аккуратной документации по ГОСТ — поможем разобраться: 120 академических часов на проработку, бесплатная консультация по вашей теме и сопровождение до защиты. Разработка и оформление любой сложности — от прототипа до финальных выводов.
Чему вы научитесь на этой теме
- Проектировать конвейеры обработки неструктурированных данных с участием LLM.
- Обосновывать выбор архитектуры и компонентов, а не только «что модно».
- Снимать метрики качества и производительности воспроизводимо, а не «по ощущениям».
- Оформлять техническую документацию по ГОСТ 34.602-89 и связывать её со стандартом ISO/IEC 25010.
- Защищать работу: отвечать на вопросы про галлюцинации модели, приватность данных, ложные срабатывания.
Типичные ошибки студентов на такой теме:
- «Используем Gemini, потому что Google» — без критериев сравнения это не обоснование, а реклама. Составьте таблицу с весами критериев.
- Нет метрик качества LLM. Достаточно Precision/Recall на 500 примерах и указания методики разметки.
- Забыт ГОСТ 34.602-89 на ТЗ. Проверьте наличие разделов «Требования к системе», «Стадии разработки», «Состав работ» — их спрашивают на защите чаще всего.
- Отсутствует описание границ допустимого использования. Тема связана с теневыми источниками — нужен раздел про этику и правовое поле.
FAQ
Обязательно ли писать рабочий код?
Зависит от кафедры: где-то достаточно архитектуры и имитационной модели. Но если тема про ИИ-агента, прототип с 200–500 строками и воспроизводимым экспериментом сильно повышает оценку.
Где брать данные, если реальный даркнет недоступен?
Легальные варианты: публичные датасеты по кибербезопасности, синтетическая генерация текстов с помощью LLM, корпус с форумов, доступных через открытые API. Опишите методику формирования — это ценнее, чем «данные под NDA».
Как оформить UML-диаграммы, чтобы не придрались?
Единый нотационный стиль (C4 или UML 2.5), все элементы подписаны, есть легенда. Диаграммы — в приложении, в тексте — ссылки «см. Приложение А». Проверьте нумерацию и подписи по ГОСТ 19.701-90.
Насколько сложно защитить тему без реального заказчика?
Нормально. Заказчика имитирует раздел «Апробация»: тестовый сценарий, метрики, оценка внедрения. Судьи ценят честность про ограничения.
Чек-лист «Что проверить перед сдачей»
- Задачи во введении совпадают с содержанием глав и выводами.
- Есть ссылка на первоисточник и корректное оформление ссылок.
- Метрики описаны с формулами, выборками и условиями эксперимента.
- Схемы пронумерованы, есть перечень сокращений.
- Титульник, содержание и приложения соответствуют ГОСТ 7.32-2017 / требованиям кафедры.
- Список литературы оформлен по ГОСТ Р 7.0.100-2018.
- Проверена уникальность и отсутствие «воды» в первом абзаце.
Материал подготовлен экспертами компании Diplom-Expert. Мы помогаем студентам с 2010 года: подбираем актуальную тему, проектируем архитектуру, оформляем документацию. Если нужна помощь с разработкой темы или сопровождением — наши специалисты готовы подсказать. Заказать диплом по вашей специальности можно буквально за пару кликов: ВКР на заказ — это про сопровождение, а не про формальность.
Последнее обновление: 2026-09-28
Источник: Google сканирует даркнет с помощью ИИ-агентов (опубликовано 2026-03-26)