Финуниверситет — Информационная безопасность

Поддомен статьи: AI/ML (компьютерное зрение, детекция объектов). Роль автора: Data/ML-инженер. Схема структуры: C.

Распознавание малоразмерных объектов в тумане для ВКР: датасет, метрики, защита модели

Введение

Китайские военные моряки собрали более двух тысяч парных кадров и почти двадцать тысяч размеченных объектов — чтобы проверить, как системы распознавания ведут себя в сложных погодных условиях. Формально это новость из области оборонных технологий. Фактически — готовый сценарий для дипломной работы по машинному обучению: ограниченный датасет, высокая плотность объектов на кадр, сложный фон, туман как фактор деградации изображения.

Почему это важно выпускнику ИТ? Потому что 80% студенческих ML-проектов рассыпаются не на этапе «выбрал YOLO», а на этапе «а где данные и чем мерить качество». Если вы научитесь собирать и валидировать датасет под задачу детекции в условиях плохой видимости, вы получите ВКР, которую можно защищать на кафедре, показывать на хакатоне и подтверждать цифрами. Ниже — конкретные темы, метрики, схемы и оформление.

FAQ: что чаще всего спрашивают перед началом

Где взять данные, если своего датасета нет?

Открытые источники: DOTA (аэрофотосъёмка), xView, VisDrone, Kaggle-наборы морских судов, SMD (Singapore Maritime Dataset) с кадрами плохой видимости. Для имитации тумана используйте физические модели атмосферного рассеяния (ASM), реализованные в библиотеках синтеза тумана, — это позволяет искусственно расширить датасет и описать в главе 2 методику аугментации. Парные кадры «чистое / затуманенное» — это фактически задача image dehazing, отлично ложится в теоретическую главу.

Хватит ли 2000 кадров?

Для узкого класса объектов — да, если правильно провести разбиение и не допустить утечки данных между train и val. Ориентируйтесь на 70/15/15 и обязательно стратифицируйте по погодным условиям. Двадцать тысяч размеченных объектов дают в среднем 10 инстансов на кадр — это высокая плотность, значит, придётся следить за NMS и за перекрытием боксов.

Как считать метрики и что писать в главе 3?

mAP@0.5 и mAP@0.5:0.95 по COCO-протоколу, precision/recall, F1, IoU. Дополнительно — задержку инференса в мс на CPU и GPU, потребление памяти, размер модели. Это прямо ложится в раздел «Оценка эффективности» и подтверждается таблицей и графиком PR-кривой.

Нужна ли своя видеокарта?

Не обязательно. Google Colab, Kaggle Notebooks и облачные GPU-инстансы закрывают обучение моделей до 10–20 млн параметров. В экономической части ВКР считайте не стоимость железа, а стоимость часа аренды GPU и общее время обучения.

Темы ВКР: три рабочих варианта

Как встроить кейс в главы работы

Глава 1. Теория и постановка задачи

Опишите физику рассеяния света в тумане, модели атмосферной дымки, метрики качества детекции. Здесь же — обзор архитектур: YOLO-семейство, RetinaNet, DETR. Обязательно постройте схему пайплайна в нотации C4 (уровень Container) или UML-диаграмму деятельности: сбор → разметка → аугментация → обучение → валидация → экспорт. Это то, что комиссия любит видеть в явном виде.

Глава 2. Проектирование и реализация

Здесь описываете структуру датасета: сколько кадров, сколько инстансов, распределение по классам и погодным условиям, как формировались парные кадры. Приводите таблицу разбиения выборки. Ниже — фрагмент конфигурации обучения, который можно оформить как листинг.

# config/train.yaml — гиперпараметры обучения детектора
model: yolov8m
data:
  path: datasets/maritime_fog
  train: images/train
  val:   images/val
  test:  images/test
  names: [vessel, buoy, unknown]
epochs: 120
batch: 16
imgsz: 640
optimizer: AdamW
lr0: 0.001
augment:
  hsv_h: 0.015
  hsv_v: 0.4
  mosaic: 1.0
  mixup: 0.1
  fog_synthesis:
    enabled: true
    beta_range: [0.6, 1.6]
metrics:
  primary: mAP50-95
  extra: [precision, recall, f1, latency_ms]

Если работаете с парными кадрами, добавьте ветку восстановления изображения перед детектором. Архитектурно это можно описать как «модуль предобработки + детектор», и на C4-диаграмме это два отдельных контейнера, обменивающихся тензорами. Такой подход делает работу заметно сильнее типичного «обучил YOLO на COCO».

Глава 3. Эксперименты и оценка

Минимум три эксперимента: baseline без аугментации, baseline с аугментацией тумана, предложенная модель. Для каждого — таблица метрик и графики. Проверьте статистическую значимость различий (t-тест или bootstrap по подвыборкам) — это сразу отличает сильную ВКР от слабой.

МодельmAP@0.5mAP@0.5:0.95PrecisionRecallLatency, мс
Baseline (чистые кадры)0.7120.4380.7410.68818
Baseline + туман0.5830.3410.6120.54718
Предложенная модель0.6740.4120.7030.64123

Схемы, которые нужно построить

Не ограничивайтесь скриншотами из TensorBoard. Комиссия оценивает именно проектные артефакты: диаграмма классов разметки, UML-диаграмма последовательности инференса, C4-диаграмма развёртывания, схема эксперимента. ГОСТ 19 (ЕСПД) пригодится для описания программного изделия и руководства оператора, ГОСТ 34 — если система позиционируется как автоматизированная. Качество атрибутов ПО опишите через ISO/IEC 25010: функциональная полнота, точность, производительность, надёжность.

Чек-лист «Что проверить перед сдачей»
  • Формулировки задач в главе 1 совпадают с выводами главы 3 дословно по смыслу.
  • Датасет описан таблицей: источник, объём, классы, разбиение, баланс.
  • Метрики указаны с протоколом измерения (IoU-порог, batch, устройство).
  • Схемы подписаны, пронумерованы, есть ссылки на них в тексте.
  • Листинги кода оформлены по ГОСТ и вынесены в приложение, если длиннее страницы.
  • Ссылки на источники за последние 5 лет — не менее 60% от списка.
  • Проверка на заимствования: уникальность текста и корректное цитирование рисунков.
Типичные ошибки студентов
  • Утечка данных между выборками. Кадры из одной серии попадают и в train, и в val — метрики завышены, на защите это вскрывается первым вопросом. Разбивайте по сценам, а не по файлам.
  • Обучение «под метрику» без описания протокола. Ссылка на 2 000 пар кадров из статьи — хороший повод показать, что вы понимаете разницу между валидацией и тестом. Держите тестовую выборку до финала.
  • Нет baseline. Если вы не сравниваете свою модель с простой альтернативой, улучшение недоказуемо. Baseline — это не формальность, а ваш главный аргумент в главе 3.
Если до защиты осталось мало времени, а тема ещё «плывёт» — можно начать с бесплатной консультации: специалисты помогут уточнить постановку задачи, подобрать датасет и выстроить структуру. В среднем проработка ВКР занимает около 120 часов, из которых львиная доля уходит на эксперименты и оформление. Мы разбираемся с любой темой — от компьютерного зрения до оформления по ГОСТ.

Материал подготовлен экспертами компании [Название сайта]. Мы помогаем студентам с 2010 года. Если вам нужна помощь в разработке темы, подборе датасета или оформлении работы, наши специалисты готовы подсказать.

Последнее обновление: 2026-10-03

Источник: Китайские военные моряки снова учат ИИ находить корабли в тумане. Чьи корабли ищут — по-прежнему не уточняется (опубликовано 2026-03-26)