Опубликовано: 03.10.2026 | Источник: SecurityLab (RSS)
Поддомен статьи: AI/ML (компьютерное зрение, детекция объектов). Роль автора: Data/ML-инженер. Схема структуры: C.
Распознавание малоразмерных объектов в тумане для ВКР: датасет, метрики, защита модели
Введение
Китайские военные моряки собрали более двух тысяч парных кадров и почти двадцать тысяч размеченных объектов — чтобы проверить, как системы распознавания ведут себя в сложных погодных условиях. Формально это новость из области оборонных технологий. Фактически — готовый сценарий для дипломной работы по машинному обучению: ограниченный датасет, высокая плотность объектов на кадр, сложный фон, туман как фактор деградации изображения.
Почему это важно выпускнику ИТ? Потому что 80% студенческих ML-проектов рассыпаются не на этапе «выбрал YOLO», а на этапе «а где данные и чем мерить качество». Если вы научитесь собирать и валидировать датасет под задачу детекции в условиях плохой видимости, вы получите ВКР, которую можно защищать на кафедре, показывать на хакатоне и подтверждать цифрами. Ниже — конкретные темы, метрики, схемы и оформление.
FAQ: что чаще всего спрашивают перед началом
Где взять данные, если своего датасета нет?
Открытые источники: DOTA (аэрофотосъёмка), xView, VisDrone, Kaggle-наборы морских судов, SMD (Singapore Maritime Dataset) с кадрами плохой видимости. Для имитации тумана используйте физические модели атмосферного рассеяния (ASM), реализованные в библиотеках синтеза тумана, — это позволяет искусственно расширить датасет и описать в главе 2 методику аугментации. Парные кадры «чистое / затуманенное» — это фактически задача image dehazing, отлично ложится в теоретическую главу.
Хватит ли 2000 кадров?
Для узкого класса объектов — да, если правильно провести разбиение и не допустить утечки данных между train и val. Ориентируйтесь на 70/15/15 и обязательно стратифицируйте по погодным условиям. Двадцать тысяч размеченных объектов дают в среднем 10 инстансов на кадр — это высокая плотность, значит, придётся следить за NMS и за перекрытием боксов.
Как считать метрики и что писать в главе 3?
mAP@0.5 и mAP@0.5:0.95 по COCO-протоколу, precision/recall, F1, IoU. Дополнительно — задержку инференса в мс на CPU и GPU, потребление памяти, размер модели. Это прямо ложится в раздел «Оценка эффективности» и подтверждается таблицей и графиком PR-кривой.
Нужна ли своя видеокарта?
Не обязательно. Google Colab, Kaggle Notebooks и облачные GPU-инстансы закрывают обучение моделей до 10–20 млн параметров. В экономической части ВКР считайте не стоимость железа, а стоимость часа аренды GPU и общее время обучения.
Темы ВКР: три рабочих варианта
-
Тема 1. «Метод повышения точности детекции судов в условиях ограниченной видимости»
Актуальность: напрямую отсылает к кейсу с парными кадрами и 20 000 объектов.
Цель: повысить mAP модели детекции на затуманенных кадрах относительно baseline.
Задачи: 1) обзор архитектур одностадийной детекции; 2) сбор и разметка датасета, синтез тумана; 3) обучение baseline и предложенной модели; 4) сравнительный анализ метрик.
Структура: Гл. 1 — анализ предметной области и метрик; Гл. 2 — проектирование пайплайна и модели; Гл. 3 — эксперименты и оценка.
-
Тема 2. «Пайплайн подготовки данных для обучения детекторов на ограниченных выборках»
Актуальность: 2 000 пар кадров — типичный сценарий дефицита данных.
Цель: разработать воспроизводимый конвейер разметки, валидации и аугментации.
Задачи: 1) анализ инструментов разметки (CVAT, Label Studio); 2) контроль качества аннотаций; 3) реализация аугментаций; 4) измерение влияния аугментаций на метрики.
Структура: Гл. 1 — теория данных и разметки; Гл. 2 — реализация пайплайна; Гл. 3 — эксперименты, статистика.
-
Тема 3. «Развёртывание модели детекции в бортовой системе с ограниченными ресурсами»
Актуальность: морские системы работают на edge-устройствах, где важен каждый ватт.
Цель: получить модель с приемлемым mAP при инференсе в реальном времени.
Задачи: 1) обзор методов квантизации и дистилляции; 2) экспорт в ONNX/TensorRT; 3) замер latency; 4) оценка деградации точности.
Структура: Гл. 1 — анализ edge-платформ; Гл. 2 — оптимизация и экспорт; Гл. 3 — бенчмарки и выводы.
Как встроить кейс в главы работы
Глава 1. Теория и постановка задачи
Опишите физику рассеяния света в тумане, модели атмосферной дымки, метрики качества детекции. Здесь же — обзор архитектур: YOLO-семейство, RetinaNet, DETR. Обязательно постройте схему пайплайна в нотации C4 (уровень Container) или UML-диаграмму деятельности: сбор → разметка → аугментация → обучение → валидация → экспорт. Это то, что комиссия любит видеть в явном виде.
Глава 2. Проектирование и реализация
Здесь описываете структуру датасета: сколько кадров, сколько инстансов, распределение по классам и погодным условиям, как формировались парные кадры. Приводите таблицу разбиения выборки. Ниже — фрагмент конфигурации обучения, который можно оформить как листинг.
# config/train.yaml — гиперпараметры обучения детектора
model: yolov8m
data:
path: datasets/maritime_fog
train: images/train
val: images/val
test: images/test
names: [vessel, buoy, unknown]
epochs: 120
batch: 16
imgsz: 640
optimizer: AdamW
lr0: 0.001
augment:
hsv_h: 0.015
hsv_v: 0.4
mosaic: 1.0
mixup: 0.1
fog_synthesis:
enabled: true
beta_range: [0.6, 1.6]
metrics:
primary: mAP50-95
extra: [precision, recall, f1, latency_ms]
Если работаете с парными кадрами, добавьте ветку восстановления изображения перед детектором. Архитектурно это можно описать как «модуль предобработки + детектор», и на C4-диаграмме это два отдельных контейнера, обменивающихся тензорами. Такой подход делает работу заметно сильнее типичного «обучил YOLO на COCO».
Глава 3. Эксперименты и оценка
Минимум три эксперимента: baseline без аугментации, baseline с аугментацией тумана, предложенная модель. Для каждого — таблица метрик и графики. Проверьте статистическую значимость различий (t-тест или bootstrap по подвыборкам) — это сразу отличает сильную ВКР от слабой.
Схемы, которые нужно построить
Не ограничивайтесь скриншотами из TensorBoard. Комиссия оценивает именно проектные артефакты: диаграмма классов разметки, UML-диаграмма последовательности инференса, C4-диаграмма развёртывания, схема эксперимента. ГОСТ 19 (ЕСПД) пригодится для описания программного изделия и руководства оператора, ГОСТ 34 — если система позиционируется как автоматизированная. Качество атрибутов ПО опишите через ISO/IEC 25010: функциональная полнота, точность, производительность, надёжность.
Чек-лист «Что проверить перед сдачей»
- Формулировки задач в главе 1 совпадают с выводами главы 3 дословно по смыслу.
- Датасет описан таблицей: источник, объём, классы, разбиение, баланс.
- Метрики указаны с протоколом измерения (IoU-порог, batch, устройство).
- Схемы подписаны, пронумерованы, есть ссылки на них в тексте.
- Листинги кода оформлены по ГОСТ и вынесены в приложение, если длиннее страницы.
- Ссылки на источники за последние 5 лет — не менее 60% от списка.
- Проверка на заимствования: уникальность текста и корректное цитирование рисунков.
Типичные ошибки студентов
- Утечка данных между выборками. Кадры из одной серии попадают и в train, и в val — метрики завышены, на защите это вскрывается первым вопросом. Разбивайте по сценам, а не по файлам.
- Обучение «под метрику» без описания протокола. Ссылка на 2 000 пар кадров из статьи — хороший повод показать, что вы понимаете разницу между валидацией и тестом. Держите тестовую выборку до финала.
- Нет baseline. Если вы не сравниваете свою модель с простой альтернативой, улучшение недоказуемо. Baseline — это не формальность, а ваш главный аргумент в главе 3.
Если до защиты осталось мало времени, а тема ещё «плывёт» — можно начать с бесплатной консультации: специалисты помогут уточнить постановку задачи, подобрать датасет и выстроить структуру. В среднем проработка ВКР занимает около 120 часов, из которых львиная доля уходит на эксперименты и оформление. Мы разбираемся с любой темой — от компьютерного зрения до оформления по ГОСТ.
Материал подготовлен экспертами компании [Название сайта]. Мы помогаем студентам с 2010 года. Если вам нужна помощь в разработке темы, подборе датасета или оформлении работы, наши специалисты готовы подсказать.
Последнее обновление: 2026-10-03
Источник: Китайские военные моряки снова учат ИИ находить корабли в тумане. Чьи корабли ищут — по-прежнему не уточняется (опубликовано 2026-03-26)