Анализ поведения пользователей тарифов для ВКР: от данных до сегментации
Вы когда-нибудь задумывались, почему операторы связи знают, когда именно вам приходит в голову сменить тариф? По данным «МегаФона», пик таких мыслей у кузбассовцев приходится на четверг и пятницу, а самая активная группа — пользователи 35–44 лет. Для студента ИТ-специальности это не просто новость, а готовая фабула для дипломного проекта. Можно построить ВКР на реальном кейсе: собрать обезличенные данные, провести сегментацию, выявить паттерны поведения и спроектировать рекомендательную систему. Ниже покажу, как это превращается в полноценную работу, которую легко защитить.
Как новость про тарифы превращается в главы ВКР
Возможная тема: «Разработка модуля анализа поведения пользователей телеком-сервиса для повышения точности рекомендаций тарифов». Это звучит современно, попадает в требования ФГОС и даёт простор для проектирования и исследований. Вся структура работы выстраивается вокруг данных из статьи:
| Глава | Что наполняем | Отсылка к статье |
|---|---|---|
| Глава 1. Анализ предметной области | Обзор телеком-рынка, понятие тарифа, способы удержания клиентов, существующие алгоритмы рекомендаций | Статья подтверждает актуальность: спрос на смену тарифа неравномерен, есть возрастные и временные паттерны |
| Глава 2. Проектирование и реализация | Разработка архитектуры модуля, выбор стека (Python, pandas, SQL), проектирование базы данных, реализация алгоритмов сегментации | Используем признаки из статьи: день недели, возрастная группа, частота заходов на маркетплейс |
| Глава 3. Тестирование и оценка эффективности | Проверка точности модели, A/B-тест рекомендаций, расчёт метрик precision/recall, сравнение с базовым решением | Оцениваем, насколько учёт «четверга и пятницы» повышает точность прогноза |
Такой подход убивает двух зайцев: вы показываете умение работать с реальными данными и одновременно закрываете требование «практическая значимость».
Чем наполнить первую главу
Кроме стандартного обзора литературы, включите анализ аналогичных систем. Например, как «МегаФон» использует обезличенные данные для маркетплейса тарифов — это легальный пример работы с персональными данными. Здесь же уместно описать нормативную базу: ГОСТ 34.601 для автоматизированных систем, ISO/IEC 25010 для оценки качества ПО. Не нужно углубляться в юридию, достаточно показать, что вы знаете о существовании стандартов.
Вторая глава: проектирование без «воды»
Спроектируйте архитектуру в нотации C4 или UML. Достаточно трёх уровней: контейнеры (веб-приложение, БД, аналитический сервис), компоненты (модуль сбора данных, модуль сегментации, модуль рекомендаций), код (основные классы). Для наглядности добавьте диаграмму потока данных. Например:
Источник логов → ETL (pandas, SQL) → Хранилище признаков → Сегментация (RFM/KMeans) → Рекомендатель (правила/ML)
Сразу продумайте структуру БД. Для телеком-кейса подойдут таблицы:
users (user_id, age_group, region)
tariff_views (user_id, view_date, tariff_id)
tariffs (tariff_id, price, data_limit, minutes)
Ниже пример SQL-запроса, который выносит ключевые признаки для сегментации:
SELECT
user_id,
COUNT(*) AS total_views,
AVG(EXTRACT(DOW FROM view_date)) AS avg_weekday,
COUNT(DISTINCT tariff_id) AS tariffs_considered,
MAX(view_date) > NOW() - INTERVAL '7 days' AS active_last_week
FROM tariff_views
GROUP BY user_id;
Третья глава: метрики, которые понимает комиссия
Одна из частых проблем студентов — пишут «эффективность повысилась», но не показывают цифр. Возьмите за основу метрики рекомендательных систем: precision@k, recall@k, F1-score. Проведите A/B-тест: контрольная группа получает стандартные рекомендации, экспериментальная — с учётом дня недели и возрастной группы. Результат оформляется таблицей:
| Метрика | Базовый алгоритм | Предложенный алгоритм | Прирост |
|---|---|---|---|
| Precision@5 | 0.32 | 0.41 | +28% |
| Recall@5 | 0.28 | 0.36 | +29% |
| Конверсия в смену тарифа | 1.2% | 1.8% | +50% |
Не выдумывайте данные для таблицы — возьмите открытый датасет, например Telco Customer Churn с Kaggle, или сгенерируйте синтетику с помощью Python.
Практические выводы: чему вы научитесь
- Проектировать ETL-пайплайны для обработки обезличенных данных.
- Проводить сегментацию клиентов методами RFM-анализа и кластеризации (KMeans, DBSCAN).
- Считать метрики качества рекомендаций и оформлять результаты A/B-тестов.
- Строить архитектурные диаграммы в нотации C4/UML и защищать принятые решения.
- Связывать бизнес-гипотезы из новостей с проверяемыми моделями в дипломе.
FAQ: частые вопросы студентов
1. Могу ли я использовать статью из CNews как официальный источник?
Да, но в списке литературы она будет смотреться слабее учебников и научных статей. Используйте новость во введении для обоснования актуальности, а в обзоре литературы ссылайтесь на исследования по анализу поведения потребителей и телеком-маркетингу.
2. Где брать данные, если нет доступа к данным «МегаФона»?
Открытые датасеты: Telecom Churn от IBM, Telco Customer Churn с Kaggle, данные с портала data.gov.ru. Если тема строго про тарифы — смоделируйте синтетические данные. Это нормально, главное — честно написать методику генерации.
3. Какие требования по ГОСТу предъявляются к структурным элементам?
Обычно вуз опирается на ГОСТ 7.32. Отдельно уточните методичку кафедры. Важно правильно оформить титульный лист, содержание, нумерацию страниц и библиографию. Программный код в приложениях, схемы — в тексте или приложениях. На защите часто спрашивают, почему выбрана та или иная архитектура — будьте готовы объяснить.
4. Что делать, если научный руководитель не понимает тему ML?
Сместите акцент на проектирование ПО: модуль рекомендаций — это классическая задача разработки. Опишите алгоритмы словами, добавьте UML-диаграммы и блок-схемы. Метрики оставьте в третьей главе — их поймёт любой математик. Не углубляйтесь в тонкости обучения нейросетей, используйте простые и интерпретируемые модели.
Чек-лист «Что проверить перед сдачей»
- Все ли задачи из введения нашли отражение в выводах по главам?
- Есть ли в работе диаграммы (C4 или UML) с описанием, а не просто картинка?
- Указаны ли метрики эффективности и полученные численные результаты?
- Соответствуют ли оформление списка литературы требованиям методички?
- Пройден ли нормоконтроль и проверка на антиплагиат (>70% по системе вуза)?
- Является ли исходный код/скрипт в приложении исполняемым и воспроизводимым?
- Ссылка на статью CNews и другие источники корректна и активна?
Типичные ошибки студентов
Ошибка 1. Переписывание новостей. «МегаФон сообщил, кузбассовцы думают о тарифах в четверг» — это не аналитика. Избегайте пересказа: вместо этого стройте гипотезу и проверяйте её на данных. Например: «Пиковая активность в четверг и пятницу объясняется тем, что пользователи планируют бюджет на выходные».
Ошибка 2. Нет связи между главой 2 и главой 3. Спроектировали алгоритм, а тестировали что-то другое. Если во второй главе заявлен учёт дня недели, то в третьей обязательно сравните модель с этим признаком и без него.
Ошибка 3. Слишком сложные модели без обоснования. Не нужно тащить нейросети туда, где хватает логистической регрессии. Комиссия любит, когда студент может объяснить выбор стека и алгоритма простыми словами.
Нужна помощь с ВКР? Если вы застряли на проектировании, расчётах или оформлении — не тратьте время впустую. Наши специалисты готовы бесплатно проконсультировать вас по структуре работы и помочь с最难 этапами. Обращайтесь, разберём вашу тему за один день.
Источник: Мысли о смене тарифа на связь приходят к кузбассовцам по четвергам и пятницам (опубликовано 2026-03-18)