Анализ поведения пользователей тарифов для ВКР: от данных до сегментации

Вы когда-нибудь задумывались, почему операторы связи знают, когда именно вам приходит в голову сменить тариф? По данным «МегаФона», пик таких мыслей у кузбассовцев приходится на четверг и пятницу, а самая активная группа — пользователи 35–44 лет. Для студента ИТ-специальности это не просто новость, а готовая фабула для дипломного проекта. Можно построить ВКР на реальном кейсе: собрать обезличенные данные, провести сегментацию, выявить паттерны поведения и спроектировать рекомендательную систему. Ниже покажу, как это превращается в полноценную работу, которую легко защитить.

Как новость про тарифы превращается в главы ВКР

Возможная тема: «Разработка модуля анализа поведения пользователей телеком-сервиса для повышения точности рекомендаций тарифов». Это звучит современно, попадает в требования ФГОС и даёт простор для проектирования и исследований. Вся структура работы выстраивается вокруг данных из статьи:

ГлаваЧто наполняемОтсылка к статье
Глава 1. Анализ предметной областиОбзор телеком-рынка, понятие тарифа, способы удержания клиентов, существующие алгоритмы рекомендацийСтатья подтверждает актуальность: спрос на смену тарифа неравномерен, есть возрастные и временные паттерны
Глава 2. Проектирование и реализацияРазработка архитектуры модуля, выбор стека (Python, pandas, SQL), проектирование базы данных, реализация алгоритмов сегментацииИспользуем признаки из статьи: день недели, возрастная группа, частота заходов на маркетплейс
Глава 3. Тестирование и оценка эффективностиПроверка точности модели, A/B-тест рекомендаций, расчёт метрик precision/recall, сравнение с базовым решениемОцениваем, насколько учёт «четверга и пятницы» повышает точность прогноза

Такой подход убивает двух зайцев: вы показываете умение работать с реальными данными и одновременно закрываете требование «практическая значимость».

Чем наполнить первую главу

Кроме стандартного обзора литературы, включите анализ аналогичных систем. Например, как «МегаФон» использует обезличенные данные для маркетплейса тарифов — это легальный пример работы с персональными данными. Здесь же уместно описать нормативную базу: ГОСТ 34.601 для автоматизированных систем, ISO/IEC 25010 для оценки качества ПО. Не нужно углубляться в юридию, достаточно показать, что вы знаете о существовании стандартов.

Вторая глава: проектирование без «воды»

Спроектируйте архитектуру в нотации C4 или UML. Достаточно трёх уровней: контейнеры (веб-приложение, БД, аналитический сервис), компоненты (модуль сбора данных, модуль сегментации, модуль рекомендаций), код (основные классы). Для наглядности добавьте диаграмму потока данных. Например:

Источник логов → ETL (pandas, SQL) → Хранилище признаков → Сегментация (RFM/KMeans) → Рекомендатель (правила/ML)

Сразу продумайте структуру БД. Для телеком-кейса подойдут таблицы:

users (user_id, age_group, region)
tariff_views (user_id, view_date, tariff_id)
tariffs (tariff_id, price, data_limit, minutes)

Ниже пример SQL-запроса, который выносит ключевые признаки для сегментации:

SELECT
  user_id,
  COUNT(*) AS total_views,
  AVG(EXTRACT(DOW FROM view_date)) AS avg_weekday,
  COUNT(DISTINCT tariff_id) AS tariffs_considered,
  MAX(view_date) > NOW() - INTERVAL '7 days' AS active_last_week
FROM tariff_views
GROUP BY user_id;

Третья глава: метрики, которые понимает комиссия

Одна из частых проблем студентов — пишут «эффективность повысилась», но не показывают цифр. Возьмите за основу метрики рекомендательных систем: precision@k, recall@k, F1-score. Проведите A/B-тест: контрольная группа получает стандартные рекомендации, экспериментальная — с учётом дня недели и возрастной группы. Результат оформляется таблицей:

МетрикаБазовый алгоритмПредложенный алгоритмПрирост
Precision@50.320.41+28%
Recall@50.280.36+29%
Конверсия в смену тарифа1.2%1.8%+50%

Не выдумывайте данные для таблицы — возьмите открытый датасет, например Telco Customer Churn с Kaggle, или сгенерируйте синтетику с помощью Python.

Практические выводы: чему вы научитесь

FAQ: частые вопросы студентов

1. Могу ли я использовать статью из CNews как официальный источник?

Да, но в списке литературы она будет смотреться слабее учебников и научных статей. Используйте новость во введении для обоснования актуальности, а в обзоре литературы ссылайтесь на исследования по анализу поведения потребителей и телеком-маркетингу.

2. Где брать данные, если нет доступа к данным «МегаФона»?

Открытые датасеты: Telecom Churn от IBM, Telco Customer Churn с Kaggle, данные с портала data.gov.ru. Если тема строго про тарифы — смоделируйте синтетические данные. Это нормально, главное — честно написать методику генерации.

3. Какие требования по ГОСТу предъявляются к структурным элементам?

Обычно вуз опирается на ГОСТ 7.32. Отдельно уточните методичку кафедры. Важно правильно оформить титульный лист, содержание, нумерацию страниц и библиографию. Программный код в приложениях, схемы — в тексте или приложениях. На защите часто спрашивают, почему выбрана та или иная архитектура — будьте готовы объяснить.

4. Что делать, если научный руководитель не понимает тему ML?

Сместите акцент на проектирование ПО: модуль рекомендаций — это классическая задача разработки. Опишите алгоритмы словами, добавьте UML-диаграммы и блок-схемы. Метрики оставьте в третьей главе — их поймёт любой математик. Не углубляйтесь в тонкости обучения нейросетей, используйте простые и интерпретируемые модели.

Чек-лист «Что проверить перед сдачей»

  • Все ли задачи из введения нашли отражение в выводах по главам?
  • Есть ли в работе диаграммы (C4 или UML) с описанием, а не просто картинка?
  • Указаны ли метрики эффективности и полученные численные результаты?
  • Соответствуют ли оформление списка литературы требованиям методички?
  • Пройден ли нормоконтроль и проверка на антиплагиат (>70% по системе вуза)?
  • Является ли исходный код/скрипт в приложении исполняемым и воспроизводимым?
  • Ссылка на статью CNews и другие источники корректна и активна?

Типичные ошибки студентов

Ошибка 1. Переписывание новостей. «МегаФон сообщил, кузбассовцы думают о тарифах в четверг» — это не аналитика. Избегайте пересказа: вместо этого стройте гипотезу и проверяйте её на данных. Например: «Пиковая активность в четверг и пятницу объясняется тем, что пользователи планируют бюджет на выходные».

Ошибка 2. Нет связи между главой 2 и главой 3. Спроектировали алгоритм, а тестировали что-то другое. Если во второй главе заявлен учёт дня недели, то в третьей обязательно сравните модель с этим признаком и без него.

Ошибка 3. Слишком сложные модели без обоснования. Не нужно тащить нейросети туда, где хватает логистической регрессии. Комиссия любит, когда студент может объяснить выбор стека и алгоритма простыми словами.

Нужна помощь с ВКР? Если вы застряли на проектировании, расчётах или оформлении — не тратьте время впустую. Наши специалисты готовы бесплатно проконсультировать вас по структуре работы и помочь с最难 этапами. Обращайтесь, разберём вашу тему за один день.

Материал подготовлен экспертами компании «ИТ-Диплом». Мы помогаем студентам с 2010 года: пишем код, проектируем архитектуры, оформляем пояснительные записки по ГОСТ. Если вам нужна помощь в разработке темы или оформлении работы — наши специалисты готовы подсказать.

Последнее обновление: 2026-08-15

Источник: Мысли о смене тарифа на связь приходят к кузбассовцам по четвергам и пятницам (опубликовано 2026-03-18)