Data Scientist История Кати

Data Scientist. История Кати, которая нашла сокровища в цифровом мусоре
Как Катя нашла золото в горах данных, которые никто не хотел смотреть.
Скучная работа, которая изменила всё.
🧠 Катя работала в банке. В отделе, который назывался «Управление рисками». На деле это означало, что она каждый день смотрела на таблицы с просрочками по кредитам и делала отчёты для начальства.
— Катя, посчитай, сколько клиентов не платят третий месяц.
— Катя, сделай сводку по регионам.
— Катя, почему у нас такой высокий процент отказов?
Она чувствовала себя цифровой Золушкой. Данные текли рекой, но никто не пытался извлечь из них что-то большее, чем проценты и графики.
Однажды, когда она задержалась допоздна, её начальник Борис Иванович подошёл и сказал фразу, которая перевернула её жизнь:
Катя, ты знаешь, я смотрю на эти таблицы уже 15 лет. Я вижу, что какие-то клиенты всегда платят, а какие-то нет. И кажется, я могу предсказать, кто из новых не заплатит. Но я не могу это объяснить. Это просто чуйка.
Борис Иванович, а давайте я попробую превратить вашу чуйку в алгоритм? — спросила Катя.
Он удивлённо посмотрел на неё и махнул рукой:
— Давай. Всё равно хуже не будет.
С чего начинается Data Scientist
Катя начала с того, что открыла Python. Она знала его ещё с университета, но никогда не использовала на работе. Первое, что она сделала — скопировала историю всех кредитных заявок за три года. Это было 500 000 строк. Огромный массив.
Она начала чистить данные: убирать дубли, заполнять пропуски, преобразовывать даты, категориальные признаки переводить в числа. Это оказалось самым нудным этапом. Но Катя знала: грязные данные — это грязные предсказания.
Через две недели у неё была таблица, готовая к анализу. Она построила первую модель — логистическую регрессию. Результат был скромным: точность 74%. Только 74 из 100 клиентов модель классифицировала правильно. Многовато ошибок для банка.
Но Катя не сдалась.
Она вспомнила, что видела на курсах: нужно пробовать разные алгоритмы. Следующим был случайный лес (Random Forest). Точность выросла до 85%. Затем — градиентный бустинг. 91%.
А если добавить внешние данные? — подумала Катя.
Она нашла открытые данные о безработице по регионам, курсе валют, инфляции. Добавила их к своей модели. Точность выросла до 94%.
Презентация, которая изменила карьеру
Через месяц Катя пришла к Борису Ивановичу не с отчётом, а с презентацией.
Вот, смотрите. Наша новая модель предсказывает, какой клиент не вернёт кредит, с вероятностью 94%. Это на 12% точнее, чем было.
Борис Иванович долго молчал, глядя на экран. Потом улыбнулся.
Катя, ты ведь сама это сделала? Без привлечения IT-отдела?
Да, я сама. Я научилась.
А почему ты раньше молчала?
Катя пожала плечами:
— Думала, это слишком сложно для меня.
В ту неделю Катя стала не просто аналитиком, а Data Scientist-ом.
Теперь её модель использовалась в реальном процессе одобрения кредитов. Банк сократил количество невозвратов на 18% в первый же квартал. Катя получила повышение, а вместе с ним — свободу выбирать проекты.
Катя сегодня: о чём молчат вакансии
Сейчас Катя работает в отделе Data Science, где их команда из пяти человек решает задачи, о которых она раньше даже не слышала:
-
Прогноз оттока клиентов — кто уйдёт в следующем квартале.
-
Сегментация клиентов — чтобы предлагать им подходящие продукты.
-
Оптимизация кредитного скоринга — чтобы давать деньги тем, кто вернёт, и отказывать тем, кто не вернёт.
Катя часто шутит, что она — детектив, который ищет закономерности там, где обычный человек видит хаос.
Ей не нужно программировать сложные нейросети с нуля (это делают ML-инженеры).
Её задача — найти правильные данные, почистить их, применить правильную модель и объяснить бизнесу, что значит результат.
Самое сложное, — признаётся Катя, — это не математика и не код.
Это умение перевести язык цифр на язык бизнеса.
Когда я говорю финансистам: «мы снизили риск на 18%», они радуются. Когда я говорю: «ROC-AUC нашей модели 0,92», — они не понимают.
Поэтому Data Scientist — это ещё и переводчик с машинного на человеческий.
Что нужно знать, чтобы стать Data Scientist
| Навык | Уровень |
|---|---|
| Python (pandas, numpy, matplotlib, seaborn) | средний-высокий |
| SQL (написание сложных запросов) | средний |
| Статистика и теория вероятности | средний |
| Понимание алгоритмов ML | базовый-средний |
| Визуализация (умение красиво подать данные) | средний |
| Бизнес-мышление — понимать, для чего нужна модель | критически важно |
Срок обучения: 8–14 месяцев при регулярных занятиях (с нуля до уровня junior).
💬 А теперь вопрос к вам
Катя начала с того, что просто попробовала — даже не зная, получится ли. А у вас были моменты, когда вы брались за что-то, чего не умели, и у вас получалось? Или, может быть, вы сейчас на распутье и думаете, с чего начать? Поделитесь — мы всегда на связи и готовы подсказать направление! 👇
-
Data Scientist — превращает горы данных в ценные инсайты и предсказательные модели.
Входит в топ самых высокооплачиваемых профессий.





















