Data Scientist: Как начать карьеру в данных | Про IT и Digital

Data Scientist История Кати

Data Scientist. История Кати, которая нашла сокровища в цифровом мусоре

Как Катя нашла золото в горах данных, которые никто не хотел смотреть.


Скучная работа, которая изменила всё.

🧠 Катя работала в банке. В отделе, который назывался «Управление рисками». На деле это означало, что она каждый день смотрела на таблицы с просрочками по кредитам и делала отчёты для начальства.

— Катя, посчитай, сколько клиентов не платят третий месяц.
— Катя, сделай сводку по регионам.
— Катя, почему у нас такой высокий процент отказов?

Она чувствовала себя цифровой Золушкой. Данные текли рекой, но никто не пытался извлечь из них что-то большее, чем проценты и графики.
Однажды, когда она задержалась допоздна, её начальник Борис Иванович подошёл и сказал фразу, которая перевернула её жизнь:

Катя, ты знаешь, я смотрю на эти таблицы уже 15 лет. Я вижу, что какие-то клиенты всегда платят, а какие-то нет. И кажется, я могу предсказать, кто из новых не заплатит. Но я не могу это объяснить. Это просто чуйка.
Борис Иванович, а давайте я попробую превратить вашу чуйку в алгоритм? — спросила Катя.

Он удивлённо посмотрел на неё и махнул рукой:
— Давай. Всё равно хуже не будет.


С чего начинается Data Scientist

Катя начала с того, что открыла Python. Она знала его ещё с университета, но никогда не использовала на работе. Первое, что она сделала — скопировала историю всех кредитных заявок за три года. Это было 500 000 строк. Огромный массив.

Она начала чистить данные: убирать дубли, заполнять пропуски, преобразовывать даты, категориальные признаки переводить в числа. Это оказалось самым нудным этапом. Но Катя знала: грязные данные — это грязные предсказания.

Через две недели у неё была таблица, готовая к анализу. Она построила первую модель — логистическую регрессию. Результат был скромным: точность 74%. Только 74 из 100 клиентов модель классифицировала правильно. Многовато ошибок для банка.

Но Катя не сдалась.

Она вспомнила, что видела на курсах: нужно пробовать разные алгоритмы. Следующим был случайный лес (Random Forest). Точность выросла до 85%. Затем — градиентный бустинг. 91%.

А если добавить внешние данные? — подумала Катя.

Она нашла открытые данные о безработице по регионам, курсе валют, инфляции. Добавила их к своей модели. Точность выросла до 94%.

 


Презентация, которая изменила карьеру

Через месяц Катя пришла к Борису Ивановичу не с отчётом, а с презентацией.

Вот, смотрите. Наша новая модель предсказывает, какой клиент не вернёт кредит, с вероятностью 94%. Это на 12% точнее, чем было.

Борис Иванович долго молчал, глядя на экран. Потом улыбнулся.

Катя, ты ведь сама это сделала? Без привлечения IT-отдела?

Да, я сама. Я научилась.

А почему ты раньше молчала?

Катя пожала плечами:
— Думала, это слишком сложно для меня.

В ту неделю Катя стала не просто аналитиком, а Data Scientist-ом.

Теперь её модель использовалась в реальном процессе одобрения кредитов. Банк сократил количество невозвратов на 18% в первый же квартал. Катя получила повышение, а вместе с ним — свободу выбирать проекты.


Катя сегодня: о чём молчат вакансии

Сейчас Катя работает в отделе Data Science, где их команда из пяти человек решает задачи, о которых она раньше даже не слышала:

  • Прогноз оттока клиентов — кто уйдёт в следующем квартале.

  • Сегментация клиентов — чтобы предлагать им подходящие продукты.

  • Оптимизация кредитного скоринга — чтобы давать деньги тем, кто вернёт, и отказывать тем, кто не вернёт.


Катя часто шутит, что она — 
детектив, который ищет закономерности там, где обычный человек видит хаос.
Ей не нужно программировать сложные нейросети с нуля (это делают ML-инженеры).
Её задача — 
найти правильные данные, почистить их, применить правильную модель и объяснить бизнесу, что значит результат.

Самое сложное, — признаётся Катя, — это не математика и не код.

Это умение перевести язык цифр на язык бизнеса.

Когда я говорю финансистам: «мы снизили риск на 18%», они радуются. Когда я говорю: «ROC-AUC нашей модели 0,92», — они не понимают.

Поэтому Data Scientist — это ещё и переводчик с машинного на человеческий.


Что нужно знать, чтобы стать Data Scientist

Навык Уровень
Python (pandas, numpy, matplotlib, seaborn) средний-высокий
SQL (написание сложных запросов) средний
Статистика и теория вероятности средний
Понимание алгоритмов ML базовый-средний
Визуализация (умение красиво подать данные) средний
Бизнес-мышление — понимать, для чего нужна модель критически важно

Срок обучения: 8–14 месяцев при регулярных занятиях (с нуля до уровня junior).


💬 А теперь вопрос к вам

Катя начала с того, что просто попробовала — даже не зная, получится ли. А у вас были моменты, когда вы брались за что-то, чего не умели, и у вас получалось? Или, может быть, вы сейчас на распутье и думаете, с чего начать? Поделитесь — мы всегда на связи и готовы подсказать направление! 👇

  • Data Scientist — превращает горы данных в ценные инсайты и предсказательные модели.

    Входит в топ самых высокооплачиваемых профессий.

 



 

 

 

 

 

Вам может также понравиться...

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

error: Не копируйте текст и изображения.