9386 вакансий из первоисточников от 65 компаний

Свежие вакансии с официальных сайтов компаний. Полные описания и прямой отклик работодателю.

В выдаче: 9386 вакансий 65 компаний

Загружаем каталог...

Вакансия из официального источника

Data Quality Middle+/Senior (Антифрод-платформа)

Сбер · г Москва

Описание вакансии

Мы развиваем продукт DataQuality - систему мониторинга качества данных, которая в реальном времени следит за потоком событий антифрод-платформы: согласованность полей, заполненность расчетов, стабильность скорингов и агрегатов, статистику срабатывания фрод-правил, пропажу типов событий.

Мы ищем аналитика данных, который возьмет на себя две связанные задачи: довести систему алертов до состояния, когда сигналов мало, но каждый по делу, и исследовать связанные с данными обращения пользователей антифрод-платформы, находя в них подсказки о том, что мы еще не умеем мониторить.

Это техническая роль. Поток платформы - тысячи событий в секунду, история в Hadoop - миллиарды строк. Поэтому нужно понимать, как Spark исполняет ваш запрос, и уверенно владеть статистикой: пороги алертов выводятся из распределений, а не подбираются на глаз.

Роль хорошо подойдет тем, кто работал с ML (обучал и оценивал модели, искал аномалии, следил за дрейфом признаков), но не хочет уходить в Data Science или MLOps. У нас статистика и ML-подходы применяются к прикладной задаче с быстрым результатом: настроенная вами проверка уже завтра ловит реальный инцидент на боевом потоке.

Обязанности

* разбирать поток срабатываний проверок качества данных, отличая реальную деградацию от шума и ложных сигналов

* настраивать проверки так, чтобы снижать долю ложных срабатываний: подбирать пороги по уровням severity, окно агрегации и базовый период на основе распределения метрики за исторический период, а не «на глаз»

* копать до первопричины срабатываний: идти в сырые события, поднимать историю, сопоставлять с релизами и инцидентами

* оценивать качество алертов: сколько сигналов были ложными и почему (строгий порог, короткое окно, сезонность, редкий тип события)

* развивать методы детектирования: проверять статистические и ML-подходы к поиску аномалий и дрейфа на временных рядах и распределениях скорингов, оценивать их на истории инцидентов и предлагать, что включать в продукт

* работать с полной историей событий в Hadoop: писать запросы и расчеты на Spark SQL и PySpark так, чтобы они укладывались в ресурсы общего кластера

* исследовать обращения, которые пользователи антифрод-платформы пишут в поддержку, и вытаскивать из них реальную проблему с данными

* соотносить обращения с текущим покрытием мониторинга: понимать, что уже отлавливается проверками, а где инструмента нет

* доводить находку до понятного «полуфабриката»: проблема, подтвержденная на данных, и передавать ее системному аналитику, который оформит из нее требования для команды разработки.

Требования

* опыт в аналитике данных или Data Science от трех лет, включая работу с потоковыми или near-real-time данными и с большими объемами в Hadoop / Spark

* Spark SQL и PySpark на больших объемах - ежедневный инструмент: условия проверок в системе пишутся на Spark SQL. Важно понимать, как запрос исполняется. Нужно уметь прочитать план запроса и оценить его стоимость до запуска: кластер общий, и тяжелый запрос по полной истории мешает всем

* SQL уверенно: оконные функции, многошаговые агрегации, джойны с контролем кардинальности, корректная работа с NULL и типами. Понимание, почему запрос деградирует, и чем колоночная СУБД отличается от строчной; опыт с ClickHouse будет плюсом

* Python как основной рабочий инструмент, а не эпизодический. Способность быстро написать скрипт, который поднимет историю срабатываний и покажет, какие пороги дают ложные сигналы

* теория вероятностей и математическая статистика на уровне уверенного применения: доверительные интервалы, проверка гипотез, ошибки первого и второго рода и тд

* прикладная статистика для мониторинга: дрейф распределений (PSI), отклонение среднего и дисперсии от базовой линии, выбросы (z-score / IQR), сезонность; precision / recall применительно к алертам. Меры расхождения распределений и принятые для них пороговые значения, баланс ложноположительных и ложноотрицательных срабатываний

* практический опыт с ML: потребуется понимать метрики качества, как работает переобучение, дрейф признаков и то, как качество данных влияет на модель. Выводить модели в продакшен не потребуется

* понимание принципов мониторинга качества данных: типы проверок, уровни severity и то, что за ними стоят разные действия от информирования до инцидента

* системный взгляд и исследовательская жилка: видеть картину целиком, не лечить симптом порогом, если корень в источнике данных, и копать до истины

Будет плюсом:

* понимание работы фрод-правил и скорингов

* опыт оптимизации расчетов на Spark

* опыт ML-детектирования аномалий и дрейфа данных в промышленном мониторинге (это направление у нас в развитии)

* опыт работы в поддержке / эксплуатации: разбор инцидентов, приоритизация обращений

* опыт с инструментами контроля качества данных: Great Expectations, Soda, Evidently, Monte Carlo. Отдельно ценим понимание, где их настройки по умолчанию перестают работать на больших объемах

* опыт с каталогами данных и lineage: Atlas, DataHub, OpenLineage

* опыт работы с ИИ-ассистентами при разборе кода.

Условия

* комфортный современный офис в Москве, Кутузовский, 32

* график работы – офис

* ежегодный пересмотр зарплаты, квартальная и годовая премия

* корпоративный спортзал и зоны отдыха

* более 400 образовательных программ СберУниверситета для профессионального и карьерного развития

* программа адаптации и помощь руководителя на старте (для Junior позиций)

* расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа

* гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ

* подписка Прайм с возможностью совместного использования на трёх близких

* вознаграждение за рекомендацию друзей в команду Сбер

Откликнуться на сайте компании

Источник: официальный сайт Сбер. Актуальность проверена 06.10.2026 19:50 (Екатеринбург).