Вакансия из официального источника
Старший инженер данных в команду продуктовой аналитики Инфраструктуры
Яндекс · Москва, Санкт-Петербург
Описание вакансии
Инфраструктура Яндекса — это технологии, системы и сервисы, на которых работают все продукты компании. Мы обеспечиваем полный цикл разработки — от написания кода до развёртывания приложений и сервисов.
Мы превращаем данные о процессе разработки в решения, которые двигают компанию вперёд. Тимлиды, технические и продакт-менеджеры приходят к нам, чтобы понять, как развивать свои внутренние сервисы, — и получают ответы, основанные на данных. Наш фокус — экономия железа, AI readiness и качественные продуктовые запуски внутренних сервисов. Для этого мы развиваем своё хранилище данных.
Наши системы сложнее типичного бизнес-DWH на порядок. Мы не строим витрины по продажам или маркетингу — мы анализируем саму инженерную культуру компании: данные внутренних репозиториев, процессы сборки, тестирования и деплоя. Это значит, что вместо погружения в нишевую бизнес-предметную область вы будете разбираться в деталях реализации инфраструктуры и распределённых систем, которые ежедневно обрабатывают петабайты данных и держат нагрузку в десятки тысяч RPS — с нетривиальными задачами по моделированию данных, производительности и масштабированию, которых просто нет в классических DWH.
Наша глобальная цель — сделать так, чтобы любую аналитику по сервисам Инфраструктуры можно было получить, не задумываясь о том, кто, куда и в каком формате отгружает логи. Для этого мы бережно собираем в DWH очищенные и описанные данные, по которым технические менеджеры и коллеги из других бизнес-юнитов могут смотреть любые интересующие их метрики.
Разработка в Яндексе — основной производственный процесс компании. Ваши метрики и витрины будут напрямую влиять на эффективность тысяч инженеров, а значит — на скорость и качество создания ключевых продуктов Яндекса.
Какие задачи вас ждут
Разработка DWH
Вам предстоит разрабатывать ETL-процессы на внутренних инструментах с использованием Python и YQL — внутреннего диалекта SQL. Нужно будет проектировать сущности из данных и создавать витрины для аналитики и ML.
Проработка интеграций
Вам предстоит разобраться во всех тонкостях десятков систем-источников, которые хранят данные в различных базах и разных форматах, чтобы свести всё к понятному формату для построения качественных витрин.
Оптимизация кода и мультиагентной разработки
Вам предстоит оптимизировать код, чтобы обеспечить быструю обработку большого объёма данных. Мы постоянно улучшаем существующие ETL-процессы и ищем возможности ускорения запросов.
Мультиагентная разработка уже дала нам кратный рост скорости — в 4 раза. Теперь фокус смещается с «быстрее» на «эффективнее и удобнее». Вызов — уменьшить time-to-market, сократить расход токенов и минимизировать количество интервенций (моментов, когда агентам нужен человек), чтобы работа с AI-инструментами была одновременно быстрой, дешёвой и по-настоящему автономной.
Надёжность на масштабе
Мы выросли кратно: за полгода 2026 года подключили столько же систем-источников, сколько за 2024 и 2025 год, вместе взятые. DWH такого масштаба живёт по другим законам: то, что стабильно работало на десятке пайплайнов, перестаёт быть управляемым на сотне. Вызов — не тушить инциденты вручную, а построить метрики стабильности и процессы, которые будут системно справляться с этим ростом, на порядок опережая его.
Кросс-ДЦ-отчётность
Учения по отключению дата-центров — это часть жизни инфраструктуры Яндекса, и DWH должен быть к этому готов не хуже боевых сервисов. Вызов — спроектировать архитектуру так, чтобы дашборды и витрины продолжали работать бесшовно, независимо от того, что происходит с ДЦ под капотом.
Больше о том, как мы делаем внутреннюю инфраструктуру Яндекса, — в канале Yandex Infrastructure
Мы ждём, что вы
- Отлично владеете Python и SQL
- Проектировали и развивали DWH или аналитические платформы: выбирали архитектуру, стек и подходящую модель проектирования данных
- Глубоко понимаете устройство распределённых вычислительных движков и умеете системно оптимизировать производительность и ресурсы под рост нагрузки
- Отвечали за эксплуатацию критичных доменов данных: определяли SLO, выстраивали мониторинг, устраняли системные причины сбоев
- Умеете системно применять AI-агентов в разработке: ставить задачи так, чтобы агенты работали автономно, и оценивать результат их работы
- Готовы погружаться в специфику инфраструктуры, тесно общаться с разработчиками и менеджерами и брать на себя ответственность за критичные домены и сервисы
Узнать больше
-
Yandex Infrastructure
-
Офисы в Москве
-
Офисы в Санкт-Петербурге
Откликнуться на сайте компании
Источник: официальный сайт Яндекс. Актуальность проверена 30.09.2026 17:01 (Екатеринбург).
