Вакансия из официального источника
Разработчик интеграции Apache Spark с YTsaurus
Яндекс · Екатеринбург, Нижний Новгород, Новосибирск, Санкт-Петербург, Москва
Описание вакансии
Привет! Я Саша Токарев, руковожу командой разработки интеграции Apache Spark с YTsaurus (проект SPYT). Мы ищем опытного Spark-разработчика, который станет частью нашей команды и будет вместе с нами развивать проект. Гарантируем большой объём сложных, но интересных и нетривиальных задач!
Саша Токарев
Ведущий разработчик группы разработки SPYT
YT (YTsaurus) — это основная платформа для аналитики и построения batch-процессов в Яндексе, которая включает несколько видов хранилищ, планировщик ресурсов и встроенный MapReduce-движок. Apache Spark — популярный открытый фреймворк для распределённой обработки больших объёмов данных.
Уже больше 5 лет мы занимаемся интеграцией Spark с YTsaurus в рамках проекта SPYT. За это время Spark стал одним из основных аналитических инструментов для работы с данными, которые хранятся в YTsaurus и используются как внутри Яндекса, так и внешними пользователями. Исходный код SPYT доступен в опенсорсе в репозитории . За последние годы мы несколько раз рассказывали про наш проект на конференциях:
- Как подключить к Apache Spark проприетарный источник данных
- Помогаем планировщику Apache Spark быть ещё эффективнее
- Spark Connect: новый подход для работы с Apache Spark
- YTsaurus Shuffle Service: как повысить надёжность и производительность тяжёлых Spark-приложений
Перед нами стоят всё более интересные и амбициозные задачи, и мы ищем сильного разработчика, который станет частью нашей команды.
Какие задачи вас ждут
Повышение эффективности интеграции Apache Spark и YTsaurus
Как у Spark, так и у YTsaurus регулярно выходят новые версии, которые расширяют набор предоставляемых этими инструментами возможностей. Одна из основных задач команды — постоянно интегрировать их, чтобы обеспечивать наиболее эффективное взаимодействие. Кроме того, мы проводим регулярные бенчмарки, в ходе которых определяем проблемные зоны в интеграции и устраняем их.
Расширение области применения инструмента
Мы находимся в тесном контакте с дата-инженерами — как с теми, кто работает в Яндексе, так и с опенсорс-пользователями: помогаем им наиболее эффективно решать задачи при помощи нашего инструмента. На основе обратной связи от них, а также общих трендов развития инструментов для дата-инженерии мы регулярно актуализируем план дальнейшей интеграции.
Продвижение опенсорс-проекта
С 2023 года код YTsaurus, в том числе и SPYT, есть в открытом доступе, поэтому мы активно работаем над развитием внешнего комьюнити вокруг проекта.
Мы ждём, что вы
- Работали с Apache Spark не менее трёх лет и знаете, как добиться от него максимальной эффективности
- Умеете разрабатывать под JVM на Java и Scala, а также на Python
- Понимаете принципы распределённого хранения и обработки больших объёмов данных
Будет плюсом, если вы
- Работали с Hadoop-стеком (HDFS, YARN)
- Работали с Docker и Kubernetes
- Принимали участие в работе над опенсорс-проектом
- Знаете C++
Больше о команде
Мы искренне увлечены большими распределёнными системами и сложными техническими задачами. Многие из нас имеют академический опыт и до сих пор активно преподают — в МФТИ, ВШЭ и других вузах, а также в ШАДе. Несколько человек из нашей команды занимали призовые места в соревнованиях по спортивному программированию.
У нас сохраняется дух стартапа: дружно общаемся в рабочее и нерабочее время, вместе штурмуем задачи, экспериментируем и участвуем в CTF.
Узнать больше
-
YTsaurus
-
Офисы в Екатеринбурге
-
Офисы в Нижнем Новгороде
-
Офисы в Новосибирске
-
Офисы в Санкт-Петербурге
-
Офисы в Москве
-
Как в Яндексе проходят алгоритмические секции собеседований
-
Как мы нанимаем бэкенд-разработчиков
-
Задачи для подготовки к собеседованиям
Откликнуться на сайте компании
Источник: официальный сайт Яндекс. Актуальность проверена 14.09.2026 13:31 (Екатеринбург).
