9632 вакансии из первоисточников от 61 компания

Свежие вакансии с официальных сайтов компаний. Полные описания и прямой отклик работодателю.

В выдаче: 9632 вакансии 61 компания

Загружаем каталог...

Вакансия из официального источника

Разработчик системы трейсинга

Яндекс · Удалённая работа по России

Описание вакансии

Мы — команда, которая отвечает за разработку и развитие распределённой системы трассировки внутри observability-платформы. Наша система используется повсеместно в Яндексе и Yandex Cloud: она помогает инженерам анализировать производительность, выявлять инциденты и понимать поведение сложных распределённых систем.

Это критически важная и высоконагруженная инфраструктура, через которую ежедневно проходят миллиарды трассировок от сотен микросервисов. Надёжность и производительность нашего решения напрямую влияют на устойчивость ключевых сервисов Яндекса.

Трейсинг в числах:

- 20 ГБ/с поток на запись

- Миллиарды трассировок в день

- Кластер обработки данных: 600 контейнеров, 3600 CPU, 9 ТБ RAM

- 5 ПБ хранилище в ClickHouse

Технологический стек:

- Язык: Golang

- Протоколы: gRPC, HTTP, Protobuf

- Хранение: ClickHouse, YDB

- Observability: OpenTelemetry, Jaeger

- Оркестрация: Kubernetes, внутренняя облачная инфраструктура Яндекса

Какие задачи вас ждут

Масштабирование и повышение доступности системы

Необходимо обеспечить стабильную работу системы распределённого трассирования в условиях роста нагрузки. Это включает в себя анализ текущих узких мест, проектирование и внедрение решений для горизонтального масштабирования, отказоустойчивости и балансировки нагрузки. Вам предстоит работать с распределённым хранилищем трасс, компонентами ingestion и обработки, а ещё вместе с командой создавать стратегию обеспечения высокой доступности (high availability) всей системы.

Разработка горячего хранилища

Вы будете участвовать в разработке подсистемы горячего хранения трассировок, в которой данные временно накапливаются в памяти до их перекладывания в холодное хранилище. Эта подсистема должна обеспечивать высокую скорость приёма трасс, хранение в оперативной памяти и выполнение вычислений — агрегация, расчёт метрик, выделение аномалий — и других форм аналитики. По итогам обработки данные структурируются и отправляются в долговременное (холодное) хранилище. Важно обеспечить стабильную работу при высоких объёмах данных и реализовать гибкие механизмы управления жизненным циклом трассировок в памяти.

Развитие пользовательских сценариев для ускорения получения инсайтов

Вам предстоит улучшать пользовательский опыт при работе с системой трассировки: разрабатывать сценарии, позволяющие быстрее выявлять причины деградаций, ошибок и аномалий. Это подразумевает создание механизмов фильтрации и группировки трассировок, построение автоматических срезов (например, «медленные запросы», «ошибочные трассы», «редкие паттерны»), а также интеграцию с другими источниками информации: логами, метриками, алертами. Цель — свести к минимуму время между обнаружением проблемы и её пониманием.

Применение AI/ML к трассировкам: генерация и проверка гипотез, создание MVP

Нужно будет активно участвовать в исследовании возможностей применения AI/ML к данным трассировок. То есть как генерировать собственные идеи, так и проверять уже сформулированные гипотезы — от автоматического выявления аномалий до объяснения причин инцидентов с помощью моделей. Особое внимание будет уделено созданию MVP-инструментов, использующих большие языковые модели (BLM) для анализа и интерпретации трассировок, генерации кратких описаний, ответов на запросы инженеров и построения пользовательских сценариев. Задача требует инициативности, способности быстро собирать прототипы, работы с реальными данными и совместной итерации с ML-экспертами и продуктовыми командами.

Участие в развитии observability-платформы

Система трассировки — ключевой компонент широкой observability-платформы, включающей в себя также логи, метрики, алерты и пользовательские сценарии. Вам предстоит участвовать в архитектурной и технической проработке решений на стыке этих направлений: обеспечивать корреляцию трасс с логами и метриками, участвовать в унификации пользовательского интерфейса и API, выстраивать единые принципы хранения, навигации и анализа данных. Важна способность мыслить в масштабе всей платформы, видеть связи между подсистемами и предлагать решения, повышающие наблюдаемость сложных распределённых систем в целом.

Больше о бэкенде в Яндексе — в канале Yandex for Backend

Мы ждём, что вы

- Уверенно владеете Golang

- Разрабатывали высоконагруженные распределённые системы

- Понимаете принципы observability: трассировка, метрики, логи

- Умеете работать в команде, принимать технические решения и брать на себя ответственность

- Хотите решать сложные задачи, которые напрямую влияют на весь Яндекс

Будет плюсом, если вы

- Работали с различными инструментами трейсинга

- Работали с базами данных, аналогичными ClickHouse

Смотрите другие вакансии направления Yandex Cloud Observability Platform по ссылке .

Узнать больше

-

Yandex Infrastructure

-

Как в Яндексе проходят алгоритмические секции собеседований

-

Как мы нанимаем бэкенд-разработчиков

-

Задачи для подготовки к собеседованиям

Откликнуться на сайте компании

Источник: официальный сайт Яндекс. Актуальность проверена 22.09.2026 13:35 (Екатеринбург).