Tech Lead SRE в Яндекс ID
Яндекс ID — одна из ключевых инфраструктурных систем Яндекса. Через неё проходят аутентификация и авторизация пользователей и сервисов, а от её работы напрямую зависит доступность большого количества продуктов компании.Обеспечение надёжности Паспорта
Вы будете техническим партнёром CTO по вопросам надёжности. Вам предстоит помогать принимать архитектурные решения, выявлять системные риски, разбирать сложные инциденты и оценивать, какие инвестиции в надёжность принесут наибольший эффект. Также вы станете ментором и дополнительным экспертом для команд, которые отвечают за критически важные компоненты ID.
Надёжность компонентов Яндекс ID
Вы будете детально изучать работу Blackbox, TVM, Паспорта и прокси. Вам нужно будет выявить основные причины сбоев и ограничения текущей архитектуры, а затем разработать программу, которая повысит их надёжность. Цель — добиться доступности критичных компонентов на уровне 99,99–99,999% там, где это возможно технически. При этом главное — не просто достичь высоких показателей, а обеспечить реальную надёжность: чтобы система устойчиво работала при сбоях инфраструктуры и зависимостей, позволяла локализовать аварии, продолжала функционировать при частичных отказах и автоматически восстанавливала работу.
Развитие SRE‑подхода
Вы будете вместе с командой развивать подходы к обеспечению надёжности критичных сервисов Яндекс ID: автоматизировать эксплуатационные задачи, улучшать инструменты и процессы, развивать инфраструктурную разработку. Важно помогать команде находить системные решения проблем надёжности, сокращать объём ручной работы и постепенно наращивать инженерные практики и экспертизу внутри службы.
Больше о бэкенде в Яндексе — в канале Yandex for Backend* Работали с SRE-практиками
- Обладаете сильным инженерным бэкграундом и работали с высоконагруженными распределёнными системами
- Глубоко понимаете принципы построения отказоустойчивых систем и умеете находить не только отдельные проблемы, но и системные ограничения надёжности
- Можете самостоятельно погрузиться в большую существующую систему и разобраться в её архитектуре, зависимостях и классах отказов
- Знаете, что такое техническое лидерство, и можете влиять на несколько команд без необходимости напрямую управлять каждым инженером
- Умеете превращать большие и плохо определённые проблемы в конкретную инженерную программу
- Можете одновременно работать на уровне архитектуры системы и погружаться в детали конкретного инцидента или компонента
- Умеете аргументировать технические решения и договариваться с сильными инженерами и руководителями* Отвечали за надёжность критичных инфраструктурных систем
- Строили системы с требованиями доступности 99,99% и выше
- Работали над разработкой инфраструктурных систем и хорошо пишете код
About the Company
More jobs at Yandex
-
QA-инженер в команду тестирования симулятора автономного транспорта
Москва, Санкт-Петербург · · Oct 2, 2026
-
AI Engineer в команду экспериментальных финтех‑проектов (Kotlin)
Санкт-Петербург, Москва, Минск · · Sep 30, 2026
-
Разработчик на C++ в ML-инфраструктуру рекомендаций Яндекс Еды (MLOps)
· Remote · Sep 17, 2026
-
Full‑Stack AI Engineer в команду экспериментальных финтех‑проектов (Kotlin)
· · Sep 17, 2026
-
SRE-инженер в команду AI-агентов Фантеха
Санкт-Петербург, Москва · · Sep 9, 2026