Site Reliability Engineer(SRE)

Company: 당근마켓
Location: г Москва
Type:
Posted: Oct 7, 2026
Views: 0

AI-платформа корпоративного уровня — аналог AI Hub. Реализован чат-интерфейс (аналог ChatGPT) и сценарии сбора аналитики по собственным базам знаний (RAG на базе Qdrant) и по открытым источникам в интернете. В качестве LLM используются современные модели, задействован LLM-шлюз с маршрутизацией запросов.

Проект введён в промышленную эксплуатацию: работают реальные пользователи, нагрузка стабилизирована, требования к доступности согласованы.

Технологический стек:

· PostgreSQL — основное хранилище данных

· Kubernetes — оркестрация

· Kafka — обмен событиями

· Redis — кэширование

· S3 (совместимое объектное хранилище) — данные и бэкапы

· Qdrant — векторная база знаний

· Prometheus + Grafana — мониторинг

· OpenSearch — логи### Твои задачи:

  • обеспечение доступности и отказоустойчивости платформы в проде: определение и контроль SLO/SLI, дежурства, разбор инцидентов, проведение postmortem

  • разработка и сопровождение CI/CD-конвейеров, инфраструктуры как кода (IaC)

  • управление Kubernetes: кластеры и версии, admission-контроллеры, network policies, resource limits/requests, HPA, автоскейлинг

  • диагностика и оптимизация производительности (CPU / memory / I/O), профилирование нагрузки LLM-инференса

  • настройка и развитие наблюдаемости: метрики, логи, трассировки, алертинг, дашборды

  • управление секретами и доступом, выполнение требований безопасности

  • работа с Kafka, Redis, PostgreSQL и S3: настройка, тюнинг, резервное копирование и восстановление, DR-планы

  • участие в архитектурных решениях для новых сервисов платформы.### Мы ожидаем, что у тебя есть:

  • 3+ года опыта в SRE / DevOps / платформенной инфраструктуре

  • глубокий опыт работы с Kubernetes в промышленной эксплуатации

  • PostgreSQL: планирование запросов, индексы, репликация, бэкапы и восстановление

  • Kafka, Redis, S3-совместимые объектные хранилища

  • CI/CD, Linux, Bash

  • мониторинг и логирование: Prometheus / Grafana, OpenSearch, алертинг

  • понимание принципов SLO / SLI / Error Budgets

  • опыт работы с облачной и on-premise инфраструктурой, сетевой уровень, TLS

  • опыт создания AI-агентов и использования их в работе будет преимуществом.

Будет плюсом:

  • опыт эксплуатации ML/LLM-инференса (vLLM, Triton, KServe), понимание нагрузочных профилей GPU

  • опыт работы с векторными БД (Qdrant, Milvus, pgvector)

  • знание IaC (Terraform, Ansible)

  • опыт участия в RAG / AI-платформенных проектах

  • навыки написания postmortem и улучшения процессов эксплуатации.### Работа в СберТехе - это:

  • гибридный формат работы

  • годовой бонус и ежегодный пересмотр зарплаты

  • статус аккредитованной ИТ-компании

  • расширенный ДМС с первого дня и льготное страхование для семьи

  • корпоративный университет Сбера, внутренняя образовательная платформа, участие в IT-конференциях

  • 90 дней удаленной работы из любого региона РФ

  • льготная ипотека в Сбере

  • бесплатная подписка СберПрайм, которой можно поделиться с 3 близкими.

About the Company

Name: 당근마켓

당근은 동네의 숨은 가치에 주목합니다. 근처 이웃과의 중고 직거래를 시작으로, 전에 없던 지역 생활 커뮤니티를 만들어 나가고 있어요. 이웃들은 진짜 우리 동네 이야기를 나누고, 가게 사장님들은 이웃의 목소리를 가장 가까이서 들을 수 있지요. 거래부터 모임, 홍보, 결제까지, 로컬에서 일어나는 모든 경험을 당근이 하나로 연결하고 있습니다.

More jobs at 당근마켓