Вакансия Ведущий инженер доступности в MAX

Ведущий инженер доступности в MAX

Ведущий инженер доступности в MAX
Мы разрабатываем крупнейший мессенджер в России, чтобы соединять людей, сервисы и компании. Создаём простые и удобные инструменты коммуникации.

Задачи

  • Развивать и сопровождать инфраструктуру highload-системы, повышать надёжность, доступность и производительность
  • Внедрять и поддерживать SLO/SLI и практики error budget, выстраивать алертинг на основе пользовательских метрик и приоритизации
  • Развивать observability (Prometheus/Alertmanager, Grafana, централизованные логи): делать эксплуатационные дашборды, настраивать алерты, снижать alert noise, улучшать MTTD/MTTR
  • Автоматизировать рутинные операции и эксплуатационные процессы, снижать toil, развивать self-service подходы для команд разработки
  • Участвовать в on-call, оперативно реагировать и устранять инциденты, координировать восстановление, проводить postmortem и доводить улучшения до продакшена
  • Взаимодействовать с командами разработки и смежными инфраструктурными командами: участвовать в архитектурных обсуждениях, ревью изменений, согласовании требований к production readiness
  • Вести и развивать эксплуатационную документацию: писать и актуализировать runbooks/playbooks для типовых инцидентов и деградаций, инструкции по релизам/роллбэкам и аварийным процедурам (в том числе DR), документировать дашборды/алерты и схемы зависимостей/эскалаций

Требования

  • Опыт 5+ лет в SRE/DevOps/Platform/System Engineering, опыт эксплуатации highload-систем
  • Глубокие знания Linux: администрирование, диагностика производительности (CPU/mem/io), анализ деградаций, systemd, файловые системы, лимиты/квоты, troubleshooting на production
  • Сетевые основы для диагностики: TCP/IP, DNS, HTTP/HTTPS, TLS, L4/L7 балансировка, keepalive; умение находить и устранять сетевые причины деградаций
  • Опыт эксплуатации распределённых систем: понимание partial failures, timeouts/retries, backpressure, graceful degradation
  • Облака: опыт эксплуатации инфраструктуры в публичном облаке — сети и балансировщики, autoscaling, IAM/роль‑модель; построение отказоустойчивости по зонам/регионам, базовые DR-подходы
  • Контейнеры и Kubernetes: понимание контейнеризации и практический опыт работы с Kubernetes на уровне эксплуатации (деплой, конфигурации, диагностика проблем приложений/окружения)
  • Infrastructure as Code: Terraform (или аналог) + Ansible; Git‑workflow, code review, версионирование инфраструктуры
  • CI/CD и управление изменениями: безопасные релизы (canary/blue‑green), rollback стратегии, снижение рисков изменений
  • Код и автоматизация: чтение чужого кода (Go/Java/Python) для диагностики; написание автоматизации (Python/Go/Bash), создание утилит/джоб для эксплуатации
  • Observability: Prometheus/Alertmanager, Grafana, централизованные логи (Graylog/ELK) — дашборды под эксплуатацию, алерты с учётом снижения шума и приоритизации
  • SRE-практики: SLI/SLO, error budget, incident response, postmortem без поиска виноватых
  • Готовность к on-call и участие в разборе и устранении инцидентов
  • Навыки создания и поддержки эксплуатационной документации: runbooks/playbooks, инструкции по деплою/роллбэку, схемы архитектуры, описания SLO/алертов; умение писать кратко и так, чтобы документ работал в инциденте

Будет плюсом

  • Опыт с БД/кешами/очередями: PostgreSQL/Redis/Cassandra/Kafka/ClickHouse и так далее
  • Сопровождение Java: JVM/GC, heap/thread dumps, профилирование, диагностика latency
  • Security basics: secrets management, least privilege

Мы предлагаем

Гибкий график работы
Бонусы и скидки от партнеров
Офис в центре города
ДМС
Профессиональная команда

Формат работы

Дистанционный

Уровень

senior

График работы

полный

MAX

Цифровая платформа, в которую интегрированы мессенджер, мини-приложения, нейропомощник, платёжный сервис и конструктор чат-ботов.

Мы предлагаем

Гибкий график работы
Бонусы и скидки от партнеров
Офис в центре города
ДМС
Профессиональная команда