Site Reliability Engineer в группу эксплуатации YT в One-cloud, Москва
YTsaurus — опенсорс-платформа для хранения и обработки данных, которую в VK активно развивают и используют как основу единого дата-лейка. Система обрабатывает миллионы событий в секунду на динамических таблицах, работает с сотнями петабайт данных и обслуживает тысячи пользователей. У нас большие кластеры, сложная инфраструктура и высокие требования к надёжности. И мы ищем SRE, который поможет поддерживать и развивать всё это.
Задачи
- Автоматизировать эксплуатацию YTsaurus
- Интегрировать платформу с внутренними системами VK
- Следить за стабильностью и производительностью
- Разбираться с проблемами на уровне кода (в основном C++)
- Решать задачи, которые не гуглятся
- Разбираться с инцидентами в рамках дежурств
- Масштабировать кластер YTsaurus до 500ПБ
- Заниматься оптимизацией использования железа (CPU, диски)
Требования
- Опыт работы с распределёнными системами
- Знания в области сетей (TCP/IP, DNS, балансировка, ACL) и ОС Linux
- Способность работать самостоятельно: формулировать цели, предлагать решения
Будет плюсом
- Опыт работы с высоконагруженными системами или большими объёмами данных
- Владение C++ на уровне чтения и отладки сложного кода
Мы предлагаем
Гибкий график работы
Бонусы и скидки от партнеров
Офис в центре города
ДМС
Профессиональная команда
Формат работы
Дистанционный
Комбинированный
Уровень
senior
График работы
полный
One-cloud
Мы создаём и внедряем облачные технологии для одной из крупнейших серверных инфраструктур. Наша технологическая платформа включает S3-хранилища, базы данных, облако One Cloud, системы метрик, единой конфигурации, мониторинга, средства и инструменты разработки и диагностики. Разрабатываем новые решения и создаём программы с открытым исходным кодом.
Мы предлагаем
Гибкий график работы
Бонусы и скидки от партнеров
Офис в центре города
ДМС
Профессиональная команда