Группа разработки инструментов надёжности отвечает за важную часть мониторинга VK. Мы разрабатываем инструменты оценки SLO, проверки доступности (а-ля downdetect), таймлайны и прочее. Также отвечаем за автоматизацию процессов по заведению управления инцидентами.
Мы являемся частью инфраструктуры мониторинга облака VK и плотно взаимодействуем с командами мониторинга и ситуационного центра. Все алерты всех команд проходят через наши сервисы — так что мы ещё и отвечаем то, чтобы все продолжало работать в любых условиях.
Задачи
- Разработка сервисов и инструментов для алертинга и управления инцидентами
- Интеграция с системами VictoriaMetrics, Grafana, Kafka/Redis Streams
- Интеграция open-source решений с in-house инфраструктурой ВКонтакте
- Построение observabilty-платформы
- Проектирование API и внутренних сервисов для обмена событиями и метриками
- Оптимизация производительности и надёжности разрабатываемых систем
- Участие в архитектурных решениях, код-ревью и CI/CD-автоматизации
Требования
- От пяти лет коммерческого опыта разработки на Go
- Глубокое понимание принципов построения распределённых систем, очередей сообщений, потоковой обработки событий, работы сетей и ОС Linux
- Опыт работы с реляционными (PostgreSQL) и нереляционными БД (Redis; ClickHouse будет плюсом)
- Навыки построения REST/gPRC API
- Опыт написания unit- и интеграционных тестов
- Проактивность: умение организовать процесс разработки и предлагать архитектурные улучшения
Мы предлагаем
Формат работы
Уровень
График работы
One-cloud
Мы создаём и внедряем облачные технологии для одной из крупнейших серверных инфраструктур. Наша технологическая платформа включает S3-хранилища, базы данных, облако One Cloud, системы метрик, единой конфигурации, мониторинга, средства и инструменты разработки и диагностики. Разрабатываем новые решения и создаём программы с открытым исходным кодом.