Data Meetup VK Tech #1: платформы данных
Data Meetup VK Tech #1: платформы данных
Приглашаем на технический митап для инженеров, архитекторов и руководителей, которые проектируют, развивают и эксплуатируют платформы данных.
Офлайн-участие — по регистрации и подтверждению организатора. Для онлайн-подключения достаточно регистрации. Регистрируйтесь на мероприятие: https://tech.vk.ru/events/data-meetup-vk-tech-n-1/
Присоединяйтесь к Telegram-каналу «Данные на стероидах»! Там вас ждут анонсы новых мероприятий, практические материалы о работе с данными от команды Дата сервисов VK Tech и возможность задать вопросы экспертам.
В программе
17:30 - 18:05 Сбор гостей
18:05 - 18:35 Вычисления, хранение, масштабируемость: погружение в архитектуру гиперконвергентной дата-платформы
Павел Кутаков, Главный архитектор VK Data Platform, компания VK Tech
Вот уже больше 10 лет подход Compute/storage separation является мейнстримом благодаря быстрому росту скорости в сетях. Но всегда ли этот подход применим? Нам кажется что для построения платформы данных - не очень. Мы решили замкнуть спираль развития и вернуться к единой архитектуре, которую теперь принято называть гиперконвергентной.
В докладе расскажу почему было принято такое решение и как в такой архитектуре получить привычную для облаков гибкость решения. А также посмотрим как обеспечить безопасность одновременно с гибкостью и удобством эксплуатации.
18:35 - 19:25 Одна таблица — три шарда: S3-шардирование на stateless-сайдкарах
Дмитрий Листвин, Big Data Engineer команды аналитической инфраструктуры, компания «Авито»
Аналитическая платформа Авито живёт на Trino и Vertica поверх Hive-каталогов с хранением в S3 на HDD. Конфигурация S3, доступная нам, упёрлась в предел масштабирования — а мы хотели писать больше и читать быстрее.
Решили масштабировать по-своему: взяли несколько кластеров S3 и стали распределять файлы каждой таблицы по каждому кластеру. В качестве ключа — хеш пути объекта. Таким образом, мы читаем каждую партицию сразу с 3-х кластеров S3, увеличивая скорость в пике с 20 до 60 гигабайт в секунду.
А чтобы действовать быстро и не создавать лишних боттлнеков, использовали как шардирующий прокси уже существующие HAProxy-сайдкары, которые и так стоят на каждой compute-ноде.
В итоге каждая compute-нода сразу идёт в нужный S3 за нужным файлом, минуя классический прокси-слой.
В докладе расскажу, как писали расширение Haproxy на Lua, как хитро реализовали ListObjects и DeleteObjects запросы, какие проблемы собрали и как мы сейчас управляем этим решением при решардировании.
19:25 - 19:40 Перерыв
19:40 - 20:30 Круглый стол с инженерами из RWB и VK Tech
Участники:
- Павел Кутаков, Главный архитектор VK Data Platform, компания VK Tech
- Юрий Гаврилов, Руководитель группы проектного менеджмента Юнита Платформа департамента медиа, компания RWB
- Глеб Дубровин, Software Development Engineer (Backend), компания RWB
Ведущий:
- Алексей Гончарук, Руководитель разработки Cedrus, компания VK Tech
Инженеры RWB расскажут, как готовят кастомные сегменты для таргетирования с помощью Trino и DataFusion. Затем обсудим архитектуру и развитие современных платформ данных: Kubernetes, self-service-аналитику, подготовку инфраструктуры под AI-агентов и новые типы машинных нагрузок. Отдельно поговорим о том, как AI меняет разработку и эксплуатацию дата-платформ и куда в целом движется индустрия.
20:30 - 00:00 Нетворкинг, пицца и приятные напитки
Регистрация на мероприятие: https://tech.vk.ru/events/data-meetup-vk-tech-n-1/



