Data Meetup VK Tech #1: платформы данных

18
августа 2026 года
Начало события в 18:00

Data Meetup VK Tech #1: платформы данных

Приглашаем на технический митап для инженеров, архитекторов и руководителей, которые проектируют, развивают и эксплуатируют платформы данных.

Офлайн-участие — по регистрации и подтверждению организатора. Для онлайн-подключения достаточно регистрации. Регистрируйтесь на мероприятие: https://tech.vk.ru/events/data-meetup-vk-tech-n-1/

Присоединяйтесь к Telegram-каналу «Данные на стероидах»! Там вас ждут анонсы новых мероприятий, практические материалы о работе с данными от команды Дата сервисов VK Tech и возможность задать вопросы экспертам.

В программе

17:30 - 18:05 Сбор гостей

18:05 - 18:35 Вычисления, хранение, масштабируемость: погружение в архитектуру гиперконвергентной дата-платформы

Павел Кутаков, Главный архитектор VK Data Platform, компания VK Tech

Вот уже больше 10 лет подход Compute/storage separation является мейнстримом благодаря быстрому росту скорости в сетях. Но всегда ли этот подход применим? Нам кажется что для построения платформы данных - не очень. Мы решили замкнуть спираль развития и вернуться к единой архитектуре, которую теперь принято называть гиперконвергентной.

В докладе расскажу почему было принято такое решение и как в такой архитектуре получить привычную для облаков гибкость решения. А также посмотрим как обеспечить безопасность одновременно с гибкостью и удобством эксплуатации.

18:35 - 19:25 Одна таблица — три шарда: S3-шардирование на stateless-сайдкарах

Дмитрий Листвин, Big Data Engineer команды аналитической инфраструктуры, компания «Авито»

Аналитическая платформа Авито живёт на Trino и Vertica поверх Hive-каталогов с хранением в S3 на HDD. Конфигурация S3, доступная нам, упёрлась в предел масштабирования — а мы хотели писать больше и читать быстрее.

Решили масштабировать по-своему: взяли несколько кластеров S3 и стали распределять файлы каждой таблицы по каждому кластеру. В качестве ключа — хеш пути объекта. Таким образом, мы читаем каждую партицию сразу с 3-х кластеров S3, увеличивая скорость в пике с 20 до 60 гигабайт в секунду.

А чтобы действовать быстро и не создавать лишних боттлнеков, использовали как шардирующий прокси уже существующие HAProxy-сайдкары, которые и так стоят на каждой compute-ноде.

В итоге каждая compute-нода сразу идёт в нужный S3 за нужным файлом, минуя классический прокси-слой.

В докладе расскажу, как писали расширение Haproxy на Lua, как хитро реализовали ListObjects и DeleteObjects запросы, какие проблемы собрали и как мы сейчас управляем этим решением при решардировании.

19:25 - 19:40 Перерыв

19:40 - 20:30 Круглый стол с инженерами из RWB и VK Tech

Участники: 

  • Павел Кутаков, Главный архитектор VK Data Platform, компания VK Tech
  • Юрий Гаврилов, Руководитель группы проектного менеджмента Юнита Платформа департамента медиа, компания RWB
  • Глеб Дубровин, Software Development Engineer (Backend), компания RWB

Ведущий: 

  • Алексей Гончарук, Руководитель разработки Cedrus, компания VK Tech

Инженеры RWB расскажут, как готовят кастомные сегменты для таргетирования с помощью Trino и DataFusion. Затем обсудим архитектуру и развитие современных платформ данных: Kubernetes, self-service-аналитику, подготовку инфраструктуры под AI-агентов и новые типы машинных нагрузок. Отдельно поговорим о том, как AI меняет разработку и эксплуатацию дата-платформ и куда в целом движется индустрия.

20:30 - 00:00 Нетворкинг, пицца и приятные напитки


Регистрация на мероприятие: https://tech.vk.ru/events/data-meetup-vk-tech-n-1/

Поделиться

18
августа 2026 года
Начало события в 18:00