<link rel="preload" as="image" href="https://tech-events.vktech-static.ru/static/images/icons/LocationMapIcon_28.svg"/><div class="EventPageDateAndTime_location__uQjGW"><img src="https://tech-events.vktech-static.ru/static/images/icons/LocationMapIcon_28.svg" alt="" class="EventPageDateAndTime_locationIcon__AS6PF"/><p class="typography_23498 bodyM_055b7">Офис VK, БЦ «SkyLight», Ленинградский пр-т, 39</p></div>
О мероприятии
Технический митап для инженеров, архитекторов и руководителей, которые проектируют, развивают и эксплуатируют платформы данных.
Митап состоит из 3 частей.
Первая часть: спикеры расскажут 2 доклада, которые посвящены архитектуре, хранению и масштабированию аналитической инфраструктуры.
Вторая часть: круглый стол инженеров RWB и VK Tech: кейс Trino и DataFusion в RWB и дискуссия о будущем платформ данных в эпоху AI.
Третья часть: нетворкинг, притяные напитки, пицца.
Офлайн-участие — по регистрации и подтверждению организатора. Для онлайн-подключения достаточно регистрации.
Присоединяйтесь к Telegram-каналу[ «Данные на стероидах»](https://telegram.me/sterodata)! Там вас ждут анонсы новых мероприятий, практические материалы о работе с данными от команды Дата сервисов VK Tech и возможность задать вопросы экспертам.
[→ Добавить событие в календарь](https://tools.emailmatrix.ru/event-generator/?format=ics&id=498136)
В программе
Сбор гостей
Вычисления, хранение, масштабируемость: погружение в архитектуру гиперконвергентной дата-платформы
Павел КутаковГлавный архитектор VK Data Platform, компания VK Tech
Вот уже больше 10 лет подход Compute/storage separation является мейнстримом благодаря быстрому росту скорости в сетях. Но всегда ли этот подход применим? Нам кажется что для построения платформы данных - не очень. Мы решили замкнуть спираль развития и вернуться к единой архитектуре, которую теперь принято называть гиперконвергентной.
В докладе расскажу почему было принято такое решение и как в такой архитектуре получить привычную для облаков гибкость решения. А также посмотрим как обеспечить безопасность одновременно с гибкостью и удобством эксплуатации.
Одна таблица — три шарда: S3-шардирование на stateless-сайдкарах

Дмитрий ЛиствинBig Data Engineer команды аналитической инфраструктуры, компания «Авито»
Аналитическая платформа Авито живёт на Trino и Vertica поверх Hive-каталогов с хранением в S3 на HDD. Конфигурация S3, доступная нам, упёрлась в предел масштабирования — а мы хотели писать больше и читать быстрее.
Решили масштабировать по-своему: взяли несколько кластеров S3 и стали распределять файлы каждой таблицы по каждому кластеру. В качестве ключа — хеш пути объекта. Таким образом, мы читаем каждую партицию сразу с 3-х кластеров S3, увеличивая скорость в пике с 20 до 60 гигабайт в секунду.
А чтобы действовать быстро и не создавать лишних боттлнеков, использовали как шардирующий прокси уже существующие HAProxy-сайдкары, которые и так стоят на каждой compute-ноде.
В итоге каждая compute-нода сразу идёт в нужный S3 за нужным файлом, минуя классический прокси-слой.
В докладе расскажу, как писали расширение Haproxy на Lua, как хитро реализовали ListObjects и DeleteObjects запросы, какие проблемы собрали и как мы сейчас управляем этим решением при решардировании.
Круглый стол с инженерами из RWB и VK Tech
Павел КутаковГлавный архитектор VK Data Platform, компания VK Tech

Алексей ГончарукРуководитель разработки Cedrus, компания VK Tech

Юрий ГавриловРуководитель группы проектного менеджмента Юнита Платформа департамента медиа, компания RWB

Глеб ДубровинSoftware Development Engineer (Backend), компания RWB
Инженеры RWB расскажут, как готовят кастомные сегменты для таргетирования с помощью Trino и DataFusion. Затем обсудим архитектуру и развитие современных платформ данных: Kubernetes, self-service-аналитику, подготовку инфраструктуры под AI-агентов и новые типы машинных нагрузок. Отдельно поговорим о том, как AI меняет разработку и эксплуатацию дата-платформ и куда в целом движется индустрия.
Нетворкинг, пицца и приятные напитки

