Мы — группа мультимодальных контентных моделей в отделе экспериментальных технологий AI VK. Мы разрабатываем технологии глубокого понимания контента и применяем их для развития рекомендательных систем ВКонтакте.
Мы строим модели, которые извлекают содержательные представления из постов, клипов, длинных видео и музыкальных треков, объединяя информацию из текста, изображения, видеоряда, речи и звука. Эти представления используются для поиска похожего контента, построения признаков, классификации и улучшения качества рекомендаций в продуктах VK.
Основные направления нашей работы — базовые embedding-модели для представления контента, мультимодальные модели и контентные классификаторы. Мы исследуем современные архитектуры, обучаем собственные модели на больших внутренних датасетах и доводим их до применения в продуктовых рекомендательных системах.
Позиция находится на стыке ресёрча и инженерии: от чтения статей, построения датасетов и постановки экспериментов до масштабного обучения, оптимизации инференса и проверки моделей в A/B-тестах.
Стек:
- PyTorch
- YT (YTsaurus), YQL
- NVIDIA Triton Inference Server, TensorRT, vLLM
- Распределённое обучение и multi-GPU inference
- Python, C++, Go
Задачи
- Разрабатывать и обучать базовые embedding-модели для текста, изображений, видео, речи, звука и музыки
- Разрабатывать мультимодальные модели и контентные классификаторы
- Исследовать архитектуры и методы обучения представлений: metric learning, contrastive learning, self-supervised и supervised learning
- Строить датасеты и бенчмарки для оценки качества моделей и проводить масштабные экспериментальные исследования
- Адаптировать модели под задачи retrieval и рекомендательных систем
- Интегрировать модели в продуктовые механики рекомендаций постов, клипов, видео и музыки
- Оптимизировать и масштабировать обучение и инференс моделей
- Деплоить модели и сопровождать их в продакшене: проводить A/B-тесты, анализировать метрики и мониторить качество
- Постоянно разбирать свежие статьи и идеи из индустрии и академической среды, воспроизводить перспективные подходы и проверять их на наших задачах
- Настраивать пайплайны сбора и разметки данных, работать с асессорами и синтетическими данными: проектировать инструкции, контролировать качество и проводить калибровки
Требования
- Опыт разработки, обучения и внедрения DL-моделей
- Уверенное знание теории машинного и глубокого обучения
- Хорошее понимание алгоритмов и структур данных, линейной алгебры, теории вероятностей и статистики
- Умение проектировать корректные эксперименты, выбирать метрики и интерпретировать результаты
- Навык написания чистого и поддерживаемого кода, понимание принципов проектирования ПО
- Владение современными практиками совместной разработки с кодовыми агентами: умение эффективно декомпозировать задачи для агентных инструментов, контролировать и ревьюить сгенерированный код
- Умение самостоятельно разбираться в новых предметных областях, быстро ставить эксперименты и проверять гипотезы
- Готовность работать как с исследовательской частью задачи, так и с её инженерной реализацией
- Открытость, ответственность, самостоятельность и проактивность
Будет плюсом
- Опыт разработки поисковых или рекомендательных систем в индустриальном масштабе
- Опыт работы с embedding-моделями, metric learning, contrastive learning или representation learning
- Опыт работы с мультимодальными моделями, VLM, audio-language моделями, video encoders или foundation-моделями
- Опыт обучения моделей для аудио, музыки, речи, изображений или видео
- Опыт self-supervised learning и обучения на больших слабоструктурированных датасетах
- Опыт распределённого обучения на нескольких GPU или нескольких узлах
- Опыт оптимизации DL-моделей: профилирование, квантизация, дистилляция, уменьшение размерности представлений
- Опыт построения больших датасетов и систематических бенчмарков для ML-моделей
- Публикации на профильных ML-конференциях или сильный исследовательский бэкграунд
Мы предлагаем
Формат работы
Уровень
График работы
Рекомендации
Рекомендации — создаём алгоритмы персонализированных рекомендаций, чтобы пользователи видели максимально релевантный и интересный контент, а авторы — быстро находили свою аудиторию.