
Это подтвержденный факт — инженеры VK действительно запустили в работу мультимодальные модели VLM. Теперь поиск понимает не только заголовок ролика, но и то, что реально происходит в кадре, какой там звук и даже стиль монтажа. На текущий момент технология уже обкатывается в VK Видео, а позже ее планируют растянуть на всю экосистему.
На мой взгляд, это правильный шаг в сторону современного поиска. Раньше алгоритмы были привязаны к тегам и описаниям, которые авторы часто заполняют абы как. Теперь же нейросеть сможет найти «влог из Стамбула с видом на Босфор», даже если в названии этого нет. К тому же разработчики обещают ускорить выпуск новых поисковых фишек в пять раз за счет автоматизации датасетов.
Такой подход делает ленту по-настоящему персонализированной. Система начнет понимать ваши предпочтения на уровне визуала, а не просто по ключевым словам. 🎬











