«Яндекс» поделился технологией непрерывной обработки данных: она помогает быстрее учитывать смену интересов пользователей
- CNews FORUM 12 ноября
- CNews AWARDS 12 ноября
- Школа Роста
- Российский рынок облаков за 20 лет
- 30 лет рынку ERP в России
- Главные
ИТ-сценарии 2026 - Цифровизация
- Импортозамещение
- Безопасность
- ИТ в госсекторе
- ИТ в банках
- ИТ в торговле
- Телеком
- Интернет
- ИТ-бизнес
- Рейтинги
- Инфографика
|
«Яндекс» выложил в опенсорс YTsaurus Flow — технологию для непрерывной обработки больших потоков данных. Она обрабатывает клики, лайки и другие события в интернете сразу же — по мере их появления. Благодаря этому алгоритмы быстрее замечают, как изменились интересы пользователей и что происходит в сети. Это позволяет мгновенно распознавать действия мошенников, точнее рекомендовать товары, книги, фильмы и так далее и подбирать рекламу, которая действительно полезна. Об этом CNews сообщили представители «Яндекса».
Интересы и потребности пользователей все время меняются. Человек может искать билет на самолет, а потом переключиться на новый фильм или товары для дома. Чтобы алгоритмы уловили эту смену интересов, им нужны свежие данные о действиях пользователя — что он покупал, какую музыку слушал, о чем спрашивал. Однако эти данные обычно обрабатывают не сразу, а сначала накапливают — примерно как посылки для отправки поездом. Из-за этого информация поступает в систему с задержкой, которая может составлять часы. YTsaurus Flow сводит эту задержку практически к нулю, поскольку обрабатывает данные в реальном времени — по мере поступления.
Технология будет полезна в самых разных проектах, где важна свежесть информации, — не только в рекламных и рекомендательных сервисах. Например, с ее помощью можно готовить данные для обучения ML-моделей, обновлять информацию для сайтов и приложений, считать просмотры, клики и заказы. Технология рассчитана на высокую нагрузку и обрабатывает каждое событие ровно один раз, не теряя и не дублируя данные. Она продолжает работать даже в случае сбоев, перераспределяя нагрузку между доступными серверами.
YTsaurus Flow уже применяется во многих сервисах «Яндекса». Например, «Маркету» она помогает быстрее собирать статистику, чтобы продавцы могли оперативно реагировать на изменение спроса, антифрод-системам — обнаруживать действия злоумышленников, а «Рекламе» — подбирать интересные людям предложения. Например, раньше на подготовку данных для дообучения некоторых моделей, отвечающих за подбор рекламы, уходило больше 10 часов. С помощью YTsaurus Flow эту задержку удалось почти полностью устранить. Каждую секунду YTsaurus Flow обрабатывает в «Яндекс Рекламе» более 100 ГБ данных и миллионы событий в интернете: кликов, показов, лайков, заказов и так далее.
Андрей Бурилов, ИТ-директор Мосбиржи: Финансовые операции станут частью кода цифровизация
Технология работает в рамках YTsaurus — это открытая платформа «Яндекса» для хранения и обработки больших объемов данных, предназначенная для крупного бизнеса. Благодаря YTsaurus Flow компании смогут обрабатывать данные не только партиями, но и по мере поступления. Кроме того, у них будет возможность учитывать накопленную и свежую информацию в одной системе.
YTsaurus Flow — это совместная разработка команд Yandex Infrastructure и «Яндекс Рекламы». Технология доступна под лицензией Apache 2.0, что позволяет использовать ее в том числе в коммерческих проектах.
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.