Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← К новостям

Google Research представляет ME-POIs: учитывающую мобильность платформу, которая добавляет «Как используется место» к текстовым эмбеддингам POI

Команда из Google Research и Университета Южной Калифорнии (USC) выпустила Mobility-Embedded POIs (ME-POIs) — фреймворк, который встраивает агрегированные данные о перемещениях людей в текстовые эмбеддинги мест. Идея заключается в том, что языковые модели описывают, чем является место, но не то, как оно используется. Две кофейни могут иметь одну категорию, находиться в одном адресном квартале и обладать одинаковым текстовым вектором, хотя в одной посетители постоянно сменяют друг друга в часы поездок на работу, а в другой клиенты проводят по девяносто минут. ME-POIs кодирует каждый визит как контекстуализированный вектор, а затем с помощью контрастивного обучения сопоставляет эти визиты с одним обучаемым прототипом для каждого POI. В пяти задачах обогащения карт на данных о мобильности в Лос-Анджелесе и Хьюстоне добавление ME-POIs улучшило 34 из 35 сочетаний модели и задачи в Лос-Анджелесе, обеспечив относительный прирост до 81.9% F1 в определении цели визита и снижение MAE на 24.7% в оценке загруженности. Примечательно, что вариант, обученный только на данных о мобильности, превзошёл эмбеддинги Gemini в классификации уровня цен.

Можно ли внедрить эту систему?

Частично: это фреймворк, который нужно воссоздать, а не готовый чекпойнт для скачивания. На момент публикации Google Research опубликовала статью, но не предоставила публичный код или веса. Требования к вычислительным ресурсам невысоки: модель содержит около 53.7M параметров и предварительно обучалась на одной NVIDIA Tesla V100 16GB. Настоящее препятствие — данные: вам понадобятся лицензированные данные о пешеходном трафике или журналы визитов из первичных источников, а также полигоны POI.

Как работает фреймворк

Каждый визит представляет собой тройку: координаты, время прибытия и время ухода. Для их обработки используются три факторизованных энкодера: Space2Vec для многоштабного определения местоположения и два энкодера Time2Vec — отдельно для прибытия и ухода, чтобы время начала и продолжительность пребывания оставались различимыми. Объединённые векторы получают синусоидальное позиционное кодирование и проходят через 4-слойный Transformer с 8 головами внимания (d_h = 512), который формирует контекстуализированные эмбеддинги визитов.

В основе лежит контрастивная цель. У каждого POI есть обучаемый прототип, а функция потерь InfoNCE приближает эмбеддинг каждого визита к прототипу его собственного POI и отдаляет его от остальных POI в мини-пакете. Прототип становится функциональным центроидом, усредняющим индивидуальные расписания пользователей.

Разреженность — самая сложная часть. Лишь 9.07% POI в Лос-Анджелесе и 7.04% POI в Хьюстоне достигли порога для якорных объектов (соответственно 100 и 50 визитов в общей сложности). Для длинного хвоста ME-POIs вычисляет нормализованные гауссовы ядра с тремя полосами пропускания — 0.3 км, 1.0 км и 3.0 км — и переносит гистограммы визитов якорных объектов на разреженные POI, после чего добавляет компоненту KL, заставляющую разреженный эмбеддинг предсказывать этот априорный профиль. Вторая компонента KL обучает якорные объекты на основе их собственных эмпирических распределений. Четвёртая функция потерь максимизирует косинусное сходство с проецируемыми текстовыми эмбеддингами, промпты для которых следуют рецепту GeoLLM: координаты, категория, адрес и десять ближайших POI с указанием расстояния и направления.

Что показывают цифры

Оценка проводилась на двух анонимизированных наборах данных о мобильности — Лос-Анджелес (39,557 POI, 6.9M визитов, полный 2019 год) и Хьюстон (28,419 POI, 715,604 визита, 20 дней в марте 2020 года) — по пяти задачам обогащения карт с использованием зондирования замороженных эмбеддингов. Метки для часов работы и закрытий получены от SafeGraph, а для цели визита, загруженности и уровня цен — из Google Maps.

Добавление ME-POIs улучшило 34 из 35 сочетаний модели и задачи в Лос-Анджелесе. Максимальный относительный прирост составил: 16.2% F1 для еженедельных часов работы (OpenAI-large), 81.9% F1 для цели визита (Gemini), 6.5% F1 для постоянного закрытия (E5) и снижение MAE на 24.7% для загруженности (Gemini). В Хьюстоне F1 для уровня цен вырос на 75.1% у GTR-T5. Единственным ухудшением стал результат Gemini для постоянного закрытия — снижение на 0.4%.

Более интересен результат варианта, использующего только мобильность. Обученный без какого-либо выравнивания с текстом, он достигает точности 0.600 при определении уровня цен в Лос-Анджелесе против 0.559 у Gemini — коллективное поведение превосходит слова, которыми описывается место. Кроме того, он превосходит все базовые методы на основе траекторий по каждой задаче.

Объяснение: механизм шаг за шагом

Ключевые выводы

  • ME-POIs обучает один не зависящий от контекста вектор для каждого POI, а не вектор, обусловленный траекторией.
  • Контрастивное выравнивание в сочетании с многоштабным переносом KL решает проблему длинного хвоста: 91% POI в Лос-Анджелесе являются разреженными.
  • Прирост достигает 81.9% F1 для цели визита и снижения MAE на 24.7% для загруженности.
  • Эмбеддинги, использующие только данные о мобильности, превосходят текстовые эмбеддинги Gemini в классификации уровня цен.
  • Публичного кода или весов пока нет; настоящее препятствие — лицензированные данные о визитах, а не вычислительные ресурсы.

Ознакомьтесь с статьёй и техническими подробностями. Также посетите нашу страницу на GitHub с руководствами, кодом и ноутбуками.

Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему ML-сообществу на Reddit с более чем 150 тыс. участников и подписаться на нашу рассылку. Стоп! Вы пользуетесь Telegram? теперь к нам можно присоединиться и в Telegram.

Хотите стать нашим партнёром для продвижения вашего репозитория GitHub, страницы Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости