Google Research представляє ME-POIs: фреймворк, що враховує мобільність і додає «Як використовується місце» до текстових вбудовувань POI
Команда з Google Research та USC представила Mobility-Embedded POIs (ME-POIs) — фреймворк, який вбудовує агреговані дані про пересування людей у текстові представлення місць. Його основна ідея полягає в тому, що мовні моделі описують, чим є місце, але не те, як його використовують. Дві кав’ярні можуть мати спільну категорію, один поштовий блок і схожий текстовий вектор, водночас в одній клієнти постійно змінюються через потік пасажирів, а в іншій затримуються на дев’яносто хвилин. ME-POIs кодує кожне відвідування як контекстуалізований вектор, а потім за допомогою контрастивного навчання узгоджує ці відвідування з одним навчуваним прототипом для кожного POI. У п’яти завданнях збагачення карт на даних про мобільність у Лос-Анджелесі та Г’юстоні додавання ME-POIs до потужних текстових енкодерів покращило 34 із 35 пар модель—завдання в Лос-Анджелесі, із відносним приростом до 81,9% F1 для визначення мети відвідування та зниженням MAE на 24,7% для оцінювання завантаженості. Примітно, що варіант, навчений лише на даних про мобільність, перевершив вбудовування Gemini у класифікації рівня цін.
Чи придатний він для розгортання?
Частково: це фреймворк, який потрібно відтворити, а не контрольна точка, яку можна завантажити. На момент публікації Google Research опублікувала статтю, але не надала відкритого коду чи ваг. Вимоги до обчислювальних ресурсів невисокі: модель має приблизно 53,7 млн параметрів і попередньо навчалася на одній NVIDIA Tesla V100 16GB. Справжня перешкода — дані: вам знадобляться ліцензовані дані про пішохідний трафік або журнали відвідувань із власних джерел, а також полігони POI.
Як працює фреймворк
Кожне відвідування — це трійка: координати, час прибуття та час від’їзду. Для їх обробки використовуються три факторизовані енкодери: Space2Vec для багатомасштабного визначення місця та два енкодери Time2Vec — окремо для прибуття й від’їзду, щоб час початку та тривалість перебування залишалися відмінними. Об’єднані вектори отримують синусоїдальне позиційне кодування та проходять через 4-шаровий 8-головий Transformer (d_h = 512), який створює контекстуалізовані вбудовування відвідувань.
Основна мета є контрастивною. Кожен POI має навчуваний прототип, а функція втрат InfoNCE наближає вбудовування кожного відвідування до прототипу його POI та віддаляє його від інших POI у мініпакеті. Прототип стає функціональним центроїдом, який нівелює відмінності в розкладах окремих користувачів.
Найскладніша частина — розрідженість даних. Лише 9,07% POI Лос-Анджелеса та 7,04% POI Г’юстона подолали поріг для опорних об’єктів (відповідно 100 і 50 загальних відвідувань). Для довгого хвоста ME-POIs обчислює нормалізовані гауссові ядра з трьома смугами пропускання — 0,3 км, 1,0 км і 3,0 км — та переносить гістограми відвідувань опорних об’єктів до розріджених POI, після чого додає KL-складову, яка змушує розріджене вбудовування прогнозувати цей апріорний розподіл. Друга KL-складова навчає опорні об’єкти на основі їхніх власних емпіричних розподілів. Четверта функція втрат максимізує косинусну схожість із проєктованими текстовими вбудовуваннями, чиї промпти відповідають підходу GeoLLM: координати, категорія, адреса та десять найближчих POI із відстанню і напрямком.
Що показують цифри
Оцінювання охоплює два анонімізовані набори даних про мобільність — Лос-Анджелес (39 557 POI, 6,9 млн відвідувань, увесь 2019 рік) і Г’юстон (28 419 POI, 715 604 відвідування, 20 днів у березні 2020 року) — у п’яти завданнях збагачення карт із використанням тестування на заморожених вбудовуваннях. Розмітка для годин роботи та закриттів походить від SafeGraph, а для визначення мети відвідування, завантаженості та рівня цін — від Google Maps.
Додавання ME-POIs покращило 34 із 35 пар модель—завдання в Лос-Анджелесі. Максимальний відносний приріст: 16,2% F1 для щотижневих годин роботи (OpenAI-large), 81,9% F1 для визначення мети відвідування (Gemini), 6,5% F1 для визначення остаточного закриття (E5) та зниження MAE на 24,7% для завантаженості (Gemini). У Г’юстоні F1 для рівня цін зріс на 75,1% для GTR-T5. Єдиною регресією стала модель Gemini у визначенні остаточного закриття — показник знизився на 0,4%.
Цікавішим є результат варіанту, що використовує лише дані про мобільність. Навчений без будь-якого узгодження з текстом, він досягає точності 0,600 у визначенні рівня цін у Лос-Анджелесі проти 0,559 у Gemini — колективна поведінка перевершує слова, якими описують місце. Він також перевершує всі базові моделі на основі траєкторій у кожному завданні.
Пояснення: механізм крок за кроком
Ключові висновки
- ME-POIs навчає один контекстно-незалежний вектор для кожного POI, а не вектор, зумовлений траєкторією.
- Контрастивне узгодження разом із багатомасштабним перенесенням через KL-складову розв’язує проблему довгого хвоста: 91% POI Лос-Анджелеса є розрідженими.
- Приріст сягає 81,9% F1 для визначення мети відвідування та зниження MAE на 24,7% для завантаженості.
- Вбудовування, отримані лише з даних про мобільність, перевершують текстові вбудовування Gemini у класифікації рівня цін.
- Відкритого коду чи ваг поки немає; справжньою перешкодою є ліцензовані дані про відвідування, а не обчислювальні ресурси.
Ознайомтеся зі статтею та технічними деталями. Також запрошуємо відвідати нашу сторінку GitHub із навчальними матеріалами, кодом і ноутбуками.
Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого ML SubReddit із понад 150 тисячами учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.
Потрібно налагодити партнерство з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.