Новий тип ШІ-моделі від творця ChatGPT захоплює розробників
ChatGPT розбив серце Діогу Алмейді.
Алмейда був дослідником OpenAI, який допомагав створювати чатбота, а потім винайшов навчання з підкріпленням на основі відгуків людей (RLHF) — методику навчання моделей, яка, можливо, найбільше відповідальна за нашу нинішню епоху ШІ. Але попри свої можливості він був розчарований.
«У нас блискавка в пляшці, але водночас вона не корисна», — сказав Алмейда TechCrunch. «Відтоді я борюся з цією проблемою. Мені знадобився час, щоб дійти висновку: проблема в тому, що ми оптимізуємо людську мову … Чотири роки ми були надзвичайно хорошими в людській мові, але для автоматизації це не корисно, тому що комп’ютери розмовляють іншою мовою».
Два роки тому Алмейда залишив OpenAI, щоб заснувати TypeSafe AI — стартап, який намагається вирішити цю проблему. Цього тижня компанія випустила нову модель на основі трансформера — Jev, яка не є великою мовною моделлю (LLM). Вона не генерує текст, а натомість створює ймовірності, або те, що компанія називає «каліброваними рішеннями».
Відмова від мови дає кілька переваг: модель стає неймовірно дешевою та швидкою, а оскільки користувачі заздалегідь визначають результати, вона не може галюцинувати. Її вихідні токени безкоштовні, а вхідні токени підраховуються мільярдами, а не мільйонами.

Розробники виявляють значний інтерес до продукту; компанія ненадовго втратила можливість обслуговувати користувачів через свій API через надзвичайно високий попит. Jev видається найбільш корисною для автоматизації програмного забезпечення. Поки що розробники програмного забезпечення вважають її дешевшим і надійнішим способом інтегрувати інтелект у свій код.
Наприклад, Пранит Шарма, інженер-програміст у Vercel — компанії, що створює інфраструктуру для агентів, — сказав, що його компанія використовувала ChatGPT Luna 5.6 від OpenAI для запуску класифікатора, який перевіряв команди на безпеку. Коли Vercel замінила Luna від OpenAI на Jev, результати почали надходити у 5–18 разів швидше та з більшою точністю.
Інший розробник, технічний директор Bryo AI Ніхіл Мудхолкар, протестував Jev у порівнянні з Gemini для класифікації ділових електронних листів. У його тесті Gemini була трохи точнішою, але коштувала у 10–20 разів дорожче. Мудхолкара більше зацікавили показники впевненості Jev — «це єдина модель, яка повертає справжню ймовірність, що робить її ідеальною для автоматизації робочих процесів!»
Окрім заміни LLM у певних випадках використання, нова модель також може доповнювати їх, виконуючи роль інтелектуальної перевірки неправильної поведінки. Використання агентів для моніторингу агентів може швидко стати дорогим, але, на думку Алмейди, використання для цього Jev має сенс. Він бачить, як користувачі розгортають Jev для відстеження трас агентів LLM і запобігання джейлбрейкам.
«Зрештою, вона дещо делегує проблему галюцинацій користувачеві», — пояснив Армін Ронахер, технічний директор Earendil, яка створює відкритий каркас моделей Pi. «Користувач має сказати: гаразд, якщо це повертається лише з імовірністю 50%, можливо, це підкидання монети, і я це відкину. Але якщо ймовірність становить 95%, тоді, звісно, я можу щось із цим зробити».
Ще одним потенційним застосуванням Jev, за словами Ронахера, є маршрутизація моделей. Було б корисно передбачати, чи потребує певне робоче навантаження конкретної моделі, але використання LLM для цього завдання було б дорогим. Низька вартість і швидкість Jev роблять такий сортувальний процес у реальному часі можливим.
І саме на це сподівається Алмейда. Модель названа на честь Вільяма Стенлі Джевонса, економіста XIX століття, чиє ім’ям назване явище описує, як зниження вартості товару може призвести до його дедалі ширшого використання. У цьому випадку зниження вартості інтелекту має призвести до його широкого впровадження.
«Ми думаємо, що всюди з’являтиметься інтелектуальне програмне забезпечення — у спосіб, що виникає та розподіляється … значно більше схожий на ранній інтернет, ніж, знаєте, на мегазастосунки, які люди намагаються створювати зараз», — сказав Алмейда.
Алмейда неохоче розповідає про архітектуру моделі, яка, як підозрюють сторонні спостерігачі, побудована на основі LLM із відкритими вагами. Компанія називає Jev «моделлю System One», зосередженою на інтуїції, а не на міркуванні, і спеціально зосередженою на правильному завданні. Алмейда каже, що Jev навчається виключно на синтетичних даних за допомогою методики, яку він називає «навчанням із підкріпленням на основі каліброваних рішень».
«Ми рано зробили ставку на те, що створюватимемо всі наші дані, і це була одна з найкращих ставок у моєму житті — на мою думку, краща за наш запуск, краща за RLHF», — сказав він TechCrunch. «Половина [нашої компанії] — це лабораторія, яка фактично володіє всією цією підгалуззю статистично зрозумілих синтетичних даних, і тепер це моя найбільша життєва радість».
Наразі Jev залишається єдиною моделлю такого типу, але Ронахер очікує, що тепер, коли її корисність стала очевидною, з’являться конкуренти.
«Багато в чому ми мали побачити це раніше, але, ймовірно, через те, що LLM такі дешеві й субсидовані, вам часто ще не потрібно бути винахідливими», — сказав він.
Сама TypeSafe створюватиме більше версій моделі в нових модальностях. На запитання, чи є TypeSafe передовою лабораторією, Алмейда відповів: «Головний продукт передових лабораторій — це страх або ажіотаж. Я хотів би, щоб нашим головним продуктом був інтелект…[але ми] не лабораторія в тому сенсі, знаєте, як ставка на нескінченне багатство, чи релігію, чи створення Бога в центрі обробки даних, чи що там сьогодні вважається головним».
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.