Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Нов вид ИИ модел от създател на ChatGPT въодушевява разработчиците

ChatGPT разби сърцето на Диого Алмейда.

Алмейда е изследовател в OpenAI, помогнал за създаването на чатбота, а след това и за изобретяването на обучението с подсилване чрез човешка обратна връзка (RLHF) — техниката за обучение на модели, която вероятно има най-голям принос за настоящата ни ера на изкуствения интелект. Но въпреки възможностите му той бил разочарован.

„Имаме светкавица в бутилка, но въпреки това тя не е полезна“, каза Алмейда пред TechCrunch. „Оттогава се боря с този проблем. Отне ми известно време да стигна до извода: проблемът е, че оптимизираме за човешкия език … Четири години сме изключително добри в човешкия език, но той не е полезен за автоматизация, защото компютрите говорят на различен език.“

Преди две години Алмейда напусна OpenAI, за да основе TypeSafe AI — стартъп, който се опитва да реши този проблем. Тази седмица компанията пусна нов модел, базиран на трансформър архитектурата, Jev, който не е голям езиков модел (LLM). Той не генерира текст, а вместо това произвежда вероятности — или това, което компанията нарича „калибрирани решения“.

Отказът от езика води до няколко резултата: моделът става изключително евтин и бърз, а тъй като потребителите предварително определят изходите, той не може да халюцинира. Изходните му токени са безплатни, а входните токени се таксуват на милиард, а не на милион.

Екранна снимка показва сравнение между Jev и модел на OpenAI, отговарящи на едни и същи заявки. Кредити за изображението:TypeSafe AI / TypeSafe AI

Разработчиците проявяват голям интерес към продукта; за кратко компанията загуби възможността да обслужва потребители чрез своя API, тъй като търсенето беше толкова високо. Jev изглежда най-полезен за софтуерна автоматизация. Досега софтуерните разработчици го виждат като по-евтин и по-надежден начин да внедрят интелигентност в своя код.

Например Пранит Шарма, софтуерен инженер във Vercel — компания, създаваща инфраструктура за агентни системи, каза, че компанията му е използвала ChatGPT Luna 5.6 на OpenAI, за да изпълнява класификатор, който проверява командите за сигурност. Когато Vercel замени Luna на OpenAI с Jev, резултатите започнали да се получават от 5 до 18 пъти по-бързо и с по-голяма точност.

Друг разработчик, техническият директор на Bryo AI Никхил Мудхолкар, изпробва Jev и Gemini за класифициране на служебни имейли. В неговия тест Gemini бил малко по-точен, но струвал от 10 до 20 пъти повече. Още по-интересни за Мудхолкар били оценките за увереност на Jev — „това е единственият модел, който връща истинска вероятност, което го прави идеален за автоматизиране на работни процеси!!“

Освен че може да замени LLM в определени случаи на употреба, новият модел може и да ги допълва, като действа като интелигентна проверка за неправомерно поведение. Използването на агенти за наблюдение на други агенти бързо може да стане скъпо, но според Алмейда има смисъл това да се прави с Jev. Той си представя потребители, които използват Jev за проследяване на следите от действията на LLM агентите и предотвратяване на jailbreak атаки.

„В крайна сметка той до известна степен прехвърля проблема с халюцинациите към потребителя“, обясни Армин Ронахер, техническият директор на Earendil, която създава отворената среда за модели Pi. „Потребителят трябва да каже: добре, ако това се върне с вероятност от само 50%, може би е хвърляне на монета и ще го пренебрегна. Но ако е 95%, тогава със сигурност мога да направя нещо с него.“

Друга потенциална употреба на Jev е маршрутизирането на модели, каза Ронахер. Би било полезно да се предвижда дали дадено работно натоварване изисква конкретен модел, но използването на LLM за тази задача би било скъпо. Ниската цена и високата скорост на Jev правят възможно подобно сортиране в реално време.

И това е надеждата на Алмейда. Моделът е кръстен на Уилям Стенли Джевънс, икономист от XIX век, чийто едноименен парадокс описва как спадът в цената на дадена стока може да доведе до все по-широката ѝ употреба. В този случай спадът в цената на интелигентността би трябвало да доведе до широкото ѝ внедряване.

„Смятаме, че навсякъде просто ще има интелигентен софтуер по начин, който възниква спонтанно и е разпределен … много повече като ранния интернет, отколкото като мегаприложенията, които хората се опитват да създадат в момента“, каза Алмейда.

Алмейда не разкрива подробности за архитектурата на модела, за която външни наблюдатели подозират, че е изградена върху LLM с отворени тегла. Компанията нарича Jev „модел System One“, фокусиран върху интуицията, а не върху разсъждението, и конкретно фокусиран върху правилната задача. Алмейда казва, че Jev е обучен изцяло върху синтетични данни с помощта на техника, която той нарича „обучение с подсилване чрез калибрирани решения“.

„Още в началото заложихме на това да създаваме всички наши данни и това беше един от най-добрите залози, които съм правил в живота си — според мен по-добър от стартирането ни, по-добър от RLHF“, каза той пред TechCrunch. „Половината [от компанията ни] е лаборатория, която на практика притежава цялото това подполе на статистически добре разбраните синтетични данни, а това сега е радостта на живота ми.“

Засега Jev е единственият модел от този тип, но Ронахер очаква конкуренти да се появят, след като полезността му стане очевидна.

„По много начини трябваше да видим това по-рано, но вероятно тъй като LLM са толкова евтини и субсидирани, все още често не се налага да бъдете креативни“, каза той.

Самата TypeSafe ще създава още версии на модела в нови модалности. Попитан дали TypeSafe е лаборатория за върхови технологии, Алмейда каза: „Основният продукт на лабораториите за върхови технологии е страхът или рекламата. Бих искал нашият основен продукт да бъде интелигентността…[но ние] не сме лаборатория в смисъла на това, да залагаме на безкрайно богатство, или на религия, или на изграждането на Бог в център за данни, или каквото там е актуално днес.“

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от TechCrunch на

Прочетете оригинала в TechCrunch ↗

Текстът и изображенията са собственост на TechCrunch и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини