Vals, яку підтримує Andreessen Horowitz, прагне стати золотим стандартом бенчмаркінгу ШІ
Бенчмаркінг став галузевою нормою, за якою компанії, що розробляють ШІ, перевіряють можливості своїх моделей і, коли показники складаються на їхню користь, вирізняються серед конкурентів та рекламують свою перевагу. Іншими словами, хороші бенчмарки майже завжди означають хороший піар.
На жаль, компанії також навчилися обходити застарілі системи бенчмаркінгу — багато з яких є старішими й не пристосовані для вимірювання можливостей сучасних моделей.
Vals, стартап, заснований у 2024 році, заявляє, що поставив собі за мету виправити цю вкрай недосконалу систему. Менш ніж за два роки компанія заявила про себе як про помітного гравця в технологічній індустрії, а торік їй вдалося залучити посівний раунд під керівництвом 8VC і Bloomberg Beta. Потім, минулого місяця, після періоду стрімкого зростання, вона залучила 40 мільйонів доларів у раунді серії A під керівництвом Andreessen Horowitz.
25-річний співзасновник компанії Раян Крішнан раніше проходив стажування в Palantir, а під час навчання в Стенфорді працював у Microsoft і широко відомій лабораторії штучного інтелекту університету. Крішнан каже, що Vals виникла з його власних спостережень за тим, як бенчмаркінг відставав від розвитку галузі, який він мав вимірювати.
«Ми бачили, як на ринок швидко виходила безліч нових, дуже потужних моделей, а академічні бенчмарки [не] встигали за цим передовим розвитком», — розповідає Крішнан. За його словами, оскільки ШІ інтегрується в усі сфери суспільства, бенчмарки мають існувати саме для того, щоб перевіряти, чи можуть моделі робити те, що, за твердженнями компаній, вони здатні робити.
Минулого тижня молодий засновник показав мені офіс своєї компанії на двох поверхах на вулиці Фолсом у Сан-Франциско — у старій цегляній будівлі, яка століття тому була великою пивоварнею. Замість промислового виробництва пива ця історична споруда тепер стала домівкою для низки різних стартапів, які прагнуть створити майбутнє технологічної індустрії.
«Історично, я думаю, оцінювання проводили, щоб перевірити інтелект у дуже абстрактний спосіб, — каже мені Крішнан. — Наприклад, чи знають моделі достатньо інформації, щоб скласти тест на кшталт іспиту на адвокатську ліцензію?»
Саме тут Vals прагне вирізнитися. Хоча багато систем бенчмаркінгу пропонують тести, доступні публічно (це може дозволити компанії навчати свою модель на таких тестах і таким чином, імовірно, шахраювати на іспиті), Vals не розкриває публічно конкретні матеріали своїх тестів. Замість вимірювання загальних знань моделі ШІ Vals також оцінює їхню здатність виконувати складні завдання, пов’язані з конкретними галузями, такими як право, фінанси та програмування.
«Ми насправді дивимося на те, який реальний вплив мають моделі, — сказав Крішнан. — Чи можуть вони виконувати роботу, результатом якої в кожній галузі буде продукт такої самої якості, як і продукт людини?»
За його словами, ідея полягає в тому, щоб перевіряти не лише позитивні результати, а й негативні. Мета — проаналізувати, «які були б негативні наслідки, якби ці моделі вийшли з-під контролю у світі».
Можливості, які вимірює Vals, розширюються. Окрім більш традиційних галузей, стартап продовжує освоювати унікальніші сфери. «У нас є бенчмарк для рекурсивного самовдосконалення. Ми працюємо у сфері психічного здоров’я, кібербезпеки, біобезпеки і навіть права збройних конфліктів — навчаємо моделі розуміти, як застосовувати Женевську конвенцію», — розповідає Крішнан.
Компанії платять Vals за тестування своїх моделей, і цю концепцію може бути непросто зрозуміти. Навіщо компанії платити, щоб дізнатися, що її модель працює недостатньо добре? Але ефективне вимірювання допомагає компаніям виявляти проблеми та вдосконалюватися з часом. Крішнан порівнює їхню модель доходів із ситуацією, коли студент платить College Board за складання SAT.
Своєю чергою, ці оцінювання стають ключовими чинниками ухвалення рішень для компаній, які прагнуть придбати нові моделі ШІ.
Стартап нещодавно повідомив, що його дохід нині у вісім разів перевищує торішній. Зростає і штат. Vals, яка почала рік лише з вісьмома працівниками, уже потроїла команду — до 25 людей. Крішнан сказав, що в міру зростання стартап планує переїхати до значно більшого офісу, а також найняти ще 10–15 людей. Нещодавно компанія також запустила програму, присвячену наданню державним установам оцінювань моделей.
Крішнан вважає систему бенчмаркінгу своєї компанії майбутнім підходом до того, як компанії, що розробляють ШІ, розвиватимуть свій бізнес і здобуватимуть суспільну довіру.
«Компанії, що розробляють ШІ, починають виходити на біржу. SpaceX вийшла на біржу. Очікується, що Anthropic зробить це пізніше цього року. Підозрюю, що OpenAI незабаром стане публічною. Я думаю, що в міру того, як моделі ШІ ставатимуть основною частиною економіки й ширше поширюватимуться, типи бенчмарків та оцінювань, які ми проводимо, визначатимуть їхнє використання і стануть центральною частиною того, як ці компанії подаватимуть публічну звітність або розповідатимуть про потенційні інвестиції, які вони планують здійснити у сфері ШІ», — сказав він.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.