Vals, подкрепена от Andreessen Horowitz, се стреми да се превърне в златния стандарт за сравнително оценяване на ИИ
Бенчмаркингът се превърна в индустриален стандарт за това как компаниите за изкуствен интелект валидират възможностите на своите модели и, когато показателите са в тяхна полза, се отличават от конкурентите и рекламират превъзходството си. С други думи, добрите бенчмаркове почти винаги означават добър PR.
За съжаление, компаниите също така са открили как да надхитрят остарелите системи за бенчмаркинг — много от които са по-стари и не са създадени да измерват възможностите на съвременните модели.
Vals, стартъп, създаден през 2024 г., заявява, че си е поставил за цел да поправи именно тази несъвършена система. За по-малко от две години компанията се утвърди като забележимо присъствие в технологичната индустрия, а миналата година успя да осигури начален инвестиционен рунд, воден от 8VC и Bloomberg Beta. След това, миналия месец, след период на бърз растеж, тя набра 40 милиона долара в инвестиционен рунд серия A, воден от Andreessen Horowitz.
Раян Кришнан, 25-годишният съосновател на компанията, преди това е бил стажант в Palantir, а като студент в Станфорд е работил за Microsoft и високо ценената лаборатория за изкуствен интелект на университета. Кришнан казва, че Vals се е родила от собствените му наблюдения върху това как бенчмаркингът изостава от напредъка на индустрията, която е създаден да измерва.
„Виждахме как на пазара бързо се появяват множество нови, много способни модели, а академичните бенчмаркове [не] успяваха да се справят с този напредък на границата на възможностите“, споделя Кришнан. Тъй като изкуственият интелект се интегрира във всяка част от обществото, бенчмарковете наистина трябва да съществуват, за да проверяват дали моделите могат да правят това, което компаниите твърдят, че могат, казва Кришнан.
Миналата седмица младият основател ми показа двуетажния офис на компанията на улица „Фолсъм“ в Сан Франциско — стара тухлена сграда, която преди век е служила като място на голяма пивоварна. Вместо промишлено производство на бира, историческата сграда днес е дом на редица различни стартъпи, които се стремят да създадат бъдещето на технологичната индустрия.
„Исторически погледнато, мисля, че оценяването е било насочено към измерване на интелигентността по много абстрактен начин“, казва ми Кришнан. „Например, разполагат ли моделите с достатъчно знания, за да издържат изпит от типа на адвокатския?“
Именно тук Vals се стреми да се отличи. Докато много системи за бенчмаркинг предлагат публично достъпни тестове (което може да позволи на дадена компания да обучи модела си спрямо тези тестове и така, може да се твърди, да измами на изпита), Vals не разкрива публично конкретните материали за своите тестове. Вместо да измерва общите познания на даден модел с изкуствен интелект, Vals също така оценява способността на моделите да изпълняват сложни задачи, свързани с конкретни отрасли като право, финанси и програмиране.
„Това, което правим, е всъщност да разглеждаме какви са реалните въздействия на моделите“, каза Кришнан. „Могат ли те да извършват работа, която създава продукт със същото качество като човешкия във всяка област?“
Идеята е да се проверяват не само положителните, но и отрицателните резултати, казва той. Целта е да се анализира „какви биха били негативните последици, ако тези модели започнат да действат безконтролно в света“.
Възможностите, които Vals измерва, се разширяват. Освен по-традиционните отрасли стартъпът продължава да навлиза и в по-уникални области. „Имаме бенчмарк за рекурсивно самоусъвършенстване. Работим в областта на психичното здраве, киберсигурността, биосигурността и дори правото на въоръжените конфликти, за да могат моделите да разберат как да прилагат Женевската конвенция“, споделя Кришнан.
Компаниите плащат на Vals, за да тества моделите им, което може да е трудно за осмисляне. Защо една компания би платила, за да разбере, че моделът ѝ не се представя добре? Но ефективното измерване помага на компаниите да отстраняват проблеми и да се подобряват с течение на времето. Кришнан сравнява модела им на приходи с това как един студент може да плати на College Board, за да се яви на SAT.
На свой ред тези оценки се превръщат в ключови фактори при вземането на решения за компаниите, които искат да придобият нови модели с изкуствен интелект.
Стартъпът наскоро разкри, че приходите му в момента са осем пъти по-високи, отколкото са били миналата година. Екипът му също се разраства. Vals, която започна годината само с осем души, вече се е утроила до екип от 25 души. Кришнан каза, че с разрастването на стартъпа планът е да се премести в значително по-голям офис, както и да бъдат наети още 10 до 15 души. Компанията също така наскоро стартира програма, насочена към предоставяне на оценки на модели за федерални агенции.
Кришнан вижда системата за бенчмаркинг на компанията си като бъдещето на начина, по който компаниите за изкуствен интелект ще мислят за разрастването на бизнеса си и изграждането на обществено доверие.
„Компаниите за изкуствен интелект започват да излизат на борсата. SpaceX излезе на борсата. Очаква се Anthropic да го направи по-късно тази година. Подозирам, че OpenAI скоро също ще стане публична. Мисля, че с превръщането на моделите с изкуствен интелект в основна част от икономиката и с по-широкото им разпространение видовете бенчмаркове и оценки, които правим, ще определят употребата им и ще бъдат централен елемент от начина, по който тези компании подават публични документи или говорят за планираните инвестиции, които ще направят в изкуствен интелект“, каза той.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.