Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Vals, получившая поддержку Andreessen Horowitz, стремится стать золотым стандартом бенчмаркинга ИИ

Бенчмаркинг стал отраслевым стандартом, с помощью которого компании, занимающиеся ИИ, проверяют возможности своих моделей и, когда показатели складываются в их пользу, выделяются среди конкурентов и рекламируют свое превосходство. Иными словами, хорошие бенчмарки почти всегда означают хороший пиар.

К сожалению, компании также научились обходить устаревшие системы бенчмаркинга — многие из них появились давно и не предназначены для измерения возможностей современных моделей.

Vals — стартап, созданный в 2024 году, — заявляет, что его миссия заключается в исправлении этой весьма несовершенной системы. Менее чем за два года компания успела стать заметным игроком технологической отрасли, а в прошлом году ей удалось привлечь посевной раунд под руководством 8VC и Bloomberg Beta. Затем, в прошлом месяце, после периода стремительного роста, она привлекла $40 млн в рамках раунда серии A под руководством Andreessen Horowitz.

25-летний сооснователь компании Раян Кришнан ранее проходил стажировку в Palantir, а во время учебы в Стэнфорде работал в Microsoft и широко известной лаборатории искусственного интеллекта университета. По словам Кришнана, Vals появилась благодаря его собственным наблюдениям за тем, как бенчмаркинг отставал от развития отрасли, для измерения возможностей которой он был создан.

«Мы видели, как на рынок быстро выходило множество новых, очень мощных моделей, а академические бенчмарки [уже] не поспевали за этим передовым развитием», — рассказывает Кришнан. По его словам, с учетом того, что ИИ интегрируется во все сферы общества, бенчмарки должны существовать для проверки того, способны ли модели делать то, что, согласно рекламе компаний, они умеют.

На прошлой неделе молодой основатель показал мне двухэтажный офис своей компании на Фолсом-стрит в Сан-Франциско — старое кирпичное здание, в котором век назад размещалась крупная пивоварня. Вместо промышленного производства пива это историческое строение теперь служит домом для множества стартапов, стремящихся создать будущее технологической отрасли.

«Исторически, как мне кажется, оценка проводилась для проверки интеллекта в очень абстрактной форме, — говорит мне Кришнан. — Например, обладают ли модели достаточными знаниями, чтобы сдать экзамен, похожий на экзамен на адвокатскую лицензию?»

Именно здесь Vals стремится отличаться от других. В то время как многие системы бенчмаркинга предлагают общедоступные тесты (это позволяет компании обучать свою модель на этих тестах и тем самым, по сути, жульничать на экзамене), Vals не раскрывает публично конкретные материалы своих тестов. Вместо измерения общих знаний ИИ Vals также оценивает способность моделей выполнять сложные задачи, связанные с конкретными отраслями, такими как право, финансы и программирование.

«Мы фактически изучаем реальное влияние моделей, — сказал Кришнан. — Могут ли они выполнять работу, результат которой в каждой области будет таким же качественным, как продукт, созданный человеком?»

По его словам, идея заключается в проверке не только положительных, но и отрицательных результатов. Цель — проанализировать, «каковы были бы негативные последствия, если бы эти модели вышли из-под контроля в мире».

Возможности, которые измеряет Vals, расширяются. Помимо более традиционных отраслей, стартап продолжает осваивать все более необычные направления. «У нас есть бенчмарк рекурсивного самоулучшения. Мы работаем в сферах психического здоровья, кибербезопасности, биобезопасности и даже права вооруженных конфликтов — обучаем модели понимать, как применять Женевскую конвенцию», — рассказывает Кришнан.

Компании платят Vals за тестирование своих моделей, и поначалу эту концепцию бывает трудно осмыслить. Зачем компании платить за то, чтобы узнать, что ее модель работает плохо? Но эффективная система измерений помогает компаниям выявлять проблемы и со временем совершенствоваться. Кришнан сравнивает их модель дохода с ситуацией, когда студент платит College Board за сдачу экзамена SAT.

В свою очередь, эти оценки становятся важными факторами при принятии решений компаниями, которые хотят приобрести новые модели ИИ.

Недавно стартап сообщил, что его текущая выручка в восемь раз превышает прошлогоднюю. Растет и штат. Vals, начавшая год всего с восемью сотрудниками, уже утроила численность команды — до 25 человек. Кришнан сказал, что по мере роста стартап планирует переехать в значительно более просторный офис, а также нанять еще 10–15 сотрудников. Недавно компания также запустила программу, направленную на предоставление федеральным ведомствам услуг по оценке моделей.

Кришнан считает, что разработанная его компанией система бенчмаркинга определит будущее подходов ИИ-компаний к развитию бизнеса и завоеванию общественного доверия.

«Компании, занимающиеся ИИ, начинают выходить на биржу. SpaceX вышла на биржу. Ожидается, что Anthropic сделает это позже в этом году. Думаю, OpenAI тоже скоро станет публичной компанией. По мере того как модели ИИ становятся центральной частью экономики и получают более широкое распространение, используемые нами типы бенчмарков и оценок будут определять сферу их применения и станут ключевым элементом того, как эти компании будут подавать публичную отчетность или рассказывать о планируемых инвестициях в ИИ», — сказал он.

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием TechCrunch

Читать оригинал на TechCrunch ↗

Текст и изображения принадлежат TechCrunch и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости