Sakhanda Wire
NVDA $230.48 -2.94% MSFT $522.61 -1.35% GOOGL $348.29 -0.63% META $720.89 -0.06% AMZN $254.06 -2.25%
← К новостям

Популярный рейтинг ИИ Arena почти вдвое увеличил оценку до $3,1 млрд за 10 месяцев

Arena, возникшая в 2023 году как исследовательский проект в Калифорнийском университете в Беркли, в рамках которого краудсорсинговым методом составлялись рейтинги ИИ-моделей, привлекла $200 млн в раунде серии B при оценке в $3,1 млрд, сообщила компания в четверг.

Это произошло после того, как компания сообщила о достижении $100 млн годовой выручки в пересчёте на текущий темп в июне.

Раунд возглавили Lightspeed Venture Partners и Khosla Ventures; в нём также приняли участие Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z, Felicis и другие инвесторы. Ранее в январе Arena объявила о привлечении $150 млн в раунде серии A при оценке после инвестиций в $1,7 млрд. На тот момент её годовая выручка в пересчёте на текущий темп составляла $30 млн, сообщила компания. Таким образом, примерно за 10 месяцев её оценка почти удвоилась.

Arena предоставляет краудсорсинговую платформу, бесплатную для потребителей. Пользователи вводят запросы или заказывают проекты, созданные с помощью вайб-кодинга, а затем оценивают, какая модель справилась лучше. Arena утверждает, что платформу посещают десятки миллионов человек в месяц.

В сентябре прошлого года компания представила коммерческий продукт AI Evaluations — сервис, который предоставляет разработчикам моделей и предприятиям подробную аналитику производительности на основе отзывов сообщества. Время было выбрано идеально. В этом году лаборатории, занимающиеся разработкой ИИ, выяснили, что их модели подстраивались под тесты бенчмаркинга, находя способы набрать высокие баллы, не заслуживая их по-настоящему. В то же время предприятиям требовалась помощь в определении того, какая модель лучше всего подходит для их внутренних задач, вместо того чтобы полагаться только на стандартизированные бенчмарки.

«ИИ развивается быстрее, чем наши возможности по его оценке, а статические бенчмарки перестают работать, как только модели понимают, что их тестируют, — заявила компания в объявлении о привлечении финансирования. — Миру нужна нейтральная третья сторона, которая будет оценивать, насколько ИИ действительно безопасен и соответствует заданным принципам, когда он оказывается в руках реальных людей. Сегодня Arena берёт на себя эту роль», — добавила она.

С этой целью Arena также добавила в свой рейтинг новую категорию: соответствие заданным принципам. В ней модели ранжируются по таким критериям, как несанкционированные действия (совершение действий, о которых модель не просили); ложная атрибуция (ошибочное приписывание высказываний или фактов ненадлежащему источнику); а также то, что компания называет «обманчивым завершением» (ложное заявление о выполнении задач, которые на самом деле не были выполнены).

В настоящее время несколько моделей OpenAI занимают верхние позиции в её предварительном рейтинге соответствия заданным принципам, а Claude Opus 5.5 и Claude Fable находятся соответственно на шестом и девятом местах.

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием TechCrunch

Читать оригинал на TechCrunch ↗

Текст и изображения принадлежат TechCrunch и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости