Claude Haiku 5.5 выходит с огромным снижением цен, доказывая, что ценовая гонка в сфере ИИ ещё далека от завершения
Основные моменты
- Anthropic выпустила Claude Haiku 5.5 — свою самую быструю и доступную малую модель, созданную для высоконагруженных задач, таких как запросы к данным и поддержка клиентов.
- Haiku 5.5 демонстрирует значительный прирост результатов в тестах по сравнению с Haiku 4.5 при цене токенов до 90 процентов ниже. Она также превосходит бюджетную модель OpenAI GPT-6 Luna в таких областях, как агентное программирование.
- Haiku 5.5 уже доступна в AWS, Google Cloud и Azure. Anthropic также вдвое снижает стоимость чтения кэша Sonnet 5.5 и вводит ежемесячные кредиты API для подписчиков.
Anthropic выпустила Claude Haiku 5.5 — самую быструю и доступную малую модель компании на сегодняшний день. Результаты тестов показывают значительный скачок производительности по сравнению с предшественницей, а Anthropic также снижает цены на Sonnet 5.5.
По данным Anthropic, Haiku 5.5 предназначена для высоконагруженных задач с ограниченным бюджетом, таких как создание кратких изложений, запросы к базам данных, классификация и поддержка клиентов в реальном времени. В среднем модель стоит примерно на 75 процентов дешевле Haiku 4.5. Для запросов с промптами объёмом до 100 000 токенов, на которые, по словам Anthropic, приходилось около 90 процентов всех предыдущих запросов к Haiku, цены снижаются до 90 процентов. Промпты длиннее 100 000 токенов стоят в пять раз дороже.
| Цена за 1 миллион токенов | Haiku 5.5 (промпты до / свыше 100 тыс.) | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|
| Чтение кэша | $0.01 / $0.05 | $0.10 | $0.10 |
| Запись в кэш | $0.125 / $0.625 | $1.25 | $2.50 |
| Входные токены | $0.10 / $0.50 | $1.00 | $2.00 |
| Выходные токены | $0.50 / $2.50 | $5.00 | $10.00 |
Anthropic отмечает, что Haiku 5.5 использует обновлённый токенизатор, который расходует немного больше токенов на задачу, чем предшественница. То же самое произошло с моделями Opus 4.x, где расход токенов вырос примерно на 30 процентов только из-за изменения токенизатора. Реальная экономия, вероятно, будет меньше, чем предполагают цены за токен.
Тесты показывают большой скачок по сравнению с Haiku 4.5
Haiku 5.5 набирает 1 620 баллов в тесте знаний GDPval-AA v2.1 — более чем вдвое больше, чем её предшественница, набравшая 735 баллов. В Humanity's Last Exam она достигает 45,9 процента без инструментов и 57,4 процента с инструментами против 10,2 и 18,7 процента соответственно.
Самый большой скачок наблюдается в работе с компьютером, при которой модель самостоятельно управляет компьютером. Поскольку работа с компьютером расходует большое количество токенов, такая дешёвая и быстрая модель, как Haiku 5.5, подходит для этого особенно хорошо. Она набирает 72,4 процента в OSWorld-2.1 против 15,7 процента ранее. В тесте агентного программирования Terminal-Bench 4.0 она достигает 39,2 процента, тогда как Haiku 4.5 набрала ноль.
Anthropic также приводит для сравнения бюджетную модель OpenAI GPT-6 Luna, и Haiku 5.5 лидирует во всех протестированных категориях. Однако результаты Sonnet 5.5 показывают, что Haiku 5.5 всё ещё значительно уступает более крупной модели Anthropic.
| Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 | |
|---|---|---|---|---|
| Работа со знаниями / GDPval-AA v2.1 | 1 620 | 735 | 1 437 | 1 840 |
| Работа со знаниями / AA-Briefcase v1.1 | 1 578 | 614 | 1 336 | 1824 |
| Работа с компьютером / OSWorld 2.1 | 72,4% (офлайн-подмножество) | 15,7% (офлайн-подмножество) | 48,9% (офлайн-подмножество) | 83,9% (офлайн-подмножество) |
| Мультидисциплинарное рассуждение / Humanity's Last Exam | 45,9% (без инструментов) | 10,2% (без инструментов) | — | 56,9% (без инструментов) |
| 57,4% (с инструментами) | 18,7% (с инструментами) | — | 64,5% (с инструментами) | |
| Агентное программирование / Terminal-Bench 4.0 | 39,2% | 0,0% | 16,4% | 70,6% |
| Агентное программирование / FrontierCode 1.1 (Main) | 46,4% | — | 42,4% | 52,1% (Xhigh) |
| Визуальное рассуждение / Chartography | 46,4% (без инструментов) | 6,4% (без инструментов) | 29,1% (без инструментов) | 61,6% (без инструментов) |
Первая модель Haiku позволяет пользователям выбирать между стоимостью и производительностью
Haiku 5.5 — первая модель класса Haiku с регулируемыми уровнями рассуждения, позволяющими пользователям находить баланс между стоимостью и качеством. Anthropic утверждает, что модель лучше всего подходит для узкоспециализированных задач, таких как сжатие, создание кратких изложений или работа в качестве субагента. Для сложного агентного программирования лучше по-прежнему выбирать Sonnet 5.5 и Opus 5.5.
Меры защиты от угроз кибербезопасности стали строже, чем у предшественницы, но при этом допускают более широкий спектр защитных задач, чем Sonnet 5.5, отчасти потому, что модель в целом менее мощная. Тестирование на проникновение по-прежнему заблокировано. Организации с более широкими потребностями могут подать заявку на участие в программах Anthropic по проверке в области биологических наук и кибербезопасности.
Haiku 5.5 уже доступна на всех платформах, включая Amazon Web Services, Google Cloud и Microsoft Azure.
Sonnet 5.5 тоже становится дешевле, а Anthropic раздаёт кредиты API
Одновременно с запуском Haiku Anthropic снижает стоимость чтения кэша Sonnet 5.5 на 50 процентов — с $0.20 до $0.10 за миллион токенов. Компания утверждает, что это должно снизить расходы на большинство агентных задач примерно на 20 процентов. Почти наверняка этот шаг стал реакцией на новую серию GPT-6.1 от OpenAI, показывая, что ценовые войны в сфере ИИ становятся как никогда ожесточёнными.
Anthropic также вводит ежемесячные кредиты API. Подписчики Max-5x получают $100, подписчики Max-20x — $200, а подписчики Team — до $500 в месяц. Пользователи могут тратить эти кредиты на эксперименты с инструментами, приложениями и агентами через API.
Компания также обновляет SDK для Python и TypeScript, добавляя бета-поддержку работы с компьютером и браузером.
Новости ИИ без шумихи — отобраны людьми
Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, наш эксклюзивный ежегодный отчёт о передовых разработках "AI Radar", доступ ко всему архиву и разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.