Anthropic пуска Claude Haiku 5.5: малък модел с контекст от 1 млн. токена на цена от $0,10 за милион входни токени
Anthropic пусна Claude Haiku 5.5 — своя най-евтин и бърз малък модел досега. Той е предназначен за високонатоварени задачи като обобщаване, компактиране, класификация и задачи със субагенти. Запазва контекстен прозорец от 1 млн. токена и поддържа до 128 хил. изходни токена. Цените започват от $0.10 за един милион входни токена и $0.50 за един милион изходни токена. Това е с 90% по-малко от Claude Haiku 4.5 за подкани до 100 хил. токена.
Може ли да бъде внедрен? Да, като хостван API. Haiku 5.5 е общодостъпен в Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry и Claude Platform в AWS.
Какво пусна Anthropic
Haiku 5.5 е първият модел от класа Haiku с регулируема настройка за усилие. Адаптивното мислене е включено по подразбиране, а параметърът за усилие по подразбиране е medium.
Моделът приема текст и изображения, генерира текст и има краен срок на познанията юни 2026 г. Пакетните задачи поддържат до 300 хил. изходни токена в бета версия.
Важно е да се отбележат две ключови неща. Стойности на temperature, top_p или top_k, различни от тези по подразбиране, връщат грешка 400. Новият токенизатор също така отчита приблизително 30% повече токени за един и същ текст в сравнение с Haiku 4.5. Ръководството за миграция обхваща и двете.
Ценообразуване: структура с 2 нива
Ценообразуването се разделя при 100 хил. токена в подкана. До 100 хил. токена входът струва $0.10, а изходът — $0.50 на милион. Четенето от кеша струва $0.01, а записването в кеша за 5 минути — $0.125. Над 100 хил. токена ставките се увеличават до $0.50 за вход и $2.50 за изход.
Haiku 4.5 таксуваше $1 за вход и $5 за изход. Anthropic твърди, че около 90% от заявките към Haiku 4.5 са били под 100 хил. токена. След корекция за токенизатора компанията изчислява, че Haiku 5.5 работи средно с около 75% по-ниска цена. Пакетната обработка намалява цената с още 50%.
GPT-6 Luna посочва идентични ставки за кратък контекст. По-високото му ниво започва едва над 272 хил. входни токена — при $0.20 и $0.75. При подкана от 150 хил. токена Luna е по-евтината опция по каталожна цена.
Бенчмаркове
Всички стойности по-долу са посочени от Anthropic (вижте системната карта):
- OSWorld 2.1 (офлайн подмножество): 72.4% в сравнение с 48.9% за GPT-6 Luna и 15.7% за Haiku 4.5.
- Terminal-Bench 4.0: 39.2% в сравнение с 16.4% за Luna и 0.0% за Haiku 4.5.
- FrontierCode 1.1 (Main): 46.4% в сравнение с 42.4% за Luna.
- Humanity’s Last Exam: 45.9% без инструменти и 57.4% с инструменти.
- GDPval-AA v2.1: 1620 в сравнение с 1437 за Luna и 735 за Haiku 4.5.
Sonnet 5.5 все още води във всеки ред, включително със 70.6% на Terminal-Bench 4.0. Самата Anthropic препоръчва Sonnet 5.5 и Opus 5.5 за сложни агентни задачи по програмиране.
Най-добри случаи на употреба
Три типа работни натоварвания са най-подходящи за Haiku 5.5:
- Първият е работа със субагенти под управлението на Opus 5.5 или Sonnet 5.5. В Rogo субагент на Haiku 5.5 извлича ред с приходи от формуляр 10-K, докато по-голям модел създава презентацията.
- Вторият е високонатоварено задаване на въпроси към документи и обобщаване. AlphaSense го е тествала във функция, която обработва около 8 млн. обаждания седмично.
- Третият е работа, чувствителна към скоростта, като обслужване на клиенти в реално време и използване на браузър.
Haiku 5.5 спрямо най-близките му конкуренти
| Функция | Claude Haiku 5.5 | GPT-6 Luna | Gemini 3.5 Flash-Lite |
|---|---|---|---|
| Вход / изход (за 1 млн.) | $0.10 / $0.50 | $0.10 / $0.50 | $0.30 / $2.50 |
| Ценообразуване за дълги подкани | $0.50 / $2.50 над 100 хил. | $0.20 / $0.75 над 272 хил. | Фиксирана ставка |
| Четене от кеша (за 1 млн.) | $0.01 | $0.01 | $0.03 + съхранение |
| Контекстен прозорец | 1 млн. токена | 1 050 000 токена | 1 048 576 токена |
| Максимален изход | 128 хил. токена | 128 000 токена | 65 536 токена |
| Входове | Текст, изображения | Текст, изображения | Текст, изображение, видео, аудио, PDF |
| Контрол на разсъжденията | Адаптивно мислене + усилие (по подразбиране medium) | reasoning.effort от none до max (по подразбиране medium) | Поддържа се мислене |
| Използване на компютър | Поддръжка в SDK в бета версия | Поддържа се (Responses API) | Поддържа се (Preview) |
| Отстъпка за пакетна обработка | 50% | 50% (Batch и Flex) | 50% |
| Краен срок на познанията | юни 2026 г. | 18 май 2026 г. | Не е посочен на страницата на модела |
| Къде може да работи | Claude API, Bedrock, Google Cloud, Microsoft Foundry, Claude Platform в AWS | OpenAI API | Gemini API |
Източници: Документация на Anthropic, съобщение на Anthropic, страница на модела в OpenAI, цени на OpenAI, страница на модела в Google, цени на Google. Каталожни цени за стандартното ниво, проверени на 7 октомври 2026 г.
Интерактивно обяснение
Основни изводи
- $0.10 за вход и $0.50 за изход на 1 млн. токена при подкани до 100 хил. токена.
- Контекст от 1 млн. токена, изход от 128 хил. токена, адаптивно мислене с настройка за усилие (по подразбиране
medium). - 72.4% на OSWorld 2.1 в сравнение с 15.7% за Haiku 4.5 (по данни на Anthropic).
- Същата каталожна цена за кратък контекст като GPT-6 Luna; Luna е по-евтин над 100 хил. токена.
- Позициониран като субагент под Opus 5.5 и Sonnet 5.5, а не като водещ модел за програмиране.
Разгледайте техническите подробности. Цялата заслуга е за изследователя на този проект. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Сега можете да се присъедините към нас и в Telegram.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.