Claude Haiku 5.5 излиза с огромни ценови отстъпки, доказвайки, че ценовата надпревара при ИИ далеч не е приключила
Основни моменти
- Anthropic пусна Claude Haiku 5.5 — най-бързия и достъпен малък модел на компанията, създаден за задачи с голям обем като заявки към данни и обслужване на клиенти.
- Haiku 5.5 показва значителни подобрения в бенчмарковете спрямо Haiku 4.5 при цени на токените до 90 процента по-ниски. Той също така превъзхожда бюджетния модел GPT-6 Luna на OpenAI в области като агентно програмиране.
- Haiku 5.5 вече е достъпен в AWS, Google Cloud и Azure. Anthropic също намалява наполовина разходите за четене на кеша на Sonnet 5.5 и въвежда месечни API кредити за абонати.
Anthropic пусна Claude Haiku 5.5 — най-бързия и достъпен малък модел на компанията досега. Резултатите от бенчмарковете показват значителен скок в производителността спрямо предшественика му, а Anthropic също намалява цените на Sonnet 5.5.
Според Anthropic Haiku 5.5 е създаден за задачи с голям обем и чувствителност към разходите, като обобщаване, заявки към бази данни, класификация и обслужване на клиенти в реално време. Средно моделът струва около 75 процента по-малко от Haiku 4.5. При заявки с подканвания до 100 000 токена, които според Anthropic представляват приблизително 90 процента от всички предишни заявки към Haiku, цените падат с до 90 процента. Подканванията, по-дълги от 100 000 токена, струват пет пъти повече.
| Цена за 1 милион токена | Haiku 5.5 (подкания до / над 100 хил.) | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|
| Четене от кеша | $0.01 / $0.05 | $0.10 | $0.10 |
| Запис в кеша | $0.125 / $0.625 | $1.25 | $2.50 |
| Входни токени | $0.10 / $0.50 | $1.00 | $2.00 |
| Изходни токени | $0.50 / $2.50 | $5.00 | $10.00 |
Anthropic посочва, че Haiku 5.5 използва обновен токенизатор, който изразходва малко повече токени за задача от предшественика му. Същото се случи с моделите Opus 4.x, при които използването на токени скочи с около 30 процента само заради промяната в токенизатора. Реалните спестявания вероятно са по-малки от предполагаемото намаление на цената за токен.
Бенчмарковете показват голям скок спрямо Haiku 4.5
Haiku 5.5 получава 1 620 точки в бенчмарка за знания GDPval-AA v2.1 — повече от два пъти над постигнатите от предшественика му 735 точки. На Humanity's Last Exam той достига 45,9 процента без инструменти и 57,4 процента с инструменти, спрямо съответно 10,2 и 18,7 процента.
Най-големият скок е при използването на компютър, при което моделът управлява компютър самостоятелно. Тъй като използването на компютър изразходва големи количества токени, евтин и бърз модел като Haiku 5.5 е естествен избор. Той постига 72,4 процента на OSWorld-2.1 спрямо 15,7 процента преди. В бенчмарка за агентно програмиране Terminal-Bench 4.0 той достига 39,2 процента, докато Haiku 4.5 е получил нула.
Anthropic посочва и бюджетния модел GPT-6 Luna на OpenAI за сравнение, като Haiku 5.5 води във всяка тествана категория. Референтните резултати на Sonnet 5.5 обаче показват, че Haiku 5.5 все още изостава значително от по-големия модел на Anthropic.
| Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 | |
|---|---|---|---|---|
| Работа със знания / GDPval-AA v2.1 | 1 620 | 735 | 1 437 | 1 840 |
| Работа със знания / AA-Briefcase v1.1 | 1 578 | 614 | 1 336 | 1824 |
| Използване на компютър / OSWorld 2.1 | 72,4% (офлайн подмножество) | 15,7% (офлайн подмножество) | 48,9% (офлайн подмножество) | 83,9% (офлайн подмножество) |
| Мултидисциплинарно разсъждение / Humanity's Last Exam | 45,9% (без инструменти) | 10,2% (без инструменти) | — | 56,9% (без инструменти) |
| 57,4% (с инструменти) | 18,7% (с инструменти) | — | 64,5% (с инструменти) | |
| Агентно програмиране / Terminal-Bench 4.0 | 39,2% | 0,0% | 16,4% | 70,6% |
| Агентно програмиране / FrontierCode 1.1 (Main) | 46,4% | — | 42,4% | 52,1% (Xhigh) |
| Визуално разсъждение / Chartography | 46,4% (без инструменти) | 6,4% (без инструменти) | 29,1% (без инструменти) | 61,6% (без инструменти) |
Първият модел Haiku позволява на потребителите да разменят цена за производителност
Haiku 5.5 е първият модел от клас Haiku с регулируеми нива на разсъждение, което позволява на потребителите да балансират разходите и качеството. Anthropic посочва, че моделът работи най-добре при тясно дефинирани задачи като компактно представяне, обобщаване или работа като подагент. За сложно агентно програмиране Sonnet 5.5 и Opus 5.5 остават по-добрият избор.
Мерките за киберсигурност са по-строги от тези при предшественика, но позволяват по-широк набор от защитни задачи в сравнение със Sonnet 5.5, отчасти защото моделът като цяло е по-малко способен. Тестването за проникване остава блокирано. Организациите с по-широки потребности могат да кандидатстват за програмите за проверка на Anthropic в областта на науките за живота и киберсигурността.
Haiku 5.5 вече е достъпен на всички платформи, включително Amazon Web Services, Google Cloud и Microsoft Azure.
Sonnet 5.5 също поевтинява, а Anthropic раздава API кредити
Заедно с пускането на Haiku Anthropic намалява с 50 процента разходите за четене на кеша на Sonnet 5.5 — от $0.20 на $0.10 за милион токена. Компанията заявява, че това трябва да намали разходите за повечето агентни задачи с около 20 процента. Ходът почти сигурно е реакция на новата серия GPT-6.1 на OpenAI, което показва, че ценовите войни в областта на изкуствения интелект се водят по-ожесточено от всякога.
Anthropic също въвежда месечни API кредити. Абонатите на Max-5x получават $100, абонатите на Max-20x — $200, а абонатите на Team получават до $500 месечно. Потребителите могат да използват кредитите, за да експериментират с инструменти, приложения и агенти чрез API.
Компанията обновява и своите Python и TypeScript SDK, като добавя бета поддръжка за използване на компютър и браузър.
Новини за изкуствения интелект без сензации – подбрани от хора
Абонирайте се за THE DECODER за четене без реклами, седмичен бюлетин за изкуствения интелект, ексклузивния ни шест пъти годишно публикуван доклад за новостите в областта на изкуствения интелект „AI Radar“, пълен достъп до архива и достъп до секцията за коментари.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.