Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Anthropic пуска Claude Sonnet 5.5: 70,6% в Terminal-Bench 4.0 при същата цена от $2/$10

Anthropic току-що пусна Claude Sonnet 5.5. Това е вторият модел в семейството Claude 5.5, след Claude Opus 5.5. Anthropic го позиционира като по-бързо и по-евтино допълнение към Opus 5.5. Той е предназначен за добре дефинирани ежедневни задачи, поправяне на грешки и създаване на завършени документи, презентации и електронни таблици.

Може ли да бъде внедрен? Да. Той е наличен в Claude Platform под името claude-sonnet-5-5, както и в AWS, Google Cloud и Microsoft Azure. Това е модел със затворени тегла, така че самостоятелното му хостване не е възможно.

Какво се промени спрямо Sonnet 5

Anthropic съобщава за 4 основни подобрения спрямо Sonnet 5:

  • Скорост: генерирането на изход е с над 30% по-бързо, което го прави най-бързия Sonnet досега.
  • Цена на задача: до 30% по-ниска, тъй като са му необходими по-малко токени и извиквания на инструменти.
  • Писане: по-ясна проза, като ранните тестери го определят като по-добър партньор за съвместна работа.
  • Компютърно зрение и дългосрочна работа: това е първият Sonnet, който побеждава Pokémon Red, използвайки само екранни снимки.

Спецификации от прегледа на моделите: контекст от 1 млн. токена, максимален изход от 128 хил. токена и надежден праг на знанията от юни 2026 г. Адаптивното мислене е включено по подразбиране. Усилието се предлага на 5 нива: ниско, средно, високо, xhigh и максимално.

Бенчмаркове

Всички резултати по-долу са докладвани от доставчика в публикацията за пускането. Методологията е описана в системната карта на Sonnet 5.5.

  • Terminal-Bench 4.0: 70,6% спрямо 10,3% за Sonnet 5 и 66,4% за Opus 5.5 при Xhigh.
  • CursorBench 4.0: 55,5%, с около 2 пункта по-малко от Opus 5.5 (57,8%).
  • FrontierCode 1.1: 52,1% при Xhigh и 46,2% при Max. GPT-6 Sol е постигнал 49,3%.
  • GDPval-AA v2.1: 1844 спрямо 1846 за Opus 5.5 и 1449 за Sonnet 5.
  • OSWorld 2.1: 80,1% при използване на компютър, близо до Opus 5.5 (81,8%).
  • Humanity’s Last Exam: 64,5% с инструменти спрямо 54,9% преди.

Резултатът при Max е по-нисък от този при Xhigh по конкретна причина. При Max моделът по-често е извършвал многоагентен преглед на кода. Това понякога е водело до изтичане на времето или промени извън обхвата, което FrontierCode санкционира. Anthropic също посочва, че Opus 5.5 остава ясно по-силен при сложна и отворена работа.

Ценообразуване и ефективност

Цените в списъка са непроменени спрямо Sonnet 5: $2 за милион входни токени и $10 за милион изходни токени. Четенето на кеширани данни струва $0,20, а записът в кеша — $2,50 за милион. Това е наполовина по-евтино от Opus 5.5 ($4/$20). Спестяванията идват от ефективността при използването на токени, а не от намаление на цената.

Данните от клиентите потвърждават това. Balyasny Asset Management е измерила около 121 хил. токена на отговор спрямо 497 хил. при Sonnet 5. Base44 е отчела 3,6 итерации на изграждане на приложение, докато при Opus 5 са били необходими 7,7. Zendesk е обработвал тикети с 20% по-бързо.

Стойностите по подразбиране за усилието се различават според интерфейса. Claude Code и приложенията на Claude използват по подразбиране „Средно“. Claude Platform използва по подразбиране „Високо“.

Как се сравнява

ФункцияClaude Sonnet 5.5GPT-6 SolGemini 3.1 Pro PreviewClaude Opus 5.5
РазработчикAnthropicOpenAIGoogleAnthropic
Цена за 1 млн. токена (вход/изход)$2 / $10$2 / $10 (подкани до 272 хил.)$2 / $12 (подкани до 200 хил.)$4 / $20
Контекстен прозорец1 млн. токена1 050 000 токена1 048 576 токена1 млн. токена
Максимален изход128 хил. токена128 хил. токена65 536 токена128 хил. токена
Праг на знаниятаюни 2026 г.20 април 2026 г.Не е посоченюни 2026 г.
Контрол на разсъждениятаАдаптивно мислене, 5 нива на усилие6 нива на усилие (от никакво до максимално)Поддържа се мисленеАдаптивно мислене (винаги включено)
ВходовеТекст, изображениеТекст, изображениеТекст, изображение, видео, аудио, PDFТекст, изображение
FrontierCode 1.152,1% (Xhigh)49,3%Не е докладван54,4%
GDPval-AA v2.118441487Не е докладван1846
Chartography (без инструменти)61,6%53,6%Не е докладван64,4%
Етап на пусканеОбщодостъпенОбщодостъпенПредварителна версияОбщодостъпен
Отворени теглаНеНеНеНе

Резултатите от бенчмарковете са докладвани от Anthropic; изпълненията на GDPval-AA са на Artificial Analysis. Цените са стандартните тарифи в API списъка, проверени на 28 септември 2026 г.

Интерактивно обяснение

Claude Sonnet 5.5, обяснен интерактивно

Прегледайте бенчмарковете, нивата на усилие, цената на задачите и инструмента за проверка на миграцията към API.

Изберете ниво на усилие. Sonnet 5.5 предлага 5.
Дълбочина на разсъжденията
Скорост и спестяване на токени

Измервателните уреди са илюстративни за посоката, описана от Anthropic (при по-високо усилие моделът разсъждава по-дълго и проверява работата по-задълбочено). Препоръките са взети от ръководството за миграция към Sonnet 5.5.

Илюстративна оценка по каталожна цена ($2 за вход и $10 за изход на 1 млн. токена, идентична за Sonnet 5 и 5.5).
Входни токени на задача: Изходни токени на задача при Sonnet 5: Намаление на токените при Sonnet 5.5: % (Anthropic: до 30% по-ниска цена на задача)
Sonnet 5, на задача
Sonnet 5.5, на задача
При 10 000 задачи месечно спестявате

Спестяванията идват от по-малко токени и извиквания на инструменти, а не от по-ниска номинална цена. Реалното ви съотношение зависи от работното натоварване.

Изберете настройка от вашия код от ерата на Sonnet 5, за да видите какво връща Sonnet 5.5.
Източници: публикацията на Anthropic за пускането и документацията на Claude Platform, 28 септември 2026 г.© Marktechpost

Основни изводи

  • Sonnet 5.5 постига 70,6% на Terminal-Bench 4.0 спрямо 10,3% преди.
  • Цената остава $2/$10, но цената на задача спада с до 30%.
  • Той е в рамките на 2 пункта от Opus 5.5 при GDPval-AA.
  • Първият Sonnet с киберзащитни механизми и класификатори за извличане на разсъждения.
  • Може да бъде внедрен незабавно чрез API, AWS, Google Cloud и Azure.

Вижте официалното съобщение, ръководството за миграция и системната карта. Цялата заслуга е за изследователя на този проект. Също така, можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия 150k+ ML SubReddit и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Имате нужда от партньор за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face, ИЛИ пускане на продукт, ИЛИ уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини