Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Anthropic пуска Claude Opus 5.5: производителност на ниво Fable 5.1 при 40% по-ниски разходи за работа от Opus 5

Anthropic пусна Claude Opus 5.5, първия модел от новото си семейство Claude 5.5. Екипът заявява, че при повечето задачи той се представя на нивото на Claude Fable 5.1. Освен това работата му струва с 40% по-малко от тази на Opus 5 при типични натоварвания и стандартни настройки. Според собствените бенчмаркове на Anthropic той води при агентното програмиране, работата с компютър и интелектуалния труд.

Може ли да бъде внедрен? Да, като управляван API модел. Anthropic не е публикувала теглата, така че самостоятелното хостване не е възможно. Разработчиците могат да използват claude-opus-5-5 в Claude Platform, Amazon Web Services, Google Cloud и Microsoft Azure. Както при предишните модели Opus, е налично нулево съхранение на данни.

Бенчмаркове: силна преднина, но не пълна победа

Резултатите на Opus 5.5 са получени с адаптивно мислене при максимално усилие и активирани производствени предпазни мерки.

БенчмаркOpus 5.5Fable 5.1Opus 5GPT-6 Astra
Terminal-Bench 4.066.4%55.8%52.3%57.9%
FrontierCode v1.154.4%50.3%48.0%53.3%
CursorBench 4.057.8%51.8%46.6%н/д
GDPval-AA v2.1 (Elo)1846173517081542
OSWorld 2.081.8%80.7%74.0%н/д
Terminal-Bench-Science 0.158.7%52.6%29.0%64.6%
AutomationBench40.0%31.4%26.9%41.4%

За Opus 5.5 е отчетен резултат 66.4% при максимално усилие в Terminal-Bench 4.0. GPT-6 Astra все още води в Terminal-Bench-Science и AutomationBench. Zapier е провел AutomationBench без резервни модели, така че намесите на предпазните механизми са отчетени като неуспехи. Anthropic също предупреждава, че разликите в бенчмарковете стават все по-ненадежден ориентир. При собственото им използване разликата спрямо Fable 5.1 е по-малка, отколкото подсказват резултатите.

Резултатите, коригирани спрямо разходите, са по-показателни. При стандартно (средно) усилие Opus 5.5 постига 54.6% във FrontierCode. Това надминава най-високия резултат на GPT-6 Astra от 53.3% при около една пета от разходите за задача. В CursorBench резултатът при средно усилие е 52.5%. Това е с 11 пункта над най-добрия резултат на GPT-5.6 Sol при около една трета от разходите.

Цени и скорост

Opus 5.5 изисква по-малко изчислителни ресурси за обслужване от Opus 5 и цената отразява това.

На 1 млн. токенаOpus 5.5Opus 5
Вход$4$5
Изход$20$25
Четене от кеша$0.20$0.50
Запис в кеша$5$6.25

Четенето от кеша съставлява по-голямата част от разходите за агентни задачи и програмиране, а цената му спада с 60%. Opus 5.5 използва и по-малко токени за задача. В комбинация това води до намаление на разходите с 40%. Генерирането на изход е с над 30% по-бързо от това на Opus 5. Бързият режим в Claude Code и Claude Platform предлага до 2,5 пъти по-висока скорост при $8 за вход и $40 за изход на милион токена.

Anthropic също така увеличава петчасовите лимити за използване в плановете Pro, Max, Team и базирания на места Enterprise. Абонатите получават нулиране на лимита, което могат да запазят и използват по-късно.

Какво съобщават първите тестери

  • Един тестер е завършил миграция на код от 680 000 реда за по-малко от ден.
  • Друг е одитирал и поправил кодова база от 200 000 реда за по-малко от 3 часа. Opus 5 е отнел над 20 часа и е използвал 2,5 пъти повече токени.
  • При вътрешно пренасяне на HAProxy от C към Rust Opus 5.5 е приключил за 9,5 часа. Fable 5.1 е отнел 12 часа, а Opus 5.5 е струвал с 51% по-малко.
  • Deloitte посочва, че Opus 5.5 при най-ниско усилие е открил 72% от известните грешки при преглед. Opus 5 при високо усилие е открил 56%.
  • При тест с трудно намираем финансов отчет 16 от 18-те отчета на Opus 5.5 са покрили изискванията за качество на Anthropic. Fable 5.1 и Opus 5 не са успели нито веднъж.

Стилът на писане също се е променил. Opus 5.5 поставя ключовата информация на първо място, използва по-малко жаргон и следва правилата за писане, които му задавате.

Безопасност, предпазни мерки и промени в API

Opus 5.5 е първият продукт на Anthropic след призива на главния изпълнителен директор Dario Amodei за забавяне на темпото на развитие на водещите технологии. Външни оценители, сред които METR и Frontier Design, са го тествали преди пускането му. Той постига най-добрия резултат досега в автоматизирания поведенчески одит на Anthropic, който обхваща близо 2000 сценария. При нов тест за ограничаване той се е опитвал да заобиколи границите с около 85% по-рядко от Opus 5. Anthropic също отбелязва, че моделът често подозира, че е подложен на оценяване.

Способностите му в областта на биологията и киберсигурността са сравними с тези на Claude Mythos 5.1. Затова Opus 5.5 се предлага с предпазни мерки, подобни на тези на Fable 5.1:

Още две промени засягат интеграциите. Мисленето вече не може да бъде деактивирано. Изходите също така съдържат воден знак за съответствие с нормативния акт на ЕС за изкуствения интелект. Пълните подробности са в системната карта на Opus 5.5.

Интерактивно обяснение

Основни изводи

  • Opus 5.5 се изравнява с Fable 5.1 при повечето задачи и надминава както Opus 5, така и Fable 5.1 в почти всеки отчетен бенчмарк.
  • Цената за API спада до $4/$20 на 1 млн. токена, а четенето от кеша поевтинява с 60% до $0.20.
  • Anthropic оценява спестяванията при типични натоварвания на 40%, като изходът се генерира с над 30% по-бързо от Opus 5.
  • Заявките за киберсигурност и биология се подчиняват на предпазни мерки от клас Fable 5.1, а мисленето не може да бъде изключено.
  • Затворени тегла: claude-opus-5-5 работи чрез Claude Platform, AWS, Google Cloud и Azure.

Вижте техническите подробности тук. Всички заслуги са за изследователя на този проект. Също така не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Сега можете да се присъедините към нас и в Telegram.

Искате да си партнирате с нас за популяризиране на вашето GitHub хранилище, страница в Hugging Face, продуктово представяне, уебинар и др.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини