GPT-6.1 Sol се доближава до Astra на една пета от цената
Основни точки
- OpenAI пуска GPT-6.1 Sol — модел, който почти се изравнява по производителност с планирания флагман Astra, но струва една пета от цената му.
- Флагманът GPT-6.1 Astra засега няма да бъде пуснат заради опасения за безопасността. При вътрешни тестове той заблуждаваше и използваше инструменти без разрешение.
- Sol вече е достъпен за платени клиенти в ChatGPT Work, Codex и API, а цената му е сравнима с тази на Claude Sonnet 5.5.
Новият GPT-6.1 Sol на OpenAI би трябвало да се доближава до GPT-6 Astra на малка част от цената. Планираният флагмански модел Astra остава зад кулисите заради проблеми с безопасността.
OpenAI залага на ефективността на разходите вместо на върхова производителност. Докато флагманът му GPT-6.1 Astra няма да бъде пуснат според плана заради опасения за безопасността, компанията пуска GPT-6.1 Sol като много по-евтина алтернатива. Според OpenAI моделът се доближава до Astra при автономно програмиране, работа с компютър и офис задачи на една пета от цената.
Цената за API е 2 долара за един милион входни токени и 10 долара за изходни. Така Sol е на същата цена като GPT-6 Sol и Claude Sonnet 5.5 на Anthropic. Кешираните входни данни струват 0,10 долара — с 95 процента по-малко от некешираните, докато Sonnet 5.5 таксува 0,20 долара. Това помага най-вече на агенти, които използват повторно контекст при множество заявки.
| Цена за един милион токени | Claude Opus 5.5 | GPT-6 Sol | GPT-6.1 Sol | Claude Sonnet 5.5 |
|---|---|---|---|---|
| Входни токени | 4 $ | 2 $ | 2 $ | 2 $ |
| Изходни токени | $20 | $10 | $10 | $10 |
| Операции за четене от кеша | $0.20 | $0.20 | $0.10 | $0.20 |
| Операции за запис в кеша | $5 | $2.50 | — | $2.50 |
Потребителите на Plus, Pro, Business, Enterprise и Edu могат да използват Sol в ChatGPT Work и Codex от днес, макар че той все още не е наличен в обикновения чат. Разработчиците могат да получат достъп до него чрез API като gpt-6.1-sol. Версия Ultrafast, която генерира токени до осем пъти по-бързо в Codex, се очаква през следващите няколко дни.
Собствените данни на OpenAI поставят Sol непосредствено след Astra
Всички бенчмаркове са предоставени от OpenAI, която ги определя като предварителни. Честно сравнение, включително със Sonnet 5.5, няма да бъде възможно до пускането му.
При бенчмарка за програмиране DeepSWE v1.1 OpenAI твърди, че Sol се изравнява с Astra при приблизително една пета от цената и постига резултат с 6,4 процентни пункта по-висок от най-добрия резултат на GPT-6 Sol. При OSWorld 2.0, който тества работата с компютър, той надминава предшественика си със седем пункта и изостава от Astra с 2,1 пункта при около една седма от цената.
При бенчмарка за документи GDP.pdf OpenAI твърди, че Sol превъзхожда Opus 5.5 на Anthropic при по-малко от половината разходи за задача. В AutomationBench, който обхваща многостъпкови бизнес процеси, той завършва с 2,2 пункта пред Opus 5.5 при средно усилие за разсъждение и около една трета от цената.
При Terminal-Bench Science Sol повече от удвоява резултата на предшественика си, според OpenAI. Средната научна задача струва 5,47 долара в сравнение с 23,21 долара за Opus 5.5 и 23,80 долара за Astra. Astra все пак постига най-високия резултат — 68,1 процента, а OpenAI продължава да я препоръчва за най-трудните изследователски задачи.
OpenAI също твърди, че Sol е по-надежден по отношение на фактите. При нарочно трудни заявки, на които по-ранните модели са отговаряли неправилно, делът на грешните отговори при ниско усилие за разсъждение спада от 11,4 на 7,7 процента. OpenAI признава, че тези заявки не са представителни за нормалната употреба.
Sol става по-безопасен точно в областта, в която Astra се провали
OpenAI казва, че Sol се представя и много по-добре от предшественика си при тестовете за безопасност, макар че все още изостава от Astra. Той се опитва да заобиколи изрични блокировки, като съобщенията „достъпът е отказан“, в 23,5 процента от случаите — спад от 64,4 процента при GPT-6 Sol. При Astra делът е 17,4 процента. Нежелани резултати, като неоторизирани транзакции, се случват в 4,3 процента от изпълненията в сравнение със 17,4 процента при предшественика и 2,9 процента при Astra.
Когато инструментът за търсене е повреден, Sol прикрива проблема, вместо да го съобщи, в 2,8 процента от случаите. GPT-6 Sol прави това в 4,9 процента от случаите, а Astra — в 1,5 процента. Подобно на Astra и предшественика си, Sol никога не се е опитвал да заобиколи автоматизирана проверка за безопасност. OpenAI отбелязва, че тестовете са били проектирани да бъдат трудни и са проведени без пълните защити, които продуктите ѝ използват.
Именно по отношение на безопасността планираният флагмански модел не оправда очакванията. Според Wall Street Journal OpenAI няма да пусне GPT-6.1 Astra в ChatGPT и Codex през октомври, както беше планирано, тъй като изследователи са изразили опасения за безопасността по време на вътрешни тестове. Ръководителят по безопасността Саачи Джайн заяви, че моделът по-често заблуждава и продължава без разрешение, като понякога използва външни инструменти по рискови начини, въпреки че се справя по-добре със завършването на задачи.
OpenAI не се отказва напълно от модела. Компанията планира да използва базовия модел за още обучения с подсилване и евентуално за бъдещи поколения GPT-6. Джайн заяви, че компанията трябва да намери правилния баланс между това моделът да остане в рамките на задачата си и да не стане ленив.
Новини за изкуствения интелект без сензацията – подбрани от хора
Абонирайте се за THE DECODER за четене без реклами, седмичен бюлетин за изкуствения интелект, нашия ексклузивен шест пъти годишно публикуван доклад „AI Radar“ за водещите технологии, пълен достъп до архива и достъп до секцията за коментари.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.