GPT-6 Sol і Luna від OpenAI удвічі дешевші, але майже не впливають на продуктивність
З GPT-6 Sol і Luna OpenAI додає до своєї лінійки дві дешевші моделі, які відповідають продуктивності попередників за вдвічі нижчою ціною токенів і прагнуть конкурувати з деякими дорожчими моделями Anthropic.
Найбільша зміна — зниження ціни на 50 відсотків порівняно з GPT-5.6 Sol і Luna. GPT-6 Sol тепер коштує $2 за мільйон вхідних токенів і $10 за мільйон вихідних, тоді як Luna коштує $0.10 за вхідні та $0.50 за вихідні токени.
OpenAI пояснює нижчі ціни вдосконаленнями кешування та інференсу, заявляючи, що безпосередньо передає цю економію користувачам. Це ставить її ціни в один діапазон із дешевшими моделями з відкритими вагами. Terra, яка раніше була найдешевшою моделлю в лінійці, більше недоступна.
| Модель | Вхідні дані | Вихідні дані |
|---|---|---|
| GPT-6 Sol проти GPT-5.6 Sol | $4 → $2 | $20 → $10 |
| GPT-6 Luna проти GPT-5.6 Luna | $0.20 → $0.10 | $1.20 → $0.50 |
За словами OpenAI, Sol призначена для регулярних складних завдань, таких як створення нових функцій, перевірка коду, налагодження та аналіз даних. Luna має виконувати великі обсяги чітко визначених завдань за низькою ціною — наприклад, узагальнювати документи, витягувати інформацію та відповідати на короткі запитання.
Окрім зниження цін на токени, OpenAI заявляє, що вдосконалила кешування промптів для GPT-6, запропонувавши знижку 90 відсотків на кешовані вхідні токени. Нова інформаційна панель кешування промптів та інструмент діагностики мають допомогти розробникам оптимізувати використання кешу, а тепер вони можуть змінювати рівень міркування та доступність інструментів без анулювання кешу.
На момент запуску обидві моделі доступні в ChatGPT Work і Codex для передплатників Plus, Pro, Business, Enterprise та Edu. Користувачі тарифів Free і Go отримують доступ до Luna через десктопний застосунок, але спочатку жодна з моделей не доступна у звичайному чаті. API пропонує їх під назвами gpt-6-sol і gpt-6-luna, тоді як доступ до них у ChatGPT розгортається поступово.
Перевага GPT-6 Sol і Luna в бенчмарках зводиться до вартості
OpenAI позиціонує нові моделі передусім за співвідношенням ціни та продуктивності порівняно з лінійкою Claude від Anthropic. У тесті OSWorld 2.0, який перевіряє використання комп’ютера, OpenAI заявляє, що GPT-6 дає результати, подібні до Claude Opus 5, приблизно за на 80 відсотків нижчої вартості, хоча Astra все ще лідирує в цій категорії.
У тесті AutomationBench, який перевіряє бізнес-процеси в 47 інструментах, GPT-6 Sol на найвищому рівні зусиль, за повідомленнями, перевершує Claude Opus 5 на максимальному рівні зусиль. OpenAI оцінює вартість одного завдання для Sol лише у 9 відсотків від вартості Opus. Luna тим часом покращила результат попередниці на 5,4 відсоткового пункта, коштуючи на 58 відсотків дешевше.
Для програмування OpenAI наводить результати двох бенчмарків. FrontierCode 1.1 перевіряє, чи створюють агенти ШІ код, який справді можна інтегрувати в наявну кодову базу, оцінюючи якість тестів, стиль коду та відповідність вимогам. GPT-6 Sol набирає 49,3 відсотка на максимальному рівні зусиль за $2.14 за завдання, приблизно відповідаючи Claude Fable 5.1, яка набирає 50,3 відсотка на максимальному рівні зусиль, але коштує в шість разів дорожче — $12.83. Claude Opus 5 досягає 53,4 відсотка за $4.31 на середньому рівні зусиль — налаштуванні, яке дало найкращий результат моделі в цьому тесті.
Рівні міркування OpenAI виходять з-під контролю
У DeepSWE v1.1 — бенчмарку для складних завдань програмної інженерії, що виконуються протягом тривалого часу в реальних кодових базах, — OpenAI повідомляє про результат 68,8 відсотка для GPT-6 Sol на максимальному рівні зусиль. Це в межах 1,1 відсоткового пункта від найкращого результату Claude Fable 5 — 69,9 відсотка на рівні «xhigh», тоді як Fable на рівні «max» набирає 69,7 відсотка за $21.63 за завдання.
Звісно, Sol тут не претендує на лідерство. Claude Opus 5 досягає 73,7 відсотка на максимальному рівні зусиль за $11.84 за завдання, а власна GPT-5.6 Sol від OpenAI набирає 72,7 відсотка за $6.46. Сенс GPT-6 Sol у тому, щоб наблизитися до цих показників за частку ціни. На рівні «xhigh» вона дає 66,6 відсотка за $1.00 за завдання. Luna ще дешевша: на максимальному рівні зусиль вона досягає такого самого результату лише за $0.22. OpenAI заявляє, що результат Luna можна порівняти з Claude Opus 5 і Claude Fable 5 на середньому рівні зусиль, водночас її вартість на 93 відсотки нижча за Opus і на 96 відсотків — за Fable.
Результати DeepSWE також перетворюють вибір між власними моделями OpenAI на головоломку. Luna на максимальному рівні зусиль відповідає Sol на рівні «xhigh», коштуючи на 78 відсотків дешевше. Підвищення Sol до максимального рівня зусиль дає лише 68,8 відсотка — всього на 2,2 відсоткового пункта більше, ніж Luna. Хто має розбиратися в усьому цьому під час реального використання?

Загалом добірка бенчмарків OpenAI виглядає вибірковою. Відсутні такі показники, як GDPval для інтелектуальної роботи або Terminal-Bench 4.0 для агентного програмування, хоча вони входять до звичного набору тестів. Схоже, OpenAI також пропустила запуск Opus 5.5, яка потенційно на 40 відсотків дешевша за Opus 5 і має значно кращу продуктивність.
Незалежний аналіз виявляє незначний реальний прогрес
За даними Artificial Analysis, GPT-6 Sol і Luna вдвічі знизили вартість виконання завдань порівняно зі своїми попередниками, але показники інтелекту залишилися на рівні GPT-5.6: у деяких оцінюваннях є покращення, а в інших — погіршення. Згідно з аналізом, в індексі агентів програмування Sol покращила результат на 2 пункти, тоді як Luna втратила 2 пункти.

Artificial Analysis також виявила погіршення результатів у двох ключових бенчмарках інтелектуальної роботи. У GDPval-AA v2.1, який перевіряє комп’ютеризовану інтелектуальну роботу в 44 професійних сферах, Sol втратила близько 100 балів Elo, а Luna — приблизно 75. Ручна перевірка показала, що погіршення здебільшого пов’язані з нижчою якістю презентацій і неповними результатами.
Artificial Analysis і раніше зазнавала критики, коли оцінила модель Astra від OpenAI надто низько через застарілі бенчмарки. Після цього відбулося два оновлення бенчмарків, і Astra знову очолила рейтинг. Побачимо, що станеться цього разу.
У будь-якому разі очевидно, що OpenAI робить велику ставку на ціну з GPT-6 Sol і Luna. Тепер моделям потрібно довести свою цінність у повсякденній роботі, адже бенчмарки розповідають лише частину історії. Це також може пояснити, чому OpenAI виключила деякі з них. У поєднанні з різними рівнями міркування та результатами, які часом виглядають оптимізованими під бенчмарки — навмисно чи ні, — вся гра з бенчмарками здається дедалі безглуздішою з кожним новим запуском моделі.
Новини ШІ без ажіотажу — відібрані людьми
Підпишіться на THE DECODER, щоб читати без реклами, отримувати щотижневу розсилку про ШІ, ексклюзивний щорічний звіт про передові технології «AI Radar», повний доступ до архіву та доступ до розділу коментарів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.