OpenAI випускає GPT-6 Sol і Luna: ціни на API на 50% нижчі, результати бенчмарків
OpenAI випустила GPT-6 Sol і GPT-6 Luna — 2 нові моделі у своєму сімействі GPT-6. Вони посідають нижчий рівень за GPT-6 Astra, яку запустили на початку цього місяця. OpenAI навчала обидві моделі методами, подібними до тих, що застосовувалися для Astra. Мета — перенести до швидших і доступніших моделей досягнення Astra.
Доступні для розгортання вже сьогодні? Так. Обидві моделі доступні в API OpenAI під назвами gpt-6-sol і gpt-6-luna. Це моделі, доступні лише через API, тож ваги для самостійного розгортання відсутні.
Три рівні, один підхід
Сімейство GPT-6 тепер має 3 рівні. Astra — топова модель для найскладніших завдань. Sol орієнтована на складне програмування та професійні завдання за нижчою вартістю. Luna призначена для швидких і масштабних повсякденних завдань.
Команда OpenAI зазначає, що вдосконалене кешування та інференс дають змогу обслуговувати ці моделі дешевше. Компанія знижує ціни API для Sol і Luna на 50% порівняно з промоційними цінами GPT-5.6.
| Модель | Вхідні дані (за 1 млн токенів) | Вихідні дані (за 1 млн токенів) |
|---|---|---|
| GPT-6 Astra | $10.00 | $50.00 |
| GPT-6 Sol | $2.00 (було $4) | $10.00 (було $20) |
| GPT-6 Luna | $0.10 (було $0.20) | $0.50 (було $1.20) |
Варто звернути увагу на одну деталь. Ціна вихідних даних Luna знижується з $1.20 до $0.50 — приблизно на 58%, а не на 50%.
Бенчмарки: що повідомляє OpenAI
Професійна робота: У тесті AutomationBench 1.0.6 Sol із рівнем зусиль xhigh набирає 33.2% за вартості $0.27 за завдання. Claude Opus 5 із максимальним рівнем зусиль набирає 26.9% за вартості, що у 11.1 раза вища. Astra з низьким рівнем зусиль набирає 30.3% за вартості, що у 3.9 раза вища за Sol. Luna з високим рівнем зусиль випереджає попередницю на 5.4 процентного пункта за вартості одного завдання, нижчої на 58%.
У тесті Agents’ Last Exam Sol із максимальним рівнем зусиль набирає 56.4%. Це перевищує найкращий результат Claude Opus 5 за вартості одного завдання, нижчої на 60%.
Програмування: У тесті DeepSWE v1.1 Sol із максимальним рівнем зусиль набирає 68.8%. Це на 1.1 процентного пункта менше, ніж Claude Fable 5 із рівнем xhigh, але вартість одного завдання приблизно на 80% нижча. Luna із максимальним рівнем зусиль набирає 66.6% — результат, зіставний із Opus 5 та Fable 5 за середнього рівня зусиль. У цих порівняннях Luna коштує на 93% дешевше за завдання, ніж Opus 5, і на 96% дешевше, ніж Fable 5.
У тесті FrontierCode 1.1 Main, який оцінює, чи готовий код до злиття, Sol відповідає результату Claude Fable 5.1 із рівнем xhigh, але коштує значно дешевше.
Використання комп’ютера: В офлайн-тесті OSWorld 2.0 Sol із рівнем xhigh набирає 60.5% проти 60.3% у Opus 5 із середнім рівнем зусиль. Вартість одного завдання для Sol приблизно на 80% нижча. Luna з максимальним рівнем зусиль перевершує GPT-5.6 Sol із середнім рівнем зусиль за 1/10 вартості.
Фактологічна точність: Внутрішній тест OpenAI використовує деперсоніфіковані розмови в ChatGPT, у яких користувачі позначали помилки моделей. Sol робить приблизно вдвічі менше помилок, ніж її попередниця. Luna з вищим рівнем зусиль відповідає GPT-5.6 Sol приблизно за 1/100 її вартості.
OpenAI також зберегла стиль комунікації Astra. Очікуйте зрозуміліших і дещо коротших відповідей із меншою кількістю жаргону, особливо в розмовах про програмування.
Кешування промптів для агентів із тривалим виконанням
Агенти повторно надсилають ті самі інструкції, інструменти та історію під час кожного кроку. GPT-6 використовує вдосконалену систему кешування промптів із вищою часткою влучань у кеш за замовчуванням. За читання кешованих вхідних даних надаються знижки до 90%. Тепер відповідні спільні префікси, повторно використані протягом 30-хвилинного вікна, також підпадають під цю умову.
Нові елементи керування для розробників:
- Панель кешування промптів відстежує частку влучань у кеш із часом.
- Інструмент діагностики пояснює промахи, наприклад
"reason": "tools_changed". - Явні точки розриву дають змогу вибирати, де закінчується кешований префікс.
- Рівень зусиль для міркування можна змінювати посеред розмови за допомогою
configuration_updateбез порушення кешу. allowed_toolsобмежує інструменти, які можна викликати, водночас зберігаючи визначення незмінними.- Попереднє прогрівання готує відомий контекст до першого запиту користувача.
У повному посібнику з кешування промптів описано кожен підхід. GitHub повідомляє, що ці зміни скоротили частку токенів промптів, які потребують повторної обробки, більш ніж на 50%, допомагаючи Copilot відповідати швидше.
Доступність
- API:
gpt-6-solіgpt-6-luna. - ChatGPT Work і Codex: користувачі Plus, Pro, Business, Enterprise та Edu.
- Free і Go: Luna у настільному застосунку ChatGPT.
- Ще недоступні в чаті. Розгортання ChatGPT поступово відбувається протягом дня запуску.
Інтерактивне пояснення
Ключові висновки
- Sol коштує $2/$10, а Luna — $0.10/$0.50 за 1 млн токенів.
- Sol із рівнем xhigh перевершує Opus 5 max у AutomationBench, коштуючи 9% від його вартості.
- Luna набирає 66.6% у DeepSWE v1.1, коштуючи на 93% дешевше за завдання, ніж Opus 5.
- За читання кешованих вхідних даних надається знижка до 90%, а також доступні нові елементи керування кешем.
- Обидві моделі доступні в API, ChatGPT Work і Codex; у чаті вони ще недоступні.
Ознайомтеся з технічним блогом. Уся заслуга належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого субреддіту про машинне навчання зі 150 тис.+ учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.
Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.