Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

OpenAI випускає GPT-6 Sol і Luna: ціни на API на 50% нижчі, результати бенчмарків

OpenAI випустила GPT-6 Sol і GPT-6 Luna — 2 нові моделі у своєму сімействі GPT-6. Вони посідають нижчий рівень за GPT-6 Astra, яку запустили на початку цього місяця. OpenAI навчала обидві моделі методами, подібними до тих, що застосовувалися для Astra. Мета — перенести до швидших і доступніших моделей досягнення Astra.

Доступні для розгортання вже сьогодні? Так. Обидві моделі доступні в API OpenAI під назвами gpt-6-sol і gpt-6-luna. Це моделі, доступні лише через API, тож ваги для самостійного розгортання відсутні.

Три рівні, один підхід

Сімейство GPT-6 тепер має 3 рівні. Astra — топова модель для найскладніших завдань. Sol орієнтована на складне програмування та професійні завдання за нижчою вартістю. Luna призначена для швидких і масштабних повсякденних завдань.

Команда OpenAI зазначає, що вдосконалене кешування та інференс дають змогу обслуговувати ці моделі дешевше. Компанія знижує ціни API для Sol і Luna на 50% порівняно з промоційними цінами GPT-5.6.

МодельВхідні дані (за 1 млн токенів)Вихідні дані (за 1 млн токенів)
GPT-6 Astra$10.00$50.00
GPT-6 Sol$2.00 (було $4)$10.00 (було $20)
GPT-6 Luna$0.10 (було $0.20)$0.50 (було $1.20)

Варто звернути увагу на одну деталь. Ціна вихідних даних Luna знижується з $1.20 до $0.50 — приблизно на 58%, а не на 50%.

Бенчмарки: що повідомляє OpenAI

Професійна робота: У тесті AutomationBench 1.0.6 Sol із рівнем зусиль xhigh набирає 33.2% за вартості $0.27 за завдання. Claude Opus 5 із максимальним рівнем зусиль набирає 26.9% за вартості, що у 11.1 раза вища. Astra з низьким рівнем зусиль набирає 30.3% за вартості, що у 3.9 раза вища за Sol. Luna з високим рівнем зусиль випереджає попередницю на 5.4 процентного пункта за вартості одного завдання, нижчої на 58%.

У тесті Agents’ Last Exam Sol із максимальним рівнем зусиль набирає 56.4%. Це перевищує найкращий результат Claude Opus 5 за вартості одного завдання, нижчої на 60%.

Програмування: У тесті DeepSWE v1.1 Sol із максимальним рівнем зусиль набирає 68.8%. Це на 1.1 процентного пункта менше, ніж Claude Fable 5 із рівнем xhigh, але вартість одного завдання приблизно на 80% нижча. Luna із максимальним рівнем зусиль набирає 66.6% — результат, зіставний із Opus 5 та Fable 5 за середнього рівня зусиль. У цих порівняннях Luna коштує на 93% дешевше за завдання, ніж Opus 5, і на 96% дешевше, ніж Fable 5.

У тесті FrontierCode 1.1 Main, який оцінює, чи готовий код до злиття, Sol відповідає результату Claude Fable 5.1 із рівнем xhigh, але коштує значно дешевше.

Використання комп’ютера: В офлайн-тесті OSWorld 2.0 Sol із рівнем xhigh набирає 60.5% проти 60.3% у Opus 5 із середнім рівнем зусиль. Вартість одного завдання для Sol приблизно на 80% нижча. Luna з максимальним рівнем зусиль перевершує GPT-5.6 Sol із середнім рівнем зусиль за 1/10 вартості.

Фактологічна точність: Внутрішній тест OpenAI використовує деперсоніфіковані розмови в ChatGPT, у яких користувачі позначали помилки моделей. Sol робить приблизно вдвічі менше помилок, ніж її попередниця. Luna з вищим рівнем зусиль відповідає GPT-5.6 Sol приблизно за 1/100 її вартості.

OpenAI також зберегла стиль комунікації Astra. Очікуйте зрозуміліших і дещо коротших відповідей із меншою кількістю жаргону, особливо в розмовах про програмування.

Кешування промптів для агентів із тривалим виконанням

Агенти повторно надсилають ті самі інструкції, інструменти та історію під час кожного кроку. GPT-6 використовує вдосконалену систему кешування промптів із вищою часткою влучань у кеш за замовчуванням. За читання кешованих вхідних даних надаються знижки до 90%. Тепер відповідні спільні префікси, повторно використані протягом 30-хвилинного вікна, також підпадають під цю умову.

Нові елементи керування для розробників:

  • Панель кешування промптів відстежує частку влучань у кеш із часом.
  • Інструмент діагностики пояснює промахи, наприклад "reason": "tools_changed".
  • Явні точки розриву дають змогу вибирати, де закінчується кешований префікс.
  • Рівень зусиль для міркування можна змінювати посеред розмови за допомогою configuration_update без порушення кешу.
  • allowed_tools обмежує інструменти, які можна викликати, водночас зберігаючи визначення незмінними.
  • Попереднє прогрівання готує відомий контекст до першого запиту користувача.

У повному посібнику з кешування промптів описано кожен підхід. GitHub повідомляє, що ці зміни скоротили частку токенів промптів, які потребують повторної обробки, більш ніж на 50%, допомагаючи Copilot відповідати швидше.

Доступність

  • API: gpt-6-sol і gpt-6-luna.
  • ChatGPT Work і Codex: користувачі Plus, Pro, Business, Enterprise та Edu.
  • Free і Go: Luna у настільному застосунку ChatGPT.
  • Ще недоступні в чаті. Розгортання ChatGPT поступово відбувається протягом дня запуску.

Інтерактивне пояснення

Ключові висновки

  • Sol коштує $2/$10, а Luna — $0.10/$0.50 за 1 млн токенів.
  • Sol із рівнем xhigh перевершує Opus 5 max у AutomationBench, коштуючи 9% від його вартості.
  • Luna набирає 66.6% у DeepSWE v1.1, коштуючи на 93% дешевше за завдання, ніж Opus 5.
  • За читання кешованих вхідних даних надається знижка до 90%, а також доступні нові елементи керування кешем.
  • Обидві моделі доступні в API, ChatGPT Work і Codex; у чаті вони ще недоступні.

Ознайомтеся з технічним блогом. Уся заслуга належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого субреддіту про машинне навчання зі 150 тис.+ учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.

Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини