Cloudflare випустила Clef і Clef-flash: моделі ухвалення рішень із відкритими вагами, що повертають типізовані ймовірності замість тексту
Cloudflare випустила Clef і Clef-flash — перші моделі, навчені її командою Workers AI. Це моделі прийняття рішень, а не чат-боти. Кожна з них зчитує вхідний стан і схему типізованих запитань. Вона повертає ймовірність для кожної дозволеної відповіді без довільного тексту. Обидві моделі мають відкриті ваги за ліцензією Apache 2.0 і сумісні з API Jev від TypeSafe AI.
Чи можна їх розгортати? Так, обидві моделі вже працюють у Workers AI, а ваги доступні на Hugging Face для самостійного розгортання.
Що робить модель прийняття рішень
LLM генерує токени один за одним, і її вихід усе ще потребує парсингу. Модель прийняття рішень відповідає лише на фіксований набір запитань щодо вхідних даних. Clef підтримує 3 типи запитань:
noul: так/ні, повертає ймовірність відповіді «так».choice: обирає 1 іменований варіант із ймовірностями для кожного варіанта та значенням упевненості.score: оцінює відповідно до впорядкованої шкали, повертаючи оцінку, зважену за ймовірностями.
У Workers AI 1 запит містить до 64 запитань і до 4 зображень.
TypeSafe AI запустила Jev, свою першу модель «System One», 15 вересня 2026 року. Згодом з’явилися відкриті альтернативи, як-от Kev-9B і Laya. Clef використовує той самий API System One. Перехід із Jev означає зміну кінцевої точки та назви моделі.
Як працює Clef
Clef донавчено на основі Qwen3.8-27B, а Clef-flash — на основі Qwen3.5-9B. Обидві моделі зберігають енкодер зору базової моделі.
Інференс має 2 етапи. Спочатку базова модель виконує один прохід лише з попереднім заповненням за станом і запитаннями. Потім невеликий трансформер — спільна голова схеми — зчитує фінальні приховані стани. Він спрямовує докази до кожного запитання, дає полям змогу взаємодіяти через механізм cross-attention і спільно оцінює всі варіанти. Softmax для кожного запитання перетворює логіти на ймовірності.
Під час навчання обидві базові моделі були заморожені, а голова маршрутизації спільно оптимізувалася за допомогою низькорангових адаптерів рангу 256. Функція втрат поєднує перехресну ентропію зі згладжуванням міток і втрати Бр’єра для калібрування. Вторинна ціль — навчання з підкріпленням для каліброваних рішень (RLCD) — надає часткові бали сусіднім порядковим варіантам.
Інтерактивне пояснення
Бенчмарки: де Clef перемагає, а де — ні
У короткому списку Cloudflare з 10 бенчмарків із набору Decision Index 0.2.1 модель Clef показала найкращий результат у 7.
- BANKING77 (macro-F1): Clef — 94.20 проти 79.74 у Jev.
- CLINC150+OOS (macro-F1): Clef — 97.43 проти 89.27 у Jev.
- Побутова техніка (точний збіг випадку): Clef-flash — 97.73 проти 52.27 у Jev.
В інших випадках Jev має явну перевагу. У повній картці моделі зазначено, що Jev випереджає Clef у GPQA Diamond (78.3 проти 48.0). Він також лідирує в MMLU-Pro (82.7 проти 65.9) і BBH (92.9 проти 73.7).
У власних оцінюваннях робочих процесів TypeSafe Clef випередила Jev у 3 із 4 напрямів, хоча й із невеликою перевагою. Обробка рахунків-фактур — 64.7 проти 61.8, обслуговування клієнтів — 76.3 проти 76.0, а інциденти безпеки — 62.9 проти 61.7. Jev лідирує в спостережуваності трас агентів: 71.6 проти 68.5.
У робочому процесі Cloudflare для аналізу кіберзагроз Clef класифікувала домен за 2,2 секунди. gpt-oss-120b знадобилося 4,7 секунди.
Усі числа надані постачальниками; незалежного відтворення результатів поки не проводили.
Порівняння характеристик
| Характеристика | Clef | Clef-flash | Jev | Kev-9B | Laya |
|---|---|---|---|---|---|
| Розробник | Cloudflare | Cloudflare | TypeSafe AI | Jared Palmer | Convai Innovations |
| Розмір | 27B | 9B | Не розкрито | 9B + 45.4M LoRA | 421M |
| Базова модель | Qwen3.8-27B | Qwen3.5-9B | Не розкрито | Qwen3.5-9B-Base | ModernBERT-large |
| Ваги | Apache 2.0 | Apache 2.0 | Розміщений API | Apache 2.0 | Apache 2.0 |
| Вхідні зображення | Так | Так | Ні | Ні | Ні |
| Контекст | 65,536 | 65,536 | 32K (за даними Cloudflare) | 65,536 (перевірено 8,192) | 512 (англійська) |
| Медіанна затримка* | 209.3 мс | 38.8 мс | 524.1 мс | 51.4 мс | 5.8 мс |
| Ціна розміщення (вхідні дані) | $0.24/M | $0.09/M | $0.042/M | Самостійне розгортання | Самостійне розгортання |
*Внутрішній прогін Cloudflare у Decision Index. Усі 5 реалізують API System One. Джерела: документація Clef, документація Clef-flash, картка Clef, публікація про Jev, картка Kev-9B, картка Laya.
Розгортання та донавчання
Обидві моделі можна викликати через прив’язку Workers AI (env.AI.run()), REST API або AI Gateway. Для самостійного розгортання в картках моделей зазначено тестування на одному H200 із вагами BF16.
Cloudflare також оголосила про сервіс навчання з підкріпленням для налаштування Clef на приватних даних. Спочатку він буде доступний інженерам Cloudflare, які працюють безпосередньо з клієнтами, а згодом з’явиться платформа самообслуговування. Конвеєр поєднує AI Gateway, Workers AI, Containers і новий компонент Trainer. Команди можуть подати заявку через форму для партнерів із розробки.
Ключові висновки
- Clef (27B) і Clef-flash (9B) — це моделі прийняття рішень за ліцензією Apache 2.0, сумісні з Jev.
- Медіанна затримка: 209,3 мс для Clef, 38,8 мс для Clef-flash і 524,1 мс для Jev.
- Clef зчитує текст, JSON, зображення та відео в межах контекстного вікна на 64K токенів.
- Jev і надалі лідирує в тестах, орієнтованих на знання, як-от GPQA Diamond, MMLU-Pro і BBH.
- Сервіс RL-донавчання запускається спочатку для інженерів Cloudflare, які працюють безпосередньо з клієнтами.
Перегляньте ваги моделі, демо і технічні деталі. Уся подяка належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого субреддіту про машинне навчання зі 150 тис.+ учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.
Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.