Sakhanda Wire
NVDA $223.96 +2.27% MSFT $499.99 +0.03% GOOGL $354.30 -0.96% META $592.10 +0.37% AMZN $274.48 +0.82%
← К новостям

Pokee AI выпустила Pokee-Isaac 28B: агентную модель с контекстом в 10 млн токенов для работы внутри контура заказчика

Агенты с длинным горизонтом накапливают контекст быстрее, чем решают задачи. Каждый результат работы инструмента, наблюдение и промежуточный шаг рассуждения остаются в окне, а две наиболее важные возможности — удерживать этот контекст и сохранять связность на всём его протяжении — до сих пор почти исключительно предоставлялись облачными эндпоинтами. Это исключает регулируемые отрасли, учреждения государственного сектора и приложения на устройствах, где данные вообще не могут покидать заданный периметр. Pokee AI выпустила Pokee-Isaac 28B — базовую текстовую модель с 28 млрд параметров и контекстным окном на 10 млн токенов, предназначенную для работы внутри такого периметра. Исследовательская команда Pokee заявляет о результате 93,3% в RULER на 10 млн токенов, паритете с наиболее мощными оптимизированными по стоимости облачными базовыми моделями на агентских бенчмарках и профиле обслуживания, рассчитанном на один GPU.

Можно ли её развернуть

Да — но по лицензии, а не как модель с открытыми весами. Pokee AI предоставляет Isaac через API для разработчиков, совместимый с OpenAI, и лицензирует её для развертывания внутри VPC, локально или на устройстве. В анонсе запуска заявлена поддержка vLLM и SGLang с первого дня, а также обслуживание на одном GPU, начиная с RTX 4090 или эквивалентного решения. Исследовательская команда публикует измерения только с одного GPU класса B200, поэтому утверждение о потребительских GPU следует воспринимать как рекомендацию поставщика, а не как опубликованный результат.

  • Уровень компании: Это подходит организациям, которые уже владеют собственным стеком инференса, — командам среднего размера и крупным предприятиям с платформенной группой, а также производителям устройств. Специалисту-одиночке без локального оборудования следует использовать размещённый API; аргумент в пользу периметра имеет смысл только при наличии самого периметра.
  • Отрасли: здравоохранение и страховые компании, финансовые услуги и страхование, оборонный и государственный сектор, юриспруденция и электронное раскрытие доказательств, а также фармацевтические и полупроводниковые исследования и разработки. Общая черта здесь — правило, согласно которому данные не могут пересекать границу внешнего API, а не просто предпочтение конфиденциальности.
  • Приложения: проверка кода во всём репозитории, анализ многолетних контрактов и страховых требований, расследование инцидентов по полным архивам журналов и длительно работающие инструментальные агенты, которым никогда не требуется обобщение или сокращение контекста. В исследовательской статье этот второй момент сформулирован явно: когда внутри периметра доступно достаточно пригодного для использования контекста, иерархии памяти и сжатие становятся опциональными, а не обязательными.

Результаты работы с длинным контекстом

В RULER Isaac удерживает результат выше 93,3% на каждой проверенной длине, достигая 93,3% на 10 млн токенов. GPT-5.6 Luna и Gemini 3.5 Flash Lite идут наравне с ним до 512K, а затем сталкиваются с переполнением контекста на 1M.

В MRCR v2 с 8 иголками Isaac получает 0,607, 0,743 и 0,500 на 256K, 512K и 1M соответственно. Его преимущество над Gemini увеличивается с 0,133 до 0,295 в ходе этого диапазона испытаний.

Результаты в агентских задачах и безопасности

Isaac лидирует в BFCL v4 с результатом 70,94 против 70,61 у Luna. В отчёте это называется паритетом, а не лидерством, что является корректной интерпретацией. В τ³-bench его средний результат по четырём доменам составляет 0,662, что выше 0,631 у Gemini; при этом в банковском домене у всех результат составляет 0,186, что отражает сложность задачи. В MCP-Atlas он занимает третье место с покрытием 74,59%, но использует 9,10 хода на задачу против 14,99 у Gemini. В Terminal-Bench 2.1 он решает 56 из 86 совместимых с текстом задач (65,1%), уступая Luna с результатом 60. Это единственный бенчмарк, где облачная базовая модель одерживает победу, и в отчёте это прямо указано.

В ходе red-team-тестирования по методике DTAP Isaac показывает самые низкие показатели успешности прямых (36,0), косвенных (35,2) и совокупных (35,6) атак при 82,5% успешных добросовестных задач. Есть одно отличие: базовые модели работали в стандартном раннере, а Isaac — в оболочке Pokee.

Эффективность, стоимость и переносимость

При рабочей нагрузке RULER на одном GPU класса B200 время до первого токена составляет 23,6 с на 1M и 72,9 с на 10M. Пропускная способность префилла растёт вместе с контекстом — с 42 400 до 137 200 токенов/с, поэтому увеличение длины запроса в десять раз приводит примерно к троекратному росту времени до первого токена. Стоимость по прайс-листу составляет $0,15/$1,00 за миллион входных/выходных токенов и обозначена как предварительная. Isaac также полностью работает на устройствах Intel Arc Pro B70 и Core Ultra Series 3 (Panther Lake), а также на Qualcomm Snapdragon X2 Elite.

Ключевые выводы

  • Pokee-Isaac 28B набирает 93,3% в RULER на 10 млн токенов; все базовые модели в представленной группе показывают 0,0 после 2 млн.
  • Скорость префилла достигает 137 200 токенов/с при контексте 10 млн на одном B200; скорость декодирования остаётся практически неизменной — около 335 токенов/с.
  • Модель лидирует в BFCL v4 (70,94) и τ³-bench (средний результат 0,662), занимает второе место в Terminal-Bench 2.1 и третье — в MCP-Atlas.
  • Самый низкий совокупный показатель успешности атак в DTAP (35,6) при сохранении 82,5% успешности добросовестных задач.
  • Веса не опубликованы; развертывание по лицензии возможно в VPC, локально или на устройстве.

Ознакомьтесь с блогом и статьёй. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Стоп! Вы есть в Telegram? теперь вы можете присоединиться к нам и в Telegram.

Хотите сотрудничать с нами для продвижения вашего репозитория GitHub, страницы Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

Ещё новости

Все последние новости