Sakhanda Wire
NVDA $237.17 +2.73% MSFT $517.69 +0.95% GOOGL $344.54 +1.86% META $733.79 +1.08% AMZN $252.72 +1.81%

MarkTechPost

208 новостей · все источники

MarkTechPost

DeepSeek AI выпустила DeepSeek Harness в предварительной версии для разработчиков: лицензированная по MIT оболочка для агентов, где всё — плагин

DeepSeek Harness v0.1 — лицензированная по MIT оболочка для агентов, где каждая возможность реализована как плагин Cordis. Четыре режима выполнения, журналы сессий только для добавления и маршрутизация моделей, не зависящая от провайдера.

MarkTechPost

Дообучение LLM с вызовом инструментов: полное руководство с XYZ-Aquila-SFT и Qwen3

Реализуйте сквозной конвейер дообучения языковых моделей с вызовом инструментов. В руководстве рассматриваются разбор траекторий, структурированное извлечение вызовов инструментов, формирование представления в совместимом с Qwen формате ChatML и эффективная адаптация LoRA с использованием PyTorch.

MarkTechPost

Z.ai выпустила GLM-5.3 без переобучения базовой модели: лучше справляется со сложным программированием и задачами с длинным горизонтом

Z.ai выпустила GLM-5.3 14 августа 2026 года. Модель повторно использует неизменённую базовую модель GLM-5.2 на 743 млрд параметров. Весь заявленный прирост обеспечен масштабированным постобучением: большим числом сред для задач с длинным горизонтом, большим числом типов сред и более длительным обучением. Результат в Terminal-Bench 3.0 вырос с 4,6 до 28,3, а DeepSWE…

MarkTechPost

Знакомьтесь: Needle 2 — открытая модель с 45 млн параметров для вызова инструментов, поставляемая в виде бинарного файла размером 14 МБ и запускающая полноценную сессию в 28 МБ ОЗУ

Cactus Compute выпустила Needle 2 — открытую модель с 45 млн параметров для вызова инструментов, работы с устройствами и структурированного извлечения данных. Полная модель представляет собой единый бинарный файл размером 14 МБ и запускает сессию примерно в 28 МБ ОЗУ. Она лидирует в обоих сплитах Seal-Tools, при этом…

MarkTechPost

Создание LLM, ориентированной на рассуждения: практическое руководство по потоковой загрузке, отбору и дообучению корпуса рассуждений SupraLabs

В этом руководстве представлен полный рабочий процесс создания компактной языковой модели, ориентированной на рассуждения. Загружая корпус рассуждений SupraLabs с Hugging Face в потоковом режиме, мы применяем фильтры качества и отбираем данные для контролируемого дообучения (SFT). Используя SmolLM2-135M-Instruct и LoRA, мы демонстрируем…

MarkTechPost

Google AI только что выпустила Gemini 3.7 Flash: модель для программирования и агентов по цене $0,75 за 1 млн входных токенов

Google выпустила Gemini 3.7 Flash — усовершенствованную версию Gemini 3.6 Flash с алгоритмическими улучшениями ядра рассуждений. Модель работает с текстом, изображениями, аудио и видео в контекстном окне на 1 млн токенов и поддерживает вывод до 64 тыс. токенов, а также настраиваемые конфигурации мышления. Программирование…

MarkTechPost

Liquid AI выпустила LFM2.5-VL-3B: визуально-языковую модель на 3 млрд параметров, которая читает экраны, локализует объекты и вызывает инструменты на устройстве

Liquid AI выпустила LFM2.5-VL-3B — визуально-языковую модель с 3,1 млрд параметров, предназначенную для работы на устройствах. В среднем она набирает 80,7 балла в ScreenSpot-v2 и повышает результат локализации объектов в RefCOCO с 57,1 до 87,9. Вызов функций впервые появился в линейке VL, а результат в ToolSandbox вырос с 26,4 до 59,5…

MarkTechPost

Dyna Robotics представила Dyna-2: модель действий в мире, предварительно обученную на 1 млн часов видео от первого лица

Dyna Robotics выпустила Dyna-2 — модель действий в мире, предварительно обученную более чем на миллион часов эгоцентрического видео людей. В техническом отчёте установлены три результата: закон масштабирования на человеческих данных до 1 млн часов, первый перенос этого закона…

MarkTechPost

SpaceXAI выпустила Grok 4.6: передовую модель с контекстом 500K, оптимизированную для длительно работающих агентов, кодинга и интеллектуальной работы

SpaceXAI выпустила Grok 4.6 12 августа 2026 года — это посттренировочное обновление Grok 4.5, а не более крупная базовая модель. Она сравнялась с GPT-5.6 Sol Max, набрав 61 балл в Artificial Analysis Intelligence Index, получила контекст 500K и новый режим xhigh…

MarkTechPost

Постобучение Tulu 3 с AllenAI Open Instruct с использованием SFT, DPO, RLVR, GRPO и оценки на основе верификатора

Создайте собственый конвейер постобучения LLM с использованием фреймворка Open Instruct от AllenAI. Это подробное руководство посвящено контролируемой тонкой настройке (SFT), прямой оптимизации предпочтений (DPO) и обучению с подкреплением на основе проверяемых вознаграждений (GRPO), оптимизированному для эффективной работы на оборудовании с 16 ГБ без необходимости в ресурсоёмком…

MarkTechPost

NVIDIA AI выпустила Nemotron 3.5 Lightning: открытую MoE-модель на 30 млрд параметров с 3 млрд активных параметров и NeMo Switchyard Model Router

Открытая 30-миллиардная MoE-модель NVIDIA ориентирована на уровень выполнения задач агентами, а Switchyard направляет каждый шаг к самой дешёвой подходящей модели.

MarkTechPost

MiLM Plus от Xiaomi представляет PROVE: метрики удаления объектов RC-S и RC-T, согласованные с восприятием, и реалистичный видеобенчмарк

Модели удаления объектов развивались быстрее, чем метрики, используемые для их оценки. Диффузионные инструменты удаления теперь убедительно восстанавливают тени, отражения и закрытую структуру, однако PSNR, SSIM, LPIPS, ReMOVE и CFD часто неправильно ранжируют их результаты. Корень проблемы…