Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%

MarkTechPost

208 новостей · все источники

MarkTechPost

Исследователь из Princeton предлагает Recurrent Looped Transformer (RLT), переносящий состояние декодера через каждый токен и фиксирующий 96 блоков на токен при неограниченной временной глубине

В техническом отчёте Yifan Zhang о Recurrent Looped Transformer (RLT) предлагается каузальный энкодер в паре с рекуррентным декодером, который переносит своё финальное скрытое состояние и послойный кэш внимания со скользящим окном через каждый токен промпта и ответа, без сброса при обслуживании…

MarkTechPost

AWS представляет Pizza Bot: open source-инбокс для фоновых ИИ-агентов

Pizza Bot — это open source-инбокс с самостоятельным хостингом для ИИ-агентов, созданный на базе DeepAgents и LangGraph. Он объединяет постоянное состояние задач, интеграции MCP, настраиваемые подтверждения и планируемые рабочие процессы у нескольких провайдеров моделей.

MarkTechPost

Контекстная инженерия внутри оболочки: 4 механизма, которые предотвращают переполнение контекста и потерю цели в задачах с длинным горизонтом

Поверхностный агент — это LLM, вызывающая инструменты в цикле, и в длинных задачах он терпит неудачу по 2 причинам: переполнение контекста и потеря цели. В этой статье раскрывается слой оболочки, который устраняет обе проблемы, с фактическими порогами, внедрёнными…

MarkTechPost

Реализация рабочих процессов машинного обучения с NVIDIA cuML, RAPIDS, бенчмаркингом GPU, объяснимостью, кластеризацией и инференсом моделей

Это практическое руководство демонстрирует, как создавать и ускорять рабочие процессы машинного обучения с помощью NVIDIA cuML и RAPIDS. В нём рассматриваются настройка среды GPU, ускорение scikit-learn без написания кода с помощью cuml.accel, бенчмаркинг производительности ключевых алгоритмов машинного обучения, manifold learning с UMAP и HDBSCAN, древовидные модели…

MarkTechPost

Cognition представила SWE-2: дообученную на базе Kimi K3 модель для написания кода, сравняющуюся с Fable 5.1 в FrontierCode при стоимости на 64% ниже

Cognition, компания, создавшая кодирующего агента Devin, представила SWE-2 — свою наиболее мощную на сегодняшний день модель для написания кода. SWE-2 дообучена с помощью обучения с подкреплением на базе Kimi K3 — открытой модели Moonshot AI с 2,8 трлн параметров. Cognition сообщает о результате 50,0% в FrontierCode…

MarkTechPost

Языковая модель мухи (FLM) встраивает полный коннектом плодовой мушки в замороженную LLM на 1,2 млрд параметров, а собственные контрольные эксперименты показывают, что такая схема не помогает

Языковая модель мухи (FLM) подаёт токенные эмбеддинги на все 166 700 сохранённых нейронов и 25,6 млн связей коннектома плодовой мушки MaleCNS, а затем добавляет небольшую обучаемую поправку к замороженной базовой модели LFM2.5-1.2B-Instruct. Обучаются лишь 278 528 параметров. Прилагаемый…

MarkTechPost

Могут ли LLM проектировать собственный агентский х harness? HarnessDev от ByteDance Seed показывает: обобщаются лишь 34 из 64 изменений

ByteDance Seed, SUTD, Georgia Tech, M-A-P и TokenWave.AI представили HarnessDev — бенчмарк, который оценивает работоспособный х harness, созданный моделью, а не выдаваемый ею ответ. Начиная с основы с результатом 0, 6 LLM-моделей-создателей строят х harness-ы в 5…

MarkTechPost

Anthropic добавила оценки плагинов в Claude Code: 6 типов оценивания, базовый вариант без плагина и CI-проверка для навыков

Anthropic опубликовала новый рабочий процесс оценки плагинов для Claude Code. Команда claude plugin eval запускает плагин с реалистичными запросами, оценивает результат, созданный Claude, и сравнивает его с запуском, в котором плагин не загружен. Она…

MarkTechPost

Cohere выпустила North Small Translate: модель перевода MoE на 218 млрд параметров, набирающая 83,6 на WMT26 для 50 языков

Cohere выпустила North Small Translate — модель с открытыми весами и архитектурой Mixture-of-Experts, предназначенную для машинного перевода на 50 языков. Она использует 25 млрд из 218 млрд параметров на токен и набирает 83,6 балла в оценке Cohere по WMT26. Веса можно бесплатно использовать в некоммерческих целях, при этом…

MarkTechPost

Sakana AI запускает Fugu Max и Fugu Ultra v2 для более дешёвой и мощной оркестрации мультиагентных систем

Sakana AI выпустила Fugu Max и Fugu Ultra v2 — две модели, построенные на одной и той же обученной архитектуре оркестрации. Fugu Max направляет задачи к компактным открытым и специализированным моделям, включая NVIDIA Nemotron, по цене $2/$6 за 1 млн токенов. Fugu Ultra v2…

MarkTechPost

Google Research представила ToolGrad: фреймворк с подходом «сначала ответ» достигает показателя прохождения 99,8% при генерации данных для использования инструментов

Google Research представила ToolGrad — фреймворк из ACL 2026 Findings, инвертирующий генерацию наборов данных для использования инструментов: сначала он строит проверенную цепочку API, а затем пишет соответствующий запрос пользователя. Руководствуясь текстовыми «градиентами» в цикле из 4 модулей — предложить–выполнить–выбрать–обновить, ToolGrad достигает…

MarkTechPost

Знакомьтесь: Redis LangCache — управляемый семантический кэш, который сокращает расходы на LLM API до 90% и возвращает попадания из кэша до 15 раз быстрее

Рабочие LLM-приложения редко получают вопрос, который никто не задавал раньше. Ассистенты поддержки и RAG-конвейеры обрабатывают одни и те же намерения тысячи раз в день, каждый раз в разных формулировках, а большинство стеков рассматривает каждую формулировку как новый, полностью оплачиваемый запрос.…