Sakhanda Wire
NVDA $233.95 +1.34% MSFT $517.53 +0.92% GOOGL $343.50 +1.56% META $728.08 +0.30% AMZN $251.52 +1.33%

Последние новости

Более старые новости

TechCrunch

Передовые лаборатории ИИ по-прежнему не говорят, как сдерживали бы вышедшую из-под контроля модель

Новое исследование показало, что у ведущих лабораторий ИИ почти нет публично задокументированных планов по сдерживанию вышедших из-под контроля моделей, что вызывает вопросы об их готовности, поскольку системы ИИ всё чаще демонстрируют неожиданное и потенциально опасное поведение.

MarkTechPost

Курс Decoding AI с открытым исходным кодом описывает три способа запуска цикла агента и экономику провайдеров каждого из них

Большинство команд считают главным решением выбор модели. Однако литература по harness-инжинирингу постоянно указывает на другое. В эксперименте LangChain с Terminal-Bench изменение только harness — при использовании одной и той же модели — подняло кодирующего агента примерно с 30-го места в топ-5. Этот результат…

The Decoder

Исследование объясняет, почему ИИ-агентам помогают «навыки» и когда они дают сбой

Исследование ученых из Принстонского университета и Калифорнийского университета в Сан-Диего показывает, что так называемые навыки делают ИИ-агентов лучше главным образом благодаря структурированным рабочим процессам, а не дополнительным знаниям. Но по мере роста библиотеки навыков агентам становится все труднее…

The Decoder

Netflix тестирует языковую модель как альтернативу логике рекомендаций, созданной вручную

Netflix сравнила свою многолетнюю систему рекомендаций с разработанной внутри компании языковой моделью GenRec и заявила, что получила лучшие результаты. Вместо того чтобы полагаться на тысячи созданных вручную признаков, GenRec преобразует поведение пользователей при просмотре в обычный текст. Сама Netflix называет ее «ранней…

The Decoder

Психометрические методы выявили серьезные недостатки тестирования безопасности ИИ

Исследователи из британского Института безопасности ИИ использовали психометрические методы, чтобы показать, что популярные бенчмарки безопасности языковых моделей не измеряют единую устойчивую характеристику. Сплошная блокировка запросов может искусственно завысить показатель безопасности, даже когда модель становится менее…

MarkTechPost

Лучшие GPU-неооблака 2026 года: CoreWeave, Nebius, Lambda, Crusoe и Groq — рейтинг по опубликованным ценам и законтрактованным мощностям

Пять крупнейших GPU-неооблаков теперь работают по совершенно разным моделям. CoreWeave и Nebius отчитываются перед SEC; Lambda и Crusoe — частные компании, движущиеся к IPO; Groq превратилась в облако для инференса после лицензирования своей технологии LPU…

TechCrunch

Opus 4.6 от Anthropic — машина для порнографии

Anthropic запрещает своим моделям Claude генерировать откровенно сексуальный контент. Но серия тестов, проведённых TechCrunch, показала, что для обхода этого ограничения много не требуется.

MarkTechPost

Создание агентных конвейеров для интеллектуальной работы с документами: научные иллюстрации с AutoFigure

В этом руководстве рассматривается AutoFigure — практический набор инструментов для создания профессиональных научных иллюстраций непосредственно по текстовым описаниям и исследовательским статьям. Мы покажем, как настроить среду, сконфигурировать рабочий процесс генерации через API и преобразовать сложные конвейеры интеллектуальной работы с документами в диаграммы в стиле научных публикаций,…

The Verge

Более 1 млн человек нажали кнопку LinkedIn «Похоже на ИИ-шлак»

LinkedIn действительно объявила о кнопке «Похоже на ИИ-шлак» 30 июля, и компания сообщает, что ею уже воспользовалось много людей. Согласно публикации главного директора по продукту Хари Шринивасана в четверг, «более миллиона человек»…

MarkTechPost

Anthropic переносит Claude Mythos 5 в Claude Security: корпоративные команды получают передовое сканирование уязвимостей без прямого доступа к модели

Anthropic перенесла свою наиболее мощную модель для кибербезопасности в продукт, который команды по безопасности могут самостоятельно включить. Сканирование в Claude Security теперь выполняется на Claude Mythos 5, доступной в публичной бета-версии клиентам Claude Enterprise без отдельного дополнения для модели. Сканирование подключается…