Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← К новостям

Harvey представляет Harvey Tenet: базовую модель Kimi K3, дообученную Fireworks для выполнения юридическими агентами задач с длинным горизонтом

Harvey выпустила Harvey Tenet, свою первую модель с постобучением, в формате предварительной исследовательской версии по состоянию на сегодняшний день. Tenet — это базовая модель Kimi K3, прошедшая постобучение с помощью Fireworks посредством асинхронного обучения с подкреплением для выполнения юридической работы с длинным горизонтом планирования. Обучающий корпус объединял синтетические данные, общедоступные юридические данные и данные от экспертов-людей. Harvey заявляет, что данные клиентов не использовались. По сравнению с базовой моделью K3 Tenet выполняет почти вдвое больше отложенных задач в Legal Agent Benchmark (LAB) Harvey и на 20% больше задач в LAB: Contracts, повышая долю полностью пройденных задач соответственно на 9 и 2 процентных пункта. Harvey сообщает о лучшем в отрасли результате на LAB: Contracts и втором месте на LAB. Полученные улучшения также переносились без дополнительного обучения на APEX Agents Mercor и Redline Bench Crosby. Заявленная цель двояка: создать передовой юридический интеллект на моделях с открытыми весами и дать юридическим фирмам возможность владеть собственными специализированными моделями.

Можно ли её развернуть?

Пока нет: Harvey Tenet — это предварительная исследовательская версия, о которой было объявлено 20 августа 2026 года. Harvey не опубликовала веса, карточку модели или API-эндпоинт. Базовая модель имеет открытые веса; сама Tenet — это собственный чекпойнт Harvey, и компания заявляет, что со временем работа перейдёт «от исследований к производству» внутри продуктов Harvey. Сегодня публикуется рецепт, а не сам артефакт.

  • Уровень компаний: Только предприятия. Доступ осуществляется через платформу Harvey, которая продаётся юридическим фирмам, фирмам среднего размера и внутренним юридическим командам. Лаборатория со стеком RL могла бы воспроизвести этот метод; для обучения использовалось около 150 графических процессоров NVIDIA B300 на протяжении двух месяцев.
  • Отрасли: Юридические услуги, внутренние юридические подразделения компаний, прямые инвестиции и инвестиционный банкинг (проверка сделок M&A), а также регулируемые отрасли, где объём договоров определяет затраты — страхование, финансовые услуги, здравоохранение, энергетика.
  • Применения: Меморандумы по проверке сделок M&A на основе виртуальных комнат данных, составление, проверка и редактирование договоров, структурированное извлечение данных из до 10 000 документов и поиск прецедентов в накопленных знаниях фирмы.

Что показывают цифры

По сравнению с базовой моделью K3 Tenet выполняет почти вдвое больше отложенных задач в Legal Agent Benchmark (LAB) Harvey и на 20% больше задач в LAB: Contracts, повышая долю полностью пройденных задач соответственно на 9 и 2 процентных пункта. Harvey сообщает о лучшем в отрасли результате на LAB: Contracts и втором месте на LAB, используя оценки базовой модели от Vals.

Более интересным результатом является переносимость. Tenet также существенно улучшает показатели на APEX Agents Mercor (корпоративное право) и Redline Bench Crosby — ни один из этих тестов не использовался во время обучения, — сохраняя показатели на тестах знаний, включая LegalBench, CUAD, MAUD и PRBench от Scale. Агентное обучение не ухудшило базовые юридические рассуждения.

Затраты были оптимизированы одновременно с другими показателями, а не принесены в жертву. Открытые веса снижают цену токена; формирование награды, отдающее предпочтение более коротким траекториям при одинаковом качестве, уменьшает потребление токенов. Harvey сообщает о значительном повышении качества при стабильных затратах.

Как проходило обучение

Обучение проводилось с использованием асинхронного обучения с подкреплением в изолированных юридических средах, построенных по аналогии с задачами LAB: инструкция в стиле задания партнёра длиной в среднем около 50 слов, клиентское дело с ключевыми и второстепенными документами и экспертная шкала оценки с атомарными критериями «пройдено/не пройдено» — примерно 50 на задачу, а в крайних случаях несколько сотен. Один проход может превышать 1 000 ходов.

Проходы оцениваются по принципу LLM-as-a-judge; в результате абляционных исследований была выбрана Kimi 2.6. Награда объединяет долю выполненных критериев шкалы, целостный подсчёт решённых юридических вопросов и бонус за полное прохождение. Политика оптимизируется с помощью GSPO с использованием LoRA ранга 64 поверх всей сети K3, восьми групп задач по восемь проходов на шаг оптимизатора, примерно в 1 750 средах и более чем 10 000 проходов за эпоху. Fireworks совместно разработала развёртывания тренера и проходов на уровне ядер, используя схему token-in-token-out и воспроизведение работы маршрутизатора, чтобы сохранять численное соответствие большой MoE-модели во время обучения и вывода.

Три способности, обучавшиеся отдельно

Команда Harvey также провела постобучение специализированных моделей, к которым Tenet может обращаться как к инструментам или субагентам:

  • Проверка сделок M&A: В LAB: Diligence одна задача может обрабатывать до 80 млн токенов; ни один базовый вариант не выполнил более 43,8% критериев. Совместно с Baseten Harvey перешла к оболочке Recursive Language Model, в которой корневой агент хранит комнату данных в REPL и делегирует задачи субагентам. Один лишь оркестратор GLM-5.2 достиг 46,1%; после постобучения в этой оболочке с помощью самодистилляции показатель достиг 60,1%.
  • Review Table: Вместе с Applied Compute постобученная GLM-5.2 повысила качество ответов на 3,6 пункта, а качество цитирования — на 12,1 пункта при примерно в десять раз меньшей стоимости одной ячейки; модель научилась воздерживаться от ответа, когда вопрос неприменим.
  • Знания фирмы: Вместе с Engram модель Qwen3.8-27B изучает около 100 млн токенов клиентских дел, преобразуя их в 1 млн токенов структурированных знаний, а также в параметрическую память. Доля пройденных критериев выросла более чем на 15%, число токенов в завершённых траекториях снизилось на 58%, а стоимость запроса уменьшилась примерно на 90% — 190,8 единицы интеллекта на токен против 129,3 у лучшей передовой конфигурации.

Факты независимой проверки Marktechpost

Проверка реальности

Harvey Tenet — заявленные результаты тестов проверены

Аудит: исследовательская версия Harvey, 20 августа 2026 года · и тред Harvey в X · Режим: по умолчанию

78Оценка преувеличения
19Заявлений
1Подтверждено
10Сообщено самой компанией
6Отмечено
2Невозможно проверить

Ничто из опубликованного Harvey не было опровергнуто. Оценка высока, поскольку Tenet отсутствует во всех публичных таблицах лидеров — не у Vals, не у Artificial Analysis, не у Mercor. Формула оценки: (8 × 6 отметок) + (15 × 0 опровержений) + (3 × 10 заявлений самой компании) = 78.

Таблица заявлений

ЗаявлениеЧислоНезависимая проверкаВердикт
Выполняет примерно в 2 раза больше отложенных задач LAB, чем базовая Kimi K3 ≈ 2× Отсутствует в любых публичных таблицах Сообщено самой компанией
Рост доли полностью пройденных задач LAB +9 п.п. Тот же результат заявлен как «+82%» в X Отметка F1
Рост доли полностью пройденных задач LAB: Contracts +2 п.п. Публичной таблицы лидеров не существует Сообщено самой компанией
Лучший результат на LAB: Contracts SOTA Тест принадлежит Harvey, проводится и оценивается Harvey Отметка F2
Второе место на LAB #2 Первое место у Vals — Muse Spark 1.1 с результатом 20,00%; тест Harvey, разница в инструментах никогда не измерялась Отметка F3
Базовая Kimi K3 на APEX Agents, корпоративное право 58,8% 58,8% (Kimi K3 Max) — точное совпадение Подтверждено
Tenet существенно превосходит базовую K3 на APEX Agents Только оболочка Harvey: 58,8% → 67,5% Отметка F4
Превосходит базовую K3 на Redline Bench Crosby Не указано Отсутствует в публичной таблице лидеров Сообщено самой компанией
APEX v1 Big Law Associate — тест знаний, а не агентная таблица Не указано Слепой запуск, заказанный у Mercor; результаты не опубликованы в публичной таблице v1 Сообщено самой компанией
Сохраняет показатели на LegalBench, CUAD, MAUD «сильный» Неканонические метрики, применённые ко всем моделям Сообщено самой компанией
Сложная подвыборка PRBench 36,0 → 36,8% Harvey называет результат статистически незначимым Сообщено самой компанией
Доля пройденных критериев на LAB: Diligence 43,8 → 60,1% Публичной таблицы лидеров нет Сообщено самой компанией
Стоимость одной ячейки в Review Table ≈ 1/10 Базовая модель не названа Отметка F6
Показатель «интеллект на токен» для Firm Knowledge 190,8 Материал Engram; метрика принадлежит Harvey Сообщено самой компанией
«Наша первая постобученная модель с открытыми весами» Business Insider: проприетарная, внутренняя Отметка F5
«Менее четверти стоимости ведущих базовых моделей» < 25% Только X; сопоставляемые модели не названы Отметка F7
≈150 графических процессоров NVIDIA B300, 2 месяца, GSPO + LoRA ранга 64 Невозможно проверить по самой природе утверждения Не поддаётся проверке
Данные клиентов не использовались в постобучении Невозможно проверить по самой природе утверждения Не поддаётся проверке

Объяснение отметок

F1 · Игра со знаменателемВ блоге сообщается о +9 и +2 процентных пунктах. В треде в X тот же результат представлен как +82% и +22%. Оба утверждения верны; число из социальных сетей звучит в девять раз больше.

F2 · Выдача собственного отчёта за факт«Лучший результат на LAB: Contracts» — это победа в собственной тестовой системе Harvey. Harvey заявляет, что публичной таблицы лидеров для неё нет и все оценки являются внутренними запусками Harvey. LAB изначально была запущена намеренно без таблицы лидеров.

F3 · Несовпадение настроекHarvey открыто сообщила об этом: Tenet работала в стандартной публичной оболочке плюс инструмент завершения, перенесённый из обучения, тогда как результаты конкурентов были получены от Vals. Отметка касается сопоставимости, а не сокрытия информации — Harvey никогда не публиковала LAB с инструментом и без него, поэтому его влияние не измерено. Собственные цифры Harvey по APEX показывают, что изменение оболочки повышает результат базовой K3 на 8,7 пункта, а заявление о LAB касается ранга, при этом лидеры Vals находятся между 12% и 20%.

F4 · Несовпадение настроекНа APEX Agents Tenet работала во внутренней bash-оболочке Harvey, тогда как конкуренты использовали опубликованные показатели Mercor. Harvey раскрывает, что её оболочка повышает результат базовой K3 с 58,8% до 67,5% — в пределах 0,1 пункта от лидера Fable 5 с результатом 67,4%, ещё до какого-либо обучения.

F5 · Формулировка«С открытыми весами» описывает базовую Kimi K3, а не Tenet. Веса, карточка модели и API не опубликованы, однако несколько изданий выпустили заголовки, называя саму Tenet моделью с открытыми весами.

F6 · Игра со знаменателем«Примерно одна десятая стоимости на ячейку» измерена относительно неназванных «сильнейших базовых моделей», при этом для обеих сторон не указаны конфигурация сервинга, точность или оборудование.

F7 · Игра со знаменателем«Менее четверти стоимости ведущих базовых моделей» появляется только в X. Сопоставляемые модели не названы, а цена из прайс-листа не отделена от измеренного потребления токенов.

Должное признаниеHarvey попросила Mercor провести слепое тестирование APEX v1, не раскрывая Harvey информацию о запусках, задачах или оценках на уровне отдельных задач — это самый надёжный метод проверки в публикации, хотя он свидетельствует о сохранении знаний, а не об агентных навыках. Harvey также добровольно сообщила об отсутствии результата на PRBench, задокументировала расхождения с Artificial Analysis и Vals и раскрыла влияние оболочки в F4, которое ослабляет собственную формулировку Harvey о результатах на APEX.

Проверка реальности от Marktechpost · подтверждено 23.08.2026Режим по умолчанию: цифры, предоставленные компанией, принимаются с пометкой «сообщено самой компанией». Оценки меняются; перепроверяйте их перед цитированием.

Основные выводы

  • Tenet — это чекпойнт Kimi K3 с постобучением, а не публичный релиз модели с открытыми весами — нет ни весов, ни API.
  • Улучшения без дополнительного обучения перенеслись на APEX Agents и Redline Bench, что указывает на выученное поведение, а не подгонку под тесты.
  • Формирование награды с учётом длины траектории позволило одновременно улучшить качество и снизить затраты, а не обменивать одно на другое.
  • Именно стек специализированных решений — RLM для проверки сделок, Review Table и память фирмы — обеспечил наибольшие улучшения.

Ознакомьтесь с ТЕХНИЧЕСКИМИ ПОДРОБНОСТЯМИ здесь. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь к нам можно присоединиться и в Telegram.

Хотите сотрудничать с нами для продвижения вашего репозитория GitHub, страницы на Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости