Harvey представляет Harvey Tenet: базовую модель Kimi K3, дообученную Fireworks для выполнения юридическими агентами задач с длинным горизонтом
Harvey выпустила Harvey Tenet, свою первую модель с постобучением, в формате предварительной исследовательской версии по состоянию на сегодняшний день. Tenet — это базовая модель Kimi K3, прошедшая постобучение с помощью Fireworks посредством асинхронного обучения с подкреплением для выполнения юридической работы с длинным горизонтом планирования. Обучающий корпус объединял синтетические данные, общедоступные юридические данные и данные от экспертов-людей. Harvey заявляет, что данные клиентов не использовались. По сравнению с базовой моделью K3 Tenet выполняет почти вдвое больше отложенных задач в Legal Agent Benchmark (LAB) Harvey и на 20% больше задач в LAB: Contracts, повышая долю полностью пройденных задач соответственно на 9 и 2 процентных пункта. Harvey сообщает о лучшем в отрасли результате на LAB: Contracts и втором месте на LAB. Полученные улучшения также переносились без дополнительного обучения на APEX Agents Mercor и Redline Bench Crosby. Заявленная цель двояка: создать передовой юридический интеллект на моделях с открытыми весами и дать юридическим фирмам возможность владеть собственными специализированными моделями.
Можно ли её развернуть?
Пока нет: Harvey Tenet — это предварительная исследовательская версия, о которой было объявлено 20 августа 2026 года. Harvey не опубликовала веса, карточку модели или API-эндпоинт. Базовая модель имеет открытые веса; сама Tenet — это собственный чекпойнт Harvey, и компания заявляет, что со временем работа перейдёт «от исследований к производству» внутри продуктов Harvey. Сегодня публикуется рецепт, а не сам артефакт.
- Уровень компаний: Только предприятия. Доступ осуществляется через платформу Harvey, которая продаётся юридическим фирмам, фирмам среднего размера и внутренним юридическим командам. Лаборатория со стеком RL могла бы воспроизвести этот метод; для обучения использовалось около 150 графических процессоров NVIDIA B300 на протяжении двух месяцев.
- Отрасли: Юридические услуги, внутренние юридические подразделения компаний, прямые инвестиции и инвестиционный банкинг (проверка сделок M&A), а также регулируемые отрасли, где объём договоров определяет затраты — страхование, финансовые услуги, здравоохранение, энергетика.
- Применения: Меморандумы по проверке сделок M&A на основе виртуальных комнат данных, составление, проверка и редактирование договоров, структурированное извлечение данных из до 10 000 документов и поиск прецедентов в накопленных знаниях фирмы.
Что показывают цифры
По сравнению с базовой моделью K3 Tenet выполняет почти вдвое больше отложенных задач в Legal Agent Benchmark (LAB) Harvey и на 20% больше задач в LAB: Contracts, повышая долю полностью пройденных задач соответственно на 9 и 2 процентных пункта. Harvey сообщает о лучшем в отрасли результате на LAB: Contracts и втором месте на LAB, используя оценки базовой модели от Vals.
Более интересным результатом является переносимость. Tenet также существенно улучшает показатели на APEX Agents Mercor (корпоративное право) и Redline Bench Crosby — ни один из этих тестов не использовался во время обучения, — сохраняя показатели на тестах знаний, включая LegalBench, CUAD, MAUD и PRBench от Scale. Агентное обучение не ухудшило базовые юридические рассуждения.
Затраты были оптимизированы одновременно с другими показателями, а не принесены в жертву. Открытые веса снижают цену токена; формирование награды, отдающее предпочтение более коротким траекториям при одинаковом качестве, уменьшает потребление токенов. Harvey сообщает о значительном повышении качества при стабильных затратах.
Как проходило обучение
Обучение проводилось с использованием асинхронного обучения с подкреплением в изолированных юридических средах, построенных по аналогии с задачами LAB: инструкция в стиле задания партнёра длиной в среднем около 50 слов, клиентское дело с ключевыми и второстепенными документами и экспертная шкала оценки с атомарными критериями «пройдено/не пройдено» — примерно 50 на задачу, а в крайних случаях несколько сотен. Один проход может превышать 1 000 ходов.
Проходы оцениваются по принципу LLM-as-a-judge; в результате абляционных исследований была выбрана Kimi 2.6. Награда объединяет долю выполненных критериев шкалы, целостный подсчёт решённых юридических вопросов и бонус за полное прохождение. Политика оптимизируется с помощью GSPO с использованием LoRA ранга 64 поверх всей сети K3, восьми групп задач по восемь проходов на шаг оптимизатора, примерно в 1 750 средах и более чем 10 000 проходов за эпоху. Fireworks совместно разработала развёртывания тренера и проходов на уровне ядер, используя схему token-in-token-out и воспроизведение работы маршрутизатора, чтобы сохранять численное соответствие большой MoE-модели во время обучения и вывода.
Три способности, обучавшиеся отдельно
Команда Harvey также провела постобучение специализированных моделей, к которым Tenet может обращаться как к инструментам или субагентам:
- Проверка сделок M&A: В LAB: Diligence одна задача может обрабатывать до 80 млн токенов; ни один базовый вариант не выполнил более 43,8% критериев. Совместно с Baseten Harvey перешла к оболочке Recursive Language Model, в которой корневой агент хранит комнату данных в REPL и делегирует задачи субагентам. Один лишь оркестратор GLM-5.2 достиг 46,1%; после постобучения в этой оболочке с помощью самодистилляции показатель достиг 60,1%.
- Review Table: Вместе с Applied Compute постобученная GLM-5.2 повысила качество ответов на 3,6 пункта, а качество цитирования — на 12,1 пункта при примерно в десять раз меньшей стоимости одной ячейки; модель научилась воздерживаться от ответа, когда вопрос неприменим.
- Знания фирмы: Вместе с Engram модель Qwen3.8-27B изучает около 100 млн токенов клиентских дел, преобразуя их в 1 млн токенов структурированных знаний, а также в параметрическую память. Доля пройденных критериев выросла более чем на 15%, число токенов в завершённых траекториях снизилось на 58%, а стоимость запроса уменьшилась примерно на 90% — 190,8 единицы интеллекта на токен против 129,3 у лучшей передовой конфигурации.
Факты независимой проверки Marktechpost
Проверка реальности
Harvey Tenet — заявленные результаты тестов проверены
Аудит: исследовательская версия Harvey, 20 августа 2026 года · и тред Harvey в X · Режим: по умолчанию
Ничто из опубликованного Harvey не было опровергнуто. Оценка высока, поскольку Tenet отсутствует во всех публичных таблицах лидеров — не у Vals, не у Artificial Analysis, не у Mercor. Формула оценки: (8 × 6 отметок) + (15 × 0 опровержений) + (3 × 10 заявлений самой компании) = 78.
Таблица заявлений
| Заявление | Число | Независимая проверка | Вердикт |
|---|---|---|---|
| Выполняет примерно в 2 раза больше отложенных задач LAB, чем базовая Kimi K3 | ≈ 2× | Отсутствует в любых публичных таблицах | Сообщено самой компанией |
| Рост доли полностью пройденных задач LAB | +9 п.п. | Тот же результат заявлен как «+82%» в X | Отметка F1 |
| Рост доли полностью пройденных задач LAB: Contracts | +2 п.п. | Публичной таблицы лидеров не существует | Сообщено самой компанией |
| Лучший результат на LAB: Contracts | SOTA | Тест принадлежит Harvey, проводится и оценивается Harvey | Отметка F2 |
| Второе место на LAB | #2 | Первое место у Vals — Muse Spark 1.1 с результатом 20,00%; тест Harvey, разница в инструментах никогда не измерялась | Отметка F3 |
| Базовая Kimi K3 на APEX Agents, корпоративное право | 58,8% | 58,8% (Kimi K3 Max) — точное совпадение | Подтверждено |
| Tenet существенно превосходит базовую K3 на APEX Agents | — | Только оболочка Harvey: 58,8% → 67,5% | Отметка F4 |
| Превосходит базовую K3 на Redline Bench Crosby | Не указано | Отсутствует в публичной таблице лидеров | Сообщено самой компанией |
| APEX v1 Big Law Associate — тест знаний, а не агентная таблица | Не указано | Слепой запуск, заказанный у Mercor; результаты не опубликованы в публичной таблице v1 | Сообщено самой компанией |
| Сохраняет показатели на LegalBench, CUAD, MAUD | «сильный» | Неканонические метрики, применённые ко всем моделям | Сообщено самой компанией |
| Сложная подвыборка PRBench | 36,0 → 36,8% | Harvey называет результат статистически незначимым | Сообщено самой компанией |
| Доля пройденных критериев на LAB: Diligence | 43,8 → 60,1% | Публичной таблицы лидеров нет | Сообщено самой компанией |
| Стоимость одной ячейки в Review Table | ≈ 1/10 | Базовая модель не названа | Отметка F6 |
| Показатель «интеллект на токен» для Firm Knowledge | 190,8 | Материал Engram; метрика принадлежит Harvey | Сообщено самой компанией |
| «Наша первая постобученная модель с открытыми весами» | — | Business Insider: проприетарная, внутренняя | Отметка F5 |
| «Менее четверти стоимости ведущих базовых моделей» | < 25% | Только X; сопоставляемые модели не названы | Отметка F7 |
| ≈150 графических процессоров NVIDIA B300, 2 месяца, GSPO + LoRA ранга 64 | — | Невозможно проверить по самой природе утверждения | Не поддаётся проверке |
| Данные клиентов не использовались в постобучении | — | Невозможно проверить по самой природе утверждения | Не поддаётся проверке |
Объяснение отметок
F1 · Игра со знаменателемВ блоге сообщается о +9 и +2 процентных пунктах. В треде в X тот же результат представлен как +82% и +22%. Оба утверждения верны; число из социальных сетей звучит в девять раз больше.
F2 · Выдача собственного отчёта за факт«Лучший результат на LAB: Contracts» — это победа в собственной тестовой системе Harvey. Harvey заявляет, что публичной таблицы лидеров для неё нет и все оценки являются внутренними запусками Harvey. LAB изначально была запущена намеренно без таблицы лидеров.
F3 · Несовпадение настроекHarvey открыто сообщила об этом: Tenet работала в стандартной публичной оболочке плюс инструмент завершения, перенесённый из обучения, тогда как результаты конкурентов были получены от Vals. Отметка касается сопоставимости, а не сокрытия информации — Harvey никогда не публиковала LAB с инструментом и без него, поэтому его влияние не измерено. Собственные цифры Harvey по APEX показывают, что изменение оболочки повышает результат базовой K3 на 8,7 пункта, а заявление о LAB касается ранга, при этом лидеры Vals находятся между 12% и 20%.
F4 · Несовпадение настроекНа APEX Agents Tenet работала во внутренней bash-оболочке Harvey, тогда как конкуренты использовали опубликованные показатели Mercor. Harvey раскрывает, что её оболочка повышает результат базовой K3 с 58,8% до 67,5% — в пределах 0,1 пункта от лидера Fable 5 с результатом 67,4%, ещё до какого-либо обучения.
F5 · Формулировка«С открытыми весами» описывает базовую Kimi K3, а не Tenet. Веса, карточка модели и API не опубликованы, однако несколько изданий выпустили заголовки, называя саму Tenet моделью с открытыми весами.
F6 · Игра со знаменателем«Примерно одна десятая стоимости на ячейку» измерена относительно неназванных «сильнейших базовых моделей», при этом для обеих сторон не указаны конфигурация сервинга, точность или оборудование.
F7 · Игра со знаменателем«Менее четверти стоимости ведущих базовых моделей» появляется только в X. Сопоставляемые модели не названы, а цена из прайс-листа не отделена от измеренного потребления токенов.
Должное признаниеHarvey попросила Mercor провести слепое тестирование APEX v1, не раскрывая Harvey информацию о запусках, задачах или оценках на уровне отдельных задач — это самый надёжный метод проверки в публикации, хотя он свидетельствует о сохранении знаний, а не об агентных навыках. Harvey также добровольно сообщила об отсутствии результата на PRBench, задокументировала расхождения с Artificial Analysis и Vals и раскрыла влияние оболочки в F4, которое ослабляет собственную формулировку Harvey о результатах на APEX.
Проверка реальности от Marktechpost · подтверждено 23.08.2026Режим по умолчанию: цифры, предоставленные компанией, принимаются с пометкой «сообщено самой компанией». Оценки меняются; перепроверяйте их перед цитированием.
Основные выводы
- Tenet — это чекпойнт Kimi K3 с постобучением, а не публичный релиз модели с открытыми весами — нет ни весов, ни API.
- Улучшения без дополнительного обучения перенеслись на APEX Agents и Redline Bench, что указывает на выученное поведение, а не подгонку под тесты.
- Формирование награды с учётом длины траектории позволило одновременно улучшить качество и снизить затраты, а не обменивать одно на другое.
- Именно стек специализированных решений — RLM для проверки сделок, Review Table и память фирмы — обеспечил наибольшие улучшения.
Ознакомьтесь с ТЕХНИЧЕСКИМИ ПОДРОБНОСТЯМИ здесь. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь к нам можно присоединиться и в Telegram.
Хотите сотрудничать с нами для продвижения вашего репозитория GitHub, страницы на Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.