Harvey представляє Harvey Tenet: базову модель Kimi K3, донавчену Fireworks для виконання юридичними агентами завдань із довгим горизонтом
Harvey випустила Harvey Tenet, свою першу модель після посттренування, як дослідницький попередній реліз станом на сьогодні. Tenet — це базова модель Kimi K3, післятренована Fireworks за допомогою асинхронного навчання з підкріпленням для довготривалої юридичної роботи. Навчальний корпус поєднував синтетичні дані, загальнодоступні юридичні дані та дані від експертів-людей. Harvey заявляє, що дані клієнтів не використовувалися. Порівняно з базовою моделлю K3, Tenet виконує майже вдвічі більше відкладених завдань у Legal Agent Benchmark (LAB) від Harvey та на 20% більше у LAB: Contracts, підвищуючи показник повного проходження відповідно на 9 і 2 відсоткові пункти. Harvey повідомляє про найкращий у галузі результат у LAB: Contracts і друге місце в LAB. Переваги також перенеслися без додаткового навчання на APEX Agents від Mercor і Redline Bench від Crosby. Заявлена мета подвійна: створити передовий юридичний інтелект на моделях із відкритими вагами та надати юридичним фірмам шлях до володіння власними спеціалізованими моделями.
Чи придатна вона до розгортання?
Ще ні, Harvey Tenet — це дослідницький попередній реліз, оголошений 20 серпня 2026 року. Harvey не опублікувала ваги, картку моделі чи кінцеву точку API. Базова модель має відкриті ваги; сама Tenet є власним чекпойнтом Harvey, а компанія заявляє, що з часом робота перейде «від досліджень до виробництва» у продуктах Harvey. Сьогодні постачається рецепт, а не сам артефакт.
- Рівень компанії: Лише для підприємств. Доступ здійснюється через платформу Harvey, яка продається юридичним фірмам, середнім фірмам і внутрішнім юридичним командам. Лабораторія зі стеком RL могла б відтворити цей метод; для навчання використовували приблизно 150 графічних процесорів NVIDIA B300 протягом двох місяців.
- Галузі: Юридичні послуги, внутрішні юридичні департаменти корпорацій, приватний капітал та інвестиційний банкінг (дью-ділідженс у M&A), а також регульовані сектори, де обсяг контрактів визначає витрати — страхування, фінансові послуги, охорона здоров’я, енергетика.
- Застосування: Меморандуми з дью-ділідженс у M&A на основі кімнат даних, підготовка, перевірка та редагування контрактів, структуроване вилучення даних із до 10 000 документів і пошук прецедентів у накопичених знаннях фірми.
Що кажуть цифри
Порівняно з базовою моделлю K3, Tenet виконує майже вдвічі більше відкладених завдань у Legal Agent Benchmark (LAB) від Harvey та на 20% більше у LAB: Contracts, підвищуючи показник повного проходження відповідно на 9 і 2 відсоткові пункти. Harvey повідомляє про найкращий у галузі результат у LAB: Contracts і друге місце в LAB, використовуючи оцінки базової моделі від Vals.
Цікавішим результатом є перенесення. Tenet також істотно покращує результати на APEX Agents від Mercor (корпоративне право) і Redline Bench від Crosby — жоден із цих тестів не використовувався під час навчання — водночас зберігаючи результати на бенчмарках знань, зокрема LegalBench, CUAD, MAUD і PRBench від Scale. Агентне навчання не погіршило підручникове юридичне міркування.
Витрати оптимізуються спільно, а не приносяться в жертву. Відкриті ваги знижують ціну за токен; формування винагороди, яке надає перевагу коротшим траєкторіям за однакової якості, зменшує кількість спожитих токенів. Harvey повідомляє про значне підвищення якості за стабільної вартості.
Як її навчали
Навчання використовувало асинхронне навчання з підкріпленням у ізольованих середовищах для юридичних завдань, побудованих за зразком LAB: інструкція в стилі партнера, що в середньому містить близько 50 слів, клієнтська справа з ключовими та периферійними документами, а також експертна рубрика з атомарними критеріями проходження/непроходження — приблизно 50 на завдання, а в крайніх випадках — сотні. Один rollout може перевищувати 1 000 ходів.
Rollout-и оцінюються за допомогою LLM як судді; після абляційних досліджень було обрано Kimi 2.6. Винагорода поєднує частку виконаних критеріїв рубрики, цілісний підрахунок розв’язаних юридичних питань і бонус за повне проходження. Політика оптимізується за допомогою GSPO із LoRA рангу 64 над усією мережею K3, вісьмома групами завдань по вісім rollout-ів на крок оптимізатора, приблизно у 1 750 середовищах і з понад 10 000 rollout-ів на епоху. Fireworks спільно розробила тренер і розгортання rollout-ів на рівні ядра, використовуючи підхід token-in-token-out і відтворення маршрутизації, щоб підтримувати числову узгодженість великої MoE під час навчання та інференсу.
Три можливості, навчені окремо
Команда Harvey також післятренувала спеціалізовані моделі, до яких Tenet може звертатися як до інструментів або субагентів:
- Дью-ділідженс у M&A: У LAB: Diligence одне завдання може опрацьовувати до 80 млн токенів; жоден базовий показник не пройшов понад 43,8% критеріїв. Разом із Baseten Harvey перейшла до оболонки Recursive Language Model, де кореневий агент утримує кімнату даних у REPL і делегує завдання субагентам. Сам оркестратор GLM-5.2 досяг 46,1%; після його посттренування в цій оболонці за допомогою самодистиляції результат досяг 60,1%.
- Review Table: Разом із Applied Compute післятренована GLM-5.2 підвищила якість відповідей на 3,6 бала, а якість цитування — на 12,1 бала, при цьому вартість однієї комірки становила приблизно одну десяту від початкової; модель навчилася утримуватися від відповіді, коли запит не застосовується.
- Знання фірми: Разом із Engram модель Qwen3.8-27B вивчає приблизно 100 млн токенів клієнтських справ і перетворює їх на 1 млн токенів структурованих знань плюс параметричну пам’ять. Показник проходження критеріїв зріс більш ніж на 15%, кількість токенів у завершених траєкторіях зменшилася на 58%, а вартість запиту скоротилася приблизно на 90% — 190,8 одиниці інтелекту на токен проти 129,3 для найкращої передової конфігурації.
Факти незалежного тестування Marktechpost
Перевірка реальності
Harvey Tenet — заяви щодо бенчмарків, перевірено
Аудит: дослідницький попередній реліз Harvey, 20 серпня 2026 р. · і тред Harvey в X · Режим: стандартний
Жодна опублікована Harvey інформація не була спростована. Показник високий, оскільки Tenet не присутня в жодній публічній таблиці лідерів — ні в Vals, ні в Artificial Analysis, ні в Mercor. Формула показника: (8 × 6 позначок) + (15 × 0 спростованих) + (3 × 10 самозвітних) = 78.
Таблиця заяв
| Заява | Число | Незалежна перевірка | Вердикт |
|---|---|---|---|
| Виконує приблизно вдвічі більше відкладених завдань LAB, ніж базова Kimi K3 | ≈ 2× | Відсутня в будь-якій публічній таблиці | Самозвіт |
| Зростання показника повного проходження LAB | +9 п. п. | Той самий результат заявлено як «+82%» у X | Позначка F1 |
| Зростання повного проходження LAB: Contracts | +2 п. п. | Публічної таблиці лідерів не існує | Самозвіт |
| Найкращий у галузі результат у LAB: Contracts | SOTA | Бенчмарк належить Harvey, проводиться та оцінюється нею | Позначка F2 |
| Посідає друге місце в LAB | #2 | №1 у Vals — Muse Spark 1.1 із 20,00%; запущено Harvey, різницю від інструментів ніколи не було кількісно оцінено | Позначка F3 |
| Базова Kimi K3 на APEX Agents, корпоративне право | 58,8% | 58,8% (Kimi K3 Max) — точно збігається | Перевірено |
| Tenet істотно випереджає базову K3 на APEX Agents | — | Лише оболонка Harvey: 58,8% → 67,5% | Позначка F4 |
| Випереджає базову K3 на Redline Bench Crosby | Не вказано | Відсутня в публічній таблиці лідерів | Самозвіт |
| APEX v1 Big Law Associate — бенчмарк знань, а не агентна таблиця | Не вказано | Сліпий запуск, замовлений у Mercor; результати не опубліковані в публічній таблиці v1 | Самозвіт |
| Зберігає результати на LegalBench, CUAD, MAUD | «сильний» | Неканонічні метрики, застосовані до всіх моделей | Самозвіт |
| Складна підмножина PRBench | 36,0 → 36,8% | Harvey називає це статистично незначущим | Самозвіт |
| Показник проходження критеріїв LAB: Diligence | 43,8 → 60,1% | Публічної таблиці лідерів немає | Самозвіт |
| Вартість комірки Review Table | ≈ 1/10 | Базову модель ніколи не названо | Позначка F6 |
| Показник інтелекту на токен для Firm Knowledge | 190,8 | Опис Engram; метрика є власною метрикою Harvey | Самозвіт |
| «Наша перша модель із відкритими вагами після посттренування» | — | Business Insider: пропрієтарна, внутрішня | Позначка F5 |
| «Менше чверті вартості провідних базових моделей» | < 25% | Лише X; порівнювані моделі не названо | Позначка F7 |
| Приблизно 150 графічних процесорів NVIDIA B300, 2 місяці, GSPO + LoRA рангу 64 | — | Принципово неперевірювано | Не підлягає перевірці |
| Дані клієнтів не використовувалися під час посттренування | — | Принципово неперевірювано | Не підлягає перевірці |
Пояснення позначок
F1 · Гра зі знаменникомУ блозі повідомляється про +9 і +2 відсоткові пункти. У треді X той самий результат подано як +82% і +22%. Обидва твердження правильні; соціальна цифра звучить у дев’ять разів більшою.
F2 · Самозвіт як факт«SOTA на LAB: Contracts» — це перемога на власному бенчмарку Harvey. Harvey заявляє, що публічної таблиці лідерів для нього немає і всі оцінки є внутрішніми запусками Harvey. LAB навмисно запустили без таблиці лідерів.
F3 · Невідповідність налаштуваньHarvey прямо це розкрила: Tenet працювала у стандартній публічній оболонці плюс інструмент завершення, перенесений із навчання, тоді як результати конкурентів отримано від Vals. Позначка стосується порівнюваності, а не приховування — Harvey ніколи не публікувала LAB із цим інструментом і без нього, тому його цінність не оцінена кількісно. Власні показники Harvey для APEX демонструють, що зміна оболонки підвищує результат базової K3 на 8,7 пункту, а твердження щодо LAB стосується рейтингу, де лідери Vals мають результати від 12% до 20%.
F4 · Невідповідність налаштуваньНа APEX Agents Tenet працювала у внутрішній bash-оболонці Harvey, тоді як конкуренти використовували опубліковані Mercor показники. Harvey розкриває, що оболонка підвищує результат базової K3 з 58,8% до 67,5% — у межах 0,1 пункту від лідера Fable 5 із 67,4%, ще до будь-якого навчання.
F5 · Формулювання«Модель із відкритими вагами» описує базу Kimi K3, а не Tenet. Ваги, картку моделі чи API не опубліковано, проте кілька видань опублікували заголовки, називаючи саму Tenet релізом із відкритими вагами.
F6 · Гра зі знаменником«Приблизно одна десята вартості на комірку» вимірюється порівняно з неназваними «найсильнішими базовими моделями», без зазначення конфігурації обслуговування, точності чи обладнання для жодної зі сторін.
F7 · Гра зі знаменником«Менше чверті вартості провідних базових моделей» з’являється лише в X. Порівнювані моделі не названо, а ціна за прайс-листом не відокремлена від виміряного споживання токенів.
Належне визнанняHarvey попросила Mercor провести сліпе тестування APEX v1, не розкриваючи Harvey запуски, завдання чи оцінки на рівні завдань — це найнадійніший метод перевірки в цій публікації, хоча він засвідчує збереження знань, а не агентну майстерність. Harvey також добровільно повідомила про нульовий результат на PRBench, задокументувала розбіжності з Artificial Analysis і Vals, а також розкрила вплив оболонки у F4, що послаблює її власне формулювання щодо APEX.
Перевірка реальності від Marktechpost · перевірено 2026-08-23Стандартний режим: цифри, надані постачальником, приймаються з позначкою «самозвіт». Показники змінюються; повторно перевіряйте їх перед цитуванням.
Ключові висновки
- Tenet — це чекпойнт Kimi K3 після посттренування, а не публічний реліз моделі з відкритими вагами — немає ні ваг, ні API.
- Переваги без додаткового навчання перенеслися на APEX Agents і Redline Bench, що свідчить про набуту поведінку, а не підгонку під бенчмарки.
- Формування винагороди з урахуванням довжини траєкторії дозволило одночасно покращити якість і вартість, замість компромісу між ними.
- Саме стек спеціалізованих компонентів — дью-ділідженс RLM, Review Table, пам’ять фірми — продемонстрував найбільші зміни.
Ознайомтеся з ТЕХНІЧНИМИ ДЕТАЛЯМИ тут. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого субреддіту про машинне навчання зі 150+ тисячами учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.
Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.