Harvey представя Harvey Tenet: базов модел Kimi K3, допълнително обучен с Fireworks за дългосрочна работа на правни агенти
Harvey представи Harvey Tenet, своя първи модел, обучен допълнително след предварителното обучение, като изследователска предварителна версия от днес. Tenet е базовият модел Kimi K3, допълнително обучен от Fireworks чрез асинхронно обучение с подсилване за правна работа с дълъг хоризонт. Обучаващият корпус комбинира синтетични данни, публично достъпни правни данни и данни от човешки експерти. Harvey заявява, че не са използвани данни на клиенти. В сравнение с базовия модел K3, Tenet изпълнява почти два пъти повече отделени за тестване задачи в Legal Agent Benchmark (LAB) на Harvey и с 20% повече в LAB: Contracts, като повишава процента на пълно преминаване съответно с 9 и 2 процентни пункта. Harvey съобщава за най-добри резултати в LAB: Contracts и второ място в LAB. Подобренията се пренасят, без допълнително обучение, и към APEX Agents на Mercor и Redline Bench на Crosby. Декларираната цел е двойна: изграждане на правна интелигентност от най-високо ниво върху модели с отворени тегла и предоставяне на път на адвокатските кантори да притежават собствени специализирани модели.
Може ли да бъде внедрен?
Все още не, Harvey Tenet е изследователска предварителна версия, обявена на 20 август 2026 г. Harvey не е публикувала тегла, карта на модела или API крайна точка. Базовият модел е с отворени тегла; самият Tenet е собствена контролна точка на Harvey, а компанията заявява, че с времето разработката ще премине „от изследвания към продукция“ в продуктите на Harvey. Това, което се предоставя днес, е рецептата, а не самият артефакт.
- Ниво на компанията: Само за предприятия. Достъпът се осъществява чрез платформата на Harvey, която се продава на адвокатски кантори, средни кантори и вътрешни правни екипи. Лаборатория с набор от инструменти за обучение с подсилване би могла да възпроизведе метода; обучението е използвало приблизително 150 графични процесора NVIDIA B300 в продължение на два месеца.
- Индустрии: Правни услуги, вътрешни корпоративни правни отдели, частен капитал и инвестиционно банкиране (дю дилиджънс при сливания и придобивания), както и регулирани сектори, в които обемът на договорите определя разходите — застраховане, финансови услуги, здравеопазване, енергетика.
- Приложения: Меморандуми за дю дилиджънс при сливания и придобивания върху виртуални хранилища с документи, изготвяне, преглед и редактиране на договори, структурирано извличане на информация от до 10 000 документа и търсене на прецеденти в натрупаните знания на кантората.
Какво показват числата
В сравнение с базовия модел K3, Tenet изпълнява почти два пъти повече отделени за тестване задачи в Legal Agent Benchmark (LAB) на Harvey и с 20% повече в LAB: Contracts, като повишава процента на пълно преминаване съответно с 9 и 2 процентни пункта. Harvey съобщава за най-добри резултати в LAB: Contracts и второ място в LAB, използвайки резултати на базовия модел от Vals.
По-интересният резултат е пренасянето. Tenet също така се подобрява значително в APEX Agents на Mercor (корпоративно право) и Redline Bench на Crosby — нито един от тях не е бил използван по време на обучението — като същевременно запазва представянето си в бенчмаркове за знания, включително LegalBench, CUAD, MAUD и PRBench на Scale. Агентното обучение не е влошило учебникарското правно разсъждение.
Разходите са оптимизирани съвместно, а не намалени за сметка на нещо друго. Отворените тегла понижават цената на токен; оформянето на наградата, което предпочита по-кратки траектории при еднакво качество, намалява използваните токени. Harvey съобщава за значителни подобрения в качеството при стабилни разходи.
Как е обучен
Обучението е използвало асинхронно обучение с подсилване в изолирани правни среди, изградени подобно на задачите в LAB: инструкция в стил на партньор, средно около 50 думи, клиентски казус с ключови и периферни документи и експертна рубрика с атомарни критерии за преминаване/непреминаване — приблизително 50 на задача, а в крайни случаи и стотици. Една отделна реализация може да надхвърли 1000 хода.
Реализациите се оценяват от LLM като съдия; при аблационните изследвания е избран Kimi 2.6. Наградата комбинира дела на изпълнените критерии от рубриката, холистичен брой решени правни въпроси и бонус за пълно преминаване. Политиката се оптимизира с GSPO, използвайки LoRA с ранг 64 върху цялата мрежа K3, осем групи задачи с по осем реализации на оптимизационна стъпка, в приблизително 1750 среди и над 10 000 реализации на епоха. Fireworks съвместно изгради внедряването на обучаващата система и реализациите на ниво ядро, с token-in-token-out и възпроизвеждане на маршрутизатора, за да поддържа голям MoE числено съгласуван по време на обучението и инференцията.
Три способности, обучени отделно
Екипът на Harvey също така е обучил допълнително специализирани модели, към които Tenet може да насочва като към инструменти или подагенти:
- Дю дилиджънс при сливания и придобивания: В LAB: Diligence една задача може да премине през до 80 млн. токена; нито един базов модел не е изпълнил повече от 43,8% от критериите. С Baseten Harvey премина към система Recursive Language Model, при която коренов агент държи виртуалното хранилище с документи в REPL и делегира на подагенти. Само оркестраторът GLM-5.2 е достигнал 46,1%; след допълнително обучение в тази система чрез самодистилация резултатът е достигнал 60,1%.
- Review Table: С Applied Compute допълнително обученият GLM-5.2 е подобрил качеството на отговорите с 3,6 пункта, а качеството на цитиране — с 12,1 пункта, при приблизително една десета от разходите на клетка, като е научил да се въздържа от отговор, когато въпросът не е приложим.
- Знания на кантората: С Engram модел Qwen3.8-27B изучава около 100 млн. токена от клиентски казуси и ги преобразува в 1 млн. токена структурирани знания плюс параметрична памет. Процентът на преминатите критерии се е увеличил с повече от 15%, токените в завършените траектории са намалели с 58%, а разходите на заявка са спаднали с приблизително 90% — 190,8 интелигентност на токен спрямо 129,3 за най-добрата конфигурация от водещите модели.
Факти от независимия тест на Marktechpost
Проверка на реалността
Harvey Tenet — твърденията за бенчмаркове, проверени
Одитирано: изследователската предварителна версия на Harvey, 20 август 2026 г. · и нишката на Harvey в X · Режим: по подразбиране
Нищо, публикувано от Harvey, не беше опровергано. Оценката е висока, защото Tenet не присъства в нито една публична класация — нито в Vals, нито в Artificial Analysis, нито в Mercor. Формула за оценката: (8 × 6 флага) + (15 × 0 опровергани) + (3 × 10 самодекларирани) = 78.
Таблица на твърденията
| Твърдение | Число | Независима проверка | Присъда |
|---|---|---|---|
| Изпълнява около 2 пъти повече отделени за тестване задачи в LAB от базовия Kimi K3 | ≈ 2× | Не присъства в публична класация | Самодекларирано |
| Повишение на процента на пълно преминаване в LAB | +9 т. | Същият резултат е представен като „+82%“ в X | Флаг F1 |
| Повишение на пълното преминаване в LAB: Contracts | +2 т. | Не съществува публична класация | Самодекларирано |
| Най-добри резултати в LAB: Contracts | SOTA | Бенчмаркът е притежаван, провеждан и оценяван от Harvey | Флаг F2 |
| Заема второ място в LAB | #2 | №1 на Vals е Muse Spark 1.1 с 20,00%; провеждан от Harvey, разликата от инструментите никога не е била количествено определена | Флаг F3 |
| Базовият Kimi K3 в APEX Agents, корпоративно право | 58,8% | 58,8% (Kimi K3 Max) — съвпада напълно | Проверено |
| Tenet значително превъзхожда базовия K3 в APEX Agents | — | Само системата на Harvey: 58,8% → 67,5% | Флаг F4 |
| Превъзхожда базовия K3 в Redline Bench на Crosby | Не е посочено | Липсва в публичната класация | Самодекларирано |
| Задача за Big Law Associate в APEX v1 — бенчмарк за знания, а не агентна класация | Не е посочено | Сляп тест, възложен на Mercor; не е публикуван в публичната класация v1 | Самодекларирано |
| Запазва резултатите си в LegalBench, CUAD, MAUD | „силен“ | Неканонични показатели, приложени към всички модели | Самодекларирано |
| Трудното подмножество на PRBench | 36,0 → 36,8% | Harvey го определя като статистически незначимо | Самодекларирано |
| Процент на преминатите критерии в LAB: Diligence | 43,8 → 60,1% | Няма публична класация | Самодекларирано |
| Разход на клетка в Review Table | ≈ 1/10 | Базовият модел никога не е назован | Флаг F6 |
| Интелигентност на токен в Firm Knowledge | 190,8 | Публикация на Engram; показателят е собствен на Harvey | Самодекларирано |
| „Първият ни допълнително обучен модел с отворени тегла“ | — | Business Insider: собствен, вътрешен | Флаг F5 |
| „По-малко от една четвърт от разходите за водещите базови модели“ | < 25% | Само в X; сравнителните модели не са назовани | Флаг F7 |
| ≈150 графични процесора NVIDIA B300, 2 месеца, GSPO + LoRA с ранг 64 | — | Непроверимо по своята същност | Непроверимо |
| При допълнителното обучение не са използвани данни на клиенти | — | Непроверимо по своята същност | Непроверимо |
Обяснение на флаговете
F1 · Игра с знаменателяВ блога се съобщава за +9 и +2 процентни пункта. Нишката в X представя същия резултат като +82% и +22%. И двете твърдения са верни; числото в социалната мрежа звучи девет пъти по-голямо.
F2 · Самодеклариране като факт„SOTA в LAB: Contracts“ е победа в собствения бенчмарк на Harvey. Harvey заявява, че няма публична класация за него и че всички резултати са от вътрешни тестове на Harvey. LAB е създаден умишлено без класация.
F3 · Несъответствие в настройкитеHarvey е разкрила това ясно: Tenet е работил в стандартната публична система плюс инструмент за приключване, пренесен от обучението, докато резултатите на конкурентите са от Vals. Флагът се отнася до съпоставимостта, а не до прикриване — Harvey никога не е публикувала LAB с инструмента и без него, така че стойността му не е количествено определена. Собствените данни на Harvey за APEX показват, че промяна в системата премества голия K3 с 8,7 пункта, а твърдението за LAB е за класиране, при което лидерите на Vals са между 12% и 20%.
F4 · Несъответствие в настройкитеВ APEX Agents Tenet е работил във вътрешната bash система на Harvey, докато конкурентите са използвали публикуваните данни на Mercor. Harvey разкрива, че системата повишава резултата на голия K3 от 58,8% на 67,5% — в рамките на 0,1 пункта от лидера Fable 5 с 67,4%, преди каквото и да е обучение.
F5 · Формулировка„С отворени тегла“ описва базовия Kimi K3, а не Tenet. Не са публикувани тегла, карта на модела или API, но множество медии публикуваха заглавия, наричайки самия Tenet модел с отворени тегла.
F6 · Игра с знаменателя„Приблизително една десета от разходите на клетка“ е измерено спрямо неназовани „най-силни базови модели“, без посочени конфигурация за обслужване, точност или хардуер за която и да е от страните.
F7 · Игра с знаменателя„По-малко от една четвърт от разходите за водещите базови модели“ се появява само в X. Сравнителните модели не са назовани, а каталожната цена не е отделена от измереното потребление на токени.
Заслужава признаниеHarvey е възложила на Mercor да проведе сляп тест на APEX v1, без да разкрива на Harvey реализациите, задачите или резултатите на ниво задача — най-силният метод за проверка в публикацията, макар че доказва запазване на знания, а не агентни умения. Harvey също така доброволно е посочила нулев резултат в PRBench, документирала е разминаванията си с Artificial Analysis и Vals и е разкрила ефекта на системата във F4, който подкопава собствената ѝ формулировка за APEX.
Проверка на реалността от Marktechpost · проверено на 2026-08-23Режим по подразбиране: числата само от доставчика се приемат с етикет „самодекларирано“. Оценките се променят; проверете отново, преди да ги цитирате.
Основни изводи
- Tenet е допълнително обучена контролна точка на Kimi K3, а не публично издание с отворени тегла — няма тегла, няма API.
- Подобренията се пренасят без допълнително обучение към APEX Agents и Redline Bench, което подсказва научено поведение, а не напасване към бенчмарка.
- Оформянето на наградата според дължината на траекторията е подобрило едновременно качеството и разходите, вместо да създава компромис между тях.
- Специализираният набор — RLM за дю дилиджънс, Review Table, памет на кантората — е мястото, където са отчетени най-големите разлики.
Вижте ТЕХНИЧЕСКИТЕ ПОДРОБНОСТИ тук. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия 150k+ ML SubReddit и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? вече можете да се присъедините към нас и в Telegram.
Имате нужда от партньор за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ издание на продукт ИЛИ уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.