Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← Към новините

Harvey представя Harvey Tenet: базов модел Kimi K3, допълнително обучен с Fireworks за дългосрочна работа на правни агенти

Harvey представи Harvey Tenet, своя първи модел, обучен допълнително след предварителното обучение, като изследователска предварителна версия от днес. Tenet е базовият модел Kimi K3, допълнително обучен от Fireworks чрез асинхронно обучение с подсилване за правна работа с дълъг хоризонт. Обучаващият корпус комбинира синтетични данни, публично достъпни правни данни и данни от човешки експерти. Harvey заявява, че не са използвани данни на клиенти. В сравнение с базовия модел K3, Tenet изпълнява почти два пъти повече отделени за тестване задачи в Legal Agent Benchmark (LAB) на Harvey и с 20% повече в LAB: Contracts, като повишава процента на пълно преминаване съответно с 9 и 2 процентни пункта. Harvey съобщава за най-добри резултати в LAB: Contracts и второ място в LAB. Подобренията се пренасят, без допълнително обучение, и към APEX Agents на Mercor и Redline Bench на Crosby. Декларираната цел е двойна: изграждане на правна интелигентност от най-високо ниво върху модели с отворени тегла и предоставяне на път на адвокатските кантори да притежават собствени специализирани модели.

Може ли да бъде внедрен?

Все още не, Harvey Tenet е изследователска предварителна версия, обявена на 20 август 2026 г. Harvey не е публикувала тегла, карта на модела или API крайна точка. Базовият модел е с отворени тегла; самият Tenet е собствена контролна точка на Harvey, а компанията заявява, че с времето разработката ще премине „от изследвания към продукция“ в продуктите на Harvey. Това, което се предоставя днес, е рецептата, а не самият артефакт.

  • Ниво на компанията: Само за предприятия. Достъпът се осъществява чрез платформата на Harvey, която се продава на адвокатски кантори, средни кантори и вътрешни правни екипи. Лаборатория с набор от инструменти за обучение с подсилване би могла да възпроизведе метода; обучението е използвало приблизително 150 графични процесора NVIDIA B300 в продължение на два месеца.
  • Индустрии: Правни услуги, вътрешни корпоративни правни отдели, частен капитал и инвестиционно банкиране (дю дилиджънс при сливания и придобивания), както и регулирани сектори, в които обемът на договорите определя разходите — застраховане, финансови услуги, здравеопазване, енергетика.
  • Приложения: Меморандуми за дю дилиджънс при сливания и придобивания върху виртуални хранилища с документи, изготвяне, преглед и редактиране на договори, структурирано извличане на информация от до 10 000 документа и търсене на прецеденти в натрупаните знания на кантората.

Какво показват числата

В сравнение с базовия модел K3, Tenet изпълнява почти два пъти повече отделени за тестване задачи в Legal Agent Benchmark (LAB) на Harvey и с 20% повече в LAB: Contracts, като повишава процента на пълно преминаване съответно с 9 и 2 процентни пункта. Harvey съобщава за най-добри резултати в LAB: Contracts и второ място в LAB, използвайки резултати на базовия модел от Vals.

По-интересният резултат е пренасянето. Tenet също така се подобрява значително в APEX Agents на Mercor (корпоративно право) и Redline Bench на Crosby — нито един от тях не е бил използван по време на обучението — като същевременно запазва представянето си в бенчмаркове за знания, включително LegalBench, CUAD, MAUD и PRBench на Scale. Агентното обучение не е влошило учебникарското правно разсъждение.

Разходите са оптимизирани съвместно, а не намалени за сметка на нещо друго. Отворените тегла понижават цената на токен; оформянето на наградата, което предпочита по-кратки траектории при еднакво качество, намалява използваните токени. Harvey съобщава за значителни подобрения в качеството при стабилни разходи.

Как е обучен

Обучението е използвало асинхронно обучение с подсилване в изолирани правни среди, изградени подобно на задачите в LAB: инструкция в стил на партньор, средно около 50 думи, клиентски казус с ключови и периферни документи и експертна рубрика с атомарни критерии за преминаване/непреминаване — приблизително 50 на задача, а в крайни случаи и стотици. Една отделна реализация може да надхвърли 1000 хода.

Реализациите се оценяват от LLM като съдия; при аблационните изследвания е избран Kimi 2.6. Наградата комбинира дела на изпълнените критерии от рубриката, холистичен брой решени правни въпроси и бонус за пълно преминаване. Политиката се оптимизира с GSPO, използвайки LoRA с ранг 64 върху цялата мрежа K3, осем групи задачи с по осем реализации на оптимизационна стъпка, в приблизително 1750 среди и над 10 000 реализации на епоха. Fireworks съвместно изгради внедряването на обучаващата система и реализациите на ниво ядро, с token-in-token-out и възпроизвеждане на маршрутизатора, за да поддържа голям MoE числено съгласуван по време на обучението и инференцията.

Три способности, обучени отделно

Екипът на Harvey също така е обучил допълнително специализирани модели, към които Tenet може да насочва като към инструменти или подагенти:

  • Дю дилиджънс при сливания и придобивания: В LAB: Diligence една задача може да премине през до 80 млн. токена; нито един базов модел не е изпълнил повече от 43,8% от критериите. С Baseten Harvey премина към система Recursive Language Model, при която коренов агент държи виртуалното хранилище с документи в REPL и делегира на подагенти. Само оркестраторът GLM-5.2 е достигнал 46,1%; след допълнително обучение в тази система чрез самодистилация резултатът е достигнал 60,1%.
  • Review Table: С Applied Compute допълнително обученият GLM-5.2 е подобрил качеството на отговорите с 3,6 пункта, а качеството на цитиране — с 12,1 пункта, при приблизително една десета от разходите на клетка, като е научил да се въздържа от отговор, когато въпросът не е приложим.
  • Знания на кантората: С Engram модел Qwen3.8-27B изучава около 100 млн. токена от клиентски казуси и ги преобразува в 1 млн. токена структурирани знания плюс параметрична памет. Процентът на преминатите критерии се е увеличил с повече от 15%, токените в завършените траектории са намалели с 58%, а разходите на заявка са спаднали с приблизително 90% — 190,8 интелигентност на токен спрямо 129,3 за най-добрата конфигурация от водещите модели.

Факти от независимия тест на Marktechpost

Проверка на реалността

Harvey Tenet — твърденията за бенчмаркове, проверени

Одитирано: изследователската предварителна версия на Harvey, 20 август 2026 г. · и нишката на Harvey в X · Режим: по подразбиране

78Оценка на преувеличението
19Твърдения
1Проверено
10Самодекларирани
6Маркирани
2Непроверими

Нищо, публикувано от Harvey, не беше опровергано. Оценката е висока, защото Tenet не присъства в нито една публична класация — нито в Vals, нито в Artificial Analysis, нито в Mercor. Формула за оценката: (8 × 6 флага) + (15 × 0 опровергани) + (3 × 10 самодекларирани) = 78.

Таблица на твърденията

ТвърдениеЧислоНезависима проверкаПрисъда
Изпълнява около 2 пъти повече отделени за тестване задачи в LAB от базовия Kimi K3 ≈ 2× Не присъства в публична класация Самодекларирано
Повишение на процента на пълно преминаване в LAB +9 т. Същият резултат е представен като „+82%“ в X Флаг F1
Повишение на пълното преминаване в LAB: Contracts +2 т. Не съществува публична класация Самодекларирано
Най-добри резултати в LAB: Contracts SOTA Бенчмаркът е притежаван, провеждан и оценяван от Harvey Флаг F2
Заема второ място в LAB #2 №1 на Vals е Muse Spark 1.1 с 20,00%; провеждан от Harvey, разликата от инструментите никога не е била количествено определена Флаг F3
Базовият Kimi K3 в APEX Agents, корпоративно право 58,8% 58,8% (Kimi K3 Max) — съвпада напълно Проверено
Tenet значително превъзхожда базовия K3 в APEX Agents Само системата на Harvey: 58,8% → 67,5% Флаг F4
Превъзхожда базовия K3 в Redline Bench на Crosby Не е посочено Липсва в публичната класация Самодекларирано
Задача за Big Law Associate в APEX v1 — бенчмарк за знания, а не агентна класация Не е посочено Сляп тест, възложен на Mercor; не е публикуван в публичната класация v1 Самодекларирано
Запазва резултатите си в LegalBench, CUAD, MAUD „силен“ Неканонични показатели, приложени към всички модели Самодекларирано
Трудното подмножество на PRBench 36,0 → 36,8% Harvey го определя като статистически незначимо Самодекларирано
Процент на преминатите критерии в LAB: Diligence 43,8 → 60,1% Няма публична класация Самодекларирано
Разход на клетка в Review Table ≈ 1/10 Базовият модел никога не е назован Флаг F6
Интелигентност на токен в Firm Knowledge 190,8 Публикация на Engram; показателят е собствен на Harvey Самодекларирано
„Първият ни допълнително обучен модел с отворени тегла Business Insider: собствен, вътрешен Флаг F5
„По-малко от една четвърт от разходите за водещите базови модели“ < 25% Само в X; сравнителните модели не са назовани Флаг F7
≈150 графични процесора NVIDIA B300, 2 месеца, GSPO + LoRA с ранг 64 Непроверимо по своята същност Непроверимо
При допълнителното обучение не са използвани данни на клиенти Непроверимо по своята същност Непроверимо

Обяснение на флаговете

F1 · Игра с знаменателяВ блога се съобщава за +9 и +2 процентни пункта. Нишката в X представя същия резултат като +82% и +22%. И двете твърдения са верни; числото в социалната мрежа звучи девет пъти по-голямо.

F2 · Самодеклариране като факт„SOTA в LAB: Contracts“ е победа в собствения бенчмарк на Harvey. Harvey заявява, че няма публична класация за него и че всички резултати са от вътрешни тестове на Harvey. LAB е създаден умишлено без класация.

F3 · Несъответствие в настройкитеHarvey е разкрила това ясно: Tenet е работил в стандартната публична система плюс инструмент за приключване, пренесен от обучението, докато резултатите на конкурентите са от Vals. Флагът се отнася до съпоставимостта, а не до прикриване — Harvey никога не е публикувала LAB с инструмента и без него, така че стойността му не е количествено определена. Собствените данни на Harvey за APEX показват, че промяна в системата премества голия K3 с 8,7 пункта, а твърдението за LAB е за класиране, при което лидерите на Vals са между 12% и 20%.

F4 · Несъответствие в настройкитеВ APEX Agents Tenet е работил във вътрешната bash система на Harvey, докато конкурентите са използвали публикуваните данни на Mercor. Harvey разкрива, че системата повишава резултата на голия K3 от 58,8% на 67,5% — в рамките на 0,1 пункта от лидера Fable 5 с 67,4%, преди каквото и да е обучение.

F5 · Формулировка„С отворени тегла“ описва базовия Kimi K3, а не Tenet. Не са публикувани тегла, карта на модела или API, но множество медии публикуваха заглавия, наричайки самия Tenet модел с отворени тегла.

F6 · Игра с знаменателя„Приблизително една десета от разходите на клетка“ е измерено спрямо неназовани „най-силни базови модели“, без посочени конфигурация за обслужване, точност или хардуер за която и да е от страните.

F7 · Игра с знаменателя„По-малко от една четвърт от разходите за водещите базови модели“ се появява само в X. Сравнителните модели не са назовани, а каталожната цена не е отделена от измереното потребление на токени.

Заслужава признаниеHarvey е възложила на Mercor да проведе сляп тест на APEX v1, без да разкрива на Harvey реализациите, задачите или резултатите на ниво задача — най-силният метод за проверка в публикацията, макар че доказва запазване на знания, а не агентни умения. Harvey също така доброволно е посочила нулев резултат в PRBench, документирала е разминаванията си с Artificial Analysis и Vals и е разкрила ефекта на системата във F4, който подкопава собствената ѝ формулировка за APEX.

Проверка на реалността от Marktechpost · проверено на 2026-08-23Режим по подразбиране: числата само от доставчика се приемат с етикет „самодекларирано“. Оценките се променят; проверете отново, преди да ги цитирате.

Основни изводи

  • Tenet е допълнително обучена контролна точка на Kimi K3, а не публично издание с отворени тегла — няма тегла, няма API.
  • Подобренията се пренасят без допълнително обучение към APEX Agents и Redline Bench, което подсказва научено поведение, а не напасване към бенчмарка.
  • Оформянето на наградата според дължината на траекторията е подобрило едновременно качеството и разходите, вместо да създава компромис между тях.
  • Специализираният набор — RLM за дю дилиджънс, Review Table, памет на кантората — е мястото, където са отчетени най-големите разлики.

Вижте ТЕХНИЧЕСКИТЕ ПОДРОБНОСТИ тук. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия 150k+ ML SubReddit и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? вече можете да се присъедините към нас и в Telegram.

Имате нужда от партньор за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ издание на продукт ИЛИ уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини