Sakhanda Wire
NVDA $235.51 +2.01% MSFT $514.05 +0.24% GOOGL $343.55 +1.57% META $729.77 +0.53% AMZN $250.78 +1.03%
← Към новините

Отваряме изходния код на AstaBrief, бързия модел за генериране на отчети в Asta

Отваряне на кода на AstaBrief, бързия модел за генериране на доклади в Asta
За предприятия Статия
Публикувана 2 октомври 2026 г.
🤗 Модел | 📊 Данни

AstaBrief — генериране на научни доклади

Езиковите модели вече могат да помагат на изследователите да търсят литература, да синтезират доказателства и да работят по сложни въпроси. Но научната работа поставя специфични изисквания към тези модели — отговорите трябва да останат основани на доказателства, моделите трябва да запазват това, което доказателствата действително подкрепят, вместо незабелязано да разширяват заключенията на дадено изследване, а изследователите трябва да могат да проверяват крайните резултати.

Виждаме това по начина, по който учените използват Asta, нашата агентна платформа за научна работа. Вместо прости търсения по ключови думи, потребителите често предоставят съществен контекст и множество ограничения — например молят Asta да сравни подходи в даден корпус от литература, като вземе предвид конкретен метод, популация или среда. Много от тях се връщат към генерираните доклади по-късно, като ги приемат за работни изследователски артефакти, а не за еднократни отговори.

Искахме да помогнем на учените да генерират цитирани доклади по-бързо с модел, който могат да изтеглят и стартират сами. За тази цел проверихме дали малък отворен модел, обучен специално за генериране на научни доклади, може да постигне качеството на докладите на патентованите модели, които използвахме, като същевременно намали времето за генериране и разходите за обслужване.

Създадохме AstaBrief 8B — модел, който превръща изследователски въпрос и извлечени откъси от литературата в цитиран доклад. Днес AstaBrief е наличен в Asta в функцията „Генериране на доклад“ като Бърз режим наред с режим „Мислене“, задвижван от Claude, а също така отваряме кода му и публикуваме обучаващите данни, за да могат други да изучават, възпроизвеждат и надграждат нашия подход.

Разработването на AstaBrief изискваше десетки хиляди реални изследователски заявки, филтриране с фокус върху цитиранията, данни за предпочитания и преработен конвейер за генериране на доклади, който създава целия доклад наведнъж, вместо раздел по раздел. Резултатът е почти десетократно намаляване на времето за генериране на доклад в сравнение с патентованите модели, които проследявахме — в целия конвейер на Asta Бързият режим има средно 51,1 секунди на доклад в сравнение със 178,5 секунди за режим „Мислене“, тоест е около 3,5 пъти по-бърз.

Заедно тези подобрения на ефективността превърнаха AstaBrief в полезен тестов случай за по-широка цел: създаване на отворени езикови модели, които могат да бъдат адаптирани към специфичните изисквания на научната работа.

Отворените тегла ще позволят на институциите да изпълняват AstaBrief на собствената си инфраструктура, което е необходимо, когато изследователските въпроси разкриват чувствителна или непубликувана работа. Наред с теглата на модела публикуваме примерен работен процес, който изследователите могат да адаптират, за да създават доклади от собствените си PDF файлове — отправна точка за локално генериране на доклади.

Тази публикация разглежда как обучихме AstaBrief, какво научихме за основаването му на научни доказателства и кои части от нашия подход според нас могат да бъдат пренесени към бъдещи модели за науката. По-голямата част от описаното обучение и оценяване беше завършена през 2025 г., така че патентованите модели, използвани за генериране на обучаващи данни и като точки за сравнение, отразяват водещото ниво по онова време. Не сме повторили пълната оценка спрямо днешните водещи модели; резултатите по-долу е най-добре да се разглеждат като доказателства за конкретните избори при обучението и дизайна на системата, които тествахме.

Обучение на модела

Целта ни с AstaBrief беше да създадем модел с отворени тегла и всички качества, които са най-важни за дългоформатен научен синтез: качество на отговора, релевантност, структура и обвързване на цитиранията с доказателствата. Започнахме с Qwen3-8B и насочихме по-голямата част от усилията си към данните за дообучение, оценяването и съпътстващата инфраструктура за генериране на доклади.

Адаптирането на универсални модели за научна работа — както и обучението на нови научни модели от нулата — е нещо, което проучваме широко в Ai2. Чрез NSF OMAI, национална инициатива на САЩ, ръководена от Ai2 за изграждане на напълно отворена AI инфраструктура и модели за научни открития, нашите изследователи работят пряко с научни общности, за да разберат от какво се нуждаят от бъдещите отворени модели и в какво днешните универсални модели не достигат. Това включва изучаване на различията в потребностите между научните области и работните процеси, като в бъдеще ще споделим още резултати от това изследване.

Скорошна работа, включително нашият DR Tulu, показа, че методите, основани на обучение с подсилване (RL), могат да подобрят генерирането на дълги доклади при модели с отворени тегла, особено когато в цикъла на обучение участват модели съдии. Разгледахме този път за AstaBrief, но в крайна сметка се насочихме към по-проста рецепта, изградена около supervised fine-tuning (SFT) и директна оптимизация на предпочитанията (DPO).

Обучението, основано на RL, може да бъде нестабилно и скъпо. Искахме да видим докъде можем да повишим качеството на генериране на доклади с по-евтина и по-лесна за оперативно управление настройка — такава, която също е по-лесна за отстраняване на грешки и итеративно подобряване.

Това направи качеството на обучаващите данни особено важно. Вместо да разчитаме на по-сложен метод за оптимизация, който да компенсира шумни примери, прекарахме голяма част от проекта в изясняване как да генерираме, подбираме и филтрираме примери, които действително демонстрират желаното от нас поведение при писане на доклади.

Искахме също AstaBrief да бъде по-бърз, за да могат потребителите бързо да получат предварителни доклади, които след това да доразвиват в последващи ходове. За подобренията на скоростта решихме да обучим AstaBrief да генерира директно крайния доклад в един проход при потребителска заявка и релевантни извлечени откъси, като заобиколи скъпите етапи на обобщаване и клъстеризиране на откъсите, използвани от нашия режим „Мислене“, базиран на Claude, и като не създава отговора раздел по раздел. Интересното е, че установихме, че това е възможно без загуба на производителност.

Събиране на данни за SFT обучение

Конвейерът за обучение започна с реални потребителски заявки, изпратени чрез системата, описана в нашата статия „Синтезиране на научна литература с езикови модели с допълнено извличане“, и ScholarQA — рамката, която сега стои в основата на функцията „Генериране на доклад“ в Asta. Вместо да обучаваме само със синтетични подсказки или задачи от типа на бенчмаркове, искахме AstaBrief да се учи от реални заявки на реални учени.

Нашето изследване показва, че учените често искат различни неща от езиковите модели в сравнение с потребителите на универсални чатботове или традиционни инструменти за търсене. В нашия анализ на стотици хиляди заявки към Asta експертите изследователи често предоставят съществен контекст, множество ограничения и връзки между концепции, вместо да разчитат на кратки подсказки под формата на ключови думи.

По-скорошни проучвания сред потребителите на Asta също разкриха различия в начина, по който изследователите искат AI да участва в работата им — някои се чувстват комфортно да използват модели за генериране на идеи или експериментиране, докато други предпочитат по-ограничена роля при синтезирането, наблюдението на литературата или откриването на закономерности. Въпреки тези различия участниците искат по-ясна проследимост на източниците, по-голяма видимост върху действията на модела и по-голям контрол върху използвания от него контекст.

Филтрирахме събраните потребителски логове по качество, релевантност и поверителност, като премахнахме трафика от бета тестери и ботове, отхвърлихме заявки, твърде кратки, за да бъдат смислени, и използвахме филтриране, основано на LLM, за откриване на заявки на неанглийски език, ненаучни заявки и подсказки, съдържащи лична информация. Така остана набор от 90 хил. заявки, свързани с изследвания.

За SFT генерирахме целеви изходи под формата на пълни доклади от филтрираните заявки, използвайки многостъпковия конвейер ScholarQA зад генерирането на доклади в Asta. Конвейерът извличаше релевантна литература, организираше материала в раздели и използваше поддържащ модел за генериране на доклади, който синтезираше доказателствата в цитиран доклад. Използвахме комбинация от патентовани системи: Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini и GPT-4.1. След филтриране по качество това даде 47 хил. използваеми обучаващи примера.

Създаване на DPO двойки

DPO изискваше различен вид обучаващи данни. Вместо един целеви доклад за всяка заявка, имахме нужда от двойки доклади, като единият е предпочитан пред другия.

Създадохме тези двойки от отделно подмножество заявки, които не бяха използвани при генерирането на данни за SFT. Единият доклад за всяка заявка идваше от съществуващия конвейер ScholarQA, обикновено поддържан от Claude 3.5 Sonnet или 3.7 Sonnet. Конкуриращият доклад се генерираше чрез подаване на извлечените от ScholarQA откъси от литературата към различен модел: o3, o4-mini, DeepSeek-V3 или DeepSeek-R1 в зависимост от примера.

Два модела съдии — GPT-4.1 и DeepSeek-R1 — сравняваха всяка двойка и избираха победител. Уверихме се, че съдиите LLM са съгласувани с човешките предпочитания (95% съгласие), и запазихме само двойките, при които и двата съдии са съгласни. Това ни даде по-чист набор от предпочитания и премахна голяма част от шума, който обикновено се появява в мащабно генерираните данни за предпочитания.

След филтриране по качество крайният набор от данни за DPO съдържаше около 6 хил. примера.

Използването на множество генератори и изискването за съгласие между двама съдии ни даде сравнително прост начин за създаване на данни за предпочитания, без да приемаме изхода или преценката на който и да е модел за абсолютна истина.

Филтриране на данните за по-добро приписване

Основната ни цел при оценяването беше SQABench-CS2 — набор от 200 написани от потребители изследователски въпроса по компютърни науки. Проследявахме четири показателя по време на разработването на AstaBrief:

  • Резултат по рубрика, който измерва каква част от необходимото съдържание е обхваната от доклада.
  • Прецизност на отговора, която измерва дали всеки абзац е релевантен към въпроса.
  • Прецизност на цитиранията, която измерва дали всяко цитиране подкрепя твърдението, към което е прикрепено.
  • Пълнота на цитиранията, която измерва дали твърденията в доклада са напълно подкрепени от предоставените цитирания.

За крайния ни модел проведохме и допълнителни оценки: DeepScholarBench — бенчмарк с 63 заявки за дългоформатен изследователски синтез, изграден от скорошни статии в ArXiv — и две отделни двойкови оценки спрямо доклади, генерирани от конвейера, задвижван от Claude: сравнение, оценено от LLM, върху SQABench-CS2, и малко човешко проучване.

Докладът може да звучи изпипан и завършен, докато се отклонява от въпроса или прикрепя цитирания към твърдения, които не следват от основаващите ги доказателства. За научния синтез трябваше да измерваме тези поведения поотделно. Но подкрепата от цитирания е само част от научната достоверност — моделът може да цитира правилното изследване и въпреки това да направи по-силно твърдение, отколкото самото изследване подкрепя. Това може да се случи по незабележими начини, например когато резултат за конкретна извадка се превърне в общо твърдение за цяла популация, резултат, съобщен в минало време, се прехвърли в сегашно време и звучи универсално валиден, или описателна констатация се превърне в препоръка какво трябва да правят клиницисти, политици или изследователи.

Тези видове обобщения са особено важни при генерирането на научни доклади, защото всяка стъпка може да разшири привидния обхват на доказателствата, без да въведе очевидно невярно твърдение. Следователно цитираното изречение може технически да е свързано с източника си, но все пак да надценява това, което изследователите действително са установили. Нашите показатели при разработването се фокусираха главно върху релевантността, обхвата и обвързването на цитиранията с доказателствата; по-богатото оценяване на авторите на научни доклади трябва също да проверява дали те запазват обхвата и силата на твърденията в източниците си.

Първите ни SFT обучения подобриха цялостното качество на съдържанието, но все още изоставаха от конвейера ни за генериране на доклади, задвижван от Claude, по отношение на прецизността на отговорите и качеството на цитиранията. С други думи, моделът се подобри в писането на доклади, но все още не беше достатъчно последователно основан на доказателства за нуждите на научния синтез.

Това ни подтикна да отделим повече време на качеството на данните. Тествахме четири филтъра, основани на статистически показатели, за да идентифицираме по-слабите синтетични обучаващи примери:

  • Съотношение между токените на изхода и входа. Отговорите с много високи съотношения често бяха шумни, защото генерираха много текст от твърде малко доказателства.
  • Релевантност на цитиранията. За всеки синтетичен доклад в обучаващия набор осреднихме оценките за релевантност при извличане на цитираните статии. Ниските средни стойности подсказваха, че докладът разчита прекалено много на доказателства с по-нисък ранг.
  • Плътност на цитиранията. Измерихме дела на твърденията, които имат поне едно цитиране. Докладите с ниска плътност често съдържаха големи части неподкрепен текст.
  • Разнообразие на цитиранията: Измерихме дела на статиите, цитирани в отговора, спрямо набора, върнат от конвейера за извличане на доклади, задвижван от Claude. Ниските резултати подсказваха, че докладът разчита прекомерно на няколко статии.

Най-съществените подобрения дойдоха от филтрирането на синтетични доклади с ниска плътност на цитиранията; по-агресивното филтриране, комбинациите от филтри и промените на скоростта на обучение не добавиха значими подобрения.

Това беше един от най-ясните уроци от проекта: по-сложното филтриране не е непременно по-добро. Сравнително прост сигнал — дали синтетичните доклади последователно цитират твърденията си — се оказа по-полезен от няколко по-сложни комбинации, които изпробвахме. Научната специализация, с други думи, не е задължително въпрос на добавяне на повече научен текст към предварителното обучение; съставът и качеството на данните за дообучение и това дали демонстрират поведения като обосноваване и приписване могат съществено да променят представянето на получения модел.

Този фокус върху обоснован и полезен изход съответства и на това, което сме чули в изследванията си сред потребителите на Asta. Участниците отбелязват, че генерирането на повече текст не е непременно по-полезно; те искат кратък синтез и достатъчно проследимост на източниците, за да могат да преглеждат и проверяват резултатите, без да се лутат в ненужни изходи.

След като получихме по-силна SFT контролна точка, проведохме DPO обучение върху нея. Този етап повиши резултатите още повече, като доближи AstaBrief до конвейера за доклади, задвижван от Claude, в Asta и DR Tulu при генерирането на доклади.

Проверка на подхода

Тъй като този модел беше предназначен да работи като част от нашата агентна рамка за генериране на доклади в Asta (а не непременно като самостоятелен модел), основният ни въпрос беше дали AstaBrief може да запази качествата на докладите, които ценим, като същевременно даде възможност за значително по-бърз и по-евтин конвейер за генериране на доклади. С други думи, не питахме единствено дали моделът може да се изравни с по-силен патентован модел в отделни бенчмаркове; искахме да разберем каква част от това качество можем да запазим с много по-проста система.

изображение

изображение

Всеки ред е подреден от най-добрия към по-слабия; по-високият резултат е по-добър при всички показатели. Qwen3-8B е оценен само върху тестовата част на SQABench-CS2. SQABench-CS2 е набор от изследователски въпроси по компютърни науки, написани от потребители; DeepScholarBench оценява дългоформатния изследователски синтез със свои показатели, които не са сравними с тези на SQABench-CS2.

При оценяванията, които използвахме по време на разработването, AstaBrief беше конкурентоспособен на конвейера, задвижван от Claude, и на DR Tulu по няколко показателя за качеството на отговорите и цитиранията. Графиката по-долу показва сравнението, оценено от LLM — в отделно човешко проучване с 14 въпроса трима научни изследователи допринесоха с по 4–5 въпроса и класираха докладите от трите системи по общо предпочитание, пълнота, релевантност, организация и точност на цитиранията (разрешени бяха равенства). По общо предпочитание DR-Tulu печели, но двама от тримата изследователи предпочитат AstaBrief пред останалите системи по показателите за точност на цитиранията, демонстрирайки полезността на нашите филтри за качеството на SFT данните.

изображение

Лентите показват дела на сравненията на доклади, оценени от LLM, в които всяка система е победила режима „Мислене“ при едни и същи въпроси. Човешките оценки са извършени отделно и не са включени. Режимът „Мислене“ е референтният модел за сравнение и няма лента. За разлика от DR-Tulu, Asta Brief беше оптимизиран за това двойково класиране на доклади по време на етапа DPO.

Тези числа е най-добре да се разглеждат като потвърждение на инженерния подход към момента на разработването му, а не като твърдение за мястото на този конкретен базов модел спрямо днешното водещо ниво. Екосистемата на моделите се развива бързо — очакваме уроците за създаване на данни, филтриране на приписването и обслужване да се обобщят.

Проверката на полезността на AstaBrief в Asta показва окуражаващо ранно използване на Бързия режим. Сред 374 потребители на Asta, които са го изпробвали, 29,1% са го използвали в продължение на два или повече дни, а потребителите генерират средно 3,67 нишки с доклади чрез него. Двадесет и три процента от потребителите, изпробвали Бързия режим, са продължили да го използват и никога не са се върнали към режим „Мислене“ за бъдещи нишки. Допълнителни 18% са превключвали между Бърз и режим „Мислене“ според целите си, като са използвали Бързия режим за около 40% от нишките си.

Макар че обратната връзка обикновено е твърде оскъдна, за да се правят категорични заключения, виждаме, че Бързият режим получава положителна обратна връзка с подобна честота като режима „Мислене“ (84,2% спрямо 85,2%).

Какво следва

Генерирането на доклади в Asta е първата производствена употреба на AstaBrief, предоставяйки на изследователите Бърз режим с отворени тегла наред със съществуващия режим „Мислене“. Тъй като моделът е с отворени тегла, институциите могат да го внедрят на собствен хардуер, включително зад собствената си защитна стена, без да разчитат на API на патентован модел за генериране на доклади.

В Asta това също означава, че можем директно да изучаваме и подобряваме тази част от конвейера за генериране на доклади, като запазим режим „Мислене“ като опция за задачи, изискващи повече изчислителни ресурси.

Предстои още работа. Проучваме по-фино обучение на предпочитанията, по-силни подходи, комбиниращи RAG и RL, възможности за множество ходове и инструменти, допълнителни научни източници на данни и декомпозиция на заявки. Интересуват ни и оценки, които надхвърлят въпроса дали дадено твърдение има подкрепящо цитиране и проверяват дали моделът запазва доказателствената — за да уловим по-добре качеството на доклада като изследователски артефакт и да проверим дали моделът запазва доказателствения обхват на своите източници. Това включва качества като краткост и организация, както и това дали моделът превръща специфични за извадката резултати в широки обобщения или описателни резултати в препоръки.

AstaBrief е един експеримент в по-дълга поредица от работа върху езикови модели за науката — от ScholarQA и DR Tulu до бъдещи версии на Olmo, които започват да се оформят още сега. Уроците тук — особено относно обучаващите данни, филтрирането и оценяването — могат да помогнат за насочването на следващите ни разработки.

Изпробвайте Бързия модел още днес в Asta или изтеглете AstaBrief от Hugging Face.

Модели, споменати в тази статия 1

Колекции, споменати в тази статия 1

Общност

Качвайте изображения, аудио и видеоклипове, като ги плъзнете в текстовото поле, поставите ги или натиснете тук.
Докоснете или поставете тук, за да качите изображения

· Регистрирайте се или влезте в профила си, за да коментирате

Модели, споменати в тази статия 1

Колекции, споменати в тази статия 1

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от Hugging Face на

Прочетете оригинала в Hugging Face ↗

Текстът и изображенията са собственост на Hugging Face и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини