Відкриваємо вихідний код AstaBrief — швидкої моделі для створення звітів в Asta
Мовні моделі вже можуть допомагати дослідникам шукати літературу, синтезувати докази й опрацьовувати складні запитання. Однак наукова робота висуває до цих моделей особливі вимоги: відповіді мають залишатися обґрунтованими доказами, моделі повинні зберігати те, що насправді підтверджують докази, а не непомітно розширювати висновки дослідження, а дослідники мають бути спроможними перевірити кінцеві результати.
Ми бачимо це в тому, як науковці використовують Asta — нашу агентну платформу для наукової роботи. Замість простого пошуку за ключовими словами користувачі часто надають значний контекст і багато обмежень — наприклад, просять Asta порівняти підходи в корпусі літератури, враховуючи певний метод, популяцію або середовище. Багато хто також повертається до створених звітів пізніше, сприймаючи їх як робочі дослідницькі матеріали, а не як одноразові відповіді.
Ми хотіли допомогти науковцям швидше створювати звіти з цитуваннями за допомогою моделі, яку вони могли б завантажити й запускати самостійно. Для цього ми перевірили, чи зможе невелика відкрита модель, спеціально навчена створювати наукові звіти, зрівнятися за якістю звітів із закритими моделями, які ми використовували, водночас скоротивши час створення та витрати на обслуговування.
Ми створили AstaBrief 8B — модель, яка перетворює дослідницьке запитання та уривки знайденої літератури на звіт із цитуваннями. Сьогодні AstaBrief доступна в Asta у функції «Створити звіт» як швидкий режим поряд із режимом Thinking на основі Claude. Ми також відкриваємо код моделі та навчальні дані, щоб інші могли досліджувати, відтворювати й розвивати наш підхід.
Розробка AstaBrief потребувала десятків тисяч реальних дослідницьких запитів, фільтрації з фокусом на цитуваннях, даних про вподобання та оновленого конвеєра створення звітів, який пише весь звіт за один прохід, а не розділ за розділом. У результаті час створення звіту скоротився майже на порядок порівняно із закритими моделями, за якими ми стежили: у всьому конвеєрі Asta швидкий режим у середньому створює звіт за 51,1 секунди проти 178,5 секунди в режимі Thinking, тобто приблизно у 3,5 раза швидше.
У сукупності ці здобутки в ефективності зробили AstaBrief корисним прикладом для ширшої мети: створення відкритих мовних моделей, які можна адаптувати до специфічних вимог наукової роботи.
Відкриті ваги також дадуть установам змогу запускати AstaBrief на власній інфраструктурі, що необхідно, коли дослідницькі запитання розкривають конфіденційну або неопубліковану роботу. Разом із вагами моделі ми випускаємо приклад робочого процесу, який дослідники можуть адаптувати для створення звітів із власних PDF-файлів, що стане відправною точкою для локального створення звітів
У цій публікації описано, як ми навчали AstaBrief, що дізналися про її обґрунтування науковими доказами та які частини нашого підходу, на нашу думку, можна перенести в майбутні моделі для науки. Більшість описаного навчання й оцінювання було завершено у 2025 році, тому закриті моделі, використані для створення навчальних даних і як точки порівняння, відображають передовий рівень того часу. Ми не проводили повторного повного оцінювання на сучасних передових моделях; наведені нижче результати найкраще сприймати як свідчення щодо конкретних рішень у навчанні та проєктуванні системи, які ми перевіряли.
Навчання моделі
Нашою метою під час створення AstaBrief була розробка моделі з відкритими вагами, яка мала б усі найважливіші для широкого наукового синтезу якості: якість відповіді, релевантність, структуру та обґрунтованість цитуваннями. Ми почали з Qwen3-8B і зосередили більшість зусиль на даних післянавчання, оцінюванні та допоміжній інфраструктурі створення звітів.
Адаптація універсальних моделей для наукової роботи — і навчання нових наукових моделей із нуля — є напрямом, який ми широко досліджуємо в Ai2. У межах NSF OMAI, національної ініціативи США під керівництвом Ai2 зі створення повністю відкритої інфраструктури ШІ та моделей для наукових відкриттів, наші дослідники безпосередньо співпрацюють із науковими спільнотами, щоб зрозуміти їхні потреби в майбутніх відкритих моделях і з’ясувати, у чому сучасні універсальні моделі не відповідають цим потребам. Це також охоплює вивчення відмінностей між науковими галузями та робочими процесами; у майбутньому ми поділимося новими результатами цього дослідження.
Нещодавні роботи, зокрема наша DR Tulu, показали, що методи на основі навчання з підкріпленням (RL) можуть покращити створення довгих звітів для моделей із відкритими вагами, особливо коли моделі-судді залучені до циклу навчання. Ми розглядали цей шлях для AstaBrief, але зрештою зосередилися на простішому підході на основі донавчання з учителем (SFT) і прямої оптимізації вподобань (DPO).
Навчання на основі RL може бути нестабільним і дорогим. Ми хотіли перевірити, наскільки можна підвищити якість створення звітів за допомогою дешевшої та простішої в операційному управлінні конфігурації, яку також легше налагоджувати й ітеративно вдосконалювати.
Тому якість навчальних даних стала особливо важливою. Замість того щоб покладатися на складніший метод оптимізації для компенсації зашумлених прикладів, ми витратили значну частину проєкту на з’ясування того, як генерувати, відбирати й фільтрувати приклади, які справді демонстрували бажану поведінку під час написання звітів.
Ми також хотіли, щоб AstaBrief працювала швидше, аби користувачі могли швидко отримувати попередні звіти, а потім доопрацьовувати їх у наступних повідомленнях. Для підвищення швидкості ми вирішили навчити AstaBrief безпосередньо генерувати фінальний звіт за один прохід на основі запиту користувача та відповідних знайдених фрагментів, обходячи дорогі етапи узагальнення й кластеризації фрагментів, які використовує наш режим Thinking на основі Claude, і не створюючи відповідь окремо для кожного розділу. Цікаво, що ми виявили можливість зробити це без втрати продуктивності.
Збір навчальних даних SFT
Навчальний конвеєр розпочався з реальних запитів користувачів, надісланих через систему, описану в нашій статті «Синтез наукової літератури за допомогою LM із доповненням пошуком», і ScholarQA — фреймворку, який тепер лежить в основі функції «Створити звіт» в Asta. Замість навчання лише на синтетичних запитах або завданнях у стилі бенчмарків ми хотіли, щоб AstaBrief навчалася на реальних запитах реальних науковців.
Наше дослідження показує, що науковці часто вимагають від мовних моделей іншого, ніж користувачі від універсальних чат-ботів або традиційних пошукових інструментів. У нашому аналізі сотень тисяч запитів до Asta експертні дослідники часто надавали значний контекст, численні обмеження та зв’язки між поняттями, а не покладалися на короткі запити у стилі ключових слів.
Новіші дослідження користувачів Asta також виявили відмінності в тому, як дослідники хочуть залучати ШІ до своєї роботи: дехто охоче використовує моделі для генерування ідей або експериментів, тоді як інші віддають перевагу більш вузькій ролі в синтезі, моніторингу літератури або пошуку закономірностей. Попри ці відмінності, учасники хочуть чіткішого відстеження джерел, більшої прозорості щодо дій моделі та кращого контролю над контекстом, який вона використовує.
Ми відфільтрували зібрані журнали користувачів за якістю, релевантністю та конфіденційністю: вилучили трафік бета-тестерів і ботів, відкинули надто короткі для змістовного аналізу запити та використали етап фільтрації на основі LLM, щоб виявити неангломовні запити, ненаукові запити й запити, що містили персональну інформацію. У результаті залишилося 90 тисяч дослідницьких запитів.
Для SFT ми генерували цільові результати у вигляді повних звітів із відфільтрованих запитів, використовуючи багатокроковий конвеєр ScholarQA, що лежить в основі створення звітів в Asta. Конвеєр знаходив релевантну літературу, організовував матеріал у розділи та використовував допоміжну модель для створення звітів, щоб синтезувати докази у звіт із цитуваннями. Ми використали суміш закритих систем: Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini та GPT-4.1. Після фільтрації за якістю це дало 47 тисяч придатних навчальних прикладів.
Створення пар DPO
DPO потребувала іншого типу навчальних даних. Замість одного цільового звіту для кожного запиту нам були потрібні пари звітів, у яких один мав перевагу над іншим.
Ми створили ці пари з окремої підмножини запитів, які не використовувалися під час генерування даних SFT. Один звіт для кожного запиту походив з наявного конвеєра ScholarQA, зазвичай із підтримкою Claude 3.5 Sonnet або 3.7 Sonnet. Конкуруючий звіт генерувався шляхом передавання знайдених ScholarQA уривків літератури іншій моделі: o3, o4-mini, DeepSeek-V3 або DeepSeek-R1 — залежно від прикладу.
Дві моделі-судді — GPT-4.1 і DeepSeek-R1 — порівнювали кожну пару та обирали переможця. Ми переконалися, що судді-LLM узгоджуються з людськими вподобаннями (95% збігів), і залишали лише пари, у яких обидва судді погоджувалися. Це дало нам чистіший набір даних про вподобання та усунуло значну частину шуму, який зазвичай з’являється в масштабно згенерованих даних про вподобання.
Після фільтрації за якістю остаточний набір даних DPO становив близько 6 тисяч прикладів.
Використання кількох генераторів і вимога узгодженості між двома суддями дали нам відносно простий спосіб створити дані про вподобання, не вважаючи результат або оцінку жодної окремої моделі еталоном істини.
Фільтрація даних для кращої атрибуції
Нашою основною ціллю оцінювання був SQABench-CS2 — набір із 200 дослідницьких запитань у галузі комп’ютерних наук, написаних користувачами. Упродовж розробки AstaBrief ми відстежували чотири метрики:
- Оцінка за критеріями, яка вимірює, наскільки багато необхідного змісту охоплює звіт.
- Точність відповіді, яка вимірює, чи є кожен абзац релевантним запитанню.
- Точність цитування, яка вимірює, чи підтверджує кожне цитування твердження, до якого воно прикріплене.
- Повнота цитування, яка вимірює, чи повністю підтверджені твердження звіту наведеними цитуваннями.
Для нашої фінальної моделі ми також провели додаткові оцінювання: DeepScholarBench — бенчмарк із 63 запитів для довгого дослідницького синтезу, створений на основі нещодавніх статей з ArXiv, — а також два окремі попарні оцінювання проти звітів, створених конвеєром на основі Claude: порівняння за оцінками LLM на SQABench-CS2 і невелике дослідження за участю людей.
Звіт може звучати відшліфовано й повно, водночас відхиляючись від запитання або прикріплюючи цитування до тверджень, які не випливають із відповідних доказів. Для наукового синтезу нам потрібно було вимірювати ці характеристики окремо. Однак підтримка цитуванням — лише частина наукової достовірності: модель може процитувати правильне дослідження й водночас зробити сильніше твердження, ніж те, яке підтверджує саме дослідження. Це може відбуватися непомітно — наприклад, коли результат для певної вибірки перетворюється на загальне твердження про всю популяцію, результат, описаний у минулому часі, змінюється на твердження в теперішньому часі, що звучить універсальніше, або описовий результат перетворюється на рекомендацію щодо того, що мають робити клініцисти, політики чи дослідники.
Такі узагальнення особливо важливі для створення наукових звітів, оскільки кожен крок може розширити уявний масштаб доказів, не додаючи явно хибного твердження. Тому речення з цитуванням може технічно стосуватися джерела, але водночас перебільшувати те, що насправді встановили дослідники. Наші метрики розробки передусім зосереджувалися на релевантності, охопленні та обґрунтованості цитуваннями; багатше оцінювання авторів наукових звітів також має перевіряти, чи зберігають вони масштаб і силу тверджень у своїх джерелах.
Наші перші запуски SFT покращили загальну якість змісту, але все ще поступалися нашому конвеєру створення звітів на основі Claude за точністю відповідей і якістю цитувань. Іншими словами, модель стала краще писати звіти, але все ще не так послідовно обґрунтовувала їх доказами, як було потрібно для наукового синтезу.
Це спонукало нас приділити більше часу якості даних. Ми перевірили чотири статистичні фільтри для виявлення слабших синтетичних навчальних прикладів:
- Співвідношення токенів результату до вхідних токенів. Відповіді з дуже високими співвідношеннями часто були зашумленими, оскільки генерували багато тексту на основі надто малої кількості доказів.
- Релевантність цитувань. Для кожного синтетичного звіту в навчальному наборі ми усереднювали оцінки релевантності пошуку його процитованих статей. Низькі середні значення свідчили, що звіт надто сильно покладався на докази з нижчим рейтингом.
- Щільність цитувань. Ми вимірювали частку тверджень, які мали хоча б одне цитування. У звітах із низькою щільністю часто були великі фрагменти непідтвердженого тексту.
- Різноманітність цитувань: Ми вимірювали частку статей, процитованих у відповіді, з огляду на набір, повернутий конвеєром пошуку звітів на основі Claude. Низькі показники свідчили, що звіт надмірно покладався на кілька статей.
Найбільше покращення дало відфільтровування синтетичних звітів із низькою щільністю цитувань; агресивніша фільтрація, комбінації фільтрів і перебір швидкостей навчання не додали значущих покращень.
Це був один із найочевидніших уроків проєкту: складніша фільтрація не обов’язково була кращою. Відносно простий сигнал — чи послідовно синтетичні звіти цитували свої твердження — виявився кориснішим за кілька складніших комбінацій, які ми випробували. Отже, наукова спеціалізація не обов’язково полягає в додаванні більшої кількості наукового тексту до попереднього навчання; склад і якість даних післянавчання, а також демонстрація ними таких видів поведінки, як обґрунтування та атрибуція, можуть суттєво змінити продуктивність отриманої моделі.
Ця увага до обґрунтованого й корисного результату також відповідає тому, що ми почули в дослідженнях користувачів Asta. Учасники зазначають, що створення більшої кількості тексту не обов’язково є кориснішим; вони хочуть стислого синтезу та достатньої прозорості джерел, щоб переглядати й перевіряти результати, не продираючись крізь непотрібні матеріали.
Після того як ми отримали сильніший контрольний етап SFT, ми провели навчання DPO поверх нього. Цей етап додатково підвищив продуктивність, наблизивши AstaBrief до конвеєра звітів на основі Claude в Asta та DR Tulu за показниками створення звітів.
Перевірка підходу
Оскільки ця модель призначалася для роботи як частина агентного фреймворку створення звітів Asta (а не обов’язково як автономна модель), нашим головним питанням було, чи зможе AstaBrief зберегти важливі для нас якості звітів, забезпечивши водночас значно швидший і дешевший конвеєр створення звітів. Іншими словами, ми запитували не лише, чи зможе модель зрівнятися із сильнішою закритою моделлю в окремих бенчмарках; ми хотіли зрозуміти, яку частину цієї якості можна зберегти за допомогою набагато простішої системи.
Кожен рядок упорядковано від найкращого до найгіршого; за кожною метрикою більше означає краще. Qwen3-8B оцінювали лише на тестовій частині SQABench-CS2. SQABench-CS2 — це набір дослідницьких запитань у галузі комп’ютерних наук, написаних користувачами; DeepScholarBench оцінює довгий дослідницький синтез за власними метриками, які не можна порівнювати з метриками SQABench-CS2.
В оцінюваннях, які ми використовували під час розробки, AstaBrief була конкурентною конвеєру на основі Claude та DR Tulu за кількома показниками якості відповідей і цитувань. На графіку нижче показано порівняння за оцінками LLM. В окремому дослідженні за участю 14 запитань троє наукових дослідників кожен додав по 4–5 запитань і ранжував звіти трьох систем за загальними вподобаннями, повнотою, релевантністю, організацією та точністю цитувань (нічиї були дозволені). За загальними вподобаннями перемагає DR-Tulu, але двоє з трьох дослідників віддають AstaBrief перевагу над іншими системами за метриками точності цитувань, демонструючи корисність наших фільтрів якості даних SFT.
Стовпчики показують частку порівнянь звітів, оцінених LLM, у яких кожна система перемогла режим Thinking на тих самих запитаннях. Людські оцінки проводилися окремо й не включені. Режим Thinking є еталоном для порівняння та не має власного стовпчика. На відміну від DR-Tulu, AstaBrief оптимізували для цього попарного ранжування звітів на етапі DPO.
Ці числа найкраще сприймати як підтвердження інженерного підходу на момент його розробки, а не як твердження про місце цієї конкретної базової моделі щодо сучасного передового рівня. Екосистема моделей швидко змінюється — ми очікуємо, що саме уроки щодо створення даних, фільтрації атрибуції та обслуговування моделей узагальнюватимуться.
Перевірка корисності AstaBrief в Asta показала обнадійливі перші результати використання швидкого режиму. Серед 374 користувачів Asta, які його випробували, 29,1% використовували його протягом двох або більше днів, а користувачі в середньому створювали з ним 3,67 гілки звітів. Двадцять три відсотки користувачів, які випробували швидкий режим, продовжили ним користуватися й більше не поверталися до режиму Thinking у наступних гілках. Ще 18% перемикалися між швидким режимом і Thinking залежно від своїх цілей, використовуючи швидкий режим приблизно у 40% своїх гілок.
Хоча відгуків загалом замало для однозначних висновків, ми бачимо, що швидкий режим отримує позитивні відгуки з такою самою частотою, як і режим Thinking (84,2% проти 85,2%).
Що далі
Створення звітів в Asta — це перше виробниче застосування AstaBrief, яке дає дослідникам швидкий режим із відкритими вагами поряд із наявним режимом Thinking. Оскільки модель має відкриті ваги, установи можуть розгортати її на власному обладнанні, зокрема за власним брандмауером, не покладаючись на API закритої моделі для створення звітів.
В Asta це також означає, що ми можемо безпосередньо досліджувати й покращувати цю частину конвеєра створення звітів, зберігаючи режим Thinking як опцію для завдань, що потребують більших обчислювальних ресурсів.
Попереду ще багато роботи. Ми досліджуємо детальніше навчання на основі вподобань, сильніші підходи RAG плюс RL, багатокрокові можливості та можливості роботи з кількома інструментами, додаткові наукові джерела даних і декомпозицію запитів. Нас також цікавлять оцінювання, які виходять за межі питання про те, чи має твердження підтверджувальне цитування, і перевіряють, чи зберігає модель доказовість — щоб краще відображати якість звіту як дослідницького матеріалу та з’ясувати, чи зберігає модель доказовий масштаб своїх джерел. Це охоплює такі якості, як стислість та організація, а також те, чи перетворює модель результати для конкретної вибірки на широкі узагальнення або описові результати на рекомендації.
AstaBrief — один із експериментів у тривалій роботі над мовними моделями для науки: від ScholarQA і DR Tulu до майбутніх версій Olmo, які вже починають формуватися. Уроки цієї роботи — особливо щодо навчальних даних, фільтрації та оцінювання — можуть допомогти визначити, що ми створюватимемо далі.
Спробуйте швидку модель в Asta вже сьогодні або завантажте AstaBrief із Hugging Face.
Моделі, згадані в цій статті 1
Колекції, згадані в цій статті 1
Спільнота
· Зареєструйтеся або увійдіть, щоб прокоментувати
Моделі, згадані в цій статті 1
Колекції, згадані в цій статті 1
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.





