Sakhanda Wire
NVDA $235.51 +2.01% MSFT $514.05 +0.24% GOOGL $343.55 +1.57% META $729.77 +0.53% AMZN $250.78 +1.03%
← К новостям

Открываем исходный код AstaBrief — быстрой модели для генерации отчётов в Asta

Открытый исходный код AstaBrief — быстрой модели для создания отчётов в Asta
Для предприятий Статья
Опубликовано 2 октября 2026 г.
🤗 Модель | 📊 Данные

AstaBrief — scientific report generation

Языковые модели уже могут помогать исследователям искать литературу, обобщать доказательства и работать со сложными вопросами. Однако научная работа предъявляет к этим моделям особые требования: ответы должны оставаться обоснованными доказательствами, модели должны сохранять то, что действительно подтверждают доказательства, а не незаметно расширять выводы исследования, и исследователи должны иметь возможность проверять итоговые результаты.

Мы видим это по тому, как учёные используют Asta — нашу агентную платформу для научной работы. Вместо простого поиска по ключевым словам пользователи часто предоставляют значительный контекст и множество ограничений — например, просят Asta сравнить подходы в массиве литературы с учётом конкретного метода, популяции или условий. Многие также возвращаются к созданным отчётам позже, рассматривая их как рабочие исследовательские материалы, а не как разовые ответы.

Мы хотели помочь учёным быстрее создавать отчёты с цитатами с помощью модели, которую они могли бы скачать и запускать самостоятельно. Для этого мы проверили, сможет ли небольшая открытая модель, специально обученная для создания научных отчётов, сравниться по качеству отчётов с проприетарными моделями, которые мы использовали, одновременно сократив время генерации и затраты на обслуживание.

Мы создали AstaBrief 8B — модель, которая превращает исследовательский вопрос и найденные фрагменты литературы в отчёт с цитатами. Сегодня AstaBrief доступна в функции Asta «Создать отчёт» в качестве быстрого режима наряду с режимом Thinking на базе Claude. Мы также открываем исходный код модели и обучающих данных, чтобы другие могли изучать, воспроизводить и развивать наш подход.

Разработка AstaBrief потребовала десятков тысяч реальных исследовательских запросов, фильтрации с акцентом на цитирование, данных о предпочтениях и переработанного конвейера генерации отчётов, который создаёт полный отчёт за один проход, а не раздел за разделом. В результате время генерации отчёта сократилось почти на порядок по сравнению с отслеживаемыми нами проприетарными моделями: во всём конвейере Asta быстрый режим в среднем создаёт отчёт за 51,1 секунды против 178,5 секунды в режиме Thinking, то есть примерно в 3,5 раза быстрее.

В совокупности эти улучшения эффективности сделали AstaBrief полезным примером для более широкой цели: создания открытых языковых моделей, которые можно адаптировать к конкретным требованиям научной работы.

Открытые веса также позволят организациям запускать AstaBrief на собственной инфраструктуре, что необходимо, когда исследовательские вопросы раскрывают конфиденциальную или ещё не опубликованную работу. Вместе с весами модели мы выпускаем пример рабочего процесса, который исследователи могут адаптировать для создания отчётов из собственных PDF-файлов, предоставляя отправную точку для локальной генерации отчётов

В этой публикации рассказывается, как мы обучали AstaBrief, что узнали о её обосновании научными доказательствами и какие части нашего подхода, по нашему мнению, можно перенести в будущие модели для науки. Большая часть описанных обучения и оценки была завершена в 2025 году, поэтому проприетарные модели, использованные для создания обучающих данных и в качестве точек сравнения, отражают передовой уровень того времени. Мы не повторяли полную оценку на современных передовых моделях; приведённые ниже результаты лучше воспринимать как свидетельство о конкретных проверенных нами решениях в области обучения и проектирования системы.

Обучение модели

Целью создания AstaBrief была открытая по весам модель со всеми наиболее важными качествами для научного синтеза в длинной форме: качеством ответов, релевантностью, структурой и обоснованностью цитатами. Мы начали с Qwen3-8B и сосредоточили большую часть усилий на данных постобучения, оценке и вспомогательной инфраструктуре генерации отчётов.

Адаптация универсальных моделей для научной работы — и обучение новых научных моделей с нуля — является одним из направлений, которые мы широко исследуем в Ai2. В рамках NSF OMAI, национальной инициативы США под руководством Ai2 по созданию полностью открытой ИИ-инфраструктуры и моделей для научных открытий, наши исследователи напрямую работают с научными сообществами, чтобы понять, что им потребуется от будущих открытых моделей и в чём современные универсальные модели не справляются. Это включает изучение различий в потребностях разных научных областей и рабочих процессов; в будущем мы поделимся дополнительными результатами этого исследования.

Недавние работы, включая нашу DR Tulu, показали, что методы на основе обучения с подкреплением (RL) могут улучшить генерацию длинных отчётов для моделей с открытыми весами, особенно когда в цикл обучения включены модели-судьи. Мы рассматривали этот путь для AstaBrief, но в итоге сосредоточились на более простой схеме, основанной на дообучении с учителем (SFT) и прямой оптимизации предпочтений (DPO).

Обучение на основе RL может быть нестабильным и дорогим. Мы хотели понять, насколько можно повысить качество генерации отчётов с помощью более дешёвой и удобной в эксплуатации системы, которую также проще отлаживать и итеративно улучшать.

Поэтому качество обучающих данных стало особенно важным. Вместо того чтобы полагаться на более сложный метод оптимизации для компенсации зашумлённых примеров, мы значительную часть проекта посвятили тому, чтобы понять, как создавать, отбирать и фильтровать примеры, действительно демонстрирующие нужное нам поведение при написании отчётов.

Мы также хотели сделать AstaBrief быстрее, чтобы пользователи могли быстро получать предварительные отчёты, которые затем можно дорабатывать в последующих запросах. Для повышения скорости мы решили обучить AstaBrief напрямую генерировать итоговый отчёт за один проход на основе пользовательского запроса и релевантных найденных фрагментов, минуя затратные этапы суммирования и кластеризации фрагментов, используемые нашим режимом Thinking на базе Claude, и не создавая ответ раздел за разделом. Интересно, что нам удалось сделать это без потери производительности.

Сбор данных для обучения SFT

Конвейер обучения начался с реальных пользовательских запросов, отправленных через систему, описанную в нашей статье «Синтез научной литературы с помощью языковых моделей с дополнением поиска», и ScholarQA — фреймворка, который теперь лежит в основе функции Asta «Создать отчёт». Вместо обучения только на синтетических подсказках или задачах в стиле бенчмарков мы хотели, чтобы AstaBrief училась на реальных запросах реальных учёных.

Наше исследование показывает, что учёные часто задают языковым моделям другие вопросы, чем пользователи универсальных чат-ботов или традиционных поисковых инструментов. В нашем анализе сотен тысяч запросов Asta эксперты-исследователи часто предоставляли значительный контекст, множество ограничений и связи между понятиями, а не полагались на короткие запросы в стиле ключевых слов.

Более поздние исследования пользователей Asta также выявили различия в том, как исследователи хотят привлекать ИИ к своей работе: некоторые готовы использовать модели для генерации идей или экспериментов, тогда как другие предпочитают более узкую роль моделей в синтезе, мониторинге литературы или поиске закономерностей. Несмотря на эти различия, участники хотят более ясной прослеживаемости источников, большей прозрачности действий модели и большего контроля над используемым контекстом.

Мы отфильтровали собранные пользовательские журналы по качеству, релевантности и конфиденциальности, исключив трафик бета-тестировщиков и ботов, удалив слишком короткие и потому неинформативные запросы, а также применив фильтрацию на основе LLM для выявления запросов не на английском языке, ненаучных запросов и подсказок, содержащих персональную информацию. В результате осталось 90 тысяч исследовательских запросов.

Для SFT мы создали целевые выходные данные в виде полных отчётов на основе отфильтрованных запросов, используя многоэтапный конвейер ScholarQA, лежащий в основе генерации отчётов Asta. Конвейер находил релевантную литературу, организовывал материалы по разделам и использовал вспомогательную модель генерации отчётов для синтеза доказательств в отчёт с цитатами. Мы применяли сочетание проприетарных систем: Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini и GPT-4.1. После фильтрации по качеству получилось 47 тысяч пригодных обучающих примеров.

Создание пар для DPO

Для DPO требовался другой тип обучающих данных. Вместо одного целевого отчёта на запрос нам были нужны пары отчётов, в которых один предпочтительнее другого.

Мы создали эти пары из отдельной подвыборки запросов, не использованной при генерации данных для SFT. Один отчёт на запрос создавался существующим конвейером ScholarQA, обычно с использованием Claude 3.5 Sonnet или 3.7 Sonnet. Конкурирующий отчёт создавался путём передачи найденных ScholarQA фрагментов литературы другой модели: o3, o4-mini, DeepSeek-V3 или DeepSeek-R1 — в зависимости от примера.

Две модели-судьи — GPT-4.1 и DeepSeek-R1 — сравнивали каждую пару и выбирали победителя. Мы убедились, что судьи на базе LLM согласуются с человеческими предпочтениями (95% совпадений), и оставляли только пары, в которых оба судьи пришли к одному мнению. Это обеспечило более чистый набор предпочтений и устранило значительную часть шума, который обычно появляется в масштабных данных о предпочтениях.

После фильтрации по качеству итоговый набор данных DPO составил около 6 тысяч примеров.

Использование нескольких генераторов и требование согласия двух судей дало нам относительно простой способ создавать данные о предпочтениях, не считая результат или оценку какой-либо одной модели эталоном истины.

Фильтрация данных для улучшения атрибуции

Нашей основной целью оценки был SQABench-CS2 — набор из 200 исследовательских вопросов по информатике, написанных пользователями. На протяжении разработки AstaBrief мы отслеживали четыре метрики:

  • Оценка по рубрике, измеряющая, насколько полно отчёт охватывает необходимое содержание.
  • Точность ответа, измеряющая, насколько каждый абзац релевантен вопросу.
  • Точность цитирования, измеряющая, подтверждает ли каждая цитата утверждение, к которому она относится.
  • Полнота цитирования, измеряющая, полностью ли утверждения отчёта подтверждаются приведёнными цитатами.

Для итоговой модели мы также провели дополнительные оценки: DeepScholarBench — бенчмарк из 63 запросов для синтеза длинных исследовательских текстов, созданный на основе недавних статей ArXiv, — и две отдельные попарные оценки по сравнению с отчётами, созданными конвейером на базе Claude: сравнение с оценкой LLM на SQABench-CS2 и небольшое исследование с участием людей.

Отчёт может звучать гладко и полно, одновременно уходя в сторону от вопроса или прикрепляя цитаты к утверждениям, которые не следуют из исходных доказательств. Для научного синтеза нам нужно было измерять эти характеристики отдельно. Однако подтверждение цитатами — лишь часть научной достоверности: модель может процитировать правильное исследование и всё же сделать более сильное утверждение, чем позволяет само исследование. Это может происходить незаметно: например, вывод о конкретной выборке может превратиться в обобщённое утверждение обо всей популяции; результат, изложенный в прошедшем времени, может быть преобразован в формулировку в настоящем времени, звучащую как универсально верная; описательный вывод может превратиться в рекомендацию о том, что должны делать клиницисты, политики или исследователи.

Такие обобщения особенно важны для генерации научных отчётов, поскольку каждый шаг может расширить кажущийся охват доказательств, не создавая явно ложного утверждения. Поэтому предложение с цитатой может быть технически связано с источником, но при этом преувеличивать то, что фактически установили исследователи. В ходе разработки мы в первую очередь ориентировались на релевантность, полноту и обоснованность цитатами; более содержательная оценка авторов научных отчётов также должна проверять, сохраняют ли они масштаб и силу утверждений, содержащихся в источниках.

Первые запуски SFT улучшили общее качество содержания, но всё ещё уступали нашему конвейеру генерации отчётов на базе Claude по точности ответов и качеству цитирования. Иными словами, модель стала лучше писать отчёты, но всё ещё не была настолько стабильно основана на доказательствах, насколько требовалось для научного синтеза.

Это побудило нас уделить больше времени качеству данных. Мы протестировали четыре статистических фильтра для выявления более слабых синтетических обучающих примеров:

  • Соотношение токенов выхода и входа. Ответы с очень высокими значениями часто были зашумлены, поскольку генерировали много текста на основе слишком малого количества доказательств.
  • Релевантность цитат. Для каждого синтетического отчёта в обучающем наборе мы усредняли оценки релевантности найденных документов, на которые ссылались. Низкие средние значения указывали, что отчёт слишком сильно опирался на доказательства с низким рейтингом.
  • Плотность цитирования. Мы измеряли долю утверждений, имевших хотя бы одну цитату. В отчётах с низкой плотностью часто встречались большие фрагменты неподкреплённого текста.
  • Разнообразие цитат: Мы измеряли долю статей, процитированных в ответе, от общего набора, возвращённого конвейером поиска отчётов на базе Claude. Низкие значения указывали, что отчёт чрезмерно зависел от нескольких статей.

Наибольший прирост дала фильтрация синтетических отчётов с низкой плотностью цитирования; более жёсткая фильтрация, комбинации фильтров и перебор скорости обучения не дали существенных улучшений.

Это был один из самых очевидных уроков проекта: более сложная фильтрация не обязательно лучше. Относительно простой сигнал — стабильно ли синтетические отчёты цитировали свои утверждения — оказался полезнее нескольких более сложных комбинаций, которые мы пробовали. Иными словами, специализация под научную сферу не обязательно заключается в добавлении большего количества научного текста на этапе предварительного обучения; состав и качество данных постобучения, а также демонстрация в них таких моделей поведения, как обоснование и атрибуция, могут существенно изменить производительность полученной модели.

Этот акцент на обоснованном и полезном выводе также согласуется с тем, что мы узнали из исследований пользователей Asta. Участники отмечают, что больше текста не обязательно означает больше пользы; им нужны лаконичный синтез и достаточная прослеживаемость источников, чтобы проверять результаты, не продираясь через ненужные выводы.

Получив более сильный контрольный вариант SFT, мы провели поверх него обучение DPO. Этот этап ещё больше повысил производительность и приблизил AstaBrief по генерации отчётов к конвейеру на базе Claude в Asta и DR Tulu.

Проверка подхода

Поскольку эта модель предназначалась для работы как часть агентного фреймворка генерации отчётов Asta, а не обязательно как самостоятельная модель, главным для нас был вопрос: сможет ли AstaBrief сохранить важные для нас качества отчётов, обеспечив при этом существенно более быстрый и дешёвый конвейер генерации. Иными словами, мы спрашивали не только, сможет ли модель сравниться с более сильной проприетарной моделью на отдельных бенчмарках; мы хотели понять, какую долю этого качества можно сохранить с помощью гораздо более простой системы.

image

image

Каждая строка упорядочена от лучшего результата к худшему; по всем метрикам большее значение лучше. Qwen3-8B оценивалась только на тестовой части SQABench-CS2. SQABench-CS2 — это набор написанных пользователями исследовательских вопросов по информатике; DeepScholarBench оценивает синтез длинных исследовательских текстов по собственным метрикам, которые несопоставимы с метриками SQABench-CS2.

В оценках, использованных нами в ходе разработки, AstaBrief была конкурентоспособна с конвейером на базе Claude и DR Tulu по нескольким показателям качества ответов и цитирования. На диаграмме ниже показано сравнение с оценкой LLM; в отдельном исследовании с участием 14 вопросов три научных исследователя внесли по 4–5 вопросов каждый и ранжировали отчёты трёх систем по общему предпочтению, полноте, релевантности, организации и точности цитирования (ничьи допускались). По общему предпочтению победила DR-Tulu, но двое из трёх исследователей предпочли AstaBrief другим системам по метрикам точности цитирования, что демонстрирует пользу наших фильтров качества данных SFT.

image

Столбцы показывают долю сравнений отчётов с оценкой LLM, в которых каждая система победила режим Thinking на одних и тех же вопросах. Человеческие оценки проводились отдельно и не включены. Режим Thinking является эталоном сравнения и не имеет столбца. В отличие от DR-Tulu, Asta Brief оптимизировалась для такого попарного ранжирования отчётов на этапе DPO.

Эти цифры лучше воспринимать как подтверждение инженерного подхода на момент его разработки, а не как утверждение о положении именно этой базовой модели относительно современного передового уровня. Экосистема моделей быстро меняется; мы ожидаем, что обобщаться будут уроки, связанные с созданием данных, фильтрацией атрибуции и обслуживанием моделей.

Проверка полезности AstaBrief в Asta показала многообещающее раннее использование быстрого режима. Среди 374 пользователей Asta, опробовавших его, 29,1% использовали его в течение двух или более дней, а пользователи в среднем создавали с его помощью 3,67 цепочки отчётов. Двадцать три процента пользователей, попробовавших быстрый режим, продолжили им пользоваться и больше не возвращались к режиму Thinking в последующих цепочках. Ещё 18% переключались между быстрым режимом и Thinking в зависимости от своих целей, используя быстрый режим примерно в 40% цепочек.

Хотя отзывов обычно недостаточно для уверенных выводов, мы видим, что быстрый режим получает положительные отзывы примерно с такой же частотой, как и режим Thinking (84,2% против 85,2%).

Что дальше

Генерация отчётов в Asta — первое производственное применение AstaBrief, предоставляющее исследователям быстрый режим с открытыми весами наряду с существующим режимом Thinking. Поскольку веса модели открыты, организации могут развернуть её на собственном оборудовании, в том числе за собственным межсетевым экраном, не полагаясь на API проприетарной модели для генерации отчётов.

В Asta это также означает, что мы можем напрямую изучать и улучшать эту часть конвейера генерации отчётов, сохраняя режим Thinking как вариант для более ресурсоёмких задач.

Нам ещё многое предстоит сделать. Мы изучаем более детальное обучение на предпочтениях, более сильные подходы, сочетающие RAG и RL, возможности многошагового взаимодействия и работы с несколькими инструментами, дополнительные источники научных данных и декомпозицию запросов. Нас также интересуют оценки, которые выходят за рамки проверки наличия у утверждения подтверждающей цитаты и выясняют, сохраняет ли модель доказательную — как для более точной оценки качества отчёта как исследовательского материала, так и для проверки того, сохраняет ли модель доказательный охват своих источников. Сюда относятся такие качества, как краткость и организация, а также способность модели не превращать результаты, относящиеся к конкретной выборке, в широкие обобщения и описательные результаты — в рекомендации.

AstaBrief — один из экспериментов в рамках длительной работы над языковыми моделями для науки: от ScholarQA и DR Tulu до будущих версий Olmo, которые уже начинают формироваться. Уроки этого проекта — особенно в области обучающих данных, фильтрации и оценки — помогут определить, что мы будем создавать дальше.

Попробуйте быструю модель в Asta уже сегодня или скачайте AstaBrief с Hugging Face.

Модели, упомянутые в этой статье 1

Коллекции, упомянутые в этой статье 1

Сообщество

Загружайте изображения, аудио и видео, перетаскивая их в текстовое поле, вставляя или нажимая здесь.
Нажмите или вставьте сюда, чтобы загрузить изображения

· Зарегистрируйтесь или войдите, чтобы оставить комментарий

Модели, упомянутые в этой статье 1

Коллекции, упомянутые в этой статье 1

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием Hugging Face

Читать оригинал на Hugging Face ↗

Текст и изображения принадлежат Hugging Face и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости