Adaption Labs представляет «Invent a Dataset»: обучающие данные генерируются из описания задачи, а не из исходного корпуса
На этой неделе Adaption Labs выпустила Invent a Dataset. Эта функция создает структурированный, готовый для обучения датасет на основе описания поведения, которому вы хотите обучить модель. Вам не нужны исходный корпус, заранее заданная схема или руководство по разметке.
Можно ли его развернуть? Да, с одной оговоркой. Invent a Dataset уже доступен в приложении Adaption, а также через Python SDK и REST API. Сгенерированные строки можно скачать в форматах JSONL, JSON, CSV или Parquet, поэтому полученный артефакт представляет собой переносимый файл, которым вы владеете и который можете использовать для обучения где угодно. Сама генерация выполняется на размещенной платформе Adaption и расходует кредиты. Возможность самостоятельного размещения генерации не задокументирована.
Решаемая проблема
Большинство рабочих процессов создания датасетов начинается с уже существующих данных. Затем команды тратят недели на их разметку, фильтрацию и преобразование, чтобы приблизить их к целевой задаче. По мнению Adaption, это ограничивает качество модели тем, насколько имеющиеся данные соответствуют предполагаемому поведению. В случае специализированных и принадлежащих компании задач необходимый сигнал обычно содержится во внутренних системах, неструктурированном тексте или журналах рабочих процессов. Преобразовать его в целевой обучающий набор обычно непросто.
Исследовательская команда также противопоставляет свой подход существующим инструментам для работы с синтетическими данными. Такие инструменты автоматизируют генерацию после того, как человек уже определил схему, распределение задач и стратегию генерации. Invent a Dataset начинает на уровень раньше — с самого поведения.
Как работает API
Механика работы подробно задокументирована и вполне конкретна. Один вызов datasets.invent создает датасет и запускает генерацию, немедленно возвращая статус running. Затем вы опрашиваете datasets.get, пока статус не изменится на succeeded или failed, после чего скачиваете строки.
Основным элементом управления являются коды доменов. Актуальные коды извлекаются с помощью datasets.invent_domains, а не задаются жестко. Затем можно передать такие значения, как medical, при необходимости сузив область с помощью квалифицированных кодов поддоменов, например medical.symptoms_diagnosis. Требуется указать как минимум один домен или поддомен. Несколько доменов могут участвовать в одном запуске. Домен, переданный без поддоменов, охватывает всю свою область.
Поддерживаются два формата вывода. instruction_dataset используется по умолчанию и создает пары «запрос — завершение» для контролируемой тонкой настройки. preference_pairs создает выбранные и отклоненные варианты завершения для обучения на основе предпочтений, например DPO.
Для промышленного использования важны три параметра. estimate=True рассчитывает стоимость точного запроса и возвращает оценку и доступное количество кредитов, ничего не создавая и не списывая. Параметр prompt позволяет передать до 10 000 символов, чтобы задать тематику строк. Параметр idempotency_key принимает до 255 символов и делает повторы сетевых запросов безопасными: вместо запуска второго процесса возвращается исходный датасет. Количество строк ограничено лимитом на один запуск, установленным вашим тарифным планом.
Расширение языков и локалей
language_expansion работает в двух режимах. translate создает новый вариант строки для каждого целевого языка. localize создает вариант для каждой пары страны и языка, используя формулировки, специфичные для локали, а не прямой перевод. Параметр sample_rate в диапазоне от 0.01 до 1 управляет долей придуманных строк, которые будут расширены, а кредиты начисляются за количество строк в расширенном выводе, а не в исходном наборе. Неподдерживаемые коды приводят к ошибке 400 с примером допустимых значений.
Цикл без исходных данных
Invent a Dataset — это первая половина цикла. Идентификатор датасета напрямую передается в autoscientist.create, который совместно оптимизирует данные и рецепт обучения под вашу целевую функцию. AutoScientist был запущен в мае 2026 года и представляет собой аналог компонента Adaptive Data со стороны обучения.
По данным Adaption, AutoScientist превосходит настройки обучения, подготовленные ее собственными исследовательскими сотрудниками, в среднем на 35%. Доля побед выросла с 48% до 64%. Эти показатели получены в ходе внутренних специализированных отраслевых оценок по восьми вертикалям. Размер датасетов составлял от 5 000 до 100 000 строк; использовались архитектуры, доступные для тонкой настройки у Together AI.
Ключевые выводы
- Invent a Dataset генерирует обучающие строки на основе описания задачи, без исходного корпуса, схемы или меток.
- Один вызов
datasets.inventзадает домены, количество строк, формат и расширение языков; генерация выполняется асинхронно. - Результат представляет собой пары инструкций или пары предпочтений и доступен для скачивания в форматах JSONL, JSON, CSV или Parquet.
- Идентификаторы датасетов напрямую передаются в AutoScientist, замыкая цикл от намерения до обученной модели.
Ознакомьтесь с техническими подробностями здесь. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тысячами участников и подписаться на нашу рассылку. Стоп! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.
Хотите сотрудничать с нами для продвижения вашего репозитория GitHub, страницы Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.