Adaption Labs представляє «Invent a Dataset»: навчальні дані генеруються з опису завдання, а не з початкового корпусу
Цього тижня Adaption Labs випустила Invent a Dataset. Ця функція генерує структурований набір даних, готовий для навчання, на основі опису поведінки, якої ви хочете навчити модель. Вам не потрібні початковий корпус даних, попередньо визначена схема чи інструкція з розмітки.
Чи можна це розгортати? Так, із одним застереженням. Invent a Dataset уже доступний у застосунку Adaption, а також через Python SDK і REST API. Згенеровані рядки можна завантажити у форматах JSONL, JSON, CSV або Parquet, тож отриманий артефакт є портативним файлом, який належить вам і може використовуватися для навчання будь-де. Сама генерація виконується на платформі Adaption і споживає кредити. Задокументованого шляху для самостійного розгортання генерації немає.
Проблема, на яку спрямовано рішення
Більшість процесів роботи з наборами даних починаються з даних, які вже існують. Потім команди тижнями розмічають, фільтрують і переформатовують їх, щоб наблизити до цільового завдання. Adaption стверджує, що це обмежує якість моделі тим, наскільки доступні дані відповідають бажаній поведінці. Для власних і спеціалізованих завдань відповідний сигнал зазвичай міститься у внутрішніх системах, неструктурованому тексті або журналах робочих процесів. Він рідко безпосередньо перетворюється на цілеспрямований навчальний набір даних.
Дослідницька команда також відмежовує цей підхід від наявних інструментів для роботи із синтетичними даними. Такі інструменти автоматизують генерацію після того, як людина вже визначила схему, розподіл завдань і стратегію генерації. Invent a Dataset починає на рівень раніше — безпосередньо з поведінки.
Як працює API
Механізм роботи задокументований і конкретний. Один виклик datasets.invent створює набір даних і запускає генерацію, одразу повертаючи статус running. Потім ви опитуєте datasets.get, доки статус не стане succeeded або failed, і завантажуєте рядки.
Основним елементом керування є коди доменів. Поточні коди отримують за допомогою datasets.invent_domains, а не задають жорстко в коді. Потім ви передаєте такі значення, як medical, за потреби звузивши їх за допомогою кваліфікованих кодів піддоменів, наприклад medical.symptoms_diagnosis. Потрібно вказати принаймні один домен або піддомен. Кілька доменів можуть бути включені до одного запуску. Домен, переданий без піддоменів, охоплює весь відповідний спектр.
Підтримуються два формати виведення. instruction_dataset використовується за замовчуванням і створює пари запит-відповідь для контрольованого донавчання. preference_pairs створює вибрані та відхилені варіанти відповідей для навчання на основі переваг, наприклад DPO.
Для промислового використання важливі три параметри. estimate=True розраховує вартість точного запиту й повертає оцінку порівняно з доступними кредитами, не створюючи набір даних і не списуючи нічого. prompt приймає до 10 000 символів, щоб спрямувати тематику рядків. idempotency_key приймає до 255 символів і робить повторні мережеві запити безпечними, повертаючи початковий набір даних замість запуску другого процесу. Кількість рядків обмежується лімітом на один запуск, установленим вашим тарифним планом.
Розширення мов і локалей
language_expansion працює у двох режимах. translate створює новий варіант рядка для кожної цільової мови. localize створює варіант для кожної пари країна-мова, використовуючи формулювання, специфічні для локалі, а не прямий переклад. Значення sample_rate від 0.01 до 1 визначає, яка частка вигаданих рядків буде розширена, а кредити списуються за кількість рядків у розширеному результаті, а не в оригіналі. Непідтримувані коди повертають помилку 400 із прикладом дійсних значень.
Цикл без даних
Invent a Dataset є першою половиною циклу. Ідентифікатор набору даних безпосередньо передається до autoscientist.create, який спільно оптимізує дані та рецепт навчання відповідно до вашої цілі. AutoScientist був запущений у травні 2026 року й є відповідником Adaptive Data на етапі навчання.
Adaption повідомляє, що AutoScientist перевершує результати навчання, налаштованого власними дослідниками компанії, у середньому на 35%. Частка перемог зросла з 48% до 64%. Ці показники отримано під час внутрішніх спеціалізованих для доменів оцінювань у восьми вертикалях. Розміри наборів даних становили від 5 000 до 100 000 рядків, а архітектури були доступні для донавчання через Together AI.
Основні висновки
- Invent a Dataset генерує навчальні рядки на основі опису завдання без початкового корпусу, схеми чи міток.
- Один виклик
datasets.inventвизначає домени, кількість рядків, формат і розширення мов; генерація виконується асинхронно. - Результатом є пари інструкція-відповідь або пари переваг, які можна завантажити у форматах JSONL, JSON, CSV або Parquet.
- Ідентифікатори наборів даних безпосередньо передаються до AutoScientist, замикаючи цикл від наміру до навченої моделі.
Ознайомтеся з технічними деталями тут. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого субреддіту ML із понад 150 тис. учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.
Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.