Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Adaption Labs представя „Invent a Dataset“: обучаващи данни, генерирани от описание на задача, а не от изходен корпус

Тази седмица Adaption Labs представи Invent a Dataset. Функцията генерира структуриран набор от данни, готов за обучение, въз основа на описание на поведението, което искате моделът да усвои. Не е необходимо да разполагате с изходен корпус, предварително дефинирана схема или ръководство за анотиране.

Може ли да се внедри? Да, с една уговорка. Invent a Dataset вече е наличен в приложението Adaption и чрез Python SDK и REST API. Генерираните редове могат да се изтеглят като JSONL, JSON, CSV или Parquet, така че полученият артефакт е преносим файл, който притежавате и можете да използвате за обучение навсякъде. Самото генериране се извършва на хостваната платформа на Adaption и използва кредити. Не е документиран вариант за генериране със собствен хостинг.

Проблемът, към който е насочено решението

Повечето работни процеси за създаване на набори от данни започват с вече съществуващи данни. След това екипите прекарват седмици в анотиране, филтриране и преструктуриране на данните, за да ги доближат до целевата задача. Аргументът на Adaption е, че това ограничава качеството на модела до степента, в която наличните данни съответстват на желаното поведение. При собствени и специализирани задачи релевантният сигнал обикновено се намира във вътрешни системи, неструктуриран текст или журнали на работни процеси. Той рядко се преобразува безпроблемно във фокусиран набор от данни за обучение.

Изследователският екип също прави разграничение спрямо съществуващите инструменти за синтетични данни. Тези инструменти автоматизират генерирането, след като човек вече е дефинирал схемата, разпределението на задачите и стратегията за генериране. Invent a Dataset започва една стъпка по-рано — от самото поведение.

Как работи API

Механиката е документирана и конкретна. Едно извикване на datasets.invent създава набора от данни и стартира генерирането, като незабавно връща статус running. След това извиквате периодично datasets.get, докато статусът стане succeeded или failed, и изтегляте редовете.

Кодовете на домейните са основният механизъм за управление. Получавате актуалните кодове чрез datasets.invent_domains, вместо да ги задавате твърдо. След това подавате стойности като medical, като по желание ги ограничавате чрез квалифицирани кодове на поддомейни, например medical.symptoms_diagnosis. Изисква се поне един домейн или поддомейн. Няколко домейна могат да участват в едно и също изпълнение. Подаден домейн без поддомейни използва целия си обхват.

Поддържат се два изходни формата. instruction_dataset е форматът по подразбиране и създава двойки от подсказки и отговори за контролирано дообучаване. preference_pairs създава избрани и отхвърлени отговори за обучение, базирано на предпочитания, например DPO.

Три параметъра са важни за производствена употреба. estimate=True изчислява цената на точното запитване и връща прогнозните и наличните кредити, без да създава или таксува каквото и да било. prompt приема до 10 000 знака, за да насочи какво точно да съдържат редовете. idempotency_key приема до 255 знака и прави повторните опити при мрежови проблеми безопасни, като връща оригиналния набор от данни, вместо да стартира второ изпълнение. Броят редове е ограничен при всяко стартиране в зависимост от вашия план.

Разширяване на езиците и локалите

language_expansion работи в два режима. translate създава нов вариант на реда за всеки целеви език. localize създава вариант за всяка комбинация от държава и език, като използва специфична за локала формулировка, а не директен превод. sample_rate между 0.01 и 1 определя каква част от измислените редове ще бъде разширена, а кредити се начисляват за броя на разширените изходни редове, не за първоначалния брой. Неподдържаните кодове връщат грешка 400 с примерен списък на валидните стойности.

Цикълът с нулево количество данни

Invent a Dataset е първата половина на един цикъл. Идентификаторът на набора от данни се подава директно към autoscientist.create, който съвместно оптимизира данните и рецептата за обучение спрямо вашата цел. AutoScientist беше представен през май 2026 г. и е съответстващият компонент от страната на обучението към стълба Adaptive Data.

Adaption съобщава, че AutoScientist превъзхожда обучението, конфигурирано от собствения му изследователски екип, средно с 35%. Процентът на победите се е увеличил от 48% на 64%. Тези показатели са от вътрешни оценки, специализирани по домейни, в осем вертикални сектора. Размерът на наборите от данни варира от 5000 до 100 000 реда, при архитектури, предлагани за дообучаване от Together AI.

Основни изводи

  • Invent a Dataset генерира редове за обучение от описание на задача, без изходен корпус, схема или етикети.
  • Едно извикване на datasets.invent задава домейните, броя редове, формата и разширяването на езиците; генерирането е асинхронно.
  • Изходът представлява двойки от инструкции или двойки от предпочитания и може да бъде изтеглен като JSONL, JSON, CSV или Parquet.
  • Идентификаторите на наборите от данни се подават директно към AutoScientist, затваряйки цикъла от намерение до обучен модел.

Вижте техническите подробности тук. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit за машинно обучение с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Имате нужда от партньор за популяризирането на вашето GitHub хранилище, страница в Hugging Face, представяне на продукт, уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини