Модель, которой не существовало, поэтому вы создали её сами
В течение следующих нескольких дней я таким же способом создал ещё пять моделей. Каждая начиналась с сообщения в HuggingChat с включённым ML-intern и завершалась публикацией открытой модели на Hub с её оценкой в карточке модели. ML-intern планирует работу, запрашивает у меня бюджет до начала каких-либо трат, проводит небольшой тест перед основной задачей, затем обучает, оценивает и публикует модель на оборудовании Hugging Face.
Как я задаю промпты ML Intern
Именно на первое сообщение я трачу больше всего усилий. Мой первый промпт для модели citrus, представленный ниже, занимал около 450 слов. К шестому проекту он увеличился примерно до 2 000 слов, потому что каждый проект подсказывал мне, что я хочу добавить в следующий. Все семь промптов доступны на GitHub по адресу yvrjsharma/ml-intern-prompts — в точности в том виде, в котором я их написал.
Промпт начинается с идеи в одной строке и объяснения, зачем она мне нужна. Затем в нём указываются точные компоненты: датасет, базовая модель, скрипт обучения. Всё, что я уже проверил, помещается под заголовок, буквально звучащий как «Проверенные факты, не выводить заново», чтобы агент тратил свой бюджет на работу, а не на повторное открытие уже известных мне вещей. Для LoRA с углом обзора камеры в этом разделе было указано, какой тренер недавно добавил поддержку прозрачных изображений и какие открытые задачи на GitHub делали запасной тренер рискованным.
Две строки в промпте имеют критическое значение. В первой запрашивается базовый результат до начала обучения. Например, в промпте citrus сказано: «Также сообщи оценку базовой модели без обучения по той же метрике, чтобы мы могли увидеть прирост». Без этого вы получаете обученную модель, но не знаете, лучше ли она той, с которой вы начали. Вторая — это дымовой тест с проверкой. Для LoRA изображений я запросил 50 шагов обучения, а затем проверку того, что сохранённые веса действительно изменились, прежде чем оплачивать полный запуск.
В конце промпта я перечисляю ожидаемые результаты и ограничиваю стоимость. Я определяю, что должно входить в карточку модели, и добавляю инструкцию вроде: «Ограничь общие расходы 12 долларами США и спроси меня, прежде чем превысить эту сумму». Поскольку ML-intern начинает каждую задачу с нулевым бюджетом и требует разрешения перед выполнением платных задач, это ограничение расходов строго соблюдается. Если не указать бюджет, агент предлагает несколько вариантов в зависимости от масштаба проекта и спрашивает, какой из них вы предпочитаете.
Не обязательно включать всё это с первой попытки. Например, в моём описании citrus не было раздела проверенных фактов, но ML Intern всё равно создал модель, которая более чем втрое повысила точность модели Qwen3.5-2B. Позвольте рассказать о 6 вещах, которые я создал с помощью ML-Intern всего за несколько дней.
1. Модель, которая знает вашу область
Универсальная модель компьютерного зрения может описать пожелтевший лист цитрусового дерева. Но определить, вызвано ли это проблемой с клещами или дефицитом магния, а также предложить биологические и небиологические способы лечения растения — очень сложная задача. С помощью Claude я собрал обучающий датасет из трёх источников, размещённых организацией Project-AgML на Hub. Получившийся citrus-disease-vlm-instruct — это датасет, содержащий 3 017 размеченных изображений, охватывающих 21 отдельный вид вредителей, заболеваний, дефицита питательных веществ и методов лечения. ML-intern выполнил дообучение Qwen3.5-2B на этих примерах, предварительно убедившись, что базовая модель прошла оценку.
На 335 тестовых фотографиях базовая модель правильно определила проблему в 14,9% случаев. После двух эпох на одной A10G дообученная модель достигла 52,8%. Стоимость вычислений составила около 1,90 доллара США.
Смотрите: Модель · Датасет · Приложение Citrus Doctor
2. Модель, которая рисует вашего персонажа
Модели изображений знают множество персонажей. Huggy, нарисованный в плоском стиле брендовых материалов Hugging Face, среди них не было. Я попросил ML-Intern создать LoRA для FLUX.2 klein base 4B, обученную на 84 рисунках с подписями из датасета Chunte/huggy_for_training.
Агент сохранял контрольную точку каждые 100 шагов и создавал один и тот же набор промптов для каждой из них, что упростило выбор. На шаге 200 Huggy впервые полностью соответствовал модели. Начиная с шага 500 стиль Huggy начал проникать в промпты, никак с Huggy не связанные! Обученная LoRA также работает на дистиллированной модели klein за 4 шага. Стоимость вычислений составила около 7,60 доллара США.
Смотрите: Модель · Датасет · Приложение Huggy Generator
3. Модель, которая умеет делать новый трюк
- LoRA для угла обзора камеры — одно из самых популярных дополнений сообщества для предыдущих моделей Qwen-Image. Можно дать модели изображение объекта и попросить показать его под углом 45 градусов слева. Когда через несколько дней после выпуска Qwen-Image 2.1 я проверил доступные решения, такой модели ещё никто не создал, поэтому я поручил ML-intern разработать её.
ML-intern визуализировал 1 030 отсканированных предметов домашнего обихода из Google Scanned Objects под 24 углами каждый — всего 24 722 прозрачных изображения — в CPU-задаче стоимостью несколько центов. Затем он отобрал 461 объект для обучения и 40 для тестирования, а также создал 1 844 пары изображений «до и после обучения», равномерно распределённые по 23 инструкциям для камеры.
Обучение заняло 2 000 шагов и около 90 минут на одной A100 (примерно 3,75 доллара США). Весь проект занял около половины дня и 48 задач, включая те, что завершились ошибкой из-за отсутствующих пакетов или неверных путей и были повторно отправлены ML-Intern. Общая стоимость вычислений составила около 16 долларов США.
Смотрите: Модель · Датасет · Приложение Viewpoint Orbit
- LoRA Doodle-in — ещё одна интересная идея. Загрузите фотографию с пурпурным наброском и добавьте короткий промпт с названием объекта. LoRA заменяет набросок этим объектом, сохраняя исходное освещение и композицию.
Для этого не существовало датасета, поэтому в промпте я описал, как его создать. Нужно взять настоящую фотографию из Open Images, удалить один объект с помощью модели дорисовки LaMa и нарисовать набросок там, где раньше находился объект. Нетронутая фотография служит целевым изображением. ML-intern написал и протестировал скрипты формирования пар в CPU-песочнице, а затем запустил их как GPU-задачи, по пути записывая автора и лицензию каждой исходной фотографии. Он создал 6 042 обучающие пары и тестовый набор из 160 пар, 40 из которых происходят из 23 классов объектов, полностью исключённых из обучения.
До обучения он отдельно измерил показатели базовой модели и модели с LoRA Viggle turbo, а также проверил, что пакетная обработка изменений создаёт идентичные изображения, что сделало оценку дешевле. Обучение заняло 2 000 шагов, 1 час 38 минут на одной A100 (около 4 долларов США), а сравнение сохранённых контрольных точек на 48 тестовых парах позволило выбрать шаг 500.
В сочетании с LoRA Viggle turbo за 6 шагов LoRA показала отличные результаты. 67,5% объектов были обнаружены там, где они были нарисованы, при 4,7 секунды на одно изменение. Объекты из 23 невиданных классов размещались с такой же надёжностью, как и остальные (65,0% против 64,2%). Проект занял чуть больше дня и 59 задач. Общая стоимость вычислений составила около 24 долларов США.
Смотрите: Модель · Датасет · Приложение Doodle-in
4. Модель, которая помещается на вашем устройстве
- Pocket Rewriter из начала этой статьи — первая из них. ML-intern начал с генерации 8 797 коротких запросов для изображений с помощью небольшой instruct-модели через Inference Providers, следуя набору, указанному в моём промпте: фотографии, постеры, логотипы, инфографика и другое; примерно треть запросов требовала точного текста в кавычках, а многие были написаны не на английском языке. Затем учитель на 9B переписал их все на одной A100 за 2 часа 37 минут (около 6,50 доллара США). После фильтрации по качеству для обучающего датасета было отобрано 1 840 примеров.
Обучение студентов на 0,8B и 2B заняло 12 и 18 минут на A10G (0,75 доллара США за обе модели). Версия на 0,8B также поставляется в виде файла GGUF размером 812 МБ для запуска на CPU. Проект занял около 11 часов и 24 задачи. Общая стоимость вычислений составила около 16 долларов США.
Смотрите: Студент Pocket rewriter 0.8B · Студент 2B · Датасет · Приложение Pocket Studio · Сравнить учителя и студента в Rewriter Arena
- Agate-Preview-002-4step — вторая. Agate Preview 002 от Logolabs — текстово-изобразительная модель со 260 миллионами параметров, достаточно маленькая для браузера, но ей требуется 50 шагов с guidance, то есть 100 проходов сети для одного изображения. Я попросил ML-intern дистиллировать её всего до 4 проходов!
Понадобилось два запуска. В первом было закэшировано 155 000 обучающих изображений в виде латентов, guidance был встроен в модель, а затем количество шагов поэтапно уменьшалось с 16 до 8 и затем до 4 — всё на A100. Студент на 4 шага превзошёл результат учителя на тех же 4 шагах по GenEval и FID, после чего ML-intern экспортировал его в ONNX для браузера. Этот запуск занял около 13 часов и стоил 22 доллара США.
Во втором запуске я попросил ML-Intern ещё немного улучшить студента на 4 шага. Затем он создал ещё 24 000 пар изображений с учителем на 16 шагах и около часа дообучал на них студента на 4 шага. GenEval вырос с 0,509 до 0,536 против 0,563 у учителя на 50 шагах — всего за 4 шага, то есть при четверти вычислительных затрат. ML-intern повторно экспортировал браузерную версию. Второй запуск занял около 8 часов. Общая стоимость вычислений за оба запуска составила около 37 долларов США.
Смотрите: Модель Agate на 4 шага · Датасет · Запустить Agate в браузере · Agate 4-step LIVE
Сколько это стоило
| Модель | Базовая модель | Вычисления |
|---|---|---|
| Citrus Doctor | Qwen3.5-2B | 1,90 доллара США |
| Huggy LoRA | FLUX.2 klein base 4B | 7,60 доллара США |
| Pocket rewriter (0,8B и 2B) | Qwen3.5-0.8B и 2B | 16,05 доллара США |
| Viewpoint Orbit LoRA | Qwen-Image 2.1 | 16 долларов США |
| Doodle-in LoRA | Qwen-Image 2.1 | 24,30 доллара США |
| Agate 4-step (два запуска) | Agate Preview 002 | 37 долларов США |
| Итого | около 103 долларов США |
Это расходы на GPU- и CPU-задачи, указанные для каждого сеанса.
Создайте свою
ML-intern доступен в HuggingChat. Включите режим ML-intern и вставьте промпт. Если вам нужна отправная точка, мои примеры промптов можно свободно копировать. Начните с модели, которая, по вашему мнению, должна существовать, и имеющегося у вас датасета — или датасета, который вы можете описать. Задайте небольшой бюджет, запросите базовый результат и дымовой тест, а затем изучите полученный результат, прежде чем увеличивать лимит.
Если вы создадите что-нибудь с его помощью, поделитесь этим в X и отметьте @Gradio и @HuggingFace. Мы будем рады увидеть модели, которые вы создадите, хотя никто другой не догадался бы сделать их для вас.
Модели, упомянутые в этой статье 10
Датасеты, упомянутые в этой статье 7
Пространства, упомянутые в этой статье 8
Сообщество
· Зарегистрируйтесь или войдите, чтобы оставить комментарий
Модели, упомянутые в этой статье 10
Датасеты, упомянутые в этой статье 7
Пространства, упомянутые в этой статье 8
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.