Sakhanda Wire
NVDA — MSFT — GOOGL — META — AMZN —
← Към новините

Моделът, който не съществуваше, затова си го направихте сами

Моделът, който не съществуваше, затова го създадохте сами
Публикувано 8 октомври 2026 г.
Актуализиране в GitHub
Миналата седмица исках малка версия на преписвача на подсказки, който се доставя с Qwen-Image 2.1. Официалният модел е 9B и се нуждае от около 20 GB памет, като разсъждава върху хиляди токени, преди да напише един-единствен абзац. В Hub намерих само компресирани копия на същия 9B модел. Затова описах какво искам на ML Intern, а на следващия ден имах версия 0.8B, която работи на CPU. Тя връща валиден резултат в 99,7% от случаите и използва около една четвърт от токените на учителя. Изчислителните разходи за целия проект, включително етикетирането на 8 797 примерни заявки от 9B модела, възлязоха на 16 щатски долара.

През следващите няколко дни създадох още пет модела по същия начин. Всеки започна като съобщение в HuggingChat с включен ML-intern, а завърши като публичен модел в Hub с оценката си в картата на модела. ML-intern планира работата, иска от мен бюджет, преди да изразходва каквото и да е, изпълнява малък тест преди същинската задача, след което обучава, оценява и публикува на хардуер на Hugging Face.

Как подканвам ML Intern

Първото съобщение е мястото, където влагам най-много усилия. Първата ми подсказка за модела citrus, споделен по-долу, беше около 450 думи. До шестия ми проект тя беше по-близо до 2 000 думи, защото всеки проект ме научи на нещо, което исках да включа в следващия. И седемте подсказки са в GitHub на yvrjsharma/ml-intern-prompts, точно както съм ги написал.

Подсказката започва с идеята в един ред и причината, поради която я искам. След това посочва точните компоненти: набора от данни, базовия модел и скрипта за обучение. Всичко, което вече съм проверил, се поставя под заглавие, което буквално гласи „Проверени факти, не ги извеждай наново“, така че агентът да изразходва бюджета си за работа, вместо да преоткрива неща, които вече знам. За LoRA модела за ъгъла на камерата тази секция посочваше кой обучаващ инструмент току-що е добавил поддръжка за изображения с прозрачност и кои отворени GitHub issue-та правят резервния обучаващ инструмент рисков.

Два реда в подсказката са критични. Първият изисква базова оценка преди всяко обучение. Например подсказката за citrus гласи: „Съобщи и резултата на базовия модел без допълнително обучение по същата метрика, за да видим подобрението.“ Без това получавате обучен модел, но нямате представа дали е по-добър от модела, с който сте започнали. Вторият е димов тест с прикрепена проверка. За LoRA моделите за изображения поисках 50 стъпки на обучение, след което проверка дали записаните тегла действително са се променили, преди да платя за пълното изпълнение.

В края на подсказката описвам очакваните резултати и ограничавам разходите. Определям какво трябва да съдържа картата на модела и включвам инструкция като: „Ограничете общите разходи до 12 щатски долара и ме попитайте, преди да ги надхвърлите.“ Тъй като ML-intern започва всяка задача с нулев бюджет и се нуждае от разрешение, преди да изпълни платени задачи, това ограничение на разходите се спазва стриктно. Когато не посочите бюджет, агентът предлага няколко варианта според мащаба на проекта и пита кой предпочитате.

Не е задължително да ви е необходимо всичко това още при първия опит. Например в моето задание за citrus нямах секция проверени факти, но ML Intern все пак създаде модел, който повиши повече от три пъти точността на модела Qwen3.5-2B. Нека ви разкажа за 6 неща, които създадох с Ml-Intern само за няколко дни.

1. Модел, който познава вашата област

Един общ модел за зрение може да опише пожълтяващ лист на цитрусово растение. Много е трудно обаче да ви каже дали проблемът е свързан с акари или с недостиг на магнезий, както и какви биологични и небиологични средства да използвате за третиране на растението. С помощта на Claude съставих набор от данни за обучение, обединен от три източника, хоствани от организацията Project-AgML в Hub. Полученият набор от данни citrus-disease-vlm-instruct съдържа 3 017 анотирани изображения на 21 различни вредители, заболявания, хранителни дефицити и подходи за третиране. ML-intern се погрижи за дообучаването на Qwen3.5-2B с тези примери, като предварително се увери, че базовият модел е оценен.

От 335-те тестови снимки базовият модел назоваваше правилния проблем в 14,9% от случаите. След две епохи на един A10G дообученият модел постигна 52,8%. Изчислителни разходи: около 1,90 щатски долара.

Вижте: Модел · Набор от данни · Приложение Citrus Doctor

2. Модел, който рисува вашия персонаж

Моделите за изображения познават много персонажи. Huggy, нарисуван в плоския стил на брандовите материали на Hugging Face, не беше сред тях. Поисках от ML-Intern LoRA модел върху FLUX.2 klein base 4B, обучен с 84 изображения с надписи от набора от данни Chunte/huggy_for_training.

Агентът записваше контролна точка на всеки 100 стъпки и генерираше един и същ набор от подсказки с всяка от тях, което улесни избора. Стъпка 200 беше първата, при която Huggy напълно съответстваше на модела. От стъпка 500 нататък стилът на Huggy започна да се просмуква в подсказки, които нямаха нищо общо с Huggy! Обученият LoRA модел работи и с дестилирания klein модел при 4 стъпки. Изчислителни разходи: около 7,60 щатски долара.

Вижте: Модел · Набор от данни · Приложение Huggy Generator

3. Модел, който изпълнява нов трик

  1. LoRA модели за ъгъла на камерата са сред най-харесваните допълнения от общността за по-ранните модели Qwen-Image. Можете да дадете на модела снимка на обект и да поискате да го видите под ъгъл 45 градуса отляво. Когато проверих няколко дни след излизането на модела Qwen-Image 2.1, никой не беше създал такъв, затова възложих на ML-intern да го изгради.

LoRA за ъгъла на камерата за Qwen

ML-intern изобрази 1 030 сканирани домакински предмета от Google Scanned Objects от 24 ъгъла всеки — 24 722 прозрачни изображения — в CPU задача, която струваше няколко цента. По-късно финализира 461 предмета за обучение и отдели 40 за тестване, както и 1 844 двойки изображения преди и след обучението, разпределени равномерно между 23 инструкции за камерата.

Обучението продължи 2 000 стъпки за около 90 минути на един A100 (~3,75 щатски долара). Целият проект отне около половин ден и 48 задачи, включително тези, които се провалиха заради липсващи пакети или грешни пътища и трябваше да бъдат изпратени повторно от ML-Intern. Общи изчислителни разходи: около 16 щатски долара.

Вижте: Модел · Набор от данни · Приложение Viewpoint Orbit

  1. LoRA Doodle-in е друга интересна идея. Качете снимка с пурпурна драскулка върху нея и добавете кратка подсказка, назоваваща обект. LoRA моделът заменя драскулката с този обект, като запазва оригиналното осветление и композиция.

За това не съществуваше набор от данни, затова в подсказката си описах как да бъде създаден. Започнете с реална снимка от Open Images, премахнете един обект с модела за запълване LaMa и нарисувайте драскулка там, където е бил обектът. Непроменената снимка е целта. ML-intern написа и тества скриптовете за изграждане на двойки в CPU пясъчник, след което ги изпълни като GPU задачи, като през цялото време записваше автора и лиценза на всяка изходна снимка. Той създаде 6 042 двойки за обучение и тестов набор от 160 двойки, като 40 от тестовите двойки са от 23 класа обекти, които изцяло не са били включени в обучението.

Преди обучението измери базовия модел самостоятелно и с Viggle turbo LoRA, както и провери дали изпълнението на редакциите на партиди създава идентични изображения, което направи оценяването по-евтино. Обучението продължи 2 000 стъпки за 1 час и 38 минути на един A100 (~4 щатски долара), а сравнение на записаните контролни точки върху 48 тестови двойки избра стъпка 500.

В комбинация с Viggle turbo LoRA при 6 стъпки LoRA моделът се представи много добре. 67,5% от обектите са били разпознати на мястото, където са били нарисувани, при 4,7 секунди на редакция. Обектите от 23-те невиждани класа са се появили също толкова надеждно, колкото и останалите (65,0% спрямо 64,2%). Проектът отне малко повече от ден и 59 задачи. Общи изчислителни разходи: около 24 щатски долара.

Вижте: Модел · Набор от данни · Приложение Doodle-in

4. Модел, който се побира на вашето устройство

  1. Pocket Rewriter от началото на тази публикация е първият. ML-intern започна с генерирането на 8 797 кратки заявки за изображения с малък instruct модел чрез Inference Providers, следвайки комбинация, зададена в моята подсказка: снимки, плакати, лога, инфографики и други; около една трета от тях изискваха точен текст в кавички, а много от тях бяха на езици, различни от английския. След това учителят 9B пренаписа всички заявки на един A100 за 2 часа и 37 минути (~6,50 щатски долара). След филтриране за качество 1 840 примера бяха избрани за набора от данни за обучение.
Qwen Image 2.1 Pocket Studio

Обучението на студентите 0.8B и 2B отне съответно 12 и 18 минути на A10G (0,75 щатски долара общо). Моделът 0.8B се предлага и като GGUF файл с размер 812 MB за работа на CPU. Проектът отне около 11 часа и 24 задачи. Общи изчислителни разходи: около 16 щатски долара.

Вижте: Студент Pocket rewriter 0.8B · Студент 2B · Набор от данни · Приложение Pocket Studio · Сравнете учителя и студента в Rewriter Arena

  1. Agate-Preview-002-4step е вторият. Agate Preview 002 на Logolabs е текстово-към-изображение модел с 260 милиона параметъра, достатъчно малък за браузър, но му трябват 50 стъпки с насочване, което означава 100 мрежови преминавания за едно изображение. Поисках от ML-intern да го дестилира до само 4 преминавания!

Това отне две изпълнения. При първото 155 000 обучаващи изображения бяха кеширани като латентни представяния, насочването беше вградено в модела, а броят на стъпките беше намален поетапно от 16 до 8 и до 4, всичко това на A100. Студентът с 4 стъпки надмина изпълнението на учителя при същите 4 стъпки по GenEval и FID, след което ML-intern го експортира в ONNX за браузъра. Това изпълнение отне около 13 часа и 22 щатски долара.

Направих второ обучение, като помолих ML-Intern да подобри още малко студента с 4 стъпки. След това той създаде още 24 000 двойки изображения с учителя при 16 стъпки и дообучи студента с 4 стъпки спрямо тях за около час. GenEval се повиши от 0,509 на 0,536 спрямо 0,563 за учителя при 50 стъпки — с едва 4 стъпки (една четвърт от изчисленията). ML-intern експортира отново браузърната версия. Второто изпълнение отне около 8 часа. Общи изчислителни разходи за двете изпълнения: около 37 щатски долара.

Вижте: Модел Agate с 4 стъпки · Набор от данни · Стартирайте Agate в браузъра си · Agate 4-step LIVE

Колко струваше

Модел Базов модел Изчисления
Citrus Doctor Qwen3.5-2B 1,90 щатски долара
Huggy LoRA FLUX.2 klein base 4B 7,60 щатски долара
Pocket rewriter (0.8B и 2B) Qwen3.5-0.8B и 2B 16,05 щатски долара
Viewpoint Orbit LoRA Qwen-Image 2.1 16 щатски долара
Doodle-in LoRA Qwen-Image 2.1 24,30 щатски долара
Agate 4-step (две изпълнения) Agate Preview 002 37 щатски долара
Общо около 103 щатски долара

Това са таксите за GPU и CPU задачите, отчетени за всяка сесия.

Създайте свой модел

ML-intern е в HuggingChat. Включете режима ML-intern и поставете подсказка. Ако искате отправна точка, моите примерни подсказки могат да се копират свободно. Започнете с модел, който бихте искали да съществува, и с набор от данни, който имате или можете да опишете. Дайте му малък бюджет, поискайте базова оценка и димов тест и прегледайте получения резултат, преди да увеличите ограничението.

Ако създадете нещо с него, споделете го в X и отбележете @Gradio и @HuggingFace. Ще се радваме да видим моделите, които създавате и които никой друг не би се сетил да изгради за вас.

Модели, споменати в тази статия 10

Набори от данни, споменати в тази статия 7

Пространства, споменати в тази статия 8

Общност

Качвайте изображения, аудио и видеоклипове, като ги плъзнете в текстовото поле, поставите ги или щракнете тук.
Докоснете или поставете тук, за да качите изображения

· Регистрирайте се или влезте, за да коментирате

Модели, споменати в тази статия 10

Набори от данни, споменати в тази статия 7

Пространства, споменати в тази статия 8

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от Hugging Face на

Прочетете оригинала в Hugging Face ↗

Текстът и изображенията са собственост на Hugging Face и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини