Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Обучение на модел за програмиране да рисува акварели с TRL и OpenEnv

Обучение на кодиращ модел да рисува акварели с TRL и OpenEnv
Публикувано 3 септември 2026 г.
Актуализиране в GitHub
Обучение на кодиращ модел да рисува акварели

На 23 август Surya Narreddi публикува красиво видео на акварели, нарисувани от езиков модел. Моделът пише JavaScript чрез p5.brush, библиотека, която „добавя естествени инструменти за рисуване към p5.js“. Видеото бързо стана вирусно — към момента на писане има над 1,5 млн. гледания.

Видеото беше придружено от публикация в блог, обясняваща обучението зад по-ранен и по-тесен етап на проекта — близки планове на цветя, а не пълните композиции от видеото, за съжаление все още без отворени артефакти. На сайта му се казва, че предстои пълен технически доклад, така че го последвайте. Първоначалната идея е негова и идва от сферата на изкуството и дизайна, където уменията му са далеч над моите. Моят опит е от инженерната страна: възпроизвеждам рецептата открито, като публикувам всеки компонент.

Бележка: за контекста зад проекта, разказан от самия Surya, гледайте това видео на дипломната му работа.

В тази статия се опитвам да възпроизведа идеята му с TRL и OpenEnv. Наборът от референтни изображения, RL средата, скриптовете за обучение и обучените модели — всичко е отворено.

Целият процес работи от край до край в Hugging Face:

След като двата Space-а са готови, рецептата се изпълнява с една команда. Дублирайте средата и модела за оценяване, задайте две променливи на средата за сместа от награди и стартирайте:

hf jobs uv run train/watercolour_grpo.py --flavor h200 --timeout 48h --secrets HF_TOKEN -- \
  --env-url https://<you>-watercolour-env.hf.space \
  --model Qwen/Qwen3.5-35B-A3B --lora --all-linear --bf16 --gradient-checkpointing \
  --subject 'a peach hibiscus' --references 4 \
  --top-p 0.95 --top-k 20 \
  --lr 5e-5 --lr-scheduler constant_with_warmup --warmup-steps 5 \
  --scale-rewards none \
  --steps 110 --n-episodes 240 --num-generations 8 \
  --per-device-batch-size 1 --gradient-accumulation-steps 8 \
  --max-completion-length 8192 \
  --run-tag my-run --out <you>/watercolour-grpo --push-to-hub

Останалата част от тази статия разказва как стигнахме дотук, а всеки компонент е в хранилището.

Следвах оригиналната публикация стъпка по стъпка и променях нещо само когато беше строго необходимо. Всяка моя идея отиде в списък, вместо в експеримента, а този списък се превърна в „Какво бих опитал следващо“ в края, заедно с пълния списък на публикуваните артефакти. Ако вече сте прочели публикацията му, рамката и дизайнът на наградата ще са ви познати. Новото е отворената реализация, ръчно оцененият набор и трите обучени и сравнени смеси от награди; то започва от „RL средата, която трябва да изградите“.

Три изпълнения, по едно за всяка смес от награди, развиващи се паралелно. Всеки кадър показва медианната картина за дадена стъпка. Все още няма нужда да ги различавате — статията обяснява кое изпълнение кое е.

Защо хората го харесаха

Картините изглеждат свободни, несъвършени и ръчно направени в момент, когато моделите за изображения създават съвършени (статистически средни) картини. Предполагам, че този контраст е голяма част от причината видеото да стане вирусно. То ми напомни за ранните дни на генеративното изкуство с AI, когато целта беше да се изследва средството. DeepDream (2015) беше инструмент за отстраняване на грешки, който хората превърнаха в изкуство; произведения като Edmond de Belamy (2018) се появиха от художници, изследващи какво може да прави един GAN, а художници като Mario Klingemann прекараха тези години в създаване на мечтателни портрети с невронни мрежи.

Този проект ми се струва по-близък до онези ранни дни. В дипломната си работа Surya описва пътя, довел дотук. Той започнал с подаване на подсказки към модели „текст към изображение“, при които подсказката е единственият лост, който можете да използвате, а повече детайли носят повече контрол само до определен момент. Обучението на самия модел стига по-далеч. Другата половина на идеята е средството. Моделът пише програма от около 150 реда JavaScript, която рисува изображението. Резултатът на модела е код. Можете да го прочетете, редактирате и стартирате отново, а решението зад всеки щрих е видимо. Стилът идва от ограничение, според което моделът може да използва само десет метода на библиотеката. Повече за това по-долу.

В същия период Anna Ridler снимала хиляди лалета, ръчно етикетирала всяко, представила самия набор от данни като произведение на изкуството и по-късно обучила модел върху него. Открих работата ѝ чрез препратките, които AI агентите върнаха, докато изграждах този проект, и я харесах, защото този проект прави нещо много сходно: ръчно подбира набор от изображения и след това се обучава спрямо тях.

RL върху вкуса

Повечето от скорошната работа с RL върху езикови модели използва проверими награди. Например математически задачи с известен отговор, код, който преминава тестове, или оценяващи системи, които са верни или грешни и се изпълняват евтино. Този проект е по-близък до по-старото изключение — RLHF, при което моделът научава модел на наградата от човешки предпочитания.

Тук наградата е естетическо предпочитание. Няма правилен отговор. Истинският въпрос на проекта е дали можете да правите RL върху вкуса.

Наградата, както е дефинирана в неговия блог и реализирана в изградената от мен RL среда:

термин тегло какво измерва
gate 0.05 скицата се компилира, рисува нещо и не мами
length 0.05 меко насърчаване към по-дълги кодови фрагменти
двойно оценяване 0.60 стил, сравнен с референции, избрани от набор
HPSv3 0.30 естетическо предпочитание към визуализацията

HPSv3 е отворен модел за предпочитания със 7 млрд. параметъра. Подайте му изображение и текстово описание и той връща оценка за това доколко човек би предпочел изображението. Обучен е върху голям набор от човешки избори между двойки изображения, така че оценката му е средна стойност на вкуса на много хора. Двойният оценяващ модел е Qwen3-VL-30B-A3B-Instruct, общ модел за зрение, извикван чрез HF Inference Providers. Двойният оценяващ вижда картината-кандидат до четири референции, избрани на случаен принцип от набора, насочван от писмено описание на това какво да оценява (разтичания, полупрозрачни нанасяния, меки ръбове). Всяко сравнение е в двата реда на представяне, а оценката му е делът на сравненията, спечелени от кандидата. Единственият му стандарт е наборът, така че оценката му е моят вкус, кодиран в тези оценки.

Процесът на награждаване, компонент по компонент
Два от четирите термина във функцията на наградата са модели. И двата са заместители на нечий вкус.

Това са теглата, до които Narreddi е достигнал. Наборът определя вкуса тук. Това измества работата от настройване на хиперпараметри към изграждане на набора, който решава кое е красиво.

Обучих три изпълнения с тази награда. Те се различават само по начина, по който теглото се разделя между двата моделни оценяващи:

изпълнение двойно оценяване HPSv3 роля
judge-led 0.60 0.30 оригиналната смес, спряна на стъпка 110
hps-led 0.30 0.60 средната точка, спряна на стъпка 110
hps-only 0.00 0.90 валидиращото изпълнение, спряно на стъпка 60

Започнах с hps-only, за да проверя дали процесът изобщо може да се обучава. След като наградата започна да се повишава и метриките бяха стабилни, нямаше причина да го изпълнявам по-дълго, затова стартирах двете по-дълги изпълнения. Въпросът, който те задават, е колко от силата на HPSv3 може да бъде предадена на двойния оценяващ? Колкото по-голямо тегло носи оценяващият, толкова повече наградата означава моят вкус вместо вкуса на всички и толкова по-трудно би трябвало да се изкачва. Между другото, ако стигнете достатъчно далеч или стилът ви е твърде отдалечен от средния, моделът може да спре напълно.

За щастие това не се случи и двете изпълнения с двойния оценяващ също се обучиха. Ръчно оцененият набор може да насочва политиката, поне доколкото показват метриките и крайните картини. Числата са по-долу.

Уточнение. Ако използваме авангарден модел, той вече може да генерира JavaScript кода, който рисува акварел по подсказка. Това е началната точка. Работата тук е да научим по-малък модел да прави това, съчетано с личните художествени предпочитания на даден човек.

RL средата, която трябва да изградите

Средата обгръща всичко между модела и наградата, включително JavaScript библиотеката, която моделът използва за рисуване, системната подсказка, която го ограничава, безглавия Chromium, който визуализира всяка скица, и портата, която отхвърля измамите.

Библиотеката върши повече работа, отколкото изглежда. p5.brush, създадена от @acamposuribe, симулира средство, вместо просто да рисува форми: пигментът се разтича отвъд ръбовете на запълването, хартията има текстура, щрихите имат плътност, а полетата на потока преместват мазките наоколо. Когато моделът извика brush.fillBleed(0.25), той решава докъде ще се разтече мастилото.

Бележка. Авторът на p5.brush се опитва да научи машина да рисува много преди всичко това. През 2022 г. той създава серия генеративно изкуство, която крие дневник за обучаването на p5.js да рисува като дете: „Едва успява да използва пастелите [...] Не може да следва прости команди. Стига ми за днес, ужасно дразнещо е.“ Серията е трябвало да има три произведения и той е направил две. Когато видеото на Surya става вирусно, той цитира публикацията, споделяйки този дневник и казвайки, че тази работа е третото произведение, появило се самостоятелно.

p5.brush предоставя 47 метода. Подсказката разрешава 10: scaleBrushes, noStroke, fill, noFill, fillBleed, fillTexture, beginShape, vertex, endShape и circle. Това, което добавят останалите тридесет и седем — линии, щриховка, персонализирани четки — би нарушило акварелния вид. С тези десет моделът може да рисува само запълнени форми, а библиотеката добавя разтичането към всяка от тях.

Генерирана скица и картината, която създава
Част от един draw() rollout и това, което визуализира. Коментарите са на самия модел. Награда 0.864, 129 реда, стъпка 22. Пълният изходен код на всяка картина е в набора от rollouts.

Публикацията му в блога ми спести много време, което можех да изгубя в итерации върху подсказката. Дългата справка за API кара модела да измисля методи, които не съществуват, а неговите 200 GEPA итерации са стигнали до строг списък с разрешени методи без документация. Видях същите грешки и написах списъка на ръка. Единственото ми допълнение към тази рецепта е едно изречение: рисувайте всяко венчелистче два или три пъти — първо голям слой, а вътре в него по-малък и по-непрозрачен. Тази малка промяна направи резултатите ми много по-цветни.

Бележка. Ако за първи път чувате за GEPA, това е автоматичен оптимизатор на подсказки. Езиков модел разсъждава с обикновени думи къде текущата подсказка се е провалила и предлага по-добра, а цикълът се повтаря.

Портата е последният компонент. Скицата трябва да се компилира, да използва библиотеката вместо директни извиквания към p5, да поставя истински пигмент върху платното и да не се опитва да заблуди оценяващия, например чрез изписване на текст върху платното.

Наборът е функцията на наградата

Наборът се състои от 178 картини, разделени на две нива според личните ми предпочитания — love и okay. Всички те действително са генерирани от модел. Четири модела с отворени тегла, извиквани чрез Inference Providers, написаха скици с p5.brush, като всеки работеше по реална, свободно лицензирана снимка на хибискус от iNaturalist. Модел за зрение даде писмена обратна връзка за всяка скица в три итерации на усъвършенстване. След това всяка крайна визуализация беше оценена поотделно от мен и 178 преминаха подбора.

генератор брой картини
GLM-5.2 64
Kimi-K3 57
Qwen3-Coder-Next 35
Qwen3.5-122B-A10B 22

Тук избрах четири различни семейства модели, за да проверя различните им стилове. Това бяха отворените модели, които създадоха валидна скица всеки път при бърза проверка на надеждността; два други кандидата отпаднаха, защото не я преминаха. Ако искате да създадете собствен набор, може да изберете други.

Референция от ниво love до такава от ниво okay
Двете нива в реалния им вид. Несъгласието с оценката е напълно разумно — нечия преценка вече е функцията на наградата.

Нивата вършат реална работа в наградата. Когато двойният оценяващ избира четири референции, половината идват от love, а половината от okay, така че политиката винаги среща съперници, които понякога може да победи, а победата носи еднакво възнаграждение срещу всяко ниво. Това е една от малкото ми умишлени промени: оригиналът сравнява само с най-високото ниво, а аз оставих по-лесното ниво при избора, за да получава дори слабата ранна политика сигнал.

В набора няма картина, направена от човек, което е реално ограничение. p5.brush е нишова библиотека, а човешката работа, съществуваща с достъпен код за нея, е шепа произведения — далеч недостатъчни за тренировъчен корпус, както отбелязва и блогът му.

Интересната идея тук, както вече обсъждах, е, че моделът ще се научи да имитира съдържанието на набора. Ако насочим средата към друг набор от данни, наградата автоматично ще се промени, без да докосваме нито един ред код. За набора, който генерирах и споделям открито, включвам и изходната скица.

Ако разгледаме оценяващите по-внимателно, те отговарят на различни въпроси. HPSv3 решава дали това е цвете, а двойният оценяващ решава дали е добре нарисувано в избрания от мен стил.

Само още едно YOLO изпълнение

Преди нещо да заработи, имаше дълъг период на равни криви на наградата. Ако сте опитвали да възпроизведете научна статия или публикация в блог без отворени артефакти, вероятно разбирате. Всяко изпълнение проверяваше това, което смятах за разумна теория за причината за проблема. Едно изпълнение отнема много време, затова поставях следващото на опашката, докато още преглеждах резултатите от предишното. Както винаги, отговорът беше да се започне с нещо по-лесно, което работи, и след това върху него да се надгражда. Първата научила се задача за контрол, без браузър и без оценяващи, беше проста, а причината беше, че скоростта ми на обучение беше просто твърде ниска.

Три плоски експеримента с наградата спрямо успешното изпълнение
Три експеримента с наградата, три плоски линии. Смених набора, премахнах шума от визуализатора и изключих двойния оценяващ, но нищо от това не раздвижи кривата. Изпълнението, което се раздвижи, промени конфигурацията на обучаващия, така че разликата е в обучаващия, а не в сместа от награди.

Друга промяна, чието откриване ми струваше време, беше правилното настройване на параметрите на LoRA. Обичайният списък target_modules предполага плътен модел, а Qwen/Qwen3.5-35B-A3B е смес от експерти, която именува повечето си проекции по различен начин, така че адаптерът обучаваше десет слоя от четиридесет. Реших това, като го промених на all-linear, което обхваща всеки линеен слой. Маршрутизираните експерти в тази архитектура са слети тензори, които дори all-linear оставя замразени, но всички останали получават адаптер и това беше достатъчно за обучение.

Поправката включваше четири промени в GRPOTrainer на TRL:

настройка от до защо
скорост на обучение 2e-5 5e-5 горната граница, използвана от LoRA Without Regret за GRPO
планировчик linear constant_with_warmup линейното намаляване беше изразходвало по-голямата част от скоростта на обучение в средата на изпълнението и наградата така и не се повиши
scale_rewards group none едно отхвърляне от портата намаляваше всяко друго предимство в групата
target_modules ръчен списък all-linear обхваща всеки линеен слой

Тези четири промени отключиха първото успешно изпълнение (hps-only), при което наградата очевидно се подобряваше.

С тази конфигурация и трите изпълнения се обучават. Двете изпълнения с оценяващ бяха стартирани за 200 стъпки и спрени на 110, като наградата все още се покачваше бавно. Една стъпка отнема петнадесет до осемнадесет минути, а сравнението между смесите вече беше стабилно, затова спрях и двете, за да спестя изчислителни ресурси. Средната групова награда през първата и последната третина на всяко изпълнение:

изпълнение стъпки първа третина последна третина Δ
hps-only 60 0.58 0.71 +0.13
judge-led 110 0.45 0.72 +0.27
hps-led 110 0.57 0.82 +0.24
Трите изпълнения, по една крива за всяко

Трите криви съответстват на това колко тежи моят вкус. Колкото повече тежи оценяващият, толкова по-нисък е стартът и толкова по-шумно е изкачването. judge-led прекара първите тридесет стъпки почти без промяна, преди да се раздвижи. Това е същият ход, който реши отстраняването на грешките: свийте проблема, докато нещо се научи, след което добавяйте трудните части една по една.

Самият термин на двойния оценяващ се повиши в двете изпълнения, които го използваха. С напредването на обучението моделът печели повече сравнения срещу набора — твърдение, което hps-only не можеше да направи. Нито една група в никое изпълнение не се срина до идентични награди — режимът на повреда на GRPO, който унищожава градиента. За любопитните, кривите по метрики (HPSv3, покритие с боя, ентропия) са в хранилището като CSV.

Пълната команда за стартиране, хардуерът и двете променливи на средата, които превръщат това в другите две изпълнения, са в рецептата.

Какво всъщност научи

Във всяко изпълнение първото, което моделът научи, беше да спре да създава лоши картини — почти празните платна и безформените разливи, които получават обща награда под 0.3. При hps-only три четвърти от покачването на груповата средна стойност идват от това, че лошите картини стават рядкост. В изпълненията с оценяващ сривът е още по-рязък: rollouts под 0.3 спадат от 99 на 16 между третините на judge-led, а от 37 на 4 при hps-led.

Медианата спрямо най-добрата картина за всяка стъпка

Ето защо очевидната визуална мярка — най-добрата картина на всяка стъпка — показва почти никаква разлика при hps-only. Тя се променя с +0.034 през изпълнението, докато медианата се променя с +0.155. Обучението се вижда в средата на разпределението.

Това, което двойният оценяващ променя, е върхът. При hps-only картините стават по-надеждни, без да стават по-добри. Качеството на добрите картини добавя само +0.03 към груповата средна стойност, а щом HPSv3 види венчелистчета около център и стъбло, спира да изисква повече пигмент. При включен оценяващ се появява другата половина от историята. По-добро тук означава по-близко до набора, тоест по-близко до това, което съм оценил като „добро“ или което ми харесва повече. Това добавя +0.12 при judge-led и +0.16 при hps-led; най-доброто за всяка стъпка също се повишава, а покритието с боя се удвоява и при двете изпълнения (от 0.11 на 0.23 и от 0.13 на 0.30), докато при hps-only почти не се променя. Когато има референция, която да надмине, добрата картина все още може да стане по-добра, а моделът започва да получава награда за използването на повече пигмент.

Още едно откритие. Моделът игнорира изрична инструкция — и правилно. Системната подсказка изисква от петнадесет до тридесет запълнени форми. Ако погледнем действителната средна стойност, тя е между 7 и 9, а n_shapes почти не корелира с наградата в никое изпълнение (+0.000, −0.14, +0.07). Политиката не получава награда за спазването на това изречение, затова не го спазва.

Има и таван по маршрута hps-only. Ако всеки rollout съвпадаше с добрите, средната стойност на това изпълнение би била 0.771. Дали повече стъпки биха го надхвърлили, остава открит въпрос.

Картините показват и нещо, което таблиците пропускат. В рамките на всяко изпълнение всички те изглеждат сходно. С напредването на обучението наградите вътре във всяка група се сближават, а медианните картини в началното видео изглеждат като варианти на едно и също цвете. Това е GRPO, който прави точно предназначеното за него с набор, изграден върху един обект. Наборът решава какво се смята за разнообразие по същия начин, по който решава какво се смята за качество. Ако наградата плаща само за съвпадение с едно цвете, моделът се научава да рисува това едно цвете. По-разнообразен резултат би изисквал по-разнообразен набор, а изграждането му изисква повече работа по подбор. По-новите композиции на Surya са пример за това. Картините на животни на Alex Yango са същата рецепта с различен избор на съдържание в набора. Това е най-голямата разлика между естетическата награда и оценяващия по математика. Зад числото стои много човешка работа — решаването какво принадлежи в набора за наградата. Есето на Jason Liu за вкуса казва общата версия в един ред: AI измести тясното място от създаването към забелязването.

Surya завършва блога си с някои от любимите си творби. Вместо да избера моите, по-долу е стена с 178-те картини, получили най-висока оценка от наградата в двете изпълнения с оценяващ — същият брой, който съдържа референтният набор, в произволен ред. Отворете я и изберете свои.

178 картини от двете изпълнения с оценяващ, без етикети
178-те любими картини на наградата от двете изпълнения с оценяващ, разбъркани. Сега изберете вашите.

За да изберете, сте разгледали много и сте запазили няколко — точно това е работата, създала наградата на този проект. Всяка картина от всяко изпълнение, заедно със скицата и наградата си, е в наборите от rollouts и може да бъде разглеждана в тази галерия.

Медианната картина от последната стъпка на всяко изпълнение
Медианната картина от последната стъпка на всяко изпълнение, в същия ред като началното видео. Един и същ базов модел, един и същ набор, три смеси от награди, три стила.

Тъй като наградата частично се основаваше на моя вкус, редно е да завърша с моята оценка като зрител. За моето око judge-led е изпълнението, което в крайна сметка е най-разнообразно и най-интересно от художествена гледна точка. hps-led рисува убедителни акварели, но най-добрите му произведения споделят мек, мокро-в-мокро вид, който почти представлява собствен стил. hps-only се сближава най-силно и повечето му картини се установяват върху едни и същи цветове. Можете сами да прецените в галерията, която съдържа всяка картина от всяко изпълнение и позволява сортиране по стъпка и награда.

Инфраструктурата е трудна

Този проект е предимно инфраструктура. Едно изпълнение се нуждае от обучаващ, два Space-а, маршрутизатор за изводи и websocket, които да останат стабилни с часове, а всеки компонент, който се повреди тихо, се превръща в грешно число някъде другаде. Половината работа е да провериш дали числото, което четеш, съответства на случилото се в действителност.

Отказите на инфраструктурата се записваха в наградата като нули. Визуализация, която е изтекла по време, или оценяващ, който не е отговорил, получаваше същата оценка като лоша картина — 0.0 в групата. Във всички мои изпълнения това беше около 1,5% от rollouts, а в най-лошото изпълнение достигна 5,2%. Това обучава модела върху шум, затова тези пътища вече връщат None, а rollout-ът се изключва от групата.

Открих и грешка в OpenEnv и изпратих поправката нагоре по веригата. Клиентът поддържа един постоянен websocket, а сокет, затворен от отсрещната страна, оставаше кеширан, така че всяко следващо извикване се проваляше, въпреки че средата беше здрава. Това ми струваше две наполовина завършени изпълнения, докато го открия. Поправката е изпратена нагоре по веригата, а стартираните с нея изпълнения работят чисто оттогава.

Стъпки 11 и 12 от изпълнението judge-led, четирите най-добри от всяка
Две последователни стъпки от изпълнението judge-led, четирите най-добри от всяка. Дали картините от стъпка 12 изглеждат с половин точка по-лоши, решавате вие.

Наградата за една стъпка зависи от това кои референции е избрала. Двойният оценяващ избира четири референции за всяка стъпка, така че всяка стъпка се изправя пред различен набор съперници, а някои избори са просто по-трудни. Самото GRPO е сравнително безопасно, защото предимствата се изчисляват вътре в групата и трудният избор премества цялата група заедно. Кривата, която четях, не беше безопасна и част от това, което изглеждаше като лоша стъпка, беше просто труден избор. Изображението по-горе е един пример. Стъпка 12 получава половин точка по-малко от стъпка 11 най-вече защото е избрала най-трудните референции в изпълнението, докато самите картини изглеждат близки.

Колко струва

Закръглени числа и само за завършените изпълнения.

компонент от какво се нуждае
обучаващ 1 H200. 18 часа за 60 стъпки, около 34 за 110
HPSv3 Space от тип a100-large, активен през цялото изпълнение
средата Space от тип cpu-upgrade, който визуализира удобно в рамките на времето
двойният оценяващ квота в Inference Providers за Qwen/Qwen3-VL-30B-A3B-Instruct
наборът, еднократно свободно лицензирани снимки от iNaturalist, квота в Inference Providers за четирите генератора и вашите собствени часове за оценяване

Една стъпка включва осем rollouts и отнема петнадесет до осемнадесет минути, като 70–80% от времето е визуализиране. Една визуализация отнема 69 до 96 секунди при ограничение от 90 секунди. Част от това е очаквано: Space-ът няма GPU, така че Chromium визуализира WEBGL платното чрез софтуера, а разтичанията и текстурите на p5.brush изискват много работа с пиксели. И все пак очаквах да е по-бързо и не съм открил пълната причина.

Оценяващият може да струва повече от обучението, което го използва: HPSv3 трябва да работи през цялото изпълнение, затова поставете Space-а на пауза или задайте таймера му за заспиване, когато изпълнението приключи.

Инфраструктурата: какво се таксува по време на изпълнение и какво остава след него
Четири платени услуги трябва да работят стабилно едновременно. Само Hub и trackio продължават да съществуват след изпълнението.

Всичко работи върху HF Jobs, със средата като Docker Space и метрики в trackio.

Какво бих опитал следващо

Правилото на този проект беше да възпроизведе рецептата с всеки ресурс, отворен за достъп, а не да я подобри, така че по пътя се натрупа списък от неизпробвани идеи. Това са тези, които действително бих опитал, подредени според количеството налични доказателства.

Многократни стъпки и възможност моделът да вижда какво рисува. Това е първото, което бих опитал. Оригиналният блог обучава с един ход, затова и аз обучавах с един ход, а в тази конфигурация моделът рисува със затворени очи. В изображението никога не постъпва нищо и единствената обратна връзка, която получава, е едно число. Доказателството, че цикълът с обратна връзка работи, е самият набор. Референтните картини са създадени от модели, които са итератирали три рунда под надзора на критик за зрение, а по-късните рундове са по-добри. Материалът, който определя наградата, е създаден с цикъл, до който политиката няма достъп.

По-малки модели. Има доказателства, че 35B е повече, отколкото е необходимо. В страничните ми експерименти 4B вече пишеше валидни скици, които преминаваха портата. Ако 4B може да научи това, разходите за експеримента спадат с порядък.

Другите идеи в списъка са SFT върху източниците на набора преди започване на RL, изрично награждаване на пигмента, преместване на сместа от референции на оценяващия от лесни към трудни с напредването на изпълнението, докато остане само love, разширяване на списъка от десет метода за по-голям визуален диапазон (опитите ми за това сриват повече скици и нарушават акварелния вид) и проверка колко последователен наистина е двойният оценяващ чрез оценяване на едно и също изображение два пъти.

Методът не е специфичен за цветя.

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

← Към новините

Още новини

Всички последни новини