DiffusionGemma від Google доводить, що для створення дифузійної моделі тексту не потрібно навчати її з нуля
Замість навчання нової моделі з нуля Google DeepMind переобладнала Gemma 4 на дифузійну модель, використавши менш як 10 відсотків початкового бюджету навчання. DiffusionGemma генерує 256 токенів паралельно, а не по одному, досягаючи приблизно 1 500 токенів на секунду. За якістю вона все ще поступається оригінальній авторегресійній моделі в бенчмарках, особливо в завданнях на міркування.
Стаття DiffusionGemma від Google доводить, що для створення текстової дифузійної моделі не потрібно навчати її з нуля вперше з’явилася на сайті The Decoder.
Це видання віддає у стрічку лише початок статті, а повний текст тримає у себе. Повністю стаття доступна за посиланням нижче.