DiffusionGemma на Google доказва, че не е нужно да обучавате модел за текстова дифузия от нулата
Вместо да обучава нов модел от нулата, Google DeepMind адаптира Gemma 4 в дифузионен модел, използвайки по-малко от 10 процента от първоначалния бюджет за обучение. DiffusionGemma генерира 256 токена паралелно, вместо един по един, като достига около 1 500 токена в секунда. Качеството все още изостава от оригиналния авторегресивен модел в бенчмарковете, особено при задачи за разсъждение.
Статията DiffusionGemma на Google доказва, че не е нужно да обучавате модел от нулата, за да създадете текстов дифузионен модел беше публикувана първоначално в The Decoder.
Това издание публикува в потока си само началото на статията, а пълният текст остава на неговия сайт. Цялата статия е на връзката по-долу.