Sakhanda Wire
NVDA $223.96 +2.27% MSFT $499.99 +0.03% GOOGL $354.30 -0.96% META $592.10 +0.37% AMZN $274.48 +0.82%
← Към новините

DiffusionGemma на Google доказва, че не е нужно да обучавате модел за текстова дифузия от нулата

Вместо да обучава нов модел от нулата, Google DeepMind адаптира Gemma 4 в дифузионен модел, използвайки по-малко от 10 процента от първоначалния бюджет за обучение. DiffusionGemma генерира 256 токена паралелно, вместо един по един, като достига около 1 500 токена в секунда. Качеството все още изостава от оригиналния авторегресивен модел в бенчмарковете, особено при задачи за разсъждение.

Статията DiffusionGemma на Google доказва, че не е нужно да обучавате модел от нулата, за да създадете текстов дифузионен модел беше публикувана първоначално в The Decoder.

Това издание публикува в потока си само началото на статията, а пълният текст остава на неговия сайт. Цялата статия е на връзката по-долу.

Първоначално публикувано от The Decoder на

Прочетете оригинала в The Decoder ↗

Текстът и изображенията са собственост на The Decoder и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини