DiffusionGemma от Google доказывает, что для создания диффузионной модели текста не нужно обучать её с нуля
Вместо обучения новой модели с нуля Google DeepMind переоборудовала Gemma 4 в диффузионную модель, потратив менее 10 процентов первоначального бюджета на обучение. DiffusionGemma генерирует 256 токенов параллельно, а не по одному, достигая скорости около 1 500 токенов в секунду. Однако по результатам тестов качество по-прежнему уступает исходной авторегрессионной модели, особенно в задачах на рассуждение.
Статья DiffusionGemma от Google доказывает, что для создания текстовой диффузионной модели не нужно обучать её с нуля впервые появилась на сайте The Decoder.
Это издание отдаёт в ленту только начало статьи, а полный текст держит у себя. Целиком статья доступна по ссылке ниже.