Google's DiffusionGemma bewijst dat je niet vanaf nul hoeft te trainen om een tekst-diffusiemodel te bouwen
In plaats van een nieuw model vanaf nul te trainen, bouwde Google DeepMind Gemma 4 om tot een diffusiemodel met minder dan tien procent van het oorspronkelijke trainingsbudget. DiffusionGemma genereert 256 tokens tegelijk in plaats van één voor één en haalt zo'n 1.500 tokens per seconde. De kwaliteit blijft in benchmarks nog wel achter bij het oorspronkelijke autoregressieve model, vooral bij redeneertaken.
🔗 lees originele bron