DiffusionGemma 26B-A4B-it — 8 bits (gemma-4-swift-mlx)
Pack pré-quantifié de google/diffusiongemma-26B-A4B-it
pour la bibliothèque Swift gemma-4-swift-mlx
(MLX, Apple Silicon). C'est le poids du profil de référence a4bdiff/8bit-fast / a4bdiff/8bit-lean.
Format propre à gemma-4-swift-mlx (
gemma4-diffusion-prequantized-v1) : ce pack n'est pas un checkpointmlx-lm/mlx-vlmgénérique, et les packsmlx-community/diffusiongemma-*ne se chargent pas à sa place. Il garde une seule copie des modules partagés entre encodeur et décodeur, etprequantized.jsondécrit la quantification de chaque module et la SHA-256 de chaque fichier.
Quantification
Affine 8 bits, groupes de 64, toutes les couches linéaires du décodeur et des experts MoE (SwitchLinear).
Mesures (M3 Max 96 Go, 2026-09-28/29)
| bf16 (Google) | ce pack | |
|---|---|---|
| Taille | 48 Go | 28,0 Go |
| Chargement (disque USB) | 58 s | 32 s |
| Pic au chargement | 51,0 Go | 26,7 Go |
| Mémoire active | 49,3 Go | 26,7 Go |
| Débit texte (d1) | 32,7 tok/s | 28,9 tok/s |
| ScreenSpot-100 | 80 | 78 |
Sortie identique à la quantification à la volée depuis le bf16.
Détail et lignes brutes : BENCHMARKS.md du dépôt, section « DiffusionGemma 26B-A4B ».
Utilisation
hf download VincentGOURBIN/diffusiongemma-26B-A4B-it-gemma4swift-8bit --local-dir <dossier>
gemma4-cli diffusion --model-path <dossier> "Votre prompt" # pack reconnu via prequantized.json
gemma4-cli bench-diffusion --model-path <dossier> --reference a4bdiff/8bit-fast --workload d1
En Swift, passer le dossier comme modelPath du pipeline de diffusion avec le profil a4bdiff/8bit-fast.
Le pack est reproductible depuis le bf16 de Google :
gemma4-cli export-diffusion --model-path <bf16> --reference a4bdiff/8bit-fast --out <pack>.
Licence
Apache-2.0, comme le modèle d'origine de Google. Seule la représentation des poids change (quantification affine MLX).