VincentGOURBIN/diffusiongemma-26B-A4B-it-gemma4swift-8bit

🤗 Hugging Face 来源image-text-to-textapache-2.0激活 4B28 GBother✓ 7 个校验和今天更新

DiffusionGemma 26B-A4B-it — 8 bits (gemma-4-swift-mlx)

Pack pré-quantifié de google/diffusiongemma-26B-A4B-it pour la bibliothèque Swift gemma-4-swift-mlx (MLX, Apple Silicon). C'est le poids du profil de référence a4bdiff/8bit-fast / a4bdiff/8bit-lean.

Format propre à gemma-4-swift-mlx (gemma4-diffusion-prequantized-v1) : ce pack n'est pas un checkpoint mlx-lm / mlx-vlm générique, et les packs mlx-community/diffusiongemma-* ne se chargent pas à sa place. Il garde une seule copie des modules partagés entre encodeur et décodeur, et prequantized.json décrit la quantification de chaque module et la SHA-256 de chaque fichier.

Quantification

Affine 8 bits, groupes de 64, toutes les couches linéaires du décodeur et des experts MoE (SwitchLinear).

Mesures (M3 Max 96 Go, 2026-09-28/29)

bf16 (Google) ce pack
Taille 48 Go 28,0 Go
Chargement (disque USB) 58 s 32 s
Pic au chargement 51,0 Go 26,7 Go
Mémoire active 49,3 Go 26,7 Go
Débit texte (d1) 32,7 tok/s 28,9 tok/s
ScreenSpot-100 80 78

Sortie identique à la quantification à la volée depuis le bf16.

Détail et lignes brutes : BENCHMARKS.md du dépôt, section « DiffusionGemma 26B-A4B ».

Utilisation

hf download VincentGOURBIN/diffusiongemma-26B-A4B-it-gemma4swift-8bit --local-dir <dossier>
gemma4-cli diffusion --model-path <dossier> "Votre prompt"   # pack reconnu via prequantized.json
gemma4-cli bench-diffusion --model-path <dossier> --reference a4bdiff/8bit-fast --workload d1

En Swift, passer le dossier comme modelPath du pipeline de diffusion avec le profil a4bdiff/8bit-fast. Le pack est reproductible depuis le bf16 de Google : gemma4-cli export-diffusion --model-path <bf16> --reference a4bdiff/8bit-fast --out <pack>.

Licence

Apache-2.0, comme le modèle d'origine de Google. Seule la représentation des poids change (quantification affine MLX).