⚡ Each donation funds the next large quant.
I host free GGUF or MoE quants as independent research.
Local hardware: Mechrevo Kuangshi GM7AG0M — RTX 3060 Laptop 6GB GDDR6, 64GB DDR5, i7-12700H (14C/20T, 4.7GHz), Windows 11, Samsung 990 Pro.
Good for imatrix and 0.6–35B-class work in RAM. 9B+ and searches need rented H200/Blackwell, typically $100 per quant.
🎉 Boosty🦄 | ☕ Buy Me a Coffee🦄 | ⭐ DonationAlerts🦄
💚 Thanks to Hugging Face for extra storage.🦄
NOESIS / AMAImedia
Released as part of the NOESIS Professional Multilingual Dubbing Automation Platform (framework: Deterministic Hybrid Control Framework for Frozen Neural Operators — DHCF-FNO).
- Founder: Ilia Bolotnikov
- Organization: AMAImedia.com
- X (Twitter): @AMAImediacom
- LinkedIn: Ilia Bolotnikov
- Telegram: @djbionicl
- Release date: 2026-09-18
AMAImedia
- Original repository: yandex/AliceAI-Foundation-80B-A3B-Base
AliceAI-Foundation-80B-A3B — BF16 repack + GGUF quantizations
Repack (BF16 safetensors, shards ≤50 GB) and community GGUF quantizations of
yandex/AliceAI-Foundation-80B-A3B-Base
(model_type: alice_ai, 80B total / 3B active MoE with KDA layers).
Совместимость.
alice_ai— гибридная архитектура (Kimi Delta Attention + gated attention + MoE + Attention Residuals). На сентябрь 2026 upstream llama.cpp не имеет графа инференса дляalice_ai: все GGUF в этом репозитории собраны и проверены, но запускаются только на AliceAI-aware runtime. Для инференса используйте Transformers5.16.1+flash-linear-attention==0.5.0(как в карточке оригинала) или AliceAI-aware vLLM-образ. Обычныйllama-cliдля этой архитектуры пока неприменим.
Compatibility.
alice_aiis a hybrid architecture (Kimi Delta Attention + gated attention + MoE + Attention Residuals). As of September 2026 upstream llama.cpp has no inference graph foralice_ai: every GGUF here is converted and validated, but needs an AliceAI-aware runtime. Use Transformers5.16.1+flash-linear-attention==0.5.0(upstream card) or an AliceAI-aware vLLM image. Stockllama-clidoes not apply to this architecture yet.
О модели / About the model
| Параметр | Значение |
|---|---|
| Параметры | 80B всего, 3B активных на токен |
| Hidden size | 2048 |
| Словарь | 129024 (SentencePiece, tokenizer.model) |
| Слоёв | 48 · 12 × (3 × (KDA → MoE) → 1 × (Gated Attention → MoE)) |
| KDA | 32 Q-головы / 32 KV-головы, head dim 128, conv kernel 4 |
| Gated Attention | 16 Q-голов / 2 KV-головы, head dim 256 |
| MoE | 512 экспертов, top-10 + 1 shared, expert FFN 512 |
| MTP | 1 слой (публикуется отдельно: mtp.safetensors) |
| Контекст | 262 144 токена |
| Лицензия | Apache-2.0 |
Файлы / Files
BF16 safetensors (repack)
| File | Size (bytes) | Notes |
|---|---|---|
models-00001-of-00004.safetensors |
40 161 159 351 | shard 1/4 (≤50 GB, HF limit) |
models-00002-of-00004.safetensors |
40 627 521 805 | shard 2/4 |
models-00003-of-00004.safetensors |
39 553 779 850 | shard 3/4 |
models-00004-of-00004.safetensors |
39 546 206 588 | shard 4/4 |
mtp.safetensors |
3 300 946 285 | MTP head, 20 tensors |
models.safetensors.index.json, model.safetensors.index.json |
— | tensor → shard map (1307 tensors) |
config.json, configuration_alice_ai.py, modeling_alice_ai.py, tokenizer.model, tokenizer_config.json, special_tokens_map.json |
— | оригинальные файлы модели |
Исходные 49 шардов Yandex слиты в один стриминговый файл и заново нарезаны
на 4 части ≤50 ГБ; корректность подтверждена побайтово — 1307 тензоров,
SHA256 каждого тензора, 0 расхождений (см. code/compare_tensors.py).
GGUF (GGUF/)
| File | Notes |
|---|---|
GGUF/AliceAI-Foundation-80B-A3B-F16.gguf |
F16, 1287 тензоров (MTP исключён) |
GGUF/AliceAI-Foundation-80B-A3B-Q8_0.gguf |
Q8_0 — near-lossless reference |
GGUF/AliceAI-Foundation-80B-A3B-Q6_K.gguf |
Q6_K — near-lossless K-quant |
GGUF/AliceAI-Foundation-80B-A3B-Q4_K_M.gguf |
Q4_K_M — recommended general use |
GGUF/AliceAI-Foundation-80B-A3B-Q2_K.gguf |
Q2_K — experimental low-memory tier |
GGUF/AliceAI-Foundation-80B-A3B-MTP-F16.gguf |
MTP-голова в GGUF (blk.48 + blk.48.nextn.*, 21 тензор, 3.30 ГБ) |
MTP публикуется в двух форматах: mtp.safetensors — в корне репозитория,
GGUF/AliceAI-Foundation-80B-A3B-MTP-F16.gguf — в папке GGUF/.
Как это сделано / How it was made
Весь пайплайн лежит в code/:
download.py— снапшот оригинального чекпоинта (49 шардов).split_merge.py— стриминговое слияние в один файл + выделение MTP.compare_tensors.py— сверка заголовков и по-тензорный SHA256 (PASS, 0 потерь).shard4.py— нарезка на 4 валидных safetensors-шарда ≤50 ГБ + индексы.upload_shards.py— публикация BF16.patch_alice_ai.py+alice_ai.cpp+alice-ai-quant-stub.patch— quant-only стабalice_aiдля llama.cpp (регистрирует архитектуру дляllama-quantize).convert_alice_foundation.py— собственный HF → GGUF F16 конвертер (маппинг тензоров, SentencePiece-словарь, метаданные; без mmap).quantize_alice.sh— 4 параллельных кванта (Q8_0,Q6_K,Q4_K_M,Q2_K).
Быстрый старт (инференс) / Quick start (inference)
# transformers==5.16.1, accelerate==1.14.0, flash-linear-attention==0.5.0
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "AMAImedia/AliceAI-Foundation-80B-A3B-BF16-GGUF"
tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
model_id, trust_remote_code=True, dtype="bfloat16", device_map="auto",
)
Оригинальная документация и бенчмарки — в карточке yandex/AliceAI-Foundation-80B-A3B-Base.
Лицензия и атрибуция / License and attribution
Веса распространяются под Apache-2.0 (как у оригинала). Это community-repack и
community-кванты, не официальный релиз Yandex. Инференс-код модели —
modeling_alice_ai.py — включён в репозиторий без изменений.