AMAImedia/AliceAI-Foundation-80B-A3B-NOESIS-BF16-GGUF

🤗 Hugging Face sourcetext-generationapache-2.081.3B params3B activated163 GBGGUF✓ 17 checksumsupdated today
Submit in one command

Run it next to your model folder. It makes the torrent, checks your files against Hugging Face, and submits it. You just start seeding and paste your key from your account. It only reads your files and never changes them. Read the script first if you like.

curl -fsSL https://pirateface.co/package.sh | bash -s -- --repo AMAImedia/AliceAI-Foundation-80B-A3B-NOESIS-BF16-GGUF ./model-folder
Needs a seeder →

⚡ Each donation funds the next large quant.

I host free GGUF or MoE quants as independent research.
Local hardware: Mechrevo Kuangshi GM7AG0M — RTX 3060 Laptop 6GB GDDR6, 64GB DDR5, i7-12700H (14C/20T, 4.7GHz), Windows 11, Samsung 990 Pro.
Good for imatrix and 0.6–35B-class work in RAM. 9B+ and searches need rented H200/Blackwell, typically $100 per quant.

🎉 Boosty🦄 | ☕ Buy Me a Coffee🦄 | ⭐ DonationAlerts🦄

💚 Thanks to Hugging Face for extra storage.🦄


NOESIS / AMAImedia

Released as part of the NOESIS Professional Multilingual Dubbing Automation Platform (framework: Deterministic Hybrid Control Framework for Frozen Neural Operators — DHCF-FNO).

AMAImedia


AliceAI-Foundation-80B-A3B — BF16 repack + GGUF quantizations

Repack (BF16 safetensors, shards ≤50 GB) and community GGUF quantizations of yandex/AliceAI-Foundation-80B-A3B-Base (model_type: alice_ai, 80B total / 3B active MoE with KDA layers).

Совместимость. alice_ai — гибридная архитектура (Kimi Delta Attention + gated attention + MoE + Attention Residuals). На сентябрь 2026 upstream llama.cpp не имеет графа инференса для alice_ai: все GGUF в этом репозитории собраны и проверены, но запускаются только на AliceAI-aware runtime. Для инференса используйте Transformers 5.16.1 + flash-linear-attention==0.5.0 (как в карточке оригинала) или AliceAI-aware vLLM-образ. Обычный llama-cli для этой архитектуры пока неприменим.

Compatibility. alice_ai is a hybrid architecture (Kimi Delta Attention + gated attention + MoE + Attention Residuals). As of September 2026 upstream llama.cpp has no inference graph for alice_ai: every GGUF here is converted and validated, but needs an AliceAI-aware runtime. Use Transformers 5.16.1 + flash-linear-attention==0.5.0 (upstream card) or an AliceAI-aware vLLM image. Stock llama-cli does not apply to this architecture yet.

О модели / About the model

Параметр Значение
Параметры 80B всего, 3B активных на токен
Hidden size 2048
Словарь 129024 (SentencePiece, tokenizer.model)
Слоёв 48 · 12 × (3 × (KDA → MoE) → 1 × (Gated Attention → MoE))
KDA 32 Q-головы / 32 KV-головы, head dim 128, conv kernel 4
Gated Attention 16 Q-голов / 2 KV-головы, head dim 256
MoE 512 экспертов, top-10 + 1 shared, expert FFN 512
MTP 1 слой (публикуется отдельно: mtp.safetensors)
Контекст 262 144 токена
Лицензия Apache-2.0

Файлы / Files

BF16 safetensors (repack)

File Size (bytes) Notes
models-00001-of-00004.safetensors 40 161 159 351 shard 1/4 (≤50 GB, HF limit)
models-00002-of-00004.safetensors 40 627 521 805 shard 2/4
models-00003-of-00004.safetensors 39 553 779 850 shard 3/4
models-00004-of-00004.safetensors 39 546 206 588 shard 4/4
mtp.safetensors 3 300 946 285 MTP head, 20 tensors
models.safetensors.index.json, model.safetensors.index.json — tensor → shard map (1307 tensors)
config.json, configuration_alice_ai.py, modeling_alice_ai.py, tokenizer.model, tokenizer_config.json, special_tokens_map.json — оригинальные файлы модели

Исходные 49 шардов Yandex слиты в один стриминговый файл и заново нарезаны на 4 части ≤50 ГБ; корректность подтверждена побайтово — 1307 тензоров, SHA256 каждого тензора, 0 расхождений (см. code/compare_tensors.py).

GGUF (GGUF/)

File Notes
GGUF/AliceAI-Foundation-80B-A3B-F16.gguf F16, 1287 тензоров (MTP исключён)
GGUF/AliceAI-Foundation-80B-A3B-Q8_0.gguf Q8_0 — near-lossless reference
GGUF/AliceAI-Foundation-80B-A3B-Q6_K.gguf Q6_K — near-lossless K-quant
GGUF/AliceAI-Foundation-80B-A3B-Q4_K_M.gguf Q4_K_M — recommended general use
GGUF/AliceAI-Foundation-80B-A3B-Q2_K.gguf Q2_K — experimental low-memory tier
GGUF/AliceAI-Foundation-80B-A3B-MTP-F16.gguf MTP-голова в GGUF (blk.48 + blk.48.nextn.*, 21 тензор, 3.30 ГБ)

MTP публикуется в двух форматах: mtp.safetensors — в корне репозитория, GGUF/AliceAI-Foundation-80B-A3B-MTP-F16.gguf — в папке GGUF/.

Как это сделано / How it was made

Весь пайплайн лежит в code/:

  1. download.py — снапшот оригинального чекпоинта (49 шардов).
  2. split_merge.py — стриминговое слияние в один файл + выделение MTP.
  3. compare_tensors.py — сверка заголовков и по-тензорный SHA256 (PASS, 0 потерь).
  4. shard4.py — нарезка на 4 валидных safetensors-шарда ≤50 ГБ + индексы.
  5. upload_shards.py — публикация BF16.
  6. patch_alice_ai.py + alice_ai.cpp + alice-ai-quant-stub.patch — quant-only стаб alice_ai для llama.cpp (регистрирует архитектуру для llama-quantize).
  7. convert_alice_foundation.py — собственный HF → GGUF F16 конвертер (маппинг тензоров, SentencePiece-словарь, метаданные; без mmap).
  8. quantize_alice.sh — 4 параллельных кванта (Q8_0, Q6_K, Q4_K_M, Q2_K).

Быстрый старт (инференс) / Quick start (inference)

# transformers==5.16.1, accelerate==1.14.0, flash-linear-attention==0.5.0
from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "AMAImedia/AliceAI-Foundation-80B-A3B-BF16-GGUF"
tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
    model_id, trust_remote_code=True, dtype="bfloat16", device_map="auto",
)

Оригинальная документация и бенчмарки — в карточке yandex/AliceAI-Foundation-80B-A3B-Base.

Лицензия и атрибуция / License and attribution

Веса распространяются под Apache-2.0 (как у оригинала). Это community-repack и community-кванты, не официальный релиз Yandex. Инференс-код модели — modeling_alice_ai.py — включён в репозиторий без изменений.