AMAImedia/AliceAI-Foundation-80B-A3B-NOESIS-BF16-GGUF

🤗 Hugging Face 来源text-generationapache-2.081.3B 参数激活 3B163 GBGGUF✓ 17 个校验和今天更新
一条命令提交

在你的模型文件夹旁边运行它。它会制作种子、将文件与 Hugging Face 比对,然后提交。你只需开始做种,并粘贴你账户中的密钥。它只读取你的文件,绝不修改。如果愿意,可以先阅读脚本。

curl -fsSL https://pirateface.co/package.sh | bash -s -- --repo AMAImedia/AliceAI-Foundation-80B-A3B-NOESIS-BF16-GGUF ./model-folder
需要做种者 →

⚡ Each donation funds the next large quant.

I host free GGUF or MoE quants as independent research.
Local hardware: Mechrevo Kuangshi GM7AG0M — RTX 3060 Laptop 6GB GDDR6, 64GB DDR5, i7-12700H (14C/20T, 4.7GHz), Windows 11, Samsung 990 Pro.
Good for imatrix and 0.6–35B-class work in RAM. 9B+ and searches need rented H200/Blackwell, typically $100 per quant.

🎉 Boosty🦄 | ☕ Buy Me a Coffee🦄 | ⭐ DonationAlerts🦄

💚 Thanks to Hugging Face for extra storage.🦄


NOESIS / AMAImedia

Released as part of the NOESIS Professional Multilingual Dubbing Automation Platform (framework: Deterministic Hybrid Control Framework for Frozen Neural Operators — DHCF-FNO).

AMAImedia


AliceAI-Foundation-80B-A3B — BF16 repack + GGUF quantizations

Repack (BF16 safetensors, shards ≤50 GB) and community GGUF quantizations of yandex/AliceAI-Foundation-80B-A3B-Base (model_type: alice_ai, 80B total / 3B active MoE with KDA layers).

Совместимость. alice_ai — гибридная архитектура (Kimi Delta Attention + gated attention + MoE + Attention Residuals). На сентябрь 2026 upstream llama.cpp не имеет графа инференса для alice_ai: все GGUF в этом репозитории собраны и проверены, но запускаются только на AliceAI-aware runtime. Для инференса используйте Transformers 5.16.1 + flash-linear-attention==0.5.0 (как в карточке оригинала) или AliceAI-aware vLLM-образ. Обычный llama-cli для этой архитектуры пока неприменим.

Compatibility. alice_ai is a hybrid architecture (Kimi Delta Attention + gated attention + MoE + Attention Residuals). As of September 2026 upstream llama.cpp has no inference graph for alice_ai: every GGUF here is converted and validated, but needs an AliceAI-aware runtime. Use Transformers 5.16.1 + flash-linear-attention==0.5.0 (upstream card) or an AliceAI-aware vLLM image. Stock llama-cli does not apply to this architecture yet.

О модели / About the model

Параметр Значение
Параметры 80B всего, 3B активных на токен
Hidden size 2048
Словарь 129024 (SentencePiece, tokenizer.model)
Слоёв 48 · 12 × (3 × (KDA → MoE) → 1 × (Gated Attention → MoE))
KDA 32 Q-головы / 32 KV-головы, head dim 128, conv kernel 4
Gated Attention 16 Q-голов / 2 KV-головы, head dim 256
MoE 512 экспертов, top-10 + 1 shared, expert FFN 512
MTP 1 слой (публикуется отдельно: mtp.safetensors)
Контекст 262 144 токена
Лицензия Apache-2.0

Файлы / Files

BF16 safetensors (repack)

File Size (bytes) Notes
models-00001-of-00004.safetensors 40 161 159 351 shard 1/4 (≤50 GB, HF limit)
models-00002-of-00004.safetensors 40 627 521 805 shard 2/4
models-00003-of-00004.safetensors 39 553 779 850 shard 3/4
models-00004-of-00004.safetensors 39 546 206 588 shard 4/4
mtp.safetensors 3 300 946 285 MTP head, 20 tensors
models.safetensors.index.json, model.safetensors.index.json — tensor → shard map (1307 tensors)
config.json, configuration_alice_ai.py, modeling_alice_ai.py, tokenizer.model, tokenizer_config.json, special_tokens_map.json — оригинальные файлы модели

Исходные 49 шардов Yandex слиты в один стриминговый файл и заново нарезаны на 4 части ≤50 ГБ; корректность подтверждена побайтово — 1307 тензоров, SHA256 каждого тензора, 0 расхождений (см. code/compare_tensors.py).

GGUF (GGUF/)

File Notes
GGUF/AliceAI-Foundation-80B-A3B-F16.gguf F16, 1287 тензоров (MTP исключён)
GGUF/AliceAI-Foundation-80B-A3B-Q8_0.gguf Q8_0 — near-lossless reference
GGUF/AliceAI-Foundation-80B-A3B-Q6_K.gguf Q6_K — near-lossless K-quant
GGUF/AliceAI-Foundation-80B-A3B-Q4_K_M.gguf Q4_K_M — recommended general use
GGUF/AliceAI-Foundation-80B-A3B-Q2_K.gguf Q2_K — experimental low-memory tier
GGUF/AliceAI-Foundation-80B-A3B-MTP-F16.gguf MTP-голова в GGUF (blk.48 + blk.48.nextn.*, 21 тензор, 3.30 ГБ)

MTP публикуется в двух форматах: mtp.safetensors — в корне репозитория, GGUF/AliceAI-Foundation-80B-A3B-MTP-F16.gguf — в папке GGUF/.

Как это сделано / How it was made

Весь пайплайн лежит в code/:

  1. download.py — снапшот оригинального чекпоинта (49 шардов).
  2. split_merge.py — стриминговое слияние в один файл + выделение MTP.
  3. compare_tensors.py — сверка заголовков и по-тензорный SHA256 (PASS, 0 потерь).
  4. shard4.py — нарезка на 4 валидных safetensors-шарда ≤50 ГБ + индексы.
  5. upload_shards.py — публикация BF16.
  6. patch_alice_ai.py + alice_ai.cpp + alice-ai-quant-stub.patch — quant-only стаб alice_ai для llama.cpp (регистрирует архитектуру для llama-quantize).
  7. convert_alice_foundation.py — собственный HF → GGUF F16 конвертер (маппинг тензоров, SentencePiece-словарь, метаданные; без mmap).
  8. quantize_alice.sh — 4 параллельных кванта (Q8_0, Q6_K, Q4_K_M, Q2_K).

Быстрый старт (инференс) / Quick start (inference)

# transformers==5.16.1, accelerate==1.14.0, flash-linear-attention==0.5.0
from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "AMAImedia/AliceAI-Foundation-80B-A3B-BF16-GGUF"
tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
    model_id, trust_remote_code=True, dtype="bfloat16", device_map="auto",
)

Оригинальная документация и бенчмарки — в карточке yandex/AliceAI-Foundation-80B-A3B-Base.

Лицензия и атрибуция / License and attribution

Веса распространяются под Apache-2.0 (как у оригинала). Это community-repack и community-кванты, не официальный релиз Yandex. Инференс-код модели — modeling_alice_ai.py — включён в репозиторий без изменений.