Each donation funds the next large quant.
I host free GGUF or MoE quants as independent research.
Local hardware: Mechrevo Kuangshi GM7AG0M — RTX 3060 Laptop 6GB GDDR6, 64GB DDR5, i7-12700H (14C/20T, 4.7GHz), Windows 11, Samsung 990 Pro.
Good for imatrix and 0.6–35B-class work in RAM. 9B+ and searches need rented H200/Blackwell, typically $100 per quant.
Boosty |
Buy Me a Coffee |
DonationAlerts
Thanks to Hugging Face for extra storage.
NOESIS / AMAImedia
Released as part of the NOESIS Professional Multilingual Dubbing Automation Platform
(framework: Deterministic Hybrid Control Framework for Frozen Neural Operators — DHCF-FNO).
AMAImedia
AliceAI-Foundation-80B-A3B — BF16 repack + GGUF quantizations
Repack (BF16 safetensors, shards ≤50 GB) and community GGUF quantizations of
yandex/AliceAI-Foundation-80B-A3B-Base
(model_type: alice_ai, 80B total / 3B active MoE with KDA layers).
Совместимость. alice_ai — гибридная архитектура (Kimi Delta Attention +
gated attention + MoE + Attention Residuals). На сентябрь 2026 upstream
llama.cpp не имеет графа инференса для alice_ai: все GGUF в этом
репозитории собраны и проверены, но запускаются только на
AliceAI-aware runtime. Для инференса используйте Transformers 5.16.1 +
flash-linear-attention==0.5.0 (как в карточке оригинала) или
AliceAI-aware vLLM-образ. Обычный llama-cli для этой архитектуры пока
неприменим.
Compatibility. alice_ai is a hybrid architecture (Kimi Delta Attention +
gated attention + MoE + Attention Residuals). As of September 2026 upstream
llama.cpp has no inference graph for alice_ai: every GGUF here is
converted and validated, but needs an AliceAI-aware runtime. Use
Transformers 5.16.1 + flash-linear-attention==0.5.0 (upstream card) or an
AliceAI-aware vLLM image. Stock llama-cli does not apply to this
architecture yet.
О модели / About the model
| Параметр |
Значение |
| Параметры |
80B всего, 3B активных на токен |
| Hidden size |
2048 |
| Словарь |
129024 (SentencePiece, tokenizer.model) |
| Слоёв |
48 · 12 × (3 × (KDA → MoE) → 1 × (Gated Attention → MoE)) |
| KDA |
32 Q-головы / 32 KV-головы, head dim 128, conv kernel 4 |
| Gated Attention |
16 Q-голов / 2 KV-головы, head dim 256 |
| MoE |
512 экспертов, top-10 + 1 shared, expert FFN 512 |
| MTP |
1 слой (публикуется отдельно: mtp.safetensors) |
| Контекст |
262 144 токена |
| Лицензия |
Apache-2.0 |
Файлы / Files
BF16 safetensors (repack)
| File |
Size (bytes) |
Notes |
models-00001-of-00004.safetensors |
40 161 159 351 |
shard 1/4 (≤50 GB, HF limit) |
models-00002-of-00004.safetensors |
40 627 521 805 |
shard 2/4 |
models-00003-of-00004.safetensors |
39 553 779 850 |
shard 3/4 |
models-00004-of-00004.safetensors |
39 546 206 588 |
shard 4/4 |
mtp.safetensors |
3 300 946 285 |
MTP head, 20 tensors |
models.safetensors.index.json, model.safetensors.index.json |
— |
tensor → shard map (1307 tensors) |
config.json, configuration_alice_ai.py, modeling_alice_ai.py, tokenizer.model, tokenizer_config.json, special_tokens_map.json |
— |
оригинальные файлы модели |
Исходные 49 шардов Yandex слиты в один стриминговый файл и заново нарезаны
на 4 части ≤50 ГБ; корректность подтверждена побайтово — 1307 тензоров,
SHA256 каждого тензора, 0 расхождений (см. code/compare_tensors.py).
GGUF
| File |
Notes |
GGUF/AliceAI-Foundation-80B-A3B-F16.gguf |
F16, 1287 тензоров (MTP исключён) |
GGUF/AliceAI-Foundation-80B-A3B-Q8_0.gguf |
Q8_0 — near-lossless reference |
GGUF/AliceAI-Foundation-80B-A3B-Q6_K.gguf |
Q6_K — near-lossless K-quant |
GGUF/AliceAI-Foundation-80B-A3B-Q4_K_M.gguf |
Q4_K_M — recommended general use |
GGUF/AliceAI-Foundation-80B-A3B-Q2_K.gguf |
Q2_K — experimental low-memory tier |
Как это сделано / How it was made
Весь пайплайн лежит в code/:
download.py — снапшот оригинального чекпоинта (49 шардов).
split_merge.py — стриминговое слияние в один файл + выделение MTP.
compare_tensors.py — сверка заголовков и по-тензорный SHA256 (PASS, 0 потерь).
shard4.py — нарезка на 4 валидных safetensors-шарда ≤50 ГБ + индексы.
upload_shards.py — публикация BF16.
patch_alice_ai.py + alice_ai.cpp + alice-ai-quant-stub.patch — quant-only
стаб alice_ai для llama.cpp (регистрирует архитектуру для llama-quantize).
convert_alice_foundation.py — собственный HF → GGUF F16 конвертер
(маппинг тензоров, SentencePiece-словарь, метаданные; без mmap).
quantize_alice.sh — 4 параллельных кванта (Q8_0, Q6_K, Q4_K_M, Q2_K).
Быстрый старт (инференс) / Quick start (inference)
# transformers==5.16.1, accelerate==1.14.0, flash-linear-attention==0.5.0
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "AMAImedia/AliceAI-Foundation-80B-A3B-BF16-GGUF"
tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
model_id, trust_remote_code=True, dtype="bfloat16", device_map="auto",
)
Оригинальная документация и бенчмарки — в карточке
yandex/AliceAI-Foundation-80B-A3B-Base.
Лицензия и атрибуция / License and attribution
Веса распространяются под Apache-2.0 (как у оригинала). Это community-repack и
community-кванты, не официальный релиз Yandex. Инференс-код модели —
modeling_alice_ai.py — включён в репозиторий без изменений.