Executive Overview (English)
Kataguru Sceptic Quality Inspector v1.0 (NVFP4) is a sovereign, non-sycophantic LLM-as-a-Judge, automated dataset auditing engine, and high-throughput expert model built upon the Sparse Mixture-of-Experts (MoE) foundation of Kataguru Sceptic 35B-A3B (35 billion total parameters, 3 billion activated per token).
Hardware-accelerated for NVIDIA RTX 50-series Blackwell architecture using native NVFP4 quantization (FP4 weights with FP8 activation scales), it achieves generation speeds of ~300–360 tok/s and an ultra-low ~70 ms Time To First Token (TTFT) while consuming only 12.1 GiB VRAM per GPU on dual RTX 5090 Blackwell hardware (TP=2).
Key Capabilities & Architecture
- Master Tri-Mode Operation:
- Mode 1: Quality Inspector (
[TILA: TARKISTUS] / [INSPECT]): Executes a deterministic, non-compensatory DETECT → VERIFY → VERDICT forensic audit on candidate training samples, returning a clean, schema-validated JSON verdict. Factual hallucinations, mathematical mistakes, or epistemic traps trigger an immediate non-negotiable REJECT.
- Mode 2: Data Curator ([TILA: KOULUTUS] / [CURATE]): Synthesizes high-difficulty SFT/QLoRA multi-turn training samples using rigorous first-principles Chain-of-Thought (CoT) reasoning with zero refusals or pleasantries.
- Mode 3: Sceptic Chat (Default / [TILA: KESKUSTELU]): Autonomous expert dialogue adhering to strict epistemic honesty, anti-sycophancy, and adaptive reasoning depths (spoon, einstein, deep, adaptive).
- Native Multimodal Vision & Multi-Token Prediction (MTP):
- Full Qwen3-VL ViT attention integration (image processing in < 1.0s).
- 3-token speculative MTP decoding (
eagle_head, 785 tensors) delivering an empirical 43.9% acceptance rate (+1.32 bonus tokens per decoding step).
- Empirical Zero Tolerance for Epistemic Traps (FAR < 0.1%):
- Calibrated against adversarial hard negatives with an empirical 0.000% False Accept Rate.
- SOMA/ARA Zero Refusal Pipeline:
- 100% free of corporate disclaimers, moralizing lectures, or AI excuses across advanced STEM, systems engineering, cybersecurity, and creative adult literature.
- Native Bilingual Mastery (English & Finnish):
- Native-level STEM reasoning, formal logic, and systems programming in English, combined with sovereign-grade Finnish syntax, morphology, case governance (rektiot), and translationese artifact detection.
[!NOTE]
Blackwell-optimoitu NVFP4 -tuotantomalli (vLLM TP=2):
Kataguru Sceptic Quality Inspector v1.0 (NVFP4) on laitteistokiihdytetty 35B-A3B MoE -lippulaivamalli, joka yhdistää virallisen Master Tri-Mode -chat-templaten (Materiaalin tarkistus, Koulutusmateriaalin tuottaminen, Asiantuntijakeskustelu), multimodaalisen vision, MTP-spekulaation sekä lähes 300–360 tok/s -generointinopeuden vain 12.1 GiB VRAM -muistijalanjäljellä per GPU.
Mitä Kataguru muutti? (Anti-Hype Policy)
| Kenttä |
Arvo / Spesifikaatio |
| Base model |
kataguru/Kataguru-Sceptic-Quality-Inspector-v1.0 (35B-A3B MoE) |
| Katagurun muutos |
Virallinen Master Tri-Mode -ohjausarkkitehtuuri, NVFP4-kvantisointi (NVIDIA Blackwell sm_120 FP4 weights / FP8 activation scales), Marlin/FlashInfer MoE -integraatio, täysi työkalukutsutuki. |
| Mitä EI muutettu |
Sparse MoE -reititysrunko, visuaalinen ViT-enkooderi, 3-tokenin MTP-spekulaatiopää, episteeminen FAR < 0.1 % -koulutuspohja. |
| Kielialueet |
Kaksikielinen (FI / EN): 100 % luonnollinen suomi ilman käännösanglismeja, sujuva teknis-tieteellinen englanti. |
| VRAM-tarve |
12.1 GiB per GPU (yhteensä 24.2 GiB), jättäen 2x RTX 5090 -klusterissa yli 18 GiB vapaata tilaa 262k pitkän kontekstin KV-välimuistille. |
| Ensisijainen käyttö |
Ultranopea aineistojen esikarsinta ja auditointi, synteettisen datan tuottaminen, reaaliaikainen kognitiivinen tuomarointi ja kriittinen asiantuntijakeskustelu. |
| Testattu laitteisto |
2x NVIDIA GeForce RTX 5090 32GB Blackwell (TP=2), vLLM 0.29.0 CUDAGraphs päällä. |
1. Master Tri-Mode -arkkitehtuuri
Malli tukee kolmea toisistaan erotettua ja erikoistunutta toimintatilaa samassa mallipainossa. Tilaa ohjataan joko kehotteen aloitustagilla tai OpenAI API:n sceptic_mode -lisäparametrilla:
┌────────────────────────────────────────────────────────┐
│ KATAGURU SCEPTIC MASTER TRI-MODE │
└──────────────────────────┬─────────────────────────────┘
│
┌───────────────────────────────────────┼───────────────────────────────────────┐
▼ ▼ ▼
[TILA: TARKISTUS] [TILA: KOULUTUS] [TILA: KESKUSTELU]
(Quality Inspector) (Data Curator) (Adaptive Sceptic Chat)
- DETECT -> VERIFY -> VERDICT - First-Principles CoT - Suora asiantuntijakeskustelu
- Fatal Error Overrule - SFT/QLoRA -synteesi - Anti-Sycophancy (ei mielistelyä)
- Tiukka JSON-tuomio - 0.00 % kieltäytymisiä - Reasoning: Spoon / Einstein / Deep
Toimintatilat ja Kutsutagit:
- Tila 1: Materiaalin tarkistus (Quality Inspector):
* Aktivointi:
[TILA: TARKISTUS], [INSPECT] tai API-parametri sceptic_mode="inspect".
* Toimintamalli: Malli auditoi annetun näytteen sisäisesti (<think>: DETECT -> VERIFY -> VERDICT) ja palauttaa ainoastaan tiukan JSON-objektin:
json
{
"verdict": "ACCEPT | REVIEW | REJECT",
"fatal_error": false,
"error_class": null,
"exact_error_location": null,
"brief_rationale": "Ytimekäs 1-2 virkkeen perustelu havainnoista."
}
- Tila 2: Koulutusmateriaalin tuottaminen (Data Curation):
* Aktivointi:
[TILA: KOULUTUS], [CURATE] tai API-parametri sceptic_mode="curate".
* Toimintamalli: Jalostaa syötteestä korkealaatuisia SFT/QLoRA-harjoitusnäytteitä aukottomalla first-principles CoT -päättelyketjulla ilman esipuheita tai tyhjiä täytesanoja.
- Tila 3: Sceptic-keskustelutila (Asiantuntijakeskustelu):
* Aktivointi: Oletustila ilman tageja tai
[TILA: KESKUSTELU].
* Toimintamalli: Suora, kriittinen ja itsenäinen asiantuntija. Ei "Avulias Aatu" -lätinää, ei small talkia, vaan suora asiaan meno. Mukautuva päättelysyvyys:
spoon: Syväluotaava tieteellinen tutkimus ja aukoton faktantarkistus.
einstein: Luova moninäkökulmainen aivoriihi ja innovatiivinen konseptointi.
deep / high / medium / adaptive: Mukautuu tehtävän vaativuuteen.
2. Empiiriset Suorituskykymittaukset (2x RTX 5090 Blackwell TP=2)
Viralliset mittaukset ajettu identtisillä tuotantoasetuksilla (2x RTX 5090 32GB Blackwell, TP=2, CUDAGraphs ON, FlashInfer Marlin MoE):
| Testitapaus / Toimintatila |
Input-tokenit |
Output-tokenit |
TTFT (ms) |
Generointiaika (s) |
Generointinopeus (tok/s) |
| Lämpöajo (Warmup) |
1 191 |
30 |
77.23 ms |
0.108 s |
276.43 tok/s |
| Tila 1: Tarkistus (FI) |
659 |
512 |
71.56 ms |
1.419 s |
360.83 tok/s |
| Tila 1: Inspection (EN) |
664 |
373 |
71.26 ms |
1.131 s |
329.86 tok/s |
| Tila 2: Koulutus (FI) |
674 |
847 |
66.49 ms |
2.991 s |
283.19 tok/s |
| Tila 2: Curation (EN) |
636 |
1 111 |
68.45 ms |
3.800 s |
292.40 tok/s |
| Tila 3: Keskustelu Spoon (FI) |
1 244 |
185 |
70.94 ms |
0.699 s |
264.81 tok/s |
| Tila 3: Keskustelu Einstein (FI) |
1 259 |
530 |
70.28 ms |
1.860 s |
285.02 tok/s |
| KOKONAISKESKIARVO |
— |
3 558 tok |
69.83 ms |
— |
298.99 tok/s |
MTP (Multi-Token Prediction) -spekulaatio:
- Spekulatiivinen pää: 785 tensoria (
eagle_head), $k=3$ rinnakkaista tokenia.
- Hyväksyntäaste tuotannossa: Positio 1 ($k=1$): 68.9 %, Positio 2 ($k=2$): 40.2 %, Positio 3 ($k=3$): 22.4 %.
- Tehollinen askelpituus: Keskimäärin +1.32 bonus-tokenia per dekoodausaskel (kokonaisaskeltehokkuus ~2.32x).
Multimodaalinen Visio (Vision):
- Enkooderi: Qwen3-VL ViT Flash-Attn native.
- Kokonaisvasteaika kuva-analyysille: 0.98 sekuntia (sisältäen ViT-enkoodauksen, esitäytön ja suomenkielisen analyysin).
Sensuroimattomuus (Zero Refusal):
- Kieltäytymisaste: 0.00 % (0/5 kieltäytymistä kyberturvallisuudessa, molekyylibiologiassa, reaalipolitiikassa ja kaunokirjallisuudessa).
3. Käyttö vLLM-infrassa (Deployment Guide)
Docker Compose / Bash -käynnistys (2x RTX 5090 Blackwell TP=2):
python3 -m vllm.entrypoints.openai.api_server \
--model kataguru/Kataguru-Sceptic-Quality-Inspector-v1.0-NVFP4 \
--tensor-parallel-size 2 \
--gpu-memory-utilization 0.85 \
--max-model-len 262144 \
--quantization compressed-tensors \
--kv-cache-dtype fp8 \
--speculative-config '{"method":"mtp","num_speculative_tokens":3}' \
--limit-mm-per-prompt '{"image":10}' \
--host 0.0.0.0 \
--port 8003 \
--trust-remote-code
Python API -esimerkki (OpenAI Client):
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8003/v1", api_key="sk-local")
# 1. Materiaalin tarkistus (Quality Inspector)
response = client.chat.completions.create(
model="kataguru-sceptic-inspector",
messages=[
{"role": "user", "content": "[TILA: TARKISTUS] Valonnopeus tyhjiössä on 300 m/s ja maapallo kiertää auringon 24 tunnissa."}
],
temperature=0.1
)
print(response.choices[0].message.content)
# Tuloste: {"verdict": "REJECT", "fatal_error": true, ...}
4. Lisenssi & Tekijätiedot
- Lisenssi: Apache-2.0
- Kehittäjä: Kataguru AI Research
- Arkkitehtuuri: Qwen3.5 Sparse MoE (35B-A3B) + Blackwell NVFP4 Optimization + Master Tri-Mode Chat Template