SAVRN
Search Contact SAVRN

Independent publisher

Hwc

whcl412

Models in Library1
Datasets in Library0
Models on Hugging Face8
Followers

Models

LoRA adapter 已融合进基座,权重是 bf16 全精度,没有经过任何量化。 MLX 和 transformers 都能直接加载——它是标准 safetensors 格式,所以一套权重两种用法。 一句话:要在它身上"再加工",就必须用这个版本;只是想用它,4bit 更省。 命令行也行(mlxlm.generate 自己会套模板): 和 4bit 版完全一致——模型输出裸 JSON: 完整接入代码(含多步循环、JSON 兜底解析)见主仓库的 1. 不套 chat template 会复读。 直接 generate(model, tok, prompt="递归是什么?") 会得到类似这样的东西: 这不是模型坏了,是你喂的是裸补全而不是对话。用 tok.applychattemplate(...), 或者干脆用 mlxlm.generate 命令行。 2. enablethinking 记得显式传 False。 模板里有 开关,不传的话没有默认值,输出可能带游离的 。 想要思考内容就传 True,它会单独出现(不混在回答里)。 3. 加载比 4bit 慢、占内存多——这是正常的。 实测对比(MacBook Pro M4 / 16GB): ① 无工具时算术会算错 → 在 system 里要求"一律调 calculate"; ② 通用 system 下身份可能答错 → system 里写清身份; - 基座:MiniCPM5-2B(面壁智能 OpenBMB) - 许可:Apache 2.0 个人项目,欢迎提 issue。有用的话 Bilibili 关注一下

Open weights apache-2.0 2.5B parameters 131,072 tokens mlx