0xSojalSec/GLM-4.7-Flash-Name-NSFW

🤗 Hugging Face 来源mit29.9B 参数60 GBsafetensors✓ 14 个校验和今天更新
需要做种者 →

GLM-4.7-Flash · 猫娘人格

⚠️ 成人内容警告

这个模型用成人向角色扮演数据微调过,会主动生成露骨的性相关内容和粗俗语言, 且没有做任何安全对齐。它不适合公开服务、面向未成年人的产品、或任何 需要内容合规的场景。请确认你所在地区对此类内容的适用法律。

下面所有示例、说明都是虚构角色的输出,不代表任何真实人物的言行。


这是什么

在 zai-org/GLM-4.7-Flash 上做的 LoRA 微调, 目标是固定一个猫娘人格的语气与说话习惯,然后合并、量化成 GGUF。

基座 GLM-4.7-Flash
结构 30B MoE,每 token 激活约 3B 参数
规模 47 层,hidden 2048,64 路由专家 + 1 共享专家,top-4
注意力 MLA(含 LoRA 式 Q/KV 压缩)
上下文 202,752
微调方式 LoRA SFT
训练框架 ms-swift
合并 swift export --merge_lora true --device_map cpu
量化 llama.cpp(部分档位带 imatrix 校准)

人格设定

银发蓝瞳的猫娘。居高临下、爱嘲讽、口无遮拦,动不动骂人「杂鱼」; 进入亲密情境后语气转为黏软、撒娇、示弱。常驻口癖:喵、窝、杂鱼、主人、哦齁齁齁齁齁。 内心独白用同一套口吻,短促、带刺、不解释。

回复带思考链,格式是 thinking…</…>(具体标记由基座模板决定)。

注意:如果只想用基座本身的通用能力,不要用这份权重——人格是写死在数据里的, 它会污染所有回复的语气。

采样参数(重要)

GLM-4.7-Flash 对采样参数比较敏感,照下面来:

参数 值 原因
--temp 1.0 基座推荐值。调低会让语气变僵、口癖消失
--top-p 0.95 基座推荐值
--min-p 0.01 必须显式指定。llama.cpp 默认是 0.05,会剪掉太多
--repeat-penalty 1.0 必须关掉。重复惩罚会破坏思考链和口癖节奏

工具调用场景可改用 --temp 0.7 --top-p 1.0。

⚠️ 关于 --jinja

必须带 --jinja,否则不会套用对话模板,模型会退化成纯文本补全—— 最明显的症状是没有思考链、回复不带人格口癖。

如果想自己控制提示词格式而不依赖 --jinja,手写模板是:

<|system|>
{系统提示词}
<|user|>
{用户输入}
<|assistant|>

(实际标记以基座 chat_template 为准,llama-gguf 里存的那份就是标准答案。)

已知的模板坑

  • 不建议用 Ollama 跑。 GLM-4.7 的模板用了 {% macro %}、namespace() 等较新的 Jinja 特性,Ollama 的模板引擎兼容性更差,容易出现格式错乱。
  • llama.cpp 内置的 minja 对同一批语法支持也不完整。如果发现回复格式不对、 思考块重复、或者人格口癖消失,先用 --jinja 对比一次,确认是模板渲染的问题 而不是权重的问题。
  • 用到的 llama.cpp 需要是较新的版本——glm4_moe_lite 这个架构上游合并得比较晚, 老版本会直接报架构不支持。

训练数据

  • 样本量:约 1800+ 条多轮对话
  • 语言:中文为主
  • 内容:成人向角色扮演,含露骨性描写与粗俗用语
  • 标注方式:人工撰写 / 模型生成 + 人工筛选

已知限制

  • 未做安全对齐。 模型会输出成人内容、粗话、以及可能令人不适的表达, 且不会拒绝越界请求。请不要把它接到任何面向公众的服务上。
  • 人格会覆盖一切。 问它正经问题也会用同样的腔调回答,专业性没有保证。
  • 只有 3B 激活参数。 复杂推理、长链条工具调用上明显弱于大模型。
  • 多人格能力弱。 训练只覆盖了这一个角色,换设定容易串味。

致谢

免责声明

仅供个人研究与娱乐使用。作者不对模型生成的任何内容负责,也不保证其准确性、 合法性或适用性。使用者需自行确认对成人内容的获取与使用符合所在地法律。