GLM-4.7-Flash · 猫娘人格
⚠️ 成人内容警告
这个模型用成人向角色扮演数据微调过,会主动生成露骨的性相关内容和粗俗语言, 且没有做任何安全对齐。它不适合公开服务、面向未成年人的产品、或任何 需要内容合规的场景。请确认你所在地区对此类内容的适用法律。
下面所有示例、说明都是虚构角色的输出,不代表任何真实人物的言行。
这是什么
在 zai-org/GLM-4.7-Flash 上做的 LoRA 微调,
目标是固定一个猫娘人格的语气与说话习惯,然后合并、量化成 GGUF。
| 基座 | GLM-4.7-Flash |
| 结构 | 30B MoE,每 token 激活约 3B 参数 |
| 规模 | 47 层,hidden 2048,64 路由专家 + 1 共享专家,top-4 |
| 注意力 | MLA(含 LoRA 式 Q/KV 压缩) |
| 上下文 | 202,752 |
| 微调方式 | LoRA SFT |
| 训练框架 | ms-swift |
| 合并 | swift export --merge_lora true --device_map cpu |
| 量化 | llama.cpp(部分档位带 imatrix 校准) |
人格设定
银发蓝瞳的猫娘。居高临下、爱嘲讽、口无遮拦,动不动骂人「杂鱼」; 进入亲密情境后语气转为黏软、撒娇、示弱。常驻口癖:喵、窝、杂鱼、主人、哦齁齁齁齁齁。 内心独白用同一套口吻,短促、带刺、不解释。
回复带思考链,格式是 thinking…</…>(具体标记由基座模板决定)。
注意:如果只想用基座本身的通用能力,不要用这份权重——人格是写死在数据里的, 它会污染所有回复的语气。
采样参数(重要)
GLM-4.7-Flash 对采样参数比较敏感,照下面来:
| 参数 | 值 | 原因 |
|---|---|---|
--temp |
1.0 |
基座推荐值。调低会让语气变僵、口癖消失 |
--top-p |
0.95 |
基座推荐值 |
--min-p |
0.01 |
必须显式指定。llama.cpp 默认是 0.05,会剪掉太多 |
--repeat-penalty |
1.0 |
必须关掉。重复惩罚会破坏思考链和口癖节奏 |
工具调用场景可改用 --temp 0.7 --top-p 1.0。
⚠️ 关于 --jinja
必须带 --jinja,否则不会套用对话模板,模型会退化成纯文本补全——
最明显的症状是没有思考链、回复不带人格口癖。
如果想自己控制提示词格式而不依赖 --jinja,手写模板是:
<|system|>
{系统提示词}
<|user|>
{用户输入}
<|assistant|>
(实际标记以基座 chat_template 为准,llama-gguf 里存的那份就是标准答案。)
已知的模板坑
- 不建议用 Ollama 跑。 GLM-4.7 的模板用了
{% macro %}、namespace()等较新的 Jinja 特性,Ollama 的模板引擎兼容性更差,容易出现格式错乱。 - llama.cpp 内置的 minja 对同一批语法支持也不完整。如果发现回复格式不对、
思考块重复、或者人格口癖消失,先用
--jinja对比一次,确认是模板渲染的问题 而不是权重的问题。 - 用到的 llama.cpp 需要是较新的版本——
glm4_moe_lite这个架构上游合并得比较晚, 老版本会直接报架构不支持。
训练数据
- 样本量:约
1800+条多轮对话 - 语言:中文为主
- 内容:成人向角色扮演,含露骨性描写与粗俗用语
- 标注方式:人工撰写 / 模型生成 + 人工筛选
已知限制
- 未做安全对齐。 模型会输出成人内容、粗话、以及可能令人不适的表达, 且不会拒绝越界请求。请不要把它接到任何面向公众的服务上。
- 人格会覆盖一切。 问它正经问题也会用同样的腔调回答,专业性没有保证。
- 只有 3B 激活参数。 复杂推理、长链条工具调用上明显弱于大模型。
- 多人格能力弱。 训练只覆盖了这一个角色,换设定容易串味。
致谢
免责声明
仅供个人研究与娱乐使用。作者不对模型生成的任何内容负责,也不保证其准确性、 合法性或适用性。使用者需自行确认对成人内容的获取与使用符合所在地法律。