boboliu/Qwen2-7B-Instruct-FP8-KV-CN

🤗 Hugging Face 来源text-generationapache-2.07.6B 参数8.7 GBsafetensors✓ 2 个校验和今天更新
一条命令提交

在你的模型文件夹旁边运行它。它会制作种子、将文件与 Hugging Face 比对,然后提交。你只需开始做种,并粘贴你账户中的密钥。它只读取你的文件,绝不修改。如果愿意,可以先阅读脚本。

curl -fsSL https://pirateface.co/package.sh | bash -s -- --repo boboliu/Qwen2-7B-Instruct-FP8-KV-CN ./model-folder
需要做种者 →

Qwen2-7B-Instruct Quantized with AutoFP8 with KVCache

使用 larryvrh/belle_resampled_78K_CN 校准静态量化的 Qwen/Qwen2-7B-Instruct 模型,可启用 fp8 kv cache。

主要为中文通常语言逻辑任务,为 vLLM 准备。

使用

参数加入 kv_cache_dtype="fp8"

评估

使用 lm-evaluation-harness + vLLM serve 进行评估:

项目 Qwen2-7B-Instruct Qwen2-7B-Instruct-FP8-CN Recovery 此项目 Recovery
ceval-valid 81.87 81.65 99.73% 81.35 99.36%
cmmlu 81.78 81.26 99.36% 81.19 99.28%
agieval_logiqa_zh (5 shots) 47.63 48.54 101.91% 46.54 97.71%
平均 70.43 70.48 100.07% 69.69 98.95%