测试了几天,记录一下部署qwen3.8 27B可以比较正常运行的参数。
环境lmstudio,显卡rtx 3090,显存24G,内存16G。
以下参数名称为中文界面下显示的名称
GPU卸载 : 65
评估批处理大小 : 2048
Physical Batch Size : 64 (显存不够时尝试降低此值,显存够时增加此值)
Context Checkpoints : 32
保持模型在内存中 : false
尝试mmap : false
其他参数不变。
MTP(多token预测,或投机解码)预测token设置过2或3,感觉差别不大。
速度大概在47~50 token/s 。
注意,不要开启KV缓存量化!我花了一天时间得出了此结论,开启后模型会严重降智,严重时会出现无限循环文本。