跑本地模型用来测试或者本地对话,ollma 可以开箱即用。但是如果想让模型性能更好,还是得用 llama cpp
项目地址:https://github.com/ggml-org/llama.cpp/releases
我用的是笔记本
cpu: AMD 8845hs
核显:780M
内存:24G ddr5
llama cpp 放到了 D:\AI\ 路径下, 模型放到 D:\AI\models
打开记事本,粘贴以下内容,重命名为 30B.bat。 双击运行。
我的测试对话输出稳定在25tokens/s ,对话,测试是够用的。
@echo off
chcp 65001 >nul
cd /d D:\AI\llama-b10976-bin-win-vulkan-x64
llama-server.exe ^
-m "D:\AI\models\Qwen3-Coder-30B-A3B-Instruct-UD-IQ2_M.gguf" ^
-ngl 99 ^
-c 64000 ^
-t 14 ^
-b 2048 ^
-ub 1024 ^
--cache-type-k q8_0 ^
--cache-type-v q5_1 ^
--host 0.0.0.0 ^
--port 8080 ^
--parallel 1 ^
--flash-attn on
pause参数 | 含义 | 备注 |
|---|---|---|
| 尽可能把所有层放到 GPU(Vulkan) | Qwen3-Coder-30B-A3B 是 MoE,激活只有 3B,权重不大,但 KV Cache 很大;显存不够就降低 ngl |
| 上下文窗口 64k token | 配合 FlashAttn + KV 量化,才能稳定跑长上下文 |
| CPU 线程数 | 一般设为你的 CPU 物理核心数,不要超过物理核 |
| 批大小 batch | prefill 批处理 |
| 解码批大小 | 生成阶段 batch |
| K 缓存量化为 q8_0 | 节省大量显存 |
| V 缓存量化 q5_1 | 你选的组合,平衡显存 / 质量;推荐长上下文两者都 q8_0 更稳 |
| 监听所有网卡 | 局域网其他设备可以访问 |
| Web/API 端口 | 网页 UI + OpenAI 兼容接口 |
| 最大并发请求槽位 | 一次只处理 1 个对话;多人同时用就改成 2/3 |
| 开启 Flash Attention | Vulkan 后端支持,大幅降低 KV 显存占用,长 prompt 预填充更快,必须开启才能稳定跑 64k 上下文CSDN博... |

