SEi AI 更换本地模型指南
零刻 SEi13/14 AI 机型是通过专门适配算力卡的 llama.cpp 运行本地模型,使用适配后的大模型即可调用算力卡。
本教程以零刻 SEi14 AI 机型为例,实际上手操作切换本地模型,只需按如下步骤操作即可。
本教程适用于零刻 SEi13 AI、SEi14 AI 机型
1. 下载模型
llama.cpp 使用 GGUF 格式的模型文件,如需调用算力卡 NPU,还需使用针对算力卡适配过的模型,可在联网状态下,通过以下命令快速搜索已适配模型。
/opt/llama/bin/model-cli query
这里我们选择下载 Qwen3.6-35B-A3B_w4a8 量化模型,这是一个适合用于知识问答、文本生成、文档理解等常见应用场景的大模型,支持 256K 上下文。这里我们记下要下载的模型前面的 ID:1779265995558,然后执行一下命令拉取模型:
sudo /opt/llama/bin/model-cli pull 1779265995558
注:sudo 指获取管理员权限,要求输入用户密码,在终端输入密码默认不会显示,正常输入后回车执行即可
模型默认存储在 /opt/llama/models/<模型名> 目录,下载好以后,验证是否下载成功,执行:
sudo ls /opt/llama/models
输出结果中包含文件夹(qwen3.6_35b-a3b_w4a8_262144_1_1),说明下载成功,我们要的模型文件就在这个文件夹里面,进一步搜索验证:
sudo ls /opt/llama/models/qwen3.6_35b-a3b_w4a8_262144_1_1
如下图,可以看到输出结果中有三个 GGUF 格式文件,HiModel-Qwen3.6-35b-a3b-w4a8... 文件是模型主文件,mmproj...... 文件是多模态投影器,用于实现大模型的多模态能力,让大模型能够理解视觉信息,这里自动下载了两个 mmproj 文件,我们使用其中一个文件即可。
2. 编辑 llama 启动脚本
下载好本地模型后,需要手动编辑 llama 开机自启脚本,执行:
sudo nano /etc/systemd/system/llama-server.service
主要修改[Service] 中的ExecStart 启动参数,建议按下图修改参数。
编辑完成后,按下 Ctrl+X - Y - 回车 ,保存退出编辑器。
注:顶部的 Description=xxx 是说明文本,可改可不改,不影响运行结果
下面是ExecStart 启动参数的说明,有需要可以自行调整参数,更多参数可前往 Llama.cpp 官方查询:
| 启动参数 | 参数全称 | 参数说明 |
|---|---|---|
--log-file /var/log/llama-server.log |
--log-file |
指定日志文件路径,将服务运行日志持久写入文件,不再仅输出终端 |
--log-timestamps |
--log-timestamps |
为每条日志增加时间戳,方便定位异常发生时间 |
--port 8080 |
--port |
设置 HTTP API 监听端口,客户端通过 http://IP:8080 调用推理服务 |
-m /opt/llama/models/qwen3.6_xxx.gguf |
--model (-m) |
指定加载的 GGUF 大模型文件路径 |
--mmproj /opt/llama/models/mmproj_xxx.gguf |
--mmproj |
指定加载的 GGUF 多模态投影器文件路径 |
--alias qwen36 |
--alias |
自定义模型别名,OpenAI 兼容 API 请求时可直接使用别名,无需填写完整模型文件名 |
-np 1 |
--parallel (-np) |
最大并发会话数量,限制服务同时处理的推理请求数 |
-c 262144 |
--ctx-size (-c) |
上下文窗口总大小,当前配置支持 256K 上下文(对话历史 + 输入 + 输出总 token 上限) |
-n 262144 |
--n-predict (-n) |
单次请求最大生成 Token 数量,取值不可超过上下文窗口大小 |
提示:mmproj 仅支持多模态大模型,纯文本模型无法使用 mmproj 文件。
3. 验证新模型是否启用
编辑并保存好 llama 启动脚本后,输入以下命令重启服务,或是直接重启系统即可:
sudo systemctl daemon-reload
sudo systemctl restart llama-server
重启后打开网页 127.0.0.1:8080 ,可以看到显示的模型名称为 qwen36,说明模型切换成功,打个招呼确认模型能否正常使用,得到回应后说明成功了。
4. OpenClaw 切换新模型
新模型就绪后,还需要到 OpenClaw 中切换默认模型,打开终端执行:
openclaw config
选择 Local - Model
然后选择 vLLM;
vLLM base URL 修改为 http://127.0.0.1:8080/v1;
vLLM API Key 填写 sk-local(可以随意输入)
vLLM model 填写 qwen36
然后回车,再按一次回车即可。
这样就配置完成了,再移动到 Done 并按下回车,结束配置。
结束配置后,还需要重启 OpenClaw Gateway 以应用修改,执行:
openclaw gateway restart
重启后即可以新模型使用 OpenClaw。
多模型切换
配置好新模型后,原先的模型如果没有取消勾选,会自动以备用模型配置,可以通过以下命令查询可用模型列表:
openclaw models list
在终端中可以切换默认模型,无需重启 Gateway,执行:
openclaw models set <模型名称>
如需临时切换模型,可以在与 OpenClaw 的对话中回复:/model <模型名称> 快速切换,无需重启。
/opt/llama/bin ,直接使用model-cli <命令> 即可:
echo 'export PATH="$PATH:/opt/llama/bin"' >> ~/.bashrc
source ~/.bashrc












No comments to display
No comments to display