SEi AI 更换本地模型指南 零刻 SEi13/14 AI 机型是通过专门适配算力卡的 llama.cpp 运行本地模型,使用适配后的大模型即可调用算力卡。 本教程以零刻 SEi14 AI 机型为例,实际上手操作切换本地模型,只需按如下步骤操作即可。 本教程适用于零刻 SEi13 AI、SEi14 AI 机型   1. 下载模型 llama.cpp 使用 GGUF 格式的模型文件,如需调用算力卡 NPU,还需使用针对算力卡适配过的模型,可在联网状态下,通过以下命令快速搜索已适配模型。 /opt/llama/bin/model-cli query 这里我们选择下载 Qwen3.6-35B-A3B_w4a8 量化模型,这是一个适合用于知识问答、文本生成、文档理解等常见应用场景的大模型,支持 256K 上下文。这里我们记下要下载的模型前面的 ID:1779265995558,然后执行一下命令拉取模型: sudo /opt/llama/bin/model-cli pull 1779265995558 注:sudo 指获取管理员权限,要求输入用户密码,在终端输入密码默认不会显示,正常输入后回车执行即可 模型默认存储在 /opt/llama/models/<模型名> 目录,下载好以后,验证是否下载成功,执行: sudo ls /opt/llama/models 输出结果中包含文件夹(qwen3.6_35b-a3b_w4a8_262144_1_1),说明下载成功,我们要的模型文件就在这个文件夹里面,进一步搜索验证: sudo ls /opt/llama/models/qwen3.6_35b-a3b_w4a8_262144_1_1 如下图,可以看到输出结果中有三个 GGUF 格式文件, HiModel-Qwen3.6-35b-a3b-w4a8... 文件是模型主文件, mmproj...... 文件是多模态投影器,用于实现大模型的多模态能力,让大模型能够理解视觉信息,这里自动下载了两个 mmproj 文件,我们使用其中一个文件即可。   2. 编辑 llama 启动脚本 下载好本地模型后,需要手动编辑 llama 开机自启脚本,执行: sudo nano /etc/systemd/system/llama-server.service 主要修改 [Service] 中的 ExecStart 启动参数,建议按下图修改参数。 编辑完成后,按下 Ctrl+X - Y - 回车 ,保存退出编辑器。 注:顶部的 Description=xxx 是说明文本,可改可不改,不影响运行结果 下面是 ExecStart 启动参数的说明,有需要可以自行调整参数,更多参数可前往 Llama.cpp 官方查询: 启动参数 参数全称 参数说明 --log-file /var/log/llama-server.log --log-file 指定日志文件路径,将服务运行日志持久写入文件,不再仅输出终端 --log-timestamps --log-timestamps 为每条日志增加时间戳,方便定位异常发生时间 --port 8080 --port 设置 HTTP API 监听端口,客户端通过 http://IP:8080 调用推理服务 -m /opt/llama/models/qwen3.6_xxx.gguf --model (-m) 指定加载的 GGUF 大模型文件路径 --mmproj /opt/llama/models/mmproj_xxx.gguf --mmproj 指定加载的 GGUF 多模态投影器文件路径 --alias qwen36 --alias 自定义模型别名,OpenAI 兼容 API 请求时可直接使用别名,无需填写完整模型文件名 -np 1 --parallel (-np) 最大并发会话数量,限制服务同时处理的推理请求数 -c 262144 --ctx-size (-c) 上下文窗口总大小,当前配置支持 256K 上下文(对话历史 + 输入 + 输出总 token 上限) -n 262144 --n-predict (-n) 单次请求最大生成 Token 数量,取值不可超过上下文窗口大小 提示: mmproj 仅支持多模态大模型,纯文本模型无法使用 mmproj 文件。   3. 验证新模型是否启用 编辑并保存好 llama 启动脚本后,输入以下命令重启服务,或是直接重启系统即可: sudo systemctl daemon-reload sudo systemctl restart llama-server 重启后打开网页 127.0.0.1:8080 ,可以看到显示的模型名称为 qwen36 ,说明模型切换成功,打个招呼确认模型能否正常使用,得到回应后说明成功了。   4. OpenClaw 切换新模型 新模型就绪后,还需要到 OpenClaw 中切换默认模型,打开终端执行: openclaw config 选择 Local - Model 然后选择 vLLM ; vLLM base URL 修改为 http://127.0.0.1:8080/v1 ; vLLM API Key 填写 sk-local (可以随意输入) vLLM model 填写 qwen36 然后回车,再按一次回车即可。 这样就配置完成了,再移动到 Done 并按下回车,结束配置。 结束配置后,还需要重启 OpenClaw Gateway 以应用修改,执行: openclaw gateway restart 重启后即可以新模型使用 OpenClaw。 多模型切换 配置好新模型后,原先的模型如果没有取消勾选,会自动以备用模型配置,可以通过以下命令查询可用模型列表: openclaw models list 在终端中可以切换默认模型,无需重启 Gateway,执行: openclaw models set <模型名称> 如需临时切换模型,可以在与 OpenClaw 的对话中回复: /model <模型名称> 快速切换,无需重启。 Tips:如后续需频繁调用 model-cli 命令查询、下载模型,建议将以下命令加入环境变量简化命令,后续可以省略  /opt/llama/bin ,直接使用   model-cli <命令> 即可: echo 'export PATH="$PATH:/opt/llama/bin"' >> ~/.bashrc source ~/.bashrc