# SEi AI 更换本地模型指南

##### <span class="md-plain">零刻 SEi13/14 AI 机型是通过专门适配算力卡的 llama.cpp 运行本地模型，使用适配后的大模型即可调用算力卡。</span>

##### <span class="md-plain">本教程以零刻 SEi14 AI 机型为例，实际上手操作切换本地模型，只需按如下步骤操作即可。</span>

> ##### <span class="md-pair-s ">**<span class="md-plain">本教程适用于零刻 SEi13 AI、SEi14 AI 机型</span>**</span>

### <span class="md-pair-s ">**<span class="md-plain">1. 下载模型</span>**</span>

##### <span class="md-plain">llama.cpp 使用 GGUF 格式的模型文件，如需调用算力卡 NPU，还需使用针对算力卡适配过的模型，可在联网状态下，通过以下命令快速搜索已适配模型。</span>

```
/opt/llama/bin/model-cli query
```

[![搜索模型.png](https://doc.bee-link.com.cn/uploads/images/gallery/2026-07/scaled-1680-/NYVI3TVvTmINrpGy-73pVZkkMGP.png)](https://doc.bee-link.com.cn/uploads/images/gallery/2026-07/NYVI3TVvTmINrpGy-73pVZkkMGP.png)

##### <span class="md-plain">这里我们选择下载 </span><span class="md-pair-s" spellcheck="false">`Qwen3.6-35B-A3B_w4a8`</span><span class="md-plain"> 量化模型，这是一个适合用于知识问答、文本生成、文档理解等常见应用场景的大模型，支持 256K 上下文。这里我们记下要下载的模型前面的 ID：1779265995558，然后执行一下命令拉取模型：</span>

```
sudo /opt/llama/bin/model-cli pull 1779265995558
```

<span class="md-plain">注：sudo 指获取管理员权限，要求输入用户密码，在终端输入密码默认不会显示，正常输入后回车执行即可</span>

[![下载模型.png](https://doc.bee-link.com.cn/uploads/images/gallery/2026-07/scaled-1680-/65LBzlVBCwuuxDUr-AuVQDMT5T8.png)](https://doc.bee-link.com.cn/uploads/images/gallery/2026-07/65LBzlVBCwuuxDUr-AuVQDMT5T8.png)

##### <span class="md-plain">模型默认存储在 </span><span class="md-pair-s" spellcheck="false">`/opt/llama/models/<模型名>`</span><span class="md-plain"> 目录，下载好以后，验证是否下载成功，执行：</span>

```
sudo ls /opt/llama/models
```

##### <span class="md-plain">输出结果中包含文件夹（qwen3.6\_35b-a3b\_w4a8\_262144\_1\_1），说明下载成功，我们要的模型文件就在这个文件夹里面，进一步搜索验证：</span>

```
sudo ls /opt/llama/models/qwen3.6_35b-a3b_w4a8_262144_1_1
```

##### <span class="md-plain">如下图，可以看到输出结果中有三个 GGUF 格式文件，</span><span class="md-pair-s" spellcheck="false">`HiModel-Qwen3.6-35b-a3b-w4a8...`</span><span class="md-plain"> 文件是模型主文件，</span><span class="md-pair-s" spellcheck="false">`mmproj......`</span><span class="md-plain"> 文件是多模态投影器，用于实现大模型的多模态能力，让大模型能够理解视觉信息，这里自动下载了两个 mmproj 文件，我们使用其中一个文件即可。</span>

[![验证模型.png](https://doc.bee-link.com.cn/uploads/images/gallery/2026-07/scaled-1680-/8XAsblbyBhGHPnma-g2yBiode2T.png)](https://doc.bee-link.com.cn/uploads/images/gallery/2026-07/8XAsblbyBhGHPnma-g2yBiode2T.png)

#####  

### <span class="md-pair-s ">**<span class="md-plain">2. 编辑 llama 启动脚本</span>**</span>

##### <span class="md-plain">下载好本地模型后，需要手动编辑 llama 开机自启脚本，执行：</span>

```
sudo nano /etc/systemd/system/llama-server.service
```

[![编辑脚本1.png](https://doc.bee-link.com.cn/uploads/images/gallery/2026-07/scaled-1680-/NnhqTGsaarDYW2tr-1.png)](https://doc.bee-link.com.cn/uploads/images/gallery/2026-07/NnhqTGsaarDYW2tr-1.png)

##### <span class="md-plain">主要修改</span><span class="md-pair-s" spellcheck="false">`[Service]`</span><span class="md-plain"> 中的</span><span class="md-pair-s" spellcheck="false">`ExecStart`</span><span class="md-plain"> 启动参数，建议按下图修改参数。</span>

##### <span class="md-plain">编辑完成后，按下 </span><span class="md-pair-s" spellcheck="false">`Ctrl+X`</span><span class="md-plain"> - </span><span class="md-pair-s" spellcheck="false">`Y`</span><span class="md-plain"> - </span><span class="md-pair-s" spellcheck="false">`回车`</span><span class="md-plain"> ，保存退出编辑器。</span>

<span class="md-plain">注：顶部的 Description=xxx 是说明文本，可改可不改，不影响运行结果</span>

[![编辑脚本2.png](https://doc.bee-link.com.cn/uploads/images/gallery/2026-07/scaled-1680-/qwz7eRsxUezNzeSY-2.png)](https://doc.bee-link.com.cn/uploads/images/gallery/2026-07/qwz7eRsxUezNzeSY-2.png)

##### <span class="md-plain">下面是</span><span class="md-pair-s" spellcheck="false">`ExecStart`</span><span class="md-plain"> 启动参数的说明，有需要可以自行调整参数，更多参数可前往 Llama.cpp 官方查询：</span>

<table class="md-table" id="bkmrk-%E5%90%AF%E5%8A%A8%E5%8F%82%E6%95%B0-%E5%8F%82%E6%95%B0%E5%85%A8%E7%A7%B0-%E5%8F%82%E6%95%B0%E8%AF%B4%E6%98%8E---log" style="width: 100%; height: 637.25px;"><thead><tr class="md-end-block" style="height: 36.5px;"><th style="width: 24.3147%; height: 36.5px;"><span class="td-span"><span class="md-plain">启动参数</span></span></th><th style="width: 22.7639%; height: 36.5px;"><span class="td-span"><span class="md-plain">参数全称</span></span></th><th style="width: 52.9214%; height: 36.5px;"><span class="td-span"><span class="md-plain">参数说明</span></span></th></tr></thead><tbody><tr class="md-end-block" style="height: 87.25px;"><td style="width: 24.3147%; height: 87.25px;"><span class="td-span"><span class="md-pair-s" spellcheck="false">`--log-file /var/log/llama-server.log`</span></span></td><td style="width: 22.7639%; height: 87.25px;"><span class="td-span"><span class="md-pair-s" spellcheck="false">`--log-file`</span></span></td><td style="width: 52.9214%; height: 87.25px;"><span class="td-span"><span class="md-plain">指定日志文件路径，将服务运行日志持久写入文件，不再仅输出终端</span></span></td></tr><tr class="md-end-block" style="height: 37.75px;"><td style="width: 24.3147%; height: 37.75px;"><span class="td-span"><span class="md-pair-s" spellcheck="false">`--log-timestamps`</span></span></td><td style="width: 22.7639%; height: 37.75px;"><span class="td-span"><span class="md-pair-s" spellcheck="false">`--log-timestamps`</span></span></td><td style="width: 52.9214%; height: 37.75px;"><span class="td-span"><span class="md-plain">为每条日志增加时间戳，方便定位异常发生时间</span></span></td></tr><tr class="md-end-block" style="height: 61.25px;"><td style="width: 24.3147%; height: 61.25px;"><span class="td-span"><span class="md-pair-s" spellcheck="false">`--port 8080`</span></span></td><td style="width: 22.7639%; height: 61.25px;"><span class="td-span"><span class="md-pair-s" spellcheck="false">`--port`</span></span></td><td style="width: 52.9214%; height: 61.25px;"><span class="td-span"><span class="md-plain">设置 HTTP API 监听端口，客户端通过 </span><span class="md-pair-s" spellcheck="false">`http://IP:8080`</span><span class="md-plain"> 调用推理服务</span></span></td></tr><tr class="md-end-block" style="height: 87.25px;"><td style="width: 24.3147%; height: 87.25px;"><span class="td-span"><span class="md-pair-s" spellcheck="false">`-m /opt/llama/models/qwen3.6_xxx.gguf`</span></span></td><td style="width: 22.7639%; height: 87.25px;"><span class="td-span"><span class="md-pair-s" spellcheck="false">`--model (-m)`</span></span></td><td style="width: 52.9214%; height: 87.25px;"><span class="td-span"><span class="md-plain">指定加载的 GGUF 大模型文件路径</span></span></td></tr><tr class="md-end-block" style="height: 87.25px;"><td style="width: 24.3147%; height: 87.25px;"><span class="td-span"><span class="md-pair-s" spellcheck="false">`--mmproj /opt/llama/models/mmproj_xxx.gguf`</span></span></td><td style="width: 22.7639%; height: 87.25px;"><span class="td-span"><span class="md-pair-s" spellcheck="false">`--mmproj`</span></span></td><td style="width: 52.9214%; height: 87.25px;"><span class="td-span"><span class="md-plain">指定加载的 GGUF 多模态投影器文件路径</span></span></td></tr><tr class="md-end-block" style="height: 60px;"><td style="width: 24.3147%; height: 60px;"><span class="td-span"><span class="md-pair-s" spellcheck="false">`--alias qwen36`</span></span></td><td style="width: 22.7639%; height: 60px;"><span class="td-span"><span class="md-pair-s" spellcheck="false">`--alias`</span></span></td><td style="width: 52.9214%; height: 60px;"><span class="td-span"><span class="md-plain">自定义模型别名，OpenAI 兼容 API 请求时可直接使用别名，无需填写完整模型文件名</span></span></td></tr><tr class="md-end-block" style="height: 60px;"><td style="width: 24.3147%; height: 60px;"><span class="td-span"><span class="md-pair-s" spellcheck="false">`-np 1`</span></span></td><td style="width: 22.7639%; height: 60px;"><span class="td-span"><span class="md-pair-s" spellcheck="false">`--parallel (-np)`</span></span></td><td style="width: 52.9214%; height: 60px;"><span class="td-span"><span class="md-plain">最大并发会话数量，限制服务同时处理的推理请求数</span></span></td></tr><tr class="md-end-block" style="height: 60px;"><td style="width: 24.3147%; height: 60px;"><span class="td-span"><span class="md-pair-s" spellcheck="false">`-c 262144`</span></span></td><td style="width: 22.7639%; height: 60px;"><span class="td-span"><span class="md-pair-s" spellcheck="false">`--ctx-size (-c)`</span></span></td><td style="width: 52.9214%; height: 60px;"><span class="td-span"><span class="md-plain">上下文窗口总大小，当前配置支持 256K 上下文（对话历史 + 输入 + 输出总 token 上限）</span></span></td></tr><tr class="md-end-block" style="height: 60px;"><td style="width: 24.3147%; height: 60px;"><span class="td-span"><span class="md-pair-s" spellcheck="false">`-n 262144`</span></span></td><td style="width: 22.7639%; height: 60px;"><span class="td-span"><span class="md-pair-s" spellcheck="false">`--n-predict (-n)`</span></span></td><td style="width: 52.9214%; height: 60px;"><span class="td-span"><span class="md-plain">单次请求最大生成 Token 数量，取值不可超过上下文窗口大小</span></span></td></tr></tbody></table>

<span class="md-plain">提示：</span><span class="md-pair-s" spellcheck="false">`mmproj`</span><span class="md-plain"> 仅支持多模态大模型，纯文本模型无法使用 mmproj 文件。</span>

#####  

### <span class="md-pair-s">**<span class="md-plain">3. 验证新模型是否启用</span>**</span>

##### <span class="md-plain">编辑并保存好 llama 启动脚本后，输入以下命令重启服务，或是直接重启系统即可：</span>

```
sudo systemctl daemon-reload
```

```
sudo systemctl restart llama-server
```

##### <span class="md-plain">重启后打开网页 </span><span class="md-pair-s" spellcheck="false">`127.0.0.1:8080`</span><span class="md-plain"> ，可以看到显示的模型名称为 </span><span class="md-pair-s" spellcheck="false">`qwen36`</span><span class="md-plain">，说明模型切换成功，打个招呼确认模型能否正常使用，得到回应后说明成功了。</span>

[![测试模型.png](https://doc.bee-link.com.cn/uploads/images/gallery/2026-07/scaled-1680-/VGhd09K3XyF5i3A3-ONLYHYABTU.png)](https://doc.bee-link.com.cn/uploads/images/gallery/2026-07/VGhd09K3XyF5i3A3-ONLYHYABTU.png)

[![测试模型2.png](https://doc.bee-link.com.cn/uploads/images/gallery/2026-07/scaled-1680-/afrezs0XAqYFlHa1-2.png)](https://doc.bee-link.com.cn/uploads/images/gallery/2026-07/afrezs0XAqYFlHa1-2.png)

#####  

### <span class="md-pair-s ">**<span class="md-plain">4. OpenClaw 切换新模型</span>**</span>

##### <span class="md-plain">新模型就绪后，还需要到 OpenClaw 中切换默认模型，打开终端执行：</span>

```
openclaw config
```

##### <span class="md-plain">选择 </span><span class="md-pair-s" spellcheck="false">`Local`</span><span class="md-plain"> - </span><span class="md-pair-s" spellcheck="false">`Model`</span>

##### <span class="md-plain">然后选择 </span><span class="md-pair-s" spellcheck="false">`vLLM`</span><span class="md-plain">；</span>

##### <span class="md-plain">vLLM base URL 修改为 </span><span class="md-pair-s" spellcheck="false">`http://127.0.0.1:8080/v1`</span><span class="md-plain">；</span>

##### <span class="md-plain">vLLM API Key 填写 </span><span class="md-pair-s" spellcheck="false">`sk-local`</span><span class="md-plain">（可以随意输入）</span>

##### <span class="md-plain">vLLM model 填写 </span><span class="md-pair-s" spellcheck="false">`qwen36`</span>

##### <span class="md-plain">然后回车，再按一次回车即可。</span>

[![配置模型.png](https://doc.bee-link.com.cn/uploads/images/gallery/2026-07/scaled-1680-/9WyMwxhfDOfa8Rfy-1U127uKvWT.png)](https://doc.bee-link.com.cn/uploads/images/gallery/2026-07/9WyMwxhfDOfa8Rfy-1U127uKvWT.png)

##### <span class="md-plain">这样就配置完成了，再移动到 </span><span class="md-pair-s" spellcheck="false">`Done`</span><span class="md-plain"> 并按下回车，结束配置。</span>

[![完成配置.png](https://doc.bee-link.com.cn/uploads/images/gallery/2026-07/scaled-1680-/qNiWj1959QqiaomX-Pn2bP0tMug.png)](https://doc.bee-link.com.cn/uploads/images/gallery/2026-07/qNiWj1959QqiaomX-Pn2bP0tMug.png)

##### <span class="md-plain">结束配置后，还需要重启 OpenClaw Gateway 以应用修改，执行：</span>

```
openclaw gateway restart
```

##### <span class="md-plain">重启后即可以新模型使用 OpenClaw。</span>

[![新模型对话.png](https://doc.bee-link.com.cn/uploads/images/gallery/2026-07/scaled-1680-/3zW05XOZq0Irl9MK-hknWRY1fma.png)](https://doc.bee-link.com.cn/uploads/images/gallery/2026-07/3zW05XOZq0Irl9MK-hknWRY1fma.png)

#### <span class="md-pair-s ">**<span class="md-plain">多模型切换</span>**</span>

##### <span class="md-plain">配置好新模型后，原先的模型如果没有取消勾选，会自动以备用模型配置，可以通过以下命令查询可用模型列表：</span>

```
openclaw models list
```

##### <span class="md-plain">在终端中可以切换默认模型，无需重启 Gateway，执行：</span>

```
openclaw models set <模型名称>
```

[![设置默认模型.png](https://doc.bee-link.com.cn/uploads/images/gallery/2026-07/scaled-1680-/CZiImTciMLK8os7E-usmZfTguUi.png)](https://doc.bee-link.com.cn/uploads/images/gallery/2026-07/CZiImTciMLK8os7E-usmZfTguUi.png)

##### <span class="md-plain">如需临时切换模型，可以在与 OpenClaw 的对话中回复：</span><span class="md-pair-s" spellcheck="false">`/model <模型名称>`</span><span class="md-plain"> 快速切换，无需重启。</span>

---

##### <span class="md-plain md-expand">Tips：如后续需频繁调用 model-cli 命令查询、下载模型，建议将以下命令加入环境变量简化命令，后续可以省略 </span><span class="md-pair-s" spellcheck="false">`/opt/llama/bin` ，直接使用</span><span class="md-plain md-expand"> </span><span class="md-pair-s" spellcheck="false">`model-cli <命令>` 即可：</span>

```
echo 'export PATH="$PATH:/opt/llama/bin"' >> ~/.bashrc<br></br>source ~/.bashrc
```

[![环境变量.png](https://doc.bee-link.com.cn/uploads/images/gallery/2026-07/scaled-1680-/oAHlBaam7k5M2j9x-tx43PCuTiv.png)](https://doc.bee-link.com.cn/uploads/images/gallery/2026-07/oAHlBaam7k5M2j9x-tx43PCuTiv.png)