全局网关基于 llama-swap:一个端口承载多个模型,按请求中的 model 字段自动切换到对应上游,是 LMPanel 最强大的功能。
网关是什么
没有网关时,每个模型一个端口,客户端要记一堆地址;有网关后:
- 所有模型共用
http://127.0.0.1:8199 - 请求时在
model字段写明模型名,网关自动路由到对应后端 - 未加载的模型按需启动(或预先驻留),用完可自动卸载释放显存
你的客户端/Agent ──> 127.0.0.1:8199 (llama-swap 网关) ──> llama-server (模型A)
└──> llama-server (模型B)
演示图占位
此处放:网关配置界面
说明:预载模型、分组并行、卸载超时、API Key 鉴权配置项
网关页核心配置
| 配置项 | 说明 |
|---|---|
| 预载模型 | 常驻内存、随时响应的模型(启动即加载) |
| 分组并行 | 同一组内模型并行服务,跨组共享资源 |
| 卸载超时(TTL) | 空闲 N 秒后自动卸载模型释放显存;0 = 永不卸载 |
| API Key 鉴权 | 开启后请求需携带密钥,防止本机未授权访问 |
| 代理与过滤器 | 高级请求转发与过滤规则 |
演示图占位
此处放:curl 调用网关示例
说明:向 127.0.0.1:8199 发请求,按 model 字段路由到对应模型
基本使用
- 在「模型」页确保想用的模型已添加(配置正确即可,不必手动启动)
- 网关页开启 / 配置这些模型
- 向网关发送请求,
model填模型名称:
curl http://127.0.0.1:8199/v1/chat/completions
-H "Content-Type: application/json"
-d '{
"model": "你的模型名",
"messages": [{ "role": "user", "content": "你好" }]
}'
- 网关按 model 字段路由:对应模型未启动则自动拉起,响应后按 TTL 策略卸载
鉴权
- 开启 API Key 后,请求需带
Authorization: Bearer <key> - 在网关页管理密钥
- 密钥仅限本机使用时也可不开鉴权(默认允许本机)
演示图占位
此处放:一键同步网关地址
说明:同步到 Claude Code / Codex / Gemini CLI / OpenCode
把网关地址同步给 Agent 工具
网关兼容 OpenAI 接口,Claude Code / Codex / Gemini CLI / OpenCode 等工具只需把 base URL 指向网关:
- 在网关页点击 一键同步
- 工具配置中 base URL 填
http://127.0.0.1:8199 - 需要鉴权时同时写入 API Key
详细步骤见 08 · 接入 Agent 工具。
常见问题
| 现象 | 处理 |
|---|---|
| 请求返回模型不存在 | 检查 model 字段是否与模型名称完全一致(含大小写) |
| 切换模型慢 | 首次加载需时间,可开启"预载"常驻常用模型 |
| 显存被占满 | 设置合适的卸载超时(TTL),闲置自动释放 |
| 网关无法工作 | 检查防火墙是否放行 llama-swap 监听本地端口 |
下一步
- 网关的配置文件结构与宏 → 10 · 配置详解
- 接入 Claude Code / Codex → 08 · 接入 Agent 工具