模型页是 LMPanel 的主战场:启动 / 停止 / 重启、失败诊断、参数配置与 API 调试都在这里完成。
模型卡
每个模型对应一张卡片,核心状态与操作:
| 状态 / 元素 | 含义 |
|---|---|
| ▶ 启动 / ■ 停止 / 重启 | 模型生命周期控制 |
| 绿色端口 | 健康检查通过,服务就绪 |
| 黄色 / 转圈 | 启动中(健康检查进行中) |
| 红色 + 中文提示 | 启动失败,附具体原因与对策 |
| 启动命令预览 | 展开可见完整 llama-server 参数,可复制核对 |
演示图占位
此处放:模型卡状态
说明:绿色端口表示健康检查通过;按钮:启动 / 停止 / 重启
启动 / 停止 / 重启
- 启动:按模型配置拉起后端进程,自动做健康检查(等待就绪或超时)
- 停止:优雅停止后端进程并释放端口
- 重启:先停后起,常用于修改参数后生效
健康检查机制:进程起来后按
checkEndpoint(默认/health)轮询,直到返回 200 才标记为运行中;超时则判定失败。
演示图占位
此处放:启动失败诊断弹窗
说明:中文原因与对策,如显存不足、端口占用、文件缺失
启动失败智能诊断
LMPanel 会分析失败原因并直接给中文对策,常见分类:
| 诊断结果 | 常见原因 | 对策 |
|---|---|---|
| GPU 显存不足(CUDA OOM) | 模型过大 / -ngl 过高 / 上下文过长 |
换更小量化版本,减小 -ngl 或 --ctx-size |
| GGUF 缺失或损坏 | 文件被移动 / 下载不完整 | 核对模型路径,重新下载(下载页自动校验 SHA-256) |
| 端口被占用 | 其他程序占用端口 | 停止占用程序,或修改全局起始端口 |
| 缺少 VC++ 运行库 | 系统未装运行库 | 安装 VC++ 运行库 |
| 参数错误 | 命令参数不合法 | 查看启动命令预览,逐项核对参数 |
参数配置
新建模型卡或编辑时,可配置两类内容:
基础字段
| 字段 | 说明 |
|---|---|
| 模型名称 | API 请求中的 model 字段(建议英文) |
| 显示名称 | 界面展示用 |
| GGUF 文件路径 | 选择模型文件 |
| 端口 | 留空自动分配(起始端口默认 8200 起) |
推理参数(llama-server 参数)
常用参数:
| 参数 | 作用 | 推荐起点 |
|---|---|---|
-ngl |
将多少层卸载到 GPU(显存足够则全部) | 99(全部) |
--temp |
生成温度,越高越随机 | 通用 1.0,精确编码 0.6 |
--top-p |
核采样阈值 | 0.95 |
--top-k |
候选 token 数 | 20 |
--ctx-size |
上下文长度(越大越占显存) | 按模型能力,如 8192+ |
--repeat-penalty |
重复惩罚 | 1.0~1.1 |
界面提供 一键参数预设 可快速套用常用组合,避免手敲。
演示图占位
此处放:API 调试台
说明:直连 / 网关模式、temperature / max_tokens 调节与响应显示
API 调试台
内嵌在模型卡中的调试工具:
- 直连模式:直接请求该模型的端口,验证模型本身
- 网关模式:经网关
http://127.0.0.1:8199请求,验证路由与切换 - 可视化调整
temperature/max_tokens - 即时显示请求 / 响应与耗时
多模型共存
两个模型各自独立启动时,端口自动分配(8200、8201…),互不影响;若要"一个端口智能路由",用 06 · 全局网关。
下一步
- 多模型统一入口 → 06 · 全局网关
- 参数与命令的底层格式 → 10 · 配置详解