本教程的目标:30 分钟内跑通第一个本地模型对话。核心就三步:装后端 → 加模型 → 启动并验证。
第一步:安装后端引擎
LMPanel 需要 llama.cpp(推理引擎)与 llama-swap(网关)才能工作。
- 启动 LMPanel,按顶部引导进入 设置 → 后端与依赖
- 找到
llama.cpp与llama-swap,点击 安装 / 升级 - 等待下载完成,状态变为"已安装"即可
升级包来自 GitHub Releases,替换前会自动备份到
.lmpanel-backup,可放心升级。 网络不通时也可手动下载 llama.cpp 预编译包解压到backendsllama.cpp。
演示图占位
此处放:后端安装界面(设置 → 后端与依赖)
说明:一键安装 llama.cpp 与 llama-swap 后的状态
第二步:添加模型
两种方式任选:
方式 A:从模型下载页下载(推荐新手)
- 进入「模型下载」页,搜索或浏览 HuggingFace 模型(如
Qwen系列) - 选择 GGUF 格式文件,点击下载(支持断点续传,校验失败自动删除重下)
- 下载完成后在「模型」页新建卡片,指向刚下载的文件
方式 B:使用本地已有 GGUF
- 进入「模型」页,点击 新建模型卡
- 填写模型名称(如
qwen3-8b,建议英文,作为 API 请求中的 model 字段) - 选择 GGUF 文件路径(
models目录下的.gguf文件) - 按需调整参数(
-ngl显存层数、--temp温度、--ctx-size上下文长度等),有「一键参数预设」可快速套用
演示图占位
此处放:新建模型卡界面
说明:填写模型名称、选择 GGUF 文件、调整推理参数
第三步:启动并验证
- 点击模型卡上的 ▶ 启动
- 等待健康检查通过:按钮转圈 → 变成绿色端口即就绪
- 打开「调试台」,选择该模型,发送一句"你好",看到回复即成功
启动失败时不必看天书日志——LMPanel 会自动诊断常见原因(显存不足 / 文件缺失 / 端口占用 / 缺少 VC++ 运行库 / 参数错误)并弹出中文对策。
验证要点
| 检查项 | 预期结果 |
|---|---|
| 模型卡状态 | 显示绿色端口,标记为运行中 |
| 底部状态栏 | 显示实时 RAM / GPU 占用 |
| 调试台 | 能正常对话并显示生成参数 |
| 运行日志 | 可看到 llama-server 的 stdout |
演示图占位
此处放:模型启动成功与调试台对话
说明:绿色端口就绪,调试台发送消息获得回复
恭喜!
第一个模型已经跑起来了。接下来可以:
- 配置全局网关,让多个模型共用一个端口 → 06 · 全局网关
- 把网关接进 Claude Code / Codex → 08 · 接入 Agent 工具
- 遇到问题查 → 12 · 故障排查