注册
教程中心 / LM Panel 教程

LM Panel 教程

LM Panel 本地大模型管理面板:安装配置、模型管理、多模型网关、Agent 接入与故障排查,从入门到进阶

13 · 术语表

LM Panel 教程 更新于 2026-10-10 16:46:00

阅读其他章节或排查问题时遇到的专业词,在这里快速查。

模型文件

术语 说明
GGUF llama.cpp 系列的模型文件格式,一个文件包含权重与结构,即"模型文件"
量化(Quantization) 压缩权重精度的技术,换更小文件、省显存,代价是轻微质量损失
Q4_K_M / Q5_K_M / Q8_0 常见量化等级:Q 后数字越小压缩越狠;K_M 是均衡变体;Q8_0 接近原始精度
IQ 系列 更低比特的量化(如 IQ3_S),为小显存而生
mmproj 多模态投影文件,视觉模型(如带图像输入能力的 Qwen-VL)需要它与主 GGUF 配合
embeddings / embedding 模型 文本向量化模型,用于检索 / 向量库,非对话用途

推理参数

术语 说明
-ngl(GPU 层数) 把模型多少层放到 GPU 计算;99≈全部层卸载到 GPU
上下文(ctx-size) 模型一次能"记住"的 token 窗口长度;越长越占显存
token 文本切分的最小单元,约等于 0.5~1 个中文词 / 0.75 个英文词
temperature(温度) 采样随机性:低更稳定保守,高更多样发散
top-p / top-k / min-p 采样截断参数,控制候选范围与概率阈值
repeat-penalty 重复惩罚:抑制内容重复
presence-penalty 存在惩罚:鼓励讨论新主题
Flash Attention(-fa) 注意力加速机制,省显存提速
KV 缓存量化 对缓存做量化(如 q4_0),进一步省显存
reasoning(推理模式) 模型的"思考"过程:先推理再回答(如 Qwen3 的 thinking);--reasoning-budget 限制思考长度
MTP / 投机解码 用草稿模型加速生成的技术(如 --spec-type draft-mtp),可显著提速

架构与运维

术语 说明
llama.cpp 开源推理引擎,LMPanel 的文本后端
llama-swap 多模型网关:单端口按 model 字段路由到多个 llama-server
网关(proxy) 统一入口地址,如 http://127.0.0.1:8199
健康检查 进程启动后轮询 /health,返回 200 才标记运行中
TTL(卸载超时) 模型空闲 N 秒后自动卸载释放显存;0 = 永不卸载
宏(macros) config 中可复用的命令片段,模型通过 ${宏名} 引用
孤儿进程 应用异常退出后残留的后端进程,占显存,需回收
快照(snapshot) config.yaml 的备份版本,可一键恢复
HF / HuggingFace 模型仓库;国内自动回退 hf-mirror 镜像
OpenAI 兼容接口 /v1/chat/completions 等标准接口,Agent 工具可直接对接
minisign 更新包签名校验机制,防止更新包被篡改

端口约定

端口 用途
8199 全局网关统一入口
8200 起 模型直连端口(startPort 起始,自动递增)
${PORT} 宏占位符,启动时替换为实际端口
TOP