13 · 术语表
LM Panel 教程
更新于 2026-10-10 16:46:00
阅读其他章节或排查问题时遇到的专业词,在这里快速查。
模型文件
| 术语 |
说明 |
| GGUF |
llama.cpp 系列的模型文件格式,一个文件包含权重与结构,即"模型文件" |
| 量化(Quantization) |
压缩权重精度的技术,换更小文件、省显存,代价是轻微质量损失 |
| Q4_K_M / Q5_K_M / Q8_0 |
常见量化等级:Q 后数字越小压缩越狠;K_M 是均衡变体;Q8_0 接近原始精度 |
| IQ 系列 |
更低比特的量化(如 IQ3_S),为小显存而生 |
| mmproj |
多模态投影文件,视觉模型(如带图像输入能力的 Qwen-VL)需要它与主 GGUF 配合 |
| embeddings / embedding 模型 |
文本向量化模型,用于检索 / 向量库,非对话用途 |
推理参数
| 术语 |
说明 |
| -ngl(GPU 层数) |
把模型多少层放到 GPU 计算;99≈全部层卸载到 GPU |
| 上下文(ctx-size) |
模型一次能"记住"的 token 窗口长度;越长越占显存 |
| token |
文本切分的最小单元,约等于 0.5~1 个中文词 / 0.75 个英文词 |
| temperature(温度) |
采样随机性:低更稳定保守,高更多样发散 |
| top-p / top-k / min-p |
采样截断参数,控制候选范围与概率阈值 |
| repeat-penalty |
重复惩罚:抑制内容重复 |
| presence-penalty |
存在惩罚:鼓励讨论新主题 |
| Flash Attention(-fa) |
注意力加速机制,省显存提速 |
| KV 缓存量化 |
对缓存做量化(如 q4_0),进一步省显存 |
| reasoning(推理模式) |
模型的"思考"过程:先推理再回答(如 Qwen3 的 thinking);--reasoning-budget 限制思考长度 |
| MTP / 投机解码 |
用草稿模型加速生成的技术(如 --spec-type draft-mtp),可显著提速 |
架构与运维
| 术语 |
说明 |
| llama.cpp |
开源推理引擎,LMPanel 的文本后端 |
| llama-swap |
多模型网关:单端口按 model 字段路由到多个 llama-server |
| 网关(proxy) |
统一入口地址,如 http://127.0.0.1:8199 |
| 健康检查 |
进程启动后轮询 /health,返回 200 才标记运行中 |
| TTL(卸载超时) |
模型空闲 N 秒后自动卸载释放显存;0 = 永不卸载 |
| 宏(macros) |
config 中可复用的命令片段,模型通过 ${宏名} 引用 |
| 孤儿进程 |
应用异常退出后残留的后端进程,占显存,需回收 |
| 快照(snapshot) |
config.yaml 的备份版本,可一键恢复 |
| HF / HuggingFace |
模型仓库;国内自动回退 hf-mirror 镜像 |
| OpenAI 兼容接口 |
/v1/chat/completions 等标准接口,Agent 工具可直接对接 |
| minisign |
更新包签名校验机制,防止更新包被篡改 |
端口约定
| 端口 |
用途 |
8199 |
全局网关统一入口 |
8200 起 |
模型直连端口(startPort 起始,自动递增) |
${PORT} |
宏占位符,启动时替换为实际端口 |