注册

AI人工智能常用名词

遇到不认识的 AI 术语?这里是人工智能常用名词的一词一页详解:从 VAE、KSampler、CFG 等绘画生成术语,到 GPU、RAG、Transformer 等通用 AI 概念,每个名词都有定义、用法与常见问题。

共收录 243 个术语

V VAE VAE(Variational Autoencoder,变分自编码器)既是经典生成模型(编码器+解码器学习潜在表示,Kingma & Welling 2013),也是 Stable Diffusion 中的图像编解码组件:负责像素与潜空间的互相转换,决定出图清晰度与色彩,ComfyUI 中常单独加载。 K KSampler KSampler 是 ComfyUI 中最核心的采样节点,通过采样器算法、调度器、步数和 CFG 控制扩散去噪过程,直接决定生成图像的风格与质量。 S Sampler Sampler(采样器)是扩散模型的去噪算法,决定每一步噪声如何被估计与消除,常见有 Euler、DPM++ 2M、UniPC 等,直接影响出图速度与风格。 S Scheduler Scheduler(调度器)决定采样过程中每一步噪声强度的分配方式(步长曲线),常见 karras、exponential、sgm_uniform 等,与采样器配合影响出图风格。 C CFG CFG(无分类器引导)控制生成结果对提示词的遵循程度,数值越高越贴合提示词但可能过饱和失真,ComfyUI 中一般建议 5-10。 S Steps Steps(采样步数)是扩散模型去噪的迭代次数,步数越多细节越充分但耗时越长,ComfyUI 中一般 20-30 步即可获得高质量出图。 S Seed Seed(种子)是采样随机数的起始值,相同种子加相同参数可复现同一张图;修改种子获得新构图,常用于微调与批量生成。 L Latent Latent(潜像/潜变量)是图像被编码压缩后在潜空间中的低维数据表示,包含图像的核心特征;扩散模型直接在潜像上加噪/去噪,Stable Diffusion 中 512×512 图像对应的潜像约为 64×64,是节点间传递的中间态。 L LoRA LoRA 是小体积的可插拔模型微调文件,用于给大模型注入特定风格、角色或概念,体积通常几十到几百 MB,可与底模叠加使用。 C Checkpoint Checkpoint(大模型)是训练完整的扩散模型文件,通常包含 UNet、VAE 与文本编码器,决定出图的整体风格与能力,是生成质量的基础。 C CLIP CLIP(Contrastive Language-Image Pretraining)是 OpenAI 提出的图文对比预训练模型,通过对比学习把文本与图像对齐到同一向量空间;在 ComfyUI 中作为文本编码器,把 positive/negative 提示词编码为控制生成的条件向量。 D Diffusion Model 扩散模型是一类生成模型:先按固定调度逐步给数据加噪(前向过程),再训练神经网络学习反向去噪重建数据(反向过程)。Stable Diffusion 等主流文生图模型均基于扩散模型,ComfyUI 中的采样器与调度器负责执行反向去噪。 D Denoise Denoise(降噪)在扩散模型中指逐步去除噪声恢复图像的过程;在 ComfyUI 的 KSampler 中是 0~1 的降噪强度参数,控制本次采样重新绘制多少内容,图生图、局部重绘、放大时常用。 L Latent Space 潜空间(Latent Space)是扩散模型实际工作的低维向量空间:图像经 VAE 编码为潜像后在这里加噪/去噪,相比像素空间维度大幅降低(如 512×512 图像压缩为 64×64),是 Stable Diffusion 高效生成的关键。 R Reasoning 推理(Reasoning)指 AI 基于已有知识和模式理解新信息、进行分析判断并得出结论的能力,是解决复杂任务(如问答、数学推导、规划)的基础。 P Planning 规划(Planning)指 AI 把目标需求分解为一系列可执行步骤、设计行动顺序以实现目标的能力,用于解决多步骤、多约束的复杂任务。 T Training 训练(Training)是 AI 系统的学习阶段:把数据集“投喂”给模型,模型反复调整内部参数以减小预测误差,从中习得执行任务或做预测的能力。 I Inference 推断(Inference)是 AI 系统的使用阶段:模型运用训练阶段学到的参数与模式,对新的输入(如预测新房价格、回答提问)给出输出。 S Small Language Model 小语言模型(SLM)是参数规模远小于大语言模型(LLM)的语言模型,如微软 Phi-3:体积紧凑、可在笔记本/手机等设备离线运行,适合简单问答等轻量场景。 G Grounding 锚定(Grounding)是把模型与真实数据源、具体实例连接起来,让 AI 依据可信资料作答、减少编造(幻觉),提高回答的准确性与时效性。 R RAG 检索增强生成(RAG)是一种在不重新训练模型的前提下为 AI 注入新知识的方法:先从外部资料库检索相关内容,再让模型基于检索结果生成回答,省时省钱且知识更新及时。 O Orchestration 编排(Orchestration)是 AI 应用的调度层:按正确顺序引导模型与工具执行各步骤、管理聊天上下文,把多环节能力组合成完整、连贯的响应。 M Memory AI 的“记忆”并非模型自带的存储,而是通过编排实现的上下文管理:短期记忆(把聊天历史放进当前请求)与长期记忆(存到外部库供后续使用)相结合。 T Transformer Transformer 是当今生成式 AI 的核心神经网络架构(ChatGPT 的 “T”),通过注意力机制权衡输入各部分的重要性、捕捉长距离上下文,是文本生成最主流的模型架构。 F Frontier Model 前沿模型(Frontier Model)是处于能力顶端的大规模 AI 系统,能在多种任务上展现全新、广泛的能力,其安全与负责任发展由行业组织(如前沿模型论坛)共同推动。 G GPU GPU(图形处理单元)是拥有数千微型核心、擅长并行计算的芯片,最初为 3D 图形渲染而生,如今是 AI 训练与推断的核心算力引擎。 A Artificial Intelligence Artificial Intelligence(人工智能,AI)是研究如何让计算机模拟人类感知、推理、学习与决策能力的学科,涵盖机器学习、自然语言处理、计算机视觉等方向。 M Machine Learning 机器学习(Machine Learning)是人工智能的核心分支,研究让计算机从数据中自动归纳规律并做出预测或决策,而无需为每个任务显式编写规则。 D Deep Learning 深度学习(Deep Learning)是基于多层神经网络的机器学习方法,通过多层神经元自动从数据中提取特征表示,广泛应用于图像识别、语音识别与自然语言处理。 N Neural Network 神经网络(Neural Network)是受人脑神经元连接方式启发的计算模型,由多层人工神经元通过带权连接组成,是深度学习的基础结构。 L Large Language Model 大语言模型(Large Language Model,LLM)是基于 Transformer 架构、在海量文本上预训练而成的超大规模语言模型,能理解并生成人类语言,是 ChatGPT、Claude 等对话产品的核心底座。 G Generative AI Generative AI(生成式AI)是一类能够根据提示自动生成文本、图像、音频、代码等新内容的人工智能技术,代表路线为大语言模型与扩散模型。 F Foundation Model 基础模型(Foundation Model)是在大规模数据上预训练得到的大型模型,可通过微调或提示适配语言、视觉等多种下游任务,是当前生成式 AI 的底座。 A Agent AI Agent(智能体)是以大语言模型为推理核心、能自主规划并调用工具完成目标的系统,广泛用于自动化办公与复杂任务执行。 P Prompt 提示词(Prompt)是用户输入给大语言模型的指令或问题,模型据此生成回答,提示词的写法直接影响输出质量。 P Prompt Engineering 提示词工程(Prompt Engineering)是通过设计与优化输入给大语言模型的指令、示例与约束,引导模型稳定输出预期结果的实践方法,是高效使用大模型的核心技能。 C Context Window Context Window(上下文窗口)是大语言模型一次能同时“看到”并用于推理的Token数量上限,决定了模型可处理的对话长度与文档篇幅。 T Token Token(词元)是大语言模型切分文本后处理的最小单元,模型以 Token 为单位理解输入、生成输出,Token 数量决定上下文长度与 API 调用费用。 T Tokenization Tokenization(切词/分词)是把原始文本切分为模型可处理 Token 序列的预处理过程,直接影响大模型的输入理解、上下文占用与 API 计费。 E Embedding 嵌入(Embedding)是把词语、图像等对象映射成连续向量的表示方法,语义相近的对象在向量空间中距离也更近。 V Vector Database 向量数据库(Vector Database)是专门存储、索引与检索高维向量嵌入的数据库,支持按语义相似度快速召回,是 RAG、语义搜索与推荐系统的关键基础设施。 A Attention Attention(注意力机制)是让模型在处理序列时动态聚焦相关信息的技术,Transformer与大语言模型均建立在自注意力机制之上。 S Self-Attention 自注意力(Self-Attention)是 Transformer 架构的核心机制,让模型处理一个词时动态关注句子中其他相关词,从而捕捉长距离依赖关系。 F Fine-tuning Fine-tuning(微调)是在预训练大模型基础上用领域数据继续训练以适配特定任务的技术,相比从头训练成本更低,是通用模型专业化的主流手段。 P Pre-training 预训练(Pre-training)是在大规模数据上先训练模型掌握通用能力、再通过微调迁移到具体任务的训练范式,是大模型时代的主流做法。 T Transfer Learning 迁移学习(Transfer Learning)是把在大规模数据上学到的知识迁移到下游小样本任务的方法,大模型的预训练加微调范式本质上就是迁移学习。 F Few-shot Learning Few-shot Learning(少样本学习)是模型仅凭提示词中给出的少量示例就能快速完成新任务的能力,大语言模型通常通过上下文学习实现。 Z Zero-shot Learning 零样本学习(Zero-shot Learning)指模型在没有某任务标注示例、仅凭自然语言指令的情况下完成该任务的能力,是大模型泛化性的重要体现。 I In-Context Learning In-Context Learning(上下文学习)是大语言模型仅凭提示词中的示例即可完成新任务、且不更新参数的能力,是 Prompt Engineering 与 Few-shot Learning 的理论基础。 C Chain of Thought 思维链(Chain of Thought, CoT)是让大语言模型分步推理的提示方法,通过展示中间推导过程显著提升数学、逻辑等复杂任务的准确率。 R Reinforcement Learning 强化学习(Reinforcement Learning,RL)是智能体通过与环境交互、依据奖励信号试错来学习最优策略的机器学习范式,RLHF 即基于它对齐大模型。 R RLHF RLHF(基于人类反馈的强化学习)是用人类偏好数据训练奖励模型、再以此微调大语言模型的技术,用于让模型输出更符合人类期望。 S Supervised Learning 监督学习(Supervised Learning)是机器学习的主流范式,使用带有标注答案的训练数据让模型学习输入到输出的映射,典型任务包括分类与回归。 U Unsupervised Learning Unsupervised Learning(无监督学习)是在无标注数据上发现内在结构与规律的机器学习范式,典型任务包括聚类与降维,也是大模型预训练的思想基础。 S Self-Supervised Learning 自监督学习(Self-Supervised Learning)是从数据本身构造监督信号的训练方式,无需人工标注即可利用海量数据,是大模型预训练的核心方法。 C Classification 分类(Classification)是监督学习中把输入划归到预定义类别的任务,如垃圾邮件识别、情感分析,是最基础也应用最广的机器学习任务之一。 R Regression Regression(回归分析)是监督学习中用于预测连续数值(如价格、温度、销量)的一类方法,常见形式有线性回归与逻辑回归。 O Overfitting 过拟合(Overfitting)指模型在训练数据上表现很好,但在新数据上泛化能力差,把训练集里的噪声和偶然细节也当成规律学了下来。 L Loss Function Loss Function(损失函数)衡量模型预测结果与真实标签之间的差距,是训练过程优化的目标,其数值下降是模型在学习的直接信号。 G Gradient Descent 梯度下降(Gradient Descent)是机器学习最常用的优化算法,通过沿损失函数下降最快的方向迭代调整参数,逐步降低模型误差。 B Backpropagation 反向传播(Backpropagation)是神经网络训练的核心算法:基于链式法则逐层计算损失对各权重的梯度,配合梯度下降更新参数。 E Epoch Epoch(训练轮次)指机器学习训练中把整个训练集完整过一遍的次数,是控制训练进度的基本超参数。 L Learning Rate 学习率(Learning Rate)是训练神经网络时控制参数每次更新幅度的超参数,过大易震荡发散,过小则收敛缓慢,是影响训练成败的关键旋钮。 O Optimizer Optimizer(优化器)是深度学习中根据梯度更新模型参数的算法,决定训练的收敛速度与稳定性,代表算法有 SGD、Adam、AdamW 等。 D Dataset 数据集(Dataset)是用于训练、验证和测试模型的数据集合,数据的质量、规模与标注直接决定模型的实际效果。 H Hyperparameter 超参数(Hyperparameter)是训练前人工设定、不通过训练学习得到的参数,如学习率、网络层数、批大小,其取值直接影响模型效果与训练效率。 A Activation Function Activation Function(激活函数)是神经网络中对加权输入做非线性变换的函数,没有它多层网络将退化为单层线性模型。 S Softmax Softmax 是一种归一化函数,把模型输出的实数分数转换成总和为 1 的概率分布,广泛用于多分类模型输出层与大语言模型采样环节。 N Normalization Normalization(归一化/标准化)是对输入或网络中间数据做尺度统一的技术,能稳定训练、加速收敛,代表方法有 Batch Normalization、LayerNorm。 R Regularization 正则化(Regularization)是防止模型过拟合的一类技术,通过约束模型复杂度使其在新数据上泛化更好。 D Dropout Dropout 是一种正则化技巧:训练时随机丢弃部分神经元的输出,降低神经元间的协同依赖,从而缓解神经网络过拟合。 C Convolutional Neural Network Convolutional Neural Network(卷积神经网络,CNN)是专门处理网格状数据的神经网络,在图像识别、检测与分割任务中被广泛使用。 R Recurrent Neural Network 循环神经网络(RNN)是为序列数据设计的神经网络,通过隐藏状态在时间步之间传递信息,曾广泛用于语言建模与机器翻译,后被 Transformer 大量取代。 L LSTM LSTM(长短期记忆网络)是一种特殊的循环神经网络,通过门控机制缓解长序列梯度消失问题,曾广泛用于语音识别、机器翻译与时间序列预测。 G GAN 生成对抗网络(GAN)由生成器与判别器相互博弈训练,能生成逼真的图片等内容,是生成式 AI 的重要奠基模型。 A Autoencoder 自编码器(Autoencoder)是一种无监督神经网络:先把输入压缩到低维隐空间再重构回输入,用于特征学习、降维与图像去噪。 N Natural Language Processing Natural Language Processing(自然语言处理,NLP)是让计算机理解、生成与运用人类语言的AI方向,涵盖机器翻译、文本摘要、问答等任务。 C Computer Vision 计算机视觉(Computer Vision)是让计算机从图像或视频中理解和提取信息的 AI 领域,覆盖图像分类、目标检测、图像分割等任务。 S Speech Recognition Speech Recognition(语音识别,ASR)是把人类口语音频自动转写为文字的技术,广泛用于语音助手、会议纪要与字幕生成,代表模型如 Whisper。 T Text-to-Speech 语音合成(Text-to-Speech, TTS)是把文字自动转换为自然语音朗读的技术,广泛用于有声书、导航、智能客服等场景。 H Hallucination 幻觉(Hallucination)指大语言模型生成看似合理但与事实不符、凭空捏造内容的现象,是影响大模型可信度与落地的核心问题。 T Temperature Temperature(温度系数)是大语言模型控制生成随机性的采样参数:数值越高输出越发散多样,越低越确定保守。 Q Quantization 量化(Quantization)是模型压缩技术,把高精度浮点数权重转换为低位宽整数(如 8bit、4bit),在精度损失可控的前提下显著降低显存占用与推理成本。 M Mixture of Experts Mixture of Experts(MoE,混合专家模型)是一种稀疏激活的大模型架构,每次推理只激活部分专家子网络,在扩大参数量的同时控制计算成本。 K Knowledge Distillation 知识蒸馏(Knowledge Distillation)是让大模型(教师)训练小模型(学生)的模型压缩技术,用小模型接近大模型效果并降低部署成本。 P Pruning 模型剪枝(Pruning)是从训练好的神经网络中移除冗余权重或神经元以减小体积、加速推理的压缩方法,是 Model Compression 的常用手段。 C Chatbot Chatbot(聊天机器人)是通过对话界面与用户交互的AI应用,现代产品多基于大语言模型实现问答、写作与任务执行。 G GPT GPT(Generative Pre-trained Transformer,生成式预训练 Transformer)是 OpenAI 提出的大语言模型系列,采用 Transformer 解码器架构,是推动生成式 AI 普及的代表性模型。 B BERT BERT 是 Google 于 2018 年提出的双向预训练语言模型,革新了自然语言理解任务,是文本分类、问答、命名实体识别等场景的经典基线模型。 C ChatGPT ChatGPT 是 OpenAI 于 2022 年底推出的对话式大语言模型产品,以自然对话方式回答问题、辅助写作与编程,引爆了生成式 AI 的普及。 C Claude Claude 是 Anthropic 公司推出的大语言模型系列,以长上下文处理、安全对齐与对话体验著称,提供网页版产品与 API 两种使用方式。 G Gemini Gemini是Google(Google DeepMind)开发的多模态大模型系列,支持文本、图像、音频与视频的理解与生成。 L Llama Llama 是 Meta 开源发布的大语言模型系列,采用开放权重策略,允许研究者与企业本地部署、微调,是开源大模型生态的重要基础模型之一。 S Stable Diffusion Stable Diffusion 是一款开源的文本到图像扩散模型,可根据文字提示生成图像,支持本地部署与社区微调(LoRA、ControlNet),是开源图像生成生态的基石。 F Function Calling 函数调用(Function Calling)是让大语言模型根据意图决定调用哪个外部工具或接口的能力,是智能体与自动化应用的核心技术。 K Knowledge Graph 知识图谱(Knowledge Graph)以实体—关系—实体的三元组结构化描述世界知识,支持可解释的知识检索与推理,常用于搜索与问答系统。 R Recommender System Recommender System(推荐系统)是根据用户行为与偏好自动筛选、排序内容的算法系统,广泛用于电商、短视频与信息流。 M Multi-Agent System 多智能体系统(Multi-Agent System)指多个大模型智能体分工协作、通过通信与工具调用共同完成复杂任务的系统范式,适合需要规划、检索与执行配合的工作流。 W World Model World Model(世界模型)是让 AI 学习环境运行规律、能预测“采取某行动后会发生什么”的模型,是具身智能与自动驾驶决策的核心方向之一。 S Synthetic Data 合成数据(Synthetic Data)是由算法或 AI 模型生成的仿真数据,用于补足真实数据不足、保护隐私,是训练数据的重要补充来源。 I Image Generation 图像生成(Image Generation)指由模型自动生成图像的技术,主流路线以扩散模型为核心,输入文本提示即可得到对应图片。 T Text-to-Image Text-to-Image(文生图)是根据文字提示自动生成对应图像的技术,主流方案为扩散模型,代表产品有Stable Diffusion、Midjourney。 M Machine Translation 机器翻译(Machine Translation)是利用计算机自动把一种自然语言文本转换成另一种语言的技术,大语言模型时代已进入上下文感知、可保持风格的翻译阶段。 S Semantic Search Semantic Search(语义搜索)是基于向量 Embedding 理解查询与文档含义的检索方式,相比关键词匹配能返回“意思相近”的结果,是 RAG 系统的核心环节。 I Instruction Tuning 指令微调(Instruction Tuning)是用指令—回答样本对预训练模型做监督微调,让模型学会听懂并遵循人类指令,是对话模型的关键一步。 A Alignment 对齐(Alignment)指让大模型的行为符合人类意图、价值观与安全规范的过程,RLHF 是其代表性技术路线。 A Agentic AI Agentic AI(智能体式AI)指能够自主规划、调用工具、多步完成复杂任务的AI系统,通常以大语言模型为决策核心。 E Explainable AI 可解释人工智能(Explainable AI,XAI)研究让模型决策过程可被人类理解的方法与技术,在医疗、金融等高风险场景用于揭示模型为什么这样判断。 D DeepSeek DeepSeek(深度求索)是中国AI公司及其开源大语言模型系列的名称,采用混合专家等架构,以较低训练成本达到较强的推理与代码能力。 Q Qwen Qwen(通义千问)是阿里巴巴达摩院团队研发的大语言模型系列,提供多种参数规模的开源与商用版本,支持中文、英文等多语言任务。 M Mistral Mistral 是法国 AI 公司 Mistral AI 开发的大语言模型系列,以权重开放与高效著称,代表模型有 Mistral 7B、Mixtral 8x7B 等。 W Whisper Whisper 是 OpenAI 开源的语音识别模型,在海量多语言语音数据上训练,支持多语言语音转文字,对口音与噪声环境鲁棒。 D DALL-E DALL-E 是 OpenAI 推出的文生图大模型,可根据自然语言提示生成图像,是 Text-to-Image 方向的代表性产品之一。 M Midjourney Midjourney是一款商业化的文生图产品,用户输入提示词即可生成高质量插画与摄影风格图像,底层为扩散模型。 S Sora Sora 是 OpenAI 发布的文本生成视频模型,可根据文字提示生成视频片段,代表了视频生成领域从短视频向更长叙事发展的方向。 Y YOLO YOLO(You Only Look Once)是一种单阶段实时目标检测算法,以速度快著称,广泛用于视频监控、自动驾驶感知与工业质检等实时检测场景。 R ResNet ResNet(残差网络)通过残差连接解决深层网络难以训练的问题,使上百层的卷积神经网络得以有效训练,是计算机视觉的里程碑结构。 I ImageNet ImageNet 是大规模图像识别数据集,由数百万张带类别标注的图片构成,长期作为计算机视觉研究的标准训练与评测基准。 P PyTorch PyTorch是Meta开源的Python深度学习框架,以动态计算图与简洁API著称,是学术研究与工业界训练模型的主流框架之一。 T TensorFlow TensorFlow 是 Google 开源的深度学习框架,提供从模型定义、训练到部署的全套工具链,广泛用于学术研究与工业生产环境。 K Keras Keras 是一个高级深度学习框架,以简洁易用的 API 著称,现为 TensorFlow 官方高级 API,适合快速原型验证与教学入门。 H Hugging Face Hugging Face 是知名 AI 开源模型与社区平台,提供 Transformers 库和模型仓库,汇集大量开源大模型与数据集,是使用开源模型的主要入口之一。 L LangChain LangChain 是用于开发大语言模型应用的开源框架,提供提示词管理、链式调用、检索接入等模块化组件,简化 RAG 与 Agent 应用搭建。 L LlamaIndex LlamaIndex是面向大语言模型应用的数据框架,专注于把私有文档、数据库等外部数据接入检索增强生成(RAG)流程。 O ONNX ONNX(Open Neural Network Exchange,开放神经网络交换格式)是一种跨框架的模型表示标准,让不同深度学习框架训练的模型可互相转换并部署到推理引擎上。 O OpenCV OpenCV 是开源的计算机视觉算法库,提供图像处理、特征提取、目标检测等数百个常用函数,是 CV 领域事实上的标准工具库。 C CUDA CUDA 是 NVIDIA 推出的通用并行计算平台与编程模型,让开发者利用 GPU 进行大规模并行计算,是训练和运行深度学习模型的主流计算底座。 T TPU TPU(Tensor Processing Unit,张量处理单元)是 Google 为深度学习定制的专用 AI 芯片,主打大规模矩阵运算加速。 N NPU NPU(Neural Processing Unit,神经网络处理器)是专为矩阵与张量运算设计的AI芯片,相比通用CPU更适合神经网络推理与训练。 V vLLM vLLM 是一款高吞吐的大语言模型推理与服务框架,通过 PagedAttention 等显存管理技术连续批处理请求,广泛用于在线部署开源大模型。 C ComfyUI ComfyUI 是基于节点图的 Stable Diffusion 前端,把出图流程拆为可视化节点,便于复现工作流与复杂定制,是 AI 绘图进阶用户常用工具。 G Grok Grok 是 xAI 推出的对话式大语言模型产品,以直率调侃的风格为特色并接入实时信息,面向普通用户提供问答与聊天服务。 C Copilot Copilot 指以 AI 辅助形式嵌入工作流的副驾驶式产品,典型如编程助手,可根据上下文自动补全代码并由人做最终决策。 O OpenAI OpenAI是美国AI公司,开发了GPT系列大语言模型、ChatGPT、DALL-E与Whisper等模型与产品,推动了生成式AI的普及。 A Anthropic Anthropic 是一家专注于大语言模型与 AI 安全的美国 AI 公司,开发了 Claude 系列模型,以 Constitutional AI 等对齐方法著称。 D DeepMind DeepMind 是 Google 旗下的人工智能研究机构,因 AlphaGo、AlphaFold 等系统闻名,在强化学习与科学 AI 方向有深远影响。 A AlphaGo AlphaGo 是 DeepMind 开发的围棋人工智能,2016 年战胜人类围棋世界冠军,是 AI 发展史上的标志性事件。 A AlphaFold AlphaFold 是 DeepMind 开发的蛋白质结构预测系统,能从氨基酸序列高精度预测三维结构,是 AI for Science 的代表成果。 T Turing Test Turing Test(图灵测试)由艾伦·图灵于1950年提出:若评判者通过文字对话无法区分对方是机器还是人,则认为该机器表现出智能。 T Top-p Top-p(核采样,Nucleus Sampling)是大模型文本生成时的采样策略:只从累积概率达到阈值 p 的最小候选词集合中采样,平衡输出的多样性与稳定性。 T Top-k Top-k 是文本生成解码时只保留概率最高的前 k 个候选词的采样策略,用于控制生成结果的多样性与稳定性。 B Beam Search 束搜索(Beam Search)是序列生成任务常用的解码算法,每步保留概率最高的若干候选序列再逐步扩展,比贪心搜索更可能得到全局较优结果。 G Greedy Decoding 贪心解码(Greedy Decoding)是逐 Token 选择概率最高输出的生成策略,简单稳定但容易输出重复、缺乏多样性。 K KV Cache KV Cache(键值缓存)是大模型推理时缓存注意力中Key/Value矩阵的优化技术,生成新Token时复用历史计算、避免重复运算。 F FlashAttention FlashAttention 是一种内存高效的注意力计算算法,通过分块重计算减少 GPU 显存读写,显著加速自注意力训练与推理,是长上下文大模型的常用优化。 A Adapter Adapter(适配器)是参数高效微调(PEFT)的一种方法:在冻结的预训练模型层间插入小型可训练模块,以少量参数实现任务适配。 P PEFT PEFT(参数高效微调)是只微调模型一小部分参数、冻结大部分参数的技术,以极低显存成本实现定制化微调,LoRA 是其代表方法。 M Model Compression 模型压缩(Model Compression)指通过剪枝、量化、蒸馏等方法减小模型体积与算力开销,使其能部署到端侧等资源受限环境。 S Sparse Attention Sparse Attention(稀疏注意力)是对标准自注意力的改进:每个Token只与序列中的部分位置计算关联,而非两两全连接。 S SGD 随机梯度下降(SGD,Stochastic Gradient Descent)是最基础的优化算法之一:每次用一小批样本估计梯度并更新参数,是训练神经网络的经典方法。 M Momentum Momentum(动量)是优化器中模拟惯性的机制,累积历史梯度方向以加速收敛、减少震荡,是 SGD 与 Adam 等优化器的常见组件。 E Early Stopping 早停(Early Stopping)是防止过拟合的训练技巧:监控验证集表现,当验证误差连续多轮不再下降时提前停止训练。 B Batch Normalization 批归一化(Batch Normalization)在网络训练中按批次对每层输入做标准化,稳定分布、加速收敛并缓解梯度消失。 G Gradient Accumulation Gradient Accumulation(梯度累积)是显存不足时模拟大批次训练的技巧:累积多个小批量梯度,达到设定步数后再统一更新权重。 G Gradient Clipping 梯度裁剪(Gradient Clipping)是训练 RNN 等模型时防止梯度爆炸的技巧:当梯度范数超过阈值时按比例缩小梯度,稳定训练过程。 V Vanishing Gradient Vanishing Gradient(梯度消失)是深层网络反向传播时梯度逐层变小、浅层参数几乎不更新的现象,是 LSTM 与残差连接出现的重要原因。 C Cross-validation 交叉验证(Cross-validation)是评估模型泛化能力的方法:把数据分成若干份轮流做验证与训练,多次取平均比单次划分更稳定可靠。 T Test Set 测试集(Test Set)是模型训练完成后用于最终评估的、训练中从未见过的数据集,用来衡量模型的真实泛化能力。 V Validation Set Validation Set(验证集)是从训练数据中留出、不参与权重更新的一部分样本,用于在训练过程中评估泛化能力与挑选超参数。 C Confusion Matrix 混淆矩阵(Confusion Matrix)是分类模型的评估表格,按真实类别与预测类别统计样本数量,从中可算出精确率、召回率与 F1 等指标。 P Precision Precision(精确率)是分类模型评估指标之一,衡量预测为正的样本中真正为正的比例,与 Recall 互补并共同构成 F1 Score。 R Recall 召回率(Recall)是分类任务评估指标,表示所有真实为正例的样本中被模型正确找出的比例,即该抓出来的抓出来了多少。 F F1 Score F1 Score 是精确率与召回率的调和平均,用于综合衡量分类模型性能,在类别不平衡场景比准确率更可靠。 A AUC AUC(ROC曲线下面积)是二分类模型排序能力的常用指标,取值0.5~1,越接近1表示区分正负样本的能力越强。 A Accuracy 准确率(Accuracy)是分类模型最直观的指标:预测正确的样本数占全部样本数的比例,但在类别不平衡场景下会产生误导。 P Perplexity Perplexity(困惑度)是衡量语言模型对文本预测能力的指标,数值越低表示模型对测试语料预测越准,是 NLP 模型对比的常用指标。 B BLEU BLEU 是机器翻译与文本生成常用的自动评估指标,通过比较机器输出与人工参考之间的 n-gram 重合度打分,越高通常越接近参考译文。 B Benchmark 基准测试(Benchmark)是用标准化数据集与任务统一评测模型能力的体系,用于横向比较不同大模型的优劣。 A Active Learning Active Learning(主动学习)是让模型主动挑选“最值得标注”的样本交人工标注,从而用尽量少的标注预算获得更好效果的学习框架。 S Semi-supervised Learning 半监督学习(Semi-supervised Learning)介于监督与无监督之间:利用大量未标注数据配合少量标注数据训练模型,降低标注成本。 M Meta Learning Meta Learning(元学习,“学会学习”)是让模型学会快速适应新任务的学习范式,目标是用少量样本快速上手新任务。 C Contrastive Learning 对比学习(Contrastive Learning)通过让模型把相似样本对在向量空间拉近、不相似样本对推远来学习表示,无需人工标签即可获得有效特征。 R Representation Learning 表示学习(Representation Learning)是让模型自动学习数据有效特征表示的方法,深度学习与 Embedding 的核心目标即在于此。 M Multimodal Multimodal(多模态)指模型能同时理解与生成文本、图像、音频、视频等多种类型的数据,而不局限于单一模态。 V Vision-Language Model 视觉-语言模型(Vision-Language Model,VLM)能同时理解图像与文本,可完成图文问答、图像描述等跨模态任务,是多模态 AI 的代表。 I Image Captioning Image Captioning(图像描述生成)是为输入图像自动生成文字描述的多模态任务,连接计算机视觉与自然语言处理。 O Object Detection 目标检测(Object Detection)是计算机视觉任务:判断图片里有什么类别,并用边界框标出每个目标位置,常见于自动驾驶、安防与工业质检。 I Image Segmentation 图像分割(Image Segmentation)把像素按所属对象分组,区分前景与背景及不同物体轮廓,用于医学影像、自动驾驶等场景。 F Face Recognition Face Recognition(人脸识别)是计算机视觉的一类任务:从图像或视频中检测人脸并比对身份,常用于门禁、身份核验与相册分类。 O OCR OCR(Optical Character Recognition,光学字符识别)是把图片、扫描件中的文字转换成可编辑文本的技术,广泛用于票据、证件与文档数字化。 V Voice Cloning Voice Cloning(声音克隆)是用少量目标人语音样本合成其说话声纹的技术,可用于个性化配音与有声书制作,需严格防范滥用。 T Text-to-Video 文生视频(Text-to-Video)是根据文字提示词自动生成对应视频片段的生成式技术,需在保证语义连贯的同时维持帧间一致性。 V Video Generation 视频生成(Video Generation)指由文本提示或参考图像自动生成动态视频片段,是扩散模型在时间维度上的延伸。 T Text Summarization Text Summarization(文本摘要)指自动把长文档压缩成简短要点的NLP任务,分抽取式与生成式两类。 S Sentiment Analysis 情感分析(Sentiment Analysis)是 NLP 任务,自动判断一段文本所表达的情感倾向(正面、负面、中性),常用于评论、舆情与客服反馈分析。 N Named Entity Recognition Named Entity Recognition(命名实体识别,NER)是从文本中识别人名、地名、机构名等实体并分类的 NLP 基础任务。 Q Question Answering 问答系统(Question Answering, QA)让机器根据知识或上下文回答自然语言问题,现代做法常结合检索增强生成减少凭空回答。 C Code Generation 代码生成(Code Generation)指由自然语言描述自动生成程序代码,是大语言模型在软件工程中的核心应用。 D Data Augmentation Data Augmentation(数据增强)指通过对现有样本做合理变换来扩充训练集规模与多样性,如图像翻转、裁剪、文本同义改写。 F Feature Engineering 特征工程(Feature Engineering)是把原始数据加工成模型可用特征的过程,包括清洗、归一化、构造组合特征等,在传统机器学习中对效果影响显著。 F Feature Feature(特征)是输入数据中供模型学习的具体属性变量,特征工程的质量直接决定传统机器学习模型的上限。 L Label 标签(Label)是训练数据中人工标注的标准答案,如图像对应的类别名、句子的情感极性,监督学习就是让模型预测逼近标签。 W Weights 权重(Weights)是神经网络中可训练的参数,决定输入特征对输出的贡献大小,训练过程本质就是不断调整权重。 B Bias Bias(偏差)一指模型预测与真实值之间的系统误差,二指模型对特定人群产生的不公平倾向,后者是AI伦理的关注重点。 D Decision Tree 决策树(Decision Tree)是一种树形结构的监督学习模型,通过一系列特征阈值判断逐层分支,最终给出分类或回归结果,模型天然可解释。 R Random Forest Random Forest(随机森林)是基于多棵决策树集成的经典机器学习算法,稳健易解释,常用于表格数据分类与回归任务。 S Support Vector Machine 支持向量机(SVM)是经典机器学习分类算法,在特征空间寻找最优分隔超平面使类别间隔最大化,在中小规模结构化数据上表现稳健。 K K-means K-means 是经典无监督聚类算法:把数据划分为 K 个簇,使样本到簇中心的距离总和最小,用于用户分群等场景。 K K-nearest Neighbors K-nearest Neighbors(K近邻,KNN)是简单的监督学习算法:预测样本时找特征空间中距离最近的K个邻居,投票或平均出结果。 G Gradient Boosting 梯度提升(Gradient Boosting)是一种集成学习方法,串行训练多棵弱决策树,每棵拟合一前模型的残差,在表格数据竞赛与工业中广泛应用。 P Principal Component Analysis Principal Component Analysis(主成分分析,PCA)是一种线性降维方法,把高维数据投影到少数主要方向上,用于数据压缩与可视化。 M Multi-head Attention 多头注意力(Multi-head Attention)是 Transformer 的核心机制,把注意力拆成多个并行头分别关注不同语义关系,最后合并结果。 P Positional Encoding 位置编码(Positional Encoding)为 Transformer 输入注入顺序信息,弥补自注意力本身无法区分词序的缺陷。 E Encoder Encoder(编码器)是把输入数据压缩成稠密表示(Embedding)的模型组件,BERT即典型的编码器模型。 D Decoder Decoder(解码器)是 Transformer 架构中根据已生成内容自回归地预测下一个 Token 的部分,GPT 系列模型采用纯 Decoder 结构。 T Tokenizer Tokenizer(切词器)是把原始文本切分为 Token 序列的组件,是大语言模型的配套工具,直接影响模型输入表示与输出还原。 G Graph Neural Network 图神经网络(GNN)专门处理图结构数据,通过在节点与邻居间传递聚合信息学习表示,适用于节点间存在关联关系的数据。 G Ground Truth 标准答案(Ground Truth)指数据集中经过人工或权威方式确认的真实标注,是训练与评测模型时的对照基准。 F Fairness Fairness(公平性)指AI系统在不同人群、地区、性别等分组上的表现应相当,不因特征相关性而系统性优待或歧视某一群体。 P Prompt Injection 提示词注入(Prompt Injection)是针对大模型应用的安全攻击:用户输入中隐藏恶意指令,覆盖或劫持系统提示,让模型执行攻击者期望的行为。 J Jailbreak Jailbreak(越狱提示)指通过特殊措辞绕过大模型安全限制、诱导其输出被拒内容的攻击手法,与 Prompt Injection 同属 AI 安全关注范畴。 R Red Teaming 红队测试(Red Teaming)是模拟攻击视角对 AI 系统做安全测试,主动寻找模型被诱导输出有害内容或被注入提示词的漏洞。 A AI Ethics AI 伦理(AI Ethics)研究人工智能开发与使用中的公平、透明、隐私与责任等规范问题,指导技术负责任地落地。 R Responsible AI Responsible AI(负责任的AI)是一套开发与使用AI的原则框架,要求兼顾安全、公平、透明、隐私与人类可控。 A AI Safety AI 安全(AI Safety)研究如何让人工智能系统可靠、可控、对齐人类意图,涵盖幻觉、滥用、偏见、提示词注入与高风险决策等议题。 D Differential Privacy Differential Privacy(差分隐私)是一种隐私保护框架:通过向数据或计算结果加入可控噪声,保证单条记录无法被反推。 F Federated Learning 联邦学习(Federated Learning)是分布式训练范式:模型训练在本地设备进行,原始数据不出本地,只上传模型更新,在保护隐私下协同训练。 E Edge AI 边缘智能(Edge AI)指把 AI 模型部署在手机、摄像头等本地设备上运行,不依赖云端,兼顾低时延与数据隐私。 A Autonomous Driving Autonomous Driving(自动驾驶)指车辆利用传感器与AI算法自主完成环境理解与驾驶决策,按SAE分级从辅助驾驶到完全无人。 H Humanoid Robot 人形机器人(Humanoid Robot)是外形与运动方式近似人类的机器人,结合具身智能与大模型完成行走、操作与交互,是 AI 落地物理世界的方向之一。 D Data Science Data Science(数据科学)是综合运用统计学、编程与领域知识从数据中提取洞察的交叉学科,涵盖数据采集、建模到决策落地全流程。 B Big Data 大数据(Big Data)指规模巨大、类型多样、增长迅速的数据集合,难以用传统工具处理;机器学习与大模型正建立在对大数据的利用之上。 A API API(应用程序编程接口)是软件之间互相调用能力的标准化约定,开发者通过它接入大模型服务而无需自建模型。 P Plugin Plugin(插件)指大模型通过标准化接口调用的外部工具或服务,使模型能获取实时信息、操作外部系统。 M MCP MCP(Model Context Protocol,模型上下文协议)是 Anthropic 提出的开放协议,标准化大模型与外部数据源、工具之间的连接方式,类似 AI 应用的 USB-C 接口。 T Tool Use Tool Use(工具使用)指大模型在回答时主动调用外部工具(搜索、计算器、代码解释器、API)补充自身能力,是构建 AI Agent 的基础。 S Structured Output 结构化输出(Structured Output)指让大模型按固定格式(如 JSON、指定字段)返回结果而非自由文本,便于程序直接解析与下游系统对接。 S Sentence Embedding 句向量(Sentence Embedding)把整句文本映射为稠密向量,使语义相近的句子在向量空间中距离接近,用于检索与聚类。 A Anomaly Detection Anomaly Detection(异常检测)指识别数据中偏离正常模式的样本,如欺诈交易、设备故障、网络入侵。 C Collaborative Filtering 协同过滤(Collaborative Filtering)是推荐系统的经典方法:根据相似用户喜欢的物品或用户共同偏好做推荐,电商与影音平台广泛使用。 D Data Drift Data Drift(数据漂移)指模型上线后输入数据分布随时间偏离训练分布的现象,会导致效果衰减,是模型监控的核心指标。 A A/B Testing A/B 测试是对照实验方法:把用户随机分组分别使用不同版本,比较关键指标差异以判断哪个版本更好,广泛用于产品与模型上线决策。 I Image-to-Image 图生图(Image-to-Image)以一张参考图为基础,按提示词与重绘强度生成新图,可用于风格迁移与局部修改。 N Negative Prompt Negative Prompt(负面提示词)是文生图中专门描述“不希望出现”内容的字段,引导扩散模型把对应元素从画面中抑制掉。 S Style Transfer 风格迁移(Style Transfer)是把一张图的艺术风格套用到另一张图内容上的图像生成技术,神经风格迁移开启了 AI 艺术图的早期方向。 S Super Resolution Super Resolution(超分辨率)是把低分辨率图像放大为高清图像的计算机视觉技术,用于老照片修复、视频增强、遥感影像等场景。 I Inpainting 图像修复(Inpainting)是 AI 图像编辑技术,根据周边画面自动补全被涂抹或缺失的区域,常用于去水印、移除路人、修补老照片。 O Outpainting 外扩绘制(Outpainting)在已有图像边界之外生成延续内容,把小图扩成更大画幅,保持视觉连贯。 C ControlNet ControlNet是为扩散模型增加空间可控性的网络结构:提供边缘图、姿态骨架、深度图等条件,据此精确控制生成图像的构图。 D DreamBooth DreamBooth 是一种个性化图像微调方法:用少量某对象的图片微调扩散模型,使其能用提示词稳定生成该对象在不同场景下的图像。 T Textual Inversion Textual Inversion(文本反转)是用少量图片学习一个新概念 Embedding 的 Stable Diffusion 轻量微调技术,比 DreamBooth 更轻便。 N Natural Language Understanding 自然语言理解(NLU)是自然语言处理的子领域,研究让机器读懂语言的含义与意图,涵盖情感分析、命名实体识别、阅读理解等任务。 N Natural Language Generation 自然语言生成(NLG)让机器把数据或意图转写成流畅的人类语言,是聊天机器人、文本摘要等应用的输出环节。