Skip to content

大模型工程术语地图:别再只会说参数量和token

2026年4月30日

讨论大模型时,最常见的两个词是参数量和token。但如果只会看这两个,很快就会遇到问题。这篇文章给应用工程师、后端工程师、AI工程师一张概念地图。

六层架构总览

层级关键词
第一层Transformer、Attention、MoE、MLA
第二层Prefill、Decode、KV Cache、PagedAttention
第三层TTFT、TPOT、Continuous Batching、Scheduler
第四层FP16、INT8、INT4、PTQ、QAT
第五层GPU、NPU、HBM、NVLink、TOPS
第六层RAG、Embedding、Tool Calling、Agent Runtime、Eval

第一层:模型结构

Transformer

当前大语言模型最核心的网络结构,通过Attention和MLP等模块处理token序列。

Attention

让当前token从上下文里寻找相关信息的机制,解决序列中token之间如何建立关联的问题。

MHA / MQA / GQA

  • MHA(多头注意力):多个attention head从不同角度看上下文
  • MQA(多查询注意力):多个query head共享较少的K/V,减少KV Cache
  • GQA(分组查询注意力):介于MHA和MQA之间,一组query head共享K/V

MLA

Multi-head Latent Attention,通过低维latent表示压缩注意力状态,降低KV Cache压力。

MoE

Mixture of Experts,专家混合模型,让每个token只激活一部分专家。

第二层:上下文与缓存

Prefill

模型先处理输入上下文的阶段,解决模型在生成第一个token前如何读完prompt的问题。

Decode

模型逐token生成输出的阶段,输出越长,decode循环越久。

KV Cache

缓存历史token在Attention里产生的Key和Value状态,解决decode阶段不用每一步都重算历史上下文的问题。

应用工程师要关心它: 长上下文、多轮对话和Agent会显著放大KV Cache的显存成本。

PagedAttention

把KV Cache像分页内存一样管理,解决传统KV Cache预分配浪费和显存碎片问题。

Prefix Cache

复用相同prompt前缀的缓存机制,适合有公共前缀的企业知识库、代码助手场景。

Context Compression

压缩上下文内容或状态的技术,解决上下文越来越长、token和KV Cache越来越贵的问题。

第三层:推理服务

TTFT

Time To First Token,首token延迟。用户感受到的"模型半天没反应",通常和TTFT有关。

TPOT

Time Per Output Token,每个输出token的生成时间,决定模型的"打字速度"。

Continuous Batching

连续批处理,允许请求动态加入和退出batch,提高GPU利用率和吞吐。

Scheduler

推理服务里的调度器,决定哪些请求什么时候prefill、什么时候decode、如何占用显存和GPU。

Tail Latency

尾延迟(P95、P99),描述最慢一批请求的体验。平均延迟好看,不代表用户体验稳定。

第四层:量化与压缩

FP16 / BF16

16 bit浮点格式,在保持较好数值表现的同时降低FP32的压力。

INT8 / INT4

整数低精度表示,解决模型权重、激活或KV Cache占用过大的问题。本地推理、端侧部署常用。

PTQ

Post-Training Quantization,训练后量化,不重新训练模型也能转成低精度格式。

GPTQ / AWQ / SmoothQuant

常见量化方法,解决低精度量化带来的精度损失问题。同样是INT4,不同方法的质量和速度可能差很多。

GGUF

本地推理生态里常见的模型文件格式,打包模型权重、量化信息和推理元数据。

第五层:硬件与系统

GPU

大模型训练和推理最常用的加速器,显存、带宽和软件生态直接影响推理成本。

HBM

高带宽显存,解决GPU计算单元需要高速读取模型权重和中间状态的问题。

很多推理瓶颈不是算不动,而是数据喂不够。

连接计算、内存和设备的互联技术,多卡推理、KV Offload和异构系统都会受互联影响。

TOPS / FLOPS

计算性能指标,但峰值算力不等于真实token/s。

Compute-bound / Memory-bound

  • Compute-bound:瓶颈主要在计算
  • Memory-bound:瓶颈主要在内存和带宽

优化方向完全不同。

第六层:应用工程

RAG

Retrieval-Augmented Generation,检索增强生成,解决模型回答时如何使用外部知识的问题。

Embedding

把文本、图片或其他对象转换成向量表示,让系统能计算语义相似度。

Vector Database

向量数据库,但不能把RAG简化成向量数据库。

混合检索,结合关键词检索和向量检索。纯向量检索容易漏掉精确术语、编号、代码和专有名词。

Rerank

对召回候选结果重新排序。很多RAG效果提升来自rerank,而不是换向量库。

Tool Calling

让模型调用外部工具或函数,只是Agent的入口,不是Agent的全部。

Agent Runtime

管理Agent执行过程的运行时,解决规划、状态、工具、权限、错误恢复和成本控制问题。

Eval

评测,解决AI应用修改后如何知道系统是否真的变好的问题。

核心判断框架

下次再看到一个新词,可以先问三件事:

  1. 它在哪一层? — 搞清楚属于系统哪部分
  2. 它解决什么瓶颈? — 搞清楚为什么要关心它
  3. 它会影响什么? — 成本、延迟、质量,还是稳定性?

这样你就不会只停留在"参数量"和"token"这两个入口词上了。

术语关系图

模型结构(Transformer/Attention/MoE)

上下文缓存(Prefill/Decode/KV Cache)

推理服务(TTFT/TPOT/Scheduler)

量化压缩(FP16/INT8/PTQ)

硬件系统(GPU/HBM/NVLink)

应用工程(RAG/Agent/Eval)

理解大模型工程,最重要的不是背术语,而是把术语放回系统位置。

不要孤军奋战啦!

加入微信群一起学习交流 AI

与大神一起使用 OpenClaw、Hermes、Claude Code、Seedance 2.0、GPT-Image-2 等

微信公众号

扫码关注微信公众号
私信 "加群",将自动获取微信群二维码

探索 AI 世界,掌握智能未来