Appearance
讨论大模型时,最常见的两个词是参数量和token。但如果只会看这两个,很快就会遇到问题。这篇文章给应用工程师、后端工程师、AI工程师一张概念地图。
六层架构总览
| 层级 | 关键词 |
|---|---|
| 第一层 | Transformer、Attention、MoE、MLA |
| 第二层 | Prefill、Decode、KV Cache、PagedAttention |
| 第三层 | TTFT、TPOT、Continuous Batching、Scheduler |
| 第四层 | FP16、INT8、INT4、PTQ、QAT |
| 第五层 | GPU、NPU、HBM、NVLink、TOPS |
| 第六层 | RAG、Embedding、Tool Calling、Agent Runtime、Eval |
第一层:模型结构
Transformer
当前大语言模型最核心的网络结构,通过Attention和MLP等模块处理token序列。
Attention
让当前token从上下文里寻找相关信息的机制,解决序列中token之间如何建立关联的问题。
MHA / MQA / GQA
- MHA(多头注意力):多个attention head从不同角度看上下文
- MQA(多查询注意力):多个query head共享较少的K/V,减少KV Cache
- GQA(分组查询注意力):介于MHA和MQA之间,一组query head共享K/V
MLA
Multi-head Latent Attention,通过低维latent表示压缩注意力状态,降低KV Cache压力。
MoE
Mixture of Experts,专家混合模型,让每个token只激活一部分专家。
第二层:上下文与缓存
Prefill
模型先处理输入上下文的阶段,解决模型在生成第一个token前如何读完prompt的问题。
Decode
模型逐token生成输出的阶段,输出越长,decode循环越久。
KV Cache
缓存历史token在Attention里产生的Key和Value状态,解决decode阶段不用每一步都重算历史上下文的问题。
应用工程师要关心它: 长上下文、多轮对话和Agent会显著放大KV Cache的显存成本。
PagedAttention
把KV Cache像分页内存一样管理,解决传统KV Cache预分配浪费和显存碎片问题。
Prefix Cache
复用相同prompt前缀的缓存机制,适合有公共前缀的企业知识库、代码助手场景。
Context Compression
压缩上下文内容或状态的技术,解决上下文越来越长、token和KV Cache越来越贵的问题。
第三层:推理服务
TTFT
Time To First Token,首token延迟。用户感受到的"模型半天没反应",通常和TTFT有关。
TPOT
Time Per Output Token,每个输出token的生成时间,决定模型的"打字速度"。
Continuous Batching
连续批处理,允许请求动态加入和退出batch,提高GPU利用率和吞吐。
Scheduler
推理服务里的调度器,决定哪些请求什么时候prefill、什么时候decode、如何占用显存和GPU。
Tail Latency
尾延迟(P95、P99),描述最慢一批请求的体验。平均延迟好看,不代表用户体验稳定。
第四层:量化与压缩
FP16 / BF16
16 bit浮点格式,在保持较好数值表现的同时降低FP32的压力。
INT8 / INT4
整数低精度表示,解决模型权重、激活或KV Cache占用过大的问题。本地推理、端侧部署常用。
PTQ
Post-Training Quantization,训练后量化,不重新训练模型也能转成低精度格式。
GPTQ / AWQ / SmoothQuant
常见量化方法,解决低精度量化带来的精度损失问题。同样是INT4,不同方法的质量和速度可能差很多。
GGUF
本地推理生态里常见的模型文件格式,打包模型权重、量化信息和推理元数据。
第五层:硬件与系统
GPU
大模型训练和推理最常用的加速器,显存、带宽和软件生态直接影响推理成本。
HBM
高带宽显存,解决GPU计算单元需要高速读取模型权重和中间状态的问题。
很多推理瓶颈不是算不动,而是数据喂不够。
NVLink / PCIe / CXL
连接计算、内存和设备的互联技术,多卡推理、KV Offload和异构系统都会受互联影响。
TOPS / FLOPS
计算性能指标,但峰值算力不等于真实token/s。
Compute-bound / Memory-bound
- Compute-bound:瓶颈主要在计算
- Memory-bound:瓶颈主要在内存和带宽
优化方向完全不同。
第六层:应用工程
RAG
Retrieval-Augmented Generation,检索增强生成,解决模型回答时如何使用外部知识的问题。
Embedding
把文本、图片或其他对象转换成向量表示,让系统能计算语义相似度。
Vector Database
向量数据库,但不能把RAG简化成向量数据库。
Hybrid Search
混合检索,结合关键词检索和向量检索。纯向量检索容易漏掉精确术语、编号、代码和专有名词。
Rerank
对召回候选结果重新排序。很多RAG效果提升来自rerank,而不是换向量库。
Tool Calling
让模型调用外部工具或函数,只是Agent的入口,不是Agent的全部。
Agent Runtime
管理Agent执行过程的运行时,解决规划、状态、工具、权限、错误恢复和成本控制问题。
Eval
评测,解决AI应用修改后如何知道系统是否真的变好的问题。
核心判断框架
下次再看到一个新词,可以先问三件事:
- 它在哪一层? — 搞清楚属于系统哪部分
- 它解决什么瓶颈? — 搞清楚为什么要关心它
- 它会影响什么? — 成本、延迟、质量,还是稳定性?
这样你就不会只停留在"参数量"和"token"这两个入口词上了。
术语关系图
模型结构(Transformer/Attention/MoE)
↓
上下文缓存(Prefill/Decode/KV Cache)
↓
推理服务(TTFT/TPOT/Scheduler)
↓
量化压缩(FP16/INT8/PTQ)
↓
硬件系统(GPU/HBM/NVLink)
↓
应用工程(RAG/Agent/Eval)理解大模型工程,最重要的不是背术语,而是把术语放回系统位置。
