AI 领域常见数量级速查:模型参数、GPU 显存与算力、数据集规模、量化与推理指标,附权威来源。英语数量词与单位前缀的语言学辨析见 数量。
大语言模型参数规模(B 单位核心应用场景)
| 模型名称 | 参数量 | 应用场景说明 |
|---|---|---|
| GPT-1 | 117M (1.17亿) | 2018年发布,OpenAI初代GPT模型,奠定Transformer预训练范式 |
| GPT-2 | 1.5B (15亿) | 2019年发布,首次展现大模型的文本生成能力,训练数据40GB网络文本 |
| GPT-3 | 175B (1750亿) | 2020年发布,参数规模跃升117倍,开启千亿参数模型时代 |
| LLaMA-2 | 7B/13B/70B (70亿/130亿/700亿) | Meta开源模型(论文),7B版本可在消费级GPU(如RTX 4090)上运行 |
| PaLM | 8B/62B/540B (80亿/620亿/5400亿) | Google 2022年初代旗舰,540B版本展现强大多语言与推理能力;PaLM-2 参数未公开(仅 Gecko/Otter/Bison/Unicorn 代号) |
| GPT-4 | 约1.76T(第三方泄露估计,OpenAI 未公开) | 混合专家模型(混合专家模型 MoE)架构(同为泄露分析推测),训练成本约1亿美元亦为估计值 |
典型表述对比:
- hundreds/thousands用法:“训练小模型时,我们通常用数百万到数千万条数据进行微调”
- 标准单位用法:“GPT-3有175B参数,LLaMA-2 70B是企业级部署的主流选择”
AI硬件规格(GB/TB单位核心应用场景)
GPU显存与算力(科学单位前缀标准应用)
- Nvidia H100:80GB HBM3显存,单卡FP16算力约990 TFLOPS(SXM 稠密;官方规格),是AI训练的旗舰卡
- Nvidia A100:40GB/80GB HBM2显存,单卡FP16算力312 TFLOPS(官方规格),广泛用于数据中心
- Nvidia RTX 4090:24GB GDDR6X显存,消费级最强AI显卡,可运行7B-13B模型
- AMD MI250:64GB HBM2显存,双芯设计,常用于超算中心AI训练
- Google TPU v5e:支持数百GB聚合显存,单芯片算力达万亿次浮点运算
TFLOPS 的算力口径辨析见 由浅入深理解Nvidia显卡:CUDA Core、Tensor Core与机器学习算力详解。
存储与内存配置
- 训练集群:“GPT-4训练集群使用数千TB(PB级)存储,内存带宽达数百GB/s”
- 推理服务器:“企业级LLM推理节点通常配置2TB系统内存+8×80GB H100 GPU显存”
- 边缘设备:“端侧AI芯片(如手机NPU)内存仅数GB,需模型量化至 FP8 精度”
数据集规模(MB/GB/TB/PB单位应用)
| 数据集名称 | 大小 | 数据类型 | 应用场景 |
|---|---|---|---|
| MNIST | 约12MB | 手写数字图像 | 入门级图像分类训练 |
| ImageNet-1K | 约150GB(官网) | 自然图像(1400万张) | 计算机视觉模型基准测试 |
| BookCorpus | 约8GB (8亿token) | 图书文本 | GPT-1训练核心数据集 |
| Common Crawl | 约50TB (4000亿token) | 网页文本 | 多数大模型预训练基础数据 |
| GPT-4训练数据 | 约1PB(第三方估计,OpenAI 未公开) | 多模态数据 | 涵盖文本、图像、代码等多类型数据 |
表述规范示例:
- hundreds/thousands用法:“微调分类模型时,我们从数据集中采样数千张图片做验证集”
- 标准单位用法:“ImageNet-1K数据集大小为150GB,包含1000个类别(此处1000为类别数,非单位)“
AI算力与性能指标(TFlops/T/s单位应用)
-
训练算力需求
- “训练GPT-3需约3.14e23浮点运算,用1024张A100需数月时间”
- 显存需求的估算方法见 模型训练和推理时大概需要占用多少显存?
-
推理性能表现
- “H100运行LLaMA-2 70B INT4量化版,生成速度达数千token/秒”(batch 聚合吞吐)
-
特殊场景数据
- 模型量化:“LLaMA-2 7B 量化到 INT4 后权重仅约 3.5GB,可在单张消费级显卡上推理(量化主要服务推理;训练场景多用 LoRA 等参数高效微调)”
- 模型量化:“将67B模型从FP16量化到INT4,显存占用从270GB降至68GB,性能损失<5%”
- 分布式训练:“用数百张GPU进行数据并行训练,可将训练时间从数月缩短至数周”
数量词与单位前缀辨析
英语数量词(hundreds/thousands,表范围)与标准单位前缀(kilo-/mega-/giga-/tera-,1k=10³…1T=10¹²,表精确值)的完整辨析见 数量。注意”1千B参数”是混用中文量词与单位后缀,应说 1T 参数(1000B)。