AI 领域常见数量级速查:模型参数、GPU 显存与算力、数据集规模、量化与推理指标,附权威来源。英语数量词与单位前缀的语言学辨析见 数量

大语言模型参数规模(B 单位核心应用场景)

模型名称参数量应用场景说明
GPT-1117M (1.17亿)2018年发布,OpenAI初代GPT模型,奠定Transformer预训练范式
GPT-21.5B (15亿)2019年发布,首次展现大模型的文本生成能力,训练数据40GB网络文本
GPT-3175B (1750亿)2020年发布,参数规模跃升117倍,开启千亿参数模型时代
LLaMA-27B/13B/70B (70亿/130亿/700亿)Meta开源模型(论文),7B版本可在消费级GPU(如RTX 4090)上运行
PaLM8B/62B/540B (80亿/620亿/5400亿)Google 2022年初代旗舰,540B版本展现强大多语言与推理能力;PaLM-2 参数未公开(仅 Gecko/Otter/Bison/Unicorn 代号)
GPT-4约1.76T(第三方泄露估计,OpenAI 未公开)混合专家模型(混合专家模型 MoE)架构(同为泄露分析推测),训练成本约1亿美元亦为估计值

典型表述对比

  • hundreds/thousands用法:“训练小模型时,我们通常用数百万到数千万条数据进行微调”
  • 标准单位用法:“GPT-3有175B参数,LLaMA-2 70B是企业级部署的主流选择”

AI硬件规格(GB/TB单位核心应用场景)

GPU显存与算力(科学单位前缀标准应用)

  • Nvidia H100:80GB HBM3显存,单卡FP16算力约990 TFLOPS(SXM 稠密;官方规格),是AI训练的旗舰卡
  • Nvidia A100:40GB/80GB HBM2显存,单卡FP16算力312 TFLOPS(官方规格),广泛用于数据中心
  • Nvidia RTX 4090:24GB GDDR6X显存,消费级最强AI显卡,可运行7B-13B模型
  • AMD MI250:64GB HBM2显存,双芯设计,常用于超算中心AI训练
  • Google TPU v5e:支持数百GB聚合显存,单芯片算力达万亿次浮点运算

TFLOPS 的算力口径辨析见 由浅入深理解Nvidia显卡:CUDA Core、Tensor Core与机器学习算力详解

存储与内存配置

  • 训练集群:“GPT-4训练集群使用数千TB(PB级)存储,内存带宽达数百GB/s
  • 推理服务器:“企业级LLM推理节点通常配置2TB系统内存+8×80GB H100 GPU显存”
  • 边缘设备:“端侧AI芯片(如手机NPU)内存仅数GB,需模型量化至 FP8 精度

数据集规模(MB/GB/TB/PB单位应用)

数据集名称大小数据类型应用场景
MNIST约12MB手写数字图像入门级图像分类训练
ImageNet-1K约150GB(官网自然图像(1400万张)计算机视觉模型基准测试
BookCorpus约8GB (8亿token)图书文本GPT-1训练核心数据集
Common Crawl约50TB (4000亿token)网页文本多数大模型预训练基础数据
GPT-4训练数据约1PB(第三方估计,OpenAI 未公开)多模态数据涵盖文本、图像、代码等多类型数据

表述规范示例

  • hundreds/thousands用法:“微调分类模型时,我们从数据集中采样数千张图片做验证集”
  • 标准单位用法:“ImageNet-1K数据集大小为150GB,包含1000个类别(此处1000为类别数,非单位)“

AI算力与性能指标(TFlops/T/s单位应用)

  1. 训练算力需求

  2. 推理性能表现

    • “H100运行LLaMA-2 70B INT4量化版,生成速度达数千token/秒”(batch 聚合吞吐)
  3. 特殊场景数据

    • 模型量化:“LLaMA-2 7B 量化到 INT4 后权重仅约 3.5GB,可在单张消费级显卡上推理(量化主要服务推理;训练场景多用 LoRA 等参数高效微调)”
    • 模型量化:“将67B模型从FP16量化到INT4,显存占用从270GB降至68GB,性能损失<5%”
    • 分布式训练:“用数百张GPU进行数据并行训练,可将训练时间从数月缩短至数周

数量词与单位前缀辨析

英语数量词(hundreds/thousands,表范围)与标准单位前缀(kilo-/mega-/giga-/tera-,1k=10³…1T=10¹²,表精确值)的完整辨析见 数量。注意”1千B参数”是混用中文量词与单位后缀,应说 1T 参数(1000B)。