英伟达披露了其最新 Blackwell 架构 GPU 在使用一种名为 NVFP4 的新低精度数值格式进行大语言模型训练时的性能提升。此次公告基于谷歌 JAX 框架和 MaxText 训练库的实验结果,反映出行业持续降低人工智能模型训练成本和时间的努力。
根据一篇开发者博客文章,英伟达在 Blackwell GPU 上使用 NVFP4 格式训练 Llama 3 8B 模型时,相较 FP8 基线实现了 1.31 倍至 1.73 倍的加速。这意味着最高 73% 的性能提升,公司表示,这些增益并未带来可测量的准确度损失。公司称,在 10,000 个预训练步骤中保持了相近的训练损失曲线。
数值精度与训练效率的平衡
人工智能模型训练中的数值精度涉及计算速度、内存使用和最终模型质量之间的平衡。传统上,32 位浮点(FP32)格式是标准,但近年来行业已转向 16 位(FP16)、Brain Float 16(BF16)以及 8 位(FP8)格式。每一步都以降低精度为代价,换取更高的计算吞吐量和更低的内存带宽需求。
NVFP4 将这一趋势扩展到 4 位浮点格式。理论上,4 位格式相较 8 位格式可以将内存使用量减半并提高吞吐量。然而,在实际应用中,可表示的数值范围和精度都较为有限,这可能在训练过程中带来数值不稳定或收敛问题。
英伟达的结果之所以值得关注,是因为这些结果表明,尽管存在上述理论顾虑,NVFP4 仍可在真实的大语言模型训练中使用,并且不会造成准确度损失。公司报告称,在 10,000 个预训练步骤中保持了相近的训练损失曲线,这表明模型的学习模式与 FP8 情况下相近。
Blackwell 架构的作用
这些性能提升与 Blackwell GPU 的硬件设计密切相关。Blackwell 是英伟达最新的数据中心 GPU 架构,内置了用于低精度算术运算的专用硬件加速器。NVFP4 格式旨在利用这些硬件能力,将软件优化与硬件支持结合起来。
MaxText 是谷歌开发的基于 JAX 的高性能训练库,为大语言模型训练提供实现。英伟达强调与 MaxText 的集成,凸显了 JAX 生态中的协作,也表明 Blackwell 的能力可以在 PyTorch 或 TensorFlow 之外的框架中得到利用。
行业背景与竞争格局
此次公告是行业降低人工智能训练成本的更广泛努力的一部分。大语言模型训练可能需要大量计算支出,训练时间从数周到数月不等。73% 的加速有望降低这些成本和时间,使更多组织能够开展大规模模型训练。
竞争对手也在朝类似方向推进。AMD 正在开发自己的低精度格式,谷歌的 TPU 围绕 Brain Float 格式进行优化,英特尔及其他新进入者也在寻求在人工智能加速器市场中的位置。英伟达的 NVFP4 公告可以放在这一竞争环境中理解。
实际考量与限制
不过,将这些结果应用于生产环境仍需考虑多项因素。首先,英伟达披露的结果基于特定模型(Llama 3 8B)和特定训练配置(MaxText 配方)。在不同模型架构、数据集或训练超参数下是否会出现类似结果,还需要进一步验证。
其次,10,000 个预训练步骤可能只代表完整训练过程的一部分。大模型通常要经历数十万到数百万个训练步骤,数值误差可能在较长周期内累积。英伟达是否已确认在更长训练运行中也能保持同样的准确度,目前并不明确。
第三,NVFP4 是 Blackwell 架构专用格式,因此要利用这一能力需要升级到最新硬件。使用现有 Hopper 或 Ampere 代 GPU 的组织无法立即受益于这些能力。
未来展望
随着人工智能模型规模和复杂性持续增长,低精度训练的进展变得愈发重要。行业已经在讨论拥有万亿级参数的模型,而训练此类模型所需的计算资源也在持续增加。NVFP4 之类的技术有助于缓和这一增长,并支持更高效的训练。
此外,低精度格式在推理阶段也可能发挥重要作用。将训练好的模型部署到生产环境时,更低的精度意味着更快的响应时间和更低的运营成本。如果训练和推理都能使用同一种低精度格式,整个人工智能流水线的效率可能得到提升。
英伟达的公告显示,硬件制造商、框架开发者和模型研究者之间的协作可以带来实际的性能改进。JAX 和 MaxText 社区多快采纳 NVFP4,以及是否能在其他模型和任务中复现类似结果,将有助于决定这项技术的长期影响。
低精度格式的采用也具有经济和环境层面的影响。缩短训练时间可以降低电力消耗,从而可能减少数据中心运营成本和碳排放。随着人工智能行业面临可持续性压力,高效训练技术为同时应对环境与经济考量提供了一种路径。
