2021.02.03

Bfloat16 – 简介

分享:

AI 计算在计算上是昂贵的,特别是在处理 FP32 的较大数字集时。半精度 FP16 浮点数只有 8 位精度的有效数字和 5 位的指数,与 FP32 相比,其精度和可表示的数字范围都较低。

BFloat16 是由 Google 开发的,专门用来满足 AI 的特殊需求,AI 需要大量数字的范围,而对有效数字的精度要求较低。BFloat16 本质上是一个截断有效数字的 FP32,带来 FP16 的性能和 FP32 的动态范围,同时使用一半的内存。使用 BF16 的好处是可以轻松将现有的 FP32 数据转换为 BF16,以便进一步的神经处理。BF16 提供了足够的精度,没有更多。这是完成工作的合适工具。

bfloat16-2-2

BF16 bfloat16 :
1位元用于符号
8位元用于指数
2-127最小正值为2128最大正值(指数偏移量为127)。
7bit 用于有效数字

 

我们正处于人工智慧时代的边缘。拥有一种针对人工智慧的通用且快速的数字格式实现将加速我们朝着正确的方向前进。业界已经支持BFloat16格式,并在广泛的硬体平台上提供支持。格式的发明者Google在云端提供了他们自己的TPU(张量处理单元)。人工智慧加速器的事实领导者Nvidia也接受了bf16,并将其实施到他们最新的基于Ampere的硅晶片中的张量核心。CPU巨头Intel在Nervana加速器中提供了专门的解决方案,并将BF16整合到他们的AVX-512扩展中,以便在对人工智慧的依赖较少的特定使用情况下,减少的工作负载可以由CPU本身处理。ARM也将bf16整合到他们的SVE和Neon指令中。这一点非常重要,因为ARM v8在从移动设备到基础设施的广泛平台上都有使用。

 

表1 – 支援BFloat16的选定硬体列表

CPU Support
第一代和第二代英特尔® Xeon® 可扩展处理器 no
第三代英特尔® 至强® 可扩展处理器(Cooper Lake) yes
GPU 支持
Nvidia Volta (V100) No
Nvidia Turing (T4) No
Nvidia Ampere(A100) yes
AMD Radeon RX6000 No
AMD Radeon Instinct yes

 

 

相关讯息

面向Neocloud时代的机柜级AI基础设施架构
2026.09.24

面向Neocloud时代的机柜级AI基础设施架构

生成式AI与Agentic AI应用持续发展,加上日益增长的AI训练与推理工作负载,对计算吞吐量、内存、网络与存储能力提出了前所未有的要求。因此,AI基础设施已无法再以独立服务器为核心进行设计。随着专业化Neocloud服务提供商兴起,产业进一步向机柜级架构发展,将计算、网络与散热管理整合于同一架构中,以实现高效且高度适应性的AI计算能力。

打造可扩展的AI与云原生应用基础设施
2026.09.09

打造可扩展的AI与云原生应用基础设施

随着AI应用与云原生应用持续重塑企业IT环境,基础设施必须能够支持日益多元且动态的工作负载。从虚拟化、分布式服务到数据密集型应用,现代数据中心需要在计算、内存、存储与I/O性能之间取得平衡。随着工作负载需求持续演进,基础设施也必须具备更高的扩展能力与效率。

高密度AI基础设施:以先进散热技术提升计算性能与扩展能力
2026.09.02

高密度AI基础设施:以先进散热技术提升计算性能与扩展能力

随着AI工作负载对计算能力的需求不断提升,数据中心必须在有限的空间与能源条件下,实现更高的计算密度与更优异的散热效率。当高功耗CPU与GPU被整合至紧凑型服务器平台中时,先进的散热管理便成为维持系统性能与提升基础设施效率的关键。

咨询车

您的咨询车共计 0 件产品

产品比较

您的比较共计 0 件产品

订阅电子报

数字验证

请由小到大,依序点击数字

我们使用 cookies 以确保我们的网站正常运作,个性化内容和广告,提供社交媒体功能并分析流量。我们还会与社交媒体、广告和分析合作伙伴分享您使用我们网站的信息。

管理Cookies

隱私權偏好設定中心

我们使用 cookies 以确保我们的网站正常运作,个性化内容和广告,提供社交媒体功能并分析流量。我们还会与社交媒体、广告和分析合作伙伴分享您使用我们网站的信息。

管理同意設定

必要的Cookie

一律啟用

这些 cookies 是网站运作所必需的,您无法在系统上关闭它们。

这些 Cookie 通常仅在您执行某个动作(即服务请求)时设置,例如设置隐私偏好、登录或填写表单。

您可以设置浏览器以阻止或提示您这些Cookie,但这可能会导致某些网站功能无法正常运作。