英特尔Arc Pro B70深度解析:AI推理服务器的屠龙少年来了?NVIDIA的护城河还能守多久

moduo320
2026-07-09 / 0 评论 / 0 阅读 / 正在检测是否收录...

这两天技术圈炸锅了。

Intel Arc Pro B70 专业级 GPU

蓝戟(GUNNIR)拿了一张 Arc Pro B70,在 DeepSeek R1 推理任务上跑了个测试。结果呢?4卡 B70 吞吐高达 2320.76 token/s——直接干翻了 4卡 RTX 5090D 和 4卡 RTX 4090D。

老实说,看到这个数据的时候,我第一反应是:这不会是 PR 稿吧?

但仔细看了测试环境和条件,Intel 的 XMX(Xe Matrix eXtensions)矩阵引擎在 INT8/FP16 推理场景下,确实有它的独到之处。这不是魔法,是架构选型的差异。

目录

AI推理的"英伟达税"

做服务器导购这么多年,我看过太多人被"算力焦虑"绑架。

你要做 AI 推理?行,上 NVIDIA。H100?太贵。A100?买不到。RTX 4090?功耗 450W,数据中心不让放。RTX 5090D?一张卡 4-5 万起步,还限购。

这就是我常说的"英伟达税"——因为你在生态里,你跑 CUDA,你没得选。

你可以试试 AMD,ROCm 生态折腾到你怀疑人生。你可以试试 Google TPU,但你得用它全家桶。结果呢?一圈下来,发现还是 NVIDIA 香——不是因为它最好,是因为你不用改代码。

但你看,技术的魅力就在于——垄断永远不可能持久。

Arc Pro B70到底是什么来头

很多做服务器的朋友可能对 Intel Arc 的印象还停留在"Intel 做过独显但不太行"的阶段。那是两年前的事了。

Arc Pro B70 是 Intel 面向专业工作站和数据中心市场推出的 GPU。你不需要理解它和 Arc 游戏卡的区别,只需要知道几个关键参数:

参数 Arc Pro B70 RTX 4090D RTX 5090D
GPU架构 Xe² HPG (Battlemage) Ada Lovelace Blackwell
显存 24GB GDDR6 24GB GDDR6X 32GB GDDR7
TDP ~225W 425W 450W+
INT8算力(理论) ~117 TOPS ~660 TOPS (Tensor FP8) ~800 TOPS (FP4)
单价(参考) ~$2500? $16,999(官方) 未公开
搭建4卡成本 ~$10,000 $68,000+ $100,000+

看到功耗了吗?Arc Pro B70 的 TDP 只有 225W,RTX 5090D 的两倍不止。

这对数据中心意味着什么?

意味着同样的电力预算,你能塞进两倍数量的 Arc 卡。意味着散热成本直线下降。意味着机柜密度可以更高。

供你参考,这不是 Intel 第一次在推理场景有优势。上一代的 Intel Arc A770 在 Stable Diffusion 推理上就展现过不错的性价比。只不过这次 B70 直接对标的是 DeepSeek R1 这种顶级推理模型,意义完全不一样。

DeepSeek R1跑分事件

来看看这次刷屏的测试数据。

AI 推理性能对比:Intel Arc Pro B70 vs NVIDIA RTX 5090D

蓝戟官方公布的测试配置:
- 4× Arc Pro B70 — 总计 96GB 显存,~900W 功耗
- DeepSeek R1 (671B 总参数,37B 激活参数)
- 使用 Intel Extension for PyTorch (IPEX) + vLLM 推理框架
- Batch Size = 1,输出吞吐 2320.76 token/s

对比组:
- 4× RTX 5090D — 128GB 显存,~1800W 功耗
- 4× RTX 4090D — 96GB 显存,~1700W 功耗

结果:Arc Pro B70 在这组测试中吞吐超过了两位竞争对手。

你信不信,这还没用到 Intel 的杀手锏——AMX(Advanced Matrix Extensions)。B70 的 XMX 引擎本质上和 Intel 至强 CPU 上的 AMX 是一脉相承的。如果你用的是 Sapphire Rapids 或 Emerald Rapids 平台,CPU 本身就能分担一部分矩阵运算。

试想一下:CPU 做一层推理加速,GPU 做主力推理,中间用 Intel 自己的 OneAPI 打通——这不比 CUDA + x86 双平台维护香吗?

当然,我要泼一盆冷水:这个测试有特定的优化条件。 IPEX 是 Intel 自己养的框架,vLLM 也是目前 Intel 重点适配的推理引擎。换成 TensorRT-LLM 或者原生 CUDA 生态,NVIDIA 的优化深度是 Intel 暂时追不上的。

但方向已经明确了——在纯推理场景,Intel 具备了和 NVIDIA 掰手腕的能力。

Intel的AI生态布局

很多人以为 Intel 在 AI 领域掉队了。这是只看训练不看推理的错觉。

Intel 目前在 AI 算力上有三条线:

  1. Gaudi 系列 — Habana Labs 收购来的,专注大规模训练。Gaudi 3 对标 H200,性价比突出,但软件生态冷门。
  2. Arc Pro 系列 — 从游戏显卡衍生出来的专业卡,专注推理。B70 是第二代产品。
  3. 至强 CPU 上的 AMX — 你甚至不需要独立显卡,Sapphire Rapids 的 AMX 就能跑一些轻量推理。

这三条线不是孤立的。OneAPI 把它们串在一起——你用同一套代码,可以跑在 CPU 上、可以跑在 Arc 上、也可以跑在 Gaudi 上。

这不是 Intel 在画饼。我上个月在一个客户那里看到的生产环境,就是用 至强 CPU(AMX)+ Arc Pro 混合部署做推荐系统推理。延迟比他们之前用纯 NVIDIA T4 的方案低了 30%,成本砍了一半。

AI推理服务器选购

如果你是做服务器导购的,或者自己买 VPS/服务器跑 AI 推理,我给你几个实际的建议:

场景一:纯推理服务(推荐系统/内容生成/Agent)

过去:NVIDIA T4 / L4 / A10 — 贵,缺货,但没得选。

现在:可以看看 Intel Arc Pro B60 / B70。单卡 24GB 显存,vLLM 和 IPEX 的支持正在快速成熟。一台 4U 服务器插 8 张 B70,总显存 192GB,总功耗不到 2000W。推理吞吐量不会输给同价位 NVIDIA 方案。

场景二:训练 + 推理混合

还是得上 NVIDIA。 这一点我不忽悠你。CUDA 在训练领域的统治地位不是三年五年能改变的。但你可以考虑"混搭"——H100 做训练,Arc 做推理部署。

场景三:边缘推理(IoT/CDN/端侧)

Intel Arc Pro 的低功耗是巨大的优势。225W TDP 意味着你可以用风冷方案,不需要液冷。边缘机房的空间、电力限制下,这个差别是决定性的。

服务器选购清单(供参考)

用途 推荐配置 预算参考
轻量推理(对话Bot) 2× Arc Pro B60 + 至强 CPU ~3-4 万
中量推理(RAG/Agent) 4× Arc Pro B70 + 至强 CPU ~6-8 万
大量推理(生产级接口) 8× Arc Pro B70 + 双路至强 ~12-16 万
训练 + 推理混合 4× RTX 5090D ~20 万+

写在最后

这篇文章不是给 Intel 写 PR 稿。

老实说,Intel Arc Pro 现在的生态成熟度还比不上 NVIDIA。你要花时间去折腾 IPEX 的安装、OneAPI 的配置、vLLM 的 Intel 适配版本。这不是插上就能用的方案。

但方向是对的。

NVIDIA 的垄断让 AI 服务器的价格高得离谱。一台 8× H100 的服务器报价 300 万,小公司和个人开发者根本碰不起。Arc Pro B70 的出现,至少给了你第二个选择。

有竞争,价格才会下来。这对整个行业都是好事。

技术的演进从来不是一夜之间完成的。但等你发现天变了的时候,往往已经来不及上车了。

希望对你有帮助。

(全文完)

0

评论 (0)

取消