这两天技术圈里炸了两个消息。
7月7日,路透社、The Information同时爆料——DeepSeek和智谱AI正在秘密自研定制化AI推理芯片。消息一出,英伟达盘前股价应声下跌1.6%。
老实说,我一点也不意外。
如果你在过去一年里一直在关注AI基础设施的变化,你就会发现:训练大模型的故事已经讲完了,下半场拼的是推理。而当推理成本成为AI公司最大的账单时,自己下场造芯片,几乎是唯一的路。
今天这篇文章,我想跟你聊聊:DeepSeek造芯这件事,对普通用户买VPS、云服务器到底意味着什么?以及2026年的当下,AI推理服务器到底该怎么选?
目录
- 为什么DeepSeek非造芯片不可?
- 推理vs训练:算力需求的结构性翻转
- 推理服务器和普通服务器的本质区别
- 2026年买AI服务器,你需要注意的三件事
- 总结
一、为什么DeepSeek非造芯片不可?
先看一组数字。
DeepSeek在6月份完成了70亿美元融资。一家以"极低成本训练"闻名全球的AI公司,突然融了这么多钱,你以为是要继续烧钱训模型?错。全部砸向推理基础设施。
为什么会这样?
你看,DeepSeek V4在全球上线后,日Token使用量暴涨。智谱的GLM-5.2出海后,一周内API调用量飙升27倍。这些模型走红之后,面临一个最现实的问题——每个用户问你一个问题,你都得算一遍。而每算一遍,都要烧钱。
机构数据显示,在AI大模型的生产环境中,推理环节占了总计算成本的80%-90%。训练几百万美元一次就够了,推理是每天、每秒都在烧。
用英伟达的H100去做推理?好比开着法拉利去菜市场买菜——性能确实强,但成本和功耗高得离谱。专用推理芯片(ASIC)把训练用的冗余电路全部砍掉,能效比直接翻几倍。这就是为什么Google有TPU、AWS有Inferentia、OpenAI在做"Jalapeno"芯片——所有人都在往同一条路上走。
DeepSeek和智谱,不过是在这条路上跟上了全球第一梯队。
二、推理vs训练:算力需求的结构性翻转
我经常跟做服务器导购的朋友说一句话:判断一个技术方向值不值得跟进,就看它的算力流向了哪里。
2023年,全球AI算力的80%用于训练大模型。到了2026年,这个比例完全倒过来了——推理算力消耗已经是训练的5倍以上。
Trendforce预测,2026年ASIC(专用推理芯片)的增长率将达到44.6%,而GPU只有16.1%。彭博行业研究预测,到2033年定制AI芯片市场规模将达到1180亿美元。
这意味着什么?
对整个服务器行业来说,游戏规则变了。
以前你买服务器,看CPU主频、核心数、内存大小就够了。现在你买服务器,要关心它有没有NPU(神经网络处理单元)、推理吞吐量是多少TOPS、显存带宽够不够喂大模型、有没有做算子加速的定制优化。
这不是锦上添花,这是根本性的变化。
三、推理服务器和普通服务器的本质区别
很多人问我:耗子叔,我就想跑个AI服务,买台普通的云服务器不行吗?
行,但你得想清楚成本账。
一台2核4G的普通VPS,跑个网站绰绰有余。但如果你想跑一个7B参数量的大模型做推理,先不说能不能跑动,光是把模型参数加载到内存就需要14GB以上的显存。普通服务器呢?跑一个推理请求可能要等几十秒,用户体验就是灾难。
推理服务器(或者叫AI推理云服务器)和普通服务器的本质区别,我给你列个表:
| 维度 | 普通服务器 | AI推理服务器 |
|---|---|---|
| 核心算力 | CPU | GPU/NPU/TPU |
| 内存要求 | 4-32GB | 16-256GB+ 高带宽显存 |
| 关键指标 | 主频、核心数 | TOPS、显存带宽 |
| 适合场景 | Web应用、数据库 | 大模型推理、AI应用 |
| 成本 | 低 | 相对高,但单次推理成本低 |
| 能耗 | 一般 | 高,需要更好的散热 |
所以结论很简单:如果你只是建站、跑脚本、做代理,普通VPS足够了。但如果你想做AI应用——不管是ChatGPT类对话机器人、AI翻译、AI绘图——你需要的是一台推理优化的云服务器。
四、2026年买AI推理服务器,你需要注意的三件事
作为服务器导购的同行,我给几条实在的建议:
1. 不要盲目追H100、A100
英伟达的高端GPU现在什么价格?你猜。一个H100在灰市上的价格已经被炒到3-4万美元以上。
坦白说,对你的大部分客户来说,根本不需要这个级别的算力去跑推理。企业的推理场景中,80%以上的需求用中端推理卡甚至纯CPU就能搞定。不要为了面子买你用不上的算力。
2. 关注国产推理芯片的进展
DeepSeek和智谱造芯这件事,最大的影响不是他们自己,而是带动了整个国产AI硬件生态的成熟。华为昇腾、寒武纪、地平线等国产芯片厂商,在推理场景上的性价比已经相当能打了。
你说国产芯片和英伟达的差距?确实存在,尤其是单卡性能。但在推理场景中,规模化的性价比和供应链的稳定性,远比纸面参数更重要。你信不信,一个稳定的国产推理集群,长期来看比靠灰市渠道买来的H100要靠谱得多?
3. 算力租赁比自购更香
这也是2026年最大的变化之一。
Meta传出出租多余AI算力的消息、各大云厂商都在推出按量计费的推理实例。对于大多数中小团队和个人开发者来说,租推理服务器比买推理服务器划算太多了。
为什么?因为推理的负载不是恒定的。白天用户多,晚上用户少。如果你自己买服务器,你只能按照峰值负载去配置,闲时算力全部浪费。而按量计费的推理实例,高峰时弹性扩容,低峰时缩容,成本直接砍半。
你不需要拥有一座发电厂,你只需要一个稳定便宜的插座。 是不是这个道理?
五、总结
DeepSeek和智谱秘密造芯这件事,表面上看是AI公司的硬件扩张。本质上传递了一个清晰到不能再清晰的信号——
AI行业正在从"拼训练"转向"拼推理",而推理算力,将是未来三年服务器市场最大的增长点。
对你的客户来说,这意味着:
- 如果你的业务涉及AI应用,是时候把推理服务器纳入考虑了
- 选型时,优先关注推理吞吐量和显存带宽,而不是单纯看CPU主频
- 用好算力租赁,比砸钱买硬件更聪明
对整个行业来说,DeepSeek和智谱这一步棋,是在为国产AI算力生态打地基。虽然芯片从设计到流片需要两年以上的时间,但这条路必须走。
供你参考。
(全文完)
评论 (0)