今天 Mozilla 发布了 2026 年《开源 AI 现状报告》,里面有一个数据让我盯了很久——
GPT-4 级别模型的 API 价格,从 2022 年末的每百万 Token 20 美元,跌到了 2025 年 12 月的 0.40 美元。
36 个月,跌了 98%,50 分之一。这是什么概念?互联网时代带宽价格下降都没这么猛。
更刺激的是,OpenRouter 上 Top 5 的模型全是开源的。DeepSeek V4 Flash 一个月吃掉 18.4T Tokens,小米 Mimo-V2.5 吃 14.9T,腾讯 Hy3 Preview 吃 14.8T。开源模型不仅在追平闭源,用量上已经反超了。
老实说,看到这个数据我第一反应不是 "API 真便宜",而是——
"那我自己买台服务器部署模型,是不是变成冤大头了?"
这篇文章我就把这件事掰开揉碎讲清楚。
数据中心里的服务器矩阵——API 价格暴跌后,自建服务器还是不是好选择?
目录
- 一、API 价格跌到什么程度了?
- 二、自己买台服务器跑模型,到底要花多少钱?
- 三、API vs 自建:算一笔明白账
- 四、什么情况下自建服务器依然香?
- 五、如果你决定自建,VPS 怎么选?
- 六、写给最后
一、API 价格跌到什么程度了?
先看数据。
Mozilla 这份报告拉了一条非常恐怖的曲线。我直接说结论:
| 时间 | 每百万 Token 价格 | 跌了多少 |
|---|---|---|
| 2022 年末 | $20.00 | — |
| 2023 年末 | ~$5.00 | 跌 75% |
| 2024 年末 | ~$1.50 | 跌 92.5% |
| 2025 年 12 月 | $0.40 | 跌 98% |
你没看错。当年 GPT-4 刚出的时候,调一次 API 烧钱烧得心里发虚。现在呢?同样级别的模型,成本只有当年的一包烟钱。
而且注意,这不只是闭源模型的降价。开源模型也在跟着卷。DeepSeek V4 Flash 已经是全球 API 调用量第一的模型,百万 Token 的价格甚至比 GPT-4 级别的闭源模型还要便宜一个数量级。
你看,技术圈里一直有人在喊 "开源追上闭源了",以前我总觉得有点夸张。但这组数据摆在这儿,由不得你不信。
二、自己买台服务器跑模型,到底要花多少钱?
好,现在来看另一边。
假设你想自己部署一个 7B 参数的模型(DeepSeek V4 Flash 这个级别的),你需要什么配置?
我直接给一个最小可行配置:
- GPU 云服务器 / 独服:至少 1 张 RTX 4090(24GB 显存)或 A10(24GB)
- 内存:32GB+
- 存储:200GB+ SSD
- 带宽:5Mbps+(面向生产环境至少要 50Mbps)
现在看价格:
| 方案 | 月成本(估算) | 说明 |
|---|---|---|
| 国内 GPU 云服务器(包月) | ¥3,000 - ¥8,000/月 | 4090 或 A10,带宽另算 |
| 海外 GPU 云服务器(按小时) | ~$0.5-1.5/小时 | 按需使用,长期用不如包月 |
| 自购硬件托管 | ¥30,000+ 一次性 + ¥1,000+/月托管 | 适合重度用户 |
| 轻量 VPS + API 混合 | ¥100-500/月 | 只做推理转发,不部署模型 |
这只是硬件。你还要算:
- 电力成本:一张 4090 满载 450W,一天 10 度电,一年 ¥3,000+
- 带宽成本:对外提供服务,带宽是持续支出
- 维护时间:模型更新、环境配置、故障排查——你确定自己有时间搞?
- 模型迭代:你部署的是 V4 Flash,下个月 V5 出来了,你追不追?
三、API vs 自建:算一笔明白账
好,最核心的问题来了。
假设你每天处理 1000 万 Token(一个中型应用的水平),我们来算账:
用 API 方案
DeepSeek V4 Flash API 价格 ≈ $0.15/百万 Token
日费用 = 1000 万 × $0.15 = $1.50
月费用 = $45 ≈ ¥330
年费用 ≈ ¥4,000
不用操心运维,不用关心 GPU 驱动版本,不用半夜爬起来修 CUDA 报错。
自建方案(GPU 云服务器)
GPU 服务器月租 ≈ ¥5,000(含带宽)
年费用 = ¥60,000
差距:15 倍。
你信不信,我算到这的时候自己都愣了一下。API 现在是真的便宜。
试想一下,如果你是一个独立开发者或者小团队,每个月 ¥330 的 API 费用 vs ¥5,000 的服务器费用,这选择题太难吗?
AI 模型的成本决策——什么时候该用 API,什么时候该自建?
四、什么情况下自建服务器依然香?
但是——对,这里有个"但是"——有些事情,API 永远干不了,或者干起来比自建更贵。
我列几个自建服务器依然有优势的场景:
1. 数据隐私敏感
老实说,这是最大的理由。
你把用户数据通过 API 传到第三方,对方能看到什么?条款里怎么写?数据会不会被用于训练?这些问题是灰色地带。
如果你做的是医疗、金融、企业内部知识库这类场景,数据出墙本身就是红线。 这时候自建不是选择题,是必答题。
2. 高吞吐 + 低延迟
API 有网络延迟。从上海到美国西海岸至少 100ms+,加上排队、序列化反序列化,一次推理轻松 300ms+。
如果你需要实时交互(聊天机器人、语音助手、实时翻译),自建服务器的延迟优势是 API 给不了的。
你看,腾讯和阿里的大模型都是自己部署的——不是因为他们买不起 API,而是延迟上受不了。
3. 定制化需求
API 给你的是"黑盒"。你能调参数,但不能改模型结构。
但如果你要做 fine-tune、做 RAG、做 Agent 编排,自建服务器的灵活度是 API 没法比的。你可以自己控制推理策略,自己优化显存分配,甚至自己做模型量化。
这不香吗?
4. 大规模推理
当月调用量超过 5 亿 Token 级别时,自建服务器的边际成本就开始低于 API 了。
大致分水岭在这里:
月调用量 < 1 亿 Token → 无脑 API
月调用量 1-10 亿 Token → 混合方案
月调用量 > 10 亿 Token → 可以考虑自建
五、如果你决定自建,VPS 怎么选?
好,如果你决定走自建路线,我直接给几条建议,不带虚的。
1. 先从小规格起步
别上来就租 A100 80G 的机器,¥30,000 一个月肉疼。先从 4090 或 A10 起步,跑 7B 级别的模型完全够用。
2. 选带 GPU 的云服务器,而不是自己买硬件
自己买 4090 一张 ¥15,000+,加上主板电源机箱,两万起步。而且噪音大、散热难搞、断电风险自己扛。国内厂商的 GPU 云服务器虽然不便宜,但至少 7×24 有人帮你看着。
3. 关注显存,而不是算力
很多人选 GPU 第一眼看 TFLOPS,这是典型的外行看热闹。推理场景下,显存大小直接决定你能跑多大的模型。7B 模型 FP16 要 14GB,加上 KV Cache 和 overhead,24GB 起步比较稳。
4. 带宽别抠
用 API 的时候你不在乎带宽,因为那是服务商的事。自建就不一样了,你对外提供服务,带宽不够就是灾难。建议至少 10Mbps 起步,面向生产环境 50-100Mbps。
5. 考虑混合方案
这是我个人最推荐的做法——
- 高频、低延迟的核心链路:自建,保证体验可控
- 低频、非核心的调用:走 API,省成本
- 冷备和模型测试:用按量付费的 GPU 实例
你会发现,混合方案实际上能让你的总成本降到纯自建的 1/3 到 1/5,同时保留核心场景的控制权。
六、写给最后
回到开头的问题:API 价格跌了 98%,自建服务器还划算吗?
我的答案是:分场景。
- 如果你是一个个人开发者、小团队,做的是常规的文本生成、对话、内容总结——API 现在是真的香,别纠结,直接用。
- 如果你处理的是敏感数据、需要低延迟、或者调用量大到千万级——自建服务器依然是刚需,但要做好成本控制。
- 最优解往往不是二选一,而是混搭——关键场景自建保质量,非关键场景 API 保成本。
(全文完)
评论 (0)