按场景选型,而不是按品牌
国产算力卡选型最容易犯的错误是拿参数表横向比大小。实际上不同技术路线面向的场景差异很大,选错了即使峰值算力更高也跑不出效果。
| 场景 | 关键指标 | 优先考虑 |
|---|---|---|
| 大模型训练 | 显存容量、片间互联带宽、集群扩展效率 | 训推一体卡,关注万卡集群能力 |
| 大模型推理 | 显存带宽、单卡成本、TCO | 高性价比推理卡,优先 HBM 显存 |
| 边缘 / 端侧 | 功耗、稳定性、体积 | 低功耗半高卡,被动散热 |
| AI + 图形渲染混合 | 同时支持张量与光追 | 兼顾图形与计算的通用卡 |
我们实际供货产品的选型对照如下,可按项目场景与预算组合:
| 品牌 | 型号 | 定位 | 适用场景 |
|---|---|---|---|
| 华为昇腾 | Atlas 300I Duo / 910B | 训推一体 | 大模型训练、政务与金融信创 |
| 海光 | DCU K100 / Z100 | 通用 GPGPU | CUDA 迁移、AI 推理、图形渲染 |
| 寒武纪 | 思元 370 / 590 | 推理优化 | 中小模型推理、边缘与端侧 |
| 天数智芯 | 天垓 100 / 智铠 | 通用算力 | 训练推理混合负载 |
三条技术路线
1. 专用 AI 架构(华为昇腾) 全栈自主可控,集群协同最强,信创与政务金融项目强制适配,万亿参数大模型训练能力最成熟。代价是 CUDA 代码迁移成本较高。
2. 通用 GPGPU(海光、天数智芯、摩尔线程、壁仞) CUDA 兼容性好,原有英伟达代码几乎零改动,图形与 AI 兼顾。超大规模万卡集群生态不如昇腾。
3. MLU / XPU(寒武纪、昆仑芯) 推理吞吐极致优化,中小模型成本最低。万亿参数全量训练是短板。
上述三条技术路线的分类适用于我们供货的产品线:华为昇腾覆盖专用 AI 架构路线,海光与天数智芯覆盖通用 GPGPU 路线,寒武纪覆盖推理优化路线,可按项目实际负载与信创要求组合供货。
选型避坑
- FP8 算力高不代表整体性能好:FP8 仅适用于推理,训练需看 FP16/BF16。部分产品标称 FP8 高但 FP16 只有标称值一半,无法用于训练
- 显存不是越大越好:要看显存类型(HBM vs GDDR)与带宽,34B 以上模型并发时 GDDR 会成为瓶颈
- 别用训练卡跑纯推理:能效大幅浪费,TCO 显著上升
- 算总拥有成本而非采购价:以 100 卡集群、5 年周期测算,电费、运维与故障损失往往与硬件采购成本同量级
我们可提供主流卡型的实测数据与 POC 测试报告(含训练吞吐、推理延迟与功耗对比),常规型号供货周期 1-2 周,国产化整机与集群方案视配置 2-4 周交付。