news 2026/8/30 7:23:48

大模型时代大模型服务器配置清单选型研究

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
大模型时代大模型服务器配置清单选型研究

说大模型时代之前,说一下非大模型时代的服务器,非AI应用的话,主要是存储服务器和应用服务器,包括大数据时代也主要是存储服务器和计算服务器,存储、应用、计算服务器的特点主要是CPU、内存、磁盘这三类指标够大就OK,尤其内存、磁盘,多线程的应用对CPU也有要求。进入大模型时代后,动辄部署几个、十个二十个大模型或小模型,都是需要算力的,需要GPU卡的,而GPU卡是相当传统有些小贵的,如何合理规划算力和服务器配置也很重要了,涉及到钱了、涉及ROI划不划算了。

应用服务器和存储服务器按业务量去估算,估算3-5年,CPU、内存、硬盘的差不多够大,满足未来3-5年业务增长就ok,比较容易配置选型。如下述配置清单:

序号

名称

配置

数量

用途

1

存储服务器

CPU≥64核,主频≥2.1GHz,内存≥512GB,系统存储≥480G SSD,数据存储≥96TB,单盘不小于8TB,网络端口≥4个千兆电口+4个万兆光口;

6台

提供存储空间。

2

应用服务器

CPU≥64核,主频≥2.1GHz,内存≥512GB,系统存储≥480G SSD,数据存储≥96TB,单盘不小于8TB,网络端口≥4个千兆电口+4个万兆光口;

5台

提供应用服务。

根据业务量适当调整存储服务器、应用服务器配置和台数,如内存、硬盘、数量。

大模型时代的大模型服务器包括模型训练服务器、推理服务器,不同的模型偏好的配置稍有不同,共同点都是需要算力支撑、需要GPU算力卡,包括多模态大模型。因为模型发展太快了,不能按3-5年进行估算,起码1-2年内没问题,后续根据业务发展情况选用更优秀的大模型和更高的算力。根据以往项目经验看,华为Atlas 910B4 64G NPU卡比Atlas 300I DUO PCIE卡表现更好一些、推理速度更快一些。以下是参考的配置:

1

模型训练服务器

CPU≥128核 ,主频≥2.6GHz,内存≥480G,

系统存储≥960GB SATA SSD,数据存储≥8TB,网络端口≥4个千兆电口+4个万兆光口;e

NPU卡:8*Ascend 910B HB内存64G;

60台

支持预训练、继续预训练、

全参数微调大模型

2

推理服务器

CPU≥48核,主频2.6GHz,内存≥24*64GB,系统存储≥2*960GB SATA SSD,数据存储≥4*3.84TB NVME SSD,

GPU卡:配置8*Atlas 300I DUO PCIE卡(96GB);网卡:配置板载4口GE*1+双口25GE*1

1台

Qwen2.5-72B-Instruct1

3

推理服务器

CPU≥48核,主频2.6GHz,内存≥24*64GB,系统存储≥2*960GB SATA SSD,数据存储≥4*3.84TB NVME SSD,

GPU卡:8*Atlas 300I DUO PCIE卡(96GB),网卡:配置板载4口GE*1+双口25GE*1

1台

RYS-Llama3.1-Large

4

推理服务器

CPU≥48核,主频2.6GHz,内存≥24*64GB,系统存储≥2*960GB SATA SSD,数据存储≥2*3.84TB NVME SSD,GPU卡:8*Atlas 910B4 64G NPU卡,互联带宽392GB/s,网卡:配置板载4口GE*1+自带8*200G NPU直出光口,双口25GE*1

1台

Mistral-Large-Instruct-2407

5

推理服务器

CPU≥48核,主频2.6GHz,内存≥24*64GB,系统存储≥2*960GB SATA SSD ,数据存储≥4*3.84TB NVME SSD,GPU卡: 8*Atlas 300I DUO PCIE卡(96GB),网卡:配置板载4口GE*1+双口25GE*1

1台

Smaug-72B

6

推理服务器

CPU≥48核,主频2.6GHz,内存≥16*64GB,系统存储≥2*960GB SATA SSD ,数据存储≥2*3.84TB NVME SSD,GPU卡:配置8*Atlas 910B4 64G NPU卡,互联带宽392GB/s,网卡:配置板载4口GE*1+自带8*200G NPU直出光口,双口25GE*1

1台

InternVL

一般情况下,910B卡通过nvidia-smi查看GPU使用情况,300I DUO卡通过npu-smi info查看GPU使用情况。一般一台GPU服务器配置8块卡,八块卡怎么分配规划保证利用率最高、算力最大化利用也很重要。推理模型根据参数量进行估算,如Qwen3-32B最低2张卡,条件允许的话可以4张卡及以上,推理的速度会更快一些,当然Qwen3-72B参数规模就得8张卡了,算力太低的话,大模型根本跑不起来。如下是我们之前一个项目的GPU规划表,可以参考:

模型规划

卡数量

Qwen3-32B

2张卡

Qwen2.5-VL-32B

2张卡

文生视频

1张卡

文生图

1张卡

图生文

1张卡

视频转文字

1张卡

语音合成

0张卡(轻量化模型只用cpu)

或者

模型规划

卡数量

Qwen3-32B

3张卡

文生视频

1张卡

文生图

1张卡

图生文

1张卡

视频转文字

1张卡

语音合成

1张卡

或者条件允许的情况下,把推理大模型跟多模态大模型分开部署,推理模型使用4-6张卡,多模态大模型每个小模型使用2张卡,充分利用算力,把性能提上去,利益最大化。参与的过往的项目中,使用的多模态大模型主要有:文生图:Qwen/Qwen-Image、图生文:Qwen/Qwen2.5-VL-7B-Instruct、文图生视频:Wan-AI/Wan2.2-TI2V-5B、视频转文字:Whisper-large-v3、语音合成模型(文本转语音):IndexTTS-2,推理大模型使用Qwen3-32B大模型。当然Qwen72B参数大模型需要的配置更高。参考最低配置如下:

设备编号

配置

部署模型

模型类型

所需 NPU 卡数

设备 1

规格:4U机架式服务器;
2、CPU:配置4颗HUAWEI Kunpeng 920 5250,单颗物理核数48核,主频2.6GHz;
3、内存:配置8*64GB;
4、硬盘:配置2块480GB SATA SSD系统盘,5块3.84TB NVME SSD数据盘;
raid卡:SP686C-M-16i 4G RAID0,1,5,6,10,50,60,4GB Cache
5、NPU卡:配置8*Ascend 910B 64G-HCCS
6、物理网卡:1*4*25GE(业务网)+4张 8*200GRCEE V2(参数网);
7、电源:配置4*2600W白金交流电源;2+2冗余
(910B芯片 320TFLOPS FP16,640TOPS INT8 ,显存为64GB HBM2e,显存带宽400GB/s)

Qwen2.5-72B-Instruct1

72B 大模型

4 卡

RYS-Llama3.1-Large

等效 72B 大模型

4 卡

设备 2

规格:4U机架式服务器;
2、CPU:配置4颗HUAWEI Kunpeng 920 5250,单颗物理核数48核,主频2.6GHz;
3、内存:配置8*64GB;
4、硬盘:配置2块480GB SATA SSD系统盘,5块3.84TB NVME SSD数据盘;
raid卡:SP686C-M-16i 4G RAID0,1,5,6,10,50,60,4GB Cache
5、NPU卡:配置8*Ascend 910B 64G-HCCS
6、物理网卡:1*4*25GE(业务网)+4张 8*200GRCEE V2(参数网);
7、电源:配置4*2600W白金交流电源;2+2冗余
(910B芯片 320TFLOPS FP16,640TOPS INT8 ,显存为64GB HBM2e,显存带宽400GB/s)

Mistral-Large-Instruct-2407

等效 72B 大模型

4 卡

Smaug-72B

72B 大模型

4 卡

设备 3

规格:4U机架式服务器;
2、CPU:配置4颗HUAWEI Kunpeng 920 5250,单颗物理核数48核,主频2.6GHz;
3、内存:配置8*64GB;
4、硬盘:配置2块480GB SATA SSD系统盘,5块3.84TB NVME SSD数据盘;
raid卡:SP686C-M-16i 4G RAID0,1,5,6,10,50,60,4GB Cache
5、NPU卡:配置12*Ascend 910B 64G-HCCS
6、物理网卡:1*4*25GE(业务网)+4张 8*200GRCEE V2(参数网);
7、电源:配置4*2600W白金交流电源;2+2冗余
(910B芯片 320TFLOPS FP16,640TOPS INT8 ,显存为64GB HBM2e,显存带宽400GB/s)

Qwen2.5-VL-7B-Instruct

7B 视觉模型

2 卡

ModelTC/Qwen-Image-Lightning
funasr

轻量视觉模型

2 卡

InternVL 14B

视觉大模型

2 卡

Wan2.2-TI2V-5B

跨模态模型

2 卡

大模型平台

Whisper-large-v3

语音识别翻译模型(视频转文本)

2 卡

IndexTTS-2

语音合成模型(文本转语音)

2 卡

条件允许不差钱的情况下,推荐配置如下:

设备编号

配置

部署模型

模型类型

所需 NPU 卡数

设备 1

规格:4U机架式服务器;
2、CPU:配置4颗HUAWEI Kunpeng 920 5250,单颗物理核数48核,主频2.6GHz;
3、内存:配置16*64GB;
4、硬盘:配置2块480GB SATA SSD系统盘,5块3.84TB NVME SSD数据盘;
raid卡:SP686C-M-16i 4G RAID0,1,5,6,10,50,60,4GB Cache
5、NPU卡:配置8*Ascend 910B 64G-HCCS
6、物理网卡:1*4*25GE(业务网)+4张 8*200GRCEE V2(参数网);
7、电源:配置4*2600W白金交流电源;2+2冗余
(910B芯片 320TFLOPS FP16,640TOPS INT8 ,显存为64GB HBM2e,显存带宽400GB/s)

Qwen2.5-72B-Instruct1

72B 大模型

8 卡

设备 2

规格:4U机架式服务器;
2、CPU:配置4颗HUAWEI Kunpeng 920 5250,单颗物理核数48核,主频2.6GHz;
3、内存:配置16*64GB;
4、硬盘:配置2块480GB SATA SSD系统盘,5块3.84TB NVME SSD数据盘;
raid卡:SP686C-M-16i 4G RAID0,1,5,6,10,50,60,4GB Cache
5、NPU卡:配置8*Ascend 910B 64G-HCCS
6、物理网卡:1*4*25GE(业务网)+4张 8*200GRCEE V2(参数网);
7、电源:配置4*2600W白金交流电源;2+2冗余
(910B芯片 320TFLOPS FP16,640TOPS INT8 ,显存为64GB HBM2e,显存带宽400GB/s)

RYS-Llama3.1-Large

等效 72B 大模型

8 卡

设备 3

规格:4U机架式服务器;
2、CPU:配置4颗HUAWEI Kunpeng 920 5250,单颗物理核数48核,主频2.6GHz;
3、内存:配置16*64GB;
4、硬盘:配置2块480GB SATA SSD系统盘,5块3.84TB NVME SSD数据盘;
raid卡:SP686C-M-16i 4G RAID0,1,5,6,10,50,60,4GB Cache
5、NPU卡:配置8*Ascend 910B 64G-HCCS
6、物理网卡:1*4*25GE(业务网)+4张 8*200GRCEE V2(参数网);
7、电源:配置4*2600W白金交流电源;2+2冗余
(910B芯片 320TFLOPS FP16,640TOPS INT8 ,显存为64GB HBM2e,显存带宽400GB/s)

Mistral-Large-Instruct-2407

等效 72B 大模型

8 卡

设备 4

规格:4U机架式服务器;
2、CPU:配置4颗HUAWEI Kunpeng 920 5250,单颗物理核数48核,主频2.6GHz;
3、内存:配置16*64GB;
4、硬盘:配置2块480GB SATA SSD系统盘,5块3.84TB NVME SSD数据盘;
raid卡:SP686C-M-16i 4G RAID0,1,5,6,10,50,60,4GB Cache
5、NPU卡:配置8*Ascend 910B 64G-HCCS
6、物理网卡:1*4*25GE(业务网)+4张 8*200GRCEE V2(参数网);
7、电源:配置4*2600W白金交流电源;2+2冗余
(910B芯片 320TFLOPS FP16,640TOPS INT8 ,显存为64GB HBM2e,显存带宽400GB/s)

Smaug-72B

72B 大模型

8 卡

设备 5

规格:4U机架式服务器;
2、CPU:配置2颗HUAWEI Kunpeng 920 5250,单颗物理核数48核,主频2.6GHz;
3、内存:配置16*64GB;
4、硬盘:配置2块480GB SATA SSD系统盘,5块3.84TB NVME SSD数据盘;
raid卡:SP686C-M-16i 4G RAID0,1,5,6,10,50,60,4GB Cache
5、NPU卡:配置4*Ascend 910B 64G-HCCS
6、物理网卡:1*4*25GE(业务网)+4张 8*200GRCEE V2(参数网);
7、电源:配置4*2600W白金交流电源;2+2冗余
(910B芯片 320TFLOPS FP16,640TOPS INT8 ,显存为64GB HBM2e,显存带宽400GB/s)

Qwen2.5-VL-7B-Instruct

7B 视觉模型

2 卡

ModelTC/Qwen-Image-Lightning
funasr

轻量视觉模型

2 卡

大模型平台

设备 6

规格:4U机架式服务器;
2、CPU:配置4颗HUAWEI Kunpeng 920 5250,单颗物理核数48核,主频2.6GHz;
3、内存:配置16*64GB;
4、硬盘:配置2块480GB SATA SSD系统盘,5块3.84TB NVME SSD数据盘;
raid卡:SP686C-M-16i 4G RAID0,1,5,6,10,50,60,4GB Cache
5、NPU卡:配置16*Ascend 910B 64G-HCCS
6、物理网卡:1*4*25GE(业务网)+4张 8*200GRCEE V2(参数网);
7、电源:配置4*2600W白金交流电源;2+2冗余
(910B芯片 320TFLOPS FP16,640TOPS INT8 ,显存为64GB HBM2e,显存带宽400GB/s)

InternVL 14B

视觉大模型

4 卡

Wan2.2-TI2V-5B

跨模态模型

4 卡

Whisper-large-v3

语音识别翻译模型(视频转文本)

4 卡

IndexTTS-2

语音合成模型(文本转语音)

4 卡

经济条件一般的企业,可以选择有些轻量级的多模态模型,使用CPU卡,不用GPU节省开支,当然了推理大模型、推理服务器,模型的参数和算力硬件方面要重点关注考虑、重点加大投入了,保证项目使用方用户体验。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/30 8:07:00

Shapiro-Wilk与Shapiro-Francia检验:正态性检验原理与实战指南

简介:本资源是一份面向统计分析初学者与科研人员的正态性检验工具包,聚焦于小样本至中等样本(3≤n≤5000)下数据分布形态的严格检验问题,特别适用于假设检验前的数据预处理、回归残差诊断及非参数方法适用性评估等场景…

作者头像 李华
网站建设 2026/8/30 7:53:39

工厂和实体店用AI做推荐,有没有人试过?

前阵子跟几个朋友聊天,一个做设备加工的兄弟说了一件事挺郁闷的。 他说有个老客户给他介绍了一个新买家,结果人家在网上查了一圈,AI推荐了三家同行,独独没推荐他。买家还把截图发给他看:“老王,人家AI咋不推…

作者头像 李华
网站建设 2026/8/30 7:57:16

Tikhonov正则化与L曲线:病态反问题的稳定求解实战指南

简介:本资源是一套面向数学建模、反问题求解及机器学习初学者的Tikhonov正则化实践工具包,聚焦于病态线性系统求解中的过拟合抑制与正则化参数λ的科学选取问题。压缩包共12个MATLAB源文件(.m),总大小仅14KB&#xff0…

作者头像 李华
网站建设 2026/8/30 7:53:02

SAP ABAP增强重构:从Customer Exits到函数模块的架构优化实践

1. 项目概述:从“补丁”到“积木”的进化在SAP的ABAP世界里,Customer Exits(客户出口)是个老生常谈但又绕不开的话题。但凡做过几年SAP开发的顾问,谁没在SMOD、CMOD里翻找过可用的增强点呢?传统的Customer …

作者头像 李华
网站建设 2026/8/30 8:04:56

普通面经(中):从算法手撕到HR面的避坑指南

作为一个写过“普通面经(上)”的求职者,我原本以为面试这件事的焦虑峰值会在投简历阶段结束。真正走到“中”这个环节——算法手撕、项目拷问、系统设计、HR面——我才发现,最耗神的不是知识储备不够,而是“明明准备了…

作者头像 李华
网站建设 2026/8/30 7:00:10

二级域名分发系统源码详解:部署实践与二次开发指南

简介:在互联网业务快速扩张的背景下,域名管理成为站长和开发者绕不开的基础课题。二级域名作为主域名下的子资源,通过合理分发机制可以将无限个独立子域名按规则分配给不同站点、用户或业务场景。其核心原理是依赖域名池与分发规则引擎&#…

作者头像 李华