摘要:随着 M6 Mac mini、国产 NPU 推理节点普及,端侧与数据中心 AI 业务对 PCIe 通道数量、P2P 直传、多设备并发的需求持续提升。PCIe 交换芯片作为算力硬件的互联枢纽,很多整机项目的性能瓶颈并非 NPU 算力,而是 PCIe 总线通道不足、带宽争抢。本文基于 IX9104 硬件能力,分析当前 AI 推理、私有化部署、边缘智能业务中存在的互联痛点,梳理适配场景、技术边界与选型要点。 标签:#PCIe5.0 #IX9104 #AI 推理服务器 #国产算力 #硬件互联
0 前言
近期苹果更新 M6/M5 Pro 版本 Mac mini,重点强化本地端侧大模型运行能力,端侧 AI 推理逐步从云端下沉到单机硬件设备。不管是 x86 平台服务器、ARM 国产算力节点,还是高性能端侧主机,在做多加速卡、向量数据库 SSD、高速网卡同时接入时,普遍遇到主控原生 PCIe 通道资源不足的工程难题。
很多项目 NPU 算力充足,但受限于 CPU 输出 PCIe lane 数量,无法同时挂载多块 NPU、多路 NVMe 向量库盘与高速网卡,出现推理时延抖动、知识库检索慢、卡间数据交互开销高等现象。此时 PCIe5.0 交换芯片就用来解决通道扩展、流量调度、多设备高速互联问题。
重要说明:IX9104 为 PCIe 交换芯片,不参与模型计算,只负责 PCIe 域的数据转发交换,大模型推理吞吐上限仍然由 NPU 算力、显存、推理框架决定。
1 IX9104 核心硬件参数
IX9104 是国产 104‑Lane PCIe5.0 全非阻塞交叉交换器件,单通道速率 32GT/s,总双向带宽 1664Gbps,最多可配置 26 组端口,支持 x1/x2/x4/x8/x16 灵活 lane 拆分配置。
关键能力:
- 全非阻塞交换架构,典型转发延迟约 115ns;
- 支持硬件 P2P 对等传输,加速卡之间数据交互可绕过 CPU,降低多卡推理时延;
- 支持 NTB 非透明桥,实现多主机跨域互联;
- 工业宽温‑40℃~+105℃,适配服务器与密闭边缘机箱;
- 固件、驱动全国产自研,适配 openEuler、麒麟、统信等系统,对国产 NPU 做固件适配优化;
- PIN‑TO‑PIN 兼容主流进口同规格器件,可直接做 BOM 替换,降低整机硬件改板成本。
2 当前 AI 服务硬件的典型互联痛点
在大模型推理、Agent 智能体、RAG 知识库业务落地中,硬件侧经常遇到以下工程问题:
- 高密度推理节点通道缺口:4‑8 卡 NPU 推理服务器,CPU 原生 PCIe5.0 lane 有限,无法同时接多片 NPU、多路 NVMe SSD 向量库、400G 网卡,只能缩减加速卡数量或者减少高速存储盘位,牺牲整机业务能力。
- 多卡 MoE 推理 CPU 开销过高:MoE 模型专家分片部署在多块 NPU,卡间大量数据交互全部经过 CPU 内存转发,占用大量 CPU 资源,拉高推理延迟。
- 边缘私有化整机硬件冲突:本地私有化部署 RAG、Agent,需要 NPU 算力、知识库高速存储、视频采集卡、网卡同时工作;边缘整机机箱密闭散热环境苛刻,主控通道紧张,带宽抢占导致推理卡顿。
- 信创项目供应链与合规约束:部分政企、金融行业 AI 项目,要求核心器件国产化比例,进口交换芯片缺少国密能力,无法满足总线流量安全要求。
- 混合异构算力组网:一台节点内部存在不同厂商国产 NPU,需要做异构协同推理,对 PCIe 交换的固件兼容性、带宽调度能力提出更高要求。
3 IX9104 在 AI 服务中的应用场景
3.1 高密度 AI 推理服务器(4‑8 卡国产 NPU 推理节点)
面向 RAG 知识库、Agent 智能体、MoE 大模型私有化推理业务。
- 业务特征:单节点部署多片国产 NPU,搭配多路 PCIe5.0 NVMe SSD 存放向量数据库,外接 400G 网卡对外提供 API 推理服务。
- 芯片价值:扩展 PCIe5.0 高速端口,解决 CPU 原生 lane 不足;开启硬件 P2P 直传,NPU 之间数据传输绕过 CPU,降低 MoE 模型专家交换带来的 CPU 开销,稳定多卡并发推理时延。
- 适用业务:企业私有大模型服务、行业知识库检索、批量离线推理任务集群。
3.2 边缘私有化 AI 智能主机
工厂、园区、政企内网场景,模型与知识库完全本地运行,数据不出域。
- 业务特征:密闭机箱 7×24 小时连续运行,同时接入 NPU 加速卡、高速知识库 SSD、视频采集卡、千兆 / 25G 网卡。机箱内部温度波动大,对器件宽温可靠性有要求。
- 芯片价值:宽温规格适配密闭边缘机箱;动态带宽调度,区分模型权重加载、向量检索、推理计算不同业务流量,避免多外设抢占总线带宽造成推理抖动;端口硬件隔离、支持热插拔,提升整机可靠性。
- 适用业务:本地行业 Agent、厂区质检大模型、园区视频研判、内网企业知识库系统。
3.3 信创混合算力一体机
党政、金融、能源行业信创 AI 项目。
- 业务特征:整机要求国产化器件占比达标,需要支持多主机 NTB 互联,总线传输数据需要安全加密。
- 芯片价值:全国产固件驱动,内置国密硬件加密能力,PCIe 总线流量硬件加密,不需要额外外挂加密卡;NTB 非透明桥支持多主机算力池组网;硬件引脚兼容进口器件,原有整机 PCB 尽量少改动完成国产化替换,缩短项目研发周期。
3.4 原型验证与硬件开发平台
面向 AI 服务器硬件研发,整机前期原型调试。
- 业务特征:硬件工程师需要快速验证多 NPU 协同、P2P 传输、向量存储并发读写等方案。
- 芯片价值:配套评估板提供 MCIO、PCIe Slot、M.2 等多种物理接口,快速完成端口拆分、P2P、NTB 功能验证,缩短国产 AI 整机原型迭代周期。
4 选型边界与工程注意事项
- 算力规模边界:IX9104 定位高密度 8 卡级别 AI 整机;如果是 2‑4 卡中端边缘整机,可优先考虑 PCIe4.0 的 IX8024,避免 PCIe5.0 带来 BOM 成本冗余。
- 性能认知边界:交换芯片解决的是通道扩展、转发调度,不能提升 NPU 本身算力,模型推理性能瓶颈依然优先排查 NPU、显存、推理框架参数。
- 固件适配:使用国产 NPU 平台,需要确认交换芯片固件版本与 NPU 驱动、操作系统版本匹配,P2P 功能需要整机 BIOS、驱动联合配置开启。
- PCB 设计:PCIe5.0 信号速率高,硬件设计时需要严格遵守高速 PCB 阻抗、长度约束,否则会出现链路降速、不稳定问题。
5 总结
端侧大模型、私有化 Agent、RAG 知识库业务持续落地,越来越多 AI 整机的瓶颈从 NPU 算力转移到高速互联层面。IX9104 这类国产 PCIe5.0 交换芯片,核心价值就是补齐整机 PCIe 通道缺口,优化多加速卡协同的数据交互路径,同时满足信创项目国产化、硬件安全的硬性要求。
在整机方案设计阶段,硬件架构师就需要评估 CPU 原生 PCIe lane 资源,预判多 NPU、向量存储、高速网卡同时接入时的通道压力,提前把 PCIe 交换器件纳入方案评估,减少后期整机性能返工。