,重点融入大规模部署下AI基础设施的各类关联性问题:数据中心网络拓扑(Fat-Tree、Clos架构)、服务器规模(千卡/万卡集群)、组网架构(InfiniBand/RoCE v2)、存储规模与冷热分层(NVMe SSD + HDD + 对象存储)、CPU/GPU/DPU芯片(AMD EPYC / NVIDIA H100/B200 / Intel IPU)、RAID卡与RAID模式(硬件RAID 0/5/6/10、软件RAID如mdadm、ZFS RAID-Z)、内存(HBM带宽、DDR5容量、NUMA亲和性)、缓冲(ring buffer、page cache)、队列(IB send queue、GPU stream)、调度(GPU kernel launch、分布式训练调度器如Slurm/Kubernetes)、存储IO(随机/顺序读写、IOPS、吞吐)、数据库/文件系统(Lustre、GPFS、Ceph、HDFS、PostgreSQL、Redis)等。
编号 | 系统 | 模块·组件·多模块调用与交互·其他 | 工程问题(≥2000字,含跨学科数学物理约束、典型参数数值及AI infra基础设施关联) | 关联知识 |
|---|---|---|---|---|
1731 | 图上的图神经网络与差分隐私(DP on Graphs) | 在GNN训练中注入噪声保护节点隐私(边隐私、节点特征 |