news 2026/8/14 3:39:30

国产芯片训出世界级大模型:从算力瓶颈到软硬件协同的破局之路

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
国产芯片训出世界级大模型:从算力瓶颈到软硬件协同的破局之路

1. 从“卡脖子”到“跑起来”:国产芯片与大模型的破局之路

今天早上,我的朋友圈和几个技术群被一条消息刷屏了:“DeepSeek V4 正式发布”。这本身并不稀奇,毕竟大模型迭代的消息隔三差五就有。但真正让圈内人,尤其是我们这些长期关注底层算力的人感到心头一震的,是紧随其后的那句定语——“用国产芯片训出世界级大模型”。这短短十几个字,背后蕴含的信息量,可能比模型参数本身还要庞大。它不仅仅是一个技术产品的发布,更像是一个标志性事件,宣告了一个我们期待已久、却又充满挑战的可能性,正在从实验室的论文和PPT里,一步步走向工程化的现实。

在过去几年里,我们谈论大模型,尤其是千亿、万亿参数级别的“世界级”模型时,几乎默认的语境就是英伟达的GPU集群。从Transformer架构的提出到GPT系列的每一次飞跃,背后都是海量A100、H100乃至最新的B200在提供澎湃算力。这形成了一个近乎垄断的生态:最先进的模型架构、最庞大的训练框架(如PyTorch)、最高效的通信库(如NCCL),都围绕着特定的硬件进行深度优化。对于任何想要挑战这个生态的后来者,尤其是使用不同架构的国产芯片,面临的不是“从60分做到90分”的优化问题,而是“从0到1”打通整个软硬件栈,并证明其能稳定、高效、规模化地完成极端复杂任务的系统性工程。

因此,当看到DeepSeek V4这样级别的模型宣称基于国产芯片训练完成时,我的第一反应不是“性能如何”,而是“怎么做到的?”。这背后需要克服的,远不止是芯片的峰值算力(TOPS)是否达标,更是一场涉及编译器、算子库、通信、存储、调度乃至算法本身协同设计的“硬仗”。它意味着,从芯片指令集到最终模型输出的整个链路,都必须被重新审视和深度定制。这对于整个国内AI基础设施产业来说,其示范意义和撬动效应,可能比单个模型刷榜更具价值。接下来,我们就深入拆解一下,要实现这样一个目标,究竟需要跨过哪些关键的技术门槛,以及DeepSeek V4的这次实践,可能为我们揭示了哪些可行的路径。

2. 国产芯片训大模型的核心挑战:不止于算力纸面数据

很多人一提到国产芯片,首先会去对比算力卡上的理论峰值性能,比如FP16/FP32/BF16的TFLOPS(每秒万亿次浮点运算)数据。这固然重要,但只是万里长征的第一步。在实际的大规模分布式训练场景中,决定最终训练效率和成本的,是一个复杂的系统性工程。国产芯片要真正扛起训练世界级大模型的重任,至少需要在以下四个维度上证明自己。

2.1 计算效率:从“峰值算力”到“有效算力”

芯片宣传的峰值算力,就像一辆跑车的最高时速,是在最理想、最简单的测试程序下跑出来的。而大模型训练,则像是在复杂的城市路况中进行F1比赛,充满了急弯、拥堵和频繁的起停。这里的关键在于“计算密度”和“内存带宽”的匹配。

大模型训练的核心计算是矩阵乘法(MatMul),尤其是针对Attention机制中的QKV投影和FFN层的大规模稠密矩阵运算。国产芯片的架构(如存算一体、特定矩阵计算单元)可能为此做了特殊优化。但问题在于,训练过程并非全是这种规整的计算。大量的激活函数(如GELU、SiLU)、Layer Normalization、Dropout等操作,虽然计算量相对较小,但访问内存的模式不规则,极易成为性能瓶颈。如果芯片的标量计算单元和内存子系统(包括片上缓存和HBM带宽)设计无法高效处理这些“零碎”计算,那么整体的有效算力就会大打折扣。

此外,混合精度训练(常用BF16/FP16存储,FP32进行累加)的支持是否完备、精度损失是否可控、自定义算子的开发便捷性如何,都直接影响算法工程师的调优空间和最终模型质量。

2.2 通信效率:万卡集群的“毛细血管”网络

训练一个千亿乃至万亿参数的模型,需要将计算任务拆分到成千上万张加速卡上。这些卡之间需要频繁地交换梯度、参数和激活值。因此,卡间互联的带宽和延迟,直接决定了分布式训练的扩展效率。

英伟达的NVLink和NVSwitch技术之所以成为事实标准,就是因为它们提供了远超PCIe的卡间直连带宽和极低的延迟。国产芯片集群通常采用基于以太网(RoCEv2/IB)或专用互联技术(如某些国产芯片的互联总线)。这里的挑战在于:

  1. 带宽与延迟:能否提供足够高的互联带宽(例如单端口200Gb/s以上)和微秒级的延迟,以支撑All-Reduce、All-Gather等集合通信操作的高效执行。
  2. 拓扑与路由:在万卡规模下,网络拓扑(如胖树、Dragonfly+)的设计和路由算法的优化至关重要,要避免热点和拥塞。
  3. 通信库优化:需要有一个类似于NCCL的、与硬件深度绑定的高性能通信库,能够智能地选择通信算法、进行流量控制和错误恢复。

如果通信成为瓶颈,那么增加再多的计算卡,训练速度也无法线性提升,甚至可能停滞不前,造成巨大的资源浪费。

2.3 软件栈成熟度:从“能用”到“好用”的鸿沟

这是国产芯片生态最薄弱、也最需要时间积累的环节。一个完整的大模型训练软件栈包括:

  • 编译器与运行时:需要将PyTorch等框架定义的动态计算图,高效地编译并映射到芯片的特定计算单元上。这要求编译器能进行深度的算子融合、内存优化和流水线调度。
  • 高性能算子库:提供经过极致优化的基础算子(如Conv、MatMul、LayerNorm)和融合算子(如Fused Attention)。这些算子需要针对芯片的微架构进行手写汇编或 intrinsic 优化,榨干每一分硬件性能。
  • 训练框架适配:不仅仅是让PyTorch能在芯片上跑起来,更需要深度集成。例如,支持自动混合精度(AMP)、激活检查点(Activation Checkpointing)、ZeRO系列优化器(如DeepSpeed ZeRO)等高级训练技术。这些技术的实现往往需要框架、算子和通信库的紧密配合。
  • 开发与调试工具:提供易用的性能分析工具(Profiler),帮助开发者定位计算、通信、内存的瓶颈;稳定的驱动和监控系统,保障长时间训练的可靠性。

缺乏成熟的软件栈,就像给F1赛车手一辆没有调校过的发动机和变速箱,空有马力也无法赢得比赛。

2.4 稳定性与可靠性:长达数月的“马拉松”考验

大模型训练是一次持续数周甚至数月的“长跑”。在这个过程中,任何一张卡出现硬件故障、任何一次通信错误、任何一次软件栈的微小bug,都可能导致训练中断,需要从最近的检查点(Checkpoint)恢复。这不仅浪费算力,更拖慢研发进度。

国产芯片集群需要证明其具备企业级的可靠性:

  • 硬件可靠性:芯片、内存、互联组件的失效率是否可控?是否有完善的错误检测与纠正(ECC)机制?
  • 系统容错:训练框架和调度系统是否支持弹性训练?能否在少量节点故障时,自动隔离问题节点并重新调度任务,而不需要完全重启?
  • 可维护性:集群的运维管理是否便捷?日志、监控、告警系统是否完善?

DeepSeek V4的成功训练,首先就必须在以上四个维度上,趟出一条可行的路。它不仅仅是对芯片单点能力的测试,更是对从芯片到集群、从硬件到软件的整体解决方案的一次大考。

3. DeepSeek V4的实践路径推测:软硬件协同的“组合拳”

虽然官方尚未披露DeepSeek V4训练的技术细节全貌,但结合行业通用实践和国产芯片的发展现状,我们可以合理推测其成功背后的关键技术路径。这很可能不是单一技术的胜利,而是一套精心设计的软硬件协同“组合拳”。

3.1 芯片选型与集群架构:走向异构与规模化

目前国内有多家厂商推出了可用于AI训练的高性能芯片,如华为昇腾、寒武纪思元、海光DCU等。DeepSeek团队的选择,很可能基于以下几个考量:

  • 算力密度与能效比:在单位机架空间和功耗限制下,选择计算密度更高的芯片,以降低总体拥有成本(TCO)。
  • 互联能力:芯片是否具备高速片间互联技术?其集群组网方案(如基于RoCE的以太网或专用网络)的极限带宽和规模上限是多少?这决定了单集群能安全扩展到多大规模。
  • 软件生态:哪家芯片的软件栈(编译器、算子库、通信库)相对更成熟,与PyTorch等主流框架的集成度更高,团队的学习和迁移成本更低。

在集群架构上,很可能采用了“计算-存储-网络”分离的规模化设计。计算节点由搭载多颗国产芯片的服务器组成,通过高速网络互联;存储采用并行文件系统(如CephFS、 Lustre)或高性能对象存储,用于存放海量的训练数据和模型检查点;作业调度则可能基于Kubernetes或Slurm,进行复杂的资源管理和任务调度。

3.2 训练框架的深度定制与优化:从“适配”到“融合”

要让PyTorch在国产芯片上高效运行,绝不仅仅是写几个后端接口那么简单。DeepSeek的工程团队必然进行了深度的框架定制。

  1. 计算图编译与优化:很可能采用了类似PyTorch 2.0的torch.compile技术路线,或者深度集成了华为的CANN、寒武纪的MagicMind等国产编译框架。将动态图捕获并编译成静态计算图,针对国产芯片进行大规模的算子融合、内存布局优化和流水线调度,以消除框架层开销,提升执行效率。
  2. 定制化内核与融合算子:针对模型结构中的热点(如Multi-Head Attention、MLP块),手写或利用芯片厂商提供的工具开发高度优化的融合算子。例如,将Attention计算中的QKV投影、Softmax、Dropout等操作融合成一个内核,大幅减少内存读写和内核启动开销。
  3. 分布式策略创新:在数据并行(DP)、模型并行(MP)、流水线并行(PP)的基础上,可能需要针对国产芯片的通信特性进行策略创新。例如,在通信带宽受限的情况下,更精细地设计张量并行(Tensor Parallelism)的切分策略,或者采用更高效的通信原语(如2D/3D并行)。也可能深度集成或改进了DeepSpeed、Megatron-LM等开源框架,使其适配国产硬件的通信库。

3.3 算法与系统的协同设计:为硬件“量体裁衣”

最顶级的优化,是让算法去适应硬件特性,而不是反过来。这在DeepSeek V4的训练中可能体现为:

  • 模型结构搜索(NAS)的约束:在搜索或设计模型架构时,除了考虑参数量、FLOPs,还将国产芯片的特定计算单元效率、内存层次结构作为约束条件。例如,倾向于使用芯片擅长加速的特定激活函数或归一化层。
  • 混合精度策略的微调:BF16是当前训练的主流精度,但国产芯片对BF16的支持程度和效率可能不同。团队可能需要精细调整不同计算环节(如前向、反向、优化器更新)的精度策略,在保证训练稳定性的前提下,最大化利用芯片的算力。
  • 激活重计算与内存优化:由于国产芯片的HBM容量可能相对有限,激活检查点(重计算)策略变得尤为关键。需要精准选择哪些层的激活需要保存,哪些可以丢弃后重新计算,以在内存和计算之间取得最佳平衡。

3.4 大规模运维与稳定性保障:看不见的“护城河”

支撑数月训练的稳定性,是工程能力的终极体现。这背后可能有一套复杂的系统:

  • 全链路监控与告警:从芯片温度、功耗、ECC错误,到网络流量、延迟、丢包率,再到作业进度、Loss曲线、梯度异常,建立全方位的监控大盘和智能告警。
  • 自动化的检查点与恢复:制定科学的检查点保存频率和策略(全量检查点+增量检查点),并实现训练任务的快速恢复。可能还采用了异步检查点技术,减少保存对训练进程的阻塞。
  • 预测性维护:通过分析硬件日志数据,尝试预测可能发生的故障,提前进行资源迁移或维护,防患于未然。

注意:这里存在一个常见的误解,即认为“用国产芯片训练”等于“完全去英伟达化”。在现实的技术迁移过程中,很可能存在一个过渡阶段。例如,可能用国产芯片集群进行大部分的前向和反向计算,而某些特定的、尚未优化到位的通信模式或控制逻辑,仍由少量CPU或其它协处理器处理。或者,在软件栈的底层,仍部分借鉴或兼容了CUDA的某些编程模型思想,以降低开发难度。完全独立的、从零开始的软硬件体系,其建设周期和难度是超乎想象的。DeepSeek V4的实践,更可能是在现有生态基础上,进行最大程度的替代和优化,证明了国产芯片作为主力算力的可行性。

4. 性能评估与影响分析:我们该如何看待这个“世界级”?

“用国产芯片训出世界级大模型”,这个表述包含两个关键点:“国产芯片训练”和“世界级模型”。对于前者,我们已经分析了其技术内涵。对于后者,我们需要一个客观的评估框架。毕竟,“世界级”不是一个营销词汇,而应该有扎实的技术指标支撑。

4.1 模型性能的评估维度

要判断DeepSeek V4是否达到“世界级”,我们需要看它在以下几个核心维度上的表现:

  1. 基础能力基准(Benchmark):这是硬指标。包括:

    • 知识 & 推理:MMLU(大规模多任务语言理解)、GPQA(专业领域QA)、MATH(数学)、BBH(BIG-Bench Hard)等。这些基准测试模型在通用知识、复杂推理和专业领域的理解能力。
    • 代码能力:HumanEval(代码生成)、MBPP(Python编程问题),评估模型的代码生成和问题解决能力。
    • 中文理解与生成:CEval(中文学科考试)、CMMLU(中文多任务理解),以及长文本生成、诗歌创作、文言文翻译等更具中文特色的任务。这是国产模型必须建立优势的领域。 关键不是看总分,而是看它在与GPT-4、Claude-3、Gemini Ultra等顶尖闭源模型,以及Llama 3、Qwen 2.5等优秀开源模型的同台竞技中,处于什么位置。是否有全面领先,或是在某些关键项上形成差异化优势?
  2. 训练效率与成本:这是体现国产芯片价值的关键。虽然外部很难获得确切数据,但可以从一些侧面推断:

    • 公开信息:团队是否会披露近似的数据,如“在XX规模芯片集群上,耗时YY天完成训练”?
    • 迭代速度:如果DeepSeek V4之后,V4.5或V5的版本迭代周期明显短于国际同类模型,那也能间接证明其训练基础设施的效率。
    • 成本结构:长期看,使用国产芯片是否能带来显著的训练成本下降?这关系到模型商业化以及后续更多研究机构跟进的可能性。
  3. 系统效率指标:对于技术圈而言,一些更底层的指标同样重要:

    • MFU(Model FLOPs Utilization):模型浮点运算利用率。这是衡量训练系统效率的黄金指标,表示实际用于有效模型计算的FLOPs占硬件峰值FLOPs的比例。在万卡规模下,MFU能达到20%以上就已属优秀。国产芯片集群的MFU能达到什么水平,直接反映了软硬件协同优化的功力。
    • 线性加速比:当计算卡数量翻倍时,训练速度能提升多少倍。理想情况是接近线性(如512卡到1024卡,速度提升1.9倍以上),这考验通信和负载均衡能力。

4.2 对行业生态的潜在影响

DeepSeek V4的成功实践,其行业影响力可能远超模型本身:

  1. 为国产芯片提供“杀手级应用”场景:大模型训练是当前对算力需求最迫切、最极致的场景。成功案例将极大增强市场对国产训练芯片的信心,吸引更多AI公司、云服务商进行采购和适配,形成正向循环,加速整个国产AI算力生态的成熟。
  2. 降低大模型研发门槛:如果国产芯片集群能够提供稳定、高性价比的训练服务,那么更多的中小型研究团队和公司,将有机会参与到前沿大模型的研发中,促进整个AI领域的创新活力。这有助于打破算力垄断可能带来的创新壁垒。
  3. 推动软件栈的标准化与开源:为了吸引开发者,芯片厂商和像DeepSeek这样的先行者,有动力将部分优化后的软件层(如算子库、通信优化库、训练框架插件)开源或标准化。这能减少重复造轮子,加速整个生态的发展。
  4. 促进自主可控的AI基础设施:从国家安全和产业安全的角度看,建立一套不依赖单一外部供应商的、从硬件到软件的全栈AI能力,具有长远的战略意义。DeepSeek V4是一次重要的技术可行性验证。

4.3 冷静看待挑战与差距

在欢呼的同时,也必须清醒地认识到存在的挑战:

  • 生态差距依然存在:CUDA生态经过十余年发展,积累了数百万开发者、海量的优化库和工具链。国产芯片的软件生态在易用性、丰富度和社区活跃度上,仍有很长的路要走。让一个AI研究员轻松地从A100环境迁移到国产芯片环境,目前还比较困难。
  • 持续创新与迭代的压力:芯片和软件栈都需要持续快速迭代,以跟上AI算法月甚至周级别的创新速度。例如,下一代模型可能需要对MoE(混合专家)、SSM(状态空间模型)等新架构有更好的支持,这对硬件设计的前瞻性和软件栈的灵活性提出了更高要求。
  • 全栈人才的极度稀缺:既懂大模型算法,又精通分布式系统,还能深入硬件进行性能调优的“全栈”型人才凤毛麟角。构建和运营这样一个复杂的系统,人才是比硬件更稀缺的资源。

5. 给开发者与企业的启示:在新时代的算力格局中寻找位置

DeepSeek V4的发布,不仅是一个技术新闻,更是一个强烈的信号,预示着AI算力格局可能开始发生结构性变化。对于广大AI开发者、创业公司和传统企业而言,该如何应对和布局?

5.1 对于大模型研发团队:拥抱多元化算力,关注TCO

如果你正在或计划训练自己的大模型,那么:

  • 将“国产芯片适配”纳入技术选型评估:在新项目启动时,不再默认只考虑英伟达方案。可以主动接触国产芯片厂商或其云服务合作伙伴,申请测试资源,进行小规模的概念验证(PoC)。评估重点不仅是峰值算力,更要关注实际模型训练时的有效算力(MFU)、通信效率、软件栈的成熟度和开发体验。
  • 建立模型与框架的“可移植性”意识:在模型架构设计和代码编写时,有意识地避免使用某些高度特定化的CUDA扩展或API。尽量使用PyTorch原生算子或主流开源框架(如DeepSpeed, Megatron)提供的抽象接口,这能为未来向不同硬件平台迁移降低难度。
  • 深度参与或关注开源生态:关注像Colossal-AI、MindSpore(华为)等对国产硬件支持较好的开源框架的发展。参与其中,贡献代码或反馈,共同推动一个更加开放、多元的AI计算生态。

5.2 对于应用开发与企业:关注模型服务,而非训练本身

对于绝大多数企业来说,直接训练千亿级大模型既不经济也不必要。更现实的路径是:

  • 基于优秀开源或API模型进行微调(Fine-tuning):像DeepSeek V4这样的模型,很可能后续会发布开源版本。企业可以利用其强大的基座能力,使用自己的领域数据,在成本更低的硬件(甚至可能是国产的中端训练卡或推理卡)上进行参数高效微调(PEFT),如LoRA、QLoRA,快速获得一个专属的行业模型。
  • 重点评估推理成本与性能:模型最终要落地产生价值,推理阶段的成本和延迟是关键。国产芯片在推理侧(如华为昇腾310、寒武纪MLU等)的布局更早,生态相对更成熟,性价比优势可能更明显。企业可以对比不同硬件平台上的推理吞吐量、延迟和单次调用成本。
  • 利用国产云服务提供的AI能力:国内主流云厂商(阿里云、腾讯云、华为云等)都已提供了基于国产芯片的AI算力实例和模型服务。企业可以直接调用这些云服务,避免自建硬件的复杂性和高昂的固定成本,快速验证AI应用场景。

5.3 一个务实的行动路线图

面对算力格局的潜在变化,一个务实的行动路线图可能是:

  1. 短期(未来6-12个月)保持现有技术栈稳定,但开展技术侦察。主要研发和生产环境仍可基于成熟生态。同时,指派一个小团队或投入少量资源,开始学习国产芯片的基础知识,在测试环境中跑通一些经典的模型(如BERT、Llama 7B),熟悉其开发工具链和调优方法。关注像DeepSeek V4这类标杆项目的技术分享和开源动态。
  2. 中期(1-3年)在非核心或新项目中进行试点。当国产芯片的软件生态有显著改善,并有更多成功案例出现时,可以选择一个全新的、风险可控的项目,尝试使用国产算力进行全流程开发(从训练到部署)。目标是在可控成本下,验证其全链路能力,并积累内部经验。
  3. 长期构建异构、多元的算力策略。理想的未来状态不是“替换”,而是“融合”。企业可以根据不同工作负载的特性,灵活调度和使用不同架构的算力。例如,将大规模预训练任务放在性价比最优的平台上(可能是国产集群),将超低延迟的在线推理放在专用推理芯片上,将算法原型开发放在易用的成熟生态上。这要求企业具备更强的算力抽象和管理能力。

DeepSeek V4的发布,就像在原本看似铁板一块的算力高墙上,凿开了一道清晰的裂缝,让光透了进来。它证明了一条路径的可行性,但这条路依然漫长且充满挑战。对于我们每一个从业者而言,最重要的不是立刻欢呼或转向,而是以更开放、更务实、更深入的技术视角,去理解这场正在发生的变革,并从中找到属于自己的机会和位置。未来的AI算力世界,很可能不再是单一架构的王国,而是一个多元异构、竞争共存的生态系统。而今天,我们看到了这个生态中,一颗重要的新星开始闪耀。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/14 3:39:12

360云盘做服务器建设网站:个人博客与小型项目的低成本试错指南

在这个互联网流量红利逐渐见顶的时代,每个人都渴望拥有一个属于自己的网络角落。无论是为了记录生活的点滴,还是展示编程学习的成果,甚至是搭建一个小型的商业官网,拥有一个稳定的网站已成为许多技术爱好者的刚需。提到建网站,大多数人的第一反应是购买云服务器(VPS),租…

作者头像 李华
网站建设 2026/8/14 3:38:43

让企业礼品册兑换更高效:一站式礼品册兑换网站建设全攻略

在这个讲究体验与效率的时代,企业福利和商务馈赠早已不再是简单的“发一堆米面油”或者“塞一张硬通货购物卡”那么简单了。尤其是对于大中型企业来说,如何在保持成本控制的同时,让员工和客户感受到满满的诚意和尊重,是一道经久不衰的管理难题。传统的礼品发放方式,不仅 l…

作者头像 李华
网站建设 2026/8/14 3:36:57

揭秘上饶便宜的网站建设:避开隐形消费陷阱,老板们必看的避坑指南与实操建议

在这个互联网流量红利逐渐见顶、每一分钱都要花在刀刃上的时代,很多初创企业主、中小商家以及传统转型的老老板们,坐在办公室里对着账单发愁,心里最纠结的问题往往不是“要不要做网站”,而是“怎么能花最少的钱,做出最能用的网站”。特别是在咱们江西上饶,这座拥有丰富旅…

作者头像 李华
网站建设 2026/8/14 3:36:48

深耕本土:富阳建设局网站作为城市更新与民声汇聚的核心阵地

在这个信息爆炸、万物互联的时代,我们似乎每天都被海量的资讯推着走。手机屏幕亮了又灭,灭了又亮,无数的链接在指尖流淌,但真正能沉淀下来、进入我们生活肌理的信息却寥寥无几。对于生活在富阳这片土地上的居民来说,有一个特定的入口,它或许没有互联网大厂那样炫酷的交互…

作者头像 李华
网站建设 2026/8/14 3:36:38

工程机械设备全生命周期管理,推荐哪些软件?

一、工程机械行业动态:后市场服务化转型当前,我国工程机械行业正处于稳步复苏的上行通道。2025年工程机械板块收入增速提升至12%,2026年一季度进一步攀升至13%,行业景气度持续回暖。从需求端来看,内外需市场形成共振。…

作者头像 李华
网站建设 2026/8/14 3:35:23

微信聊天记录导出不再难:开源工具 WeChatMsg 帮你把回忆永久存档

微信聊天记录导出不再难:开源工具 WeChatMsg 帮你把回忆永久存档 【免费下载链接】WeChatMsg 提取微信聊天记录,将其导出成HTML、Word、CSV文档永久保存,对聊天记录进行分析生成年度聊天报告 项目地址: https://gitcode.com/GitHub_Trendin…

作者头像 李华