一、梯度检查点 gradient_checkpointing=True
1. 原理
模型正向计算时会保存全部中间计算结果,反向传播求梯度时要用,这部分缓存极其占显存。
开启梯度检查点后:正向计算不保存全部中间缓存,反向传播需要时,重新再算一遍。
2. 代价与收益
收益:显存直接减少 40%~50%,是最核心的显存节省手段;
代价:CPU/GPU 重复计算,训练速度变慢 20%~30%;
3. 你的场景作用
2~3B 全参数训练,不开这个直接爆显存;开启后才能腾出空间放下梯度、优化器数据。
二、8bit 优化器(8-bit AdamW)
1. 普通 FP32 AdamW 的显存问题
全参数训练三大显存块:模型权重、梯度、优化器缓存(Adam 维护两组动量参数,和模型参数一样大)。
标准 Adam 用 32 位浮点存动量,占用显存巨大。
2. 8bit 优化器作用
把优化器内部的动量、方差数据压缩为 8 位整数存储,优化器显存占用直接降低 75%。
3. 限制
轻微损失精度,loss 会小幅震荡,不适合对精度极致苛刻的场景;
V100 架构完美兼容,新款消费卡也支持;
4. 必要性
2~3B 全量训练不用 8bit 优化器,优化器缓存就能塞满 32G 显存。
三、极小 batch(per_device_train_batch_size=1)
1. batch 含义
batch 是单次丢进 GPU 并行计算的样本数量(对话 / 文本 / 图片条数)。
batch 越大,单次并行处理的数据越多,显存占用线性上升。
2. 极小 batch = 每次只训练 1 条样本
设置 batc
8bit 优化器 + 梯度检查点 + 极小 batch 什么意思
张小明
前端开发工程师
【体系教程】FVCOM三维水动力、温盐、波浪、泥沙及水质数值模拟全流程实践
第一章、FVCOM基础理论1、主流海洋数值模式及特点介绍2、FVCOM控制方程介绍3、FVCOM数值方法介绍4、FVCOM程序计算流程介绍5、FVCOM求解过程推导详解第二章、FVCOM运行环境部署1、虚拟机安装及配置2、Linux系统安装配置3、Linux系统下FVCOM常用命令介绍4、INTEL编译器安装配置5…
鸿蒙 PC Markdown 编辑器外部修改检测:从文件指纹到冲突决策
鸿蒙 PC Markdown 编辑器外部修改检测:从文件指纹到冲突决策 桌面 Markdown 文件很少只被一个程序触碰。用户可能在终端执行格式化脚本、在 Git 客户端切换分支、让生成器更新文档,或者同时打开另一款编辑器。应用如果假设“打开之后磁盘永远不变”&…
跨模态智能体技术:架构设计与工程实践
1. 跨模态智能体技术概述在人工智能领域,多模态交互正成为技术演进的重要方向。跨模态Agent Harness(智能体框架)通过整合文本、图像和音频三种核心感知通道,构建了一个能够理解、处理和生成多种数据形式的统一智能系统。这种技术…
大模型在视频创作工具中的应用:从脚本生成到自动剪辑的AI工具链
大模型在视频创作工具中的应用:从脚本生成到自动剪辑的AI工具链 一、背景与问题定义 视频创作的门槛从未像今天这样低——手机能拍 4K,剪辑软件几乎免费。但"拍出来"和"拍好"之间仍隔着巨大的鸿沟:脚本怎么写、分镜怎么规…
深入解析Tiva TM4C123BH6ZRB Flash与EEPROM寄存器级操作
1. 项目概述与核心价值 在嵌入式开发的日常工作中,无论是存储一段关键的用户配置,还是实现固件的在线升级(OTA),都绕不开对微控制器内部非易失性存储器的直接操作。很多开发者习惯于依赖厂商提供的驱动库,这…
餐饮数字化新基建解析:全链路门店智能运营体系落地实践
摘要:随着餐饮行业数字化进程深度推进,行业数字化建设已脱离基础扫码点餐的初级阶段,逐步走向全链路运营、数据化管控、私域资产沉淀、连锁标准化治理的成熟阶段。当前多数中小餐饮数字化方案存在功能碎片化、数据割裂、权限体系缺失、连锁适…