三步选对能源数据集:开源能源数据集新手完全指南
【免费下载链接】awesome-public-datasetsA topic-centric list of HQ open datasets.项目地址: https://gitcode.com/GitHub_Trending/aw/awesome-public-datasets
做家庭用电行为或智能电网研究,第一步该找哪类数据?awesome-public-datasets 项目是一份按主题组织的高质量开放数据集清单,其 Energy 板块收录了二十多个开源能源数据集,覆盖户级分钟级电力、建筑级负荷到国家级电厂台账,让你按研究场景筛选、直接挑到合适的切入点。
本指南不按编号罗列,而是先分清数据属于哪个尺度(户级、建筑级还是国家级),再把数据集归入对应场景,最后给出一份新手上手清单。
家庭用电行为研究:户级数据怎么挑
这一板块面向单户家庭用电模式研究。判断标准主要看三点:采样粒度(分钟级还是 15 分钟级)、时间跨度(数周还是数年)、是否提供逐家电表计数据。
AMPds:分钟级家庭电力数据的基准选择
AMPds 是覆盖 120 个英国家庭的分钟级电力数据集,除整户总表外还记录多个电器回路的用电。它解决的是负载分解研究里最常见的问题:每分钟到底在跑哪些电器。做非侵入式负载监测(NILM)或家庭能效分析的新手,适合把它作为第一个上手的数据集。
ECO:非侵入式负载监测的标准测试集
ECO 来自苏黎世联邦理工学院,包含 6 个瑞士家庭、连续 4 周的用电记录,整户与子回路双表计同步采集,是负载分解算法对比中引用最多的基准之一。如果你的目标是复现论文或横向比较算法,这一类数据里它最常用。
UK-DALE:294 个英国家庭的电器级电力数据
UK-DALE 记录了 2013 至 2015 年间 294 个英国家庭的电器级耗电,时间跨度比 ECO 长、家庭数量是后者的近 50 倍。它适合做电器类型级需求建模(洗衣机、烘干机、充电桩这类)或家庭用电行为聚类。注意其粒度低于分钟级,做精细波形分析时不如 AMPds,但训练效率更高。
PLAID:只看插电电器的专项数据集
PLAID 覆盖 2014 至 2015 年 230 个美国家庭,只记录通过插座连接的电器(电水壶、充电器、电视等)用电。如果你的研究重点是"拔掉插头能省多少电"或待机功耗,它比整户数据更对路,噪音也更少。
DEL:南非 20 年家庭用电负荷纵向记录
DEL 是南非 1994 至 2014 年的家庭电力负荷研究,时间跨度长达两十年,能观察用电结构在长期内的演变。它的价值不在采样粒度而在跨度,适合做发展中国家用电模式和需求侧管理的趋势研究。
SYND:真实数据不够时合成的 NILM 数据
SYND 是 2020 年发表于 Nature Scientific Data 的合成能源数据集,用电网仿真生成,电器组合和波形贴近真实。它的定位是给模型"加练":当真实数据规模不够训练时,用它可以补足样本量,再回到真实集上验证。
建筑与电网负荷监测:从一栋楼到一个国家
建筑级和电网级研究需要另一种尺度的数据:单栋建筑的子表计、多建筑综合记录,或全国统计口径。
BLUEd:建筑级全标注电力分解数据
BLUEd 是建筑级完全标注的电力分解数据集,以 15 分钟采样同步记录整栋楼总表与空调、照明等关键回路的子表。它回答的问题是:一栋楼的总负荷如何拆分到子系统。做楼宇能耗建模、智能楼宇控制的研究者可以围绕它搭建基线。
COMBED:多建筑综合能源数据
COMBED 把多栋建筑的电力、温度等时序数据整合在一起,适合跨建筑对比分析。相比 BLUEd 这类单建筑数据集,它的优势是能支撑建筑间统计规律挖掘,粒度则没有前者细。
MORED:摩洛哥建筑用电数据
MORED 自 2019 年春起持续记录摩洛哥建筑的耗电情况,属于北非气候与用电市场的建筑级数据。如果你的研究涉及制冷负荷占比、炎热地区建筑能效,它是少数能用的开放来源。
EIA:美国官方电力统计口径
EIA 是美国能源信息署的官方数据,清单中指向 EIA-923 表,即公用事业公司级的发电与供应统计。粒度到公司、频率为月度或季度,权威且长期连续。分析美国电力供应侧时,把它作为基准口径最稳。
PUDL:美国能源数据的统一口径库
PUDL(Public Utility Data Liberation Project)把 EIA、FERC 等多个来源的统计口径整理成统一格式,数据自 1993 年起连续。做美国电价、发电量、排放的长期趋势研究时,用它可以省掉自己拼接多份原始表格的繁琐工作。
负荷预测数据集索引:做预测任务先查这张目录
Publicly Available Datasets For Electric Load Forecasting 是一个持续维护的索引条目,按地区和规模汇总了各类开放的电力负荷预测数据。如果你的任务就是需求预测,先用它当目录挑出两三个候选数据集,再逐一核对字段,比盲目找数据省时间。
可再生能源与发电基础设施:电厂台账与清洁能源技术
第三类数据回答的不是"用了多少电",而是"电从哪来":电厂在哪里、装机多少、什么技术路线。
全球发电厂数据库:全球电厂台账
全球发电厂数据库(WRI 维护)收录了全球范围的发电厂清单,每条记录包含燃料类型、装机容量、地理坐标和运营状态。它回答的是宏观问题:全球发电容量如何分布、可再生占比多少。做能源转型与基础设施研究时,这张底表几乎都会用到。
MaStR:德国可再生能源装机全台账
MaStR 是德国官方的市场主数据登记库,覆盖全部并网的光伏与风电安装记录,含位置和容量信息。国家级、逐台设备粒度的开放台账并不多见,适合做分布式能源的空间分布分析。
DBFC:直接硼氢化物燃料电池专业数据
DBFC 面向直接硼氢化物燃料电池,记录了受控实验条件下的电性能表现,属于清洁能源器件级的专业数据。它的受众是燃料电池研发人员,用来搭建电化学模型和性能曲线,而非通用的电力数据分析。
PEM1:质子交换膜燃料电池对照数据
PEM1 是 ECSIM 项目发布的质子交换膜(PEM)燃料电池数据集,与 DBFC 同属清洁能源技术数据系列。如果你的研究要横向比较不同燃料电池路线,可以把两者放在同一套评估流程里,观察不同负载工况下的输出差异。
新手第一步:从单个数据集开始
不建议一次性下载所有数据,可操作的第一步是:
先定场景再选数据集:做负载分解选 AMPds 或 ECO,做美国电力市场长周期分析选 PUDL,做发电侧空间分析选全球发电厂数据库。
先拿目录再找原始数据:克隆仓库后查看 README 的 Energy 部分,这里列出了本主题全部条目,每条都关联了独立的 Meta 说明文件:
git clone https://gitcode.com/GitHub_Trending/aw/awesome-public-datasets核对数据质量:进入数据集官方页面后重点看四项——采样周期(分钟级还是 15 分钟级)、时间覆盖区间、子表计标注是否完整、项目是否仍在维护。清单中标记 OK 的条目通常链接可用,标 FIXME 的条目使用前要额外验证。
【免费下载链接】awesome-public-datasetsA topic-centric list of HQ open datasets.项目地址: https://gitcode.com/GitHub_Trending/aw/awesome-public-datasets
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考