文章主要内容总结
本文针对大型语言模型(LLMs)评估中能源消耗因素被忽视的问题,提出了生成能源竞技场(Generative Energy Arena, GEA)这一评估平台。
- 背景:现有LLM评估方法存在局限——自动化基准测试与人类偏好相关性低,传统人类评估可扩展性差,公开竞技场(如LM Arena)未考虑能源消耗;而LLM的能源消耗(训练和推理阶段)日益成为重要议题。
- GEA设计:解决了三个核心问题:
- 能源信息获取:通过比较同系列不同规模的模型(如GPT-4.1与GPT-4.1-mini),提供相对能耗信息(不涉及绝对值);
- 能源信息呈现:采用两步评估流程,先让用户仅基于质量选择,再告知能耗信息并询问是否更改选择,避免偏见;
- 影响指标:定义了投票改变率(EcE_cE