摘要:AI Generated Text Dataset(AI生成文本数据集) 是一个用于人工智能生成文本检测与真实性识别研究的数据集,包含人工撰写文本与大语言模型生成文本样本。。
数据集概述
AI Generated Text Dataset(AI生成文本数据集) 是一个用于人工智能生成文本检测与真实性识别研究的数据集,包含人工撰写文本与大语言模型生成文本样本。数据集旨在帮助研究人员、教育机构和开发者研究文本来源判别问题,支持机器学习模型对人工生成内容与真实人类文本进行分类识别。
数据结构与关键特征
数据集以 CSV 格式存储,包含 text 和 generated 两个字段,共 1460 条文本样本。其中 text 表示完整文本内容,generated 表示文本来源标签(1 表示 AI 生成,0 表示人工撰写)。数据具有明显类别不平衡特点,包括约 85 条 AI 生成文本和 1375 条人类文本,文本长度约为 200 个 token,适用于研究文本语义特征、语言模式、句式复杂度和生成痕迹等特征。
应用价值与研究方向
该数据集可用于构建 AI 文本检测系统,应用于学术论文查重、新闻真实性验证、内容审核和合成媒体检测等领域。研究方向包括基于 TF-IDF 与传统机器学习的文本分类、深度学习模型(Transformer、BERT 等)微调、类别不平衡学习、可解释人工智能(SHAP/LIME)分析以及大语言模型生成文本特征研究。
数据集来源
由张家梁(Bob)整理并于2026年在7zcode平台公开发布。
数据集信息
免责声明与引用
数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。
作者信息
作者:Bob (张家梁)
项目编号:Datasets-362
文件大小:1M
原创声明:本数据集为整理作品