- NLP
- 知识库
- 文档
【免费下载链接】NLP-progress
Repository to track the progress in Natural Language Processing (NLP), including the datasets and the current state-of-the-art for the most common NLP tasks.
本文基于 NLP-progress 仓库中 persian/summarization.md 的内容,系统梳理波斯语文本摘要(Persian Text Summarization)的任务定义、自动评估指标的固有局限,以及pn_summary、Pasokh两个代表性数据集与其上的抽取式/生成式 SOTA 结果。读完本文,你将掌握波斯语摘要研究的主要资源分布、各模型在 ROUGE-1/ROUGE-2/ROUGE-L 上的实测对比,以及如何正确解读与使用这些榜单数据。
摘要任务的定义与本仓库的定位
文本摘要(Summarization)的任务是:生成一个或多个原始文档的更短版本,同时尽可能保留输入的大部分含义。它通常被划分为**抽取式(Extractive)与生成式(Abstractive)**两大类——前者从原文中挑选关键句子拼接成摘要,后者用语言模型重新生成表达相同内容的短语。
NLP-progress 项目(README.md)的目标正是"追踪 NLP 各常见任务与数据集上的研究进展,为读者提供基准数据集与当前 SOTA 的快速概览"。在仓库的目录结构中,波斯语板块(persian/目录)与英语、法语、俄语、土耳其语、德语等板块并列,其中 persian/summarization.md 就是波斯语摘要任务的专属追踪页;英文对应页 english/summarization.md 则覆盖了 CNN/Daily Mail、Gigaword、X-Sum 等主流英语基准。
评估指标的警告:ROUGE 与 METEOR 的三大局限
波斯语摘要页在罗列任何结果之前,首先给出了一条重要警告:对于摘要任务,ROUGE、METEOR 等自动指标存在严重局限,具体有三点:
- 只评估内容选择,不覆盖质量:这些指标不衡量流畅度(fluency)、语法正确性(grammaticality)、连贯性(coherence)等其他质量维度。一个语法错误频出但内容命中率高的摘要仍可能获得高分。
- 过度依赖词面重叠:在评估内容选择时,指标主要依赖词面(lexical)重叠;但一篇抽象式摘要完全可以在与参考摘要没有任何词面重叠的情况下表达相同内容,此时 ROUGE 分数会严重低估其真实质量。
- 单一参考摘要问题:鉴于摘要任务的主观性以及标注者之间较低的一致性,这些指标在设计时假定每个输入对应多个参考摘要;然而
pn_summary等较新数据集每条输入只提供单一参考摘要,进一步削弱了指标的可靠性。
因此,仅凭这些自动指标来追踪进展、声称 SOTA 是值得商榷的。多数论文会额外进行人工对比实验来佐证,但这类人工实验难以跨论文横向比较——原文档也呼吁社区若有更好的比较方案可直接贡献。
值得注意的细节是,这条警告与 english/summarization.md 中的版本结构一致,只是把"仅提供单一参考摘要"的例子从 CNN/DailyMail、Gigaword 替换为pn_summary,说明仓库内各语言页共享同一套方法论警示,并针对各自的数据集做了本地化——从这一对比可以推断,该警告模板是整个仓库追踪摘要任务时的统一共识。
波斯语摘要资源概览:稀缺但正在补全
原文档明确指出:波斯语的生成式/抽取式摘要任务资源相对匮乏,部分数据集没有在线公开版本,或缺少维护者(curators)。例如在翻阅学术论文时可能看到Pasokh等数据集,但实际可获取性存疑。幸而,得益于部分研究者在该领域的投入,一个名为Persian News Summarization(简称pn_summary)的数据集同时面向波斯语摘要的两类任务准备完毕,并已开放在线获取。
pn_summary:波斯语新闻摘要数据集
pn_summary 是一个结构良好的波斯语摘要数据集,其关键规格如下:
- 规模:由 200,000 篇爬取新闻中筛选出的93,207 篇在线新闻文章;
- 来源:来自6 家不同的新闻机构;
- 类别覆盖:涵盖18 个新闻类别,范围从经济到旅游;
- 标注形式:每篇文档(文章)同时包含长原始文本与一段人工生成的摘要;
- 评估协议:模型使用全长度(full-length)F1 分数的 ROUGE-1、ROUGE-2、ROUGE-L 评估,METEOR 为可选指标。
从仓库的 structured/export.py 源码结构看,这类 Markdown 中的 SOTA 表格可以通过导出脚本被解析为结构化 JSON(具体用法见 structured/README.md),也就是说pn_summary的模型成绩可以被机器读取与二次利用,便于做跨论文的榜单对比。
生成式模型与混合模型
| Model | ROUGE-1 | ROUGE-2 | ROUGE-L | METEOR | Paper / Source | Code |
|---|---|---|---|---|---|---|
| BERT2BERT (ParsBERT) + mT5(Farahani 等,2020) | 44.01 | 25.07 | 37.76 | - | Leveraging ParsBERT and Pretrained mT5 for Persian Abstractive Text Summarization | Official(随 pn_summary 仓库发布) |
这是pn_summary上目前收录的生成式(Abstractive)/混合模型 SOTA:将波斯语预训练模型ParsBERT(同样出自 Hooshvare 团队,详见 persian/named_entity_recognition.md 中对 ParsBERT 在 ArmanPersoNERCorpus 与 PEYMA 上的高 F1 记录)作为 BERT2BERT 结构的编码端,与多语言生成模型mT5配合完成摘要生成,在 ROUGE-1 上达到 44.01、ROUGE-2 25.07、ROUGE-L 37.76,官方代码随pn_summary数据仓库一并发布。
Pasokh:单文档与多文档双形态数据集
Pasokh 是另一个被收录的波斯语摘要数据集,其规格与原文档记载如下:
- 来源:覆盖7 家新闻机构的新闻内容,横跨6 个新闻类别;
- 两种形态:单文档(Single-Document,SD)与多文档(Multi-Document,MD);
- 规模:分别包含100、1000 条记录;
- 标注形式:每篇文档覆盖5 个样本,分别用于抽取式(extractive)与生成式(abstractive)示例。
该数据集在原文档中被特别提及为"在学术论文中可见、但线上可获取性存疑"的典型例子——这恰好呼应了上文"波斯语摘要资源稀缺"的现状描述。
抽取式模型与混合模型
| Model | ROUGE-1 | ROUGE-2 | ROUGE-L | METEOR | Paper / Source | Code |
|---|---|---|---|---|---|---|
| Based on NER (SD)(Khademi, Fakhredanesh,2020) | 47.20 | 33.40 | - | - | Persian Automatic Text Summarization Based on Named Entity Recognition | - |
| Based on NER (SD)(Khademi 等,2020) | 45.40 | 30.10 | - | - | Conceptual Text Summarizer: A new model in continuous vector space | - |
| Feature Extraction (SD)(Rezaei 等,2019) | 78.00 | 71.00 | 74.00 | - | Features in Extractive Supervised Single-document Summarization: Case of Persian News | Official(SummBot) |
| Multi-Feature Extraction (SD)(Kermani, Ghanbari,2019) | 48.70 | 42.60 | - | - | Extractive Persian Summarizer for News Websites | - |
对这张表可以观察到几个有研究价值的模式(均为基于表中数据的客观归纳,而非外部结论):
- 得分最高的路线是显式特征工程:Rezaei 等(2019)的 Feature Extraction 方法在 ROUGE-1/2/L 上分别达到 78.00 / 71.00 / 74.00,是表中唯一三项指标全部报出、且显著领先其余条目的方法,并提供了官方代码(SummBot);
- 命名实体信息是有力的抽取信号:两条 Based on NER 路线(Khademi 等)在同一年份分别报出 ROUGE-1 47.20 / 45.40 的成绩,显示将命名实体识别结果作为句子打分特征在单文档抽取任务上的可行性;
- 多特征融合路线(Kermani & Ghanbari,2019)在 ROUGE-1 48.70 / ROUGE-2 42.60 上与 NER 路线量级接近,但在表中略占优;
- METEOR 一列在全部条目中均为空,与文档"METEOR 为可选指标"的评估协议说明一致。
如何阅读、复现与追踪这张榜单
结合仓库整体机制,可以给出三条使用建议:
- 把榜单当作入口而非终点:每个条目的论文标题与官方代码链接是继续深挖的起点,表格按"最优结果置顶"排序的规范(见 README.md 的贡献指南)保证了榜单的可读性;若要复现某个模型,优先以条目提供的官方实现为准。
- 留意评估口径:
pn_summary使用全长度 F1 的 ROUGE-1/2/L(METEOR 可选),Pasokh表中部分条目未报告 ROUGE-L,跨数据集直接比较分数没有意义;即使在同一数据集内,也应注意文档开头的指标局限警告——高分不等于高质量。 - 榜单可被机器消费:如果你希望做更系统的对比分析,可以运行仓库提供的导出脚本把整个波斯语摘要页解析为结构化 JSON:在仓库根目录执行
python structured/export.py persian,脚本会依据 structured/README.md 的约定将 Markdown 中的数据集描述、链接与 SOTA 表格抽取为structured.json(默认输出文件名,可用--output覆盖)。从 structured/export.py 的实现(如extract_dataset_desc_links用正则抽取标题、按表格行解析模型与分数)可以确认,这类"数据集描述 + 结果表格"的页面正是该项目刻意设计的结构化数据来源。
延伸阅读
波斯语板块中与摘要研究高度相关的还有:
- persian/named_entity_recognition.md:由于 Pasokh 上的两条 SOTA 都基于命名实体识别(NER),了解 ArmanPersoNERCorpus 与 PEYMA 上的实体标注体系(IOB 格式)有助于理解这类抽取特征的构建方式;
- persian/natural_language_inference.md:摘要的"内容保真"与蕴含判断(entailment)密切相关,FarsTail 数据集是该方向在波斯语上的代表;
- english/summarization.md:用于横向理解评估指标警告与榜单结构的同源英文版本。
如需返回仓库总览,可跳转至 README.md。
- NLP
- 知识库
- 文档
【免费下载链接】NLP-progress
Repository to track the progress in Natural Language Processing (NLP), including the datasets and the current state-of-the-art for the most common NLP tasks.
相关推荐
终极风扇控制指南:如何让电脑静音又凉爽的完整教程
终极风扇控制指南:如何让电脑静音又凉爽的完整教程 还在为电脑风扇噪音而烦恼吗?你是否遇到过深夜工作时风扇突然狂转,或者游戏时散热不足导致性能下降?FanCont
NLP知识库文档3分钟快速掌握B站会员购抢票神器:Python自动化购票终极指南
3分钟快速掌握B站会员购抢票神器:Python自动化购票终极指南 还记得那个令人沮丧的夜晚吗?你最喜欢的歌手演唱会门票在B站会员购开售,你提前半小时就守在电脑前
NLP知识库文档NLP-progress 西班牙语文本摘要:MLSUM 多语言摘要数据集与西班牙语 SOTA 结果追踪
NLP progress 西班牙语文本摘要:MLSUM 多语言摘要数据集与西班牙语 SOTA 结果追踪 本文基于 NLP progress 仓库中的 spani
NLP知识库文档
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考