LDC2011T04是由微软研究院印度分部(MSR India)开发、LDC 于 2011 年发布的梵语(Sanskrit)词性标注(POS)数据集,基于IL-POST(Indian Language Part-of-Speech Tagset)分层标注框架构建,是梵语计算语言学、形态句法分析领域的核心基准数据。
一、核心基本信息
项目 详情
官方编号 LDC2011T04
发布机构 Linguistic Data Consortium (LDC)
发布时间 2011 年
开发主体 Microsoft Research India (MSR India)
语言 梵语(Sanskrit)
标注框架 IL-POST(印度语言统一词性标注框架)
核心用途 梵语词性标注、形态分析、句法解析、机器翻译、信息抽取
数据格式 纯文本(.txt)+ XML(.xml)
编码 UTF-8
NLP语料共享、LDC语料https://mp.weixin.qq.com/s/8GgZFh9XAr7FYwivQ_ajRg