news 2026/9/7 9:59:38

Indian Language Part-of-Speech Tagset: Sanskrit数据集介绍,官网编号LDC2011T04

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Indian Language Part-of-Speech Tagset: Sanskrit数据集介绍,官网编号LDC2011T04

LDC2011T04是由微软研究院印度分部(MSR India)开发、LDC 于 2011 年发布的梵语(Sanskrit)词性标注(POS)数据集,基于IL-POST(Indian Language Part-of-Speech Tagset)分层标注框架构建,是梵语计算语言学、形态句法分析领域的核心基准数据。

一、核心基本信息

项目 详情
官方编号 LDC2011T04
发布机构 Linguistic Data Consortium (LDC)
发布时间 2011 年
开发主体 Microsoft Research India (MSR India)
语言 梵语(Sanskrit)
标注框架 IL-POST(印度语言统一词性标注框架)
核心用途 梵语词性标注、形态分析、句法解析、机器翻译、信息抽取
数据格式 纯文本(.txt)+ XML(.xml)
编码 UTF-8

NLP语料共享、LDC语料https://mp.weixin.qq.com/s/8GgZFh9XAr7FYwivQ_ajRg

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/25 12:18:17

斯坦福与NVIDIA联手:视频生成实现短时技巧与长剧情双模态学习

这项由斯坦福大学联合NVIDIA研究团队完成的研究发表于2026年2月的预印本论文中,论文编号为arXiv:2602.24289v1,有兴趣深入了解的读者可以通过该编号查询完整论文。想象你正在教一个学生制作电影。如果只给他看5秒钟的短片段,他能学会拍摄技巧…

作者头像 李华
网站建设 2026/8/30 20:47:06

ELK栈日志丢失临界值探测报告

1. 问题背景与探测意义ELK(Elasticsearch、Logstash、Kibana)栈作为主流日志管理系统,在高并发场景下易因资源瓶颈引发日志丢失。本报告聚焦压力测试中的临界值探测,即通过模拟负载确定日志丢失的阈值点(如消息堆积量、…

作者头像 李华
网站建设 2026/9/1 18:36:07

SSL/TLS 3.0新握手协议的前向安全审计研究报告

SSL/TLS协议作为互联网通信安全的基石,其3.0版本(泛指最新演进,如TLS 1.3)通过优化握手协议显著提升了前向安全性(Forward Secrecy),确保即使长期密钥泄露,历史会话数据仍不可解密。…

作者头像 李华