首页 > 编程知识 正文

NLP新闻分类,新闻文本分类python

时间:2023-05-03 09:19:58 阅读:278478 作者:1493

这是另一个数据集的加强版,为多级分类,分类更全(含1000+多级分类),量更大。


数据来源:

今日头条客户端


文本多层分类的概念见下图


数据格式:

1000866069|,|tip,news|,|【互联网资讯】PPT设计宝典!十招教你做出拿得出手的PPT|,|互联网,美国,ppt,powerpoint,幻灯片,演示文稿,微软,字体列表|,|复制代码

每行为一条数据,以|,|分割的各字段,从前往后分别是 新闻ID,分类代码,新闻字符串(仅含标题),新闻关键词,新闻label


所有分类的目录见 all_cat.txt


数据规模:

共2914000条,分布于1000+个多层的类别中。


采集时间:

2018年06月


下载地址

https://github.com/fateleak/toutiao-multilevel-text-classfication-dataset


NLP的同学加我微信吧:


LISCENSE

WTFPL

版权声明:该文观点仅代表作者本人。处理文章:请发送邮件至 三1五14八八95#扣扣.com 举报,一经查实,本站将立刻删除。