您的位置:首页 > 运维架构

hadoop-R语言-安装NLP自然语言分析包

2016-12-27 10:47 344 查看
引言: R语言是一种非常强大的分析与展示的统计科学家工具,其也提供了若干关于自然语言的分析处理工具,本文讲展示如何在Linux进行安置。
1.  自然语言处理(NLP)  对于英语体系,基于空格可以直接进行分词,而中文则不同,需要进行分词,然后进行后续处理。NLP是natural language processing的缩写,专指此类的工作。    自然语言处理包: Snowball, RWeka    文本挖掘: tm    分词工具: Rwordseg2.  所属环境    Linux: centos 6, 已经安置Java, 由于Rwordseg需要依赖java3.  安置指令与过程   3.1  安装R语言环境     >> yum install R     

   3.2  安装Snowball     >> install.packages(c('Snowball'))          其会提示该包没有找到,需要使用以下包:     >> install.packages(c('SnowballC'))      

   3.3  安装tm    >> install.packages(c('tm'))        

      

   3.4 安装RWeka    >> install.packages(c('RWeka'))     

     

   3.5 安装Rwordseg     直接执行install.packages(c('Rwordseg'))将会报错,提示找不到此类包。     需要切换到install.packages("Rwordseg", repos ="http://R-Forge.R-project.org", type = "source"),从另外一个源中进行安装。    



     3.6 结束 安装完成了所有必须的NLP。
内容来自用户分享和网络整理,不保证内容的准确性,如有侵权内容,可联系管理员处理 点击这里给我发消息
标签: