文本挖掘之详细整体的流程
2016-03-04 15:06
155 查看
1、分词
2、特征权重的计算
3、模型的选择
(1)向量空间模型与布尔模型
(2)概率模型
4、特征选择
IG(特征选择),DF(文档频率),IF-IDF,ECE(期望交叉熵),X方,MI(文档互信息),WET(文档证据权重),OI,CC(相关系数)等常用的特征选择
在我前面的文章都有提到
5、特征抽取
LDA(线性特征抽取),PCA(主成分分析),FA(因子分析),SVD(奇异值分解),NMF(非负矩阵分解),LSI或者LSA(潜在语义分析)
我的其他文章都有提到
6、文本分类算法
KNN,SVM,BP神经网络,Bayes,决策树,基于规则分类,组合算法。
7、文本聚类算法
K-means,agent,divided,DBSCAN 等
8、模型的评估
指标
准确率,错误率,精确度,召回率(主要使用混洗矩阵)
如何验证这些指标?
保持、随机二次抽样、交叉验证、自助法
如何比较二个模型?
ROC曲线的绘制
2、特征权重的计算
3、模型的选择
(1)向量空间模型与布尔模型
(2)概率模型
4、特征选择
IG(特征选择),DF(文档频率),IF-IDF,ECE(期望交叉熵),X方,MI(文档互信息),WET(文档证据权重),OI,CC(相关系数)等常用的特征选择
在我前面的文章都有提到
5、特征抽取
LDA(线性特征抽取),PCA(主成分分析),FA(因子分析),SVD(奇异值分解),NMF(非负矩阵分解),LSI或者LSA(潜在语义分析)
我的其他文章都有提到
6、文本分类算法
KNN,SVM,BP神经网络,Bayes,决策树,基于规则分类,组合算法。
7、文本聚类算法
K-means,agent,divided,DBSCAN 等
8、模型的评估
指标
准确率,错误率,精确度,召回率(主要使用混洗矩阵)
如何验证这些指标?
保持、随机二次抽样、交叉验证、自助法
如何比较二个模型?
ROC曲线的绘制
相关文章推荐
- ZOJ 3635 Cinema in Akiba(二分+树状数组)
- 数组求和
- hp-ux操作系统下tusc命令的使用
- LabVIEW宝典
- block,inline和inline-block的区别
- Android总结01_服务
- iOS中 第三方LBXScan库二维码扫描
- 修改Eclipse中的$(user)变量
- spring的@Transactional
- <meta-data>的使用
- (5)Jfreechart环形图
- java提高篇-----异常(二)
- Zend Studio 修改高亮变量的颜色、括号颜色
- List (迭代器)
- Android程序中安装APP
- Jquery选择兄弟元素
- (十五)责任链模式-代码实现
- 1.3 for语句
- 使用devenv/MSBuild在命令行编译sln或csproj
- java开发之关键字