全文检索引擎Solr系列——整合MySQL、MongoDB
2016-01-11 19:11
676 查看
MySQL
拷贝mysql-connector-java-5.1.25-bin.jar到E:\solr-4.8.0\example\solr-webapp\webapp\WEB-INF\lib目录下面配置E:\solr-4.8.0\example\solr\collection1\conf\solrconfig.xml
创建E:\solr-4.8.0\example\solr\collection1\conf\data-config.xml,指定MySQL数据库地址,用户名、密码以及建立索引的数据表
考虑到数据表中的数据量非常大,比如千万级,不可能一次索引完,因此需要分批次完成,那么查询语句query要设置两个参数:${dataimporter.request.length} ${dataimporter.request.offset}
query=”select id,title,content from blog_blog limit ${dataimporter.request.length} offset ${dataimporter.request.offset}”
请求:http://localhost:8983/solr/collection2/dataimport?command=full-import&commit=true&clean=false&offset=0&length=10000
deltaImportQuery 根据ID取得需要进入的索引的单条数据。
deltaQuery 用于增量索引的sql语句,用于取得需要增量索引的ID。
deletedPkQuery 用于取出需要从索引中删除文档的的ID
为数据库表字段建立域(field),编辑E:\solr-4.8.0\example\solr\collection1\conf\schema.xml:
参考:
/article/3744878.html
http://wiki.apache.org/solr/DataImportHandler#Using_delta-import_command
Mongodb
安装mongo-connector,最好使用手动安装方式:<code>git clone https://github.com/10gen-labs/mongo-connector.git cd mongo-connector #安装前修改mongo_connector/constants.py的变量:设置DEFAULT_COMMIT_INTERVAL = 0 python setup.py install </code>
默认是不会自动提交了,这里设置成自动提交,否则mongodb数据库更新,索引这边没法同时更新,或者在命令行中可以指定是否自动提交,不过我现在还没发现。
配置schema.xml,把mongodb中需要加上索引的字段配置到schema.xml文件中:
<code>mongod --replSet myDevReplSet --smallfiles </code>
初始化:rs.initiate()
启动mongo-connector:
<code>E:\Users\liuzhijun\workspace\mongo-connector\mongo_connector\doc_managers>mongo-connector -m localhost:27017 -t http://localhost:8983/solr/collection2 -n s_soccer.person -u id -d ./solr_doc_manager.py </code>
-m:mongod服务
-t:solr服务
-n:mongodb命名空间,监听database.collection,多个命名空间逗号分隔
-u:uniquekey
-d:处理文档的manager文件
注意:mongodb通常使用
_id作为uniquekey,而Solrmore使用
id作为uniquekey,如果不做处理,索引文件时将会失败,有两种方式来处理这个问题:
指定参数
--unique-key=id到mongo-connector,Mongo Connector 就可以翻译把
_id转换到
id。
把schema.xml文件中的:
<code><uniqueKey>id<uniqueKey> </code>
替换成
<code><uniqueKey>_id</uniqueKey> </code>
同时还要定义一个
_id的字段:
<code><field name="_id" type="string" indexed="true" stored="true" /> </code>
启动时如果报错:
<code>2014-06-18 12:30:36,648 - ERROR - OplogThread: Last entry no longer in oplog cannot recover! Collection(Database(MongoClient('localhost', 27017), u'local'), u'oplog.rs') </code>
清空E:\Users\liuzhijun\workspace\mongo-connector\mongo_connector\doc_managers\config.txt中的内容,需要删除索引目录下的文件重新启动
测试
mongodb中的数据变化都会同步到solr中去。
相关文章推荐
- MongoDB安装过程记录。
- 前端菜鸡之路——mongoDB安装
- 使用C#代码为MongoDB添加2D索引
- NoSQL 之 Morphia 操作 MongoDB
- mongoDB 查询操作
- linux(ubuntu)安装mongodb的命令
- MongoDB查询命令具体解释
- mongoDB性能篇——mongoDB数据库索引
- mongoDB应用篇——固定集合和GridFS文件
- mongoDB基础篇——NoSQL特性及MongoDB数据查询
- 【转】Mongodb的介绍及安装
- mongodb replSet
- win7 环境 mongodb学习
- JAVA单例MongoDB工具类
- 第11期面授mongodb教学大纲(课程已讲)
- MongoDB
- Mac OS install mongodb
- Mongodb 笔记06 副本集的组成、从应用程序连接副本集、管理
- Mongodb 笔记05 创建副本集
- Mongodb 笔记04 特殊索引和集合、聚合、应用程序设计