您的位置:首页 > 编程语言 > Python开发

抽取python 标准库页面生成 mobi 离线文件

2014-08-05 09:57 225 查看
前段时间买了个 kindle ,所以就不想老是开电脑 看 书了。而在学习python 时,看到python 主要的还是熟悉一些库的功能。

所以就想着把标准库给捉下来看。

python 标准库https://docs.python.org/2/library/

下面是一段用来练手的 python 捉取html 内容的代码:

import urllib2
import os
import re

#打开并保存hmtl
def save_html(urlname):
main_url=r'https://docs.python.org/2/library/'
main_dir=r'E:BOOKpythonpython_library'

url=main_url+urlname+'.html'
file_name=main_dir+'\' +urlname+'.html'
try:
req=urllib2.urlopen(url)

urlfile=open(file_name,'w')
urlfile.write(req.read())
except:
print url

finally:
urlfile.close()

#保存主页
save_html('index')

#正则表达式查找链接并保存对应文件
req=urllib2.urlopen(r'https://docs.python.org/2/library/index.html')
p=re.compile(r'''<li class="toctree-.+?"><a class="reference internal" href="(.+?).html">.+?</a></li>''')
matchs=p.findall(req.read())

for row in matchs:
save_html(row)


捉完后,使用了 [ calibre - E-book management ] 把html 转换成mobi 格式的文件。

mobi 下载链接:
http://f.dataguru.cn/forum.php?mod=attachment&aid=MTQ5OTQzfDc1Y2MyMDk5fDE0MDgxNzEzNTB8NDQxMTd8MzM3NjMy
内容来自用户分享和网络整理,不保证内容的准确性,如有侵权内容,可联系管理员处理 点击这里给我发消息
标签: