您的位置：首页 > 编程语言 > Python开发

Python etree.xpath不能准确定位HTML

2015-02-21 16:00 633 查看

最近做毕设的时候需要用Python通过XPath从HTML中获取一些值

在大多数网站中是很好用的，今天突然发现在搜狐视频上就获取的不是很正常了

测试代码：

#coding:utf8
from lxml import etree
f = open('sohu.html', 'r')
html = f.read()
f.close()
tree = etree.HTML(html)
container = tree.xpath("//*")
print container输出结果：
[<Element html at 0x25b0b08>, <Element head at 0x25b0b48>, <Element script at 0x25b0f08>, <Element meta at 0x25b0048>, <Element meta at 0x25b00c8>, <Element meta at 0x25b0108>, <Element meta at 0x25b0208>]

可以明显发现只能获取到几个节点，跟优酷的结果完全不同

一直以为是自己xpath写错了，后来发现是搜狐视频首页的编码是GBK，其他能正常获取节点的编码都是UTF-8

改了一下代码：

#coding:utf8
from lxml import etree
import re
f = open('sohu.html', 'r')
html = f.read()
f.close()
html = re.sub(r'charset=(\w*)', 'charset=UTF-8', html)
tree = etree.HTML(html)
container = tree.xpath("//*")
print len(container)最后输出：
3216

搞定！~\(≧▽≦)/~

内容来自用户分享和网络整理，不保证内容的准确性，如有侵权内容，可联系管理员处理

标签： python etree xpath html

相关文章推荐

新的分享

章节导航