Python etree.xpath不能准确定位HTML
2015-02-21 16:00
633 查看
最近做毕设的时候需要用Python通过XPath从HTML中获取一些值
在大多数网站中是很好用的,今天突然发现在搜狐视频上就获取的不是很正常了
测试代码:
<span style="font-size:18px;">#coding:utf8
from lxml import etree
f = open('sohu.html', 'r')
html = f.read()
f.close()
tree = etree.HTML(html)
container = tree.xpath("//*")
print container</span>输出结果:
<span style="font-size:18px;">[<Element html at 0x25b0b08>, <Element head at 0x25b0b48>, <Element script at 0x25b0f08>, <Element meta at 0x25b0048>, <Element meta at 0x25b00c8>, <Element meta at 0x25b0108>, <Element meta at 0x25b0208>]</span>
可以明显发现只能获取到几个节点,跟优酷的结果完全不同
一直以为是自己xpath写错了,后来发现是搜狐视频首页的编码是GBK,其他能正常获取节点的编码都是UTF-8
改了一下代码:
<span style="font-size:18px;">#coding:utf8
from lxml import etree
import re
f = open('sohu.html', 'r')
html = f.read()
f.close()
html = re.sub(r'charset=(\w*)', 'charset=UTF-8', html)
tree = etree.HTML(html)
container = tree.xpath("//*")
print len(container)</span>最后输出:
<span style="font-size:18px;">3216</span>
搞定!~\(≧▽≦)/~
在大多数网站中是很好用的,今天突然发现在搜狐视频上就获取的不是很正常了
测试代码:
<span style="font-size:18px;">#coding:utf8
from lxml import etree
f = open('sohu.html', 'r')
html = f.read()
f.close()
tree = etree.HTML(html)
container = tree.xpath("//*")
print container</span>输出结果:
<span style="font-size:18px;">[<Element html at 0x25b0b08>, <Element head at 0x25b0b48>, <Element script at 0x25b0f08>, <Element meta at 0x25b0048>, <Element meta at 0x25b00c8>, <Element meta at 0x25b0108>, <Element meta at 0x25b0208>]</span>
可以明显发现只能获取到几个节点,跟优酷的结果完全不同
一直以为是自己xpath写错了,后来发现是搜狐视频首页的编码是GBK,其他能正常获取节点的编码都是UTF-8
改了一下代码:
<span style="font-size:18px;">#coding:utf8
from lxml import etree
import re
f = open('sohu.html', 'r')
html = f.read()
f.close()
html = re.sub(r'charset=(\w*)', 'charset=UTF-8', html)
tree = etree.HTML(html)
container = tree.xpath("//*")
print len(container)</span>最后输出:
<span style="font-size:18px;">3216</span>
搞定!~\(≧▽≦)/~
相关文章推荐
- 7.在用selenium2(WebDriver)做自动化时候,如果有的元素通过ID,Xpath,CSS selector不能定位的解决方案。
- Python中利用xpath解析HTML
- python xpath 提取html 中使用<br>分割的文本
- Python基于lxml模块解析html获取页面内所有叶子节点xpath路径功能示例
- Python中利用xpath解析HTML的方法
- python中 sgmllib 解析html时的问题(不能区分在javascript 的某些字符串)
- python selenium使用xpath定位
- Python lxml解析HTML并用xpath获取元素
- xpath: Python网页爬虫定位辅助利器
- python 使用xpath解析html
- html锚点定位不准确问题
- <Python>页面元素定位方式:xpath----轴定位方式
- python selenium xpath定位方式
- python selenium xpath定位时使用变量
- python3爬虫必学Xpath,快速使用lxml.etree
- Python+Selenium的元素定位方法(xpath)
- Python Xpath 提取html整个元素(标签与内容)
- Python中利用xpath解析HTML
- IE9下Swiper控件不能准确定位到指定页面问题的解决
- python 使用lxml解析html(xpath)