使用子查询可提升 COUNT DISTINCT 速度 50 倍
2016-06-22 11:15
316 查看
注:这些技术是通用的,只不过我们选择使用Postgres的语法。使用独特的pgAdminIII生成解释图形。Count distinct是SQL分析时的祸根,因此它是我第一篇博客的不二选择。 | Garfielt 翻译于 2年前 3人顶 顶 翻译的不错哦! |
让我们以我们一直使用的一个简单查询开始:哪个图表的用户访问量最大? ? 一千万行数据时,查询需要48秒。要知道原因让我们看一下SQL解析: 它慢是因为数据库遍历了所有日志以及所有的图表,然后join它们,再将它们排序,这些都在真正的group和分组和聚合工作之前。 | Garfielt 翻译于 2年前 3人顶 顶 翻译的不错哦! |
group-聚合后的任何工作代价都要低,因为数据量会更小。group-聚合时我们不需使用dashboards.name,我们也可以先在数据库上做聚集,在join之前: |
正如设计的,group-聚合在join之前。而且,额外的我们可以利用time_on_site_logs表里的索引。
Garfielt
翻译于 2年前
2人顶
顶 翻译的不错哦!
我们可以做的更好。通过在整个日志表上group-聚合,我们处理了数据库中很多不必要的数据。Count distinct为每个group生成一个哈希——在本次环境中为每个dashboard_id——来跟踪哪些bucket中的哪些值已经检查过。 |
Garfielt
翻译于 2年前
2人顶
顶 翻译的不错哦!
呵呵,大发现:这样只需要0.7秒!这比上面的查询快28倍,比原来的快了68倍。 通常,数据大小和类型很重要。上面的例子受益于基数中没多少换算。distinct (user_id, dashboard_id)相对于数据总量来说数量也很少。不同的对数越多,用来group和计数的唯一数据就越多——代价便会越来越大。 下一遇到长时间运行的count distinct时,尝试一些子查询来减负吧。 |
相关文章推荐
- php数组指针学习笔记(一)
- leetcode——Maximal Rectangle
- Unix传奇
- Appnium移动自动化框架初探
- calc()问题
- Java多线程系列--“基础篇”01之 基本概念
- iOS手势识别的简单应用
- Android网络相关(WiFi的开关,WiFi热点的开关,获取手机IP地址等)
- ehcache.xml配置文件详解
- listview.setselection(position)不起作用
- 使用GSON库转换Java对象为JSON对象的进阶实例详解
- 获取当前url地址和目录不包含访问的文件名
- think in java笔记:this关键字
- BASISI系统中如何配置web service
- JavaScript Promise
- 上帝造题的七分钟 [Tyvj 1716]
- 毕向东Java视频学习笔记【day08-继承】
- dlib landmark+人面识别
- trace enabled
- C++泛型和算法