您的位置：首页 > 其它

spark新能优化之reduceBykey和groupBykey的使用

2016-07-13 17:41 423 查看

val counts = pairs.reduceByKey(_ + _)

val counts = pairs.groupByKey().map(wordCounts => (wordCounts._1, wordCounts._2.sum))

如果能用reduceByKey，那就用reduceByKey，因为它会在map端，先进行本地combine，可以大大减少要传输到reduce端的数据量，减小网络传输的开销。

只有在reduceByKey处理不了时，才用groupByKey().map()来替代。

因为reduceBykey聚合后传输的数据量就变少了,而groupBykey没聚合会传递到taskResult上面数据量比较大

内容来自用户分享和网络整理，不保证内容的准确性，如有侵权内容，可联系管理员处理

标签：

相关文章推荐

SQL优化---SQL执行的先后顺序
android activity跳转
jsp自适应设备屏幕
友盟页面爬虫工具
使用Fiddler测试WebApi接口
Appium移动自动化测试（一）--安装Appium
html&css笔记
第7章 Linux档案与目录管理
Eclipse中Maven Dependencies引入某个jar包显示为文件夹
0712c#第一天C#语言基础介绍与语法入门
Ｏss使用文档 ##[上传，下载]
VxWorks中logMsg与printf的区别
Android依赖注入：Dagger、RoboGuice和ButterKnife比较
第16周啊哈算法水管工铺设管道
Cognos: get output of report
nyoj 30 gone fishing
【git】中vim命令
关于 frame 显示问题，IE 显示正常，但是在火狐中不行的问题
关于Redis数据过期策略
工作总结—HMC5883L应用的一些说明

新的分享

一次教科书级别的Redis高可用架构设计实践 - Redis
曾光：北京这次的毒株不像国内流行类型
从PRD文档到产品上线，有哪些问题需要解决？
vue3自定义指令的使用
Oracle SQL性能优化最常用的40条建议 - ORACLE
程序员翻车常见反应，你中枪了吗？ - 职场生涯
新鲜开源：基于Prometheus的企业监控平台设计与实现 - 运维
嵌入式软件开发之程序架构设计-任务调度
【Java面试】请简单说一下你对受检异常和非受检异常的理解
奇安信更新招股书：第一季亏损过5亿，齐向东持股38%
艾瑞咨询：2020年中国后智能厨房案例研究报告
艾瑞咨询：2020年中国人工智能+物流发展研究报告

章节导航