Spark API编程动手实战-03-以在Spark 1.2版本实现对Job输出结果进行排序 - stark_summer - ITeye博客

`

Stark_Summer

浏览: 726528 次
性别:
来自: 大连

最近访客更多访客>>

loginboot

街头诗人

ahww520

sz_jack

博主相关

博客

微博

相册

收藏

留言

关于我

文章分类

社区版块

存档分类

最新评论

lixuanbin： iteye已经快要tj了吧。。
iteye为什么不支持markdown?
haorengoodman： Tachyon 能在做数据分类吗？例如我有一坨hdfs文件，将 ...
tachyon与hdfs,以及spark整合
lee3836：求源码，大牛
clover分布式任务调度系统
cfan37： ...
sparksql与hive整合
greemranqq： 9.9 送上，希望博客长久~。~
【【【【【#####>>>>>【关于我】【您·的·支·持·是·我·最·大·的·动·力】<<<<<#####】】】】】

Spark API编程动手实战-03-以在Spark 1.2版本实现对Job输出结果进行排序

博客分类：

spark

sortByKey reduceByKey 位置置换 part-00000 part-00001

阅读更多

从前一篇文章中的wordcount的输出结果可以看出来结果是未经排序的，如何对spark的输出结果进行排序呢？

先对reduceByKey的结果进行key,value位置置换（数字，字符），然后再进行数字排序，再将key，value位置置换后就是排序后的结果了，最终将结果存储到HDFS中

可以发现我们成功对输出结果进行排序！

1
顶

0
踩

分享到：

Spark API编程动手实战-04-以在Spark 1.2 ... | Spark API编程动手实战-02-以集群模式进行 ...

2015-01-29 13:21
浏览 1381
评论(0)
分类:编程语言
查看更多

评论

发表评论

您还没有登录,请您登录后再发表评论

相关推荐

Spark实战高手之路-第5章Spark API编程动手实战（2）: Spark实战高手之路-第5章Spark API编程动手实战（2）

Spark实战高手之路-第5章Spark API编程动手实战（1）: ### Spark实战高手之路-第5章Spark API编程动手实战（1） #### 一、基础知识概述 **Spark**作为一项先进的大数据处理技术，在云计算领域占据着举足轻重的地位。本书《Spark实战高手之路》旨在帮助读者从零开始，...

spark-3.0.0-bin-hadoop2.7-hive1.2.tgz: spark安装包，spark 官网下载的，46%的已解决的问题都是是针对Spark SQL的，包括结构化流和MLlib，以及高层API，包括SQL和DataFrames。在经过了大量优化后，Spark 3.0的性能比Spark 2.4快了大约2倍

Spark实战高手之路-第6章Spark SQL编程动手实战(1): ### Spark实战高手之路-第6章Spark SQL编程动手实战(1) 知识点提炼 #### 一、Spark概述及重要性 - **Spark** 是一种高性能的大数据处理框架，相较于传统的Hadoop MapReduce有着显著的优势，如内存计算、统一的数据...

spark-3.0.2-bin-hadoop2.7-hive1.2.tgz: 在运行Spark之前，需要根据你的集群环境调整`conf/spark-defaults.conf`和`conf/hive-site.xml`等配置文件，以确保与Hadoop和Hive的正确连接。总的来说，Spark 3.0.2与Hadoop 2.7和Hive 1.2的集成为大数据处理提供...

Spark实战高手之路 - Spark亚太研究院.part4.rar: 【Spark亚太研究院系列丛书】Spark实战高手之路-第5章Spark API编程动手实战（1）【Spark亚太研究院系列丛书】Spark实战高手之路-第5章Spark API编程动手实战（2）【Spark亚太研究院系列丛书】Spark实战高手之路-...

Spark实战高手之路 - Spark亚太研究院.part3.rar: 【Spark亚太研究院系列丛书】Spark实战高手之路-第5章Spark API编程动手实战（1）【Spark亚太研究院系列丛书】Spark实战高手之路-第5章Spark API编程动手实战（2）【Spark亚太研究院系列丛书】Spark实战高手之路-...

Spark实战高手之路 - Spark亚太研究院.part2.rar: 【Spark亚太研究院系列丛书】Spark实战高手之路-第5章Spark API编程动手实战（1）【Spark亚太研究院系列丛书】Spark实战高手之路-第5章Spark API编程动手实战（2）【Spark亚太研究院系列丛书】Spark实战高手之路-...

Spark实战高手之路 - Spark亚太研究院.part1.rar: 【Spark亚太研究院系列丛书】Spark实战高手之路-第5章Spark API编程动手实战（1）【Spark亚太研究院系列丛书】Spark实战高手之路-第5章Spark API编程动手实战（2）【Spark亚太研究院系列丛书】Spark实战高手之路-...

spark-2.1.0-bin-without-hadoop版本的压缩包，直接下载到本地解压后即可使用: 在Ubuntu里安装spark，spark-2.1.0-bin-without-hadoop该版本直接下载到本地后解压即可使用。 Apache Spark 是一种用于大数据工作负载的分布式开源处理系统。它使用内存中缓存和优化的查询执行方式，可针对任何规模...

Spark高手之路-Spark SQL编程动手实战: 《Spark高手之路-Spark SQL编程动手实战》是针对大数据处理领域的高级学习资料，旨在帮助读者深入理解Spark框架，特别是其SQL编程方面的应用。本指南涵盖了Spark框架的核心概念、源码解析以及在各种业务场景下的实战...

spark资源 spark-2.3.2-bin-hadoop2.7 tgz文件: 压缩包文件名中提到的“spark-2.3.2-bin-hadoop2.7.tgz”暗示了该压缩包是为了与Hadoop 2.7版本兼容而设计的。Hadoop通常被用作存储和处理大数据的基础设施，而Spark设计为能够利用Hadoop的HDFS（Hadoop Distributed...

spark-3.1.2.tgz & spark-3.1.2-bin-hadoop2.7.tgz.rar: Spark-3.1.2.tgz和Spark-3.1.2-bin-hadoop2.7.tgz是两个不同格式的Spark发行版，分别以tar.gz和rar压缩格式提供。 1. Spark核心概念： - RDD（弹性分布式数据集）：Spark的基础数据结构，是不可变、分区的数据集合...

spark-3.2.4-bin-hadoop3.2-scala2.13 安装包: 在本安装包“spark-3.2.4-bin-hadoop3.2-scala2.13”中，包含了用于运行Spark的核心组件以及依赖的Hadoop版本和Scala编程语言支持。以下是对这些关键组成部分的详细解释： 1. **Spark**: Spark的核心在于它的弹性...

spark-3.1.3-bin-without-hadoop.tgz: Spark Streaming则构建在RDD之上，通过微批处理实现对实时数据流的处理，支持复杂的窗口操作和状态管理。这对于实时监控、在线分析等应用场景非常有用。 MLlib是Spark的机器学习库，包含了多种算法如分类、回归、...

Spark高手之路-API编程动手实战: 通过一个完整的具有代表性的Spark项目来贯穿Spark的方方面面，包括项目的架构设计，用的的技术剖析、开发实现、运维等等。

spark-2.3.0-bin-hadoop2.7版本.zip: 综上所述，"spark-2.3.0-bin-hadoop2.7版本.zip"是一个包含了完整的Spark 2.3.0发行版，集成了Hadoop2.7的环境，可供开发者在本地或集群环境中快速搭建Spark开发和测试环境。这个版本的Spark不仅在核心功能上有所...

spark-3.2.0-bin-hadoop3-without-hive: 总结来说，“spark-3.2.0-bin-hadoop3-without-hive”是一个专注于 Spark 与 Hadoop 3 基础集成的版本，它提供了最新的 Spark 特性，如优化的 SQL 引擎和 DataFrame API，同时也兼容 Hadoop 3 的诸多改进。...

spark-assembly-1.5.2-hadoop2.6.0.jar: 《Spark编程核心组件：spark-assembly-1.5.2-hadoop2.6.0.jar详解》在大数据处理领域，Spark以其高效、易用和灵活性脱颖而出，成为了许多开发者的首选框架。Spark-assembly-1.5.2-hadoop2.6.0.jar是Spark中的一个...

spark-3.0.0-bin-hadoop2.7-hive1.2: spark-3.0.0-bin-hadoop2.7-hive1.2组合为用户提供了在大数据环境下的多种工具和功能，不仅可以处理大规模的数据集，还能进行高效的数据分析和处理。这种集成方式不仅方便了用户的操作，也推动了整个大数据生态的...

Global site tag (gtag.js) - Google Analytics