HDFS 操作命令

  1. 创建目录命令:hdfs dfs -mkdir
  2. 上传文件命令:hdfs dfs -put
  3. 查看文件内容命令:hdfs dfs -cat

YARN 的本质和诞生背景

YARN 的本质是将原来的 JobTracker 分为两个独立的功能模块,分别是资源管理和作业调度。由于 Hadoop 的发展,用户对于大数据的处理需求越来越高,而原来的 MapReduce 模型无法满足这种需求。因此,Hadoop 需要一个新的资源管理框架来支持更多的计算模型和处理方式,YARN 就是为了满足这个需求而被创造出来的。

MapReduce 词频统计示例

对于一行文本'hello hadoop hello world',通过 Map 处理后的形式为:

<'hello',1>, <'hadoop',1>, <'hello',1>, <'world',1>

Hive 表查询操作

有一张 Hive 表名为 person,有身份证字段 (ID),姓名字段 (NAME),年龄字段 (AGE),手机号码字段 (NUM) 等,按要求写出 Hive 查询语句:

  1. 查询年龄大于 18 且小于 60 的人,输出姓名和年龄:
SELECT NAME, AGE FROM person WHERE AGE > 18 AND AGE < 60
  1. 查询手机号码为 139 开头的人,输出身份证号和手机号码:
SELECT ID, NUM FROM person WHERE NUM LIKE '139%'

Shuffle 工作原理

Shuffle 是 MapReduce 中的一个关键步骤,它的作用是将 Map 阶段输出的数据根据 Key 经过一定的处理后分发到 Reduce 阶段,以便进行后续的处理。具体来说,Shuffle 包含三个过程:Partition、Sort 和 Combiner。

  1. Partition 将 Map 输出的 Key-Value 数据按照 Key 进行分区,每个分区对应一个 Reduce Task。
  2. Sort 将每个分区中的数据按照 Key 进行排序。
  3. Combiner 是可选的步骤,它用于在 Map 端对 Key-Value 进行合并以减少数据传输和处理时间。

最终,Shuffle 将排序后的数据按照分区写入磁盘,以供 Reduce Task 进行读取和处理。

HDFS、YARN、MapReduce 和 Hive 操作详解

原文地址: https://www.cveoy.top/t/topic/o0jN 著作权归作者所有。请勿转载和采集!

免费AI点我,无需注册和登录