Spark SQL 读取文件并创建临时表教程
使用 Spark SQL 读取文件并创建临时表的步骤如下:\n\n1. 首先,创建一个 SparkSession 对象,该对象是使用 Spark SQL 的入口点。可以使用以下代码创建 SparkSession 对象:\n\n\nfrom pyspark.sql import SparkSession\n\nspark = SparkSession.builder \n .appName("ReadFileAndCreateTempTable") \n .getOrCreate()\n\n\n2. 使用 SparkSession 对象的read方法读取文件并返回一个 DataFrame 对象。可以使用以下代码读取 CSV 文件:\n\n\ndata = spark.read.csv("path_to_file.csv", header=True, inferSchema=True)\n\n\n其中,path_to_file.csv 是文件的路径,header=True 表示第一行是列名,inferSchema=True 表示自动推断列的数据类型。\n\n3. 使用 DataFrame 对象的createOrReplaceTempView 方法将 DataFrame 对象注册为一个临时表。可以使用以下代码创建一个名为temp_table 的临时表:\n\n\ndata.createOrReplaceTempView("temp_table")\n\n\n4. 现在,可以使用 Spark SQL 查询临时表了。可以使用以下代码查询临时表中的数据:\n\n\nresult = spark.sql("SELECT * FROM temp_table")\nresult.show()\n\n\n其中,SELECT * FROM temp_table 是一个 SQL 查询语句,result.show() 用于显示查询结果。\n\n完整的示例代码如下:\n\n\nfrom pyspark.sql import SparkSession\n\nspark = SparkSession.builder \n .appName("ReadFileAndCreateTempTable") \n .getOrCreate()\n\ndata = spark.read.csv("path_to_file.csv", header=True, inferSchema=True)\ndata.createOrReplaceTempView("temp_table")\n\nresult = spark.sql("SELECT * FROM temp_table")\nresult.show()\n\n\n请将path_to_file.csv 替换为实际的文件路径。
原文地址: https://www.cveoy.top/t/topic/ppbk 著作权归作者所有。请勿转载和采集!