导读一、文件加载1.spark.read.load是加载数据的通用方法,默认加载和保存的是parquet格式文件read可读格式2.spark.read.for....
一、文件加载1. spark.read.load是加载数据的通用方法, 默认 加载和保存的是 parquet 格式文件
read可读格式

2. spark.read.format("…")[.option("…")].load("…")- format("…"):指定加载的数据类型,包括"csv"、"jdbc"、"json"、"orc"、"parquet"和"textFile"。
- load("…"):在"csv"、"jdbc"、"json"、"orc"、"parquet"和"textFile"格式下需要传入加载数据的路径。
- option("…"):在"jdbc"格式下需要传入 JDBC 相应参数,url、user、password 和 dbtable 我们前面都是使用read API 先把文件加载到 DataFrame 然后再查询
也可以直接在文件上进行查询: 文件格式 .` 文件路径 `
spark.sql("select * from json.`文件路径`").show
二、保存数据1.df.write.save 保存数据的通用方法
保存不同格式的数据,可以对不同的数据格式进行设定
2.df.write.format("…")[.option("…")].save("…")- format("…"):指定保存的数据类型,包括"csv"、"jdbc"、"json"、"orc"、"parquet"和"textFile"。
- save ("…"):在"csv"、"orc"、"parquet"和"textFile"格式下需要传入保存数据的路径。
- option("…"):在"jdbc"格式下需要传入 JDBC 相应参数,url、user、password 和 dbtable 保存操作可以使用 SaveMode, 用来指明如何处理数据,使用 mode() 方法来设置。有一点很重要: 这些 SaveMode 都是没有加锁的, 也不是原子操作。
其中SaveMode 是一个枚举类,其中的常量包括: