请描述在 PySpark 环境下,读取一个 CSV 文件并将其转换为 DataFrame 的具体做法与可能用到的参数。
考察说明
考查对 PySpark 数据加载基础操作的掌握程度。
回答思路
- 【回答框架 1】使用 SparkSession 的 read 方法,指定 CSV 文件路径即可加载,例如 spark.read.csv('path'),该方法返回 DataFrame。
- 【回答框架 2】可通过 option 设置分隔符、表头、推断模式等参数,如 .option('header', 'true') 表示第一行为列名,.option('inferSchema', 'true') 自动推断列类型。
- 【回答框架 3】加载后可对 DataFrame 进行列名修改、类型转换或筛选等操作,以满足后续处理需求。
- 【回答框架 4】加载时需注意文件路径支持本地或分布式文件系统,如 HDFS 或 S3。
- 【回答框架 5】若文件有特殊格式,可使用多个 option 组合,或使用 load 方法指定格式。
- 【关键点 1】spark.read.csv 是加载 CSV 的标准方法。
- 【关键点 2】header 和 inferSchema 是常用关键参数。
- 【关键点 3】DataFrame 可直接用于后续转换与行动操作。
- 【易错点 1】忽略文件路径错误或权限问题,导致加载失败。
- 【易错点 2】未设置正确的分隔符或编码,造成数据解析异常。
- 【易错点 3】在集群模式下未使用分布式路径,导致性能低下。