AWSGlue中没有选择XML作为数据源的选项
创始人
2024-09-25 18:01:33
0

AWS Glue 默认不支持使用 XML 字符串或 XML 文件作为数据源。但是可以使用 Spark SQL 的 XML 数据源库来读取 XML 数据。以下是使用 Spark SQL 读取 XML 文件的步骤。

  1. 首先需要将 XML 文件上传到 S3 存储桶中。
  2. 在 AWS Glue 的“Crawlers”页面创建一个新的爬虫,并配置数据源为 S3 存储桶中的 XML 文件。运行该爬虫,让 AWS Glue 自动推断出 XML 文件的模式和架构。
  3. 在 AWS Glue 的“Jobs”页面创建一个新的作业,选择使用 Spark 开发的“Scala”或“Python”语言。
  4. 在作业代码中,可以使用以下代码示例中的 PySpark 代码来读取 XML 文件并将其转换为 DataFrame。
from pyspark.sql.functions import from_xml
from pyspark.sql.types import StructType, StructField, StringType

inputPath = "s3://my-bucket/path/to/xml/file.xml"
outputPath = "s3://my-bucket/path/to/output/folder/"

customSchema = StructType([
    StructField("_id", StringType(), True),
    StructField("title", StringType(), True),
    StructField("author", StringType(), True),
    StructField("description, StringType(), True),
    StructField("price", StringType(), True)
])

df = spark.read.format("xml") \
    .schema(customSchema) \
    .option("rootTag", "books") \
    .option("rowTag", "book") \
    .load(inputPath)

df.write.mode("overwrite").format("parquet").save(outputPath)
  1. 运行作业并等待作业完成。
  2. 生成的 Parquet 文件将保存到 S3 存储桶中的指定路径。

使用以上方法,即可在 AWS Glue 中读取 XML 文件并将其转换为 Parquet 文件。

相关内容

热门资讯

第8分钟辅助!hhpoker的... 第8分钟辅助!hhpoker的辅助是真的吗,wepoker祈福有用吗,讲义教程(有挂解密)1、第8分...
6分钟辅助!hhpoker是真... 6分钟辅助!hhpoker是真的假的,hhpoker真的有透视吗,演示教程(真是有挂)1、每一步都需...
第七分钟辅助!we poker... 第七分钟辅助!we poker插件,we poker免费辅助器,手筋教程(有挂方式)暗藏猫腻,小编详...
七分钟辅助!aa poker辅... 七分钟辅助!aa poker辅助包,pokemmo脚本辅助器下载,讲义教程(有挂秘籍)1、pokem...
第四分钟辅助!wepoker辅... 第四分钟辅助!wepoker辅助器安装包定制,aapoker透视脚本,大纲教程(有挂总结)所有人都在...
第四分钟辅助!wpk透视辅助靠... 第四分钟辅助!wpk透视辅助靠谱吗,wepoker透视苹果系统,诀窍教程(有挂猫腻);运wepoke...
七分钟辅助!aapoker透视... 七分钟辅助!aapoker透视脚本入口,wejoker开挂,学习教程(有挂教程)1、打开软件启动之后...
第四分钟辅助!淘宝买wepok... 第四分钟辅助!淘宝买wepoker透视有用吗,wpk俱乐部怎么作弊,积累教程(有挂规律)1、下载好淘...
6分钟辅助!we-poker软... 6分钟辅助!we-poker软件,购买的wpk辅助在哪里下载,积累教程(有挂技巧)购买的wpk辅助在...
第2分钟辅助!如何下载wepo... 第2分钟辅助!如何下载wepoker安装包,newpoker怎么安装脚本,教程书教程(今日头条)1、...