View a markdown version of this page

适用于 Apache Spark 的 AWS 运行时(emr-spark-8.0 预览版) - Amazon EMR
Amazon Web Services 文档中描述的 Amazon Web Services 服务或功能可能因区域而异。要查看适用于中国区域的差异,请参阅 中国的 Amazon Web Services 服务入门 (PDF)

本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。

适用于 Apache Spark 的 AWS 运行时(emr-spark-8.0 预览版)

下表列出了AWS runtime for Apache Spark(emr-spark-8.0-预览版)中可用的应用程序版本。

应用程序版本信息
应用程序 版本
Spark 4.0.1-amzn-0
适用于 Apache Spark 的 AWS 运行时(emr-spark-8.0 预览版)版本说明
  • 预览版 — 这是AWS runtime for Apache Spark以 Apache Spark 4.0.1 为特色的预览版。此预览仅在 EMR 无服务器上可用。

  • 区域可用性 -此预览版本适用于所有提供 EMR Serverless 的地区,中国和 Amazon GovCloud (美国) Amazon 地区除外。

  • 应用程序版本信息 -此版本附带以下应用程序版本:

    • Amazon Java 软件开发工具包 2.35.5, 1.12.792

    • 蟒蛇 3.9,3.11, 3.12

    • 斯卡拉 2.13.16

    • AmazonCloudWatchAgent 1.300034.0-amzn-0

    • 三角洲 4.0.0-amzn-0-spark

    • 冰山 1.10.0-amzn-spark-0

    • 对于支持 Corretto 17 (JDK 17) 的应用程序,此版本默认附带亚马逊 Corretto 17(基于 OpenJDK 构建)。

  • 预览限制 -以下功能在此预览版本中不可用:

    • 交互和集成功能:U SageMaker nified Studio、EMR Studio 集成、Spark Connect、Livy, JupyterEnterpriseGateway 不支持。

    • 表格格式和访问控制:不支持 Hudi、Delta 通用格式以及带有行级或列级筛选和运算符的精细访问控制 (FGAC)。 DDL/DML

    • 数据连接器:spark-sql-kinesis、emr-dynamodb 和 spark-redshift 连接器不可用。

    • 历史服务器:永久 Spark 历史服务器在此预览版本中不可用。用户仍然可以访问实时 Spark UI 以实时监控和调试有效的无服务器作业。

    • 专业功能:物化视图不可用。

  • 预览功能 -您可以在此预览版本中测试以下功能。不建议将此预览版本用于生产工作负载:

    • SQL 功能:具有更严格类型处理的 ANSI SQL 模式、用于链接操作的 SQL PIPE 语法 (|>)、半结构化 JSON 数据的变体数据类型、使用控制流语句和会话变量的 SQL 脚本编写以及 SQL 用户定义函数。

    • 流媒体增强功能:带有转换WithState 运算符的任意状态处理 API v2、用于可查询流式传输状态的状态数据源读取器(实验性),以及带有改进的 RocksDB 变更日志检查点的增强状态存储。

    • 表格格式支持:支持 VARIANT 数据类型的 Apache Iceberg v Amazon 3、S3 Tables 集成以及 Amazon Lake Formation 适用于 Iceberg、Delta Lake 和 Hive 表的全表访问 (FTA)。

  • 其他文档 -有关其他 Apache Spark 文档,请参阅 Apache Spark 4.0.1 发行文档

开始使用

要开始使用 Apache Spark 4.0.1 预览版,请使用 CLI 创建 EMR 无服务器应用程序: Amazon

aws emr-serverless create-application --type spark \ --release-label emr-spark-8.0-preview \ --region us-east-1 --name spark4-preview