View a markdown version of this page

发布说明和文档历史记录 - Amazon ParallelCluster
Amazon Web Services 文档中描述的 Amazon Web Services 服务或功能可能因区域而异。要查看适用于中国区域的差异,请参阅 中国的 Amazon Web Services 服务入门 (PDF)。

本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。

发布说明和文档历史记录

下表描述了《Amazon ParallelCluster 用户指南》的主要更新和新功能。我们还经常更新文档来处理发送给我们的反馈意见。

Amazon ParallelCluster
更改 描述 日期

Amazon ParallelCluster 版本 3.16.1 已发布

要升级,请输入以下内容:sudo pip install --upgrade aws-parallelcluster。

更改:

  • 将 Slurm 升级到版本 25.11.8(从 25.11.6)。

2026年9月8日

Amazon ParallelCluster 版本 3.16.0 已发布

要升级,请输入以下内容:sudo pip install --upgrade aws-parallelcluster。

增强功能:

  • 将pcluster-diag诊断工具添加到 Amazon ParallelCluster AMI,以便在群集节点上运行按需诊断检查。

  • 通过在暂时性 IMDS 连接故障时重试 EBS 卷附件,提高集群创建的弹性。

  • 通过在重试时重置元数据,进一步减少 RHEL 和 Rocky 上因回购镜像不同步而导致的暂时构建映像故障。

  • 通过重复使用计算节点上已有的头节点驱动编排,消除对 cfn-hup 和 cfn-init 的依赖,提高登录节点上集群更新的弹性。

  • 将所有 Amazon ParallelCluster托管的引导文件移/tmp到专用/opt/parallelcluster/tmp目录中,这样映像构建、集群创建和更新都可以在使用 noexec 挂载/tmp的自定义 AMI 上运行。只有跳过 GdrCopy 安装,映像构建才可以在自定义 AMI 上运行。

  • 禁用fwupd-refresh.timer以提高大规模紧密耦合的工作负载的性能。

更改:

  • ClusterNameValidator现在,验证器在使用时将集群名称限制为 40 个字符ExternalSlurmdbd,这与的现有限制一致。Database这样可以防止 MySQL 的表名长度限制导致的运行时故障。

  • 验证器MultiNetworkInterfacesInstancesValidator现在还涵盖启用了 EFA 的单网卡实例,这些实例通过多个网络接口启动,因此无法自动分配公有 IP。

  • CLI 现在需要额外的权限tag:GetResources,它使用该权限按标签解析登录节点负载均衡器 ARN(请参阅相关的错误修复)。

  • 在 pcluster CLI 中添加对 Python 3.13 的支持。

  • NFSv4-only 在 Amazon ParallelCluster-managed NFS 服务器(头节点)上强制执行。NFSv3 客户端堆栈(rpcbind、rpc-statd、lockd)保持不变,因此群集节点仍然可以挂载外部 NFSv3 服务器。

  • 将默认 NFS 锁定管理器 (lockd) 端口从 32768 更改为 4045,以避免与 Linux 临时端口范围(32768—60999)发生冲突,这可能会导致零星的挂载故障。这仅影响挂载外部 NFSv3 服务器的节点;所有 Amazon ParallelCluster托管存储均通过 NFSv4 挂载且不受影响。如果您限制防火墙中的 NFS 端口,则必须打开 TCP/UDP 4045,否则 NFSv3 挂载将失败。

  • 使用 NVIDIA 本地存储包而不是运行文件安装程序从分发包管理器安装 NVIDIA 驱动程序、CUDA 工具包、架构管理器、NVLSM 和 IMEX。

  • 在操作系统上, RHEL-family 安装用于 DCV GPU 加速的 Xorg 驱动程序并禁用 Wayland 以便 GDM 始终启动 Xorg。现在,在将 NVIDIA 驱动程序安装切换到本地回购包后,这是必需的;以前只有在 Ubuntu 上才需要这样做。

  • 将 NVIDIA 驱动程序、Fabric Manager 和 IMEX 升级到版本 595.71.05(从 580.126.20)。

  • 将 CUDA Toolkit 升级到版本 13.2.2(从 13.0.2)。

  • 将 DCGM 升级到版本 4.6.0(从 4.5.1)。

  • 在 GPU 运行状况检查中,启用 NVIDIA MIG 时跳过 DCGM 诊断,因为 dcgmi diag 不支持 MIG。

  • 将 Slurm 升级到版本 25.11.6(从 25.11.4)。

  • 将 EFA 安装程序升级到 1.49.0(从 1.47.0)。

    • Efa-driver: efa-3.1.0

    • Efa-config: efa-config-1.18-1

    • Efa-profile: efa-profile-1.7-1

    • Libfabric-aws: libfabric-aws-2.4.0-1

    • Rdma-core: rdma-core-63.0-1

    • 打开 MPI:openmpi40-aws-4.1.7-3 和 openmpi50-aws-5.0.9-11

  • 将 mysql-community-client 升级到版本 8.4.10(从 8.4.8)。

  • 在所有区域安装来自 Amazon S3 的 aws-parallelcluster 节点软件包,而不是 PyPI,以支持气隙和代理环境。

  • 从亚马逊 EFS 官方终端节点安装亚马逊 efs-utils,而不是从源代码构建。现在,用户在使用build-image隔离子网时,必须在其 proxy/egress 配置amazon-efs-utils.aws.com中将该 CloudFront 域列入许可名单。

  • 将 Cinc Client 升级到版本 19.3.14(从 18.8.54)。

  • 将 GdrCopy 升级到版本 2.6(从 2.5.2)。

  • 将 pMix 升级到版本 5.0.11(从 5.0.10)。

  • 将 Enroot 升级到版本 4.2.1(从 3.4.1)。

  • 将 Pyxis 升级到版本 0.24.0(从 0.20.0)。

  • 将 stunnel 升级到版本 5.78(从 5.67)。

  • 将 Python 升级到版本 3.14.6(从 3.14.2)。

  • 将 Intel MPI 升级到版本 2021.18.0.749(从 2021.17.2.94 起)。

  • 将 Arm 性能库 (ArmPL) 升级到版本 26.01.1(从 24.10)。

  • 将 aws-cfn-bootstrap 升级到版本 2.0-40(从 2.0-38)。

  • 升级第三方说明书依赖项:

    • line-5.0.0(来自第 4.5.21 行)

    • nfs-5.1.6(来自 nfs-5.1.5)

    • openssh-2.11.17(来自 openssh-2.11.14)

    • yum-8.0.0(来自 yum-7.4.20)

    • yum-epel-5.0.9(来自 yum-epel-5.0.8)

  • 将 FSx for Lustre AutomaticBackupRetentionDays 参数的最大允许值从 35 提高到 90,与亚马逊 FSx 服务限制相匹配。

错误修复:

  • 修复使用登录节点和禁用 CloudWatch 日志记录时集群创建失败的问题。

  • 修复在同一区域同时运行多个创建集群命令时偶尔出现的 Amazon S3 存储桶创建失败(针对名为的存储桶parallelcluster-*-v1-do-not-delete)。

  • 修复通过自定义 Slurm 设置覆盖或集群名称包含大写字母时 ClusterName Slurm 记账引导失败导致的集群创建失败的问题。

  • 从 Slurm 配置中移除已过时的AccountingStorageUser参数,该参数会导致无害的错误消息。

  • 通过让 DCV 服务器决定实例类型的显示编码器来修复 DCV 配置。

  • 通过导出DEBIAN_FRONTEND=noninteractive到子进程,修复 DCV 先决条件安装可能会阻塞交互式提示的问题。

  • 修复了在不支持 GPU 加速时由 DCV 尝试 GL 初始化导致的 Xdcv 段错误。

  • 修复了由于动态链接器无法发现 http-parser 库而无法在 AL2023 上启动 slurmrestd 的问题。

  • 修复计算子网无法到达 DynamoDB 时计算节点引导程序挂起而没有明显错误的问题。

  • 修复 clustermgtd 无法检测到计算节点引导超时,这导致集群无法进入保护模式的问题。

  • 使用按标签解析负载均衡器 ARN tag:GetResources 来修复负载均衡器查询中的竞争条件,这以前会导致带有登录节点的集群更新失败。

  • 当下载的食谱版本与 Amazon ParallelCluster CLI 版本不匹配时,会提pcluster build-image早失败。

  • 修复使用 Amazon EFS 作为内部共享存储类型/opt/parallelcluster/shared时登录节点无法挂载的问题。

  • 修复由于新内核静默 RHEL-family 忽略过时的机制而无法在操作系统(内核 >= 6.4)上禁用 SELinux 的问题。

  • dcgm如果父映像已经安装了版本 fabric-managergdrcopy,则跳过安装、来修复build-image故障。

  • 修复了在启动大量节点时由于最终一致性而更换计算节点的问题。

  • 修复了舰队启动不足以退出保护模式的竞赛条件。当舰队在某些节点启动时向保护模式过渡时发出队列停止命令时,就会触发此竞赛条件。

  • 修复了维护预留中的静态节点在被替换时进入 terminate/relaunch 循环的问题。

  • 修复由 IAM 策略标签条件导致的集群创建和更新失败,这些条件要求parallelcluster:cluster-name标签是请求中的唯一标签,而不仅仅是存在标签。这会影响具有登录节点的集群,也影响了请求中添加 Amazon 或 CloudFormation 附加额外标签时堆栈的创建和更新。

  • 在下载导出的集群和映像日志时防止路径遍历,因此包含../分段的 CloudWatch 日志流名称无法再导致文件写入导出目录之外。

  • 当配置的 Amazon 配置文件不存在时,返回明显的错误而不是意外的致命异常。

  • 缓存 GetPolicy API 调用以缩短具有其他 IAM 策略的集群的验证时间。

弃用:

  • 不再支持亚马逊 Linux 2。

  • Amazon 不再支持批处理作为调度器。

2026年8月20日

Amazon ParallelCluster 版本 3.15.1 已发布

要升级,请输入以下内容:sudo pip install --upgrade aws-parallelcluster。

更改:

  • 修补官方 Amazon ParallelCluster AMI 以解决问题 CVE-2026-31431。

  • 在 Ubuntu 上禁用algif_aead内核模块来解决 CVE-2026-31431。

  • 将除亚马逊 Linux 2 之外的所有操作系统的 NVIDIA 驱动程序升级到版本 580.126.20(从 580.105.08),寻址。 CVE-2025-33219

  • 将除亚马逊 Linux 2 之外的所有操作系统的 NVIDIA Fabric Manager 升级到 580.126.20(从 580.105.08)。

  • 将除亚马逊 Linux 2 之外的所有操作系统的 NVIDIA IMEX 升级到 580.126.20(从 580.105.08)。

2026 年 5 月 28 日

Amazon ParallelCluster 版本 3.15.0 已发布

要升级,请输入以下内容:sudo pip install --upgrade aws-parallelcluster。

增强功能:

  • 为除 AL2 之外的所有操作系统添加对 p6-b300 实例的支持。

  • 将计算节点中的 cfn-hup 替换为 systemd 计时器以支持就地更新,从而大规模提高紧密耦合的工作负载的性能。

  • 禁用dnf-makecache.timer以提高大规模紧密耦合的工作负载 RHEL/Rocky 的性能。

  • 支持集群更新Tags期间的更新。

  • LaunchTemplateOverrides添加到集群配置中,允许通过覆盖计算资源的启动模板来自定义网络接口。

  • 在缺少 clustermgtd 心跳时添加警报。

更改:

  • 启用 EFA 后, Amazon ParallelCluster 现在将网络接口配置为interface和efa-only而不是组合efa类型。这将 IP 地址消耗从每个网卡减少到每个实例一个。

  • 将 Slurm 升级到版本 25.11.4(从 24.11.7)。

  • 将 Pmix 升级到 5.0.10(从 5.0.6)。

  • 将 EFA 安装程序升级到 1.47.0(从 1.44.0)。

  • 将除亚马逊 Linux 2 之外的所有操作系统的 NVIDIA 驱动程序升级到版本 580.105.08(从 570.172.08)。

  • 将 GdrCopy 升级到版本 2.5.2(从 2.4.4)。

  • 将 DCV 升级到版本 2025.0-20103(从 2024.0-19030)。

  • 将除亚马逊 Linux 2 之外的所有操作系统的 CUDA Toolkit 升级到版本 13.0.2(从 12.8.1)。

  • 将除亚马逊 Linux 2 之外的所有操作系统的 Python 升级到 3.14.2(从 3.12.11)。

  • 将 Cinc Client 升级到版本 18.8.54(从 18.7.10)。

  • 将英特尔 MPI 库升级到 2021.17.2(从 2021.16.0 开始)。

  • 将除亚马逊 Linux 2 之外的所有操作系统的 DCGM 升级到版本 4.5.1(从 4.4.1)。

  • 通过在重试时重置元数据,减少 RHEL 和 Rocky 中因存储库镜像不同步而导致的临时构建映像故障。

  • 无论故障情况如何,都务必在集群更新和计算队列状态更新失败时启动 clustermgtd。

  • 提高集群更新回滚工作流程的弹性。

  • 将除亚马逊 Linux 2 之外的所有操作系统的 NVIDIA Fabric 管理器升级到 580.105.08。

  • 将 aws-cfn-bootstrap 升级到版本 2.0-38(从 2.0-33)。

  • 将除亚马逊 Linux 2 之外的所有操作系统的 mysql-community-client 升级到 8.4.8 版(从 8.0.39 版)。

  • 将亚马逊 Linux AMI 的 amazon-efs-utils 升级到 2.4.0 版(从 v2.1.0)。

  • 将 jmespath 升级到 ~=1.0(从 ~=0.10)。

  • 将 tabulate 升级到 <=0.9.0(从 <=0.8.10)。

  • 添加验证器以在计算和登录节点上禁用(通过 DevSettings)就地更新时发出警告。

错误修复:

  • 修复了使用带有隐式主路由表关联的公有子网时 LoginNodes NLB 无法公开访问的问题。

  • 修复了在 GPU 实例和启用 DCV 但无法访问互联网的情况下创建集群时出现的故障。

  • 修复了当 head/compute /login 节点共享同一个安全组时,由于最终一致性导致集群创建间歇性失败的问题。

  • 修复在装有过期操作系统包的 Ubuntu 父映像上安装 ubuntu-desktop 期间的构建映像故障。

  • 修复的验证HeadNode/LocalStorage。此配置参数不支持更新。

  • 修复验证器PlacementGroupCapacityReservationValidator以接受跨账户置放群组的容量预留。

  • 修复 CloudWatch 代理配置,确保正确解析所有日志文件的时间戳。

  • 修复日志配置以捕获所有 Slurm 运行状况检查事件(将日志级别从 “警告” 更新为 “信息” 以防止丢失日志条目)。

  • 通过确保更新期间完成引导的节点更新不会失败,从而提高集群更新弹性。

  • 防止群集更新故障恢复过程在 Amazon 批处理群集上运行。此恢复机制只能在 Slurm 集群上执行。

弃用:

  • 从 3.14.0 版本开始不推荐使用的LoginNodes/Pools/Ssh/KeyName配置参数已不再支持。

  • 这是支持亚马逊 Linux 2 的最后一个 Amazon ParallelCluster 版本,因为亚马逊 Linux 2 将于 2026 年 6 月 30 日终止支持。

  • 这是支持 Amazon 批处理 CLI 的最后一个 Amazon ParallelCluster 版本。从 v3.16.0 开始, Amazon ParallelCluster 将不再支持 Amazon Batch 作为调度器。

2026 年 3 月 23 日

Amazon ParallelCluster 版本 3.14.2 已发布

要升级,请输入以下内容:sudo pip install --upgrade aws-parallelcluster。

更改:

  • 将 munge 升级到版本 0.5.18(从 0.5.16)到地址。 CVE-2026-25506

  • 将安装程序中的 NodeJS 版本升级到版本 22.22.0(从 20.18.3)。

2026 年 2 月 16 日

Amazon ParallelCluster 版本 3.14.1 已发布

要升级,请输入以下内容:sudo pip install --upgrade aws-parallelcluster。

更改:

  • 通过确保 clustermgtd 在更新成功完成后或在队列重新配置成功的更新失败之后启动 clustermgtd 来提高集群更新弹性。

  • 添加 chef 属性cluster/in_place_update_on_fleet_enabled以禁用计算和登录节点上的就地更新,并大规模减轻性能影响。

  • 将 Slurm 升级到版本 24.11.7(从 24.11.6)。

  • 将 Werkzeug 升级到 ~=3.1(从 ~=2.0)到地址。 CVE-2024-34069

  • 将 Connexion 升级到 ~=2.15.1(从 ~=2.13.0)。

  • 将 Flask 升级到 ~=3.1.0(从 >=2.2.5,<2.3)。

  • 如果内核上有 NVIDIA 驱动程序,drm_client_lib请在安装 NVIDIA 驱动程序之前加载内核模块。

  • 通过安装软件包来减少依赖占用量,sssd-common而不是sssd.

  • 将除亚马逊 Linux 2 之外的所有操作系统的 libjwt 升级到 1.18.4 版(从 1.17.0 版)。

  • 将 amazon-efs-utils 升级到版本 2.4.0(从 v2.3.1)。

  • 将 EFA 安装程序升级到 1.44.0(从 1.43.2)。

    • Efa-driver: efa-2.17.3-1

    • Efa-config: efa-config-1.18-1

    • Efa-profile: efa-profile-1.7-1

    • Libfabric-aws: libfabric-aws-2.3.1-1

    • Rdma-core: rdma-core-59.0-1

    • 打开 MPI:openmpi40-aws-4.1.7-2 和 openmpi50-aws-5.0.8-11

错误修复:

  • 修复了由于 cfn-signal 未能发出过期等待条件句柄信号,导致回滚到超过 24 小时的集群状态后,cfn-hup 在头节点上进入无限循环的问题。

  • 修复更新失败后计算节点可能部署错误集群配置版本的竞争条件。

  • 防止由于在检查过程中启动实例而导致集群准备情况检查失败。

  • 修复 CloudWatch 代理配置中 chef-client.log 的时间戳解析不正确的问题。

  • 在构建映像期间禁用 Ubuntu 上的快照自动刷新,以防止间歇性重启失败。

  • 通过仅保存已安装内核的内核包,将 Ubuntu 的 EFA 安装时间缩短约 20 分钟。

  • 添加GetFunction和GetPolicy权限,PClusterBuildImageCleanupRole以防止在删除构建映像堆栈期间出AccessDenied错。

  • 修复DevSettings为空或DevSettings/InstanceTypesData缺少必填字段时的验证错误消息。

2025年12月22日

Amazon ParallelCluster 版本 3.14.0 已发布

要升级,请输入以下内容:sudo pip install --upgrade aws-parallelcluster。

增强功能:

  • 包括 P6e-GB200 和 P6-B200 实例的驱动程序。 ParallelCluster 设置一个 Slurm 拓扑插件来处理。 P6e-GB200 UltraServers有关重要的其他设置要求,请参阅 “限制” 部分。

  • 支持prioritized和capacity-optimized-prioritized分配策略。这允许用户优先考虑子网的放置,以优化成本和性能。

  • 添加对基于内核 6.12(除了 6.1)的亚马逊 Linux 2023 AMI 的build-image支持。

  • 在亚马逊 Linux 2023 上支持 DCV。

  • 当节点无法引导时,Echo chef-client 会在实例控制台中登录。这有助于在 CloudWatch 日志不可用的情况下调查引导故障。

限制:

  • P6e-GB200 实例仅在亚马逊 Linux 2023、Ubuntu 22.04 和 Ubuntu 24.04 上进行测试。

  • 在上使用 IMEX P6e-GB200 需要额外的设置。请参阅我们公共文档中的专用教程。

  • P6-B200 实例仅在亚马逊 Linux 2023、RHEL 8 和 9、Rocky 8 和 9、Ubuntu 22.04 和 Ubuntu 24.04 上进行测试。

  • 不建议 HealthChecks 在 GPU 内存超过 320 GB 的实例中使用 GPU(例如 p6-b200.48xlarge)。运行状况检查持续时间可能超过 10 分钟,这可能会导致作业失败并显著降低任务吞吐量。

更改:

  • 为除亚马逊 Linux 2 之外的所有操作系统安装 nvidia-imex。

  • UnkillableStepTimeout从 slurm.conf 中移除,让 slurm 设置这个值。

  • 将 Lambda 函数使用的 Python 运行时升级到 Python 3.12(从 3.9)。有关 Python 3.9 EOL 的重要信息,请参阅 Lambda 文档。

  • 支持通过新的配置参数对用于头节点内部共享存储的 EFS 文件系统进行加密HeadNode/SharedStorageEfsSettings/Encrypted。

  • 添加验证器,警告不要在 DCV 中使用非 GPU 实例。

  • 将 Slurm 升级到版本 24.11.6(从 24.05.8)。

  • 将 EFA 安装程序升级到 1.43.2(从 1.41.0)。

    • Efa-driver: efa-2.17.2-1

    • Efa-config: efa-config-1.18-1

    • Efa-profile: efa-profile-1.7-1

    • Libfabric-aws: libfabric-aws-2.1.0-5

    • Rdma-core: rdma-core-58.0-1

    • 打开 MPI:openmpi40-aws-4.1.7-2 和 openmpi50-aws-5.0.6-11

  • 将 Cinc Client 升级到版本 18.4.12(从 18.2.7)。

  • 将除亚马逊 Linux 2 之外的所有操作系统的 NVIDIA 驱动程序升级到版本 570.172.08(从 570.86.15)。

  • 将除亚马逊 Linux 2 之外的所有操作系统的 CUDA Toolkit 升级到 12.8.1 版(从 12.8.0)。

  • 将除亚马逊 Linux 2 之外的所有操作系统的 DCGM 升级到版本 4.4.1(从 3.3.6)。

  • 将除亚马逊 Linux 2 之外的所有操作系统的 Python 升级到 3.12.11(从 3.12.8)。

  • 将适用于 Amazon Linux 2 的 Python 升级到 3.9.23(从 3.9.20)。

  • 将英特尔 MPI 库升级到 2021.16.0(从 2021.13.1 开始)。

  • 将 DCV 升级到版本 2024.0-19030。

  • 将官方 ParallelCluster Amazon Linux 2023 AMI 升级到内核 6.12(从 6.1)。

错误修复:

  • 通过部署全局角色来防止build-image堆栈删除失败,该角色在映像构建成功或失败后自动删除build-image堆栈。即使在堆栈被删除之后,该角色也应该存在。参见https://github.com/aws/aws-parallelcluster/issues/5914。

  • 修复了规则同时包含 IPv4 范围 (IpRanges) 和安全组引用 (UserIdGroupPairs) 时安全组验证失败的问题。

  • 修复 Rocky 9 上的build-image故障,这种故障发生在父映像没有在最新 Rocky 次要版本上发布最新的内核版本时。

  • 修复集群 ID 不匹配问题,该问题在使用 slurm 记账时会导致集群更新失败。

  • 修复 CloudWatch 代理启动中可能导致节点引导失败的争用条件。

弃用:

2025 年 9 月 30 日

Amazon ParallelCluster 版本 3.13.2 已发布

要升级,请输入以下内容:sudo pip install --upgrade aws-parallelcluster。

错误修复:

  • 修复了计算资源引用已过期update-cluster且无法通过 EC2 API 访问的容量预留时可能导致和update-compute-fleet失败的错误。

  • 修复 Rocky 9 在父映像未发布最新内核版本时发生的build-image故障。参见https://github.com/aws/aws-parallelcluster/issues/6874。

2025 年 6 月 24 日

Amazon ParallelCluster 版本 3.13.1 已发布

要升级,请输入以下内容:sudo pip install --upgrade aws-parallelcluster。

更改:

  • 将 Slurm 升级到版本 24.05.8。

  • 将 EFA 安装程序升级到 1.41.0(从 1.38.1)。

    • Efa-driver: efa-2.15.0-1

    • Efa-config: efa-config-1.18-1

    • Efa-profile: efa-profile-1.7-1

    • Libfabric-aws: libfabric-aws-2.1.0-1

    • Rdma-core: rdma-core-57.0-1

    • 打开 MPI:openmpi40-aws-4.1.7-2 和 openmpi50-aws-5.0.6

  • 将非亚马逊 Linux AMI 的 amazon-efs-utils 升级到版本 2.3.1(从 v2.1.0)。

  • 在 us-isob-east-1 和 us-iso-east-1 中支持 DCV。

  • 在 us-isob-east-1 和 us-iso-east-1 中支持 Lustre 和 ONTAP 的 FSX。

  • 通过在开始固定,完成时取消固定,确保整个 ParallelCluster 映像构建过程中的内核一致性。

错误修复:

  • 修复了安装 ARM 性能库时导致在 Amazon 绝密和 Amazon 秘密区域中构建映像失败的错误。

  • 修复了阻止脚本 “update_directory_service_password.sh” 更新 AD 密码的错误。

2025 年 6 月 4 日

Amazon ParallelCluster 版本 3.13.0 已发布

要升级,请输入以下内容:sudo pip install --upgrade aws-parallelcluster。

弃用:

  • 这是支持 Ubuntu 20.04 的最后一个 ParallelCluster 版本,因为 Ubuntu 20.04 将于 2025 End-Of-Standard-Support 年 5 月发布。

增强功能:

  • 添加对 Ubuntu 24.04 的支持。

  • 添加对 ap-southeast-7 区域的支持。

  • 禁用官方 ParallelCluster AMI 中未使用的服务 cups 和 wpa_supplicant 以提高安全性。

更改:

  • 将 Slurm 升级到版本 24.05.7。

  • 将除 AL2 之外的所有操作系统的 NVIDIA 驱动程序升级到版本 570.86.15(从 550.127.08)。

  • 将除 AL2 之外的所有操作系统的 CUDA Toolkit 升级到版本 12.8.0(从 12.4.1)。

  • 将除 AL2 之外的所有操作系统的 Python 升级到 3.12.8(从 3.9.20)。

  • 在 Ubuntu 22.04 上,安装与编译内核相同的编译器版本的 Nvidia 驱动程序。

  • 升级aws-cfn-bootstrap到 2.0-33 版。

  • 将 EFA 安装程序升级到 1.38.0(从 1.36.0)。

    • Efa-driver: efa-2.13.0-1

    • Efa-config: efa-config-1.17-1

    • Efa-profile: efa-profile-1.7-1

    • Libfabric-aws: libfabric-aws-1.22.0-1

    • Rdma-core: rdma-core-54.0-1

    • Open MPI:openmpi40-aws-4.1.7-1 和 openmpi50-aws-5.0.5

  • 将 amazon-efs-utils 升级到版本 2.1.0。

  • 移除第三方食谱:apt-7.5.22 和 pyenv-4.2.3。

  • 升级第三方说明书依赖项:

    • line-4.5.21(来自第 4.5.13 行)

    • nfs-5.1.5(来自 nfs-5.1.2)

    • openssh-2.11.14(来自 openssh-2.11.12)

    • yum-7.4.20(来自 yum-7.4.13)

    • yum-epel-5.0.8(来自 yum-epel-5.0.2)

  • 将 Pmix 升级到 5.0.6(从 5.0.3)。

  • 将 ARM PL 升级到版本 24.10(从 23.10)。

  • 在 Lambda 层和安装程序中将 Python 升级到版本 3.12.8(从 3.9.17)。

  • 在 Lambda 层和安装程序中将 NodeJS 升级到版本 20.18.3(从 18.20.3)。

  • 删除以 DSA 身份生成登录节点的 DSA 密钥,这在 OpenSSH 9.7+ 中不再支持。

  • 启动计算节点后,在 Slurm 中设置实例 ID 和实例类型信息。

  • 安装不带 “no-cc-version-check” 选项的 NVIDIA 驱动程序,该选项现已在 NVIDIA 安装程序中弃用。

  • 添加验证器以强制执行最多 10 个登录节点池。

  • 将默认根卷大小更新为 45 GB。

错误修复:

  • 取消使用 cfn-init 进行计算节点引导,以缩短节点扩展时间。

  • 修复了使用代理时导致计算节点引导失败的问题。

  • 在 Ubuntu 22.04 上,使用与编译内核相同的编译器版本安装 Nvidia 驱动程序,以防止安装失败。-修复更新期间仅在头节点上执行覆盖 aws-parallelcluster-node 包的问题。

  • 修复了在多用户环境(与 Active Directory 集成) Pyxis/Enroot 中通过执行的容器化任务会失败的问题。

  • 修复了在使用目录服务时在 Rocky 9.5+ 上使用 authselect 导致节点引导失败的问题。

2025 年 4 月 1 日

Amazon ParallelCluster 版本 3.12.0 已发布

要升级,请输入以下内容:sudo pip install --upgrade aws-parallelcluster。

增强功能:

  • 添加新的编译映像配置部分Build/Installation,即可安装 on/off NVIDIA 软件和 Lustre 客户端。默认情况下,NVIDIA 软件虽然包含在官方 ParallelCluster AMI 中,但不由build-image安装。默认情况下,安装了 Lustre 客户端。

  • CLI 命令export-cluster-logs和现在export-image-logs可以在默认情况下将日志导出到默认 ParallelCluster 存储桶或导出到 Customs3Bucket(如果在配置中指定)。

  • 将 Amazon DCV 支持扩展到 ARM 实例上的 Ubuntu2204。

更改:

  • 将 NVIDIA 驱动程序升级到版本 550.127.08(从 550.90.07)。这解决了 NVIDIA 的一个已知问题。有关更多信息,请参阅 NVIDIA 数据中心文档中的已知问题。

  • 将亚马逊 DCV 升级到版本2024.0-18131。

    • server:2024.0-18131-1

    • xdcv:2024.0.631-1

    • gl:2024.0.1078-1

    • web_viewer:2024.0-18131-1

  • 将 EFA 安装程序升级到 1.36.0。

    • Efa-driver: efa-2.13.0-1

    • Efa-config: efa-config-1.17-1

    • Efa-profile: efa-profile-1.7-1

    • Libfabric-aws: libfabric-aws-1.22.0-1

    • Rdma-core: rdma-core-54.0-1

    • Open MPI:openmpi40-aws-4.1.7-1 和 openmpi50-aws-5.0.5

  • Auto-restart 失败了 slurmctld。

  • 将 mysql-community-client 升级到版本 8.0.39。

  • 移除对生命周期结束的 Python 3.7 和 3.8 的支持。

错误修复:

  • 修复了集群更新期间未检测到自定义操作脚本序列更改的问题。

  • 为 Amazon ParallelCluster API 添加缺失的权限,以便为部署登录节点所需的弹性负载平衡和 Auto Scaling 创建服务关联角色。

  • 修复了我们在管理卷时获取区域的方式存在的问题,以便它可以正确处理本地区域。

  • 修复了在更新AccessPointIds期间添加 EFS 文件系统时会失败的问题。

  • 修复了使用 PCAPI 时,更新非类型参数String(例如)时集群更新可能失败的问题。MaxCount

  • 安装外部 OpenZFS 时,不再需要为端口 111、2049、20001、20002、20003 设置出站规则。

2024 年 12 月 19 日

Amazon ParallelCluster 版本 3.11.1 已发布

功能:

  • Pyxis 现在默认为禁用状态,因此必须按照产品文档中的说明手动启用。

  • 在 ParallelCluster Lambda Layer 中将 Python 运行时升级到 3.12 版。

  • 不再将 setuptools 的版本固定为 70.0.0 之前的版本。

  • 将 libjwt 升级到 1.17.0 版本。

  • 完整更改日志

错误修复

  • 修复了我们在配置 Pyxis Slurm 插件的方式中可能 ParallelCluster 导致任务提交失败的问题。

  • 通过在公共策略模板中添加登录节点所需的缺失权限,修复导致登录节点配置部署失败的问题。https://github.com/aws/aws-parallelcluster/issues/6483

2024 年 10 月 21 日

Amazon ParallelCluster 版本 3.11.0 已发布

增强功能

  • 添加对登录节点上自定义操作的支持。

  • 允许 DCV 连接到登录节点。

  • 添加对 ap-southeast-3 区域的支持。

  • 向登录节点网络负载均衡器添加安全组。

  • 为登录节点添加AllowedIps配置。

  • 添加新配置SharedStorage/EfsSettings/AccessPointId以为挂载指定可选的 EFS 接入点

  • 允许最多 10 个登录节点池。

  • 在官方 pcluster AMI 中安装 enroot 和 pyxis

更改

  • [BREAKING] API DescribeCluster 和 CLI 命令返回的loginNodes字段describe-cluster已从字典更改为数组,以支持多个登录节点池。此更改破坏了向后兼容性,使这些操作与使用旧版本部署的集群不兼容。

  • 将 Slurm 升级到 23.11.10(从 23.11.7)。

  • 将 Pmix 升级到 5.0.3(从 5.0.2)。

  • 将 EFA 安装程序升级到 1.34.0。

    • Efa-driver: efa-2.10.0-1

    • Efa-config: efa-config-1.17-1

    • Efa-profile: efa-profile-1.7-1

    • Libfabric-aws: libfabric-aws-1.22.0-1

    • Rdma-core: rdma-core-52.0-1

    • Open MPI:openmpi40-aws-4.1.6-3 和 openmpi50-aws-5.0.3-11

  • 将 NVIDIA 驱动程序升级到版本 550.90.07(从 535.183.01)。

  • 将 CUDA Toolkit 升级到版本 12.4.1(从 12.2.2)。

  • 将 Python 升级到 3.9.20(从 3.9.19)。

  • 将英特尔 MPI 库升级到 2021.13.1.769(从 2021.12.1.8 起)。

错误修复

  • 修复验证器,EfaPlacementGroupValidator使其不建议在使用容量区块时配置置放群组。

  • 通过确保 FSx for Lustre 文件系统是按照安全组规则创建的,从而修复偶尔出现的集群创建失败问题。

  • 修复启用置放群组时群集删除失败的问题。

  • 修复了限制 SSH 访问时登录节点被标记为不健康的问题。

  • 修复retrieve_supported_regions以便它可以获得正确的 S3 网址。

  • 修复describe_images为使用分页。

  • No route tables found修复了将默认 VPC 子网指定为时的错误 LoginNodes/Networking/SubnetIds。

2024 年 9 月 26 日

Amazon ParallelCluster 版本 3.10.1 已发布

错误修复

  • 修复中国区域的映像构建失败。

2024 年 7 月 8 日

Amazon ParallelCluster 版本 3.10.0 已发布

增强功能:

  • 添加新的配置部分Scheduling/SlurmSettings/ExternalSlurmdbd,将集群连接到外部 Slurmdbd。

  • 在 “ Amazon 绝密” 和 “秘密区域” 中添加对构建映像的 Amazon 支持。

  • 添加对亚马逊 Linux 2023 的支持。

  • 添加对price-capacity-optimized作为的支持AllocationStrategy。

  • 添加验证器以防止使用带有容量区块的置放群组。

更改:

  • 不再支持 CentOS 7。

  • 将 Cinc Client 从 18.2.7 升级到 18.4.12 版本。

  • 将 munge 升级到版本 0.5.16(从 0.5.15)。

  • 将 Pmix 升级到 5.0.2(从 4.2.9)。

  • 升级第三方说明书依赖项:

    • apt-7.5.22(来自 apt-7.5.14)

    • openssh-2.11.12(来自 openssh-2.11.3)

  • 移除第三方食谱:selinux-6.1.12。

  • 将 EFA 安装程序升级到 1.32.0。

    • Efa-driver: efa-2.8.0-1

    • Efa-config: efa-config-1.16-1

    • Efa-profile: efa-profile-1.7-1

    • Libfabric-aws: libfabric-aws-1.21.0-1

    • Rdma-core: rdma-core-50.0-1

    • Open MPI:openmpi40-aws-4.1.6-3 和 openmpi50-aws-5.0.2-12

  • 将 NVIDIA 驱动程序升级到版本 535.183.01(从 535.154.05)。

  • 将 Python 升级到 3.9.19(从 3.9.17)。

  • 将英特尔 MPI 库升级到 2021.12.1.8(从 2021.9.0.43482 开始)。

错误修复:

  • 将 “数据存储库关联” 配置修改为AutoExportPolicy可AutoImportPolicy选配置。

  • 修复了删除集群期间出现的一个问题,该问题现在可以在实例处于关闭或终止状态时完成计算队列清理。这是为了避免终止周期较长的实例类型的集群删除失败。

  • 允许在集群配置Monitoring部分启用 cloudwatch 仪表板并禁用警报。

  • 允许 ParallelCluster 自定义资源禁止使用验证器。PclusterCluster/SuppressValidators

  • 正在删除,/etc/profile.d/pcluster.sh这样就不会在每次用户登录时执行,cfn_bootstrap_virtualenv也不会将其添加到 PATH 环境变量中。

  • 通过将字段failureReason替换为DescribeCluster响应来修复 ParallelCluster API 规范。failures

  • 通过添加缺失的 CloudFormation 堆栈状态来修复 ParallelCluster API 规范:IMPORT_*REVIEW_IN_PROGRESS和UPDATE_FAILED。

  • 修复了阻止群集更新包含传输中加密的 EFS 文件系统的问题。

  • 修复了使用 EFS 共享内部数据时阻止 slurmctld 和 slurmdbd 服务在头节点重启时重新启动的问题。

  • 在 Ubuntu 系统上,删除与来自的配置冲突的 cloud-init 日志文件的默认日志配置文件。 ParallelCluster

  • 使用 RHEL 8.10 或更新版本修复映像构建失败。

2024 年 6 月 27 日

Amazon ParallelCluster 版本 3.9.3 已发布

要进行升级,请键入 sudo pip install --upgrade aws-parallelcluster

功能:

  • 在 us-iso-east-1 中增加了对 FSx Lustre 作为共享存储类型的支持。

错误修复:

  • 从 Slurm 配置的 SlurmctldParameters 中移除 cloud_dns,以避免出现 Slurm 扇出问题。

    这不是必需的,因为我们是在实例启动时设置 IP 地址的。

2024 年 6 月 19 日

Amazon ParallelCluster 版本 3.9.2 已发布

功能:

  • 将 Slurm 升级到 23.11.7(从 23.11.4)。

  • 有关更多详细信息,请参CHANGELOG3.9.2阅 GitHub。

2024 年 5 月 28 日

Amazon ParallelCluster 版本 3.9.1 已发布

要进行升级,请输入以下内容:sudo pip install --upgrade aws-parallelcluster

错误修复

  • 在更新集群操作中卸载文件系统时,移除对共享存储 mountdir 的递归删除。

2024 年 4 月 11 日

Amazon ParallelCluster 版本 3.9.0 已发布

要进行升级,请输入以下内容:sudo pip install --upgrade aws-parallelcluster

增强功能:

  • 添加配置参数 DeploymentSettings/DefaultUserHome,使用户能够将默认用户的主目录移到 /local/home 而不是 /home(默认)。

  • 允许更新 MinCount、MaxCount、Queue 和 ComputeResource 配置参数,而无需停止计算实例集。现在可以通过将 Scheduling/SlurmSettings/QueueUpdateStrategy 设置为 TERMINATE 来更新它们。 Amazon ParallelCluster 只终止通过集群更新调整集群容量时移除的节点。

  • 允许更新 Efs、、类型的外部共享存储 FsxLustre FsxOntap, FsxOpenZfs 且 FileCache 无需更换计算和登录队列。

  • 增加了对 RHEL9 的支持。

  • 增加了对 Rocky Linux 9 的支持,作为通过 build-image 过程创建的 CustomAmi。目前没有公开的官方 Amazon ParallelCluster Rocky9 Linux AMI 可用。

  • CommunicationParameters从 “自定义 Slurm 设置” 拒绝列表中移除。

  • 添加 DeploymentSettings/DisableSudoAccessForDefaultUser 参数,在支持的操作系统中禁用默认用户的 sudo 访问权限。

  • 对适用于 Lustre 文件系统的 FSx 的更改创建者 ParallelCluster:将 Lustre 服务器版本更改为 2.15.

  • 通过 ['cluster']['nvidia']['kernel_open'] cookbook 节点属性,增加在构建 AMI 时选择开放源代码和封闭源代码 Nvidia 驱动程序的可能性。

  • * 添加一个 clustermgtd 配置选项 ec2_instance_missing_max_count,允许对 Amazon EC2 描述实例与运行实例的最终一致性进行可配置的重试次数。

更改

  • 将 Slurm 升级到 23.11.4(从 23.02.7)。

  • 将 NVIDIA 驱动程序升级到版本 535.154.05。

  • 在 pcluster CLI 和 aws-parallelcluster-batch-cli 中添加对 Python 3.11、3.12 的支持。

  • 使用 Amazon EC2 DescribeInstances 响应NetworkCardIndex列表中的网卡索引来构建网络接口,而不是在MaximumNetworkCards范围内循环。

  • 使用 P3、G3、P2 和 G2 类型实例时,集群创建失败,因为其 GPU 架构与 3.8.0 版中引入的开源 Nvidia 驱动程序(OpenRM)不兼容。

  • 升级第三方 cookbook 依赖项:nfs-5.1.2(从 nfs-5.0.0 升级)

  • 将 EFA 安装程序升级到 1.30.0.

    • Efa-driver: efa-2.6.0-1

    • Efa-config: efa-config-1.15-1

    • Efa-profile: efa-profile-1.6-1

    • Libfabric-aws: libfabric-aws-1.19.0

    • Rdma-core: rdma-core-46.0-1

    • Open MPI:openmpi40-aws-4.1.6-2 和 openmpi50-aws-5.0.0-11

  • 将 NICE DCV 升级到版本 2023.1-16388.

    • server:2023.1.16388-1

    • xdcv:2023.1.565-1

    • gl:2023.1.1047-1

    • web_viewer:2023.1.16388-1

错误修复

  • 修复以 Active Directory 用户身份从登录节点提交作业时会失败的问题。该问题是由于在头节点上与外部 Active Directory 集成的配置不完整造成的。

  • 重构 CloudFormation 模板 parallelcluster-policies.yaml 中定义的 IAM 策略,以防止 ParallelCluster 因策略超过 IAM 限制而导致 API 部署失败。

  • 修复当头节点写入密钥的时间超过预期时,登录节点启动失败的问题。

有关更改的详细信息,请参阅上的 aws-parallelcluster- ui 软件包的CHANGELOG文件。 GitHub

2024 年 3 月 5 日

Amazon ParallelCluster 版本 3.8.0 已发布

Amazon ParallelCluster 3.8.0 版本已发布。

增强功能:

  • 增加了对适用于 ML 的 Amazon EC2 容量块的支持。

  • 增加了对 Rocky Linux 8 的支持,作为通过 build-image 过程创建的 CustomAmi。目前没有公开的官方 Amazon ParallelCluster Rocky8 Linux AMI 可用。

  • 添加Scheduling/ScalingStrategy参数以控制在 Slurm 计算节点启动 Amazon EC2 实例时使用的集群扩展策略。可能的值为 all-or-nothing、greedy-all-or-nothing、best-effort,默认值为 all-or-nothing。

  • 添加HeadNode/SharedStorageType参数以使用 EFS 存储而不是从头节点根卷导出的 NFS 导出来传输集群内共享文件系统资源: ParallelCluster、英特尔、Slurm 和数据。/home此增强功能减少了头节点联网的负载。

  • 允许通过配置文件的 SharedStorage 部分将 /home 挂载为 EFS 或 FSx 外部共享存储。

  • 添加新参数SlurmSettings/MungeKeySecretArn以允许使用密钥管理器中用户定义的外部 MUNGE Amazon 密钥。

  • 添加Monitoring/Alarms/Enabled参数以切换集群的亚马逊 CloudWatch警报。

  • 添加头节点警报以监控 Amazon EC2 运行状况检查、CPU 利用率和头节点的整体状态,并将其添加到使用集群创建的 CloudWatch 控制面板中。

  • 将 PERSISTENT_2 用作托管式 FSx for Lustre 的 DeploymentType 时,添加对数据存储库关联的支持。

  • 添加Scheduling/SlurmSettings/Database/DatabaseName参数以允许用户为数据库服务器上的数据库指定自定义名称,以用于 Slurm 记账。

  • 在计算资源中配置 CapacityReservationTarget/CapacityReservationId 时,将 InstanceType 作为可选配置参数。

  • 增加为 Amazon ParallelCluster API 创建的 IAM 角色和策略指定前缀的可能性。

  • 增加了为 Amazon ParallelCluster API 创建的 IAM 角色和策略指定权限边界的可能性。

更改

  • 将 Slurm 升级到 23.02.7(从 23.02.6)。

  • 将 NVIDIA 驱动程序升级到版本 535.129.03。

  • 将 CUDA 工具包升级到版本 12.2.2。

  • 使用开源 NVIDIA GPU 驱动程序(OpenRM)作为 Linux 的 NVIDIA 内核模块,而不是 NVIDIA 封闭源代码模块。

  • 在 Slurm resume 程序中删除对all_or_nothing_batch配置参数的支持,转而使用新的Scheduling/ScalingStrategy群集配置。

  • 将集群警报命名约定更改为“[cluster-name]-[component-name]-[metric]”。

  • 对于根卷和其他卷,将 Amazon 机密和绝密区域中的默认 EBS 卷类型从 gp2 更改为 gp3。

  • 现在,API 的可选权限边界适用于 Amazon ParallelCluster API 基础设施创建的每个 IAM 角色。

    • 将 EFA 安装程序升级到 1.29.1。

    • Efa-driver: efa-2.6.0-1

    • Efa-config: efa-config-1.15-1

    • Efa-profile: efa-profile-1.5-1

    • Libfabric-aws: libfabric-aws-1.19.0-1

    • Rdma-core: rdma-core-46.0-1

    • Open MPI:openmpi40-aws-4.1.6-1

  • 在所有支持的操作系统中,将 GDRCopy 升级到 2.4 版,但 Centos 7 除外,它使用的是 2.3.1 版。

  • 将 aws-cfn-bootstrap 升级到版本 2.0-28。

  • 在 aws-parallelcluster-batch-cli 中添加对 Python 3.10 的支持。

错误修复

  • 修复了在修改计算资源中声明的实例类型列表时,集群更新回滚后扩展配置不一致的问题。

  • 修复了通过集群配置文件与外部 LDAP 服务器集成的集群中切换无 root 权限用户时的用户 SSH 密钥生成问题。

  • 修复了在设置时禁用 Slurm 省电模式的问题。ScaledownIdletime = -1

  • 修复 Slurm Accounting update_slurm_database_password.sh 脚本中 Slurm 安装目录的硬编码路径。

2023 年 12 月 19 日

Amazon ParallelCluster 版本 3.7.2 已发布

Amazon ParallelCluster 版本 3.7.2 已发布。

更改:

  • 将 Slurm 升级到 23.02.6。

2023 年 10 月 25 日

Amazon ParallelCluster 版本 3.7.1 已发布

Amazon ParallelCluster 版本 3.7.1 已发布。

更改:

  • 将 Slurm 升级到 23.02.5(从 23.02.4)。

    • 将 Pmix 升级到 4.2.6(从 3.2.3 升级)。

    • 将 libjwt 升级到 1.15.3(从 1.12.0 升级)。

  • 将 EFA 安装程序升级到 1.26.1,修复 P5 中的 RDMA 写入数据问题。

    • Efa-driver: efa-2.5.0-1.

    • Efa-config: efa-config-1.15-1.

    • Efa-profile: efa-profile-1.5-1.

    • Libfabric-aws: libfabric-aws-1.18.2-1.

    • ERdma-core: rdma-core-46.0-1.

    • Open MPI:openmpi40-aws-4.1.5-4。

2023 年 9 月 22 日

Amazon ParallelCluster 版本 3.7.0 已发布

Amazon ParallelCluster 3.7.0 版本已发布。

增强功能:

  • 支持使用配置 YAML 文件 Amazon ParallelCluster 配置计算资源中的静态和动态节点优先级。

  • 增加了对 Ubuntu 22 的支持。默认情况下不支持 RSA 密钥。

  • 添加了队列配置设置 JobExclusiveAllocation,用于在任何给定时间在分区中以独占模式将节点分配给单个作业。

  • 允许在创建集群和更新集群时覆盖 aws-parallelcluster-node 程序包。对于头节点,这适用于集群更新。仅用于开发目的。

  • 避免在计算节点上启动 NFS 服务器。

  • 添加了对登录节点的支持。

  • 当为 Slurm 计算资源指定了多种实例类型时,允许进行基于内存的调度。

  • 添加了支持,允许将现有 Amazon 文件缓存作为共享存储进行挂载。

更改:

  • 默认情况下,为 Slurm 动态节点分配优先级(权重)为 1000。通过这样做,Slurm 可以优先考虑空闲静态节点而不是空闲的动态节点。

  • 使aws-parallelcluster-node守护程序仅处理 Amazon ParallelCluster 托管的 Slurm 分区。

  • 将 EFS-utils 监视器轮询间隔增加到 10 秒。当 EncryptionInTransit 设置为 true 时(这是导致监视器运行的唯一条件),此更改适用。

  • 将 EFA 安装程序升级到 1.25.1。

    • Efa-driver:efa-2.5.0-1(来自efa-2.1.1g)

    • Efa-config:efa-config-1.15-1(来自efa-config-1.13-1)

    • Efa-profile:efa-profile-1.5-1(无变化)

    • Libfabric-aws:libfabric-aws-1.18.1-0(来自libfabric-aws-1.17.1-1)

    • Rdma-core:rdma-core-46.0-1(来自rdma-core-43.0-1)

    • Open MPI:openmpi40-aws-4.1.5-4(从 openmpi40-aws-4.1.5-1)

  • 将 Slurm 升级到版本 23.02.4。

  • 将默认值 Imds/ImdsSupport 从 v1.0 更改为 v2.0。

  • 弃用 Ubuntu 18。

  • 将默认根卷大小更新为 40 GB,以补偿对 Centos 7 的限制。

  • 限制头节点内文件/ tmp/wait_condition_handle .txt的权限,这样只有超级用户才能读取它。

  • 创建 Slurm 分区节点列表映射 JSON 文件,供节点包守护程序用来识别 Slurm 分区和节点列表。 PC-managed

  • 将 NVIDIA 驱动程序升级到版本 535.54.03。

  • 将 CUDA 库升级到版本 12.2.0。

  • 将 NVIDIA Fabric Manager 升级到 nvidia-fabricmanager-535。

  • 将 ARM PL 升级到版本 23.04.1,仅适用于 Ubuntu 22.04。

  • 将 NICE DCV 升级到版本 2023.0-15487。

    • Server:2023.0.15487-1

    • xdcv:2023.0.551-1

    • gl:2023.0.1039-1

    • web_viewer:2023.0.15487-1

错误修复:

  • 为 ScaledownIdletime 值添加验证功能,以防止设置的值低于 -1。

  • 修复了在启用 DCV 的 GPU 实例上使用 Ubuntu 深度学习 AMI 创建集群失败的问题。

  • 修复了在使用 CustomLambdaRole创建 ParallelCluster CloudFormation 自定义资源提供商时导致创建悬而未决的 IAM 策略的问题。

  • 修复了使用等于 True 的 SlurmSettings/Dns/UseEc2Hostnames 时导致具有多个网络接口的实例上的计算节点 DNS 名称不一致的问题

有关更改的详细信息,请参阅上的 aws-parallelcluster、aws-parallelcluster -cookbook 和 aws-parallel cluster 节点软件包的CHANGELOG文件。 https://github.com/aws/aws-parallelcluster-node/releases/tag/v3.7.0 GitHub

2023 年 8 月 30 日

仅文档发布

Amazon ParallelCluster 已发布第 3 版特定用户指南。

仅文档发布:

  • Amazon ParallelCluster 版本 3 有自己的单独用户指南。

2023 年 7 月 17 日

Amazon ParallelCluster 版本 3.6.1 已发布

Amazon ParallelCluster 版本 3.6.1 已发布。

更改:

  • 避免将计算节点添加到多个 Slurm 分区clustermgtd时出现的重复节点。

错误修复:

  • 删除根卷设备名称(/dev/sda1和/dev/xvda)的硬编码,然后从期间create-cluster使用的 AMI 中检索该名称。

  • 修复使用ElasticIp设置为的 CloudFormation 自定义资源时集群创建失败的问题True。

  • 修复使用包含大型配置文件的 Amazon CloudFormation 自定义资源时集群创建和更新失败的问题。

  • 修复了无法在 Ubuntu 上禁用 ptrace 保护并且不允许在 libfabric 中进行跨内存附加 (CMA) 的问题。

  • 修复了使用多个实例类型且未返回任何实例时的快速容量不足故障转移逻辑。

有关更改的详细信息,请参阅上的 aws-parallelcluster、aws-parallelcluster -cookbook 和 aws-parallel cluster 节点软件包的CHANGELOG文件。 https://github.com/aws/aws-parallelcluster-node/blob/v3.6.1/CHANGELOG.md GitHub

2023 年 7 月 5 日

Amazon ParallelCluster 版本 3.6.0 已发布

Amazon ParallelCluster 版本 3.6.0 已发布。

文档:

增强功能:

更改:

  • 将 Slurm 升级到版本23.02.2(从版本22.05.8)。

  • 将 munge 升级到版本 0.5.15(从版本 0.5.14)。

  • 将 Slurm 设置为 30 TreeWidth。

  • 将 Slurm prolog 和epilog配置分别设置为目标目录/opt/slurm/etc/scripts/prolog.d/和。/opt/slurm/etc/scripts/epilog.d/

  • 将 Slurm BatchStartTimeout 设置为在计算节点注册期间运行Prolog脚本的最大时间 3 分钟。

  • 将 CloudWatch 日志RetentionInDays的默认值从 14 天增加到 180 天。

  • 将 EFA 安装程序升级到 1.22.1。

    • Dkms:2.8.3-2

    • Efa-driver:efa-2.1.1g(无变化)

    • Efa-config:efa-config-1.13-1(无变化)

    • Efa-profile:efa-profile-1.5-1(无变化)

    • Libfabric-aws:libfabric-aws-1.17.1-1(来自libfabric-aws-1.17.0-1)

    • Rdma-core:rdma-core-43.0-1(无变化)

    • Open MPI:openmpi40-aws-4.1.5-1(无变化)

  • 在 Amazon Linux 2 上将 Lustre 客户端版本升级到 2.12。Lustre 客户端 2.12 已经安装在 Ubuntu 20.04、18.04 和 CentOS >= 7.7 上。

  • 在 CentOS 7.6 上将 Lustre 客户端版本升级到 2.10.8。

  • 将 NVIDIA 驱动程序升级到版本 470.182.03(从版本 470.141.03)。

  • 将 NVIDIA Fabric Manager 升级到版本 470.182.03(从版本 470.141.03)。

  • 将 NVIDIA CUDA Toolkit 升级到版本 11.8.0(从版本 11.7.1)。

  • 将 NVIDIA CUDA 示例升级到版本 11.8.0。

  • 将 Intel MPI Library 升级到 2021 年版更新 9(从 2021 年版更新 6)。有关更多信息,请参阅 Intel® MPI Library 2019 更新 9。

  • 将 NICE DCV 升级到版本 2023.0-15022(从版本 2022.2-14521)。

    • server:2023.0.15022-1(从版本 2022.2-14521-1)。

    • xdcv:2023.0.547-1(从版本 2022.2.519-1)。

    • gl:2023.0.1027-1(从版本 2022.2.1012-1)。

    • web_viewer:2023.0.15022-1(从版本 2022.2.14521-1)。

  • 将 aws-cfn-bootstrap 升级到版本 2.0-24。

  • 升级为 Amazon 批处理集群构建容器镜像时 CodeBuild 环境使用的镜像:

    • aws/codebuild/amazonlinux2-x86_64-standard:4.0(从 aws/codebuild/amazonlinux2-x86_64-standard:3.0)。

    • aws/codebuild/amazonlinux2-aarch64-standard:2.0(从 aws/codebuild/amazonlinux2-aarch64-standard:1.0)。

错误修复:

  • 修复了 Amazon EFS 和 Amazon FSx 网络安全组验证器以避免误报错。

  • 修复了 Image Builder 在 build-image 操作期间创建的资源缺少标记的问题。

  • 修复了 MaxCount 的更新策略,使其始终对 MaxCount 属性进行数值比较。

  • 修复了具有多个网卡的计算节点实例上的 IP 一致性问题。

  • 修复了StoragePass在执行队列参数更新和 Slurm 记账配置未更新slurm_parallelcluster_slurmdbd.conf时替换的问题。

  • 修复了使用现有 EFS 文件系统创建集群时导致创建虚安全组的问题。

  • 修复了重启 cfn-hup 进程守护程序时导致其失败的问题。

  • 将带有INVALID_REG标志的动态节点视为 Slurm 保护模式的引导故障。在 Slurm 注册失败的静态节点之后,已被视为引导失败。node_replacement_timeout

有关更改的详细信息,请参阅上的 aws-parallelcluster、aws-parallelcluster -cookbook 和 aws-parallel cluster 节点软件包的CHANGELOG文件。 https://github.com/aws/aws-parallelcluster-node/blob/v3.6.0/CHANGELOG.md GitHub

2023 年 5 月 22 日

Amazon ParallelCluster 版本 3.5.1 已发布

Amazon ParallelCluster 3.5.1 版本已发布。

增强功能:

更改:

  • 将 EFA 安装程序升级到 1.22.0。

    • Efa-driver:efa-2.1.1g(来自efa-2.1.1-1)

    • Efa-config:efa-config-1.13-1(来自 efa-config-1.12-1)

    • Efa-profile:efa-profile-1.5-1(无变化)

    • Libfabric-aws:libfabric-aws-1.17.0-1(来自libfabric-aws-1.16.1amzn3.0-1)

    • Rdma-core:rdma-core-43.0-1(无变化)

    • Open MPI:openmpi40-aws-4.1.5-1(从 openmpi40-aws-4.1.4-3)

    将 NICE DCV 升级到版本 2022.2-14521。

    • server:2022.2.14521-1

    • xdcv:2022.2.519-1

    • gl:2022.2.1012-1

    • web_viewer:2022.2.14521-1

错误修复:

  • 修复了在集群更新过程中删除共享 Amazon EBS 卷时因 MountDir 和 /etc/exports 之间的模式匹配而导致的潜在节点启动失败问题。

  • 修复了每次 clustermgtd 迭代时 compute_console_output 日志文件被截断的问题。

有关更改的详细信息,请参阅上的 aws-parallelcluster、aws-parallelcluster -cookbook 和 aws-parallel cluster 节点软件包的CHANGELOG文件。 https://github.com/aws/aws-parallelcluster-node/blob/v3.5.1/CHANGELOG.md GitHub

2023 年 3 月 29 日

Amazon ParallelCluster 3.5.0 版本已发布

Amazon ParallelCluster 3.5.0 版本已发布。

增强功能:

  • 使用 Amazon ParallelCluster UI 访问和管理集群。

  • 在可在工作负载中引用的 CloudFormation 模板中添加版本控制 Amazon ParallelCluster 策略。

  • 添加一个可以与自己的代码一起使用的 Amazon ParallelCluster Python 库。

  • 在计算节点引导失败时向 Amaz CloudWatch on 添加计算节点控制台输出的日志记录。

  • 集群创建失败时向 describe-cluster 输出中添加了包含失败代码和原因的失败字段。

  • 添加了验证器以防止在调用子进程模块时注入恶意字符串。

  • 在配置静态节点时,如果集群状态更改为 PROTECTED,则集群创建将失败。

更改:

  • 升级到 Slurm 版本22.05.8(从版本)22.05.7

  • 将 EFA 安装程序升级到 1.21.0。

    • Efa-driver:efa-2.1.1-1(来自efa-2.1)

    • Efa-config:efa-config-1.12-1(来自 efa-config-1.11-1)

    • Efa-profile:efa-profile-1.5-1(无变化)

    • Libfabric-aws:libfabric-aws-1.16.1amzn3.0-1(来自libfabric-aws-1.16.1)

    • Rdma-core:rdma-core-43.0-1(来自rdma-core-43.0-2)

    • Open MPI:openmpi40-aws-4.1.4-3(无变化)

  • 使 Slurm 控制器日志更加详细,并为 Slurm 省电插件启用额外的日志记录。

错误修复:

  • 通过验证启用 Slurm 记账时集群名称不超过 40 个字符来修复集群数据库的创建问题。

  • 修复了在 clustermgtd Amazon EC2 实例状态检查失败时导致通过 Slurm 重启的计算节点被替换的问题。

  • 修复了由于头节点上的 IAM 策略不正确而导致与其他账户共享容量预留的计算节点无法启动的问题。

有关更改的详细信息,请参阅上的 aws-parallelcluster、aws-parallelcluster-cookbook、 aws-parallelclust er-node 和 aws-parallelcluster- ui 软件包的CHANGELOG文件。https://github.com/aws/aws-parallelcluster-node/blob/v3.5.0/CHANGELOG.md https://github.com/aws/aws-parallelcluster-ui/releases/tag/2023.02 GitHub

2023 年 2 月 20 日

Amazon ParallelCluster 版本 3.4.1 已发布

Amazon ParallelCluster 版本 3.4.1 已发布。

错误修复:

  • 修复 Slurm 调度器问题,该问题可能导致错误地应用其计算节点内部注册表的更新。如果发生此问题,EC2 实例可能会变得不可用,或者可能由不正确的实例类型提供支持。

有关更改的详细信息,请参阅上的 aws-parallelcluster、aws-parallelcluster -cookbook 和 aws-parallel cluster 节点软件包的CHANGELOG文件。 https://github.com/aws/aws-parallelcluster-node/blob/v3.4.1/CHANGELOG.md GitHub

2023 年 1 月 13 日

Amazon ParallelCluster 版本 3.4.0 已发布

Amazon ParallelCluster 版本 3.4.0 已发布。

增强功能:

  • 增加了对跨多个可用区启动节点的支持,以提高容量可用性。

  • 增加了对为每个队列指定多个子网的支持,以提高容量可用性。

  • 在 Iam/中添加新的配置参数 ResourcePrefix,为创建的 IAM 资源的路径和名称指定前缀 Amazon ParallelCluster。

  • 添加新的配置部分 DeploymentSettings/,LambdaFunctionsVpcConfig用于指定 Amazon ParallelCluster Lambda 函数使用的 Vpc 配置。

  • 添加了指定要在集群更新期间在头节点中运行的自定义脚本的功能。使用 Slurm 作为调度器OnNodeUpdated时,可以使用 HeadNode CustomActions//来指定脚本。

更改:

  • 取消为现有文件系统创建 Amazon EFS 挂载目标。

  • 使用 amazon-efs-utils 挂载 EFS 文件系统。可以使用传输中加密和 IAM 授权用户来挂载 EFS 文件系统。

  • 在 Centos7 和 Ubuntu 上安装 stunnel 5.67 以支持 EFS 传输中加密。

  • 将 EFA 安装程序升级到 1.20.0(从 1.18.0)。

    • Efa-driver:efa-2.1(来自efa-1.16.0-1)

    • Efa-config:efa-config-1.11-1(无变化)

    • Efa-profile:efa-profile-1.5-1(无变化)

    • Libfabric-aws:libfabric-aws-1.16.1(来自libfabric-aws-1.16.0~amzn4.0-1)

    • Rdma-core: rdma-core-43.0-2 来自 (rdma-core-41.0-2)

    • Open MPI:openmpi40-aws-4.1.4-3(从 openmpi40-aws-4.1.4-2)

  • 将 Slurm 升级到版本 22.05.7(从 22.05.5)。

  • 将 Python 升级到 3.9.16 和 3.7.16(从 3.9.15 和 3.7.13)。

  • 使用 Slurm22.05.7,处于IDLE+CLOUD+COMPLETING+POWER_DOWN+NOT_RESPONDING状态的动态节点不被认为是不健康的。

有关更改的详细信息,请参阅上的 aws-parallelcluster、aws-parallelcluster -cookbook 和 aws-parallel cluster 节点软件包的CHANGELOG文件。 https://github.com/aws/aws-parallelcluster-node/blob/v3.4.0/CHANGELOG.md GitHub

2022 年 12 月 22 日

Amazon ParallelCluster 版本 3.3.1 已发布

Amazon ParallelCluster 版本 3.3.1 已发布。

更改:

  • 在亚马逊 EC2 弃用两年后,官方 Amazon ParallelCluster 产品 AMI 现已上市。

  • 将 Amazon ParallelCluster API Lambda 的内存大小增加到 2048,以减少冷启动罚款并避免超时。

错误修复:

  • 在进行包括更改计算实例集子网 ID 的集群更新时,防止替换托管的 FSx for Lustre 文件系统并防止数据丢失。

  • SharedStorage DeletionPolicy 适用于集群更新操作。

有关更改的详细信息,请参阅上的 aws-parallelcluster 软件包CHANGELOG文件。 GitHub

2022 年 12 月 2 日

Amazon ParallelCluster 仅限文档 hpc6id 注意事项

Amazon ParallelCluster 仅限文档的更新

2022 年 12 月 2 日

Amazon ParallelCluster 版本 3.1.5 已发布

Amazon ParallelCluster 版本 3.1.5 已发布。

增强功能:

  • 修复了阻止空闲节点终止的 Slurm 问题。

  • 将 EFA 安装程序升级到 1.18.0

    • Efa-driver: efa-1.16.0-1

    • Efa-config:efa-config-1.11-1(来自efa-config-1.9-1)

    • Efa-profile:efa-profile-1.5-1(无变化)

    • Libfabric-aws:libfabric-aws-1.16.0~amzn4.0-1(来自libfabric-1.13.2)。

    • Rdma-core:rdma-core-41.0-2(来自rdma-core-37.0)

    • Open MPI:openmpi40-aws-4.1.4-2(从 openmpi40-aws-4.1.1-2)

更改:

  • 在 Amazon ParallelCluster API 堆栈中添加lambda:ListTags和lambda:UntagResourceParallelClusterUserRole用于集群更新的。

  • 将 Intel MPI Library 升级到 2021 年版更新 6(从 2021 年版更新 4)。有关更多信息,请参阅 Intel® MPI Library 2021 更新 6。

  • 将 NVIDIA 驱动程序升级到版本 470.141.03(从 470.103.01)。

  • 将 NVIDIA Fabric Manager 升级到版本 470.141.03(从 470.103.01)。

有关更改的详细信息,请参阅上的 aws-parallelcluster、aws-parallelcluster -cookbook 和 aws-parallel cluster 节点软件包的CHANGELOG文件。 https://github.com/aws/aws-parallelcluster-node/blob/v3.1.5/CHANGELOG.md GitHub

2022 年 11 月 16 日

Amazon ParallelCluster 版本 3.3.0 已发布

Amazon ParallelCluster 3.3.0 版本已发布。

增强功能:

  • 使用 Slurm 作为调度器时,添加对计算资源多实例分配配置的支持。有关更多信息,请参阅使用 Slur m 进行多实例类型分配。

  • 增加了对使用更新配置进行集群更新时添加和删除 SharedStorage 的支持。有关更多信息,请参阅共享存储。

  • 为 Efs 和FsxLustre共享存储设置添加新的配置参数DeletionPolicy以支持存储保留。

  • 使用新的配置参数 Scheduling/SlurmSettings/Database 添加对 Slurm 记账的支持。有关更多信息,请参阅使用 Slurm 记账。 Amazon ParallelCluster

  • 添加对 On-Demand 容量预留 (ODCR) 和容量预留资源组的支持。有关更多信息,请参阅使用 On-Demand 容量预留 (ODCR) ./launch-instances-odcr-v3.html 启动实例。

  • 添加新的配置参数以指定要在集群中支持的 IMDS 版本或在集群中构建镜像基础架构 Imds/ImdsSupport和构建 Imds/ImdsSupport配置。

  • PlacementGroup在/ComputeResources部分添加对网络 SlurmQueues/的支持。

  • 增加了对具有多个网络接口并且每个设备仅限一个 ENI 的实例的支持。

  • 通过检查附加的安全组中的 CIDR 块,改进了外部 Amazon EFS 文件系统的网络验证。

  • 添加了用于检查配置的实例类型是否支持置放群组的验证器。

  • 将 NFS 线程数配置为 min(256, max(8, num_cores * 4)) 以确保更好的稳定性和性能。

  • 将 NFS 安装移至构建时以减少配置时间。

  • 为部署 Amazon ParallelCluster API 时创建的 EcrImageBuilder SNS 主题启用服务器端加密,用于通知 docker 镜像构建事件。

更改:

  • 更改 SlurmQueues/Networking/PlacementGroup/的行为Enabled。现在,它会为每个计算资源创建一个唯一的托管置放群组,而不是为所有计算资源创建一个托管置放群组。

  • 添加对 SlurmQueues/网络/PlacementGroup/名称作为首选命名方法的支持。

  • 将头节点标签从启动模板移动到了实例定义中,以避免在标签更新时替换头节点。

  • 通过 cloud-init 执行的脚本而不是通过启动模板中设置的 CpuOptions 禁用多线程处理。

  • 在 API 基础架构、API Docker 容器和集群 Lambda 资源中将 Python 升级到版本 3.9,将 NodeJS 升级到版本 16。

  • 在 aws-parallelcluster-batch-cli 中删除了对 Python 3.6 的支持。

  • 将 Slurm 升级到版本 22.05.5(从 21.08.8-2)。

  • 将 NVIDIA 驱动程序升级到版本 470.141.03(从 470.129.06)。

  • 将 NVIDIA Fabric Manager 升级到版本 470.141.03(从 470.129.06)。

  • 将 NVIDIA CUDA Toolkit 升级到版本 11.7.1(from 11.4.4)。

  • 将 v Amazon ParallelCluster irtualenvs 中使用的 Python 从升级到。3.7.13 3.9.15

  • 将 EFA 安装程序升级到版本 1.18.0。

    • Efa-driver:efa-1.16.0-1(无变化)

    • Efa-config: efa-config-1.11-1 (from efa-config-1.10-1)

    • Efa-profile:efa-profile-1.5-1(无变化)

    • Libfabric-aws:libfabric-aws-1.16.0~amzn4.0-1(来自libfabric-aws-1.16.0~amzn2.0-1)。

    • Rdma-core:rdma-core-41.0-2(来自rdma-core-37.0)

    • Open MPI:openmpi40-aws-4.1.4-2(从 openmpi40-aws-4.1.1-2)

  • 将 NICE DCV 升级到版本 2022.1-13300(从 2022.0-12760)。

  • 为 Queues 启用 SingleSubnetValidator 抑制。

  • 当节点处于 COMPLETING 状态时不替换 DRAIN 节点,因为 Epilog 可能仍在运行。

错误修复:

  • 修复了在传递不正确的过滤器时 Amazon ParallelCluster ListClusterLogStreams命令中过滤器参数验证失败的问题。

  • 修复了参数 SharedStorage/EfsSettings与其他 SharedStorage/EfsSettings参数一起指定FileSystemId时验证失败的问题。以前不包括 FileSystemId。

  • 修复了在配置中更改 SharedStorage 的顺序以及进行其他更改时的集群更新问题。

  • 在 Amazon ParallelCluster API UpdateParallelClusterLambdaRole 中修复了将日志上传到的错误 CloudWatch。

  • 修复了在执行任何说明书之前安装程序包时 Cinc 不使用本地 CA 证书捆绑包的问题。

  • 修复了在设置 Build:UpdateOsPackages:Enabled:true 后使用 pcluster build-image 升级 ubuntu 时出现的挂起问题。

  • 修复了 YAML 集群配置分析在遇到重复密钥时失败的问题。

有关更改的详细信息,请参阅上的 aws-parallelcluster、aws-parallelcluster -cookbook 和 aws-parallel cluster 节点软件包的CHANGELOG文件。 https://github.com/aws/aws-parallelcluster-node/blob/v3.3.0/CHANGELOG.md GitHub

2022 年 11 月 2 日

Amazon ParallelCluster 添加了仅限文档的 API 参考。

Amazon ParallelCluster 仅限文档的更新

2022 年 10 月 27 日

Amazon ParallelCluster 版本 3.2.1 已发布

Amazon ParallelCluster 版本 3.2.1 已发布。

增强功能:

  • 改进了逻辑,使主机路由表与不同网卡关联,从而更好地支持具有多个 NIC 的 Amazon EC2 实例。

更改:

  • 将 NVIDIA 驱动程序升级到版本 470.141.03。

  • 将 NVIDIA Fabric Manager 升级到版本 470.141.03。

  • 禁用可能对节点性能产生负面影响的 cron 作业任务 man-db 和 mlocate。

  • 将 Intel MPI Library 升级到 2021.6.0.602。

  • 将 Python 从 3.7.10 升级到 3.7.13 以应对这种安全风险。

错误修复:

  • 避免集群配置不可用时 DescribeCluster 失败。

有关更改的详细信息,请参阅上的 aws-parallelcluster、aws-parallelcluster -cookbook 和 aws-parallel cluster 节点软件包的CHANGELOG文件。 https://github.com/aws/aws-parallelcluster-node/blob/v3.2.1/CHANGELOG.md GitHub

2022 年 10 月 3 日

Amazon ParallelCluster 版本 3.2.0 已发布

Amazon ParallelCluster 3.2.0 版本已发布。

增强功能:

更改:

  • 将 EFA 安装程序升级到版本 1.17.2。

    • EFA 驱动程序:efa-1.16.0-1

    • EFA 配置:efa-config-1.10-1

    • EFA 配置文件:efa-profile-1.5-1

    • Libfabric:libfabric-aws-1.16.0~amzn2.0-1

    • RDMA 内核:rdma-core-41.0-2

    • Open MPI:openmpi40-aws-4.1.4-2

  • 将 NICE DCV 升级到版本 2022.0-12760。

  • 将 NVIDIA 驱动程序升级到版本 470.129.06。

  • 将 NVIDIA Fabric Manager 升级到版本 470.129.06。

  • 将根卷和其他卷中的默认 EBS 卷类型从 gp2 更改为 gp3。

  • 对适用于 Lustre 文件系统的 FSx 的更改创建者: Amazon ParallelCluster

    • 将默认部署类型更改为 Scratch_2。

    • 将 Lustre 服务器版本更改为 2.12。

  • 传递现有 PlacementGroup/true时不需要将PlacementGroup/En abled 设置为Id。

  • 当 PlacementGroup/Enabled 显式设置为 false 时,不允许设置 PlacementGroup/Id。

  • 为 Amazon ParallelCluster创建的所有资源添加标签 parallelcluster:cluster-name。

  • 添加lambda:ListTags和 t lambda:UntagResource o ParallelClusterUserRole 供 Amazon ParallelCluster API 堆栈使用以进行集群更新。

  • 启用配置参数 HeadNode/Imds/Secured 后,将 IPv6 对 IMDS 的问权限限制为仅根用户和集群管理员用户。

  • 对于自定义 AMI,使用 AMI 根卷大小而不是 ParallelCluster默认的 35 GiB。可以在集群配置文件中更改该值。

  • 当配置参数 Scheduling/SlurmQueues/ComputeResources/SpotPrice 低于所需的最低竞价型请求履行价格时,自动禁用计算实例集。

  • 在更新期间添加或删除某个部分时,在更改集中显示 requested_value 和 current_value 值。

  • 禁用深度学习 AMI 中提供的 aws-ubuntu-eni-helper 服务,以避免在配置具有多个网卡的实例时与 configure_nw_interface.sh 冲突。

  • 删除了对 Python 3.6 的支持。

  • 在配置具有多个网卡的实例时,将所有网络接口的 MTU 设置为 9001。

  • 配置计算节点 FQDN 时,删除结尾圆点。

  • 在 POWERING_DOWN 中管理静态节点。

  • 不替换 POWER_DOWN 中的动态节点,因为作业可能仍在运行。

  • 只有在更新了集群配置中的 Scheduling 参数时,才会在集群更新时重启 clustermgtd 和 slurmctld 进程守护程序。

  • 更新 slurmctld 和 slurmd systemd 服务文件。

  • 启用配置参数 HeadNode/Imds/Secured 后,将 IPv6 对 IMDS 的问权限限制为仅根用户和集群管理员用户。

  • 设置 Slurm 配置 AuthInfo=cred_expire=70 以缩短在节点不可用时重新排队的作业在重启之前必须等待的时间。

  • 升级第三方说明书依赖项:

    • apt-7.4.2(从 apt-7.4.0)

    • line-4.5.2(从 line-4.0.1)

    • openssh-2.10.3(从 openssh-2.9.1)

    • pyenv-3.5.1(从 pyenv-3.4.2)

    • selinux-6.0.4(从 selinux-3.1.1)

    • yum-7.4.0(从 yum-6.1.1)

    • yum-epel-4.5.0(从 yum-epel-4.1.2)

错误修复:

  • 修复默认行为,在构建自定义 AMI 时跳过 Amazon ParallelCluster 验证和测试步骤。

  • 修复了 computemgtd 中的文件句柄泄漏问题。

  • 修复偶尔会因启动的实例在 EC2 DescribeInstances 响应中不可用而立即终止的竞争条件。

  • 对于使用 Arm 处理器的实例类型,修复了对 DisableSimultaneousMultithreading 参数的支持。

  • 修复从先前版本升级时 Amazon ParallelCluster API 堆栈更新失败的问题。在 EcrImageDeletionLambdaRole 中添加了用于 ListImagePipelineImages 操作的资源模式。

  • 修复 Amazon ParallelCluster API 添加了为 Lustre 文件系统创建 FSx 时缺少从 Amazon S3 导入或导出所需的权限的问题。

有关更改的详细信息,请参阅上的 aws-parallelcluster、aws-parallelcluster -cookbook 和 aws-parallel cluster 节点软件包的CHANGELOG文件。 https://github.com/aws/aws-parallelcluster-node/blob/v3.2.0/CHANGELOG.md GitHub

2022 年 7 月 27 日

Amazon ParallelCluster 今年迄今为止的仅限文档的更新

Amazon ParallelCluster 仅限文档的更新。

新章节:

章节更新:

2022 年 7 月 6 日

Amazon ParallelCluster 版本 3.1.4 已发布

Amazon ParallelCluster 版本 3.1.4 已发布。

增强功能:

更改:

  • 将 Slurm 升级到版本 21.08.8-2。

  • 借助 JWT 支持构建 Slurm。

  • 传递现有 PlacementGroup/true时不需要将PlacementGroup/En abled 设置为Id。

  • 添加lambda:TagResource到 ParallelCluster API 堆栈ParallelClusterUserRole用于创建集群和创建映像。

错误修复:

  • 修复了使用带 --filters 选项的 export-cluster-logs 命令时导出集群日志的功能。

  • 修复 Amazon Batch Docker 入口点,使用/home共享目录来协调 Multi-node-Parallel 任务执行。

  • 将 Slurm 不健康的静态节点设置为关闭时重置节点地址,以避免将容量不足而发生故障的静态节点视为引导故障节点。

有关更改的详细信息,请参阅上的 aws-parallelcluster、aws-parallelcluster -cookbook 和 aws-parallel cluster 节点软件包的CHANGELOG文件。 https://github.com/aws/aws-parallelcluster-node/blob/v3.1.4/CHANGELOG.md GitHub

2022 年 5 月 16 日

Amazon ParallelCluster 版本 3.1.3 已发布

Amazon ParallelCluster 版本 3.1.3 已发布。

增强功能:

  • 当切换到其他用户以及在以其他用户身份执行命令时,例如在 SSH 登录期间,将会执行 SSH 密钥创建并创建主目录。

  • 在配置参数 DirectoryService/DomainName 中增加了对 FQDN 和 LDAP 可分辨名称的支持。新验证器现在会检查这两种语法。

  • 头节点上部署的新 update_directory_service_password.sh 脚本支持手动更新 SSSD 配置中的 Active Directory 密码。密码由 Amazon 密钥管理器从集群配置中检索。

  • 增加了对在没有默认 VPC 的环境中部署 API 基础架构的支持。

更改:

  • C-States 在 x86_64 官方 AMI 和通过build-image命令创建的 AMI 中更深入地禁用,以保证高性能和低延迟。

  • 操作系统程序包更新和安全修复。

  • 将 Amazon Linux 2 基本映像更改为使用内核 5.10 的 AMI。

错误修复:

  • 修复了映像构建成功后由于新的 EC2 Image Builder 策略导致构建映像堆栈处于 DELETE_FAILED 状态的问题。

  • 修复了配置参数 DirectoryService/DomainAddr 在包含多个域地址时转换为 ldap_uri SSSD 属性的问题。

有关更改的详细信息,请参阅 aws-parallelcluster 的CHANGELOG文件和上的 aws-parallelcluster-cookb ook 软件包。 GitHub

2022 年 4 月 20 日

Amazon ParallelCluster 版本 3.1.2 已发布

Amazon ParallelCluster 版本 3.1.2 已发布。

更改:

  • 将 Slurm 升级到版本 21.08.6(从 21.08.5)。

错误修复:

  • 修复了在没有互联网访问权限的子网中部署集群时在计算节点上更新 /etc/hosts 文件的问题。

  • 修复了计算节点引导,在加入集群之前将等待临时驱动器初始化完成。

有关更改的详细信息,请参阅上的 aws-parallel cluster 软件包的CHANGELOG文件。 GitHub

2022 年 3 月 2 日

Amazon ParallelCluster 版本 3.1.1 已发布

Amazon ParallelCluster 版本 3.1.1 已发布。

  • 通过与通过 Amazon 目录服务管理的 Active Directory (AD) 域集成,增加对多用户群集环境的支持。

  • 在集群配置文件中增加了对 UseEc2Hostnames 的支持。如果设置为 true,则对计算节点使用 Amazon EC2 默认主机名(例如 ip-1-2-3-4)。

  • 增加了对在没有互联网访问权限的子网中创建集群的支持。

  • 添加了对每个队列包含多种计算实例类型的支持。

  • 在使用 NVIDIA 卡的 ARM 实例上添加了对使用 Slurm 进行 GPU 调度的支持。

  • 在 Amazon ParallelCluster CLI 中添加 cluster-name (-n)、region (-r)、image-id (-i) 和cluster-configuration/image-configuration(-c) 的缩写标志。

  • 为 FSx for Lustre AutoImportPolicy 参数增加了对 NEW_CHANGED_DELETED 选项的支持。

  • 将 parallelcluster:compute-resource-name 标签添加到了计算节点使用的 EC2 LaunchTemplates 资源。

  • 改进集群内创建的安全组,以便在为某些头节点 and/or 队列指定SecurityGroups参数时允许来自自定义安全组的入站连接。

  • 为 ARM 安装 NVIDIA 驱动程序和 CUDA 库。

更改:

  • 将 Slurm 升级到版本 21.08.5(从 20.11.8)。

  • 将 Slurm 插件升级到版本 21.08(从 20.11)。

  • 将 NICE DCV 升级到版本 2021.3-11591(从 2021.1-10851)。

  • 将 NVIDIA 驱动程序升级到版本 470.103.01(从 470.57.02)。

  • 将 NVIDIA Fabric Manager 升级到版本 470.103.01(从 470.57.02)。

  • 将 CUDA 升级到版本 11.4.4(从 11.4.0)。

  • Intel MPI 更新至 2021 年版更新 4(从 2019 年版更新 8 进行更新)。有关更多信息,请参阅 Intel® MPI Library 2021 更新 4。

  • 将 PMIx 升级到版本 3.2.3(从 3.1.5)。

  • 删除了将失败的计算节点转储到 /home/logs/compute。计算节点日志文件在 Amazon EC2 控制台日志中 CloudWatch 和日志中可用。

  • 启用潜在抑制 SlurmQueues 和 ComputeResources 长度验证器。

  • 在 Amazon Linux 2 上禁用实例启动时的程序包更新。

  • 构建 Amazon ParallelCluster 自定义映像时禁用 Amazon EC2 ImageBuilder 增强型映像元数据。

  • 将 cloud-init 数据源显式设置为 EC2。这可节省 Ubuntu 和 CentOS 平台的启动时间。

  • 在计算实例集启动模板名称中使用计算资源名称而不是实例类型。

  • 将 stderr 和 stdout 重定向到 CLI 日志文件,以防止 pcluster CLI 输出中出现不需要的文本。

  • 将 configure/install 食谱移至将调用的食谱与主食谱分开。现有的入口点保持不变,并且向后兼容。

  • 在 AMI 构建期间下载 Intel HPC 平台的依赖项,以避免在集群创建期间联系互联网。

  • 配置 Slurm 节点时不从计算资源名称中删除 -。

  • 未安装 NVIDIA 驱动程序时,不在 Slurm 中配置 GPU。

  • 修复了 BatchUserRole 中的 ecs:ListContainerInstances 权限。

  • 修复了未指定前缀时的集群日志导出问题,以前导出为 None 前缀。

  • 修复了集群更新失败时不执行回滚的问题。

  • 修复了 BatchUserRole 中的 ecs:ListContainerInstances 权限。

  • 修复了 HeadNode 的 RootVolume 架构,如果指定了不支持的 KmsKeyId,则会引发错误。

  • 修复亚马逊 FSx 缺少显示在 CloudWatch 控制面板中的指标的问题。

  • 修复了 EfaSecurityGroupValidator。以前,在提供自定义安全组并启用 EFA 的情况下,它可能会产生假失败。

有关更改的详细信息,请参阅上的 aws-parallelcluster、aws-parallelcluster -cookbook 和 aws-parallel cluster 节点软件包的CHANGELOG文件。 https://github.com/aws/aws-parallelcluster-node/blob/v3.1.1/CHANGELOG.md GitHub

2022 年 2 月 10 日

Amazon ParallelCluster 版本 3.0.3 已发布

Amazon ParallelCluster 版本 3.0.3 已发布。

有关更改的详细信息,请参阅上的 aws-parallelcluster 和 aws-parallelcluster-cookbook 软件包的CHANGELOG文件。 GitHub

2022 年 1 月 17 日

Amazon ParallelCluster 版本 3.0.2 已发布

Amazon ParallelCluster 版本 3.0.2 已发布。

将 Elastic Fabric 适配器安装程序升级到 1.14.1

  • EFA 配置:efa-config-1.9-1(从 efa-config-1.9)

  • EFA 配置文件:efa-profile-1.5-1(从 efa-profile-1.5)

  • EFA 内核模块:efa-1.14.2(从 efa-1.13.0)

  • RDMA 内核:rdma-core-37.0(从 rdma-core-35)

  • libfabric:libfabric-1.13.2(从 libfabric-1.13.0)

  • Open MPI:openmpi40-aws-4.1.1-2(无变化)

如果实例类型支持,则始终启用 GPUDirect RDMA。GdrSupport配置选项无效。

有关更改的详细信息,请参阅上的 aws-parallelcluster、aws-parallelcluster-cookbook 和 aws-parallel cluster 节点软件包的CHANGELOG文件。https://github.com/aws/aws-parallelcluster-node/blob/v3.0.2/CHANGELOG.md GitHub

2021 年 11 月 5 日

Amazon ParallelCluster 版本 3.0.1 已发布

Amazon ParallelCluster 版本 3.0.1 已发布。

集群配置迁移工具

  • 客户现在可以将其群集配置从 Amazon ParallelCluster 版本 2 格式迁移到 YAML-based Amazon ParallelCluster 版本 3 格式。有关更多信息,请参阅 pcluster3-config-converter 。

可以停止头节点

  • 停止计算队列后,可以使用 Amazon EC2 控制台或 stop- Amazon instances CLI 命令停止头节点,然后重新启动。

从~/.aws/config文件读取的默认 Amazon 区域

  • 对于 p cluster 命令,如果未在配置文件、环境中或命令行中指定 Amazon 区域,则使用~/.aws/config文件[default]部分的region设置中指定的默认区域。 Amazon

有关更改的详细信息,请参阅上的 aws-parallelcluster、aws-parallelcluster-cookbook 和 aws-parallel cluster 节点软件包的CHANGELOG文件。https://github.com/aws/aws-parallelcluster-node/blob/v3.0.1/CHANGELOG.md GitHub

2021 年 10 月 27 日

Amazon ParallelCluster 版本 3.0.0 已发布

Amazon ParallelCluster 3.0.0 版本已发布。

支持通过 Amazon API Gateway 进行集群管理

  • 现在,客户可以使用 Amazon API Gateway 通过 HTTP 端点管理和部署集群。这为脚本化或事件驱动的工作流程开辟了新的可能性。

    为了与此 API 兼容,还重新设计了 Amazon ParallelCluster 命令行界面 (CLI),并包括一个新的 JSON 输出选项。这项新功能使客户也可以使用 CLI 实现类似的构造块功能。

改进了自定义 AMI 的创建

  • 现在,客户可以使用 EC2 Image Builder 采用更强大的流程来创建和管理自定义 AMI。自定义 AMI 现在可以通过单独的 Amazon ParallelCluster 配置文件进行管理,并且可以在命令行界面中使用 pcluster build-image 命令创建。 Amazon ParallelCluster

有关更改的详细信息,请参阅上的 aws-parallelcluster、aws-parallelcluster-cookbook 和 aws-parallel cluster 节点软件包的CHANGELOG文件。https://github.com/aws/aws-parallelcluster-node/blob/v3.0.0/CHANGELOG.md GitHub

2021 年 9 月 10 日

PCUI
更改 描述 日期

PCUI 版本 2026.04.0 已发布

PCUI 版本 2026.04.0 已发布

重大更改:

  • 移除对 <= 3.5.0 Amazon ParallelCluster 版本的支持。

功能:

  • 添加对通过单个 PCUI 部署管理多个 Amazon ParallelCluster 版本的支持。

  • 在us-gov-east-1区域中添加对 PCUI 的支持。

错误修复:

  • 修复问题,确保集群创建向导中的操作系统选项反映所选 Amazon ParallelCluster 版本支持的操作系统。

  • 修复了允许 PCUI 在向导中提供全部可选实例类型的问题。

  • 改进未指定Version参数时的 CloudFormation 错误消息。

安全性:

  • 降低 PCUI Lambda 中路径遍历攻击的风险。

  • 修复集群 HeadNode上 SSM SendCommand 调用中的操作系统命令注入漏洞。

  • 修复了导致访问令牌泄漏到 CloudWatch 日志中的错误。

  • 将请求升级到版本 2.33.1(从 2.32.0)。

  • 将密码学升级到版本 46.0.7(从 44.0.1)。

  • 将 boto3 升级到版本 1.42.91(从 1.24.30)。

  • 将 urllib3 升级到版本 2.6.3(从 1.26.20)。

  • 将 ecdsa 升级到版本 0.19.2(从 0.18.0)。

  • 将 certifi 升级到版本 2026.2.25(从 2024.7.4 起)。

  • 将 flask-cors 升级到版本 6.0.2(从 4.0.2)。

  • 将 python-jose 升级到版本 3.5.0(从 3.4.0)。

  • 升级到 15.5.10 版本(从 14.2.26 开始)。

  • 将 eslint-config-next 升级到版本 15.5.10(从 14.0.4 开始)。

  • 将 @ 升级babel/runtime 到版本 7.27.0(从 7.23.5)。

  • 将大括号扩展升级到版本 1.1.12(从 1.1.11)。

2026 年 4 月 30 日

PCUI 版本 2025.04.0 已发布

PCUI 版本 2025.04.0 已发布

重大更改:

  • 移除 PC 版本的默认值。现在,用户必须指定要使用的电脑版本。

功能:

  • 除了默认权限外,还添加新的堆栈参数 AdditionalPoliciesPCAPI “”,为 ParallelCluster API Lambda 角色添加自定义权限。

错误修复:

安全性:

2025 年 4 月 16 日

PCUI 版本 2024.11.0 已发布

PCUI 版本 2024.11.0 已发布

错误修复:

  • 明确为 ECR 私有存储库设置策略,以防止在影响 Lambda 函数的堆栈更新时删除策略。该策略包括 Lambda 函数获取代码所需的权限。

2024 年 11 月 22 日

PCUI 版本 2024.10.0 已发布

PCUI 版本 2024.10.0 已发布

更改:

  • 添加对 Amazon ParallelCluster 3.11.1 的支持。

  • 在向导中添加对 On-Demand 容量预留和容量块的支持。

  • 在向导中将 g6、m7 和 p5 系列添加到支持的实例类型列表中。

  • 添加新的堆栈可选参数,为 PCUI 和 Cognito 配置自定义域。

错误修复:

  • 修复了破坏自定义域设置的错误。

安全性:

  • Flask-CORS 从 3.0.10 升级到 4.0.2 以解决漏洞。 CVE-2024-6221

  • 将 lint-staged 从 13.0.3 升级到 15.2.5 以修复漏洞。 CVE-2024-4068

  • 完整更改日志

2024 年 10 月 22 日

发布了 PCUI 版本 2024.05.0

发布了 PCUI 版本 2024.05.0。

错误修复:

  • 修复了用户打开“作业状态”面板时前端屏蔽 UI 的错误。

  • 完整更改日志

2024 年 5 月 14 日

发布了 PCUI 版本 2024.04.0

发布了 PCUI 版本 2024.04.0。

功能:

2024 年 4 月 17 日

发布了 PCUI 版本 2024.03.0

发布了 PCUI 版本 2024.03.0。

功能:

  • 增加了对 Amazon ParallelCluster 版本 3.9.0 的支持

  • 增加了对 Ubuntu 22.04 和 Red Hat Enterprise Linux 9 的支持

  • 已弃用 Ubuntu 18.04

错误修复

  • 修复了在使用多个集群时导致某些集群不显示的问题

有关更改的详细信息,请参阅上的aws-parallelcluster-ui软件包CHANGELOG文件 GitHub。

2024 年 3 月 12 日

发布了 PCUI 版本 2024.02.0

发布了 PCUI 版本 2024.02.0

更改:

  • 将 Lambda 运行时环境更新为 Python v3.9

有关更改的详细信息,请参阅上的aws-parallelcluster-ui软件包CHANGELOG文件 GitHub。

2024 年 2 月 8 日

发布了 PCUI 版本 2023.12.0

发布了 PCUI 版本 2023.12.0。

功能:

  • 增加了对使用私有联网部署 PCUI 的支持。

  • 增加了选择对 PCUI 和 PCAPI 基础设施创建的每个 IAM 角色应用权限边界的可能性

  • 增加了选择对 PCUI 和 PCAPI 基础设施创建的每个 IAM 角色和策略应用前缀的可能性。

  • 增加了对 ParallelCluster 版本 3.8.0 的支持,向导中没有功能对等功能。

有关更改的详细信息,请参阅上的 aws-parallelcluster- ui 软件包的CHANGELOG文件。 GitHub

2023 年 12 月 21 日

发布了 PCUI 版本 2023.10.0

发布了 PCUI 版本 2023.10.0。

功能:

  • 增加了对 ParallelCluster 3.7.2 的支持,向导中的功能奇偶校验仅限于 FSx 文件缓存,基于内存的调度兼容性与多种实例类型。

错误修复:

  • 修复了当 PCUI 没有与 Cost Explorer 交互的权限时导致 UI 错误的问题。

改进

  • 通过将访问令牌 TTL 从 10 分钟缩短为 5 分钟,提高了安全性。

有关更改的详细信息,请参阅上的 aws-parallelcluster- ui 软件包的CHANGELOG文件。 GitHub

2023 年 10 月 20 日

发布了 PCUI 版本 2023.06.0

发布了 PCUI 版本 2023.06.0。

更改:

  • 将默认 Amazon ParallelCluster API 版本升级到 3.6.0。

错误修复:

  • 修复了 Amazon GovCloud (US-West) 区域的部署失效问题。

  • 现在,在创建开始后,拆分面板可以正确加载集群详细信息。

备注:

  • 成本监控功能在 Amazon GovCloud (美国)地区不可用。

有关更改的详细信息,请参阅上的 aws-parallelcluster- ui 软件包的CHANGELOG文件。 GitHub

2023 年 6 月 7 日

发布了 PCUI 版本 2023.05.0

发布了 PCUI 版本 2023.05.0。

增强功能:

  • 从 3.6.0 Amazon ParallelCluster 版开始,添加对 RHEL 8 的支持。

  • 添加了集群成本监控功能。

  • 从 3.6.0 Amazon ParallelCluster 版开始,增加队列和计算资源配额。

更改:

  • 改进了集群创建向导的用户界面。

  • 提高了 PCUI 部署的速度。

  • 改进了添加新用户的界面。

  • 队列默认位于头节点子网中。

错误修复:

  • 集群创建完成后,切换到正确的区域。

  • 修复了“编辑集群”功能中的加载指示器显示问题。

  • 修复 EBS SnapshotId 属性删除后的集群创建问题。

有关更改的详细信息,请参阅上的 aws-parallelcluster- ui 软件包的CHANGELOG文件。 GitHub

2023 年 5 月 16 日

发布了 PCUI 版本 2023.04.0

发布了 PCUI 版本 2023.04.0。

增强功能:

  • 重新设计了集群创建向导。

  • 重新设计了集群日志页面。

  • 为共享存储添加了自定义名称设置。

  • 在向集群添加存储时添加了多个存储选项。

  • 增加了对 Amazon EFS 和 FSx for Lustre 的 DeletionPolicy 支持。

  • 在集群配置中添加了 ImdsSupport 设置。

  • 增加了对 C7 实例类型的支持。

  • 添加了 “恢复到以前的 Amazon 系统管理器文档版本” 教程。

更改:

  • 集群配置 YAML 的大小最大可达到 1MB。

  • 用户不会因为使用 Boto3 IAM 临时凭证进行授权而注销。

  • 选择 HPC 实例时禁用了多线程选项。

  • 删除了集群创建页面上的禁用回滚功能。

  • 在提供必需的信息之前,用户无法使用 PCUI。

  • 最多可以添加 10 个队列。

  • 在 PCUI 安装过程中不覆盖 SSM-SessionManagerRunShell 文档。

错误修复:

  • 修复了损坏的重置密码链接。

  • 修复了因 EcrPrivateRepository 不为空而导致 delete stack 损坏的问题

  • 修复了“多用户管理属性”部分中“生成 SSH 密钥”复选框的初始化问题。

  • 修复了因作业具有未定义属性而导致崩溃的问题。

  • 修复了 SCRATCH FSx 的设置。

  • 修复了“启动和停止实例”按钮,单击一次后仍处于启用状态。

有关更改的详细信息,请参阅上的 aws-parallelcluster- ui 软件包的CHANGELOG文件。 GitHub

2023 年 4 月 17 日

Terraform
更改 描述 日期

1.2.0 版 Terraform 提供 Amazon ParallelCluster 商已发布

错误修复:

  • 修复了在集群上禁用 CloudWatch 日志记录时aws-parallelcluster_cluster数据源失败的问题。

更改:

  • 将 Go 最低版本升级到 1.23.0(从 1.21)。

  • 将 aws-sdk-go-v2 升级到 v1.36.3(从 v1.32.7)。

  • 将 aws-sdk-go-升级v2/config 到 v1.29.13(从 v1.28.7)。

  • 将 aws-sdk-go-v2/service /apigateway 升级到 v1.30.1(从 v1.28.2)。

  • 将 aws-sdk-go-v2/service /cloudformation 升级到 v1.59.1(从 v1.56.2)。

  • 将 aws-sdk-go-v2/service /sts 升级到 v1.33.18(从 v1.33.3)。

  • 将 terraform-plugin-framework 升级到 v1.14.1(从 v1.9.0)。

  • 将 terraform-plugin-go 升级到 v0.26.0(从 v0.23.0)。

  • 将 terraform-plugin-plugin-升级sdk/v2 到 v2.36.1(从 v2.34.0)。

2026年8月25日

1.2.0 版 Terraform 模块已发布 Amazon ParallelCluster

更改:

  • 允许 Amazon 提供商 v6。

  • 在所有示例中使用 ParallelCluster API 3.15.1。

2026年8月25日

1.1.0 版 Terraform 提供 Amazon ParallelCluster 商已发布

错误修复:

  • 修复了使用 ParallelCluster API 3.11.x 部署带有登录节点的集群时导致 terraform-apply 失败的问题。

2024 年 12 月 6 日

1.1.0 版的 Terraform 模块已发布 Amazon ParallelCluster

更改:

  • 在所有模块示例中使用 Amazon ParallelCluster Terraform Provider 1.x。

  • 在所有带有堆栈名称 ParallelCluster ParallelCluster API 的示例中使用 API 3.11.1。

  • 在所有模块示例中部署登录节点。

2024 年 12 月 6 日

Terraform 提供商 1.0.0 版本已发布 Amazon ParallelCluster

功能:

2024 年 6 月 26 日

1.0.0 版 Terraform 模块已发布 Amazon ParallelCluster

功能:

2024 年 6 月 26 日