

本文属于机器翻译版本。若本译文内容与英语原文存在差异，则一律以英文原文为准。

# 模型部署
<a name="model-customize-mtrl-deployment"></a>

 训练作业完成后，训练后的模型将作为模型包在输出模型包组中提供。您有两种部署方式。

## 选项 1：使用 SageMaker AI AI 推理进行部署
<a name="model-customize-mtrl-deployment-sagemaker"></a>

 将您的模型托管在 A SageMaker I AI 推理端点上，以实现实时、无服务器或异步预测。此选项可让您对实例类型、扩展策略和网络配置进行精细控制。当您需要低延迟服务、自定义推理逻辑或与现有 SageMaker AI AI 工作流程紧密集成时，它非常适合。

 要进行部署，请`OutputModelPackageArn`从已完成的训练作业中检索并使用它来创建终端节点。

```
# Retrieve the output model ARN from your completed job
aws sagemaker describe-job \
  --job-name "my-agent-rft-job" \
  --job-category AgentRFT \
  --region us-west-2
```

 有关完整的部署选项和配置，请参阅 SageMaker AI AI 文档中的[部署模型进行推理](https://docs.amazonaws.cn/sagemaker/latest/dg/deploy-model.html)。

## 选项 2：导入到亚马逊 Bedrock
<a name="model-customize-mtrl-deployment-bedrock"></a>

 将您的模型导入 Amazon Bedrock，即可使用 Bedrock 的托管推理 API，无需配置终端节点。Amazon Bedrock 支持导入自定义的开源基础模型（例如 Mistral AI 或 Llama）和在 AI 人工智能中微调的 Amazon Nova 模型。 SageMaker 有关更多信息，请参阅《[亚马逊 Bedrock 用户指南》中的将预训练模型导入](https://docs.amazonaws.cn/bedrock/latest/userguide/import-pre-trained-model.html) Amazon Bedrock。对于 Nova 模型，请参见[使用创建自定义模型进行导入](https://docs.amazonaws.cn/bedrock/latest/userguide/import-with-create-custom-model.html)。

## 使用 SageMaker AI 工作室部署
<a name="model-customize-mtrl-deployment-studio"></a>
+ 导航至 “**工作” > “培训**”，然后选择 “**Multi-turn RL**” 选项卡。
+ 选择已完成的作业，然后在 “**自定义模型详细信息**” 下选择模型，以查看性能指标、模型谱系和训练日志。
+ 在 “**治理**” 选项卡下，批准模型以使其符合部署条件。
+ 选择**部署**。选择是部署到 SageMaker AI AI 实时终端节点还是通过 Amazon Bedrock 部署，以及是创建新的终端节点还是重复使用现有终端节点。
+ 选择实例类型并可选择配置 VPC 设置、IAM 角色和 KMS 加密密钥。
+ 在 “部署” 选项卡下监控**部署**进度。
+ 导航到 “**部署” > “端点**”。当您的终端节点和关联的推理组件的状态为时 InService，您的终端节点已准备好进行调用。

## 使用 SageMaker AI Python 开发工具包部署
<a name="model-customize-mtrl-deployment-python-sdk"></a>

 部署到 A SageMaker I 终端节点：

```
from sagemaker.serve import ModelBuilder
from sagemaker.core.resources import ModelPackage

# Get the output model package from your completed training job
model_package = ModelPackage.get(
    model_package_name=job.output_model_package_arn
)

model_builder = ModelBuilder(
    model=model_package,
    image_uri="763104351884.dkr.ecr.us-west-2.amazonaws.com/djl-inference:0.36.0-lmi24.0.0-cu129",
    instance_type="ml.g6e.48xlarge",
)
model_builder.accept_eula = True
model_builder.build()

endpoint = model_builder.deploy(
    endpoint_name="mtrl-finetuned-endpoint",
    instance_type="ml.g6e.48xlarge",
    initial_instance_count=1,
)
```

 调用终端节点：

```
import json

response = endpoint.invoke(
    body=json.dumps({
        "model": "/opt/ml/model",
        "messages": [{"role": "user", "content": "What is 25 * 4?"}],
        "max_tokens": 200,
        "stream": False,
    }).encode("utf-8"),
    content_type="application/json",
)
```