

本文属于机器翻译版本。若本译文内容与英语原文存在差异，则一律以英文原文为准。

# Multi-turn 强化学习
<a name="model-customize-mtrl"></a>

Multi-turn 强化学习 (RL) 训练代理人在一系列步骤中做出正确的决策，而不仅仅是在一个瞬间。代理观察其环境，采取行动，获得奖励，然后移动到新的状态，在许多时间步骤中重复此过程。目标是学习一种策略（模型行为），该策略可以在整个序列中最大限度地提高累积奖励，而不是孤立地针对任何一个步骤进行优化。这种方法越来越多地用于在多步推理和代理任务上训练语言模型，在这种任务中，模型在多个回合中执行工具调用、代码执行或网络搜索等操作，并根据整个序列获得奖励。这与单回合不同 RLHF/RLAIF，在单回合中，奖励一次分配给一个输出。

## 一个简单的比喻
<a name="model-customize-mtrl-analogy"></a>

想象一下，您是一名处理支持请求的客户服务代理。您无法在一封邮件中解决这个问题。你问一些澄清问题，查看客户的账户，尝试修复，检查它是否奏效，如果没有，则进行跟进。最后，客户要么满意，要么不满意。随着时间的推移，你会更好地识别哪个步骤顺序往往会带来良好的解决方案。

Multi-turn RL 以同样的方式训练模型。它不是根据单个响应对模型进行评分，而是让模型跨多个步骤完成任务，并根据整个序列对其进行奖励。该模型会了解对话前期的哪些决定真正重要。

## 关键术语
<a name="model-customize-mtrl-terminology"></a>
+ **代理：**系统中的决策实体。它观察当前形势，决定采取什么行动，并随着时间的推移学习以改进其策略。实际上，代理由 AI 模型提供支持，但两者并不相同。模型是底层的神经网络；代理是使用它来感知、决策和行动的更广泛的系统。*简而言之：处理票证的客户服务代表。*
+ **Environment/Agentic 应用程序：**代理与之互动的所有内容，包括对话历史记录、客户的账户详细信息以及代理可以使用的任何工具。*简而言之：支持平台、客户以及销售代表可用的所有信息。*
+ **状态：**代理在决定下一步做什么之前观察到的当前情况的快照。*简单来说：销售代表现在知道什么，例如客户的问题、已经尝试过的内容以及最新的回复。*
+ **操作：**代理在每个步骤中执行的操作，例如询问澄清问题、调用工具或发送回复。*简而言之：销售代表的下一步行动，无论是问问题、查找内容还是发送修复程序。*
+ **奖励：**代理在每一步或任务结束时收到的反馈信号，表明事情进展如何。*简而言之：客户是否满意？ 结果就是回报。*
+ **策略：**代理人学到的策略。它将给定状态映射到最有可能带来良好结果的操作。*简而言之：销售代表的知识是从经验中积累的，他们知道在给定情况下什么往往行得通。*
+ **剧集：**从头到尾完成一项任务。*简而言之：一次全面的支持对话，从客户的第一条消息到解决方案。*
+ **回合：**剧集中的单次交换，通常是代理采取的一项操作及其从环境中收到的响应。在对话中，这是一条消息及其回复。*简而言之：在支持对话中迈出一步，比如客服人员提问，客户回答。*
+ **轨迹：**整个剧集中记录的状态、动作和奖励的完整序列。它是代理人所做的事情和结果的完整记录，用于计算奖励和更新政策。*简而言之：从头到尾的支持对话的完整记录，包括代理做出的每一个决定以及事情的进展情况。*
+ **累积奖励：**在剧集中所有步骤中累积的总奖励，这是代理人最终想要最大化的奖励。*简而言之：不仅仅是一步是否顺利，还包括整个对话总体上是否顺利。*

## 多回合强化学习的用例
<a name="model-customize-mtrl-use-cases"></a>

Multi-turn 当单个响应不足以很好地完成任务时，RL 是正确的方法。如果你的用例涉及一系列步骤，而决策取决于先前的步骤，那么多回合 RL 值得考虑。

以下是一些指向它的信号：
+ **你的任务需要来回互动：**模型需要提问、收集信息，并根据一路上学到的内容进行调整。单一的提示-响应周期是不够的。示例：支持人员在提出修复建议之前通过询问后续问题来诊断问题。
+ **结果的质量取决于一系列行动：**最后要获得正确的答案需要在整个过程中采取正确的行动。如果实现目标的道路很重要，那么仅奖励最终产出是不够的。示例：一个跨多个步骤规划、编写、运行和调试代码的编码助手。
+ **模型需要在多个步骤中使用工具：**模型调用外部工具，例如搜索、API 或代码执行，而一个工具调用的结果会影响其接下来的工作。示例：研究助理在生成摘要之前搜索信息、评估结果并完善其查询。
+ **任务中途的错误应该是可以恢复的：**你希望模型识别出何时出现问题并纠正方向，而不是从一开始就走一条错误的道路。示例：代理尝试解决方案，检查其是否有效，如果不起作用，则尝试其他方法。
+ **你看到的单回合表现不错，但端到端任务完成率却很差：**如果你的模型可以很好地处理各个步骤，但很难将它们组合成连贯的成功结果，那么多回合 RL 可以帮助弥合这一差距。

## 支持的型号、定价和区域
<a name="model-customize-mtrl-supported"></a>

### 支持的模型
<a name="model-customize-mtrl-supported-models"></a>


| 模型 | Region | 
| --- | --- | 
| Nova Lite 2.0 | IAD (us-east-1)、PDX (us-west-2) | 
| GPT-OSS-20B | IAD (us-east-1)、PDX (us-west-2) | 
| Gemma-4-31B-it | PDX (us-west-2) | 
| Qwen 3.6 27B | PDX (us-west-2) | 

### 定价
<a name="model-customize-mtrl-pricing"></a>

要了解完整的定价详情，请参阅[公开定价页面](https://www.amazonaws.cn/sagemaker/ai/pricing/)。费用基于三个维度：
+ **预填充：**处理在每个训练步骤开始时输入到模型的输入令牌的成本。这包括提示、对话历史记录以及模型在生成响应之前收到的任何上下文。
+ **示例：**模型在训练推出期间生成的代币成本。这是模型生成响应的地方，然后对响应进行评估并用于计算奖励信号。
+ **训练：**向后传球的成本，模型的权重根据奖励信号更新。这是 RL 过程中的核心学习步骤。

## 主题
<a name="w2aac29c15c13"></a>
+  [先决条件](model-customize-mtrl-prereqs.md) 
+  [为经纪人做好准备](model-customize-mtrl-agent.md) 
+  [为多回合强化学习创建资产](model-customize-mtrl-assets.md) 
+  [培训作业提交](model-customize-mtrl-job.md) 
+  [模型评测](model-customize-mtrl-evaluation.md) 
+  [模型部署](model-customize-mtrl-deployment.md) 
+  [超参数参考](model-customize-mtrl-hyperparams.md) 
+  [为多轮 RL 任务配置 VPC](model-customize-mtrl-vpc.md) 
+  [用于多回合强化学习的静态加密](model-customize-mtrl-encryption-at-rest.md) 
+  [问题排查](model-customize-mtrl-troubleshooting.md) 
+  [配额](model-customize-mtrl-quotas.md) 
+  [示例数据集和教程](model-customize-mtrl-samples.md) 