教程与实测

AWS 展示 SageMaker 多轮强化学习搜索代理流程,四组评估中三组提升

事件时间 1 个独立来源编辑评分 72/100本站发布

先了解这件事

AWS 发布 SageMaker AI 训练流程,以多轮强化学习微调 Qwen3.6-27B 搜索代理,结合检索工具与轨迹奖励;作者报告四组独立评估中三组提升。

变化是什么

新增的是训练与评估教程,不是新 Qwen 模型发布。

对你意味着什么

训练可以针对完整搜索轨迹优化,但结果也说明收益并非对所有数据集都成立。

示例使用 BM25 与向量搜索工具,以 nDCG@10 评估检索质量。奖励对失败轨迹赋值 -1,包括超过轮数或 token 上限的情况;流程还讨论无服务器训练、MLflow 观测与可恢复任务。

作者报告四组独立评估中三组提升,FreshStack 则从 0.4112 变为 0.4089,出现小幅退化。这是所评估配置下的结果,不能概括为强化学习会改善所有搜索负载。

实践上可先在自己的搜索任务复现基线,固定工具与限制,再同时检查排序质量和失败轨迹。文章日期为 10 月 2 日,精确发布时间取自 AWS 官方博客 RSS。

事实核查

  • 已核实流程在 SageMaker AI 上以多轮强化学习训练 Qwen3.6-27B 搜索代理,使用 BM25 和向量搜索。依据
  • 已核实使用 nDCG@10,对包含轮数/token 超限的失败轨迹奖励 -1,并讨论无服务器训练、MLflow 和可恢复任务。依据
  • 已核实作者报告四组独立评估中三组提升,FreshStack 从 0.4112 降至 0.4089。依据

报道时间线

  1. 一手来源AWS
    Fine-tune a search agent with multi-turn RL on Amazon SageMaker AI
  2. 一手来源AWS
    AWS official RSS publication timestamp