教程与实测
AWS 展示 SageMaker 多轮强化学习搜索代理流程,四组评估中三组提升
事件时间 1 个独立来源编辑评分 72/100本站发布
先了解这件事
AWS 发布 SageMaker AI 训练流程,以多轮强化学习微调 Qwen3.6-27B 搜索代理,结合检索工具与轨迹奖励;作者报告四组独立评估中三组提升。
变化是什么
新增的是训练与评估教程,不是新 Qwen 模型发布。
对你意味着什么
训练可以针对完整搜索轨迹优化,但结果也说明收益并非对所有数据集都成立。
示例使用 BM25 与向量搜索工具,以 nDCG@10 评估检索质量。奖励对失败轨迹赋值 -1,包括超过轮数或 token 上限的情况;流程还讨论无服务器训练、MLflow 观测与可恢复任务。
作者报告四组独立评估中三组提升,FreshStack 则从 0.4112 变为 0.4089,出现小幅退化。这是所评估配置下的结果,不能概括为强化学习会改善所有搜索负载。
实践上可先在自己的搜索任务复现基线,固定工具与限制,再同时检查排序质量和失败轨迹。文章日期为 10 月 2 日,精确发布时间取自 AWS 官方博客 RSS。