设置

关灯

第一百三十章 虚拟与现实(第3节)

的走势在某个时间点之后出现了明显的偏离。

“棋手模型在训练后期,出现了一些我们称之为‘策略固化’的现象。”苏酥雪的语调比刚才低沉了一些,“在面对某些特定类型的任务时,它会倾向于使用它最熟悉、最擅长的策略,即使存在更优的策略可选。”

她点开了一个具体的案例。在传送带分拣任务中,棋手模型几乎总是优先抓取距离最近的物体,而不是按照物体的优先级顺序来安排抓取顺序。这种“就近优先”策略在大多数情况下是高效的,但在某些特殊情况下——例如当远处有一个高优先级物体即将通过传送带末端、而近处有几个低优先级物体时——这种策略会导致高优先级物体被漏捡。

“我们测试了多种不同的物体排列组合,发现在大约百分之七的情况下,‘就近优先’策略不是最优选择。但棋手模型很少主动选择其他策略,即使在训练中我们多次向它展示了更优策略的存在。”

“这是为什么?”

“目前的分析结论是:棋手模型在训练过程中,对‘成功率’的优化权重过高,对‘效率’的优化权重相对不足。‘就近优先’策略的成功率很高——百分之九十三——虽然它不是最优的,但它的成功率足够高,以至于棋手模型不愿意冒险尝试其他不确定性更高的策略。这是一种‘舒适区’效应。”

陆迪峰沉默了片刻,然后说:“这倒是很像人了。”

“确实很像。”苏酥雪说,“但正因为很像,我才更担心。如果棋手模型在虚拟训练场中就已经开始形成自己的‘舒适区’和‘习惯’,那么在现实世界中,这种行为模式可能会变得更加顽固。我们需要在训练目标中加入更多的多样性奖励,鼓励它探索和尝试不同的策略,而不是一味地追求成功率。”

“那就改。训练目标函数的调整,你来做方案,我来审核。”

“好。”

三月的第二周,陈岩从非洲发来了一条让所有人都松了一口气的消息。

本章未完,请点击"下一页"继续阅读! 第3页 / 共5页