第一百三十章 虚拟与现实 (2 / 3) 首页

字体:      护眼 关灯

上一章 目录 下一章

第一百三十章 虚拟与现实 (2 / 3)
        苏酥雪切换到了第三段回放画面。这次的场景是一个模拟的故障排除任务——一条虚拟产线的某个关键工位突然卡死,棋手模型需要诊断故障原因并采取修复措施。这个任务在训练中没有出现过类似的先例,属于完全的未知情境。

        画面中,棋手模型在产线卡死后停顿了大约两秒钟——这是它在分析和评估情况的时间。然后它做出了一系列动作:首先,它控制虚拟探头检查了卡死工位的传感器读数;然后,它调用了书库中关于该型号设备的结构图纸,进行了快速的比对分析;最后,它推断出卡死的可能原因是传动皮带脱落,并控制虚拟工具将皮带复位。整个诊断和修复过程耗时约四十五秒,相当于一个经验丰富的维修工人的平均用时。

        “它从来没有见过这个故障模式。”苏酥雪说,“但它通过组合已有的知识——传感器数据分析、结构图纸理解、工具操作技能——成功地解决了这个从未遇到过的问题。这就是我们想要的‘泛化能力’。”

        “不好的方面呢?”陆迪峰问。

        苏酥雪关掉了回放画面,调出了一份数据报表。报表上用红色标注了几条曲线,曲线的走势在某个时间点之后出现了明显的偏离。

        “棋手模型在训练后期,出现了一些我们称之为‘策略固化’的现象。”苏酥雪的语调比刚才低沉了一些,“在面对某些特定类型的任务时,它会倾向于使用它最熟悉、最擅长的策略,即使存在更优的策略可选。”

        第一百三十章虚拟与现实

        她点开了一个具体的案例。在传送带分拣任务中,棋手模型几乎总是优先抓取距离最近的物体,而不是按照物体的优先级顺序来安排抓取顺序。这种“就近优先”策略在大多数情况下是高效的,但在某些特殊情况下——例如当远处有一个高优先级物体即将通过传送带末端、而近处有几个低优先级物体时——这种策略会导致高优先级物体被漏捡。

        “我们测试了多种不同的物体排列组合,发现在大约百分之七的情况下,‘就近优先’策略不是最优选择。但棋手模型很少主动选择其他策略,即使在训练中我们多次向它展示了更优策略的存在。”

        “这是为什么?”

        “目前的分析结论是:棋手模型在训练过程中,对‘成功率’的优化权重过高,对‘效率’的优化权重相对不足。‘就近优先’策略的成功率很高——百分之九十三——虽然它不是最优的,但它的成功率足够高,以至于棋手模型不愿意冒险尝试其他不确定性更高的策略。这是一种‘舒适区’效应。”

        陆迪峰沉默了片刻,然后说:“这倒是很像人了。”

        “确实很像。”苏酥雪说,“但正因为很像,我才更担心。如果棋手模型在虚拟训练场中就已经开始形成自己的‘舒适区’和‘习惯’,那么在现实世界中,这种行为模式可能会变得更加顽固。我们需要在训练目标中加入更多的多样性奖励,鼓励它探索和尝试不同的策略,而不是一味地追求成功率。”

        “那就改。训练目标函数的调整,你来做方案,我来审核。”

  The content is not finished, continue reading on the next page

更多完整内容阅读登陆

《墨缘文学网,https://wap.mywenxue.org》
加入书签我的书架


上一章 目录 下一章