第三百二十八章 又是幸福的烦恼 (5/6)
韩路一沉默了一会儿。
他在心里暗暗想道,马小飞啊马小飞,刚才休息的时候你为什么不提前给我透透题?
“我觉——”他说了一半,又停了一下,“我觉那些用户说的是对的。”
马小飞挑了挑眉。
“汤圆在设计的时候,我们在安全边界上做了很多工作。”韩路一说,“我们不希望它帮人做某些事情,我们希望它在一些话题上保持克制,最关键的是,我们希望它不会给出错误的信息——这很难,但这些是我们设计的出发点。”
“那么,”马小飞问道,“你为什么选择这样的设计理念呢?”
“因为我觉现在业界的主流方式是错的。”韩路一说。
马小飞给韩路一暗地里竖了一个大拇指。
节目效果这不就出来了吗?
他问道:“能详细说说吗?”
“你知道现在大多数大模型是怎么训练出来的吗?”韩路一问道。
马小飞摇了摇头,做出一副认真听讲的表情。
“现在业内主流的训练方式叫人类反馈强化学习。”韩路一说,“简单来说,就是让真人来给模型的回答打分,模型从这些分数里学习什么叫好回答。”
“听起来挺合理的。”马小飞说。
“合理,但是有一个问题。”韩路一说,“人类打分的时候,有一个很难避免的倾向——当a说了一个你喜欢听的答案,你会不自觉地给高分;当a说了一个你不想听的答案,哪怕它是对的,你也会给低分。”
“就是……喜欢被夸的意思?”
“喜欢被认同。”韩路一说,“所以模型从这个反馈里学到了什么?它学到了:顺着用户说,用户就满意。时间长了,它就变成了一个特别会说好话的模型——你说今天天气真好,它说是啊真好;你说我觉这个方案不错,它说您这个想法非常有见地;你问它一个问题,它先夸你问好,再给你一个你想要的答案。”
马小飞若有所思地点了点头:“所以它不是在帮你,它是在哄你。”
“对。”韩路一说,“它学会的不是怎么给出正确答案,而是怎么让你觉它给了正确答案——而这两件事差很远。”
“那这个问题怎么解决呢?”马小飞追问道。
章节报错
请简要描述您遇到的问题(如:内容缺失、章节错乱、文字乱码等)