字号调节
字色调节
背景设置
关灯
护眼
字号调节
字色调节
背景设置
第三百七十四章 考试合格,但没通过 (1/4)
测试数据是完全基于现在上线的汤圆0.9版本和新训练完成的汤圆1.0版本之间进行对比的。
0.9已经很强了,从四月一日发布之后,到现在快两个月了,随着各家发布新模型,汤圆虽然不再是全榜单最强,但在意图理解、低幻觉率等几个方向还在霸榜。
这在模型迭代飞快,榜单天天轮换的现在可不多见。
质疑汤圆刷榜的声音也越来越少。
而刚训练完成的1.0和0.9最大的区别,就是加入了更多、逻辑链更长、质量更高的标注数据。
这种数据再次提升了汤圆模型的逻辑能力。
和0.9相比,1.0在复杂意图理解、长程任务完成率方面再次提高。
这些本来就是汤圆模型的强项。
换句话说,0.9到1.0的变化,并不是补齐了0.9的短板,而是把它原本就长的长板变更长了。
除了刚才说的那些以外,其实汤圆和其他海外一线模型相比最强的是中文能力。
这当然是因为汤圆后训练中的大量标注数据都是以中文为主的,预训练中的中文语料占比也比其他的模型更多。
很多模型虽然号称是多语言支持,但他们往往在运算和思考过程中使用的是英语,直到最后的输出层才翻译成中文,这种逻辑当然会导致很多中文语境的隐藏语义的缺失。
紧接着,韩路一看了看测评结果,问道:“长程任务的提升有这么多?”
“我们在推理侧也用了异步新框架。”赵文渊说道,他没展开解释,反正一会儿也要讲。
赵文渊打开一个长程任务示例,展示给韩路一。
这个任务的输入提示有多简单呢?
里面只有一句话:“写一个mncaft。”
mncaft,中文名我的世界,一个瑞典程序员自己开发的独立游戏,后来以十亿美元的价格卖给了微软。
与此同时,它一度是世界上销量最高的游戏,全球卖出三亿多份。
这个游戏的有趣之处就在于,它的画面极为简陋,但是系统极为复杂。
章节报错
请简要描述您遇到的问题(如:内容缺失、章节错乱、文字乱码等)