第三百八十一章 带着任务去 (3/4)
偷测试集,他难道是商业间谍吗?如果是的话,他直接偷模型不好吗,为什么要去偷一个没什么用的测试集?
现在理查德不仅要作废排名第一的测试结果,还要把提前泄露考题的黑锅扣在他身上?
林伟伦冷笑了一声,说道:“科尔曼教授,你的指责令人发笑,如果你执意要执行这样的决定的话,我会代表新加坡国立大学退出这次合作。”
林伟伦说这话只是在虚张声势,他只是个教授,不是校长,更不姓李。他完全因为专业对口担任合作方的负责人,根本没有权利决定退出合作。
理查德果然没被吓到,他微微一笑:“林教授,请便吧。”
忽然,林伟伦没等到会议结束就直接走出了会议室,一路回到自己的办公室。
回到办公室之后,他又拿出测试结果的分数看了一遍。
以往的模型测试集主要集中在测试知识、数学能力、编程能力、理解能力和推理能力之类的方向。
但是因为智能体应用最近的爆火,a funatn这一次的测试集特意注重了长程任务的能力,而且占比极高,总分一百分的测试题中有三十五分是与长程任务的管理有关的。
当然,这里说的分并不是像学生考试做卷子一样,四个选项里蒙一个,对了就拿分。具体的测试过程相当复杂,每一题都要完成一个跨度长达几个小时、进行很多个步骤才能完成的任务,最后成功之后才能拿到一分,有时甚至要重复多次来验证稳定性,取平均分。
在这样的新标准下,现在的公开模型评分普遍不算太高。
之前霸榜了很久的汤圆0.9只有70.2分。
紧接着,mn的新模型最终分70.8分,pna的pt-v-最终分71.7。
分数第二高的金星模型2.0分是72.3分。
互相之间咬的很紧。
只有汤圆1.0,分93.5,比第二名领先了二十多分。
说实话,这种程度的领先,林伟伦也不理解。
但正是因为不理解,他更不能接受理查德等人毫无理由的打压。打不过就修改规则?这些傲慢的西方人。
与此同时,林伟伦翻看起了源智科技来参会成员的联系方式,他决定等对方到了之后,亲自过去交流一下。
至少要让他们知道自己所受到的不公正待遇。
章节报错
请简要描述您遇到的问题(如:内容缺失、章节错乱、文字乱码等)