字号调节
字色调节
背景设置
关灯 护眼
字号调节
字色调节
背景设置

第三百八十一章 带着任务去 (3/4)

偷测试集,他难道是商业间谍吗?如果是的话,他直接偷模型不好吗,为什么要去偷一个没什么用的测试集?

现在理查德不仅要作废排名第一的测试结果,还要把提前泄露考题的黑锅扣在他身上?

林伟伦冷笑了一声,说道:“科尔曼教授,你的指责令人发笑,如果你执意要执行这样的决定的话,我会代表新加坡国立大学退出这次合作。”

林伟伦说这话只是在虚张声势,他只是个教授,不是校长,更不姓李。他完全因为专业对口担任合作方的负责人,根本没有权利决定退出合作。

理查德果然没被吓到,他微微一笑:“林教授,请便吧。”

忽然,林伟伦没等到会议结束就直接走出了会议室,一路回到自己的办公室。

回到办公室之后,他又拿出测试结果的分数看了一遍。

以往的模型测试集主要集中在测试知识、数学能力、编程能力、理解能力和推理能力之类的方向。

但是因为智能体应用最近的爆火,a funatn这一次的测试集特意注重了长程任务的能力,而且占比极高,总分一百分的测试题中有三十五分是与长程任务的管理有关的。

当然,这里说的分并不是像学生考试做卷子一样,四个选项里蒙一个,对了就拿分。具体的测试过程相当复杂,每一题都要完成一个跨度长达几个小时、进行很多个步骤才能完成的任务,最后成功之后才能拿到一分,有时甚至要重复多次来验证稳定性,取平均分。

在这样的新标准下,现在的公开模型评分普遍不算太高。

之前霸榜了很久的汤圆0.9只有70.2分。

紧接着,mn的新模型最终分70.8分,pna的pt-v-最终分71.7。

分数第二高的金星模型2.0分是72.3分。

互相之间咬的很紧。

只有汤圆1.0,分93.5,比第二名领先了二十多分。

说实话,这种程度的领先,林伟伦也不理解。

但正是因为不理解,他更不能接受理查德等人毫无理由的打压。打不过就修改规则?这些傲慢的西方人。

与此同时,林伟伦翻看起了源智科技来参会成员的联系方式,他决定等对方到了之后,亲自过去交流一下。

至少要让他们知道自己所受到的不公正待遇。

分类热门
都市 言情 甜宠日常 穿书女配 种田经营 修仙 修真 穿书 女配 日常
为你精选
首富从ai浪潮开始手打精校版 首富从ai浪潮开始TXT百度云下载 首富从ai浪潮开始 小说 首富从ai浪潮开始网盘 首富从ai浪潮开始