第三百八十一章 带着任务去 (2/4)
第二封则是在几小时之后,模型匿名解除,证实1042是由源智科技提交的汤圆1.0模型。
委员会发出的邮件内容已经变成了:「高度怀疑汤圆1.0模型通过非技术手段进行了作弊,已决定将汤圆1.0模型的成绩进行作废处理。汤圆0.9模型的成绩可以保留。」
林伟伦晃了晃手中的纸,问道:“在匿名阶段,处理决定是进行复核检查;等到身份解盲之后,就变成了作废处理。我想知道这背后的理由是什么?”
“自然是因为我们掌握了更多的信息。”理查德淡定地回答道。
“更多的信息是厂商的名字吗?”林伟伦的语气略显讥讽,因为他真的觉这个问题非常荒诞。
“这是一部分有用的信息。”理查德并没有觉这里面有什么不对,他神色认真地说道,“我们对中国厂商都有所了解,现实情况就是,中国的大模型厂商在公开排行榜上有非常强的优化动机。你也看到了,这个来自中国的模型分数极为异常,我们都有理由相信这个测试结果是不准确的。”
只是分高就是不准确?
林伟伦“嘿”了一声:“如果测试结果不准确的话,难道不是所有的模型测试结果都不准确吗?为什么单独剔除这一个模型?”
“这套测试题是多家机构和专家联合设计的,我认为作为最新的、评价现行模型的标准,是很有价值的——只要剔除掉明显作弊的模型就可以了。”
林伟伦环视了一圈坐在会议室里的代表,a funatn的成员单位大部分都来自于美国,这里大部分的代表也都来自于美国。
对这个结果,没有一个代表提出不同的意见。
他感到自己刚刚经历了一场学术霸凌。
虽然这个霸凌不是针对他本人的。
“那么,”林伟伦继续说道,“这样一套经过严密设计的测试题,他们是怎么作弊的?”
理查德看向林伟伦。
“我没想到你会问出这个问题,林教授。”他说道,话里意有所指,“一个模型的成绩异常的高,自然是因为提前进行了针对性的训练,我认为,可能有a funatn的合作单位把这套本应视为机密的测试题进行了泄露。”
这场人工智能大会新加坡站,a funatn的合作单位只有两家,新加坡国立大学和新加坡国家a研究院,这个指责指向谁,不言而喻。
林伟伦气极反笑。
与此同时,以他的权限,他只能看到分数结果,却对测试里的内容一无所知。
合作方唯一能接触到的信息是内部公告和关于会议议程、测试流程的一些统一邮件。
章节报错
请简要描述您遇到的问题(如:内容缺失、章节错乱、文字乱码等)