首个AI高考全卷评测结果发布：最高分303 数学全不及格事情经过是怎样的？

发布时间：2024-06-19 17:27:58来源：

「首个AI高考全卷评测结果发布：最高分303 数学全不及格」!!!今天受到全网的关注度非常高，那么具体的是什么情况呢，下面大家可以一起来看看事情经过是怎样的！

快科技6月19日消息，据媒体报道，上海人工智能实验室旗下司南评测体系OpenCompass选取了7个大模型进行高考“语数外”全卷能力测试。OpenCompass发布了首个大模型高考全卷评测结果。

在满分420分的三科测试中，阿里通义千问2-72B以303分的成绩拔得头筹，紧随其后的是OpenAI的GPT-4o，获得296分，而上海人工智能实验室的书生·浦语2.0位列第三。

这三大模型的得分率均超过了70%，展现了不俗的实力。相比之下，来自法国大模型初创公司的Mistral则排名末尾。

参与此次评测的模型来源广泛，包括阿里巴巴、零一万物、智谱AI、上海人工智能实验室、法国Mistral的开源模型，以及OpenAI的闭源模型GPT-4o。

为确保公平，实验室特别指出，由于无法确定闭源模型的更新时间，评测中仅将GPT-4o作为参考，并未纳入商用闭源模型。同时，所有参与评测的模型均在高考前（2024年4月-6月）开源，有效避免了“刷题风险”。

从评测结果来看，大模型在语文和英语方面的表现普遍较好，但在数学方面则普遍不及格。最高分仅为75分，由书生·浦语2.0获得，紧随其后的是GPT-4o的73分。语文方面，通义千问表现出色，而英语则由GPT-4o领跑。

数学成绩的不理想凸显出大模型在复杂推理能力方面的不足。这一能力是金融、工业等要求可靠场景落地所需的关键能力，也是大模型未来发展的重要方向。

以上就是关于【首个AI高考全卷评测结果发布：最高分303 数学全不及格】的相关消息了，希望对大家有所帮助！

免责声明：本答案或内容为用户上传，不代表本网观点。其原创性以及文中陈述文字和内容未经本站证实，对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺，请读者仅作参考，并请自行核实相关内容。如遇侵权请及时联系本站删除。

首个AI高考全卷评测结果发布：最高分303 数学全不及格 事情经过是怎样的？