← 返回

NEWS · 快讯

标签:AI基准测试

查看带有该精确标签的快讯。

订阅此筛选 RSS

共 2 条快讯 · 门户最近更新

基准测试称 OpenAI Decisions API 比 Jev 贵 2 倍且效果差 5-10%

作者 typesafeai 援引 Hamed Nilforoshan 的基准测试称,其在服务 250 万用户的 HiringCafe.com 上将被称为“Jev 杀手”的 OpenAI Decisions API 与 Jev 进行对比,任务是按 1-10 分预测用户查询/简历与职位描述的相关性。作者称 OpenAI 方案成本高 2 倍,效果差 5-10%。以上为作者转述的测试结果,未经独立核实。

typesafeai查看原文 ↗

Scale Labs 推出 Humanity’s Sixth Sense 视觉推理基准:人类得分 93.1%,最强模型仅 53.6%

Scale Labs 宣布推出名为 Humanity’s Sixth Sense(HSS)的新基准,用于测试日常依赖的直觉式视觉推理。据其介绍,该基准包含 522 个开放式任务,覆盖图像与视频,考察空间推理、因果推理到社会理解等能力。团队称人类平均得分为 93.1%,最强模型 GPT-6-astra 为 53.6%,而模型中位数仅 30.9%。上述数字与结论均为发布方自述,尚未独立核实。

scale_AI查看原文 ↗

#AI基准测试 · AI快讯 · Portal