基准测试称 OpenAI Decisions API 比 Jev 贵 2 倍且效果差 5-10%
作者 typesafeai 援引 Hamed Nilforoshan 的基准测试称,其在服务 250 万用户的 HiringCafe.com 上将被称为“Jev 杀手”的 OpenAI Decisions API 与 Jev 进行对比,任务是按 1-10 分预测用户查询/简历与职位描述的相关性。作者称 OpenAI 方案成本高 2 倍,效果差 5-10%。以上为作者转述的测试结果,未经独立核实。
共 2 条快讯 · 门户最近更新
作者 typesafeai 援引 Hamed Nilforoshan 的基准测试称,其在服务 250 万用户的 HiringCafe.com 上将被称为“Jev 杀手”的 OpenAI Decisions API 与 Jev 进行对比,任务是按 1-10 分预测用户查询/简历与职位描述的相关性。作者称 OpenAI 方案成本高 2 倍,效果差 5-10%。以上为作者转述的测试结果,未经独立核实。
Scale Labs 宣布推出名为 Humanity’s Sixth Sense(HSS)的新基准,用于测试日常依赖的直觉式视觉推理。据其介绍,该基准包含 522 个开放式任务,覆盖图像与视频,考察空间推理、因果推理到社会理解等能力。团队称人类平均得分为 93.1%,最强模型 GPT-6-astra 为 53.6%,而模型中位数仅 30.9%。上述数字与结论均为发布方自述,尚未独立核实。