← 返回快讯

快讯事件 · 1 条来源

Scale Labs发布DistressBench基准,衡量AI应对心理健康危机的表现

scale_AI

Scale Labs发布DistressBench基准,用于衡量AI模型在人们面临心理健康危机时的响应表现。该团队表示,越来越多的人转向AI聊天机器人寻求心理健康支持,但该基准关注的是模型在最关键时刻是否真正有帮助。

全部来源

前后事件

相关事件

Scale Labs 推出 Humanity’s Sixth Sense 视觉推理基准:人类得分 93.1%,最强模型仅 53.6%

Scale Labs 宣布推出名为 Humanity’s Sixth Sense(HSS)的新基准,用于测试日常依赖的直觉式视觉推理。据其介绍,该基准包含 522 个开放式任务,覆盖图像与视频,考察空间推理、因果推理到社会理解等能力。团队称人类平均得分为 93.1%,最强模型 GPT-6-astra 为 53.6%,而模型中位数仅 30.9%。上述数字与结论均为发布方自述,尚未独立核实。

scale_AI共 1 条来源

Scale Labs发布DistressBench基准,衡量AI应对心理健康危机的表现