← 返回

NEWS · 快讯

标签:基准测试

查看带有该精确标签的快讯。

订阅此筛选 RSS

共 9 条快讯 · 门户最近更新

Databricks Day 0 上线 Anthropic 新模型 Claude Haiku 5.5,自称质量较 Haiku 4.5 提升约 15%

Databricks 宣布 Anthropic 最新模型 Claude Haiku 5.5 以 Day 0 形式在其平台上可用。作者称该模型是 Anthropic 发布过的最便宜、最快、能力最强的小模型;在 Databricks 的 OfficeQA Pro V1 基准测试中,Claude Haiku 5.5 的质量比 Haiku 4.5 高出约 15%,成本则低得多。用户可在 Databricks 上运行 Haiku 5.5 及 60 多个其他模型,用于驱动 agentic 应用和智能体,由 Unity Gateway 负责治理、监控和安全。上述性能和基准结论均来自作者陈述,未经独立核实。

databricks查看原文 ↗

实测:RTX 3060 单卡跑 Liquid AI 开源模型 d1-3B,BoolQ 88.4%、MMLU-Pro 44.5%

作者称在单张 RTX 3060(12GB 显存)上运行 Liquid AI 新发布的开源多模态决策模型 d1-3B:BoolQ 3,270 题全量验证集得分 88.4%(高于官方卡片 86.7),MMLU-Pro 12,032 题得分 44.5%,GPQA 29.8% 接近随机,与其知识是最弱项的定位一致;约 43ms p50 每次决策、每秒 21-23 次决策、占 5GB 显存。推文并引用 Liquid AI:Open d1 发布 d1-3B(文本+视觉)与 d1-omni-600M(文本+图像或文本+音频)两个开源权重模型。

liquidai查看原文 ↗

Claude Haiku 5.5 以 Day 0 形式上线 Databricks,基准质量较 Haiku 4.5 提升约 15%

Databricks 宣布 Anthropic 最新模型 Claude Haiku 5.5 以 Day 0 形式在 Databricks 平台上线。Databricks 称这是 Anthropic 迄今最便宜、最快、能力最强的小模型,并声称在其 OfficeQA Pro V1 基准上 Haiku 5.5 比 Haiku 4.5 质量高约 15%、成本仅为一小部分(均为 Databricks 说法,未独立核实)。用户可在 Databricks 上基于既有数据运行该模型及 60 余款其他模型,治理与调用安全由 Unity Gateway 负责。

databricks查看原文 ↗

Artificial Analysis 音乐 Arena v1.1:千条提示覆盖17种流派,超3.7万盲测投票

作者团队介绍 Music Arenas v1.1 更新:新增 1,000 条提示(每个基准 500 条),覆盖 17 种流派;评测改为仅采用招募评估者小组的盲投票,公开投票不计入评分。团队称更新后榜单基于超 37,000 条盲测偏好投票,每个上榜模型均有超 2,000 票;AA-Music-Vocal v1.1 不提供歌词,以衡量模型的端到端歌曲创作能力。

ArtificialAnlys查看原文 ↗

Perplexity Decider v1.1 上线 OpenRouter:开放权重多模态决策模型

OpenRouter 称,Perplexity Decider v1.1 已上线 OpenRouter;该开放权重多模态决策模型可接收文本、JSON 或图像,并返回带概率的类型化答案,输入定价为 0.02 美元/百万 token,输出免费。Perplexity Developers 表示,更新后的 pplx-decider-v1.1-27b 已可用,并在新的 Hugging Face Decision Index 0.3 基准上得分最高;其输入价格较 v1 减半。

OpenRouter查看原文 ↗

Mistral Large 4 首测:1T 参数、49B 激活,开放权重将于月底推出

推文作者称 Mistral AI 的 Mistral Large 4 是一个 1T 参数模型(49B 激活),开放权重将于本月底推出。他们对该模型进行了一系列真实场景测试,并与多个主流闭源及开源模型(包括 GPT-6.1 Sol、Astra、Claude Fable、Claude Opus 5.5、Claude Sonnet 5.5、Kimi K3、GLM 5.3 Flash、DeepSeek Flash 和 Muse Spark)进行了对比,以展示其当前水平,并表示后续将更新更多评分。以上均为作者自称,尚未独立核实。

arena查看原文 ↗

Mistral Large 4 预览版登 Code Arena: WebDev 第 45 名,获 1534 分

榜单方 Arena 表示,Mistral Large 4(预览版)首次亮相 Code Arena: WebDev,以 1534 分位列总榜第 45 名,使 MistralAI 成为进入该榜前 15 名的实验室中唯一的欧洲机构。作者称其较上一代 Mistral Large 3 提升 304 分(原文分别提到 Large 3 排第 133 名和第 130 名),并比表现次优的变体 Mistral Medium 3.5(第 122 名)高出 271 分。因该模型仍为预览版,随着继续训练和开放权重发布,其分数与排名可能变化。

arena查看原文 ↗

smallest_AI 的 Pulse 登顶 Voice Arena 说话人分离 + ASR 榜单,DER 24.4%

作者称,smallest_AI 的 Pulse 在 Voice Arena 的 Diarization Bench 之 Diarization + ASR 赛道排名第一,DER(说话人日志错误率)为 24.4%,该赛道下一名系统得分为 40.7%。正文说明该赛道共有七个系统参评,DER 为错误率,数值越低越好。推文末尾在冻结正文中被截断,相关细节以原文已给出的信息为准。

omarsar0查看原文 ↗

作者称 OpenAI Decisions API 在其招聘私有基准上比 Jev 贵 2 倍、效果差 5-10%

Hamed Nilforoshan 发帖称,他在招聘平台 HiringCafe.com(服务 250 万用户)的私有基准上测试了 OpenAI Decisions API 与 Jev:任务是在 1-10 分制下预测用户查询/简历与职位描述的相关性。作者表示,在该测试中 OpenAI 方案成本高 2 倍,效果差 5-10%。以上均为作者自述结果,未经独立核实。

CompleteSkeptic查看原文 ↗