Databricks 宣布 Anthropic 最新模型 Claude Haiku 5.5 以 Day 0 形式在其平台上可用。作者称该模型是 Anthropic 发布过的最便宜、最快、能力最强的小模型;在 Databricks 的 OfficeQA Pro V1 基准测试中,Claude Haiku 5.5 的质量比 Haiku 4.5 高出约 15%,成本则低得多。用户可在 Databricks 上运行 Haiku 5.5 及 60 多个其他模型,用于驱动 agentic 应用和智能体,由 Unity Gateway 负责治理、监控和安全。上述性能和基准结论均来自作者陈述,未经独立核实。
databricks查看原文 ↗
作者称在单张 RTX 3060(12GB 显存)上运行 Liquid AI 新发布的开源多模态决策模型 d1-3B:BoolQ 3,270 题全量验证集得分 88.4%(高于官方卡片 86.7),MMLU-Pro 12,032 题得分 44.5%,GPQA 29.8% 接近随机,与其知识是最弱项的定位一致;约 43ms p50 每次决策、每秒 21-23 次决策、占 5GB 显存。推文并引用 Liquid AI:Open d1 发布 d1-3B(文本+视觉)与 d1-omni-600M(文本+图像或文本+音频)两个开源权重模型。
liquidai查看原文 ↗
Databricks 宣布 Anthropic 最新模型 Claude Haiku 5.5 以 Day 0 形式在 Databricks 平台上线。Databricks 称这是 Anthropic 迄今最便宜、最快、能力最强的小模型,并声称在其 OfficeQA Pro V1 基准上 Haiku 5.5 比 Haiku 4.5 质量高约 15%、成本仅为一小部分(均为 Databricks 说法,未独立核实)。用户可在 Databricks 上基于既有数据运行该模型及 60 余款其他模型,治理与调用安全由 Unity Gateway 负责。
databricks查看原文 ↗
作者团队介绍 Music Arenas v1.1 更新:新增 1,000 条提示(每个基准 500 条),覆盖 17 种流派;评测改为仅采用招募评估者小组的盲投票,公开投票不计入评分。团队称更新后榜单基于超 37,000 条盲测偏好投票,每个上榜模型均有超 2,000 票;AA-Music-Vocal v1.1 不提供歌词,以衡量模型的端到端歌曲创作能力。
ArtificialAnlys查看原文 ↗
OpenRouter 称,Perplexity Decider v1.1 已上线 OpenRouter;该开放权重多模态决策模型可接收文本、JSON 或图像,并返回带概率的类型化答案,输入定价为 0.02 美元/百万 token,输出免费。Perplexity Developers 表示,更新后的 pplx-decider-v1.1-27b 已可用,并在新的 Hugging Face Decision Index 0.3 基准上得分最高;其输入价格较 v1 减半。
OpenRouter查看原文 ↗
推文作者称 Mistral AI 的 Mistral Large 4 是一个 1T 参数模型(49B 激活),开放权重将于本月底推出。他们对该模型进行了一系列真实场景测试,并与多个主流闭源及开源模型(包括 GPT-6.1 Sol、Astra、Claude Fable、Claude Opus 5.5、Claude Sonnet 5.5、Kimi K3、GLM 5.3 Flash、DeepSeek Flash 和 Muse Spark)进行了对比,以展示其当前水平,并表示后续将更新更多评分。以上均为作者自称,尚未独立核实。
arena查看原文 ↗
榜单方 Arena 表示,Mistral Large 4(预览版)首次亮相 Code Arena: WebDev,以 1534 分位列总榜第 45 名,使 MistralAI 成为进入该榜前 15 名的实验室中唯一的欧洲机构。作者称其较上一代 Mistral Large 3 提升 304 分(原文分别提到 Large 3 排第 133 名和第 130 名),并比表现次优的变体 Mistral Medium 3.5(第 122 名)高出 271 分。因该模型仍为预览版,随着继续训练和开放权重发布,其分数与排名可能变化。
arena查看原文 ↗
作者称,smallest_AI 的 Pulse 在 Voice Arena 的 Diarization Bench 之 Diarization + ASR 赛道排名第一,DER(说话人日志错误率)为 24.4%,该赛道下一名系统得分为 40.7%。正文说明该赛道共有七个系统参评,DER 为错误率,数值越低越好。推文末尾在冻结正文中被截断,相关细节以原文已给出的信息为准。
omarsar0查看原文 ↗
Hamed Nilforoshan 发帖称,他在招聘平台 HiringCafe.com(服务 250 万用户)的私有基准上测试了 OpenAI Decisions API 与 Jev:任务是在 1-10 分制下预测用户查询/简历与职位描述的相关性。作者表示,在该测试中 OpenAI 方案成本高 2 倍,效果差 5-10%。以上均为作者自述结果,未经独立核实。
CompleteSkeptic查看原文 ↗