快讯事件 · 1 条来源
基准测试称 OpenAI Decisions API 比 Jev 贵 2 倍且效果差 5-10%
作者 typesafeai 援引 Hamed Nilforoshan 的基准测试称,其在服务 250 万用户的 HiringCafe.com 上将被称为“Jev 杀手”的 OpenAI Decisions API 与 Jev 进行对比,任务是按 1-10 分预测用户查询/简历与职位描述的相关性。作者称 OpenAI 方案成本高 2 倍,效果差 5-10%。以上为作者转述的测试结果,未经独立核实。
全部来源
前后事件
上一篇:作者发布大规模 agentic LLM 推理数据集:206B tokens、12002 个会话下一篇:Ai2 的 byte-level 语言模型研究被 Nature 接收,新检查点扩展至 Qwen 与 Llama
相关事件
Ramp十月SaaS数据:AI支出呈双向分化,作者称Jev一个月内拿下1个百分点市场采用率
作者援引Ara Kharazian发布的Ramp平台(2026年10月)顶级SaaS厂商数据称,AI支出正被两股力量拉扯:一方面,更新、更便宜的模型正在压低AI支出;另一方面,Jev在一个月内获得了整整一个百分点的市场采用率,作者称这一增速闻所未闻。原文在提及"routers"后被截断,关于路由器的表述不完整。以上均为作者说法,未独立核实。
OpenRouter 推出决策模型排行榜,typesafeai 暂居各项榜首
OpenRouter 宣布上线 Decision Model Rankings(决策模型排行榜)。据其介绍,该排行榜可查看不同决策模型及任务类型的支出份额和 Token 份额,任务维度包括相关性(Relevance)、正确性(Correctness)、指令遵循(Instruction Following)等。作者援引 OpenRouter 信息称,@typesafeai 目前在所有类别中排名第一。上述排名与份额数据均为作者及 OpenRouter 的说法,未经独立核实。
TypeSafeAI 团队称 Jev 周四上线后已服务一万亿 tokens
Modal 转发 @TypeSafeAI 团队的说法称,Jev 于周四上线,到周日已服务一万亿 tokens,且增长未见放缓;该推文同时宣传可了解团队在 Modal 上扩展 Jev 的做法。token 服务量尚未经独立核实。