Artificial Analysis 宣布其视频排行榜现在会标注派生模型,并支持用户隐藏这类模型。官方称,AA-Video-T2V v2.0 榜单前五中有两个模型——Utopai X 和 MiniMax H3 Max——基于 MiniMax H3 后训练而成。派生模型默认保留在榜单中,因为团队表示它们与基础模型在能力、价格、速度和可用性上可能存在实质差异。现在派生模型名称旁会显示其基础模型的 logo,用户还可选择"Hide derived models"仅对基础模型排名。
ArtificialAnlys查看原文 ↗
推文称,针对智能体“读多写少”的场景,DeepSeek 缩小了其记忆缓存:每 token 缓存为 890 bytes,较 DeepSeek-V1 小 437 倍;同时称从 4K 到 1M 输入,每个输出 token 的计算量增加 25%。推文还称 Flash 在 AA Index 上以 39 比 36 领先 V4-Pro,任务成本为 0.27 美元对 0.67 美元。以上均为原文主张,未独立核实。
DeepLearningAI查看原文 ↗
作者称在 SWE-bench Verified 上用同一模型运行了 Claude Code、mini-SWE-agent 和 OpenCode:前两者在 447 个任务上得分相差不超过 5 分,更换 harness 的影响约等于重跑一次(45 题困难子集上各有 13% 结果翻转)。成本差异主要来自每一步重复发送的 system prompt 和 tool schema;精简 harness 提示词和工具可在不降低准确率的情况下最多降本 3 倍。
omarsar0查看原文 ↗
作者宣布 GeoGuess Bench(geoguessbench.com)上线。据推文介绍,该基准用于衡量 AI 模型玩 GeoGuessr 的能力:团队让模型对 210 张来自世界各地的照片逐一预测拍摄地点,并根据预测与真实位置的接近程度评分。作者称部分结果"令人意外",但具体榜单在正文中被截断,未包含可引用的细节。
nutlope查看原文 ↗