← 返回

NEWS · 快讯

标签:模型评测

查看带有该精确标签的快讯。

订阅此筛选 RSS

共 4 条快讯 · 门户最近更新

Artificial Analysis 视频榜单为派生模型加标注,可一键隐藏

Artificial Analysis 宣布其视频排行榜现在会标注派生模型,并支持用户隐藏这类模型。官方称,AA-Video-T2V v2.0 榜单前五中有两个模型——Utopai X 和 MiniMax H3 Max——基于 MiniMax H3 后训练而成。派生模型默认保留在榜单中,因为团队表示它们与基础模型在能力、价格、速度和可用性上可能存在实质差异。现在派生模型名称旁会显示其基础模型的 logo,用户还可选择"Hide derived models"仅对基础模型排名。

ArtificialAnlys查看原文 ↗

推文称 DeepSeek 将智能体记忆缓存压缩至每 token 890 bytes

推文称,针对智能体“读多写少”的场景,DeepSeek 缩小了其记忆缓存:每 token 缓存为 890 bytes,较 DeepSeek-V1 小 437 倍;同时称从 4K 到 1M 输入,每个输出 token 的计算量增加 25%。推文还称 Flash 在 AA Index 上以 39 比 36 领先 V4-Pro,任务成本为 0.27 美元对 0.67 美元。以上均为原文主张,未独立核实。

DeepLearningAI查看原文 ↗

研究:模型不变时,agent harness 可带来最高 3 倍成本差异

作者称在 SWE-bench Verified 上用同一模型运行了 Claude Code、mini-SWE-agent 和 OpenCode:前两者在 447 个任务上得分相差不超过 5 分,更换 harness 的影响约等于重跑一次(45 题困难子集上各有 13% 结果翻转)。成本差异主要来自每一步重复发送的 system prompt 和 tool schema;精简 harness 提示词和工具可在不降低准确率的情况下最多降本 3 倍。

omarsar0查看原文 ↗

GeoGuess Bench 上线:用 210 张照片测试 AI 模型的 GeoGuessr 定位能力

作者宣布 GeoGuess Bench(geoguessbench.com)上线。据推文介绍,该基准用于衡量 AI 模型玩 GeoGuessr 的能力:团队让模型对 210 张来自世界各地的照片逐一预测拍摄地点,并根据预测与真实位置的接近程度评分。作者称部分结果"令人意外",但具体榜单在正文中被截断,未包含可引用的细节。

nutlope查看原文 ↗