推文介绍一篇NVIDIA团队论文称,让多模态模型在智能体场景中使用工具后,拒答有害请求的失败率最高相对上升68.7%,平均上升17.7%;该现象出现在Claude Opus 4.6和4.7、Gemini Agentic Vision、Qwen3.5-122B-A10B及agent-tuned开源模型,并横跨MM-SafetyBench、HoliSafe和VLSBench。作者将原因归因于工具输出淹没原始请求的恶意意图,以及模型注意力转向描述工具结果而非做安全决策;作者还提出,在最终回答前重新插入原始请求和图片可部分恢复被削弱的拒答。以上均为推文所述研究结论,未独立核实。
作者推荐名为 good-css.com 的工具,称其提供打包好的技能(skill),为智能体提供良好的网页设计原则指导,并让网站更易于被智能体使用;作者称只需把该网址交给智能体即可由其完成后续工作。推文同时引用 joel 的示例提示词"read https://good-css.com and give me the most valuable improvements we can make right now"。以上为作者介绍,未独立核实。