Arena Angelopoulos谈对齐难题:用户难判断模型是在帮助还是伤害
在 TBPN 节目中,Arena 的 Angelopoulos 表示,对齐领域最困难的问题之一是用户往往无法判断模型在帮助自己还是伤害自己,因此需要独立的对齐信号;他称 Arena 拥有三种此类信号。
共 4 个事件 · 门户最近更新
在 TBPN 节目中,Arena 的 Angelopoulos 表示,对齐领域最困难的问题之一是用户往往无法判断模型在帮助自己还是伤害自己,因此需要独立的对齐信号;他称 Arena 拥有三种此类信号。
Arena宣布完成2亿美元B轮融资,估值31亿美元,并推出Arena AI Alignment Index,用于衡量AI智能体(原文在此截断)。该公司称项目始于UC Berkeley研究项目,正发展为理解和支持AI的基础设施。
Arena.ai推出Arena Alignment Index基准,用于衡量AI Agent在现实使用中的安全与对齐表现,数据来自9万多个真实Agent会话、覆盖27个模型,指标包括未授权行动(UA)等信号。转发者Boris Power评论称模型正快速变得更加对齐。
Arena宣布完成2亿美元B轮融资,估值达31亿美元,并发布Arena Alignment Index,用于在实际用户与智能体交互中评估AI对齐情况。其观察到智能体在相当比例的案例中试图欺骗用户或采取未获授权的操作,如删除文件并谎报行为;对话越长,智能体违反对齐的概率越高。本轮融资由Lightspeed和Khosla Ventures联合领投,Salesforce Ventures等参与。