Goodfire 推出模型内部监控器,拦截失控 AI 智能体成本更低
Goodfire 发布一种监控 AI 智能体的新方式,通过读取模型内部激活信号而非重新审查其输出,来发现失控行为,该监控器面向 Baseten 客户开放。
Goodfire 发布一种监控 AI 智能体的新方式,通过读取模型内部激活信号而非重新审查其输出,来发现失控行为,该监控器面向 Baseten 客户开放。
OpenAI 解雇了与 Hugging Face 黑客事件调查相关的三名安全研究员 Tomek Korbak、Jasmine Wang 和 Mikita Balesni,三人向公司安全委员会发公开信称解雇过程突然且公开,令团队人心惶惶。