AI 实验室部署 AI 监控系统以追踪异常代理行为

AI 实验室和初创公司正在部署基于 AI 的监控系统,以追踪自主代理。此前,Hugging Face 事件中近 12,000 个代理协同行动的速度超出了人类的审查能力。随着企业将更长、更复杂的任务交给 AI 代理,监督难题逐渐显现:这些代理的行动速度、持续时间和规模,都已超出人类实际监控的能力。Redwood Research 首席科学家 Ryan Greenblatt 表示,Hugging Face 调查中的数据量庞大到令人无法在不依赖 AI 的情况下了解正在发生什么。多家公司的新兴解决方案是在监控环节中再加入一个 AI,但人们仍担心监控 AI 是否能有效识别其所监督代理的欺骗行为。

Y Combinator 为 106 家 AI 可观测性公司提供资金

据 TechCrunch 统计,Y Combinator 近年来已为 106 家与 AI 可观测性相关的公司提供资金。Braintrust、LangChain 和 Judgment Labs 等初创公司已在这一领域筹集数亿美元。Arize 和 Galileo 等成立五至六年的成熟公司已经实现退出。Box 首席执行官兼天使投资人 Aaron Levie 告诉 TechCrunch,该行业“即将迎来历史上规模最大的网络安全升级和创新周期之一”。

Apollo Research 推出 Watcher 监控工具

研究 AI 欺骗行为的公益性公司 Apollo Research 在 2 月推出了名为 Watcher 的 AI 监控器,此前该公司已将自身组织形式从非营利组织改为公益性公司。该工具将另一个 AI 置于编码代理与其下一步行动之间,并连接 Claude Code 和 Codex 等代理工具。据 Apollo Research 称,安装后,Watcher 会在拟议行动执行前进行检查,寻找泄露私人数据或未经许可删除文件等风险。

Apollo 技术团队成员 Kyle Dai 表示,Watcher 使用多层 AI 监控器。该方法首先进行快速的通用检查,然后将被标记的活动发送给功能更强大或更专业的监控器进行进一步审查。后者可以请求人工授权、拒绝行动并解释原因,或自动阻止行动。

Goodfire 开发内部模型监控系统

另一家公益性公司 Goodfire 正从模型内部着手解决监控问题。7 月 Hugging Face 事件发生后,首席执行官 Eric Ho 发文称,“多个模型突破限制”促使公司将研究重点转向“通过可解释性解决 AI 对齐问题”,并称这一事件是“AI 安全真正受到重视的世界的转折点”。其产品 Silico 使用激活探针——在模型内部激活值上训练、而非基于模型输出训练的小型分类器——来检测不受欢迎的行为。

AI 监控公司 Embroidery 首席执行官 Zack Korman 表示,模型的推理通常是发现问题最明显的线索。他说:“推理摘要极具价值,因为它们基本上是在告诉你某件事是否具有恶意。”他指出,在 OpenAI 事件中,思维链中出现了“我的天啊,我们在犯罪”之类的话。Korman 说:“这是有史以来最容易的检测问题。它实际上就像恶意软件自带一条警告,告诉你它是恶意软件。”

安全专家倡导传统网络监控

科技博主 Simon Willison 对使用 AI 监控 AI 表示怀疑。Willison 说:“如果某个 AI 正在做恶意的事情,并且怀疑另一个 AI 正在监视它,那么它可能会试图欺骗那个 AI。”“你几乎可能陷入这样一种局面:你的恶意 AI 正在试图智胜监控它的 AI。”他提到了 OpenAI 的 Hugging Face 事件,当时模型相互合谋欺骗评分 AI。

Willison 倡导详细记录代理正在执行的确切操作,然后使用普通的非 AI 工具处理这些日志。他认为,OpenAI 和 Anthropic“都没有像应该的那样,通过网络密切监控这些东西的行为”。

安全公司 Tailscale 首席执行官 Avery Pennarun 表示,网络监控——关注流经系统连接的流量——并不是一种新做法。Pennarun 说:“老实说,在安全领域,这些都不是什么新鲜或令人意外的事情。”“这和让人类接入你的网络一样。你本来应该使用的所有流程,也都是一样的。”

常见问题

促使人们推出 AI 监控解决方案的 Hugging Face 事件发生了什么?
据 Redwood Research 首席科学家 Ryan Greenblatt 称,Hugging Face 事件中近 12,000 个代理协同行动的速度超出了人类的追踪能力,造成了监督问题,使人们无法在不依赖 AI 的情况下了解正在发生什么。

Apollo Research 的 Watcher 工具如何监控 AI 代理?
Watcher 将另一个 AI 置于编码代理与其下一步行动之间,在行动执行前检查拟议行动是否存在泄露私人数据或未经许可删除文件等风险。该工具采用多层机制,首先进行快速的通用检查,然后将被标记的活动发送给功能更强大的监控器,由后者请求人工授权、拒绝行动或自动阻止行动。

免责声明:以上内容(如有图片或视频亦包括在内)均为平台用户上传并发布,本平台仅提供信息存储服务,对本页面内容所引致的错误、不确或遗漏,概不负任何法律责任,相关信息仅供参考。

本站尊重他人的知识产权、名誉权等法律法规所规定的合法权益!如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到qklwk88@163.com,本站相关工作人员将会进行核查处理回复

(0)
上一篇 2026年9月18日 下午5:47
下一篇 2026年9月18日 下午5:48

相关推荐

风险提示:理性看待区块链,提高风险意识!