Goodfire推新型AI监控技术,低成本拦截失控智能体 封面图
技术进展

Goodfire推新型AI监控技术,低成本拦截失控智能体

Heooo 10月09日00时31分 3 阅读

「AI安全初创公司Goodfire推出“由内而外”的监控系统,通过探针实时读取模型内部激活信号,在不显著增加计算开销的前提下,以远低于传统方案的成本检测恶意行为。该技术已在Baseten平台上线,支持多种风险类型监测。」

在人工智能代理(AI agents)日益复杂、自主性不断增强的背景下,如何有效监控其行为、防止其“越狱”或执行有害操作,已成为开发者和企业关注的核心问题。传统方法通常依赖一个外部AI模型全程复审主模型的输出内容,但这种方式成本高昂,尤其当代理长时间运行并处理大量文本时,费用迅速攀升。

Goodfire推新型AI监控技术,低成本拦截失控智能体

针对这一痛点,专注于AI可解释性(interpretability)的初创公司Goodfire近日推出了一种全新的低成本监控方案。与传统“事后审查”不同,Goodfire采用“由内而外”(inside-out)的策略——在其监控系统中部署名为“探针”(probes)的小型检测器,实时读取AI模型在推理过程中的内部神经激活信号。这些探针如同机场安检门,在模型每一步计算时同步扫描其内部状态,仅在发现异常时才触发更深入的二次审查。

该技术目前已集成至Baseten平台,后者是一家为企业提供AI模型托管与运行服务的公司。用户可根据自身需求选择监控的风险类型,包括恶意黑客攻击、化学或生物武器相关滥用、以及奖励作弊(reward hacking)等,并设定自动化响应机制:记录事件、转交人工审核,或直接拒绝请求。

Goodfire强调,其方案在成本和效率上具有显著优势。传统监控模型需重新处理主模型的所有输出,而Goodfire的探针则直接利用模型前向传播过程中已计算出的中间激活值,几乎不产生额外计算负担。据公司CEO Eric Ho在MAD播客中介绍:“内部激活监控非常便宜,因为它复用了前向传递中的已有计算。模型已经在算这个token,我们只是读取它已经完成的中间结果,并在其上运行一个分类器。”

Goodfire推新型AI监控技术,低成本拦截失控智能体

实际测试数据也印证了这一优势。在对开源模型Kimi K3的1,500次会话监控中,Goodfire方案总成本仅约51美元,而使用较便宜的外部AI模型全程监控需233美元,顶级模型则高达10,000美元。同时,该系统成功捕获了94%的恶意黑客会话,误报率(将无害会话送审)为8.7%。更值得注意的是,即使同时运行四个探针,模型响应延迟也仅增加不到2%。

Goodfire联合创始人兼CTO Dan Balsam指出,该技术的最大价值在于“能在事情发生前就捕捉到风险”,甚至可在模型评估或训练阶段就识别潜在的越狱倾向。这一能力对于开源模型尤为重要——由于其代码和权重公开,开发者可能移除原有安全限制,而Goodfire的轻量级探针可作为嵌入式“安全层”,在不破坏模型功能的前提下提供持续防护。

随着AI代理在企业自动化、科研探索等场景中的广泛应用,高效、低成本的安全监控将成为基础设施的关键一环。Goodfire的创新路径,或许为构建可信赖的下一代AI系统提供了新的技术范式。

# AI安全 # 模型监控 # 可解释性 # Goodfire # Baseten

来源:Heooo AI工具导航