模型卡片不足以治理开源权重基础模型
「一项针对Hugging Face上500张模型卡片的研究指出,现有模型卡片框架未能充分告知下游开发者开源权重基础模型的独特安全挑战。该研究主张采用模型卡片、可接受使用政策和许可证三层互补的治理框架,并呼吁将三者整合为综合安全工件。」
随着开源权重基础模型(OWFMs)的快速增长,AI社区正在重新审视有效的下游治理策略。尽管模型卡片已被广泛采纳为模型仓库中的透明度工件,但现有框架往往未能充分告知下游开发者和用户关于OWFMs所特有的安全挑战。一篇最新发表于arXiv的立场论文对此进行了深入剖析,通过分析Hugging Face平台上的500张模型卡片,提出了一个多层次治理框架的构想。
该论文指出,有效的OWFMs治理需要整合三个互补的组成部分:模型卡片、可接受使用政策(AUPs)以及许可证。这一观点源于对现有监管方法所遗留安全空白的识别。研究人员通过分析带有安全关键信息的模型卡片,发现现有方法在模型传承(model heritage)、对齐溯源(alignment provenance)以及经验观察行为(empirically observed behaviors)等方面存在明显不足。
具体而言,模型传承指的是模型从哪些基础模型衍生而来,这直接影响其潜在风险特征。对齐溯源则关注模型在训练过程中采用了哪些安全对齐技术,例如基于人类反馈的强化学习(RLHF)或红队测试。然而,当前许多模型卡片对这些关键信息要么一笔带过,要么完全没有提及。与此同时,经验观察行为——即在特定输入下模型可能产生的有害输出——也缺乏系统性记录。这些信息的缺失使得下游开发者难以对模型进行充分的风险评估和针对性防护。
论文进一步认为,标准的开源许可证(OSLs)并不适合OWFMs,甚至可能削弱可接受使用政策的可执行性。开源许可证通常侧重于版权和分发条款,而非使用行为的安全约束。当许可证与AUP发生冲突或模糊不清时,下游用户可能绕开安全限制,或者因法律不确定性而无法有效执行AUP。这种法律维度的薄弱使得仅依赖许可证或AUP的单一治理方式难以奏效。
基于上述观察,论文勾勒了模型卡片、AUP和许可证的演进方向,主张将它们从各自孤立的文档发展为整合的安全工件(integrated safety artifacts)。具体来说,模型卡片应补充可量化的安全指标和传承信息,AUP应针对OWFMs的再分发和微调场景制定更具体的条款,而许可证则需与AUP形成互补而非冲突的关系。只有将信息维度、规范维度和法律维度有机结合,才能构建一个连贯且全面的治理框架。
这项研究的意义在于,它为AI治理提供了一个操作性较强的分析框架。对于模型发布者而言,它提示了如何优化模型文档以增强责任透明度;对于下游开发者和企业用户,它强调了在选用开源权重模型时需关注的治理工具组合;对于政策制定者和社区规范制定者,它则提供了评估现有治理工具效能的实证基础。
随着开源权重模型在产业界的应用日益广泛,如何平衡开放共享与安全可控已成为一个重要课题。这篇论文所提出的多层次治理思路,或将为未来模型发布和监管实践提供有价值的参考方向。
来源:Heooo AI工具导航