技术进展
Claude Fable 5优化生物安全机制减少误拦截
Heooo 08月08日16时00分 27 阅读
「Anthropic近日更新Claude Fable 5模型的生物安全防护机制,优化安全分类器以更准确区分无害与高风险问题,使生物学相关问答的降级现象减少85%,模型可处理更广泛生物学任务,同时仍限制专业研究和药物开发请求。」
Anthropic近日发布博文,宣布正在更新旗下Claude Fable 5模型的生物安全防护机制,重点解决此前生物安全分类器过度拦截的问题。据官方测试数据,本次更新使生物学相关问答的降级现象减少了85%,Fable 5现在能够处理更广泛的生物学任务,用户提出此类问题后遭遇系统降级的情况明显减少。
此前,为防范某些恶意用户利用Fable 5模型进行生物武器研究等高风险活动,Anthropic专门为Claude设置了安全分类器,用于检测用户是否要求模型执行受保护的生物学任务,或生成有害内容。然而,这一机制在拦截高风险请求的同时,也误伤了不少正常生物学问题,导致用户体验受影响。
为此,Anthropic调整了安全分类器的工作机制,使其能够更准确地分辨无害问题与真正高风险的问题,而非一刀切地拦截所有生物学相关请求。这种精细化的分类逻辑,既保留了对潜在滥用行为的防护能力,又减少了对合规用户的干扰。
值得注意的是,即使误拦截率大幅下降,Fable 5模型仍会限制专业生物学研究和药物开发相关的请求。Anthropic表示,这是为了持续防范AI技术可能带来的安全风险。未来,公司将继续在开放能力和安全防护之间寻求平衡,不断优化模型的行为边界。
# Anthropic # Claude Fable 5 # 生物安全 # 模型优化
来源:Heooo AI工具导航