产业 / 媒体
Base Labs联手Hugging Face与Goodfire,为开放权重模型构建安全基础设施
Baseten旗下研究机构Base Labs于2026年9月17日宣布,与Hugging Face及模型可解释性公司Goodfire AI达成合作,共同为开放权重模型建立安全评估与监控基础设施。此举背景是开放权重模型的安全隐患日益受到关注——一种名为「abliteration」的技术可绕过模型安全护栏,目前Hugging Face平台上已有逾6000个经此处理的模型。Base Labs计划研发并公开发布针对开放模型的训练与监控方法,将安全标准内嵌于模型全生命周期,而非依赖后期修补。三方强调,开放性本身是AI安全的优势,能提供更高的行为透明度,并将安全研究转化为可操作的控制手段。Baseten今年6月完成15亿美元F轮融资,估值达130亿美元;Goodfire亦于今年完成由B Capital领投的1.5亿美元B轮融资。
Baseten旗下研究机构Base Labs于周三正式宣布一项开放权重AI安全合作计划,合作方包括开源模型托管平台Hugging Face以及专注模型可解释性的Goodfire AI。三方将共同开发针对开放权重模型的安全评估与监控基础设施,并计划将相关方法公开发布,供更广泛的开发者社区参考与使用。
此次合作的直接背景是开放权重模型面临的安全威胁持续升级。一种名为「abliteration」的技术正被越来越多地用于移除模型内置的安全护栏,使其可能被滥用于有害场景。Hugging Face平台数据显示,目前已有超过6000个经过此类处理的模型公开流通,问题规模不容小觑。
Base Labs对此次合作的定位不是修补式的安全补丁,而是要建立一套透明、可复现的开放模型安全标准,将安全机制内嵌于模型训练与部署的全流程。Baseten在社交媒体上表示,开放性本身是AI安全的优势,能够提供更高的行为可见度,并将安全研究转化为可操作、透明的控制手段,而非依赖封闭系统的黑箱机制。
在三方分工上,Goodfire因其专注于打开AI决策「黑箱」、解释模型内部运作机制的核心能力,被认为最有可能承担将安全机制内嵌于模型的技术工作。Goodfire在回应中明确表示,安全必须内置于开放模型之中,并由服务提供方负责落实,这一表态与其产品方向高度契合。
从资本实力来看,此次合作的参与方均处于强势地位。Baseten于今年6月完成15亿美元F轮融资,估值跃升至130亿美元;Goodfire亦于今年完成由B Capital领投的1.5亿美元B轮融资,专注推进其模型可解释性平台。雄厚的资金支持为三方长期推进这一安全框架提供了保障。
展望未来,Baseten已向更广泛的开发者生态发出公开邀请,鼓励各方参与贡献这一安全框架。三方表示,目标是共同构建一个既安全又对所有人开放可及的开放模型生态系统。目前,合作的具体技术细节尚未对外披露,后续进展值得持续关注。
要点
- Base Labs、Hugging Face与Goodfire AI三方合作,旨在为开放权重模型建立内嵌式安全标准,而非依赖事后补救措施。
- abliteration技术可绕过模型安全护栏,Hugging Face平台上已有逾6000个经此处理的模型,开放权重模型的安全风险已达相当规模。
- 三方均认为开放性是AI安全的优势,透明度有助于将安全研究转化为可操作的控制手段。
- Baseten估值130亿美元、Goodfire完成1.5亿美元B轮融资,雄厚资本为长期推进安全框架提供支撑。
- Base Labs已向开发者社区发出公开邀请,寻求更广泛的生态参与共建安全框架。
原始标题:Base Labs launches an open-weight AI safety partnership with Hugging Face and Goodfire
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。