工程 / 官方
零出站费用,把任意云端 GPU 接到 Hub 数据
Hugging Face 与 SkyPilot 联合发布零出站费用存储方案。团队只需在 SkyPilot 任务中用 hf:// 协议挂载 Hub 上的模型、数据集或 Bucket,配合已有 HF_TOKEN,即可在 AWS、GCP、Azure、Nebius、Lambda 或自有 Kubernetes、Slurm 集群上运行开发、训练与推理任务。Hub 数据无需迁移,读取不收出站或 CDN 费用,存储成本约 12-18 美元/TB/月,相对 AWS S3 约 23 美元/TB 加出站费更具优势。在 Qwen3.5-4B 上的多语言微调基准显示,同一份 YAML 仅切换 --infra 参数即可在三地完成,数据始终从同一 Bucket 流式读取,首个 epoch 即可让 GPU 几乎立即进入工作状态。
跨云运行 AI 工作负载,长期受制于一项隐性成本:数据存储与算力分布在不同云厂商时,跨网读取会产生出站费用与延迟。Hugging Face 与 SkyPilot 联合推出 store: hf 存储后端,把 Hub 上的模型、数据集与 Bucket 作为一等公民接入 SkyPilot 调度体系,让任意云端 GPU 都能直接流式访问同一份数据。
集成方式非常轻量:在 SkyPilot 任务的 file_mounts 中使用 hf:// 协议,配合环境变量里的 HF_TOKEN,即可将 Bucket 以读写方式挂载,或将模型、数据集、Space 仓库以只读方式挂载。MOUNT 模式走 Hugging Face 自研的 hf-mount FUSE 后端,在文件系统层按需拉取数据并维护本地缓存;COPY 模式则通过 huggingface_hub 预先下载,两种方式都不需要额外的存储账号或密钥。
读取侧的成本优势是这次合作的核心。Hugging Face Storage 完全免出站与免 CDN 费,无论 SkyPilot 把任务调度到 AWS、GCP、Azure、Lambda 还是用户私有集群,同一个 Bucket 都能直接被读取,不再需要在每家云上各保留一份数据副本。对以读取为主的训练与推理场景而言,这项费用差是长期可见的。
写入侧仍按计算所在云厂商的标准计费,与把数据存到任何外部存储一致。但对于首 epoch 这种尚未缓存的冷启动场景,Xet 块级去重配合按需拉取让 GPU 几乎立即开始工作,避免了传统整文件复制带来的长时间空转。
基准测试在 Qwen/Qwen3.5-4B 与 HuggingFaceH4/Multilingual-Thinking 数据集上进行,模型从 Hub 仓库只读挂载、检查点写入 Bucket,同一份 YAML 仅在 AWS、GCP、Lambda 之间切换 --infra 参数即完成训练。SkyPilot 把任务放到 GPU 可用的集群,数据始终来自同一 Bucket。
总体而言,这次合作消除了“为了避免出站费而把任务钉死在某个云厂商”的束缚。模型与数据留在 Hub、算力按需分布到 20+ 云与本地集群,团队可以在现有预留资源池里灵活调度,而不必再为每家云准备一份独立数据集。
要点
- hf:// 协议让 Hub 上的模型、数据集、Bucket 可作为本地路径直接挂载到 SkyPilot 任务,无需预复制
- 读取 Hub 数据免出站与 CDN 费,存储单价约 12-18 美元/TB/月,相对 AWS S3 约 23 美元/TB 加出站费有显著优势
- 同一份任务 YAML 可调度至 AWS、GCP、Azure、Nebius、Lambda、 Kubernetes 与 Slurm 等 20+ 后端,算力分配更灵活
- hf-mount FUSE 配合 Xet 块级去重,首 epoch 即可流式读取,避免整文件下载造成的 GPU 空转
- 基准测试显示在 Qwen3.5-4B 多语言微调中,三地切换参数、共享同一 Bucket 的链路顺畅
原始标题:Run AI workloads on any cloud, store on Hugging Face: zero-egress storage with SkyPilot
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。