产业 / 媒体
NASA将谷歌Gemma大语言模型送入轨道,实现卫星图像在轨分析
NASA喷气推进实验室将谷歌的Gemma 3大语言模型送入太空,首次在轨演示了视觉语言模型分析卫星自身传感器拍摄的图像。该系统名为NAVI-Orbital,在Loft Orbital公司制造的YAM-9卫星上运行,使用压缩后的4位Gemma 3 4B模型,在基准测试中达到88%的分类准确率,且无需针对特定数据集进行训练或微调。这一突破意味着科学家现在可以通过自然语言提示与航天器交互,取代以往需要操作团队和复杂结构化指令的传统模式。该系统在轨运行于英伟达Jetson Orin AGX计算模块上,功耗仅需8GB内存,展示了轻量化AI在太空应用的巨大潜力。
NASA喷气推进实验室近期将谷歌的Gemma 3大语言模型送入太空,实现了首次在轨视觉语言模型分析卫星自身传感器图像的演示。该系统名为NAVI-Orbital,在Loft Orbital公司制造的YAM-9卫星上运行,使用压缩后的4位Gemma 3 4B模型,在包含7960张图像的基准测试中达到88%的分类准确率,且无需针对特定数据集进行训练或微调。NASA技术组负责人Juan M. Delfa表示,这一成功意味着研究人员与航天器交互方式的根本性转变。
NAVI-Orbital是一个基于LangGraph协调器的智能软件框架,由Delfa及其合作者开发。它部署了谷歌的开放权重模型Gemma 3 4B,以生成纯文本图像描述。在轨测试中,研究人员在法国图卢兹和阿根廷海岸上空进行了两次实时捕获测试,除了生成图像文本描述外,还通过脚本化问题询问图像是否包含商业或住宅区域等特征。图像分析在YAM-9卫星上完成,该卫星搭载了由多个抗辐射处理器组成的计算集群。
Gemma 3在英伟达Jetson Orin AGX上运行,这是一个常用于机器人和AI任务的小型计算模块。4位、40亿参数的模型仅需8GB内存,使其能够在低功耗设备上运行。Delfa强调,这传达了模型轻量化的信息,可以在非常小的计算机上运行。Loft Orbital总经理Paul Lasserre指出,视觉能力的大语言模型可为轨道操作带来范式转变,通过语义压缩解决带宽限制问题。
传统卫星无法提供快速、高保真的图像和视频传输,带宽有限且只能在特定轨道位置向地面站传输数据。Lasserre认为,AI模型可以通过语义压缩解决这一问题,即卫星仅传输文本摘要而非大量原始图像数据。例如,在野火检测中,卫星目前需要长达90分钟的延迟才能将结果传回地面,而具备在轨分析能力的卫星可以立即发送文本警告。
NAVI-Orbital不仅实现了更快的洞察,还展示了与航天器交互的新方式。虽然系统目前被刻意隔离于飞行软件之外,仅读取图像并生成描述,但重新配置系统以搜索不同类型目标只需编辑文本提示,无需重写或重新验证机载软件。Delfa表示,长期愿景是将这一能力扩展到无人卫星和图像处理之外,作为宇航员的AI伴侣,通过自然语言交互辅助太空任务。
这一演示表明,在太空中部署大语言模型并通过提示控制它是可行的。未来,科学家可以通过上传自然语言提示来指导航天器分析任务,彻底改变以往需要操作团队和复杂指令的传统模式。尽管距离完全实现这一愿景还需大量研究,但NAVI-Orbital的成功为太空AI应用开辟了新的可能性。
要点
- NASA首次在轨演示视觉语言模型分析卫星图像,使用谷歌Gemma 3实现88%分类准确率。
- Gemma 3以4位压缩格式运行于英伟达Jetson Orin AGX,仅需8GB内存,展示轻量化AI在太空的可行性。
- 语义压缩技术可大幅减少卫星数据传输量,将野火检测等任务的延迟从90分钟降至实时。
- 自然语言提示取代传统结构化指令,使科学家能更灵活地与航天器交互。
- 长期愿景包括将AI作为宇航员伴侣,通过自然语言辅助太空任务。
原始标题:NASA Puts Google’s Gemma Large Language Model in Orbit
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。