AI资讯 / Agent

Agent / 分析

每小时不到6美元的自动化AI工程师

Latent Space

OpenAI最新发布的GPT-6 Astra是首款基于Stargate架构的超大规模模型,在FrontierMath(97.6%)和ARC-AGI-3(99.9%)等最高难度基准测试中几乎达到满分,全面超越竞争对手Fable 5.1。Latent Space团队获得早期访问权限,耗费超过200亿tokens对其进行全方位实测,得出一个令人震惊的结论:GPT-6 Astra已属于新一类能够独立胜任AI工程师工作的模型。它不仅能协助选择和训练模型、标注数据、维持流水线运转,还能部署和调试完整系统、指挥并评估多个子智能体,并在单一智能体线程中保持数十亿tokens级别的上下文连贯性。更值得关注的是其成本表现:以每秒33个tokens、每百万tokens最高50美元的价格计算,实际使用成本约合每小时6美元,同时在速度与智能的综合表现上也处于市场前列。

GPT-6 Astra于2026年9月3日正式发布,是OpenAI推出的首款Stargate架构超级模型。在当前最具挑战性的两项权威基准测试中,Astra分别取得FrontierMath 97.6%和ARC-AGI-3 99.9%的成绩,全面压制此前的领先者Fable 5.1。OpenAI联合创始人Greg Brockman公开表示AGI已经到来,研究负责人Jakub Pachocki则将其描述为他期待已久的「自动化AI研究实习生」。

Latent Space团队在获得早期访问权限后,将Astra投入了大量真实场景测试,累计消耗超过200亿tokens。测试范围涵盖构建十余款内部及个人工具(其中4款替代了此前付费的SaaS产品)、重新设计个人网站、搭建GitHub与Vercel的功能性替代方案、为一款合法走法数量是围棋一万倍的策略棋盘游戏训练AI,以及整理个人财务节省数万美元等高度多样化的任务。

在AI工程能力层面,Astra展现出此前模型从未具备的系统性自主能力。它能够自主选择并训练模型、辅助数据标注并利用用户标注结果进行主动学习(类似SAM机制)、监控并维持数据流水线的持续运转、读取和分析运行日志,以及一次性完成整个系统的部署与调试。更关键的是,它能够扇出式地调度和评估多个子智能体,包括运行其他模型的智能体,并在超长上下文中保持逻辑连贯。

成本是Astra最出人意料的竞争优势之一。以每秒33个tokens的生成速度和每百万tokens最高50美元的定价计算,实际使用成本约合每小时6美元。Artificial Analysis的独立测评也证实,Astra在token效率上优于同级别的Sol和Fable模型,这意味着在预览阶段的延迟表现延续至正式发布后,Astra有望同时成为市场上速度与智能综合表现最优的选择之一(Spark 1.3除外)。

Latent Space团队在文章中特别强调,此次测评结论并不局限于Astra一款模型。他们正在对Grok、Fable等其他前沿模型进行类似测试,认为本文讨论的智能体编码模式将普遍适用于2026年底所有同级别的前沿模型。团队的核心建议是:现在是时候大幅提升对AI模型的期望值,以更激进、更不设限的方式去探索Astra和Fable级别模型的实际边界。

这一系列测试结果指向一个更宏观的行业信号:AI模型正在从「辅助工具」向「自主执行者」跨越。当一个模型能够独立完成从需求分析、系统设计、代码实现到部署调试的完整工程闭环,并以每小时6美元的成本运行时,AI工程师的工作方式乃至团队协作结构都将面临深刻重塑。对于开发者和企业而言,如何有效「雇用」和管理这类模型,将成为下一阶段最核心的竞争力。

要点

  • GPT-6 Astra在FrontierMath(97.6%)和ARC-AGI-3(99.9%)两项顶级基准测试中接近满分,全面超越Fable 5.1,标志着AI能力出现阶跃式提升。
  • Astra已具备完整的AI工程师能力,可自主完成模型训练、数据标注、流水线维护、系统部署调试及多智能体调度等复杂工程任务。
  • 实际使用成本约合每小时6美元,同时在token效率上优于同级竞品,兼顾速度与智能的综合表现具有显著竞争力。
  • Latent Space团队通过200亿tokens的实测证明,Astra能够在单一智能体线程中保持数十亿tokens级别的上下文连贯性,支撑长周期复杂任务。
  • 类似的智能体编码能力预计将在2026年底前普及至Grok、Fable等其他前沿模型,开发者应尽早建立驾驭此类模型的方法论。
查看原始来源

原始标题:GPT-6 Astra: an automated AI Engineer you can hire for <$6 an hour

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。