AI资讯 / 产业

产业 / 媒体

AMD收购初创公司Taalas,将AI模型直接烧入芯片硅基

The Decoder

AMD宣布收购加拿大AI初创公司Taalas,后者专注于构建将模型架构与训练参数直接嵌入芯片的专用推理硬件。Taalas于2023年在多伦多成立,今年2月才正式公开亮相,其核心技术路线与业界主流截然不同:通过将模型权重硬编码进硅基,推理速度得以大幅提升,但代价是每块芯片只能运行单一模型。演示芯片在运行Llama 3.1-8B时,每用户每秒生成token数超过16000,远超其他推理芯片。AMD计划将该技术整合进其加速器产品路线图,与Instinct GPU系列共同构成系统级解决方案。与此同时,据报道谷歌也在研发类似的专用芯片用于Gemini模型推理。此次收购仍需通过常规监管审批。

AMD宣布收购加拿大AI初创公司Taalas,这家公司以一种非常规的方式重新定义了AI推理芯片的设计逻辑。Taalas于2023年在多伦多成立,今年2月才正式走出隐身模式。其核心创新在于将神经网络的模型架构与训练好的参数权重直接硬编码进芯片硅基,而非像传统GPU那样在运行时动态加载模型。这一设计使推理延迟大幅降低,吞吐量显著提升。

Taalas公开的演示芯片数据令业界瞩目:在运行Meta的Llama 3.1-8B模型时,该芯片每用户每秒可生成超过16000个token,远超目前市场上任何竞争硬件的同类指标。这种速度优势源于模型权重与计算单元的深度融合,省去了数据搬运和动态调度的开销,但也因此带来了根本性的限制——每块芯片只能服务于一个固定模型,无法灵活切换。

AMD计划将Taalas的技术整合进其AI加速器产品路线图,与现有的Instinct GPU系列形成互补,共同构成面向企业客户的系统级推理解决方案。AMD AI部门高级副总裁Vamsi Boppana表示,此次收购将有效强化公司的AI产品组合,尤其是在高吞吐量推理场景下的竞争力。Taalas联合创始人Ljubisa Bajic则表示,AMD所具备的规模与市场触达能力,正是这家初创公司实现技术落地所需要的资源。

这一技术路线并非Taalas独有的探索方向。据报道,谷歌也在内部研发类似的专用芯片,专门用于加速其Gemini系列模型的推理部署。将特定模型与硬件深度绑定的思路,正在成为追求极致推理性能的一条新兴路径,尤其适用于大规模部署单一模型的云端推理场景,例如聊天机器人、代码补全等高并发应用。

不过,这种硬编码方案也面临明显的商业挑战。模型迭代速度极快,一旦芯片与某一版本模型绑定,便难以随模型升级而复用,这对芯片的生命周期管理和客户采购决策都构成压力。如何在极致性能与灵活性之间找到平衡,将是AMD整合Taalas技术后需要面对的核心课题。此次收购目前仍需通过标准监管审批程序方可正式完成。

要点

  • Taalas将模型权重直接硬编码进推理芯片,演示芯片运行Llama 3.1-8B时每用户每秒超过16000个token,远超现有竞品。
  • 这种设计以灵活性换取极致速度,每块芯片只能运行单一固定模型,无法动态切换。
  • AMD计划将该技术与Instinct GPU系列整合,构建面向企业的系统级推理解决方案。
  • 谷歌据报道也在研发类似的模型专用推理芯片,用于Gemini系列部署,显示这一技术路线正获得头部玩家关注。
  • 模型迭代速度与芯片硬编码之间的矛盾,是该技术路线商业化落地的核心挑战。
查看原始来源

原始标题:AMD acquires Taalas, a startup that bakes AI models directly into silicon

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。