AI资讯 / 工程

工程 / 工程

Yahoo 借助 Amazon Bedrock 重构搜索再营销关键词扩展能力

AWS Machine Learning

Yahoo 在其需求方平台(DSP)的搜索再营销(SRT)模块中引入 Amazon Bedrock,以大语言模型替代原有的 Word2Vec 加局部敏感哈希(LSH)方案,解决了旧系统词汇过时、语义理解薄弱、部分关键词无法扩展等痛点。经过对 Amazon Titan、Meta Llama 及 Anthropic Claude 系列模型的对比评估,Yahoo 最终选用 Claude 3.5 Sonnet v2 作为核心扩展模型。新方案在严格相似度阈值下,关键词扩展中位比率提升五倍,最大扩展比率翻倍,且在旧系统完全无法产出结果的场景下仍能生成数百乃至数千个相关词。为控制幻觉风险,系统引入嵌入向量相似度验证步骤,并叠加敏感词过滤与合规审查机制,确保扩展结果在语义相关性与广告政策之间取得平衡。

搜索再营销(SRT)是 Yahoo DSP 广告技术套件的核心受众定向能力,其本质是将用户在 Yahoo 搜索及合作伙伴平台上的历史搜索行为转化为可供广告主使用的受众细分。广告主通过定义目标关键词来描述受众特征,系统再将这些关键词扩展为语义相关的词集,以覆盖更广泛的潜在用户群体。扩展后的关键词与原始关键词共同存储于 Amazon OpenSearch Service 集群,供后续批量评分流程使用,判断用户是否归属于特定受众细分。

旧有架构依赖 Word2Vec 嵌入模型与局部敏感哈希(LSH)的组合方案,流程涵盖关键词规范化、嵌入生成、索引构建、LSH 检索、敏感词过滤及结果排序等多个环节。然而该方案存在明显局限:词汇库更新滞后,难以反映新兴搜索词;扩展逻辑依赖句法相似性而非语义理解;对于稀有或歧义关键词,系统有时完全无法生成任何扩展结果,导致广告主的受众覆盖出现空白。

为解决上述问题,Yahoo 引入 Amazon Bedrock 的无服务器基础模型访问能力,在不自建推理基础设施的前提下,快速完成对多个主流大语言模型的原型验证与对比评估。团队在 Amazon SageMaker Studio 中测试了 Amazon Titan、Meta Llama 以及 Anthropic Claude 系列,最终以扩展比率与语义相似度的综合表现为标准,选定 Claude 3.5 Sonnet v2 作为生产模型。新架构将生成式 AI 关键词扩展无缝嵌入原有的 SQL 元数据存储与 OpenSearch 索引流程之中。

在实际部署中,团队观察到大语言模型存在幻觉倾向,部分扩展词与原始关键词语义偏离明显。为此,系统引入嵌入向量相似度验证机制:对每个扩展关键词生成嵌入向量,计算其与原始关键词嵌入的余弦相似度,仅保留超过预设阈值的结果。这一验证步骤有效过滤了噪声词汇,确保扩展结果与广告主原始意图保持语义一致,同时也为整个工作流的可信度提供了质量保障。

量化结果显示,与旧有 LSH 方案相比,基于 Claude 3.5 Sonnet v2 的新方案在严格相似度阈值下,关键词扩展中位比率提升五倍,最大扩展比率翻倍。在旧系统完全无法产出扩展词的场景中,新方案往往能生成数百乃至数千个相关词,显著扩大了广告主的可触达受众规模。除语义过滤外,系统还叠加了敏感词审查、受众细分黑名单及用户隐私偏好合规检查,确保扩展结果符合广告政策要求。

Yahoo 此次实践表明,生成式 AI 与传统广告技术工作流的结合并非简单的模型替换,而是需要在扩展能力、语义质量与合规约束之间构建完整的质量控制体系。Amazon Bedrock 提供的无服务器模型访问模式降低了多模型快速迭代的工程门槛,使广告技术团队得以将精力集中于业务逻辑优化而非基础设施管理。这一路径对于同样面临关键词扩展挑战的数字广告从业者具有较强的参考价值。

要点

  • Yahoo 以 Claude 3.5 Sonnet v2 替代 Word2Vec+LSH 方案后,关键词扩展中位比率在严格相似度阈值下提升五倍,最大扩展比率翻倍
  • 系统引入嵌入向量余弦相似度验证步骤,有效抑制大语言模型幻觉,确保扩展关键词与原始意图保持语义对齐
  • Amazon Bedrock 的无服务器基础模型访问能力使团队无需自建推理基础设施,即可快速完成多模型对比评估与原型验证
  • 新架构在语义扩展之外叠加了敏感词过滤、受众黑名单及用户隐私合规审查,满足计算广告的政策约束要求
  • 生成式 AI 关键词扩展在旧系统完全无法产出结果的稀有关键词场景下仍能生成数百至数千个相关词,填补了受众覆盖空白
查看原始来源

原始标题:How Yahoo enhances search retargeting using Amazon Bedrock

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。