DataHub 关键词情报 · 数据更新至 2026-07-22
Together AI工程与基础设施招聘
本页聚焦Together AI工程与基础设施相关岗位,便于用户比较岗位职责、地点、薪资标注和详情入口。
活跃公司
- Together AI51 · 100.0%
热门地点
- 美国40 · 78.4%
- 荷兰7 · 13.7%
- 印度3 · 5.9%
- 英国1 · 2.0%
岗位方向
- 工程与基础设施51 · 100.0%
OPEN ROLES
代表岗位
GTM工程师
构建GTM技术栈:打造AI原生技术栈并实现无缝集成;集中数据:构建自动化引擎,将数据集中到CRM及数据仓库中;维护数据完整性:构建并维护数据流、丰富逻辑和同步架构,确保系统端到端准确、去重且可信
高级软件工程师,GPU基础设施生命周期管理
构建配置状态机:设计并实现软件,对物理主机的完整生命周期(从发现、推理启动、GPU驱动/CUDA堆栈、健康验证到退役/RMA)进行建模,作为显式、版本化的状态和转换;构建自助服务API:设计声明式API和控制平面,使推理团队能够通过一次API调用请求、扩展和拆除推理集群,无需工单或人工介入
语音AI高级平台工程师
负责Together实时API层的架构和可靠性,为WebSocket和HTTP流式API设定技术方向,支持大规模STT和TTS,建立连接生命周期、背压、优雅降级和重连的可靠性标准;主导延迟敏感型语音工作负载的自动扩展架构,设计编排系统处理跨数万个GPU的突发实时流量,解决并发连接限制、流状态和硬延…
高级平台工程师,服务基础设施
负责产品基础内服务基础设施的技术方向,包括Kubernetes、AWS、Terraform、CDN、ALB、DNS、IAM、服务网络及相关运维模式;通过提升可靠性、可操作性、部署安全性、基础设施一致性和生产就绪度,升级现有产品基础服务
高级机器学习工程师,语音AI
端到端负责语音推理路线图——定义并执行优化STT、TTS和语音到语音模型的技术策略;推动一流的推理性能——架构并实现针对语音工作负载的领先TTFB、吞吐量和GPU利用率的系统;领导语音模型的大规模生产化——为无服务器和专用端点设计服务架构,包括批处理策略、流式推理管道和针对实时音频的内存管理
高级工程师,分布式存储与HPC及AI基础设施
为Together AI架构并实施技术战略和存储路线图,在扩展GPU集群时推动高性能架构决策;通过集成Vast、Weka和Ceph,工程化并扩展多PB级AI/ML存储系统,并通过自动化分层和生命周期策略执行深度成本优化
软件工程师(阿姆斯特丹)
跨全栈构建和发布功能——前端使用TypeScript/Next.js,后端使用Elixir/Phoenix服务(您可以逐步学习);端到端地拥有明确定义的工作,从实施到测试和发布;为身份和访问功能做出贡献:SSO、OAuth、组织、项目、API密钥和基于角色的访问控制
高级软件工程师(阿姆斯特丹)
端到端设计和拥有身份验证与授权系统,包括SSO、OAuth/OIDC、SAML、组织、项目、API密钥以及基于角色/属性的访问控制;制定并记录影响所有Together产品身份功能的技术决策
高级产品工程师
全面负责商务前端层:从消费服务API、构建类型化界面到交付精美、可访问的用户体验,并在必要时深入后端系统以在快节奏环境中推进产品工作;将复杂的产品需求和业务逻辑分解为迭代路线图,正确排序实现步骤,无需逐步指导即可执行
高级平台工程师,语音AI
构建并强化用于语音转文本和文本转语音的实时WebSocket和HTTP流式API,包括连接生命周期管理、背压处理、错误处理和重连机制,达到生产级语音代理的可靠性标准;设计并实现语音模型端点的自动扩缩容,处理突发实时流量模式,考虑并发连接限制、流状态和严格的延迟上限
高级机器学习工程师,语音AI
优化语音模型(STT、TTS、语音到语音)的推理性能,针对我们精选的模型集,实现最佳的首次字节时间、吞吐量和GPU利用率;在无服务器和专用端点上将语音模型投入生产,包括针对音频工作负载的批处理策略、流式推理和内存管理
数据仓库工程师
参与构建和维护用于产品、使用量、计费和运营数据的奖章/精选数据仓库架构(青铜/白银/黄金层);构建和维护由Airflow编排的管道以及dbt转换项目(模块化、经过测试、有文档记录);帮助设计分析就绪的模型:SCD类型2、星型模式以及上游规范层的适当规范化
分析工程师 — 数据仓库
参与构建和维护产品、使用、计费和运营数据的奖章/精选数据仓库架构(青铜/白银/黄金层);构建和维护Airflow编排的管道以及dbt转换项目(模块化、经过测试和文档化);帮助设计分析就绪模型:SCD类型2、星型模式以及上游规范层的适当规范化
AI基础设施工程师(SRE)
参与PagerDuty轮值待命,响应影响可用性的事件;使用Ansible、Terraform和Kubernetes构建并运行基础设施,支持大规模并发用户;构建监控系统,确保为客户提供最高质量的服务
AI基础设施工程师(SRE)
参与PagerDuty轮班值守,响应影响可用性的事件;使用Ansible、Terraform和Kubernetes构建和运行基础设施,以支持大规模并发用户;构建监控系统,确保为客户提供最高质量的服务
AI基础设施工程师
参与轮值待命(Pagerduty)以响应生产事故;使用Ansible、Terraform和Kubernetes构建和运行我们的基础设施,以支持大规模并发用户;构建监控系统,确保为客户提供最高质量的服务
客户支持工程师(推理方向),印度
直接与客户互动,解决涉及尖端GPU集群及推理和微调服务的复杂技术挑战,确保每次都能提供快速有效的解决方案;成为所有生成式AI解决方案的产品专家,在问题升级到工程和产品团队之前,充当最后的技术防线
客户支持工程师(推理方向)
直接与客户互动,解决涉及尖端GPU集群及推理和微调服务的复杂技术挑战,确保每次都能提供快速有效的解决方案;成为所有生成式AI解决方案的产品专家,在问题升级到工程和产品团队之前,充当最后的技术防线
客户支持工程师(GPU集群)
直接与客户互动,解决涉及尖端Kubernetes GPU集群的复杂技术挑战,确保每次都能快速有效地解决问题;成为GPU集群服务的产品专家,在问题升级到工程和产品团队之前,充当最后的技术防线
客户成功工程师(GPU集群)
担任指定战略客户的技术联系人,全面负责计算、网络、存储和设施领域的技术关系;通过定期状态报告、技术指导会议、季度业务回顾(QBR)和执行业务回顾(EBR)推动结构化互动;将客户运营反馈转化为工程、产品和基础设施路线图的可行输入
基础设施设计工程师
通过设计空白空间布局来架构HPC集群,包括机架放置、通道配置、冷热通道封闭、设备密度以及高密度GPU部署的气流策略;与电气和机械工程师合作,将电力和冷却基础设施集成到空白空间环境中;与网络工程团队合作,定义和验证高速AI集群互连的物理层要求(结构化布线、路径规划、端口密度),确保设计与物理和逻辑网…
销售开发工程师
与客户经理合作,将入站意向转化为商业合同;与客户经理合作,将Together平台用户转化为更广泛的商业机会;通过引入客户声音,协作制定产品路线图和功能;在CRM系统(如Pipedrive、Salesforce等)中细致管理新业务机会管道
GPU工程师
优化和微调GPU代码以实现更好的性能和可扩展性;与跨职能团队合作,将GPU加速解决方案集成到现有软件系统中;紧跟GPU编程技术和最新进展;具备GPU编程和并行计算的坚实基础,例如CUDA和/或Triton
工程师
研究其性能和可扩展性与推理行为紧密耦合的强化学习和后训练方法;协同设计算法和系统,而非将它们视为独立部分;通过重新思考推理、调度和训练之间的交互,旨在解锁新的实验范式;项目可能涉及更大的模型、更长的推演和更复杂的评估
机器学习工程师 - 推理
设计和构建支撑Together AI推理引擎的生产系统,确保大规模下的可靠性和性能;开发和优化面向大规模AI应用的运行时推理服务;与研究人员、工程师、产品经理和设计师合作,将新功能和研究能力推向世界
LLM推理框架与优化工程师
设计和开发用于文本、图像和多模态生成模型的容错、高并发分布式推理引擎;实现和优化分布式推理策略,包括专家混合(MoE)并行、张量并行、流水线并行,以实现高性能服务;应用CUDA图优化、TensorRT/TRT-LLM图优化、基于PyTorch的编译(torch.compile)和推测解码,以提高效…
首席开发者体验工程师 - 文档(旧金山/纽约)
领导我们产品线的全面文档策略;编写关于如何在我们平台上进行推理、微调和训练的全面指南;与工程团队合作,使用我们的SDK(Python和TypeScript示例)记录和展示新功能;创建针对特定用例的教程和指南,以解决客户使用我们API的常见场景
高级工程师,分布式存储、高性能计算与人工智能基础设施
设计多PB级AI/ML存储系统;集成WekaFS、Ceph等技术;主导容量规划与成本优化(通过分层、生命周期策略、规模调整实现30-50%的成本节约);设计/优化RDMA、InfiniBand、400GbE网络;针对最大吞吐量和最低延迟进行调优;实施NVMe-oF/iSCSI;排查瓶颈;优化存储相…
高级工程师,分布式存储与高性能计算及人工智能基础设施
设计多PB级AI/ML存储系统;集成WekaFS、Ceph等技术;主导容量规划和成本优化(通过分层、生命周期策略、规模调整实现30-50%的成本节约);设计/优化RDMA、InfiniBand、400GbE网络;针对最大吞吐量和最低延迟进行调优;实施NVMe-oF/iSCSI;排查瓶颈;优化存储的…
软件工程师(机器学习平台)
负责多集群编排、投资组合优化、预测性自动扩缩容、控制面板、模型启动、轻量级模型优化等工作;分析与改进现有分布式系统、API、数据库及基础设施的健壮性和可扩展性;与产品团队合作,理解功能需求并交付满足业务需求的解决方案
站点可靠性工程师
参与值班轮换(Pagerduty),响应生产事件;使用Ansible、Terraform和Kubernetes构建和运行基础设施,以支持海量并发用户;构建监控系统,确保为客户提供最高质量的服务
工程师
识别、设计和开发支撑Together云平台的基础后端服务;分析和改进现有分布式系统、API、数据库和基础设施的健壮性与可扩展性;与产品团队合作理解功能需求,并提供满足业务需求的解决方案
工程师
设计、构建和维护高性能、安全、高可用的后端服务/操作器,用于数据中心自动化硬件管理(如Infiniband分区、数据中心内并行存储配置、虚拟机配置);为拥有数千个GPU的新GB200数据中心设计和构建IaaS软件层
高级软件工程师,可观测性
识别、设计和开发支撑Together云平台的基础后端服务;分析和改进现有分布式系统、API、数据库和基础设施的健壮性与可扩展性;与产品团队合作,理解功能需求并交付满足业务需求的解决方案
高级软件测试开发工程师
与SDET团队合作,制定可持续的测试自动化策略,并推动相关团队承担责任,维护这些实践;识别项目需求,建立考虑团队资源、路线图和质量标准的QA最佳实践和流程;以用户影响为决策因素,维护高质量标准
高级网络工程师(阿姆斯特丹)
设计、部署、管理和维护全球多供应商、多协议的高性能计算网络;分析数据以诊断和识别网络问题的根本原因,最大限度地减少停机时间;评估并推荐网络技术、硬件和软件解决方案;参与设计评审,确保拟议的网络架构符合业务需求,并针对性能、可扩展性和可靠性进行优化
高级网络工程师
设计、部署、管理和维护全球多供应商、多协议的高性能计算网络;分析数据以诊断和识别网络问题的根本原因,最大限度地减少停机时间;评估并推荐网络技术、硬件和软件解决方案;参与设计评审,确保拟议的网络架构符合业务需求,并在性能、可扩展性和可靠性方面进行优化
高级开发者生产力工程师
自动化CI/CD管道以实现零停机部署(例如,金丝雀部署、蓝绿部署);创建鼓励可重用工作流程和简单性的智能管道;简化构建/测试/部署工作流程;构建共享工具(CLI、代码生成器、IDE插件)以加速团队开发
高级数据工程师
识别、设计和开发能够每日处理数百万甚至数十亿事件的基础数据基础设施组件;分析和改进现有数据处理基础设施的健壮性和可扩展性;与产品团队合作,理解功能需求并交付满足业务需求的解决方案;为新系统和现有系统编写清晰、经过良好测试且可维护的基础设施即代码和软件
工程师
识别、设计和开发支持Together商业平台的基础后端服务;分析和改进现有分布式系统、API、数据库和基础设施的健壮性和可扩展性;与产品团队合作,理解功能需求并提供满足业务需求的解决方案
高级后端工程师,推理平台
构建和优化全球及本地请求路由,确保跨数据中心和模型引擎集群的低延迟负载均衡;开发自动扩缩容系统,动态分配资源以满足数十个数据中心的严格服务水平目标;设计多租户流量整形系统,调整资源分配和请求处理,包括智能速率限制和调控,以确保所有用户的公平性和一致性体验
高级后端工程师 - 商务平台
设计和构建支撑 Together 货币化和商务栈的基础后端服务,包括计费、支付、授权和使用量追踪;与产品经理、财务和上市团队跨职能合作,理解需求并交付符合业务目标的系统;负责核心商务实体的数据建模和模式设计,确保正确性、可扩展性和长期灵活性
网络架构师
定义和发展Together AI的全球路由及骨干网架构,涵盖自建数据中心、合作伙伴托管站点、接入点、云区域和互联网络;为高带宽AI工作负载建立端到端拓扑策略,包括东西向网络结构、骨干/超骨干/核心网络、数据中心互联和跨区域互联
机器学习平台工程师
负责多集群编排、投资组合优化、预测性自动扩缩容、控制面板、模型启动、模型优化等工作;分析和改进现有分布式系统、API、数据库和基础设施的鲁棒性和可扩展性;与产品团队合作,理解功能需求并交付满足业务需求的解决方案
机器学习运维负责人
负责生产环境中推理和微调服务在无服务器和专用部署中的可用性与性能SLA;负责改进多集群ML基础设施的测试、部署、配置管理和监控实践,并与基础设施SRE紧密合作;构建自助式工具和自动化流程,以减少运营负担,并赋能内部用户(MLOps、客户体验)及自助服务产品
机器学习工程师
设计和构建支撑Together Cloud推理与微调API的生产系统,确保大规模下的可靠性与性能;与研究员、工程师、产品经理和设计师合作,将新功能和研究能力推向市场;分析和提升各种系统资源的效率、可扩展性和稳定性
基础设施工程师,数据平台
拥有并负责支持数据系统的所有基于AWS的基础设施的设计、实施和运维;构建和维护可重复、文档完善的Terraform基础设施模块;与多个数据工程团队协作,了解并支持他们的基础设施需求;与安全工程团队合作,实施和维护IAM策略及Lake Formation权限
解决方案架构师
担任我们最具战略意义客户的技术顾问,深度融入客户,支持他们使用Together AI上的开源模型构思和开发创新应用;运行Together整个技术栈(包括硬件和软件解决方案)的复杂演示和概念验证
解决方案架构师
担任我们最具战略意义客户的技术顾问,深度嵌入客户团队,支持他们使用Together AI上的开源模型构思和开发创新应用;运行复杂的演示和概念验证(POC),展示Together的完整技术栈,包括硬件和软件解决方案
客户支持工程师
直接与客户互动,解决涉及尖端GPU集群以及推理和微调服务的复杂技术挑战,确保每次都能提供快速有效的解决方案;成为我们所有生成式AI解决方案的产品专家,在问题升级到工程和产品团队之前充当最后的技术防线
客户支持工程师
直接与客户互动,解决涉及尖端GPU集群以及推理和微调服务的复杂技术挑战,确保每次都能提供快速有效的解决方案;成为我们所有生成式AI解决方案的产品专家,在问题升级到工程和产品团队之前,作为最后的技术防线
相关搜索词
这些词用于覆盖真实搜索需求,也方便用户继续定位公司、城市、岗位方向和薪资信息。