DataHub 关键词情报 · 数据更新至 2026-07-22
月之暗面工程与基础设施招聘
本页聚焦月之暗面工程与基础设施相关岗位,便于用户比较岗位职责、地点、薪资标注和详情入口。
活跃公司
- 月之暗面176 · 100.0%
热门地点
- 北京168 · 95.5%
- 上海8 · 4.5%
岗位方向
- 工程与基础设施176 · 100.0%
OPEN ROLES
代表岗位
机器学习训练数据处理工程师
负责公司机器学习大规模训练数据的处理工作;设计并实现大规模离线分布式数据处理系统;参与数据清洗、标注等数据预处理流程;支持NLP或CV模型的训练数据准备与优化;在数据处理、清洗、标注或推荐系统、搜索、广告排序等项目中有开发经验,并担任重要角色
分布式系统工程师
设计稳健运行的分布式服务架构;优化超大规模线上推理集群运行效率;985/211高校研究生以上学历或优秀本科生;热爱写代码,熟悉编译原理、操作系统、计算机网络等计算机基础知识;熟练掌握一种编程语言,Python、Golang、Rust、TypeScript优先
iOS工程师
负责公司iOS端产品开发、维护、发布的相关工作;合理技术选型,挑战现有架构,丰富技术储备;了解业务,参与产品需求评审、设计等流程,给出技术方案和意见;持续迭代和提高项目架构,支持业务发展
iOS架构师
负责公司iOS端产品的核心功能开发、维护与发布工作;参与架构设计与技术选型,协助推进架构演进;理解业务目标,参与需求评审与方案讨论,提供可落地的技术实现方案;持续优化工程结构与代码质量,支持业务稳定发展
编码工程师
制作Coding Agent的基准测试,涵盖从基础设施到数据的全流程;寻找SWE Bench之外的各种衡量Coding Agent的指标;打造属于Moonshot自己的编码工具,但避免成为另一个Claude Code
高级爬虫工程师
设计和优化大规模Web爬虫的URL发现与调度系统,持续扩大数据覆盖面;建设多因子抓取优先级体系,在有限资源下最大化高质量页面的获取效率;主导反爬对抗和动态渲染方案,提升核心站点的抓取成功率
数据平台架构师/高级数仓工程师
负责数据平台架构设计与开发,包括全链路血缘、自助打标平台、指标管理等工具平台;基于对数据链路的理解,优化与改善现有流程与性能,提升数据的稳定性与及时性;独立完成数据各层级建模,构建成熟、稳定的数据仓库
高级数据仓库工程师
设计与开发全链路血缘、自助打标平台、指标管理等工具平台;基于对数据链路的理解,优化与改善现有流程与性能,提升数据的稳定性与及时性;独立完成数据各层级建模,构建成熟、稳定的数据仓库;构建流批一体架构,基于Flink、Kafka、数据湖等技术实现实时与离线数据Pipeline
GPU集群SRE工程师
负责月之暗面大规模GPU训练与推理集群的稳定性保障,支撑业务7×24高可用运行;负责Kubernetes及云原生周边系统(监控、日志、镜像分发、存储)的运维保障与平台化工具开发以及疑难问题的排查解决
高级Kubernetes平台开发工程师
设计并维护支撑大模型训练/推理的Kubernetes平台,负责集群生命周期管理、节点治理、网络/存储CSI插件及自动化运维体系;深度优化容器镜像分发,将千节点集群的Pod启动时间压缩到秒级
Kubernetes 调度器高级开发工程师
负责 Kubernetes 调度器及调度插件的深度定制,设计面向 AI 工作负载的调度策略,包括 GPU 拓扑感知、NUMA 亲和、网络亲和、RDMA 域感知等;攻克超大规模集群(万卡级)调度性能瓶颈,优化调度吞吐、调度延迟与决策质量,支持每秒数百 Pod 的调度并发
深度学习系统工程师(训练-推理协同优化)
推动量化感知训练和量化训练的工程化落地,研发W8A8、W4A16等低比特训练方案,实现训练与推理精度-效率的最优平衡;设计并实现投机解码及其变体(如EAGLE、DFlash等)的全链路方案,包括草稿模型训练、接受率优化与系统调度策略
业务安全工程师(Kimi业务线)
负责Kimi业务线安全风险识别、评估与治理,从攻击者视角发现业务风险并推动闭环治理;围绕核心业务场景开展攻防验证和漏洞挖掘,识别安全风险并推动改进落地;跟踪外部高危漏洞、攻击技术和安全事件,结合业务实际开展影响分析、风险处置和复盘加固
业务安全工程师(Kimi 业务线)
负责 Kimi 业务线安全风险识别、评估与治理,从攻击者视角发现业务风险并推动闭环治理;围绕核心业务场景开展攻防验证和漏洞挖掘,识别安全风险并推动改进落地;跟踪外部高危漏洞、攻击技术和安全事件,结合业务实际开展影响分析、风险处置和复盘加固
数据安全高级研发工程师
负责数据安全核心系统的研发与架构设计,围绕数据分类分级、敏感数据扫描、动态/静态脱敏、加解密服务、访问控制网关、DLP引擎、UEBA行为审计等场景,构建高性能、可扩展的数据安全中台与治理平台
Agent 工程师
参与 Kimi 产品研发,围绕真实场景持续迭代;建设并优化 LLM/Agent 评估平台,形成实验、评测、回归与数据闭环;打造可复用的工具与技能体系,提升扩展效率与规模化交付能力;完善工程基建与效能体系,包括遥测、微服务治理、CI/CD、DevOps 和 AI+研发流程
AI评估系统工程师
构建一体化评估系统,定义并持续改进Agent Eval Platform,维护Internal Benchmark,支持不同Harness和Eval策略下的灵活评估;优化线上监控与评估体系,打通在线评估与离线评估的闭环
解决方案架构师
作为客户技术问题的第一道入口,提供专业解答,必要时拉通内部资源,确保客户信任;针对不同角色进行方案宣讲,利用技术可信度和商业敏锐度推动客户决策;深入客户业务场景,理解数据流、决策链和痛点,共同定义成功落地方案,包括非标准集成或新功能需求
强化学习基础设施工程师
针对大规模Agentic RL场景,设计训练与采样的混合调度策略,优化多模型(Policy、Reference、Reward、Value)的并行协同与显存共享;深度定制vLLM,优化Rollout阶段的KV Cache复用、量化和投机方法,将Token生成延迟压至极限
高级网络工程师
负责公司跨云、云到IDC、IDC到IDC的专线与互联网络规划、建设、运维与优化;管理复杂的网络拓扑、路由策略与访问边界,保障生产、大数据、训练/推理流量在多环境间稳定运行;设计并持续优化网络高可用方案,包括链路冗余、故障切换、路由收敛、容量规划与变更风险控制
数据智能平台开发工程师
负责数据智能Agent开发,支持自然语言查数、Text2SQL、智能归因等场景,推动LLM与数据平台深度联动;协助数仓语义层建设,配合指标平台与血缘系统实现语义资产标准化;负责统一数据API服务层开发,将数仓资产(表/指标/标签)封装为标准化接口,建设网关、权限与缓存体系
产品构建者(全栈大前端工程师)
负责跨平台客户端(Desktop/Web/Android)的全栈交付,不设技术边界;使用Electron/Tauri等框架开发桌面端应用,并实现KMP逻辑复用;深入Windows/macOS原生层(Win32/AppKit/C++等)进行系统集成开发
数据安全专家
主导Kimi产品数据全生命周期安全能力的设计、落地与持续迭代,建立敏感数据识别与分级分类体系,推动自动化识别、标签化、策略化能力在生产环境落地;设计并实施数据加密、静态/动态脱敏、数据最小化使用等技术方案,解决数据在存储、计算、流转、使用过程中的安全与效率平衡问题,构建数据血缘、访问路径与使用行为…
智能增长工程师
亲手打造用户增长核心链路,包括投放系统、用户触达、行为数据链路和效果归因,让AI在每一个决策点上增强甚至替代人的判断;主导研发独立于主线产品的小而快实验,在Agent领域发掘能带来10倍增长的非共识机会
高级 SRE 工程师
构建可持续的 On-call 与应急响应体系,重构报警体系,建立分级降噪机制,实现故障的分钟级发现与精准定位;建立标准化的 On-call 手册与应急流程,引入混沌工程主动暴露系统脆弱点,主导故障复盘并推动根因修复
增长实习生(开发者方向)
围绕小红书、抖音、B站、公众号、开发者社区等国内渠道,将Kimi的Coding、Agent、API、长文本、多模态等能力转化为用户易懂、愿点、愿试、愿分享的内容和投放素材;持续追踪CTR、互动、转化等数据,拆解素材、复盘效果,迭代内容和投放策略
增长实习生(开发者方向)
围绕小红书、抖音、B站、公众号、开发者社区等国内渠道,将Kimi的Coding、Agent、API、长文本、多模态等能力转化为用户易懂、愿点、愿试、愿分享的内容和投放素材;持续追踪CTR、互动、转化等数据,拆解素材、复盘效果,迭代内容和投放策略
预训练数据工程师
设计和优化大规模Web爬虫的URL发现与调度系统,持续扩大数据覆盖范围;建设多因子抓取优先级体系,在有限资源下最大化高质量页面的获取效率;主导反爬对抗和动态渲染方案,提升核心站点的抓取成功率
机器学习平台工程师(Kubernetes / GPU)
设计并维护支撑大模型训练/推理的Kubernetes平台;负责集群生命周期管理、节点治理、网络/存储CSI插件及自动化运维体系;深度优化容器镜像分发,将千节点集群的Pod启动时间压缩到秒级
预训练数据工程师
设计和优化大规模Web爬虫的URL发现与调度系统,持续扩大数据覆盖面;建设多因子抓取优先级体系,在有限资源下最大化高质量页面的获取效率;主导反爬对抗和动态渲染方案,提升核心站点的抓取成功率
数据开发工程师
负责数据平台架构设计与开发,包括全链路血缘、自助打标平台、指标管理等工具平台;基于对数据链路的理解,优化与改善现有流程与性能,提升数据的稳定性与及时性;独立完成数据各层级建模,构建成熟、稳定的数据仓库
Kubernetes 调度器开发工程师
负责Kubernetes调度器及调度插件的深度定制,设计面向AI工作负载的调度策略(GPU拓扑感知、NUMA亲和、网络亲和、RDMA域感知);攻克超大规模集群(万卡级)调度性能瓶颈,优化调度吞吐、调度延迟与决策质量,支持每秒数百Pod的调度并发
机器学习平台 SRE 工程师
负责大规模 GPU 训练与推理集群的稳定性保障,支撑业务 7×24 高可用运行;负责 Kubernetes 及云原生周边系统(监控、日志、镜像分发、存储)的运维保障与平台化工具开发以及疑难问题的排查解决
机器学习平台工程师(K8s / GPU 基础设施)
设计并维护支撑大模型训练/推理的Kubernetes平台,负责集群生命周期管理、节点治理、网络/存储CSI插件及自动化运维体系;深度优化容器镜像分发,将千节点集群的Pod启动时间压缩到秒级
高级 SRE 工程师
构建可持续的On-call与应急响应体系,重构报警体系,建立分级降噪机制,实现故障的分钟级发现与精准定位;建立标准化的On-call手册与应急流程,引入混沌工程主动暴露系统脆弱点,主导故障复盘并推动根因修复
Agent 产品工程师(多智能体方向)
设计Agent与Agent之间协作的交互协议,将协作视为新型harness,最大化模型能力释放;定义Agent与人之间协作的产品形态,让用户在真实工作流中与AI共同推进复杂任务;构建面向未来组织的协作界面与工作流,持续扩展Agent的协作带宽
全栈工程师
将模糊的想法或业务诉求自行拆解为可落地的方案,并完成开发、上线及持续迭代;讨论并改进Agent相关技术,包括agent loop、tool calling、状态管理、异步任务、长链路容错、上下文组织、效果调优、幻觉控制及评估集建设
资深后端工程师-商业化
负责主导商业化内核与支付适配的总体设计、开发、落地及演进,支撑跨市场、高可用的会员订阅式商业化平台的管理与优化;依据公司与部门的战略以及业务实际需求,制定研发路线图并把控各子系统的优先级
数据安全研发工程师
负责数据安全核心系统的研发与架构设计,围绕数据分类分级、敏感数据扫描、动态/静态脱敏、加解密服务、访问控制网关、DLP引擎、UEBA行为审计等场景,构建高性能、可扩展的数据安全中台与治理平台
AI数据平台工程师
负责数据智能Agent开发,支持自然语言查数、Text2SQL、智能归因等场景,推动LLM与数据平台深度联动;协助数仓语义层建设,配合指标平台与血缘系统实现语义资产标准化;负责统一数据API服务层开发,将数仓资产(表/指标/标签)封装为标准化接口,建设网关、权限与缓存体系
机器学习平台 SRE 工程师
负责大规模 GPU 训练与推理集群的稳定性保障,支撑业务 7×24 小时高可用运行;负责 Kubernetes 及云原生周边系统(监控、日志、镜像分发、存储)的运维保障与平台化工具开发以及疑难问题的排查解决
资深后端工程师-商业化
负责主导商业化内核与支付适配的总体设计、开发、落地及演进,支撑跨市场、高可用的会员订阅式商业化平台的管理与优化;依据公司与部门的战略以及业务实际需求,制定研发路线图并把控各子系统的优先级
大规模推理系统工程师
设计稳健运行的分布式服务架构;优化超大规模线上推理集群运行效率;985/211高校研究生以上学历或优秀本科生;热爱写代码,熟悉编译原理、操作系统、计算机网络等计算机基础知识;熟练掌握一种编程语言,Python、Golang、Rust、TypeScript优先
Kubernetes 调度器开发工程师
负责 Kubernetes 调度器及调度插件的深度定制,设计面向 AI 工作负载的调度策略(GPU 拓扑感知、NUMA 亲和、网络亲和、RDMA 域感知);攻克超大规模集群(万卡级)调度性能瓶颈,优化调度吞吐、调度延迟与决策质量,支持每秒数百 Pod 的调度并发
全栈极客工程师(AI-Native 方向)
以Windows桌面端为主战场,同时负责macOS和Web端的开发与逻辑复用;使用Electron/Tauri搭建桌面端,深入Windows原生层(Win32/WinUI/C++)进行系统集成
机器学习平台 SRE 工程师
负责月之暗面大规模 GPU 训练与推理集群的稳定性保障,支撑业务 7×24 高可用运行;负责 Kubernetes 及云原生周边系统(监控、日志、镜像分发、存储)的运维保障与平台化工具开发以及疑难问题的排查解决
LLM推理优化工程师
负责分布式训练与推理协同优化;推动Quantized-aware Training (QAT) 和 Quantized Training 的工程化落地,研发W8A8、W4A16等低比特训练方案,实现训练与推理精度-效率的最优平衡
Kubernetes 调度器开发工程师
负责Kubernetes调度器及调度插件的深度定制,设计面向AI工作负载的调度策略(GPU拓扑感知、NUMA亲和、网络亲和、RDMA域感知);攻克超大规模集群(万卡级)调度性能瓶颈,优化调度吞吐、调度延迟与决策质量,支持每秒数百Pod的调度并发
推理框架工程师
提升LLM推理引擎的计算效率,提高用户使用体验;跟进业界最新方案,实验并落地;探索创新性的推理方案,实现数量级级别的成本下降;熟练掌握Python、C++;熟练掌握CUDA,或拥有3年以上的计算密集型优化经验
推理框架工程师
提升LLM推理引擎的计算效率,提高用户使用体验;跟进业界最新方案,实验并落地;探索创新性的推理方案,实现数量级级别的成本下降;熟练掌握Python、C++;熟练掌握CUDA,或拥有3年以上的计算密集型优化经验
全栈极客工程师(AI-Native 方向)
以Windows桌面端为主战场,同时负责macOS和Web端的开发与逻辑复用;使用Electron/Tauri搭建桌面端,深入Windows原生层(Win32/WinUI/C++)进行系统集成
Harness 研发工程师
设计并迭代 Kimi Agent 与 Kimi Work 的核心 harness:Agent Loop、工具调用、模型输出解析、上下文构造、状态管理、执行调度、沙箱隔离、权限控制、容错重试与终止机制
机器学习平台工程师(K8s / GPU 基础设施)
设计并维护支撑大模型训练/推理的Kubernetes平台,负责集群生命周期管理、节点治理、网络/存储CSI插件及自动化运维体系;深度优化容器镜像分发,将千节点集群的Pod启动时间压缩到秒级
LLM推理优化工程师
推动 Quantized-aware Training (QAT) 和 Quantized Training 的工程化落地,研发W8A8、W4A16等低比特训练方案,实现训练与推理精度-效率的最优平衡
Kubernetes 调度器开发工程师
负责Kubernetes调度器及调度插件的深度定制,设计面向AI工作负载的调度策略(GPU拓扑感知、NUMA亲和、网络亲和、RDMA域感知);攻克超大规模集群(万卡级)调度性能瓶颈,优化调度吞吐、调度延迟与决策质量,支持每秒数百Pod的调度并发
推理框架工程师
提升LLM推理引擎的计算效率,提高用户使用体验;跟进业界最新方案,实验并落地;探索创新性的推理方案,实现数量级级别的成本下降;熟练掌握Python、C++;熟练掌握CUDA,或拥有3年以上的计算密集型优化经验
评估系统工程师
构建一体化评估系统:定义并持续改进Agent Eval Platform,维护Internal Benchmark,支持不同harness和Eval策略下的灵活评估,优化线上监控与评估体系,打通在线评估与离线评估的闭环
内容安全负责人
指导公司的内容安全团队,确保内容质量、效率和用户体验;制定并实施内容质量管理流程和标准,优化日常业务处理规范,持续提升团队的专业能力和交付水平;收集并分析风险案例,推动风控政策和流程的持续改进
数据平台开发工程师
负责数据智能Agent开发,支持自然语言查数、Text2SQL、智能归因等场景,推动LLM与数据平台深度联动;协助数仓语义层建设,配合指标平台与血缘系统实现语义资产标准化;负责统一数据API服务层开发,将数仓资产(表/指标/标签)封装为标准化接口,建设网关、权限与缓存体系
数据安全研发工程师
负责数据安全核心系统的研发与架构设计,围绕数据分类分级、敏感数据扫描、动态/静态脱敏、加解密服务、访问控制网关、DLP引擎、UEBA行为审计等场景,构建高性能、可扩展的数据安全中台与治理平台
训练框架工程师
负责LLM的训练研究及框架优化,结合算法和工程提升模型上限;参与机器学习训练框架底层组件的抽象、设计、优化与落地;调研大模型及相关方向的前沿工程技术;本科及以上学历,计算机相关专业;熟悉PyTorch等某一种机器学习框架
训练框架工程师
负责 LLM 的训练研究及框架优化,结合算法和工程提升模型上限;参与机器学习训练框架底层组件的抽象、设计、优化与落地;调研大模型及相关方向的前沿工程技术;本科及以上学历,计算机相关专业;熟悉 PyTorch 等某一种机器学习框架
AI产品运营工程师
理解产品与用户需求,围绕真实业务场景,拆解任务并设计产品运营方案;搭建分场景Benchmark,设计测试任务、评估维度和验收标准,配合模型与产品能力迭代;基于Agent Harness参与产品运营方案设计,协同产研推进功能落地
安全攻防实习生(SRC&护网)
负责对Kimi等AI前沿产品及生态进行安全测试,确保业务安全上线;基于攻防视角挖掘内部系统相关漏洞,以攻促防提升业务安全水位;参与Moonshot安全体系建设,持续跟进大模型相关前沿攻防技术
大规模推理系统工程师
设计稳健运行的分布式服务架构;优化超大规模线上推理集群运行效率;推动大模型推理系统的高效部署与持续迭代;985/211高校研究生以上学历或优秀本科生;热爱写代码,熟悉编译原理、操作系统、计算机网络等计算机基础知识
内容安全负责人
指导内容安全团队,确保内容质量、效率和用户体验;制定并实施内容质量管理流程和标准,优化日常业务处理规范,持续提升团队专业能力和交付水平;收集并分析风险案例,推动风控政策和流程的持续改进
安全运维工程师(终端安全/EDR方向)
负责EDR系统的部署、策略配置、规则调优及高可用保障;基于EDR告警开展威胁狩猎,分析恶意行为链(IOA),完成事件定性、溯源与闭环处置;通过Python/Shell/PowerShell脚本实现数据采集、策略下发与自动化响应
高级后端研发工程师
参与Kimi核心产研业务后端系统的架构设计与研发,支撑主站、用户体系、会员服务、企业服务、开放平台等关键产品方向;设计与开发核心业务模块,包括账号与权限、资源与配额、业务配置、任务调度、数据流转、多租户架构等
大规模推理系统工程师
设计稳健的分布式服务架构,确保系统稳定运行;优化超大规模线上推理集群的运行效率;持续改进推理系统性能,提升服务吞吐量;985/211高校研究生及以上学历,或优秀本科生;热爱代码编写,熟悉编译原理、操作系统、计算机网络等计算机基础知识
内容安全负责人
指导公司内容安全团队,确保内容质量、效率和用户体验;制定并实施内容质量管理流程和标准,优化日常业务处理规范,持续提升团队专业能力和交付水平;收集并分析风险案例,推动风控政策和流程的持续改进
高性能计算工程师
负责大规模深度学习训练/推理框架中CUDA内核的性能优化与定制开发;开展与GPU体系结构相关的前沿探索性工作,包括新指令集、算子融合、异构计算和硬件趋势研究;与算法研究员合作,推动模型结构与底层实现的协同优化
推理框架工程师
提升 LLM 推理引擎的计算效率,提高用户使用体验;跟进业界最新推理优化方案,进行实验验证与落地;探索创新性的推理方案,实现数量级级别的成本下降;设计并优化分布式推理系统架构;熟练掌握 Python 和 C++
高级Golang研发工程师(商业化方向)
参与Kimi商业化系统的架构设计与研发,支撑订阅服务、企业API及支付结算等关键业务的高可用、高性能后端建设;负责订单系统、结算系统、配额管理、企业级多租户架构等核心模块的设计与编码工作
API开放平台工程师
熟悉主流模型开放平台(Kimi、DeepSeek、Anthropic、OpenAI等),精通OpenAI API标准;将Function Call、MCP、Agent等能力融入产品功能,推动多场景高效应用
KIMI前端开发工程师(主站方向)
与产品、设计及后端团队协作,理解业务需求与设计意图,交付高质量的可交互界面;设计高效、可复用的前端组件与模块,参与内部组件库建设;参与前端工程化体系建设,持续提升研发效率与代码质量;将AI工具融入Review、测试、规范等研发环节,推动自动化落地
开放平台测试工程师
独立负责 RESTful API、SDK 及开发者工具的测试方案设计与执行,把控版本发布质量与向后兼容性,保障开发者集成体验;深入理解 OpenAPI / Anthropic API 规范与接口契约,从设计阶段介入契约测试(Contract Testing),预防破坏性变更,具备接口层面的灰盒/白…
内容安全负责人
指导公司的内容安全团队,确保内容质量、效率和用户体验;制定并实施内容质量管理流程和标准,优化日常业务处理规范,持续提升团队专业能力和交付水平;收集并分析风险案例,推动风控政策和流程的持续改进
大规模推理系统工程师(数据库方向)
设计稳健运行的分布式服务架构,支撑大规模推理系统稳定运行;优化超大规模线上推理集群的运行效率,提升系统吞吐与响应速度;参与大模型推理引擎的研发与性能调优工作;985/211高校研究生以上学历或优秀本科生
大规模推理系统工程师
设计稳健运行的分布式服务架构;优化超大规模线上推理集群运行效率;985/211高校研究生以上学历或优秀本科生;热爱写代码,熟悉编译原理、操作系统、计算机网络等计算机基础知识;熟练掌握一种编程语言,python、golang、rust、typescript优先
API解决方案架构师
深入理解客户业务需求,提供专业技术咨询服务;基于大模型API能力,设计符合客户场景的技术解决方案;向客户展示产品功能,进行技术演示和PoC验证;与销售、产品、研发团队紧密配合,推动项目成功交付
相关搜索词
这些词用于覆盖真实搜索需求,也方便用户继续定位公司、城市、岗位方向和薪资信息。