返回岗位列表

DataHub 招聘专题 · 数据更新至 2026-07-22

AI数据工程师招聘

AI 数据工程师岗位连接数据采集、清洗、标注、治理、训练样本构建和评测数据体系,是大模型落地中的关键基础岗位。本专题聚合相关招聘信息,帮助候选人判断能力要求和公司需求。

相关岗位87
覆盖公司23
主要公司阶跃星辰
热门地点北京

专题说明

AI数据工程师招聘:DataHub整理87个相关岗位,覆盖23家公司,数据更新至2026-07-22。 页面会随招聘数据重建自动更新,适合用于观察岗位供给、公司分布和城市变化。

高级数据工程师(公共部门)

Scale AI美国$200,000-$250,000

与运营、财务和工程团队合作,推动开发提供单一事实来源基础准确性的数据管道;持续改进现有数据管道,简化业务利益相关者的自助服务支持;执行定期系统审计,创建数据质量测试,确保数据/指标的完整准确报告

Helix AI工程师,数据基础设施

Figure AI美国$150,000-$400,000

设计、构建和维护用于卸载、存储、操作和提供机器人数据访问的工具和软件组件;在本地和云环境中大规模架构和管理存储及计算资源;为Figure数据管道的所有阶段(从记录到神经网络训练)实施最佳数据传输和存储解决方案

大模型数据工程师

美团上海薪资未公开

负责大模型SFT/DPO/RL/RAG等训练范式的数据采集、清洗、标注与质量评估,体系化构建高质量数据集生产Pipeline;探索AI for Data前沿实践,研发数据增强与智能合成技术,利用AI自动化生产和校验训练数据,构建数据飞轮

大数据开发工程师

小米北京薪资未公开

负责小爱内容资源数据流及数据服务建设;负责小爱内容数据、搜索推荐服务架构优化;负责小爱用户画像、LLM通用知识库建设;熟悉大数据相关技术:Spark/Flink/Hadoop/HBase/Hive/Iceberg等

自动驾驶数据工程师

小米北京薪资未公开

搭建自动驾驶的全自动数据生产流程,高效支持各模块的数据挖掘、自动标注、算法评测、数据/真值可视化等任务;进行数据挖掘/分析的策略研发工作,结合模型能力降低策略的开发成本和提升挖掘准召率

数据工程经理(产品方向)

Anthropic美国$405,000-$485,000 USD

构建并扩展产品分析工程团队,包括招聘和指导嵌入产品支柱的高绩效分析工程师;定义并执行产品数据基础和分析能力的战略路线图;监督可扩展数据管道、数据模型和分析解决方案的设计与实施,将原始产品事件日志转化为规范数据集和洞察性数据市场

IT控制数据工程师

OpenAI美国薪资未公开

构建用于IT控制的可靠数据管道、模型和数据集,包括访问、身份、配置、变更、工单、异常和证据数据;创建数据质量、血缘、对账和完整性检查,使控制数据在SOX及其他审计场景中具有可辩护性;设计自动化证据生成工作流,生成完整、准确且可重复的审计群体、导出、仪表板和控制工件

数据平台工程师

阶跃星辰北京薪资未公开

搭建和完善数据仓库,设计数据模型与分层架构,沉淀公司数据资产,为算法训练和业务分析提供可靠的数据基座;建设和维护数据平台产品(数据分析平台、数据集管理平台、DataAgent等),推动数据治理,提升数据使用效率

数据平台工程师

阶跃星辰北京薪资未公开

负责通用数据与Agent数据平台建设,覆盖数据采集、生产、清洗、评测与回流全链路;搭建高稳定性Pipeline、数据工具链与Workflow,支撑算法训练、评测与实验迭代;建设数据质量治理、资产管理与可观测体系,持续提升数据一致性、可追溯性与生产效率

具身智能数据工程师

面壁智能北京薪资未公开

设计多源异构数据采集管线,对接遥操作、人手动捕、外骨骼、仿真等不同数据源,完成从原始传感器数据到可训练格式的全链路;构建数据处理与增强算法,包括视觉域适配(人手→机器人手 inpainting)、异常轨迹检测与清洗、多模态对齐(RGB + 深度 + 触觉 + 关节角 + 力矩)

具身智能数据基础设施工程师

面壁智能深圳薪资未公开

设计多源异构数据采集管线,对接遥操作、人手动捕、外骨骼、仿真等不同数据源,完成从原始传感器数据到可训练格式的全链路;构建数据处理与增强算法,包括视觉域适配(人手→机器人手 inpainting)、异常轨迹检测与清洗、多模态对齐(RGB + 深度 + 触觉 + 关节角 + 力矩)

机器人真机部署与数据工程专家

面壁智能北京薪资未公开

维护数据与评测:负责真机数据处理、质量验证、评测体系建设;收集、清洗和管理机器人预训练/微调数据;商用/开源机械臂系统集成与真机评测;支持Teleop数据采集与质量验证;搭建本地真机评测流程,并集成RoboChallenge、RoboArena等开源真机评测体系

软件工程师,数据基础设施

Cohere美国薪资未公开

直接参与PB级存储基础设施的构建与维护,解决随之而来的网络和性能挑战;与全球顶尖的研究人员和工程师每日协作,共同推进AI训练与评估任务;4年以上数据存储基础设施工作经验;精通Python编程语言

多模态数据工程师

生数科技北京薪资未公开

负责构建超大规模高质量多模态数据集,建立从原始视频抓取、清洗、质量评估到自动化标注的全链路工业化流水线;实施支持多模态参考与视频编辑的专项数据工程,通过自动化手段生产图生视频、视频指令编辑、动作/风格参考等任务所需的高度对齐配对数据

具身智能数据工程师

生数科技北京薪资未公开

负责具身智能数据集建设、清洗、标注、去重、增强与质量管控;处理机器人多模态数据:相机图像/视频、关节状态、动作、力控、仿真交互数据等;参与数据pipeline开发:数据采集→解析对齐→过滤存储→训练喂入

具身智能数据工程师

生数科技北京薪资未公开

负责具身智能数据集的建设、清洗与标注工作;处理机器人多模态数据,包括相机图像/视频、关节状态、动作、力控及仿真交互数据等;支持模型训练数据生产,进行rot6d/四元数/关节位姿转换、时序对齐、去噪与异常检测

视频生成数据工程师

生数科技北京薪资未公开

负责流式视频生成场景下的大规模数据处理流水线设计与持续优化,覆盖数据采集、清洗、标注、转码的全链路流程,保障数据流水线的稳定性、可扩展性与高吞吐;持续调研业界先进的数据处理方法与工具,构建指标化、标准化、自动化的数据处理与质检流程,提升海量视频/多模态数据的供给效率,确保数据质量与模型训练需求精准…

预训练数据工程师(实习/全职)

DeepSeek北京薪资未公开

设计全网数据选取策略,包括链接质量预估、属性聚合、站点抓取配额等,保证数据多样性和覆盖;负责全网数据采集环路的设计与开发,构建高吞吐、可容错的分布式采集系统;通过识别低质站群、重复镜像站点等手段控制链接规模,提升链接库有效性

多模态大模型数据工程实习生

阶跃星辰北京300-400元/天

负责多模态训练数据处理Pipeline的开发与优化;基于Spark、Ray、Hive等分布式计算框架,开发和优化海量图文数据处理Pipeline;参与多模态训练数据的采集、解析、清洗、去重、过滤、标注等核心环节建设

AI数据开发工程师

阶跃星辰北京35-65K

负责算法数据平台系统的架构设计和开发工作,保障系统稳定、高效、安全;深入发掘和分析算法团队的数据需求,设计合理的技术方案并实现,生产交付文本、多模等各类模型训练数据;持续对系统平台进行架构改造和优化,提升系统的稳定性与可扩展性

大模型数据开发工程师

阶跃星辰北京35-65K

设计、开发和维护基于Spark/Ray的大规模自动化ETL Pipeline,处理PB级多模态图文数据;优化图文数据的准确性和丰富度,以提升多模态模型的能力上限;计算机、大数据相关专业,本科及以上学历

预训练数据工程师

月之暗面北京25-50K

设计和优化大规模Web爬虫的URL发现与调度系统,持续扩大数据覆盖范围;建设多因子抓取优先级体系,在有限资源下最大化高质量页面的获取效率;主导反爬对抗和动态渲染方案,提升核心站点的抓取成功率

预训练数据工程师

月之暗面北京25-50K

设计和优化大规模Web爬虫的URL发现与调度系统,持续扩大数据覆盖面;建设多因子抓取优先级体系,在有限资源下最大化高质量页面的获取效率;主导反爬对抗和动态渲染方案,提升核心站点的抓取成功率

数据开发工程师

月之暗面北京35-55K

负责数据平台架构设计与开发,包括全链路血缘、自助打标平台、指标管理等工具平台;基于对数据链路的理解,优化与改善现有流程与性能,提升数据的稳定性与及时性;独立完成数据各层级建模,构建成熟、稳定的数据仓库

AI数据平台工程师

月之暗面北京35-55K

负责数据智能Agent开发,支持自然语言查数、Text2SQL、智能归因等场景,推动LLM与数据平台深度联动;协助数仓语义层建设,配合指标平台与血缘系统实现语义资产标准化;负责统一数据API服务层开发,将数仓资产(表/指标/标签)封装为标准化接口,建设网关、权限与缓存体系

量化交易基础设施数据工程师(AI训练方向)

MiniMax北京40-70K

搭建高保真量化策略回测模拟环境,生成带时序标签、统计一致性约束和市场微观结构特性的合成策略数据集;设计针对核心量化策略范式(alpha因子合成、统计套利、事件驱动、CTA、ML因子等)的边界测试用例,将正确实现与典型错误配对为训练样本

算法数据平台工程师

阶跃星辰北京30-60K

负责算法数据平台系统的架构设计和开发工作,保障系统稳定、高效、安全运行;深入发掘和分析算法团队的数据需求,设计合理的技术方案并推动落地实现;持续对系统平台进行架构改造和优化,提升系统的稳定性与可扩展性

数据开发工程师(风控相关)

智谱AI北京25-50K

负责大模型业务风控数据体系建设,支撑反作弊、反欺诈攻防策略场景,构建高质量、可复用的数据资产,保障数据时效性与准确性;参与实时数仓与特征工程架构设计,覆盖日志接入、非结构化数据处理、特征计算、策略引擎等关键链路,快速响应黑产变化

预训练数据工程师

月之暗面北京25-50K

设计和优化大规模Web爬虫的URL发现与调度系统,持续扩大数据覆盖面;建设多因子抓取优先级体系,在有限资源下最大化高质量页面的获取效率;主导反爬对抗和动态渲染方案,提升核心站点的抓取成功率

预训练数据工程师

月之暗面北京25-50K

设计和优化大规模Web爬虫的URL发现与调度系统,持续扩大数据覆盖面;建设多因子抓取优先级体系,在有限资源下最大化高质量页面的获取效率;主导反爬对抗和动态渲染方案,提升核心站点的抓取成功率

数据开发工程师

月之暗面北京30-50K

设计与开发全链路血缘、自助打标平台、指标管理等数据工具平台;基于数据链路理解,优化改善现有流程与性能,提升数据稳定性与及时性;独立完成数据各层级建模,构建成熟稳定的数据仓库;构建流批一体架构,基于Flink、Kafka、数据湖等技术实现实时与离线数据Pipeline

预训练数据工程师

月之暗面北京25-50K

设计与优化大规模Web爬虫的URL发现与调度系统,持续扩大数据覆盖范围;建设多因子抓取优先级体系,在有限资源下最大化高质量页面的获取效率;主导反爬对抗和动态渲染方案,提升核心站点的抓取成功率

量化交易基础设施数据工程师

MiniMax北京30-60K

搭建高保真量化回测模拟环境,生成带时间戳、低延迟约束和事务一致性要求的合成代码数据集;设计针对金融协议(FIX/FAST/ITCH/OUCH)编解码逻辑的边界测试用例,将正确实现与典型错误配对为训练样本

AI数据开发工程师

智谱AI北京40-70K

参与模型训练数据集的构建,包括数据清洗与处理,实现数据闭环,构建稳定高性能的分布式pipeline;负责模型训练数据标签体系的构建,搭建自动化打标能力,打通线上用户数据并分析数据分布

数据工程师(风控方向)

智谱AI北京20-40K

负责大模型业务风控数据体系建设,支撑反作弊、反欺诈攻防策略场景,构建高质量、可复用的数据资产,保障数据时效性与准确性;参与实时数仓与特征工程架构设计,覆盖日志接入、非结构化数据处理、特征计算、策略引擎等关键链路,快速响应黑产变化

大模型数据工程师

面壁智能西安20-40K

参与大模型训练数据的构建,包括数据采集、数据清洗、数据增强,搭建高效的分布式数据pipeline;参与大语言模型的数据质量提升,包括数据风控策略、异常数据检测、数据修复、特定领域数据扩充

数据工程师

面壁智能北京30-60K

负责构建面向大模型训练的高质量数据体系,主导语音、视觉、多模态数据的采集、存储、清洗及特征工程;探索基于生成式模型的合成数据构建,包括数据增强、对抗生成等技术;设计与实施数据质量评估体系,开发高质量、高知识密度的数据筛选机制

高级数据开发工程师

面壁智能北京30-40K

负责复杂业务需求的数据模型设计与开发,确保数据质量和系统稳定性;参与数据平台的架构设计与优化,提升数据处理效率和系统性能;负责数据管道的建设与维护,包括ETL流程的设计与实施;与数据科学团队协作,将数据转化为业务洞察,支持决策制定

大模型数据开发工程师

面壁智能北京30-60K

负责大模型训练数据的清洗工作,针对文本、多模态等数据类型,设计高效的去重算法与异常数据过滤方案,剔除无效、冗余数据,提升数据集纯净度;开展多源异构数据的整合工作,打通不同渠道、不同格式的数据壁垒;运用聚类算法对数据进行分类梳理,挖掘数据内在关联,构建结构化、体系化的训练数据池

大模型数据开发工程师

面壁智能北京30-60K

负责大模型训练数据的清洗工作,针对文本、多模态等数据类型,设计高效的去重算法与异常数据过滤方案,剔除无效、冗余数据,提升数据集纯净度;开展多源异构数据的整合工作,打通不同渠道、不同格式的数据壁垒;运用聚类算法对数据进行分类梳理,挖掘数据内在关联,构建结构化、体系化的训练数据池

高级数据基础设施工程师

面壁智能北京25-50K

实现和维护可复用的库、模块和平台,用于大规模数据采集与处理;根据系统设计,构建基础设施组件,如代理服务、镜像管道、可靠调度器及中间件抽象层;确保采集管道及支撑系统在数百PB至ZB规模下的可靠性、可扩展性和效率

语音大模型数据工程师

阶跃星辰北京40-70K

设计、搭建并持续迭代语音大模型数据处理与生产管线,覆盖数据采集、清洗、标注、质检与版本管理,持续产出高质量训练数据;构建并维护大规模语音数据的自动化处理与质量控制流程,保障数据的稳定性、一致性和可追溯性

大模型数据开发工程师

阶跃星辰北京40-70K

设计、开发和维护基于Spark/Ray的大规模自动化ETL Pipeline,处理PB级多模态图文数据;优化图文数据的准确性与丰富度,以提升多模态大模型的能力上限;计算机、大数据相关专业,本科及以上学历

大数据开发工程师/数据仓库工程师

昆仑万维北京41-51K

参与设计并持续优化离线与实时相结合的数据仓库分层架构(如ODS、DWD、DWS、ADS);负责核心业务主题域的数据模型设计、开发与维护,保障数据的一致性、准确性和完整性;编写高效、稳定的ETL/ELT数据处理流程及调度脚本,负责日常运维与性能优化

视频生成模型数据工程师

MiniMax上海31-51K

参与定义和刻画用于视频模型训练的高质量数据标准,包括视频的审美品质、内容多样性、技术参数等维度;基于既定标准,主动在全球范围内的视频平台、开源数据集及特定渠道中寻找和发掘符合要求的视频数据

数据开发工程师(风控方向)

智谱AI北京20-40K

负责大模型业务风控数据体系建设,支撑反作弊、反欺诈攻防策略场景,构建高质量、可复用的数据资产,保障数据时效性与准确性;参与实时数仓与特征工程架构设计,覆盖日志接入、非结构化数据处理、特征计算、策略引擎等关键链路,快速响应黑产变化

技术主管经理 - 数据工程

Glean印度薪资未公开

25%时间用于指导高级数据工程师的技术与职业发展;提升第三方应用中高价值上游数据的可用性;与商业智能团队合作识别数据基础的最大缺口;与市场推广及财务运营团队协作优化Salesforce等企业应用的数据管理流程

数据基础设施技术人员

Runway远程$240,000-$290,000

构建并拥有大规模多模态数据集的创建、处理和管理的管道,包括向量数据库(LanceDB)管理和ML元数据查询优化;构建并拥有从Postgres和ClickHouse到分析仓库的ETL和CDC流

数据平台工程师

Perplexity AI美国薪资未公开

设计和运营大规模批处理和流式数据管道,支持产品功能、AI训练/评估、分析和实验;构建和发展事件驱动和流式系统(如Kafka/Kinesis/PubSub风格的架构),用于实时数据摄取、转换和交付

多模态大模型数据工程师

面壁智能北京薪资未公开

负责多模态大模型预训练、指令微调、偏好对齐等阶段的数据建设工作,包括数据采集、入库、清洗、观测及挖掘;建立多模态数据的闭环验证体系(数据构造→模型训练→性能评测),确保数据有效提升模型能力

多模态大模型数据工程师

面壁智能上海薪资未公开

负责多模态大模型预训练、指令微调、偏好对齐等阶段的数据建设工作,包括数据采集、入库、清洗、观测及挖掘;建立多模态数据的闭环验证体系,覆盖数据构造、模型训练到性能评测全链路;参与训练数据全生命周期管理体系建设,提升海量数据读取效率及模型训练工程效率

多模态大模型数据工程师

面壁智能深圳薪资未公开

负责多模态大模型预训练、指令微调、偏好对齐等阶段的数据建设工作,包括数据采集、入库、清洗、观测及挖掘;负责多模态数据的闭环验证,建立从数据构造到模型训练再到性能评测的全链路闭环体系,确保数据提升模型基础能力

多模态大模型数据工程师

面壁智能成都薪资未公开

负责多模态大模型预训练、指令微调、偏好对齐等阶段的数据建设工作,包括数据采集、入库、清洗、观测、挖掘等环节;负责多模态数据的闭环验证,建立从数据构造到模型训练再到性能评测的全链路闭环体系

自动驾驶数据工程师

小米北京薪资未公开

搭建自动驾驶的全自动数据生产流程,支持数据挖掘、自动标注、算法评测、数据/真值可视化等任务;进行数据挖掘/分析的策略研发,降低开发成本并提升准召率;利用多模态大模型进行case自动分拣,提升问题流转效率

多模态数据工程师

阿里巴巴北京薪资未公开

负责多模态数据pipeline建设、数据版本管理、数据处理、数据算子开发集成等工作;开发自动化数据处理工具与脚本,优化数据清洗、标注及质量评估的效率和规模化能力;参与多模态大模型训练数据的构建与管理,参与数据筛选、标注及质量评估工作

多模态数据工程师

阿里巴巴远程薪资未公开

负责多模态数据pipeline建设、数据版本管理、数据处理、数据算子开发集成等工作;开发自动化数据处理工具与脚本,优化数据清洗、标注及质量评估的效率和规模化能力;参与多模态大模型训练数据的构建与管理,参与数据筛选、标注及质量评估工作

软件工程师,数据基础设施 - 研究

OpenAI美国$250K-$380K

设计和维护标准化的数据集API,包括无法放入内存的多模态(MM)数据;构建主动测试和规模验证管道,用于GPU规模的数据集加载;与团队成员合作,将数据集无缝集成到训练和推理管道中,确保顺利采用和良好的用户体验

数据基础设施软件工程师

OpenAI美国$210K-$405K

设计、构建和维护数据基础设施系统,如分布式计算、数据编排、分布式存储、流式基础设施、机器学习基础设施,同时确保可扩展性、可靠性和安全性;确保我们的数据平台能够在保持可靠和高效的同时实现数量级的扩展

订阅相关更新

留下邮箱,每周接收岗位趋势、热门公司和新增机会摘要。