DataHub 关键词情报 · 数据更新至 2026-07-22
AI数据工程师招聘
AI 数据工程师岗位连接数据采集、清洗、标注、治理、训练样本构建和评测数据体系,是大模型落地中的关键基础岗位。本专题聚合相关招聘信息,帮助候选人判断能力要求和公司需求。
活跃公司
- 阶跃星辰18 · 20.7%
- 面壁智能13 · 14.9%
- 月之暗面8 · 9.2%
- OpenAI7 · 8.0%
- xAI6 · 6.9%
- 生数科技4 · 4.6%
- 智谱AI4 · 4.6%
- Figure AI3 · 3.4%
- 小米3 · 3.4%
- MiniMax3 · 3.4%
热门地点
- 北京50 · 57.5%
- 美国24 · 27.6%
- 上海3 · 3.4%
- 深圳3 · 3.4%
- 远程3 · 3.4%
- 西安1 · 1.1%
- 印度1 · 1.1%
- 成都1 · 1.1%
- 杭州1 · 1.1%
岗位方向
- 工程与基础设施61 · 70.1%
- 算法与研究21 · 24.1%
- 其他岗位4 · 4.6%
- 产品与运营1 · 1.1%
OPEN ROLES
代表岗位
高级数据工程师(公共部门)
与运营、财务和工程团队合作,推动开发提供单一事实来源基础准确性的数据管道;持续改进现有数据管道,简化业务利益相关者的自助服务支持;执行定期系统审计,创建数据质量测试,确保数据/指标的完整准确报告
Helix AI工程师,数据基础设施
设计、构建和维护用于卸载、存储、操作和提供机器人数据访问的工具和软件组件;在本地和云环境中大规模架构和管理存储及计算资源;为Figure数据管道的所有阶段(从记录到神经网络训练)实施最佳数据传输和存储解决方案
大模型数据工程师
负责大模型SFT/DPO/RL/RAG等训练范式的数据采集、清洗、标注与质量评估,体系化构建高质量数据集生产Pipeline;探索AI for Data前沿实践,研发数据增强与智能合成技术,利用AI自动化生产和校验训练数据,构建数据飞轮
大数据开发工程师
负责小爱内容资源数据流及数据服务建设;负责小爱内容数据、搜索推荐服务架构优化;负责小爱用户画像、LLM通用知识库建设;熟悉大数据相关技术:Spark/Flink/Hadoop/HBase/Hive/Iceberg等
数据工程经理(产品方向)
构建并扩展产品分析工程团队,包括招聘和指导嵌入产品支柱的高绩效分析工程师;定义并执行产品数据基础和分析能力的战略路线图;监督可扩展数据管道、数据模型和分析解决方案的设计与实施,将原始产品事件日志转化为规范数据集和洞察性数据市场
IT控制数据工程师
构建用于IT控制的可靠数据管道、模型和数据集,包括访问、身份、配置、变更、工单、异常和证据数据;创建数据质量、血缘、对账和完整性检查,使控制数据在SOX及其他审计场景中具有可辩护性;设计自动化证据生成工作流,生成完整、准确且可重复的审计群体、导出、仪表板和控制工件
数据平台工程师
搭建和完善数据仓库,设计数据模型与分层架构,沉淀公司数据资产,为算法训练和业务分析提供可靠的数据基座;建设和维护数据平台产品(数据分析平台、数据集管理平台、DataAgent等),推动数据治理,提升数据使用效率
具身智能数据工程师
设计多源异构数据采集管线,对接遥操作、人手动捕、外骨骼、仿真等不同数据源,完成从原始传感器数据到可训练格式的全链路;构建数据处理与增强算法,包括视觉域适配(人手→机器人手 inpainting)、异常轨迹检测与清洗、多模态对齐(RGB + 深度 + 触觉 + 关节角 + 力矩)
软件工程师,数据基础设施
直接参与PB级存储基础设施的构建与维护,解决随之而来的网络和性能挑战;与全球顶尖的研究人员和工程师每日协作,共同推进AI训练与评估任务;4年以上数据存储基础设施工作经验;精通Python编程语言
多模态数据工程师
负责构建超大规模高质量多模态数据集,建立从原始视频抓取、清洗、质量评估到自动化标注的全链路工业化流水线;实施支持多模态参考与视频编辑的专项数据工程,通过自动化手段生产图生视频、视频指令编辑、动作/风格参考等任务所需的高度对齐配对数据
预训练数据工程师(实习/全职)
设计全网数据选取策略,包括链接质量预估、属性聚合、站点抓取配额等,保证数据多样性和覆盖;负责全网数据采集环路的设计与开发,构建高吞吐、可容错的分布式采集系统;通过识别低质站群、重复镜像站点等手段控制链接规模,提升链接库有效性
预训练数据工程师
设计和优化大规模Web爬虫的URL发现与调度系统,持续扩大数据覆盖范围;建设多因子抓取优先级体系,在有限资源下最大化高质量页面的获取效率;主导反爬对抗和动态渲染方案,提升核心站点的抓取成功率
量化交易基础设施数据工程师(AI训练方向)
搭建高保真量化策略回测模拟环境,生成带时序标签、统计一致性约束和市场微观结构特性的合成策略数据集;设计针对核心量化策略范式(alpha因子合成、统计套利、事件驱动、CTA、ML因子等)的边界测试用例,将正确实现与典型错误配对为训练样本
数据开发工程师(风控相关)
负责大模型业务风控数据体系建设,支撑反作弊、反欺诈攻防策略场景,构建高质量、可复用的数据资产,保障数据时效性与准确性;参与实时数仓与特征工程架构设计,覆盖日志接入、非结构化数据处理、特征计算、策略引擎等关键链路,快速响应黑产变化
大数据开发工程师/数据仓库工程师
参与设计并持续优化离线与实时相结合的数据仓库分层架构(如ODS、DWD、DWS、ADS);负责核心业务主题域的数据模型设计、开发与维护,保障数据的一致性、准确性和完整性;编写高效、稳定的ETL/ELT数据处理流程及调度脚本,负责日常运维与性能优化
技术主管经理 - 数据工程
25%时间用于指导高级数据工程师的技术与职业发展;提升第三方应用中高价值上游数据的可用性;与商业智能团队合作识别数据基础的最大缺口;与市场推广及财务运营团队协作优化Salesforce等企业应用的数据管理流程
数据基础设施技术人员
构建并拥有大规模多模态数据集的创建、处理和管理的管道,包括向量数据库(LanceDB)管理和ML元数据查询优化;构建并拥有从Postgres和ClickHouse到分析仓库的ETL和CDC流
数据平台工程师
设计和运营大规模批处理和流式数据管道,支持产品功能、AI训练/评估、分析和实验;构建和发展事件驱动和流式系统(如Kafka/Kinesis/PubSub风格的架构),用于实时数据摄取、转换和交付
多模态数据工程师
负责多模态数据pipeline建设、数据版本管理、数据处理、数据算子开发集成等工作;开发自动化数据处理工具与脚本,优化数据清洗、标注及质量评估的效率和规模化能力;参与多模态大模型训练数据的构建与管理,参与数据筛选、标注及质量评估工作
数据工程师
设计和实施涉及CPU和GPU处理的PB级、高吞吐量数据处理系统;设计和实施用于编排复杂数据管道的工具;设计和实施创新工具,以大规模提高预训练和后训练中跨不同模态的数据可发现性和数据质量
数据工程师
设计和维护数据库架构与数据模型;构建和维护ETL/ELT管道及编排工作流;创建和管理跨内部与外部系统的新数据集成;负责业务报告:数据集、仪表板、指标和自助分析;确保数据质量、可观测性、治理和文档化
高级数据工程师
识别、设计和开发能够每日处理数百万甚至数十亿事件的基础数据基础设施组件;分析和改进现有数据处理基础设施的健壮性和可扩展性;与产品团队合作,理解功能需求并交付满足业务需求的解决方案;为新系统和现有系统编写清晰、经过良好测试且可维护的基础设施即代码和软件
高级数据工程师(多模态/大模型方向)
设计并实现面向大模型训练与推理的多模态数据处理与构建管线;管线需覆盖图像、视频、音频、文本、3D及多模态理解等数据类型;管线需支撑预训练、后训练(SFT / RLHF / Preference)及评测数据构建
自动驾驶数据工程师
搭建自动驾驶的全自动数据生产流程,高效支持各模块的数据挖掘、自动标注、算法评测、数据/真值可视化等任务;进行数据挖掘/分析的策略研发工作,结合模型能力降低策略的开发成本和提升挖掘准召率
数据平台工程师
负责通用数据与Agent数据平台建设,覆盖数据采集、生产、清洗、评测与回流全链路;搭建高稳定性Pipeline、数据工具链与Workflow,支撑算法训练、评测与实验迭代;建设数据质量治理、资产管理与可观测体系,持续提升数据一致性、可追溯性与生产效率
具身智能数据基础设施工程师
设计多源异构数据采集管线,对接遥操作、人手动捕、外骨骼、仿真等不同数据源,完成从原始传感器数据到可训练格式的全链路;构建数据处理与增强算法,包括视觉域适配(人手→机器人手 inpainting)、异常轨迹检测与清洗、多模态对齐(RGB + 深度 + 触觉 + 关节角 + 力矩)
机器人真机部署与数据工程专家
维护数据与评测:负责真机数据处理、质量验证、评测体系建设;收集、清洗和管理机器人预训练/微调数据;商用/开源机械臂系统集成与真机评测;支持Teleop数据采集与质量验证;搭建本地真机评测流程,并集成RoboChallenge、RoboArena等开源真机评测体系
具身智能数据工程师
负责具身智能数据集建设、清洗、标注、去重、增强与质量管控;处理机器人多模态数据:相机图像/视频、关节状态、动作、力控、仿真交互数据等;参与数据pipeline开发:数据采集→解析对齐→过滤存储→训练喂入
具身智能数据工程师
负责具身智能数据集的建设、清洗与标注工作;处理机器人多模态数据,包括相机图像/视频、关节状态、动作、力控及仿真交互数据等;支持模型训练数据生产,进行rot6d/四元数/关节位姿转换、时序对齐、去噪与异常检测
视频生成数据工程师
负责流式视频生成场景下的大规模数据处理流水线设计与持续优化,覆盖数据采集、清洗、标注、转码的全链路流程,保障数据流水线的稳定性、可扩展性与高吞吐;持续调研业界先进的数据处理方法与工具,构建指标化、标准化、自动化的数据处理与质检流程,提升海量视频/多模态数据的供给效率,确保数据质量与模型训练需求精准…
多模态大模型数据工程实习生
负责多模态训练数据处理Pipeline的开发与优化;基于Spark、Ray、Hive等分布式计算框架,开发和优化海量图文数据处理Pipeline;参与多模态训练数据的采集、解析、清洗、去重、过滤、标注等核心环节建设
大数据开发工程师(大模型方向)
设计、开发和维护基于Spark/Ray的大规模自动化ETL Pipeline,处理PB级多模态图文数据;优化图文数据的准确性与丰富度,以提升多模态模型的能力上限;计算机、大数据相关专业,本科及以上学历
AI数据开发工程师
负责算法数据平台系统的架构设计和开发工作,保障系统稳定、高效、安全;深入发掘和分析算法团队的数据需求,设计合理的技术方案并实现,生产交付文本、多模等各类模型训练数据;持续对系统平台进行架构改造和优化,提升系统的稳定性与可扩展性
大模型数据开发工程师
设计、开发和维护基于Spark/Ray的大规模自动化ETL Pipeline,处理PB级多模态图文数据;优化图文数据的准确性和丰富度,以提升多模态模型的能力上限;计算机、大数据相关专业,本科及以上学历
预训练数据工程师
设计和优化大规模Web爬虫的URL发现与调度系统,持续扩大数据覆盖面;建设多因子抓取优先级体系,在有限资源下最大化高质量页面的获取效率;主导反爬对抗和动态渲染方案,提升核心站点的抓取成功率
数据开发工程师
负责数据平台架构设计与开发,包括全链路血缘、自助打标平台、指标管理等工具平台;基于对数据链路的理解,优化与改善现有流程与性能,提升数据的稳定性与及时性;独立完成数据各层级建模,构建成熟、稳定的数据仓库
AI数据平台工程师
负责数据智能Agent开发,支持自然语言查数、Text2SQL、智能归因等场景,推动LLM与数据平台深度联动;协助数仓语义层建设,配合指标平台与血缘系统实现语义资产标准化;负责统一数据API服务层开发,将数仓资产(表/指标/标签)封装为标准化接口,建设网关、权限与缓存体系
算法数据平台工程师
负责算法数据平台系统的架构设计和开发工作,保障系统稳定、高效、安全运行;深入发掘和分析算法团队的数据需求,设计合理的技术方案并推动落地实现;持续对系统平台进行架构改造和优化,提升系统的稳定性与可扩展性
预训练数据工程师
设计和优化大规模Web爬虫的URL发现与调度系统,持续扩大数据覆盖面;建设多因子抓取优先级体系,在有限资源下最大化高质量页面的获取效率;主导反爬对抗和动态渲染方案,提升核心站点的抓取成功率
预训练数据工程师
设计和优化大规模Web爬虫的URL发现与调度系统,持续扩大数据覆盖面;建设多因子抓取优先级体系,在有限资源下最大化高质量页面的获取效率;主导反爬对抗和动态渲染方案,提升核心站点的抓取成功率
数据开发工程师
设计与开发全链路血缘、自助打标平台、指标管理等数据工具平台;基于数据链路理解,优化改善现有流程与性能,提升数据稳定性与及时性;独立完成数据各层级建模,构建成熟稳定的数据仓库;构建流批一体架构,基于Flink、Kafka、数据湖等技术实现实时与离线数据Pipeline
预训练数据工程师
设计与优化大规模Web爬虫的URL发现与调度系统,持续扩大数据覆盖范围;建设多因子抓取优先级体系,在有限资源下最大化高质量页面的获取效率;主导反爬对抗和动态渲染方案,提升核心站点的抓取成功率
量化交易基础设施数据工程师
搭建高保真量化回测模拟环境,生成带时间戳、低延迟约束和事务一致性要求的合成代码数据集;设计针对金融协议(FIX/FAST/ITCH/OUCH)编解码逻辑的边界测试用例,将正确实现与典型错误配对为训练样本
AI数据开发工程师
参与模型训练数据集的构建,包括数据清洗与处理,实现数据闭环,构建稳定高性能的分布式pipeline;负责模型训练数据标签体系的构建,搭建自动化打标能力,打通线上用户数据并分析数据分布
数据工程师(风控方向)
负责大模型业务风控数据体系建设,支撑反作弊、反欺诈攻防策略场景,构建高质量、可复用的数据资产,保障数据时效性与准确性;参与实时数仓与特征工程架构设计,覆盖日志接入、非结构化数据处理、特征计算、策略引擎等关键链路,快速响应黑产变化
大模型数据工程师
参与大模型训练数据的构建,包括数据采集、数据清洗、数据增强,搭建高效的分布式数据pipeline;参与大语言模型的数据质量提升,包括数据风控策略、异常数据检测、数据修复、特定领域数据扩充
数据工程师
负责构建面向大模型训练的高质量数据体系,主导语音、视觉、多模态数据的采集、存储、清洗及特征工程;探索基于生成式模型的合成数据构建,包括数据增强、对抗生成等技术;设计与实施数据质量评估体系,开发高质量、高知识密度的数据筛选机制
高级数据开发工程师
负责复杂业务需求的数据模型设计与开发,确保数据质量和系统稳定性;参与数据平台的架构设计与优化,提升数据处理效率和系统性能;负责数据管道的建设与维护,包括ETL流程的设计与实施;与数据科学团队协作,将数据转化为业务洞察,支持决策制定
大模型数据开发工程师
负责大模型训练数据的清洗工作,针对文本、多模态等数据类型,设计高效的去重算法与异常数据过滤方案,剔除无效、冗余数据,提升数据集纯净度;开展多源异构数据的整合工作,打通不同渠道、不同格式的数据壁垒;运用聚类算法对数据进行分类梳理,挖掘数据内在关联,构建结构化、体系化的训练数据池
大模型数据开发工程师
负责大模型训练数据的清洗工作,针对文本、多模态等数据类型,设计高效的去重算法与异常数据过滤方案,剔除无效、冗余数据,提升数据集纯净度;开展多源异构数据的整合工作,打通不同渠道、不同格式的数据壁垒;运用聚类算法对数据进行分类梳理,挖掘数据内在关联,构建结构化、体系化的训练数据池
高级数据基础设施工程师
实现和维护可复用的库、模块和平台,用于大规模数据采集与处理;根据系统设计,构建基础设施组件,如代理服务、镜像管道、可靠调度器及中间件抽象层;确保采集管道及支撑系统在数百PB至ZB规模下的可靠性、可扩展性和效率
大模型大数据开发工程师-多模态方向
设计、开发和维护基于Spark/Ray的大规模自动化ETL Pipeline,处理PB级多模态图文数据;优化图文数据的准确性与丰富度,以提升多模态大模型的能力上限;计算机、大数据相关专业,本科及以上学历
语音大模型数据工程师
设计、搭建并持续迭代语音大模型数据处理与生产管线,覆盖数据采集、清洗、标注、质检与版本管理,持续产出高质量训练数据;构建并维护大规模语音数据的自动化处理与质量控制流程,保障数据的稳定性、一致性和可追溯性
大模型数据开发工程师
设计、开发和维护基于Spark/Ray的大规模自动化ETL Pipeline,处理PB级多模态图文数据;优化图文数据的准确性与丰富度,以提升多模态大模型的能力上限;计算机、大数据相关专业,本科及以上学历
视频生成模型数据工程师
参与定义和刻画用于视频模型训练的高质量数据标准,包括视频的审美品质、内容多样性、技术参数等维度;基于既定标准,主动在全球范围内的视频平台、开源数据集及特定渠道中寻找和发掘符合要求的视频数据
数据开发工程师(风控方向)
负责大模型业务风控数据体系建设,支撑反作弊、反欺诈攻防策略场景,构建高质量、可复用的数据资产,保障数据时效性与准确性;参与实时数仓与特征工程架构设计,覆盖日志接入、非结构化数据处理、特征计算、策略引擎等关键链路,快速响应黑产变化
多模态大模型数据工程师
负责多模态大模型预训练、指令微调、偏好对齐等阶段的数据建设工作,包括数据采集、入库、清洗、观测及挖掘;建立多模态数据的闭环验证体系(数据构造→模型训练→性能评测),确保数据有效提升模型能力
多模态大模型数据工程师
负责多模态大模型预训练、指令微调、偏好对齐等阶段的数据建设工作,包括数据采集、入库、清洗、观测及挖掘;建立多模态数据的闭环验证体系,覆盖数据构造、模型训练到性能评测全链路;参与训练数据全生命周期管理体系建设,提升海量数据读取效率及模型训练工程效率
多模态大模型数据工程师
负责多模态大模型预训练、指令微调、偏好对齐等阶段的数据建设工作,包括数据采集、入库、清洗、观测及挖掘;负责多模态数据的闭环验证,建立从数据构造到模型训练再到性能评测的全链路闭环体系,确保数据提升模型基础能力
多模态大模型数据工程师
负责多模态大模型预训练、指令微调、偏好对齐等阶段的数据建设工作,包括数据采集、入库、清洗、观测、挖掘等环节;负责多模态数据的闭环验证,建立从数据构造到模型训练再到性能评测的全链路闭环体系
自动驾驶数据工程师
搭建自动驾驶的全自动数据生产流程,支持数据挖掘、自动标注、算法评测、数据/真值可视化等任务;进行数据挖掘/分析的策略研发,降低开发成本并提升准召率;利用多模态大模型进行case自动分拣,提升问题流转效率
多模态数据工程师
负责多模态数据pipeline建设、数据版本管理、数据处理、数据算子开发集成等工作;开发自动化数据处理工具与脚本,优化数据清洗、标注及质量评估的效率和规模化能力;参与多模态大模型训练数据的构建与管理,参与数据筛选、标注及质量评估工作
软件工程师,数据基础设施 - 研究
设计和维护标准化的数据集API,包括无法放入内存的多模态(MM)数据;构建主动测试和规模验证管道,用于GPU规模的数据集加载;与团队成员合作,将数据集无缝集成到训练和推理管道中,确保顺利采用和良好的用户体验
数据基础设施软件工程师
设计、构建和维护数据基础设施系统,如分布式计算、数据编排、分布式存储、流式基础设施、机器学习基础设施,同时确保可扩展性、可靠性和安全性;确保我们的数据平台能够在保持可靠和高效的同时实现数量级的扩展
数据基础设施工程师
设计和实施稳健的访问控制系统,确保只有授权用户才能访问敏感数据;构建用于权限管理、审计日志记录和合规性要求的基础设施;处理跨数千用户和系统的IAM策略、ACL和安全控制;构建和维护为关键业务报告提供支持的数据管道和数据仓库
软件工程师(数据管道与评估框架)
创建和维护用于智能体、数据和模型评估任务的框架;为AI智能体构建运行环境;开发自动化常见工作流程的工具;改进大规模强化学习任务中的警报、指标和错误处理机制;重构现有的智能体、数据、评估和训练框架,以提高模块化程度
全模态视频数据工程师
与爬虫团队合作,发现和获取视频数据集;构建可扩展的视频数据管理和处理基础设施;设计实验以评估视频数据集的性能;创新并优化用于扩展视频预训练数据的配方;紧跟用于准备多模态训练数据的最新技术;具备强大的机器学习实验设计能力
预训练数据工程师
与爬虫团队合作,发现和获取数据集;设计和构建能够高效、精确处理PB级数据集的管道;设计有洞察力的实验,以评估数据集质量及其对模型训练的影响;设计严谨的对照实验,以理解数据和数据处理流程;创新预训练数据的扩展配方,探索新的前沿
多模态中期训练数据工程师
将合成编码数据扩展到数万亿令牌规模,并进行大规模Docker验证;通过合成数据生成,将旗舰模型的智能提炼到轻量级模型中;优化中期训练数据混合比例,以提升强化学习的性能上限;设计长上下文数据配方
强化学习数据工程师
设计用于扩展RL数据生成和收集的管道;创新下一代RL算法;非常熟悉大型语言模型数据收集;具备跨领域专业知识者优先
数据工程师(预训练数据方向)
设计和构建可扩展的数据管道,以摄取、解析、过滤和优化多样化的网络数据集;进行数据消融分析以评估数据质量,并尝试不同的数据混合方案以提升模型性能;开发稳健的数据建模技术,确保数据集的结构和格式达到最佳训练效率
高级数据工程师
设计和优化Figure的端到端平台数据管道,从机器人遥测数据接收到数据仓库转换和可视化;改进和维护现有的ETL/ELT管道,确保其可扩展性、可靠性和可观察性;通过验证和异常检测框架,检测和缓解数据回归、模式漂移和缺失数据
高级数据工程师
开发和维护管道及工具,将机器人日志转换为更易于访问、可视化和自动检测感兴趣事件的形式;优化数据处理,减少数据卸载与工程团队可用数据之间的时间;设计和优化数据存储解决方案,处理复杂、高容量的时间序列和结构化数据
LLM预训练数据工程师
负责从互联网及多源文本中构建高质量语料库,主导LLM预训练数据体系的规划与建设;设计并实现大规模文本数据的采集、清洗、去重与质量评估流程;制定并迭代语料策略,主导数据消融实验,深度分析不同数据方案对模型能力(知识、推理、表达等)的影响
大数据开发工程师(多模态方向)
设计、开发和维护基于Spark Core/Spark SQL的大规模自动化ETL Pipeline,处理PB级多模态图文数据;优化Spark作业性能和稳定性,解决调度延迟、OOM等问题,提高任务执行效率,减少人工介入成本
AI代码数据工程师
利用AI编码助手(如Claude Code、Codex等)生成和扩充高质量代码数据;完成数据清洗、过滤与质量控制,提升训练语料多样性和准确性;研究代码生成原理,优化提示词策略,提高生成代码的准确性与安全性
语音大模型数据工程师
设计、搭建并持续迭代语音大模型数据处理与生产管线,覆盖数据采集、清洗、标注、质检与版本管理;持续产出高质量训练数据;构建并维护大规模语音数据的自动化处理与质量控制流程,保障数据的稳定性、一致性和可追溯性
数据工程师/大模型数据专员
参与收集、处理、清洗来自网页、电子书等多种渠道的原始文本数据;与大模型算法团队、数据采集团队、分布式训练工程团队密切合作,建立数据系统迭代流程;建立针对大模型的数据质量评估方法,持续提高数据质量和多样性、安全性、有用性
AI代码数据工程师
利用AI编码助手生成和扩充高质量代码数据,完成数据清洗、过滤与质量控制,以提升训练语料的多样性和准确性;研究代码生成原理,优化提示词策略,提高生成代码的准确性与安全性;分析模型输出与数据质量,识别错误模式与边界样本,提出改进方案并指导数据迭代
大数据开发工程师(多模态方向)
设计、开发和维护基于Spark Core/Spark SQL的大规模自动化ETL Pipeline,处理PB级多模态图文数据;优化Spark作业性能和稳定性,解决调度延迟、OOM等问题,提高任务执行效率,减少人工介入成本
相关搜索词
这些词用于覆盖真实搜索需求,也方便用户继续定位公司、城市、岗位方向和薪资信息。