Data Agent开发工程师
负责百炼平台Data Agent智能体相关功能的梳理、定位、设计、开发和产品化工作;负责追踪Data Agent前沿方向,聚焦核心技术的研究和突破;负责Data Agent相关的基础设施能力设计和工程开发工作
AI行业岗位
阿里巴巴是数字商业与云计算公司,业务覆盖电商、云服务、物流、本地生活和人工智能技术平台。在业务特点上,阿里巴巴更强调技术研发与产品落地的结合:一方面需要持续推进模型、算法、数据、算力和工程平台等基础能力,另一方面也要把 AI 能力转化为稳定可用的产品、工具或行业解决方案。这类公司的竞争力通常来自高密度研发团队、快速迭代的工程体系、对真实应用场景的理解,以及从基础研究到商业化交付的协同能力。从团队建设看,相关方向主要集中在模型算法、工程平台、产品应用、数据与算力等领域,适合关注前沿技术、复杂系统、产品化能力和长期产业机会的人持续观察。整体来看,公司价值不只体现在单点技术突破,也体现在持续吸引高水平人才、沉淀工程方法、连接生态伙伴并把能力规模化交付的综合实力。
阿里巴巴招聘页会持续整理岗位职责、工作地点、薪资标注和岗位方向,适合通过搜索了解阿里巴巴最新招聘机会。
OPEN ROLES
负责百炼平台Data Agent智能体相关功能的梳理、定位、设计、开发和产品化工作;负责追踪Data Agent前沿方向,聚焦核心技术的研究和突破;负责Data Agent相关的基础设施能力设计和工程开发工作
负责具身智能与机器人系统的整体架构设计,主导硬件模块、控制栈、感知栈与大模型平台的统一设计;建设数据体系,协同算法团队推进具身大模型训练,搭建大规模训练与分布式基础设施;将具身智能模型部署至机器人端侧,进行软硬件协同优化
参与Web软件的设计、开发和维护,包括PC Web站点、移动端H5/小程序、浏览器插件等;参与AI产品全流程,协同各角色完成需求分析、设计、开发及上线;探索AI与不同场景结合的产品开发,提供音视频、图像处理等前端技术解决方案
制定并推动多模态交互系统的端云整体工程架构演进路线,覆盖端侧推理、客户端集成、云端服务及协同策略;主导端侧AI推理框架的设计与优化,包括模型加载、算子加速、内存管理、功耗控制、异构计算调度等,确保大模型在资源受限设备上的高效运行
负责通义万相多模态世界模型的Reward Model构建,包括基模型评价维度和benchmark构建;构建强化学习Reward Model和有效RL算法;结合线上用户反馈挖掘模型缺点、持续迭代,实现和人类评测和偏好对齐
负责通义万相多模态生成大模型研发,重点解决生成大模型的训练和推理效率问题;负责研发各种蒸馏加速算法,包括CFG蒸馏,推理步数蒸馏等;负责研发各种Training-free推理加速算法,不限于cache、量化、采样优化等策略
探索多模态理解与生成大模型的技术边界,支持功能迭代和推理性能优化;构建实时流式输入/输出系统,实现百毫秒级端到端延迟;建设低延迟、高可用的分布式模型服务系统,提升吞吐与并发能力;解决复杂软硬件技术问题,跟踪行业最新技术并集成创新实践
负责Qwen-Omni多语言能力研发,解决多语言语音翻译、实时同传等技术问题;大模型算法前沿技术追踪、探索,建设技术影响力;研发基于多模态大模型的多语言/跨语言任务处理新范式,构建基于大模型的多语言应用
研究超长上下文管理和记忆技术、模型自进化、long cot、数据自动合成技术,提升超长文本、多文档能力;研究长文本强化学习基础技术,包括long-context reasoning RL、open-ended generation RL、long-context agentic RL,提升文档大模…
多模态预训练:开展数据清洗、模型结构设计、训练策略优化等研究;多模态后训练:迭代SFT/RLHF策略,优化专项能力数据与评估标准;多模态推理与通用Agent:通过强化学习提升模型任务执行能力
下一代理解生成一体化的模型结构设计与研发,探索Autoregressive LLM、Diffusion及两者结合的多种技术路线;研究及探索世界模型的多模态训练数据及对应训练策略;设计及研发自动化评估方法设计与实现,为模型研发提供科学指导
技术咨询与支持,解决客户在产品选型、SDK接入、效果评估等不同阶段的研发、算法问题;需求分析与产品优化,识别客户高频共性问题,主导形成标准化解决方案并推动上线;KA客户保障,主动预判潜在风险,协同跨团队解决重大卡点问题,确保客户业务顺利落地
负责原生多模态模型研究和开发,结合多模态能力(支持文本、图像、语音输入)实现复杂指令生成,包括但不限于文生图、图生图、文档生成、可控编辑等核心方向;负责图像生成模型效果优化,探索扩散模型、自回归模型结构和策略优化等核心技术课题
负责面向实时交互场景的数字人生成技术研发,重点探索3D/身体表征与视频生成的深度融合;运用前沿AIGC和多模态技术和数据管线技术,主导构建高质量、大规模的2D/3D人像数据集;紧跟业界前沿,探索Few-Step Diffusion Model、3D数字人等新范式在人像视频生成中的高效应用
负责面向超拟人语音交互场景的SFT数据方案设计,涵盖角色人设一致性、多轮对话逻辑、情感表达等维度,构建高质量对话语料;针对多模态交互、A陪伴等需求,设计角色扮演数据的标注规范,包括身份背景、经典台词、行为模式等细粒度标签
研究和构建具身智能大模型(Embodied Foundation Models)与机器人大脑;探索语言、视觉、动作等多模态融合机制(VLM / VLA / VLA-Agent);优化模型的长时记忆、推理能力与可泛化性
参与/负责搜索代理、深度研究、助手等智能体模型的体系化优化(评测、数据合成、SFT、RL等),保障模型的落地可交付效果与领先性;参与/负责对接重点业务,分解和抽象场景问题,设计和调优智能体全链路
负责语音合成、语音识别、端到端语音交互大模型算法的基础研究和应用落地;参与语音合成与识别技术在业务场景落地,解决落地过程中的前沿问题,持续优化语音合成与识别核心技术效果;深入调研和关注音频/NLP/多模态/全模态等方向的前沿技术,持续探索语音技术的新能力和新应用
主导/核心参与全模态大模型(文本、图像、视频、音频、3D等)的模型架构与核心算法设计、训练及优化;探索跨模态对齐、多模态融合和原生多模态等前沿技术创新;开发全模态大模型在具体场景中的应用落地(如实时AI视频通话等方向)
主导 AIOS 的整体架构设计,包括AI原生系统内核层、系统服务层、AI运行时与智能交互层;设计并实现 AI原生系统内核(AI;native Kernel),将调度、内存与资源管理与AI智能决策引擎深度融合
探索超前沿大语言模型强化学习算法和Agentic应用范式;参与大模型应用开发平台架构设计,积极推进MCP等开源协议赋能企业级开发平台;构建大模型轻应用,推进大模型在金融/医疗/教育等核心场景落地和赋能
负责魔搭社区(modelscope.cn 以及 modelscoope.ai)的站点多端建设,围绕各类 AI 开源场景、研发能力打磨平台开发者和泛 AI 用户的体验;负责新兴 AI 应用的开源开放建设,从基础对话到多模态场景和智能体、从python工具链到各类可视化应用,协同内外模型开源和社区能力…
参与多模态/具身智能机器人在真实场景中的应用方案设计、系统集成与验证;搭建端到端具身机器人任务pipeline,包括感知、理解、规划、控制、执行等模块的工程化实现;推动具身智能大模型能力在机器人实际任务中的落地优化(如操作、导航、交互等)
探索研究多模态大模型、GUI agent、Agentic RL、AI memory、多模态RAG等前沿技术;参与研发多模态、全模态大模型等下一代人工智能核心技术,探索面向真实环境的多模态智能体多轮强化学习
负责通义实验室多模态口语交互的算法研发,推进大模型增强的语言交互技术能力建设;端到端多模态联合建模:语音/视觉/文本等模态融合并应用于人机交互场景;多模态交互应用算法:意图动态规划、多智能体协作、多任务推理、主动交互
负责通义实验室语音团队的语音处理算法研发,包括语音增强、回声消除、麦克风阵列(波束形成、声源定位等)、语音唤醒、多模检测、轻量化ASR/TTS/LLM等任务;持续关注行业前沿动态,通过专利申请、论文和技术报告等形式提升团队的技术影响力
具身基础模型研究: 构建面向机器人的多模态基础模型,将视觉语言模型与机器人中心的物理世界理解与决策深度融合,构建具身领域的高质量的大规模真实与仿真数据集,设计并训练支持感知、动作、记忆、规划与语言理解统一的具身基础模型
参与前沿语音生成大模型的研发,涵盖数据体系设计、模型架构设计、训练优化等;探索语音合成、声学建模、自然语言处理等多模态融合技术,提升模型在语音质量、自然度及逻辑推理能力上的表现;针对实际应用场景(音色克隆、情感控制等)优化模型效果和性能,解决复杂技术难题
探索研究多模态生成大模型的设计与开发;参与研发多模态生成大模型开发等下一代人工智能核心技术;负责跟踪和研究多模态生成大模型前沿技术调研、落地、对业务进行优化;计算机科学、人工智能、机器学习或相关领域的硕士或博士学位
参与Qwen3-Music项目研究以及开源,构建世界级的影响力项目;围绕Qwen基座模型展开音频处理及音频交互相关的基础研究与应用;支持开发实时交互系统;计算机科学、语音交互、人工智能、机器学习等领域的博士/硕士毕业生
主导端侧AI推理框架的整体架构设计与核心模块开发,支持多模态大模型在资源受限设备上的高效运行;深度优化模型推理性能,包括算子融合、内存复用、图优化、量化(INT8/INT4)、稀疏化、编译优化(如MLIR/TVM)等关键技术
设计并构建面向多模态交互(语音、视觉、语言、上下文融合)的云端推理服务平台,支持Omni/Speech/VL等大模型的在线/近线推理;主导端云协同架构中云端服务模块的技术方案,包括模型服务化(Model Serving)、动态批处理(Dynamic Batching)、请求调度、弹性扩缩容、负载均…
负责面向AI手机、智能座舱等ToB场景的多模态交互模型研发,包括语音基础模型、视觉-语言模型(VLM)、全模态大模型的后训练(CPT/SFT/RL)与推理优化;研发基于神经网络、扩散模型或大模型的端侧音频信号处理算法(如语音增强、降噪、去混响),提升复杂声学环境下的语音交互质量
负责语音识别和语音对话大模型的算法研发与优化,包括声学模型、LLM模型和解码器等;探索新的算法架构,建设高效率、低时延的语音应用系统;结合业务需求,持续改进现有模型的性能,确保其在不同应用场景下的准确性和鲁棒性
构建端到端的数据与MLOps基础设施,支撑语音、图像、文本、传感器等多模态数据的大规模处理及模型的后训练、评估与部署;设计自动化数据管线,实现多模态数据的收集、清洗、标注、版本管理、质量监控及隐私合规处理
主导面向ToB场景的Android端多模态交互系统架构设计与核心模块开发;与AI算法团队紧密协作,高效集成语音识别、语音合成、视觉理解、大语言模型等端侧推理模块;设计并实现低延迟、高并发的双工对话通道,支持实时打断、动态判停、上下文感知等高级交互能力
面向ToB行业场景(如AI手机、智能座舱等),设计并构建可扩展、高可用的Agent编排系统,支撑多模态交互系统中复杂任务的自动化执行;深度整合阿里集团内部丰富的Agent能力,同时对接第三方生态服务,打造统一的行业级Agent应用
负责人工智能相关产品的数据和算法等场景测试;基于算法和工程团队现有质量问题提出建议与解决方案,推动算法质量提升;协同算法与工程团队进行质量把控和风险监控;参与数据和算法的质量系统建设,完善全链路质量保证能力
负责通用模型 Qwen 的代码能力和代码专有模型 Qwen;)包括但不限于数据收集、预训练、后训练(强化学习)、评测等方向上的探索;)我们坚持 Large;scale RL 来提升 Code Reasoning 能力,在专家级编程竞赛超越人类,并构建 Coding Agent 来解决真实世界软件开…
挖掘大模型弱点,持续快速构建覆盖各项模型能力的评测数据集,探索可靠、具有可扩展性的评测方案;Judge 方案构建,训练 LLM Judge / Reward Model,建模人类偏好并提升长尾任务的评价准确性
探索更多可 scalable 的 verifier 信号,并通过 RL 提升模型的各项能力;提升 reward model 在创作、人类偏好、指令遵循等各专项上的能力,减少reward hacking和bias
预训练数据:大规模预训练数据合成技术探索、STEM & reasoning 优化、长尾知识优化、精品数据挖掘过滤、自然数据 scaling、长文本优化、面向 test;预训练策略:新型预训练损失函数探索、遗忘对抗与持续学习、optimizer 优化、lr scheduler 优化、课程学习、sca…
优化Qwen基础大模型的通用Agent能力(如Tool use、RAG、Planning、Memory等算法研发);跟进业界Agent Benchmark,保持Qwen的行业领先水平
需求对接与迭代: 快速理解模型预训练需求,灵活调整数据方案以适应高频迭代;数据处理与优化: 开发工具完成数据收集、清洗、格式转换(如HTML;Text、ASR等),构建验证与测试集以量化性能指标,优化流程以应对超大规模数据挑战
负责AI平台大数据架构演进以及推进落地:根据不同领域场景大模型落地需求,与算法团队和IT基础设施团队紧密合作,提出大模型训练和优化数据规模、数据类型、数据结构等建议,确保架构有效实施
负责向量检索服务后端功能模块的设计、开发与持续优化;保障线上服务的稳定性、可扩展性与可观测性,快速响应并修复线上问题;与算法、产品及前端团队紧密协作,高效落地面向RAG、智能搜索等场景的功能需求
负责多模态数据数据pipeline建设、数据版本管理、数据处理、数据算子开发集成等工作;开发自动化数据处理工具与脚本,优化数据清洗、标注及质量评估的效率和规模化能力;参与多模态大模型训练数据的构建与管理,参与数据筛选、标注及质量评估工作
探索 Android、Ubuntu、Windows 等多端场景下,面向 GUI 交互、代码生成、Tool Use等场景的通用多模态 Agent 构建;开展多模态理解、强化学习、Tool Use等前沿技术的研究与实践
单人/多说话人语音识别;语音合成与高质量音频合成;音乐生成 / 歌声生成;理解指令遵循能力提升与推理,包括 SFT, GRPO 等;流式音频交互模型的推理与加速 (熟悉RTC/WebSocket等)
负责面向AI手机、智能座舱等ToB场景的对话系统整体算法能力建设;AI Memory与用户个性化建模:构建长期用户画像、兴趣演化与上下文记忆机制;语义检索与向量数据库算法:设计高效、低延迟的语义匹配、嵌入表示与向量索引方案
主导面向ToB行业(如AI手机厂商、智能汽车Tier1/主机厂等)的多模态交互系统整体架构设计,制定可扩展、高性能、低延迟的技术方案;深度参与客户需求分析,抽象行业共性问题,构建标准化、模块化的交互算法平台,支持多客户、多终端快速适配
探索研究多模态理解、计算机视觉、自然语言处理等前沿技术;参与研发多模态、全模态大模型等下一代人工智能核心技术;探索大规模/超大规模多模态理解与生成统一的基础模型,提升大模型能力;负责跟踪和研究多模态大模型前沿技术调研、落地、对业务进行优化
探索大规模多模态理解生成统一基础模型,包括统一建模设计、高效模型结构设计、高效Scaling、视觉Tokenizer、多模态联合训练等;探索和突破多模态强化学习,包括视觉CoT、面向复杂视觉设计任务的强化学习设计、基于用户反馈的在线自学习等
主导多模态理解/音频大模型的前沿算法研究及产业落地;研发语音识别、语音翻译以及音频分析等理解算法;开发跨模态(语音/文本/视觉)的音频语义理解系统;探索音频大模型架构设计;推动算法成果转化:通过ModelScope开源社区创造研究价值,或通过阿里云产品体系创造商业价值
负责百炼平台Data Agent智能体相关功能的梳理、定位、设计和产品化工作;负责追踪Data Agent前沿方向,聚焦核心技术的研究和突破;负责Data Agent相关的基础设施能力设计和工程开发工作
负责具身智能与机器人系统的整体架构设计,主导机器人平台化(硬件模块、控制栈、感知栈)与大模型平台化(数据、训练、推理)的统一设计;建设数据体系,协同科研模型算法团队推进具身大模型训练,调用云平台搭建面向具身场景的大规模训练与分布式基础设施
负责通义万相多模态世界模型的Reward Model构建,包括基模型评价维度和benchmark建设;构建强化学习Reward Model和有效RL算法,实现与人类评测和偏好的对齐;结合线上用户反馈挖掘模型缺点,持续迭代优化模型能力
负责通义万相多模态生成大模型研发,重点解决生成大模型的训练和推理效率问题;负责研发各种蒸馏加速算法,包括CFG蒸馏、推理步数蒸馏等;负责研发各种Training-free推理加速算法,涵盖cache、量化、采样优化等策略
探索多模态理解与生成大模型的技术边界,支持多模态模型的功能迭代和推理性能优化;构建极致性能的实时流式输入/输出系统,提供百毫秒级别的端到端延迟体验;建设超低延迟、高可用、可扩展的分布式模型服务系统,通过提升模型吞吐和并发,提供最普惠的AI模型服务
负责Qwen-Omni多语言能力研发,解决多语言语音翻译、实时同传等技术问题;追踪大模型算法前沿技术,探索创新方案,建设团队技术影响力;研发基于多模态大模型的多语言/跨语言任务处理新范式,构建大模型多语言应用
开展智能数据库基础研究,并将研究成果部署到实际产品中;运用统计与优化工具优化大数据管理系统的分布式存储与索引;利用统计算法实现交互式数据分析(近似查询处理与在线聚合);进行查询优化研究,包括更准确的代价模型、执行计划选择等
研究超长上下文管理和记忆技术、模型自进化、long cot、数据自动合成技术等,提升超长文本与多文档处理能力;开展长文本强化学习基础技术研究,包括long-context reasoning RL、open-ended generation RL、long-context agentic RL,解…
开展多模态预训练研究及实验,包括数据清洗筛选、数据配比优化、课程学习、视觉语言模型结构设计优化、训练策略优化、预训练数据合成、scaling law预测、词表优化、模型蒸馏压缩、长上下文能力优化等
负责下一代理解生成一体化模型结构设计与研发,探索自回归大语言模型、扩散模型及两者结合的多种技术路线;研究及探索世界模型的多模态训练数据及对应训练策略;设计及研发自动化评估方法,为模型研发提供科学指导
提供技术咨询与支持,解决客户在产品选型、SDK接入、效果评估等阶段的研发及算法问题;进行需求分析与产品优化,识别客户高频共性问题,主导形成标准化解决方案并推动上线;负责KA客户保障,主动预判潜在风险,协同跨团队解决重大卡点问题,确保客户业务顺利落地
负责原生多模态模型研究和开发,结合多模态能力(支持文本、图像、语音输入)实现复杂指令生成,包括文生图、图生图、文档生成、可控编辑等核心方向;负责图像生成模型效果优化,探索扩散模型、自回归模型结构和策略优化等核心技术课题
负责面向实时交互场景的数字人生成技术研发,重点探索3D/身体表征与视频生成的深度融合,实现高保真、低延迟的全模态驱动数字人生成;运用Z-Image等前沿AIGC和多模态技术及数据管线技术,主导构建高质量、大规模的2D/3D人像数据集,为下一代数字人模型研发奠定数据基石
设计面向超拟人语音交互场景的SFT数据方案,覆盖角色人设一致性、多轮对话逻辑、情感表达等维度,构建高质量对话语料;针对多模态交互、AI陪伴等需求,设计角色扮演数据的标注规范,包括身份背景、经典台词、行为模式等细粒度标签
研究和构建具身智能大模型(Embodied Foundation Models)与机器人大脑系统;探索语言、视觉、动作等多模态融合机制(VLM / VLA / VLA-Agent);优化模型的长时记忆、推理能力与可泛化性
参与或负责search agent、deepresearch、Assistant等agent模型的体系化优化工作,涵盖评测、数据合成、SFT、RL等环节;保障模型的落地可交付效果和技术领先性
负责语音合成、语音识别、端到端语音交互大模型算法的基础研究和应用落地;参与语音合成与识别技术在业务场景落地,解决落地过程中的前沿问题,持续优化语音合成与识别核心技术效果;深入调研和关注音频/NLP/多模态/全模态等方向的前沿技术,持续探索语音技术的新能力和新应用
主导或核心参与全模态大模型的模型架构与核心算法设计、训练及优化;探索跨模态对齐、多模态融合和原生多模态等前沿技术创新;开发全模态大模型在具体场景中的应用落地,如实时AI视频通话等方向;将全模态大模型技术与业务需求结合,推动场景化落地
主导AIOS的整体架构设计,包括AI原生系统内核层、系统服务层、AI运行时与智能交互层;设计并实现AI原生系统内核,将调度、内存与资源管理与AI智能决策引擎深度融合;构建AIOS Runtime,支持端侧模型的高效运行、动态加载、分层缓存、在线推理与自适应资源分配
负责魔搭社区(modelscope.cn及modelscope.ai)的站点多端建设,围绕各类AI开源场景打磨平台开发者和泛AI用户的体验;负责新兴AI应用的开源开放建设,涵盖基础对话、多模态场景、智能体等,从Python工具链到可视化应用,协同内外资源打造标杆范例
参与多模态/具身智能机器人在真实场景中的应用方案设计、系统集成与验证;搭建端到端具身机器人任务pipeline,包括感知、理解、规划、控制、执行等模块的工程化实现;推动具身智能大模型能力在机器人实际任务中的落地优化(如操作、导航、交互等)
探索研究多模态大模型、GUI智能体、智能体强化学习、AI记忆、多模态检索增强生成等前沿技术;参与研发多模态、全模态大模型等下一代人工智能核心技术;探索面向真实环境的多模态智能体多轮强化学习方法
负责通义实验室多模态口语交互的算法研发,深入理解全链路多模态交互技术;开展端到端多模态联合建模,实现语音/视觉/文本等模态融合并应用于人机交互场景;研发多模态交互应用算法,包括意图动态规划、多智能体协作、多任务推理、主动交互
负责语音处理算法研发,包括语音增强、回声消除、麦克风阵列(波束形成、声源定位等)技术;承担语音唤醒、多模检测、轻量化ASR/TTS/LLM等任务的技术攻关;深入理解全链路技术挑战,推动语音前后端团队协作
构建面向机器人的多模态基础模型,将视觉语言模型与机器人中心的物理世界理解与决策深度融合;构建具身领域的高质量大规模真实与仿真数据集;设计并训练支持感知、动作、记忆、规划与语言理解统一的具身基础模型
参与前沿语音生成大模型的研发,涵盖数据体系设计、模型架构设计、训练优化等;探索语音合成、声学建模、自然语言处理等多模态融合技术,提升模型在语音质量、自然度及逻辑推理能力上的表现;针对实际应用场景(音色克隆、情感控制等)优化模型效果和性能,解决复杂技术难题
参与Qwen3-Music项目的研究与开源工作,构建具有世界级影响力的音频模型项目;负责AI音乐生成核心技术的研发,包括旋律生成、伴奏合成、歌声合成、音色建模等方向;持续优化MusicLM类模型的训练与性能提升
主导端侧AI推理框架的整体架构设计与核心模块开发,支持Omni、Speech、VLM等多模态大模型在资源受限设备上的高效运行;深度优化模型推理性能,包括算子融合、内存复用、图优化、量化(INT8/INT4)、稀疏化、编译优化(MLIR/TVM)等关键技术
设计并构建面向多模态交互(语音、视觉、语言、上下文融合)的云端推理服务平台,支持Omni/Speech/VL等大模型的在线/近线推理;主导端云协同架构中云端服务模块的技术方案,包括模型服务化、动态批处理、请求调度、弹性扩缩容、负载均衡等关键能力
负责面向AI手机、智能座舱等ToB场景的多模态交互模型研发,包括语音基础模型、视觉-语言模型(VLM)、全模态大模型的后训练(CPT/SFT/RL)与推理优化;研发基于神经网络、扩散模型或大模型的端侧音频信号处理算法(如语音增强、降噪、去混响),提升复杂声学环境下的语音交互质量
负责语音识别和语音对话大模型的算法研发与优化,包括声学模型、LLM模型和解码器等;探索新的算法架构,建设高效率、低时延的语音应用系统;结合业务需求,持续改进现有模型的性能,确保其在不同应用场景下的准确性和鲁棒性
构建端到端的数据与MLOps基础设施,支撑语音、图像、文本、传感器等多模态数据的大规模处理及模型的后训练、评估与部署;设计自动化数据管线,实现多模态数据的收集、清洗、标注、版本管理、质量监控及隐私合规处理
主导面向ToB场景的Android端多模态交互系统架构设计与核心模块开发,涵盖语音采集/播放、摄像头控制、传感器融合、UI响应及状态管理;与AI算法团队紧密协作,高效集成语音识别、语音合成、视觉理解、大语言模型等端侧推理模块,优化模型加载、推理调度与资源协同策略
面向ToB行业场景(如AI手机、智能座舱等),设计并构建可扩展、高可用的Agent编排系统,支撑多模态交互系统中复杂任务的自动化执行;深度整合阿里集团内部丰富的Agent能力,同时对接第三方生态服务,打造统一的行业级Agent应用
负责人工智能相关产品的数据和算法等场景测试;基于算法和工程团队现有质量问题给出合理化的建议和解决方案,推动落地实现算法质量提高;协同算法团队和工程团队进行全面的质量把控和风险监控;参与数据和算法的质量系统建设,完善算法全链路质量保证能力
负责通用模型Qwen的代码能力构建与代码专有模型Qwen-Coder的全栈研发;开展数据收集、大规模预训练、后训练(强化学习)、评测等方向的探索与创新;通过大规模预训练与大规模强化学习提升代码推理能力,目标在专家级编程竞赛中超越人类水平
挖掘大模型弱点,持续快速构建覆盖各项模型能力的评测数据集,探索可靠、具有可扩展性的评测方案;参与 LLM-as-a-Judge 方案构建,训练 LLM Judge / Reward Model,建模人类偏好并提升长尾任务的评价准确性
探索更多可扩展的验证器信号,并通过强化学习提升模型的各项能力;提升奖励模型在创作、人类偏好、指令遵循等各专项上的能力,减少奖励作弊和偏差;研究推理路径压缩和外推,实现更高质量的推理思考
探索大规模预训练数据合成技术,优化STEM与推理能力、长尾知识覆盖;开展精品数据挖掘过滤、自然数据scaling及长文本优化研究;面向test-time scaling进行数据优化策略设计与实现
从事Qwen基础大模型的通用Agent能力优化,包括Tool use、RAG、Planning、Memory等能力的算法研发和优化;跟进业界Agent Benchmark,保持Qwen的Agent行业领先水平
快速理解模型预训练需求,灵活调整数据方案以适应高频迭代;开发工具完成数据收集、清洗、格式转换(如HTML2Text、PDF2Text、ASR等),构建验证与测试集以量化性能指标;构建自动化、高效率的数据处理管线,优化组件性能,确保稳定性和可扩展性
负责AI平台大数据架构演进及推进落地,根据不同领域场景大模型落地需求,与算法团队和IT基础设施团队紧密合作,提出大模型训练和优化数据规模、数据类型、数据结构等建议,确保架构有效实施
负责向量检索服务后端功能模块的设计、开发与持续优化;保障线上服务的稳定性、可扩展性与可观测性,快速响应并修复线上问题;与算法、产品及前端团队紧密协作,高效落地面向RAG、智能搜索等场景的功能需求
负责多模态数据pipeline建设、数据版本管理、数据处理、数据算子开发集成等工作;开发自动化数据处理工具与脚本,优化数据清洗、标注及质量评估的效率和规模化能力;参与多模态大模型训练数据的构建与管理,参与数据筛选、标注及质量评估工作
探索Android、Ubuntu、Windows等多端场景下,面向GUI交互、代码生成、Tool Use等场景的通用多模态Agent构建,提升多端智能体的交互能力与适配性;开展多模态理解、强化学习、Tool Use等前沿技术的研究与实践
负责单人及多说话人语音识别技术的研究与开发;开展语音合成与高质量音频合成相关工作;进行音频前端处理与音色转换技术研究;实现音色克隆(Zero-Shot TTS)功能;探索音乐生成与歌声生成技术
构建AI Memory与用户个性化建模能力,包括长期用户画像、兴趣演化与上下文记忆机制;设计语义检索与向量数据库算法,实现高效低延迟的语义匹配、嵌入表示与向量索引方案;研发LLM对话中控算法,涵盖多意图识别、任务路由、安全对齐、幻觉抑制与对话状态管理
主导面向ToB行业(如AI手机厂商、智能汽车Tier1/主机厂等)的多模态交互系统整体架构设计,制定可扩展、高性能、低延迟的技术方案;深度参与客户需求分析,抽象行业共性问题,构建标准化、模块化的交互算法平台,支持多客户、多终端快速适配
探索研究多模态理解、计算机视觉、自然语言处理等前沿技术;参与研发多模态、全模态大模型等下一代人工智能核心技术;探索大规模/超大规模多模态理解与生成统一的基础模型,提升大模型能力;负责跟踪和研究多模态大模型前沿技术调研、落地、对业务进行优化
探索大规模多模态理解生成统一基础模型,包括统一建模设计、高效模型结构设计、高效Scaling、视觉Tokenizer、多模态联合训练等方向;探索和突破多模态强化学习技术,涵盖视觉CoT、面向复杂视觉设计任务的强化学习设计、基于用户反馈的在线自学习等
从事Qwen基础大模型的通用Agent能力优化,包括Tool use、RAG、Planning、Memory等能力的算法研发和优化;跟进业界Agent Benchmark,保持Qwen的Agent行业领先水平
快速理解模型预训练需求,灵活调整数据方案以适应高频迭代;开发工具完成数据收集、清洗、格式转换(如HTML2Text、PDF2Text、ASR等);构建验证与测试集以量化性能指标,优化流程以应对超大规模数据挑战
负责AI平台大数据架构演进以及推进落地;根据不同领域场景大模型落地需求,与算法团队和IT基础设施团队紧密合作;提出大模型训练和优化数据规模、数据类型、数据结构等建议,确保架构有效实施;负责搭建大模型数据平台,支撑大模型数据的存储、预处理(去重、相似度计算、脱敏等)诉求
负责向量检索服务后端功能模块的设计、开发与持续优化;保障线上服务的稳定性、可扩展性与可观测性,快速响应并修复线上问题;与算法、产品及前端团队紧密协作,高效落地面向RAG、智能搜索等场景的功能需求
负责多模态数据pipeline建设、数据版本管理、数据处理、数据算子开发集成等工作;开发自动化数据处理工具与脚本,优化数据清洗、标注及质量评估的效率和规模化能力;参与多模态大模型训练数据的构建与管理,参与数据筛选、标注及质量评估工作
探索Android、Ubuntu、Windows等多端场景下,面向GUI交互、代码生成、Tool Use等场景的通用多模态Agent构建,提升多端智能体的交互能力与适配性;开展多模态理解、强化学习、Tool Use等前沿技术的研究与实践
负责单人及多说话人语音识别技术的研究与优化;开展语音合成与高质量音频合成相关工作;进行音频前端处理与音色转换技术研发;实现音色克隆(Zero-Shot TTS)相关算法;探索音乐生成与歌声生成的创新方法
构建AI Memory与用户个性化建模能力,包括长期用户画像、兴趣演化与上下文记忆机制;设计语义检索与向量数据库算法,实现高效低延迟的语义匹配、嵌入表示与向量索引方案;研发LLM对话中控算法,完成多意图识别、任务路由、安全对齐、幻觉抑制与对话状态管理
主导面向ToB行业(如AI手机厂商、智能汽车Tier1/主机厂等)的多模态交互系统整体架构设计,制定可扩展、高性能、低延迟的技术方案;深度参与客户需求分析,抽象行业共性问题,构建标准化、模块化的交互算法平台,支持多客户、多终端快速适配
探索研究多模态理解、计算机视觉、自然语言处理等前沿技术;参与研发多模态、全模态大模型等下一代人工智能核心技术;探索大规模/超大规模多模态理解与生成统一的基础模型,提升大模型能力;负责跟踪和研究多模态大模型前沿技术调研、落地、对业务进行优化
开展高效模型结构设计与推理性能验证,评估对模型精度的影响;探索模型稀疏化、蒸馏、fast decoding等后训练优化技术,提升推理效率并推动落地;与多模态模型团队协作,支持推理效率需求并促进技术集成
负责Qwen通用模型及Qwen-Coder专有模型的构建,涵盖数据收集、预训练、后训练与评测;通过大规模预训练和强化学习提升代码推理能力,研发解决真实软件开发任务的Coding Agent
探索多模态生成大模型的架构设计与关键技术,涵盖高效生成、生成与理解统一、多模态理解等方向;参与大规模生成模型的预训练与强化学习/RLHF后训练开发,构建高效数据管线;跟踪前沿技术动态,推动多模态生成模型在实际业务中的应用与性能优化
没有找到符合条件的岗位。