返回数据资产中心

DataHub 关键词情报 · 数据更新至 2026-07-22

阶跃星辰算法与研究招聘

本页聚焦阶跃星辰算法与研究相关岗位,便于用户比较岗位职责、地点、薪资标注和详情入口。

相关岗位380
覆盖公司1
主要方向算法与研究
薪资标注73.2%

活跃公司

  1. 阶跃星辰380 · 100.0%

热门地点

  1. 北京336 · 88.4%
  2. 上海43 · 11.3%
  3. 深圳1 · 0.3%

岗位方向

OPEN ROLES

代表岗位

显示 80 / 380 个相关岗位

AI编程大模型应用工程师

阶跃星辰北京薪资未公开

深入探索大语言模型在编程场景中的应用,参与Coding Agent开发,探索顶尖AI编程模型和框架的能力边界;持续探索创新的评测方法,提出更好的基准测试,定义模型能力,通过数据分析和算法改进优化大模型应用效果,跟踪数据变更对模型的影响,与算法团队配合进行数据实验,形成可量化的反馈机制

大宗商品AI算法专家

阶跃星辰上海薪资未公开

构建覆盖全球宏观指标、行业基本面及替代品价格的多因子时序预测模型;探索Transformer、Mamba等前沿架构在商品价格预测中的应用,持续迭代模型精度;利用大语言模型自动提取研报、新闻、政策文本中的关键供需信号,实现非结构化信息的定量化

AI模型效果评估专家

阶跃星辰上海薪资未公开

为模型效果提供输入、反馈与评测;与toB团队及效果产品经理配合;输出策略与洞察,确保模型工程化后效果不打折;负责数据回流与benchmark设定;具备技术背景与模型趋势sense;懂模型能力、工程化与用户痛点

大模型后训练系统工程师

阶跃星辰北京薪资未公开

构建基础训练/推理引擎,保障精度并优化效率;优化低精度训练/推理效率,确保训练与推理一致性;设计/优化大规模强化学习框架,面向下一代长程任务进行深度优化;加强稳定性建设,提升大规模训练中的容错定位与恢复效率

大模型API产品ToB销售经理

阶跃星辰上海薪资未公开

负责大模型API产品的ToB销售执行,主动挖掘并触达潜在企业客户,跟进销售线索,完成个人销售目标;日常维护客户关系,梳理并分析客户的业务场景与需求,配合售前及产研团队输出相应的AI落地解决方案

大模型后训练引擎工程师

阶跃星辰上海薪资未公开

负责后训练阶段SFT、RL等训练引擎建设与分布式训练性能优化,支撑不同后训练任务的高效接入、稳定运行与规模化迭代;负责低精度训练能力建设,提升低精度训练场景下的效率、精度与稳定性;负责长上下文训练能力建设,支撑长序列后训练任务的高效训练

大模型评测工程师

阶跃星辰北京薪资未公开

跟进学术界和企业界前沿的评测基准,持续健全世界级SOTA模型的观测榜单,例如AIME、GPQA、HLE、Codeforces、SWE、MultiChallenge、BrowseComp、Tau-Bench、Aider、MMMU、MathVista等

语音大模型Agent工程师

阶跃星辰上海薪资未公开

负责语音大模型Agent能力建设,包括实时语音交互、多轮对话、任务执行与工具调用能力研发;参与ASR、TTS、语音理解、语音智能体等核心能力的工程化落地;构建面向企业场景的语音Agent工作流、Prompt、记忆与规划能力

金融AI Agent研究员

阶跃星辰上海薪资未公开

参与金融Agent评测基准的建设,设计严谨的评估方法,拆解LLM Trading Agent的收益来源;开发7×24小时市场信息Agent,实现风口挖掘、热点前瞻、主题选股、个股深研等功能

AI大模型生态合作运营经理

阶跃星辰北京薪资未公开

负责AI大模型供应商的资源对接、商务洽谈与合作落地,维护长期合作关系;跟踪模型版本、定价、配额、SLA等关键信息,持续优化供应商组合;配合销售团队拓展外部B端渠道,输出合作方案与商务素材

机器人运动控制算法工程师

阶跃星辰深圳薪资未公开

负责多自由度机械臂/高动态腿足机器人运动控制算法的设计、开发、仿真验证与落地应用,涵盖运动学正逆解、动力学建模与补偿、轨迹规划、伺服控制等核心模块;搭建并优化机械臂/腿足机器人仿真环境,开展算法离线仿真测试、参数调优及性能验证,保障算法稳定性与可靠性

大模型服务平台产品经理

阶跃星辰上海薪资未公开

负责大模型服务平台的产品规划与路线图设计,推动产品从内部基础设施向企业级服务演进;设计企业级核心能力:商业化计费、多模型路由与降级策略、Token计量计费、资源池隔离、租户、SLA保障、KEY管理与权限体系等

大模型推理引擎开发工程师

阶跃星辰北京薪资未公开

参与分布式大模型推理框架的开发与优化,提升推理性能与吞吐量;针对不同场景的LLM请求特点,优化GPU计算流程,打造业内领先的高效LLM推理引擎;调研并引入前沿机器学习系统技术,推动系统架构的持续优化升级

算法数据平台架构师

阶跃星辰北京薪资未公开

负责算法数据平台系统的架构设计和开发工作,保障系统稳定、高效、安全;深入发掘和分析算法团队的数据需求,设计合理的技术方案并实现;持续对系统平台进行架构改造和优化,提升系统的稳定性与可扩展性

大模型强化学习训练与推理系统工程师

阶跃星辰北京薪资未公开

负责强化学习训练与推理基础设施的设计、开发与优化;负责分布式训练、任务调度、权重同步、热更新等核心链路建设;持续优化系统性能,包括吞吐量、时延、GPU利用率、训练效率等指标;建设稳定性与可观测能力,定位并解决OOM、超时、通信瓶颈、一致性问题等

大模型训推系统工程师

阶跃星辰北京薪资未公开

维护并持续优化Post-Train训推框架,降低使用门槛,让研究员专注于实验本身而非环境问题;深入训练与推理全链路,覆盖显存优化、通信加速、调度策略、吞吐与延迟等核心指标,缩短实验周期,提升资源利用率

大语言模型基础设施工程师

阶跃星辰北京薪资未公开

负责大语言模型训练基础设施的设计与开发,包括大规模数据加载优化、训练数据构建和数据处理流水线;负责大规模训练数据格式与存储方案设计,优化数据输入输出和分布式训练场景下的数据吞吐能力;负责模型工具链建设,包括模型格式转换、权重切分与合并、跨框架模型迁移

大模型开放平台后端开发工程师

阶跃星辰上海薪资未公开

负责大模型开放平台的整体架构设计与核心模块研发,包括API Gateway、模型路由、流量调度、多租户隔离等,确保系统高可用、高并发与可扩展;设计并实现统一的模型调用协议与接入标准,支持多模型(自研/三方)的统一接入、版本管理、灰度发布与流量切换,对外提供标准化的API/SDK

个人/工作智能体研究员

阶跃星辰北京薪资未公开

探索基于人机协同的高质量工作流数据挖掘与合成,构建多步骤、跨应用、长周期的复杂工作任务数据,以加强智能体的规划和多工具编排能力;构建WorkingAgent的基础能力,包括任务分解与规划、多工具协同调用、上下文管理与信息整合、自主纠错与迭代执行能力

多模态预训练数据研究员/算法专家

阶跃星辰北京70-100K

主导多模态大模型预训练数据的生产与质控体系建设,覆盖采集、解析、合成、清洗、配比全链路,规模达万亿token量级;以数据为中心的方法量化数据与模型能力的因果关系,设计配比与采样策略,通过对照实验沉淀可复现结论

基础设施工程师(大模型方向)

阶跃星辰北京70-100K

负责分布式训练系统的设计与优化;参与推理优化、训练框架、RL系统、平台和网络等方向的研发工作;支持大规模分布式系统和云原生/K8s环境的搭建与维护;进行CUDA/GPU编程、性能优化或分布式训练加速技术的应用与改进

大模型AI Coding实习生

阶跃星辰北京300-400元/天

建设并优化LLM/Agent评测平台,形成实验、评测、回归与数据闭环;设计和优化AI Coding产物评估标准,对生成的前端页面、组件、工具等进行多维度质量评估;参与LLM训练数据建设,包括编码任务设计、数据合成、数据清洗、质量筛选与问题归因

LLM 预训练主训研究员

阶跃星辰北京500-1000元/天

负责千卡以上规模预训练任务的日常运维与异常处理,保障训练零中断或快速恢复;诊断并解决loss spike、梯度爆炸、NaN、慢节点等训练异常,建立系统化的问题分类与处理机制;优化训练吞吐(MFU),通过kernel融合、通信隐藏、梯度checkpoint等手段提升GPU利用率

多模数据算法实习生(coding方向)

阶跃星辰北京300-400元/天

研究高质量训练数据合成方案,调研并分析前沿的多模态大模型训练数据合成方法及最佳实践(如CoSyn、MathCoderVL等);建立合成数据的质量评估体系(如图像合理性、图像-文本匹配度等),设计自动化拒绝采样策略

大模型评测算法实习生

阶跃星辰北京300-400元/天

根据模型迭代重点与业务需求,深度参与大模型的预训练、后训练模型评测;设计并实现能够体现模型能力的评测集,包括多轮对话、长上下文、代码能力等;挖掘与收集高质量数据,构建自动化、可扩展、可靠的评测流程

多模态数据算法实习生

阶跃星辰北京500-1000元/天

参与多模态预训练数据的构建、清洗与优化工作;利用数据科学方法判断最具价值的数据方向,并通过对照实验验证;开发数据处理脚本,搭建数据闭环系统;与团队协作,推动数据驱动的模型迭代;认同数据是模型能力的决定性因素,愿意为数据质量负责

大模型评测算法实习生

阶跃星辰北京500-600元/天

参与大模型自动化评测框架的设计、开发与维护;支持训练框架上的联动开发,持续提升评测流程的稳定性、可扩展性和执行效率;跟进学术界与工业界最新的大模型评测基准,负责将其快速、准确地集成到现有评测平台中

大模型后训练系统工程师(实习)

阶跃星辰北京500-550元/天

基础训练/推理引擎开发、精度保障、效率优化等;低精度训推效率优化、训推一致性建设等;大规模RL框架设计/优化,面向下一代长程任务训练深度优化;稳定性建设,提升大规模训练过程中容错定位及恢复效率

多模态预训练数据研究员

阶跃星辰北京500-1000元/天

主导阶跃多模态大模型预训练数据的生产与质控体系建设,覆盖采集、解析、合成、清洗、配比全链路,规模达万亿token量级,质控体系的设计本身即为核心交付;以data-centric方法量化“数据→模型能力”的因果关系,设计配比与采样策略,通过对照实验沉淀可复现结论,而非依赖经验判断

LLM预训练代码数据研究员

阶跃星辰北京500-1000元/天

负责代码大模型预训练数据体系的建设与迭代,包括代码语料清洗、质量评估、去重、去污染、数据配比、课程学习与数据飞轮设计,持续提升模型代码、数学、推理与工具使用能力;负责Agentic Pretrain Data的研究与构建,探索基于真实开发流程、代码仓库、测试反馈、工具调用、执行轨迹、Issue/P…

大模型训练优化工程师

阶跃星辰北京70-100K

负责大语言模型训练基础设施的设计与开发,包括大规模数据加载优化、训练数据构建和数据处理管道;负责大规模训练数据格式与存储方案设计,优化数据IO和分布式训练场景下的数据吞吐能力;负责模型工具链建设,包括模型格式转换、权重切分与合并、跨框架模型迁移

大模型评测算法实习生

阶跃星辰北京330-630元/天

参与大模型自动化评测框架的设计、开发与维护,支持与训练框架的联动开发,持续提升评测流程的稳定性、可扩展性和执行效率;跟进学术界与工业界最新的大模型评测基准,包括主客观评测、Agent Benchmark等,负责将相关指标和数据集快速、准确地集成到现有评测平台中

多模态大模型数据工程实习生

阶跃星辰北京300-400元/天

负责多模态训练数据处理Pipeline的开发与优化;基于Spark、Ray、Hive等分布式计算框架,开发和优化海量图文数据处理Pipeline;参与多模态训练数据的采集、解析、清洗、去重、过滤、标注等核心环节建设

多模态算法实习生

阶跃星辰北京500-600元/天

探索自动数据缩放新范式,包括字幕、交错、视频等多模态数据处理;探索与物理更相关的视觉编码器,提升对真实世界的理解能力;探索更统一的视觉语言模型训练范式;探索多模态强化学习的数据与算法策略,实现模型可扩展性提升

大模型强化学习系统工程师

阶跃星辰北京70-100K

负责强化学习训练与推理基础设施的设计、开发与优化;负责分布式训练、任务调度、权重同步、热更新等核心链路建设;持续优化系统性能,包括吞吐量、时延、GPU利用率、训练效率等指标;建设稳定性与可观测能力,定位并解决OOM、超时、通信瓶颈、一致性问题等

大模型训推系统工程师(RL方向)

阶跃星辰北京50-70K

基础训练/推理引擎构建、精度保障、效率优化;低精度训推效率优化、训推一致性建设;大规模RL框架设计/优化,面向下一代长程任务进行深度优化;稳定性建设,提升大规模训练过程中的容错定位及恢复效率

高级推理平台工程师(大模型推理云平台)

阶跃星辰北京35-65K

负责推理云平台核心系统的架构设计与关键模块开发,建设服务控制面、配置管理、发布变更、运行治理等平台能力;面向大规模IDC与云上环境,设计和演进平台基础设施架构,提升系统在复杂部署场景下的稳定性、扩展性与可运维性

多模态大模型算法工程师/研究员

阶跃星辰北京40-70K

参与多模态大模型(文本、图像、视频等)的算法研究与工程实现,重点攻关模型在复杂视觉场景下的代码生成能力,覆盖从设计稿到可运行前端代码的端到端链路;推动多模态模型的通用工具使用能力建设,让模型能够基于视觉输入调用Python工具、搜索工具、文件操作等通用工具链,实现从视觉理解到工具编排的闭环

大模型基础设施工程师

阶跃星辰北京40-70K

负责代码执行沙箱(Sandbox)的设计与开发,支持多语言、多场景的安全隔离执行环境,满足后训练阶段大规模并发评测需求;负责评测框架(Harness)的建设与维护,支持多种任务类型(代码、数学、工具调用等)的自动化评分与奖励信号生成

基础模型-数据平台开发工程师

阶跃星辰北京30-60K

负责算法数据平台系统的架构设计和开发工作,保障系统稳定、高效、安全;深入发掘和分析算法团队的数据需求,设计合理的技术方案并实现;持续对系统平台进行架构改造和优化,提升系统的稳定性与可扩展性

模型策略产品经理

阶跃星辰北京30-60K

负责对话、多模态及Agent场景下的模型效果迭代,包括但不限于模型意图、模型回复质量等,与算法、工程等团队协作提升模型效果;通过线上数据、用户研究、Badcase分析、竞品洞察和模型评测结果,定位模型体验问题,拆解优化路径并推动版本迭代

大模型训练优化工程师

阶跃星辰北京40-70K

负责大语言模型(LLM)训练基础设施的设计与开发,包括大规模数据加载优化、训练数据构建和数据处理Pipeline;负责大规模训练数据格式与存储方案设计(如WebDataset/Sharded Dataset等),优化数据IO和分布式训练场景下的数据吞吐能力

AIGC算法工程师/研究员

阶跃星辰北京40-60K

研发适用于视觉生成任务的文生图基座大模型和图像编辑大模型后训练算法RLHF,显著超越Stable Diffusion、Flux及QWen-image等开源基座模型;设计并研发从美学评分、指令遵循、文字渲染以及肢体优化等多个维度的RLHF奖赏模型,提升并激发生成模型后训练上限

大模型数据平台研发工程师

阶跃星辰北京40-70K

负责算法数据平台系统的架构设计和开发工作,保障系统稳定、高效、安全;深入发掘和分析算法团队的数据需求,设计合理的技术方案并实现;持续对系统平台进行架构改造和优化,提升系统的稳定性与可扩展性

大模型训练优化工程师

阶跃星辰北京30-60K

负责大语言模型(LLM)训练基础设施的设计与开发,包括大规模数据加载优化、训练数据构建和数据处理Pipeline;负责大规模训练数据格式与存储方案设计(如WebDataset/Sharded Dataset等),优化数据IO和分布式训练场景下的数据吞吐能力

语音大模型产品经理

阶跃星辰北京25-50K

独立负责语音大模型(如语音识别、语音合成和端到端语音对话等)及其对应产品的能力规划、测评和数据体系搭建、产品迭代和发布的全生命周期管理;与商业化团队协作,分析、归纳客户和用户需求,向解决方案团队提供支持,参与模型开源、发布、定价、上架等过程

大模型数据开发工程师

阶跃星辰北京35-65K

设计、开发和维护基于Spark/Ray的大规模自动化ETL Pipeline,处理PB级多模态图文数据;优化图文数据的准确性和丰富度,以提升多模态模型的能力上限;计算机、大数据相关专业,本科及以上学历

多模态预训练数据研究员

阶跃星辰北京45-75K

主导多模态大模型预训练数据的生产与质控体系建设,覆盖采集、解析、合成、清洗、配比全链路,规模达万亿token量级;以data-centric方法量化数据与模型能力的因果关系,设计配比与采样策略,通过对照实验沉淀可复现结论

大模型评测产品经理

阶跃星辰北京30-60K

负责大模型评测体系的产品化建设,面向LLM、多模态理解/生成、Agent、工具调用、长文本、推理等场景,设计科学、可扩展的评测方法与产品流程;与算法、工程、数据标注、业务产品团队协作,定义评测指标、评测集、Badcase分类、人工评审标准和自动化评测方案

模型产品经理

阶跃星辰北京30-60K

负责公司LLM产品规划与落地,包括产品定义、模型效果优化、用户体验提升;驱动算法、数据、评估团队协同,把控数据质量与模型迭代方向,持续提升模型在真实场景中的表现;深入分析用户需求与使用场景,探索大模型技术在C端/B端产品中的创新应用

大模型评测工程师

阶跃星辰北京40-70K

跟进学术界和企业界前沿的评测基准,持续健全世界级SOTA模型的观测榜单,例如AIME、GPQA、HLE、Codeforces、SWE、MultiChallenge、BrowseComp、Tau-Bench、Aider、MMMU、MathVista等

语音技术项目经理(模型方向)

阶跃星辰北京25-50K

负责语音大模型相关项目的整体推进与进度管理,协调算法、数据、工程等多方资源,确保项目按计划交付;跟进语音大模型的研发进展与关键里程碑,推动模型从研究到可用版本的持续迭代;支持模型研发过程中的数据需求管理,包括数据采集、清洗、标注及质量评估等环节的协调

语音技术项目经理(模型方向)

阶跃星辰上海30-60K

负责语音大模型相关项目的整体推进与进度管理,协调算法、数据、工程等多方资源,确保项目按计划交付;跟进语音大模型的研发进展与关键里程碑,推动模型从研究到可用版本的持续迭代;支持模型研发过程中的数据需求管理,包括数据采集、清洗、标注及质量评估等环节的协调

多模态算法实习生

阶跃星辰北京300-500元/天

参与VLMO的Pretrain、SFT和RLVR/RLHF阶段全链路训练工作;探索auto data scaling,包括caption、interleave、video等多元多模态数据处理新范式

Agent RL算法研究员

阶跃星辰北京60-90K

利用强化学习方法改进智能体的规划、反思与工具调用能力;探索基于人机协同的高质量数据挖掘与合成,增强智能体规划与工具使用能力;构建多模态智能体,提升多模态大模型RLHF训练效果;构建智能体自动化评测体系

大模型算法实习生(Reasoning/RL方向)

阶跃星辰北京400-500元/天

参与大模型Post-training阶段算法研究与实践,系统性提升模型推理、泛化与对齐能力;开展在线学习、持续学习、自适应数据采样与模型自我进化等前沿算法研究;参与Scalable RL算法与训练框架设计与实现,支持大规模并行训练与高效rollout

大模型预训练算法研究员/工程师

阶跃星辰北京60-90K

参与通用推理大模型对齐(Alignment)方向的研发工作,涵盖数据循环体系的构建;在监督微调(SFT)与强化学习(RL)阶段中对数据使用策略进行系统性探究;深入探索对齐阶段(Alignment)的数据与算法在大规模训练中的可扩展性与优化路径

Post Train算法研究员

阶跃星辰北京50-80K

参与通用推理大模型对齐(Alignment)方向的研发工作,涵盖数据循环体系的构建;在监督微调(SFT)与强化学习(RL)阶段中对数据使用策略进行系统性探究;深入探索对齐阶段的数据与算法在大规模训练中的可扩展性与优化路径

大模型Alignment算法研究员

阶跃星辰北京50-80K

参与大模型对齐Alignment方向的研发,涉及数据循环、SFT及RL训练算法等相关内容;探索Alignment阶段的数据Scaling Up;解决技术难题,为语言大模型和多模态大模型的落地提供技术支持

大模型预训练算法研究员

阶跃星辰北京500-550元/天

负责预训练数据的筛选、配比优化与知识边界拓展,深入专业领域挖掘高质量训练数据,助力模型从通才向专家进化;构建科学全面的模型评估体系,打破传统benchmark局限,从标准考试走向实战考验,为模型能力提供精准的深度诊断报告

Agent RL算法研究员

阶跃星辰北京50-80K

利用强化学习方法改进智能体的规划、反思和利用工具的能力;探索基于人机协同的高质量数据挖掘与合成,以加强智能体的规划和工具利用能力;构建多模态智能体,提升多模态大模型RLHF中的训练效果

多模态大模型算法工程师

阶跃星辰北京50-80K

参与多模态大模型(文本、图像、视频等)的算法研究与工程实现,重点攻关模型在复杂视觉场景下的代码生成能力,覆盖从设计稿到可运行前端代码的端到端链路;推动多模态模型的通用工具使用能力建设,让模型能够基于视觉输入调用Python工具、搜索工具、文件操作等通用工具链,实现从视觉理解到工具编排的闭环

Agent Harness研究员(实习)

阶跃星辰北京400-500元/天

设计并构建Code Agent评测体系(Harness),包括benchmark设计、评测pipeline搭建、指标定义与数据分析;调研和复现前沿Agent评测框架,提出改进方案;搭建端到端的Agent能力评估环境(sandbox隔离、代码执行、多轮交互评测)

多模态大模型算法实习生-泛OCR方向

阶跃星辰北京400-500元/天

跟踪学术界与工业界最新发布的文档解析、图表理解(Chart、diagram等)、STEM相关图像理解等工作,定期进行总结分享;深入理解OCR评估体系(如NED、CDM、TEDS等指标),参与评测基准的构建与维护,设计更贴近用户体感的OCR评测方案

Agent RL 算法研究员(实习)

阶跃星辰北京400-500元/天

设计和构建Code Agent评测体系(Harness),包括benchmark设计、评测pipeline搭建、指标定义与分析;调研和复现前沿Agent评测框架,提出改进方案;搭建端到端的Agent能力评估环境(sandbox隔离、代码执行、多轮交互评测)

大模型训练框架系统工程师

阶跃星辰北京50-80K

负责大语言模型、多模态模型的预训练和后训练框架研究与开发;与公司算法团队深度合作,为大模型进行算法与系统的联合优化;进行前瞻性技术调研并进行自主创新,保持公司在大模型系统方面的技术领先地位

大模型Post Train算法工程师/研究员

阶跃星辰北京100-200K

负责大模型对齐方向研发,涵盖SFT、RL全阶段的数据策略与算法优化;负责后训练及Mid-training数据筛选、合成与配比,建立数据-模型正向飞轮;探索通用Agent/Agent RL等前沿训练范式,提升模型任务规划与多步推理能力

Agent基建算法工程师

阶跃星辰北京50-80K

负责Agent训练与推理全链路框架的开发、优化与稳定性保障,支撑大规模模型训练实验的高效运转;设计并维护Agent执行沙箱,保障代码执行、工具调用等复杂场景下的安全性、隔离性与可靠性

大模型AI Coding算法工程师/专家

阶跃星辰北京50-80K

深入探索LLM在编程场景中的应用,参与Coding Agent开发,对顶尖AI coding模型和框架的能力边界进行持续探索;设计创新的评测方法,提出更优的Benchmark,定义模型能力,通过数据分析和算法改进持续优化应用性能与用户体验

LLM预训练算法研究员

阶跃星辰北京50-80K

数据炼丹:调配预训练数据配比、打磨学习策略,拓宽模型知识边界,深入专业领域挖掘高质量数据,让模型从通才蜕变为专家,与团队协作注入推理、代码、Agent等核心能力;模型能力度量:打破传统benchmark局限,构建更科学全面的评估体系,从标准考试走向实战考验,探索创新评估维度,为模型能力提供精准诊断…

LLM Post-Train算法研究员

阶跃星辰北京500-550元/天

参与通用推理大模型对齐(Alignment)方向的研发工作,涵盖数据循环体系的构建;在监督微调(SFT)与强化学习(RL)阶段系统性探究数据使用策略;深入探索对齐阶段的数据与算法在大规模训练中的可扩展性与优化路径

Code Agent研究员

阶跃星辰北京50-80K

利用强化学习方法改进智能体的规划、反思和利用工具的能力,强化在实际场景中的可用性;探索基于人机协同的高质量数据挖掘与合成,增强智能体的规划和工具利用能力;构建Code Agent基础能力,包括Planning能力、测例及代码生成能力

相关搜索词

这些词用于覆盖真实搜索需求,也方便用户继续定位公司、城市、岗位方向和薪资信息。

阶跃星辰算法与研究招聘阶跃星辰算法与研究招聘有哪些公司阶跃星辰算法与研究招聘薪资阶跃星辰算法与研究招聘岗位AI招聘阶跃星辰算法与研究招聘阶跃星辰招聘算法与研究招聘