大模型算法与评测专家
岗位摘要
闭环算法优化:深度参与从基础模型到创新应用的全链路开发,通过评测反馈直接驱动模型微调 (SFT)、偏好对齐 (RLHF/DPO) 及架构改进,确保技术领先性;构建科学评测体系:设计、搭建并维护可扩展的模型评测基准与自动化平台,涵盖基础能力、指令遵循、长文本及安全性等多维度
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 闭环算法优化:深度参与从基础模型到创新应用的全链路开发,通过评测反馈直接驱动模型微调 (SFT)、偏好对齐 (RLHF/DPO) 及架构改进,确保技术领先性
- 构建科学评测体系:设计、搭建并维护可扩展的模型评测基准与自动化平台,涵盖基础能力、指令遵循、长文本及安全性等多维度
- 多模态与垂直领域评估:针对文本、视觉多模态及特定业务场景进行定量分析,构建高质量测试集,精准诊断算法边界
- 端到端应用落地:协同研发团队优化 RAG、Agent 等应用链路,基于评测数据定位 Rerank、Tool
- use 等环节的算法瓶颈并实施改进
- 标准化与方法论:推动评测工具自动化与流程标准化,探索 LLM
- Judge 等前沿评测技术,打造业内领先的评测标准
- 计算机、人工智能或相关专业硕士及以上学历
任职要求
- 计算机、人工智能或相关专业硕士及以上学历
- 具备扎实的机器学习和深度学习基础,深入理解 Transformer 架构,熟悉主流大语言模型(如 Qwen、Llama、MiniCPM 等)的训练与推理机制
- 熟练掌握 OpenCompass、VLMEvalKit 等主流评测框架,熟悉 SWE-bench(代码)、GAIA(Agent)、MMMU(多模态)等前沿基准评测
- 精通 Python 编程,具备模型训练(LlamaFactory、Swift、DeepSpeed)或评测平台从 0 到 1 的搭建经验
- 具备优秀的数据敏感度,能够从杂乱的预测结果中归纳出算法缺陷,并转化为可实施的训练策略
- 在顶级会议(NeurIPS、ACL、CVPR、ICML 等)发表过论文,或在知名开源评测榜单、数据竞赛中取得优异成绩者优先
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。