大模型评测工程师
岗位摘要
设计、搭建并持续迭代大模型多维度评测框架,使模型能力可衡量、可对比、可解释;与算法团队配合,将评测结论转化为数据需求,寻找并推动提升模型智能的关键数据落地;跟踪前沿论文与开源社区,及时将新评测维度和数据策略落地到业务中
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计、搭建并持续迭代大模型多维度评测框架,使模型能力可衡量、可对比、可解释
- 与算法团队配合,将评测结论转化为数据需求,寻找并推动提升模型智能的关键数据落地
- 跟踪前沿论文与开源社区,及时将新评测维度和数据策略落地到业务中
- 具备产品思维,能够发现问题并推动解决,以提升模型能力
任职要求
- 具备 Python/Go/Java/C++ 任一语言使用经验,能够独立编写脚本、调用 API、搭建小工具
- 逻辑思维能力强,坚持'用数据说话',熟悉 SQL / Pandas / Jupyter 等分析工具
- 对大模型有基础认知(使用过 GPT、Claude 等),能够快速理解 SFT、RL 等概念
- 有参与过大模型 benchmark、evaluation 等相关工作经验
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。