大模型评测工程师
岗位摘要
设计、搭建并持续迭代大模型多维度评测框架,使模型能力可衡量、可对比、可解释;与算法团队配合,将评测结论转化为数据需求,寻找并推动提升模型智能的关键数据落地;跟踪前沿论文与开源社区,及时将新评测维度和数据策略落地到业务中
岗位职责
- 设计、搭建并持续迭代大模型多维度评测框架,使模型能力可衡量、可对比、可解释
- 与算法团队配合,将评测结论转化为数据需求,寻找并推动提升模型智能的关键数据落地
- 跟踪前沿论文与开源社区,及时将新评测维度和数据策略落地到业务中
- 具备产品思维,能够发现问题并推动解决,以提升模型能力
任职要求
- 具备 Python/Go/Java/C++ 任一语言使用经验,能够独立编写脚本、调用 API、搭建小工具
- 逻辑思维能力强,坚持'用数据说话',熟悉 SQL / Pandas / Jupyter 等分析工具
- 对大模型有基础认知(使用过 GPT、Claude 等),能够快速理解 SFT、RL 等概念
- 有参与过大模型 benchmark、evaluation 等相关工作经验