预训练数据算法研究实习生
岗位摘要
负责多模态预训练数据的清洗算法研究,涵盖文本、图像、视频、音频等数据的质量评估与分级;开发和优化基于SFT模型的内容理解算法,实现自动化的数据分类与过滤;跟踪预训练数据处理相关的学术研究前沿,参与技术方案设计
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责多模态预训练数据的清洗算法研究,涵盖文本、图像、视频、音频等数据的质量评估与分级
- 开发和优化基于SFT模型的内容理解算法,实现自动化的数据分类与过滤
- 跟踪预训练数据处理相关的学术研究前沿,参与技术方案设计
- 构建数据质量评估体系,持续优化数据清洗效果
任职要求
- 计算机科学、人工智能等相关专业在读研究生
- 有模型微调的实际项目经验,且有论文/产品/开源产出
- 熟练使用Transformers、LLaMA-Factory等深度学习框架
- 发表过数据质量相关论文者优先
- 在Kaggle等平台NLP或大模型相关比赛中获得前10%排名者优先
福利待遇
- 日薪150-250元,薪酬具有竞争力
- 5天/周全勤,实习期3个月
- 参与前沿AI预训练数据研究,与行业顶尖团队合作
- 积累大模型微调与数据处理实战经验
工作地址
北京海淀区搜狐网络大厦9层
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。