返回岗位列表

阶跃星辰

多模态大模型算法实习生-泛OCR方向

地点:北京 薪资:400-500元/天 日期:2026-05-22

岗位摘要

跟踪学术界与工业界最新发布的文档解析、图表理解(Chart、diagram等)、STEM相关图像理解等工作,定期进行总结分享;深入理解OCR评估体系(如NED、CDM、TEDS等指标),参与评测基准的构建与维护,设计更贴近用户体感的OCR评测方案

岗位职责

  • 跟踪学术界与工业界最新发布的文档解析、图表理解(Chart、diagram等)、STEM相关图像理解等工作,定期进行总结分享
  • 深入理解OCR评估体系(如NED、CDM、TEDS等指标),参与评测基准的构建与维护,设计更贴近用户体感的OCR评测方案
  • 调研并分析经典文档图像/图表合成方法,参与设计与开发高效的数据合成pipeline,覆盖各泛OCR子任务
  • 调研基于LaTeX/HTML/Markdown的文档页渲染方法,参与搭建并优化相关pipeline与工程实现
  • 探索适合泛OCR任务的数据增强技术,包括几何变换、噪声注入等,并在实际数据上应用
  • 探索并设计/优化适合OCR任务的VLM训练算法/模型结构
  • 探索搭建泛OCR领域的数据飞轮,寻求数据-模型协同进化的训练策略

任职要求

  • 研究生在读,计算机/人工智能/模式识别相关专业优先
  • 熟练掌握Python编程,熟悉OpenCV、PIL等图像处理库
  • 熟练掌握Pytorch等深度学习训练框架,同时熟练掌握Transformer/Megatron等大模型训练框架
  • 深入理解多模态大模型(VLM)基础原理,对泛OCR相关任务有一定基础认知
  • 具备文档图像处理经验,了解传统文本检测(DB、EAST等)、传统文本识别(CTC等)、表格识别等经典OCR方法者优先
  • 熟悉最新OCR相关工作(如DeepSeekOCR2、MinerU2.5、PaddleOCR-VL等)者优先
  • 具备泛OCR数据合成、LaTeX/HTML/Markdown渲染工程经验者优先
  • 具备利用大模型工具快速学习新技术的能力,能独立阅读前沿论文并获取关键insight
  • 有大规模数据处理、分布式训练经验者优先
  • 良好的沟通能力和团队合作精神,能够与算法、工程团队密切协作

福利待遇

  • 日薪400-500元,具有竞争力的实习薪酬
  • 参与前沿多模态大模型研究,积累丰富的技术经验
  • 与专业的算法、工程团队协作,提供良好的学习成长环境
  • 实习周期6个月以上,保障项目的连续性与深度研究机会

工作地址

北京海淀区大恒科技大厦12F