多模态大模型算法实习生-OCR方向
岗位摘要
跟踪学术界与工业界OCR、文档理解、图表解析等领域最新进展,定期进行总结分享;深入理解OCR评估体系(NED、CDM、TEDS等指标),参与评测基准构建与维护;设计更贴近用户体感的OCR评测方案
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 跟踪学术界与工业界OCR、文档理解、图表解析等领域最新进展,定期进行总结分享
- 深入理解OCR评估体系(NED、CDM、TEDS等指标),参与评测基准构建与维护
- 设计更贴近用户体感的OCR评测方案
- 调研经典文档图像合成方法(如SynthDoG),参与设计高效的数据合成pipeline
- 调研基于LaTeX/HTML/Markdown的文档页渲染方法,搭建并优化相关pipeline
- 探索适合OCR任务的数据增强技术并在实际数据上应用
- 探索并设计适合OCR任务的VLM训练算法与模型结构
- 探索并搭建OCR领域的数据飞轮,寻求数据-模型协同进化的训练策略
任职要求
- 研究生在读,计算机/人工智能/模式识别相关专业优先
- 熟练掌握Python编程,熟悉OpenCV、PIL等图像处理库
- 熟练掌握PyTorch等深度学习训练框架,同时熟练掌握Transformer/Megatron等大模型训练框架
- 深入理解多模态大模型(VLM)基础原理,对OCR相关任务有一定基础认知
- 具备利用大模型工具快速学习新技术的能力,能独立阅读前沿论文并获取关键insight
- 良好的沟通能力和团队合作精神,能够与算法、工程团队密切协作
- 具备文档图像处理经验,了解传统文本检测(DB、EAST等)、传统文本识别(CTC等)、表格识别等经典OCR方法者优先
- 熟悉最新OCR相关工作(DeepSeekOCR2、MinerU2.5、PaddleOCR-VL等)者优先
- 有OCR数据合成、LaTeX/HTML/Markdown渲染工程经验者优先
- 有大规模数据处理、分布式训练经验者优先
福利待遇
- 实习薪资400-410元/天
- 线下办公,工作地点位于北京市海淀区核心科技区域
工作地址
北京海淀区大恒科技大厦南座9层
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。