生物信息学计算数据专家
岗位摘要
负责主流生信工作流(Snakemake、Nextflow、WDL、CWL等)的拆解与结构化沉淀,提炼包含分析模式、工具选型、参数空间和失败模式的训练素材;基于公开组学数据(TCGA、GEO、UK Biobank、ENCODE、CELLxGENE、HCA等)及顶刊论文,构建从自然语言研究问题到可执行…
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责主流生信工作流(Snakemake、Nextflow、WDL、CWL等)的拆解与结构化沉淀,提炼包含分析模式、工具选型、参数空间和失败模式的训练素材
- 基于公开组学数据(TCGA、GEO、UK Biobank、ENCODE、CELLxGENE、HCA等)及顶刊论文,构建从自然语言研究问题到可执行分析脚本的端到端映射语料
- 针对bulk/单细胞RNA-seq、WGS/WES、ChIP/ATAC-seq、空间组学、蛋白组、宏基因组等场景,构建含完整推理链(假设→质控→流程→解读→二次分析)的训练数据
- 设计多维度评估基准,对标BixBench、GenoTEX、BioCoder、LAB-Bench等现有方案,覆盖流程正确性、工具选型合理性、参数调优水平及生物学结论可信度
- 与算法团队按迭代节奏协同,跟踪模型版本的效果变化,持续优化数据质量
- 将阶段性成果沉淀为论文、开源数据集或benchmark报告
任职要求
- 计算生物学、生物信息学、计算机、统计学或相关专业硕士及以上学历
- 具备2至3年生信实战经验,有完整的项目交付经历(学术或工业均可)
- 熟练掌握至少一种工作流框架(Snakemake/Nextflow/WDL/CWL等),熟悉NGS数据处理全链路(QC→比对→定量/calling→下游统计分析)
- 熟练使用Python或R,具备良好工程习惯(版本管理、容器化、单元测试)
- 具备扎实的分子生物学与遗传学知识,能够独立判断分析结果的生物学合理性
- 具备良好的中英文文献阅读与技术写作能力
加分项
- 有领域顶刊一作论文,或 nf
- core、Bioconductor、Galaxy 等社区贡献经历
- 具备临床生信、药物发现、靶点发现、CRISPR 筛选等转化医学经验
- 有多组学整合(mWAS、eQTL、单细胞多组学等)实战经验
- 熟悉 LLM 训练数据构建、Prompt Engineering、RAG 或 Agent
- 有 HPC 或 AWS/GCP 大规模并行计算经验
- 曾构建并公开发布领域 benchmark 或数据集
- 阚先生 3日内活跃
福利待遇
- 有竞争力的薪酬待遇(30-60K·16薪)
- 参与前沿多模态大模型在计算生物学领域的应用与创新
- 有机会将阶段性成果沉淀为论文、开源数据集或benchmark报告
工作地址
北京海淀区蓟门壹号8楼
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。