生物信息学计算数据专家(AI训练方向)

MiniMax

北京 / 上海全职MiniMax社会招聘社招

岗位职责

【岗位背景】 MiniMax 自研多模态大模型,产品已覆盖 200+ 个国家和地区。 当前团队正在将大模型能力拓展至计算生物学与生物信息分析方向。该方向既是科研人员的高频刚需场景,也天然适合检验模型的工具调用、长链路代码生成与推理能力。 因此,我们需要有扎实生信实战经验的同事,参与构建高质量的训练数据与评估体系。 【岗位职责】 负责主流生信工作流(Snakemake、Nextflow、WDL、CWL 等)的拆解与结构化沉淀,提炼包含“分析模式—工具选型—参数空间—失败模式”的训练素材。 基于公开组学数据(TCGA、GEO、UK Biobank、ENCODE、CELLxGENE、HCA 等)及顶刊论文,构建从自然语言研究问题到可执行分析脚本的端到端映射语料。 针对 bulk / 单细胞 RNA-seq、WGS/WES、ChIP/ATAC-seq、空间组学、蛋白组、宏基因组等场景,构建含完整推理链(假设 → 质控 → 流程 → 解读 → 二次分析)的训练数据,必要时引入 GO、KEGG、HPO、Reactome 等本体进行知识对齐。 设计多维度评估基准,对标 BixBench、GenoTEX、BioCoder、LAB-Bench 等现有方案,覆盖流程正确性、工具选型合理性、参数调优水平及生物学结论可信度。评估方式可包含自动化指标与专家盲评。 与算法团队按迭代节奏协同,跟踪模型版本的效果变化,持续优化数据质量;团队鼓励将阶段性成果沉淀为论文、开源数据集或 benchmark 报告。

任职要求

【任职要求】 学历:计算生物学、生物信息学、计算机、统计学或相关专业硕士及以上。 经验:具备 2~3 年生信实战经验,有完整的项目交付经历(学术或工业均可)。 工具链:熟练掌握至少一种工作流框架(Snakemake / Nextflow / WDL / CWL 等),熟悉 NGS 数据处理全链路(QC → 比对 → 定量 / calling → 下游统计分析)。具体方向不限(基因组变异、转录组差异表达、单细胞、表观、蛋白等)。 编程能力:熟练使用 Python 或 R,具备良好工程习惯(版本管理、容器化、单元测试)。 生物学基础:扎实的分子生物学与遗传学知识,能够独立判断分析结果的生物学合理性。 语言能力:良好的中英文文献阅读与技术写作能力。 【加分项(满足任意一项即可重点关注)】 有领域顶刊一作论文,或 nf-core、Bioconductor、Galaxy 等社区贡献经历。 具备临床生信、药物发现、靶点发现、CRISPR 筛选等转化医学经验。 有多组学整合(mWAS、eQTL、单细胞多组学等)实战经验。 熟悉 LLM 训练数据构建、Prompt Engineering、RAG 或 Agent。 有 HPC 或 AWS/GCP 大规模并行计算经验。 曾构建并公开发布领域 benchmark 或数据集。
岗位信息来源于公开招聘渠道,仅作信息聚合展示。收录于 2026/7/23岗位编号 minimax_social-7627073781622065417