【岗位职责】
1. 核心研发: 负责多模态大模型的核心研发,面向医疗场景(医学影像/临床文本/结构化数据等)构建可用、可靠的多模态理解与生成能力。
2. 底层机制研发: 围绕医疗场景的关键痛点做底层机制级研发:从表征学习、跨模态对齐、注意力与信息路由、训练目标与优化稳定性等模型底层出发,提出并验证新方法/新模块/新训练范式,而不是照搬现有通用 VLM。
3. 医学影像攻坚: 针对医学影像在 VLM 中的典型难点进行系统性攻关
4. 训练与对齐流程: 设计并落地高质量训练与对齐流程:多阶段训练(预训练/对齐/指令微调等)、数据混配与采样策略、损失函数与约束设计、训练稳定性与可复现训练管线建设。
5. 临床评测体系: 搭建面向临床可靠性的评测体系:多模态能力分解评测(定位、属性、推理、报告一致性)、泛化评测(外部验证/OOD)、安全性评测(幻觉、误导性回答、置信度/不确定性表达)。
6. 业务协同: 与产品/医学专家/数据团队协作,将研究目标映射到真实业务任务(如报告辅助、质控、分诊、随访、结构化抽取等),推动从研究验证到应用验证的闭环。
【任职要求】
1. 硕士及以上学历(计算机/人工智能/数学相关方向)。
2. 丰富的 VLM 研发经验: 深度参与过至少一个 VLM/多模态大模型的完整训练与迭代(架构、对齐、训练策略、评测);能够独立完成从问题定义→方案设计→实验验证→迭代收敛的闭环。
3. 扎实的理论与工程能力: 熟练 PyTorch,理解 Transformer/注意力机制、对比学习与对齐学习、生成式建模、优化与泛化。
4. *性原理思维: 能够从底层分析并解释 VLM 在医疗场景失效的根因(信息瓶颈、对齐噪声、数据偏差等),并提出机制级改造方案。
5. 严谨的实验习惯: 能设计有效对照与消融、识别数据泄漏与评测偏差;具备良好的论文复现与阅读能力。
6. 良好的沟通协作能力。(加分项):顶会/期刊论文发表;有多模态安全、幻觉抑制等方向研究积累。