Evan Fields

本研究流包含两个大方向的项目,旨在切实支持 SecureBio 当前的检测工作。第一个方向研究 AI 生物工具或通用 AI 工具在大规模宏基因组检测中的实际价值,包括算力成本、测序成本、模型类型与规模,以及工作流程各阶段之间的权衡。第二个方向探索将基因组语言模型用作新颖性检测器,例如使用类似困惑度的指标标记异常序列,并评估这一方法能否以合理成本提供灵敏、可解释的补充,配合传统生物信息学系统使用。

Stream overview

我尤其关注两个能够直接支持现有检测工作的项目:

​

  • 梳理将 AI 生物工具(或普通 AI 工具)用于大规模宏基因组检测的成本、可行性和前景。包括我在内的许多人直觉上认为,AI 能为基因组数据分析带来新能力。但 SecureBio 生成的宏基因组数据量极大,例如目前每周会生成约 500 亿对测序读段。即使只对每条读段运行一次中等规模模型的前向传播,成本也可能非常高。据我所知,目前还缺少严谨研究,说明哪些 AI 工具适用于病原体宏基因组检测的哪些类型或阶段。

​

如果能绘制一张“阶段图”,刻画算力成本、测序成本和工具类型等因素之间的权衡,将非常有价值。若还能推测未来变化,或分析这些关系如何随模型规模、模型能力和测序成本变化,则更好。这里的数学主要是算术,但这些计算很有用;它们需要深入理解宏基因组病原体检测的工作方式以及不同 AI 工具的特点。

​

难度更高、价值也更大的研究,是建立一套理论框架,判断通用大语言模型、蛋白质折叠模型、基因组语言模型、多轨生物基础模型等工具,原则上分别最适合用于病原体宏基因组检测流程的哪些环节。

​

  • 许多大流行病监测方案本质上都包含新颖性检测:这个基因组序列是否前所未见,或至少在本地环境中未曾出现?SecureBio 已经建立了几种此类系统,但主要使用传统生物信息学方法。也可以用基因组语言模型检测新颖性,例如基于困惑度的指标:某个序列让模型感到多意外?我们尚未深入探索这种检测方式。

​

我设想的项目会先建立这样的检测系统,再对其进行调整和分析:

  • 系统会标记哪些序列?其中是否存在明显的生物学模式?能否发现新的、意料之外的信息?
  • 系统如何处理其他检测系统标记的读段?能否为其他系统的警报提供佐证?
  • 信噪比如何?怎样提高灵敏度和特异度?
  • 系统的成本效益如何?怎样丰富输入数据,同时尽量不损失灵敏度?

​

这是一项探索性项目:我手头没有精确标注每条读段是否应被标记的数据集。我们要探索的是,这种检测方法能否以及如何补充传统方法,带来实际价值。

​

请注意,等到 MATS 项目开始时,其中一个项目可能已由另一项并行奖学金启动。

Location during program:

Boston

Mentors

Evan Fields
SecureBio
,
Senior research scientist
Biosecurity

Evan is a research scientist at SecureBio Detection, where he works on computational pipelines and detection methods for uncovering threats in deep metagenomic sequencing data. Prior to transitioning his career into biosecurity, he was the VP of data science and engineering at Zoba, a startup providing optimization services to the shared mobility industry. He holds a PhD in operations research and, in his free time, devotes lots of thought cycles to sourdough pizza.

Read more

Fellows we are looking for

必备条件:

  • 对生物安全本身感兴趣,而不只是把它视为 AI 安全的一个分支。
  • 愿意优先开展直接实践工作,即使项目可能最终没有可发表的研究成果。
  • 有兴趣并有能力负责一项自主度较高的探索性项目,兼任产品经理和研究员的角色。
  • 能够以定量、可解释的方式思考 AI 生物模型:不仅关注模型做什么,也要研究它如何运作,以及这对生物监测中的实际用途意味着什么。
  • 能够使用自己熟悉的编程语言编写、评估、调整和调试 AI 工作流程,也就是围绕模型运行的整体流程。

​

优先条件:

  • 有生物安全、公共卫生、生物监测、宏基因组学、病毒学、污水流行病学、核酸测序、基因组语言模型或蛋白质语言模型等相关经验。
  • 能够微调基因组语言模型,或训练模型输出头。
  • 有处理海量数据(生物或其他数据)的经验,熟悉流式算法、减少数据传输成本和提升工作流程效率等问题。

​

不太适合的情况:

  • 最感兴趣的是可解释性研究或发表论文。

Project selection

我会根据 SecureBio Detection 的需求以及与我匹配的研究员情况,决定开展两个大方向中的哪一个。在选定方向内,我会根据自己认为对 SecureBio Detection 有帮助、有趣且相关的内容提供指导;研究员则有自主权,也需要主动负责具体工作方向的选择。