把不同物种的基因组想成同一部古籍流传下来的多个版本:如果某个字经过漫长年代仍几乎没变,它很可能不能随便改。GPN-Star正是沿着这条思路,判断人类DNA中的哪些变异值得警惕。它不只把DNA当作文本,还直接纳入多序列比对——把不同物种源自共同祖先的位置排在一起——以及系统发育树,也就是物种之间的亲缘和进化距离。
这个设计值得注意,因为以往套用自然语言处理架构的基因组语言模型,即使体量很大,在一些任务上仍不如经典进化模型。作者称,GPN-Star在人体编码区与非编码区的多类变异影响预测中达到当前最佳表现,并更善于筛选致病变异、全基因组关联研究锁定的候选变异,也提升了罕见变异关联检验的能力。一个有意思的细节是:更近或更久远的进化历史并非谁始终更好,优势取决于具体任务。团队还把框架扩展到小鼠、鸡、果蝇、线虫和拟南芥,显示这条路线不只适用于人类;不过上述效果均来自论文作者报告。