人工智能拓展科学发现边界 加速生命科学与多学科研究进程
人工智能正逐步成为科学研究的重要工具。通过处理大规模数据、开展虚拟实验、生成研究假设并辅助验证理论,人工智能正在生命科学、医学、工程和空间探索等多个领域推动科研模式发生变化,为研究人员突破时间、资源和信息处理能力的限制提供新的技术支持。
长期以来,科学发现受到实验周期、研究资源和数据规模等因素制约。随着人工智能技术的发展,科研人员可以利用相关模型完成文献梳理、数据分析、规律识别和实验结果解释,并推动不同学科之间的协同研究。特别是在面对传统方法难以处理的海量复杂数据时,人工智能能够帮助研究人员提高分析效率,发现此前不易识别的关联和模式。

由斯坦福学者布莱恩·希(Brian Hie)共同领导的团队开发了Evo 2,这是一个基于涵盖生命各个领域的遗传数据训练的人工智能模型
斯坦福大学以人为本人工智能研究院的研究人员正在将人工智能应用于物理科学、生命科学、工程及政策研究等领域。其中,人工智能在生物学研究中的应用进展尤为显著。
传统生物学研究高度依赖观察和长期实验,而人工智能能够通过虚拟实验预测基因突变、设计新的遗传序列,并辅助分析疾病发生机制,从而缩短部分研究过程。2025年2月,由斯坦福大学学者Brian Hie参与研发的DNA语言模型Evo 2正式发布。该模型利用覆盖生命各领域的遗传数据进行训练,包括人类在内,被研究团队称为当时规模最大的生物学人工智能模型。
Evo 2由工程学、遗传学和神经生物学等领域的研究人员共同开发,训练数据包含9万亿个碱基对,模型参数规模达到400亿。其运行方式与语言模型类似,但输入内容并非自然语言,而是由DNA碱基字母组成的基因序列片段。
研究人员输入一段基因序列的起始部分后,Evo 2能够继续生成后续序列。模型生成的内容有时可接近自然界中已有生物的遗传序列,也可以提出经过变化或优化的候选序列。科研人员可进一步分析这些突变序列,用于研究基因功能、疾病机制,以及培育适应性更强的农作物等。
Brian Hie表示,Evo 2能够帮助研究人员分析蛋白质生物化学等复杂生命过程,加快基因功能和疾病研究。研究团队已构建开放式生物语言模型、人工智能生成的基因组数据库,并探索由人工智能设计具有生命活性的基因组,为未来按特定功能设计遗传序列奠定基础。
除提高研究效率外,人工智能也在推动学科之间的数据共享与知识融合。不过,相关技术在科研应用中仍面临模型偏差、数据质量、使用门槛和资源分配不均等问题。研究人员认为,需要建立相应的评估和约束机制,确保人工智能模型能够提供可靠的科学价值,并使相关技术成果得到更加广泛和公平的应用。
随着模型能力和科研数据基础不断完善,人工智能有望进一步参与实验设计、理论验证和科学假设生成,成为研究人员探索生命机制、宇宙演化及其他重大科学问题的重要辅助工具。