近日,由中国科学院人工智能研究所联合多家科研机构自主研发的通用科学AI模型“神珍”正式向社会开放使用。这一模型被业界称为“科学领域的多面手”,能够同时处理蛋白质结构预测、天气模拟、材料性质分析、基因组解读、化学反应路径推演以及天文数据分类六大类科学信息。这标志着我国在科学智能(AI for Science)领域迈出了关键一步,也为全球科研工作者提供了全新的数字化工具。
不只是一个模型:从“单一任务”到“多科学通才”
长期以来,人工智能在科学领域的应用多聚焦于单一任务,例如专门用于蛋白质结构预测的AlphaFold,或仅用于气象预报的AI系统。这些模型虽性能卓越,但彼此割裂,不同学科之间数据难以互通。“神珍”模型的突破在于其拥有一个统一的多模态学习框架,能够理解并生成蛋白质序列、气象格点数据、晶体结构、基因序列、分子图以及天体光谱等多种格式的科学数据。
“神珍”项目负责人、中科院人工智能研究所李正阳研究员在发布会上表示:“我们的目标不仅仅是做一个更强大的模型,而是构建一个可以跨学科协作的‘科学底座’。科学家不再需要为每一个问题单独训练模型,而是可以直接用‘神珍’进行查询、模拟和预测。”
六大能力详解:从微观蛋白到宏观天气
根据官方介绍,“神珍”模型的核心能力覆盖六类科学信息:
- 蛋白质结构预测:该模型能够在数秒内从氨基酸序列预测出蛋白质的三维结构,精度与AlphaFold2持平,但在某些特定蛋白质家族上表现出更好的泛化能力。
- 天气与气候模拟:基于全球气象再分析数据训练的模块,“神珍”可以生成未来15天的高分辨率天气预报,并支持气候模式下的长期情景推演。
- 材料性质分析:针对已知或虚拟的晶体结构,模型能预测其电子带隙、机械强度、热导率等关键物理化学性质,有助于加速新材料的筛选。
- 基因组解读:模型具备对DNA序列的语义理解能力,可识别基因编码区域、调控元件,并预测基因变异可能导致的表型效应。
- 化学反应路径推演:用户输入反应物与条件,“神珍”可自动生成可能的中间产物、过渡态及最终产物,辅助有机合成路线设计。
- 天文数据分类:模型经过天文巡天项目数据训练,能够自动识别恒星、星系、类星体等天体光谱特征,并估算红移等参数。
“这六大功能并非简单拼凑,而是共享一个底层表示空间。例如,模型在处理蛋白质结构时学到的一些序列模式,能够帮助它更好地理解基因调控序列。”李正阳补充道。
开放共享:降低科研门槛,加速交叉创新
“神珍”模型的开放方式也备受关注。研究团队已将其核心模型权重、API接口以及部分微调工具开源,并在国内主要云计算平台上线了“神珍”服务。普通科研人员只需要通过网页或简单的Python代码即可调用,无需自行搭建复杂的算力环境。
“过去我们想做跨学科研究,比如用蛋白质知识来启示材料设计,往往需要两个不同领域的团队耗费数月对接。现在‘神珍’或许能帮我们快速找到跨领域的相似性。”北京大学生命科学学院教授陈晓宇评论称。
此外,团队还注意到模型可能存在“幻觉”问题——即对超出训练集范围的科学信息给出看似合理但实际错误的输出。为此,“神珍”在输出结果时会附带置信度评分,并提示用户哪些部分需要进一步实验验证。
前景:科学发现的新引擎
业内分析认为,“神珍”模型的开放将有力推动“AI-driven discovery”的普及。在药物研发、新能源材料开发、极端天气预报等应用场景中,它可以大幅缩短前期计算和筛选的时间。不过,也有专家提醒,模型的可靠性仍需在更多基准测试中接受检验,尤其是在涉及安全或高风险的决策场景中。
李正阳表示,下一步团队计划开放“神珍”的插件生态,允许科研人员上传自定义数据集进行微调,并计划在明年发布支持更广泛科学领域的“神珍-2”。
随着“神珍”的全面开放,中国乃至世界的科学研究正在迎来一位全新的“数字助手”——它不眠不休,跨越学科,只为让科学发现的脚步更快一些。