科学研究正面临一个根本性矛盾:不同学科的数据格式、量级和处理方式天差地别,但自然界本身的运作规律却是统一的。蛋白质的折叠规则、分子的相互作用、气候系统的演化,这些看似分属不同学科的规律,在底层可能共享着某种统一的数学结构。能否用一套AI模型同时理解这些跨领域的科学语言?上海科学智能研究院在2026年WAIC上给出的答案是"神珍"。
7月中旬,上智院在WAIC期间正式发布了"神珍"科学多模态基础模型。这款模型总参数约110亿,面向DNA、RNA、蛋白质、小分子、地球系统和医学影像六类科学数据,在一个统一模型中同时支持科学理解与多类结果生成。复旦大学特聘教授、上智院院长漆远表示,该模型阶段性实现了跨领域科学知识的统一表征与多模态融合理解,是AI4S基础设施建设的重要一步。
传统科学AI模型大多是"单打独斗"式的:一个模型只做蛋白质结构预测,另一个模型只做分子动力学模拟,第三个模型只做气象预报。这种做法的好处是专业性强,但坏处也很明显,每个模型都只能看到世界的极小切片,无法捕捉不同科学层级之间的关联信号。
"神珍"的设计哲学恰好相反。它试图在一个统一的Transformer架构中,同时学习六类科学数据的表征。这六类数据覆盖了从微观到宏观的不同层级:DNA和RNA是生命信息的编码层,蛋白质是生命功能的执行层,小分子是药物作用的基本单元,地球系统则是宏观环境的总和。医学影像则充当了从基础科学到临床应用的桥梁。
在技术实现上,"神珍"采用多模态对齐训练策略,让模型在不同类型的科学数据之间建立语义映射。例如,模型在学习蛋白质序列的同时,也在学习这段序列对应的DNA编码区域、可能相互作用的小分子,以及在医学影像中的潜在表达模式。这种跨模态对齐使得模型能够在一个统一的语义空间中理解科学问题,而非将不同学科的数据割裂对待。
上智院团队透露,在多项基准测试中,"神珍"展现出超越单一领域模型的理解能力,特别是在需要跨学科知识融会贯通的复杂科学问题上表现突出。例如,给定一个疾病的临床描述,模型不仅能够从医学影像层面给出诊断建议,还能追溯到底层的蛋白质和分子机制,并提供可能的治疗靶点参考。这种"端到端"的跨学科推理能力,是传统单领域模型难以实现的。
"神珍"的发布恰逢AI4S赛道从概念炒作走向务实落地的关键转折点。过去几年,AI在科学研究中的应用更多停留在辅助层面:用AI加速计算、辅助分析实验数据、帮助筛选候选分子。但真正的科学发现需要的是"自主假设"的能力,不是在已有的数据中寻找模式,而是提出全新的科学假说并设计实验验证。
漆远在WAIC演讲中提出了一个犀利的观点:"AI要从'预测'下一个Token走向'发现'未知的规律,而AI发现未知的科学规律将是超级智能的开始。"他认为,这一进程的核心在于通过从高维空间中压缩和发现简洁的机理,以及构建科学验证的高效闭环。真实的科研是包含了文献调研、假设提出、数据采集、模型构建、仿真验证、实验反馈的漫长链条,AI4S必须发展出能够组织复杂研究流程的系统能力。
"神珍"的跨模态统一表征能力,正是朝着这个方向迈出的重要一步。当模型能够同时理解DNA序列、蛋白质结构和疾病影像,它就具备了提出跨学科假说的可能。例如,模型可以自动发现某种基因突变在不同蛋白质结构中的共性模式,进而推测它与特定疾病的关联,并建议验证实验的设计方案。这种从数据中自主发现规律的能力,正是AI4S从"辅助计算"走向"自主发现"的核心跃迁。
值得注意的是,"神珍"的定位不仅仅是一个模型,而是一个平台级的基础设施。上智院同步开放了模型的API和基础工具链,支持科研机构和企业在此基础上进行定制化开发和垂直领域微调。这种开放策略与通用大模型领域的开源趋势如出一辙,但在科学计算领域显得尤为关键。
漆远分析指出,AI4S面临的最大挑战并非模型能力不足,而是高质量端到端数据的严重匮乏。不同于通用大模型可以从互联网获取海量训练数据,科学智能所依赖的训练数据多来自一线的科研实验与生产实践,获取难度大、整合成本高。上智院通过构建"神珍"这样的统一基础模型,正在努力降低单个科研团队在AI4S领域"从零开始"的门槛,让更多研究机构能够站在统一的科学AI底座上进行创新。
从应用成果来看,上智院的策略已经初见成效。基于"神珍"模型,上智院联合多家科研机构在药物靶点发现、蛋白质设计、气象预测等方向取得了显著进展。后续版本还将进一步提升模型参数规模和多模态对齐精度,并计划开放模型权重供学术研究使用。
如果从更宏观的视角来看待"神珍",它的意义或许超越了技术本身。当一个模型能够同时理解DNA序列的编码逻辑、蛋白质的折叠方式和疾病的影像特征时,它实际上在构建一个跨学科的知识图谱。这种能力将极大地加速那些需要多学科协同攻关的科研项目,例如新发传染病的快速诊断与药物设计。正如上智院所规划的,开源开放后的"神珍"有望为中国科研领域提供一个普惠的科学AI基础设施,让更多的研究团队无需从零开始搭建科学AI系统,而是站在统一底座上加速科学发现的进程。