前不久,位于怀柔科学城的北京高端科学仪器与传感器产业集聚区,又迎来一位新“住户”——物科数智。正如企业名称所呈现的,他们展开的探索,是要借助大模型的强大脑力,为“电子实验室”打造智能数据底座。 目前,团队已经开始接触集聚区内科学仪器、新材料等领域的“邻居”企业,探索“AI+科学仪器”的新赛道。
一台平板电脑,替代了实验室原本的手工记录方式(刘苏雅 摄)
在中国科学院物理研究所材料基因组研究平台,实验室内的几十台生长炉正在同时工作。“‘烧炉子’,是做材料研究必不可少的一环,科研人员需要利用这些生长炉获取特定的实验材料样品,再开展后续实验。”作为长期从事计算材料科学研究的科研人员,中国科学院物理研究所特聘研究员吴泉生不仅关注材料的计算模拟和性质预测,也关注相关环节产生的科研数据如何有效汇聚、管理、利用。
长期以来,科研人员的实验工作,是与实验记录本为伴的。然而,手写记录的实验数据往往难查找、难溯源。现在,一台平板电脑,让厚厚的一摞实验记录本“下岗”了。
“自从这套系统接入,我再也没有手写过实验记录。”中国科学院物理研究所博士生邓修同熟练地操作电子实验室系统,仪器采集的数据能实时上传、收集,系统还能调用大模型,快速完成实验配比计算、数据分析等工作,智能预判复杂材料的性能,极大缩短相关研究周期。
不过,要让来自不同研究领域、不同类型仪器的数据,自动汇集到这套系统中,就必须统一“度量衡”。为此,吴泉生和团队一起探索了多年。“哪怕是同一种仪器,不同厂家的数据接口、适配软件、通讯方式都不同,更不用说实验中需要用到的功能各异的科学仪器了。”吴泉生想让数据采集实现自动化,就只能下“笨功夫”。团队设计了中位机作为“数据中介”,将材料基因组研究平台上正在使用的所有科学仪器接口一一打通,实现科研数据自动抓取,并实时传输到数据中心。
经过7年的积累,数据中心已经积淀了万亿字节量级的凝聚态物理实验数据。其中不仅有科研团队产出重要成果所依托的正向数据,还包括大量的“失败”数据。“材料科学的研究,尝试几百上千种材料是常事,但其中有效的材料或许只有几种。这些效果不佳的实验数据,在项目完成后,往往就再也无人问津。”吴泉生表示,数据中心对此“照单全收”,以大量数据作为分析基础,大模型的脑力能更好地发挥,“当数据积累到一定程度,大模型或许就能从中总结出新思路,取得新的研究突破。”
经过前期的积累,吴泉生和团队正在探索打造科学仪器数据自动化采集的通用标准。“结合现在国产科学仪器的蓬勃发展态势,我们希望能在底层逻辑上形成一套数据标准,帮助国产仪器从源头避免数据壁垒的出现。”吴泉生说,数据是科学智能发展的底座,打破数据壁垒,科学大模型就有了灵活的手和眼,可以借助各类科学仪器感知物理世界。
目前,北京高端科学仪器与传感器产业集聚区已经汇聚电镜、质谱、智能传感等重点领域的重点企业350余家,并正在构建融合创新体系。北京怀柔仪器和传感器有限公司相关负责人表示,这一智能数据底座的建立,不仅打破了仪器间的数据壁垒,更为集聚区内企业提供了通用的技术范式,将有力推动“AI+科学仪器”的深度融合,加速整个产业向智能化、协同化方向升级。
来源:北京日报客户端
记者:刘苏雅