AI for science需要推理,不仅仅是数据

AI导读

Every few decades, someone announces that science has reached its end. In 1903, the revered physicist Albert Michelson wrote that the “facts of physical science have all been discovered.” In the 1980s, Stephen Hawking predicted that theoretical physics might be finished by the end of the century. Wi...

AI Prism 智棱 - AI政策 分类封面图
每隔几十年,就有人宣布科学已经终结。1903年,受人尊敬的物理学家阿尔伯特·迈克尔逊写道,"物理科学的事实都已被发现。"20世纪80年代,斯蒂芬·霍金预测理论物理学可能在本世纪末完成。随着人工智能 explosive arrival,这种感觉再次弥漫在空气中——这一次伴随着诺贝尔奖。 2024年,谷歌DeepMind的德米斯·哈萨比斯和约翰·朱珀因神经网络AlphaFold获得了诺贝尔化学奖的一部分——该网络通过学习数千个实验测量的形状来预测蛋白质的三维结构。这个棘手的问题抵抗了半个世纪的系统性攻击;AlphaFold似乎一劳永逸地解决了它,世界 became fixated on 其方法的 promise。哈萨比斯和他的团队称AlphaFold为"AI如何将所有科学加速到数字速度的模板。"一波为生物学、化学和材料发现构建基础模型的初创公司筹集了数十亿美元,受到DeepMind成功的鼓舞。AlphaFold已经表明,AI与 sufficient 数据的结合可以做出突破性发现(即使我们不理解 underlying 机制),而且似乎 once again,科学其余部分的道路 laid out 在我们面前。 可以肯定的是,AI将给科学带来 extraordinary 变化,但越来越清楚的是,AlphaFold和类似的东西可能不是这种 metamorphosis 的最佳模板。尽管它是一项 profound 成就,但产生AlphaFold的条件是罕见的,在其他领域满足这些条件所需的时间将 measured in decades,而不是 years。相反,科学的加速将由于另一种方法而到来:AI智能体。 AlphaFold成功的主要条件是蛋白质数据库的存在——一个约17万个实验验证的蛋白质结构数据集,DeepMind团队可以在其上训练模型。蛋白质数据库的创建并不简单:它花了53年的国际合作,据最近估计,约210亿美元的实验工作来 assembly。那种规模的努力 notoriously 难以资助,几乎不可能协调,执行起来极其耗时;它们 often 因此 unsuccessful。 但即使在具有必要凝聚力和资源、相关数据不因商业 ownership 而 inaccessible 的领域,另一个障碍讨论 too little:生成 comparable 数据的科学 impossibility。在蛋白质结构的情况下,关键的实验技术——蛋白质晶体学——是一种 unusually 可复制和可靠的工具,以至于超过25个诺贝尔奖依赖于它。但在大多数实验科学中,结果 more often than not 变化。细胞系 drift。化学品有 trace contaminants。实验室湿度变化。创建 measured 数据集——足够一致、足够准确、足够精确、足够 scalable 以训练生物学或大多数化学中的现代神经网络——需要新的测量和新的标准化方法—— none of which 将很快 ready。 当然,有少数领域满足这些要求:天气预报、大部分基因组学、非常有限的化学领域。如果 hasn't already,这些领域可能 soon 看到AlphaFold式的突破。政府对这些数据集生产和协调的支持 will be critical,正如美国新兴生物技术国家安全委员会所 argue 的那样。但对于科学中的大多数开放问题,至少在短期内,我们将需要不同的计划。幸运的是,一些更安静、更 modest 的东西已经开始 showing promise。 科学家一直在不确定中推理。致力于识别新药物靶点的生物学家从未拥有 perfect 数据集。相反,他们结合 docking 计算和已知结构,考虑分子动力学,运行少量 binding assays,并使用他们的判断根据每种方法 particular strengths 和失败点来 weighing 它们。科学的技能不在于任何单一工具;而在于综合许多工具产生的东西,并随着证据 comes in 修订结果。这是大多数实际研究 actually proceeds 的方式。但直到 very 最近,没有软件可以做到。 智能体现在可以。简单来说,智能体是一个被赋予了工具——数字或物理——以及使用它们能力的AI推理引擎。在过去的几年里,AI的一个 fundamental 架构转变 enabled 了这些程序的 rapid proliferation,它们由大型语言模型驱动, dramatically 减少了对科学 specialized 数据集的需求。对于科学来说,这一技术进步代表了一个 foundational 变化:它允许我们创建可以模拟实际研究的迭代、高度 contingent 过程的数字工具。虽然AlphaFold等工具对有限的问题应用强大的方法,但智能体 inherently 是通才。它们不代表做科学的新方式——而是 digitally 模拟人类发现过程。 以谷歌5月宣布的AI共同科学家为例。研究人员给了它一页简介和一个目标:弄清楚抗生素耐药性如何在细菌物种之间传播——耐药感染的关键驱动因素。系统 spin up 了子智能体。一个从文献中 drafted 假设。另一个像同行评审员一样 picking them apart。第三个运行锦标赛来 rank 最强的候选人。第四个 refined 获胜假设。智能体得出结论:耐药基因 hitching rides on 细菌病毒, borrowing whichever virus could ferry 它们 into 新宿主。这个假设是正确的。伦敦帝国理工学院的研究人员花了十年时间通过 painstaking 湿实验室工作得出了相同的结论;他们的论文 previously 未被共同科学家 seen,仍在同行评审中。 像共同科学家这样的智能体仍然是新颖的工具,在它们成为科学过程 ubiquitous 部分之前还有真正的挑战需要克服:它们仍然 liable to 产生幻觉,它们的判断不一致,它们有记忆和输入约束限制了它们可以自主运行的时间。但这些技术障碍 will fall away,随着它们 falls away,我们将开始注意到科学智能体对科学 done 的可靠性、一致性和速度的复合效应。 也许最 notably,智能体为科学的"可重复性危机"提供了一个 structural 修复——研究人员无法复制彼此 results 的 widespread 问题。几十年来,科学界一直 begged 研究人员共享他们的原始数据和 exact 代码,以努力标准化实验过程。但研究人员长期以来 resisted 这种 tedious 行政工作,这些工作发生在有趣的科学 already done 之后。相比之下,智能体自动记录它们采取的每一个动作,创建导致其结果的方法的 exact 记录,并允许 precise 复制。 第二个后果将是科学记忆的放大。研究人员之间的知识转移是一个 notoriously murky 过程;如果不是通过 years of 培训和观察完成,研究生就被迫 pore through 数十年 predecessors kept 的 messy 实验室笔记本,寻找将 make or break 他们方案的细节。随着智能体成为科学过程 increasingly 大的部分,一个实验室的整个科学历史将被记录在一个 central、标准化的机构知识库中。 但智能体最重要的影响将是速度。在任何领域,当测试一个想法所需的时间少于在会议中争论它的时间时,人们停止辩论, just run 测试。一个可以在一小时内阅读一千篇论文、设计500个分子、并在早上从 failed tests 中学习的智能体将降低实验成本,并 fundamentally 改变科学完成的速度。它还将 give 研究人员自由去追逐大胆、奇怪的问题——他们 otherwise 永远不会冒险花时间在上面—— opening 我们尚未想象的科学之门。 虽然AlphaFold模板 certainly 将是 incredible 发现的关键,但它 alone 不会将我们带到科学的终点。相反,向智能体AI的转变代表了一个 much rarer 层级的突破:一个同时 envelops 每个科学领域的工具。历史上,如此 scope 的工具只 arrived 少数几次:微积分、统计推断、光谱学、计算机。每一个都揭示了没人想到要 formulate 的问题世界,而那些问题反过来重新定义了它们的领域。有了智能体, another such transformation upon us。 埃里克·施密特于2001年至2011年担任谷歌CEO。2024年,他与妻子温迪共同创立了施密特科学——一个资助科学与技术中非常规探索领域的慈善 venture。 苏哈斯·梅什领导施密特科学AI中心的AI for science 工作。他是材料发现AI方面的专家。 埃里克·施密特办公室副associate兼科学负责人玛雅·莱文 additional 研究。

内容声明

本文内容基于公开市场信息与媒体报道进行整理,部分观点来自社区讨论。如涉及事实性问题,欢迎通过 xurj005@163.com 与我们指正,我们将及时核实并更新。