MIT团队运用机器学习闭环自主分子发现平台,成功发现、合成和描述了303种新分子
编辑 | X
传统意义上,发现所需特性的分子过程一直是由手动实验、化学家的直觉以及对机制和第一原理的理解推动的。
随着化学家越来越多地使用自动化设备和预测合成算法,自主研究设备越来越接近实现。
近日,来自 MIT 的研究人员开发了由集成机器学习工具驱动的闭环自主分子发现平台,以加速具有所需特性的分子的设计。无需手动实验即可探索化学空间并利用已知的化学结构。
在两个案例研究中,该平台尝试了 3000 多个反应,其中 1000 多个产生了预测的反应产物,提出、合成并表征了 303 种未报道的染料样分子。
该研究以《Autonomous, multiproperty-driven molecular discovery: From predictions to measurements and back》为题,于 2023 年 12 月 22 日发布在《Science》上。
论文链接:https://www.science.org/doi/10.1126/science.adi1407
发现具有所需功能特性的小分子对于健康、能源和可持续发展的进步至关重要。该过程通常是通过缓慢、费力、迭代的设计-制造-测试-分析 (DMTA) 循环进行的。
新兴的机器学习 (ML) 工具可以生成新的候选分子,预测其特性,并通过计算机辅助合成规划 (CASP) 提出反应途径。化学自动化的进步可以在手动设置后以最少的人为干预实现化学合成和表征。
将 ML 生成算法、ML 属性预测、CASP、机器人技术和自动化化学合成、纯化和表征集成到 DMTA 工作流程中,可以开发自主化学发现平台,该平台能够在不同的化学空间中运行,而无需手动重新配置。理想的以属性为中心的发现平台将提出并合成分子,以丰富机器学习生成和属性模型,并最终发现性能最佳的分子。实际上,有必要排除可用自动化硬件无法安全执行的反应。
为了实现自主发现,来自 MIT 的研究团队展示了一个集成的 DMTA 循环,该循环迭代地提出、实现和表征分子,仅在预测工具的指导下探索化学空间。
图补全(graph-completion)生成模型设计候选分子,并使用 ML 模型针对这三个属性中的每一个进行评估。CASP 工具提出了多步合成配方,由自动液体处理机、批量反应器、高性能液相色谱 (HPLC) 和机械臂执行。Plate reader 测量吸收光谱,校准的 HPLC 保留时间提供水-辛醇分配系数,模拟太阳光源与 plate reader 结合量化光氧化降解。测得的分子特性会自动反馈以重新训练特性预测模型,从而完成自动化 DMTA 循环的一个步骤。
研究人员在小分子有机染料的两个分子发现用例中展示了该平台:(i)探索未知的化学空间和(ii)利用已知的化学空间。该平台根据需要执行并自动调整工作流程,在迭代期间和迭代之间,人工干预仅限于设定和调整目标、提供所需材料以及偶尔修复不可恢复的错误,例如 HPLC 装置堵塞。
平台灵活性对于执行包含反应类别广度的多步反应途径至关重要,这些反应类别需要实现涵盖所需属性空间的候选物。研究通过针对分子染料(具有多种化学性质和复杂分子特性的模型系统)来验证该平台的功能。在两个案例研究中,该平台尝试了 3000 多个反应,其中 1000 多个产生了预测的反应产物,完成了 303 个未报告分子(即在发布之前没有 CAS 登记号)的多步反应途径。
对于这两个案例研究,吸收最大值、分配系数和光氧化稳定性是目标属性,平台自动测量和记录每个属性,以完善模型预测并为未来的实验选择提供信息。
研究人员表示:「该平台的未来迭代将受益于预测能力的改进,特别是反应保真度、条件推荐和分子生成,以及分析工具。闭环集成平台的持续开发是继续加速分子发现的一条有希望的道路。」
以上是MIT团队运用机器学习闭环自主分子发现平台,成功发现、合成和描述了303种新分子的详细内容。更多信息请关注PHP中文网其他相关文章!

热AI工具

Undresser.AI Undress
人工智能驱动的应用程序,用于创建逼真的裸体照片

AI Clothes Remover
用于从照片中去除衣服的在线人工智能工具。

Undress AI Tool
免费脱衣服图片

Clothoff.io
AI脱衣机

AI Hentai Generator
免费生成ai无尽的。

热门文章

热工具

记事本++7.3.1
好用且免费的代码编辑器

SublimeText3汉化版
中文版,非常好用

禅工作室 13.0.1
功能强大的PHP集成开发环境

Dreamweaver CS6
视觉化网页开发工具

SublimeText3 Mac版
神级代码编辑软件(SublimeText3)

热门话题

在现代制造业中,精准的缺陷检测不仅是保证产品质量的关键,更是提升生产效率的核心。然而,现有的缺陷检测数据集常常缺乏实际应用所需的精确度和语义丰富性,导致模型无法识别具体的缺陷类别或位置。为了解决这一难题,由香港科技大学广州和思谋科技组成的顶尖研究团队,创新性地开发出了“DefectSpectrum”数据集,为工业缺陷提供了详尽、语义丰富的大规模标注。如表一所示,相比其他工业数据集,“DefectSpectrum”数据集提供了最多的缺陷标注(5438张缺陷样本),最细致的缺陷分类(125种缺陷类别

开放LLM社区正是百花齐放、竞相争鸣的时代,你能看到Llama-3-70B-Instruct、QWen2-72B-Instruct、Nemotron-4-340B-Instruct、Mixtral-8x22BInstruct-v0.1等许多表现优良的模型。但是,相比于以GPT-4-Turbo为代表的专有大模型,开放模型在很多领域依然还有明显差距。在通用模型之外,也有一些专精关键领域的开放模型已被开发出来,比如用于编程和数学的DeepSeek-Coder-V2、用于视觉-语言任务的InternVL

编辑|ScienceAI基于有限的临床数据,数百种医疗算法已被批准。科学家们正在讨论由谁来测试这些工具,以及如何最好地进行测试。DevinSingh在急诊室目睹了一名儿科患者因长时间等待救治而心脏骤停,这促使他探索AI在缩短等待时间中的应用。Singh利用了SickKids急诊室的分诊数据,与同事们建立了一系列AI模型,用于提供潜在诊断和推荐测试。一项研究表明,这些模型可以加快22.3%的就诊速度,将每位需要进行医学检查的患者的结果处理速度加快近3小时。然而,人工智能算法在研究中的成功只是验证此

对于AI来说,奥数不再是问题了。本周四,谷歌DeepMind的人工智能完成了一项壮举:用AI做出了今年国际数学奥林匹克竞赛IMO的真题,并且距拿金牌仅一步之遥。上周刚刚结束的IMO竞赛共有六道赛题,涉及代数、组合学、几何和数论。谷歌提出的混合AI系统做对了四道,获得28分,达到了银牌水平。本月初,UCLA终身教授陶哲轩刚刚宣传了百万美元奖金的AI数学奥林匹克竞赛(AIMO进步奖),没想到7月还没过,AI的做题水平就进步到了这种水平。IMO上同步做题,做对了最难题IMO是历史最悠久、规模最大、最负

编辑|KX时至今日,晶体学所测定的结构细节和精度,从简单的金属到大型膜蛋白,是任何其他方法都无法比拟的。然而,最大的挑战——所谓的相位问题,仍然是从实验确定的振幅中检索相位信息。丹麦哥本哈根大学研究人员,开发了一种解决晶体相问题的深度学习方法PhAI,利用数百万人工晶体结构及其相应的合成衍射数据训练的深度学习神经网络,可以生成准确的电子密度图。研究表明,这种基于深度学习的从头算结构解决方案方法,可以以仅2埃的分辨率解决相位问题,该分辨率仅相当于原子分辨率可用数据的10%到20%,而传统的从头算方

编辑|ScienceAI问答(QA)数据集在推动自然语言处理(NLP)研究发挥着至关重要的作用。高质量QA数据集不仅可以用于微调模型,也可以有效评估大语言模型(LLM)的能力,尤其是针对科学知识的理解和推理能力。尽管当前已有许多科学QA数据集,涵盖了医学、化学、生物等领域,但这些数据集仍存在一些不足。其一,数据形式较为单一,大多数为多项选择题(multiple-choicequestions),它们易于进行评估,但限制了模型的答案选择范围,无法充分测试模型的科学问题解答能力。相比之下,开放式问答

编辑|紫罗AI在简化药物发现方面的应用正在爆炸式增长。从数十亿种候选分子中筛选出可能具有开发新药所需特性的分子。需要考虑的变量太多了,从材料价格到出错的风险,即使科学家使用AI,权衡合成最佳候选分子的成本也不是一件容易的事。在此,MIT研究人员开发了一个定量决策算法框架SPARROW,来自动识别最佳分子候选物,从而最大限度地降低合成成本,同时最大限度地提高候选物具有所需特性的可能性。该算法还确定了合成这些分子所需的材料和实验步骤。SPARROW考虑了一次合成一批分子的成本,因为多个候选分子通常可

编辑|KX在药物研发领域,准确有效地预测蛋白质与配体的结合亲和力对于药物筛选和优化至关重要。然而,目前的研究没有考虑到分子表面信息在蛋白质-配体相互作用中的重要作用。基于此,来自厦门大学的研究人员提出了一种新颖的多模态特征提取(MFE)框架,该框架首次结合了蛋白质表面、3D结构和序列的信息,并使用交叉注意机制进行不同模态之间的特征对齐。实验结果表明,该方法在预测蛋白质-配体结合亲和力方面取得了最先进的性能。此外,消融研究证明了该框架内蛋白质表面信息和多模态特征对齐的有效性和必要性。相关研究以「S
