环境暴露对人群健康影响评估需要可靠、全面、标准化的毒理学数据,以支持监管决策。然而,现有数据库仍较为碎片化,物种和器官覆盖范围狭窄且分布不均,剂量-反应关系不完整,验证链也缺乏一致性,从而限制了其在风险预测中的应用。与此同时,监管与技术正加速转向基于人工智能的计算模型,这凸显出建设高质量毒理学数据库、为下一代方法学奠定基础的紧迫性。对此,北京大学王斌研究员与复旦大学方明亮教授团队系统阐述了毒理学数据整理、协调统一与开放获取面临的关键挑战,并提出相应策略,包括建立置信度分级框架以充分利用异质性数据集,采用新型高通量平台高效、准确地生成相互作用数据,以及促进以科研共同体为基础的数据共享。进一步阐释,如何发展AI、赋能的方法,提升毒理学数据基础设施的组织化、互操作性和可用性,从而支持人工智能驱动的环境毒理学与基于机制的人类健康风险评估。具体策略包括:整合知识网络以构建机制引导的人工智能模型;采用连接大规模预训练与小样本微调的迁移学习框架;利用知识图谱增强与提示学习,系统预测“暴露-生物学-疾病”相互作用。努力将碎片化资源转化为系统化、可解释且具有预测能力的体系。作者认为,建设高质量毒理学数据库将加速毒理学向AI驱动范式转型,并为更可靠的风险评估及更有力的全球环境健康保护奠定基础。
论文类型:展望
第一完成单位:北京大学
第一作者:王斌
通讯作者:方明亮(复旦大学)
期刊:Environmental Science & Technology
论文信息:Wang B, Wu T, Shou Y, Ma Y, Ren M, Gago-Ferrero P, Schlenk D, Fang M*. Building the Foundations of AI-Driven Toxicology: How to Use Fragmented Data for Mechanism-Based Human Health Risk Assessment. Environmental Science & Technology. 2026, https://doi.org/10.1021/acs.est.5c17092
全文链接: https://pubs.acs.org/doi/10.1021/acs.est.5c17092

人群环境暴露通常涉及多种化学物的复杂混合,其作用机制不明确,并可能产生非靶向效应,传统毒理学方法难以开展高通量、机制化和系统性的健康风险评估。近年来,监管需求、新方法学和AI技术共同推动环境毒理学由动物实验和传统QSAR模式,逐步转向高通量筛查、组学、器官芯片、知识图谱及机制驱动的计算模型。然而,现有毒理数据仍分散于不同机构与平台,在化学物、物种、器官、毒性终点和剂量—反应信息方面覆盖不均,且存在数据格式、标识体系、实验条件和元数据标准不一致等问题,限制了跨数据库整合及模型外推。为系统呈现该领域的数据基础,表1汇总了当前具有代表性的毒理学数据库与分析平台,包括ECOTOX、CompTox、PubChem、ChEMBL、ToxCast、CTD、OECD QSAR Toolbox及ExposomeX等,并比较其建设机构、数据来源、覆盖规模与核心功能,为后续分析数据库局限及提出AI驱动的整合策略奠定基础。。
表1. 当前典型毒理学数据库与分析平台概览

当前毒理学数据库类型多样,可分为原始数据资源与整合分析平台,涵盖生态毒理、化学与生物活性、药物与靶点、内分泌干扰及暴露组等多个领域。ECOTOX、NORMAN和MarineTox Predictor支持多物种生态风险评估;PubChem、ChEMBL及CompTox等提供大规模化学结构、生物活性和毒性终点信息;ExposomeX进一步连接“暴露-生物学-疾病”关系。然而,现有数据仍分散于不同实验体系和数据库,在物种、器官、终点、暴露条件及元数据完整性方面差异明显。化学标识、数据格式、术语体系和实验报告标准不统一,造成跨平台整合与互操作困难。科研数据强调多样性但异质性较高,监管数据标准化程度较高却存在开放性和透明度限制。这些问题共同构成图1所概括的证据碎片化、数据覆盖失衡和实验一致性不足等核心挑战。

图1|构建高质量毒理学数据库面临三方面挑战。毒理学证据来源异质且验证链不完整,不同靶点和毒性终点的数据覆盖高度失衡;现有数据集中于少数模式物种和器官,限制跨物种外推与机制推断;实验检测成本高、终点特异性强,并存在实验室间差异,进一步降低数据整合、复用及风险预测的可靠性。
为破解毒理学数据碎片化、质量不一和机制信息不足等瓶颈,研究提出了一个面向AI驱动健康风险评估的系统解决框架(图2)。首先,不再简单地将低质量数据全部剔除,而是依据实验标准化程度、可重复性和元数据完整性对数据进行分层,并从完整性、一致性和任务相关性等维度建立置信度评价体系。高置信度数据可直接用于模型训练,中等置信度数据可通过加权方式纳入,低置信度数据则可用于稳健性检验或假设生成,从而在保证可靠性的同时扩大化学物和毒性终点的覆盖范围。其次,研究强调利用蛋白—配体筛选、DNA编码化合物库、亲和筛选质谱、转录组学、代谢组学及单细胞多组学等新型高通量技术,在统一实验条件下规模化生成标准化生物学数据。这些技术能够帮助识别化学物作用靶点、分子起始事件、关键通路及潜在不良结局,为机制研究和毒性预测提供更完整的数据基础。最后,通过知识图谱和大语言模型智能体,可进一步整合化学结构、生物学响应、组学信息和文献证据,支持化学物—靶点预测、组学—通路映射、混合物效应解析及风险优先排序。该框架有望将分散的毒理数据转化为可追溯、可解释和可预测的机制证据,推动环境健康风险评估从经验判断迈向知识驱动和AI赋能的新阶段。

图2|构建高质量毒理学数据库并推动AI驱动的人类健康风险评估。可从三方面展开:首先,依据数据表征程度对毒理学数据进行分层,并从完整性、一致性和相关性等维度建立置信度评价体系;其次,利用蛋白—配体筛选、转录组学和代谢组学等新型高通量技术,规模化生成生物学数据并拓展机制覆盖;最后,通过知识图谱和大语言模型智能体整合化学信息、生物学响应及文献知识,支持面向毒理学的AI分析与风险评估。
图3进一步展示了稀疏毒理数据如何通过AI方法转化为具有泛化能力和机制解释力的健康风险评估工具。早期模型主要采用矩阵分解、网络扩散和node2vec等转导式方法,依赖训练阶段已观测到的完整图结构,难以处理未见化学物、未知靶点和新毒性终点。随着图神经网络的发展,模型逐步转向归纳式学习,通过消息传递和局部子图聚合实现对新实体的预测;在此基础上,自监督预训练与小样本微调可从大规模化学—生物网络中迁移知识,图提示学习则进一步注入任务特异信息,缓解预训练知识与下游毒理任务之间的不匹配。
在实际应用层面,大语言模型可从数据库、表格、报告和文献中自动提取并结构化毒理证据,多模态学习进一步融合化学结构、知识图谱和组学特征,形成统一的生物学表征空间。通过构建暴露组知识图谱,可将个体多维暴露特征、生物标志物和健康结局进行关联,支持复杂环境背景下的风险识别。同时,模型还可沿“化学物-分子靶点-通路-疾病终点”链条追踪关键机制,使风险预测由“黑箱”输出转向可解释的生物学推断。
研究还指出,基础模型有望推动毒理学由“一对一”预测迈向“多对多”系统建模,并实现数据稀缺化学物的零样本或少样本预测。未来,将环境暴露数据、生态毒理证据、组学信息和生物知识网络深度整合,并通过外部验证、基准测试和不确定性评估保障模型可靠性,是AI真正服务环境健康风险评估和监管决策的关键。

图3|稀疏毒理数据向可泛化、机制驱动健康风险评估转化的范式演进与整合框架。AI模型已由依赖完整图结构的矩阵分解和图嵌入等转导式方法,发展为可预测未知化学物与终点的归纳式图神经网络,并进一步结合预训练、微调和图提示学习,提高小样本任务适应性。与此同时,大语言模型辅助提取数据库、表格和文献证据,多模态融合化学结构、知识图谱与组学信息,依托暴露组知识图谱开展个体化风险评估,并通过追踪“化学物—通路—疾病终点”链条增强生物学解释与机制推断。
总结与展望:
面向可靠的人群健康风险评估需求,未来毒理学数据库建设需从“数据积累”转向“高质量、可共享、可解释、可计算”的系统工程。应进一步结合新型高通量技术、分级数据利用、社区协作共享、知识引导的AI及迁移学习,提升异质数据的整合效率与模型泛化能力。与此同时,还需加强标准化、可追溯性、外部验证与不确定性评估,推动风险预测结果真正服务于监管决策。建设高质量毒理学数据库不仅是方法学升级的基础,也是全球共同承担的科学责任与公共健康使命。
致谢:
感谢国家卫生健康委员会生育健康重点实验室、北京大学重大疾病流行病学教育部重点实验室和教育部骨、复旦大学环境学院团队协助。感谢国家自然科学基金委和国家科技部重点研发项目支持。
作者简介
第一作者:

王斌,北京大学生育健康研究所,长聘副教授/研究员,北京大学城市与环境学院兼职教授
主要研究方向为环境健康,暴露组学大数据与人工智能。主导构建暴露组学平台 ExposomeX(www.exposomex.cn),促进“暴露-生物学-疾病”关联的因果推断研究。迄今主持国家自然科学青年和面上基金4项,骨干参与国家重点研发项目3项。以第一或通讯作者在Environ Health Persp、Environ Sci Tech、The Lancet Reg Health West Pac, The Innovation等国际权威期刊发表论文共70余篇(H指数=54,他引6500余次)。担任Environ Sci Tech期刊副主编(AI、大数据、环境健康领域)。开设本科生、研究生北大教改课程“暴露组学”,获得“北京大学十佳本科生优秀教学案例”。担任中国队列共享平台“环境与人群健康”组长,环境诱变剂学会环境与生育健康专委会副秘书长。获得北京预防医学会科技二等奖和“全国科技系统抗击新冠疫情优秀个人”称号。
通讯作者:

方明亮,复旦大学,教授
2015年获美国杜克大学环境化学与毒理学博士学位,博士期间主要研究阻燃剂的毒性效应,以及效应导向分析在复杂混合物关键致毒物识别中的应用。此后,他赴美国斯克里普斯研究所开展博士后研究,研究方向为代谢组学。目前,主要致力于人类暴露组学方法的开发,并运用化学蛋白质组学、代谢组学等组学技术,评估环境污染物及其混合物的毒性效应。迄今已发表同行评议论文150余篇,多篇以主要作者身份发表于Nature Nanotechnology、Nature Water、Nature Chemical Biology、PNAS、Science Advances、Environmental Health Perspectives、Environmental Science & Technology和Analytical Chemistry等高水平期刊。现任 Elsevier 旗下期刊Environmental Pollution副主编,并担任Environmental Science & Technology和Environmental Science & Technology Letters编委。2023年,获Chemical Research in Toxicology青年研究者奖。