AI药物临床突破百,数据瓶颈仍难解

在“2026张江药谷大会暨上海国际生物医药产业周‘未来智药:AI+制药前沿论坛’”上,诸多专家学者谈到当前AI生物制药的发展瓶颈时,始终绕不开两个字:数据。

更准确地说,是高质量数据,以及让数据持续回流的闭环能力。

全球AI辅助药物研发正迎来指数级增长。据L.E.K. Consulting统计,截至2025年,全球进入临床阶段的AI辅助药物分子已超过100个;超过90家中国本土企业已与AI biotech公司建立合作。

巢生资本执行合伙人周悦欣也提出,与传统制药公司相比,AI制药公司明显更受资本青睐。但热度之下,AI制药发展仍存在明显瓶颈。

数据稀缺,不只是“量”的问题

力场采样创始人彭向达认为,生物制药类模型与自然语言大模型存在本质差异。

“自然语言模型可以学习海量的互联网文本数据,但针对生物分子领域高质量的结构数据储备相对有限。生物分子的工作规律往往极为复杂,当模型面对未曾学习过的分子时,预测性能便会出现衰减。而真实药物研发场景中,研究对象大多为全新分子。”彭向达介绍。

“实际上,我们的数据是很稀缺的,一个药物使用后,病人的表现怎么变化,之前可以采集大量临床上的数据,但这整套的机理数据是很难看到的。”上海科学智能研究院研究员杨自雄说,“在未来,或许会有更多的仪器,更多的方法论提出,我们可以有多尺度的数据、时间数据,但现在是做不到的。”

这意味着,AI制药缺的不是一般意义上的“大数据”,而是贴近真实药物研发过程的高质量、机制性数据。没有这些数据,模型再好,也很难“会做药”。

除了难以采集之外,数据的质量也进一步决定了AI制药的效能。生物医药领域的数据获取不仅成本高昂,还涉及患者隐私、伦理审查等复杂问题,这使得高质量、可用的训练数据更加珍稀。

上海交通大学数学科学学院和人工智能学院教授陈洛南表示,跨模态的配对数据对AI制药模型训练至关重要,但目前行业可获取的数据大多为单模态数据。

“用单点数据看某一数据切片会局限于单一维度,但是,比如通过时间扰动等手段能获得这种不同时间维度的数据,可以开展跨模态,做有组织的数据输出。”临港实验室AI临床研究员袁博表示。

模型开源之后,拼的是数据生态

相比数据采集端的困难,腾讯健康首席架构师陈睿判断:模型本身并非AI制药面临的最大壁垒。

据陈睿介绍,腾讯在深科实验室开展了大量蛋白质相关研究,不少模型已经开源,可供行业研究者使用。“我们把模型的权重开放,就是因为知道模型本身不是最大的壁垒。”

腾讯近期的重点布局是实验反馈强化学习。在陈睿看来,算力和算法只是做好AI赋能生物制药的入场券,而干湿实验的反馈闭环能力,以及各类数据,特别是失败的数据才是破局的关键。

“我们更在意的是实验处理完了,数据能够再换回到模型继续做训练,在过程中我们相应的数据,包括我们工程发展的能力,是比较重要的。”陈睿说,“我认为大家更需要关注失败的数据。”

从论坛上的讨论看,AI制药的竞争逻辑正在变化。

过去,行业更关注谁的模型更大、算法更强、算力更多,超100个AI药物进入临床阶段 AI制药为何仍被数据卡住但当模型逐渐开源、算力逐渐普及,真正的壁垒会转向数据生态。数据生态的构建需要产学研多方协作,尤其需要建立标准化的数据共享平台,减少重复投入,提高数据利用效率。

“未来10年后,一定会有一批AI重构药物研发流程的伟大公司出现。”深势科技生命科学AI4S方向架构总经理李厦戎的这句话,代表了行业对AI制药的长期期待。尽管挑战重重,但随着干湿实验闭环的完善和数据积累,AI制药有望在未来十年取得突破性进展。

免责声明:本网站内容主要来自原创、合作伙伴供稿和第三方自媒体作者投稿,凡在本网站出现的信息,均仅供参考。本网站将尽力确保所提供信息的准确性及可靠性,但不保证有关资料的准确性及可靠性,读者在使用前请进一步核实,并对任何自主决定的行为负责。本网站对有关资料所引致的错误、不确或遗漏,概不负任何法律责任。任何单位或个人认为本网站中的网页或链接内容可能涉嫌侵犯其知识产权或存在不实内容时,可联系本站进行审核删除。
(0)
AI 怪盗团AI 怪盗团
张雪回应最寒酸亿万富翁:生活无需刻意,吃饭何必贵
上一篇 11小时前
一车一价!新能源车险对标燃油车,高成本车型保费涨
下一篇 8小时前

相关推荐

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注