一款新药从最初的想法走向临床,往往要经历漫长的研发过程。很多人关注的是尽快找到候选化合物,却容易忽略一个更基础的问题:支撑这个结论的实验数据,是否真实、完整、可追溯?不同化合物与活性结果之间的关系,是否被系统地沉淀下来?能否被AI利用?
早期研发看似是在“做实验”,本质上却是在持续产生数据、分析数据,并据此作出下一轮决策。如果数据地基不牢,可能偏得越远。
一、新药早期研发,究竟在做什么?
不同药物类型和技术路线的流程并不完全相同,但以小分子创新药为例,早研通常会经历靶点发现与验证、苗头化合物发现、先导化合物筛选与优化、候选化合物确定,以及临床前研究等阶段。
在这个过程中,药化、药理、DMPK、毒理等团队围绕活性、选择性、溶解度、代谢稳定性、安全性等指标,进行一轮又一轮的“设计—合成—测试—分析-再设计”。
一个取代基的变化,可能提高活性,也可能带来毒性;一次结构改造,可能改善药代性质,也可能牺牲选择性。研究人员要根据每一轮结果理解构效关系,再设计下一批分子。因此,早研不是一条简单的直线,而是一个不断试错、比较和收敛的循环。
二、新药早研最重要的是什么?
实验数量和速度当然重要,但更重要的是:每次实验产生的数据是否可信,能不能支持下一次决策。
一个IC50数值,如果不知道由谁、在什么时间、使用哪个样品批次、按照什么条件测得,也找不到对应的实验过程和原始文件,那么它即使被填进结果表,也很难成为可靠的决策依据。
早研真正要解决的是两个问题:第一,实验记录和原始数据是否高质量、合规、可追溯;第二,化合物与实验结果能否形成清晰的构效关系。
前者回答“这个结果是否可信”,后者回答“这个结果能否指导下一步”。
三、什么样的数据,才能称为高质量数据?
高质量数据不只是结果准确,还要保证数据产生、记录、修改、审核和使用的全过程能够被解释。
首先要真实。实验结果应来自真实发生的实验,而不是几天后凭记忆补录。
其次要完整。除了最终结论,还要保留实验设计、操作步骤、样品批次、关键参数、仪器文件、异常现象和失败原因。
数据记录还要及时。记录越晚,遗漏和失真的风险越高。
同时要规范。同一个化合物、样品和检测指标,应使用统一的编号、名称和字段,避免在不同部门出现多个版本。
最后还要可追溯。团队需要知道数据由谁产生、何时产生、修改过什么、由谁审核,以及结论依据的是哪一份原始记录。
只有具备这些条件,实验数据才能真正成为可以复核、复用和分析的研发资产。
四、为什么只用Excel,很难持续提升数据质量?
明确了高质量数据的标准,接下来更现实的问题是:如何把这些要求落实到日常实验中?
很多实验室习惯使用Excel记录实验参数、样品信息和检测结果。表格直观、灵活,也便于批量录入、计算和比较。真正的问题在于,当表格以独立文件的形式散落在个人电脑、共享文件夹和邮件中时,数据很难统一管理,难以做到随时检查;版本混乱,难以确认“最终版”“最终版2”“修改版”等哪一份才是有效数据;由于缺少时间戳,很难证明原始数据的真实性。
因此,一些研发团队会通过鹰谷电子实验记录本InELN管理实验过程,实验人员可以在实验发生时记录实验设计、操作步骤、样品信息、结构式、谱图、仪器文件、结果分析和异常说明,系统同步保留人员、时间、修改和复核信息。
管理者和QA也不必等到项目结束后再集中检查。实验是否及时创建、关键字段是否缺失、原始附件是否上传、失败原因是否说明,都可以在过程中持续查看。
结合InAI智能体,还可以先由AI按照企业既定要求辅助检查实验记录完整性、识别疑点,再由科研人员或管理者确认,让问题更早暴露,而不是在申报和审计前集中补救。
图注:鹰谷电子实验记录本6.0界面图
五、数据记录下来之后,还要能够被有效利用
实验记录解决的是“结果是否可信”,但新药早研还需要回答:“这些结果能否指导下一步?”
一个项目会产生大量化合物、样品批次和检测结果。如果结构、活性和样品信息分散在不同记录和表格中,团队仍然很难快速判断:某个化合物是否合成过?同类结构有哪些?不同批次结果是否一致?某种结构变化对活性和成药性有什么影响?
鹰谷化合物与样品注册管理系统InCMS可以通过对化合物和样品进行注册,为每个研发对象建立统一编号,相当于一张“身份证”,注册时可检索已有分子,降低同一化合物被重复合成、重复制备和重复测试的风险。结构、批次、样品、检测结果和相关属性不再散落在多个Excel中,而是围绕同一个研发实体持续积累。研究人员可以进行结构式搜索和全字段搜索,筛选同系列化合物,比较结构变化与活性结果;也可以查看同一母体结构下不同批次的数据,对多个IC50计算平均值或中位数,并通过图表开展可视化构效分析。
数据只有从分散的结果表,转变为可检索、可比较、可分析的研发数据,才能真正支持分子设计和下一轮实验决策,AI才有可能真正理解这些数据。
结语
进入AI时代,很多企业希望利用AI辅助实验分析和分子设计。但如果一个IC50数值没有关联具体化合物、样品批次、实验条件和原始记录,AI就很难判断它是否可信,也无法准确分析结构与活性之间的关系。只有当数据真实、完整、规范,并形成清晰关联后,AI才能从中发现异常、总结规律,辅助优化实验设计和药物结构设计。
因此,AI应用的基础不是先选择模型,而是先建立高质量、可理解、可调用的研发数据。