2019年11月22日
许多研究人员生成的是“中等规模”、低通量且多维的数据,这类数据使用数据库管理比使用电子表格更为高效。本文对数据库的基本概念进行概述,包括多维数据的可视化、关系型数据库结构中表的关联、半自动化数据流程的映射,以及如何利用数据库揭示数据的内在含义。
近几十年来,科学数据变得日益复杂和丰富,但科学家仍在使用一些组织方法,已无法满足其不断扩展的数据需求。本视频中介绍的技术主要优势在于,能够建立一个数据库,在实现严格的数据处理流程和存储的同时,仍保持数据分析的灵活性。为了开始评估感兴趣的数据集,请下载本表中所示的示例代码和数据库。
接下来,使用这种多维数据库的图形表示来评估所关注的数据集是否确实是多维的。数据需要满足两个条件才能从数据库的组织方式中受益。首先,数据必须能够以多维形式进行可视化。
其次,它必须能够将特定的实验结果与任一维度相关联,从而获得更深入的科学认识。关系型数据库以表格形式存储信息,表格由行和列组成,可用于链接数据库内的标识性信息。多维性通过将不同字段(例如表格的列和各个独立的表格)相互关联来实现。
首先,整理数据文件,确保其具有经过周密考虑且唯一的文件名。采用良好的文件命名规范以及文件夹/子文件夹结构,可在不影响手动访问文件可读性的前提下,实现数据库的广泛可扩展性。以一致的格式添加带日期的文件,并根据元数据命名子文件夹。
在设计数据库结构时,绘制不同表中各字段之间的关系。创建描述数据库及所建立关系的 README 文档,该文档可以是图形化的(如本图所示),也可以是基于文本的。
一旦不同表之间的条目建立关联,所有相关的信息都将与该条目关联,并可用于调用复杂的查询,以筛选出所需信息。最终结果应类似于本示例:个体的不同特征与其对应的实验数据相关联。同样,通过将模式类型和数据类型的列与主数据表 DataValues 中的匹配条目关联,解释了各种缩写符号的含义。
确定所有可能导致数据收集的各种实验和数据分析方法,以及每种数据类型的常规数据存储实践。使用 GitHub 等开源版本控制软件,以确保必要的统一性和版本控制,同时尽量减少用户的操作负担。务必制定一致的数据命名和存储流程,以便实现自动化数据处理流程。
使用任何方便的编程语言为数据库生成新的数据条目。在单独的文件中创建小型辅助表格,以指导数据的自动选择。这些文件可作为流程运行时的可选模板,且易于编辑。
为了为数据管道生成新的数据条目,请按照本文补充文件中提供的示例代码以类似方式编写程序。这将允许用户使用辅助表作为输入选项。在此基础上,通过将新条目与先前的条目合并,组装出一份新的文件位置电子表格。
此处显示并提供于补充文件中的代码可用于自动化此流程。随后,使用此处所示代码检查合并后的电子表格中是否存在重复项,以实现该步骤的自动化。此外,还需使用自动化方法检查电子表格中的错误,并向用户提示错误的原因及位置。
此外,您可以编写一段代码来检查已编译的数据库,并识别出任何缺失或异常的数据点。使用类似此处所示的代码,手动删除异常数据点,同时确保数据库的完整性不受影响。重复这些步骤以添加更多的数据点。
然后利用文件位置生成数据值电子表格。同时,创建一个更新的条目列表,以便访问以识别文件位置,或与未来的条目进行合并。开始创建数据库时,首先创建一个空白的数据库文档,用于加载细胞系、数据类型和模式类型的辅助表。
转到外部数据菜单,选择文本文件导入,单击浏览,然后选择所需的文件。在导入向导中,选择“分隔符”并单击下一步。勾选“首行包含字段名称”,并将分隔符类型设置为逗号。
单击“下一步”后,选择默认字段选项,然后选择“无主键”。单击“下一步”,然后单击“完成”。接下来,通过重复这些相同步骤加载数据和模式类型。
接下来,加载数据值表。进入“外部数据”菜单,选择“文本文件导入”,单击“浏览”,然后选择所需的文件。在导入向导中,选择“分隔符”并点击“下一步”。
选择“第一行包含字段名称”,分隔符类型选择“逗号”。单击“下一步”后,选择默认字段选项,然后选择“允许 Access 添加主键”。单击“下一步”,然后单击“完成”。
现在,通过选择数据库工具,进入“关系”界面,然后将所有表格拖动到工作区来创建关系。接着进入“编辑关系”,选择“创建新关系”。选择相应的表格和字段名称,然后点击“连接类型”,以指向辅助表格。
在设置每个所需的关系后,转到“创建”并选择“查询设计”,然后选择或将所有相关表拖入上方窗口。本示例中显示了细胞系、数据值、数据类型和模式类型。这些关系应会根据之前设计的关系自动建立。
现在,填写查询列以获得所需结果。对于此数据集,进入“显示”并选择“总计”。按此处所示,填写第一列、第二列和第三列。
同时填写第四列、第五列和第六列。完成各列填写后,保存并运行查询。对于本示例实验数据,采用单因素方差分析,结合Tukey检验进行不同条件间的均值比较。
当存在大量可能的验证条件时,使用手动数据整合方法难以识别新颖关系所在。本文通过在不同验证条件下查询数据库,利用取向有序度来测量多种条件下亚细胞肌动蛋白丝的排列情况。各向异性和各向同性数据集显示出显著不同的取向有序参数(OOP),这是预料之中的结果,因为纤连蛋白微图形化对组织结构具有显著影响。
然而,在比较各向同性组织时,不同突变状态条件之间无显著差异。相反,模式组织在阳性对照细胞系中表现出统计学上更低的有序性。即使将数据按不同家族与阳性和阴性对照进行汇总,该关系仍然成立。
如有需要,可对数据进行进一步解析。例如,此处将肌动蛋白 OOP 与活检时个体的年龄进行对比,并按突变状态和家族进行分组,以说明与临床变量的关联情况。根据该数据集,肌动蛋白的排列与个体年龄之间不存在相关性。
这展示了如何以不同的组合方式分析相同的数据,以及如何利用数据库轻松完成通常难以实现的、对属于多个类别的数据进行聚合的任务。本创建数据组织流程并生成数据库的方案,为当今大规模数据收集时代所必需的科学严谨性提供了保障。
查看完整文字稿并访问数千部科学视频
本文讨论了研究人员在管理复杂科学数据时面临的挑战,并提出通过使用数据库来解决这些问题的方案。文章重点介绍了采用结构化数据库方法在可视化和分析多维数据方面的优势。
生物制药 R&D日益产生中等规模、多维度的数据集,这对传统的基于电子表格的数据管理方式构成挑战,容易危及数据完整性并延缓科研发现进程。采用结构化数据库系统可建立严谨且可扩展的数据处理流程,支持可重复的分析和快速假设检验。这一能力对于推进组织工程及相关转化医学研究至关重要,因为在这些领域,数据复杂性不断提高,同时对研究严谨性的监管要求也日益严格。
基于数据库的数据管理可从早期发现阶段无缝整合至先导化合物识别及临床前研究,支持可扩展且自动化的数据流程。