

多种数据源不知如何选择?
原始数据杂乱不知如何整理?
从CRF到结构化数据库到底缺什么?
在这里,你都能找到答案!
通过之前的阅读,相信大家已经掌握了研究方案的选择方法以及如何开展伦理审查(点我查看详情),如果明确科研思路与通过伦理审查构建了临床研究的“骨骼”,那么数据质量就是临床研究的“经脉和血肉”,是描述和呈现临床研究结果的基础和支撑。作为本系列的第四期,小谱将以干货分享的形式教大家如何搭建结构化数据库。
我们先简单介绍一下建立流程,主要分为三个步骤:
1.确定临床数据来源:研究者在开展研究之前,应全面了解本次开展的临床研究可及的数据源,从数据源中获取原始数据。
2.设计病例报告表:由于原始数据包含表格、文本、影像、日志等多种格式,不便于研究者查看调查对象的信息,因此我们需要设计并使用病例报告表(case report form,CRF)来对研究对象的信息进行全面收集。
3.构建结构化数据库:选择合适的软件将CRF进行整理,变成结构化数据库。
如此,一个高质量的临床研究数据库就建立完成啦~接下来,请跟着小谱一起来看一看每个步骤的具体内容吧。
目前开展临床研究主要的数据来源包括:
医疗机构的医院信息系统(HIS)、实验室信息管理系统(LIS)、医学影像信息系统(PACS)、电子病例信息系统(MRIS)等多个系统中的电子诊疗数据。这些数据应涵盖临床诊疗期间产生的一切数据。

某医院信息管理系统
由疾控中心、妇幼保健院、统计局、环保局、气象局等单位通过主动监测或被动监测所采集的数据。这类数据在流行病学研究中较常收集,因为某些气候、环境因素或饮食规律可能对疾病的发生发展起到重要作用;

例如:从TAP(http://tapdata.org.cn/)下载空气污染实时数据与调查对象居住地址相匹配可以得到调查对象的居住地空气污染暴露。
由政府机构、专业研究机构和国内外研究者等建立的注册登记研究数据库和大型队列数据库。这类数据适用于无临床诊疗数据但仍想开展临床研究的科研人员。

例如:已进行五轮调查且可下载的CHARLS队列数据(https://charls.pku.edu.cn/)
基因组学、转录组学、代谢组学及蛋白质组学的检测数据。这些数据可作为研究的外部验证或进行多组学联合分析。

例如:在组学领域广泛使用的TCGA癌症组学数据库 (The Cancer Genome Atlas Program (TCGA) - NCI)
病例报告表(case report form,CRF)分为纸质版和电子版,表格通常由实验员根据上述来源的原始数据内容进行如实填写,用于记录和报告每位调查对象的信息。接下来小谱给大家介绍一下设计CRF需遵循的基本原则以及CRF包含的内容:
(1) CRF设计的基本原则
①遵循研究方案:CRF应当采集研究方案所规定的所有数据,确保数据的完整性。在研究期间,如果研究方案发生修订,并且影响到数据采集时,CRF也需要进行相应的修订。
②内容扼要完整:CRF应当只包含与研究相关的数据,不采集与研究无关的数据,减少填写、核对和核查的工作量。
③指标设计明确:CRF采集的指标要简单明了、定义明确,尽量避免容易引起歧义的问题,减少开放性问题,同时数据尽可能客观,量化。
④方便填写和录入:尽可能使用封闭式问卷,减少文字书写。以降低填写的复杂性,减少出错率,增加数据的一致性,提高医生的工作效率。
⑤避免衍生数据:CRF应当采集原始数据,而不是计算后的衍生数据。衍生数据应当在后期分析时再统一计算,这样不仅可以避免计算错误,也节省填写时间。
⑥易于归档和统计分析:CRF需要考虑归档的需要,每位调查对象需有唯一识别的ID编码,并在封面或者每个页面上制作标识符;同时还要方便后续的统计分析,保证数据编码的标准性、一贯性和合理性。
(2) CRF的内容
CRF的内容遵循研究方案,基本包含下表中列出的内容。同时根据研究目的,可按需增加记录条目。如研究某药物的疗效和安全性,那么需增加合并用药记录;如研究基因靶向药物,需增加基因检测情况记录;如研究为随机对照试验、队列研究这类需收集调查对象多次信息的研究设计,需增加随访记录。除此之外,许多临床常见的公认量表也可以放入CRF中用来说明研究对象的个人生活习惯、心理状态、自理能力等特征,如蒙特利尔认知评估量表、焦虑/抑郁自评量表、日常生活能力量表。

CRF中的内容需要在临床研究的不同时期分开填写,为了清楚展示不同时期需完成的检查和记录的项目,还需要绘制临床研究流程图。下图展示了一项随机对照试验CRF填写的临床研究流程图。篇幅所限只展示了部分内容,需要 完整模版 的老师们可以留言给小谱哦~

CRF虽然全面收集了研究对象的信息,但并不能直接用于数据分析,我们需要选择合适的软件将CRF变成结构化数据库。 EpiData 是一款免费的数据录入经典工具,目前的EpiData3.1版本,从2008年投入使用至今已经十余年,依然深受研究者们的喜爱。它有诸多优点:①软件小巧,安装简易(仅1Mb大小);②设计界面友好,易学易用(官网有中文操作手册);③数据导出格式多样(Excel、SAS、SPSS、Stata等);④可进行数据核查、一致性检验等。EpiData可在官网(http://www.epidata.dk)免费下载,下面小谱跟大家讲解一下如何使用EpiData将CRF变成结构化数据库:
第一步:文件准备
使用EpiData构建结构化数据库需要三种文件:
1.QES文件

QES文件用于定义所有变量及其输入格式。将CRF或问卷的文字复制进文本框内,每个变量需给出三个信息:变量名(如,v1,id),变量描述(如,性别,编号),字段定义(如,##代表两位数)。字符编辑器可进一步定义每个变量。
EpiData支持多种变量类型:①数值型变量可设置小数点前后的位数,设置完成后以“#”表示;②字符型变量可以设置文本类型和长度,以下划线表示;③时间变量可以设置日期输入格式,还可以自动插入日期,年月日以“/”分隔;④分类变量可设置为逻辑变量,Y/1为是,N/0为否。更多变量设置可查看官网使用说明。
2.REC文件
REC文件即记录文件,用于录入和储存数据。字段设置完成后即可生成REC文件。
3.CHK文件

CHK文件即核对文件,作用是为变量设置规则:
※数值范围及允许值(Range, Legal):如键入【2-5】,表示当前变量只允许录入2、3、4、5四个数值,如键入【2,4,6】表示当前变量只允许录入2、4、6三个数值;
※跳转(Jumps):当某个变量为特定值时,自动跳转到对应变量。例如,当性别变量为1(男性)时,可设置跳过女性相关的变量,转到其他变量;
※必填项(Must enter):可设置必须为当前变量输入内容,否则无法跳转到下一变量;
※重复项(Repeat):选择【是】,则当前变量上录入的内容将在接下来的新变量上重复显示,可以省去重复内容的键入工作,如可能多次出现的调查员姓名;
※数值标签(Value label):对一组数值添加文字注释,如性别变量中1代表男性,2代表女性,设置后在数据录入过程中,按【+】,会自动弹出一个窗口展示数值的含义。
第二步:数据录入和导出
CHK文件设置好后,REC文件就可以用于数据录入了。每录完一份数据存盘成功后自动进入下一份数据的录入。全部数据录入成功后,关闭数据输入页面,重新打开EpiData,即可导出你想要的数据格式。
以.xlsx导出格式为例,可生成如下的Excel表格:

第三步:结构化数据的整理
(谱度众合可协助完成)
虽然EpiData生成的数据已经非常规整,涵盖了研究者想要的信息,但现在的数据还不能称之为“结构化数据”,我们需要根据变量的类型进行调整,方便后续数据分析。首先了解一下变量的类型及特点:

那么不同的变量类型需要怎样修改呢?
【连续型变量】【离散型变量】:对于这两类变量,我们保持原值,不做变动。
【分类变量】:二分类变量一般设置为0&1或1&2,表示是/否;无序多分类变量则将每种类别单独成列(即变为多个二分类变量),每列中的设置和二分类变量一致。
【有序多分类变量】:以疾病严重程度为例,严重程度为+、++、+++的信息可转变为1、2、3。
上面示例的Excel表格整理后如下图所示:

除了对每个变量的处理,还有一些细节需要大家注意:
为方便后续数据分析,建议研究者将中文变量名设置为英文变量名,并且尽量简短。
一份数据往往经手多个人,变量名更改后必须记录原始变量名和现变量名的对应关系,需要有Coding book注释每个变量的含义,便于大家的查看和使用。

【PS:在谱度众合做项目的老师可在我司专业数据分析人员的指导下完成结构化数据库的整理工作】
第四步:数据分析(谱度众合提供专业服务)
好不容易得到了结构化数据库,我们终于可以进行统计分析工作啦!根据不同的目的,使用不同的统计方法,就可以轻松得到论文所需的结果。这里小谱简单说明一下研究中常用的统计方法:
①描述性统计:在科研论文中,第一张图表往往展示了重要变量的分布情况。对于符合正态分布的数值变量,计算其平均值和标准差;对于不符合正态分布的数值变量,计算其四分位数间距;分类变量则以百分比表示。
②差异分析:做研究少不了比较,在蛋白质组学研究中,对照组和实验组之间的定量蛋白质数据需要进行组间差异检验。两组数据均符合正态分布时使用t检验,否则使用Wilcoxon秩和检验。
③建模分析:以蛋白质组学研究为例,其本质是蛋白质表达量与关注结局之间的关联。定量数据X(蛋白质表达量)与分类变量Y(结局,如患或不患糖尿病)之间的关联可以通过建立Logistic回归模型评估;当患者的生存时间被考虑时,X与Y之间的关联还可以通过Cox比例风险回归模型评估。