
(一)平行趋势假设与检验方法
平行趋势假设是DID估计量能干净识别平均处理效应的关键。平行趋势假设是不可检验的,但是在不同的处理效应估计量中,对平行趋势假设的理解和使用存在一些差异。
类型I:处理前处理组和控制组的结果均值差异在没有发生处理时会在处理后处理组和控制组结果均值间延续。类
型II:处理前某一时点处理组和控制组的结果差异在没有发生处理时会在处理后某一时点处理组和控制组结果间延续。
类型III:处理前处理组和控制组的结果均值差异在没有发生处理时会在处理后某一时点处理组和控制组结果间延续。
类型IV:处理前某些时点处理组和控制组结果差异在没有发生处理时会在处理后某些时点处理组和控制组结果间延续。
类型V:处理前处理组和控制组的所有结果差异在没有发生处理时都会延续到处理后每个时点。
类型I的平行趋势假设是最为人所熟知的,类型II则只要求处理前后一个时点的平行趋势延续即可,例如Callaway and Sant Anna(2021)估计量,类型III则要求处理后一期延续处理前多期的平均趋势即可,例如de Chaisemartin and D'Haultfoeuille (2020,2021,2022)估计量,类型IV与类型II的区别在于,类型II要求处理前后各一个时点,而类型IV则可以放宽至处理前后多个对应时点满足平行趋势即可,例如Borusyak et al. (2023)估计量,类型V是最严格的平行趋势假设,因为它要求处理前后所有时点反事实结果平行地变化。无论是哪种类型的平行趋势假设,它的本质都是“处理组和控制组在处理前的变化趋势在没有处理时会延续到处理后”。这也意味着从经验上看,它不可检验。
但经验研究实践中,研究者通常将平行趋势假设分成两个部分:
第一部分是处理组和控制组处理前的变化趋势,这种变化趋势可以通过数据来检验,被称为“处理前趋势检验(pretrends test)”(Roth,2022);
第二部分是在处理后,外生政策冲击以相同的方式、程度影响处理组和控制组,被称为“共同冲击(common shocks)”(Dimick and Ryan,2014; Ryan et al., 2015)。
也就是说,真正地检验“平行趋势假设”应该是进行“处理前趋势检验”和“共同冲击检验”。处理前趋势检验是当前文献检验平行趋势假设的主要内容,但是大多数文献却忽略了“共同冲击检验”。后者有两个核心要点:第一,外生的政策冲击,也就是说政策干预是外生的,一般来说,经济研究者在评估政策效应时,都是借助“自然实验”或者“准实验”框架(诺奖委员会,2021),其核心在于政策实施具有一定的随机性,满足一定的外生性,但如果能找到更外生变动的来源更好(例如,好的IV,IV-DID也是当期双重差分法的最前沿方向);第二,以相同的方式、程度影响处理组和控制组,这意味着政策干预的效应具有同质性(所以(个体或时间)异质性处理效应检验也非常必要)。
基于此,经验研究者们采用了许多方式来比较处理组和控制组之间的趋势差异,从而为平行趋势假设提供一定的经验证据:
方式一:原始数据图形法。如果所有处理组处理时间相同,那么,研究者可以画出处理组和控制组原始数据(或者两组时序均值),然后用“眼观法”来考察处理组和控制组处理前的结果均值是否存在明显的差异。如果是交叠处理,那么,也可以画出原始数据时序趋势,不过是分不同的处理年份,例如,Cheng and Hoekstra (2013)。除此之外,Anderson et al.(2013)还利用相对事件时点来画出处理组和控制组的原始数据图,并观测它们之间的变化趋势。这种方式最大的优势就是呈现了原始数据的真实信息(Kahn-Lang and Lang,2020),但它不能为平行趋势假设提供精确的证据。
方式二:均值差异性检验(Difference in Mean,DiM)。这种方式是利用样本数据来检验处理组和控制组结果变量均值是否存在统计学差异,即检验原假设“处理组和控制组均值无差异”。这种检验方式也被学者们广泛使用,例如,彭飞等(2020)、Liu et al.(2022)。
方式三:事件研究法。当前的研究实践中,最流行的方式就是采用事件研究设计来估计处理前时期的系数(Cunningham,2020),例如,彭飞等(2020)、 Miller et al.(2021)。Roth(2022)统计了美国经济学会(AEA)的主要期刊上70多篇用事件研究的文献,最后用了12篇作为样本总结发现:实践中,通过处理前趋势检验最常用的标准是检验处理前单个系数的显著性,或者联合显著性,前者更常用 。
近年来,越来越多的学者指出,处理前趋势检验对于DID的有效性来说,既不必要,也不充分(Kahn-Lang and Lang 2018),且处理前趋势检验的效力较低,可能会导致处理后处理效应有偏误(Roth,2022)。
(二)放松平行趋势假设
平行趋势假设本身不可检验,且现有为其提供经验证据的方法都或多或少存在问题。为此,一些学者也提出可以重新构建模型来引入非平行的处理前趋势,并检验处理效应估计量对处理前趋势不满足平行趋的敏感性(Bilinski and Hatfield,2018; Rambachan and Roth,2022)。
Bilinski and Hatfield(2018)提出了一个思路:首先,估计一个带有复杂趋势的DID估计量,例如,如果研究者认为有平行趋势,那么,估计两个带有不同斜率的线性趋势的模型,并将它们与更简化的模型进行比较;然后,检验两个模型处理效应是否具有差异(或者在一定范围内具有差异)。
Rambachan and Roth(2023)基于Bilinski and Hatfield(2018)的想法提出了一种方法来检验平行趋势假设的违反程度对事件研究点估计量和置信区间的影响。他们提出了许多方法来进行上述检验,主要使用的有两种:①相对偏离程度限制;②平滑限制。这个检验由两个部分组成:第一,基于研究背景,选择偏离平行趋势假设的程度Δ;第二,构造每个偏离程度对应的置信区间。
①相对偏离程度限制的思想是处理后时期违反平行趋势的程度不会大于处理前时期违反平行趋势的程度。也就是说,给处理后时期违反平行趋势的程度施加一个常数̅,使得处理带来的效应β̅:
上式中,̅限制处理后紧邻两个时期违反平行趋势程度最大不会超过处理前的̅倍。例如,̅意味着处理后时期违反平行趋势假设的程度不会比处理前违反程度的最坏情况还要差。同理,̅意味着,不会比处理前违反程度的2倍还要差。
②平滑限制的思想是处理后违反平行趋势程度不会对处理前线性外推趋势偏离太多。尤其是,作者对处理前趋势系数在紧邻两期的变化施加了一个常数,使得处理带来的效应β:
Rambachan and Roth(2023)建议经验文献中使用上述方法来构建违反平行趋势假设时的稳健置信区间,并检验不同违反程度下处理效应的敏感性。从经验研究的角度来看,如果研究者认为处理后的混淆因子对处理组和控制组影响程度与处理前的影响程度差别不大,那么,可以选择相对偏离程度限制来构建稳健置信区间;如果研究者认为违反平行趋势的原因可能是由于处理组和控制组长期演化趋势的差异,那么,可以选择平滑限制来构建稳健置信区间。需要强调的是,研究者需要紧紧围绕所研究主题的经济社会制度背景来讨论可能造成平行趋势假设不满足的原因(Roth,2022)。只要选择了一种违反平行趋势的情形,研究者就可以执行不同的̅(或M)来进行平行趋势假设的敏感性分析,并报告处理效应不显著的平行趋势违反程度临界值水平。从目前的经验研究来看,Miller et al.(2021)、Ang(2021)、Clarke and Muhlrad(2021)、Biasi and Sarsons(2022)、Dustmann et al.(2022)、许文立和孙磊(2023,许文立、孙磊|市场激励型环境规制与能源消费结构转型——来自中国碳排放权交易试点的经验证据)均应用平行趋势敏感性检验来为处理效应可信度提供更多经验证据。
Hartman and Hidalgo(2018)还提出了一种处理前趋势等价性检验。传统的处理前趋势是通过检验一个参数,即表示处理组和控制组完美平行 ,不等0表示在一定程度上偏离了平行趋。也就是说,传统的处理前趋势检验为:θθ。如果研究者有足够大的样本,那么,一定的平行趋势偏离程度可能并不要紧。因此,更好的方式可能是,根据我们的专业知识、经济/制度背景等来引入一定程度的可信的偏离,这就是Hartman and Hidalgo(2018)提出的一种处理前趋势等价性检验:θτθτ,其中,τ表示平行趋势偏离程度,具体的应用参见Liu et al.(2022) 。
除此之外,研究者还建议使用不依赖于平行趋势的处理效应估计量,例如,Xu(2017)提出的交互固定效应反事实估计量,Athey et al. (2021)提出的矩阵完成估计量,以及Arkhangelsky et al.(2021)提出的合成双重差分估计量 。从应用文献来看,许文立和孙磊(2023,许文立、孙磊|市场激励型环境规制与能源消费结构转型——来自中国碳排放权交易试点的经验证据)也应用了合成双重差分(SDID)估计量来为处理效应提供了更多的经验证据。
下面,我们来看看美国医疗救助扩展对保险覆盖率的影响。
dins: 低收入、无子家庭有健康保险的份额;
yexp2: 医疗救助扩展的年份
2014年是初次处理时间,TWFE的方程设置为:
其中,如果第一次处理发生在2014年,D=1,否则为0。

从上图,我们可以看出,医疗救助计划扩围在处理前并不显著(95%),在处理之后,显著(95%)为正。通常,我们会到此为止,得到结论:医疗救助扩围对健康保险覆盖率有显著的正向影响,且处理前并无显著的趋势,处理前趋势检验通过,可以认为平行趋势有一定的经验证据支持。
但是这够了吗?完全不够,平行趋势本身是不可检验的。但是,我们可以思考一下,即使平行趋势不成立,或者放松一些平行趋势,要是这个时候,我们仍然可以得到“医疗救助扩围对健康保险覆盖率的正效应”,那么,我们的处理效应不是更加可信吗?这就是放松平行趋势假设的敏感性检验。现在QJE、AER《数量经济技术经济研究》很多文献都建议,在DID中使用平行趋势敏感性检验。
记住了:在进行敏感性检验之间,一定要做事件研究(目前,主流的事件研究命令都可以使用)。
接下来,我们要看看上述TWFE事件的结果:
从上述结果可以看出,我们用eventdd得到的事件研究窗口实际上处理前有11期(lead11-lead2,lead1),处理后2期(lag0-lag1),还包含常数项(_cons)。我们只关注-5到2的相对事件时间窗口,如上事件研究图所示。因此,我们关注的事件研究结果是从结果的第7个系数开始,到第12个系数。因此,在平行趋势敏感性检验的honestdid命令中,pre是从7开始,到处理前最后一期,也就是10,而post是从第11个系数开始,到12,即此时,平行趋势敏感性检验的命令为:
其中,mvec声明了平行趋势偏离程度
同时,我们还可以用图形表示上述敏感性结果:

上图的纵轴是平行趋势在一定程度上不满足时的处理效应稳健置信区间,横轴表示平行趋势不满足的程度。横轴最左边的original表示TWFE的平均处理效应,我们上述使用了处理后两期的处理效应,因此,红色竖线表示第一期的处理效应。而后面的蓝色线条则表示平行趋势偏离0.5倍、1倍、1.5倍和2倍时,处理后两期平均处理效应的置信区间。从这个图,我们可以很容易看出,即使处理后的平行趋势比处理前的平行趋势偏离程度高两倍,医疗救助扩围计划对健康保险覆盖率的效应仍然在95%的置信区间上显著为正。
也就是说,上述命令实际上是默认检验事件研究处理后第一个系数的稳健置信区间。有时候,我们得到的结果可以在处理后第一个系数并不显著,这个时候,用上述命令,得到的结果可能是对平行趋势偏离非常敏感。因此,我们要选择处理后显著的处理效应。这个时候我们可能要选择单一的处理后时期。例如,处理后第二期lag1的系数。

这个时候红色的线条就是处理后第二期的系数置信区间,它与TWFE事件研究的结果一致。我们来看看平行趋势偏离程度逐渐增大时,稳健置信区间,我们可以看到,当平行趋势偏离两倍时,医疗救助扩围计划对健康保险覆盖率的影响在95%下就不显著了。但我们仍然认为第二期的处理效应较为稳健,因为我们偏离1.5倍时仍然显著为正。
在上述代码中,特别需要注意的是,matrix l_vec=0\1这个选项。等号后面的0\1表示处理后两期,第一期的系数权重为0,第二期的系数权重为1。我们TWFE的事件研究处理后有多少期系数,我们就要写多少权重,并用斜杠隔开。如果我们设置两期的平均处理效应,那么,就应该是matrix l_vec=0.5\0.5:
此外,honestdid这个stata命令还可以配合异质性处理效应稳健估计量csdid、did_multiplegt、did_imputation使用。

北京友万信息科技有限公司作为 Stata 软件在中国的授权经销商及合作伙伴,拥有强大的售后服务团队,聚合国内一线Stata行业专家为客户提供优质的技术支持服务。已为国内数十所高等院校及科研院所完成了Stata软件采购计划,用户覆盖经济、管理、生物、历史、法学、劳动、人口、地理、环境、教育和心理学等各个学科门类。依托Stata 原厂及自身经验丰富的技术团队资源,从市场策略、销售模式和宣传力度上全面推广,得到了StataCorp LCC原厂的全面认可,并与国内重点高校实验室建立一对一的定点服务计划,树立了Stata软件在中国用户中的良好品牌形象。