ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

自变量、因变量、协变量:回归与因果推断中的变量角色辨析

自变量、因变量、协变量:回归与因果推断中的变量角色辨析 刚做数据分析那两年我最怕的不是写SQL、也不是调模型而是开会。产品经理说我们控制一下用户的活跃度运营说这个因变量换成转化率吧算法同事说把协变量加进去统计背景的Leader又冒出一句你这搞了个混淆变量。同一个字段四五种叫法来回飞散会后我经常得靠猜才能确认大家说的到底是不是同一列数据。后来项目做多了读过的论文、评审记录、复盘文档堆起来才慢慢摸清这些叫法背后的来路——自变量、解释变量、因变量、响应变量、协变量它们不是简单的同义词替换每一个词都自带一套建模假设、一种场景语境、甚至一种学科立场。你把它们当同义词混着用短期没人挑你毛病一旦进入因果讨论、实验设计或者跨团队评审术语错位就会直接变成结论错位。这篇内容我打算把这件事彻底捋一遍这些变量概念分别从哪里来、各自强调什么、在什么场景下该用哪个词、以及真实项目里最容易踩的几类坑。适合刚入行的分析师、转行做数据的产品和运营、以及需要和数据同学对齐口径的工程同学。不需要你有很深的统计学基础但如果你想真正搞懂回归、实验分析、因果推断背后的语言体系这些概念是绕不过去的第一道门槛。1. 为什么同一个变量会有这么多名字1.1 从中学函数到统计建模的语义漂移大多数人第一次接触自变量和因变量是在中学数学课上。函数 y f(x)x 叫自变量y 叫因变量老师给的记忆口诀是x 自己变y 跟着变。这个定义简洁但它埋了一个后来会持续困扰你的隐含前提x 是自由的想取什么值就取什么值。真实的数据场景里x 一点不自由。做用户留存分析时你的 x 是用户注册渠道、首日使用时长、设备型号这些值不是你选的是观测到的做A/B测试时你的 x 是分组标记这个确实是你分配的但它只有0和1两个值。也就是说数学语境里的自变量强调的是一种函数依赖关系而统计建模语境里的解释变量强调的是我用它来解释y的变异。前者描述数学结构后者描述研究意图气质完全不同。语义漂移的第二层来自学科分化。数学系出身的同学习惯说自变量/因变量统计系和计量经济学背景的人更爱说解释变量/被解释变量生物医学和临床试验领域偏爱响应变量而机器学习的文献里干脆叫特征/标签。这些词指向的对象基本重叠但它们各自的默认语境不一样。你跟一个做临床试验的同事说因变量他可能要先愣一下然后翻译成结局指标才能接上话。理解了这层漂移你就会明白为什么术语统一这件事在跨职能团队里那么难——不是谁不专业而是每个人脑子里的默认坐标系不同。我的做法是在项目初期就维护一份术语对照卡放在共享文档里把团队里所有出现过的叫法映射到统一的字段名上。这个成本很低但能省掉后面无数次你说的是哪个变量的扯皮。1.2 三种主流视角下的命名体系把这些叫法按视角归类会清晰很多。我一般分成三套体系它们各自解决的问题不一样。数学与统计建模视角关心的是变量之间的数量关系。核心词是自变量、因变量、解释变量、响应变量、预测变量。这一套的目标是拟合一个函数关系回答x 变化一个单位y 平均变化多少。回归分析、方差分析都属于这一脉。实验设计视角关心的是我主动施加了什么观测到了什么。核心词是因子、处理、水平、实验单元、响应。这里的关键词是主动操纵——因子是研究者可以设定的条件比如按钮颜色、推荐算法版本、优惠券面额。实验设计里很少说自变量因为自这个字容易误导因子是被研究者指定的不是自己变的。因果推断视角关心的是如果我干预 xy 会怎么变。核心词是处理变量、结果变量、协变量、混淆变量、工具变量、中介变量、对撞变量。这一套的野心最大它不满足于相关关系要的是反事实推断。也正是在这套体系里协变量这个词才真正有了精确的、不可替代的位置。你看同一个用户首日使用时长在建模视角里它是解释变量在实验视角里它是处理前的基线指标在因果视角里它是协变量或者潜在的混淆变量。身份取决于它在整个研究设计里扮演的角色而不取决于它本身是什么。1.3 一张表把所有别名对齐为了让你一眼看清对应关系我把常见叫法和它们的归属整理成下面这张表。这张表我建议你存下来跨团队沟通时直接甩过去比解释十分钟管用。常见叫法英文常见表达主要视角角色定位典型场景自变量independent variable数学/统计用来解释或预测的输入函数关系、回归方程因变量dependent variable数学/统计被解释、被预测的输出回归方程左侧解释变量explanatory variable计量/统计强调解释变异的来源经济学实证研究响应变量response variable实验/生物统计强调对处理的响应临床试验、A/B测试预测变量predictor / feature机器学习输入特征模型训练因子 / 处理factor / treatment实验设计研究者主动操纵的条件随机对照实验结果变量outcome variable因果推断关注的最终结果效应评估协变量covariate因果推断/实验处理前、需调整的伴随变量协方差分析、CUPED控制变量control variable通用固定住以排除干扰的变量多元回归混淆变量confounder因果推断同时影响处理与结果的变量辛普森悖论中介变量mediator因果推断处理影响结果的中间通路机制分析调节变量moderator因果推断改变处理效应强弱的变量异质性分析这张表里有两个词经常被混用需要单独强调控制变量和协变量。控制变量是一个更宽泛的日常说法你想固定住的任何东西都可以叫控制变量协变量则是一个有明确技术含义的词特指在模型中被纳入调整、且理论上应当不受处理影响的变量。这个区别后面第2章会详细展开。2. 核心变量逐个拆解与辨析2.1 自变量与解释变量同源但语气不同这两个词在绝大多数场合可以互换但语气差别值得品一下。自变量来自数学传统它默认的是函数关系强调的是数学上的独立性解释变量来自统计传统它默认的是变异解释强调的是我用它来消化 y 的波动。你在写代码注释时用哪个都行但在写研究报告时用解释变量通常更稳妥因为它不暗示任何因果方向。这里有个特别容易翻车的点中文的自变量里的自和独立这个词在英文里的对应关系经常让人误以为自变量之间必须相互独立。实际上完全不是。多元回归里自变量之间高度相关是常态这种情况叫多重共线性。它的后果是系数估计变得不稳定——你今天加一个变量另一个变量的系数符号可能就翻转了。多重共线性怎么判断我一般看两个指标。一是方差膨胀因子VIF经验阈值是大于10就值得警惕大于5可以关注二是相关矩阵两两相关系数绝对值超过0.8就要留意。但要注意多重共线性影响的是系数的可解释性不影响整体预测能力。如果你的目标是预测精度而不是解释系数含义其实可以睁一只眼闭一只眼。处理共线性的常规手段有几个删掉冗余变量、把相关变量合成一个综合指标比如用主成分分析或者改用正则化方法岭回归、Lasso。岭回归的思路是给系数加一个惩罚项把不稳定的估计往0的方向拉代价是引入一点偏差换来方差大幅下降。这个权衡在样本量小、变量多的时候特别值。注意不要为了追求自变量之间不相关而机械删变量。如果两个变量业务含义不同、都重要删掉任何一个都会带来遗漏变量偏误这个代价往往比共线性更大。2.2 因变量与响应变量谁在响应谁因变量和响应变量的关系比自变量那一组更微妙。因变量是数学传统的叫法它强调依赖响应变量是实验科学的叫法它强调响应——响应什么响应你施加的处理。这个差别在实验场景里非常关键。在一个A/B测试中你给实验组用户推了新版本推荐算法观测到的次日留存率就是响应变量。用响应这个词天然携带了我的干预导致了变化这层含义用因变量则只说明它是个被解释的量不涉及因果主张。所以在写实验报告时我更倾向用响应指标或者直接叫结果指标避免用因变量因为后者容易让人误以为你已经证明了因果关系。还有一个实践上的坑因变量必须是在处理之后测量的。如果你把处理前测的指标当作因变量那你测到的差异很可能来自分组前的基线不平衡而不是你的干预。这个错误在快速迭代的产品团队里非常常见——直接拿用户在实验期间的活跃天数当响应变量却忘了这个指标里混了实验前就存在的差异。正确的做法是响应变量严格定义为处理窗口内的观测而任何处理前的信息只能作为协变量进入调整。这条线一旦划清楚很多实验结论反复横跳的问题会自动消失。2.3 协变量最容易被误用的一个词协变量covariate大概是这几个词里技术含量最高、误用率也最高的一个。它的原始出处是协方差分析ANCOVA指的是在比较组间差异时为了提高检验效能、控制已知变异来源而纳入的连续变量。协变量有两个核心性质缺一不可第一它在处理发生之前就已经确定或测量。这是它的立身之本。你不可能把处理之后的变量当协变量那叫后处理变量纳入它会引入严重偏差。第二它影响结果变量但理论上不受处理影响。如果它同时影响处理分配那它其实就是混淆变量需要额外的手段来处理比如倾向得分匹配、逆概率加权。举个具体例子。你想评估某个新功能对用户留存的影响做了一次随机分流。用户的历史活跃度就是一个典型协变量它在实验开始前就存在强烈影响留存而且你的随机分流保证了它和分组基本无关。把它放进模型能大幅提升估计精度。这就是CUPED利用实验前数据做方差缩减的底层逻辑。CUPED的公式不复杂值得记住# CUPED 方差缩减的核心计算 # Y: 实验期间的响应指标 # X: 实验前的协变量如实验前7天活跃天数 # 先估计 theta import numpy as np theta np.cov(Y, X)[0, 1] / np.var(X, ddof1) # 调整后的响应 Y_adj Y - theta * (X - X.mean()) # 对 Y_adj 做组间比较方差会显著降低theta 就是协方差除以协变量方差等于用协变量去预测响应变量的回归系数。调整后的指标 Y_adj 均值不变但方差变小同样的样本量能检出更小的效应。实测下来如果协变量和响应变量相关性在0.5左右方差能压缩20%以上等于白捡了样本量。但协变量不是想加就加。加的协变量太多、太杂会稀释效应、增加过拟合风险加的协变量如果是后处理变量那更是直接污染结论。我的经验是协变量的选择应该由因果图DAG驱动而不是由特征重要性排序驱动。这句话怎么理解后面第3章会展开。再补充一个容易搞混的概念机器学习圈里的协变量偏移covariate shift。那个协变量指的是模型输入特征的分布跟这里说的协变量完全不是一个层面的东西。协变量偏移说的是训练集和线上数据的特征分布 P(X) 变了而条件分布 P(Y|X) 没变。这个问题在推荐和风控场景里很普遍处理思路是重加权或者在线更新跟因果推断里的协变量调整没有直接关系。2.4 一张对照表看清能不能动、什么时候测变量角色的判定我觉得最实用的两个维度是谁能操纵它、它什么时候被测量。把这两个维度画出来大部分混淆就能避免。变量角色研究者能操纵吗测量时点典型处理方式处理变量/因子能处理时点随机分配或按设计施加协变量不能通常是观测的处理前纳入模型做调整混淆变量不能处理前必须调整否则有偏中介变量不能被处理影响处理后不能作为控制变量调节变量不能处理前属性处理前以交互项形式纳入响应变量/结果变量不能处理后建模的目标不做调整这张表里最容易出错的是中介变量那一行。很多人做回归时出于控制得越干净越好的直觉把所有能拿到的变量都塞进去结果把中介变量也塞进去了效应被吃掉了大半然后得出这个干预没用的错误结论。这个错误我在至少三个项目里见过每次都要花不少时间往回拉。3. 那些不在标题里但绕不开的变量角色3.1 控制变量与协变量的边界在哪前面提到控制变量和协变量容易被混用。两者的本质区别在于控制变量是一个口语化的泛称协变量是一个有严格假设的技术术语。在多元回归里你把性别、年龄、城市等级放进模型可能因为你想控制住这些因素的影响那这套说法叫控制变量完全没问题。但如果要讨论这个变量是否该纳入因果调整集你就必须回到协变量的技术标准它是不是处理前的、是不是不受处理影响的、它在因果图里处于什么位置。这里有个实用的判断流程我平时就是这么过的第一步问这个变量是在处理之前测的吗。不是直接排除在协变量之外。第二步问它同时影响处理和结果吗。如果是它是混淆变量必须调整而且要考虑是否需要倾向得分匹配这类专门方法。第三步问它只影响结果跟处理无关吗。如果是它是标准协变量纳入模型能提升精度属于锦上添花。第四步问它是被处理影响、又影响结果的吗。如果是它是中介变量千万不要当控制变量塞进去。这四问走完一个变量该不该进模型、以什么身份进基本就清楚了。我强烈建议你把这个流程写在团队的数据分析规范里它能挡掉很多隐性的分析错误。3.2 中介变量与调节变量机制与边界中介变量和调节变量解决的是两类完全不同的问题但中文名字太像经常被搞混。中介变量回答为什么。它处在处理和结果之间的因果通路上。比如你发了一张优惠券处理用户到店了中介最后下单了结果。优惠券的效果有一部分是通过到店这个中间环节实现的。中介分析的目的就是拆解效应——直接效应有多少通过中介传导的间接效应有多少。调节变量回答对谁更有效。它不改变因果链的长度而是改变因果链的强度。同样一张优惠券对价格敏感型用户效果很强对价格不敏感的用户几乎无效那价格敏感度就是一个调节变量。在模型里调节效应通过交互项来体现比如处理标记乘以价格敏感度。中介和调节在模型形式上的区别也很直观。中介分析通常要建两个方程一个用处理预测中介一个用处理和中介一起预测结果。调节分析就是在主模型里加一个乘积项。很多人直接把交互项叫中介这是术语层面的硬错误会导致审稿或评审直接被驳回。实操中还有一个容易忽略的点中介变量本身必须是可干预的、有明确时间顺序的。如果中介和结果是在同一时点测的你根本分不清谁先谁后中介分析就失去了意义。所以做机制分析时实验设计上要留出让中介变量先于结果发生的观测窗口。3.3 混淆变量与对撞变量一正一反的两个陷阱混淆变量是大家比较熟的陷阱但它在因果推断里的地位值得再强调一次混淆变量是必须控制的因为它同时影响处理和结果会制造虚假的关联或者掩盖真实的关联。经典的例子是辛普森悖论——整体看A方案转化率更高分渠道看每个渠道都是B方案更高。原因就是渠道这个混淆变量在两组之间的分布极度不均衡。对撞变量则正好相反它是绝对不能控制的。对撞变量的定义是它同时被处理和结果影响。你控制它反而会在处理和结果之间制造出原本不存在的关联。这个概念很多人第一次听会转不过弯。我用一个生活化的类比解释假设聪明和颜值之间本来没有关系。如果某个人既聪明又好看他更容易成为明星因为两个条件都满足。现在你只看明星这个群体会发现明星里聪明和颜值呈现负相关——因为长得特别好看的人不需要那么聪明也能当明星。这里的成为明星就是一个对撞变量你把它固定住只看明星就凭空创造了相关性。在真实项目里对撞变量经常以筛选条件的形式出现。比如你只分析完成过支付的用户而完成支付同时受营销触达和用户本来就有需求影响那你就把对撞变量当成了分析样本来限制得出的结论可能有严重偏差。这类问题在用户行为分析里非常隐蔽因为筛选数据的动作看起来特别自然。注意不是所有筛选都是错的。判断标准是——你筛选的依据是否同时受到处理和结果的影响。如果是慎用如果不是一般没问题。3.4 用因果图把变量角色画出来说了这么多角色落到实操层面我推荐的办法是画因果图DAG。不需要多复杂就是把处理、结果、以及你关心的所有变量画成圆圈用箭头表示谁影响谁然后按三条规则判断箭头从处理指向结果的通路上任何从结果指向它的箭头的变量都是对撞变量不能控制。同时有箭头指向处理和结果的是混淆变量必须控制。只在处理到结果的通路上处理 → 它 → 结果的是中介变量控制它会吃掉效应。这张图的价值在于它把该控制什么从直觉变成了可推理的过程。我见过太多分析报告结论不可靠不是因为方法用错而是因为在设计阶段就没想清楚变量关系。画图的成本可能就半小时但它能救你一整轮的返工。4. 把变量角色落到真实场景里4.1 场景一A/B测试中的变量分配A/B测试是这几个概念最密集的战场。我把一个典型的电商首页改版实验拆开看。处理变量就是分组标记取值是实验组和对照组。注意这里的处理是研究者随机分配的所以它是所有变量角色里唯一能动的那个。响应变量是实验窗口内的核心指标比如下单转化率。它必须在处理之后测量而且要和实验窗口严格对齐。协变量是实验前的一系列基线指标比如用户过去30天的下单次数、活跃天数、加购率。这些变量在实验开始前就存在随机分流保证了它们和分组独立纳入模型可以显著提升灵敏度。前面提到的CUPED就是在做这件事。这里有个实操细节协变量要在实验开始前就确定好不能等实验跑完再挑。为什么因为实验跑完后你看着结果去挑哪些协变量能让效应更显著这是在用数据做选择会引入多重比较问题把假阳性率大幅推高。正确做法是在实验设计文档里把协变量、响应变量、分析口径全部固化下来。另一个细节是分流单元的确认。如果处理和响应都在用户粒度那协变量也应该是用户粒度的如果处理是城市粒度比如某地区上线了新功能而响应是用户粒度的那协变量要考虑城市层特征同时要用聚类稳健标准误。这个层级不匹配的问题在区域性灰度实验里非常常见。4.2 场景二用户流失预测建模预测建模是另一套语言体系这里自变量通常叫特征因变量叫标签。但变量角色的思考方式依然适用。假设你要做一个未来30天是否流失的预测模型。标签是从未来30天这个窗口里来的特征必须严格来自观察窗口也就是当前时点之前的数据。这条时间线一旦错位就会出现数据穿越——模型在训练时偷看了未来线上表现一塌糊涂。特征的构造要遵循可用时间原则。比如最近一次登录距今的天数这个特征必须用观察截止日往前算不能用整个数据集的最新登录时间。我见过最离谱的一次穿越是特征表里用了用户历史总订单数但订单表在加工时包含了预测窗口内的订单。这种错误在离线评估里几乎看不出来AUC还特别漂亮一上线就现原形。在流失预测里还有一些变量角色是需要额外注意的混淆变量用户等级既影响触达强度又影响流失概率。如果你要评估触达对流失的因果效应必须调整它。中介变量用户活跃度下降可能是触达带来的中间结果。如果你把它当特征放进模型去预测流失模型表现会很好但用来评估触达效果时会严重低估。对撞变量比如用户是否点击过触达消息。这个变量同时被触达和用户意愿影响是典型的对撞。把它当特征会引入选择性偏差。所以哪怕你只是做一个纯预测任务理解变量角色也能帮你避开很多隐蔽的坑。预测任务可以不管因果但数据的时序结构和变量间的依赖关系必须尊重。4.3 场景三房价回归里的变量分工再换一个更传统的场景——房价预测。这个例子足够简单适合用来练手。响应变量是成交价或者挂牌价取决于你想回答什么。挂牌价反映的是卖方预期成交价反映的是市场公允值两者不能用同一个模型混着解释。解释变量是面积、房龄、楼层、朝向、装修程度这些直接影响价格的属性。协变量是所在小区、行政区、周边配套这些位置相关的信息。在很多分析里位置信息会被当成解释变量但从模型角度看它更像是一类需要控制住的伴随变量因为你的关注点通常是同等位置下面积每增加一平米价格变化多少。把位置作为协变量纳入得到的面积系数才是有意义的对比。代码上可以用statsmodels的公式接口一眼看清角色分配import statsmodels.formula.api as smf # price: 响应变量 # area, age, floor: 解释变量 # district, school_score: 协变量 model smf.ols( log_price ~ area age floor C(district) school_score, datadf ).fit(cov_typeHC3) # 异方差稳健标准误 print(model.summary())这里我把价格做了对数变换原因是房价分布右偏严重取对数后更接近正态残差更规整。C(district)表示把区级作为分类变量处理会生成一组哑变量。cov_typeHC3是异方差稳健标准误房价数据里异方差几乎是必然的——高价房的波动绝对量更大不处理会影响显著性判断。跑完模型后系数的解读要小心。面积系数是在其他变量不变的前提下面积每增加一个单位对数价格平均变化多少要想还原成百分比需要做指数变换。这个细节很多人会漏直接把对数系数当百分比念误差在小系数下不大系数大了就明显了。4.4 变量选择的一个务实流程把上面三个场景的经验汇总我总结出一套自己常用的变量选择流程你可以直接抄第一步画因果图把处理和结果摆好把已知的影响关系标出来。这一步不涉及数据纯逻辑推演。第二步按角色给变量分类。混淆变量必进协变量择优进中介变量不进对撞变量坚决不进。第三步看数据层面的技术问题。检查共线性、缺失率、分布偏态。缺失率超过30%的变量先评估缺失机制不要无脑填充。第四步做敏感性分析。把关键变量加进去、拿出来看核心系数是否稳定。如果换个组合结论就翻说明结果不稳健需要在报告里明确说明。第五步固化口径。把最终的变量清单、变换方式、分析窗口写进文档后续任何人复现都用同一套。这五步走完你的分析基本就站得住了。它不复杂但能挡掉大部分低级错误。5. 常见踩坑记录与排查清单5.1 把中介变量当控制变量效应凭空消失这是我见过频率最高的错误没有之一。典型场景是评估一个运营活动的效果分析同学为了控制得更严谨把活动期间的用户行为指标比如活动页访问次数、领券张数也放进了回归模型。结果活动系数从显著变成不显著然后团队得出活动没效果的结论。问题在哪活动页访问次数和领券张数都是被活动影响的中介变量。你把中介路径堵死了剩下的自然只有很弱的直接效应。正确的做法是把这些变量单独拿出来做中介分析或者在主模型里明确排除。排查方法很简单把每个待纳入变量按时间戳检查一遍凡是发生在处理之后的都要问一句它是不是被处理影响的结果。如果是先放到一边。5.2 变量角色错位导致结论反向第二类高频问题是对撞变量。前面讲过原理这里说一个具体表现。假设你分析使用某个功能对付费意愿的影响但你只抽取了过去一个月访问过App的用户作为样本。如果访问App同时受功能使用和付费意愿影响那这个筛选条件就是对撞变量会造成功能使用和付费意愿之间出现虚假的负相关。这类问题的排查要点是检查你的样本筛选条件是不是同时被处理变量和结果变量影响。如果是要么调整筛选范围要么在报告里明确说明这个局限性。5.3 混淆变量没调整辛普森悖论找上门第三类是混淆变量遗漏。这个最容易在分层分析里暴露。假设你发现A渠道的转化率整体高于B渠道但分新老用户看两个渠道在新用户和老用户里的转化率都是B更高。原因就是A渠道的新用户占比特别高而新用户整体转化率更高。排查方法做分层分析看整体结论和分层结论是否一致。如果出现反转几乎可以确定有强混淆变量在起作用。这时候要把混淆变量纳入模型或者用倾向得分匹配做调整。5.4 问题速查表把上面这些整理成一张表方便你在实际分析里对照排查。现象可能的根因排查方法修复方向核心变量系数符号与业务直觉相反遗漏混淆变量或存在共线性检查相关矩阵、做分层分析补入混淆变量、处理共线性加了若干变量后核心效应消失把中介变量当控制变量逐变量检查时间戳与因果关系剔除中介变量单独做机制分析整体与分层结论方向不一致存在强混淆变量按可疑变量做分层纳入模型调整或做匹配离线模型AUC很高线上很差特征穿越或对撞变量筛选检查特征可用时间与样本筛选条件重构特征、调整样本定义实验结论反复摇摆响应变量或协变量口径不固定检查分析文档是否固化事前固化口径禁止事后挑选协变量调整后效应变大且不合常理协变量本身受处理影响后处理变量核对协变量测量时间只保留处理前变量5.5 几条我踩过坑才明白的经验第一条术语混乱本质上反映的是设计没想清楚。如果团队在评审时对某个变量该叫什么争执不下八成是因为这个变量在研究设计里的位置本身就没定。这时候与其争术语不如先把因果图摊开把角色定下来术语自然就统一了。第二条不要迷信变量越多越好。我刚入行时有段时间特别迷恋把所有能拿到的字段都塞进模型觉得这样信息利用充分。后来发现每多一个变量就多一个引入偏差的机会。协变量选择要克制宁可少而准。第三条能用实验解决的尽量别用观测数据做因果推断。随机分配是唯一能一次性解决混淆变量的手段。观测数据里的调整方法倾向得分、断点回归、工具变量都有各自的假设一旦假设不成立结论就是不可靠的。这不是说观测研究没价值而是说你要清楚自己承担了多少假设风险。第四条分析文档的变量清单一栏不要只写变量名要写角色和测量时点。这个习惯我是被坑过之后才养成的。表格里多两列写清角色协变量测量时点实验前7天能避免后来接手的人把中介变量当协变量重复一遍你的错误。6. 一点后续延伸的方向如果你想把这些概念真正内化成直觉我建议按这个顺序继续走先用手头的一个真实数据集把同一个变量分别按解释变量协变量中介变量三种身份跑一遍模型观察系数怎么变。这个练习的冲击力比读十篇文档都大你会亲眼看到同一个变量换个身份结论能差到哪里去。再往上一步去读点因果推断的入门材料重点搞明白后门准则和前门准则这两个调整规则。它们是判断该控制哪些变量的通用工具比记具体的变量类型更根本。工具变量、双重差分、断点回归这些方法本质上都是在不同约束下寻找可行的识别策略。最后提醒一句这些术语的边界在学术界本身也有争论比如协变量在流行病学和经济学里的用法就略有差别。所以遇到分歧时别急着争论谁对谁错先确认对方在什么框架下说话。搞清楚坐标系比背定义有用得多。
返回列表