心理学日课

从科学方法出发,走到认知、发展、人格、情绪、关系、心理健康与应用。每天约 40 分钟。

证据标签: 稳固 多次独立重复或元分析支持 有争议 结果不一致或解释有分歧 已被质疑 大规模重复失败或原作者撤回

模块 0 · 科学思维2026-09-30约 40 分钟▶

Day 2 · 实验设计:自变量、随机分配与混淆变量

要推断“是 A 导致了 B”,关键不只是测到了差异,而是设计让除了你操纵的那一点之外,各组在其他方面平均相同——这靠操作定义、随机分配,以及对混淆变量与期望效应的主动防范。

1一句话核心

要推断“是 A 导致了 B”,关键不只是测到了差异,而是设计让除了你操纵的那一点之外,各组在其他方面平均相同——这靠操作定义、随机分配,以及对混淆变量与期望效应的主动防范。

2概念讲解

1. 从“相关不等于因果”到“怎样才能推断因果”

昨天我们说到:相关研究只能告诉我们变量一起变化,推断因果需要实验——研究者主动操纵某个变量,并通过随机分配让各组在其他方面平均而言相同。

今天把实验拆开:什么叫“操纵”?什么叫“随机分配”?为什么做完实验,别人仍可能说“你测到的差异其实不是因为你以为的那个原因”?答案就藏在操作定义、自变量与因变量、控制变量、混淆变量、内部效度与外部效度这些概念里。

2. 操作定义:把模糊概念变成可测量的东西

科学研究不能停在“压力”“智能”“吸引力”这类日常说法上——每个人对它们的理解可能都不一样。操作定义(operational definition)指:用一套具体的、可观察或可测量的程序,来界定一个概念在本研究中“是什么”。

例如:“压力大”可以操作定义为“过去一周 Perceived Stress Scale 得分 ≥ 某阈值”,也可以是“在公开演讲前即刻的心率”;“记忆好”可以是“听完词表后立刻正确回忆的个数”。不同操作定义测的未必是同一件事——所以写报告时必须写清楚,读者才能判断你测的到底是不是你声称的那个概念。

操作定义不是“概念的唯一真相”,而是本次研究里可检验的约定。换一种操作定义,结论可能改变——这不是耍赖,而是提醒我们:抽象概念需要通过具体测量进入科学。

3. 自变量、因变量与控制变量

一次典型的实验里,至少要分清三类变量:

  • 自变量(independent variable, IV):研究者主动操纵的变量。它是“原因候选”。例如:是否服用某药、是否收到积极期望标签、界面按钮是红色还是蓝色。
  • 因变量(dependent variable, DV):研究者测量的结果变量。它是“效果候选”。例如:症状评分、测验成绩、点击率。
  • 控制变量(control variables):研究者希望各组保持一致、或在分析中加以统计控制的因素,以免它们干扰因果解释。例如:测验时间、指导语措辞、屏幕亮度。
三类变量对照
研究者做什么例子(睡眠与记忆)
自变量操纵(制造不同水平)随机安排:睡足 8 小时 vs 只睡 4 小时
因变量测量结果次日词表回忆正确数
控制变量保持一致或加以控制词表材料、测验时间、咖啡因摄入规则

记一个口诀:自变量是你改的,因变量是你看的,控制变量是你尽量让它别乱的。

4. 实验组与对照组:比较才产生意义

单独给一群人做干预再测结果,往往说不清变化是不是干预造成的——时间流逝、练习效应、自然好转都可能“看起来像有效”。因此实验通常至少有两组:

  • 实验组(experimental group):接受研究者感兴趣的处理(treatment)。
  • 对照组 / 控制组(control group):不接受该处理,或接受一个对照处理(如安慰剂、标准流程、另一种版本)。

对照组不是“被忽略的人”,而是让因果解释成立的基准线。没有可比的对照,你就很难知道差异来自哪里。

5. 随机分配:为什么它是推断因果的关键

把人分进实验组还是对照组,不能按“谁方便”“谁自愿”“谁看起来更适合”来分——那样两组从一开始就可能系统不同。随机分配(random assignment)指:用随机程序(掷硬币、随机数)决定每个人进哪一组,使已知与未知的个体差异在组间平均而言趋于平衡。

注意两件常被混为一谈的事:

  • 随机分配:解决的是“各组是否可比”,服务内部效度(你能否说差异是由操纵造成的)。
  • 随机抽样:解决的是“样本是否代表总体”,服务外部效度(你能否把结论推广到更大人群)。
参与者池 随机分配 实验组 · 接受处理 对照组 · 对照处理 比较因变量 组间差异 → 归因于 IV 随机分配的目标:除自变量外,两组在其他方面平均可比
随机分配并不保证每一对个体完全相同,但在样本量足够时,它让已知与未知混淆因素在组间趋于平衡。

一项研究可以有随机分配却没有随机抽样(很多实验室实验如此):它仍可能很适合推断因果,只是推广时要谨慎。反过来,大规模问卷调查即使抽样很好,若没有随机分配的操纵,仍难直接下因果结论。

6. 混淆变量与内部效度

混淆变量(confound)指:与自变量一起系统变化、因而也可能解释因变量变化的额外因素。一旦存在混淆,你就说不清结果到底是自变量造成的,还是那个“跟着变”的东西造成的。内部效度(internal validity)问的是:在这项研究内部,我们有多大把握说“是自变量导致了因变量的变化”?混淆越多、控制越差,内部效度越低。

常见混淆来源包括:两组接受不同时长的关注、不同的指导语气、不同的时间段(一组早上测、一组晚上测)、主试对某组更热情、测量工具本身在两组使用方式不一致等。

自检句:除了我声称的那个自变量,还有没有任何别的东西也在两组之间系统不同?有的话,因果箭头就可能指错对象。

7. 期望效应与双盲:人不是试管

心理学实验里的“材料”常常是人——参与者会猜研究目的,主试也会不知不觉流露期望。这类因素本身就能改变行为,从而变成混淆。

实验者期望效应(experimenter expectancy effect):主试对结果的预期,可能通过语气、表情、无意中的提示,影响参与者的表现。罗伯特·罗森塔尔(Robert Rosenthal)在 1960 年代用一系列研究系统展示了这一点;后来他与杰 Jacobson 把类似逻辑延伸到教室情境(见下方研究卡片)。安慰剂效应(placebo effect):仅仅因为相信自己接受了有效处理,结果就可能朝预期方向变化。在药物与干预研究中,常用安慰剂对照把“真处理的特异作用”与“被关注、被期望、仪式感”等区分开。

防护工具是盲法:

  • 单盲:参与者不知道自己在实验组还是对照组。
  • 双盲:参与者与直接接触他们的主试/评估者都不知道分组(由第三方编码)。这样双方的期望都不容易系统性地“帮”某一组出成绩。

不是所有心理学研究都能做双盲(例如心理治疗中治疗师通常知道自己在用哪种疗法),但研究者仍应尽量让结果评定者保持盲态,并预先设定客观指标。

8. 外部效度:推得远,往往控得松

外部效度(external validity)问的是:结论能推广到哪些人、哪些情境、哪些操作定义?实验室里控制得越严,内部效度往往越高,但情境也可能越“不像日常”,推广时就要更小心。

这不是让你鄙视实验室研究。内部效度薄弱的研究,推广得再远也只是在推广一个不可靠的因果故事。更健康的态度是:用高内部效度的研究建立机制,再用现场实验、多情境重复去检验边界条件——Donald Campbell 与 Julian Stanley(1963)以来的方法学传统,核心就是在这种取舍中把威胁一一列清。

内部效度 vs 外部效度(实用对照)
核心问题常见威胁增强办法
内部效度差异真是 IV 造成的吗?混淆、选择偏差、期望效应、测量不一致随机分配、对照、盲法、标准化流程
外部效度能推广到谁、何种情境?样本特殊、情境人工、操作定义过窄多样本、现场实验、概念重复与多操作定义
考试与实务都爱考的一对概念:随机分配 → 内部效度;随机抽样 → 外部效度/代表性。两者解决的问题不同,不能互相替代。

9. 把整条链串起来:一个最小检查清单

读到或设计一项“实验”时,可以按顺序问:

  1. 自变量是什么?有没有清晰的操作定义?
  2. 因变量怎么测?指标是否事先确定,还是事后挑显著的那个?
  3. 有没有恰当的对照组?
  4. 分组是否随机分配?若否,组间基线是否可能系统不同?
  5. 有哪些可能的混淆?流程是否标准化?
  6. 参与者与主试的期望是否被盲法或其他方式限制?
  7. 样本与情境支持怎样程度的推广?结论有没有说过头?

3经典研究与人物

教室中的期望效应(Pygmalion in the Classroom)Robert Rosenthal & Lenore Jacobson · 1968有争议

做了什么在一所小学中,研究者对儿童做智力测验后,随机抽取约 20% 的学生,告诉教师这些孩子在来年会“智力猛长”(实际是随机标签,与真实分数无关)。数月后再测智力与学业表现。

发现原书报告:被标记为“即将绽放”的学生,尤其低年级,在某些智力测验增益上高于未被标记的同学。作者将其解释为教师期望通过互动传递,影响了学生表现。

证据说明该研究在教育与社会心理学中影响极大,但也长期受到方法与重复方面的批评(如测验选择、统计分析、效应是否稳健等)。后续文献对“教师期望能否稳定改变标准化智力分数”分歧明显;较稳妥的共识是:期望可能影响互动与机会分配,但对 IQ 分数的戏剧性效应不宜当作已确立事实。本课把它当作理解期望效应与研究争议的案例,而非板上钉钉的效应量来源。

实验者期望效应(实验室中的“自我实现预言”)Robert Rosenthal · 1960 年代稳固

做了什么罗森塔尔在动物与人类实验中系统操纵主试对结果的预期(例如告诉不同主试“这些大鼠更聪明”或暗示参与者会有某种表现),同时保持真实刺激材料相当。

发现主试的预期常能在结果上留下痕迹:即使程序看似相同,期望组仍可能出现符合预期的偏向。这说明“主试也是实验装置的一部分”。

证据说明实验者期望作为方法学威胁已被广泛接受,并直接推动了标准化脚本、自动化呈现与盲法的普及。具体效应大小随情境而异,但“需要防范主试期望”已成为良好实验实践的一部分。

双盲安慰剂对照的逻辑(随机对照试验)临床医学与方法学传统(如随机对照试验 RCT 规范) · 20 世纪中叶以降稳固

做了什么评价干预是否有效时,将参与者随机分配到真处理或外观相似的安慰剂(或标准治疗),并尽量使参与者与结果评定者都不知道分组。

发现该设计把“处理的特异作用”与自然病程、回归均值、安慰剂与期望等因素分开,是医学与干预评价中推断因果的金标准框架之一。

证据说明安慰剂效应本身真实存在且机制复杂(期望、学习、医患互动等),双盲 RCT 并不是否认安慰剂不重要,而是防止把安慰剂与非特异因素误当成处理本身的效力。心理学干预因难以对治疗师完全双盲,常退而求其次:盲态评定、活跃对照、预注册结局指标。

准实验与内部效度威胁的系统清单Donald T. Campbell & Julian C. Stanley · 1963稳固

做了什么在《Experimental and Quasi-Experimental Designs for Research》中,系统区分真实验与准实验,并列举历史、成熟、测验、仪器、选择、流失等对内部效度的威胁。

发现没有随机分配的“前后测对比”或“完整群体对比”,往往无法排除多种替代解释;设计的价值取决于它能挡掉哪些威胁。

证据说明该框架是心理学与教育学方法课的标准内容,后续由 Cook、Shadish 等人扩展,但核心问题意识(先问内部效度)一直适用。

4人际中怎么用

期待与关系你对TA的标签,可能悄悄改变互动

一旦认定“他就是懒”“她就是冷漠”,你的语气、解释空间和机会分配可能跟着变——对方感受到后,行为也可能朝标签靠拢。这不必夸大成“期望万能”,但值得自检:我最近有没有只收集符合标签的证据?有没有少给对方一次被看见的机会?

沟通把抱怨改成一个可检验的小实验

与其争论“你根本不在乎”,不如约定一个可观察的改变(操作定义):例如“这周我提前一天说计划,你是否在当天晚上 10 点前回复可行/不可行”。这就是在关系里做微型对照:改变一个自变量,看因变量是否变化。

冲突分清“处理”和“被关注”

对方道歉、送礼物或突然温柔,情绪常会好转——其中有一部分可能是“被看见”的安慰剂式力量,不等于深层问题已解决。可以感激当下的修复,同时问:若没有礼物、只谈具体行为约定,关系是否仍改善?避免把仪式感误当成结构改变。

自我觉察当你当“主试”时,留意自己的期望

劝朋友分手、劝家人相亲、劝同事跳槽时,你已经有了预期答案。谈话中你可能不知不觉只抛支持自己立场的问题。试着先写两列:支持与反对各三条,并主动问一句可能推翻你建议的问题。

5工作中怎么用

产品A/B 测试的灵魂是随机分配,不是“看起来像实验”

把新功能给活跃用户、把旧版留给不活跃用户,然后宣称“新功能提升留存”——这是混淆(用户本身就不同)。正确做法是:在同一流量池里随机分流,预先锁定主指标与窗口期,避免反复偷看、显著就停(产品版 p-hacking)。

营销活动有效还是季节有效?用保留组回答

大促期间销量上升,不能自动记到广告头上。设置随机holdout(保留组)不触达广告,比较触达组与保留组的转化差异,才更接近“广告”这个自变量的效应。若无法随机,至少承认这是准实验,结论要降级。

管理培训后分数涨了,不等于培训有效

培训结束立刻测验,常见混淆包括:练习效应、霍桑式被关注、学员取悦讲师。更干净的设计:随机决定谁先培训谁后培训(等待组对照),或用双盲评分的行为指标;至少做延时再测,看增益是否还在。

管理绩效与晋升中的期望循环

管理者若早早把某人标为“高潜”,可能给予更多辅导、曝光与容错,成绩差距被放大后再被用来证明“眼光准”。缓解办法:关键项目机会用更透明的规则分配;评估时先看行为记录再贴标签;引入不了解“高潜名单”的评定者做盲态校准。

品牌包装与仪式会改变体验,请诚实对待安慰剂成分

精美包装、专业术语、沉浸开箱都能提升主观体验——其中一部分是期望与意义赋予,不一定是配方本身。产品叙事可以利用它提升愉悦感,但若声称可验证的功效(功效、成绩、健康),就应回到对照与盲法能支撑的证据层级,避免把体验设计包装成未验证的因果承诺。

6考点速记

  • 操作定义:用具体可观察/可测量的程序界定概念;同一概念可有不同操作定义。
  • 自变量(IV):研究者操纵的变量;因变量(DV):测量的结果;控制变量:需保持一致或加以控制的因素。
  • 实验组 vs 对照组:对照提供因果解释的基准;无对照难以排除时间、练习、自然变化等。
  • 随机分配:使组间已知与未知差异平均平衡,是实验法推断因果、内部效度的关键。区别于随机抽样(服务外部效度/代表性)。
  • 混淆变量:与 IV 系统共变、可替代解释 DV 变化的因素;威胁内部效度。
  • 期望效应:实验者期望与参与者期望均可影响结果;防护包括标准化、单盲/双盲、盲态评定。
  • 安慰剂效应:因接受“有效处理”的信念及伴随情境而产生的改变;安慰剂对照用于分离特异与非特异效应。
  • 内部效度 vs 外部效度:前者问因果是否成立,后者问能否推广;严控实验室常提高内部效度、收紧外部效度,需用重复与现场研究补边界。
  • Rosenthal & Jacobson(1968)Pygmalion 研究:教师期望案例,证据有争议;实验者期望作为方法学威胁则较被广泛接受。

7自测 3 题

某产品团队把新首页只推给“最近 7 天活跃”的用户,旧首页留给其余用户,一周后发现新首页组留存更高,于是结论:“新首页提升了留存。”最主要的问题是?

  1. A. 没有操作定义
  2. B. 分组不是随机分配,活跃度本身可能是混淆变量
  3. C. 违反了可证伪性
  4. D. 样本一定没有代表性,所以一定无效
查看答案
答案:B
两组从一开始就在活跃度上系统不同,留存差异完全可能来自用户本身而非首页。即便结果“显著”,也不能归因于自变量。D 过度绝对:外部效度是另一问题;本题核心是内部效度被混淆破坏。

关于随机分配与随机抽样,下列哪一项正确?

  1. A. 两者是同一件事,只是翻译不同
  2. B. 随机分配主要服务外部效度,随机抽样主要服务内部效度
  3. C. 随机分配让各组可比以支持因果推断(内部效度);随机抽样关乎样本是否代表总体(外部效度)
  4. D. 没有随机抽样就绝对不能做任何因果推断
查看答案
答案:C
实验室实验常常对方便样本做随机分配:仍可能有较好的内部效度,推广时则需谨慎。没有随机抽样不等于不能谈因果,而是外部效度主张要收敛。

双盲设计最直接防范的是哪一类威胁?

  1. A. 样本不能代表全国人口
  2. B. 参与者与主试的期望、暗示导致的结果偏向
  3. C. 第三变量导致的虚假相关(在纯观测研究中)
  4. D. 相关系数不能大于 1
查看答案
答案:B
双盲让参与者与直接接触的主试/评定者都不知道分组,降低期望与暗示造成的系统偏差。A 是外部效度/抽样问题;C 主要靠实验操纵与随机分配来应对;D 是统计定义,与盲法无关。

8今日练习(约 20 分钟)

今天用“实验设计检查清单”拆一条真实主张,并在自己的生活里设计一个最小对照。

8 分钟

拆解一条“实验/测试”。找一条产品 A/B、营销投放、培训效果或健康干预的说法,按清单回答:① IV/DV 的操作定义是什么?② 有没有对照?③ 是否随机分配?④ 可能的混淆是什么?⑤ 有没有盲法或至少盲态评定?⑥ 结论有没有推广过度?

7 分钟

设计一个生活微型实验。选一个你关心的小问题(如:午后散步是否让你晚上更容易专注)。写出:IV、DV(如何在 1–5 分或分钟数上测量)、对照组是什么、如何在一周内尽量“像随机”地安排条件(可掷硬币决定哪天散步)、要控制哪些因素(咖啡、睡眠)。不必真的做满一周,但方案要写到可执行。

5 分钟

期望自检。写下你对某同事或亲友的一个强烈预期。列出:过去一周你多给了TA什么机会/解释,少给了什么。再写一个“若我看到 ____,我会下调这个预期”的观察标准。

9延伸阅读

  • 《这才是心理学》(How to Think Straight About Psychology)中论实验与控制的章节 Keith E. Stanovich · 书 · 延续 Day 1在相关与因果之后,继续读实验控制、安慰剂与期望等相关章节,与本课直接衔接。
  • Experimental and Quasi-Experimental Designs for Research Donald T. Campbell & Julian C. Stanley · 1963 · 书 / 经典方法小册内部效度威胁清单与准实验分类的源头文献,方法课常引。
  • Pygmalion in the Classroom Robert Rosenthal & Lenore Jacobson · 1968 · 书教师期望研究原著;阅读时请同时对照后续批评与综述,勿只记“期望改变智商”的简化版。
  • Experimenter effects in behavioral research Robert Rosenthal · 1966 · 书系统讨论实验者期望等方法学效应,奠定盲法与标准化的实践理由。
  • Experimental and Quasi-Experimental Designs for Generalized Causal Inference Shadish, Cook & Campbell · 2002 · 书 · 进阶在 Campbell & Stanley 传统上的现代扩展,适合之后想系统学因果推断设计时查阅。

10间隔复习

间隔复习:自动从 Day N-1、N-3、N-7 中抽题。先凭记忆作答,再看答案。

关于心理学的“可重复性危机”,下列说法哪一项最准确?来自 Day 1 · 心理学凭什么算科学:用证据看人(1 天前)

  1. A. 它证明了大多数心理学研究都是编造的
  2. B. 开放科学合作组织(2015)重复的研究中约 36% 得到显著结果,效应量平均约为原来的一半,提示小样本、发表偏倚等问题
  3. C. 大规模预注册重复研究证实了自我损耗效应
  4. D. 只要一次重复失败,就足以证明原效应不存在
查看答案
答案:B
A 过度引申:重复失败多源于方法问题而非造假,且许多效应(如锚定效应)重复良好。C 相反:Hagger 等(2016)的预注册多实验室重复发现效应接近零。D 错误:单次重复失败也可能有自身局限,需要综合多项证据判断。

某文章写道:“调查显示,每天喝咖啡的人抑郁风险更低,所以喝咖啡可以预防抑郁。”这一推论最主要的问题是?来自 Day 1 · 心理学凭什么算科学:用证据看人(1 天前)

  1. A. 违反了可证伪性原则
  2. B. 把相关当成了因果
  3. C. 属于巴纳姆效应
  4. D. 属于 HARKing
查看答案
答案:B
调查只能显示两者相关。可能存在反向因果(抑郁的人精力差、改变了饮食习惯),也可能有第三变量(如收入、工作状态、睡眠、社交活动同时影响两者)。要检验因果,需要随机分配的实验或设计更严谨的纵向研究。
模块 0 · 科学思维2026-09-29约 40 分钟▶

Day 1 · 心理学凭什么算科学:用证据看人

心理学算科学,不是因为它研究“人心”,而是因为它用可检验、可重复、公开的证据回答关于人的问题,并且在证据面前愿意承认自己错了。

1一句话核心

心理学算科学,不是因为它研究“人心”,而是因为它用可检验、可重复、公开的证据回答关于人的问题,并且在证据面前愿意承认自己错了。

2概念讲解

1. 为什么“凭常识懂人”不够

每个人都是“业余心理学家”:我们每天都在猜别人为什么这样做、下一步会怎样。问题在于,常识往往可以同时解释相反的结果。“物以类聚”和“异性相吸”都是俗语;“小别胜新婚”和“眼不见,心不烦”也都是。无论两个人分开后感情变好还是变淡,常识都能事后给出一个说法。

一个什么结果都能解释的说法,其实什么也没预测。科学心理学要做的,是把这些模糊的直觉变成可以被数据推翻的具体问题,例如:“在什么条件下、对哪些人、相似性对吸引力的影响有多大?”然后去测量。

2. 科学的三个基本特征

心理学家基思·斯坦诺维奇(Keith Stanovich)在《这才是心理学》(How to Think Straight About Psychology)中把科学概括为三点,这也是本课程判断一切说法的底层标准:

  • 系统的实证主义:靠有计划、有控制的观察和测量回答问题,而不是靠权威、直觉或个人经历。
  • 知识公开可验证:方法要写清楚,别人照做能得到类似结果;研究要经过同行评议。一个只有提出者本人能“验证”的发现,不算科学知识。
  • 研究可解决的问题:问题必须能用现有方法检验。“人生的意义是什么”很重要,但不是实证问题;“有明确目标的人主观幸福感是否更高”则可以研究。

3. 可证伪性:好理论要敢于“冒险”

哲学家卡尔·波普尔(Karl Popper)提出:一个理论是否科学,关键不在于能找到多少支持它的例子,而在于它是否明确说出了什么情况会证明它是错的——这叫可证伪性(falsifiability)。

波普尔在《猜想与反驳》(1963)中举过一个对照:1919 年日食观测检验了爱因斯坦广义相对论关于光线弯曲的预测,如果观测结果不符,理论就会被推翻——它冒了真实的风险。相比之下,他认为当时的精神分析(弗洛伊德)和个体心理学(阿德勒)无论出现什么行为都能解释:一个人把孩子推下水,或者一个人舍命救孩子,两种理论都能自圆其说。波普尔指出,这种“处处都能被证实”恰恰是弱点,而不是优点。

科学心理学与伪心理学的常见区别(判断时看整体倾向,不是逐条打分)
维度科学心理学伪心理学(常见表现)
主张的形式具体、可测量,说清楚什么结果会推翻它模糊、万能,任何结果都能解释
对反例的态度认真对待,修正或放弃理论解释掉反例(“你还没真正领悟”)
证据来源对照研究、大样本、重复验证个人经历、客户好评、名人背书
是否公开检验公开方法与数据,接受同行审查“独家方法”“核心技术保密”
随时间的变化不断自我修正、积累几十年不变,或只改包装
语言风格常带限定:“平均而言”“在某些条件下”绝对化:“100% 有效”“一眼看穿”
诚实的补充:可证伪性作为“科学与非科学的唯一分界线”,在科学哲学中是有争议的(库恩、拉卡托斯等人提出过重要批评);而且精神分析中的一部分具体假设后来也被实证研究检验过。但作为日常判断的实用原则——“什么证据会让你改变看法?”——它非常好用。

4. 相关不等于因果

“相关”指两个变量一起变化;“因果”指一个变量的改变会导致另一个变化。两者之间隔着两道坎:

  • 方向性问题:可能是 B 导致 A,而不是 A 导致 B。
  • 第三变量问题:可能有一个没被测量的 C 同时影响 A 和 B。
① A 导致 B A B 我们通常想当然的解释 ② 方向反了:B 导致 A A B 方向性问题 ③ 第三变量 C 同时影响两者 C A B A 与 B 相关,但彼此并无因果
看到 A 与 B 相关时,至少要想到这三种可能(还可能是巧合或样本选择造成的)。
相关研究与实验的对比
相关研究实验
研究者做什么测量已存在的变量,看它们是否一起变化主动操纵自变量,测量因变量
是否随机分配否是(这是关键)
能否推断因果不能直接推断可以(在设计良好的前提下)
适用场景无法或不应操纵的变量,如童年经历、性别可操纵且符合伦理的变量
常用统计量相关系数 r(-1 到 +1)组间差异、效应量(如 Cohen's d)

斯坦诺维奇书中有一个经典历史案例:20 世纪初美国南方糙皮病(pellagra)流行,人们发现它与卫生条件差的地区高度相关,于是怀疑是传染病。美国公共卫生署的约瑟夫·戈德伯格(Joseph Goldberger)认为真正的原因是饮食缺乏,“卫生差”和“糙皮病”都是贫困这个第三变量的结果。他通过改变饮食的研究证明了这一点;后来科学家确认糙皮病的直接原因是缺乏烟酸(维生素 B3)。

要确立因果,最有力的方法是实验:研究者主动操纵自变量,并通过随机分配让各组在其他方面平均而言相同。这样两组之后出现的差异,才能较有把握地归因于操纵本身。

5. 个案 vs 数据:“我认识一个人……”

“我爷爷每天抽烟,活到 95 岁。”斯坦诺维奇把这类论证称为“某人统计”(person-who statistics):用一个鲜活的反例去否定一个概率性的规律。可心理学和医学中的大多数规律本来就是概率性的——“吸烟提高患肺癌的风险”从来不意味着“每个吸烟者都会得肺癌”。

个案之所以说服力强,是因为它生动、容易想起。特沃斯基与卡尼曼(Tversky & Kahneman, 1973)描述的可得性启发指出:我们常根据例子“多容易想到”来判断事件有多常见。飞机失事的新闻让人觉得坐飞机很危险,就是这个道理。

这不等于个案毫无价值:个案能提出假设、提供细节、展示“可能性”;但要回答“普遍是否如此、有多大程度”,需要系统收集的数据。

6. 确认偏误:我们天生爱找“证明自己对”的证据

确认偏误(confirmation bias)指人们倾向于寻找、注意、解释和记住支持自己已有观点的信息,而忽视或贬低相反的信息(Nickerson, 1998 的综述)。

彼得·沃森(Peter Wason)1960 年的“2-4-6 任务”是经典演示:告诉参与者“2, 4, 6”符合某条规则,请他们提出新的三个数来测试自己的猜想。很多人猜“依次加 2”,然后一直提出 8-10-12、20-22-24 这类符合自己猜想的数字,得到“符合”的反馈后就很有信心地宣布答案——结果错了。真正的规则只是“任意递增的三个数”。要发现这一点,需要主动试一试可能推翻自己猜想的数字,比如 1-7-30。

日常中,一旦你认定“这个同事不靠谱”,他每次迟到你都记得,他准时交付你却不太留意。确认偏误并不是“笨”的人才有,它是人类信息加工的普遍倾向,科学方法(对照组、盲法、预注册)在很大程度上就是为了对抗它而设计的。

7. 巴纳姆效应:为什么星座和性格测试“好准”

1949 年,心理学家伯特伦·福勒(Bertram Forer)让学生做了一份性格测验,一周后给每人发了一份“个人分析报告”,请他们评价准确度(0–5 分)。学生们普遍给出了很高的分数——而实际上所有人拿到的是同一段文字,其中的句子大多摘自一本星座书,例如“你有时外向、友善、合群,有时内向、谨慎、保守”这样的描述。

这种现象后来被称为巴纳姆效应(Barnum effect,名称由保罗·米尔 Paul Meehl 在 1956 年推广开来),也叫福勒效应:人们会把笼统、普遍适用的描述当作对自己的准确刻画。让描述“显得准”的常见配方:

  • 模糊且双面:“你有时……有时……”几乎对所有人成立。
  • 偏正面:“你有很多尚未发挥的潜力”,人们更愿意接受讨喜的描述。
  • 看起来是专门为你做的:填了问卷、输入了生日,会让人更相信结果是“个性化”的。
  • 来源显得权威:专家、测评机构、精美的报告。

关于 MBTI 等类型测试,需要说得公允一些:它不等同于星座,题目确实在测量一些真实的偏好。但研究者对它有具体的批评——例如把连续分布的特质硬分成两类、部分人重测时类型会改变(参见 Pittenger, 2005);而它的类型描述大多写得正面、宽泛,这正是巴纳姆效应容易发挥作用的地方。学术研究中更常用的是大五人格模型,我们会在模块 4 详细讲。

自检一句话:一段关于你的描述,如果换一个人读也几乎同样成立,那它“准”的原因多半在于巴纳姆效应,而不在于它真的了解你。

8. 可重复性危机:心理学如何面对自己的错误

2015 年,由布莱恩·诺塞克(Brian Nosek)等人发起的开放科学合作组织(Open Science Collaboration)在《科学》(Science)上发表报告:他们重复了 2008 年发表在三本心理学顶级期刊上的 100 项研究。原研究中有 97% 报告了统计显著的结果,而重复研究中只有约 36% 得到显著结果;重复研究的效应量平均只有原研究的一半左右。

此后,一些曾经广为流传的发现在大规模重复中表现不佳,例如“自我损耗”(意志力像肌肉一样会被用完)和“权力姿势”(摆出扩张的姿势能改变激素水平),详见下方研究卡片。

造成问题的主要原因包括:

  • 样本太小:统计检验力不足,偶然结果更容易被当成发现。
  • 分析灵活性(p-hacking):多测几个指标、多试几种分析、数据“够显著”就停止收集,会大幅增加假阳性(Simmons, Nelson & Simonsohn, 2011)。
  • 发表偏倚:显著的“新奇发现”更容易发表,失败的结果被锁进抽屉。
  • 事后假设(HARKing):看到结果后再把它写成“事先预期”(Kerr, 1998)。

心理学界的回应是一系列改革:预注册(事先公开假设和分析计划)、注册报告(期刊在看到结果前就根据方法决定是否发表)、公开数据与材料、多实验室联合重复(如 Many Labs 项目)。

诚实的说明:可重复性危机不等于“心理学都是假的”。(1)一次重复失败不能证明原效应一定不存在,重复研究本身也可能有问题,OSC 2015 的方法和解读也受到过批评(如 Gilbert 等人 2016 年的评论);(2)很多发现重复得相当好,例如锚定效应在 Many Labs 1 中非常稳健;(3)一门学科能公开检查并纠正自己的错误,本身就是科学在正常运转。这场危机提醒我们:对单一、新奇、效应惊人、样本很小的研究保持谨慎。

9. 本课程为什么给每项研究标注证据强度

基于上面的原因,本课程提到的每一项研究都会带一个证据标签。它是一种对当前证据状况的概括判断,不是永久结论——新证据出现时,标签也会随之调整。

标签含义你该怎么用
稳固多次独立重复、元分析支持,或已成为领域共识可以作为理解与决策的依据,但仍注意适用条件
有争议结果不一致、效应大小或解释存在明显分歧、边界条件不清当作“值得参考的假设”,不要据此下重大结论
已被质疑大规模或预注册的重复研究失败,或原作者公开撤回了解它的历史与教训;不要再当作事实引用

3经典研究与人物

福勒的“个人分析报告”实验Bertram Forer · 1949稳固

做了什么给学生做性格测验后,发给每人一份“个性化”报告,请他们评价准确度;实际上所有人拿到的是同一段摘自星座书的笼统描述。

发现学生普遍认为报告对自己描述得很准确。这说明“觉得准”并不能证明一个测评有效。

证据说明巴纳姆效应此后被多次重复,并有文献综述(如 Dickson & Kelly, 1985)。效应强弱会受描述是否正面、来源是否权威、是否显得个性化等因素影响。

2-4-6 规则发现任务Peter Wason · 1960稳固

做了什么让参与者通过提出三个数的组合来发现隐藏规则(实际是“任意递增”)。

发现多数人倾向于只测试符合自己猜想的例子,很少主动寻找可能否定猜想的例子,因而常得出过窄的错误规则。

证据说明“人们偏好寻找支持性证据”这一现象非常稳固(Nickerson, 1998)。但 Klayman & Ha(1987)指出,这种“正向检验策略”在很多现实情境中其实是合理的,并非总是非理性——问题在于规则比猜想更宽时它会失效。

糙皮病的真正原因Joseph Goldberger · 1914–1920 年代稳固

做了什么面对糙皮病与卫生条件差的高相关,戈德伯格通过改变饮食的研究检验“饮食缺乏”假设,并论证该病并非传染病。

发现卫生差与糙皮病都源于贫困导致的饮食缺乏;后来确认直接原因是烟酸缺乏。这是“第三变量”的教科书案例。

证据说明病因已被医学确认。该案例被斯坦诺维奇用来说明相关与因果的区别。

心理学可重复性大规模检验Open Science Collaboration(Nosek 等) · 2015稳固

做了什么近 300 名研究者合作,重复 2008 年发表于三本心理学期刊的 100 项研究,发表于 Science。

发现原研究 97% 显著,重复研究约 36% 显著;重复效应量平均约为原研究的一半。

证据说明“可重复率低于人们以为的水平”这一总体结论得到后续项目呼应(如 Many Labs 2、Camerer 等 2018 年对社会科学实验的重复)。但具体的“可重复率”数字如何解读仍有争论,不应简单理解为“64% 的研究是假的”。

Many Labs 1:多实验室联合重复Klein 等 · 2014稳固

做了什么36 个实验室、数千名参与者使用相同流程,同时重复 13 个经典效应。

发现多数效应得到了重复,其中锚定效应非常稳健;但也有效应(如国旗启动、金钱启动)未能重复。

证据说明它展示了可重复性检验的“另一面”:心理学中有相当多扎实的发现,关键是分辨哪些是。

自我损耗(意志力有限资源模型)Baumeister 等 · 1998已被质疑

做了什么原研究中,先被要求抵制巧克力饼干、只吃萝卜的参与者,在随后的难解谜题上坚持时间更短,被解释为“自控资源被耗尽”。

发现该理论曾被数百项研究引用和“支持”,并广泛进入自我管理类畅销书。

证据说明Hagger 等(2016)在 23 个实验室、两千多名参与者中进行预注册重复,效应接近于零;Vohs 等(2021)的多实验室预注册研究也只发现极小或接近零的效应。早期大量“支持”研究可能受发表偏倚和小样本影响。

权力姿势Carney, Cuddy & Yap · 2010已被质疑

做了什么让参与者摆出扩张的“高权力”姿势约两分钟,报告其睾酮上升、皮质醇下降、更愿意冒险。

发现相关 TED 演讲广为传播,“面试前摆两分钟超人姿势”成为流行建议。

证据说明Ranehill 等(2015)以更大样本未能重复激素和冒险行为上的效应;第一作者 Dana Carney 于 2016 年公开表示她不再相信权力姿势的效应是真实的。关于姿势是否能让人主观上感觉更有力量,仍有争议(Cuddy 等 2018 年的分析认为有,其他研究者对此存疑)。

“假阳性心理学”Simmons, Nelson & Simonsohn · 2011稳固

做了什么通过模拟和一个故意设计的真实实验,展示研究者在分析中的常见“自由选择”会如何制造出显著结果。

发现借助灵活的分析,他们甚至“证明”了听某首披头士歌曲能让人的实际年龄变小——一个明显不可能的结论,以此说明问题的严重性。

证据说明这是方法学论证,其逻辑和模拟结果被广泛接受,直接推动了预注册等改革。

4人际中怎么用

判断他人把“他就是这种人”改写成一个假设

当你认定“他不在乎我”“她很自私”时,试着在心里加上“(待验证)”。然后像做 2-4-6 任务那样,主动留意可能推翻它的事:他有没有做过在乎你的事?在哪些情况下她并不自私?这样不是让你放弃判断,而是让判断更接近真实的人。

沟通区分“每次都这样”与“有几次这样”

吵架时的“你总是……”“你从来不……”常是可得性和确认偏误的产物:最刺痛的几次最容易想起。换成具体的描述(“这周有两次你到家没回消息”)更准确,也更不容易让对方陷入防御。

因果别急着把“同时发生”当成“因为”

“每次我提工作,他就不耐烦”——也许是因为话题,也许只是你总在他刚下班、最累的时候提(第三变量:疲劳和时间点)。换个时间试一次,就是一个小小的“实验”。

被理解感警惕“说中了”,也学会真正说中别人

当一个测试、一位“大师”或一个新认识的人让你觉得“好懂我”,先问一句:这段话换个人读是否也成立?反过来,想让别人感到被理解,笼统的夸奖(“你很有潜力”)不如具体的观察(“你开会时会先把别人的想法复述一遍再补充”)。

社交MBTI 可以当话题,别当标签

用 MBTI 或星座聊天、破冰无伤大雅;但用它预测一个人会怎么做、适不适合交往或共事,就超出了它的证据范围。

5工作中怎么用

品牌“专属于你”的文案为什么有效,边界在哪

个性化报告、年度账单、测试类 H5 常让用户觉得“好懂我”,其中一部分力量来自巴纳姆效应:宽泛、正面、看起来是为你定制的描述。用它提升体验可以,但要避免让用户误以为得到了专业的评估(例如用“测试结果”暗示健康或能力诊断)。

营销投放后销量涨了,不等于投放有效

活动上线与销量上升同时发生,可能是季节、竞品断货、自然增长等第三变量。更可靠的做法是设置随机保留组(holdout)或 A/B 测试:随机让一部分用户看不到广告,比较两组差异——这就是把实验法用到营销归因上。

管理招聘别用类型测试做筛选,结构化面试更可靠

MBTI 的发行机构本身也声明它不应用于招聘筛选。人员选拔研究的元分析(Schmidt & Hunter, 1998;Sackett 等 2022 年的修正分析)显示,结构化面试(统一问题、统一评分标准)对工作绩效的预测力明显好于随意聊天式的非结构化面试。

管理绩效评估中的确认偏误

对一个员工的第一印象会影响你之后注意哪些事。做法:平时用简短记录积累具体事例(好的和不好的都记),评估时先看记录再下结论,并主动问自己“有什么证据和我的印象相反?”

产品一个大客户的反馈,是个案还是规律?

用户访谈里生动的抱怨很有启发价值(提出假设),但决定是否投入开发,需要行为数据和更大样本验证。同时注意:只调研现有用户,会漏掉那些已经流失或从未转化的人。A/B 测试中,事先确定核心指标和样本量,不要反复偷看结果、显著就停——这正是产品版的 p-hacking。

管理读管理和效率类畅销书时,查一下证据

“意志力会被用完,所以重要决策放早上”(源于自我损耗)、“开会前摆个强势姿势”(源于权力姿势)这类建议都建立在已被质疑的研究上。遇到“研究表明”,至少追问:是哪项研究?样本多大?有没有被独立重复?

6考点速记

  • 科学的三个特征(Stanovich):系统的实证主义、知识公开可验证、研究可解决的问题。
  • 可证伪性(Popper):科学理论必须能明确指出什么观察结果会证明它是错的;能解释一切的理论不可证伪。
  • 相关≠因果:两大障碍是方向性问题和第三变量问题。相关系数 r 取值 -1 到 +1,绝对值表示强度,正负表示方向。
  • 实验法三要素:操纵自变量、测量因变量、随机分配被试到实验组与控制组;随机分配是推断因果的关键。注意区分随机分配(内部效度)与随机抽样(外部效度/代表性)。
  • 巴纳姆效应 / 福勒效应(Forer, 1949):人们把笼统、普遍适用的描述视为对自己的准确刻画。
  • 确认偏误:寻找和记住支持已有信念的信息;经典演示为 Wason(1960)2-4-6 任务。
  • 可得性启发(Tversky & Kahneman, 1973):依据例子容易想起的程度判断频率或概率。
  • 可重复性危机:OSC(2015)重复 100 项研究,约 36% 得到显著结果;主要原因:小样本、p-hacking、发表偏倚、HARKing;对策:预注册、注册报告、开放数据、多实验室重复。

7自测 3 题

某文章写道:“调查显示,每天喝咖啡的人抑郁风险更低,所以喝咖啡可以预防抑郁。”这一推论最主要的问题是?

  1. A. 违反了可证伪性原则
  2. B. 把相关当成了因果
  3. C. 属于巴纳姆效应
  4. D. 属于 HARKing
查看答案
答案:B
调查只能显示两者相关。可能存在反向因果(抑郁的人精力差、改变了饮食习惯),也可能有第三变量(如收入、工作状态、睡眠、社交活动同时影响两者)。要检验因果,需要随机分配的实验或设计更严谨的纵向研究。

以下哪一个说法最难被证伪?

  1. A. 前一晚睡眠少于 5 小时的人,第二天工作记忆测验得分会更低
  2. B. 每个人内心深处都有未被意识到的冲突,它会以各种方式表现在行为中
  3. C. 当有旁人在场时,人们主动帮助陌生人的可能性会降低
  4. D. 使用结构化面试的公司,新员工一年后的绩效评分更高
查看答案
答案:B
A、C、D 都说明了可测量的变量和预期方向,结果可能与预测相反,因此可以被检验和推翻。B 中“各种方式表现”意味着任何行为都可以被解释为支持它,没有任何观察能证明它错,所以最难证伪。

关于心理学的“可重复性危机”,下列说法哪一项最准确?

  1. A. 它证明了大多数心理学研究都是编造的
  2. B. 开放科学合作组织(2015)重复的研究中约 36% 得到显著结果,效应量平均约为原来的一半,提示小样本、发表偏倚等问题
  3. C. 大规模预注册重复研究证实了自我损耗效应
  4. D. 只要一次重复失败,就足以证明原效应不存在
查看答案
答案:B
A 过度引申:重复失败多源于方法问题而非造假,且许多效应(如锚定效应)重复良好。C 相反:Hagger 等(2016)的预注册多实验室重复发现效应接近零。D 错误:单次重复失败也可能有自身局限,需要综合多项证据判断。

8今日练习(约 20 分钟)

准备纸笔或手机备忘录。今天的练习目标是:亲身体验偏误,并练习用科学的问题审视一个说法。

5 分钟

巴纳姆自测。读下面这段“为你定制”的描述,按 0–5 分给它的准确度打分:
“你很在意别人对你的看法,但也有自己的坚持。你在熟悉的人面前比较放松,在陌生场合会先观察再表态。你有一些还没充分发挥的能力。有时你会怀疑自己做的决定是否正确。”
打完分后想一想:你身边有几个人读到这段话会打低分?记下你的感受。

7 分钟

拆解一条“研究发现”。在新闻或社交媒体上找一条“研究表明……”的内容,回答:① 这是相关研究还是实验(有没有随机分配)?② 样本大约多少人、是什么人?③ 能否想到至少两个第三变量或反向因果的可能?④ 标题的结论是否超出了研究本身能说明的范围?

5 分钟

给一个判断找反例。写下你对某个人(同事、家人、朋友)的一个判断,再写出:“如果我看到 ____,我会改变这个看法。”接下来一周,有意留意这类反例。

3 分钟

一句话复盘。用自己的话写下:今天学到的哪一个概念,最可能改变我明天的某个具体做法?

9延伸阅读

  • 《这才是心理学:看穿伪心理学的本质》(How to Think Straight About Psychology) Keith E. Stanovich · 书 · 入门首选本课“科学思维”模块的主要参考。可证伪性、某人统计、相关与因果、糙皮病案例都在其中,有中译本。
  • 《猜想与反驳》(Conjectures and Refutations) Karl Popper · 1963 · 书第一章“科学:猜想与反驳”讨论了可证伪性以及精神分析与相对论的对比。偏哲学,可只读第一章。
  • How We Know What Isn't So: The Fallibility of Human Reason in Everyday Life Thomas Gilovich · 1991 · 书系统讨论人们为何会坚信错误的东西(随机中看到模式、选择性证据等),可读性强。
  • Science Fictions Stuart Ritchie · 2020 · 书从内部视角讲科学中的造假、偏倚、疏忽与夸大,以及如何改进,对理解可重复性危机很有帮助。
  • Estimating the reproducibility of psychological science Open Science Collaboration · 2015 · 论文 · Science, 349(6251), aac4716可重复性危机的标志性论文,摘要和图表值得直接读原文。
  • The fallacy of personal validation: A classroom demonstration of gullibility Bertram R. Forer · 1949 · 论文 · Journal of Abnormal and Social Psychology, 44(1), 118–123巴纳姆效应的原始研究,篇幅很短。
  • Confirmation bias: A ubiquitous phenomenon in many guises Raymond S. Nickerson · 1998 · 论文 · Review of General Psychology, 2(2), 175–220关于确认偏误最常被引用的综述。
  • False-positive psychology Simmons, Nelson & Simonsohn · 2011 · 论文 · Psychological Science, 22(11), 1359–1366理解 p-hacking 的必读论文,论证清楚、并不艰深。

10间隔复习

今天是起点,还没有更早的内容可复习。从 Day 2 开始,这里会自动出现前几天(N-1、N-3、N-7)的题目,帮你在遗忘之前重新提取记忆。