心理学日课
从科学方法出发,走到认知、发展、人格、情绪、关系、心理健康与应用。每天约 40 分钟。
Day 2 · 实验设计:自变量、随机分配与混淆变量
要推断“是 A 导致了 B”,关键不只是测到了差异,而是设计让除了你操纵的那一点之外,各组在其他方面平均相同——这靠操作定义、随机分配,以及对混淆变量与期望效应的主动防范。
1一句话核心
要推断“是 A 导致了 B”,关键不只是测到了差异,而是设计让除了你操纵的那一点之外,各组在其他方面平均相同——这靠操作定义、随机分配,以及对混淆变量与期望效应的主动防范。
2概念讲解
1. 从“相关不等于因果”到“怎样才能推断因果”
昨天我们说到:相关研究只能告诉我们变量一起变化,推断因果需要实验——研究者主动操纵某个变量,并通过随机分配让各组在其他方面平均而言相同。
今天把实验拆开:什么叫“操纵”?什么叫“随机分配”?为什么做完实验,别人仍可能说“你测到的差异其实不是因为你以为的那个原因”?答案就藏在操作定义、自变量与因变量、控制变量、混淆变量、内部效度与外部效度这些概念里。
2. 操作定义:把模糊概念变成可测量的东西
科学研究不能停在“压力”“智能”“吸引力”这类日常说法上——每个人对它们的理解可能都不一样。操作定义(operational definition)指:用一套具体的、可观察或可测量的程序,来界定一个概念在本研究中“是什么”。
例如:“压力大”可以操作定义为“过去一周 Perceived Stress Scale 得分 ≥ 某阈值”,也可以是“在公开演讲前即刻的心率”;“记忆好”可以是“听完词表后立刻正确回忆的个数”。不同操作定义测的未必是同一件事——所以写报告时必须写清楚,读者才能判断你测的到底是不是你声称的那个概念。
3. 自变量、因变量与控制变量
一次典型的实验里,至少要分清三类变量:
- 自变量(independent variable, IV):研究者主动操纵的变量。它是“原因候选”。例如:是否服用某药、是否收到积极期望标签、界面按钮是红色还是蓝色。
- 因变量(dependent variable, DV):研究者测量的结果变量。它是“效果候选”。例如:症状评分、测验成绩、点击率。
- 控制变量(control variables):研究者希望各组保持一致、或在分析中加以统计控制的因素,以免它们干扰因果解释。例如:测验时间、指导语措辞、屏幕亮度。
| 研究者做什么 | 例子(睡眠与记忆) | |
|---|---|---|
| 自变量 | 操纵(制造不同水平) | 随机安排:睡足 8 小时 vs 只睡 4 小时 |
| 因变量 | 测量结果 | 次日词表回忆正确数 |
| 控制变量 | 保持一致或加以控制 | 词表材料、测验时间、咖啡因摄入规则 |
记一个口诀:自变量是你改的,因变量是你看的,控制变量是你尽量让它别乱的。
4. 实验组与对照组:比较才产生意义
单独给一群人做干预再测结果,往往说不清变化是不是干预造成的——时间流逝、练习效应、自然好转都可能“看起来像有效”。因此实验通常至少有两组:
- 实验组(experimental group):接受研究者感兴趣的处理(treatment)。
- 对照组 / 控制组(control group):不接受该处理,或接受一个对照处理(如安慰剂、标准流程、另一种版本)。
对照组不是“被忽略的人”,而是让因果解释成立的基准线。没有可比的对照,你就很难知道差异来自哪里。
5. 随机分配:为什么它是推断因果的关键
把人分进实验组还是对照组,不能按“谁方便”“谁自愿”“谁看起来更适合”来分——那样两组从一开始就可能系统不同。随机分配(random assignment)指:用随机程序(掷硬币、随机数)决定每个人进哪一组,使已知与未知的个体差异在组间平均而言趋于平衡。
注意两件常被混为一谈的事:
- 随机分配:解决的是“各组是否可比”,服务内部效度(你能否说差异是由操纵造成的)。
- 随机抽样:解决的是“样本是否代表总体”,服务外部效度(你能否把结论推广到更大人群)。
一项研究可以有随机分配却没有随机抽样(很多实验室实验如此):它仍可能很适合推断因果,只是推广时要谨慎。反过来,大规模问卷调查即使抽样很好,若没有随机分配的操纵,仍难直接下因果结论。
6. 混淆变量与内部效度
混淆变量(confound)指:与自变量一起系统变化、因而也可能解释因变量变化的额外因素。一旦存在混淆,你就说不清结果到底是自变量造成的,还是那个“跟着变”的东西造成的。内部效度(internal validity)问的是:在这项研究内部,我们有多大把握说“是自变量导致了因变量的变化”?混淆越多、控制越差,内部效度越低。常见混淆来源包括:两组接受不同时长的关注、不同的指导语气、不同的时间段(一组早上测、一组晚上测)、主试对某组更热情、测量工具本身在两组使用方式不一致等。
7. 期望效应与双盲:人不是试管
心理学实验里的“材料”常常是人——参与者会猜研究目的,主试也会不知不觉流露期望。这类因素本身就能改变行为,从而变成混淆。
实验者期望效应(experimenter expectancy effect):主试对结果的预期,可能通过语气、表情、无意中的提示,影响参与者的表现。罗伯特·罗森塔尔(Robert Rosenthal)在 1960 年代用一系列研究系统展示了这一点;后来他与杰 Jacobson 把类似逻辑延伸到教室情境(见下方研究卡片)。安慰剂效应(placebo effect):仅仅因为相信自己接受了有效处理,结果就可能朝预期方向变化。在药物与干预研究中,常用安慰剂对照把“真处理的特异作用”与“被关注、被期望、仪式感”等区分开。防护工具是盲法:
- 单盲:参与者不知道自己在实验组还是对照组。
- 双盲:参与者与直接接触他们的主试/评估者都不知道分组(由第三方编码)。这样双方的期望都不容易系统性地“帮”某一组出成绩。
不是所有心理学研究都能做双盲(例如心理治疗中治疗师通常知道自己在用哪种疗法),但研究者仍应尽量让结果评定者保持盲态,并预先设定客观指标。
8. 外部效度:推得远,往往控得松
外部效度(external validity)问的是:结论能推广到哪些人、哪些情境、哪些操作定义?实验室里控制得越严,内部效度往往越高,但情境也可能越“不像日常”,推广时就要更小心。这不是让你鄙视实验室研究。内部效度薄弱的研究,推广得再远也只是在推广一个不可靠的因果故事。更健康的态度是:用高内部效度的研究建立机制,再用现场实验、多情境重复去检验边界条件——Donald Campbell 与 Julian Stanley(1963)以来的方法学传统,核心就是在这种取舍中把威胁一一列清。
| 核心问题 | 常见威胁 | 增强办法 | |
|---|---|---|---|
| 内部效度 | 差异真是 IV 造成的吗? | 混淆、选择偏差、期望效应、测量不一致 | 随机分配、对照、盲法、标准化流程 |
| 外部效度 | 能推广到谁、何种情境? | 样本特殊、情境人工、操作定义过窄 | 多样本、现场实验、概念重复与多操作定义 |
9. 把整条链串起来:一个最小检查清单
读到或设计一项“实验”时,可以按顺序问:
- 自变量是什么?有没有清晰的操作定义?
- 因变量怎么测?指标是否事先确定,还是事后挑显著的那个?
- 有没有恰当的对照组?
- 分组是否随机分配?若否,组间基线是否可能系统不同?
- 有哪些可能的混淆?流程是否标准化?
- 参与者与主试的期望是否被盲法或其他方式限制?
- 样本与情境支持怎样程度的推广?结论有没有说过头?
3经典研究与人物
做了什么在一所小学中,研究者对儿童做智力测验后,随机抽取约 20% 的学生,告诉教师这些孩子在来年会“智力猛长”(实际是随机标签,与真实分数无关)。数月后再测智力与学业表现。
发现原书报告:被标记为“即将绽放”的学生,尤其低年级,在某些智力测验增益上高于未被标记的同学。作者将其解释为教师期望通过互动传递,影响了学生表现。
证据说明该研究在教育与社会心理学中影响极大,但也长期受到方法与重复方面的批评(如测验选择、统计分析、效应是否稳健等)。后续文献对“教师期望能否稳定改变标准化智力分数”分歧明显;较稳妥的共识是:期望可能影响互动与机会分配,但对 IQ 分数的戏剧性效应不宜当作已确立事实。本课把它当作理解期望效应与研究争议的案例,而非板上钉钉的效应量来源。
做了什么罗森塔尔在动物与人类实验中系统操纵主试对结果的预期(例如告诉不同主试“这些大鼠更聪明”或暗示参与者会有某种表现),同时保持真实刺激材料相当。
发现主试的预期常能在结果上留下痕迹:即使程序看似相同,期望组仍可能出现符合预期的偏向。这说明“主试也是实验装置的一部分”。
证据说明实验者期望作为方法学威胁已被广泛接受,并直接推动了标准化脚本、自动化呈现与盲法的普及。具体效应大小随情境而异,但“需要防范主试期望”已成为良好实验实践的一部分。
做了什么评价干预是否有效时,将参与者随机分配到真处理或外观相似的安慰剂(或标准治疗),并尽量使参与者与结果评定者都不知道分组。
发现该设计把“处理的特异作用”与自然病程、回归均值、安慰剂与期望等因素分开,是医学与干预评价中推断因果的金标准框架之一。
证据说明安慰剂效应本身真实存在且机制复杂(期望、学习、医患互动等),双盲 RCT 并不是否认安慰剂不重要,而是防止把安慰剂与非特异因素误当成处理本身的效力。心理学干预因难以对治疗师完全双盲,常退而求其次:盲态评定、活跃对照、预注册结局指标。
做了什么在《Experimental and Quasi-Experimental Designs for Research》中,系统区分真实验与准实验,并列举历史、成熟、测验、仪器、选择、流失等对内部效度的威胁。
发现没有随机分配的“前后测对比”或“完整群体对比”,往往无法排除多种替代解释;设计的价值取决于它能挡掉哪些威胁。
证据说明该框架是心理学与教育学方法课的标准内容,后续由 Cook、Shadish 等人扩展,但核心问题意识(先问内部效度)一直适用。
4人际中怎么用
期待与关系你对TA的标签,可能悄悄改变互动
一旦认定“他就是懒”“她就是冷漠”,你的语气、解释空间和机会分配可能跟着变——对方感受到后,行为也可能朝标签靠拢。这不必夸大成“期望万能”,但值得自检:我最近有没有只收集符合标签的证据?有没有少给对方一次被看见的机会?
沟通把抱怨改成一个可检验的小实验
与其争论“你根本不在乎”,不如约定一个可观察的改变(操作定义):例如“这周我提前一天说计划,你是否在当天晚上 10 点前回复可行/不可行”。这就是在关系里做微型对照:改变一个自变量,看因变量是否变化。
冲突分清“处理”和“被关注”
对方道歉、送礼物或突然温柔,情绪常会好转——其中有一部分可能是“被看见”的安慰剂式力量,不等于深层问题已解决。可以感激当下的修复,同时问:若没有礼物、只谈具体行为约定,关系是否仍改善?避免把仪式感误当成结构改变。
自我觉察当你当“主试”时,留意自己的期望
劝朋友分手、劝家人相亲、劝同事跳槽时,你已经有了预期答案。谈话中你可能不知不觉只抛支持自己立场的问题。试着先写两列:支持与反对各三条,并主动问一句可能推翻你建议的问题。
5工作中怎么用
产品A/B 测试的灵魂是随机分配,不是“看起来像实验”
把新功能给活跃用户、把旧版留给不活跃用户,然后宣称“新功能提升留存”——这是混淆(用户本身就不同)。正确做法是:在同一流量池里随机分流,预先锁定主指标与窗口期,避免反复偷看、显著就停(产品版 p-hacking)。
营销活动有效还是季节有效?用保留组回答
大促期间销量上升,不能自动记到广告头上。设置随机holdout(保留组)不触达广告,比较触达组与保留组的转化差异,才更接近“广告”这个自变量的效应。若无法随机,至少承认这是准实验,结论要降级。
管理培训后分数涨了,不等于培训有效
培训结束立刻测验,常见混淆包括:练习效应、霍桑式被关注、学员取悦讲师。更干净的设计:随机决定谁先培训谁后培训(等待组对照),或用双盲评分的行为指标;至少做延时再测,看增益是否还在。
管理绩效与晋升中的期望循环
管理者若早早把某人标为“高潜”,可能给予更多辅导、曝光与容错,成绩差距被放大后再被用来证明“眼光准”。缓解办法:关键项目机会用更透明的规则分配;评估时先看行为记录再贴标签;引入不了解“高潜名单”的评定者做盲态校准。
品牌包装与仪式会改变体验,请诚实对待安慰剂成分
精美包装、专业术语、沉浸开箱都能提升主观体验——其中一部分是期望与意义赋予,不一定是配方本身。产品叙事可以利用它提升愉悦感,但若声称可验证的功效(功效、成绩、健康),就应回到对照与盲法能支撑的证据层级,避免把体验设计包装成未验证的因果承诺。
6考点速记
- 操作定义:用具体可观察/可测量的程序界定概念;同一概念可有不同操作定义。
- 自变量(IV):研究者操纵的变量;因变量(DV):测量的结果;控制变量:需保持一致或加以控制的因素。
- 实验组 vs 对照组:对照提供因果解释的基准;无对照难以排除时间、练习、自然变化等。
- 随机分配:使组间已知与未知差异平均平衡,是实验法推断因果、内部效度的关键。区别于随机抽样(服务外部效度/代表性)。
- 混淆变量:与 IV 系统共变、可替代解释 DV 变化的因素;威胁内部效度。
- 期望效应:实验者期望与参与者期望均可影响结果;防护包括标准化、单盲/双盲、盲态评定。
- 安慰剂效应:因接受“有效处理”的信念及伴随情境而产生的改变;安慰剂对照用于分离特异与非特异效应。
- 内部效度 vs 外部效度:前者问因果是否成立,后者问能否推广;严控实验室常提高内部效度、收紧外部效度,需用重复与现场研究补边界。
- Rosenthal & Jacobson(1968)Pygmalion 研究:教师期望案例,证据有争议;实验者期望作为方法学威胁则较被广泛接受。
7自测 3 题
某产品团队把新首页只推给“最近 7 天活跃”的用户,旧首页留给其余用户,一周后发现新首页组留存更高,于是结论:“新首页提升了留存。”最主要的问题是?
- A. 没有操作定义
- B. 分组不是随机分配,活跃度本身可能是混淆变量
- C. 违反了可证伪性
- D. 样本一定没有代表性,所以一定无效
查看答案
两组从一开始就在活跃度上系统不同,留存差异完全可能来自用户本身而非首页。即便结果“显著”,也不能归因于自变量。D 过度绝对:外部效度是另一问题;本题核心是内部效度被混淆破坏。
关于随机分配与随机抽样,下列哪一项正确?
- A. 两者是同一件事,只是翻译不同
- B. 随机分配主要服务外部效度,随机抽样主要服务内部效度
- C. 随机分配让各组可比以支持因果推断(内部效度);随机抽样关乎样本是否代表总体(外部效度)
- D. 没有随机抽样就绝对不能做任何因果推断
查看答案
实验室实验常常对方便样本做随机分配:仍可能有较好的内部效度,推广时则需谨慎。没有随机抽样不等于不能谈因果,而是外部效度主张要收敛。
双盲设计最直接防范的是哪一类威胁?
- A. 样本不能代表全国人口
- B. 参与者与主试的期望、暗示导致的结果偏向
- C. 第三变量导致的虚假相关(在纯观测研究中)
- D. 相关系数不能大于 1
查看答案
双盲让参与者与直接接触的主试/评定者都不知道分组,降低期望与暗示造成的系统偏差。A 是外部效度/抽样问题;C 主要靠实验操纵与随机分配来应对;D 是统计定义,与盲法无关。
8今日练习(约 20 分钟)
今天用“实验设计检查清单”拆一条真实主张,并在自己的生活里设计一个最小对照。
拆解一条“实验/测试”。找一条产品 A/B、营销投放、培训效果或健康干预的说法,按清单回答:① IV/DV 的操作定义是什么?② 有没有对照?③ 是否随机分配?④ 可能的混淆是什么?⑤ 有没有盲法或至少盲态评定?⑥ 结论有没有推广过度?
设计一个生活微型实验。选一个你关心的小问题(如:午后散步是否让你晚上更容易专注)。写出:IV、DV(如何在 1–5 分或分钟数上测量)、对照组是什么、如何在一周内尽量“像随机”地安排条件(可掷硬币决定哪天散步)、要控制哪些因素(咖啡、睡眠)。不必真的做满一周,但方案要写到可执行。
期望自检。写下你对某同事或亲友的一个强烈预期。列出:过去一周你多给了TA什么机会/解释,少给了什么。再写一个“若我看到 ____,我会下调这个预期”的观察标准。
9延伸阅读
- 《这才是心理学》(How to Think Straight About Psychology)中论实验与控制的章节 Keith E. Stanovich · 书 · 延续 Day 1在相关与因果之后,继续读实验控制、安慰剂与期望等相关章节,与本课直接衔接。
- Experimental and Quasi-Experimental Designs for Research Donald T. Campbell & Julian C. Stanley · 1963 · 书 / 经典方法小册内部效度威胁清单与准实验分类的源头文献,方法课常引。
- Pygmalion in the Classroom Robert Rosenthal & Lenore Jacobson · 1968 · 书教师期望研究原著;阅读时请同时对照后续批评与综述,勿只记“期望改变智商”的简化版。
- Experimenter effects in behavioral research Robert Rosenthal · 1966 · 书系统讨论实验者期望等方法学效应,奠定盲法与标准化的实践理由。
- Experimental and Quasi-Experimental Designs for Generalized Causal Inference Shadish, Cook & Campbell · 2002 · 书 · 进阶在 Campbell & Stanley 传统上的现代扩展,适合之后想系统学因果推断设计时查阅。
10间隔复习
间隔复习:自动从 Day N-1、N-3、N-7 中抽题。先凭记忆作答,再看答案。
关于心理学的“可重复性危机”,下列说法哪一项最准确?来自 Day 1 · 心理学凭什么算科学:用证据看人(1 天前)
- A. 它证明了大多数心理学研究都是编造的
- B. 开放科学合作组织(2015)重复的研究中约 36% 得到显著结果,效应量平均约为原来的一半,提示小样本、发表偏倚等问题
- C. 大规模预注册重复研究证实了自我损耗效应
- D. 只要一次重复失败,就足以证明原效应不存在
查看答案
A 过度引申:重复失败多源于方法问题而非造假,且许多效应(如锚定效应)重复良好。C 相反:Hagger 等(2016)的预注册多实验室重复发现效应接近零。D 错误:单次重复失败也可能有自身局限,需要综合多项证据判断。
某文章写道:“调查显示,每天喝咖啡的人抑郁风险更低,所以喝咖啡可以预防抑郁。”这一推论最主要的问题是?来自 Day 1 · 心理学凭什么算科学:用证据看人(1 天前)
- A. 违反了可证伪性原则
- B. 把相关当成了因果
- C. 属于巴纳姆效应
- D. 属于 HARKing
查看答案
调查只能显示两者相关。可能存在反向因果(抑郁的人精力差、改变了饮食习惯),也可能有第三变量(如收入、工作状态、睡眠、社交活动同时影响两者)。要检验因果,需要随机分配的实验或设计更严谨的纵向研究。
Day 1 · 心理学凭什么算科学:用证据看人
心理学算科学,不是因为它研究“人心”,而是因为它用可检验、可重复、公开的证据回答关于人的问题,并且在证据面前愿意承认自己错了。
1一句话核心
心理学算科学,不是因为它研究“人心”,而是因为它用可检验、可重复、公开的证据回答关于人的问题,并且在证据面前愿意承认自己错了。
2概念讲解
1. 为什么“凭常识懂人”不够
每个人都是“业余心理学家”:我们每天都在猜别人为什么这样做、下一步会怎样。问题在于,常识往往可以同时解释相反的结果。“物以类聚”和“异性相吸”都是俗语;“小别胜新婚”和“眼不见,心不烦”也都是。无论两个人分开后感情变好还是变淡,常识都能事后给出一个说法。
一个什么结果都能解释的说法,其实什么也没预测。科学心理学要做的,是把这些模糊的直觉变成可以被数据推翻的具体问题,例如:“在什么条件下、对哪些人、相似性对吸引力的影响有多大?”然后去测量。
2. 科学的三个基本特征
心理学家基思·斯坦诺维奇(Keith Stanovich)在《这才是心理学》(How to Think Straight About Psychology)中把科学概括为三点,这也是本课程判断一切说法的底层标准:
- 系统的实证主义:靠有计划、有控制的观察和测量回答问题,而不是靠权威、直觉或个人经历。
- 知识公开可验证:方法要写清楚,别人照做能得到类似结果;研究要经过同行评议。一个只有提出者本人能“验证”的发现,不算科学知识。
- 研究可解决的问题:问题必须能用现有方法检验。“人生的意义是什么”很重要,但不是实证问题;“有明确目标的人主观幸福感是否更高”则可以研究。
3. 可证伪性:好理论要敢于“冒险”
哲学家卡尔·波普尔(Karl Popper)提出:一个理论是否科学,关键不在于能找到多少支持它的例子,而在于它是否明确说出了什么情况会证明它是错的——这叫可证伪性(falsifiability)。
波普尔在《猜想与反驳》(1963)中举过一个对照:1919 年日食观测检验了爱因斯坦广义相对论关于光线弯曲的预测,如果观测结果不符,理论就会被推翻——它冒了真实的风险。相比之下,他认为当时的精神分析(弗洛伊德)和个体心理学(阿德勒)无论出现什么行为都能解释:一个人把孩子推下水,或者一个人舍命救孩子,两种理论都能自圆其说。波普尔指出,这种“处处都能被证实”恰恰是弱点,而不是优点。
| 维度 | 科学心理学 | 伪心理学(常见表现) |
|---|---|---|
| 主张的形式 | 具体、可测量,说清楚什么结果会推翻它 | 模糊、万能,任何结果都能解释 |
| 对反例的态度 | 认真对待,修正或放弃理论 | 解释掉反例(“你还没真正领悟”) |
| 证据来源 | 对照研究、大样本、重复验证 | 个人经历、客户好评、名人背书 |
| 是否公开检验 | 公开方法与数据,接受同行审查 | “独家方法”“核心技术保密” |
| 随时间的变化 | 不断自我修正、积累 | 几十年不变,或只改包装 |
| 语言风格 | 常带限定:“平均而言”“在某些条件下” | 绝对化:“100% 有效”“一眼看穿” |
4. 相关不等于因果
“相关”指两个变量一起变化;“因果”指一个变量的改变会导致另一个变化。两者之间隔着两道坎:
- 方向性问题:可能是 B 导致 A,而不是 A 导致 B。
- 第三变量问题:可能有一个没被测量的 C 同时影响 A 和 B。
| 相关研究 | 实验 | |
|---|---|---|
| 研究者做什么 | 测量已存在的变量,看它们是否一起变化 | 主动操纵自变量,测量因变量 |
| 是否随机分配 | 否 | 是(这是关键) |
| 能否推断因果 | 不能直接推断 | 可以(在设计良好的前提下) |
| 适用场景 | 无法或不应操纵的变量,如童年经历、性别 | 可操纵且符合伦理的变量 |
| 常用统计量 | 相关系数 r(-1 到 +1) | 组间差异、效应量(如 Cohen's d) |
斯坦诺维奇书中有一个经典历史案例:20 世纪初美国南方糙皮病(pellagra)流行,人们发现它与卫生条件差的地区高度相关,于是怀疑是传染病。美国公共卫生署的约瑟夫·戈德伯格(Joseph Goldberger)认为真正的原因是饮食缺乏,“卫生差”和“糙皮病”都是贫困这个第三变量的结果。他通过改变饮食的研究证明了这一点;后来科学家确认糙皮病的直接原因是缺乏烟酸(维生素 B3)。
要确立因果,最有力的方法是实验:研究者主动操纵自变量,并通过随机分配让各组在其他方面平均而言相同。这样两组之后出现的差异,才能较有把握地归因于操纵本身。
5. 个案 vs 数据:“我认识一个人……”
“我爷爷每天抽烟,活到 95 岁。”斯坦诺维奇把这类论证称为“某人统计”(person-who statistics):用一个鲜活的反例去否定一个概率性的规律。可心理学和医学中的大多数规律本来就是概率性的——“吸烟提高患肺癌的风险”从来不意味着“每个吸烟者都会得肺癌”。
个案之所以说服力强,是因为它生动、容易想起。特沃斯基与卡尼曼(Tversky & Kahneman, 1973)描述的可得性启发指出:我们常根据例子“多容易想到”来判断事件有多常见。飞机失事的新闻让人觉得坐飞机很危险,就是这个道理。
这不等于个案毫无价值:个案能提出假设、提供细节、展示“可能性”;但要回答“普遍是否如此、有多大程度”,需要系统收集的数据。
6. 确认偏误:我们天生爱找“证明自己对”的证据
确认偏误(confirmation bias)指人们倾向于寻找、注意、解释和记住支持自己已有观点的信息,而忽视或贬低相反的信息(Nickerson, 1998 的综述)。彼得·沃森(Peter Wason)1960 年的“2-4-6 任务”是经典演示:告诉参与者“2, 4, 6”符合某条规则,请他们提出新的三个数来测试自己的猜想。很多人猜“依次加 2”,然后一直提出 8-10-12、20-22-24 这类符合自己猜想的数字,得到“符合”的反馈后就很有信心地宣布答案——结果错了。真正的规则只是“任意递增的三个数”。要发现这一点,需要主动试一试可能推翻自己猜想的数字,比如 1-7-30。
日常中,一旦你认定“这个同事不靠谱”,他每次迟到你都记得,他准时交付你却不太留意。确认偏误并不是“笨”的人才有,它是人类信息加工的普遍倾向,科学方法(对照组、盲法、预注册)在很大程度上就是为了对抗它而设计的。
7. 巴纳姆效应:为什么星座和性格测试“好准”
1949 年,心理学家伯特伦·福勒(Bertram Forer)让学生做了一份性格测验,一周后给每人发了一份“个人分析报告”,请他们评价准确度(0–5 分)。学生们普遍给出了很高的分数——而实际上所有人拿到的是同一段文字,其中的句子大多摘自一本星座书,例如“你有时外向、友善、合群,有时内向、谨慎、保守”这样的描述。
这种现象后来被称为巴纳姆效应(Barnum effect,名称由保罗·米尔 Paul Meehl 在 1956 年推广开来),也叫福勒效应:人们会把笼统、普遍适用的描述当作对自己的准确刻画。让描述“显得准”的常见配方:
- 模糊且双面:“你有时……有时……”几乎对所有人成立。
- 偏正面:“你有很多尚未发挥的潜力”,人们更愿意接受讨喜的描述。
- 看起来是专门为你做的:填了问卷、输入了生日,会让人更相信结果是“个性化”的。
- 来源显得权威:专家、测评机构、精美的报告。
关于 MBTI 等类型测试,需要说得公允一些:它不等同于星座,题目确实在测量一些真实的偏好。但研究者对它有具体的批评——例如把连续分布的特质硬分成两类、部分人重测时类型会改变(参见 Pittenger, 2005);而它的类型描述大多写得正面、宽泛,这正是巴纳姆效应容易发挥作用的地方。学术研究中更常用的是大五人格模型,我们会在模块 4 详细讲。
8. 可重复性危机:心理学如何面对自己的错误
2015 年,由布莱恩·诺塞克(Brian Nosek)等人发起的开放科学合作组织(Open Science Collaboration)在《科学》(Science)上发表报告:他们重复了 2008 年发表在三本心理学顶级期刊上的 100 项研究。原研究中有 97% 报告了统计显著的结果,而重复研究中只有约 36% 得到显著结果;重复研究的效应量平均只有原研究的一半左右。
此后,一些曾经广为流传的发现在大规模重复中表现不佳,例如“自我损耗”(意志力像肌肉一样会被用完)和“权力姿势”(摆出扩张的姿势能改变激素水平),详见下方研究卡片。
造成问题的主要原因包括:
- 样本太小:统计检验力不足,偶然结果更容易被当成发现。
- 分析灵活性(p-hacking):多测几个指标、多试几种分析、数据“够显著”就停止收集,会大幅增加假阳性(Simmons, Nelson & Simonsohn, 2011)。
- 发表偏倚:显著的“新奇发现”更容易发表,失败的结果被锁进抽屉。
- 事后假设(HARKing):看到结果后再把它写成“事先预期”(Kerr, 1998)。
心理学界的回应是一系列改革:预注册(事先公开假设和分析计划)、注册报告(期刊在看到结果前就根据方法决定是否发表)、公开数据与材料、多实验室联合重复(如 Many Labs 项目)。
9. 本课程为什么给每项研究标注证据强度
基于上面的原因,本课程提到的每一项研究都会带一个证据标签。它是一种对当前证据状况的概括判断,不是永久结论——新证据出现时,标签也会随之调整。
| 标签 | 含义 | 你该怎么用 |
|---|---|---|
| 稳固 | 多次独立重复、元分析支持,或已成为领域共识 | 可以作为理解与决策的依据,但仍注意适用条件 |
| 有争议 | 结果不一致、效应大小或解释存在明显分歧、边界条件不清 | 当作“值得参考的假设”,不要据此下重大结论 |
| 已被质疑 | 大规模或预注册的重复研究失败,或原作者公开撤回 | 了解它的历史与教训;不要再当作事实引用 |
3经典研究与人物
做了什么给学生做性格测验后,发给每人一份“个性化”报告,请他们评价准确度;实际上所有人拿到的是同一段摘自星座书的笼统描述。
发现学生普遍认为报告对自己描述得很准确。这说明“觉得准”并不能证明一个测评有效。
证据说明巴纳姆效应此后被多次重复,并有文献综述(如 Dickson & Kelly, 1985)。效应强弱会受描述是否正面、来源是否权威、是否显得个性化等因素影响。
做了什么让参与者通过提出三个数的组合来发现隐藏规则(实际是“任意递增”)。
发现多数人倾向于只测试符合自己猜想的例子,很少主动寻找可能否定猜想的例子,因而常得出过窄的错误规则。
证据说明“人们偏好寻找支持性证据”这一现象非常稳固(Nickerson, 1998)。但 Klayman & Ha(1987)指出,这种“正向检验策略”在很多现实情境中其实是合理的,并非总是非理性——问题在于规则比猜想更宽时它会失效。
做了什么面对糙皮病与卫生条件差的高相关,戈德伯格通过改变饮食的研究检验“饮食缺乏”假设,并论证该病并非传染病。
发现卫生差与糙皮病都源于贫困导致的饮食缺乏;后来确认直接原因是烟酸缺乏。这是“第三变量”的教科书案例。
证据说明病因已被医学确认。该案例被斯坦诺维奇用来说明相关与因果的区别。
做了什么近 300 名研究者合作,重复 2008 年发表于三本心理学期刊的 100 项研究,发表于 Science。
发现原研究 97% 显著,重复研究约 36% 显著;重复效应量平均约为原研究的一半。
证据说明“可重复率低于人们以为的水平”这一总体结论得到后续项目呼应(如 Many Labs 2、Camerer 等 2018 年对社会科学实验的重复)。但具体的“可重复率”数字如何解读仍有争论,不应简单理解为“64% 的研究是假的”。
做了什么36 个实验室、数千名参与者使用相同流程,同时重复 13 个经典效应。
发现多数效应得到了重复,其中锚定效应非常稳健;但也有效应(如国旗启动、金钱启动)未能重复。
证据说明它展示了可重复性检验的“另一面”:心理学中有相当多扎实的发现,关键是分辨哪些是。
做了什么原研究中,先被要求抵制巧克力饼干、只吃萝卜的参与者,在随后的难解谜题上坚持时间更短,被解释为“自控资源被耗尽”。
发现该理论曾被数百项研究引用和“支持”,并广泛进入自我管理类畅销书。
证据说明Hagger 等(2016)在 23 个实验室、两千多名参与者中进行预注册重复,效应接近于零;Vohs 等(2021)的多实验室预注册研究也只发现极小或接近零的效应。早期大量“支持”研究可能受发表偏倚和小样本影响。
做了什么让参与者摆出扩张的“高权力”姿势约两分钟,报告其睾酮上升、皮质醇下降、更愿意冒险。
发现相关 TED 演讲广为传播,“面试前摆两分钟超人姿势”成为流行建议。
证据说明Ranehill 等(2015)以更大样本未能重复激素和冒险行为上的效应;第一作者 Dana Carney 于 2016 年公开表示她不再相信权力姿势的效应是真实的。关于姿势是否能让人主观上感觉更有力量,仍有争议(Cuddy 等 2018 年的分析认为有,其他研究者对此存疑)。
做了什么通过模拟和一个故意设计的真实实验,展示研究者在分析中的常见“自由选择”会如何制造出显著结果。
发现借助灵活的分析,他们甚至“证明”了听某首披头士歌曲能让人的实际年龄变小——一个明显不可能的结论,以此说明问题的严重性。
证据说明这是方法学论证,其逻辑和模拟结果被广泛接受,直接推动了预注册等改革。
4人际中怎么用
判断他人把“他就是这种人”改写成一个假设
当你认定“他不在乎我”“她很自私”时,试着在心里加上“(待验证)”。然后像做 2-4-6 任务那样,主动留意可能推翻它的事:他有没有做过在乎你的事?在哪些情况下她并不自私?这样不是让你放弃判断,而是让判断更接近真实的人。
沟通区分“每次都这样”与“有几次这样”
吵架时的“你总是……”“你从来不……”常是可得性和确认偏误的产物:最刺痛的几次最容易想起。换成具体的描述(“这周有两次你到家没回消息”)更准确,也更不容易让对方陷入防御。
因果别急着把“同时发生”当成“因为”
“每次我提工作,他就不耐烦”——也许是因为话题,也许只是你总在他刚下班、最累的时候提(第三变量:疲劳和时间点)。换个时间试一次,就是一个小小的“实验”。
被理解感警惕“说中了”,也学会真正说中别人
当一个测试、一位“大师”或一个新认识的人让你觉得“好懂我”,先问一句:这段话换个人读是否也成立?反过来,想让别人感到被理解,笼统的夸奖(“你很有潜力”)不如具体的观察(“你开会时会先把别人的想法复述一遍再补充”)。
社交MBTI 可以当话题,别当标签
用 MBTI 或星座聊天、破冰无伤大雅;但用它预测一个人会怎么做、适不适合交往或共事,就超出了它的证据范围。
5工作中怎么用
品牌“专属于你”的文案为什么有效,边界在哪
个性化报告、年度账单、测试类 H5 常让用户觉得“好懂我”,其中一部分力量来自巴纳姆效应:宽泛、正面、看起来是为你定制的描述。用它提升体验可以,但要避免让用户误以为得到了专业的评估(例如用“测试结果”暗示健康或能力诊断)。
营销投放后销量涨了,不等于投放有效
活动上线与销量上升同时发生,可能是季节、竞品断货、自然增长等第三变量。更可靠的做法是设置随机保留组(holdout)或 A/B 测试:随机让一部分用户看不到广告,比较两组差异——这就是把实验法用到营销归因上。
管理招聘别用类型测试做筛选,结构化面试更可靠
MBTI 的发行机构本身也声明它不应用于招聘筛选。人员选拔研究的元分析(Schmidt & Hunter, 1998;Sackett 等 2022 年的修正分析)显示,结构化面试(统一问题、统一评分标准)对工作绩效的预测力明显好于随意聊天式的非结构化面试。
管理绩效评估中的确认偏误
对一个员工的第一印象会影响你之后注意哪些事。做法:平时用简短记录积累具体事例(好的和不好的都记),评估时先看记录再下结论,并主动问自己“有什么证据和我的印象相反?”
产品一个大客户的反馈,是个案还是规律?
用户访谈里生动的抱怨很有启发价值(提出假设),但决定是否投入开发,需要行为数据和更大样本验证。同时注意:只调研现有用户,会漏掉那些已经流失或从未转化的人。A/B 测试中,事先确定核心指标和样本量,不要反复偷看结果、显著就停——这正是产品版的 p-hacking。
管理读管理和效率类畅销书时,查一下证据
“意志力会被用完,所以重要决策放早上”(源于自我损耗)、“开会前摆个强势姿势”(源于权力姿势)这类建议都建立在已被质疑的研究上。遇到“研究表明”,至少追问:是哪项研究?样本多大?有没有被独立重复?
6考点速记
- 科学的三个特征(Stanovich):系统的实证主义、知识公开可验证、研究可解决的问题。
- 可证伪性(Popper):科学理论必须能明确指出什么观察结果会证明它是错的;能解释一切的理论不可证伪。
- 相关≠因果:两大障碍是方向性问题和第三变量问题。相关系数 r 取值 -1 到 +1,绝对值表示强度,正负表示方向。
- 实验法三要素:操纵自变量、测量因变量、随机分配被试到实验组与控制组;随机分配是推断因果的关键。注意区分随机分配(内部效度)与随机抽样(外部效度/代表性)。
- 巴纳姆效应 / 福勒效应(Forer, 1949):人们把笼统、普遍适用的描述视为对自己的准确刻画。
- 确认偏误:寻找和记住支持已有信念的信息;经典演示为 Wason(1960)2-4-6 任务。
- 可得性启发(Tversky & Kahneman, 1973):依据例子容易想起的程度判断频率或概率。
- 可重复性危机:OSC(2015)重复 100 项研究,约 36% 得到显著结果;主要原因:小样本、p-hacking、发表偏倚、HARKing;对策:预注册、注册报告、开放数据、多实验室重复。
7自测 3 题
某文章写道:“调查显示,每天喝咖啡的人抑郁风险更低,所以喝咖啡可以预防抑郁。”这一推论最主要的问题是?
- A. 违反了可证伪性原则
- B. 把相关当成了因果
- C. 属于巴纳姆效应
- D. 属于 HARKing
查看答案
调查只能显示两者相关。可能存在反向因果(抑郁的人精力差、改变了饮食习惯),也可能有第三变量(如收入、工作状态、睡眠、社交活动同时影响两者)。要检验因果,需要随机分配的实验或设计更严谨的纵向研究。
以下哪一个说法最难被证伪?
- A. 前一晚睡眠少于 5 小时的人,第二天工作记忆测验得分会更低
- B. 每个人内心深处都有未被意识到的冲突,它会以各种方式表现在行为中
- C. 当有旁人在场时,人们主动帮助陌生人的可能性会降低
- D. 使用结构化面试的公司,新员工一年后的绩效评分更高
查看答案
A、C、D 都说明了可测量的变量和预期方向,结果可能与预测相反,因此可以被检验和推翻。B 中“各种方式表现”意味着任何行为都可以被解释为支持它,没有任何观察能证明它错,所以最难证伪。
关于心理学的“可重复性危机”,下列说法哪一项最准确?
- A. 它证明了大多数心理学研究都是编造的
- B. 开放科学合作组织(2015)重复的研究中约 36% 得到显著结果,效应量平均约为原来的一半,提示小样本、发表偏倚等问题
- C. 大规模预注册重复研究证实了自我损耗效应
- D. 只要一次重复失败,就足以证明原效应不存在
查看答案
A 过度引申:重复失败多源于方法问题而非造假,且许多效应(如锚定效应)重复良好。C 相反:Hagger 等(2016)的预注册多实验室重复发现效应接近零。D 错误:单次重复失败也可能有自身局限,需要综合多项证据判断。
8今日练习(约 20 分钟)
准备纸笔或手机备忘录。今天的练习目标是:亲身体验偏误,并练习用科学的问题审视一个说法。
巴纳姆自测。读下面这段“为你定制”的描述,按 0–5 分给它的准确度打分:
“你很在意别人对你的看法,但也有自己的坚持。你在熟悉的人面前比较放松,在陌生场合会先观察再表态。你有一些还没充分发挥的能力。有时你会怀疑自己做的决定是否正确。”
打完分后想一想:你身边有几个人读到这段话会打低分?记下你的感受。
拆解一条“研究发现”。在新闻或社交媒体上找一条“研究表明……”的内容,回答:① 这是相关研究还是实验(有没有随机分配)?② 样本大约多少人、是什么人?③ 能否想到至少两个第三变量或反向因果的可能?④ 标题的结论是否超出了研究本身能说明的范围?
给一个判断找反例。写下你对某个人(同事、家人、朋友)的一个判断,再写出:“如果我看到 ____,我会改变这个看法。”接下来一周,有意留意这类反例。
一句话复盘。用自己的话写下:今天学到的哪一个概念,最可能改变我明天的某个具体做法?
9延伸阅读
- 《这才是心理学:看穿伪心理学的本质》(How to Think Straight About Psychology) Keith E. Stanovich · 书 · 入门首选本课“科学思维”模块的主要参考。可证伪性、某人统计、相关与因果、糙皮病案例都在其中,有中译本。
- 《猜想与反驳》(Conjectures and Refutations) Karl Popper · 1963 · 书第一章“科学:猜想与反驳”讨论了可证伪性以及精神分析与相对论的对比。偏哲学,可只读第一章。
- How We Know What Isn't So: The Fallibility of Human Reason in Everyday Life Thomas Gilovich · 1991 · 书系统讨论人们为何会坚信错误的东西(随机中看到模式、选择性证据等),可读性强。
- Science Fictions Stuart Ritchie · 2020 · 书从内部视角讲科学中的造假、偏倚、疏忽与夸大,以及如何改进,对理解可重复性危机很有帮助。
- Estimating the reproducibility of psychological science Open Science Collaboration · 2015 · 论文 · Science, 349(6251), aac4716可重复性危机的标志性论文,摘要和图表值得直接读原文。
- The fallacy of personal validation: A classroom demonstration of gullibility Bertram R. Forer · 1949 · 论文 · Journal of Abnormal and Social Psychology, 44(1), 118–123巴纳姆效应的原始研究,篇幅很短。
- Confirmation bias: A ubiquitous phenomenon in many guises Raymond S. Nickerson · 1998 · 论文 · Review of General Psychology, 2(2), 175–220关于确认偏误最常被引用的综述。
- False-positive psychology Simmons, Nelson & Simonsohn · 2011 · 论文 · Psychological Science, 22(11), 1359–1366理解 p-hacking 的必读论文,论证清楚、并不艰深。
10间隔复习
今天是起点,还没有更早的内容可复习。从 Day 2 开始,这里会自动出现前几天(N-1、N-3、N-7)的题目,帮你在遗忘之前重新提取记忆。