心理学日课
从科学方法出发,走到认知、发展、人格、情绪、关系、心理健康与应用。每天约 40 分钟。
Day 3 · 相关、调查与观察:非实验证据怎么读
大多数关于人的证据并不是实验:调查、观察与相关研究能描述与预测,但读它们时要先问抽样是否偏、回答是否装、相关有多强——以及第三变量与方向性会不会把因果故事讲错。
1一句话核心
大多数关于人的证据并不是实验:调查、观察与相关研究能描述与预测,但读它们时要先问抽样是否偏、回答是否装、相关有多强——以及第三变量与方向性会不会把因果故事讲错。
2概念讲解
1. 昨天实验能回答因果;今天回到“不能操纵时怎么办”
昨天的主线是:要推断“是 A 导致了 B”,关键是操纵自变量、随机分配,以及控制混淆与期望。可现实里大量问题不能或不该做实验——童年创伤、人格特质、收入、依恋风格、文化规范,你无法也不应随机分配。
今天专门读非实验证据:描述性研究、相关研究、问卷调查与行为观察。它们不是“低配实验”,而是另一套工具。读得好,能做预测、找模式、提出可检验的假设;读得差,就会把相关当成因果、把方便样本当成全国、把“大家都这么答”当成真相。
2. 描述 vs 相关:先分清你在回答哪类问题
描述性研究(descriptive research)回答“是什么、有多少、长什么样”:某人群的平均睡眠时长、某症状的患病率、某行为在自然情境中出现的频率。它不声称变量之间的因果,甚至不一定强调变量之间的关联。相关研究(correlational research)回答“两个(或多个)变量是否一起变化、方向如何、强度如何”。研究者测量已存在的变量,不操纵它们。相关可以是正的(一起升高)、负的(一个升一个降),或接近零(几乎不一起变)。两者常叠在一起:一次大型调查既可描述“加班有多普遍”,也可报告“加班时长与倦怠得分的相关”。读报告时先看作者声称的是描述、相关,还是偷偷滑向了因果。
| 研究者主要做什么 | 擅长回答 | 典型陷阱 | |
|---|---|---|---|
| 描述 | 系统测量频率、均值、分布 | 现状画像 | 样本偏了仍说“大家都……” |
| 相关 | 同时测量多个变量,看共变 | 关联与预测 | 把 r 讲成“导致” |
| 观察 | 在自然或结构化情境中记录行为 | 真实情境中的行为模式 | 观察者偏差、被观察改变行为 |
3. 问卷调查:问什么、问谁、怎么答都会歪
问卷与量表是心理学和社会科学最常用的工具之一:便宜、可规模化、适合测态度、信念与自我报告的经历。但“发了问卷”不等于“得到了真相”。至少盯住三件事:抽样、题目与计分、回答偏差。
- 抽样(sampling):你测到的是谁?方便样本(班级、粉丝群、扫码有礼)只能代表愿意填的人。随机抽样才更服务代表性(昨天提过:它服务外部效度,不等于随机分配)。非概率样本仍可用于探索与预测模型,但推广话术要降级。
- 响应率与无应答偏差:没填的人可能系统不同(更忙、更回避、更不满)。高响应率不能自动证明无偏,但极低响应率时要怀疑“谁愿意说话”。
- 题目措辞与量表质量:引导性措辞、双重问题(一句里问两件事)、选项不对称,都会推高某种答案。正式量表通常报告信度(如内部一致性)与效度证据;自编三道题就宣称测到了“抑郁”或“忠诚度”,要警惕。
- 社会赞许性(social desirability):人们倾向于以显得好、合规范的方式作答——少报偏见与不良行为,多报捐赠、运动、公正。Crowne 与 Marlowe 发展的社会赞许性量表,正是用来估计这种倾向有多强(见研究卡片)。
- 其他常见回答偏差:默许偏差(爱选“同意”)、极端作答或一律中间、回忆偏差、当下情绪污染回顾。
实用读法:看到“调查显示 X% 的人认为……”时,先问——样本是谁?怎么抽的?题目怎么问的?有没有可能大家在“表演正确答案”?
4. 观察法:看行为,不只听说法
人们说的和做的常不一致。因此研究者也会观察行为:
- 自然观察(naturalistic observation):在尽量不打扰的日常情境中记录(如操场互动、商店排队)。生态真实性高,但情境杂、难控制,且难以推断因果。
- 结构化观察(structured observation):在标准情境或实验室中设置可比任务(如陌生情境程序观察依恋行为),便于编码与比较,但人工痕迹更重。
- 参与观察:观察者进入群体内部;能获得深度,也更容易带入主观卷入与伦理风险。
观察法的两大经典威胁:观察者偏差(编码者按预期去“看见”行为;可用详细编码手册、多名编码者与一致性检验缓解);以及反应性(知道被观察而改变行为,即霍桑式被关注)。录像事后编码、隐蔽或习惯化观察、明确的行为操作定义,都是常见防护。
5. 相关系数 r:方向、强度,以及它不是什么
皮尔逊积差相关(Pearson’s r,由 Karl Pearson 在 19–20 世纪之交系统发展;更早 Galton 等人已有相关思想)是最常见的线性相关指标,取值大约在 −1 到 +1:
- 符号表示方向:正值 = 同向共变;负值 = 反向共变。
- 绝对值表示强度:越接近 1,点越贴近一条直线;接近 0 则线性共变很弱。
- r 描述的是线性关系。若真实关系是 U 形等非线性,r 可能接近 0,并不代表“毫无关系”。此时需看散点图或改用其他方法。
- 当变量是等级(名次)而非等距分数时,常用 Spearman 等级相关等替代指标;逻辑类似,仍是“共变有多强”,不是因果。
| 问题 | 为什么问 |
|---|---|
| 散点图长什么样? | 有无非线性、异常点、亚组混在一起 |
| 样本是谁、N 是否过小? | 小样本的 r 很不稳定;极端群体会扭曲 |
| 测量是否可靠? | 不可靠的量表会压低或扭曲相关 |
| 有没有第三变量候选? | 年龄、社会经济地位、季节、共同方法偏差等 |
| 作者有没有把相关写成因果? | “导致”“提升”“因为”需要实验或更强设计支撑 |
教科书里常用口语标尺帮助直觉(如 |r| 约 0.1 / 0.3 / 0.5 对应小/中/大),但这只是粗参照,且因领域而异;效应是否“重要”还取决于后果、基线与决策成本。不要背一个绝对分界当成真理。
更关键的禁令:r ≠ 因果。再大的相关,单独都不能证明“A 导致 B”。
6. 为什么相关推不出因果:方向性与第三变量
Day 1 已点过两道坎,今天把它们变成读报告的固定动作:
- 方向性问题(directionality):A 与 B 相关,可能是 A→B,也可能是 B→A,或互为反馈。例如“孤独感与刷手机时长相关”——究竟是孤独导致多刷,还是多刷挤掉当面社交后更孤独,或两者循环?单凭同时测得的相关,分不开。
- 第三变量问题(third-variable problem):未测的 C 同时推高(或压低)A 与 B,造成 A–B 的虚假相关(spurious correlation)。教科书经典例子:冰淇淋销量与犯罪率常一起升高——更合理的共同驱动往往是天气炎热(以及人们出门更多等伴随因素),而不是“冰淇淋导致犯罪”。
- 选择与限制范围:只在极端群体里抽样、或把不同子群糊成一团,都会制造或抹掉相关。
纵向追踪(谁先变化)、统计上控制候选第三变量、工具变量与自然实验、以及——在伦理允许时——回到昨天的真实验,都是减轻这些威胁的路径。没有银弹;每多挡掉一种替代解释,因果主张才能升一级。
7. 非实验证据何时仍然非常有用
若相关“不能直接给因果”,为什么还要大规模做调查与观察?因为它们在这些任务上往往不可替代:
- 预测:招聘、信贷风险、流失预警、流行病学筛查——目标常常是“准不准”,不一定是当场证明机制。相关与回归可以是好的预测工具(仍要外部验证,防过拟合)。
- 伦理与可行性:不能为了研究去随机分配创伤、歧视或贫困;描述与相关是负责任的起点。
- 生态效度与真实世界基线:实验室很干净,但政策与产品要知道田间地头实际分布;大型调查与自然观察提供地图。
- 生成假设:相关模式提示“该去做哪个实验、该控制哪个第三变量”。
- 收敛证据:当实验、纵向、准实验与相关指向同一机制,信念可以强于单一方法。
斯坦诺维奇在《这才是心理学》中反复强调:公众常把“相关不是因果”听成“相关无用”。更准确的态度是——相关是线索与预测器,不是因果证明书;价值取决于你用它回答什么问题。
8. 把整条链串起来:读非实验报告的检查清单
下次刷到调查、白皮书、或“大数据发现”时,按顺序问:
- 这是描述、相关,还是作者在暗示因果?
- 样本是谁?抽样方式与响应率如何?能推广到哪一群人?
- 变量如何操作定义?自陈、行为观察,还是客观记录?有无社会赞许与共同方法偏差?
- 若给了 r 或“显著相关”:方向、大致强度、是否展示散点或稳健性?
- 方向性与第三变量的替代解释是什么?作者有没有诚实讨论?
- 若用于决策:目标是预测还是解释机制?证据层级是否匹配决策代价?
3经典研究与人物
做了什么Crowne 与 Marlowe 编制了一套描述“过于美好、却不大可能全真”的条目(例如极少有过负面冲动、几乎总按规范行事),用以估计个体在自陈测验中迎合社会期望的倾向。后续衍生了多种社会赞许性/印象管理量表。
发现社会赞许性倾向会系统抬高“光彩”回答、压低敏感负面回答;在评估偏见、健康行为、品德与依从时,若不加考虑,相关与均值都可能被扭曲。
证据说明“人们会按赞许方式作答”已成为问卷方法学的基本共识;具体量表的结构(如印象管理 vs 自欺)与效标关联仍有理论争论,但威胁本身稳固。实践上:匿名、措辞去威胁、加入测谎/赞许性量表、或以行为与他评交叉验证。
做了什么在许多城市的时间序列里,冰淇淋销量与某些犯罪或暴力事件计数会在夏季一起升高。若只看两者相关,容易编出“甜食导致攻击”的故事。
发现更合理的解释是第三变量(如高温、户外活动增加、社交机会变化等)同时推高两者;相关是真的共变,因果故事却是假的。
证据说明该例的教学功能是稳固的:演示“显著相关 ≠ 机制正确”。真实犯罪学中气温与攻击的关联本身也有研究文献,机制复杂(生理唤醒、社交机会、酒精等),不能简化成单一漫画因果;本课用它锚定第三变量思维,而非提供犯罪学结论。
做了什么Galton 在研究遗传与回归到均值等现象时发展了相关与回归的直觉与图示;Karl Pearson 将积差相关系数等形式化,使之成为可计算、可比较的标准统计量。
发现相关成为描述共变的通用语言,使心理学与社会科学能在不做实验时仍量化“一起变化的程度”——同时也把“如何解释相关”永久写进方法学议程。
证据说明历史归因应谨慎:相关思想有多人贡献,Pearson 的 r 是最流行的线性形式之一而非唯一。统计工具的“稳固”不等于任何一次具体相关发现的稳固;工具正确,解释仍可能错。
做了什么LaPiere 与一对华人夫妻旅行美国,几乎所有旅馆与餐厅都接待了他们;事后写信询问“是否接待华人顾客”时,大量书面回复却表示不会接待。该演示常被用来说明问卷态度与实际行为可能脱节。
发现自我报告的态度/意向,并不总能很好地预测即时情境中的行为;情境压力、规范与测量方式都会造成差距。
证据说明LaPiere 研究在抽样、测量对应性(写信的人是否即接待者)等方面受到方法批评,不宜当作唯一铁证。但“态度–行为一致性有条件、自陈需谨慎”的更大文献方向得到大量后续支持;故标为有争议的经典案例 + 稳妥的方法学教训。
4人际中怎么用
倾听与判断别把“他总这样”当成已证实的因果
你观察到伴侣一加班就易怒,相关可能是真的;但方向可能是压力→易怒,也可能是未说出口的关系不满让人更想躲在加班里,还可能有睡眠、咖啡因等第三变量。沟通时先描述共变(“我注意到加班那天我们更容易吵”),再一起找可检验的解释,而不是直接宣判“你就是因为工作不爱我”。
提问方式你的问题可能在“社会赞许”对方
问“你是不是觉得我不重要?”或“你怎么又这样?”会把对方推进防御与正确表演。改成具体、低威胁的描述性问题(“昨晚我提计划时,你当时在忙什么?”“怎样说你会比较容易接住?”),更接近好问卷设计:降低赞许压力,增加可观察信息。
冲突用观察补自陈:看重复行为,不只听一次保证
道歉与承诺是自陈;是否改掉打断、是否准时、是否分担家务是行为。可以约定一个短观察窗(如两周)和可操作的行为标准,再回顾——这是生活里的“结构化观察”,比反复追问“你到底在不在乎”更少空想。
5工作中怎么用
营销NPS/满意度相关很高,也不等于“改分就增购”
用户满意度与复购常呈正相关,但可能是产品质量、价格或品类惯性等第三变量在驱动。优化问卷分数(话术、礼品诱导好评)可能抬高 r 左侧的分数,却不改变真实行为。决策时把满意度当预警与预测指标,机制结论仍要靠实验或因果识别。
产品问卷说“想要”,行为说“不用”:交叉验证
功能投票与访谈充满社会赞许与假想偏好(“我当然关心隐私/无障碍/学习功能”)。上线前用原型行为数据、等待列表真实转化、A/B 与漏斗观察交叉验证;把自陈当假设生成器,把行为当更硬的因变量。
管理敬业度调查:先查抽样与匿名,再开大会
若只有自愿填、或主管能看到谁填了什么,分数会被赞许性与恐惧扭曲。先保证匿名与覆盖,区分“描述现状”与“归因到某领导”;行动项尽量落到可观察行为(会议长度、反馈频次),并用前后测或对照团队评估,而不是把一次相关当罪状。
品牌把“相关洞察”写成因果口号前,降级语言
数据说“提及可持续的消费者与高花费相关”,广告若写成“讲可持续就会卖得更好”,已偷渡因果。对内可用相关做细分与预测;对外主张若暗示干预有效,需要实验或至少准实验证据,否则诚实写成共现洞察。
6考点速记
- 描述性研究:刻画现状(频率、均值、分布);相关研究:刻画共变(方向与强度);二者通常不直接推断因果。
- 问卷调查威胁:抽样偏差、无应答、措辞与量表质量、社会赞许性、默许/极端作答、回忆偏差。
- 社会赞许性:按合规范、讨喜的方式作答的倾向;Crowne & Marlowe(1960)等量表用于估计该倾向。
- 观察法:自然观察生态好、控制弱;结构化观察可比性高、人工痕迹重;威胁含观察者偏差与反应性。
- Pearson’s r:约 −1 到 +1;符号=方向,绝对值≈线性强度;非因果;非线性时 r 可能误导——先看散点图。
- 方向性问题:A↔B 谁因谁果分不清;第三变量问题:C 造成 A–B 虚假相关(如冰淇淋–犯罪–炎热)。
- 非实验证据的用途:预测、伦理上不可操纵的课题、生态基线、生成假设、与实验收敛;“相关不是因果”≠“相关无用”。
- 对比实验(Day 2):随机分配与操纵服务因果/内部效度;相关与调查无操纵时,因果话术必须降级。
7自测 3 题
一项调查发现:员工远程办公天数与自评幸福感正相关。公司宣布“强制多在家办公以提升幸福”。最核心的方法问题是?
- A. 相关系数不可能为正
- B. 相关不能直接证明因果,可能存在方向性或第三变量(如岗位类型、自律、家务负担)
- C. 只有实验研究才允许使用问卷
- D. 幸福感无法操作定义,因此相关无意义
查看答案
正相关可以真实存在,但不能单独支持“增加远程天数导致幸福”。可能是更幸福/更适合的人选择远程,或第三变量同时影响两者。A 错误;C 错误;D 过度——幸福感可用量表操作定义,问题在因果解释而非完全不可测。
关于 Pearson’s r,下列哪一项正确?
- A. r = 0 证明两个变量在任何意义上都没有关系
- B. r 的绝对值越大,越能证明因果关系越强
- C. r 主要描述线性共变的方向与强度,不证明因果;非线性关系可能使 r 接近 0
- D. 只有 r > 0.8 的结果才可以发表
查看答案
r 是线性相关的摘要;U 形等关系可使 r≈0。相关强度≠因果强度。发表也没有 r>0.8 的规则。
Crowne 与 Marlowe 的社会赞许性量表,主要帮助研究者警惕什么?
- A. 随机分配失败
- B. 自陈回答被“装好/合规范”倾向扭曲
- C. 双盲被打破
- D. 外部效度必然为零
查看答案
社会赞许性是问卷回答偏差的核心来源之一。A、C 属于实验设计问题;D 夸大且与该量表无关。
8今日练习(约 20 分钟)
今天训练“读非实验证据”:拆一条相关/调查主张,并设计一个低威胁的小观察。
拆解一条调查或相关新闻/报告。写出:① 描述还是相关还是因果口吻?② 样本与抽样?③ 变量如何测(自陈/行为)?④ 若有相关,可能的方向性与至少一个第三变量?⑤ 若你是决策者,最多能据此做什么(预测/探索/暂缓)?
改写一个高赞许性的问题。把“你是否是个公平的人?”改成 2–3 个更具体、可观察或更低威胁的问题(或情境选择题)。想一想:怎样问,对方更不必表演正确答案?
微型结构化观察。选一个关系或工作中的摩擦点,定义一个可观察行为(如“打断对方的次数”),规定 1 次 20 分钟对话的观察规则(谁记录、如何计数)。先只描述频率,不急着归因。
9延伸阅读
- 《这才是心理学》(How to Think Straight About Psychology)中论相关、调查与“相关不是因果”的章节 Keith E. Stanovich · 书 · 延续 Day 1–2用可读的例子巩固虚假相关、预测用途与公众误解;本课多处与其对齐。
- A new scale of social desirability independent of psychopathology Douglas P. Crowne & David Marlowe · 1960 · 论文 · Journal of Consulting PsychologyMarlowe–Crowne 社会赞许性量表的经典来源文献。
- Attitudes vs. Actions Richard T. LaPiere · 1934 · 论文 · Social Forces态度–行为差距的早期经典;阅读时一并了解后续方法批评与更现代的态度–行为研究。
- 《心理测量与评估》或任何一本导论教材中“相关、信度与调查法”章节 (教材通识,如 Cohen / Gravetter 等方法统计导论) · 教材章节用于把 r、散点图、抽样与信效度术语对照练习;选你正在用的考试教材即可。
10间隔复习
间隔复习:自动从 Day N-1、N-3、N-7 中抽题。先凭记忆作答,再看答案。
要把“压力”放进实验,研究者先要给出可观察的测量程序——这称为?来自 Day 2 · 实验设计:自变量、随机分配与混淆变量(1 天前)
查看答案
操作定义把抽象概念落实为具体测量或操纵程序,使研究可检验、可重复。
随机分配主要提升的是内部效度还是外部效度?为什么?来自 Day 2 · 实验设计:自变量、随机分配与混淆变量(1 天前)
查看答案
外部效度更多依赖抽样、情境代表性与跨情境重复;随机分配不自动解决推广问题。
Day 2 · 实验设计:自变量、随机分配与混淆变量
要推断“是 A 导致了 B”,关键不只是测到了差异,而是设计让除了你操纵的那一点之外,各组在其他方面平均相同——这靠操作定义、随机分配,以及对混淆变量与期望效应的主动防范。
1一句话核心
要推断“是 A 导致了 B”,关键不只是测到了差异,而是设计让除了你操纵的那一点之外,各组在其他方面平均相同——这靠操作定义、随机分配,以及对混淆变量与期望效应的主动防范。
2概念讲解
1. 从“相关不等于因果”到“怎样才能推断因果”
昨天我们说到:相关研究只能告诉我们变量一起变化,推断因果需要实验——研究者主动操纵某个变量,并通过随机分配让各组在其他方面平均而言相同。
今天把实验拆开:什么叫“操纵”?什么叫“随机分配”?为什么做完实验,别人仍可能说“你测到的差异其实不是因为你以为的那个原因”?答案就藏在操作定义、自变量与因变量、控制变量、混淆变量、内部效度与外部效度这些概念里。
2. 操作定义:把模糊概念变成可测量的东西
科学研究不能停在“压力”“智能”“吸引力”这类日常说法上——每个人对它们的理解可能都不一样。操作定义(operational definition)指:用一套具体的、可观察或可测量的程序,来界定一个概念在本研究中“是什么”。
例如:“压力大”可以操作定义为“过去一周 Perceived Stress Scale 得分 ≥ 某阈值”,也可以是“在公开演讲前即刻的心率”;“记忆好”可以是“听完词表后立刻正确回忆的个数”。不同操作定义测的未必是同一件事——所以写报告时必须写清楚,读者才能判断你测的到底是不是你声称的那个概念。
3. 自变量、因变量与控制变量
一次典型的实验里,至少要分清三类变量:
- 自变量(independent variable, IV):研究者主动操纵的变量。它是“原因候选”。例如:是否服用某药、是否收到积极期望标签、界面按钮是红色还是蓝色。
- 因变量(dependent variable, DV):研究者测量的结果变量。它是“效果候选”。例如:症状评分、测验成绩、点击率。
- 控制变量(control variables):研究者希望各组保持一致、或在分析中加以统计控制的因素,以免它们干扰因果解释。例如:测验时间、指导语措辞、屏幕亮度。
| 研究者做什么 | 例子(睡眠与记忆) | |
|---|---|---|
| 自变量 | 操纵(制造不同水平) | 随机安排:睡足 8 小时 vs 只睡 4 小时 |
| 因变量 | 测量结果 | 次日词表回忆正确数 |
| 控制变量 | 保持一致或加以控制 | 词表材料、测验时间、咖啡因摄入规则 |
记一个口诀:自变量是你改的,因变量是你看的,控制变量是你尽量让它别乱的。
4. 实验组与对照组:比较才产生意义
单独给一群人做干预再测结果,往往说不清变化是不是干预造成的——时间流逝、练习效应、自然好转都可能“看起来像有效”。因此实验通常至少有两组:
- 实验组(experimental group):接受研究者感兴趣的处理(treatment)。
- 对照组 / 控制组(control group):不接受该处理,或接受一个对照处理(如安慰剂、标准流程、另一种版本)。
对照组不是“被忽略的人”,而是让因果解释成立的基准线。没有可比的对照,你就很难知道差异来自哪里。
5. 随机分配:为什么它是推断因果的关键
把人分进实验组还是对照组,不能按“谁方便”“谁自愿”“谁看起来更适合”来分——那样两组从一开始就可能系统不同。随机分配(random assignment)指:用随机程序(掷硬币、随机数)决定每个人进哪一组,使已知与未知的个体差异在组间平均而言趋于平衡。
注意两件常被混为一谈的事:
- 随机分配:解决的是“各组是否可比”,服务内部效度(你能否说差异是由操纵造成的)。
- 随机抽样:解决的是“样本是否代表总体”,服务外部效度(你能否把结论推广到更大人群)。
一项研究可以有随机分配却没有随机抽样(很多实验室实验如此):它仍可能很适合推断因果,只是推广时要谨慎。反过来,大规模问卷调查即使抽样很好,若没有随机分配的操纵,仍难直接下因果结论。
6. 混淆变量与内部效度
混淆变量(confound)指:与自变量一起系统变化、因而也可能解释因变量变化的额外因素。一旦存在混淆,你就说不清结果到底是自变量造成的,还是那个“跟着变”的东西造成的。内部效度(internal validity)问的是:在这项研究内部,我们有多大把握说“是自变量导致了因变量的变化”?混淆越多、控制越差,内部效度越低。常见混淆来源包括:两组接受不同时长的关注、不同的指导语气、不同的时间段(一组早上测、一组晚上测)、主试对某组更热情、测量工具本身在两组使用方式不一致等。
7. 期望效应与双盲:人不是试管
心理学实验里的“材料”常常是人——参与者会猜研究目的,主试也会不知不觉流露期望。这类因素本身就能改变行为,从而变成混淆。
实验者期望效应(experimenter expectancy effect):主试对结果的预期,可能通过语气、表情、无意中的提示,影响参与者的表现。罗伯特·罗森塔尔(Robert Rosenthal)在 1960 年代用一系列研究系统展示了这一点;后来他与杰 Jacobson 把类似逻辑延伸到教室情境(见下方研究卡片)。安慰剂效应(placebo effect):仅仅因为相信自己接受了有效处理,结果就可能朝预期方向变化。在药物与干预研究中,常用安慰剂对照把“真处理的特异作用”与“被关注、被期望、仪式感”等区分开。防护工具是盲法:
- 单盲:参与者不知道自己在实验组还是对照组。
- 双盲:参与者与直接接触他们的主试/评估者都不知道分组(由第三方编码)。这样双方的期望都不容易系统性地“帮”某一组出成绩。
不是所有心理学研究都能做双盲(例如心理治疗中治疗师通常知道自己在用哪种疗法),但研究者仍应尽量让结果评定者保持盲态,并预先设定客观指标。
8. 外部效度:推得远,往往控得松
外部效度(external validity)问的是:结论能推广到哪些人、哪些情境、哪些操作定义?实验室里控制得越严,内部效度往往越高,但情境也可能越“不像日常”,推广时就要更小心。这不是让你鄙视实验室研究。内部效度薄弱的研究,推广得再远也只是在推广一个不可靠的因果故事。更健康的态度是:用高内部效度的研究建立机制,再用现场实验、多情境重复去检验边界条件——Donald Campbell 与 Julian Stanley(1963)以来的方法学传统,核心就是在这种取舍中把威胁一一列清。
| 核心问题 | 常见威胁 | 增强办法 | |
|---|---|---|---|
| 内部效度 | 差异真是 IV 造成的吗? | 混淆、选择偏差、期望效应、测量不一致 | 随机分配、对照、盲法、标准化流程 |
| 外部效度 | 能推广到谁、何种情境? | 样本特殊、情境人工、操作定义过窄 | 多样本、现场实验、概念重复与多操作定义 |
9. 把整条链串起来:一个最小检查清单
读到或设计一项“实验”时,可以按顺序问:
- 自变量是什么?有没有清晰的操作定义?
- 因变量怎么测?指标是否事先确定,还是事后挑显著的那个?
- 有没有恰当的对照组?
- 分组是否随机分配?若否,组间基线是否可能系统不同?
- 有哪些可能的混淆?流程是否标准化?
- 参与者与主试的期望是否被盲法或其他方式限制?
- 样本与情境支持怎样程度的推广?结论有没有说过头?
3经典研究与人物
做了什么在一所小学中,研究者对儿童做智力测验后,随机抽取约 20% 的学生,告诉教师这些孩子在来年会“智力猛长”(实际是随机标签,与真实分数无关)。数月后再测智力与学业表现。
发现原书报告:被标记为“即将绽放”的学生,尤其低年级,在某些智力测验增益上高于未被标记的同学。作者将其解释为教师期望通过互动传递,影响了学生表现。
证据说明该研究在教育与社会心理学中影响极大,但也长期受到方法与重复方面的批评(如测验选择、统计分析、效应是否稳健等)。后续文献对“教师期望能否稳定改变标准化智力分数”分歧明显;较稳妥的共识是:期望可能影响互动与机会分配,但对 IQ 分数的戏剧性效应不宜当作已确立事实。本课把它当作理解期望效应与研究争议的案例,而非板上钉钉的效应量来源。
做了什么罗森塔尔在动物与人类实验中系统操纵主试对结果的预期(例如告诉不同主试“这些大鼠更聪明”或暗示参与者会有某种表现),同时保持真实刺激材料相当。
发现主试的预期常能在结果上留下痕迹:即使程序看似相同,期望组仍可能出现符合预期的偏向。这说明“主试也是实验装置的一部分”。
证据说明实验者期望作为方法学威胁已被广泛接受,并直接推动了标准化脚本、自动化呈现与盲法的普及。具体效应大小随情境而异,但“需要防范主试期望”已成为良好实验实践的一部分。
做了什么评价干预是否有效时,将参与者随机分配到真处理或外观相似的安慰剂(或标准治疗),并尽量使参与者与结果评定者都不知道分组。
发现该设计把“处理的特异作用”与自然病程、回归均值、安慰剂与期望等因素分开,是医学与干预评价中推断因果的金标准框架之一。
证据说明安慰剂效应本身真实存在且机制复杂(期望、学习、医患互动等),双盲 RCT 并不是否认安慰剂不重要,而是防止把安慰剂与非特异因素误当成处理本身的效力。心理学干预因难以对治疗师完全双盲,常退而求其次:盲态评定、活跃对照、预注册结局指标。
做了什么在《Experimental and Quasi-Experimental Designs for Research》中,系统区分真实验与准实验,并列举历史、成熟、测验、仪器、选择、流失等对内部效度的威胁。
发现没有随机分配的“前后测对比”或“完整群体对比”,往往无法排除多种替代解释;设计的价值取决于它能挡掉哪些威胁。
证据说明该框架是心理学与教育学方法课的标准内容,后续由 Cook、Shadish 等人扩展,但核心问题意识(先问内部效度)一直适用。
4人际中怎么用
期待与关系你对TA的标签,可能悄悄改变互动
一旦认定“他就是懒”“她就是冷漠”,你的语气、解释空间和机会分配可能跟着变——对方感受到后,行为也可能朝标签靠拢。这不必夸大成“期望万能”,但值得自检:我最近有没有只收集符合标签的证据?有没有少给对方一次被看见的机会?
沟通把抱怨改成一个可检验的小实验
与其争论“你根本不在乎”,不如约定一个可观察的改变(操作定义):例如“这周我提前一天说计划,你是否在当天晚上 10 点前回复可行/不可行”。这就是在关系里做微型对照:改变一个自变量,看因变量是否变化。
冲突分清“处理”和“被关注”
对方道歉、送礼物或突然温柔,情绪常会好转——其中有一部分可能是“被看见”的安慰剂式力量,不等于深层问题已解决。可以感激当下的修复,同时问:若没有礼物、只谈具体行为约定,关系是否仍改善?避免把仪式感误当成结构改变。
自我觉察当你当“主试”时,留意自己的期望
劝朋友分手、劝家人相亲、劝同事跳槽时,你已经有了预期答案。谈话中你可能不知不觉只抛支持自己立场的问题。试着先写两列:支持与反对各三条,并主动问一句可能推翻你建议的问题。
5工作中怎么用
产品A/B 测试的灵魂是随机分配,不是“看起来像实验”
把新功能给活跃用户、把旧版留给不活跃用户,然后宣称“新功能提升留存”——这是混淆(用户本身就不同)。正确做法是:在同一流量池里随机分流,预先锁定主指标与窗口期,避免反复偷看、显著就停(产品版 p-hacking)。
营销活动有效还是季节有效?用保留组回答
大促期间销量上升,不能自动记到广告头上。设置随机holdout(保留组)不触达广告,比较触达组与保留组的转化差异,才更接近“广告”这个自变量的效应。若无法随机,至少承认这是准实验,结论要降级。
管理培训后分数涨了,不等于培训有效
培训结束立刻测验,常见混淆包括:练习效应、霍桑式被关注、学员取悦讲师。更干净的设计:随机决定谁先培训谁后培训(等待组对照),或用双盲评分的行为指标;至少做延时再测,看增益是否还在。
管理绩效与晋升中的期望循环
管理者若早早把某人标为“高潜”,可能给予更多辅导、曝光与容错,成绩差距被放大后再被用来证明“眼光准”。缓解办法:关键项目机会用更透明的规则分配;评估时先看行为记录再贴标签;引入不了解“高潜名单”的评定者做盲态校准。
品牌包装与仪式会改变体验,请诚实对待安慰剂成分
精美包装、专业术语、沉浸开箱都能提升主观体验——其中一部分是期望与意义赋予,不一定是配方本身。产品叙事可以利用它提升愉悦感,但若声称可验证的功效(功效、成绩、健康),就应回到对照与盲法能支撑的证据层级,避免把体验设计包装成未验证的因果承诺。
6考点速记
- 操作定义:用具体可观察/可测量的程序界定概念;同一概念可有不同操作定义。
- 自变量(IV):研究者操纵的变量;因变量(DV):测量的结果;控制变量:需保持一致或加以控制的因素。
- 实验组 vs 对照组:对照提供因果解释的基准;无对照难以排除时间、练习、自然变化等。
- 随机分配:使组间已知与未知差异平均平衡,是实验法推断因果、内部效度的关键。区别于随机抽样(服务外部效度/代表性)。
- 混淆变量:与 IV 系统共变、可替代解释 DV 变化的因素;威胁内部效度。
- 期望效应:实验者期望与参与者期望均可影响结果;防护包括标准化、单盲/双盲、盲态评定。
- 安慰剂效应:因接受“有效处理”的信念及伴随情境而产生的改变;安慰剂对照用于分离特异与非特异效应。
- 内部效度 vs 外部效度:前者问因果是否成立,后者问能否推广;严控实验室常提高内部效度、收紧外部效度,需用重复与现场研究补边界。
- Rosenthal & Jacobson(1968)Pygmalion 研究:教师期望案例,证据有争议;实验者期望作为方法学威胁则较被广泛接受。
7自测 3 题
某产品团队把新首页只推给“最近 7 天活跃”的用户,旧首页留给其余用户,一周后发现新首页组留存更高,于是结论:“新首页提升了留存。”最主要的问题是?
- A. 没有操作定义
- B. 分组不是随机分配,活跃度本身可能是混淆变量
- C. 违反了可证伪性
- D. 样本一定没有代表性,所以一定无效
查看答案
两组从一开始就在活跃度上系统不同,留存差异完全可能来自用户本身而非首页。即便结果“显著”,也不能归因于自变量。D 过度绝对:外部效度是另一问题;本题核心是内部效度被混淆破坏。
关于随机分配与随机抽样,下列哪一项正确?
- A. 两者是同一件事,只是翻译不同
- B. 随机分配主要服务外部效度,随机抽样主要服务内部效度
- C. 随机分配让各组可比以支持因果推断(内部效度);随机抽样关乎样本是否代表总体(外部效度)
- D. 没有随机抽样就绝对不能做任何因果推断
查看答案
实验室实验常常对方便样本做随机分配:仍可能有较好的内部效度,推广时则需谨慎。没有随机抽样不等于不能谈因果,而是外部效度主张要收敛。
双盲设计最直接防范的是哪一类威胁?
- A. 样本不能代表全国人口
- B. 参与者与主试的期望、暗示导致的结果偏向
- C. 第三变量导致的虚假相关(在纯观测研究中)
- D. 相关系数不能大于 1
查看答案
双盲让参与者与直接接触的主试/评定者都不知道分组,降低期望与暗示造成的系统偏差。A 是外部效度/抽样问题;C 主要靠实验操纵与随机分配来应对;D 是统计定义,与盲法无关。
8今日练习(约 20 分钟)
今天用“实验设计检查清单”拆一条真实主张,并在自己的生活里设计一个最小对照。
拆解一条“实验/测试”。找一条产品 A/B、营销投放、培训效果或健康干预的说法,按清单回答:① IV/DV 的操作定义是什么?② 有没有对照?③ 是否随机分配?④ 可能的混淆是什么?⑤ 有没有盲法或至少盲态评定?⑥ 结论有没有推广过度?
设计一个生活微型实验。选一个你关心的小问题(如:午后散步是否让你晚上更容易专注)。写出:IV、DV(如何在 1–5 分或分钟数上测量)、对照组是什么、如何在一周内尽量“像随机”地安排条件(可掷硬币决定哪天散步)、要控制哪些因素(咖啡、睡眠)。不必真的做满一周,但方案要写到可执行。
期望自检。写下你对某同事或亲友的一个强烈预期。列出:过去一周你多给了TA什么机会/解释,少给了什么。再写一个“若我看到 ____,我会下调这个预期”的观察标准。
9延伸阅读
- 《这才是心理学》(How to Think Straight About Psychology)中论实验与控制的章节 Keith E. Stanovich · 书 · 延续 Day 1在相关与因果之后,继续读实验控制、安慰剂与期望等相关章节,与本课直接衔接。
- Experimental and Quasi-Experimental Designs for Research Donald T. Campbell & Julian C. Stanley · 1963 · 书 / 经典方法小册内部效度威胁清单与准实验分类的源头文献,方法课常引。
- Pygmalion in the Classroom Robert Rosenthal & Lenore Jacobson · 1968 · 书教师期望研究原著;阅读时请同时对照后续批评与综述,勿只记“期望改变智商”的简化版。
- Experimenter effects in behavioral research Robert Rosenthal · 1966 · 书系统讨论实验者期望等方法学效应,奠定盲法与标准化的实践理由。
- Experimental and Quasi-Experimental Designs for Generalized Causal Inference Shadish, Cook & Campbell · 2002 · 书 · 进阶在 Campbell & Stanley 传统上的现代扩展,适合之后想系统学因果推断设计时查阅。
10间隔复习
间隔复习:自动从 Day N-1、N-3、N-7 中抽题。先凭记忆作答,再看答案。
关于心理学的“可重复性危机”,下列说法哪一项最准确?来自 Day 1 · 心理学凭什么算科学:用证据看人(1 天前)
- A. 它证明了大多数心理学研究都是编造的
- B. 开放科学合作组织(2015)重复的研究中约 36% 得到显著结果,效应量平均约为原来的一半,提示小样本、发表偏倚等问题
- C. 大规模预注册重复研究证实了自我损耗效应
- D. 只要一次重复失败,就足以证明原效应不存在
查看答案
A 过度引申:重复失败多源于方法问题而非造假,且许多效应(如锚定效应)重复良好。C 相反:Hagger 等(2016)的预注册多实验室重复发现效应接近零。D 错误:单次重复失败也可能有自身局限,需要综合多项证据判断。
某文章写道:“调查显示,每天喝咖啡的人抑郁风险更低,所以喝咖啡可以预防抑郁。”这一推论最主要的问题是?来自 Day 1 · 心理学凭什么算科学:用证据看人(1 天前)
- A. 违反了可证伪性原则
- B. 把相关当成了因果
- C. 属于巴纳姆效应
- D. 属于 HARKing
查看答案
调查只能显示两者相关。可能存在反向因果(抑郁的人精力差、改变了饮食习惯),也可能有第三变量(如收入、工作状态、睡眠、社交活动同时影响两者)。要检验因果,需要随机分配的实验或设计更严谨的纵向研究。
Day 1 · 心理学凭什么算科学:用证据看人
心理学算科学,不是因为它研究“人心”,而是因为它用可检验、可重复、公开的证据回答关于人的问题,并且在证据面前愿意承认自己错了。
1一句话核心
心理学算科学,不是因为它研究“人心”,而是因为它用可检验、可重复、公开的证据回答关于人的问题,并且在证据面前愿意承认自己错了。
2概念讲解
1. 为什么“凭常识懂人”不够
每个人都是“业余心理学家”:我们每天都在猜别人为什么这样做、下一步会怎样。问题在于,常识往往可以同时解释相反的结果。“物以类聚”和“异性相吸”都是俗语;“小别胜新婚”和“眼不见,心不烦”也都是。无论两个人分开后感情变好还是变淡,常识都能事后给出一个说法。
一个什么结果都能解释的说法,其实什么也没预测。科学心理学要做的,是把这些模糊的直觉变成可以被数据推翻的具体问题,例如:“在什么条件下、对哪些人、相似性对吸引力的影响有多大?”然后去测量。
2. 科学的三个基本特征
心理学家基思·斯坦诺维奇(Keith Stanovich)在《这才是心理学》(How to Think Straight About Psychology)中把科学概括为三点,这也是本课程判断一切说法的底层标准:
- 系统的实证主义:靠有计划、有控制的观察和测量回答问题,而不是靠权威、直觉或个人经历。
- 知识公开可验证:方法要写清楚,别人照做能得到类似结果;研究要经过同行评议。一个只有提出者本人能“验证”的发现,不算科学知识。
- 研究可解决的问题:问题必须能用现有方法检验。“人生的意义是什么”很重要,但不是实证问题;“有明确目标的人主观幸福感是否更高”则可以研究。
3. 可证伪性:好理论要敢于“冒险”
哲学家卡尔·波普尔(Karl Popper)提出:一个理论是否科学,关键不在于能找到多少支持它的例子,而在于它是否明确说出了什么情况会证明它是错的——这叫可证伪性(falsifiability)。
波普尔在《猜想与反驳》(1963)中举过一个对照:1919 年日食观测检验了爱因斯坦广义相对论关于光线弯曲的预测,如果观测结果不符,理论就会被推翻——它冒了真实的风险。相比之下,他认为当时的精神分析(弗洛伊德)和个体心理学(阿德勒)无论出现什么行为都能解释:一个人把孩子推下水,或者一个人舍命救孩子,两种理论都能自圆其说。波普尔指出,这种“处处都能被证实”恰恰是弱点,而不是优点。
| 维度 | 科学心理学 | 伪心理学(常见表现) |
|---|---|---|
| 主张的形式 | 具体、可测量,说清楚什么结果会推翻它 | 模糊、万能,任何结果都能解释 |
| 对反例的态度 | 认真对待,修正或放弃理论 | 解释掉反例(“你还没真正领悟”) |
| 证据来源 | 对照研究、大样本、重复验证 | 个人经历、客户好评、名人背书 |
| 是否公开检验 | 公开方法与数据,接受同行审查 | “独家方法”“核心技术保密” |
| 随时间的变化 | 不断自我修正、积累 | 几十年不变,或只改包装 |
| 语言风格 | 常带限定:“平均而言”“在某些条件下” | 绝对化:“100% 有效”“一眼看穿” |
4. 相关不等于因果
“相关”指两个变量一起变化;“因果”指一个变量的改变会导致另一个变化。两者之间隔着两道坎:
- 方向性问题:可能是 B 导致 A,而不是 A 导致 B。
- 第三变量问题:可能有一个没被测量的 C 同时影响 A 和 B。
| 相关研究 | 实验 | |
|---|---|---|
| 研究者做什么 | 测量已存在的变量,看它们是否一起变化 | 主动操纵自变量,测量因变量 |
| 是否随机分配 | 否 | 是(这是关键) |
| 能否推断因果 | 不能直接推断 | 可以(在设计良好的前提下) |
| 适用场景 | 无法或不应操纵的变量,如童年经历、性别 | 可操纵且符合伦理的变量 |
| 常用统计量 | 相关系数 r(-1 到 +1) | 组间差异、效应量(如 Cohen's d) |
斯坦诺维奇书中有一个经典历史案例:20 世纪初美国南方糙皮病(pellagra)流行,人们发现它与卫生条件差的地区高度相关,于是怀疑是传染病。美国公共卫生署的约瑟夫·戈德伯格(Joseph Goldberger)认为真正的原因是饮食缺乏,“卫生差”和“糙皮病”都是贫困这个第三变量的结果。他通过改变饮食的研究证明了这一点;后来科学家确认糙皮病的直接原因是缺乏烟酸(维生素 B3)。
要确立因果,最有力的方法是实验:研究者主动操纵自变量,并通过随机分配让各组在其他方面平均而言相同。这样两组之后出现的差异,才能较有把握地归因于操纵本身。
5. 个案 vs 数据:“我认识一个人……”
“我爷爷每天抽烟,活到 95 岁。”斯坦诺维奇把这类论证称为“某人统计”(person-who statistics):用一个鲜活的反例去否定一个概率性的规律。可心理学和医学中的大多数规律本来就是概率性的——“吸烟提高患肺癌的风险”从来不意味着“每个吸烟者都会得肺癌”。
个案之所以说服力强,是因为它生动、容易想起。特沃斯基与卡尼曼(Tversky & Kahneman, 1973)描述的可得性启发指出:我们常根据例子“多容易想到”来判断事件有多常见。飞机失事的新闻让人觉得坐飞机很危险,就是这个道理。
这不等于个案毫无价值:个案能提出假设、提供细节、展示“可能性”;但要回答“普遍是否如此、有多大程度”,需要系统收集的数据。
6. 确认偏误:我们天生爱找“证明自己对”的证据
确认偏误(confirmation bias)指人们倾向于寻找、注意、解释和记住支持自己已有观点的信息,而忽视或贬低相反的信息(Nickerson, 1998 的综述)。彼得·沃森(Peter Wason)1960 年的“2-4-6 任务”是经典演示:告诉参与者“2, 4, 6”符合某条规则,请他们提出新的三个数来测试自己的猜想。很多人猜“依次加 2”,然后一直提出 8-10-12、20-22-24 这类符合自己猜想的数字,得到“符合”的反馈后就很有信心地宣布答案——结果错了。真正的规则只是“任意递增的三个数”。要发现这一点,需要主动试一试可能推翻自己猜想的数字,比如 1-7-30。
日常中,一旦你认定“这个同事不靠谱”,他每次迟到你都记得,他准时交付你却不太留意。确认偏误并不是“笨”的人才有,它是人类信息加工的普遍倾向,科学方法(对照组、盲法、预注册)在很大程度上就是为了对抗它而设计的。
7. 巴纳姆效应:为什么星座和性格测试“好准”
1949 年,心理学家伯特伦·福勒(Bertram Forer)让学生做了一份性格测验,一周后给每人发了一份“个人分析报告”,请他们评价准确度(0–5 分)。学生们普遍给出了很高的分数——而实际上所有人拿到的是同一段文字,其中的句子大多摘自一本星座书,例如“你有时外向、友善、合群,有时内向、谨慎、保守”这样的描述。
这种现象后来被称为巴纳姆效应(Barnum effect,名称由保罗·米尔 Paul Meehl 在 1956 年推广开来),也叫福勒效应:人们会把笼统、普遍适用的描述当作对自己的准确刻画。让描述“显得准”的常见配方:
- 模糊且双面:“你有时……有时……”几乎对所有人成立。
- 偏正面:“你有很多尚未发挥的潜力”,人们更愿意接受讨喜的描述。
- 看起来是专门为你做的:填了问卷、输入了生日,会让人更相信结果是“个性化”的。
- 来源显得权威:专家、测评机构、精美的报告。
关于 MBTI 等类型测试,需要说得公允一些:它不等同于星座,题目确实在测量一些真实的偏好。但研究者对它有具体的批评——例如把连续分布的特质硬分成两类、部分人重测时类型会改变(参见 Pittenger, 2005);而它的类型描述大多写得正面、宽泛,这正是巴纳姆效应容易发挥作用的地方。学术研究中更常用的是大五人格模型,我们会在模块 4 详细讲。
8. 可重复性危机:心理学如何面对自己的错误
2015 年,由布莱恩·诺塞克(Brian Nosek)等人发起的开放科学合作组织(Open Science Collaboration)在《科学》(Science)上发表报告:他们重复了 2008 年发表在三本心理学顶级期刊上的 100 项研究。原研究中有 97% 报告了统计显著的结果,而重复研究中只有约 36% 得到显著结果;重复研究的效应量平均只有原研究的一半左右。
此后,一些曾经广为流传的发现在大规模重复中表现不佳,例如“自我损耗”(意志力像肌肉一样会被用完)和“权力姿势”(摆出扩张的姿势能改变激素水平),详见下方研究卡片。
造成问题的主要原因包括:
- 样本太小:统计检验力不足,偶然结果更容易被当成发现。
- 分析灵活性(p-hacking):多测几个指标、多试几种分析、数据“够显著”就停止收集,会大幅增加假阳性(Simmons, Nelson & Simonsohn, 2011)。
- 发表偏倚:显著的“新奇发现”更容易发表,失败的结果被锁进抽屉。
- 事后假设(HARKing):看到结果后再把它写成“事先预期”(Kerr, 1998)。
心理学界的回应是一系列改革:预注册(事先公开假设和分析计划)、注册报告(期刊在看到结果前就根据方法决定是否发表)、公开数据与材料、多实验室联合重复(如 Many Labs 项目)。
9. 本课程为什么给每项研究标注证据强度
基于上面的原因,本课程提到的每一项研究都会带一个证据标签。它是一种对当前证据状况的概括判断,不是永久结论——新证据出现时,标签也会随之调整。
| 标签 | 含义 | 你该怎么用 |
|---|---|---|
| 稳固 | 多次独立重复、元分析支持,或已成为领域共识 | 可以作为理解与决策的依据,但仍注意适用条件 |
| 有争议 | 结果不一致、效应大小或解释存在明显分歧、边界条件不清 | 当作“值得参考的假设”,不要据此下重大结论 |
| 已被质疑 | 大规模或预注册的重复研究失败,或原作者公开撤回 | 了解它的历史与教训;不要再当作事实引用 |
3经典研究与人物
做了什么给学生做性格测验后,发给每人一份“个性化”报告,请他们评价准确度;实际上所有人拿到的是同一段摘自星座书的笼统描述。
发现学生普遍认为报告对自己描述得很准确。这说明“觉得准”并不能证明一个测评有效。
证据说明巴纳姆效应此后被多次重复,并有文献综述(如 Dickson & Kelly, 1985)。效应强弱会受描述是否正面、来源是否权威、是否显得个性化等因素影响。
做了什么让参与者通过提出三个数的组合来发现隐藏规则(实际是“任意递增”)。
发现多数人倾向于只测试符合自己猜想的例子,很少主动寻找可能否定猜想的例子,因而常得出过窄的错误规则。
证据说明“人们偏好寻找支持性证据”这一现象非常稳固(Nickerson, 1998)。但 Klayman & Ha(1987)指出,这种“正向检验策略”在很多现实情境中其实是合理的,并非总是非理性——问题在于规则比猜想更宽时它会失效。
做了什么面对糙皮病与卫生条件差的高相关,戈德伯格通过改变饮食的研究检验“饮食缺乏”假设,并论证该病并非传染病。
发现卫生差与糙皮病都源于贫困导致的饮食缺乏;后来确认直接原因是烟酸缺乏。这是“第三变量”的教科书案例。
证据说明病因已被医学确认。该案例被斯坦诺维奇用来说明相关与因果的区别。
做了什么近 300 名研究者合作,重复 2008 年发表于三本心理学期刊的 100 项研究,发表于 Science。
发现原研究 97% 显著,重复研究约 36% 显著;重复效应量平均约为原研究的一半。
证据说明“可重复率低于人们以为的水平”这一总体结论得到后续项目呼应(如 Many Labs 2、Camerer 等 2018 年对社会科学实验的重复)。但具体的“可重复率”数字如何解读仍有争论,不应简单理解为“64% 的研究是假的”。
做了什么36 个实验室、数千名参与者使用相同流程,同时重复 13 个经典效应。
发现多数效应得到了重复,其中锚定效应非常稳健;但也有效应(如国旗启动、金钱启动)未能重复。
证据说明它展示了可重复性检验的“另一面”:心理学中有相当多扎实的发现,关键是分辨哪些是。
做了什么原研究中,先被要求抵制巧克力饼干、只吃萝卜的参与者,在随后的难解谜题上坚持时间更短,被解释为“自控资源被耗尽”。
发现该理论曾被数百项研究引用和“支持”,并广泛进入自我管理类畅销书。
证据说明Hagger 等(2016)在 23 个实验室、两千多名参与者中进行预注册重复,效应接近于零;Vohs 等(2021)的多实验室预注册研究也只发现极小或接近零的效应。早期大量“支持”研究可能受发表偏倚和小样本影响。
做了什么让参与者摆出扩张的“高权力”姿势约两分钟,报告其睾酮上升、皮质醇下降、更愿意冒险。
发现相关 TED 演讲广为传播,“面试前摆两分钟超人姿势”成为流行建议。
证据说明Ranehill 等(2015)以更大样本未能重复激素和冒险行为上的效应;第一作者 Dana Carney 于 2016 年公开表示她不再相信权力姿势的效应是真实的。关于姿势是否能让人主观上感觉更有力量,仍有争议(Cuddy 等 2018 年的分析认为有,其他研究者对此存疑)。
做了什么通过模拟和一个故意设计的真实实验,展示研究者在分析中的常见“自由选择”会如何制造出显著结果。
发现借助灵活的分析,他们甚至“证明”了听某首披头士歌曲能让人的实际年龄变小——一个明显不可能的结论,以此说明问题的严重性。
证据说明这是方法学论证,其逻辑和模拟结果被广泛接受,直接推动了预注册等改革。
4人际中怎么用
判断他人把“他就是这种人”改写成一个假设
当你认定“他不在乎我”“她很自私”时,试着在心里加上“(待验证)”。然后像做 2-4-6 任务那样,主动留意可能推翻它的事:他有没有做过在乎你的事?在哪些情况下她并不自私?这样不是让你放弃判断,而是让判断更接近真实的人。
沟通区分“每次都这样”与“有几次这样”
吵架时的“你总是……”“你从来不……”常是可得性和确认偏误的产物:最刺痛的几次最容易想起。换成具体的描述(“这周有两次你到家没回消息”)更准确,也更不容易让对方陷入防御。
因果别急着把“同时发生”当成“因为”
“每次我提工作,他就不耐烦”——也许是因为话题,也许只是你总在他刚下班、最累的时候提(第三变量:疲劳和时间点)。换个时间试一次,就是一个小小的“实验”。
被理解感警惕“说中了”,也学会真正说中别人
当一个测试、一位“大师”或一个新认识的人让你觉得“好懂我”,先问一句:这段话换个人读是否也成立?反过来,想让别人感到被理解,笼统的夸奖(“你很有潜力”)不如具体的观察(“你开会时会先把别人的想法复述一遍再补充”)。
社交MBTI 可以当话题,别当标签
用 MBTI 或星座聊天、破冰无伤大雅;但用它预测一个人会怎么做、适不适合交往或共事,就超出了它的证据范围。
5工作中怎么用
品牌“专属于你”的文案为什么有效,边界在哪
个性化报告、年度账单、测试类 H5 常让用户觉得“好懂我”,其中一部分力量来自巴纳姆效应:宽泛、正面、看起来是为你定制的描述。用它提升体验可以,但要避免让用户误以为得到了专业的评估(例如用“测试结果”暗示健康或能力诊断)。
营销投放后销量涨了,不等于投放有效
活动上线与销量上升同时发生,可能是季节、竞品断货、自然增长等第三变量。更可靠的做法是设置随机保留组(holdout)或 A/B 测试:随机让一部分用户看不到广告,比较两组差异——这就是把实验法用到营销归因上。
管理招聘别用类型测试做筛选,结构化面试更可靠
MBTI 的发行机构本身也声明它不应用于招聘筛选。人员选拔研究的元分析(Schmidt & Hunter, 1998;Sackett 等 2022 年的修正分析)显示,结构化面试(统一问题、统一评分标准)对工作绩效的预测力明显好于随意聊天式的非结构化面试。
管理绩效评估中的确认偏误
对一个员工的第一印象会影响你之后注意哪些事。做法:平时用简短记录积累具体事例(好的和不好的都记),评估时先看记录再下结论,并主动问自己“有什么证据和我的印象相反?”
产品一个大客户的反馈,是个案还是规律?
用户访谈里生动的抱怨很有启发价值(提出假设),但决定是否投入开发,需要行为数据和更大样本验证。同时注意:只调研现有用户,会漏掉那些已经流失或从未转化的人。A/B 测试中,事先确定核心指标和样本量,不要反复偷看结果、显著就停——这正是产品版的 p-hacking。
管理读管理和效率类畅销书时,查一下证据
“意志力会被用完,所以重要决策放早上”(源于自我损耗)、“开会前摆个强势姿势”(源于权力姿势)这类建议都建立在已被质疑的研究上。遇到“研究表明”,至少追问:是哪项研究?样本多大?有没有被独立重复?
6考点速记
- 科学的三个特征(Stanovich):系统的实证主义、知识公开可验证、研究可解决的问题。
- 可证伪性(Popper):科学理论必须能明确指出什么观察结果会证明它是错的;能解释一切的理论不可证伪。
- 相关≠因果:两大障碍是方向性问题和第三变量问题。相关系数 r 取值 -1 到 +1,绝对值表示强度,正负表示方向。
- 实验法三要素:操纵自变量、测量因变量、随机分配被试到实验组与控制组;随机分配是推断因果的关键。注意区分随机分配(内部效度)与随机抽样(外部效度/代表性)。
- 巴纳姆效应 / 福勒效应(Forer, 1949):人们把笼统、普遍适用的描述视为对自己的准确刻画。
- 确认偏误:寻找和记住支持已有信念的信息;经典演示为 Wason(1960)2-4-6 任务。
- 可得性启发(Tversky & Kahneman, 1973):依据例子容易想起的程度判断频率或概率。
- 可重复性危机:OSC(2015)重复 100 项研究,约 36% 得到显著结果;主要原因:小样本、p-hacking、发表偏倚、HARKing;对策:预注册、注册报告、开放数据、多实验室重复。
7自测 3 题
某文章写道:“调查显示,每天喝咖啡的人抑郁风险更低,所以喝咖啡可以预防抑郁。”这一推论最主要的问题是?
- A. 违反了可证伪性原则
- B. 把相关当成了因果
- C. 属于巴纳姆效应
- D. 属于 HARKing
查看答案
调查只能显示两者相关。可能存在反向因果(抑郁的人精力差、改变了饮食习惯),也可能有第三变量(如收入、工作状态、睡眠、社交活动同时影响两者)。要检验因果,需要随机分配的实验或设计更严谨的纵向研究。
以下哪一个说法最难被证伪?
- A. 前一晚睡眠少于 5 小时的人,第二天工作记忆测验得分会更低
- B. 每个人内心深处都有未被意识到的冲突,它会以各种方式表现在行为中
- C. 当有旁人在场时,人们主动帮助陌生人的可能性会降低
- D. 使用结构化面试的公司,新员工一年后的绩效评分更高
查看答案
A、C、D 都说明了可测量的变量和预期方向,结果可能与预测相反,因此可以被检验和推翻。B 中“各种方式表现”意味着任何行为都可以被解释为支持它,没有任何观察能证明它错,所以最难证伪。
关于心理学的“可重复性危机”,下列说法哪一项最准确?
- A. 它证明了大多数心理学研究都是编造的
- B. 开放科学合作组织(2015)重复的研究中约 36% 得到显著结果,效应量平均约为原来的一半,提示小样本、发表偏倚等问题
- C. 大规模预注册重复研究证实了自我损耗效应
- D. 只要一次重复失败,就足以证明原效应不存在
查看答案
A 过度引申:重复失败多源于方法问题而非造假,且许多效应(如锚定效应)重复良好。C 相反:Hagger 等(2016)的预注册多实验室重复发现效应接近零。D 错误:单次重复失败也可能有自身局限,需要综合多项证据判断。
8今日练习(约 20 分钟)
准备纸笔或手机备忘录。今天的练习目标是:亲身体验偏误,并练习用科学的问题审视一个说法。
巴纳姆自测。读下面这段“为你定制”的描述,按 0–5 分给它的准确度打分:
“你很在意别人对你的看法,但也有自己的坚持。你在熟悉的人面前比较放松,在陌生场合会先观察再表态。你有一些还没充分发挥的能力。有时你会怀疑自己做的决定是否正确。”
打完分后想一想:你身边有几个人读到这段话会打低分?记下你的感受。
拆解一条“研究发现”。在新闻或社交媒体上找一条“研究表明……”的内容,回答:① 这是相关研究还是实验(有没有随机分配)?② 样本大约多少人、是什么人?③ 能否想到至少两个第三变量或反向因果的可能?④ 标题的结论是否超出了研究本身能说明的范围?
给一个判断找反例。写下你对某个人(同事、家人、朋友)的一个判断,再写出:“如果我看到 ____,我会改变这个看法。”接下来一周,有意留意这类反例。
一句话复盘。用自己的话写下:今天学到的哪一个概念,最可能改变我明天的某个具体做法?
9延伸阅读
- 《这才是心理学:看穿伪心理学的本质》(How to Think Straight About Psychology) Keith E. Stanovich · 书 · 入门首选本课“科学思维”模块的主要参考。可证伪性、某人统计、相关与因果、糙皮病案例都在其中,有中译本。
- 《猜想与反驳》(Conjectures and Refutations) Karl Popper · 1963 · 书第一章“科学:猜想与反驳”讨论了可证伪性以及精神分析与相对论的对比。偏哲学,可只读第一章。
- How We Know What Isn't So: The Fallibility of Human Reason in Everyday Life Thomas Gilovich · 1991 · 书系统讨论人们为何会坚信错误的东西(随机中看到模式、选择性证据等),可读性强。
- Science Fictions Stuart Ritchie · 2020 · 书从内部视角讲科学中的造假、偏倚、疏忽与夸大,以及如何改进,对理解可重复性危机很有帮助。
- Estimating the reproducibility of psychological science Open Science Collaboration · 2015 · 论文 · Science, 349(6251), aac4716可重复性危机的标志性论文,摘要和图表值得直接读原文。
- The fallacy of personal validation: A classroom demonstration of gullibility Bertram R. Forer · 1949 · 论文 · Journal of Abnormal and Social Psychology, 44(1), 118–123巴纳姆效应的原始研究,篇幅很短。
- Confirmation bias: A ubiquitous phenomenon in many guises Raymond S. Nickerson · 1998 · 论文 · Review of General Psychology, 2(2), 175–220关于确认偏误最常被引用的综述。
- False-positive psychology Simmons, Nelson & Simonsohn · 2011 · 论文 · Psychological Science, 22(11), 1359–1366理解 p-hacking 的必读论文,论证清楚、并不艰深。
10间隔复习
今天是起点,还没有更早的内容可复习。从 Day 2 开始,这里会自动出现前几天(N-1、N-3、N-7)的题目,帮你在遗忘之前重新提取记忆。