心理学日课

从科学方法出发,走到认知、发展、人格、情绪、关系、心理健康与应用。每天约 40 分钟。

证据标签: 稳固 多次独立重复或元分析支持 有争议 结果不一致或解释有分歧 已被质疑 大规模重复失败或原作者撤回

模块 1 · 大脑与认知2026-10-06约 40 分钟▶

Day 8 · 感觉与知觉:从阈限、信号检测到“看见”是一种推断

感觉是感受器把物理能量转成神经信号,知觉是大脑结合经验与预期对这些信号做出解释;我们看到的不是世界的照片,而是大脑对世界的最佳推测,所以它既高效,也会系统性地出错。

1一句话核心

感觉是感受器把物理能量转成神经信号,知觉是大脑结合经验与预期对这些信号做出解释;我们看到的不是世界的照片,而是大脑对世界的最佳推测,所以它既高效,也会系统性地出错。

2概念讲解

1. 感觉 vs 知觉:两步走,但几乎同时发生

前两天讲了神经元和脑区,今天看它们最基本的工作:把外部世界“搬进”脑中。教材通常分两步:

感觉(sensation):感受器(视网膜上的光感受器、耳蜗里的毛细胞、皮肤里的触觉感受器等)把光、声波、压力、化学分子这类物理能量转换为神经冲动,这个转换过程叫换能(transduction)。知觉(perception):大脑对这些信号进行组织、识别与解释,得出“那是一张熟人的脸”“那是警报声”。
  • 自下而上加工:从感觉输入出发,一步步拼出整体(例如先检测线条和边缘,再组合成形状)。
  • 自上而下加工:用已有知识、预期和情境去引导解释(例如在潦草的字迹中,你凭上下文认出某个字)。
两种加工总是同时进行:输入提供“原料”,经验与预期决定“怎么解读”。这解释了为什么同一个信息,不同的人会看出不同的东西。

2. 心理物理学:多强的刺激才能被察觉

19 世纪,Ernst Weber 和 Gustav Fechner 开创了心理物理学,研究物理刺激强度与主观感受之间的关系。这是心理学最早的定量研究传统之一。

  • 绝对阈限:在一半(50%)的试次中能被察觉的最小刺激强度。注意它是统计定义,不是一条“过线就看见、不过线就看不见”的硬边界。
  • 差别阈限 / 最小可觉差(JND):两个刺激需要相差多少,才能在一半的试次中被察觉出不同。
  • 韦伯定律:差别阈限与原刺激强度成固定比例(ΔI / I = k)。原来越重、越亮、越贵,要被察觉的变化就要越大。比例 k 因感觉通道不同而不同。
  • 阈下刺激:低于绝对阈限、意识报告不到的刺激。它能否影响行为、影响有多大,是下面经典研究要讨论的问题。

韦伯定律在中等强度范围内描述得比较好,在极弱或极强的刺激下会偏离,教材里把它当作有用的近似规律。

3. 信号检测论:察觉不仅取决于感官,还取决于“判断标准”

阈限的概念有个问题:同一个人在不同情境下“察觉”的结果会变。比如夜里独自在家,你更容易“听到”门外有动静。信号检测论(Signal Detection Theory, SDT)把察觉拆成两部分:

  • 敏感性(d′):感官与经验让你区分“信号”和“噪音”的能力有多强。
  • 判断标准(criterion,常用 β 或 c 表示):你倾向于多快说“有”。标准放宽,抓到的真信号多,但虚报也多;标准收紧,虚报少,但漏报多。
信号检测的四种结果
回答“有”回答“没有”
信号真的存在击中(hit)漏报(miss)
信号并不存在虚报(false alarm)正确拒绝(correct rejection)

标准会受动机、代价和预期影响:机场安检、医学筛查往往宁可多虚报也不愿漏报;而频繁虚报的报警系统又会让人渐渐不理会它。SDT 最初用于雷达与听觉研究,现在广泛用于医学诊断、记忆研究和目击证词分析。

SDT 的核心洞见:一个人“没发现”或“发现太多”,不一定是能力问题,也可能是判断标准问题。两者要分开评估。

4. 感觉适应与两条经典的视觉通路理论

感觉适应:持续不变的刺激会让感受器反应减弱。进房间时闻到的气味几分钟后就“消失”了,戴上手表很快就感觉不到它。适应让神经系统把有限资源留给变化,因为变化通常更有信息量。

视觉通路几个考试常见点:

  • 视杆细胞:对弱光敏感,负责暗光视觉,不分辨颜色,多分布在视网膜周边。
  • 视锥细胞:负责颜色与细节,集中在中央凹,需要较强光线。
  • 盲点:视神经离开眼球的位置没有感受器,但大脑会“填补”,日常察觉不到。
  • 三色理论(Young–Helmholtz):视网膜上有分别对短、中、长波长最敏感的三类视锥细胞,组合产生颜色感受。
  • 拮抗过程理论(Hering):颜色以红—绿、蓝—黄、黑—白成对拮抗的方式加工,能解释负后像(盯着红色图案后看白墙,会看到绿色)。
  • 现代观点:两种理论都对,分别描述不同加工阶段——视网膜感受器层面符合三色理论,之后的神经通路符合拮抗加工。

听觉也有类似的两种理论:位置理论(不同频率使耳蜗基底膜不同位置振动最强,更适合解释高音)与频率理论(神经发放频率跟随声波频率,更适合解释低音),同样是互补关系。

5. 知觉组织:格式塔原则与深度线索

20 世纪初,Max Wertheimer、Wolfgang Köhler、Kurt Koffka 等格式塔心理学家强调“整体不同于部分之和”:大脑会主动把零散的元素组织成有意义的整体。常考原则:

  • 图形—背景:把视野分成突出的“图形”和后面的“背景”(经典例子是鲁宾杯:看成花瓶还是两张侧脸)。
  • 接近性:距离近的元素被看成一组。
  • 相似性:颜色、形状相似的元素被看成一组。
  • 连续性:倾向于看到平滑连续的线条,而不是突兀的折断。
  • 闭合:会把有缺口的图形“补全”成完整形状。
  • 共同命运:朝同一方向运动的元素被看成一组。
深度知觉线索
类别线索例子
双眼线索视网膜像差、辐合两眼看到的图像略有差异,差异越大物体越近;看近物时双眼向内转
单眼线索相对大小、遮挡、线条透视、纹理梯度、相对高度铁轨在远处汇聚;被挡住的物体在后面;纹理越密越远
运动线索运动视差坐车时近处景物飞快后退,远处景物移动缓慢

Eleanor Gibson 和 Richard Walk 的“视觉悬崖”研究(见经典研究)就是在检验婴儿和动物是否会利用深度线索。

6. 知觉恒常与错觉:同一套机制的两面

知觉恒常:物体在视网膜上的像不断变化,我们却把它知觉为稳定的。朋友走远时视网膜像变小,你不会觉得他在“缩小”(大小恒常);门打开时投影变成梯形,你仍看到长方形的门(形状恒常);白纸在阴影里反射的光比阳光下少,你仍觉得它是白的(明度与颜色恒常)。错觉正是这些“聪明”规则在特殊条件下被误用的结果。下图两条横线一样长,但大多数人会觉得下面那条更长(缪勒—莱尔错觉)。一种经典解释(Richard Gregory 提出)认为大脑把箭头当作墙角的深度线索并自动做了大小校正;也有研究者提出其他解释,并发现文化与视觉经验可能影响错觉强度,这部分仍有讨论。

2015 年网络上的“蓝黑还是白金裙子”也是一例:不同的人对照片中光照条件做了不同的无意识假设,于是“扣除”光照后得到不同颜色。

AB看起来较短看起来较长两条横线等长
缪勒—莱尔错觉:A、B 中间的横线长度完全相同,可以用尺子量一量。

7. 知觉定势与跨通道影响:预期改写体验

知觉定势指心理上的预期让我们倾向于以某种方式知觉事物。Stephen Palmer 1975 年的研究发现,先看到厨房场景,再短暂呈现一个物体,人们识别面包这类与场景相符的物体更准确,识别与场景不符、但外形相似的物体更容易出错。

知觉还会跨感觉通道相互影响:颜色会影响对味道和气味的判断,声音会影响对口感的描述。牛津大学的 Charles Spence 长期研究食物与包装中的跨通道效应。

对 Spin 的三个目标来说,这一节最实用:人看到的东西 = 输入 × 预期 × 情境。改变预期和情境,往往比改变信息本身更能改变他人的感受;同时也要知道自己的感受同样被预期塑造。

注意边界:预期影响的是“模糊、快速、需要推断”的知觉最明显。信息清晰、时间充足时,输入本身的作用更大。

3经典研究与人物

韦伯—费希纳心理物理学Ernst Heinrich Weber;Gustav Theodor Fechner · 1834;1860稳固

做了什么Weber 通过让人比较重量等实验,发现能察觉的差异与原刺激大小大致成比例。Fechner 在《心理物理学纲要》(Elemente der Psychophysik)中系统化这些方法,提出主观感受强度与刺激强度的对数关系,并发展了测量阈限的经典方法。

发现主观感受与物理刺激之间存在可测量的规律;差别阈限大致与原刺激强度成比例(韦伯定律)。

证据说明韦伯定律在中等强度范围内被反复验证,是心理学最古老的稳固规律之一;在极端强度下会偏离。Fechner 的对数定律后来被 S. S. Stevens 的幂函数定律补充修正。

信号检测论David M. Green & John A. Swets · 1966稳固

做了什么在雷达和听觉研究基础上,Green 与 Swets 的著作《Signal Detection Theory and Psychophysics》系统阐述了把察觉分解为敏感性与判断标准的方法:通过改变奖励、代价和信号出现概率,可以在不改变感官能力的情况下改变被试的“有/无”判断。

发现察觉表现同时取决于敏感性(d′)和判断标准;两者可以分别测量。

证据说明SDT 是心理学中应用最广泛的定量框架之一,延伸到医学影像诊断、记忆再认、目击证人辨认等领域,方法论基础牢固。

视觉皮层的特征检测器David Hubel & Torsten Wiesel · 1959–1960 年代稳固

做了什么他们用微电极记录猫(后来也包括猴)初级视觉皮层单个神经元的反应,意外发现某些神经元只对特定朝向的线条或边缘有强烈反应,而对光点反应很弱。他们还研究了早期视觉剥夺对视觉发育的影响。

发现视觉皮层中有对特定特征(如朝向、运动方向)敏感的神经元,视觉加工从简单特征逐层组合到复杂形状;早期视觉经验对正常发育有关键作用。Hubel 与 Wiesel 因此获 1981 年诺贝尔生理学或医学奖(与 Sperry 共享)。

证据说明核心发现被大量重复,是自下而上加工的神经基础。需要提醒的是,物体与面孔识别依赖复杂的分布式网络,不能简单理解为“每个物体都有一个专属神经元”。

视觉悬崖Eleanor J. Gibson & Richard D. Walk · 1960稳固

做了什么研究者搭建了一个铺着玻璃的平台,一半玻璃下面紧贴着棋盘格图案(“浅侧”),另一半的图案放在很深的下方(“深侧”)。大多数已会爬行的婴儿即使母亲在深侧呼唤,也不愿爬过去;多种动物幼崽也表现出类似回避。

发现会爬行的婴儿已能利用深度线索察觉高度落差并回避。

证据说明回避深侧的行为结果稳固。但“深度知觉是天生的”这一推论有争议:被试婴儿已经有数月视觉与运动经验,后续研究(如 Joseph Campos 等)提示对高度的恐惧与爬行经验有关。

“吃爆米花、喝可口可乐”阈下广告实验James Vicary(声称者) · 1957 年声称;1962 年本人承认已被质疑

做了什么市场研究员 Vicary 宣称在电影放映中以极短时间闪现“吃爆米花”“喝可口可乐”字样,使影院销量大增。这一说法引发公众恐慌和监管讨论,但他从未公开可核查的数据,其他人也无法重复,Vicary 本人后来在采访中承认这项“研究”数据量太少、基本是噱头。

发现没有可靠证据表明阈下广告能让人买原本不想买的东西。

证据说明后来的实验研究(如 Johan Karremans、Wolfgang Stroebe 等 2006 年的研究)发现,阈下呈现饮料品牌名只在被试本来就口渴时,对选择产生小幅影响。阈下影响在严格条件下可能存在,但效果小、条件苛刻,远不是“操纵消费者”。

葡萄酒的颜色改变气味描述Gil Morrot, Frédéric Brochet & Denis Dubourdieu · 2001有争议

做了什么研究者请波尔多大学的酿酒学学生描述酒的气味。其中一种白葡萄酒被加入无味的红色染料后,学生们更多地使用通常描述红酒的词汇来形容它的气味。

发现视觉信息(颜色)会改变即使是受过训练的人的嗅觉判断,体现了自上而下加工与跨通道影响。

证据说明这是一项样本较小的单项研究,媒体常夸大成“专家根本尝不出红白酒”,原文并没有这样说。不过“颜色影响味觉与嗅觉判断”这一更一般的结论,有 Charles Spence 等大量跨通道研究支持。

4人际中怎么用

沟通“对方是不是生气了?”是一道信号检测题

一条简短的消息,你可能读出冷淡,也可能读出忙碌。焦虑或关系紧张时,我们的判断标准会放宽,更容易把中性信号判成“他不高兴”(虚报)。遇到这种时刻,与其凭感觉下结论,不如用一句不带指责的确认:“你回得挺短的,是在忙还是有什么不舒服?”

关系预期会先替你“看见”对方

如果你已经认定某个同事或家人“总是挑剔”,他的一句普通提醒也容易被听成批评,这就是知觉定势。可以给自己一个小检查:把对方原话一字不差地写下来,再问自己“如果是我信任的人说这句,我会怎么理解?”

亲密关系对熟悉的好会习惯,主动制造“可察觉的变化”

感觉系统对不变的刺激会降低反应;心理学里也有类似的“享乐适应”现象,人们会逐渐习惯稳定的好处(这一点到情绪模块再细讲)。在长期关系里,具体地说出感谢、偶尔换一种相处方式,能让对方的付出重新被注意到。

5工作中怎么用

品牌用最小可觉差管理变化

依据韦伯定律的思路,消费者行为教材常建议:希望用户注意到的改进(更大容量、更好的配方),变化要明显超过最小可觉差;品牌视觉的迭代,若想保留识别度,则每次小步调整、保持核心元素稳定。需要警惕的是,悄悄缩小包装、价格不变这类做法一旦被发现,往往会损害信任。

营销别迷信阈下广告,重视情境与跨通道体验

阈下信息的作用小且条件苛刻,不值得作为策略;更可靠的是能被明确感知的情境设计:包装颜色、材质手感、店内音乐与灯光都会影响人们对产品的预期与体验。做这类设计时,最好用盲测与非盲测对比来检验效果,而不是只凭直觉。

产品用格式塔原则做界面分组

相关的控件靠近放(接近性),同类操作用一致的颜色与形状(相似性),主要按钮与背景形成清晰的图形—背景对比。用户在扫一眼的时间里就能理解界面结构,主要靠的就是这些自动的知觉组织,而不是阅读说明文字。

管理为告警、筛选和审核设定合适的判断标准

监控告警、简历筛选、内容审核本质上都是信号检测:门槛设得太低,团队被虚报淹没,很快对告警麻木;门槛设得太高,重要问题会被漏掉。按“漏报和虚报各自的代价”来设定标准,并定期复盘击中与虚报的比例。

6考点速记

  • 感觉:感受器换能(transduction);知觉:组织与解释。自下而上从输入出发,自上而下由经验与预期引导。
  • 绝对阈限:50% 试次能察觉的最小强度;差别阈限 / JND:50% 试次能察觉的最小差异。
  • 韦伯定律:ΔI / I = k,差别阈限与原刺激强度成比例;Fechner 创立心理物理学。
  • 信号检测论:击中、漏报、虚报、正确拒绝;区分敏感性 d′与判断标准。
  • 感觉适应:持续不变的刺激使反应减弱,系统更关注变化。
  • 视杆:弱光、无色、周边;视锥:颜色与细节、中央凹。三色理论(感受器层面)与拮抗过程理论(后续通路、解释负后像)互补。
  • 听觉:位置理论(高音)与频率理论(低音)互补。
  • 格式塔原则:图形—背景、接近性、相似性、连续性、闭合、共同命运。
  • 深度线索:双眼(视网膜像差、辐合),单眼(相对大小、遮挡、线条透视、纹理梯度等),运动视差;视觉悬崖(Gibson & Walk)。
  • 知觉恒常:大小、形状、明度/颜色恒常;错觉如缪勒—莱尔错觉。
  • Hubel & Wiesel:特征检测器,1981 年诺贝尔奖。
  • 阈下广告(Vicary 1957):本人承认造假;阈下影响即使存在也小且有条件。

7自测 3 题

一款售价 10 元的饮料涨价 1 元,很多顾客立刻察觉;一台 5000 元的电视涨价 1 元,几乎没人注意。最能解释这一现象的是?

  1. A. 绝对阈限
  2. B. 韦伯定律
  3. C. 感觉适应
  4. D. 闭合原则
查看答案
答案:B
韦伯定律指出差别阈限与原刺激大小成比例。同样 1 元,相对 10 元是明显比例,相对 5000 元则远低于最小可觉差。绝对阈限说的是能否察觉刺激本身,而不是差异。

一位放射科医生在一家医院工作时,为了避免漏诊,对可疑阴影一律报告“需要复查”。按照信号检测论,最准确的描述是?

  1. A. 她的敏感性(d′)提高了,所以击中和虚报都增加
  2. B. 她的判断标准放宽了,击中率上升,但虚报也会增加
  3. C. 她的判断标准收紧了,漏报会增加
  4. D. 她出现了感觉适应
查看答案
答案:B
她区分病灶与正常组织的能力(敏感性)没有因此改变,变的是“多容易说有”的标准。标准放宽时,击中和虚报会同时上升,漏报下降。

盯着一面红色的旗子看 30 秒后转看白墙,会看到一面绿色的“旗子”。下列哪种理论最直接地解释了这一现象?

  1. A. 三色理论
  2. B. 拮抗过程理论
  3. C. 位置理论
  4. D. 格式塔接近性原则
查看答案
答案:B
拮抗过程理论认为颜色以红—绿等成对拮抗的方式加工,长时间刺激红色一方使其疲劳,转看白色时拮抗的绿色一方相对占优,于是产生负后像。三色理论能解释颜色混合,但不能直接解释后像。

8今日练习(约 20 分钟)

今天练习观察自己的知觉是怎样被预期和情境塑造的。

5 分钟

体验适应与恒常。闭眼用指尖轻放在衣袖上,注意多久之后触感变弱;然后看一扇半开的门或一本斜放的书,比较“视网膜上的形状”(试着用手指比出梯形)和你“看到的形状”。各写一句你的观察。

8 分钟

一次人际信号检测复盘。回想最近一次你判断“对方不高兴 / 对你有意见”的情境。用四格表写下:当时的信号是什么?你的判断是击中还是可能的虚报?你当时的判断标准受了什么影响(疲劳、焦虑、过去的经历)?下次可以用哪句话去确认?

7 分钟

拆解一个产品或页面。打开一个你常用的 App 或你负责的产品页面,找出它用了哪些格式塔原则(接近性、相似性、图形—背景等),再找出一处分组不清、让你犹豫的地方,写下改进建议。

9延伸阅读

  • Sensation and Perception E. Bruce Goldstein(新版与 James R. Brockmole 合著) · 教材感觉与知觉领域常用教材,阈限、信号检测、视觉与听觉通路讲得系统,适合备考查阅。
  • Eye and Brain: The Psychology of Seeing(《视觉与大脑》) Richard L. Gregory · 1966 · 经典科普“知觉是假设”观点的代表作,对错觉的讨论很经典;部分具体解释后来有争议,可与新教材对照阅读。
  • Gastrophysics: The New Science of Eating Charles Spence · 2017 · 科普 · 应用讲颜色、声音、餐具、包装等如何影响味觉体验,对品牌与产品体验设计很有启发;书中不少研究样本较小,读时留意证据强度。
  • Being You: A New Science of Consciousness Anil Seth · 2021 · 科普 · 理论从“大脑在做预测”的角度讲知觉与自我,帮助理解自上而下加工;这是一种理论立场,不是学界定论。

10间隔复习

间隔复习:自动从 Day N-1、N-3、N-7 中抽题。先凭记忆作答,再看答案。

布洛卡失语与韦尼克失语的主要区别是什么?来自 Day 7 · 神经系统与大脑结构:从脑干到前额叶,以及我们怎么“看见”脑(1 天前)

查看答案
答案:布洛卡失语:说话费力、不流利,理解相对保留(多为左额叶下部受损);韦尼克失语:说话流利但内容混乱,理解困难(多为左颞叶后部受损)。
经典两区模型是简化,现代研究认为语言依赖更广泛的左侧网络。

读到“突破性显著结果”时,优先补问哪两件事?来自 Day 5 · 可重复性危机、预注册与开放科学(3 天前)

查看答案
答案:有无独立重复/预注册等透明实践;效应量与不确定性如何(显著≠重要≠稳健)。
再决定能否用于人际或业务决策。

关于心理学的“可重复性危机”,下列说法哪一项最准确?来自 Day 1 · 心理学凭什么算科学:用证据看人(7 天前)

  1. A. 它证明了大多数心理学研究都是编造的
  2. B. 开放科学合作组织(2015)重复的研究中约 36% 得到显著结果,效应量平均约为原来的一半,提示小样本、发表偏倚等问题
  3. C. 大规模预注册重复研究证实了自我损耗效应
  4. D. 只要一次重复失败,就足以证明原效应不存在
查看答案
答案:B
A 过度引申:重复失败多源于方法问题而非造假,且许多效应(如锚定效应)重复良好。C 相反:Hagger 等(2016)的预注册多实验室重复发现效应接近零。D 错误:单次重复失败也可能有自身局限,需要综合多项证据判断。
模块 1 · 大脑与认知2026-10-05约 40 分钟▶

Day 7 · 神经系统与大脑结构:从脑干到前额叶,以及我们怎么“看见”脑

大脑是分工又高度协作的层级系统:脑干管生存,边缘结构参与情绪与记忆,皮层各叶处理感觉、运动与高级认知;“某区域参与某功能”不等于“某区域就是某功能”,更不等于“左脑人/右脑人”。

1一句话核心

大脑是分工又高度协作的层级系统:脑干管生存,边缘结构参与情绪与记忆,皮层各叶处理感觉、运动与高级认知;“某区域参与某功能”不等于“某区域就是某功能”,更不等于“左脑人/右脑人”。

2概念讲解

1. 从昨天的“砖”到今天的“楼”

昨天讲了单个神经元如何发放、突触如何传递。今天往上一层:几百亿个神经元如何组成系统与脑区,以及科学家用哪些方法推断“哪个区域参与了什么”。

贯穿今天的提醒有两条:一是定位论要有边界——功能有偏重的区域,但复杂心理活动依赖分布式网络;二是方法决定能下什么结论——这正好接上模块 0 讲的实验与相关的区别。

一句话:脑区像一个团队里的角色分工,有人主要管感觉输入、有人主要管计划,但任何一件复杂的事都是多人协作完成的。

2. 神经系统的总体划分

考试最常考的是这张层级图,先把骨架记牢:

  • 中枢神经系统(CNS):脑 + 脊髓。脊髓既传递上下行信号,也能完成简单反射(如膝跳反射),不必经过大脑。
  • 周围神经系统(PNS):连接中枢与身体其余部分,分为两支。
  • 躯体神经系统:传入感觉信息、支配骨骼肌的随意运动。
  • 自主神经系统:调节心跳、呼吸、消化、腺体等不随意活动,又分为交感(动员能量,“战斗或逃跑”:心跳加快、瞳孔放大、消化抑制)与副交感(保存能量,“休息与消化”:心跳减慢、消化恢复)。
交感 vs 副交感(教学级对比)
交感神经副交感神经
总体倾向动员、应对威胁恢复、保存能量
心率加快减慢
瞳孔放大缩小
消化抑制促进
常见场景公开演讲前心跳加速饭后放松、困倦

与神经系统并行的还有内分泌系统:腺体分泌激素,经血液作用,比神经信号慢但更持久。下丘脑—垂体—肾上腺轴(HPA 轴)是应激反应的核心通路,皮质醇是其代表激素——到“情绪与压力”模块会再展开。

3. 由下往上:后脑、中脑、前脑

教材常按进化与发育的层次,从下往上介绍。越往下越偏“维持生命”,越往上越偏“灵活与高级加工”——但这只是粗略倾向,各层级之间一直在双向交流。

  • 延髓:呼吸、心跳、血压等基本生命功能;严重受损可危及生命。
  • 脑桥:连接上下脑区的“桥”,参与睡眠与觉醒调节。
  • 小脑:协调运动、平衡与时机,也参与某些运动技能学习(如骑车、打字的熟练化);近年研究发现它也参与部分认知功能。
  • 网状结构(贯穿脑干):调节觉醒与注意的整体水平。
  • 丘脑:大多数感觉信息(嗅觉除外)进入皮层前的中继与筛选站。
  • 下丘脑:体积小但作用大,调节饥饿、口渴、体温、性行为与昼夜节律,并通过控制垂体连接神经与内分泌系统。
  • 杏仁核:参与情绪信息尤其是威胁相关信息的加工、恐惧学习。
  • 海马:对形成新的陈述性记忆(事实与事件)和空间导航很关键——记忆模块会详细讲。
“边缘系统”是一个历史上方便的统称(常包括杏仁核、海马、下丘脑等),但其边界在学界并不统一;更准确的说法是“参与情绪与记忆的若干结构与回路”。

4. 大脑皮层:四个脑叶与左右半球

大脑皮层是覆盖在大脑表面、高度折叠的薄层灰质,折叠让有限颅腔容纳更大面积。左右两个半球由胼胝体(最大的连合纤维束)连接。大多数感觉与运动通路是对侧支配:左半球主要控制身体右侧,反之亦然。
四个脑叶的主要功能偏重(考试骨架)
脑叶主要功能偏重关键区域 / 记忆点
额叶运动控制、计划、决策、抑制冲动、工作记忆初级运动皮层;前额叶皮层;布洛卡区(多在左侧,言语产生)
顶叶躯体感觉、空间注意与整合初级躯体感觉皮层(紧挨运动皮层之后)
颞叶听觉、语言理解、部分记忆与物体识别初级听觉皮层;韦尼克区(多在左侧,言语理解)
枕叶视觉初级视觉皮层

Wilder Penfield 等在癫痫手术中用电刺激清醒患者的皮层,绘制出运动与躯体感觉皮层的“小人图”(homunculus):手、嘴唇、舌头所占面积远大于躯干,反映的是精细程度与感受器密度,不是身体大小。

联合皮层不直接对应单一感觉或运动,负责整合、解释与计划;人类的前额叶联合皮层相对比例较大,常与执行功能(计划、灵活切换、抑制)联系在一起。

5. 半球偏侧化:真实存在,但不是“左脑人/右脑人”

对多数右利手者而言,语言加工明显偏向左半球;右半球在某些空间与面孔加工、情绪韵律识别上相对更强。这叫偏侧化(lateralization),有扎实证据,尤其来自裂脑研究(见经典研究)。

但流行说法“理性的人用左脑、有创意的人用右脑”没有证据支持。正常人两个半球通过胼胝体持续协作,创造力、逻辑推理都依赖双侧网络。同样,“人只用了大脑的 10%”也是迷思:脑成像显示几乎所有脑区都有活动,只是不同任务下活动模式不同。

偏侧化 = 某些功能在某一侧相对更强;不等于某一侧独占,更不等于把人分成两种性格类型。

6. 我们怎么研究脑:每种方法能回答不同的问题

这一节直接接模块 0:观察到“某区域活跃”只是相关;干预某区域后行为改变才更接近因果。

常见研究方法对比
方法原理优势局限
损伤研究观察脑损伤(中风、外伤、手术)后哪些能力受损可推断某区域对功能是否必要损伤范围不规整、个案多、不能随机分配
经颅磁刺激(TMS)用磁场短暂干扰或兴奋某皮层区域可在健康人身上做因果性检验只能到达较浅的皮层,范围有限
EEG / ERP头皮记录神经元群体的电活动时间分辨率极高(毫秒级)、便宜空间定位粗
fMRI测量血氧水平依赖信号(BOLD),间接反映神经活动空间分辨率较好、无创时间分辨率较慢(秒级);是相关性数据;需要严格统计校正
PET追踪放射性示踪剂的代谢或受体结合可看特定神经化学系统有放射性、昂贵、时间分辨率低

读到“某某脑区亮了”的新闻时,先问三件事:① 这是相关还是干预?② 样本多大、是否做了多重比较校正?③ 一个区域通常参与很多过程,能否从“亮了”反推出具体心理状态?(后者叫反向推断,Russell Poldrack 等专门讨论过它的局限。)

7. 可塑性:结构会被经验改写

大脑不是出厂即定型的硬件。神经可塑性指神经连接与结构随经验、学习和损伤而改变:儿童期最强,成年后仍存在。中风后的康复训练、学习新技能后的结构变化,都是可塑性的体现。

Eleanor Maguire 等发现伦敦出租车司机海马后部体积与驾龄相关,后续纵向研究在学习路线前后比较,结果支持“训练带来变化”的方向。但请注意,可塑性有限度、有关键期,商业上“30 天重塑大脑”的宣传通常远超证据。

3经典研究与人物

布洛卡区与韦尼克区:语言功能定位Paul Broca;Carl Wernicke · 1861;1874稳固

做了什么Broca 研究一位几乎只能说出“tan”的患者,死后解剖发现其左侧额叶下部受损,后续病例也指向左额叶与言语产生有关。Wernicke 描述另一类患者:说话流利但内容混乱、理解困难,损伤位于左侧颞叶后部。

发现不同脑区损伤会造成可区分的语言障碍(表达性失语 vs 接受性失语),支持了脑功能在一定程度上的定位,也开创了用损伤推断功能的研究路径。

证据说明两类失语症的基本区分稳固,是教材经典。但现代研究显示语言依赖更广泛的左侧网络,经典“两区模型”是简化;原始依据也来自少数个案。

菲尼亚斯·盖奇(Phineas Gage)案例John Harlow(医生记录);后人分析如 Malcolm Macmillan · 1848 事故;1868 年 Harlow 报告有争议

做了什么铁路工人盖奇在爆破事故中被铁棍穿过头部(主要伤及左侧额叶),奇迹般存活。Harlow 记录他此后在性格与社会行为上明显改变,朋友称他“不再是盖奇”。这一案例常被用来说明额叶与人格、自我调节有关。

发现额叶损伤可能影响情绪调节、计划与社会行为,这一方向与后来大量神经心理学研究一致。

证据说明历史记录有限,后来的教材常夸大他的“堕落”。Macmillan 等考证发现,盖奇晚年曾在智利做长途马车夫这类需要计划与自控的工作,提示可能有相当程度的恢复。适合当“额叶与社会行为”的引子,不宜当作精确证据。

裂脑研究Roger Sperry、Michael Gazzaniga 等 · 1960 年代起稳固

做了什么部分严重癫痫患者接受胼胝体切断手术。研究者只把图像呈现给一侧视野,发现:信息送到左半球时患者能说出名称;送到右半球时往往说不出来,却能用左手挑出对应物体。Sperry 因此获 1981 年诺贝尔生理学或医学奖(共享)。

发现两个半球在功能上有偏侧化(多数人语言偏左);胼胝体对整合两侧信息至关重要。Gazzaniga 还观察到左半球会为行为“编出”合理解释,他称之为“解释器”。

证据说明核心发现稳固,被多次重复。但样本是少数特殊患者,不能直接推论到正常人“两个脑各自为政”;也不支持“左脑人/右脑人”的性格分类。

“左脑型 / 右脑型人格”的检验Jared Nielsen 等(犹他大学) · 2013已被质疑

做了什么这项发表在 PLOS ONE 的研究分析了一千多人的静息态脑成像数据,检查是否有人整体上更依赖左半球或右半球网络。结果发现局部功能连接存在偏侧化,但没有找到“个体整体偏向某一侧”的证据。

发现“理性左脑人、创意右脑人”这一流行分类缺乏支持;偏侧化是功能层面的,而不是人格类型层面的。

证据说明这里标为“已被质疑”的是左右脑人格分类说本身,而不是 Nielsen 的研究。该研究是一项重要反证,但单项研究也有方法边界,结论应与更广泛的偏侧化文献一起看。

脑成像图片会让结论显得更可信吗David McCabe & Alan Castel(原研究);Robert Michael 等(重复研究) · 2008;2013已被质疑

做了什么McCabe 与 Castel 报告:同样的文章配上脑扫描图,读者会觉得推理更科学。这一结果被广泛引用,常被说成“神经图片有魔力”。但 Michael 等人进行了大规模重复,发现脑图本身带来的说服力提升非常小,接近于零。

发现“放一张脑图就能大幅提升可信度”的说法不可靠。不过另一类现象——在解释中加入无关的神经科学术语会让外行觉得解释更好(Deena Weisberg 等 2008)——值得单独留意。

证据说明原始的“脑图效应”在重复中大幅缩水,属典型的可重复性案例,正好呼应模块 0 的第 5 天。对营销与传播的启示是:不要指望靠神经视觉包装说服人,但也要警惕神经术语对外行的干扰。

4人际中怎么用

情绪吵架时身体先一步进入“交感模式”

争执升级时心跳加快、呼吸变浅、说话变快,这是交感神经被动员的典型表现,此时深思熟虑会变难。一个实用的做法是约定“暂停 20 分钟再谈”,给身体时间回到副交感主导的平稳状态,而不是硬撑着在最激动时做决定。

理解他人别把人分成“左脑型”和“右脑型”

说某人“太理性没感情”或“太感性没逻辑”,再配上左右脑的说法,听起来有依据,其实是贴标签。更有用的是具体描述:他在什么情境下更看重数据,在什么情境下更在乎感受——人会随情境切换,而不是固定在一侧。

共情脑损伤或疾病后的“性格变化”值得被理解

家人中风、脑外伤或患神经系统疾病后变得易怒、冲动或冷漠,往往和额叶等区域受影响有关,并非“变坏了”。理解这一点能减少相互指责,也提醒我们在康复期寻求专业神经心理评估与支持。

5工作中怎么用

营销慎用“神经营销”和“左右脑”话术

“针对右脑的感性广告”“激活消费者大脑奖赏区”这类表述大多是包装。真正可靠的是 A/B 测试、销售与留存数据。如果供应商用 fMRI 或 EEG 报告证明广告效果,要追问样本量、是否预注册、脑信号能否预测真实购买行为。

管理压力下前额叶的“刹车”会变弱

高压、睡眠不足时,人更难做计划、抑制冲动和灵活切换。管理上重要的决策尽量别放在团队通宵或危机最高峰时拍板;给关键决策留出冷静期,比要求大家“更理性一点”更有效。

产品界面要尊重注意与工作记忆的上限

前额叶负责的工作记忆容量有限,一次让用户比较太多选项、记住太多步骤,会明显增加流失。把复杂流程拆成少量清晰步骤、让关键信息一直可见,是把认知负担从用户脑中移到界面上。

品牌说“科学”时,用对证据层级

品牌传播中引用脑科学时,区分“相关研究显示某区域活跃”和“实验证明能改变行为”。用词克制(例如“有研究提示”而不是“科学证明重塑大脑”),长期来看更能建立专业可信度,也更能经得起监管与舆论检验。

6考点速记

  • CNS = 脑 + 脊髓;PNS = 躯体神经系统 + 自主神经系统。
  • 交感:战斗或逃跑(心跳加快、消化抑制);副交感:休息与消化。
  • 内分泌系统:激素经血液,慢而持久;HPA 轴与应激、皮质醇相关。
  • 延髓(呼吸心跳)、小脑(运动协调与技能)、网状结构(觉醒)、丘脑(感觉中继,嗅觉除外)、下丘脑(饥渴、体温、节律,控制垂体)。
  • 杏仁核:情绪尤其威胁加工;海马:形成新的陈述性记忆、空间导航。
  • 四叶:额叶(运动、计划、布洛卡区)、顶叶(躯体感觉)、颞叶(听觉、韦尼克区)、枕叶(视觉)。
  • 布洛卡失语:说话困难、理解相对保留;韦尼克失语:说话流利但内容混乱、理解困难。
  • 胼胝体连接两半球;裂脑研究(Sperry、Gazzaniga)显示语言多偏左;对侧支配。
  • 方法:损伤 / TMS 更接近因果;EEG 时间分辨率高;fMRI 空间分辨率较好但是相关性数据。
  • 迷思:“只用 10% 的脑”“左脑人/右脑人”均无证据支持。

7自测 3 题

一位患者中风后说话流利,但内容空洞混乱,也听不太懂别人说的话。最可能受损的是哪里?

  1. A. 左侧额叶下部的布洛卡区
  2. B. 左侧颞叶后部的韦尼克区
  3. C. 小脑
  4. D. 枕叶
查看答案
答案:B
流利但理解差、内容混乱是韦尼克失语的典型表现。布洛卡失语是说话费力、理解相对保留;小脑主要与运动协调有关;枕叶主要与视觉有关。

研究者想知道“左侧前额叶某区域是否是完成某项任务所必需的”,以下哪种方法最直接?

  1. A. 用 fMRI 观察完成任务时该区域是否激活
  2. B. 用 EEG 记录任务时的脑电变化
  3. C. 用 TMS 暂时干扰该区域,看任务表现是否下降
  4. D. 问卷调查被试自我报告的专注程度
查看答案
答案:C
fMRI 与 EEG 只能显示活动与任务相关,不能说明该区域是“必需”的。TMS 是对该区域的干预,若表现下降,更接近因果证据(与模块 0 中实验 vs 相关的区别一致)。

关于裂脑研究,下列哪项说法最准确?

  1. A. 它证明了健康人可以分为左脑型和右脑型
  2. B. 它显示两个半球在某些功能上有偏侧化,胼胝体对整合两侧信息很重要
  3. C. 它证明人只用了大脑的 10%
  4. D. 它表明右半球完全没有任何理解能力
查看答案
答案:B
裂脑研究的核心结论是偏侧化与胼胝体的整合作用。它不支持人格分类(A)或 10% 迷思(C);右半球虽常无法说出名称,却能理解并用左手选出物体,所以 D 错。

8今日练习(约 20 分钟)

今天把脑区从名词表变成能画、能用、能拆穿迷思的知识。

8 分钟

默画一张大脑侧视图。不看资料,画出四个脑叶,标出运动皮层、躯体感觉皮层、布洛卡区、韦尼克区、视觉皮层,再在旁边写出小脑、脑干、丘脑、下丘脑、杏仁核、海马各一句话功能。画完对照课程,用另一种颜色补漏。

6 分钟

身体信号观察。回想最近一次紧张的场景(汇报、争执、赶截止日期),写下当时的身体反应,标出哪些属于交感神经激活。再写一个你可以用来帮自己回到平稳状态的具体方法(例如暂停、慢呼吸、走动几分钟)。

6 分钟

拆一条“脑科学”说法。找一条包含“左脑/右脑”“激活大脑某区”“开发大脑潜能”的文章、广告或课程宣传。写下:① 它的核心主张;② 它依据的是相关还是干预;③ 用今天的知识,它哪里说过头了。

9延伸阅读

  • Who's in Charge? Free Will and the Science of the Brain(中文版常译《谁说了算?》) Michael S. Gazzaniga · 2011 · 科普裂脑研究亲历者写的通俗读物,讲解释器与大脑分工;读时注意区分研究发现与作者的哲学推论。
  • Brainwashed: The Seductive Appeal of Mindless Neuroscience Sally Satel & Scott O. Lilienfeld · 2013 · 科普 · 批判性思维专门讨论脑成像被过度解读的问题,和今天“研究方法”一节高度相关,适合品牌与营销从业者阅读。
  • 《神经科学:探索脑》(Neuroscience: Exploring the Brain)中文版相关章 Mark F. Bear, Barry W. Connors, Michael A. Paradiso · 教材神经系统结构与大脑皮层章节图示清楚,可对照今天的默画练习。
  • Fundamentals of Human Neuropsychology Bryan Kolb & Ian Q. Whishaw · 教材神经心理学经典教材,损伤研究、偏侧化、失语症等章节适合系统备考时查阅。

10间隔复习

间隔复习:自动从 Day N-1、N-3、N-7 中抽题。先凭记忆作答,再看答案。

激动剂与拮抗剂有何不同?来自 Day 6 · 神经元、动作电位与神经递质:行为的生物学地基(1 天前)

查看答案
答案:激动剂增强/激活某受体系统效应;拮抗剂阻断或削弱该系统效应。
许多药物还通过再摄取、酶降解等环节间接改变递质信号。

Cronbach’s α 主要反映什么?它能单独证明效度吗?来自 Day 4 · 测量:操作化、信度与效度(3 天前)

查看答案
答案:主要反映内部一致性;不能单独证明效度。
题项可能一致地测错构念。
模块 1 · 大脑与认知2026-10-04约 40 分钟▶

Day 6 · 神经元、动作电位与神经递质:行为的生物学地基

心理与行为最终都落在神经元如何彼此通信上:电信号(动作电位)在细胞内“全或无”地传递,化学信号(神经递质)在突触间调节;懂这条地基,才能正确理解药物、情绪、动机与“某递质=某人格”的庸俗说法为何站不住。

1一句话核心

心理与行为最终都落在神经元如何彼此通信上:电信号(动作电位)在细胞内“全或无”地传递,化学信号(神经递质)在突触间调节;懂这条地基,才能正确理解药物、情绪、动机与“某递质=某人格”的庸俗说法为何站不住。

2概念讲解

1. 模块切换:从“怎么证明”,到“脑与认知用什么砖块搭起来”

前五天(模块 0)练的是科学思维:证据、实验、相关、测量、可重复性。从今天起进入模块 1 · 大脑与认知——感知觉、注意、记忆、决策等,都需要一块共同地基:神经系统如何编码与传递信息。

今天不讲“读心术”,也不把复杂心理还原成一句“缺血清素”。目标是建立可考、可迁移的生物心理骨架:神经元结构 → 动作电位 → 突触与递质 → 激动剂/拮抗剂如何改信号——为后面理解成瘾、情绪调节、注意力与药物作用留接口。

一句话:神经元用电在细胞内快速传消息,用化学在细胞间灵活调音量;心理过程是大规模网络动力学,不是单一分子的人格标签。

2. 神经元:信息处理的基本单元

神经元(neuron)是特化的细胞,负责接收、整合与传递信号。Santiago Ramón y Cajal 等用高尔基染色等方法论证:神经系统由离散的细胞通过接触沟通(神经元学说),而非一根连续的原生质网——这是现代神经科学的起点之一。

教学上常把单个神经元拆成四个功能部位(真实形态多样,但逻辑清晰):

  • 树突(dendrites):主要接收来自其他神经元的输入;分支越多,可整合的突触输入越多。
  • 胞体(soma / cell body):含细胞核与代谢中心;把树突与胞体上的兴奋性/抑制性输入整合,决定是否在轴丘触发动作电位。
  • 轴突(axon):把输出信号传送到远处;许多轴突有髓鞘(myelin),由胶质细胞形成,使传导更快、更节能(跳跃传导)。
  • 突触(synapse):通常指轴突末梢与下游细胞之间的连接区——多数是化学突触(释放递质),少数是电突触(缝隙连接直接传电)。
神经元部位 ↔ 功能(示意)
部位主要角色一句话记忆
树突接收突触输入天线
胞体 / 轴丘整合输入,决定是否发放决策点
轴突长距离传导动作电位电缆
突触前末梢释放神经递质发信端
突触后膜受体接收化学信号收信端

胶质细胞(如星形胶质、少突胶质/施万细胞)不是“填料”:它们支持代谢、形成髓鞘、参与微环境调节。本课聚焦神经元信号链,胶质留待后文扩展。

3. 动作电位:全或无的电脉冲

静息时,细胞膜内外有离子浓度差,膜内相对更负(静息电位)。当兴奋性输入把膜电位去极化到阈值附近,电压门控钠通道等快速开放,产生迅速的去极化—复极化波形,这就是动作电位(action potential)。

Hodgkin 与 Huxley 在枪乌贼巨大轴突上用电压钳等技术,定量描述了钠、钾电导如何产生动作电位——成为生物物理经典(1963 年诺贝尔生理学或医学奖相关工作)。

  • 全或无(all-or-none):一旦越过阈值,动作电位幅度大致刻板;“更强的刺激”通常表现为发放频率升高或更多神经元被招募,而不是单个锋电位无限变高。
  • 不应期:刚发放后短期内难再触发,限制最高发放率,并帮助信号单向推进。
  • 传导:无髓鞘轴突连续传播;有髓鞘时在郎飞结之间跳跃,速度显著提高。
  • 与graded电位的区别:树突/胞体上的局部电位可强可弱、可叠加;动作电位则是阈值触发后的标准化脉冲。
比喻要谨慎:全或无像电灯开关“开/关”,但神经系统的信息多在频率、时机与哪些细胞一起发放里编码——不是只有 0/1 两个心理状态。

4. 突触传递:从电到化学再回到电

动作电位抵达突触前末梢 → 钙内流 → 囊泡释放神经递质 → 递质扩散穿过突触间隙 → 结合突触后受体 → 打开离子通道或启动第二信使 → 使下游更易发放(兴奋)或更难发放(抑制)。

Otto Loewi(1921 年前后)用双蛙心灌流实验证明迷走神经通过化学物质(后来确认与乙酰胆碱相关)减慢心跳,奠定“化学突触传递”观念。多数中枢突触也遵循化学传递逻辑。

  • 兴奋性突触后电位(EPSP):使膜电位靠近阈值(如许多谷氨酸突触)。
  • 抑制性突触后电位(IPSP):使膜电位远离阈值或短接兴奋电流(如许多 GABA 突触)。
  • 清除:递质经再摄取转运体、酶降解或扩散离开,以结束信号;许多药物正是作用于这些步骤。
  • 可塑性:突触效能可因活动历史而增强或减弱(如 LTP/LTD)——学习与记忆的重要候选机制(后文详谈)。

5. 主要神经递质:功能倾向,不是人格配方

递质种类很多,教材常先掌握以下几类。务必记住:同一种递质在不同通路、脑区、受体亚型上作用不同;心理特质是多基因、多系统、多经验的产物,把“多巴胺=快乐人格”当真理,是科普污染。

常见递质的教学级“功能倾向”(过度简化,考试够用,生活勿贴标签)
递质功能倾向(示意)勿庸俗化成
谷氨酸(Glu)中枢最主要的兴奋性递质;学习相关可塑性常涉及“兴奋=脾气暴躁”
GABA中枢最主要的抑制性递质;许多抗焦虑药作用于其受体系统“抑制=性格软弱”
多巴胺(DA)动机、运动、奖励学习与预测误差等通路中关键;中脑—纹状体等“多巴胺=快乐分子/上瘾人格”
血清素(5-HT)广泛调节情绪、睡眠、食欲等;抗抑郁药常涉及再摄取等环节“血清素低=抑郁症的唯一原因”
乙酰胆碱(ACh)神经—肌肉接头;中枢注意与记忆相关回路;自主神经部分“缺胆碱=记性差的唯一解释”
去甲肾上腺素(NE)觉醒、警觉、应激反应相关;蓝斑等“NE 高=天生焦虑型”

读到“某饮料/某习惯提升多巴胺”的营销文:问它说的是哪条通路、测的是什么、有无混淆运动/预期/快感。奖励学习里,多巴胺信号常与奖励预测误差(实际结果相对预期的偏差)更相关,而不只是“愉悦本身”(见经典研究)。

考试记:谷氨酸兴奋、GABA 抑制;单胺类(DA、5-HT、NE)与动机、情绪、觉醒的调节关系密切——但机制是网络与受体层面的,不是“一分子一性格”。

6. 激动剂、拮抗剂与药物如何改突触信号

许多精神药物、娱乐性物质与毒物,本质上是在改写突触通信:增加或减少递质释放、阻断再摄取、模拟或阻断受体、抑制降解酶等。

  • 激动剂(agonist):激活受体或增强该递质系统的效应(例如某些药物直接刺激受体,或间接提高突触间隙递质浓度)。
  • 拮抗剂(antagonist):阻断受体或削弱该系统效应(例如受体阻断剂)。
  • 再摄取抑制剂:阻止递质被运回突触前,使信号在间隙停留更久(许多抗抑郁药的教学级描述属于此类思路)。
  • 耐受与适应:长期用药后,受体数量/敏感性与回路会代偿性改变——这是停药反弹、剂量调整与成瘾神经适应的生物学背景(后文心理健康模块再展开)。

对人际与工作的启示:别人的情绪波动、专注力变化或药物副作用,往往有真实的神经化学与回路基础;同时,生物学解释不等于放弃责任或污名化——解释机制是为了更准确地共情与求助,不是贴永久标签。

7. 今天怎么接到“懂人”与“考试”

考试:能默写神经元四部位、全或无、化学突触步骤、六类递质倾向、激动剂/拮抗剂定义,并点出 Cajal、Hodgkin & Huxley、Loewi、Schultz 等名字与贡献层级。

懂人:把“他就是懒/坏/玻璃心”的单一道德叙事,偶尔替换成“动机回路、应激与睡眠、药物与疾病也可能在改信号增益”——然后再回到可观察行为与证据(模块 0 的习惯不丢)。

应用:产品上的奖励反馈、品牌的预期管理、管理中的激励设计,都可以用“预测误差与动机”作隐喻——但隐喻不是脑扫描;做决策仍要行为数据与可重复检验。

  1. 看到递质营销文 → 降级为待检验假设,检查是否偷换成人格本质论。
  2. 看到药物/咖啡因/酒精影响表现 → 用突触步骤图定位“可能动了哪一环”,避免神秘化。
  3. 准备下一课(感知觉/注意等)→ 记住:心理能力是大规模网络 emergent 属性,今天只是砖与水泥。

3经典研究与人物

神经元学说:神经系统由离散细胞构成Santiago Ramón y Cajal(及同时代争论中的 Golgi 等) · 19 世纪末–20 世纪初稳固

做了什么Cajal 借助高尔基染色等方法,系统描绘神经元形态,主张神经组织由独立细胞通过接触传递信息(相对于 reticular 连续网理论)。其工作为现代神经解剖学奠基,并获 1906 年诺贝尔生理学或医学奖(与 Golgi 分享)。

发现行为与心理的生物学分析可以建立在“细胞—突触—回路”层级上;信息在单元之间传递,而非一根无界的原生质浆。

证据说明神经元作为基本单元的核心结论已被压倒性证据支持;电镜与分子神经科学进一步细化了突触结构。历史争论本身是科学方法的好教材。

动作电位的离子机制(枪乌贼巨大轴突)Alan L. Hodgkin & Andrew F. Huxley · 1952 前后(定量模型)稳固

做了什么Hodgkin 与 Huxley 在枪乌贼巨大轴突上结合实验与数学,描述电压依赖的钠、钾电导如何产生动作电位波形,奠定可兴奋膜生物物理学。

发现动作电位是可定量理解的物理—化学事件;“全或无”与阈值等概念有明确机制基础,可迁移到教学与临床电生理直觉。

证据说明核心框架稳固;哺乳动物中枢神经元通道种类更多、形态更复杂,细节有扩展,但不推翻其奠基地位。

化学突触传递:迷走物质实验Otto Loewi · 1921稳固

做了什么Loewi 将刺激迷走神经后的供体蛙心灌流液转移到受体蛙心,观察到心率减慢,证明神经对心脏的效应可通过可溶性化学物质介导(“Vagusstoff”,后与乙酰胆碱联系)。

发现神经元通讯可以是化学的;这为神经递质概念与后续药理学打开大门。

证据说明作为化学传递的经典示范,历史地位与核心结论稳固;中枢突触的多样性与共释放等是后续发展,不否定该实验的奠基意义。

多巴胺与奖励预测误差Wolfram Schultz 及同事 · 1990 年代起(系列工作)稳固

做了什么在猕猴等实验中,中脑多巴胺神经元的短暂活动常更好地跟踪“实际奖励相对预期的偏差”(reward prediction error):意外奖励时升高,预期内奖励时反应减弱或转移至线索,预期奖励缺失时可出现抑制。

发现多巴胺信号与学习与动机更新密切相关,不能简单等同于“快乐分子”。这对理解强化、成瘾与激励设计有理论启发。

证据说明预测误差账户得到大量电生理与计算神经科学支持,属教学上较稳妥的主流框架;多巴胺还有运动、努力、显著性等多重功能,单一叙事仍需限定。标为稳固指其核心发现方向,而非“解释一切”。

“低血清素导致抑郁”的简化因果论流行科普与部分早期单胺假说传播(对照:当代综述与元分析讨论) · 20 世纪后半叶起流行简化版已被质疑

做了什么抑郁的单胺假说曾推动药物研发与大众理解,但将抑郁症简单等同于“脑内血清素不足”的线性因果,已被大量批评:直接证据不足、异质性高、抗抑郁药起效机制更复杂,且不能还原为验血式的“递质缺多少”。

发现递质系统参与情绪调节是真的;“某递质低=某病/某人设”的庸俗版不可靠。临床决策应遵循循证指南,而非社交媒体配方。

证据说明标为已被质疑的是过度简化的因果口号,不是否定血清素系统研究或否定有效治疗。引用目的是训练证据素养,防止自我诊断与污名。

4人际中怎么用

共情把“性格差”偶尔翻译成“信号增益在变”

睡眠剥夺、发烧、酒精、咖啡因戒断、新药副作用,都会改变觉醒与情绪的神经调节。对方突然烦躁或迟钝时,先问身体与药物变量,再下“他变心/变坏了”的结论——这不是开脱一切,而是减少错误归因。

沟通别用递质当武器或情话

“都是你多巴胺被别人抢走了”“你血清素低所以不爱我”听起来科学,其实是伪解释:无法操作化、无法证伪、还剥夺了具体行为讨论。更有用的句子是:我观察到哪些行为、我的需求是什么、我们一起试验什么改变。

边界生物学解释与责任可以并存

成瘾与冲动有真实的回路与突触适应基础,同时仍需要边界、治疗与修复信任的行动计划。懂神经机制是为了减少羞辱、提高求助效率,不是“有脑科学所以无法选择”。

5工作中怎么用

产品反馈设计:预期与预测误差

通知、进度条、抽奖、连续打卡奖励,常在操纵“预期—结果”的差距。短期间歇、不可完全预测的强化更易维持点击(行为原理后文详述),但也更容易造成疲劳与失控感。伦理产品应问:我们是在帮助用户更新有用预期,还是在劫持动机回路?

营销慎用“多巴胺”“血清素”当卖点

补剂、课程、香氛若宣称“提升多巴胺让你幸福成功”,多半越界。合规与可信的说法应落到可测行为或经审核的功效宣称,而不是脑内分子神话。品牌长期资产靠可验证体验,不靠神经词藻。

管理激励不是无限加码多巴胺

奖金与排行榜会改变预期与预测误差:突然取消惯例奖励,可能造成像“负预测误差”一样的动机塌方。管理上更稳的是:规则透明、预期可更新、认可具体行为,而不是让团队活在间歇强化的焦虑里。

品牌用“全或无”隐喻解释阈值体验

有些体验必须过线才“成事”(加载完成、首单成功、会员权益真正兑现)——未过阈值的半吊子刺激,用户感知接近零。产品与品牌触点要保证关键路径能稳定越过“可用阈值”,而不是堆很多亚阈值噪音。

6考点速记

  • 神经元:树突(接收)、胞体/轴丘(整合)、轴突(传导)、突触(化学/少数电传递)。
  • 神经元学说:Cajal 等——神经系统由离散神经元构成(相对连续网理论)。
  • 动作电位:阈值触发;全或无;强度常编码为频率/招募,而非单峰无限增高;Hodgkin & Huxley 离子机制。
  • 化学突触:动作电位→Ca²⁺→递质释放→受体→EPSP/IPSP;Loewi 化学传递实验。
  • 谷氨酸 / GABA:中枢主要兴奋 / 抑制递质。
  • 多巴胺、血清素、乙酰胆碱、去甲肾上腺素:动机与奖励学习、情绪与睡眠食欲等调节、神经肌与注意记忆、觉醒应激——记倾向,勿人格化。
  • 奖励预测误差:Schultz 等——多巴胺瞬态常跟踪“结果相对预期的偏差”。
  • 激动剂 / 拮抗剂:增强 vs 阻断受体系统效应;再摄取抑制剂等改变间隙递质时效。
  • 警惕:“某递质=某人格/某病唯一原因”的简化口号(尤其庸俗血清素因果论已被严重质疑)。

7自测 3 题

关于动作电位的“全或无”,下列哪项最准确?

  1. A. 刺激越强,单个动作电位的幅度可以无限变高
  2. B. 一旦达到阈值,动作电位以大致刻板的方式发放;更强输入常表现为发放更频或更多细胞参与
  3. C. 动作电位只在树突产生,轴突只负责释放激素
  4. D. 全或无意味着心理状态只有快乐与痛苦两种
查看答案
答案:B
全或无指锋电位幅度刻板;信息传递常靠频率与群体编码。A 错;C 混淆结构功能;D 是错误隐喻。

Otto Loewi 的蛙心实验主要支持什么?

  1. A. 所有心理疾病都由单一基因决定
  2. B. 神经可以通过释放化学物质影响靶器官
  3. C. 多巴胺等于快乐
  4. D. 相关等于因果
查看答案
答案:B
Loewi 证明迷走效应可经灌流液中的化学物质传递。A、C、D 均非该实验结论。

把“多巴胺”直接等同于“快乐人格”,主要错在哪里?

  1. A. 多巴胺根本不存在
  2. B. 忽略通路、受体与功能的多样性(如预测误差、运动等),把网络现象还原成人格标签
  3. C. 只有血清素才与行为有关
  4. D. Cajal 已证明递质不重要
查看答案
答案:B
多巴胺真实存在且重要,但功能依脑区与情境而异;Schultz 等工作更支持学习/预测误差等账户,而非“快乐=人格”。A、C、D 错误。

8今日练习(约 20 分钟)

今天把抽象突触步骤,练成能画、能拆广告、能改归因的肌肉记忆。

7 分钟

默画一张突触卡通图。标出:突触前末梢、囊泡、递质、受体、突触后、再摄取。用箭头写出激动剂与拮抗剂可能动哪一环(不必完美,重在结构)。

7 分钟

拆一条神经营销文。找一篇宣称“提升多巴胺/血清素”的广告或短视频。写下:① 它做了什么可观察承诺;② 偷换成了什么人格/疗效本质论;③ 若用今日知识,你会要求哪些证据(样本量、测量、是否混淆预期)。

6 分钟

人际改写。把一句你最近的归因(如“他就是懒”)改写成两层:可观察行为 + 可能的状态变量(睡眠、压力、药物、奖励结构)。不要求得出最终诊断,只练习避免单一道德本质论。

9延伸阅读

  • Principles of Neural Science(教材相关章节:神经元、膜电位、突触传递) Eric R. Kandel, James H. Schwartz, Thomas M. Jessell 等(主编随版次变化) · 教材权威神经科学教材;按章节查“action potential / synaptic transmission”即可,不必通读全书。
  • Hodgkin & Huxley 1952 年系列论文(动作电位定量描述) Alan L. Hodgkin & Andrew F. Huxley · 1952 · 论文 · The Journal of Physiology经典原文偏技术;可先读教材转述,再按兴趣看图与方程直觉。
  • Predictive reward signal of dopamine neurons Wolfram Schultz · 1998 · 综述 · Journal of Neurophysiology(及其系列研究)理解奖励预测误差账户的入口;读结论与图,警惕媒体简化为“多巴胺=爽”。
  • 《神经科学:探索脑》(Neuroscience: Exploring the Brain)中文版相关章 Mark F. Bear, Barry W. Connors, Michael A. Paradiso · 教材本科友好;神经元与突触章节配图清晰,适合与今日自测对照。

10间隔复习

间隔复习:自动从 Day N-1、N-3、N-7 中抽题。先凭记忆作答,再看答案。

p-hacking 与 HARKing 各指什么?为何都会削弱证据?来自 Day 5 · 可重复性危机、预注册与开放科学(1 天前)

查看答案
答案:p-hacking:为显著而选择性尝试分析;HARKing:事后假说写成事先预测。二者都让读者高估验证强度、抬高假阳性。
开放科学用预注册与透明报告来约束它们。

冰淇淋销量与犯罪率相关,却不能说冰淇淋导致犯罪——这主要演示了哪类问题?来自 Day 3 · 相关、调查与观察:非实验证据怎么读(3 天前)

查看答案
答案:第三变量问题(如气温等共同因素造成虚假相关)
两变量真实共变,但因果故事可能完全指向未测的 C。
模块 0 · 科学思维2026-10-03约 40 分钟▶

Day 5 · 可重复性危机、预注册与开放科学

一条“显著”结果不等于牢靠知识:选择性分析、事后故事与发表偏好会制造假阳性;要判断“值不值得信”,看它能否独立重复,以及作者是否用预注册、开放数据/材料、注册报告等开放科学做法约束自己。

1一句话核心

一条“显著”结果不等于牢靠知识:选择性分析、事后故事与发表偏好会制造假阳性;要判断“值不值得信”,看它能否独立重复,以及作者是否用预注册、开放数据/材料、注册报告等开放科学做法约束自己。

2概念讲解

1. 从“尺子准不准”,到“整条证据链能不能再走一遍”

前四天分别练了:用证据看人、用实验谈因果、用相关/调查/观察做描述与预测、用操作化与信效度审测量。今天进入模块 0 的收束点之一:可重复性(replication / reproducibility)——别人按同样逻辑与合理程序再做,还能不能得到实质相近的结论。

若单篇漂亮论文无法重复,人际判断、品牌洞察与产品实验都会被“昙花一现的显著”带偏。可重复性危机不是否定心理学,而是要求我们升级读证据的标准。

一句话:显著(p 过线)回答“在这份数据与这些选择下,偶然性像不像解释”;可重复性回答“换一批人、换一个团队、按预告的计划再来,结论还站得住吗?”

2. 为什么“发表出来的真发现”也会碎:诱因与自由度

科学期刊长期更爱“新奇、显著、干净”的故事。研究者若在截止日期与职业压力下工作,就容易滑向一套并不欺诈、却极危险的习惯——统称可疑研究实践(questionable research practices),其核心是研究者自由度(researcher degrees of freedom):同一份数据,分析岔路多到足以“挖出”假阳性。

  • p-hacking:不停试不同排除规则、协变量、变换、离群点处理或停止数据采集的时机,直到 p < .05 再停手并只报告“成功”的那条路。
  • HARKing(Hypothesizing After Results are Known):先看结果,再把事后编的故事写成“我们事先就预测了……”——把探索伪装成验证,读者会高估证据强度。
  • 发表偏倚(publication bias):显著、好看的结果更容易被投稿与录用;零结果与“无聊的稳健失败”沉入文件抽屉(file drawer)。文献里因此充斥胜利叙事。
  • 小样本 + 追逐显著:样本小时效应估计极不稳定;再叠加选择性报告,容易得到夸张、难重复的效应。
读“突破性发现”时的危险信号(示意清单)
信号可能意味着什么你可以怎么做
只报显著、不提尝试过的分析分叉选择性报告 / p-hacking 风险找预注册、补充材料、是否报告鲁棒性检验
效应大得惊人、样本却很小过拟合噪声、难重复问效应量与置信区间,等独立重复
故事完美到像剧本可能 HARKing区分探索与验证;看是否承认事后调整
媒体标题远超原文限定传播层夸大回到方法与限制段落,而不是新闻稿

这些做法往往不需要伪造数据:它们是在诚实的岔路口上,被激励结构推着选了“好看的那条”。对抗方式不是道德说教,而是改变规则:事先锁计划、事后开放过程。

3. 可重复性危机:不是“心理学完蛋了”,而是标准升级

2010 年代前后,心理学(及其他领域)密集出现:经典效应在新样本中变弱或消失;大型合作重复项目系统检验“教科书级”发现;方法学论文演示“几乎任何数据都能变得显著”。媒体常说“危机”,更准确的说法是:原有发表与激励系统低估了假阳性与效应膨胀。

重复失败有多种原因,不要一刀切:原效应本就不稳或过强;新研究把握度不足;情境、测量操作或样本不同导致真实异质性;或原分析含未公开的灵活选择。读重复研究时,问“失败的是效应本身,还是某一种操作?”

  • 直接重复(direct replication):尽量沿用原程序,检验效应是否再现。
  • 概念重复(conceptual replication):换操作/情境测同一理论主张——通过了有助于概括,失败了要分清是理论问题还是操作问题。
  • 可重复 vs 可复现(用语常混):教学上可记——用同一数据与代码能否再算出同样数字(computational reproducibility),与新数据能否得到相近结论(replication)是两层。
对待危机的成熟态度:既不把单次重复失败当成“某某领域已死”,也不把“发表于顶刊”当成免死金牌。知识靠累积与收敛,不靠一篇英雄论文。

4. 开放科学工具箱:预注册、开放材料、注册报告

开放科学(Open Science)把“可检验、可审查、可重复”做成默认基础设施,而不是靠个人自觉。Center for Open Science(COS)等推动的实践,正是为锁住研究者自由度、降低发表偏倚。
  • 预注册(preregistration):在看结果(最好在收数据)之前,把假设、样本量计划、排除规则、主分析写进带时间戳的公开或私密寄存(如 OSF)。探索性分析仍可做,但须标明是探索,不能事后改写成验证。
  • 开放数据与材料(open data / open materials):在伦理与隐私允许下分享可分析数据、问卷、刺激与代码,让他人复现计算、做稳健性检查与二次分析。
  • 注册报告(Registered Reports):期刊先审理论与方法,接受后无论结果是否显著都原则上给予发表通道——把发表决定从“好不好看”挪到“问得好不好、设计得硬不硬”,从根上削弱对显著结果的偏爱。
  • 透明报告:报告效应量、区间估计、把握度、偏离预注册的地方;区分验证与探索。

预注册不是魔力护身符:写得很松的预注册仍可留下大量自由度;但有预注册的验证声明,通常比“事后完美故事”更值得优先信任。

5. 读结果时:效应量与“显著”要一起看

Day 2–4 已分别谈过实验、相关与测量;这里只补可重复性语境下的读法:统计显著只说明“在当前模型与样本下,效应不太像纯噪声”,不说明效应大、重要或稳定。

小样本里一个“刚好显著”的大效应,常常是噪声彩票;大样本里一个显著但极小的效应,可能真实却无实践意义。读重复与元分析时,优先看效应量及其不确定性是否收缩、方向是否一致,而不是数有多少颗星。

面对“重磅发现”:先问有没有独立重复与预注册;再问效应有多大、区间有多宽;最后才问故事好不好听。

6. 日常决策清单:把开放科学变成阅读习惯

你不必成为方法学家,也能用六问过滤信息:

  1. 这是验证性结论,还是探索性发现被写成了定论?
  2. 有没有预注册或注册报告?主分析是否按计划?
  3. 样本与把握度是否配得上声称的强度?有无独立重复?
  4. 是否报告效应量/区间,而不只是 p 值?
  5. 数据、材料、代码是否可查(在伦理允许范围内)?
  6. 若用于人事、投放或产品决策:赌错的代价是什么?要不要等重复或先做小规模本地检验?

3经典研究与人物

假阳性心理学:研究者自由度有多大Joseph P. Simmons, Leif D. Nelson & Uri Simonsohn · 2011稳固

做了什么Simmons、Nelson 与 Simonsohn 在 Psychological Science 发表的方法学论文系统演示:在常见的灵活分析选择下,研究者即使面对不存在的效应,也能以很高概率得到“显著”结果,并据此提出披露与约束自由度的改革建议。

发现未加约束的分析灵活性会急剧抬高假阳性率;仅靠“我们没用欺诈”不足以保证结论可靠。事后可选路径越多,越需要预声明与透明报告。

证据说明该文作为对 p-hacking / 研究者自由度的经典警示,被广泛引用并推动后续开放科学实践;具体模拟设定会随软件与惯例变化,但其核心论证方向稳固。

心理学可重复性项目(Reproducibility Project: Psychology)Open Science Collaboration(Brian A. Nosek 等) · 2015稳固

做了什么大型国际合作尝试重复发表于高影响力心理学期刊的研究。结果发表于 Science:相当一部分原显著效应在重复中显著变弱或未能再现;重复效应量整体小于原报告。

发现单凭“已发表且显著”不足以保证效应稳健;系统性重复是压力测试。该项目把可重复性从口号变成可公开审视的数据。

证据说明作为大型合作重复努力本身,证据与影响稳固;对“重复率应如何解释、把握度与协议差异”等细节存在持续方法论讨论。本课取其核心教训:要重视独立重复与效应量,而不是把项目解读成“心理学整体作废”。

为何多数发表的研究发现可能为假John P. A. Ioannidis · 2005有争议

做了什么Ioannidis 在 PLOS Medicine 的短文用简单概率论证:当研究把握度低、灵活性高、偏倚强、且真实效应稀疏时,文献中“阳性发现”里假阳性的比例可以很高。该文跨学科引爆了对发表科学可靠性的讨论。

发现在不利的激励与设计条件下,“显著并发表”远不等于“大概为真”。优先设计高把握度、低偏倚、可重复的研究,比追逐单篇奇迹更重要。

证据说明文章影响力巨大,但其模型假设、适用范围与“多数为假”的定量措辞一直有争论与反驳。标为有争议:吸收其警示逻辑,勿把标题当宇宙定律。

超感官知觉?Bem(2011)作为可重复性讨论的警示案例Daryl J. Bem · 2011已被质疑

做了什么Bem 在 Journal of Personality and Social Psychology 报告了一系列似乎支持“预感/预知”的实验,方法写得很像常规社会认知研究。论文引发剧烈争议:若按相同灵活标准,非常规主张也能显得“显著”。随后的重复与讨论成为可重复性运动的催化剂之一。

发现当分析与报告标准过松时,连极强反直觉主张都可能过审;因此改革必须针对方法与激励,而不能只靠“常识否决”。

证据说明原主张未获可靠支持,重复与批评使其成为方法学警示案例,故标为已被质疑。引用目的是理解危机如何被点燃,而非传播超心理现象。

预注册、OSF 与开放科学基础设施Brian A. Nosek, Jeffrey R. Spies, Motyl 等;Center for Open Science · 2010 年代起稳固

做了什么Nosek 与同事推动将预注册、开放材料与开放数据做成可用平台(如 Open Science Framework),并倡导期刊采用徽章、注册报告等制度,降低“不透明的成功故事”的回报。

发现改变默认基础设施与发表规则,比单纯呼吁“大家诚实一点”更能约束自由度、提升可审查性。

证据说明开放科学实践的扩散与制度创新有大量文献与采用证据;具体徽章/政策的效果因期刊与领域而异。将“预注册与开放共享作为提高可信度的工具”标为稳固方向。

4人际中怎么用

沟通别把“一次灵验”写成对方的人设定论

某次冲突后你“看人很准”,很像一篇未预注册的小样本显著结果:故事完整,却可能是事后 HARKing。要谈模式,需要跨情境的重复观察;并允许“这一次不成立”的零结果进入档案,而不是只收藏印证偏见的记忆。

冲突吵架时的 p-hacking:只检索支持己方的情节

为赢而翻旧账时,人们会不停换“排除规则”(那次不算、那次有借口),直到对方“显著有罪”。更公平的做法接近预注册:先约定要讨论的具体事件与标准,再一起看证据;承认哪些是事后追加的解读。

信任信任开放过程,而非完美叙事

愿意说“我当时猜错了/这个印象重复失败了”的人,往往比永远自洽的人更可合作。亲密关系里的“开放科学”是:分享原始细节(在边界内)、区分猜测与已反复验证的模式,并给修正留通道。

5工作中怎么用

产品A/B 与增长实验:先锁指标与停采规则

若可以一边看后台一边决定“再多跑两天/再切个人群/换个成功指标”,你就在产品里做 p-hacking。实践:实验前写清主指标、最小样本或运行窗口、排除规则;探索性切片单独标记;重要结论等重复或分阶段验证再全量。

营销把“爆款洞察”降级为待重复的假设

一条消费者访谈或一次小样本测试得出的“用户其实都……”叙事,极易被讲成定论。对客户与团队汇报时区分:探索发现 vs 已预注册/已重复的验证;要求效应方向在新渠道或新人群是否再现,而不是只炫耀第一轮的显著。

管理绩效故事也会 HARKing

季度结束后再编“我们战略完全正确”的完美因果链,会掩盖噪声与幸运。更好的管理习惯:季度初写下可检验的预测与指标;季末对照预测,明确哪些是事后解释;奖励透明的失败与可学习的零结果,而不只奖励好看的仪表盘。

品牌品牌研究外包:问开放科学三问

供应商若只给“显著偏好”幻灯片:问是否预声明分析、原始题项与数据能否审计、效应量与不确定性如何、有无独立样本复核。品牌资产决策代价高,应优先买可审查的方法,而不是买最会讲故事的结论。

6考点速记

  • 可重复性 / 重复:独立再做,结论是否实质相近;直接重复 vs 概念重复。
  • 研究者自由度:分析与设计中可灵活选择的岔路;未加约束时抬高假阳性(Simmons, Nelson, Simonsohn, 2011)。
  • p-hacking:为显著而选择性尝试分析路径;HARKing:事后假说伪装成事先预测。
  • 发表偏倚 / 文件抽屉:显著好看结果更易发表,扭曲文献。
  • Open Science Collaboration(2015):大规模重复显示许多效应变弱或未再现——重视独立重复与效应量。
  • Ioannidis(2005):在低把握度、高灵活与偏倚下,阳性发现中假阳性可占高比例(解释有争议,取其警示)。
  • 预注册:事先锁定假设与分析;探索须标明。注册报告:先审方法,结果好坏原则上都给发表通道。
  • 开放数据 / 材料:在伦理允许下提高可复现与可审查性;COS / OSF 等基础设施。
  • 读结果:显著 ≠ 重要 ≠ 稳健;结合效应量、区间、重复与透明实践。

7自测 3 题

下列哪一项最接近 p-hacking 的定义?

  1. A. 伪造被试反应以得到显著结果
  2. B. 在多种分析选择中不断尝试,直到得到显著结果并主要报告该路径
  3. C. 预注册假设后再收集数据
  4. D. 报告效应量与置信区间
查看答案
答案:B
p-hacking 强调利用分析灵活性“挖”显著;A 是造假,性质不同;C、D 是对抗策略或良好报告,不是 p-hacking。

关于 Open Science Collaboration(2015)心理学可重复性项目,较稳妥的理解是?

  1. A. 证明心理学全部理论都已作废
  2. B. 显示许多已发表效应在重复中变弱或未再现,说明需重视独立重复与方法改革
  3. C. 证明只要 p < .05,效应就一定可重复
  4. D. 只与社会心理学有关,认知与发展领域无需关心
查看答案
答案:B
项目是压力测试与改革催化剂,不是全盘否定。A、C 极端错误;D 无依据——可重复性是跨领域议题。

注册报告(Registered Reports)最主要想削弱的问题是?

  1. A. 测量一定没有信度
  2. B. 期刊与作者对“显著、好看结果”的偏爱(发表偏倚)
  3. C. 随机分配无法实现
  4. D. 相关不能等于因果(仅此一点)
查看答案
答案:B
注册报告先审方法、结果好坏原则上都可发表,从而降低只追逐显著的激励。A、C、D 不是该格式的核心靶点。

8今日练习(约 20 分钟)

今天训练“降级突破叙事”:拆一条科学新闻或工作中的实验结论,并练习写迷你预注册。

8 分钟

拆一条“重磅发现”。找一篇心理学/行为科学新闻或公司内的实验汇报。写下:① 声称;② 是否像验证还是探索;③ 有无样本、效应量、重复或预注册线索;④ 若你是决策者,最多能据此做什么、不能做什么。

7 分钟

迷你预注册。选一个你下周可能做的小检验(产品文案、作息、沟通方式)。写:假设、主指标操作定义、样本/天数、排除规则、看到什么结果算支持。收数据前先发给自己或存档时间戳。

5 分钟

人际微练习。把一句“我就知道你会……”的事后聪明,改写成:事先我预测的是什么 → 实际观察到什么 → 哪些是事后追加解释。只改写,不要求当场对质。

9延伸阅读

  • False-Positive Psychology: Undisclosed Flexibility in Data Collection and Analysis Allows Presenting Anything as Significant Joseph P. Simmons, Leif D. Nelson & Uri Simonsohn · 2011 · 论文 · Psychological Science研究者自由度与假阳性的经典演示;读懂问题意识即可。
  • Estimating the reproducibility of psychological science Open Science Collaboration · 2015 · 论文 · Science大规模重复项目;关注设计思路、效应量比较与解释边界,避免只读媒体标题。
  • Why Most Published Research Findings Are False John P. A. Ioannidis · 2005 · 论文 · PLOS Medicine短小、影响大;结合批评意见读,取其概率直觉,勿神化标题。
  • Center for Open Science / Open Science Framework 文档与 Registered Reports 介绍 Center for Open Science(Brian A. Nosek 等推动) · 网站 / 规范说明了解预注册字段、开放徽章与注册报告流程;可与今日清单对照。

10间隔复习

间隔复习:自动从 Day N-1、N-3、N-7 中抽题。先凭记忆作答,再看答案。

MTMM 里“聚合”与“区分”各指什么?来自 Day 4 · 测量:操作化、信度与效度(1 天前)

查看答案
答案:聚合:同一特质不同方法应相关较高;区分:不同特质不应因方法相同而虚假高相关。
用以论证构念效度并发现方法偏差。

双盲设计中,“双”指的是哪两方不知道分组?来自 Day 2 · 实验设计:自变量、随机分配与混淆变量(3 天前)

查看答案
答案:参与者,以及直接接触参与者的主试/结果评定者(在完全双盲中双方均不知)。
目的是降低期望与暗示造成的系统偏差。
模块 0 · 科学思维2026-10-02约 40 分钟▶

Day 4 · 测量:操作化、信度与效度

心理学要谈证据,先问“你到底在测什么”:把抽象概念变成可观察指标叫操作化;测得稳叫信度,测得对叫效度——信度高不等于效度高,而测量误差会系统性扭曲人际判断与产品指标。

1一句话核心

心理学要谈证据,先问“你到底在测什么”:把抽象概念变成可观察指标叫操作化;测得稳叫信度,测得对叫效度——信度高不等于效度高,而测量误差会系统性扭曲人际判断与产品指标。

2概念讲解

1. 从昨天的“怎么读证据”,到今天的“证据本身靠不靠谱”

前三天分别练了:用证据看人、用实验谈因果、用相关/调查/观察做描述与预测。无论哪条路,报告里的数字都来自测量——问卷题、行为编码、反应时、完成率、NPS……

若尺子本身忽长忽短,或量的根本不是你以为的东西,再漂亮的 r、再精致的实验也会骗人。今天补上方法学底座:操作定义、信度、效度,以及“测得稳 ≠ 测得对”。

一句话对照:操作化回答“我用什么指标代表这个概念”;信度回答“我测得稳不稳”;效度回答“我测的是不是我想测的”。三者缺一,证据链就断。

2. 操作化:把“聪明、忠诚、敬业”变成可观察的规则

构念(construct)是理论中的抽象概念:智力、焦虑、品牌信任、心理安全感。科学不能停留在口头定义,必须给出操作定义(operational definition):在本研究中,用哪些可观察、可记录的程序与指标来代表该构念。

例如:“饥饿”可以操作化为禁食小时数或血糖水平;“攻击”可以操作化为对假想对象施加的噪音分贝;“用户参与”可以操作化为周活跃天数或核心功能完成次数——每一种选择都在说:我们把这个概念暂时等同于这些观测。

  • 同一构念,多种操作:抑郁可用症状量表、临床访谈、行为活动量等不同操作;结论应写清“在本操作下成立”,避免偷换成“抑郁的全部真相”。
  • 操作定义 ≠ 构念的全部:把智力等同于某次测验分数,是研究便利,不是哲学定论;好研究承认操作的片面性,并用多种方法收敛(见后文 MTMM)。
  • 坏操作的常见病:指标与构念错位(用加班时长代表“忠诚”)、双重问题、不可观察的内省黑话、或把公司口号直接当测量。
构念 → 操作:几个对照例子(示意,非唯一正确)
构念(抽象)一种可能的操作定义容易错成什么
工作敬业多题项敬业度量表 + 自愿加班外的可观察贡献行为仅用“是否点赞公司文案”或单题“你敬业吗”
关系满意度标准化关系满意度量表,或双方对具体事件的行为编码只问一次“你爱我吗”,或把送礼金额当爱
产品“好用”任务成功率、完成时间、错误率 + 标准化可用性量表只看五星好评或内部人员的主观感觉

昨天读相关时已问“变量如何测”;今天把那一问升级为固定习惯:看到任何主张,先索要操作定义。

3. 信度:反复量,结果稳不稳

信度(reliability)指测量在重复或等价条件下的一致性、稳定性。经典测验理论(classical test theory)的核心直觉是:观测分数 = 真分数 + 误差;误差越大,信度越低。

信度高,表示尺子本身比较稳;信度低,表示分数里噪音太大——相关会被压低或扭曲,实验的因变量也会“抖”,再聪明的设计也难看出效应。

  • 重测信度(test–retest):同一工具隔一段时间再测,两次分数是否一致?适合相对稳定的特质;若构念本身会变(情绪、状态),间隔与解释都要谨慎。
  • 内部一致性(internal consistency):同一量表内各题是否大致测同一方向?Cronbach(1951)提出的 系数 α(Cronbach’s alpha) 是最常见的摘要之一:题项越多、题间相关越高,α 往往越高——但也因此不能靠“堆题”伪装质量,更不能把 α 当成效度证明。
  • 评分者信度(inter-rater):两名以上编码者对同一行为的评分是否一致?观察法、面试打分、内容分析都依赖它;需要清晰操作定义、培训与一致性检查。
  • 平行测验 / 复本信度:两套等价题目结果是否一致(概念上了解即可)。

读报告时:若关键量表不报告任何信度证据,或题项极少却宣称精密测量,要降级信任。不必背具体“合格线”数字——领域与用途不同,阈值争议也多;先抓住“有没有一致性证据、误差是否被讨论”。

α 是内部一致性的常用指标,不是“测验神圣系数”。α 高只说明题项彼此较一致;它们可能一致地测错了东西。

4. 效度:你量到的,是不是你以为的那个东西

效度(validity)指测量是否真正反映目标构念、以及分数解释是否站得住。方法学上常把效度看成证据的积累与论证,而不是一次“盖章通过”。常见教学分类如下(名称在教材中略有出入,逻辑一致):
  • 表面效度(face validity):外行或被试一眼看去“好像在测这个”。它有助于接受度,但最弱:好看不等于测得对;有时为降社会赞许,题目故意不那么“表面像”。
  • 内容效度(content validity):题目/指标是否覆盖构念的关键内容域(常需专家判断与蓝图)。考“统计能力”却全是名词默写,内容效度就差。
  • 效标效度(criterion validity):分数能否预测或同时关联一个外在标准?同时效度(concurrent)看当下关联;预测效度(predictive)看未来表现(如测验能否预测日后工作绩效)。效标本身也必须合理,否则是“用一把糊涂尺子校准另一把”。
  • 构念效度(construct validity):整体上,分数是否按理论行事——与相关构念该高相关的高相关(聚合),与不该相关的低相关(区分),实验操纵能否按预期改变分数等。
低信度(又散又偏) 高信度低效度(稳,但打偏) 靶心=构念真值;点=每次测量。散=低信度;聚在错误位置=高信度低效度
教学常用靶心比喻:点子分散是信度问题;点子紧紧扎在错误位置,是“稳稳地测错了”——效度问题。

Day 2 的内部/外部效度谈的是研究设计(因果与推广);今天的测量效度谈的是指标本身。两者都会出现“效度”一词,别混:一个问“结论能否归因/推广”,一个问“分数是否代表构念”。

5. 关键句:信度高 ≠ 效度高

可以有一把非常稳定却量错部位的尺子:每天用同一错误方式称“智商”,分数会很一致,却仍无效。也可以有表面好看、内部一致,却与任何外在效标无关的量表。

逻辑关系近似:信度是效度的必要非充分条件——若误差淹没一切,很难谈有效解释;但高信度只说明“稳”,不保证“对”。实践上:先保证基本可用的一致性,再积累效度证据;不要只报一个漂亮的 α 就宣布“科学量表”。

广告式话术“本测评信度高达……”若不同时给出效度论证(测什么、与何效标相关、与何构念区分),把它当成营销,而不是结论。

6. 多特质多方法:用“汇合与区分”检验构念效度

Campbell 与 Fiske(1959)提出多特质–多方法矩阵(multitrait–multimethod matrix, MTMM):用至少两种方法测至少两种特质,看相关模式是否符合理论。

核心直觉:同一特质用不同方法测量,相关应较高(聚合效度,convergent);不同特质即便用同一方法,相关也不应高到可疑(区分效度,discriminant)——否则你可能只是在测“用问卷答题的共同方法偏差”,而不是特质本身。

  • 共同方法偏差:全靠同一种自陈问卷测所有变量,相关可能被“答题风格”抬高——昨天的社会赞许性是其亲戚。
  • 实践含义:重要构念尽量多方法(自陈 + 行为 + 他评 + 客观记录);重要结论看是否经得起方法替换。

你不必亲手做完整 MTMM 表,但要会问:这个“用户忠诚”是只有问卷,还是也有复购与流失行为?这个“共情”是自吹,还是也有他评与情境行为?

7. 测量误差如何搞砸人际判断与产品指标

误差不只是统计附录,它会进入决策:

  • 人际:用一次情绪化对话“测量”对方人品,重测信度极低;用单一渠道(只看朋友圈)操作“忠诚”,效度可疑。稳定判断需要多次、多样本的行为,而不是一次印象的高自信。
  • 管理与评价:面试官间不一致(评分者信度低)会让录用变成噪声;若绩效标准与战略无关(效标/构念错位),系统会稳定地奖励错误行为。
  • 产品与营销:把五星好评操作成“产品质量”,可能混进价格敏感与礼品诱导;仪表盘指标若与真实用户价值只有弱效标关联,优化指标等于优化错东西(Goodhart 式风险:指标一变目标,指标就失效)。
  • 与昨天的衔接:不可靠的测量会压低或扭曲相关;无效的测量会让你预测一个幻影。先修尺子,再谈模式与因果。

8. 读任何“测评/指标”的检查清单

把下面六问当成肌肉记忆:

  1. 构念是什么?操作定义写清了吗?
  2. 有没有信度证据(重测、内部一致、评分者)?误差被讨论了吗?
  3. 效度证据是什么——内容覆盖、效标关联、构念的聚合/区分?
  4. 是否只有表面效度或“专家拍胸脯”?
  5. 是否全靠单一方法(尤其单一自陈)?共同方法偏差有多大?
  6. 若用于人事/产品决策:误测的代价是什么?指标会不会被博弈?

3经典研究与人物

系数 α:内部一致性的经典摘要Lee J. Cronbach · 1951稳固

做了什么Cronbach 在 Psychometrika 发表的论文系统阐述了系数 α,作为估计测验内部一致性的通用框架,承接并推广了此前关于折半信度与题间相关的工作。α 随后成为心理与教育测量报告中最常见的信度指标之一。

发现在经典测验理论假设下,α 可概括题项一致性;题项更互相关、更同质时,α 倾向更高。它帮助研究者量化“分数里有多少可重复的信号”。

证据说明α 作为“常用内部一致性指标”的历史地位稳固;但当代心理计量学对其前提(如题项本质平行、τ 等价)、被误用为效度证据、以及“越高越好”的迷思多有批评与替代(如 ω)。本课把它当概念工具,不背绝对阈值,不把它神化为效度证明。

多特质–多方法矩阵(MTMM)Donald T. Campbell & Donald W. Fiske · 1959稳固

做了什么Campbell 与 Fiske 在 Psychological Bulletin 提出:构念效度应通过系统比较“不同方法测同一特质”与“同一方法测不同特质”的相关模式来检验,即多特质–多方法矩阵。

发现聚合效度与区分效度应同时成立;若异质特质在同一方法下相关奇高,可能暴露方法偏差而非特质结构。该思路重塑了后续构念效度论证的标准。

证据说明MTMM 作为构念效度的方法论框架被广泛接受且影响深远;完整矩阵在应用中常因设计成本而简化,统计建模也有更新发展(如 CFA-MTMM)。框架本身标为稳固;具体某量表是否“通过 MTMM”需看个别研究。

经典测验理论:观测分 = 真分数 + 误差Charles Spearman 等奠基;后续心理计量学教科书系统化 · 20 世纪上半叶起稳固

做了什么经典测验理论(CTT)把一次观测分数理解为稳定的真分数成分与随机误差成分之和,并在此基础上定义信度(真分数方差占总方差的比例等表述)。它为重测、平行测验与内部一致性估计提供了共同语言。

发现测量必然含误差;提高题量(在一定条件下)、改进题目与标准化施测,可提高信度。没有误差为零的现实测验。

证据说明CTT 的教学核心稳固,仍是导论与许多应用的基础;项目反应理论(IRT)等对题项与能力的建模更细,在大型测验中常用。二者是工具层级扩展,而非“CTT 已被推翻”。本课用 CTT 直觉服务信效度判断。

构念效度概念的系统化Lee J. Cronbach & Paul E. Meehl · 1955稳固

做了什么Cronbach 与 Meehl 的经典论文论证:当缺乏单一黄金效标时,必须通过理论网络中的假设检验(构念网络)来论证分数解释的合法性——即构念效度。

发现效度不是测验的固定属性标签,而是对“分数解释与用途”的论证;需要相关、实验与理论预测等多类证据。

证据说明该文是现代效度观的里程碑,影响持续至今;后来正式标准(如 AERA/APA/NCME 教育与心理测验标准)进一步强调效度是对解释与用途的整体论证。细节术语随标准修订有演化,核心方向稳固。

4人际中怎么用

印象与归因一次情绪样本,信度太低,别当做人品总分

对方加班后语气差,是一次“状态测量”,重测可能完全不同。要谈模式,需要多个情境、一段时间的样本;要把“语气差”操作成可观察行为(打断、摔门、侮辱性用词),而不是直接跳到“性格恶劣”这个高推断构念。

倾听与提问把模糊指责改成可操作的描述

“你不在乎我”无法验证;“我约好的事有三次你未提前说明就迟到”可以共同核对。好的亲密沟通很像提高测量效度:降低抽象标签,增加具体指标,并允许对方提供其他方法的数据(他的压力、遗忘、不同优先级)。

冲突别用“高一致的偏见”当真理

你每次都能“稳定地”从对方手机亮屏读出背叛——这是高信度低效度的靶心:稳,但可能打在焦虑与解释偏差上。主动找区分证据:哪些行为按你的理论不该出现?有没有非嫉妒的替代解释?邀请第三方可观察事实,而不是只重复同一叙事。

5工作中怎么用

产品先写清指标的操作定义,再开优化大会

“提升参与度”若未操作化,设计、运营、数据三方会优化三个不同东西。写明:分子分母、时间窗、是否含僵尸行为;并另设效标(留存、任务成功、收入)做效标效度检查。否则仪表盘很稳(每天都能算),却可能稳定地指向错误目标。

营销品牌追踪:α 再漂亮,也要问测的是不是品牌资产

一串李克特题内部很一致,可能只是一致地测了“愿意给你好评的心情”或题目雷同。要看是否预测选择、溢价、流失(效标),是否与质量感知、独特性等理论维度该分则分(区分)。对客户汇报时,把“量表可靠”和“构念有效”分开讲。

管理绩效与面试:评分者信度是公平的前提

同一份简历两位面试官分差巨大,系统就在抽噪声。用结构化题目、行为锚点评分表、培训与双评,是在提高评分者信度;再检查这些分数是否真能预测入职后绩效(预测效度),避免“稳稳地录用会答题的人”。

品牌警惕“高信度的虚荣指标”

曝光、点赞、问卷喜爱度可以很稳定、很好看,却与购买或长期信任弱相关——典型的高信度、效标效度不足。品牌决策应要求:指标与商业/品牌效标的关联证据,以及是否可用行为与财务结果交叉验证(多方法)。

6考点速记

  • 操作定义:在研究中用可观察程序/指标代表抽象构念;同一构念可有多种操作,结论受操作约束。
  • 信度:测量的一致性/稳定性;观测分含真分数与误差(经典测验理论直觉)。类型含重测、内部一致性、评分者等。
  • Cronbach’s α:常用的内部一致性估计(Cronbach, 1951);α 高 ≠ 效度高;勿把 α 当构念证明。
  • 效度:分数是否反映目标构念及解释是否正当。常见:表面、内容、效标(同时/预测)、构念(含聚合与区分)。
  • 信度 vs 效度:信度高是效度的必要非充分条件;可稳稳地测错。
  • Campbell & Fiske(1959)MTMM:用多特质多方法相关模式检验聚合效度与区分效度,警惕共同方法偏差。
  • Cronbach & Meehl(1955):构念效度——通过理论网络中的证据论证分数解释。
  • 区分:测量效度(指标是否代表构念)vs Day 2 的内部/外部效度(设计的因果与推广)。

7自测 3 题

某公司用“每周自愿转发公司海报次数”作为“员工忠诚”的唯一指标,内部统计非常稳定。最准确的批评是?

  1. A. 稳定就说明一定有效,无需其他证据
  2. B. 可能信度尚可,但操作化与构念错位,效度可疑(高信度 ≠ 高效度)
  3. C. 只有重测信度才算信度,内部稳定无效
  4. D. 忠诚无法操作定义,因此任何指标都无意义
查看答案
答案:B
分数可以很稳,却在测服从宣传或空闲时间,而非忠诚。A 把信度误当成效度;C 错误——稳定性也可来自其他信度思路;D 过度——构念可以操作化,但要论证是否恰当。

关于 Cronbach’s α,下列哪一项正确?

  1. A. α 高证明量表测到了正确的理论构念
  2. B. α 是内部一致性的常用估计,不自动等于效度证据
  3. C. α 只用于实验的因变量,不用于问卷
  4. D. α < 0.95 的量表必须废弃
查看答案
答案:B
α 概括题项一致性;效度需要内容、效标、构念等另类证据。A 是最常见误用;C 错误;D 编造绝对规则且忽略领域差异与“堆题抬 α”问题。

Campbell 与 Fiske 的多特质多方法矩阵,主要用来帮助论证什么?

  1. A. 随机分配是否成功
  2. B. 构念效度中的聚合与区分,并暴露方法偏差
  3. C. 双盲是否被打破
  4. D. 样本量是否足够做相关
查看答案
答案:B
MTMM 看同一特质跨方法是否汇合、不同特质是否可区分。A、C 属实验程序;D 是统计效力问题,不是 MTMM 的核心目的。

8今日练习(约 20 分钟)

今天训练“先审尺子”:给一个抽象词写操作定义,并拆一条测评/指标主张的信效度。

8 分钟

操作化练习。选一个你常挂在嘴边的词(如“懂我”“专业”“用户喜欢”)。写出:① 一句话构念含义;② 至少两种不同的操作定义(最好一种自陈、一种行为);③ 每种操作可能测错成什么。

7 分钟

拆一条测评或 KPI。找公司问卷、星座/性格测试广告、或产品仪表盘指标。回答:信度线索有吗?效度证据是表面、效标还是构念?是否可能高信度低效度?若你是决策者,最多能用它做什么?

5 分钟

人际微练习。把一句最近的埋怨(“你从不支持我”)改写成可观察、可核对的操作化描述 + 一个你愿意收集的“另一种方法”证据(如具体事件记录,而非只凭感觉总分)。

9延伸阅读

  • Coefficient alpha and the internal structure of tests Lee J. Cronbach · 1951 · 论文 · Psychometrikaα 的经典来源;导论阶段理解其目的与误用边界即可,不必陷于推导。
  • Convergent and discriminant validation by the multitrait-multimethod matrix Donald T. Campbell & Donald W. Fiske · 1959 · 论文 · Psychological BulletinMTMM 与聚合/区分效度的原始表述,构念效度方法学必读文献之一。
  • Construct validity in psychological tests Lee J. Cronbach & Paul E. Meehl · 1955 · 论文 · Psychological Bulletin构念效度与“构念网络”论证的奠基文献。
  • 任何一本心理测量/心理统计导论中“信度与效度”章节 (如经典测验理论教材或 Cohen / Gravetter 等方法测量章节) · 教材章节与考试大纲对照:重测、内部一致性、效标与构念效度术语;选你正在用的教材即可。

10间隔复习

间隔复习:自动从 Day N-1、N-3、N-7 中抽题。先凭记忆作答,再看答案。

Pearson’s r 接近 0,是否一定表示两变量毫无关系?来自 Day 3 · 相关、调查与观察:非实验证据怎么读(1 天前)

查看答案
答案:不一定。可能只是没有线性关系,仍可能存在非线性关系;需看散点图等方法。
r 概括的是线性共变。

以下哪一个说法最难被证伪?来自 Day 1 · 心理学凭什么算科学:用证据看人(3 天前)

  1. A. 前一晚睡眠少于 5 小时的人,第二天工作记忆测验得分会更低
  2. B. 每个人内心深处都有未被意识到的冲突,它会以各种方式表现在行为中
  3. C. 当有旁人在场时,人们主动帮助陌生人的可能性会降低
  4. D. 使用结构化面试的公司,新员工一年后的绩效评分更高
查看答案
答案:B
A、C、D 都说明了可测量的变量和预期方向,结果可能与预测相反,因此可以被检验和推翻。B 中“各种方式表现”意味着任何行为都可以被解释为支持它,没有任何观察能证明它错,所以最难证伪。
模块 0 · 科学思维2026-10-01约 40 分钟▶

Day 3 · 相关、调查与观察:非实验证据怎么读

大多数关于人的证据并不是实验:调查、观察与相关研究能描述与预测,但读它们时要先问抽样是否偏、回答是否装、相关有多强——以及第三变量与方向性会不会把因果故事讲错。

1一句话核心

大多数关于人的证据并不是实验:调查、观察与相关研究能描述与预测,但读它们时要先问抽样是否偏、回答是否装、相关有多强——以及第三变量与方向性会不会把因果故事讲错。

2概念讲解

1. 昨天实验能回答因果;今天回到“不能操纵时怎么办”

昨天的主线是:要推断“是 A 导致了 B”,关键是操纵自变量、随机分配,以及控制混淆与期望。可现实里大量问题不能或不该做实验——童年创伤、人格特质、收入、依恋风格、文化规范,你无法也不应随机分配。

今天专门读非实验证据:描述性研究、相关研究、问卷调查与行为观察。它们不是“低配实验”,而是另一套工具。读得好,能做预测、找模式、提出可检验的假设;读得差,就会把相关当成因果、把方便样本当成全国、把“大家都这么答”当成真相。

与昨天对照一句话:实验问“我改了什么,结果变了吗?”;相关/调查/观察问“世界里本来怎样一起变化?我能不能可靠地描述与预测?”——后者通常不直接给你因果。

2. 描述 vs 相关:先分清你在回答哪类问题

描述性研究(descriptive research)回答“是什么、有多少、长什么样”:某人群的平均睡眠时长、某症状的患病率、某行为在自然情境中出现的频率。它不声称变量之间的因果,甚至不一定强调变量之间的关联。相关研究(correlational research)回答“两个(或多个)变量是否一起变化、方向如何、强度如何”。研究者测量已存在的变量,不操纵它们。相关可以是正的(一起升高)、负的(一个升一个降),或接近零(几乎不一起变)。

两者常叠在一起:一次大型调查既可描述“加班有多普遍”,也可报告“加班时长与倦怠得分的相关”。读报告时先看作者声称的是描述、相关,还是偷偷滑向了因果。

三类常见非实验路径(实用对照)
研究者主要做什么擅长回答典型陷阱
描述系统测量频率、均值、分布现状画像样本偏了仍说“大家都……”
相关同时测量多个变量,看共变关联与预测把 r 讲成“导致”
观察在自然或结构化情境中记录行为真实情境中的行为模式观察者偏差、被观察改变行为

3. 问卷调查:问什么、问谁、怎么答都会歪

问卷与量表是心理学和社会科学最常用的工具之一:便宜、可规模化、适合测态度、信念与自我报告的经历。但“发了问卷”不等于“得到了真相”。至少盯住三件事:抽样、题目与计分、回答偏差。

  • 抽样(sampling):你测到的是谁?方便样本(班级、粉丝群、扫码有礼)只能代表愿意填的人。随机抽样才更服务代表性(昨天提过:它服务外部效度,不等于随机分配)。非概率样本仍可用于探索与预测模型,但推广话术要降级。
  • 响应率与无应答偏差:没填的人可能系统不同(更忙、更回避、更不满)。高响应率不能自动证明无偏,但极低响应率时要怀疑“谁愿意说话”。
  • 题目措辞与量表质量:引导性措辞、双重问题(一句里问两件事)、选项不对称,都会推高某种答案。正式量表通常报告信度(如内部一致性)与效度证据;自编三道题就宣称测到了“抑郁”或“忠诚度”,要警惕。
  • 社会赞许性(social desirability):人们倾向于以显得好、合规范的方式作答——少报偏见与不良行为,多报捐赠、运动、公正。Crowne 与 Marlowe 发展的社会赞许性量表,正是用来估计这种倾向有多强(见研究卡片)。
  • 其他常见回答偏差:默许偏差(爱选“同意”)、极端作答或一律中间、回忆偏差、当下情绪污染回顾。

实用读法:看到“调查显示 X% 的人认为……”时,先问——样本是谁?怎么抽的?题目怎么问的?有没有可能大家在“表演正确答案”?

自陈报告不是垃圾:许多构念(主观幸福感、疼痛、态度)本就依赖自我报告。关键是把测量误差与偏差当作设计问题来处理——多题项、匿名、行为指标交叉验证、降低敏感题的威胁感——而不是假装问卷等于客观真相。

4. 观察法:看行为,不只听说法

人们说的和做的常不一致。因此研究者也会观察行为:

  • 自然观察(naturalistic observation):在尽量不打扰的日常情境中记录(如操场互动、商店排队)。生态真实性高,但情境杂、难控制,且难以推断因果。
  • 结构化观察(structured observation):在标准情境或实验室中设置可比任务(如陌生情境程序观察依恋行为),便于编码与比较,但人工痕迹更重。
  • 参与观察:观察者进入群体内部;能获得深度,也更容易带入主观卷入与伦理风险。

观察法的两大经典威胁:观察者偏差(编码者按预期去“看见”行为;可用详细编码手册、多名编码者与一致性检验缓解);以及反应性(知道被观察而改变行为,即霍桑式被关注)。录像事后编码、隐蔽或习惯化观察、明确的行为操作定义,都是常见防护。

5. 相关系数 r:方向、强度,以及它不是什么

皮尔逊积差相关(Pearson’s r,由 Karl Pearson 在 19–20 世纪之交系统发展;更早 Galton 等人已有相关思想)是最常见的线性相关指标,取值大约在 −1 到 +1:

  • 符号表示方向:正值 = 同向共变;负值 = 反向共变。
  • 绝对值表示强度:越接近 1,点越贴近一条直线;接近 0 则线性共变很弱。
  • r 描述的是线性关系。若真实关系是 U 形等非线性,r 可能接近 0,并不代表“毫无关系”。此时需看散点图或改用其他方法。
  • 当变量是等级(名次)而非等距分数时,常用 Spearman 等级相关等替代指标;逻辑类似,仍是“共变有多强”,不是因果。
正强相关 负相关 接近零(线性) r 的符号看方向,绝对值看线性强度;先看散点,再信系数
同一“有相关”的口头说法,背后可能是完全不同的散点形态——读报告时尽量找图,而不只找一个数字。
读到一个 r 时,至少问这五句
问题为什么问
散点图长什么样?有无非线性、异常点、亚组混在一起
样本是谁、N 是否过小?小样本的 r 很不稳定;极端群体会扭曲
测量是否可靠?不可靠的量表会压低或扭曲相关
有没有第三变量候选?年龄、社会经济地位、季节、共同方法偏差等
作者有没有把相关写成因果?“导致”“提升”“因为”需要实验或更强设计支撑

教科书里常用口语标尺帮助直觉(如 |r| 约 0.1 / 0.3 / 0.5 对应小/中/大),但这只是粗参照,且因领域而异;效应是否“重要”还取决于后果、基线与决策成本。不要背一个绝对分界当成真理。

更关键的禁令:r ≠ 因果。再大的相关,单独都不能证明“A 导致 B”。

6. 为什么相关推不出因果:方向性与第三变量

Day 1 已点过两道坎,今天把它们变成读报告的固定动作:

  • 方向性问题(directionality):A 与 B 相关,可能是 A→B,也可能是 B→A,或互为反馈。例如“孤独感与刷手机时长相关”——究竟是孤独导致多刷,还是多刷挤掉当面社交后更孤独,或两者循环?单凭同时测得的相关,分不开。
  • 第三变量问题(third-variable problem):未测的 C 同时推高(或压低)A 与 B,造成 A–B 的虚假相关(spurious correlation)。教科书经典例子:冰淇淋销量与犯罪率常一起升高——更合理的共同驱动往往是天气炎热(以及人们出门更多等伴随因素),而不是“冰淇淋导致犯罪”。
  • 选择与限制范围:只在极端群体里抽样、或把不同子群糊成一团,都会制造或抹掉相关。

纵向追踪(谁先变化)、统计上控制候选第三变量、工具变量与自然实验、以及——在伦理允许时——回到昨天的真实验,都是减轻这些威胁的路径。没有银弹;每多挡掉一种替代解释,因果主张才能升一级。

媒体标题翻译器:把“X 与 Y 有关”默认读成“X 与 Y 共变”;只有当文中真正具备操纵/随机分配或非常强的因果识别策略时,才允许自己在心里加上“导致”。

7. 非实验证据何时仍然非常有用

若相关“不能直接给因果”,为什么还要大规模做调查与观察?因为它们在这些任务上往往不可替代:

  • 预测:招聘、信贷风险、流失预警、流行病学筛查——目标常常是“准不准”,不一定是当场证明机制。相关与回归可以是好的预测工具(仍要外部验证,防过拟合)。
  • 伦理与可行性:不能为了研究去随机分配创伤、歧视或贫困;描述与相关是负责任的起点。
  • 生态效度与真实世界基线:实验室很干净,但政策与产品要知道田间地头实际分布;大型调查与自然观察提供地图。
  • 生成假设:相关模式提示“该去做哪个实验、该控制哪个第三变量”。
  • 收敛证据:当实验、纵向、准实验与相关指向同一机制,信念可以强于单一方法。

斯坦诺维奇在《这才是心理学》中反复强调:公众常把“相关不是因果”听成“相关无用”。更准确的态度是——相关是线索与预测器,不是因果证明书;价值取决于你用它回答什么问题。

8. 把整条链串起来:读非实验报告的检查清单

下次刷到调查、白皮书、或“大数据发现”时,按顺序问:

  1. 这是描述、相关,还是作者在暗示因果?
  2. 样本是谁?抽样方式与响应率如何?能推广到哪一群人?
  3. 变量如何操作定义?自陈、行为观察,还是客观记录?有无社会赞许与共同方法偏差?
  4. 若给了 r 或“显著相关”:方向、大致强度、是否展示散点或稳健性?
  5. 方向性与第三变量的替代解释是什么?作者有没有诚实讨论?
  6. 若用于决策:目标是预测还是解释机制?证据层级是否匹配决策代价?

3经典研究与人物

社会赞许性量表(Marlowe–Crowne Social Desirability Scale)Douglas P. Crowne & David Marlowe · 1960稳固

做了什么Crowne 与 Marlowe 编制了一套描述“过于美好、却不大可能全真”的条目(例如极少有过负面冲动、几乎总按规范行事),用以估计个体在自陈测验中迎合社会期望的倾向。后续衍生了多种社会赞许性/印象管理量表。

发现社会赞许性倾向会系统抬高“光彩”回答、压低敏感负面回答;在评估偏见、健康行为、品德与依从时,若不加考虑,相关与均值都可能被扭曲。

证据说明“人们会按赞许方式作答”已成为问卷方法学的基本共识;具体量表的结构(如印象管理 vs 自欺)与效标关联仍有理论争论,但威胁本身稳固。实践上:匿名、措辞去威胁、加入测谎/赞许性量表、或以行为与他评交叉验证。

虚假相关的教科书原型:冰淇淋、犯罪与天气方法学教学中的经典示例(多本导论与 Stanovich 等读物沿用) · 长期教学传统稳固

做了什么在许多城市的时间序列里,冰淇淋销量与某些犯罪或暴力事件计数会在夏季一起升高。若只看两者相关,容易编出“甜食导致攻击”的故事。

发现更合理的解释是第三变量(如高温、户外活动增加、社交机会变化等)同时推高两者;相关是真的共变,因果故事却是假的。

证据说明该例的教学功能是稳固的:演示“显著相关 ≠ 机制正确”。真实犯罪学中气温与攻击的关联本身也有研究文献,机制复杂(生理唤醒、社交机会、酒精等),不能简化成单一漫画因果;本课用它锚定第三变量思维,而非提供犯罪学结论。

相关观念的统计史:从 Galton 到 PearsonFrancis Galton;Karl Pearson · 1880s–1900s稳固

做了什么Galton 在研究遗传与回归到均值等现象时发展了相关与回归的直觉与图示;Karl Pearson 将积差相关系数等形式化,使之成为可计算、可比较的标准统计量。

发现相关成为描述共变的通用语言,使心理学与社会科学能在不做实验时仍量化“一起变化的程度”——同时也把“如何解释相关”永久写进方法学议程。

证据说明历史归因应谨慎:相关思想有多人贡献,Pearson 的 r 是最流行的线性形式之一而非唯一。统计工具的“稳固”不等于任何一次具体相关发现的稳固;工具正确,解释仍可能错。

自陈与行为不一致:态度–行为差距的研究传统如 Richard LaPiere(1934)及后续态度–行为一致性文献 · 1934有争议

做了什么LaPiere 与一对华人夫妻旅行美国,几乎所有旅馆与餐厅都接待了他们;事后写信询问“是否接待华人顾客”时,大量书面回复却表示不会接待。该演示常被用来说明问卷态度与实际行为可能脱节。

发现自我报告的态度/意向,并不总能很好地预测即时情境中的行为;情境压力、规范与测量方式都会造成差距。

证据说明LaPiere 研究在抽样、测量对应性(写信的人是否即接待者)等方面受到方法批评,不宜当作唯一铁证。但“态度–行为一致性有条件、自陈需谨慎”的更大文献方向得到大量后续支持;故标为有争议的经典案例 + 稳妥的方法学教训。

4人际中怎么用

倾听与判断别把“他总这样”当成已证实的因果

你观察到伴侣一加班就易怒,相关可能是真的;但方向可能是压力→易怒,也可能是未说出口的关系不满让人更想躲在加班里,还可能有睡眠、咖啡因等第三变量。沟通时先描述共变(“我注意到加班那天我们更容易吵”),再一起找可检验的解释,而不是直接宣判“你就是因为工作不爱我”。

提问方式你的问题可能在“社会赞许”对方

问“你是不是觉得我不重要?”或“你怎么又这样?”会把对方推进防御与正确表演。改成具体、低威胁的描述性问题(“昨晚我提计划时,你当时在忙什么?”“怎样说你会比较容易接住?”),更接近好问卷设计:降低赞许压力,增加可观察信息。

冲突用观察补自陈:看重复行为,不只听一次保证

道歉与承诺是自陈;是否改掉打断、是否准时、是否分担家务是行为。可以约定一个短观察窗(如两周)和可操作的行为标准,再回顾——这是生活里的“结构化观察”,比反复追问“你到底在不在乎”更少空想。

5工作中怎么用

营销NPS/满意度相关很高,也不等于“改分就增购”

用户满意度与复购常呈正相关,但可能是产品质量、价格或品类惯性等第三变量在驱动。优化问卷分数(话术、礼品诱导好评)可能抬高 r 左侧的分数,却不改变真实行为。决策时把满意度当预警与预测指标,机制结论仍要靠实验或因果识别。

产品问卷说“想要”,行为说“不用”:交叉验证

功能投票与访谈充满社会赞许与假想偏好(“我当然关心隐私/无障碍/学习功能”)。上线前用原型行为数据、等待列表真实转化、A/B 与漏斗观察交叉验证;把自陈当假设生成器,把行为当更硬的因变量。

管理敬业度调查:先查抽样与匿名,再开大会

若只有自愿填、或主管能看到谁填了什么,分数会被赞许性与恐惧扭曲。先保证匿名与覆盖,区分“描述现状”与“归因到某领导”;行动项尽量落到可观察行为(会议长度、反馈频次),并用前后测或对照团队评估,而不是把一次相关当罪状。

品牌把“相关洞察”写成因果口号前,降级语言

数据说“提及可持续的消费者与高花费相关”,广告若写成“讲可持续就会卖得更好”,已偷渡因果。对内可用相关做细分与预测;对外主张若暗示干预有效,需要实验或至少准实验证据,否则诚实写成共现洞察。

6考点速记

  • 描述性研究:刻画现状(频率、均值、分布);相关研究:刻画共变(方向与强度);二者通常不直接推断因果。
  • 问卷调查威胁:抽样偏差、无应答、措辞与量表质量、社会赞许性、默许/极端作答、回忆偏差。
  • 社会赞许性:按合规范、讨喜的方式作答的倾向;Crowne & Marlowe(1960)等量表用于估计该倾向。
  • 观察法:自然观察生态好、控制弱;结构化观察可比性高、人工痕迹重;威胁含观察者偏差与反应性。
  • Pearson’s r:约 −1 到 +1;符号=方向,绝对值≈线性强度;非因果;非线性时 r 可能误导——先看散点图。
  • 方向性问题:A↔B 谁因谁果分不清;第三变量问题:C 造成 A–B 虚假相关(如冰淇淋–犯罪–炎热)。
  • 非实验证据的用途:预测、伦理上不可操纵的课题、生态基线、生成假设、与实验收敛;“相关不是因果”≠“相关无用”。
  • 对比实验(Day 2):随机分配与操纵服务因果/内部效度;相关与调查无操纵时,因果话术必须降级。

7自测 3 题

一项调查发现:员工远程办公天数与自评幸福感正相关。公司宣布“强制多在家办公以提升幸福”。最核心的方法问题是?

  1. A. 相关系数不可能为正
  2. B. 相关不能直接证明因果,可能存在方向性或第三变量(如岗位类型、自律、家务负担)
  3. C. 只有实验研究才允许使用问卷
  4. D. 幸福感无法操作定义,因此相关无意义
查看答案
答案:B
正相关可以真实存在,但不能单独支持“增加远程天数导致幸福”。可能是更幸福/更适合的人选择远程,或第三变量同时影响两者。A 错误;C 错误;D 过度——幸福感可用量表操作定义,问题在因果解释而非完全不可测。

关于 Pearson’s r,下列哪一项正确?

  1. A. r = 0 证明两个变量在任何意义上都没有关系
  2. B. r 的绝对值越大,越能证明因果关系越强
  3. C. r 主要描述线性共变的方向与强度,不证明因果;非线性关系可能使 r 接近 0
  4. D. 只有 r > 0.8 的结果才可以发表
查看答案
答案:C
r 是线性相关的摘要;U 形等关系可使 r≈0。相关强度≠因果强度。发表也没有 r>0.8 的规则。

Crowne 与 Marlowe 的社会赞许性量表,主要帮助研究者警惕什么?

  1. A. 随机分配失败
  2. B. 自陈回答被“装好/合规范”倾向扭曲
  3. C. 双盲被打破
  4. D. 外部效度必然为零
查看答案
答案:B
社会赞许性是问卷回答偏差的核心来源之一。A、C 属于实验设计问题;D 夸大且与该量表无关。

8今日练习(约 20 分钟)

今天训练“读非实验证据”:拆一条相关/调查主张,并设计一个低威胁的小观察。

8 分钟

拆解一条调查或相关新闻/报告。写出:① 描述还是相关还是因果口吻?② 样本与抽样?③ 变量如何测(自陈/行为)?④ 若有相关,可能的方向性与至少一个第三变量?⑤ 若你是决策者,最多能据此做什么(预测/探索/暂缓)?

7 分钟

改写一个高赞许性的问题。把“你是否是个公平的人?”改成 2–3 个更具体、可观察或更低威胁的问题(或情境选择题)。想一想:怎样问,对方更不必表演正确答案?

5 分钟

微型结构化观察。选一个关系或工作中的摩擦点,定义一个可观察行为(如“打断对方的次数”),规定 1 次 20 分钟对话的观察规则(谁记录、如何计数)。先只描述频率,不急着归因。

9延伸阅读

  • 《这才是心理学》(How to Think Straight About Psychology)中论相关、调查与“相关不是因果”的章节 Keith E. Stanovich · 书 · 延续 Day 1–2用可读的例子巩固虚假相关、预测用途与公众误解;本课多处与其对齐。
  • A new scale of social desirability independent of psychopathology Douglas P. Crowne & David Marlowe · 1960 · 论文 · Journal of Consulting PsychologyMarlowe–Crowne 社会赞许性量表的经典来源文献。
  • Attitudes vs. Actions Richard T. LaPiere · 1934 · 论文 · Social Forces态度–行为差距的早期经典;阅读时一并了解后续方法批评与更现代的态度–行为研究。
  • 《心理测量与评估》或任何一本导论教材中“相关、信度与调查法”章节 (教材通识,如 Cohen / Gravetter 等方法统计导论) · 教材章节用于把 r、散点图、抽样与信效度术语对照练习;选你正在用的考试教材即可。

10间隔复习

间隔复习:自动从 Day N-1、N-3、N-7 中抽题。先凭记忆作答,再看答案。

要把“压力”放进实验,研究者先要给出可观察的测量程序——这称为?来自 Day 2 · 实验设计:自变量、随机分配与混淆变量(1 天前)

查看答案
答案:操作定义(operational definition)
操作定义把抽象概念落实为具体测量或操纵程序,使研究可检验、可重复。

随机分配主要提升的是内部效度还是外部效度?为什么?来自 Day 2 · 实验设计:自变量、随机分配与混淆变量(1 天前)

查看答案
答案:内部效度。因为它让各组在操纵前平均可比,从而更有把握把组间差异归因于自变量。
外部效度更多依赖抽样、情境代表性与跨情境重复;随机分配不自动解决推广问题。
模块 0 · 科学思维2026-09-30约 40 分钟▶

Day 2 · 实验设计:自变量、随机分配与混淆变量

要推断“是 A 导致了 B”,关键不只是测到了差异,而是设计让除了你操纵的那一点之外,各组在其他方面平均相同——这靠操作定义、随机分配,以及对混淆变量与期望效应的主动防范。

1一句话核心

要推断“是 A 导致了 B”,关键不只是测到了差异,而是设计让除了你操纵的那一点之外,各组在其他方面平均相同——这靠操作定义、随机分配,以及对混淆变量与期望效应的主动防范。

2概念讲解

1. 从“相关不等于因果”到“怎样才能推断因果”

昨天我们说到:相关研究只能告诉我们变量一起变化,推断因果需要实验——研究者主动操纵某个变量,并通过随机分配让各组在其他方面平均而言相同。

今天把实验拆开:什么叫“操纵”?什么叫“随机分配”?为什么做完实验,别人仍可能说“你测到的差异其实不是因为你以为的那个原因”?答案就藏在操作定义、自变量与因变量、控制变量、混淆变量、内部效度与外部效度这些概念里。

2. 操作定义:把模糊概念变成可测量的东西

科学研究不能停在“压力”“智能”“吸引力”这类日常说法上——每个人对它们的理解可能都不一样。操作定义(operational definition)指:用一套具体的、可观察或可测量的程序,来界定一个概念在本研究中“是什么”。

例如:“压力大”可以操作定义为“过去一周 Perceived Stress Scale 得分 ≥ 某阈值”,也可以是“在公开演讲前即刻的心率”;“记忆好”可以是“听完词表后立刻正确回忆的个数”。不同操作定义测的未必是同一件事——所以写报告时必须写清楚,读者才能判断你测的到底是不是你声称的那个概念。

操作定义不是“概念的唯一真相”,而是本次研究里可检验的约定。换一种操作定义,结论可能改变——这不是耍赖,而是提醒我们:抽象概念需要通过具体测量进入科学。

3. 自变量、因变量与控制变量

一次典型的实验里,至少要分清三类变量:

  • 自变量(independent variable, IV):研究者主动操纵的变量。它是“原因候选”。例如:是否服用某药、是否收到积极期望标签、界面按钮是红色还是蓝色。
  • 因变量(dependent variable, DV):研究者测量的结果变量。它是“效果候选”。例如:症状评分、测验成绩、点击率。
  • 控制变量(control variables):研究者希望各组保持一致、或在分析中加以统计控制的因素,以免它们干扰因果解释。例如:测验时间、指导语措辞、屏幕亮度。
三类变量对照
研究者做什么例子(睡眠与记忆)
自变量操纵(制造不同水平)随机安排:睡足 8 小时 vs 只睡 4 小时
因变量测量结果次日词表回忆正确数
控制变量保持一致或加以控制词表材料、测验时间、咖啡因摄入规则

记一个口诀:自变量是你改的,因变量是你看的,控制变量是你尽量让它别乱的。

4. 实验组与对照组:比较才产生意义

单独给一群人做干预再测结果,往往说不清变化是不是干预造成的——时间流逝、练习效应、自然好转都可能“看起来像有效”。因此实验通常至少有两组:

  • 实验组(experimental group):接受研究者感兴趣的处理(treatment)。
  • 对照组 / 控制组(control group):不接受该处理,或接受一个对照处理(如安慰剂、标准流程、另一种版本)。

对照组不是“被忽略的人”,而是让因果解释成立的基准线。没有可比的对照,你就很难知道差异来自哪里。

5. 随机分配:为什么它是推断因果的关键

把人分进实验组还是对照组,不能按“谁方便”“谁自愿”“谁看起来更适合”来分——那样两组从一开始就可能系统不同。随机分配(random assignment)指:用随机程序(掷硬币、随机数)决定每个人进哪一组,使已知与未知的个体差异在组间平均而言趋于平衡。

注意两件常被混为一谈的事:

  • 随机分配:解决的是“各组是否可比”,服务内部效度(你能否说差异是由操纵造成的)。
  • 随机抽样:解决的是“样本是否代表总体”,服务外部效度(你能否把结论推广到更大人群)。
参与者池 随机分配 实验组 · 接受处理 对照组 · 对照处理 比较因变量 组间差异 → 归因于 IV 随机分配的目标:除自变量外,两组在其他方面平均可比
随机分配并不保证每一对个体完全相同,但在样本量足够时,它让已知与未知混淆因素在组间趋于平衡。

一项研究可以有随机分配却没有随机抽样(很多实验室实验如此):它仍可能很适合推断因果,只是推广时要谨慎。反过来,大规模问卷调查即使抽样很好,若没有随机分配的操纵,仍难直接下因果结论。

6. 混淆变量与内部效度

混淆变量(confound)指:与自变量一起系统变化、因而也可能解释因变量变化的额外因素。一旦存在混淆,你就说不清结果到底是自变量造成的,还是那个“跟着变”的东西造成的。内部效度(internal validity)问的是:在这项研究内部,我们有多大把握说“是自变量导致了因变量的变化”?混淆越多、控制越差,内部效度越低。

常见混淆来源包括:两组接受不同时长的关注、不同的指导语气、不同的时间段(一组早上测、一组晚上测)、主试对某组更热情、测量工具本身在两组使用方式不一致等。

自检句:除了我声称的那个自变量,还有没有任何别的东西也在两组之间系统不同?有的话,因果箭头就可能指错对象。

7. 期望效应与双盲:人不是试管

心理学实验里的“材料”常常是人——参与者会猜研究目的,主试也会不知不觉流露期望。这类因素本身就能改变行为,从而变成混淆。

实验者期望效应(experimenter expectancy effect):主试对结果的预期,可能通过语气、表情、无意中的提示,影响参与者的表现。罗伯特·罗森塔尔(Robert Rosenthal)在 1960 年代用一系列研究系统展示了这一点;后来他与杰 Jacobson 把类似逻辑延伸到教室情境(见下方研究卡片)。安慰剂效应(placebo effect):仅仅因为相信自己接受了有效处理,结果就可能朝预期方向变化。在药物与干预研究中,常用安慰剂对照把“真处理的特异作用”与“被关注、被期望、仪式感”等区分开。

防护工具是盲法:

  • 单盲:参与者不知道自己在实验组还是对照组。
  • 双盲:参与者与直接接触他们的主试/评估者都不知道分组(由第三方编码)。这样双方的期望都不容易系统性地“帮”某一组出成绩。

不是所有心理学研究都能做双盲(例如心理治疗中治疗师通常知道自己在用哪种疗法),但研究者仍应尽量让结果评定者保持盲态,并预先设定客观指标。

8. 外部效度:推得远,往往控得松

外部效度(external validity)问的是:结论能推广到哪些人、哪些情境、哪些操作定义?实验室里控制得越严,内部效度往往越高,但情境也可能越“不像日常”,推广时就要更小心。

这不是让你鄙视实验室研究。内部效度薄弱的研究,推广得再远也只是在推广一个不可靠的因果故事。更健康的态度是:用高内部效度的研究建立机制,再用现场实验、多情境重复去检验边界条件——Donald Campbell 与 Julian Stanley(1963)以来的方法学传统,核心就是在这种取舍中把威胁一一列清。

内部效度 vs 外部效度(实用对照)
核心问题常见威胁增强办法
内部效度差异真是 IV 造成的吗?混淆、选择偏差、期望效应、测量不一致随机分配、对照、盲法、标准化流程
外部效度能推广到谁、何种情境?样本特殊、情境人工、操作定义过窄多样本、现场实验、概念重复与多操作定义
考试与实务都爱考的一对概念:随机分配 → 内部效度;随机抽样 → 外部效度/代表性。两者解决的问题不同,不能互相替代。

9. 把整条链串起来:一个最小检查清单

读到或设计一项“实验”时,可以按顺序问:

  1. 自变量是什么?有没有清晰的操作定义?
  2. 因变量怎么测?指标是否事先确定,还是事后挑显著的那个?
  3. 有没有恰当的对照组?
  4. 分组是否随机分配?若否,组间基线是否可能系统不同?
  5. 有哪些可能的混淆?流程是否标准化?
  6. 参与者与主试的期望是否被盲法或其他方式限制?
  7. 样本与情境支持怎样程度的推广?结论有没有说过头?

3经典研究与人物

教室中的期望效应(Pygmalion in the Classroom)Robert Rosenthal & Lenore Jacobson · 1968有争议

做了什么在一所小学中,研究者对儿童做智力测验后,随机抽取约 20% 的学生,告诉教师这些孩子在来年会“智力猛长”(实际是随机标签,与真实分数无关)。数月后再测智力与学业表现。

发现原书报告:被标记为“即将绽放”的学生,尤其低年级,在某些智力测验增益上高于未被标记的同学。作者将其解释为教师期望通过互动传递,影响了学生表现。

证据说明该研究在教育与社会心理学中影响极大,但也长期受到方法与重复方面的批评(如测验选择、统计分析、效应是否稳健等)。后续文献对“教师期望能否稳定改变标准化智力分数”分歧明显;较稳妥的共识是:期望可能影响互动与机会分配,但对 IQ 分数的戏剧性效应不宜当作已确立事实。本课把它当作理解期望效应与研究争议的案例,而非板上钉钉的效应量来源。

实验者期望效应(实验室中的“自我实现预言”)Robert Rosenthal · 1960 年代稳固

做了什么罗森塔尔在动物与人类实验中系统操纵主试对结果的预期(例如告诉不同主试“这些大鼠更聪明”或暗示参与者会有某种表现),同时保持真实刺激材料相当。

发现主试的预期常能在结果上留下痕迹:即使程序看似相同,期望组仍可能出现符合预期的偏向。这说明“主试也是实验装置的一部分”。

证据说明实验者期望作为方法学威胁已被广泛接受,并直接推动了标准化脚本、自动化呈现与盲法的普及。具体效应大小随情境而异,但“需要防范主试期望”已成为良好实验实践的一部分。

双盲安慰剂对照的逻辑(随机对照试验)临床医学与方法学传统(如随机对照试验 RCT 规范) · 20 世纪中叶以降稳固

做了什么评价干预是否有效时,将参与者随机分配到真处理或外观相似的安慰剂(或标准治疗),并尽量使参与者与结果评定者都不知道分组。

发现该设计把“处理的特异作用”与自然病程、回归均值、安慰剂与期望等因素分开,是医学与干预评价中推断因果的金标准框架之一。

证据说明安慰剂效应本身真实存在且机制复杂(期望、学习、医患互动等),双盲 RCT 并不是否认安慰剂不重要,而是防止把安慰剂与非特异因素误当成处理本身的效力。心理学干预因难以对治疗师完全双盲,常退而求其次:盲态评定、活跃对照、预注册结局指标。

准实验与内部效度威胁的系统清单Donald T. Campbell & Julian C. Stanley · 1963稳固

做了什么在《Experimental and Quasi-Experimental Designs for Research》中,系统区分真实验与准实验,并列举历史、成熟、测验、仪器、选择、流失等对内部效度的威胁。

发现没有随机分配的“前后测对比”或“完整群体对比”,往往无法排除多种替代解释;设计的价值取决于它能挡掉哪些威胁。

证据说明该框架是心理学与教育学方法课的标准内容,后续由 Cook、Shadish 等人扩展,但核心问题意识(先问内部效度)一直适用。

4人际中怎么用

期待与关系你对TA的标签,可能悄悄改变互动

一旦认定“他就是懒”“她就是冷漠”,你的语气、解释空间和机会分配可能跟着变——对方感受到后,行为也可能朝标签靠拢。这不必夸大成“期望万能”,但值得自检:我最近有没有只收集符合标签的证据?有没有少给对方一次被看见的机会?

沟通把抱怨改成一个可检验的小实验

与其争论“你根本不在乎”,不如约定一个可观察的改变(操作定义):例如“这周我提前一天说计划,你是否在当天晚上 10 点前回复可行/不可行”。这就是在关系里做微型对照:改变一个自变量,看因变量是否变化。

冲突分清“处理”和“被关注”

对方道歉、送礼物或突然温柔,情绪常会好转——其中有一部分可能是“被看见”的安慰剂式力量,不等于深层问题已解决。可以感激当下的修复,同时问:若没有礼物、只谈具体行为约定,关系是否仍改善?避免把仪式感误当成结构改变。

自我觉察当你当“主试”时,留意自己的期望

劝朋友分手、劝家人相亲、劝同事跳槽时,你已经有了预期答案。谈话中你可能不知不觉只抛支持自己立场的问题。试着先写两列:支持与反对各三条,并主动问一句可能推翻你建议的问题。

5工作中怎么用

产品A/B 测试的灵魂是随机分配,不是“看起来像实验”

把新功能给活跃用户、把旧版留给不活跃用户,然后宣称“新功能提升留存”——这是混淆(用户本身就不同)。正确做法是:在同一流量池里随机分流,预先锁定主指标与窗口期,避免反复偷看、显著就停(产品版 p-hacking)。

营销活动有效还是季节有效?用保留组回答

大促期间销量上升,不能自动记到广告头上。设置随机holdout(保留组)不触达广告,比较触达组与保留组的转化差异,才更接近“广告”这个自变量的效应。若无法随机,至少承认这是准实验,结论要降级。

管理培训后分数涨了,不等于培训有效

培训结束立刻测验,常见混淆包括:练习效应、霍桑式被关注、学员取悦讲师。更干净的设计:随机决定谁先培训谁后培训(等待组对照),或用双盲评分的行为指标;至少做延时再测,看增益是否还在。

管理绩效与晋升中的期望循环

管理者若早早把某人标为“高潜”,可能给予更多辅导、曝光与容错,成绩差距被放大后再被用来证明“眼光准”。缓解办法:关键项目机会用更透明的规则分配;评估时先看行为记录再贴标签;引入不了解“高潜名单”的评定者做盲态校准。

品牌包装与仪式会改变体验,请诚实对待安慰剂成分

精美包装、专业术语、沉浸开箱都能提升主观体验——其中一部分是期望与意义赋予,不一定是配方本身。产品叙事可以利用它提升愉悦感,但若声称可验证的功效(功效、成绩、健康),就应回到对照与盲法能支撑的证据层级,避免把体验设计包装成未验证的因果承诺。

6考点速记

  • 操作定义:用具体可观察/可测量的程序界定概念;同一概念可有不同操作定义。
  • 自变量(IV):研究者操纵的变量;因变量(DV):测量的结果;控制变量:需保持一致或加以控制的因素。
  • 实验组 vs 对照组:对照提供因果解释的基准;无对照难以排除时间、练习、自然变化等。
  • 随机分配:使组间已知与未知差异平均平衡,是实验法推断因果、内部效度的关键。区别于随机抽样(服务外部效度/代表性)。
  • 混淆变量:与 IV 系统共变、可替代解释 DV 变化的因素;威胁内部效度。
  • 期望效应:实验者期望与参与者期望均可影响结果;防护包括标准化、单盲/双盲、盲态评定。
  • 安慰剂效应:因接受“有效处理”的信念及伴随情境而产生的改变;安慰剂对照用于分离特异与非特异效应。
  • 内部效度 vs 外部效度:前者问因果是否成立,后者问能否推广;严控实验室常提高内部效度、收紧外部效度,需用重复与现场研究补边界。
  • Rosenthal & Jacobson(1968)Pygmalion 研究:教师期望案例,证据有争议;实验者期望作为方法学威胁则较被广泛接受。

7自测 3 题

某产品团队把新首页只推给“最近 7 天活跃”的用户,旧首页留给其余用户,一周后发现新首页组留存更高,于是结论:“新首页提升了留存。”最主要的问题是?

  1. A. 没有操作定义
  2. B. 分组不是随机分配,活跃度本身可能是混淆变量
  3. C. 违反了可证伪性
  4. D. 样本一定没有代表性,所以一定无效
查看答案
答案:B
两组从一开始就在活跃度上系统不同,留存差异完全可能来自用户本身而非首页。即便结果“显著”,也不能归因于自变量。D 过度绝对:外部效度是另一问题;本题核心是内部效度被混淆破坏。

关于随机分配与随机抽样,下列哪一项正确?

  1. A. 两者是同一件事,只是翻译不同
  2. B. 随机分配主要服务外部效度,随机抽样主要服务内部效度
  3. C. 随机分配让各组可比以支持因果推断(内部效度);随机抽样关乎样本是否代表总体(外部效度)
  4. D. 没有随机抽样就绝对不能做任何因果推断
查看答案
答案:C
实验室实验常常对方便样本做随机分配:仍可能有较好的内部效度,推广时则需谨慎。没有随机抽样不等于不能谈因果,而是外部效度主张要收敛。

双盲设计最直接防范的是哪一类威胁?

  1. A. 样本不能代表全国人口
  2. B. 参与者与主试的期望、暗示导致的结果偏向
  3. C. 第三变量导致的虚假相关(在纯观测研究中)
  4. D. 相关系数不能大于 1
查看答案
答案:B
双盲让参与者与直接接触的主试/评定者都不知道分组,降低期望与暗示造成的系统偏差。A 是外部效度/抽样问题;C 主要靠实验操纵与随机分配来应对;D 是统计定义,与盲法无关。

8今日练习(约 20 分钟)

今天用“实验设计检查清单”拆一条真实主张,并在自己的生活里设计一个最小对照。

8 分钟

拆解一条“实验/测试”。找一条产品 A/B、营销投放、培训效果或健康干预的说法,按清单回答:① IV/DV 的操作定义是什么?② 有没有对照?③ 是否随机分配?④ 可能的混淆是什么?⑤ 有没有盲法或至少盲态评定?⑥ 结论有没有推广过度?

7 分钟

设计一个生活微型实验。选一个你关心的小问题(如:午后散步是否让你晚上更容易专注)。写出:IV、DV(如何在 1–5 分或分钟数上测量)、对照组是什么、如何在一周内尽量“像随机”地安排条件(可掷硬币决定哪天散步)、要控制哪些因素(咖啡、睡眠)。不必真的做满一周,但方案要写到可执行。

5 分钟

期望自检。写下你对某同事或亲友的一个强烈预期。列出:过去一周你多给了TA什么机会/解释,少给了什么。再写一个“若我看到 ____,我会下调这个预期”的观察标准。

9延伸阅读

  • 《这才是心理学》(How to Think Straight About Psychology)中论实验与控制的章节 Keith E. Stanovich · 书 · 延续 Day 1在相关与因果之后,继续读实验控制、安慰剂与期望等相关章节,与本课直接衔接。
  • Experimental and Quasi-Experimental Designs for Research Donald T. Campbell & Julian C. Stanley · 1963 · 书 / 经典方法小册内部效度威胁清单与准实验分类的源头文献,方法课常引。
  • Pygmalion in the Classroom Robert Rosenthal & Lenore Jacobson · 1968 · 书教师期望研究原著;阅读时请同时对照后续批评与综述,勿只记“期望改变智商”的简化版。
  • Experimenter effects in behavioral research Robert Rosenthal · 1966 · 书系统讨论实验者期望等方法学效应,奠定盲法与标准化的实践理由。
  • Experimental and Quasi-Experimental Designs for Generalized Causal Inference Shadish, Cook & Campbell · 2002 · 书 · 进阶在 Campbell & Stanley 传统上的现代扩展,适合之后想系统学因果推断设计时查阅。

10间隔复习

间隔复习:自动从 Day N-1、N-3、N-7 中抽题。先凭记忆作答,再看答案。

关于心理学的“可重复性危机”,下列说法哪一项最准确?来自 Day 1 · 心理学凭什么算科学:用证据看人(1 天前)

  1. A. 它证明了大多数心理学研究都是编造的
  2. B. 开放科学合作组织(2015)重复的研究中约 36% 得到显著结果,效应量平均约为原来的一半,提示小样本、发表偏倚等问题
  3. C. 大规模预注册重复研究证实了自我损耗效应
  4. D. 只要一次重复失败,就足以证明原效应不存在
查看答案
答案:B
A 过度引申:重复失败多源于方法问题而非造假,且许多效应(如锚定效应)重复良好。C 相反:Hagger 等(2016)的预注册多实验室重复发现效应接近零。D 错误:单次重复失败也可能有自身局限,需要综合多项证据判断。

某文章写道:“调查显示,每天喝咖啡的人抑郁风险更低,所以喝咖啡可以预防抑郁。”这一推论最主要的问题是?来自 Day 1 · 心理学凭什么算科学:用证据看人(1 天前)

  1. A. 违反了可证伪性原则
  2. B. 把相关当成了因果
  3. C. 属于巴纳姆效应
  4. D. 属于 HARKing
查看答案
答案:B
调查只能显示两者相关。可能存在反向因果(抑郁的人精力差、改变了饮食习惯),也可能有第三变量(如收入、工作状态、睡眠、社交活动同时影响两者)。要检验因果,需要随机分配的实验或设计更严谨的纵向研究。
模块 0 · 科学思维2026-09-29约 40 分钟▶

Day 1 · 心理学凭什么算科学:用证据看人

心理学算科学,不是因为它研究“人心”,而是因为它用可检验、可重复、公开的证据回答关于人的问题,并且在证据面前愿意承认自己错了。

1一句话核心

心理学算科学,不是因为它研究“人心”,而是因为它用可检验、可重复、公开的证据回答关于人的问题,并且在证据面前愿意承认自己错了。

2概念讲解

1. 为什么“凭常识懂人”不够

每个人都是“业余心理学家”:我们每天都在猜别人为什么这样做、下一步会怎样。问题在于,常识往往可以同时解释相反的结果。“物以类聚”和“异性相吸”都是俗语;“小别胜新婚”和“眼不见,心不烦”也都是。无论两个人分开后感情变好还是变淡,常识都能事后给出一个说法。

一个什么结果都能解释的说法,其实什么也没预测。科学心理学要做的,是把这些模糊的直觉变成可以被数据推翻的具体问题,例如:“在什么条件下、对哪些人、相似性对吸引力的影响有多大?”然后去测量。

2. 科学的三个基本特征

心理学家基思·斯坦诺维奇(Keith Stanovich)在《这才是心理学》(How to Think Straight About Psychology)中把科学概括为三点,这也是本课程判断一切说法的底层标准:

  • 系统的实证主义:靠有计划、有控制的观察和测量回答问题,而不是靠权威、直觉或个人经历。
  • 知识公开可验证:方法要写清楚,别人照做能得到类似结果;研究要经过同行评议。一个只有提出者本人能“验证”的发现,不算科学知识。
  • 研究可解决的问题:问题必须能用现有方法检验。“人生的意义是什么”很重要,但不是实证问题;“有明确目标的人主观幸福感是否更高”则可以研究。

3. 可证伪性:好理论要敢于“冒险”

哲学家卡尔·波普尔(Karl Popper)提出:一个理论是否科学,关键不在于能找到多少支持它的例子,而在于它是否明确说出了什么情况会证明它是错的——这叫可证伪性(falsifiability)。

波普尔在《猜想与反驳》(1963)中举过一个对照:1919 年日食观测检验了爱因斯坦广义相对论关于光线弯曲的预测,如果观测结果不符,理论就会被推翻——它冒了真实的风险。相比之下,他认为当时的精神分析(弗洛伊德)和个体心理学(阿德勒)无论出现什么行为都能解释:一个人把孩子推下水,或者一个人舍命救孩子,两种理论都能自圆其说。波普尔指出,这种“处处都能被证实”恰恰是弱点,而不是优点。

科学心理学与伪心理学的常见区别(判断时看整体倾向,不是逐条打分)
维度科学心理学伪心理学(常见表现)
主张的形式具体、可测量,说清楚什么结果会推翻它模糊、万能,任何结果都能解释
对反例的态度认真对待,修正或放弃理论解释掉反例(“你还没真正领悟”)
证据来源对照研究、大样本、重复验证个人经历、客户好评、名人背书
是否公开检验公开方法与数据,接受同行审查“独家方法”“核心技术保密”
随时间的变化不断自我修正、积累几十年不变,或只改包装
语言风格常带限定:“平均而言”“在某些条件下”绝对化:“100% 有效”“一眼看穿”
诚实的补充:可证伪性作为“科学与非科学的唯一分界线”,在科学哲学中是有争议的(库恩、拉卡托斯等人提出过重要批评);而且精神分析中的一部分具体假设后来也被实证研究检验过。但作为日常判断的实用原则——“什么证据会让你改变看法?”——它非常好用。

4. 相关不等于因果

“相关”指两个变量一起变化;“因果”指一个变量的改变会导致另一个变化。两者之间隔着两道坎:

  • 方向性问题:可能是 B 导致 A,而不是 A 导致 B。
  • 第三变量问题:可能有一个没被测量的 C 同时影响 A 和 B。
① A 导致 B A B 我们通常想当然的解释 ② 方向反了:B 导致 A A B 方向性问题 ③ 第三变量 C 同时影响两者 C A B A 与 B 相关,但彼此并无因果
看到 A 与 B 相关时,至少要想到这三种可能(还可能是巧合或样本选择造成的)。
相关研究与实验的对比
相关研究实验
研究者做什么测量已存在的变量,看它们是否一起变化主动操纵自变量,测量因变量
是否随机分配否是(这是关键)
能否推断因果不能直接推断可以(在设计良好的前提下)
适用场景无法或不应操纵的变量,如童年经历、性别可操纵且符合伦理的变量
常用统计量相关系数 r(-1 到 +1)组间差异、效应量(如 Cohen's d)

斯坦诺维奇书中有一个经典历史案例:20 世纪初美国南方糙皮病(pellagra)流行,人们发现它与卫生条件差的地区高度相关,于是怀疑是传染病。美国公共卫生署的约瑟夫·戈德伯格(Joseph Goldberger)认为真正的原因是饮食缺乏,“卫生差”和“糙皮病”都是贫困这个第三变量的结果。他通过改变饮食的研究证明了这一点;后来科学家确认糙皮病的直接原因是缺乏烟酸(维生素 B3)。

要确立因果,最有力的方法是实验:研究者主动操纵自变量,并通过随机分配让各组在其他方面平均而言相同。这样两组之后出现的差异,才能较有把握地归因于操纵本身。

5. 个案 vs 数据:“我认识一个人……”

“我爷爷每天抽烟,活到 95 岁。”斯坦诺维奇把这类论证称为“某人统计”(person-who statistics):用一个鲜活的反例去否定一个概率性的规律。可心理学和医学中的大多数规律本来就是概率性的——“吸烟提高患肺癌的风险”从来不意味着“每个吸烟者都会得肺癌”。

个案之所以说服力强,是因为它生动、容易想起。特沃斯基与卡尼曼(Tversky & Kahneman, 1973)描述的可得性启发指出:我们常根据例子“多容易想到”来判断事件有多常见。飞机失事的新闻让人觉得坐飞机很危险,就是这个道理。

这不等于个案毫无价值:个案能提出假设、提供细节、展示“可能性”;但要回答“普遍是否如此、有多大程度”,需要系统收集的数据。

6. 确认偏误:我们天生爱找“证明自己对”的证据

确认偏误(confirmation bias)指人们倾向于寻找、注意、解释和记住支持自己已有观点的信息,而忽视或贬低相反的信息(Nickerson, 1998 的综述)。

彼得·沃森(Peter Wason)1960 年的“2-4-6 任务”是经典演示:告诉参与者“2, 4, 6”符合某条规则,请他们提出新的三个数来测试自己的猜想。很多人猜“依次加 2”,然后一直提出 8-10-12、20-22-24 这类符合自己猜想的数字,得到“符合”的反馈后就很有信心地宣布答案——结果错了。真正的规则只是“任意递增的三个数”。要发现这一点,需要主动试一试可能推翻自己猜想的数字,比如 1-7-30。

日常中,一旦你认定“这个同事不靠谱”,他每次迟到你都记得,他准时交付你却不太留意。确认偏误并不是“笨”的人才有,它是人类信息加工的普遍倾向,科学方法(对照组、盲法、预注册)在很大程度上就是为了对抗它而设计的。

7. 巴纳姆效应:为什么星座和性格测试“好准”

1949 年,心理学家伯特伦·福勒(Bertram Forer)让学生做了一份性格测验,一周后给每人发了一份“个人分析报告”,请他们评价准确度(0–5 分)。学生们普遍给出了很高的分数——而实际上所有人拿到的是同一段文字,其中的句子大多摘自一本星座书,例如“你有时外向、友善、合群,有时内向、谨慎、保守”这样的描述。

这种现象后来被称为巴纳姆效应(Barnum effect,名称由保罗·米尔 Paul Meehl 在 1956 年推广开来),也叫福勒效应:人们会把笼统、普遍适用的描述当作对自己的准确刻画。让描述“显得准”的常见配方:

  • 模糊且双面:“你有时……有时……”几乎对所有人成立。
  • 偏正面:“你有很多尚未发挥的潜力”,人们更愿意接受讨喜的描述。
  • 看起来是专门为你做的:填了问卷、输入了生日,会让人更相信结果是“个性化”的。
  • 来源显得权威:专家、测评机构、精美的报告。

关于 MBTI 等类型测试,需要说得公允一些:它不等同于星座,题目确实在测量一些真实的偏好。但研究者对它有具体的批评——例如把连续分布的特质硬分成两类、部分人重测时类型会改变(参见 Pittenger, 2005);而它的类型描述大多写得正面、宽泛,这正是巴纳姆效应容易发挥作用的地方。学术研究中更常用的是大五人格模型,我们会在模块 4 详细讲。

自检一句话:一段关于你的描述,如果换一个人读也几乎同样成立,那它“准”的原因多半在于巴纳姆效应,而不在于它真的了解你。

8. 可重复性危机:心理学如何面对自己的错误

2015 年,由布莱恩·诺塞克(Brian Nosek)等人发起的开放科学合作组织(Open Science Collaboration)在《科学》(Science)上发表报告:他们重复了 2008 年发表在三本心理学顶级期刊上的 100 项研究。原研究中有 97% 报告了统计显著的结果,而重复研究中只有约 36% 得到显著结果;重复研究的效应量平均只有原研究的一半左右。

此后,一些曾经广为流传的发现在大规模重复中表现不佳,例如“自我损耗”(意志力像肌肉一样会被用完)和“权力姿势”(摆出扩张的姿势能改变激素水平),详见下方研究卡片。

造成问题的主要原因包括:

  • 样本太小:统计检验力不足,偶然结果更容易被当成发现。
  • 分析灵活性(p-hacking):多测几个指标、多试几种分析、数据“够显著”就停止收集,会大幅增加假阳性(Simmons, Nelson & Simonsohn, 2011)。
  • 发表偏倚:显著的“新奇发现”更容易发表,失败的结果被锁进抽屉。
  • 事后假设(HARKing):看到结果后再把它写成“事先预期”(Kerr, 1998)。

心理学界的回应是一系列改革:预注册(事先公开假设和分析计划)、注册报告(期刊在看到结果前就根据方法决定是否发表)、公开数据与材料、多实验室联合重复(如 Many Labs 项目)。

诚实的说明:可重复性危机不等于“心理学都是假的”。(1)一次重复失败不能证明原效应一定不存在,重复研究本身也可能有问题,OSC 2015 的方法和解读也受到过批评(如 Gilbert 等人 2016 年的评论);(2)很多发现重复得相当好,例如锚定效应在 Many Labs 1 中非常稳健;(3)一门学科能公开检查并纠正自己的错误,本身就是科学在正常运转。这场危机提醒我们:对单一、新奇、效应惊人、样本很小的研究保持谨慎。

9. 本课程为什么给每项研究标注证据强度

基于上面的原因,本课程提到的每一项研究都会带一个证据标签。它是一种对当前证据状况的概括判断,不是永久结论——新证据出现时,标签也会随之调整。

标签含义你该怎么用
稳固多次独立重复、元分析支持,或已成为领域共识可以作为理解与决策的依据,但仍注意适用条件
有争议结果不一致、效应大小或解释存在明显分歧、边界条件不清当作“值得参考的假设”,不要据此下重大结论
已被质疑大规模或预注册的重复研究失败,或原作者公开撤回了解它的历史与教训;不要再当作事实引用

3经典研究与人物

福勒的“个人分析报告”实验Bertram Forer · 1949稳固

做了什么给学生做性格测验后,发给每人一份“个性化”报告,请他们评价准确度;实际上所有人拿到的是同一段摘自星座书的笼统描述。

发现学生普遍认为报告对自己描述得很准确。这说明“觉得准”并不能证明一个测评有效。

证据说明巴纳姆效应此后被多次重复,并有文献综述(如 Dickson & Kelly, 1985)。效应强弱会受描述是否正面、来源是否权威、是否显得个性化等因素影响。

2-4-6 规则发现任务Peter Wason · 1960稳固

做了什么让参与者通过提出三个数的组合来发现隐藏规则(实际是“任意递增”)。

发现多数人倾向于只测试符合自己猜想的例子,很少主动寻找可能否定猜想的例子,因而常得出过窄的错误规则。

证据说明“人们偏好寻找支持性证据”这一现象非常稳固(Nickerson, 1998)。但 Klayman & Ha(1987)指出,这种“正向检验策略”在很多现实情境中其实是合理的,并非总是非理性——问题在于规则比猜想更宽时它会失效。

糙皮病的真正原因Joseph Goldberger · 1914–1920 年代稳固

做了什么面对糙皮病与卫生条件差的高相关,戈德伯格通过改变饮食的研究检验“饮食缺乏”假设,并论证该病并非传染病。

发现卫生差与糙皮病都源于贫困导致的饮食缺乏;后来确认直接原因是烟酸缺乏。这是“第三变量”的教科书案例。

证据说明病因已被医学确认。该案例被斯坦诺维奇用来说明相关与因果的区别。

心理学可重复性大规模检验Open Science Collaboration(Nosek 等) · 2015稳固

做了什么近 300 名研究者合作,重复 2008 年发表于三本心理学期刊的 100 项研究,发表于 Science。

发现原研究 97% 显著,重复研究约 36% 显著;重复效应量平均约为原研究的一半。

证据说明“可重复率低于人们以为的水平”这一总体结论得到后续项目呼应(如 Many Labs 2、Camerer 等 2018 年对社会科学实验的重复)。但具体的“可重复率”数字如何解读仍有争论,不应简单理解为“64% 的研究是假的”。

Many Labs 1:多实验室联合重复Klein 等 · 2014稳固

做了什么36 个实验室、数千名参与者使用相同流程,同时重复 13 个经典效应。

发现多数效应得到了重复,其中锚定效应非常稳健;但也有效应(如国旗启动、金钱启动)未能重复。

证据说明它展示了可重复性检验的“另一面”:心理学中有相当多扎实的发现,关键是分辨哪些是。

自我损耗(意志力有限资源模型)Baumeister 等 · 1998已被质疑

做了什么原研究中,先被要求抵制巧克力饼干、只吃萝卜的参与者,在随后的难解谜题上坚持时间更短,被解释为“自控资源被耗尽”。

发现该理论曾被数百项研究引用和“支持”,并广泛进入自我管理类畅销书。

证据说明Hagger 等(2016)在 23 个实验室、两千多名参与者中进行预注册重复,效应接近于零;Vohs 等(2021)的多实验室预注册研究也只发现极小或接近零的效应。早期大量“支持”研究可能受发表偏倚和小样本影响。

权力姿势Carney, Cuddy & Yap · 2010已被质疑

做了什么让参与者摆出扩张的“高权力”姿势约两分钟,报告其睾酮上升、皮质醇下降、更愿意冒险。

发现相关 TED 演讲广为传播,“面试前摆两分钟超人姿势”成为流行建议。

证据说明Ranehill 等(2015)以更大样本未能重复激素和冒险行为上的效应;第一作者 Dana Carney 于 2016 年公开表示她不再相信权力姿势的效应是真实的。关于姿势是否能让人主观上感觉更有力量,仍有争议(Cuddy 等 2018 年的分析认为有,其他研究者对此存疑)。

“假阳性心理学”Simmons, Nelson & Simonsohn · 2011稳固

做了什么通过模拟和一个故意设计的真实实验,展示研究者在分析中的常见“自由选择”会如何制造出显著结果。

发现借助灵活的分析,他们甚至“证明”了听某首披头士歌曲能让人的实际年龄变小——一个明显不可能的结论,以此说明问题的严重性。

证据说明这是方法学论证,其逻辑和模拟结果被广泛接受,直接推动了预注册等改革。

4人际中怎么用

判断他人把“他就是这种人”改写成一个假设

当你认定“他不在乎我”“她很自私”时,试着在心里加上“(待验证)”。然后像做 2-4-6 任务那样,主动留意可能推翻它的事:他有没有做过在乎你的事?在哪些情况下她并不自私?这样不是让你放弃判断,而是让判断更接近真实的人。

沟通区分“每次都这样”与“有几次这样”

吵架时的“你总是……”“你从来不……”常是可得性和确认偏误的产物:最刺痛的几次最容易想起。换成具体的描述(“这周有两次你到家没回消息”)更准确,也更不容易让对方陷入防御。

因果别急着把“同时发生”当成“因为”

“每次我提工作,他就不耐烦”——也许是因为话题,也许只是你总在他刚下班、最累的时候提(第三变量:疲劳和时间点)。换个时间试一次,就是一个小小的“实验”。

被理解感警惕“说中了”,也学会真正说中别人

当一个测试、一位“大师”或一个新认识的人让你觉得“好懂我”,先问一句:这段话换个人读是否也成立?反过来,想让别人感到被理解,笼统的夸奖(“你很有潜力”)不如具体的观察(“你开会时会先把别人的想法复述一遍再补充”)。

社交MBTI 可以当话题,别当标签

用 MBTI 或星座聊天、破冰无伤大雅;但用它预测一个人会怎么做、适不适合交往或共事,就超出了它的证据范围。

5工作中怎么用

品牌“专属于你”的文案为什么有效,边界在哪

个性化报告、年度账单、测试类 H5 常让用户觉得“好懂我”,其中一部分力量来自巴纳姆效应:宽泛、正面、看起来是为你定制的描述。用它提升体验可以,但要避免让用户误以为得到了专业的评估(例如用“测试结果”暗示健康或能力诊断)。

营销投放后销量涨了,不等于投放有效

活动上线与销量上升同时发生,可能是季节、竞品断货、自然增长等第三变量。更可靠的做法是设置随机保留组(holdout)或 A/B 测试:随机让一部分用户看不到广告,比较两组差异——这就是把实验法用到营销归因上。

管理招聘别用类型测试做筛选,结构化面试更可靠

MBTI 的发行机构本身也声明它不应用于招聘筛选。人员选拔研究的元分析(Schmidt & Hunter, 1998;Sackett 等 2022 年的修正分析)显示,结构化面试(统一问题、统一评分标准)对工作绩效的预测力明显好于随意聊天式的非结构化面试。

管理绩效评估中的确认偏误

对一个员工的第一印象会影响你之后注意哪些事。做法:平时用简短记录积累具体事例(好的和不好的都记),评估时先看记录再下结论,并主动问自己“有什么证据和我的印象相反?”

产品一个大客户的反馈,是个案还是规律?

用户访谈里生动的抱怨很有启发价值(提出假设),但决定是否投入开发,需要行为数据和更大样本验证。同时注意:只调研现有用户,会漏掉那些已经流失或从未转化的人。A/B 测试中,事先确定核心指标和样本量,不要反复偷看结果、显著就停——这正是产品版的 p-hacking。

管理读管理和效率类畅销书时,查一下证据

“意志力会被用完,所以重要决策放早上”(源于自我损耗)、“开会前摆个强势姿势”(源于权力姿势)这类建议都建立在已被质疑的研究上。遇到“研究表明”,至少追问:是哪项研究?样本多大?有没有被独立重复?

6考点速记

  • 科学的三个特征(Stanovich):系统的实证主义、知识公开可验证、研究可解决的问题。
  • 可证伪性(Popper):科学理论必须能明确指出什么观察结果会证明它是错的;能解释一切的理论不可证伪。
  • 相关≠因果:两大障碍是方向性问题和第三变量问题。相关系数 r 取值 -1 到 +1,绝对值表示强度,正负表示方向。
  • 实验法三要素:操纵自变量、测量因变量、随机分配被试到实验组与控制组;随机分配是推断因果的关键。注意区分随机分配(内部效度)与随机抽样(外部效度/代表性)。
  • 巴纳姆效应 / 福勒效应(Forer, 1949):人们把笼统、普遍适用的描述视为对自己的准确刻画。
  • 确认偏误:寻找和记住支持已有信念的信息;经典演示为 Wason(1960)2-4-6 任务。
  • 可得性启发(Tversky & Kahneman, 1973):依据例子容易想起的程度判断频率或概率。
  • 可重复性危机:OSC(2015)重复 100 项研究,约 36% 得到显著结果;主要原因:小样本、p-hacking、发表偏倚、HARKing;对策:预注册、注册报告、开放数据、多实验室重复。

7自测 3 题

某文章写道:“调查显示,每天喝咖啡的人抑郁风险更低,所以喝咖啡可以预防抑郁。”这一推论最主要的问题是?

  1. A. 违反了可证伪性原则
  2. B. 把相关当成了因果
  3. C. 属于巴纳姆效应
  4. D. 属于 HARKing
查看答案
答案:B
调查只能显示两者相关。可能存在反向因果(抑郁的人精力差、改变了饮食习惯),也可能有第三变量(如收入、工作状态、睡眠、社交活动同时影响两者)。要检验因果,需要随机分配的实验或设计更严谨的纵向研究。

以下哪一个说法最难被证伪?

  1. A. 前一晚睡眠少于 5 小时的人,第二天工作记忆测验得分会更低
  2. B. 每个人内心深处都有未被意识到的冲突,它会以各种方式表现在行为中
  3. C. 当有旁人在场时,人们主动帮助陌生人的可能性会降低
  4. D. 使用结构化面试的公司,新员工一年后的绩效评分更高
查看答案
答案:B
A、C、D 都说明了可测量的变量和预期方向,结果可能与预测相反,因此可以被检验和推翻。B 中“各种方式表现”意味着任何行为都可以被解释为支持它,没有任何观察能证明它错,所以最难证伪。

关于心理学的“可重复性危机”,下列说法哪一项最准确?

  1. A. 它证明了大多数心理学研究都是编造的
  2. B. 开放科学合作组织(2015)重复的研究中约 36% 得到显著结果,效应量平均约为原来的一半,提示小样本、发表偏倚等问题
  3. C. 大规模预注册重复研究证实了自我损耗效应
  4. D. 只要一次重复失败,就足以证明原效应不存在
查看答案
答案:B
A 过度引申:重复失败多源于方法问题而非造假,且许多效应(如锚定效应)重复良好。C 相反:Hagger 等(2016)的预注册多实验室重复发现效应接近零。D 错误:单次重复失败也可能有自身局限,需要综合多项证据判断。

8今日练习(约 20 分钟)

准备纸笔或手机备忘录。今天的练习目标是:亲身体验偏误,并练习用科学的问题审视一个说法。

5 分钟

巴纳姆自测。读下面这段“为你定制”的描述,按 0–5 分给它的准确度打分:
“你很在意别人对你的看法,但也有自己的坚持。你在熟悉的人面前比较放松,在陌生场合会先观察再表态。你有一些还没充分发挥的能力。有时你会怀疑自己做的决定是否正确。”
打完分后想一想:你身边有几个人读到这段话会打低分?记下你的感受。

7 分钟

拆解一条“研究发现”。在新闻或社交媒体上找一条“研究表明……”的内容,回答:① 这是相关研究还是实验(有没有随机分配)?② 样本大约多少人、是什么人?③ 能否想到至少两个第三变量或反向因果的可能?④ 标题的结论是否超出了研究本身能说明的范围?

5 分钟

给一个判断找反例。写下你对某个人(同事、家人、朋友)的一个判断,再写出:“如果我看到 ____,我会改变这个看法。”接下来一周,有意留意这类反例。

3 分钟

一句话复盘。用自己的话写下:今天学到的哪一个概念,最可能改变我明天的某个具体做法?

9延伸阅读

  • 《这才是心理学:看穿伪心理学的本质》(How to Think Straight About Psychology) Keith E. Stanovich · 书 · 入门首选本课“科学思维”模块的主要参考。可证伪性、某人统计、相关与因果、糙皮病案例都在其中,有中译本。
  • 《猜想与反驳》(Conjectures and Refutations) Karl Popper · 1963 · 书第一章“科学:猜想与反驳”讨论了可证伪性以及精神分析与相对论的对比。偏哲学,可只读第一章。
  • How We Know What Isn't So: The Fallibility of Human Reason in Everyday Life Thomas Gilovich · 1991 · 书系统讨论人们为何会坚信错误的东西(随机中看到模式、选择性证据等),可读性强。
  • Science Fictions Stuart Ritchie · 2020 · 书从内部视角讲科学中的造假、偏倚、疏忽与夸大,以及如何改进,对理解可重复性危机很有帮助。
  • Estimating the reproducibility of psychological science Open Science Collaboration · 2015 · 论文 · Science, 349(6251), aac4716可重复性危机的标志性论文,摘要和图表值得直接读原文。
  • The fallacy of personal validation: A classroom demonstration of gullibility Bertram R. Forer · 1949 · 论文 · Journal of Abnormal and Social Psychology, 44(1), 118–123巴纳姆效应的原始研究,篇幅很短。
  • Confirmation bias: A ubiquitous phenomenon in many guises Raymond S. Nickerson · 1998 · 论文 · Review of General Psychology, 2(2), 175–220关于确认偏误最常被引用的综述。
  • False-positive psychology Simmons, Nelson & Simonsohn · 2011 · 论文 · Psychological Science, 22(11), 1359–1366理解 p-hacking 的必读论文,论证清楚、并不艰深。

10间隔复习

今天是起点,还没有更早的内容可复习。从 Day 2 开始,这里会自动出现前几天(N-1、N-3、N-7)的题目,帮你在遗忘之前重新提取记忆。