心理学与误判 · 11/20
确认偏误Confirmation Bias
确认偏误让人偏爱支持既有判断的证据,把反对证据挡在结论之外。
达尔文给自己立过一条规矩:遇到反对自己结论的事实,立刻记下来。1876 年,他在英国肯特郡的唐屋写自传时,回顾了这个坚持多年的习惯。无论反对意见来自出版物、新观察,还是自己冒出的念头,他都不让它只留在脑中。他发现,这些不利材料比支持自己的材料更容易被遗忘。研究物种演化时,他既积累支持理论的证据,也把难题保存下来,让自己日后仍得面对它们。
为什么成立
连续得到支持,也可能没有排除任何解释
猜数字规则时,只试符合猜想的数字,会让错误解释一直过关。看到“2、4、6”,你猜规则是“依次增加二”,接着试“4、6、8”和“10、12、14”,都得到肯定。但“任意三个递增的数”也能解释这些结果。试“1、2、9”才有辨别力:前一个猜想预测不通过,后一个预测通过。证据的价值,在于它能否让不同解释给出不同预测。
既有判断会筛选你接触和接受的证据
确认偏误会让人优先寻找、解释和记住支持既有判断的信息。搜索时,你问“这个方案为什么有效”,漏掉失败案例;阅读时,你接受有利材料,却反复挑反对材料的方法漏洞;回忆时,你先想起吻合的经历。三道筛选之后,你看到的证据越来越整齐,结论却没有接受同等严格的检验。
验证起来省力的猜想,容易变成默认答案
人会沿着已有解释寻找线索,因为这样省力,也容易得到明确反馈。结论牵涉个人立场时,接受反证还意味着修改自己认可的看法,于是挑剔证据的标准也会偏向一边。偏误由此能在认真查资料的人身上发生。
把反证写下来,才能让它参与判断
达尔文的做法把容易消失的反对材料留在纸上。今天可以先写下什么结果会让自己改口,再查资料,并记录不符合预期的观察。反证还要接受质量检查;只要可靠,就按事先写下的标准修改结论。
出处
确认偏误属于认知心理学。现代实验研究的重要起点是彼得·沃森 1960 年发表的数字规则发现实验:参与者从“2、4、6”猜规则,自选数字接受检验。许多人反复测试符合猜想的组合,未能发现真正的规则是任意三个递增的数。
换个领域看
社会
同读却更分歧
相同材料也会被读成相反的支持。1979 年,斯坦福大学的洛德、罗斯和莱珀,让支持与反对死刑的学生阅读两份研究材料,一份支持死刑有威慑力,一份反对。参与者更认可符合原有立场的研究,更挑剔另一份;读完后,双方报告的立场反而更加分化。
投资
利好越找越多
只搜索利好,会让投资判断失去检验。一位持有连锁餐饮股票的投资者,每月收集新店开业新闻,把门店增加当成需求旺盛的证明,却跳过老店销售下滑的数据。若判断依据是顾客需求,就应同时查看老店销售和关店记录;这些数据能检验增长究竟来自顾客增加,还是不断开店。
个人生活
迟到只记坏账
先认定朋友不尊重自己,记忆就会偏向那些让人不快的约会。一次聚餐,他迟到二十分钟,你把它记成又一条证据;此前几次准时赴约,却没有进入这份心里的记录。翻看最近的约会时间,比反复回想最生气的一次更能检验判断;再问清迟到原因,才能判断他是否轻视这段关系。
遇事时问自己
- 什么具体结果会让我降低对当前判断的信心?
- 我接下来查的证据,能让当前解释与另一个解释给出不同预测吗?
- 同样的方法和数据,换成支持相反结论,我还会认可吗?
- 最近遇到的最强反证是什么,我把它记在哪里了?
- 我是否因为反对材料难找、难读或让人不舒服,就提前停止了搜索?
边界与误用
判断是否存在确认偏误,要看人怎样处理证据,不能只看他最后赞成谁。可靠的支持证据多于反对证据时,坚持原判断有根据;积极寻找支持也有价值,尤其当它能排除竞争解释。最常见的误用,是把反对意见一律当成更高明,或为显得客观给两边各分一半权重。反证应按来源、测量和推理质量获得权重。个人口味没有待检验的事实主张时,也无须寻找反证;但“我喜欢它”和“它对我有益”是两种判断,后者可以检验。
练一练
电商网站的支付接口在晚间促销时变慢。值班工程师认为缓存失效,数据库管理员认为连接池太小。两种解释都能说明高峰期延迟上升。工程师连续查了三晚的日志,每次都看到延迟上升,便更确信是缓存问题。
接下来哪一步最能检验缓存失效这个判断?
同时处理两个可疑原因,容易让人觉得更有效率。但即使延迟下降,也分不清是哪项改动起了作用。
多看几晚能确认问题是否稳定,容易让人觉得证据更充分。但两种解释都预测高峰期变慢,再看到同一现象仍分不清原因。
资深工程师熟悉常见故障,他的判断容易让人信服。但这些日志同时符合两种解释,经验上的赞同没有排除另一个原因。
这一步让两种解释给出不同预测。保持其他条件相同,观察恢复缓存是否降低延迟,才能检验缓存解释。
工程师把两种解释都能预测的现象,当成了缓存解释独有的支持。反复得到这样的支持,会让信心增长,却让竞争解释一直过关。下一步应让两种解释接受能区分它们的检验。
一位基金持有人认为经理擅长选股。研究团队分析一个五年区间,发现扣除市场和行业影响后仍有超额收益,他称赞方法严谨。后来,同一团队用相同方法分析另一个五年区间,发现超额收益消失,他便说这种方法根本衡量不了选股能力,却没有指出两个区间有何相关差异。
对他处理这两份研究的方式,哪种判断最站得住?
各给一半权重看起来公平,也容易操作。但权重应来自研究质量和适用条件,不能按结论方向平均分配。
第二份研究直接挑战了原判断,容易让人急着改口。但这个选项把一个区间的表现当成稳定能力,跳过了区间条件的比较。
关键是评价证据的标准随结果改变了。他应指出方法的具体问题,再用同样的标准重新检查两份研究。
亲身经验让他熟悉这只基金,也让第一份研究显得可信。但他用熟悉感替代了方法判断,没有解释评价标准为何改变。
有利结果出现时,他认可方法;不利结果出现时,他就否定方法。原有判断成了筛选研究的门槛。把两份研究放在同一套质量标准下,才能让不利材料真正参与判断。
一位每天坐地铁通勤的乘客整理歌单,只留下自己喜欢的爵士乐。同行朋友建议他读几篇批评爵士乐的评论,免得越听越觉得自己选得对。他说自己只是喜欢这些声音,没有声称爵士乐更高级,也没有声称它能减轻疲劳。
对这份歌单,哪种判断最站得住?
比较不同评论能丰富听音乐的角度,显得认真而全面。但评论讨论的优劣,与他自己是否喜欢这些声音是两回事。
比较通勤效果看起来更理性,也可能帮助选歌。但他只是按喜欢程度选择,这个选项额外加上了一个他没有提出的效果问题。
尝试不同音乐能拓宽口味,这个建议因此很诱人。但它把偏好变得稳定当成了错误,强行加入不喜欢的曲子并没有检验任何判断。
他表达的是自己的听觉偏好。别人的批评可以提供新听法,却不能推翻他此刻的喜欢。
这个模型检查的是既有判断怎样筛选证据,不要求每一种个人口味都接受反驳。乘客没有提出待检验的事实主张,寻找反证也就没有明确对象。若他说爵士乐能减轻疲劳,就需要用实际效果检验这个新判断。