书籍基础信息
- 作者译者:英国科学院院士、统计学家戴维・汉德 著,陈璞 译,中信出版集团出版。
- 核心主旨:现有数据分析大多只关注已收集到的数据,但未观测、被隐藏、有偏差的暗数据才是造成误判、重大事故、决策灾难的核心根源;全书系统定义 15 类暗数据,拆解暗数据产生原因、现实危害,并给出识别、修正、利用暗数据的完整方法。
- 结构划分:全书分为两大板块 ——第一部分:暗数据:原因与结果(7 章,讲暗是什么、怎么产生、各类现实灾难案例);第二部分:阐明和使用暗数据(3 章,讲解决方案、挖掘暗数据价值);末尾含暗数据分类、参考文献、译者后记
前言
本书打破了以往数据类书籍只关注“已拥有数据”的惯例,转而聚焦于“未拥有的数据”——即你想要拥有、希望拥有或自以为拥有但实际上并未拥有的数据。作者将其定义为“暗数据”。暗数据如同物理学中的暗物质,虽然不可见,却深刻影响着我们的判断与决策,甚至引发灾难。作者指出,只要方法得当,暗数据不仅能被避免,还能被巧妙利用以优化决策、降低风险。书中将暗数据按成因分为15种类型。
第一部分 暗数据:原因与结果
第1章 暗数据:塑造世界的无形力量
- 幽灵数据:以“驱象粉”和麻疹疫苗为例,说明因数据缺失导致的风险不可见。创伤病患数据库中11%未知结果的患者可能误导医疗结论,这属于第1种暗数据(已知的缺失数据)。波士顿路面坑洞APP和飓风“桑迪”的Twitter数据表明,贫困或受灾严重地区因缺乏智能设备而未被统计,这属于第2种暗数据(未知的缺失数据)。
- 你真的拥有全部数据吗?:超市交易数据看似完整(数据=全部),但无法反映未来的反事实情况(第6种暗数据:或可存在的数据)及时间推移带来的变化(第7种暗数据:因时而变)。物理测量的误差(第10种暗数据)、伦敦巴士满载率造成的局部选择(第3种暗数据)、自我选择(第4种暗数据)、关键因素缺失导致的相关性误判(第5种暗数据)以及牛顿力学在极端条件下失效(第15种暗数据:推理僭越数据)均证明了暗数据无处不在。
- 被忽略的“无事发生”:1986年挑战者号航天飞机灾难是暗数据致命后果的典型。NASA在分析O形圈受损数据时,仅查看了受损记录,而遗漏了未受损的正常飞行记录(第3种暗数据)。当全部数据被纳入考量时,温度与受损率的负相关关系清晰可见。
- 暗数据的力量:暗数据不仅带来威胁,也能为我们所用。例如医学中的双盲随机对照试验(利用第13种暗数据:故意屏蔽的数据)、抽样调查、数据平滑等技术,都是积极利用暗数据的例子。
- 就在我们身边:暗数据不仅存在于数字中,甚至一个拼写错误(如eBay上漏掉一个字母“p”导致啤酒售价天差地别)也能造成巨大损失。作者在此处完整列出了15种暗数据的分类清单。
第2章 探索暗数据:收集到的与没收集到的
- 来自各方的暗数据:数据收集有三种基本方法(全面收集、抽样收集、实验收集),均面临暗数据挑战。管理性数据(如信用卡交易、医疗记录)虽能反映真实行为,但存在数据废气、自我选择(如只有富人能产生数据)等问题。NHS数据共享计划因允许公众“选择退出”导致数据不全面。投资基金的幸存者偏差(表现差的基金被剔除,导致整体收益率虚高)是第2种与第7种暗数据的协同作用。
- 以小见大:统计调查基于大数定律,通过合理抽样可用小样本推断总体。但调查面临严重的无回应问题(第4种暗数据:自我选择)。1936年《文学文摘》预测大选失败,主因并非抽样框(电话簿)有误,而是支持者回应率不同导致的自我选择偏差。全球范围内调查回应率持续下降,且网络调查加剧了自我选择风险。不诚实的调查员甚至可能编造数据(“臆答”,第14种暗数据)。
- 实验数据:通过改变条件收集数据(如A/B测试、随机对照试验),能提供反事实信息。但实验面临“退出”问题,不同组别退出率不同会扭曲结果(幸存者偏差)。互联网公司广泛使用随机试验,但如Facebook情绪操纵实验引发了严重伦理争议(违背知情同意权)。
- 注意人性的弱点:人类认知偏差会导致暗数据产生。易得性偏差让人高估易想起事件的发生率;基率谬误让人忽视基础概率;合取谬误让人误以为具体事件比一般事件更可能发生;证真偏差让人只关注支持自己观点的数据而忽略反面证据;回声室效应则加剧了这种信念的自我强化。
第3章 定义与暗数据:你想知道什么?
- 定义差异与错误测量:定义不恰当会产生第8种暗数据(数据定义)。英国移民统计中,国际乘客调查与国民保险号码数据差异巨大,原因是“长期”与“短期”移民的定义不同;犯罪统计因警方记录与受害者调查范围不同而出现矛盾;阿尔茨海默病和自闭症发病率上升,部分原因是医学定义放宽和诊断技术进步。
- 你不能测量所有事物:无法测量所有特征会导致第5种暗数据(关键因素缺失)。泰坦尼克号生还率和死刑判决率的研究展示了“辛普森悖论”:整体来看与分组来看得出的结论完全相反,原因在于未记录的第三变量(如性别、受害者种族)在组间分布不均。这证明数据是否属于暗数据取决于你想问的问题。
- 筛查:不完美的筛查工具会产生假阳性(未患病被判为患病)和假阴性(患病被判为未患病)。假阴性成为暗数据,可能导致严重后果;假阳性则带来心理恐慌和不必要的检查成本。癌症筛查中的“病程长短偏差”使得缓慢生长的癌症更容易被筛查出来,造成发病率虚高的假象。
- 基于过往表现的选择:均值回归现象表明,极端表现(极好或极差)在后续往往会向平均值靠拢,因为初始表现中掺杂了随机偶然因素。仅凭过往最好表现来选择(如招聘、选基金)往往会失望,这种不确定性本身也是一种暗数据。
第4章 非故意的暗数据:说一套,做一套
- 大视界:测量无法无限精确,四舍五入不可避免。血压值末尾数字集中在0,不仅掩盖了真实细节,还可能导致误诊(将137记录为140,超过临界值)。顶端编码和底端编码(如工资只记为“10万以上”)也会隐藏真实分布。
- 汇总:计算平均数等汇总统计量会牺牲细节,属于第9种暗数据(数据汇总)。平均数无法反映数据的分散程度和分布形态,可能掩盖极端值(如1人年入千万与9人年入1万)。
- 人为差错:“胖手指”差错(如点错小数点)造成了多起巨额财务损失。计量单位混淆导致火星气候探测器坠毁。数据过时、人口普查员造假(臆答)等人为错误无处不在。特怀曼定律指出:任何看起来有趣的数字通常都是错误的。
- 仪器限制:测量仪器故障会产生虚假峰值(如风速计午夜重置产生的假风暴数据)。天花板效应和地板效应(仪器无法记录超过最大或低于最小的值)导致数据缺失。天文学中的马姆奎斯特偏差说明,较暗的遥远天体更难被观测到,从而扭曲对宇宙结构的认知。
- 连接数据集:合并多个数据集能产生巨大价值(如洛杉矶无家可归者救助计划),但也面临记录不匹配、格式不一致、重复记录等暗数据风险。
第5章 方略性暗数据:博弈、反馈和信息不对称
- 博弈:人们会利用规则漏洞获利(第11种暗数据:反馈与博弈)。如合法避税、学校为了提高排名而劝退差生或修改紧急情况定义、考试机构降低评分标准等。坎贝尔定律和古德哈特定律指出,当一项指标成为目标时,它就不再是一项好指标。
- 反馈:测量行为本身会改变被测量事物的数值。金融泡沫(如密西西比公司、郁金香泡沫、互联网泡沫)就是反馈机制扭曲数据的极端例子。犯罪地图在线系统导致人们因担心房价而拒绝报案,使犯罪地图只反映了“报案率”而非真实犯罪率。回声室效应通过反馈强化边缘信念,导致两极分化。
- 信息不对称:一方拥有比另一方更多的信息(第12种暗数据)。如二手车“柠檬市场”中,卖家比买家更了解车况,最终会导致市场崩溃。军事侦察和间谍活动也是为了消除信息不对称。
- 逆向选择和算法:机器学习算法可能因未看到所有相关数据而得出荒谬结论(如系统误以为哮喘能降低肺炎死亡率,实则因为哮喘患者被送入重症监护室得到了更好治疗)。法律禁止在信用评分和保险定价中使用性别等受保护特征(强制作为暗数据),但这可能导致对女性等低风险群体的事实不公平,引发保险业的“死亡螺旋”。
第6章 故意的暗数据:欺诈与欺骗
- 欺诈:欺诈的核心是通过隐瞒真相(第13种暗数据:故意屏蔽的数据)来获利。骗子利用人类“系统1”快思维的仓促判断进行欺骗。
- 身份盗用与网络诈骗:从早期的“垃圾桶寻宝”到现代的网络诈骗,本质都是窃取并滥用本应保密的个人数据。预付费诈骗(如尼日利亚419诈骗)通过虚构信息诱骗受害人不断付费。
- 个人财务诈骗:信用卡欺诈形式随技术演进而变化(从磁条到芯片再到非接触式支付),呈现“水床效应”(一处防范加强导致另一处犯罪增加)。
- 金融市场欺诈与内幕交易:内幕交易利用未公开的暗数据获取暴利。做假账(如安然事件)通过隐瞒债务和虚假盈利来误导投资者。无赖交易员(如尼克·利森)隐瞒越权交易导致银行破产。
- 保险诈骗:分为硬诈骗(蓄意制造事故骗保)和软诈骗(夸大真实索赔)。防范欺诈的成本必须与潜在损失平衡,复式记账法是确保交易透明的基本工具。
- 其他欺诈形式:洗钱通过“蓝精灵魔法”将大额非法资金拆分并合法化。庞氏骗局用新投资者的钱支付老投资者,直到资金链断裂。内部盗窃则利用职务之便隐瞒资金去向。
第7章 科学与暗数据:科学发现的本质
- 科学的本质:科学的基石是可证伪性,即通过收集数据与理论预测对比。暗数据是科学的根源。弗洛伊德的精神分析理论因拒绝接受反面证据而被视为伪科学。
- 早知道就好了:杰出科学家也会因暗数据犯错。开尔文因不知核聚变而错误估计地球年龄;庞斯和弗莱施曼的冷聚变因缺乏对照组数据而失败;鲍林因未获得X射线照片而错判DNA结构。医学上,前额叶切除术和关节镜手术曾被视为有效,后经严格随机对照试验证明无效。
- 暗数据碰出新世界:偶然发现的异常数据可能带来重大突破。如宇宙微波背景辐射的发现(最初以为是鸽子粪便干扰),以及X射线、青霉素的发现。
- 暗数据打开大视野:约安尼季斯指出“大多数研究发现都是错误的”。原因包括发表偏倚(期刊偏爱新颖结果)、p值篡改(多次测试不加校正,如同折磨数据直至招供)、根据已知结果提出假设(用产生假设的同一数据去验证假设)。这些导致高声望期刊的不可再现率更高。
- 隐瞒事实:科学不端行为包括恶作剧(如辟尔唐人伪造化石)、数据伪造(编造实验数据)、数据剪辑(修改数据以符合理论)、数据加工(只挑选符合理论的数据,如对密立根油滴实验的指控)以及剽窃。
- 撤回与可信度:论文撤回率上升,部分因为欺诈,部分因为警觉性提高。应对虚假事实和假新闻的方法是坚持追问数据来源:“这是谁告诉你的?”透明度是应对暗数据的重要武器,但需注意“透明”有时也意味着事物在你眼皮底下发生而你却未察觉。
第二部分 阐明和使用暗数据
本部分的核心主旨是:暗数据虽然危险,但如果我们能理解它的生成机制并掌握正确的处理方法,不仅能消除误导,甚至能将其转化为推动理解和决策的强大力量。
第8章 处理暗数据:让光照进来
本章重点探讨了当数据确实不完整时,我们该如何应对。作者指出,最重要的是理解数据“为什么”缺失,从而采取针对性的补救措施。
1. 核心策略:识别缺失机制(鲁宾分类法)
这是处理缺失数据的统计学基石。作者用通俗易懂的语言重述了唐纳德·鲁宾提出的经典分类,强调应对方法必须根据缺失的原因而定:
- NDD型(非依赖型/完全随机缺失):
- 特征:数据缺失是随机的,与任何已观测或未观测到的数据都无关。例如,因搬家、忙碌等与研究无关的原因退出实验。
- 对策:这是最理想的情况。缺失的数据只是减少了样本量,但不会造成偏差。可以直接忽略缺失值,仅用剩余数据进行分析,结论依然可靠。
- SDD型(可见依赖型/随机缺失):
- 特征:数据缺失的概率只取决于已被观测到的数据。例如,在减肥研究中,初始体重较轻的人更容易中途退出(我们看到了初始体重,知道它与退出有关)。
- 对策:不能直接忽略,但可以通过建立模型来解决。利用已观测到的数据(如初始体重)与结果(是否退出)的关系,推断出缺失值的分布,从而对总体进行修正和估计。
- UDD型(不可见依赖型/不可忽视的缺失):
- 特征:数据缺失的概率取决于未观测到的数据本身。例如,在减肥研究中,那些体重反而增加了的人因为羞愧而不愿回来复测(我们看不到他们的最终体重,而正是因为那个未看到的体重导致了数据缺失)。
- 对策:这是最难处理的情况。因为导致缺失的关键信息恰恰是不可见的。除非有外部信息或强假设,否则简单的统计方法无法解决,可能会得出严重误导性的结论。
2. 实用应对方法与工具
在明确了缺失机制后,作者介绍了一些具体的操作手段:
- 识别机制的策略:可以利用领域专业知识(判断某些人对数据是否敏感)、参考其他研究、进行统计测试(如分组比较),甚至尝试再次联系无回应者来推断缺失原因。
- 简单方法的陷阱:
- 完整案例分析:只保留数据完整的行。这在UDD和SDD情况下会导致严重偏差,且在大数据时代可能大幅削减样本量。
- 利用所有可用数据:根据不同变量分别使用所有非缺失值计算。这可能导致基于不同子集的结论相互矛盾。
- 数值缺失模式分析:将缺失情况本身作为一种特征进行分析,适用于特定场景。
- 获取额外信息的策略——“黄金样本”:
- 以金融信贷为例,银行通常不知道那些被拒申请人的真实信用状况(暗数据)。为了解决这个问题,银行可以有意识地抽取一个本该被拒绝的高风险群体发放贷款(随机化)。通过跟踪这些“黄金样本”的违约情况,可以建立一个更准确的预测模型,从而修正对整个潜在申请人风险的评估。
3. 特殊场景:生存分析
对于“事件发生前能持续多久”的问题(如设备寿命、婚姻存续期),如果实验对象在结束前未发生事件(如设备未损坏、人未死亡),这称为“截尾”数据。这需要特殊的生存分析技术来处理,而不仅仅是填补缺失值。
4. 数据质量校准与插补
- 校准:当测量仪器已知存在系统性偏差时,通过对比已知标准来校准数据。
- 插补:用估计值填补缺失数据。
- 简单插补:用平均值填补。简单但有风险,会人为降低变异性。
- 多重插补:更高级的方法。基于现有数据,生成多个合理的可能值来填补缺失项,从而反映不确定性。
- 回归插补:利用变量间的回归关系来预测缺失值。
- 热卡插补:从数据集中找到最相似(最近邻)的个体,用其值来填补。
5. 迭代与错误数据
- 迭代调整:在UDD等复杂情况下,有时需要通过迭代过程,先做假设填补数据,分析后再修正假设。
- 错误数据的处理:必须区分“缺失”与“错误”。错误数据(如笔误、仪器故障)不仅不起作用,反而会破坏分析。特怀曼定律提醒我们:任何看起来“有趣”或反常的数据,往往都是错误的。因此,数据清洗的第一步是识别并剔除或修正错误数据。
第9章 从暗数据中获益:重构问题
本章提出了一种极具革命性的观点:与其被动地修补缺失的数据,不如主动利用暗数据的思维来重构问题,甚至在某些情况下故意让数据保持“黑暗”状态,以换取更优的决策。
1. 隐藏数据的作用
- 对自己隐藏数据:随机对照试验(RCT)
- 这是主动利用暗数据的黄金标准。为了获得反事实信息(即“如果不治疗会发生什么”),必须让部分患者接受安慰剂或对照治疗。对于医生或患者来说,哪种药更好起初是“暗数据”,正是通过故意隐藏这一信息(双盲实验),才能消除偏见,得出最科学的结论。
2. 可能发生的事(反事实推理)
- 我们永远无法观测到“可能发生的事”(第6种暗数据),但我们可以通过设计(如RCT)或推理(如因果推断中的潜在结果模型)来模拟它。理解反事实是进行有效决策的核心。
3. 伪造与合成数据
- 数据平滑与插值:在已知数据点之间进行估算,填补了观测之间的“暗”间隙。
- 贝叶斯统计(想象的数据):
- 贝叶斯方法引入了“先验概率”(Prior)。这可以被看作是“想象的数据”或基于以往知识的假设。当观测数据稀少时,先验信息就像补充的暗数据,帮助稳定结论。随着真实数据的积累,先验的影响逐渐减弱。
4. 隐私与机密保护
- 通过让数据变得“暗”(如差分隐私技术),可以在保护个人隐私的同时,提取出群体的统计规律。这是一种为了保护权益而刻意制造暗数据的做法。
5. 从暗处收集数据
- 有时候,直接测量不可行(如非法活动、敏感信息),但可以通过代理数据来推断。例如,通过电力消耗来估算种植大麻的室内农场数量,通过网络搜索关键词来预测流感爆发。这就是利用“影子的数据”来洞察暗处的真相。
第10章 暗数据分类:走出迷宫之路
作为全书的总结章节,作者正式提出了暗数据分类法。这不仅是一个清单,更是一套用于诊断数据问题的思维工具。作者详细阐述了15种暗数据类型,并指出了它们之间的关联性和启示。
1. 暗数据的15种类型(详细阐述)
作者强调,这15种类型并非互斥,现实中的问题往往是多种类型的叠加。
- 基于收集与观测的类型:
1. 已知的缺失数据:知道谁没提供数据(如问卷未答)。
2. 未知的缺失数据:不知道有数据缺失(如幸存者偏差、欺诈漏网)。
3. 局部选择案例:只观测到了特定场景或样本(如只看失败的飞行记录)。
4. 自我选择:样本自行决定是否参与(如自愿回应的调查)。
5. 关键因素缺失:未测量起决定作用的第三变量(导致虚假相关)。
6. 或可存在的数据:反事实数据(未发生的另一条时间线)。
7. 因时而变:数据在收集过程中性质发生变化(如产品更新、年龄增长)。 - 基于定义与测量的类型:
8. 数据定义:定义不清或改变导致数据扭曲(如失业率定义的变迁)。
9. 数据汇总:汇总过程掩盖了个体差异(如平均值陷阱)。
10. 测量误差与不确定性:仪器精度、人为错误导致的偏差。 - 基于心理与策略的类型:
11. 反馈与博弈:测量行为改变了对象,或利用规则漏洞。
12. 信息不对称:一方掌握另一方不知道的信息。
13. 故意屏蔽的数据:为了公平或欺诈而故意隐藏(如双盲实验)。
14. 编造与合成的数据:造假数据、假新闻、臆答。 - 基于推理与使用的类型:
15. 推理僭越数据:将结论外推到数据不支持的领域(如用北半球数据推演南半球)。
2. 串联与互补
- 作者指出,这些类型之间存在紧密联系。例如,“信息不对称”(12)往往是“欺诈”(14)的温床;“自我选择”(4)会导致“已知的缺失数据”(1);“反馈与博弈”(11)会导致“因时而变”(7)。理解这种联系有助于识别复杂的暗数据问题。
3. 启示
- 警惕性:认识到暗数据的存在是第一步。
- 机制比来源更重要:不仅要知道数据缺了,还要知道怎么缺的(鲁宾分类)。
- 设计优于补救:在设计数据收集阶段就考虑到暗数据风险(如随机抽样、实验设计)比事后修补更有效。
- 工具箱:统计学家和数据科学家拥有一系列工具(如插补、模型调整、贝叶斯方法)来应对暗数据,前提是正确识别问题类型。
译者后记:发自暗处的光
总结中包含译者视角的补充,强调在数据时代,看见“看不见”的数据是一种至关重要的能力,正如本节标题所示,暗数据不仅是阴影,更是照亮信息世界盲区的光芒。
全书整体逻辑脉络梳理
- 提出问题(第 1 章):定义暗数据,用航天、医疗致命案例证明其巨大危害,列出 15 类完整框架;
- 分场景拆解成因(2—7 章):按照数据采集方式、统计定义、测量缺陷、规则博弈、刻意欺诈、科学研究六大维度,逐一拆解每一类暗数据的产生过程、现实案例、失真原理;区分无意产生 vs 人为主动制造两类暗数据;
- 解决方法论(8—9 章):先处理已造成偏差的缺失暗数据(识别缺失机制、插补、生存分析),再反向利用暗数据,将隐藏信息转化为实验、预测、隐私保护工具;
- 收尾总结(第 10 章):统一归类 15 种暗数据,形成可落地的识别自查框架;
- 贯穿全书核心主线:人们做决策、分析数据时,天然只关注可见记录,系统性忽略各类隐藏信息;暗数据不只是简单数据缺失,定义偏差、测量误差、规则操纵、刻意造假、遗漏关键变量等全部属于暗数据,是所有统计误判、经济损失、安全事故的底层根源;想要准确判断,必须持续主动排查 “看不见的信息”。