Tag: 净获益

  • 命理判定的门槛:个体命运断言需要多大的效应量与判别力

    📌 证据等级:A


    命理判定的门槛:个体命运断言需要多大的效应量与判别力

    如果”用出生时刻判定个体命运”是一个可以检验的科学命题,那么它必须先跨过一道门槛:其携带的判别信息至少要达到 AUC 0.75 甚至更高的量级,对应的效应量(OR)至少要 3 倍以上——而现代流行病学能测量的出生时刻效应,连这个门槛的十分之一都够不着。

    正文

    上一篇文章《出生时刻的信息量上限》从”实测”端算出出生季节效应携带的信息量(约 0.0002 比特),与命理”个体命运判定”所需信息量(10+ 比特)之间存在 3-4 个数量级的鸿沟。本文换一个角度,从”理论”端问:如果命理的个体断言是真的,它需要多大的效应量与判别力?

    一、判别力的理论上限:遗传力与患病率决定天花板

    基因组学个体化预测有一套成熟理论:任何预测因子的判别力(AUC)都存在绝对上限,由结局的遗传力(heritability)与患病率共同决定。Wray 等人 2010 年给出了最大 AUC 与遗传力、患病率的显式方程,并计算了 17 种复杂疾病的”理论天花板”:要达到 AUC 0.75,各疾病需要解释的遗传方差从 10% 到 74% 不等——高遗传力疾病相对”容易”,大多数复杂性状几乎不可能靠单一类别的预测因子达到高判别力。Dreyfuss 等人 2012 年进一步证明,即使不做任何分布假设,遗传预测准确度也存在数学上的硬上限。这条理论给命理命题的第一个约束:个体命运判定必须建立在”出生时刻信息”与命运结局足够强的关联之上,而这个关联强度有理论天花板。 出生时刻(八字)作为预测因子,其判别力上限同样受限于它解释了命运结局多少方差——如果它像实测那样只解释百分之零点几,那么无论命理逻辑多精致,其判别力都不可能超过 0.51。

    二、”够用”的门槛:AUC 0.7 不够,至少 0.75-0.8

    临床预测领域对”多少 AUC 才算够用”有大量讨论。流行的经验阈值是 0.7(可接受)、0.8(优秀)、0.9(杰出)——但 White 等人 2023 年在 BMC Medicine 上分析了 PubMed 中 306,888 个报告过的 AUC 值,发现分布在这三个阈值处出现明显”堆积”,而阈值之下”短缺”,提示大量研究者为报告”漂亮”的 AUC 而反复重分析数据(AUC hacking)。这说明 0.7/0.8/0.9 不仅是经验分界,还成了被系统博弈的对象——真正经得起检验的模型,门槛应该更高。

    Vickers 的决策曲线分析(DCA)方法论给出了更严格的回答:AUC 本身不回答”模型是否值得用”,必须结合净获益(net benefit)与阈值概率(threshold probability)评估——”根据预测采取行动”的好处是否超过”误判”的代价。Vickers 与 Holland 2021 年的综述明确指出:“AUC 要多少才够用”没有统一答案——取决于使用场景与代价结构。

    那为什么本文仍坚持”至少 AUC 0.75″?因为命理不是医疗筛查,它的断言(职业、婚期、健康事件)没有明确的”行动与代价”框架,却承诺了极高粒度的个体判定。对照临床最强的预测工具多基因风险评分(PRS)——Dudbridge 2013 年的理论分析表明,即使标记面板解释了全部遗传力,要达到临床有用的 AUC(约 0.75),多数复杂疾病也需要数十万到数百万的样本规模来估计效应。命理的输入只是出生时刻,若它的判别力要达到 PRS 的天花板,意味着出生时刻必须携带相当于”全部遗传信息”的预测力——这在效应量上是不可能的。

    三、把门槛换算成效应量:AUC 0.75 需要 OR 4 以上

    AUC 与效应量(OR)的换算有标准公式。对一个二分类暴露(如”这个八字是否吉命”),AUC 0.60 约对应 OR 2.0;AUC 0.70 对应 OR 约 4.0;AUC 0.80 对应 OR 约 9-10。也就是说,命理断言要达到 AUC 0.75 的门槛,出生时刻暴露的效应量至少需要 OR 4-5——”吉命”与”凶命”之间的风险差 4 倍以上。

    对照现实:出生季节与精神分裂症的关联 OR 1.05,出生月份与数十种疾病的关联 OR 1.02-1.10,即使按效应最强的纬度带计算,出生时刻相关暴露的 OR 也极少超过 1.3。实测效应与所需效应量之间隔着约 20-30 倍。更严峻的是:即使 OR 达 3.0 的强生物标志物,加入模型后的 AUC 增量也可能微乎其微,因为判别力还取决于暴露在人群中的分布与结局患病率。

    四、另一个被低估的门槛:多重断言的一致性

    命理通常一次性做出数十个独立断言(事业、婚姻、子女、健康、财运、流年……)。一个很少被讨论的统计学含义:每个断言都是一个独立的判别问题,都要跨过各自的 AUC 门槛。 如果单个断言的判别力只有 AUC 0.55(已远超实测的 0.51),”同时准确命中 10 个维度”的概率接近零。要让”整套判词”在统计上可辩护,每个维度都要相当高,这进一步抬高了总门槛。还有一个实践陷阱:用”事后觉得准”评价命理是无效的。临床预测领域尚且存在 AUC 系统性高估,命理断言更缺乏预注册、盲法与多重检验校正。任何关于命理判别力的主张,都必须先通过盲法+预注册的检验,才能进入与 AUC 门槛对话的环节。

    五、结论:门槛立起来了,现实够不着

    把这条理论链收拢:命理”个体命运判定”若要成为可辩护的科学命题,出生时刻暴露的判别力至少要达到 AUC 0.75(对应 OR 4-5),且每个断言维度都要独立达标;而现代流行病学实测的出生时刻效应(OR 1.02-1.10,AUC 0.51)连门槛的十分之一都不到。这条鸿沟不是”统计方法不够先进”造成的,而是理论天花板与实测效应量共同决定的。科学能做的,是把门槛本身立清楚——不是断言命理”不可能”,而是给出一个可以被检验、被反驳的量化标准。

    证据与局限

    已验证: 遗传预测判别力存在由遗传力与患病率决定的绝对理论上限(PMID 22827772, 20195508);PRS 达到 AUC 0.75 需要解释大部分遗传方差且需海量样本(PMID 23555274);决策曲线分析框架下”AUC 多高才够用”取决于净获益与代价结构而非 AUC 本身(PMID 17099194, 33676020);报告中的 AUC 存在 0.7/0.8/0.9 阈值堆积的系统性高估证据(PMID 37667344);稀有事件下 AUC 的可靠性由事件数而非事件率决定(PMID 41224138)。

    部分验证: AUC-OR 换算公式有成熟方法学(Chinn 2000 等),但实际判别力还受暴露分布与患病率影响,需个案计算。

    待验证: 出生时刻(时辰粒度)暴露的效应量是否在任何疾病上达到 OR 3 以上;命理多个断言维度之间的相关性是否允许”部分维度达标”;命盘评分操作化后在临床模型基线之上能否带来 NRI/净获益增量(对应 backlog #419)。

    相关阅读

    证据等级: A
    参考文献: PMID 22827772, PMID 20195508, PMID 23555274, PMID 17099194, PMID 33676020, PMID 37667344, PMID 41224138