跳至正文

法庭物证真的能锁定唯一的人吗

目录

母裁决:痕迹能排除许多来源,也能让某一来源比其他来源更受支持;但从“很像”到“就是它”,中间那一步必须由已知真值的盲测、完整分母、适用范围与可审核的推理承重,不能由“唯一”“识别”或“法院采纳”替它走完。

零、先看结论

0.1 七项裁决

命题 裁决 置信度
“司法鉴定科学”整体上都能锁定唯一来源 不成立。 这是方法、材料与推断层级差异极大的一组实践,不是一个共享同一效度的单一学科
潜指纹比较只是主观猜测、没有实证区分力 不成立。 多项大型黑箱研究显示真实区分力;但错误非零、阈值主观、个体差异明显,不能升级为绝对个体化 中高
枪弹/工具痕有一个可用于所有案件的“行业错误率” 不成立。 黑箱结果随枪型、弹药、检材质量、鉴定人、结论量表和无结论分母显著变化
人体皮肤上的咬痕可以可靠排除或不排除某名嫌疑人 当前证据不支持。 NIST 2023 判定三个必要前提均缺乏数据承重
显微毛发“相符”可以识别某个人 不成立。 现行 DOJ 规范只允许可能来源意义上的纳入、排除或无结论,并明令不得作来源识别
DNA 是不会错、可直接证明行为与有罪的金标准 不成立。 高质量单一来源 DNA 是成熟正对照;复杂混合、转移方式、活动层与实验室过程仍须另审
法院准许作证就说明方法已被科学验证 不成立。 Rule 702 是法律准入门槛;方法基础、可靠实施、个案意见与可采性是四个问题

0.2 分项成熟度

本篇使用四档分析尺。它不是 NAS、NIST、PCAST 或法院的官方评级:

  • A: 多项经验研究支持明确用途,关键误差和适用范围可量化;
  • B: 有实质经验支持,但外部效度、阈值或个案表达仍受明显限制;
  • C: 有限的分类/筛查价值,但来源归属所需基础不足;
  • D: 高质量审查显示,预定来源比较用途缺乏足够科学基础。
方法与用途 本篇评级 当前最稳妥的结论 不能跨越的边界
潜指纹,已知样本与潜痕来源比较 B 在已测试条件下有实质区分力;错误识别低但非零,且会在少数鉴定人和困难材料上集中 不能说零错误、排除世上所有来源;一个研究平均率不能移植到个案
枪弹/工具痕来源比较 B− 多项黑箱显示多数判断方向正确,错误识别真实存在;完整结果必须含大量无结论 没有单一行业率;NIST 的枪械科学基础总评截至本轮仍未发布
人体皮肤咬痕的来源比较 D 可记录损伤,或在别的临床问题中使用牙科知识 现有数据不支持用咬痕准确排除/不排除某个人
人类显微毛发比较 C(来源识别为 D) 可把已知样本列为可能来源、排除或给无结论;宜与 DNA 等证据结合 不能个体化或识别来源,不能给无依据的数值权重
高质量单一来源 DNA A 在明确质量体系和统计模型下,对来源命题可给校准的概率性支持 仍不自动证明转移方式、活动、责任或有罪
简单双人/复杂 DNA 混合物 A− 至 B/个案条件化 取决于贡献者数、模板量、随机效应、软件、验证范围与备择命题 不能继承单一来源样本的无条件“金标准”标签

0.3 证据标签与地域边界

  • 文献较稳结论: 原始实验、正式标准、政府技术评审或判例能够直接支持;
  • 理论整合/推断: 本篇把多份材料连接后作出的分析,不冒充来源原话;
  • 本篇判断: 规范性取舍或评级,公开说明所用尺;
  • 仍不确定: 数据不够、取回失败、标准未发布或外推范围未知。

科学部分虽有跨法域意义,法律与报告规范主要核对美国联邦体系及美国标准组织。本篇不概括中国、英国、欧盟各自的司法鉴定制度,也不构成法律意见或任何具体案件鉴定意见。

一、完善后的课题与事前承诺

1.1 研究问题

母问题不是“司法鉴定是不是科学”,而是潜指纹、枪弹工具痕、咬痕和显微毛发在法庭上究竟能支持哪一级结论:

  1. 两份材料在若干可观察特征上相似;
  2. 相似程度支持同源命题多于异源命题;
  3. 可以把来源锁定到某一个人、某一把枪或某一个物体;
  4. 可以进一步回答是谁实施了行为、谁负法律责任或谁有罪。

本篇逐级审查五本账:名号账、方法效度账、错误率分母账、法庭翻译账、判决后纠错账。

1.2 主样本、对照与明确不做

主样本是潜指纹、枪弹/工具痕、人体皮肤咬痕和显微毛发;DNA 只作校准对照。本篇不覆盖法医病理、毒理、纵火、血迹形态、鞋印、笔迹、声纹、数字取证和全部实验室学科;不重做本库的目击证词/虚假记忆篇;不根据媒体报道裁具体案件;不把证词越界自动写成错误鉴定、错误定罪或无罪。

1.3 开工前写下的四个防偏假设

  • 唯一性跳: 物体或身体表面的高度变异,被直接当成从残缺痕迹中可靠识别唯一来源的能力;
  • 错误率跳: 受控研究中的条件化平均率,省略检材难度、无结论和样本选择后,被翻译成个案里的近零风险;
  • 可采性跳: 法院允许专家作证,被公共叙事读成科学共同体已经完成验证;
  • 反向虚无跳: 若干学科或历史证词严重越界,被推成“所有司法科学都是伪科学”或“DNA 之外一律无用”。

证据若显示多中心、近案件难度、预先规定判据的独立黑箱研究稳定给出低错误率,本篇必须升级对应方法;若现行标准已禁止旧式绝对语言,本篇必须区分历史问题与当前规范;若官方复核只确认表述越界,就只能停在表述越界。这三条约束均在取证前写下。

二、从一条痕迹到一项定罪,中间有六道门

2.1 “每把枪不同”不是准确度实验

特征比较至少要连续通过六步:

  1. 来源变异: 不同人或物是否通常留下不同特征;
  2. 转移与保存: 现场痕迹是否忠实保留了足够特征,而不是被压力、角度、表面、损伤或时间扭曲;
  3. 测量与特征选择: 鉴定人或算法能否稳定看见、记录同一批信息;
  4. 决策性能: 面对不知道答案的同源与异源材料,判断有多准确;
  5. 表达校准: 报告用语是否只说到实验支持的强度;
  6. 案件事实: 来源命题能否再支持接触、行为、责任或有罪。

证明第一步,不能替代第二至第六步。PCAST 2016 对主观特征比较最重要的贡献,正是要求用鉴定人不知道真值的黑箱研究直接测第四步,而不是用物体“独特”、从业资历、实验室采用或同行共识代替准确度。PCAST 2016 原始报告

2.2 四层不能互相冒充

层级 真正要问的问题 主要证据 最常见冒充
方法基础 方法在明确用途与条件下是否准确、可重复、可再现 黑箱研究、验证、实验室间研究、误差与不确定性 用认证、历史悠久或“大家都这样做”代替
实施可靠性 该实验室、该鉴定人是否可靠执行 质量体系、能力测试、盲测、设备/软件版本、复核记录 用方法总体有效替本次操作背书
个案意见 这份检材究竟允许多强的结论 原始图像/数据、检材质量、备择命题、适用验证样本 从“特征相似”跳到“只有他可能留下”
法律可采性 在某法域与案件中能否交给事实裁判者 Rule 702、判例、举证与程序规则 把准许出庭当科学真实性认证

NISTIR 8225 明确提醒:即使方法层具有科学基础,也不足以证明具体案件中的结果可信。这个分层是全篇最重要的总尺。

2.3 重复自己、同事同意、答对真值是三件事

  • 重复性: 同一鉴定人再次面对材料,是否给同样结果;
  • 再现性: 不同鉴定人面对同样材料,是否给同样结果;
  • 准确性: 判断是否与独立已知的来源真值一致。

一群人稳定重复同一偏差,可以很一致却不准确;某人偶然答对,也不证明方法可重复。真正的验证必须保留真值。

三、2009、2016 与 2026:不能把历史诊断冻成永恒判决

3.1 NAS 2009 是起点,不是 2026 现状

2009 年美国国家科学院报告的历史性判断是:除核 DNA 外,当时没有其他司法方法被严格证明能稳定并以高确定度把证据连接到某个特定个体或来源;报告同时承认各分支证据基础并不相同,潜指纹已有的研究与协议多于咬痕。它击中了“权威先于验证”的结构缺口,但不能替代 2009 年后逐项更新。National Academies 正式书目与在线全文

3.2 PCAST 2016 把黑箱试验放上承重位

PCAST 把方法基础与个案实施分开,并要求主观方法通过未知真值黑箱研究测量假阳性、假阴性和灵敏度。它还指出:100 次试验观察到 0 次错误,不等于错误率为零;在简单二项条件下,单侧 95% 上界仍约为 3%。最有用的不是某个学科的 2016 年定格,而是没有经验检验的经验主张不能靠共识变有效这一原则。PCAST 2017 补充报告

3.3 DOJ 的反驳有一半必须保留

DOJ 2021 正式回应认为,PCAST 把黑箱设为近乎唯一门槛过窄;一个总体错误率不能适用于所有实验室、鉴定人和案件,因为材料难度、测试知情、个人阈值和质量控制不同。这个外推批评是成立的,也得到后续研究支持;但“不能无条件外推”不等于“方法已经充分验证”。DOJ 对 PCAST 的正式声明

理论整合/本篇判断: 对主观特征比较,未知真值的经验性能研究是不可替代的核心证据;研究数量、样本代表性、分母与外推范围仍需逐项审。PCAST 防止“没有测就宣称可靠”,DOJ 防止“测到一个平均数就贴遍所有案件”,两把刀都要留。

四、错误率最容易被藏在分母里

4.1 三种分母回答三个问题

  • 全部呈现(PRES): 面对所有任务,硬错误出现多频繁;可含无价值和无结论;
  • 可比较(COMP): 剔除“无价值”,但保留作过比较后的无结论;
  • 确定结论(CALLS): 只在识别/排除中计算方向性错误。

无结论既不能一律算正确,也不能一律算错误。它是风险阈值、材料难度和机构政策共同产生的结果。最诚实的报告同时列出错误识别、正确排除、无结论/无价值三格,再说明采用哪个分母。

4.2 七项研究的分母账

研究 异源硬错误/全部相关呈现 异源硬错误/确定结论 同源硬错误/全部相关呈现 同源硬错误/确定结论
Ulery 2011 潜指纹 6/4,083 = 0.147% 6/3,628 = 0.165% 450/5,969 = 7.54% 450/4,113 = 10.94%
Miami-Dade 2014 潜指纹 42/1,398 = 3.00% 42/995 = 4.22% 235/3,138 = 7.49% 235/2,692 = 8.73%
Hicklin 2025 潜指纹 23/11,394 = 0.202% 23/7,971 = 0.289% 118/2,830 = 4.17% 118/1,889 = 6.25%
Baldwin/Ames I 弹壳 22/2,178 = 1.01% 22/1,443 = 1.52% 4/1,090 = 0.367% 4/1,079 = 0.371%
Ames II 弹头 20/2,842 = 0.704% 20/981 = 2.04% 41/1,405 = 2.92% 41/1,117 = 3.67%
Ames II 弹壳 26/2,835 = 0.917% 26/1,401 = 1.86% 25/1,420 = 1.76% 25/1,081 = 2.31%
BulletBB 2024 弹头 26/1,917 = 1.36% 26/576 = 4.51% 18/967 = 1.86% 18/594 = 3.03%

这些数字不是同一总体参数,不能排成“谁最科学”的排行榜。潜指纹三项研究的候选生成、任务结构和错误定义不同;枪弹研究覆盖的枪型、弹药、弹头/弹壳和质量不同;每名鉴定人又重复作答,普通独立二项模型会低估聚类不确定性。

五、潜指纹:有真实区分力,但“来源识别”仍不是绝对个体化

5.1 三项大型黑箱给出的不是同一个数字

Ulery 2011。 169 名在职鉴定人共作 17,121 次决定;非同源候选来自含逾 5,800 万人的 IAFIS 相似候选。对“可用于识别”的异源比较,完整矩阵为 3,622 次正确排除、455 次无结论、6 次错误识别,共 4,083 次;同源为 3,663 次识别、1,856 次无结论、450 次错误排除,共 5,969 次。六个错误识别来自五人,没有两名鉴定人对同一材料重复同一错误。Ulery et al. 2011,NIST 托管全文

这项研究支持低但非零的错误识别,也暴露 7.54% 的错误排除。其独立重测显示盲复核有潜力,但同源错误有一部分可被另一鉴定人复现;“没有重复某个错误”不能写成“复核必然抓住”。Ulery et al. 2012

Miami-Dade 2014。 109 人产生 4,536 次 ACE 结论。异源矩阵为 953 次排除、403 次无结论、42 次错误识别。报告认为 42 次中 35 次“看起来像”报错手指/掌区的文书错误,但无法确定;系统对外输出报错位置本身也是错误,不能在看见结果后把 35 次悄悄删除。若全保留,全部相关比较为 3.00%,只看确定结论为 4.22%;若把 35 次事后剔除,则只看确定结论为 7/960 = 0.73%。本篇并列报告,不替任何一方挑最好看的口径。NIJ/OJP 原始报告

Hicklin 2025。 156 名在职鉴定人对 FBI NGI 搜索获得的候选作出 14,224 次响应。异源 11,394 次中,1,955 次无价值、7,948 次排除、1,468 次无结论、23 次错误识别;其中 13 次由同一参与者作出。没有一个错误识别被另一鉴定人重复,错误排除则有 15% 被重复。大型数据库候选并未令观察到的平均错误识别明显高于 2011 研究,但这个结论高度依赖一个异常参与者,志愿样本也不能代表全国鉴定人。OJP 书目与摘要论文 DOI

5.2 现行标准确实后撤了,但后撤措辞不是新验证

ANSI/ASB Standard 013, First Edition 2025 建立五档结论。“来源识别”被定义为观测数据对同源命题提供“显著更强支持”,同时禁止:

  • 声称两枚印痕就是同一来源或排除全部其他来源;
  • 声称零/可忽略错误率、绝对或 100% 确定;
  • 把个人信心或职业生涯案件数当准确度;
  • 仅凭摩擦嵴“唯一性”证明结论。

但该标准又明确不覆盖鉴定人如何评估证据强度,也不覆盖机构如何定义、验证选择结论的标准。换言之,它修好了法庭语言的上限,没有单凭一份术语标准补完决策阈值的经验校准

DOJ 2020 潜指纹 ULTR 仍允许“来源识别”,甚至把它写成鉴定人认为异源概率小到可忽略;同一文件同时承认该意见不是统计导出、没有与所有其他印痕比较,并禁止唯一性、个体化、零错误与绝对确定。DOJ 潜指纹 ULTR

本篇判断: 潜指纹不是“无科学基础”,也不是“科学已锁定唯一的人”。它是一种有黑箱支持、但依赖人的阈值且必须条件化表达的来源支持工具,评级 B。

六、枪弹/工具痕:不是随机猜测,也没有一个可旅行的“1%”

6.1 Ames I 与 Ames II:低硬错误和高无结论同时为真

Baldwin/Ames I 的异源弹壳比较为 1,421 次排除、735 次无结论、22 次错误识别,共 2,178 次;全部呈现口径是 1.01%,只看确定结论是 1.52%。22 次错误中 20 次来自五名鉴定人。NIJ 技术报告正式论文全文

Ames II 使用 173 名在职志愿鉴定人和刻意较难的材料:

材料与真值 识别 三档无结论合计 排除 硬错误
弹头同源,n=1,405 1,076 288 41 41 次错误排除
弹头异源,n=2,842 20 1,861 961 20 次错误识别
弹壳同源,n=1,420 1,056 339 25 25 次错误排除
弹壳异源,n=2,835 26 1,434 1,375 26 次错误识别

弹头异源无结论达 65.5%,弹壳异源为 50.6%。所以“全部呈现中的错误识别低于 1%”与“方法能明确处理多数困难异源材料”不是同一句话。完整 AFTE 档位下,不同鉴定人的平均再现性对同源约 67.3%、异源约 36.5%,多数分歧发生在确定结论与无结论之间。Monson et al. 准确度全文重复性/再现性论文

6.2 BulletBB 2024:总率被材料组合制造

BulletBB 的基线数据覆盖 49 名鉴定人、3,156 次比较、1,240 组不同材料。异源 1,917 次中有 65 次无价值、550 次排除、1,276 次无结论、26 次错误识别;同源 967 次中有 33 次无价值、576 次识别、340 次无结论、18 次错误排除。NIST 论文页

NIST 2025 工作组报告 明确说,这项观察性、探索性研究不是为了产生可推广到所有鉴定人与弹头的单一总率:

  • 决策分布随枪械型号、弹药和弹头损伤显著变化;
  • 49 名志愿者不能代表全体;两人贡献超过一半错误识别,三人贡献近一半错误排除;
  • 18/49 人即使机构政策允许,也从不对同型号枪械作排除,推高异源无结论;
  • 调查中仅 12% 的机构总是盲复核,27% 总是非盲复核,其余只复核部分结论;
  • 没有错误识别被另一鉴定人重复,多数错误排除也未重复,工作组因此建议所有结论 100% 验证,并尽量盲法。

报告要求引用结果时注明 PRES、COMP 或 CALLS 分母,并按枪型、弹药和损伤分层。它没有宣布方法无效,也没有给一个“真实行业率”。

6.3 2023 CTS 压力测试:惊人数字成立,但只能作窄结论

2026 年 PNAS 新论文重析了一次 2023 年 CTS 能力测试。PNAS 开放全文CTS 原始报告AFTE 调查报告 的可复算账是:

项目 错误识别 正确排除 无结论 有效回答
Item 2,同类异源 57 88 135 280
Item 3,同类异源 51 92 137 280
Item 5,同类异源 53 92 135 280
合计 161 272 407 840
  • 19.2% = 161/840,是三个同类异源挑战项目的回答层错误识别比例
  • 21.8% = 61/280,是提交者中至少错误识别一次的人数比例,不是每次比较的错误概率;
  • 只看识别或排除,错误识别为 161/(161+272) = 37.2%;PNAS 文中的“可高达 35%”不能按合并口径复现;
  • 近一半回答为无结论;它不能被偷偷算成正确,也不能与错误识别混成一类。

AFTE 未发现换样证据,并明确承认鉴定人作了真实错误;但它没有证明其他质控问题不存在。它同时发现不同测试套装的纹痕质量有差异、同源已知弹头复现性偏低,并要求 CTS 强化质控。调查只有 119/280 份有效问卷,错误者覆盖 15/61,3D 检查也仅覆盖很小且非随机的材料子集。因此最准确的解释是:这次测试暴露了困难材料、鉴定阈值、机构政策、测试预期与验证方式共同造成的系统风险,不能把 19.2% 外推成行业、个人、个案错误率或某案的证据似然比。

这次事件足以击穿“实践上不可能错”的说法;它不足以单独判整个枪弹痕迹学无效。PNAS 对能力测试设计、共识评分、非盲复核的批评有力,但其对 AFTE“排除其他质控问题”的概括过强。

6.4 当前状态:语言限制已在,独立总评仍未落地

DOJ 枪弹/工具痕 ULTR 允许来源识别、排除和无结论,却同时承认结论是鉴定人意见,不是统计测量或与全部枪械比较所得;禁止唯一性、个体化、排除全部来源、零错误、无依据数字、绝对/100% 确定。

截至 2026-07-31,NIST 科学基础评审总页 仍把枪械评审列为 forthcoming;NIST 枪械评审项目页 也未发布最终 NISTIR 8353。未发布不能被解释成“方法无效”,也不能预支成“独立评审已经背书”。

本篇判断: 物理痕迹与实证区分力是真的;统一阈值、总体代表性、操作错误率和结论强度仍不完整。评级 B−。

七、咬痕:问题不是“不能唯一化”而已

NIST IR 8352 最终报告 审查的是人体皮肤上的咬痕来源比较,不是用完整牙科病历识别人类遗骸,也不是对全部法医牙科学的否定。

来源比较必须同时依赖三个前提:

  1. 人类前牙排列在个体层面足够独特;
  2. 这些特征能稳定、准确地转移到皮肤;
  3. 鉴定人能从扭曲痕迹中准确恢复并解释它们。

NIST 判定三项都缺乏数据支持,并进一步认为现有资料连“准确排除/不排除某人”都不支持。它不是说“已经证明所有牙列都不独特”,而是说唯一性没有被证明,转移与解释也没有建立可靠性能

支持这一裁决的不是几个著名错案,而是承重链本身:

  • 皮肤会因弹性、身体部位、姿势、运动、肿胀、愈合与摄影而非线性变形;
  • 受控尸体研究仍会产生高变异,且可能高估真实案件准确度;
  • 39 名分析者判断 100 张案件照片时,只有 8% 的案件在三个基础问题上达到 90% 一致;这是一致性,不是准确性,但连“是不是人类咬痕、信息够不够”都高度分歧;
  • NIST 没有给出可普遍适用的假阳性率,因此不能编一个“咬痕错误率 X%”。

文献较稳结论: 人体皮肤咬痕的来源比较缺乏足够科学基础,评级 D。记录损伤、治疗伤者、用完整牙科记录识别遗骸是不同任务,不受这一结论自动否定。NIST 出版页

八、显微毛发:能说“可能来源”,不能说“就是他”

8.1 方法边界

显微毛发比较观察颜色、髓质、色素、直径、鳞片等宏观和微观特征。相符表示已知样本提供者可列为可能来源,也表示其他人的毛发可能共享同一特征范围。

PCAST 核对的 2002 FBI 病例样本中,80 个被显微判断为不可区分的阳性关联,有 9 个后来被线粒体 DNA 排除为异源,即 9/80 = 11.25%。这不是随机黑箱试验,也不是普遍假阳性率;它能支持的窄结论是:显微相似不能承受个体来源识别,历史上对其区分力的估计过强。PCAST 2016,Hair Analysis 部分

8.2 FBI/DOJ 历史复核测的是证词越界,不是方法错误率

FBI 2015 公告 的精确分母是:

  • 257/268 = 95.9%:截至当时审到、FBI 检验人曾给出入罪性证言的审判案件中,至少有一项科学性错误陈述;
  • 26/28 = 92.9%:纳入复核的检验人中,至少一次作过错误证言或写过错误报告。

FBI 2019 根因公告 说复核团队识别并审查了 23,547 宗案件,但没有公布一个新的最终精确分子/分母,只概括至少 90% 的已审证言有错。23,547 不是证言数、阳性关联数或已证实错误数,不能拿来做 257/23,547。

错误陈述主要是把毛发关联说成排除其他所有人、给无基础的概率权重,或以职业生涯案件数证明本案正确。它不等于 95.9% 的毛发来源判断错误、95.9% 的被告无罪或 95.9% 的定罪由毛发造成。

8.3 现行规范已明确划线

DOJ 现行毛发 ULTR 只允许 inclusion、exclusion、inconclusive。纳入只表示可能来源;文件逐字明确:显微毛发检验不是来源识别的基础。它还禁止唯一性、个体化、排除所有来源、零错误、无依据数值权重和绝对确定。

本篇判断: 毛发显微比较可作有限分类与筛查,评级 C;个体来源识别评级 D。历史复核最重的教训是有限观察被法庭语言放大,不是“显微镜看毛发完全无用”。

九、DNA 对照:真正成熟的方法也必须写边界

9.1 为什么高质量单一来源 DNA 是正对照

PCAST 认为高质量单一来源核 DNA 的方法基础已经建立:实验流程可明确定义,等位基因与群体频率资料允许在备择命题下给出概率性证据权重。它展示了来源推断应有的结构:清楚的命题、数据库、质量控制、验证、数值模型与限制,而不是“鉴定人看过很多,所以确定”。

9.2 复杂混合物不能继承无条件金标准

NIST IR 8351 最终报告 对 DNA 混合物给出更精细的边界:

  • 两名或以上贡献者,只要随机效应、等位基因共享或低模板使基因型不确定性显著增加,就可能成为复杂混合;
  • 似然比是在特定模型、备择命题、协议与算法下生成的数值,不是直接从样本“量出来”的唯一真值;
  • 概率基因分型是当前子来源层最有力工具,但个案适用性应由复杂度相近的已知真值样本验证;
  • 公开验证资料的元数据、协议和条件仍不足以让外部人员独立评估所有实践的可靠程度;这不等于所有软件无效;
  • 能力测试多集中于高模板单一来源和简单双人混合,不能代表低模板、多贡献者困难样本。

最关键的一刀是推断层级:某人的 DNA 被检出,首先回答“样本对子来源命题提供多少支持”;它不自动回答 DNA 何时、如何转移,也不证明此人实施了被调查活动。

9.3 DNA 也有人因与过程错误

成熟的方法仍可能遇到样本混淆、污染、软件版本、备择命题选择、解释和报告错误。NIST 2024 DNA 人因报告 明确把人类分析员置于系统中。方法基础强本案不可错从来不是同一句话。

校准结论: 高质量单一来源为 A;受控的简单双人混合可接近 A;复杂混合按系统、实验室与样本降为条件化 A−/B;转移、活动与责任必须另立证据链。

十、人因:偏差是系统属性,不是品格判决

10.1 为什么“专业人士会保持客观”不够

NISTIR 7842 潜指纹人因报告 把偏差视为正常信息处理的系统风险,而非蓄意不诚实。真实案件中的总效应量仍未被充分测出,因此本篇不说“所有鉴定都被偏差污染”;但机制、实验迹象和官方事故足以要求流程隔离。

一项常被引用的 2006 年探索性研究,让少量指纹鉴定人再次看到自己曾认定同源的材料,并提供相反案件情境;多数人改变了判断。原始论文 DOI 这项样本很小,不能外推一个行业偏差率;它支持的是“专家判断可受任务外信息影响”这一存在性命题。

10.2 Mayfield:一个系统失效病例,不是总体错误率

DOJ OIG 的 Brandon Mayfield 官方报告 记录:FBI 将马德里爆炸案袋上潜指纹误认成 Mayfield,三名 FBI 鉴定人和一名法院指定专家均被罕见相似性误导;西班牙警方后来识别出真正来源,Mayfield 被关押两周后释放。

OIG 发现鉴定人从已知样本反向解释模糊潜痕、循环强化相似、轻视差异;这不是蓄意不当,而是当时流程的系统问题。2011 OIG 跟踪 记录 FBI 后来修订 SOP、强化记录,并对仅凭单一潜痕的来源识别要求强制盲复核。

Mayfield 证明“多名专家同意”仍可能相关性地同错,也证明程序可据事故改进;它不能给潜指纹一个总体假阳性率,更不能抹掉大型黑箱中的真实区分力。

10.3 比“提醒客观”更有用的控制

  1. 由案件管理员隔离与任务无关的前科、口供和其他证据;
  2. 先独立检查、记录未知检材,再看已知样本;修改必须留痕;
  3. 复核者不知道初检结论、初检者身份和无关案情,且复核不只抽“识别”;
  4. 把已知真值样本事前不告知地嵌入日常案件流程,测个人初检与最终实验室报告两层;
  5. 保留原图、标注、软件版本、阈值、冲突与纠正轨迹;
  6. 报告完整决策矩阵,不用“职业生涯零错误”代替数据。

NISTIR 8282 对线性顺序揭盲的核心原则,是先记录未知材料,再接触参考材料。它不能消除全部偏差,但能让变化可见、让第二意见更独立。

十一、法庭语言:规范已经后撤,标签仍可能走得比数据远

11.1 目前允许与禁止说什么

学科 当前有限表达 明确不能说
潜指纹 DOJ 允许来源识别/排除/无结论;ASB 2025 把来源识别定义为数据对同源提供显著更强支持 排除全部其他来源、零/可忽略错误、绝对/100%、只凭唯一性、个人信心等于准确
枪弹工具痕 DOJ 允许来源识别/排除/无结论,必须承认是鉴定人意见、非统计穷举 唯一化、个体化、零错误、无依据数值、绝对确定
显微毛发 纳入为可能来源、排除、无结论 来源识别、排除所有人、无基础概率权重
人体皮肤咬痕 可记录损伤;来源比较尚无足够科学基础 不能把专业指南或法庭传统写成已验证的排除/不排除能力
DNA 在明确命题、数据库、模型和验证范围内报告统计权重 把来源似然比说成有罪概率,或从检出直接跳到活动与责任

DOJ ULTR 总页 说明司法部已审查 2023 Rule 702 修订,并认为现行 ULTR 不需因此修改。ULTR 是 DOJ 检验人的质量控制底线,不自动约束所有州、地方或私人实验室,也不是方法效度证明。

11.2 “Identification” 本身存在跨标准张力

NIST OSAC 通用词典的 Identification 条目 把它定义为归入能够可靠达到的最具体类别,并提醒不宜用该词在解释中传达证据来源;学科标准却仍使用“source identification”。2025 ASB 指纹标准进一步规定:可以说观测数据显著更支持同源,却不得断言两印痕由同一来源制作。

本篇判断: 这是实质性语言改革,也是残余语义风险。专业定义可把“来源识别”降格成支持强度标签,普通听者却很容易按字面听成“来源已经识别”。最稳方案不是只背诵标签,而是同时给出比较命题、观察基础、研究条件、错误矩阵与禁止外推

十二、法院守门:可采不是科学认证

12.1 Daubert、Joiner、Kumho 的分工

  • Daubert v. Merrell Dow Pharmaceuticals 要求联邦法官审查科学证言的相关性与可靠性,并把可检验性、同行评议、错误率、标准和一般接受度列为灵活因素,不是机械清单;
  • General Electric v. Joiner 允许法院审查数据与最终意见之间是否存在过大的分析跳跃;
  • Kumho Tire v. Carmichael 把守门责任扩展到技术性与其他专业知识,传统经验不能豁免可靠性审查。

这些判例规定谁审、审什么,不是对潜指纹、枪弹或咬痕的实验验证。

12.2 2023 Rule 702 修订收紧了什么

美国法院 2023 修订官方文件 要求提出专家证言的一方以“更可能如此”的标准证明:证言有帮助、基于充分事实或数据、源自可靠原则与方法,且意见体现了这些方法对本案的可靠应用。

委员会说明专门指出,许多法院过去错误地把充分基础和可靠应用一概当作陪审团的“权重问题”;对司法特征比较,法官应尽可能获得已知或潜在错误估计,并把意见限制在可靠应用能支持的推断范围。准入门槛不要求先证明专家最终一定正确,却也不能只凭资历把过强结论交给陪审团。

诚实边界: 本篇没有系统编码美国联邦与各州 2023 年后所有可采裁定,因此不声称法院已经普遍完成或普遍失守;这里只核对规范门槛。

十三、纠错账:四个事件不能混成一个百分比

层级 问题 本篇可确认的实例 不能自动推出
表述越界 证词是否超过科学支持 FBI 毛发复核 257/268 审判案件含至少一项错误陈述 比较结果本身一定错误
鉴定错误 来源判断是否与真值冲突 Mayfield 指纹误认;黑箱中的硬错误 一定造成错误定罪
司法后果 错误是否影响搜查、羁押、判决 Mayfield 被羁押两周;毛发复核触发通知与案件重审流程 当事人一定无罪
平反/改判 法院是否撤销定罪或释放 必须逐案查判决、其他证据与因果链 可由方法错误率直接推算

毛发复核之所以重要,不是因为它给出了“显微毛发 96% 会错”,而是它展示了一个机构如何界定越界语言、搜索历史案件、通知相关方、分析根因并改写现行规范。FBI/DOJ 复核范围页

理论整合: 判决后纠错的最大难题是可追溯性。若原始图像、解释步骤、证词记录、软件版本和受影响案件目录没有保存,再正确的新标准也无法自动找到旧案。纠错能力因此不是科学基础之外的行政附录,而是司法鉴定系统可靠性的组成部分。

十四、对称红队:两边最强论证都不能删

14.1 支持方最强论证

  1. 摩擦嵴与枪械表面确会留下有信息的物理图样,不是法庭想象;
  2. 多项大型、已知真值黑箱中,正确判断远多于硬错误,潜指纹和枪弹并非随机猜测;
  3. 研究常刻意使用相似候选或困难材料,并移除案件中的同侪复核,个人黑箱率未必等于实验室最终报告率;
  4. 错误集中于少数鉴定人,独立复核常未复现错误,说明训练、筛查与盲复核可以实质降险;
  5. 2020–2025 年现行规范已禁止过去最夸张的唯一性、零错误和绝对确定语言。

14.2 批评方最强论证

  1. “物体独特”从未直接校准残缺痕迹上的决策阈值;
  2. 志愿鉴定人、测试知情、材料选择和缺失回答限制外推;少数异常人足以改变罕见错误的平均率;
  3. 无结论可吸收困难题,只报全部呈现中的低硬错误会隐藏方法的有效输出率;
  4. 非盲验证会制造相关误差,Mayfield 证明多名专家可以共同确认同一错误;
  5. “极强支持”“异源概率可忽略”等词仍可能给听者一种数据并未量化的概率印象;
  6. 咬痕和显微毛发说明,一个领域可长期拥有专业组织、标准和法庭传统,却仍缺来源归属所需基础。

14.3 裁决

支持方赢得了“潜指纹与枪弹有实质信息价值、不能一概废除”;批评方赢得了“唯一来源、通用错误率和绝对法庭语言没有被这些研究承重”。咬痕不能借潜指纹的数据得救,潜指纹也不能因咬痕失守被连坐。司法鉴定必须逐方法、逐用途、逐结论层级审判。

十五、读一份鉴定报告时,真正该问的十个问题

  1. 具体方法是什么,结论回答来源、转移、活动还是责任?
  2. 同源与异源两个备择命题是否写清?
  3. 有无未知真值、近似本案难度的验证研究?
  4. 原始计数是什么;分母含不含无价值与无结论?
  5. 检材质量、候选如何生成、材料类别与验证样本是否相似?
  6. 该鉴定人和实验室有无盲能力测试、冲突与纠错记录?
  7. 初检与复核是否真正独立,复核者看见了什么?
  8. 原图、标注、修改、软件版本和阈值是否可由另一专家审计?
  9. 报告标签在该学科中怎样定义,普通语言是否会被误听成更强主张?
  10. 即使来源命题成立,从来源到活动、责任和有罪还缺哪些证据?

这不是要求每个案件给出一个虚假的精确概率,而是要求不确定性在哪里,就把它写在哪里

十六、什么新证据会改变本篇

16.1 会升级潜指纹或枪弹

  • 按从业者完整名册随机抽样、多中心、预注册、公开匿名原始响应;
  • 从真实案件谱系随机取材,并把已知真值样本无缝嵌入日常工作,使初检与复核均不知在测试;
  • 同时测个人判断率、盲复核检出率和最终实验室报告率;
  • 标准化结论阈值后,确定结论比例与跨鉴定人再现性同时提高,而非靠更多无结论压低错误;
  • 独立于执法机构、专业协会与供应商的团队复现;
  • 经外部验证的质量/相似度指标能够事前分层预测错误并给出校准权重。

16.2 会进一步降级

  • 嵌入式盲测发现错误显著高于公开黑箱,或错误在复核后仍被正式报告;
  • 常见材料上不同鉴定人重复同一错误,而非只在极端材料或少数人集中;
  • 预注册多中心实验稳定显示任务外案情改变最终方向结论;
  • 现行能力测试无法发现异常鉴定人,或机构不保存冲突、修改和纠错轨迹;
  • NIST 最终枪械评审发现机械复现、亚类特征、阈值或总体代表性存在未解决的系统缺口。

16.3 咬痕要从 D 升级,门槛更高

必须先证明前牙特征的相关群体分布、活体皮肤在案件条件下的转移函数,再由独立、多中心、未知真值黑箱显示分析者能稳定且准确地区分来源;只增加案例系列、共识指南或更漂亮的叠图不够。

十七、诚实空位与研究限制

  1. 本篇不是全司法鉴定百科,只裁四种人工特征比较并用 DNA 校准;
  2. 法律分析限美国联邦门槛,没有逐州、逐国编码;
  3. 没有全国鉴定人总体名册与随机案件谱系,黑箱率的现实外部效度仍未知;
  4. 没有足量、长期、嵌入日常案件的双盲系统测试,最终实验室报告错误率不能从个人黑箱直接推出;
  5. NIST 枪械科学基础最终报告尚未发布;本篇拒绝预支结论;
  6. CTS 23-5262 未提交者约占四分之一,已发套装难度分布也未被全量独立重建;
  7. FBI 毛发复核的精确 257/268 是 2015 年进行中子集,2019 结案公告未给新的最终精确分母;
  8. 本篇没有用错案数据库估总体因果率,也没有把新闻报道当判决原文;
  9. 多份标准是规范性文件,能证明“要求怎样做”,不能单独证明“现实已经怎样做”;
  10. 本篇评级是分析工具,不是法律结论、执业评价或对任何在世鉴定人的品格判断。

十八、关键来源分级

A. 总纲、科学基础与法律

  1. National Academies 2009:Strengthening Forensic Science — 国家科学院综合评审,历史基线;
  2. PCAST 2016 正式报告 — 方法基础、黑箱与分项判断;
  3. PCAST 2017 补充 — 对正式异议的回应;
  4. DOJ 2021 对 PCAST 的正式声明 — 最强机构反方,须按利益位置阅读;
  5. NISTIR 8225 科学基础评审框架 — 方法、实施与个案分层;
  6. Federal Rule of Evidence 现行规则入口2023 修订官方文件
  7. DaubertJoinerKumho Tire — 美国最高法院官方扫描。

B. 潜指纹与人因

  1. Ulery et al. 20112012 重测
  2. Miami-Dade 2014,NIJ/OJP
  3. Hicklin et al. 2025,OJP 书目与摘要
  4. NISTIR 7842 潜指纹人因
  5. DOJ OIG Mayfield 报告
  6. ANSI/ASB 013-2025 指纹结论标准
  7. DOJ 潜指纹 ULTR

C. 枪弹/工具痕

  1. Baldwin/Ames 技术报告正式论文
  2. Monson/Ames II 准确度论文
  3. Hicklin BulletBB 2024,NIST
  4. NIST BulletBB 工作组 2025
  5. Albright & Scurich 2024 黑箱方法批评Khan & Carriquiry 2023 缺失数据审计
  6. CTS 23-5262 原始结果AFTE 调查与勘误Scurich & Albright 2026 PNAS
  7. DOJ 枪弹/工具痕 ULTR
  8. NIST 科学基础评审状态页

D. 咬痕、毛发与 DNA

  1. NIST IR 8352 咬痕最终评审
  2. FBI 毛发复核 2015复核范围2019 根因结案
  3. DOJ 显微毛发 ULTR
  4. NIST IR 8351 DNA 混合物最终评审
  5. NIST IR 8503 DNA 人因

十九、任务清单与完工核对

A. 去重、定义与范围

  • [x] 重读项目记忆入口、current-state、runbook、报告模板与双版验收流程;
  • [x] 全库检索司法鉴定、法庭科学、指纹、咬痕、枪弹、毛发、DNA、Daubert 与 Rule 702,确认无专篇;
  • [x] 与目击证词、复制危机、同行评议、测量代理和因果推断篇划清边界;
  • [x] 在取证前冻结主样本、五本账、完工判据与改判条件。

B. 总纲与四种方法

  • [x] 取回 NAS 2009、PCAST 2016/2017、DOJ 正式回应、NIST 框架与现行评审状态;
  • [x] 对潜指纹三项大型黑箱逐格复算原始计数和三种分母;
  • [x] 对枪弹 Ames I、Ames II、BulletBB 与 CTS 23-5262 复算,并审计支持方与批评方;
  • [x] 取回 NIST 咬痕最终评审、FBI/DOJ 毛发复核与现行 ULTR;
  • [x] 取回 PCAST 单一来源 DNA 判断与 NIST DNA 混合物最终评审。

C. 从实验室到法庭

  • [x] 取回 Rule 702、2023 修订说明、Daubert、Joiner、Kumho Tire 原文;
  • [x] 取回 DOJ ULTR、ASB 013、OSAC 词典并制作允许/禁止用语表;
  • [x] 核对 NIST 人因、顺序揭盲、盲复核与 Mayfield 官方记录;
  • [x] 建立表述越界/鉴定错误/司法后果/平反四层纠错账。

D. 对称红队与交付

  • [x] 写支持侧最强论证,不把黑箱试验中的真实区分力抹掉;
  • [x] 写批评侧最强论证,不用个别错案冒充总体错误率;
  • [x] 对所有承重数字记录分子、分母、无结论处理、样本与外推限制;
  • [x] 标出 PNAS 2026 的 35% 复算异常、Item 4 人数差异及 AFTE 质控概括过强;
  • [x] 记录取回失败与尚未发布材料,不用二手数字填空。

E. 最终交付

  • [x] 完成 Markdown 单一事实源;
  • [x] 生成裁决风与经典静态 HTML;
  • [x] 验证两版正文一致、经典版无脚本、无公式/代码渲染残留、标签与外链属性齐全;
  • [x] 更新研究索引、backlog 与 current-state。

二十、最后一句

法庭科学最危险的时刻,不是鉴定人说“我不知道”,而是一个原本有边界的相似性判断,经过“识别”“唯一”“合理科学确定性”三次翻译后,听起来像世界上只剩一个可能来源。真正可靠的制度不消灭“不知道”;它把不知道、错在哪里、谁复核过、何时应重开旧案,都变成记录的一部分。