跳至正文

谁给科学打分

目录

核验图例:本篇每条承重引用后标注核验状态—— 主笔本人联网逐字复核; 调研一手全文/出版方权威摘要逐字提取、多源交叉印证、未经主笔逐字复核; 证据层级偏弱(二手转述/摘要级/未同行评审/付费墙未取正文/未经裁定的指控); 仅题名。凡未核处一律显式标注,不以强度冒充。

课题完成态:先把”科学的质控坏了”拆开

本篇不把”同行评议/引用指标好不好”当成一个可一次验收的命题,而追问一个更窄、更可判决的问题:

科学用来管自己质量的两台机器——同行评议(判一篇稿能不能进门)与引用指标(数一个人/一篇/一刊值多少)——各自有真实功能,但被讲成”过了同行评议=正确””高被引=高质量””影响因子=价值”这三层,各越了多远?截至 2026-07-20:过评议的论文有多可靠?引用数能不能代表质量?影响因子/h 指数能不能给期刊、论文、学者定价?当这些代理被拿去做招聘/晋升/基金的考核目标时,会发生什么?

结构胎记(一句压多物):把”有真实筛选功能的社会-技术过程(同行评议)”升格成”真理认证机”(gatekeeping→truth-certification)× 把”有真实信号的计数(引用/IF/h)”升格成”价值度量衡”(signal→value)。两侧共享同一次升格:过程/信号 → 认证/度量;而当认证/度量被当成优化目标,就落入本库测量代理篇早已形式化的 Goodhart 病——代理量被优化后背叛目标量

全文把命题分账为两台机器各五层、外加一层 Goodhart 落地与一层自指:

  1. 真锚层——同行评议实测能改善稿件、多数科学家仍信它;引用指标在其发生学用途(选刊/检索)内有效、是真实的关注度信号(反祛魅不等于否认这些,更不等于把评议打成”腐败俱乐部”、把指标打成”纯营销”);
  2. 概念层——”同行评议””发表””引用””影响因子””h 指数””质量””价值”是一堆同名不同物,必须先钉死;
  3. 半硬机制层——评审者一致性低、检错有限(同行评议);引用分布极度偏斜、受领域/类型/时间窗左右(指标);
  4. 软·被打穿层一(同行评议侧)——”过评议=正确”被 sting、撤稿、造假、掠夺性期刊四面打穿;
  5. 软·被打穿层二(引用指标侧)——”高引=质量””IF=价值”被偏斜、负面引用、马太效应、发明者自我告诫打穿;
  6. Goodhart 落地层——指标一旦成为考核目标即被 gaming(强制引用、自引农场、引用卡特尔),且对称落刀”不虚无化/不污名泛化”;外加自指层:本报告自己未经同行评议、以核验标记替代被引数、库存 KPI=篇数的自我 Goodhart 风险。

研究任务清单

  • [x] 重读项目协作规则(AGENTS.md)、调研流程、当前状态、报告模板;确认署名 Claude Opus 4.8、采用格式 v5。
  • [x] 完善课题:把”科学质控坏了”改写为带前提、带可反驳条件的分层承重问题,写定结构胎记与对称三向红线。
  • [x] 查重独占边界:与测量代理性 Goodhart 篇复制危机篇分工——不重做 Goodhart 理论/1975 归因/四分类/Skalse 形式化(归 06-22 §一/§二),不重做 NHST 机理与复制率(归 06-25),二者只作上游接口;本篇独占”学术评价两台机器(同行评议过程+引用指标 IF/h/citation)作为科研质量代理的域内判例”。
  • [x] 六捆并行一手取证:同行评议真锚+机制层 / 同行评议越界判例 / 引用指标史+发明者告诫 / 指标越界+Goodhart 判例 / 全库横切自指+虚无侧+去重 / 外锚核验+提示注入+归属纠错。
  • [x] 核同行评议真锚与机制:Baldwin 2015(Nature 1973 才设强制外审)、Baldwin 2018(”Cold War United States”)、Cole 1981(NSF 抽签性)、Bornmann 2010(ICC≈.34/Kappa≈.17)、Godlee 1998/Schroter 2008/Baxt 1998(检错率)、Goodman 1994/Mulligan 2013(改稿价值)逐字。
  • [x] 核同行评议越界:Bohannon 2013(157/304)+Eisen 批评、Sokal 1996、Grievance Studies、Fang 2012(67.4% 不端)、Wakefield 撤稿+Suelzer 2019(72.7% 负面引用)、Nature 2023(撤稿破万)、Shen-Björk 2015(掠夺性 42 万篇)逐字。
  • [x] 核引用指标史与告诫:Garfield 1955/2006、Seglen 1997(15%/50%/90%)、Hirsch 2005(h 自陈局限)、DORA、Leiden 2015 逐字。
  • [x] 核 Goodhart 判例:Brembs 2013(”bad scientific practice”)、Fang-Casadevall 2011(retraction index)、Fong-Wilhite 2017(强制引用)、Ioannidis 2019(citation farm)、Merton 1968(马太效应)逐字。
  • [x] 主笔亲核最承重引用:Garfield 2006(pdftotext 官方重印)、DORA GR1、Brembs、Ioannidis 2019 本人 WebFetch 逐字确认;Seglen/Leiden/Hirsch 因付费墙/扫描件/Wayback 封禁标 ◐、经双捆交叉。
  • [x] 对称双向红队:攻升格(过评议当真理、高引当质量、IF 当价值),攻虚无化(评议当纯剧场、指标当纯噪声、”全废”当出路),攻污名泛化(评议当腐败俱乐部、高引学者当投机者、批评者当酸葡萄)。

简短结论

母裁决:同行评议与引用指标是科学用来管自己质量的两台机器,二者都有真实功能——同行评议实测能改善稿件(Goodman 1994:34 项质量指标 33 项朝改善方向变,◐)、多数研究者仍视其为学术交流不可或缺(Mulligan 2013:”nine out of 10 authors believe that peer review improved the last paper they published”,◐);引用指标在其发生学用途内有效(Garfield 1955 发明”impact factor”本为书目控制与选刊,◐;DORA:”originally created as a tool to help librarians identify journals to purchase, not as a measure of the scientific quality of research in an article”,✓)。真的不是”两台机器坏了、该全废”,也不是”学术界腐败、守门人都是骗子”。但它们被抬成三层越界,且每层都被一手证据打穿。

越界一·”过了同行评议=正确/真”被打穿。同行评议本身晚近才制度化——连《Nature》都直到 1973 年 才由主编 David Davies 把外审设为发表的强制要求(Baldwin 2015,◐),”外审=科学合法性必要条件”这一观念 Baldwin 2018 判定”arose first in the Cold War United States“(◐)。而它的过滤力有硬上限:向 304 家开放获取期刊投一篇编造的漏洞论文,Bohannon 2013 报告”More than half of the journals accepted the paper, failing to notice its fatal flaws“(157 接受/98 拒,◐);过了评议照样撤稿——Fang 2012 证明撤稿中”67.4% … were attributable to misconduct“、纯错误仅 21.3%、欺诈类自 1975 年增约 10 倍(◐);教科书级反例是 Wakefield 199860175-4/fulltext) MMR-自闭症论文,经《柳叶刀》评议发表、被引逾千次,2010 年”we fully retract this paper from the published record“(◐)。过评议是”没被明显否决”,不是”已被证明为真”。

越界二·”高被引=高质量”被打穿。引用计数把”批判”与”背书”混为一谈:对已撤的 Wakefield 论文的引用研究(Suelzer 2019)发现 1153 条引用里”negative (838 [72.7%])“——最”高引”的论文之一,七成引用是在说它错(◐);Catalini 2015 独立证明负面引用真实存在(《免疫学杂志》约 2.4% 引用为负面,◐)。且引用本就随声望而非纯质量累积——Merton 1968 的马太效应:”work published by the scientists of higher rank is the more promptly and more widely cited“(◐影印直读)。

越界三·”影响因子/h 指数=期刊/论文/学者的价值”被打穿。引用分布极度偏斜,用期刊均值代表任一单篇在统计上站不住——Seglen 1997 实测”the most cited 15% of the articles account for 50% of the citations, and the most cited 50% of the articles account for 90%“,故”Assigning the same score (the journal impact factor) to all articles masks this tremendous difference—which is the exact opposite of what an evaluation is meant to achieve“(◐)。最有力的证人是发明者自己:Garfield 2006 白纸黑字”The use of journal impacts in evaluating individuals has its inherent dangers. In an ideal world, evaluators would read each article and make personal judgments“(Garfield 2006,✓主笔亲核);h 指数发明者 Hirsch 同样自陈”a single number can never give more than a rough approximation … especially in life-changing decisions such as the granting or denying of tenure“(Hirsch 2005,◐)。批评者(Seglen)、发明者(Garfield/Hirsch)、集体宣言(DORA 主笔亲核 ✓)、操作准则(Leiden 2015)在”不得以期刊/单一数字指标替代对个人与单篇的质化判断“上高度一致。更尖锐的是 Brembs 2013 的实证:期刊等级不但不预示质量,反而”is also a strong predictor of the rate of retractions“(✓主笔亲核)。

越界四·当指标成为考核目标,就按 Goodhart 定律 gaming 失效。这正是测量代理篇行 76 预留、复制危机篇行 229 点名的接口在学术评价域的完整落地:编辑为抬本刊 IF 而强制作者加引——Fong-Wilhite 2017 调查逾 12,000 应答,”roughly 20% of survey respondents have experienced coercive citation“、2017 复测”14.1% … report being coerced“(◐);极端自引与”引用农场”让指标”spurious and meaningless“(Ioannidis 2019,✓主笔亲核);Leiden 原则 9 用指标界自己的话点破了 Goodhart——指标会招致”gaming and goal displacement (in which the measurement becomes the goal)“(Leiden 2015,◐)。指标本身不是原罪,把它当目标去优化才是。

但对称到底:绝不虚无化、绝不污名泛化。同行评议不是纯剧场——它实测改善稿件(Goodman 1994)、多数研究者仍信它(Mulligan 2013);引用指标不是纯噪声——它在选刊/检索里有真用途,连最系统的批评者 Seglen 都只反对”外推到单篇/个人”、发明者 Garfield 引 Hoeffel 收尾”Impact Factor is not a perfect tool … but there is nothing better“(✓主笔亲核)。”全废指标、全废评议”是另一极端的越界,且没有更好的可扩展替代被普遍采用。同样不把评议污名为”腐败守门人俱乐部”(reviewer/editor 多为无偿劳动)、不把高被引学者一概打成”会做关系的投机者”、不把批评指标者打成”吃不到葡萄”、不把 gaming 个案当”整个学术界腐败”(Garfield/Hirsch 是发明者却带头反对滥用、Fang-Casadevall 自限”correlation does not imply causality”)。本篇不裁定任何个人品格。

一、承重墙·概念家族消歧表:先把七个词钉死

祛魅的第一刀永远是消歧。把下面七个词混用,越界就已在语言里发生:

精确所指 常被偷换成 偷换点
同行评议 peer review 稿件由领域同行评估、给编辑决策建议的过程 “质量保证/真理认证” 过程 → 认证
发表 publication 通过某刊编辑流程、进入公开记录 “正确/已被证实” 进门 → 为真
引用 citation 一篇文献在正文里指向另一篇的行为 “背书/认可” 指向 → 赞同(忽略负面引用)
影响因子 JIF 期刊前两年论文的篇均被引数(期刊层统计) “期刊质量/单篇价值/学者水平” 期刊均值 → 单篇/个人
h 指数 h-index 个人”有 h 篇各被引≥h”的单一数字 “学术水平的标量刻度” 粗略近似 → 硬门槛
质量 quality 方法可靠、结论被数据支持、可复现 “被引数/IF” 内容 → 代理数字
价值 value / impact 对知识、实践、后续研究的实际贡献 “关注度/可见度” 贡献 → 可见度

一句话:同行评议衡量的是”要不要放它进门”,不是”它是不是真的”;引用与 IF 衡量的是”多少人指向它/它在哪本刊”,不是”它有多好/它值多少”。每一次把左列念成右列,都是一次把有适用域的工具升格成无适用域的判决键。

六层×证据强度速览

机器 命题 证据强度 核验密度
同行评议 真锚 能改善稿件、主流仍支持 Goodman 1994 ◐/Mulligan 2013 ◐
同行评议 框架内硬 能滤掉部分明显不合格 半硬 由 sting 反向定界(Bohannon 36/304 有评审识别问题)◐
同行评议 半硬机制 评审者一致性低、检错有限 半硬·偏空 Cole 1981 ◐/Bornmann 2010 ◐/Godlee 1998 ◐/Schroter 2008 ◐/Baxt 1998 ◐
同行评议 软·被打穿 “过评议=正确” Bohannon 157/304 ◐/Fang 67.4% ◐/Wakefield 全撤 ◐/Shen-Björk 42万 ◐
引用指标 真锚 发生学用途(选刊/检索)有效、是关注度信号 Garfield 1955 ◐/DORA “librarians” ✓
引用指标 框架内硬 IF 在”选刊/图书馆采购”内有效 半硬 Garfield 2006 ✓
引用指标 半硬机制 偏斜/领域/类型/时间窗左右 IF 半硬·偏空 Seglen 15/50/90 ◐/Garfield 80/20 ✓/领域依赖 ◐
引用指标 软·被打穿 “高引=质量””IF=价值” Seglen ◐/Suelzer 72.7%负面 ◐/Merton 马太 ◐/DORA/Leiden/Garfield/Hirsch 四方一致 ✓/◐
两台机器 Goodhart 落地 指标成目标→gaming 失效 软·开放 Fong-Wilhite 20%/14.1% ◐/Ioannidis “spurious and meaningless” ✓/Leiden 原则9 ◐

二、机器一·同行评议:从”改稿真功能”到”过评议=真”的滑坡

2.1 真锚层:它确实有用,而且晚近才被神化

先立真锚,否则祛魅就滑成虚无。同行评议实测改善稿件Goodman, Berlin, Fletcher & Fletcher 1994(◐)对《Annals of Internal Medicine》改稿前后打分,”33 of the 34 items changed in the direction of improvement“,尤其在研究局限讨论、置信区间、结论口吻等”读者最依赖处”,结论”Peer review and editing improve the quality of medical research reporting“。态度面,Mulligan, Hall & Raphael 2013(◐)对逾 4,000 名研究者的国际调查发现外审”considered by most to be essential to the communication of scholarly research“、”Nine out of 10 authors believe that peer review improved the last paper they published“。[我们的断言] 这两条是本节的守真锚——祛魅的对象是”过评议=真”的升格,不是同行评议这件事本身。

但真锚的另一面是:“外审=科学固有、天经地义”本身是个神话Baldwin 2015(◐)考证,连《Nature》都是”It was not until 1973 that editor David Davies made external peer review a requirement for publication in Nature“,此前”a journal could be considered scientifically respectable even if its editors were known to eschew systematic external peer review“。Baldwin 2018(◐)进一步判定,”外审是科学合法性必要条件”这一观念”seems to have arisen first in the Cold War United States“,是科研经费公共问责压力下的建构。Csiszar 2016(⚠仅导语)为这一史观提供了通俗标题”Peer review: Troubled from the start”。[理论整合] 把这层立住,后面”过评议=真”的升格才显出它把一个半世纪的历史偶然读成了永恒律。

2.2 半硬机制层:一致性低、检错有限

同行评议的机制层比外行想象的空。评审者之间一致性很低Cole, Cole & Simon 1981(◐)把 150 份 NSF 申请交给新一组评审复评,结论是”whether or not a proposal is funded depends in a large proportion of cases upon which reviewers happen to be selected for it“——是否中选很大比例上取决于恰好抽到谁。Bornmann, Mutz & Daniel 2010(◐)对 48 项研究做元分析,评审间一致性”mean ICC/r² = .34, mean Cohen’s Kappa = .17“、自评”the IRR of peer assessments is quite limited“(按 Landis-Koch,Kappa .17 仅属”轻微一致”)。(诚实限定:广为流传的”经费评审一半靠运气”式原句未从 Cole 1981 付费正文逐字核到,此处用摘要等价表述,⚠。)

检错能力也有硬上限。三项在稿件里植入已知错误的对照实验一致地令人不安:Godlee, Gale & Martyn 1998(◐)植入 8 处弱点,评审平均只指出约 2 处(<25%),且盲审/署名”had any effect on rate of detection of errors“的结论是”没有”;Schroter 2008(◐)对 607 名《BMJ》评审,每篇植入 9 处重大错误,平均查出约 2.6–3.0 处,”Short training packages have only a slight impact“;Baxt 199870006-X)(◐)用虚构稿发现评审漏掉约 2/3 重大错误,且”Sixty-eight percent of the reviewers did not realize that the conclusions of the work were not supported by the results“。[一手逐字] 同行评议能滤掉一部分明显不合格,但它不是精密探测器,更不是测谎仪。

2.3 软·被打穿层:”过了同行评议=正确”的四面反例

  • Sting(对照投稿)Bohannon 2013(◐,正文经 Wayback 存档)向 304 家 OA 期刊投一篇有致命缺陷的假论文,截稿时”157 of the journals had accepted the paper and 98 had rejected it“,且”Only 36 of the 304 submissions generated review comments recognizing any of the paper’s scientific problems“,其中 16 篇明知有恶评仍接受。必须诚实标注争议:该 sting 只投 OA、无订阅制对照组,OA 旗手 Michael Eisen 批评”it’s nuts to construe this as a problem unique to open access publishing“、Bohannon 本人承认是”practical constraints”所限,且旗舰 OA 刊 PLoS ONE 恰恰拒了稿并指出其伦理问题Eisen 2013,◐)。故本篇用它承重的方向是 Eisen 的落点”peer review is a joke / simply doesn’t work“——问题在评议这台机器,不在 OA 模式。[有争议]
  • Hoax(恶作剧)Sokal 1996(◐)把一篇”liberally salted with nonsense“、只要”sounded good“且”flattered the editors’ ideological preconceptions“的假文投给《Social Text》并获刊。诚实限定:《Social Text》当年并无外审同行评议,故它证明的是编辑把关失守,不是盲审失守——用作 hoax 谱系的起点而非”同行评议放行”的直接证据。2017–2018 的 Grievance Studies 事件更贴题:20 篇投稿中 7 篇被接受(4 已刊+3 已录未刊),”狗公园”一文获审稿人”incredibly innovative, rich in analysis“的书面溢美(◐)。(广传的”被列为期刊周年代表作/特别表彰”一说未核到一手,⚠,不当已证事实写。)
  • 过评议仍造假/撤稿Fang, Steen & Casadevall 2012(◐)——2,047 篇撤稿中”67.4% of retractions were attributable to misconduct“(欺诈 43.4%、重复发表 14.2%、抄袭 9.8%),纯错误仅 21.3%,且”The percentage of scientific articles retracted because of fraud has increased ∼10-fold since 1975“。Wakefield 199860175-4/fulltext) 是最贵的一课:经《柳叶刀》评议、驱动全球疫苗恐慌、被引逾千次(Europe PMC 计 1170;Google Scholar 口径更高),2010 年整篇撤回”we fully retract this paper from the published record“,撤因是”consecutively referred”与伦理”approved”两处被证伪(◐)。撤稿量还在创纪录——Nature 2023(◐,导语级)”More than 10,000 research papers were retracted in 2023 — a new record“,并点名成因含”sham papers and peer-review fraud“。
  • 掠夺性期刊(付费即发,评议形同虚设)Shen & Björk 2015(◐)估计掠夺性期刊发文从 2010 年 5.3 万篇增至 2014 年约 42 万篇、约 8,000 家活跃期刊、平均版面费仅 178 美元。这把”绕过评议”从个案升为产业体量(Bohannon 的 304 家里就有 121 家取自 Beall’s list)。

2.4 改革不是废除,是重设”过门”的含义(防虚无化的活证)

祛魅不导向”废除同行评议”,而导向重设它。注册报告(Registered Reports)在看到结果前就评审、给”原则性接受”(IPA),使”能否发表”与结果正负脱钩,已有”over 300 journals“采用(COS,◐);eLife 2023(◐)宣布”we will no longer make accept/reject decisions at the end of the peer-review process“,改为对所有送审稿发表”Reviewed Preprints”+公开评语;BMJ(◐)实行实名+全过程公开评议。[理论整合] 这些改革恰恰承认了本节的裁决:既然”过门”不等于”为真”,就别把二元的录用/拒稿当成真理盖章,改成公开、分级、可续的评价。

三、机器二·引用指标:从”选刊工具”到”给人定价”的滑坡

3.1 真锚层:发生学原点是书目控制,不是给个人打分

Garfield 1955(◐,原排版)首次提出引文索引,原意是”a bibliographic system for science literature“”subject control of the literature“——检索、书目控制、追溯思想史、辅助选刊。他首次用”impact factor”一词时,指的是评估”a particular work and its impact on the literature and thinking of the period“,并明说”Such an ‘impact factor’ may be much more indicative than an absolute count of the number of a scientist’s publications“。(辨析:1955 是概念萌芽;期刊层 JIF 的计算法是 1972/1975 年 SCI-JCR 才成形,⚠勿写成”1955 即发明 JIF”。)DORA(✓主笔亲核)为这一原点背书:”The Journal Impact Factor … was originally created as a tool to help librarians identify journals to purchase, not as a measure of the scientific quality of research in an article“。[我们的断言] 守真锚:IF 在”帮图书馆选刊”里是忠实工具;祛魅的对象是把它外推到单篇/个人。

3.2 半硬机制层:偏斜、因果方向、领域/类型/时间窗

引用分布极度偏斜,用期刊均值代表任一单篇在统计上就站不住。 Seglen 1997(◐,双捆经 Wayback 免费全文交叉)实测”the most cited 15% of the articles account for 50% of the citations, and the most cited 50% of the articles account for 90% of the citations“、”the most cited half of the articles are cited, on average, 10 times as often as the least cited half“,故”Assigning the same score (the journal impact factor) to all articles masks this tremendous difference—which is the exact opposite of what an evaluation is meant to achieve“。发明者给出同构口径:Garfield 2006”The so-called 80/20 phenomenon applies, in that 20% of articles may account for 80% of the citations“(✓主笔亲核)。(两口径 15/50 与 80/20 是不同样本,非矛盾,并列时点明。)

因果方向被系统性念反。 Seglen 的招牌句是”Article citation rates determine the journal impact factor, not vice versa“——是单篇引用造就 IF,而非 IF 赋予单篇质量。核验校准(捆⑥独立复核):故本篇绝不写”IF 由期刊决定”,只写”IF 是期刊层统计、无法代表单篇”或直引”not vice versa”,以免倒置 Seglen 原意。[一手逐字] 此外 IF 还被与质量无关的技术因素左右:综述比例、论文长度、学科(”biochemistry and molecular biology articles were cited about five times as often as pharmacy articles”)、以及”an extremely short term index (citations to articles published only in the past two years)“带来的时间窗偏倚。Seglen 的结论落在”For evaluation of scientific quality, there seems to be no alternative to qualified experts reading the publications“,并引 Sidney Brenner:”What matters absolutely is the scientific content of a paper, and nothing will substitute for either knowing or reading it“。

h 指数的发明者自带免责声明。 Hirsch 2005(◐,arXiv 接收稿)定义 h 后即写”a single number can never give more than a rough approximation to an individual’s multifaceted profile … especially in life-changing decisions such as the granting or denying of tenure“、跨领域不可比”high h-indices in the life sciences are much higher than in physics“、”a high h is a reliable indicator of high accomplishment, the converse is not necessarily always true“、多合作者会”treated overly kindly by his/her h“。

3.3 软·被打穿层:”高引=质量””IF=价值”

高被引不等于高质量,因为引用计数把褒贬混为一谈。对已撤 Wakefield 论文的引用分析(Suelzer 2019,◐)发现 1153 条引用中”negative (838 [72.7%])“,且 2011 年撤稿后仍有”28.3%“引用不提撤稿——一篇被引逾千次的论文,多数引用其实在否定它。Catalini 2015(◐)从概念上坐实”引用≠背书”:《免疫学杂志》约 2.4% 引用为明确负面、7.1% 的被引论文至少收到一次负面引用。而引用的分布本就受声望驱动——Merton 1968(◐影印直读)的马太效应:”work published by the scientists of higher rank is the more promptly and more widely cited“、”a scientific contribution will have greater visibility … when it is introduced by a scientist of high rank“。[一手逐字]

IF/h 不等于价值,这一层的证人阵容罕见地一致:

  • 发明者:Garfield 2006(✓主笔亲核)”The use of JIFs instead of actual article citation counts to evaluate individuals is a highly controversial issue“”rather dubious considering the known skewness“”The use of journal impacts in evaluating individuals has its inherent dangers. In an ideal world, evaluators would read each article and make personal judgments“。核验校准(捆⑥):Garfield 是审慎派、非明令反对派(文末仍引 Hoeffel”nothing better”),故本篇写”承认高度争议、有内在风险”,不写”明令反对”。
  • 集体宣言DORA General Recommendation 1(✓主笔亲核)”Do not use journal-based metrics, such as Journal Impact Factors, as a surrogate measure of the quality of individual research articles, to assess an individual scientist’s contributions, or in hiring, promotion, or funding decisions“;截至 2026-07-20 已有 27,260 个人/机构、174 国签署(2012-12-16 ASCB 发起、2013-05 发布)。
  • 操作准则Leiden Manifesto 2015(◐)原则 1″Indicators must not substitute for informed judgement“、原则 7”Reading and judging a researcher’s work is much more appropriate than relying on one number“、原则 8 反对虚假精确(IF 印到三位小数”makes no sense“”only one decimal is warranted“)、原则 6 按学科归一(”数学顶刊 IF 约 3、细胞生物学顶刊约 30″);且自陈”Luminaries in the field, such as Eugene Garfield … are on record stating some of these principles“。
  • 实证反相关Brembs 2013(✓主笔亲核)”using journal rank as an assessment tool is bad scientific practice“,且”any journal rank (not only the currently-favored Impact Factor) would have this negative impact“、”journal rank is also a strong predictor of the rate of retractions“;Fang & Casadevall 2011(◐)定义”retraction index”,发现它与 IF”a surprisingly robust correlation … (P < 0.0001 by Spearman rank correlation)“。核验校准(捆⑥):Fang-Casadevall 只报相关、无 R 值、且自限”Although correlation does not imply causality“”preliminary investigation“——本篇引用带此 caveat,绝不写成”高 IF 导致撤稿”。

四、Goodhart 落地:当代理成了目标(接父篇,不重做理论)

到这里,两台机器的病合流成同一条定律。测量代理篇 §一/§二已把 Goodhart 理论做透——原始归因是 Goodhart 1975″Any observed statistical regularity will tend to collapse once pressure is placed upon it for control purposes“,通俗版”When a measure becomes a target, it ceases to be a good measure“实为 Strathern 1997 的转述(◐,父篇结论仍成立)。(另:管理学口头禅”What gets measured gets managed”常被误归 Drucker,实无实据、更近 Ridgway 1956,⚠若引用标”归属存疑”。)本篇不重造这套理论,只落地它在学术评价域的现行判例:

  • 强制引用(coercive citation):编辑要求作者加引本刊以抬 IF。Fong & Wilhite 2017(◐)逾 12,000 应答、18 学科,”roughly 20% of survey respondents have experienced coercive citation“、2017 复测”14.1% … report being coerced“,且”35.5% … added an author … even though the contribution of those authors was minimal“。(2012 年《Science》原文常引的精确值”20.6%”付费墙未核到一手,⚠。)
  • 极端自引与”引用农场”Ioannidis 2019(✓主笔亲核)”Extreme self-citations and ‘citation farms’ … make citation metrics spurious and meaningless“;自引中位数仅 12.7%(区间 0.0%–93.8%)。中性红线:高自引本身不等于不端(部分子领域天然自引率高、作者原文主张按学科分层看),只作”指标可被操纵”的证据、不点名个人。
  • 引用卡特尔与 IF 工程:分析性报道(Davis 2012,⚠博客/未裁定指控)举一例,两篇综述互引使某刊 IF 从 6.204 掉到 4.082;DORA(✓)权威定性”Journal Impact Factors can be manipulated (or ‘gamed’) by editorial policy“。中性标注:涉及的具名期刊未经正式学术不端裁定,表述为”被分析指出的引用模式”,留当事方不同解释的空间。
  • 政策层的退潮:中国 2020 年”破除 SCI 至上”改革被英文分析概括为”Farewell to ‘SCI worship’“(Zhang & Sivertsen 2020,⚠仅摘要),转向定性+定量结合。这与 DORA/Leiden 共同构成”IF 崇拜退潮”的全球背景。

一句合流裁决:Leiden 原则 9 用指标界自己的话写下了这一切——指标”change the system through the incentives they establish“、单一指标会招致”gaming and goal displacement (in which the measurement becomes the goal)“。这不是外人对指标的攻击,是造尺人对”把尺当成目标”的自我警告。

五、对称三向红线

  • 不升格(防神化):过评议≠正确(Bohannon 157/304、Fang 67.4% 不端、Wakefield 全撤);高引≠质量(Suelzer 72.7% 负面、Merton 马太效应);IF/h≠价值(Seglen 15/50/90、DORA/Leiden/Garfield/Hirsch 四方一致、Brembs 反与撤稿正相关);指标≠它要代理的东西。
  • 不虚无化(防废物论):同行评议实测改善稿件(Goodman 1994)、主流仍支持(Mulligan 2013)、能滤掉部分明显不合格;引用指标在选刊/检索里有真用途、是真实关注度信号;连最系统的批评者 Seglen 都只反对”外推到单篇/个人”;“全废指标、全废评议”是另一极端的越界,且没有更好的可扩展替代被普遍采用。
  • 不污名泛化(防扣帽):不把同行评议污名为”腐败守门人俱乐部”(reviewer/editor 多为无偿劳动、且改革在活跃进行);不把高被引学者一概打成”会做关系的投机者”;不把批评指标者打成”吃不到葡萄”;不把 gaming 个案当”整个学术界腐败”(发明者 Garfield/Hirsch 带头反对滥用、Fang-Casadevall 自限相关非因果);本篇不裁定任何个人品格。

对称金句(一句防升格、一句防虚无,两侧同时钉住)—— 防升格:Seglen 1997″For evaluation of scientific quality, there seems to be no alternative to qualified experts reading the publications“(◐)。 防虚无:Garfield 2006 引 Hoeffel”Impact Factor is not a perfect tool to measure the quality of articles, but there is nothing better and it has the advantage of already being in existence“(✓主笔亲核)。

六、命门·库存盘点(自指):这篇报告凭什么判别人?

这是元科学篇独有、别篇给不了的一刀——审判学术质控机器的这份产物,自己就没走学术质控机器。

① 本报告未经同行评议,它凭什么? 它凭一套替代的可信度机制:每条承重引用带一手来源+可点击链接+核验状态标记(✓主笔亲核/◐一手全文/⚠层级偏弱/○仅题名),把”不凭记忆”从口号变成逐条可审计的元数据(体例定义见泛心论篇首装的格式 v5)。这恰是对”citation=endorsement””发表=真理盖章”的一个具体反例与替代:它不靠期刊背书或被引数充当可信度,靠透明、可复核、可纠错。[我们的断言] 但要诚实——这套替代机制也有它自己的命门:主笔亲核只覆盖了一部分承重锚(本篇 ✓ 仅 Garfield 2006/DORA/Brembs/Ioannidis 等数条,Seglen/Leiden/Hirsch 因付费墙/扫描件/Wayback 封禁停在 ◐),”透明可审计”降低了但没消除错误;它规避了同行评议的黑箱,也放弃了同行评议偶尔能提供的领域专家深查。它不是更高的权威,只是一种不同的、把可信度外显出来的赌注。

② 本库自己的影响因子=篇数。 现库全 135 篇(128 主篇,index.md),每篇挂”机制裁决第 N 篇”序号,本篇即第 79 篇。如果哪天”多产”本身变成目标——为冲篇数而写、把序号当 KPI 去优化——本库就会对自己犯下它在别人身上诊断的病:把”机制裁决篇数”这个代理,当成”祛魅工作质量”这个目标。Goodhart 不放过任何举尺的手,包括这一只。 防线只有一条,和我们对所有滥用者说的一样:篇数是有用的信号,不是质量的证书;核验标记是有用的元数据,不是免检的背书。

③ 我们也在大量”引用”。 本库每篇都在给承重断言挂引用链接——但用的是核验加权(标注每条的亲核层级)而非计数。这既是对”引用≠背书”的践行(我们明确区分”引用它来承重”与”引用它来反驳”,如对 Wakefield/LK-99 的负面引用),也是一个提醒:一旦有人来数本库”引用了多少一手文献”当质量分,那个数字立刻就不再是好指标。

七、母裁决重述与灵魂句

母裁决:同行评议与引用指标是科学用来管自己质量的两台机器。真锚——评议实测能改稿、主流仍信它;指标在选刊/检索的发生学用途内有效、是真实的关注度信号。但被抬成三层越界并逐层被打穿:过评议≠正确(sting/撤稿/造假/掠夺性期刊)、高引≠质量(负面引用/马太效应)、IF/h≠价值(偏斜/发明者与宣言与实证四方一致);而当代理被当成招聘/晋升/基金的优化目标,就按 Goodhart 定律 gaming 失效(强制引用/自引农场/引用卡特尔)。关键分寸是对称到底:真的不是”两台机器坏了该全废”(评议真改稿、指标真是信号、无更好可扩展替代),也不是”学术界腐败、守门人是骗子”(无偿劳动、发明者带头反对滥用、gaming 是个案)。越界才是问题,评议与指标本身不是原罪;它们是有真实功能、却被误当真理认证机与价值度量衡的社会-技术过程。

灵魂句:我们造了两台机器替科学看门、给学问称重——一台判一篇稿能不能进门,一台数一个人值不值钱。可门里照样走出被撤上千次的假论文,而最重的那半边引用里,竟有七成是别人在说它错。于是我们越来越信那个数字,越来越不信读原文的那双眼——直到写下这些指标的人反过来求我们:别拿它当尺量人,去把文章读了。这两台机器最诚实的一刻,不是判谁进门、给谁标价,而是承认自己只是过滤器和信号,不是真理的门神和价值的天平;而它们这一生最大的危险,是被它们本要服务的那个系统,念成了目标本身。

八、元-元自指与对称双向红队

攻升格(A):有人会说”过评议/高引/高 IF 至少是质量的弱信号,聚合起来就可靠”。回应:弱信号在个体决策(招聘/晋升/单篇判断)上恰恰最危险,因为偏斜(Seglen 15/50)、马太效应(Merton)、负面引用(Suelzer 72.7%)让均值无法代表个案;DORA/Leiden/Garfield/Hirsch 四方独立得出同一结论——个人评估须回到读作品。

攻虚无(B):有人会走另一极端”同行评议是笑话、指标是骗局、全废了事”(Eisen 的”peer review is a joke”若被抽离语境即是此调)。回应:Goodman 1994 的改稿证据、Mulligan 2013 的主流支持、Garfield 引 Hoeffel 的”nothing better”、以及没有更好的可扩展替代被普遍采用这一事实,共同拦停虚无化。改革(注册报告/eLife/开放评议)不是废除,是重设”过门”的含义。

攻污名(C):有人会把结论读成”学术界烂透了、守门人是既得利益集团”。回应:本篇每个 gaming 判例都做了中性化处理——Ioannidis 自限高自引≠不端、Davis 卡特尔标注未裁定、Fang-Casadevall 自限相关非因果、Garfield/Hirsch 是发明者却带头反对滥用。批评一台机器的越界,与污名操作这台机器的人,是两回事。

自指落刀:本篇的母命题”两台机器被三层越界”本身会不会也是升格?诚实回答——半升格。”过程/信号→认证/度量”这个统一结构不是空的(它让我们在看到一个评价数字时先问”这是在衡量什么、被谁当成了什么”),但两台机器的机制层断裂是真的:同行评议的失效在社会过程层(一致性/检错/激励),引用指标的失效在统计层(偏斜/因果方向/归一化)。强行说成”同一台坏机器”会混淆两个不同的可证伪点。防恒真式刹车:只要坚持”评议有真改稿功能、指标有真信号价值”这两条真锚,本篇就不会滑成”凡评价皆无效”的虚无否决键——那恰是本库方法论封顶篇门楣上写的那条律法:别把有适用域的工具,升格成无适用域的否决键。

〇 红线留痕

  • 不升格:过评议≠正确·高引≠质量·IF/h≠价值·指标≠被代理物(逐层挂一手)。
  • 不虚无化:评议真改稿(Goodman 1994)·指标真信号(Garfield 原意/DORA “librarians”)·无更好可扩展替代·Seglen 只反外推。
  • 不污名泛化:无偿劳动非阴谋·发明者带头反滥用·gaming 个案非全领域腐败·不裁定个人品格。
  • 高风险声明:本篇是科学评价机制的体检,不构成对任何期刊、机构、学者的质量或品格裁定,不构成任何招聘/晋升/基金/投稿的决策建议。
  • 自指入账:本报告未经同行评议、以核验标记替代被引数、库存 KPI=篇数存自我 Goodhart 风险——均已显式标注。

来源清单

体例:作者 年份 · 题名 · 载体 · 标识 · 访问日期 2026-07-20 · 核验标记。链接为可点击全文/官方页/开放镜像。

同行评议侧

引用指标侧

Goodhart 落地/gaming

上游接口(本库,不重做)

  • 测量的代理性——横跨物理/生物/AI 的同一病(Goodhart 理论/1975 归因/四分类/Skalse 形式化)· 2026-06-22 · 库内一手
  • 复制危机/统计显著性的滥用大体检(复制率/发表数作 KPI 的 Goodhart 落点)· 2026-06-25 · 库内一手
  • 过度推销检测器与全库导航(方法论封顶·门楣律法)· 2026-07-20 · 库内一手

〔机制裁决第 79 篇·对称双向第 74 篇·section G 科学哲学/元科学·接测量代理性/复制危机/方法论封顶·全库第 136 篇〕