服务调研关于联系
← 返回商業調查
2026-05-22內容架構·

論文工廠人類知識生產的百年流水線

楔子:一封早於耿同學十個月的匿名 PubPeer 帖子

故事的真正起點,不是一位短影片博主。

2025 年 6 月,一個名叫 PubPeer 的英文學術網站上,兩位匿名研究者貼出了同濟大學生命科學與技術學院院長王平團隊那篇登上《Nature》的論文——《Human HDAC6 senses valine abundancy to regulate DNA damage》。

帖子很短,幾張電泳圖的局部對比,附一句冷靜的話:"圖像存在不可解釋的局部重複。"

PubPeer 是學術圈一種特殊的存在:任何人可以匿名指出已發表論文裡的疑點,作者和期刊都收得到通知。它是這十年最重要的"後出版同行評審"基礎設施之一。

但 PubPeer 上的批評是英文的,藏在專業角落,圈外幾乎無人知曉。

整整十個月,沒有人接力。

直到 2026 年 4 月。


一位叫"耿同學講故事"的科普博主,把那篇 PubPeer 帖子翻成了中文,並加上自己的逐幀拆解影片,同步發到 B 站、抖音、微信視頻號等多個平台(截至 2026 年 5 月,B 站約 188 萬粉絲、抖音約 154 萬粉絲)。他放大圖片、對照像素、統計條帶形狀,複刻了那兩位匿名研究者早就指出過的問題:

他給出了一句讓全網會心一笑的評論:

"強烈建議王教授下次造假使用隨機數生成器。"

緊接著,首都醫科大學校長饒毅——這位以敢言著稱的分子生物學家——在公眾號"饒議科學"連發三篇長文,公開質疑王平團隊兩篇頂刊 Nature 論文涉嫌原始數據造假。饒毅的下場是關鍵的破圈一擊:短影片平台上的拆解影片是民間輿論,饒毅文章是學界自身的承認。

5 月 6 日,同濟大學通報:免去王平院長職務,降兩級;論文第一作者金佳麗解除聘用。

緊接著多米諾骨牌倒下:南開大學陳佺、中山大學康鐵邦與鄺棟明、上海大學蘇佳燦——已被實名公開舉報的傑青/長江學者,至此達到 5 例。

5 月 17 日,耿同學再次發布影片,宣布手頭還握著同濟、華東師範、湖南大學、中山大學4 所高校 5 位"傑青"的新一批造假證據,公開喊話:"給你們一次自查整改的機會,拒不整改,下一錘再來。"

傑青是什麼概念?國家自然科學基金"傑出青年科學基金"獲得者,是中國學術圈青年學者的最高頭銜之一,相當於"準院士預備役"。長江學者是教育部的對標頭銜。這些被點名的學者,背後都至少掛著這樣一頂帽子。

Nature 官方的回應是一句相當謹慎的話:"已注意到該論文的批評意見,正在審慎評估。"


更值得玩味的,是耿同學這個人本身。

他本名耿洪偉,吉林大學生物學本碩,北京航空航天大學生物醫學工程學院博士在讀——讀到第五年,2025 年,他從北航退學。坊間流傳的版本是"被導師為難、退學、反手開始打假"。

這是一條非典型的人生路徑:他不是體制外的"草根",他是體制內出走者。一個被這個系統打磨過五年又主動放棄博士學位的人,再用他在體制內學到的所有眼力,回頭審視這個系統。

故事到這裡,最容易被講成的版本是"草根扳倒大佬"。但事實從來更複雜:

真相是一支合力部隊——
   匿名同行(PubPeer 上的英文質疑)
 + 體制內退學者(耿洪偉的中文轉譯與放大)
 + 學界清醒派(饒毅的公開下場)
 + 公眾輿論(B 站、抖音、視頻號、微博、知乎的同步發酵)
 + 高校公關壓力下的紀律部門
四股力量同時補位,系統的自淨機制才勉強轉動了一次。

圖 1:系統失靈的那一刻——四股非常規力量合力補位圖

圖 1 · PubPeer 匿名同行(早 10 個月)+ 體制內退學者耿洪偉 + 學界清醒派饒毅 + 公眾輿論同步發酵,四股力量合流,才把一篇被肉眼可見的贗品掛出十個月之久的論文送上同濟通報台。

這才是值得認真討論的事實。它帶出的不是"系統全壞了"這種廉價結論,而是更尖銳的判斷——

這個系統的常規自淨機制(同行評審、學術委員會、行政糾錯)已經失靈到,必須靠 PubPeer 的匿名同行、退學的博士、敢言的校長、熱搜的輿論這些"非常規力量"共同發力,才能勉強抓住一個肉眼可見的贗品。

那麼真正值得追問的是這樣三個問題:

第一,為什麼這篇論文能通過 Nature 的同行評審、國家百萬經費評審、院校學術委員會的層層把關,一路暢通無阻?

第二,為什麼 PubPeer 上的匿名英文質疑掛了十個月,國內學界沒有任何制度性反應——非要等到一位短影片博主用中文喊出來、一位老牌學者下場背書,才能引發處理?

第三,如果這種烈度的造假能藏在最頂級期刊裡這麼多年,那今天我們讀到的所有"研究表明",到底有多少是真的?

要回答這三個問題,得把鏡頭拉遠,看清整個學術論文體系是怎麼搭起來的、它從哪裡來、又病在哪裡。

這篇文章就是這樣一份說明書。

上篇講它的骨架與血脈——從本科論文到院士論文,從亞里士多德到 RCT,論文如何成為人類知識的中央貨幣。

下篇講它的病灶與未來——統計學革命留下的暴君 p<0.05、Publish or Perish 催生的水化海嘯、論文如何反噬正在訓練的 AI 大模型、以及一場尚未完成的全球改革。

耿同學只是揭開了一角。我們要看的,是冰山下面那座兩百年的工廠。


上篇:論文的尺度

——從本科到院士的認識階梯


一、交差與擂台:本科畢業論文,與講師評職稱,根本不是一回事

很多人誤以為"論文"是一個統一的東西。其實它是兩種完全不同的活動,目的、受眾、判官、生死都不一樣。

本科畢業論文,本質是"交作業"。

目的不在於產出新知識,而在於證明你完成了一次完整的學術訓練:會查文獻、會用方法、能把話說清楚。評判者是導師和本校答辯委員會,發表與否無所謂,過得了答辯就行。它的水分空間天然就很大——大量本科論文實際上是高級版的讀書筆記加資料彙編。

講師評職稱發表的核心期刊論文,本質是"打擂台"。

它要在全球同領域同行的目光下接受匿名評審,要在 SCI / SSCI / CSSCI 這些被嚴格分級的期刊上活下來。評判者你不認識,他們也不知道你是誰。它不是寫給老師看的,而是寫給整個學科看的。理論上,它必須給學科帶來原創性增量,必須方法嚴謹數據可重複

一個是練兵場,一個是公共戰場。前者的邏輯是"老師我盡力了",後者的邏輯是"全行業請驗貨"。

混淆這兩件事,就是中國本科生最大的認識誤區——以為自己寫過的那篇查重 30% 通過答辯的東西,跟教授桌上摞著的那些 SCI 是同一物種。


二、從執器到立題:學術階梯上五個段位的真實門檻

把學術生涯切片來看,每一段對論文的要求,本質上是對"你和知識的關係"的要求在升級:

段位核心任務論文要求用一句話概括
本科生完成學術啟蒙通過答辯會照著抄方法
碩士生掌握一個領域的方法體系多數校要求 1 篇核心會設計研究
博士生做出原創知識貢獻2–5 篇 SCI / SSCI,至少 1 篇頂刊能發現真問題
講師評副教授建立獨立研究方向五年內若干核心 + 主持國家級課題能形成路線
副教授評教授形成學科影響力高引論文 + 代表作 + 重大專案能定義問題
院士 / 頂級學者定義學科方向頂刊封面 / 奠基性論文能開宗立派

爬階梯的本質:從"用別人造好的尺子量東西",到"造出別人都拿來用的新尺子"

圖 2:學術階梯六段位——從執器到立題

圖 2 · 本科到院士的六級遞進。每一段的真實門檻,是你與"學科尺度"之間距離的縮小——從照著抄方法,到能開宗立派。


三、兩種知識的根脈:文科與理科,不只是題材之別,而是認識論分歧

很多人以為文理之分,只是研究對象不同。其實差別要深得多——它們對"什麼算是知識"這件事,本來就持有不同立場。

理科 / 自然科學的典範:假設-驗證型。

觀察現象 → 提出假設 → 實驗設計 → 資料蒐集
→ 統計分析 → 支持或證偽 → 發表可重複結論

它的核心律法是兩個詞:可重複可證偽

格式高度統一(IMRAD:導言-方法-結果-討論),數學化、量化、客觀化。

知識是累積的,後人站在前人肩上,舊理論可以被推翻。

文科 / 人文學科的典範:詮釋-建構型。

提出研究問題 → 選擇理論框架 → 文本 / 田野 / 案例分析
→ 闡釋意義 → 建立論證 → 得出有限度的結論

它的核心律法是論證嚴密解釋力

量化不是必需,質性方法(民族誌、深度訪談、文本細讀)占主流。

知識不是單向累積的——經典可以被反覆重新詮釋,《論語》今天還能產出新論文。

社會科學夾在中間。 經濟學、心理學、社會學是兩種典範的角力場。近 20 年因果推斷革命大行其道,主流向量化傾斜,但質性研究始終沒死,"混合方法(Mixed Methods)"反成顯學。

一個未盡的道理是:文理之爭的本質,是"世界是不是可以被一把尺子量完"。理科默認是,人文默認不是。這場爭論不會有終點,因為它問的本來就是人類自身的邊界。


四、兩千年的接力:方法論從何而來

學術論文這套方法論,看似冰冷的格式手冊,其實背後是一條延續兩千年的思想接力。

第一棒——古希臘的邏輯根基(公元前 4 世紀)。

亞里士多德寫下《工具論》,奠定演繹邏輯:三段論。大前提、小前提、結論。這是一切學術論證的底層語法。今天人文論文裡最常見的"理論框架+案例論證"結構,骨子裡就是亞里士多德。

第二棒——科學革命的實驗典範(17 世紀)。

培根強調歸納:觀察先於理論。

伽利略把自然數學化,讓實驗可重複。

牛頓用一本《自然哲學的數學原理》同時演示了歸納和演繹的極致結合——這本書事實上是後世所有"科學論文"的母型。

從這一棒起,"假設—實驗—驗證"成為科學的心跳。

第三棒——統計學革命(19-20 世紀)。

這是現代論文體系真正成型的關鍵一棒,下篇專門展開講。高爾頓、皮爾遜、費舍爾、內曼-皮爾遜四個人接力造出了一整套量化判斷的工業流水線。

第四棒——社會科學方法論的建立(19-20 世紀)。

孔德推動實證主義,讓社會學也想模仿物理學。

韋伯反對,提出詮釋社會學,強調"理解(Verstehen)"。

涂爾幹把社會事實量化。

格爾茨在人類學裡搞"厚描述"。

這一棒裡的方法論戰爭——實證 vs 詮釋——至今沒有結論。

第五棒——科學哲學的典範論(20 世紀)。

波普爾提出"可證偽性",給科學畫了邊界:不可證偽的命題不是科學。

庫恩在《科學革命的結構》裡說,科學不是線性積累的,而是週期性的典範轉移——舊典範崩塌、新典範建立。

拉卡托斯提出"研究綱領"概念。

今天博士生寫"研究典範"那一章時,用的就是這套話語。

第六棒——因果推斷革命(21 世紀至今)。

安格里斯特等人用工具變數、斷點迴歸、雙重差分這些計量利器,讓經濟學和政策科學第一次能嚴肅討論"因果"而非"相關"。

朱迪亞·珀爾(Judea Pearl)用因果圖論,從數學層面證明:相關與因果是兩種東西,可以嚴格區分。

RCT(隨機對照實驗)成為醫學、經濟、政策評估的金本位。

機器學習與因果推斷的融合,是當下最前沿的方向。

圖 3:方法論兩千年接力——六棒里程碑

圖 3 · 從亞里士多德的三段論,到 21 世紀的因果推斷革命,方法論歷經六次接力——每一棒都既繼承前棒,也徹底改寫"什麼算知識"的標準。

兩千年接力下來,論文已經不只是一種文體,而是一台馴化人類好奇心的精密機器


下篇:論文的危機

——水化、AI 與一場未完成的革命


五、四子開爐:統計學革命的隱秘奠基者

如果說論文是現代知識的中央貨幣,那麼 19 到 20 世紀的統計學革命就是這種貨幣的造幣廠。四個人——高爾頓、皮爾遜、費舍爾、內曼-皮爾遜——師承相續、彼此仇視,又共同完成了奠基。

高爾頓(Francis Galton,1822-1911):第一塊磚

達爾文的表弟。受進化論刺激,他要測量"遺傳"。

他記錄了 928 名成年子女205 對父母的身高數據(為簡化敘述,下文以"父子身高"為例;他在原始數據裡把女兒身高乘以 1.08 來"換算",並把父母合併成一個"中點父母"指標——這個操作本身後來在統計學史上一直有爭議)。

他畫散點圖,問:父親極高,兒子一定極高嗎?

發現並不是。父極高,子傾向於略矮一點;父極矮,子傾向於略高一點。兩者都在向平均值靠攏。

他把這種現象叫做"迴歸到均值(Regression to the Mean)"

——這就是"迴歸"這個詞的來源。今天機器學習教科書第一章的"線性迴歸",名字源頭就是這裡。

他同時直覺地提出了相關係數的概念:兩個變數"一起動"的程度。但他數學功底不夠,沒法嚴格寫下來。

他是開局的觀察者,等著學生來給他打磨工具。

(一筆附註:高爾頓和他的學生皮爾遜都是優生學的狂熱推手——這是統計學史裡一段被反覆檢討的黑歷史,UCL 在 2020 年代正式公開道歉,至今仍在反省。統計學的誕生與種族主義意識形態深度糾纏,本身就值得另寫一篇。)

皮爾遜(Karl Pearson,1857-1936):造出精密儀器

高爾頓的學生,數學出身,性格剛硬。

他做了三件事:

① 給相關係數寫下嚴格數學定義——今天叫皮爾遜相關係數 r。範圍從 -1 到 +1。這條公式從 1900 年用到今天,幾乎沒變。

② 發明卡方檢定——回答一個核心問題:觀察到的頻率分布,和理論上"本該如此"的分布,差異是不是太大?

χ² = Σ (觀測值 - 期望值)² / 期望值

扔硬幣 100 次出 60 次正面,這枚硬幣有沒有問題?卡方告訴你。

③ 1911 年在倫敦大學學院(UCL)創立了世界第一個統計學專業系,初名"應用統計學系(Department of Applied Statistics)",把統計學從"數學的小妾"扶正為獨立學科。

但皮爾遜有個致命盲點:他堅信科學只能討論"相關",不能討論"因果"。在他看來,因果是形而上學的鬼話。

這個盲點束縛了統計學整整 100 年,直到 Judea Pearl 在 2000 年代用因果圖論才真正糾正過來。

費舍爾(Ronald Fisher,1890-1962):統治者登場

皮爾遜的死敵。兩人一生互相仇視,但一起奠定了現代統計學。

費舍爾的貢獻最深,分三層:

① 變異數分析(ANOVA)

三種施肥方案,哪個最好?傳統做法是兩兩 t 檢定,做 3 次。費舍爾說不行,這樣會累積誤差。

他的辦法是一次性檢定所有組——把總變異拆成"組間變異"和"組內變異",比值即 F 值,F 越大說明處理效果越顯著。

這個方法今天是心理學、醫學、農業實驗的標配。

② 隨機對照實驗(RCT)的三原則

他在洛桑農業試驗站工作時,發現實驗設計混亂——土地有好有壞,沒法分清是"施肥效果"還是"土地差異"。

他給出三個原則:隨機化、重複、區組

意思是:隨機分配處理,讓所有"未知的干擾"在統計意義上自動均勻分布,從而被消除。

這套思想後來直接演化成醫學臨床試驗的 RCT,成為今天循證醫學的金本位。

③ p 值——那個統治世界 90 年的數字

1925 年,費舍爾在《研究者的統計方法》裡寫下這樣一段話——

"The value for which P = 0.05, or 1 in 20, is 1.96 or nearly 2; it is convenient to take this point as a limit in judging whether a deviation is to be considered significant or not."

注意他自己用的那個詞:"convenient(方便起見)"。

p<0.05 這條線在他筆下,本來就是一個"為了方便"的工具閾值,不是終極判決。他自己用過 0.01、用過 0.02,從沒說過 0.05 是神聖不可侵犯的。

但後世學者只學了"P=0.05, 1 in 20"那句話。

p < 0.05 → "顯著" → 發表 → 寫進教科書 → 真理
p ≥ 0.05 → "不顯著" → 扔進抽屜 → 永遠消失

一個"convenient"的便利閾值,被後人加冕為科學的判決線。費舍爾晚年意識到這是災難,但 1962 年他死的時候,p<0.05 的獨裁已經全面建立。

內曼-皮爾遜框架:把刀磨成框架

內曼(Jerzy Neyman)+ 卡爾·皮爾遜的兒子小皮爾遜(Egon Pearson),1930 年代。

他們補全了費舍爾體系裡的一個漏洞:p 值只說"如果零假設成立,看到這組數據的機率",但沒說"我應該做什麼決策"。

他們引入了一對術語:

H₀(零假設):假定沒有效果
H₁(備擇假設):假定有效果

兩類錯誤:
  α(I 型錯誤)= 沒效果卻判定為有效(假陽性)
  β(II 型錯誤)= 有效果卻判定為無效(假陰性)

統計功效 Power = 1 - β

把"做不做實驗"變成了決策理論:你先定好可接受的錯誤率,再按規則行動。

費舍爾和內曼公開互罵了三十年。費舍爾說內曼把科學變成了"工廠決策",背離了求真精神;內曼說費舍爾的邏輯根本不嚴格。

諷刺的是,今天的統計學教科書把兩套體系強行縫合在一起,學生背的是一個內部邏輯自相矛盾的混合體。這個矛盾,正是後面統計學危機的隱秘源頭之一。

圖 4:統計學四子開爐——師承與恩怨關係網

圖 4 · 高爾頓 → 皮爾遜(師徒)→ 小皮爾遜(父子);皮爾遜 ⟷ 費舍爾(30 年互罵);費舍爾 ⟷ 內曼(公開互罵)。今天教科書裡那個看似渾然一體的"統計學",本質是這張恩怨網被後人強行縫合的產物。


六、p<0.05:一個被神化的"方便起見"

把這件事單獨拎出來講,是因為它牽動著整個現代科學的命脈。

圖 5:p<0.05——一條分界線的兩個世界

圖 5 · 同樣的實驗、同樣的人、同樣的方法,跨過 0.05 那條線就進入"真理"流水線,沒跨過去就進入"file drawer"消失。這條線是費舍爾隨手寫下的"convenient(方便起見)",被後人神化為科學判決。

p<0.05 的現實後果是什麼?

第一,發表偏差。期刊只愛"顯著"結果,不顯著的從來不發。結果是抽屜裡堆滿了"真相",公開發表的只是其中"看上去顯著"的那一部分。

第二,p-hacking(p 值操縱)。研究者反覆切樣本、加變數、試模型,直到 p 值跨過 0.05。這不是欺騙,常常是無意識的——人腦天然會自我合理化。

第三,HARKing(先看結果再立假設)。明明是資料探勘碰巧發現的規律,寫論文時卻說"我們假設……"。一篇徹頭徹尾的探索性研究,被包裝成驗證性研究。

第四,統計顯著 ≠ 實際顯著。樣本足夠大,幾乎任何細微差異都能 p<0.05,但這種差異在現實裡可能毫無意義。

2016 年,美國統計協會(ASA)罕見地發布官方聲明,正式承認 p 值被嚴重濫用,建議不要把 p<0.05 作為科學結論的判定標準

2019 年,800 多位科學家在《自然》聯署,呼籲廢除"統計顯著性"這個概念本身

但九十年的慣性,不會一夜之間消失。


七、發表即生存:全球水化的結構性病灶

學術圈有句黑話:Publish or Perish——發表,或者出局。

這是從美國 1960 年代開始、中國 2000 年代大規模引入的考核哲學:把論文數量直接綁定職稱、薪資、專案、戶口、子女入學。結果是把"發表"從手段變成目的本身。

水化由此變得不可避免,且是結構性的:

期刊數量爆炸。 1987 年全球學術期刊約 7 萬種(Meadows 估算),到 2020 年活躍的同行評審期刊約 4–5 萬種;若把掠奪性期刊和半學術性出版物一併計入,則遠超此數。其中掠奪性期刊(Predatory Journals)估計已佔學術出版體量的 10–30%——它們只要交版面費就發,不做同行評審。期刊總量在二戰後呈指數級增長,是水化最直接的供給側土壤。

最小發表單元文化(LPU)。 一個研究本可寫成一篇好論文,被切成五篇"夠發表的小論文",每一篇都不痛不癢,但數量好看。

引用圈與互引網路。 期刊編輯要求作者引用本刊文章;研究團隊之間簽訂"互引協議";某些學者的引用數被人為推高到驚人的水準。

統計學危機(Replication Crisis)。 2011 年起,心理學界開始大規模重複經典實驗。開放科學合作組織(OSC)2015 年發表在 Science 上的標誌性研究指出:100 項經典心理學實驗中,能在原方向上獲得統計顯著的複現,僅約 36%(更寬鬆口徑下可達 47%)。經濟學、醫學、神經科學相繼爆發類似危機。

中國的特殊曲線

2000-2015:數量狂飆,品質參差
2015-2020:高引用論文快速增長,部分領域躋身全球前列
                (AI、材料、化學、量子資訊)
2020-今:  教育部"破五唯"政策開始糾偏
           (破除唯論文、唯帽子、唯職稱、唯學歷、唯獎項)
           但實際執行參差不齊

整個系統已經形成了一種自我強化的灌水激勵——發表越多,資源越多,資源越多發得越多。少數清醒者退出遊戲,留下的人繼續加速。

回到楔子裡的同濟王平案——它扳倒的不是幾個人,而是這個系統的一個截面:當造假被肉眼看穿、被 PubPeer 掛了十個月,仍然能在 Nature 上發出來、領走百萬經費、戴上院長帽子。這證明這套篩選機制已經病到自己識別不出最基本的贗品,必須靠系統外(PubPeer 匿名同行)、系統邊緣(短影片平台博主)、系統內的少數清醒者(饒毅)合力補位,才能勉強抓住一個例外。


八、回流的污染:論文如何反噬 AI

這是當下最前沿、也最少被公開討論的話題。

大模型預訓練資料的構成大致是這樣(基於 GPT-3、Llama 等少數公開披露過訓練配方的模型推算;各家實際配方為商業機密,僅供參考):

Common Crawl(網頁爬取)   ~60-70%
GitHub 程式碼              ~10-15%
學術論文(arXiv 等)       ~5-15%
書籍                      ~10%
Wikipedia                  ~3%
其他高品質來源             ~5%

數字看起來論文佔比不高,但權重遠高於比例——訓練時往往對論文做上採樣(upsampling),因為它包含了人類最密集的顯式推理鏈。

結論:論文品質直接影響模型的推理品質,而不只是知識廣度。

那麼水論文是怎麼污染 AI 的?

第一,錯誤事實的污染。 p 值操縱得出的虛假結論、小樣本過度泛化的"心理學常識"、無法重複的"經典實驗"——AI 學到後,會以學術權威的語氣複讀出來。比如早期 GPT 描述史丹佛監獄實驗時高度自信,但這個實驗在 2018 年 Le Texier 等人公布解密錄音和訪談材料後,已被學界嚴重質疑——津巴多對獄警的指令遠比官方敘述明確,參與者亦有表演成分;它今天的學術地位已經從"經典結論"退到"研究倫理失格、結論被嚴重高估"的位置。

第二,寫作風格的污染。 那種"本研究旨在探討 X 對 Y 的影響,結果表明……具有重要的理論和實踐意義"的空洞八股句式,被大量攝入後,模型自己也開始這麼寫——用複雜詞彙掩蓋空洞內容。

第三,幻覺的深層來源。 AI 的幻覺常被歸咎於"模型本身的問題",但其中相當一部分源於訓練資料裡論文之間相互引用形成的錯誤傳播鏈。某篇論文寫錯了一個事實,被五十篇論文引用,最後變成"五十一個來源都這樣說",AI 看到的就是"高置信度的共識"。

這是一個隱秘但深刻的反饋環——學術界生產的水分,正在變成 AI 推理能力上的隱形赤字


九、知其不知的難題:AI 能識別水論文嗎?

部分能,但遠未解決,而且存在根本性困難

AI 目前能做到的:

AI 目前做不到的:

"這篇論文的貢獻增量到底有多大?"
→ 需要領域專家判斷,AI 沒有真正的理解。

"實驗是否真實進行?"
→ AI 看不到實驗室,無法驗證原始數據。

"這個結論在領域內是不是重要突破?"
→ 需要知道"領域當前邊界在哪裡"——AI 的知識有截止日期。

最根本的難點在於:判斷論文品質的核心能力是"知道自己不知道什麼"

這正好是 AI 當下最薄弱的環節。

諷刺的是,目前最有效的"造假偵測器",仍然是 PubPeer 匿名同行 + 耿洪偉那種有耐心、有領域知識、且不在系統利益鏈裡的人 + 饒毅那種敢於公開下場的學界清醒派。技術可以輔助,但取代不了。


十、未竟的革命:改革地圖

學術界並非無所作為。過去十五年,針對水化危機已經形成了五條清晰的改革路徑:

① 預註冊(Pre-registration)

改革前:做實驗 → 看結果 → 寫論文 → 選"顯著"發表
改革後:先公開宣布"我要做什麼實驗、什麼假設"
       → 做實驗 → 無論結果如何都要發表

直接斬斷 p-hacking 和 HARKing 的根。開放科學框架(OSF)至今已有超過 10 萬項預註冊研究,心理學和醫學推進最快。

② 註冊報告(Registered Reports)

更激進——期刊在實驗完成前就決定是否接收

研究者提交:研究問題 + 方法設計(無結果)
期刊評審:方法好不好?值不值得做?
期刊承諾:無論結果正面負面,都發表
研究者做實驗
發表(結果寫進去)

Nature Human Behaviour、PLOS ONE 已經引入。但推廣緩慢,因為期刊從中得不到"獨家爆款"的好處。

③ 開放資料與可重複性標準

論文提交時,必須附帶原始資料集和分析程式碼。任何人都能在自己的電腦上跑一遍驗證結果。arXiv + GitHub 已成為物理、數學、電腦科學的標配。生物醫學領域的 FAIR 原則(可查找、可獲取、可互操作、可重用)正在推進。

④ 後出版同行評審

傳統評審在發表前,效率低且不透明。新模型把評審挪到發表後:

王平案是這條改革路徑最戲劇性的現實演示:當傳統評審已無能力發現造假時,PubPeer + 中文輿論 + 學界清醒派的組合,事實上構成了系統性的"後出版同行評審"機制。它不優雅、不正式、依賴個人英雄主義補位——但它確實在工作。

⑤ 計量學改革——超越影響因子

期刊影響因子(Impact Factor)這把陳舊的尺子正在被丟棄:

DORA 宣言(2013)至今已有 22000+ 機構和個人簽署,公開承諾不再用影響因子評價個人研究。

圖 6:改革地圖五路徑

圖 6 · 五條路徑都在試圖回答同一個問題——如何讓"發表"重新對齊"求真"。其中"後出版同行評審"(PubPeer / eLife)正是楔子裡王平案的現實演示場。

這場改革有方向,無盡頭。最大的阻力不是技術,而是激勵——沒人願意第一個放棄"發表數量"這個遊戲規則


十一、硬骨頭與軟骨頭:含金量排行

講完危機和改革,回到一個更樸素的問題:今天還有哪些論文,依然讓人由衷敬佩?

樸素的答案是:工程界和硬科學。

這不是偏見,而是有結構性原因。

第一,標準更硬。

第二,失敗成本極高。

工程論文背後是產品、專利、工廠。造假會直接導致工程失敗,代價具體到一個產品砸了、一筆投資爛了、一座橋塌了。

含金量地圖(依據可重複性與社群共識):

極高含金量(工程 + 硬科學):
  · 電腦系統 / ML 頂會(NeurIPS、ICML、CVPR)
     程式碼開源、結果可重複、社群快速驗證
  · 材料科學(Nature Materials 等)
     新材料性能硬核,造假等於送命
  · 物理(PRL、Nature Physics)
     粒子物理動輒上千作者聯署,數據全體把關
  · 化學合成(JACS、Angewandte Chemie)
     合成路線和譜圖無法偽造
  · 天文 / 宇宙學
     數據來自望遠鏡,全球共享,全球交叉驗證

高含金量(應用 + 臨床):
  · 醫學 RCT(NEJM、Lancet)
     大樣本多中心,可信度高
  · 結構生物學
     蛋白結構等可由第三方獨立驗證

中等含金量(行為社科):
  · 經濟學(帶 RCT 或自然實驗的)
  · 神經科學(重複危機存在,正在改善)

含金量存疑:
  · 小樣本心理學(WEIRD 樣本問題)
  · 部分文科核心期刊
  · 掠奪性期刊氾濫的邊緣領域

需要補一句不太好聽但必要的話:生命科學是個例外。它頂著"硬科學"的招牌,但實際屬於水化高發區,細胞圖、電泳圖、顯微圖都極易 P 圖,重複一次實驗動輒幾十萬經費,可重複性遠低於物理化學等硬科學。2025 年 Nature 統計指出,全球撤稿量前十的機構裡,七家來自中國的醫院或醫學院。耿同學集中火力的領域恰恰就是生命科學——這不是巧合,而是體制結構性漏洞的對外開口。

電腦論文值得單獨說一句。

近 20 年全球最有影響力的論文,大量出自電腦工程界:

2017《Attention Is All You Need》(Transformer)
     Google Scholar 引用近 20 萬,直接引爆 AI 革命

2012《ImageNet Classification with Deep CNNs》(AlexNet)
     深度學習元年

1998《Gradient-Based Learning Applied to Document Recognition》(LeNet)
     卷積神經網路起點

這些論文有一個共同特徵:程式碼可以重複、基準測試公開、工業界在 6-12 個月內就能驗證;學術社群在 1-2 年內大規模複現並改進

它們之所以可信,不是因為評審員蓋了章,而是因為整個社群在很短的時間內複現並改進了它們

這是論文該有的樣子——一個公開的、可被驗證的、推動文明向前的認知接力棒。

圖 7:論文含金量地圖——四層金字塔

圖 7 · 判斷含金量的三個樸素維度:數據/程式碼是否公開?錯誤代價是否具體?社群能否快速複現?三問皆是 = 極高含金量。生命科學是頂著硬科學招牌的水化高發區,需單獨警惕。


結語:清醒者使用論文的幾條原則

寫到這裡,讓我留給讀者幾條樸素的提醒:

一、看到"研究表明"四個字時,先問一句:哪個研究?多大樣本?哪本期刊? 默認警覺,是清醒的起點。

二、看到 p<0.05 時,不要立刻當真。 這個數字背後是費舍爾一句"convenient(方便起見)"的註腳,它沒有它想讓你相信的那麼神聖。

三、看到"顯著"二字時,要分清"統計顯著"和"實際顯著"。 前者是數學,後者才是生活。

四、心理學和社會學的"經典結論",建議至少打八折。 重複危機告訴我們,過去幾十年的"常識",可能一半都站不住。

五、生命科學的圖像類數據,多留一分疑心。 這是同濟王平案留給我們最具體的教訓。

六、工程和硬科學的論文相對可信,因為造假的代價具體而殘酷。 這不是說它們沒有錯,而是錯會被快速暴露。

七、AI 給你的答案,本質上是過去幾十年論文池子的平均產物——而且論文權重遠高於其體量佔比,因為訓練時通常被上採樣。 池子有多乾淨,答案就有多乾淨。

最後,也是最重要的一條:

不要把"已發表"當作"已為真"。 論文體系是人類目前最好的求真工具之一,但它不是真理本身。它是一套工業流水線,會出次品,會被濫用,也會孕育真正的偉大。

王平案讓人敬佩的,從來不是某一個英雄。

是 PubPeer 上掛了十個月、沒人理會的兩條匿名英文質疑;

是一位讀到第五年放棄博士學位、轉身用中文重新喊出來的耿洪偉;

是一位敢於在公眾號實名連發三篇文章的首都醫科大學校長饒毅;

是熱搜上一夜激增的轉發、評論、追問。

四股非常規力量同時補位,系統的常規自淨機制才勉強轉動了一次。這本身就是這個時代最大的提醒:當一個系統的內建免疫已經失靈到這種程度,每一個清醒的局外人,事實上都是這個系統的最後一道防線。

清醒地用它,不被它定義。這是這個時代對一個有自我認識的現代人,最基本的要求。


參考來源:

分享
← 返回商業調查列表

相關文章 · 長為試之

長為試之印(盖印版·自然崩口)