三個 AI 都說對,我為什麼還要查? - 多模型互相檢查,什麼時候是真的、什麼時候是假獨立

三個 AI 不一定等於三票。真正要檢查的,是模型、查法與最後證據有沒有走不同的路。

本篇目錄
  1. 動用了 44 個 agent,六個搜尋者卻都停在付費牆前
  2. 我會沿著答案往回查三件事
  3. 第三位審查者,抓到前兩位共同漏掉的矛盾
  4. 換了三家,最後仍可能相信同一份資料
  5. 辯論到底比多問幾次,多做了什麼
  6. 下次先拿一個重要主張試一次
  7. 延伸閱讀:模型、查證與辯論

我曾經在同一台電腦上,看見自己的工具留下兩句互相矛盾的話。

  • 「三個驗證者採用不同視角,所以是真正獨立。」
  • 「三票都來自同一模型家族,所以是假獨立。」

回頭看,第一句把「分工不同」直接寫成「真正獨立」,跳得太快了。

我讓一個 AI 查引文,另一個找反例,看起來已經分了工。但往回看它們怎麼得到答案,才發現:任務名稱不同,搜尋入口和引用資料卻可能一樣。三個助手忙了一輪,還是可能一起漏掉同一件事。

多模型驗證的重點不是「有幾票」,而是這幾票的形成路徑有沒有真的分開。

動用了 44 個 agent,六個搜尋者卻都停在付費牆前

有一次做研究,一篇關鍵文獻會直接影響最後的判斷。整套流程動用了 44 個 agent,其中六個專門找全文。結果六個搜尋者都在期刊付費牆前停下,整套流程就把這篇文獻標成「不可取得」。

看起來很可靠:

  • 有六個搜尋者。
  • 有對抗驗證。
  • 大家得到相同結果。
  • 系統跑了大量步驟。

這批 agent 全屬於同一個模型家族;六個搜尋者實際走出的路也很相似,都在主要入口撞牆後收手。系統甚至已提醒我:搜尋者來自同一家族,應該換一條路;我卻把警告當成腳註,而不是攔阻條件。

後來換另一個模型家族,才從不同入口找到收錄全文的學位論文。補上關鍵資料後,原本看似乾淨的結論被翻轉。

回頭看,這次換模型時,也換了一條搜尋路徑:前六個搜尋者停在期刊頁面,後來找到全文的入口則是學位論文。真正讓判斷往前走的,是那份終於被找到的資料。

我會沿著答案往回查三件事

模型家族 任務框架與查法 最後證據來源
檢查軸 可能共享的限制 可嘗試的分離方式
模型家族 同一模型可能反覆漏掉相同問題 讓不同模型家族各自作答,再核對它們漏掉什麼
任務框架與查法 都收到同一種正向提問 一家找原始資料、另一家專找反例
最後證據來源 三篇文章都改寫自同一份新聞稿 沿著同一個主張,追查是否有另行取得的原始證據

我會把模型、查法和來源分開看。即使用了三家公司的模型,它們也可能搜尋到同一篇新聞稿,或一起把「期刊頁面打不開」當成「全文不存在」。尤其是來源:三個不同網址,追到最後,可能都在轉述同一份原稿。

Kim 等人在 ICML 2025 發表的研究,也觀察到不同模型會犯相似的錯。他們評估超過 350 個語言模型;在其中的 HELM 資料裡,當兩個模型都答錯時,平均約六成會選中同一個錯誤答案。換了公司、換了模型架構,答案背後的盲點仍可能重疊。研究來源

同一模型多想幾次,也有它的用途。Wang 等人的 self-consistency 方法,讓模型產生多條推理路徑,再整理出最後答案,在算術與常識推理題上改善了表現。研究來源

我會把這件事和查資料分開看:解題時,多試幾條思路可能有幫助;找文獻時,則要看有沒有走到新的入口、拿到新的資料。

第三位審查者,抓到前兩位共同漏掉的矛盾

另一次對抗評估中,兩位辯手很快同意三項建議。主席卻發現,其中兩項互相衝突:一項要求先拆開結構,另一項要求立即凍結所有改動。兩項若同時執行,前一項根本沒有機會完成。

主席的價值不是投下第三票,而是站在不同位置,檢查兩邊共同漏掉的矛盾。

同一場評估裡,另一位辯手在取得事實補正後自行撤回原主張。這反而是健康訊號:

  • 有人真的改變立場。
  • 新證據能改變結論。
  • 共識不是預先寫好的終點。

這次值得留下來的,是改口的理由:補正了哪個事實,原先哪個主張因此站不住腳。之後回頭檢查時,也能看見結論是在哪一步改變的。

我也會把主席提出的矛盾攤開來看:如果一項建議要求先修改結構,另一項卻要求立刻凍結所有改動,就得先排出執行順序。這樣才知道主席究竟解決了哪個問題。

換了三家,最後仍可能相信同一份資料

我也做過一次公開產品的三家族事實查核。三個不同模型確實各自搜尋,卻共同漏掉一個限制:它們最後依賴的是同一份公司資料。

模型不同、文字不同,證據上游仍然相同。這次缺的是能核對公司主張的另一條來源,繼續增加轉述同一份資料的答案,補不到這個缺口。

做研究時也會遇到類似情況。Greenberg 在 BMJ 2009 發表的研究,追蹤一個生物醫學主張如何被不同論文引用:有些文章沒有提出新的原始資料,卻透過反覆轉述,讓主張看起來愈來愈有根據,甚至把假說寫成事實。研究來源

所以看到三個 AI 各附一串引用時,我會沿著其中一個重要主張往回追,看看最後剩下幾份真正提供資料的來源。

同一份原文讓三個模型各自讀,仍可能抓到不同的解讀錯誤;只是這屬於閱讀覆核,不能算三份實證。反過來,一份來源也不一定太少:若只要確認「公司有沒有宣布這項功能」,公告本身就能回答;若要確認「功能是否如宣稱般有效」,才需要實測或其他能檢驗效果的資料。

辯論到底比多問幾次,多做了什麼

我曾回顧 177 場 council 的紀錄,其中很常見的情況,是幾輪討論後大家就同意了。也有主席推翻兩位辯手的時候。(完整回顧另文整理(尚未公開)

回頭看這些紀錄,我更想追問的是:討論過程究竟補進了什麼?是找到新資料、修正了前提,還是大家只是逐漸接受同一個答案?

Du 等人在 ICML 2024 發表的研究,觀察到多個模型交換推理、進行辯論後,能改善所測任務的表現。研究來源

Choi 等人在 NeurIPS 2025 進一步拆開這個流程:先讓模型各自作答,一組直接投票,另一組先討論再決定。在他們測試的七個基準中,直接投票就已取得大部分增益。研究來源

這個比較讓我想在自己的流程裡多留一份紀錄:討論前,大家各自怎麼答;討論後,又改了哪裡。

下一次,我會把討論前後的答案放在一起,記下哪些錯改對、哪些對改錯,以及新增了哪份資料。這樣才看得見,後面幾輪討論到底多做了什麼。

下次先拿一個重要主張試一次

我也會先把查證問題拆開,讓各家分別回答,再一起看結果,避免後問的 AI 只是順著前一家說下去。

Dhuliawala 等人在 ACL 2024 發表的 Chain-of-Verification,也採用了把查證問題分開作答、最後再整理答案的流程,並在所測任務中減少了幻覺。研究來源

  • 初始答案互盲,後問的 AI 沒看過前一家答案。
  • 知道實際用了哪些模型;同模型重抽樣時,不把多個答案當成多份外部證據。
  • 每一家被指定不同查法,不只是換句話問。
  • 沿著重要主張追到原始依據,標出哪些引用共享同一個上游。
  • 有一家被要求刻意搜尋最強反例。
  • 新證據出現時,各家說明維持或修改答案的理由;主席的裁決也要核對依據。
  • 資料仍取不到時,系統願意寫「無法驗證」。

先挑一個會改變決策的重要主張,讓手邊的模型各自查一次,把結果填進這張表。哪幾家其實走了同一條路,就比較容易看出來。

模型 我請它怎麼查 它引用哪一頁 那一頁的原始依據 這次多找到什麼
A
B
C

例如,三家都說某項產品有一個功能。填完後,如果三列都追到同一份公司公告,我就知道目前拿到的是同一項宣稱的三次轉述。接下來該做的,可能是直接打開產品試一次,而不是再問第四家。

現在看到三個 AI 給出整齊一致的答案,我會先停一下,往回看它們各自查到了什麼。找到新的資料、走過不同的入口,或指出前一家漏掉的矛盾,才是我多問這幾次最想得到的東西。

延伸閱讀:模型、查證與辯論

七篇研究,分別回答哪些問題?

這幾篇研究,分別回答了文章裡的不同問題。

想進一步了解的問題 對應研究與重點
不同模型會不會一起答錯? Kim,ICML 2025Correlated Errors in Large Language Models。比較跨模型的錯誤重疊;HELM 的約六成指兩個模型都答錯時,選中相同錯誤答案的比例。
同一模型多想幾次有沒有幫助? Wang,ICLR 2023Self-Consistency Improves Chain of Thought Reasoning in Language Models。產生多條推理路徑,再聚合答案,改善所測解題任務的表現。
讓模型討論有什麼效果? Du,ICML 2024Improving Factuality and Reasoning in Language Models through Multiagent Debate。研究多代理辯論對推理與事實任務的幫助。
收益來自討論,還是多份答案? Choi,NeurIPS 2025Debate or Vote: Which Yields Better Decisions in Multi-Agent Large Language Models?。把直接投票與討論後決策分開比較。
引用很多,為什麼證據仍可能很薄? Greenberg,BMJ 2009How citation distortions create unfounded authority: analysis of a citation network。追蹤一個主張如何經由反覆引用被放大。
模型評審有沒有自己的偏好? Panickssery,NeurIPS 2024LLM Evaluators Recognize and Favor Their Own Generations。研究模型辨認與偏好自身產出的現象。
怎麼減少查證被初稿牽著走? Dhuliawala,ACL 2024Chain-of-Verification Reduces Hallucination in Large Language Models。拆開查證問題,分別作答後再整理最終回覆。