三個 AI 都說對,我為什麼還要查? - 多模型互相檢查,什麼時候是真的、什麼時候是假獨立
三個 AI 不一定等於三票。真正要檢查的,是模型、查法與最後證據有沒有走不同的路。
本篇目錄
我曾經在同一台電腦上,看見自己的工具留下兩句互相矛盾的話。
- 「三個驗證者採用不同視角,所以是真正獨立。」
- 「三票都來自同一模型家族,所以是假獨立。」
回頭看,第一句把「分工不同」直接寫成「真正獨立」,跳得太快了。
我讓一個 AI 查引文,另一個找反例,看起來已經分了工。但往回看它們怎麼得到答案,才發現:任務名稱不同,搜尋入口和引用資料卻可能一樣。三個助手忙了一輪,還是可能一起漏掉同一件事。
多模型驗證的重點不是「有幾票」,而是這幾票的形成路徑有沒有真的分開。
動用了 44 個 agent,六個搜尋者卻都停在付費牆前
有一次做研究,一篇關鍵文獻會直接影響最後的判斷。整套流程動用了 44 個 agent,其中六個專門找全文。結果六個搜尋者都在期刊付費牆前停下,整套流程就把這篇文獻標成「不可取得」。
看起來很可靠:
- 有六個搜尋者。
- 有對抗驗證。
- 大家得到相同結果。
- 系統跑了大量步驟。
這批 agent 全屬於同一個模型家族;六個搜尋者實際走出的路也很相似,都在主要入口撞牆後收手。系統甚至已提醒我:搜尋者來自同一家族,應該換一條路;我卻把警告當成腳註,而不是攔阻條件。
後來換另一個模型家族,才從不同入口找到收錄全文的學位論文。補上關鍵資料後,原本看似乾淨的結論被翻轉。
回頭看,這次換模型時,也換了一條搜尋路徑:前六個搜尋者停在期刊頁面,後來找到全文的入口則是學位論文。真正讓判斷往前走的,是那份終於被找到的資料。
我會沿著答案往回查三件事
| 檢查軸 | 可能共享的限制 | 可嘗試的分離方式 |
|---|---|---|
| 模型家族 | 同一模型可能反覆漏掉相同問題 | 讓不同模型家族各自作答,再核對它們漏掉什麼 |
| 任務框架與查法 | 都收到同一種正向提問 | 一家找原始資料、另一家專找反例 |
| 最後證據來源 | 三篇文章都改寫自同一份新聞稿 | 沿著同一個主張,追查是否有另行取得的原始證據 |
我會把模型、查法和來源分開看。即使用了三家公司的模型,它們也可能搜尋到同一篇新聞稿,或一起把「期刊頁面打不開」當成「全文不存在」。尤其是來源:三個不同網址,追到最後,可能都在轉述同一份原稿。
Kim 等人在 ICML 2025 發表的研究,也觀察到不同模型會犯相似的錯。他們評估超過 350 個語言模型;在其中的 HELM 資料裡,當兩個模型都答錯時,平均約六成會選中同一個錯誤答案。換了公司、換了模型架構,答案背後的盲點仍可能重疊。研究來源
同一模型多想幾次,也有它的用途。Wang 等人的 self-consistency 方法,讓模型產生多條推理路徑,再整理出最後答案,在算術與常識推理題上改善了表現。研究來源
我會把這件事和查資料分開看:解題時,多試幾條思路可能有幫助;找文獻時,則要看有沒有走到新的入口、拿到新的資料。
第三位審查者,抓到前兩位共同漏掉的矛盾
另一次對抗評估中,兩位辯手很快同意三項建議。主席卻發現,其中兩項互相衝突:一項要求先拆開結構,另一項要求立即凍結所有改動。兩項若同時執行,前一項根本沒有機會完成。
主席的價值不是投下第三票,而是站在不同位置,檢查兩邊共同漏掉的矛盾。
同一場評估裡,另一位辯手在取得事實補正後自行撤回原主張。這反而是健康訊號:
- 有人真的改變立場。
- 新證據能改變結論。
- 共識不是預先寫好的終點。
這次值得留下來的,是改口的理由:補正了哪個事實,原先哪個主張因此站不住腳。之後回頭檢查時,也能看見結論是在哪一步改變的。
我也會把主席提出的矛盾攤開來看:如果一項建議要求先修改結構,另一項卻要求立刻凍結所有改動,就得先排出執行順序。這樣才知道主席究竟解決了哪個問題。
換了三家,最後仍可能相信同一份資料
我也做過一次公開產品的三家族事實查核。三個不同模型確實各自搜尋,卻共同漏掉一個限制:它們最後依賴的是同一份公司資料。
模型不同、文字不同,證據上游仍然相同。這次缺的是能核對公司主張的另一條來源,繼續增加轉述同一份資料的答案,補不到這個缺口。
做研究時也會遇到類似情況。Greenberg 在 BMJ 2009 發表的研究,追蹤一個生物醫學主張如何被不同論文引用:有些文章沒有提出新的原始資料,卻透過反覆轉述,讓主張看起來愈來愈有根據,甚至把假說寫成事實。研究來源
所以看到三個 AI 各附一串引用時,我會沿著其中一個重要主張往回追,看看最後剩下幾份真正提供資料的來源。
同一份原文讓三個模型各自讀,仍可能抓到不同的解讀錯誤;只是這屬於閱讀覆核,不能算三份實證。反過來,一份來源也不一定太少:若只要確認「公司有沒有宣布這項功能」,公告本身就能回答;若要確認「功能是否如宣稱般有效」,才需要實測或其他能檢驗效果的資料。
辯論到底比多問幾次,多做了什麼
我曾回顧 177 場 council 的紀錄,其中很常見的情況,是幾輪討論後大家就同意了。也有主席推翻兩位辯手的時候。(完整回顧另文整理(尚未公開))
回頭看這些紀錄,我更想追問的是:討論過程究竟補進了什麼?是找到新資料、修正了前提,還是大家只是逐漸接受同一個答案?
Du 等人在 ICML 2024 發表的研究,觀察到多個模型交換推理、進行辯論後,能改善所測任務的表現。研究來源
Choi 等人在 NeurIPS 2025 進一步拆開這個流程:先讓模型各自作答,一組直接投票,另一組先討論再決定。在他們測試的七個基準中,直接投票就已取得大部分增益。研究來源
這個比較讓我想在自己的流程裡多留一份紀錄:討論前,大家各自怎麼答;討論後,又改了哪裡。
下一次,我會把討論前後的答案放在一起,記下哪些錯改對、哪些對改錯,以及新增了哪份資料。這樣才看得見,後面幾輪討論到底多做了什麼。
下次先拿一個重要主張試一次
我也會先把查證問題拆開,讓各家分別回答,再一起看結果,避免後問的 AI 只是順著前一家說下去。
Dhuliawala 等人在 ACL 2024 發表的 Chain-of-Verification,也採用了把查證問題分開作答、最後再整理答案的流程,並在所測任務中減少了幻覺。研究來源
- 初始答案互盲,後問的 AI 沒看過前一家答案。
- 知道實際用了哪些模型;同模型重抽樣時,不把多個答案當成多份外部證據。
- 每一家被指定不同查法,不只是換句話問。
- 沿著重要主張追到原始依據,標出哪些引用共享同一個上游。
- 有一家被要求刻意搜尋最強反例。
- 新證據出現時,各家說明維持或修改答案的理由;主席的裁決也要核對依據。
- 資料仍取不到時,系統願意寫「無法驗證」。
先挑一個會改變決策的重要主張,讓手邊的模型各自查一次,把結果填進這張表。哪幾家其實走了同一條路,就比較容易看出來。
| 模型 | 我請它怎麼查 | 它引用哪一頁 | 那一頁的原始依據 | 這次多找到什麼 |
|---|---|---|---|---|
| A | ||||
| B | ||||
| C |
例如,三家都說某項產品有一個功能。填完後,如果三列都追到同一份公司公告,我就知道目前拿到的是同一項宣稱的三次轉述。接下來該做的,可能是直接打開產品試一次,而不是再問第四家。
現在看到三個 AI 給出整齊一致的答案,我會先停一下,往回看它們各自查到了什麼。找到新的資料、走過不同的入口,或指出前一家漏掉的矛盾,才是我多問這幾次最想得到的東西。
延伸閱讀:模型、查證與辯論
七篇研究,分別回答哪些問題?
這幾篇研究,分別回答了文章裡的不同問題。
| 想進一步了解的問題 | 對應研究與重點 |
|---|---|
| 不同模型會不會一起答錯? | Kim,ICML 2025:Correlated Errors in Large Language Models。比較跨模型的錯誤重疊;HELM 的約六成指兩個模型都答錯時,選中相同錯誤答案的比例。 |
| 同一模型多想幾次有沒有幫助? | Wang,ICLR 2023:Self-Consistency Improves Chain of Thought Reasoning in Language Models。產生多條推理路徑,再聚合答案,改善所測解題任務的表現。 |
| 讓模型討論有什麼效果? | Du,ICML 2024:Improving Factuality and Reasoning in Language Models through Multiagent Debate。研究多代理辯論對推理與事實任務的幫助。 |
| 收益來自討論,還是多份答案? | Choi,NeurIPS 2025:Debate or Vote: Which Yields Better Decisions in Multi-Agent Large Language Models?。把直接投票與討論後決策分開比較。 |
| 引用很多,為什麼證據仍可能很薄? | Greenberg,BMJ 2009:How citation distortions create unfounded authority: analysis of a citation network。追蹤一個主張如何經由反覆引用被放大。 |
| 模型評審有沒有自己的偏好? | Panickssery,NeurIPS 2024:LLM Evaluators Recognize and Favor Their Own Generations。研究模型辨認與偏好自身產出的現象。 |
| 怎麼減少查證被初稿牽著走? | Dhuliawala,ACL 2024:Chain-of-Verification Reduces Hallucination in Large Language Models。拆開查證問題,分別作答後再整理最終回覆。 |