小心,AI的產出可能讓企業決策變得千篇一律

目前多數的大型語言模型(LLM)都陷入了某種窠臼。它們的回答比你想像的更容易預測,而且缺乏創意。這對於寫程式或研究等任務來說沒什麼大礙,但當你在進行腦力激盪或規劃下一次度假時,這種「群體思維(Groupthink)」就會成為一個問題。

你是否曾發現,當我們向 ChatGPT 或 Gemini 尋求靈感時,得到的答案往往千篇一律?舉例來說,如果請它們寫一句「關於時間的隱喻」,你很可能會得到「時間是一條河流」或「時間是個織布匠」這類極為相似的說法。

事實上,目前多數大型語言模型(LLM)的回答比你想像的更容易預測,而且缺乏創意。這對寫程式或研究等任務來說或許沒什麼大礙,但當你在進行腦力激盪或規劃下一次度假時,這種「集體思考(Groupthink)」就會成為一個問題。

當AI給的回答越來越類似

一個橫跨華盛頓大學、卡內基美隆大學、AI2、Lila Sciences與史丹佛大學的研究團隊,發表了一篇題為《人工蜂群思維:語言模型(及其他領域)在開放式問題上的同質性》的論文。研究中發現,單一 LLM 在面對相同的開放式問題時,即使反覆詢問,提供的答案仍具有極高重複性,不同 LLM 間的答案也高度雷同。尤其面對開放式問題時,不同的 LLM 會趨向於給出非常相似的答案。這篇論文後來在2025年11月獲頒 NeurIPS 2025 最佳論文獎。

至於原因,研究人員並沒有給出確切定論。由於各家公司的訓練細節多屬機密,因而難以完全驗證。但推測可能與現今大多數LLM使用相似的訓練資料與流程有關,例如跨區域共用類似的資料來源,或是不同模型間互相沾染了彼此生成的合成資料。

而這種現象不免讓人擔憂,當愈來愈多人習慣用AI輔助發想與決策,長期下來是否會反過來讓「人類自己的思考」也變得同質化。就像團隊所進行的實驗中,即使測試25種不同規模與家族的模型,廣大的創意空間仍被壓縮到僅僅兩三個主流概念,顯示模型在抽象思考上的多樣性能力相當薄弱。

另一方面,當模型的創意輸出集中收斂於某些強勢的文化表達,也可能在無意間壓抑了其他世界觀、傳統文化與少數群體的觀點,導致觀點單一化、甚至助長既有偏見的傳播。

當中,最受關注的長期風險是,隨著數十億使用者越來越依賴語言模型協助創意寫作、腦力激盪與決策,長期接觸這些高度同質化的AI輸出,可能潛移默化地影響人類自身的思維模式,最終削弱整體社會的文化與智力多樣性,對人類創意發展構成長遠威脅。

AI 也會不自覺地喜歡「風格與自己相似」的答案?

如果說「人工蜂群效應」揭露的是AI創意內容的貧乏,那麼另一篇研究則指出一個更貼近日常商業運作、也更令人不安的延伸問題:當企業利用 AI 評估內容時,AI 是否也會不自覺地偏好「風格與自己相似」的答案?

來自馬里蘭大學、新加坡國立大學與俄亥俄州立大學的研究團隊,發表了一篇題為《演算法徵才中的 AI 自我偏好:實證證據與洞見》的論文,正面回答了這個問題。

由於當前有許多求職者會用LLM潤飾履歷,而企業端也同樣用LLM來篩選履歷,也就是說,AI同時處於「產出內容」與「評估內容」的兩端。研究團隊想知道,當評審者剛好也是LLM時,它是否會偏袒那些「讀起來很像自己會寫的」履歷?

研究團隊找來2,245份AI尚未普及前、由真人撰寫的履歷,讓GPT-4o、DeepSeek-V3、LLaMA、Qwen等7種主流LLM分別重寫履歷中的「自我簡介」段落,接著讓這些LLM輪流扮演「履歷評審」,比較「人類寫的版本」與「LLM生成的版本」誰比較優秀。結果發現:即使兩份履歷描述的是同一位候選人、內容品質相當,LLM評審依然壓倒性地偏好自己生成的版本。更驚人的是,即使人類標註者認為人類寫的那份履歷明顯寫得更好,AI評審依然選擇了自己生成的版本。

為了了解這在真實招聘場景中會造成什麼影響,研究團隊進一步模擬了24種職業的招募篩選流程。結果顯示使用同一款LLM來撰寫履歷的求職者,獲得面試機會的機率比同樣條件的人類求職者高出23%至60%。

研究者警告,若這種優勢在多輪招募中持續累積,可能形成「鎖定效應」(lock-in effect),使得某款主流LLM偏好的寫作風格會逐漸在求職者間僵固,變相懲罰那些沒有使用「對的」AI工具的人。
好消息是,這種偏誤並非無解。研究團隊測試了兩種簡單的緩解方法:一是直接在提示詞中要求AI「不要考慮或推斷內容是人類還是AI寫的,只評估內容本身」;二是讓評審模型與另外兩個「自我辨識能力較弱」的小型模型組成評審團,以多數決做出最終判斷。兩種方法都能有效降低偏誤,尤其是多數決機制,能讓偏誤幅度減少超過五成。

AI 時代,多元性更顯珍貴

對企業而言,這意味著導入AI輔助決策,無論是腦力激盪、內容審核,還是招募方式,都可能在看不見的地方,讓原本該多元、公平的判斷,逐漸收斂成一套愈來愈狹窄、愈來愈可預測的標準答案。

身為決策者,必須意識到,過度依賴 AI 模型進行戰略評核,等於是將公司的文化與身分認同「外包」給了特定模型的訓練權重。當全世界的聊天機器人都趨向於給出同一答案時,企業真正的核心競爭力,將存在於那些被 AI 系統遺漏、具備獨特視角的人類想法中。忽略 AI 自我偏好偏差的組織,最終將面臨「人才複製人」的窘境。我們必須將「自我偏好」納入 AI 公平性審核的必要框架,否則,在追求效率的過程中,我們失去的不僅是多樣性,更是組織在變局中生存的韌性。