《AI 趨勢-蔡博探路》效率悖論、浮水印爭議,與 Agent 間的地盤爭奪戰

傑文斯悖論(Jevons paradox)是一個經濟學理論,也就是當一項資源的使用效率提高、單位成本下降時,人們對它的總消耗量不減反增,結果整體支出或資源使用量反而比效率提升前更高。

近期發現這種違反直覺的實例並不少,例如 OpenAI GPT-5.6 Luna/Terra 大幅降價,單位成本降至原本的五分之一,使用量暴增到13.8 倍;據媒體報導Anthropic 又與 Nvidia 支持的 Lambda 簽下約 350 億美元的雲端運算合約。結果模型越有效率,買進的總算力反而越多。如果只做單純的第一層思考,很容易得出「效率提升等於總成本下降」這種過於樂觀的結論,但現實往往更複雜一些。

本週的 AI 產業新聞也延續了這種「表面訊號與實際走向未必一致」的味道:監管機構要求 AI 輸出「可被追蹤」,廠商的回應方式卻引發兩極爭議。 AI Agent 被放進真實企業與科研場景測試,結果好壞參半,好的部分甚至超出多數人預期;但當多個 Agent 被放在同一環境裡自行運作,原本被視為「協作」的設計,也開始暴露出「衝突」的一面。以下是本期精選趨勢:

一、各家模型能力躍升,價格卻越低?

  • Google持續押注高性價比模型
    Google 跳過了傳聞中的 3.6 Pro,發布 Gemini Flash 3.7/3.8,在程式設計、知識型工作與智慧的表現上大幅升級;且定價低於 Sonnet 5、GPT-5.6 Terra 與 Muse Spark,顯示 Google 目前戰略重心偏向企業落地而非通用強模型。

  • SpaceXAI發布Grok 4.6 與「化身群聊隊友」的 Grok Bot
    SpaceXAI 發布頂級新模型 Grok 4.6,基準測試表現足以與 Anthropic Fable 5、OpenAI GPT-5.6 Sol 等頂尖模型抗衡,價格卻低 60%,驗證了一時落後不代表永遠落後;同時也和 Cursor 推出 Grok Bot,將 Grok 化為類 iMessage 群聊體驗,其中的 AI「隊友」擁有專屬運算資源,能自主工作並像真實使用者一樣操作各類日常應用程式。

  • Anthropic發布MHS,讓 AI 學會「動手」
    Anthropic 發布 MHS(Model Hardware Standard),讓 AI agent 能以較統一的方式連接並操作各類工廠與實驗室設備,如同 MCP 以統一協定連接外部軟體工具。概念上與 MCP 類似,只是 MCP 統一的是「軟體工具」的溝通協定;MHS 統一的則是「硬體設備」的溝通協定。如果這套標準真的被廣泛採用,AI 走向「動手」的門檻會再降低一點。

二、監管或透明度?Anthropic浮水印機制引發兩極反應

Anthropic 宣布未來將在 Claude 輸出的文本、程式碼與文件中嵌入不可見浮水印,做法是透過模型選字時的統計手段留下痕跡,目的是配合歐盟《人工智慧法案》的透明度要求。這項政策公布後引發兩極反響,支持者認為這是負責任的作法,有助於辨識 AI 生成內容、提高透明度;反對者則擔心這會形成過度監管,甚至有人以「反烏托邦」來形容這種「無所不在的標記」。這個爭議短期內不會有定論,但可以預期的是,隨著監管要求擴散到更多地區,類似的浮水印機制很可能會成為主流模型的標準配備。

三、AI落地讓價值重新被定義:

  • 不只是效率提升,而是降低嘗試成本
    Asana 表示,他們利用 OpenAI 的 Codex,在兩週內、花費約一萬美元,移除了一套過時的測試框架。而根據最初估算,這項工作原本需要五年時間、600萬美元預算。這個案例值得企業領導者留意的地方,不是「AI 讓工程師寫程式快了三成」的效率提升,而是它把一項原本「不划算、沒人想碰」的多年期工程,變成了一件「短期內就能嘗試」的專案。這種質變,對企業資源配置的意義可能比單純的生產力數字更大。

  • AI 在蛋白質設計上的成功率高於業界平均
    Anthropic 發布研究顯示,Mythos Preview 與 Opus 4.8 模型在藥物發現的關鍵環節,也就是蛋白質設計任務中,能自主調度專業工具完成設計流程。在針對 15 個靶點的設計嘗試中,有 14 個成功獲得能與目標結合的蛋白質,整體設計命中率也高於業界平均水準。

  • 驗證能力正在變成一項稀缺技能?
    來自北京的神經外科住院醫師 Shanmu Jin ,利用 GPT-5.6 Sol,在 ChatGPT Work 環境(無網路)中經 16 小時自主運作後,證明了未解的矩陣數學難題 Crouzeix's Conjecture。正式的學術審查仍在進行中,但猜測提出者本人已初步驗證了此證明,這件事情也點出了一個逐漸浮現的現象:當 AI 能自己產出證明,驗證是否為真本身,正在變成一項稀缺技能。

四、Multi-agent 的「地盤爭奪戰」

Anthropic 發布了一項新研究,測試 AI agent 在群體環境下的行為模式。其中最極端的案例,是一組共享後端的三個 Claude agent,在長達四小時的時間裡,彼此互相破壞,並試圖將對方拒之門外,演變成一場「地盤爭奪戰」。

這個結果值得企業在導入 multi-agent 系統前思考,multi-agent 系統雖能透過平行化與專業分工提升能力,也可能產生從眾、勾結、資訊誤判與目標衝突等新的系統性風險。也就是說,接下來的核心挑戰,將逐漸從模型能力轉向協作機制與治理設計。

五、學術前瞻

  • NYU、AMI Labs、杜克大學等機構發表的論文《LpWM: A Case for Sparse Representations in World Models》,介紹了一種運用稀疏表徵來優化世界模型的新型架構 LpWM。
    相較於傳統稠密向量,稀疏編碼能將複雜的非線性動力學簡化,使模型在較低容量的預測器下仍能實現高效規劃。透過 RDMReg 正規化技術,該模型不僅在 PushT(機器人推積木)等任務中顯著提升規劃成功率,還展現出極佳的可解釋性;其潛在空間具有模態分解特性,二進位結構可識別不同動力學範疊,數值大小則捕捉具體狀態細節,證明稀疏幾何結構能降低控制任務的計算複雜度,揭示環境中具物理意義的結構。

  • 普林斯頓大學、MIT 等機構提出開源的自主代理架構《Prime Agent: A Self-Improving RLM Harness》。這個開源的自主代理程序架構 Prime Agent,目標是提升語言模型在長週期任務與程式開發工作流中的表現。
    這套架構透過 Recursive Language Model 實現了可程式化的內文處理,並結合 Continual Harness 技術,讓模型能跨階段保存與修正歷史、記憶及技能。
    實驗顯示,該架構明顯提升了 ARC-AGI-3 等基準測試的得分,也有效減少了因架構限制導致的失敗,讓評測結果更接近模型本身的真實潛能。

  • Google DeepMind、杜克大學等機構發表《Accelerating Scientific Research with Gemini in the Real-World》。把先前發表於 Nature、以 Gemini 為基礎的 multi-agent 系統 Co-Scientist,從單純的電腦模擬延伸到現實世界的實驗驗證,能自主完成假說生成、實驗設計與論文撰寫。
    該研究在材料科學、生物學及電腦科學三個領域驗證其效能,成功合成新型二維材料並能預測大腕枌菌的群體表型;系統內建的可靠性模組與安全架構能有效減少 AI 幻覺及剥竊問題,確保研究過程符合倫理規範。

結語

這幾則新聞的共同的主軸是,AI 正在從「被觀察、被測試的對象」,變成「在真實世界裡自己動手做事」的角色,如寫證明、設計蛋白質、操作實驗設備、甚至彼此爭奪運算資源。

雖然能力提升速度很快,但隨之而來的是,驗證機制、協作治理與透明度規範都必須跟上同樣的步調。對企業與研究機構而言,接下來要盯緊的,可能不再只是「模型能做到什麼」,而是「當它真的做到了,我們有沒有辦法確認、控管與追溯這個結果」。