《AI 趨勢-蔡博探路》科技巨頭集體喊慢,背後各有盤算
最近 AI 圈出現一個耐人尋味的現象:前沿 AI 業內人士開始公開呼籲放慢發展腳步。先是Anthropic 研究員在社群上發表辭職聲明,直指各大實驗室是在「gambling with our lives」;隨後,Anthropic 執行長 Dario Amodei 發表〈We Must Pace the Frontier〉,呼籲產業放慢前沿模型的能力提升速度。對此,NVIDIA 執行長黃仁勳的回應也相當直接:如果真覺得自家 AI 快要失控,那就自己先停下來。
各方背後自然各有盤算,而這場「暫緩派」與「加速派」之爭,短期內應該還會持續。值得注意的是,就在呼籲放慢的同時,各家新模型仍一款接一款推出。本週就從這兩條看似矛盾、實則並行的主線談起。
一、AI 安全議題升溫,從路線到模型能力蒸餾
(1)減速與加速的路線之爭:
Dario Amodei 等 AI 領袖主張放慢前沿 AI 的發展速度,核心論點是以更嚴格的安全評估與產業間協調,替社會與政府爭取建立治理機制的時間。這並非要求停止研發,而是希望前沿能力的推進速度不要遠遠甩開制度的應對能力。
不過,NVIDIA CEO黃仁勳則持相反立場。他認為,若一家公司真心相信自己的 AI 已危險到可能失控,最直接的做法是自行暫停;以尚未經科學證實的末日風險,要求整個產業一起減速,理由並不充分。
(2) Anthropic 威脅報告與美國政府的指控:
Anthropic 發布最新《威脅報告》,披露過去八個月 Claude 遭濫用的典型案例,包括涉及生物武器風險的警示、間諜活動、被要求扮演 4,700 個約會 App 用戶,以及中國 AI 實驗室以 Claude 代替自家模型對外提供服務等情況。
而美國政府也罕見地公開指控六家中國 AI 公司,透過 distillation(蒸餾)大規模擷取美國前沿模型的能力。這讓「AI 安全」的討論不再只停留在模型本身會不會失控,也延伸到能力外流與地緣競爭的層面。
二、前沿模型競賽並未停歇
(1)Anthropic 發布 Claude Fable 5.1
主要回應先前用戶的回饋。新版在長程式碼編寫與研究型任務上的表現明顯提升,觸發安全攔截的頻率也有所降低,在實用性與安全性之間做了進一步調整。
(2)OpenAI 推出備受期待的 GPT-6 Astra
,官方稱其為「最智慧、最符合人類價值觀」的模型,在科學、數學、電腦操作、程式設計與網路安全等領域的基準測試均創下新高。黃仁勳甚至表示,AGI 的時刻已經到來。不過,基準測試成績與「AGI」之間該如何界定,業界仍有不同看法。
(3) Meta 發布 Muse Spark 1.3
主打前沿等級效能與極低成本。加上 Google 不久前才推出 Gemini 3.7/3.8 Flash,輕量高效模型的競爭明顯升溫。這也顯示 Meta 正逐步走出 Llama 系列後期的低谷。
(4) 中國新創 Z.AI 推出 GLM-5.3-Flash,各指標數據為 DeepSeek 兩倍
中國新創 Z.AI 證實,先前在 OpenRouter 排行榜登上榜首的匿名免費模型「Ox Alpha」,正是其新款 GLM-5.3-Flash,各項指標數據約為第二名 DeepSeek 的兩倍。Z.AI 已公開模型權重,定價僅為頂尖競爭對手的一小部分。開源權重加上低價策略,對商用模型的定價空間將持續帶來壓力。
三、數學與醫學難題
(1) OpenAI 宣稱解決七大「千禧年大獎難題」之一,引發優先權爭議
OpenAI 表示,其未公開的內部模型完成了數學證明,解決七大「千禧年大獎難題」之一的 Navier-Stokes 方程式問題。然而,紐約大學的 Tristan Buckmaster 質疑,OpenAI 是否利用了他存放在 Codex 中的草稿搶先完成。OpenAI 最新回應否認受到草稿影響,但承認確實是聽聞該研究方向的進展後才投入。
撇開證明本身仍待數學界驗證,這起事件點出一個新問題:當研究者把未發表的工作放在 AI 工具中,資料邊界與學術優先權該如何保障,未來恐怕會越來越常被討論。
(2)AI 設計藥物出現延緩衰老的早期訊號
Insilico Medicine 公布的小樣本試驗數據顯示,其 AI 針對肺病設計的藥物 rentosertib,使患者在全部六項「衰老時鐘」指標上呈現較年輕的生物學特徵。這仍屬早期訊號,樣本數有限,但若後續得到驗證,意味著藥物效果可能不只限於肺病。比起各種行銷式宣傳,這類具體的醫學成果,或許更能改變大眾對 AI 的觀感。
四、學術前瞻
(1) IBM:STAIR,讓檢索學會「翻目錄」
《STAIR: A novel dataset and LLM based retriever for document structure augmentation》這篇論文指出,傳統檢索與 RAG 常因片段化切分(chunk)而遺失上下文的語義關聯。STAIR 將文件的目錄結構納入檢索流程,模擬人類先看目錄、再定位內容的方式,以提升精確度並降低幻覺。研究團隊同步發表跨領域的 SearchTome 基準測試集,實驗顯示其召回率明顯優於 BM25 與微調後的 DSI 等基準方法。
(2) Google DeepMind、MIT、Stanford:設計文件才是系統的唯一真理
《Design Docs Are All You Need: An AI-native Machine-Learning Performance Tool》這篇論文則提出名為 SMART 的效能建模工具,核心理念是把自然語言設計文件當作系統的唯一依據,而非程式碼。由於 ML 領域的硬體與模型架構更迭極快,傳統程式碼容易累積技術債,SMART 因此由 AI Agent 依據設計文件重新生成整個函式庫,並以有向無環圖管理模組依賴、以符號式中間表示法計算效能成本。這種做法同時處理了程式碼生成的上下文限制,也透過逐步範例維持輸出的一致性。
(3.) AIST、牛津大學等:視覺通用智慧白皮書
AIST、牛津大學等單位在《Visual General Intelligence: A White Paper》這份白皮書中主張,智慧不應只局限於語言,而應從視覺經驗中學習物理規律、空間結構與因果關係。透過大規模影片生成、自監督預測與 3D 重建,模型可望展現創意想像、科學發現與機器人體感互動等能力。與目前把視覺當作語言模型附屬功能的做法不同,VGI 強調建立視覺原生、具備持續學習與主動感知特性的系統。
結語:一邊呼籲減速,一邊持續衝刺
本週的訊號看起來有些矛盾:呼籲放慢前沿發展的聲音變得更響亮,新模型卻照樣密集推出,而且推出者往往正是同一批公司。
這未必是虛偽,更可能反映出產業的真實處境:沒有任何一家公司能單方面停下,因此才有人希望透過協調與規範,讓大家一起放慢。加速派則認為,在風險尚未被證實之前,減速本身也有代價。
對企業與一般使用者而言,這場辯論短期內不會有結論。比較務實的做法,是持續關注各方論點如何轉化為具體政策,同時留意那些真正落地的成果,例如醫藥與科學研究上的進展,因為它們最終會比口號更能說明 AI 帶來了什麼。