《AI 趨勢-蔡博探路》Token 精算時代:當「用得多」不等於「用得好」
本週有一則新聞特別引起注意,那就是 Meta 內部正在建立一套 AI Gateway,用來追蹤員工使用 AI 的狀況與成本,並準備為每個團隊、每個 Agent 設定 token budget。這則消息本身不算大新聞,但卻透露出一個訊號,那就是 AI 產業的比較基準,正從用越多越好的「Token-maximizing」,轉向「這個 Agent 完成一件工作,要花多少 token 才划算」。
本週各家模型仍在能力上互相較勁,但價格策略、風險警訊與底層論文所共同指向的,其實有點類似,那就是:Model-centric 的思維正逐漸讓位給 System-centric 的思維。重點不再只是哪個模型最強,而是整套系統能不能被有紀律、有節制地部署。以下是本期精選趨勢:
一、模型競爭正在轉向價格戰?
本週最值得留意的定價訊號來自 Anthropic 新推出的 Claude Opus 5,官方形容為「深思熟慮且具有主動性」,智慧能力接近旗艦的 Fable 5,但價格僅有一半。
Meta 則是另一種有趣的計費方式,剛發布的終端 coding agent「Muse Code」與底層模型「Muse Spark 1.2」,能力已能與 OpenAI Codex、Claude Code 相提並論;但真正引人注意的是定價細節。只要使用者同意讓 Meta 利用自己的 prompts 進行訓練,API 費用便可降低約 21 倍。換句話說,價格不再只跟算力成本掛勾,「資料換折扣」正在成為新的商業槓桿。
二、機器人成為模型新戰場
Black Forest Labs 開放搶先體驗的 FLUX 3,是一款能同步產生影片、影像與音訊的視覺智慧模型;而他們基於同一套技術延伸出的 FLUX-mimic,則是專為奧迪產線打造的機器人控制變體,目標是大幅縮短機器人的學習時間。
與此同時,Google DeepMind 推出 embodied reasoning 模型 Gemini Robotics ER 2,讓多台機器人得以在共享空間中協同執行任務,並強化了對時間與空間的推理能力。從生成內容到指揮產線機器手臂,模型的戰場正明顯地從螢幕延伸到實體世界。
三、能力愈強,警訊愈密集
模型能力上升的同時,風險訊號也在本週密集出現。近期 OpenAI、Anthropic 先後揭露模型在資安測試中意外存取真實外部系統;之後 Meta 的 Muse Spark 1.1 也出現類似事件。Meta 與 Anthropic 的案例都與第三方測試環境的權限/網路配置錯誤有關,並非模型自行突破原本正確配置的沙盒限制。美國政府也召集主要 AI 業者討論如何強化安全測試與監管機制。
與此呼應的是,超過 1,000 名來自 OpenAI 等機構的員工,聯名發出一封公開信《把握前沿發展節奏》,呼籲美國協助開發相關工具,以便在世界還向自主 AI 研究之際,能夠「有意識地控制」 AI 進步的節奏。
另一則值得玩味的資訊,則是一場隔空的數學能力對話。OpenAI 披露其下一代主力模型內部版本「Astra」解決了 10 個長期懸而未決的數學與計算機科學難題。緊接著,Anthropic 研究員 Levent Alpoge 在 24 小時內也表示,他在完全無網路的情況下,利用 Fable 模型複現了其中的 6 個證明。再加上稍早 Claude Fable 5 也以一行公式,破解了自 1939 年以來困擾數學界的 Jacobian conjecture。目前,學術圈正認真討論 Astra 的成果是否夠格角逐有著「數學諾貝爾獎」之稱的 Fields Medal。這場對話與其說是在比誰更強,不如說是在提醒業界,前沿能力的驗證正變得愈來愈難以壟斷或獨占。
四、監管與法律極力追趕技術的腳步
技術狂奔的同時,監管與法律層面同樣沒有閒著。歐盟開始實施《AI 法案》第50條透明義務,要求 AI 聊天機器人、deepfakes 及其他 AI 生成內容強制加註標籤,以減少欺騙與操縱。而 Anthropic 與圖書作者達成的 15 億美元版權和解案,也獲法院批准。該協議涉及從盜版網站獲取的 48.2 萬部作品,每部作品賠償近 3,000 美元,更重要的是,這個案件也同時確立了 AI 訓練屬於「合理使用」的法律地位,將成為產業後續訓練資料合規的重要參照。
另一方面,Stanford 大學與 Arc Institute 的研究人員,利用 Evo1、Evo2 模型設計出 16 種自然界不存在的病毒基因組(相關成果已發表於《科學》期刊),則是語言模型首次產出完整且具有生物活性的基因組成果,也再一次把「AI 是否可能被用於生物風險」這個問題,從假設性的討論推向現實。
五、學術前沿:效率與穩健性,正成為隱形的競技場
當模型能力已經逼近人類難以驗證的邊界,近期幾篇論文所關心的,反而是更基礎的問題:效率與穩健性。
-
普林斯頓大學、卡內基美隆大學等機構提出「Skill Entropy」指標,用以量化模型從一種推理技能切換到另一種技能的困難程度,並建立涵蓋 558 項技能、跨 9 個領域的 Skill2-Bench 基準測試。研究發現模型表現會隨任務複雜度上升而下降;他們也設計了一套技能熵強化學習架構,要求模型在給出答案前先預測自己需要用到哪些技能標籤,結果同時提升了準確度與技能切換能力。正好呼應了 Agent 系統愈來愈需要跨領域、長流程作業的現實。
-
蘇黎世聯邦理工學院、哥倫比亞大學等團隊提出的 RAG-Stack 架構,則是想解決 RAG 系統裡,「品質」與「效能」互相拉扯的老問題。架構由三個模組組成:負責全局優化與單階段診斷的 RAG-PE、讓工作負載與系統脫鉤的 RAG-IR,以及能免去實地測試、直接預測最佳部署的混合模型 RAG-CM。在 RAGEval 與 MSMARCO 測試中,其 Pareto 前沿覆蓋率比既有最佳方法提升 52.5% 至 153.2%;而換到新硬體時,還能直接沿用既有品質數據,覆蓋率提升可達 182.2%。
結語
本週AI的發展看似矛盾卻又合理:模型能力仍在往上提升,包括數學證明、生物設計、超長 context、實體世界控制,一項比一項驚人;但企業與研究者關心的問題,卻愈來愈往「怎麼把這些能力管好、用得有效率」靠攏。Meta 設 token budget、Anthropic 用一半價格換同等智慧、上千名業界員工聯名呼籲放慢腳步,某種程度上都像是在呼應,能力已經不是唯一的稀缺資源,如何有節制、有紀律地部署,才是下一階段真正要解決的題目。