馬斯克(Elon Musk)旗下人工智慧公司xAI於8月12日發布新一代模型Grok 4.6,距離上一代Grok 4.5發布僅相隔35天——這是AI前沿模型競爭速度持續加快的最新例證。新模型聚焦於能長時間自主運作的AI代理(agent)任務,在多項基準測試中追平OpenAI的GPT-5.6 Sol,僅次於Anthropic的Claude Opus 5。

Grok 4.6強化了模型在長時間互動、多步驟任務(如研究分析、程式碼撰寫、應用程式開發)中的自我測試與驗證能力,並改善了視覺與互動類任務的首次執行成功率。xAI表示,這得益於延伸的補充訓練,包括篩選過的模型生成資料、高品質工程資料、改良後的優化器,以及跨多領域的代理式強化學習(agentic RL)。

根據Artificial Analysis智慧指數(AA Intelligence Index)評測,Grok 4.6與GPT-5.6 Sol同分61分,僅次於Claude Opus 5,位居第四;在GDPVal-AA測試中,Grok 4.6得分1753,高於前一代Grok 4.5的1526分,成長幅度居各項測試之冠。不過在部分程式碼類基準測試中仍落後對手——DeepSWE v1.1測試中,Grok 4.6得分65.9%,低於GPT-5.6 Sol的73%;在CursorBench v3.2測試中則以69.9%小幅落後Claude Fable 5 Max的70.5%。定價維持每百萬輸入token 2美元、輸出token 6美元,與前代相同。

不過,Grok 4.6在多項程式碼相關基準測試中仍落後GPT-5.6 Sol與Claude Fable 5 Max,顯示「追平競爭對手」的說法在特定任務類型上仍有落差;xAI也未在發布資訊中公布上下文視窗(context window)長度等細節,透明度不如部分競爭對手。

前沿模型的發布週期從過去的數月,導致縮短至35天,進而壓縮開發團隊測試與除錯的時間,因此外界也開始關注這種軍備競賽式的更新節奏,是否犧牲了模型的穩定性與安全驗證。

Grok 4.6目前已在xAI的API、Cursor與Grok Build平台上線,並提供OpenRouter、Vercel、Cloudflare等第三方整合,首週於Grok Build與Cursor內提供雙倍使用額度優惠。

數據重點
距上一代Grok 4.5發布僅35天;AA智慧指數61分,追平GPT-5.6 Sol,僅次於Claude Opus 5

隨著前沿模型的發布週期壓縮至一個多月一次,這場軍備競賽的下一步,可能不再只是比較誰的分數更高,而是誰能在更快的迭代速度下,仍守住安全驗證的底線。

 

來源參考

1. Introducing Grok 4.6 — xAI官方部落格, 2026-08-12

以上為資訊分享,不構成投資建議。

Keep Reading