若你是依賴 GitHub Copilot、Azure Foundry 或自建 Agent 工作流的開發者與企業架構師,2026 年 Build 大會上微軟首次公開展示的 7 款 MAI 自研模型將直接改寫多模型路由與資料主權選型:旗艦推理模型 MAI-Thinking-1 基準接近 Claude Sonnet 4.6(並非行銷所稱的 Opus 對標);MAI-Code-1-Flash 已上線 Copilot;Surface RTX Spark Dev Box 今秋美國發售,可本機執行 120B+ 參數模型。本文涵蓋全部 7 款模型架構與定價、基準真實含義、硬體規格、戰略七維分析、接入程式碼範例與完整 FAQ。節點方案見 定價頁。
[ SECTION_01 ] // BACKGROUND 微軟為什麼要自研 MAI 模型?130 億美元依賴與三大痛點
過去七年,微軟向 OpenAI 累計投入超過 130 億美元,Azure 上的 GPT 模型是其 AI 戰略核心支柱。但深度依賴帶來結構性隱患:
- 成本失控:每次 API 呼叫都要向 OpenAI 付費,規模越大、利潤越薄。
- 技術主權缺失:無法控制模型迭代節奏、資料來源與權重所有權。
- 合約限制:原協議明確限制微軟自訓大規模模型。
轉折點在 2025 年底:雙方重新談判,新協議移除模型規模限制,允許微軟獨立追求「超級智能」。微軟 AI 負責人 Mustafa Suleyman 形容:
「我們大概六個月前才正式從與 OpenAI 的合約中『獲得自由』,被允許用自己的 IP、自己的資料、自己的算力去追求超級智能。這是非常早期的開始。」
Build 2026 是微軟第一次向世界展示這顆「自研大腦」的成果。Suleyman 在發布會上更直接表態:目標是證明微軟能成為全球頂尖四大 AI 實驗室之一——當前公認「三大」是 Google DeepMind、OpenAI、Anthropic,微軟公開承認尚不在其中。
[ SECTION_02 ] // MODELS 7 款 MAI 模型逐一拆解:架構、基準、定價與可用狀態
| 模型 | 能力 | 狀態 |
|---|---|---|
| MAI-Thinking-1 | 推理 / 編碼旗艦 | Azure Foundry 私有預覽 |
| MAI-Image-2.5 | 文生圖 + 圖生圖 | 正式可用 |
| MAI-Image-2.5 Flash | 更快更便宜的圖像生成 | 正式可用 |
| MAI-Transcribe-1.5 | 43 種語言語音轉文字 | 正式可用 |
| MAI-Voice-2 | 多語言 TTS + 語音克隆 | 正式可用 |
| MAI-Code-1-Flash | GitHub Copilot / VS Code 編碼 | 正式可用 |
| MAI-Code-1 | 完整版編碼模型 | 正式可用 |
MAI-Thinking-1 — 推理旗艦
微軟首款推理模型,主打企業級編碼與數學推理,性價比優先。採用稀疏 MoE(Mixture of Experts)架構:總參數約 1T(萬億),推理時僅啟用 35B;上下文視窗 256K tokens;從零預訓練,無第三方蒸餾;資料為企業級 clean data,商業授權、可追溯。當前處於 Azure Foundry 私有預覽(可申請)。
| 基準 | MAI-Thinking-1 | 備註 |
|---|---|---|
| SWE-Bench Pro | 52.8% | 微軟稱對標 Claude Opus 4.6(見下方分析) |
| SWE-Bench Verified | 73.5% | |
| AIME 2025 | 97.0% | 競賽數學 |
| AIME 2026 | 94.5% | 更新題目,防記憶效應 |
| LiveCodeBench v6 | 87.7% | 即時程式設計題 |
| 人類盲測(vs Claude Sonnet 4.6) | 勝出 | 1,276 任務,Surge 獨立評測 |
基準資料的真實含義(別被行銷話術誤導):
- 技術報告實際表述是 competitive with Sonnet 4.6 across a wide range of benchmarks——Sonnet 是 Anthropic 中階模型,不是旗艦 Opus。
- 比較基準版本已過時:當前最新 Anthropic 旗艦是 Claude Opus 4.8(SWE-Bench Pro 69.2%),微軟選用的是兩個版本前的 Opus 4.6(53.4%)。
- GPT-5.5 的 SWE-Bench Pro 是 58.6%,同樣高於 MAI-Thinking-1。
結論:MAI-Thinking-1 是有競爭力的中階推理模型,MoE 架構使推理成本顯著低於密集大模型,但絕對效能與當前 Anthropic / OpenAI 旗艦仍有差距。
MAI-Image-2.5 — 文生圖與圖生圖
- Text-to-Image:Arena.ai 文生圖排名 #3
- Image-to-Image:風格遷移、局部編輯;Arena.ai 圖像編輯榜排名 #2
- Control with Preservation:編輯時保留原始語意結構
- 已整合:PowerPoint、OneDrive、Azure Foundry Model Catalog
| 版本 | 輸入 | 圖像輸出 |
|---|---|---|
| 標準版 | 文字 $5/M tokens;圖像 $8/M tokens | $47 / 1M tokens |
| Flash 版 | 文字+圖像 $1.75 / 1M tokens | $33 / 1M tokens |
MAI-Transcribe-1.5 — 語音轉文字
| 指標 | 數值 |
|---|---|
| 支援語言 | 43 種(含自動語言偵測) |
| FLEURS 平均 WER | 4.9%(業界最低之一,FLEURS 基準 #1) |
| Artificial Analysis WER | 2.4%(綜測第 3) |
| 處理速度 | 276× 即時(1 小時音訊秒級轉錄) |
| 延遲改善 | 相比 1.4 版提升 5.7 倍 |
| 定價 | $0.36 / 音訊小時 |
特色功能 Contextual Biasing 可提升專業術語準確率。橫向對比:在 FLEURS 43 語言基準上超過 Scribe V2、Whisper-large-V3、GPT-4o-Transcribe 和 Gemini 3.1 Flash。典型場景:Teams 會議記錄、客服中心轉錄、Copilot 程式碼註解語音輸入、無障礙工具。
MAI-Voice-2 — 多語言 TTS
- Zero-shot 語音克隆:數秒參考音訊即可合成指定說話人聲音
- 情感風格(Emotion Styles):控制語氣、語速、情感色彩
- 語言覆蓋:15+ 新增語言(完整名單尚未全部公開)
- 輸出:MP3,24 kHz 取樣率
- 定價:$22 / 1M 字元;Flash 超低延遲變體「即將推出」
- 整合:Azure Foundry、VS Code、Dynamics 365、Microsoft Copilot
MAI-Code-1-Flash — 程式設計助手(已正式上線)
- 上下文視窗:256K tokens
- 推理效率優化:低延遲、低成本,面向高頻使用場景
- 已內建:GitHub Copilot(含 CLI)、VS Code、GitHub Actions
- 定價:$0.75 / 1M 輸入 tokens,$4.5 / 1M 輸出 tokens
- 基準:SWE-Bench 51%,超過 Claude Haiku 4.5,速度/成本優勢明顯
在 7 款 MAI 模型中,MAI-Code-1-Flash 可能是對開發者日常影響最直接的一款——不需要等待私有預覽,今天就在你的 VS Code 裡執行。
[ SECTION_03 ] // HARDWARE Surface RTX Spark Dev Box:本機 120B+ 模型與「按 Token 付費」挑戰
Satya Nadella 稱其為 dream machine——一台把雲端 AI 算力搬到桌面的開發者主機。
| 參數 | 規格 |
|---|---|
| 核心晶片 | NVIDIA RTX Spark 超級晶片(Blackwell GPU + Grace CPU) |
| 統一記憶體 | 128GB(CPU + GPU 共享,zero-copy) |
| AI 算力 | 1 Petaflop(1,000 TFLOPS) |
| 功耗 | 100W TDP |
| 機身 | 陽極氧化鋁,3D 列印,1,000 散熱孔 |
| 系統 | Windows 11 Pro(開發者專屬預設定映像) |
開箱即用預裝環境:WSL 2(含原生 GPU 直通 + CUDA)、Visual Studio Code + GitHub Copilot、PowerShell 7、Python、Node.js、Git、NVIDIA CUDA/cuDNN、AI Toolkit for VS Code、Windows ML、Microsoft Foundry CLI。
能跑什麼:本機執行 120B+ 參數模型(如 Llama 4、Qwen 3 等);1M token 上下文互動速度流暢;Fine-tune 原本需要雲端 GPU 才能跑的模型規模。
發售資訊:2026 年秋季、美國(初期)、僅限 Microsoft.com 官網、價格尚未公布(消費者也可購買,非僅企業)。當你在本機跑 120B 模型時,就不需要向 OpenAI/Anthropic 支付 API 費用——這是直接挑戰「按 token 付費」模式的硬體賭注。
[ SECTION_04 ] // STRATEGY 微軟能追上 OpenAI 和 Anthropic 嗎?七維對比與變局邏輯
| 維度 | 微軟 MAI | OpenAI GPT-5.5/5.6 | Anthropic Opus 4.8 |
|---|---|---|---|
| SWE-Bench Pro | 52.8% | ~58.6% (GPT-5.5) | 69.2% |
| 推理成本 | 低(MoE) | 中 | 中高 |
| 上下文視窗 | 256K | 1M | 200K |
| 資料透明度 | 高(商業授權) | 低 | 低 |
| 企業 Azure 整合 | 原生 | 透過合作 | 透過合作 |
| 開發者生態 | 強(GitHub、VS Code) | 極強 | 強(Claude Code) |
| 本機推理硬體 | Dev Box(獨家) | 無 | 無 |
| 目前可用性 | 部分私有預覽 | 全面可用 | 全面可用 |
已經做到的事:獨立訓練能力(MAI-Thinking-1 全程無蒸餾);多模態全覆蓋(文字、圖像、語音、轉錄、編碼);企業資料安全(商業授權、權重可控、Azure 資料駐留);成本競爭力(同等任務成本據稱低於 GPT-5.5 10 倍);極強分發管道(GitHub Copilot 數千萬開發者、M365、Teams);MAI-Code-1-Flash 已上線。
尚未追上的差距:SWE-Bench Pro 旗艦效能仍有約 16% 差距;模型迭代速度(Anthropic 已到 Opus 4.8,OpenAI 已到 GPT-5.6,微軟第一代才剛出來);訓練基礎設施仍在建設中;Claude Code / OpenAI Codex 生態更成熟;MAI-Thinking-1 仍在私有預覽。
真正的變局:微軟在把 AI 競爭從「誰的模型最強」轉向「誰的系統最好用」——當 MAI-Code-1-Flash 內建於 GitHub Copilot,7,500 萬開發者每天都在用微軟模型;當 Surface RTX Spark Dev Box 上市,「本機 AI 主權」變成硬體產品;當企業資料可安全留在 Azure 內部用於 Fine-tune MAI,資料飛輪掌握在微軟手裡。
短期(1–2 年):純模型智力測試上仍落後 OpenAI / Anthropic 旗艦。中期(3–5 年):Suleyman 團隊的 Hill-Climbing Machine 訓練體系成熟後迭代將加快,加上 Azure 分發與 GitHub 生態,有真實機會進入「四大」。這場比賽不一定是誰 benchmark 最高,而是誰在開發者工作流、企業資料主權和硬體側控制了更多摩擦點。
[ SECTION_05 ] // ACCESS 開發者怎麼用 MAI 模型?六步接入指南與 API 範例
| 模型 | 狀態 | 接入方式 |
|---|---|---|
| MAI-Thinking-1 | 私有預覽 | microsoft.ai/models/mai-thinking-1 申請 |
| MAI-Image-2.5 / Flash | 正式可用 | Azure Foundry Model Catalog |
| MAI-Transcribe-1.5 / MAI-Voice-2 | 正式可用 | Azure Speech API |
| MAI-Code-1-Flash / MAI-Code-1 | 正式可用 | GitHub Copilot / VS Code / API |
MAI 模型也可在 OpenRouter、Fireworks AI、Baseten 等平台呼叫(Build 2026 宣布)。Azure 是多模型平台,可在同一 Foundry 工作區同時呼叫 MAI 模型與 GPT-5.6。
- 確認帳號與區域:登入 Azure Portal,建立或選擇 AI Foundry 工作區,確認 Speech / OpenAI 服務端點所在地區支援目標 MAI 模型。
- 申請 MAI-Thinking-1 私有預覽:造訪 Microsoft Foundry Model Catalog 搜尋「MAI-Thinking-1」提交存取申請;公開預覽預計數週內推出。
- 部署 MAI-Code-1-Flash API:在 Foundry 部署
mai-code-1-flash端點,記錄azure_endpoint與 API Key;GitHub Copilot 使用者無需額外設定。 - 設定多模型路由:用 LiteLLM 或應用層 fallback 在 MAI-Code-1-Flash(低成本編碼)與 GPT-5.6 / Claude(複雜推理)之間分流,避免全量任務打旗艦模型。
- 接入語音與圖像:轉錄走 Azure Speech API(MAI-Transcribe-1.5);圖像生成走 Foundry Model Catalog(MAI-Image-2.5);注意 Flash 版定價更低。
- 固定 Agent 執行環境:把 Copilot CLI、Foundry CLI 試跑與多模型批次任務遷到 7×24 穩定 Mac 宿主,避免筆電休眠導致 OAuth 過期與任務中斷;金融/醫療客戶優先在 Azure 租戶內 Fine-tune,確保資料不離開環境。
import openai
client = openai.AzureOpenAI(
azure_endpoint="https://<your-resource>.openai.azure.com/",
api_key="<your-api-key>",
api_version="2026-05-01"
)
response = client.chat.completions.create(
model="mai-code-1-flash",
messages=[
{"role": "system", "content": "You are an expert software engineer."},
{"role": "user", "content": "Refactor this Python function to use async/await: ..."}
],
max_tokens=2048
)
print(response.choices[0].message.content)
[ SECTION_06 ] // DATA 可引用技術資料、FAQ 與總結
- MAI-Thinking-1 MoE 啟用參數:總參數約 1T,推理僅啟用 35B,推理成本顯著低於 GPT-5.5、Claude Opus 等密集模型。
- MAI-Transcribe-1.5 吞吐:276× 即時處理速度,FLEURS 43 語言 WER 4.9%,定價 $0.36/小時音訊。
- Surface RTX Spark Dev Box:128GB 統一記憶體、1 Petaflop 算力、100W TDP,可本機互動執行 120B+ 參數模型與 1M token 上下文。
- SWE-Bench Pro 差距:MAI-Thinking-1 52.8% vs Claude Opus 4.8 69.2%,差距約 16 個百分點;人類盲測對 Sonnet 4.6 在 1,276 任務中勝出。
FAQ 精選:
- MAI-Thinking-1 現在可以用了嗎? 目前私有預覽,需在 Azure Foundry 申請;公開預覽預計數週內推出。
- MAI-Thinking-1 真的能對標 Claude Opus 嗎? 行銷說對標 Opus 4.6,技術報告實際是對標 Sonnet 4.6;當前 Opus 4.8 SWE-Bench Pro 69.2% vs MAI-Thinking-1 52.8%。
- Surface RTX Spark Dev Box 多少錢? 價格尚未公布,預計 2026 年秋季在美國 Microsoft.com 發售。
- 開發者現在能用哪款? MAI-Code-1-Flash、MAI-Image-2.5、MAI-Transcribe-1.5、MAI-Voice-2 已正式上線;MAI-Thinking-1 需申請私有預覽。
- MAI 與 OpenAI 模型能在 Azure 共存嗎? 可以,同一 Foundry 工作區可同時呼叫 MAI 與 GPT-5.6。
- MAI-Code-1-Flash 和 GitHub Copilot 什麼關係? 已成為 Copilot 後端模型之一(CLI 與 VS Code 內嵌建議),使用者無需設定變更。
- 微軟模型和 OpenAI 的核心區別? 資料所有權——在 Azure 內 Fine-tune MAI 的資料承諾不離開你的環境;對金融、醫療、法律客戶至關重要。
Build 2026 標誌著微軟正式宣告獨立於 OpenAI 的自研 AI 之路——第一代 MAI 模型可用但不是最強,卻在成本效率、企業資料主權、GitHub 分發與本機 Dev Box 硬體上布下了長期棋局。
以下為主要參考來源,發版或入庫後請再次開啟連結核對:
Microsoft AI: Introducing MAI-Thinking-1
MAI-Thinking-1 Technical Report (PDF)
Microsoft Build 2026 MAI Keynote Transcript
New MAI models in Microsoft Foundry
Surface RTX Spark Dev Box (Microsoft Devices Blog)
Microsoft and OpenAI broke up — now they're ready to fight (The Verge)
若你把 MAI-Thinking-1 私有預覽、Foundry 多模型試跑與 Copilot CLI 批次任務跑在會休眠的筆電上,再亮眼的 MoE 成本優勢也會被任務中斷、OAuth 過期、磁碟滿載吃掉;純靠 Azure API 也無法替代穩定 7×24 的本機執行面與 Xcode 同機驗證。Surface RTX Spark Dev Box 雖能本機跑 120B,但首發僅限美國、價格未公布、無法替代遠端 CI 與多地區協作。
若你需要在 MAI 模型全面開放前7×24 試跑 Agent、固定 SSH 與可預期 Apple Silicon 算力,把 Copilot CLI、Foundry 批次任務與 LiteLLM 多模型路由遷到獨占裸金屬伺服器,通常比在不穩定環境反覆救火更划算:NOVAKVM 提供多地區 Mac Mini M4 / M4 Pro 彈性租期,固定頻寬與預設 SSH 存取,適合 iOS CI/CD 與 AI Agent 自動化同機驗證。方案見 定價頁,下單見 雲端訂購頁,部署問題見 雲端說明中心。