「這份資料我不敢丟給 AI。」如果你也講過這句話,那 NVIDIA 在 IFA 2026 公布的這批更新值得看一下:本機模型變成一鍵安裝、同一張顯卡最高快 1.9 倍、家裡多台電腦還能串起來一起算。這篇把官方講的四件事拆開,再給你三個步驟自己開始。
這是誰講的?NVIDIA 官方部落格,2026 年 9 月 3 日
來源是 NVIDIA 官方部落格 9 月 3 日的貼文,作者 Gerardo Delgado,發布時間點是德國柏林的 IFA 2026 展期。開頭第一句就把定調講完了:
「Frontier intelligence is going local.」(前沿智慧正在往本機走。)
官方說這次是 NVIDIA、Microsoft 和一票合作夥伴一起做的,目標只有一個:讓 agent 在自己的機器上更好裝、跑更快。
NVIDIA 公布了哪 4 件事?
1. 本機模型變成「一鍵安裝」
以前要在自己電腦跑模型,得自己挑模型、找相容的推論伺服器、調量化參數,還要盯著更新。官方原文的說法是「That friction is disappearing」——這些摩擦正在消失。
三個常見的 agent app 會提供 Windows 上的簡化安裝:Hermes Agent(Nous Research 做的)、OpenClaw(GitHub 超過 38 萬顆星)、Perplexity Portable Computer。三者都建在 llama.cpp 上、都吃 NVIDIA 這次的推論最佳化。Hermes 那邊會自動偵測顯卡、自己選模型和設定,不用手動下載調整;Linux 支援之後才上。
門檻要先講清楚:OpenClaw 的 Windows app 需要 24GB 以上的顯示記憶體,Perplexity Portable Computer 目前是 Linux + 24GB VRAM 以上,Windows 版官方說「即將推出」。所以這批一鍵安裝現階段還是給高階顯卡的人,一般筆電先走下面那條 Ollama 的路。
2. 同一張顯卡,最高快 1.9 倍
這張是官方自己貼的數據圖,看三組:
- llama.cpp 在 GeForce RTX 5090 上跑 Qwen3.6-35B,吞吐量從 1x 拉到 1.9x;跑 Qwen3.6-27B 是 1.5x
- vLLM 在 RTX PRO 6000 Blackwell 上,兩個模型都是 1.2x
- vLLM 在兩台 DGX Spark 組成的叢集上,Qwen3.6-27B 是 1.4x、DeepSeek v4 Flash 是 1.2x
圖表下面有標測試條件:SpeedBench-Coding 8K Throughput、用 AIPerf 量、BS=1、MTP=3。重點是這些最佳化不用你自己編譯,官方說現在直接透過 LM Studio 和 Ollama 就吃得到。
3. NVIDIA PAIR:家裡的電腦可以併起來算
這個我覺得是這次最有趣的一項。PAIR 全名 Personal AI Router,是一個免費開源工具,會自動找出你區網裡相容的機器,然後把推論請求路由到「還有餘力」的那一台。
支援 Ollama 和 LM Studio。相容範圍比想像中寬:GeForce RTX 20 系列以上、RTX PRO 工作站(Turing 以上)、DGX Spark,甚至 Apple M4 以上也算在內。也就是說書房那台顯卡機和客廳的 Mac,理論上可以一起被派工。
4. RTX Spark Windows 電腦,10 月上市
硬體這條線是新的 NVIDIA RTX Spark Windows PC,10 月開賣,第一批是 Lenovo(Yoga Pro 9n、Yoga 9n 2-in-1)和 Acer(一台小型桌機概念機)。規格官方給的是:1 PetaFLOP 的 RTX Blackwell GPU、最高 128GB 統一記憶體、20 核 Grace CPU。
順帶一提,Electronic Arts、Embark、Ubisoft、KRAFTON、NetEase、Riot Games、XBOX 也被列在支援名單裡——這台不是只給跑模型用的。CyberLink 的 PhotoDirector 也會在 10 月上市時同步推出 AI PC Mode,生成式編輯、去雜物那些功能可以選在本機或雲端跑。
為什麼要在自己電腦跑 AI?
講技術之前先講動機,因為這才是一般人會不會動手的關鍵。
第一,資料不離開裝置。報價單、客戶名單、還沒公布的內部文件,貼進雲端聊天框那一刻就是送出去了。本機跑就沒有這一步。官方在講 Perplexity Portable Computer 時舉的例子蠻具體的:把兩年的券商對帳單、彙整的稅務表單丟給 agent,讓它找出哪些持股一直在產生可避免的費用,每個數字都標明出自哪個檔案第幾頁——「而且文件從頭到尾沒有進過任何一個聊天機器人」。它要送任何內容上雲之前也會先問過你。
第二,不燒點數。官方的原話是「Users can run complete workflows locally without consuming credits」,需要更深的研究或推理時,才把那一段升級到雲端的 15 個以上前沿模型。等於把額度花在刀口上。
第三,斷網照樣能用。模型就在你的硬碟裡。飛機上、山上、公司內網不給連外,都不影響。
這個「東西留在自己手上」的邏輯,我自己是吃過虧才特別有感。之前部落格被 Google 系統誤判停用了 20 個小時,那次我做的第一件事就是把全站文章全文備份到本機——免費平台隨時可能再判你一次,手上要有夠新的一份。AI 也是同個道理:能留在自己機器上的,就不要每次都仰賴別人的伺服器有沒有心情理你。
本機 AI 怎麼開始?3 個步驟
步驟一:裝 Ollama 或 LM Studio
這兩套是目前最好上手的本機模型工具,都免費,也都是官方這次點名「加速直接吃得到」的對象。Ollama 偏指令列、設定乾淨;LM Studio 有圖形介面,第一次玩比較不會慌。挑一個裝就好,不用兩個都來。
步驟二:挑一個跑得動的模型
不要一開始就衝最大的。先從 7B 上下的模型起步,跑得順再往上加。顯示記憶體不夠的話選量化版(檔名帶 Q4、Q5 那種),犧牲一點精準度換得動。
官方這篇也順便盤了 8 月的一批新模型,想知道現在本機跑得動什麼可以參考:Nemotron 3.5 Lightning(300 億參數)、Meta 的 Muse Glimmer(300 億參數、主打寫程式)、Qwen3.8-27B、DeepSeek v4 Flash(2840 億參數的 MoE、實際啟用 130 億)。這些名字有沒有聽過不重要,重要的是「開源模型能在自己機器上跑」這件事已經是常態了——這也是為什麼 NVIDIA 用 129.3 億美元收購 Hugging Face 那件事會這麼多人在意,開源模型的集散地換老闆,影響的就是你未來下載得到什麼。
步驟三:先拿「不敢上雲的那些事」開刀
本機模型比雲端旗艦弱,這是事實,所以任務要挑對。適合的是翻譯、摘要、整理逐字稿、把一份文件重新結構化這類「材料你已經給它了」的工作。不適合的是查最新資訊、需要大量推理的難題——那些還是回頭用雲端。
下指令的方式也要調整。雲端模型你隨便問它都能猜到意思,本機小模型不行,得把範圍和輸出格式講死。我自己會這樣開頭:
「接下來這份文件只准在本機處理,不要連外。先用三句話講它在說什麼,再列出五個我該追的問題。」
先給邊界、再給格式,答案會穩很多。
我自己真的用過的一次
上個週末我在弄一個小專案,想把電視遙控器改造成 AI 的實體控制器,按方向鍵選選項、長按麥克風下語音指令。硬體那段最後是卡關收攤的(遙控器的語音走 Google 私有的藍牙協定,逆向得到但穩不下來),但中間有一段是通的:我收到 2331 包音訊,丟給本機的 whisper 轉錄,「今天天氣很好」六個字乾乾淨淨跑出來。
那一刻的感覺跟用雲端 API 很不一樣。整段語音沒有離開這台電腦,沒有 API key、沒有計費、沒有網路來回。轉錄這種任務本來就不需要世界上最聰明的模型,需要的是「隨時可用、資料不外流」。這就是本機 AI 最務實的位置。
帶同仁上課時最常被問的一題也是這個:「那我公司的資料到底能不能給 AI?」與其在「能」跟「不能」之間糾結,不如先把手上的資料分兩堆——本來就公開的丟雲端,敏感的走本機。分完你會發現,真正卡住的檔案其實沒那麼多。
套用前有幾點要注意
第一,這次的一鍵安裝門檻不低。24GB 顯示記憶體不是主流筆電的配置,多數人短期內還是走 Ollama / LM Studio 自己裝的路。
第二,PAIR 是分流不是變快。它把工作派給有餘力的機器,改善的是「整體吞吐和不塞車」,不會讓單一次回答變成兩倍速。
第三,本機不等於絕對安全。模型跑在自己電腦上,但你裝的那個 app 有沒有其他連外行為、有沒有偷偷同步,還是要自己確認。官方特別提到 Perplexity Portable Computer 送內容上雲前會請求許可,那正好說明「會不會上雲」是一個要看設定的選項,不是預設關掉的。
第四,硬體規格是官方發布數字,實際效能還要等上市後的第三方測試。NVIDIA 講 AI 要走進實體世界這件事已經講了一陣子,之前寫過的「實體 AI」那篇講的是讓機器看懂真實世界,這次是把運算搬回你的桌上,方向其實是同一條線。
小結
本機 AI 這條路,過去卡的是「難裝」和「太慢」。NVIDIA 這次公布的四件事剛好對著這兩個痛點:一鍵安裝解決難裝,最高 1.9 倍解決太慢,PAIR 讓閒置的機器加進來,RTX Spark 電腦則是給願意花錢的人一個現成解。
如果你今天只做一件事,我建議是裝 Ollama、抓一個 7B 模型、拿一份你一直不敢上傳的檔案試一次。試完你會知道自己的門檻在哪,比看十篇評測都有用。
延伸閱讀
- 文書筆電怎麼選?三星 Galaxy Book6 官方 4 個數字:25 小時續航、NPU 15 TOPS、US$799 起——想知道一般筆電的 AI 算力大概在什麼水位,可以對照著看
本文整理改寫自 NVIDIA 官方部落格〈Sparks Fly: NVIDIA Accelerates Local AI at IFA 2026〉,作者 Gerardo Delgado,2026 年 9 月 3 日發布。原文:blogs.nvidia.com
留言
張貼留言