技術

Nvidia PAIR將家中GPU連成叢集,AI代理速度翻倍——完全免費

Susan Hill

Nvidia 推出一款名為 PAIR(Personal AI Router)的全新免費工具,能將 AI 代理任務分散到你家中網路上的多台電腦,讓你的遊戲 PC、工作站,甚至 Mac 都變成一個統一的推理叢集。概念很簡單:多數算力吃重的電腦平時大多閒置,而本機端的 AI 工作負載越來越常圍繞著代理(agent)來設計,這些代理一次會產生數十個獨立的子任務。PAIR 就是把這些閒置週期連接起來。

這套軟體以透明代理(transparent proxy)的形式運作在 Ollama 與 LM Studio 之上——這兩套是目前最受歡迎的本機推理工具——因此既有設定不需要修改任何程式碼。在每台機器上安裝後,PAIR 會利用 mDNS(就是你印表機用來出現在網路上的那個協定)自動發現相容裝置。主代理(lead agent)照常提交工作,PAIR 則根據每台機器上已安裝的模型來決定由哪台機器處理哪個子任務。各機器不需要完全相同的設定:一台跑 Llama 3.3 的遊戲 PC 與一台裝有 Mistral 的筆電可以合作完成同一項工作。

Nvidia 公布的基準測試讓差異變得具體:一個包含五個子代理的任務,在單一台 RTX Spark 筆電上需要 18 分鐘,而在三台裝置的叢集上只需 8 分 48 秒。這大約是 2 倍的加速,而且完全不需動到一行程式碼,也不用付費使用雲端運算。加速效果會隨著機器數量與工作負載特性而擴展——那些能拆分成大量平行片段的工作任務受益最大。

隱私是另一個賣點,而且更持久。每個提示詞、檔案以及代理上下文都留在你的家用網路內。沒有任何東西被路由到雲端推理服務;沒有 API 金鑰、沒有用量計費、也沒有任何公司接收你的查詢。對於任何在敏感文件上執行代理的人——法律草稿、醫療紀錄、私人信件——這個差異比基準測試數字更重要。

但限制確實存在。PAIR 不保證服務品質:如果你原本指望的那台機器因為玩遊戲或匯出影片而喚醒 GPU,PAIR 會把該工作負載重新分配給其他可用的機器。這套工具明確是為那些截止時間較有彈性的長時間任務而設計,不適合需要可預測延遲的應用。它目前仍是測試版軟體。Nvidia 將這款產品定位給至少有一台相容機器的進階使用者——GeForce RTX 20 系列或更新的顯示卡,或 Apple M4 系列晶片——並且預期他們已經熟悉 Ollama 的操作。

PAIR 是免費、開源的,目前已在 Windows、macOS 與 Linux 上提供測試版。Nvidia 尚未公布 QoS 保證的藍圖或穩定版發佈日期。使用這套工具的最低實用門檻是兩台具備足夠硬體的機器,這排除了大多數只有單一電腦的設置。對於那些已經在家裡多台裝置上跑 Ollama 的使用者來說,入門門檻低到足以值得一試。

標籤: , , , , ,

討論

共有 0 則留言。