技術

阿里巴巴的讀螢幕AI在真實手機上達到92%,還能在你的硬體上執行

Susan Hill

阿里巴巴的Qwen-UI-Agent不需要特殊存取你的應用程式。它讀取螢幕,識別螢幕上的內容,並進行點擊,透過純視覺感知處理從訊息傳送到文件編輯等任務。模型權重——MAI-UI-2B和MAI-UI-8B——本週已上架Hugging Face,讓任何擁有GPU的開發者都能使用這個系統。

基準測試結果具體明確。在標準行動代理評測MobileWorld上,Qwen-UI-Agent獲得82.1%的分數,領先GPT-5.6 12個百分點,並領先Claude Opus 4.8 14.6個百分點。差距並非微不足道——可比較的西方系統在同一測試中已數月停滯在70多分。在真實裝置測試——在實際Android手機而非模擬器上執行的任務——分數攀升至92.2%。在更廣泛的真實手機評測AndroidDaily上,模型達到97.5%。在桌面電腦使用方面,透過OSWorld-Verified測量,它獲得79.5%,領先GPT-5.5和Gemini 3.1 Pro。

阿里巴巴使用來自超過100部真實行動裝置、執行150種不同應用程式的資料訓練模型,然後建立自己的基準測試——MobileWorld-Real——包含超過400項任務,以驗證實驗室外的效能。約40%的桌面任務涉及批次命令列操作以及視覺點擊,這項設計選擇反映了真實運算的運作方式,而非示範的編排方式。

工作流程中內建了安全層。模型會拒絕其標記為非法或高風險的任務,並在敏感操作——付款、資料刪除、隱私授權——時暫停,要求使用者明確確認後才繼續。系統使用強化學習處理超過100個步驟的序列,該強化學習在約10,000個同時模擬環境中進行訓練。

基準測試分數留下了更難的問題。Qwen-UI-Agent是在結構化任務上進行評估的;真實手機使用充滿中斷、通知雜亂,且涉及會無預警更新介面的應用程式。螢幕閱讀AI也引發了一個阿里巴巴技術報告未解決的隱私問題:一個處理你螢幕上每個像素的模型,能夠存取銀行詳細資訊、私人訊息,以及大多數使用者從未考慮過交給第三方系統的資料。關於這些資料在第三方部署中如何處理的指導方針並不存在。

該專案託管在GitHub上的Tongyi-MAI/MAI-UI;模型權重現已在Hugging Face上。尚未公布商業API或部署定價。Qwen-UI-Agent的下一個測試不是基準測試——而是開發者能否在基於開放權重的生產環境中,複現阿里巴巴在實驗室中記錄的成果。

標籤: , , , , ,

討論

共有 0 則留言。