文|象先志
昨天,Qwen-UI-Agent的官方頁面放出了一段演示。
AI先打開抖音,搜索「百香果酸湯牛肉」收藏量最高的圖文,收藏,記下配料;接着跳進盒馬,把調料之外的食材放進購物車,預約當天18:45送達。
之前,豆包手機最出圈的演示也差不多。用戶說一句話,手機自己打開不同App,搜索、比較、下單。區別是,當時豆包真把這套能力塞進了一台3499元的工程機,隨後被微信、銀行和支付App的風控;Qwen把同樣的動作放進了論文和項目倉庫。
同樣是跨App操作,豆包撞上了產品風控,Qwen把它放進了模型演示。

圖1|Qwen-UI-Agent官方演示首幀。右側指令要求Agent先在抖音尋找高收藏菜譜,再到盒馬購買食材並選擇18:45送達。它能證明阿里展示了跨App長任務,不能單獨證明這套能力已經進入量產手機。來源:Qwen-UI-Agent官方項目頁。
另外,Qwen-UI-Agent公開了技術報告、項目頁和演示,但截至今天,旗艦模型權重仍未開放。真正已經開源的是它的前身MAI-UI,2B和8B兩檔權重採用Apache 2.0許可證;更大的32B、235B沒有放出來。
所以,這不是一次嚴格意義上的開源發布。阿里做的,是把豆包曾經裝進一台工程機裏的系統級Agent能力,重新展示成一套獨立的模型能力:它可以訓練,可以評測,可以接入不同設備,也不必天然系統級UI綁定。
開源在這裏更像Qwen路線的底座。前一代MAI-UI負責降低試驗門檻,最新的Qwen-UI-Agent負責展示能力上限。而這一步也或多或少影響了AI手機現在的發展格局。
當AI控制手機的能力可以被塞進開源小模型,那麼全新的AI手機是否還有出現的必要?
豆包手機的背景已經不必再贅述,合作推出、被多個App封禁使用,已經是老話題了。
字節想拿走的不是一個語音入口。它想站到用戶需求和所有App之間。
這件事出現的意義是,豆包第一次把系統級Agent推到真實用戶手裏,也第一次替全行業撞到了超級App的邊界。
12月5日,豆包手機助手又發布說明,限制刷分、刷激勵場景,暫時下線銀行和互聯網支付類App的操作能力,同時限制部分競技遊戲。用戶授權並沒有自動解決平台的責任問題。AI一旦點錯按鈕、讀走驗證碼,或者把一次誤操作變成支付、發帖和賬號風險,最後找誰負責,不能靠一句「用戶同意了」帶過去。
超級App還有自己的生意。
一個GUI Agent可以繞過首頁、廣告和推薦位,直接完成搜索與交易。對用戶來說,這是少點幾下;對App來說,可能是流量入口、廣告庫存和交易分配權被掠奪。
最近,豆包換了姿勢。《晚點LatePost》報道稱,新一代豆包手機面對頭部應用時,將不再讀取螢幕、模擬點擊。只有對方主動提供MCP服務,開放相應數據和操作權限,豆包才能接入。
MCP可以理解成App自己遞出的一串工具:哪些數據可以讀,哪些動作可以做,哪一步必須讓用戶確認,都由App寫清楚。Agent不需要讀取過分的底層的數據,用戶也不用擔心AI過渡操作。
新一代豆包手機據稱把備貨量從上一代約3萬台提高到數十萬台,字節也仍在和手機廠商、頭部應用談合作。2025年12月,界面新聞曾報道,字節正與vivo、聯想、傳音等硬件廠商推進AI手機合作;聯想隨後回應稱,雙方一直保持密切溝通。
這時候,字節最重要的談判籌碼已經從「我有一個大模型」,換成了「我做出過一台真能跨App幹活的手機」。系統權限、真機適配和應用風控的坑,它都踩過。
但它很難再說,只有我能做。
阿里把一台手機拆成了模型
豆包手機遇到風控後不到一個月,2025年12月29日,阿里通義實驗室發布MAI-UI,並開放2B、8B兩檔模型權重。
Qwen做的事情,其實跟豆包很像:模型接收用戶指令和當前螢幕,決定下一步是點擊、滑動、輸入,還是調用接口;動作執行後,模型再看一眼新頁面,判斷任務有沒有走偏。
區別是,豆包把這套循環裝封裝,靠系統權限做成產品。阿里先把循環拆成了可以下載、訓練和部署的模型。
簡單來說,阿里把GUI手機開源了。
而這次公開的Qwen-UI-Agent又往前走了一步。論文稱,團隊搭建了由100多台真機、150多個App組成的運行環境,讓約一萬個模擬環境併發生成訓練軌跡,並用在線強化學習處理超過100步的長任務。它的動作也不只剩點擊螢幕:遇到文件、表格和數據處理,模型可以切到命令行;幾個連續操作,還能在一次輸出裏一起生成。

圖2|論文Figure 2。一張航班取消通知觸發Agent尋找替代行程,徵得用戶同意後,再到電腦上修改會議和表格。左側列出手機、電腦、瀏覽器以及GUI、命令行、API等動作空間。來源:Qwen-UI-Agent Technical Report,第5頁。
這套論文的價值,是把「手機替人點App」擴成了一套跨設備的執行系統。該點螢幕時點螢幕,該走接口時走接口,需要處理文件時就去命令行。GUI不再是唯一道路,但不是唯一的決策路徑。
官方成績很好看:Qwen-UI-Agent在MobileWorld、MobileWorld-Real和AndroidDaily上的成功率分別為82.1%、92.2%和97.5%,在OSWorld-Verified上得到79.5%。上一代MAI-UI-235B也曾在AndroidWorld拿到76.7%,高於UI-TARS-2的73.3%。
但確實也不能只看跑分。
最新移動端成績主要來自阿里自己搭建或運行的評測環境,表中的部分競品成績也是團隊復跑,不等於各家公司在同一套公開測試上交卷。到了Qwen-UI-Agent這一代,官方主推的移動排行榜也不再是AndroidWorld,而是MobileWorld、MobileWorld-Real和AndroidDaily。它們更貼近阿里想證明的真機與長任務能力,也讓外部複覈更難。
論文中自己倒是沒有把話說的太滿。
文其中展現了一個任務,要求Agent在樸樸超市直播間把10元以下的在售商品加入購物車,再收藏最貴的商品。模型反覆點開面包、榴蓮和抹茶蛋糕,就是沒有按要求完成。另一個是讓agent發完微信朋友圈後,把可見範圍改成「僅自己可見」;朋友圈發出去了,權限設定卻一直沒完成。

圖3|論文Figure 23。上半部分是樸樸超市選品失敗,下半部分是朋友圈已經發布、但「僅自己可見」沒有設定成功。團隊將兩例都標為MODEL FAILURE。來源:Qwen-UI-Agent Technical Report,第53頁。
相比只看排行榜,這兩次失敗顯得更加真實。任務越長,前面一次小誤判越容易滾成後面的徹底失敗;而發帖、付款和修改權限,偏偏又是用戶最不願意讓AI犯錯的地方。
Qwen證明了阿里已經建起一套收集失敗、訓練模型、再回到真機驗證的機器。它暫時還沒有證明,一台裝着Qwen的量產手機可以穩定替人生活,但絕不能說這個嘗試不重要。
開源也要拆開看。
MAI-UI只放出2B和8B「小杯」,刷出76.7% AndroidWorld成績的235B沒有開放;最新Qwen-UI-Agent的旗艦權重也沒有下載入口。阿里雲已經在無影雲手機的Agentic Mobile產品中集成千問模型與雲端Android容器,並按實例規格和使用時長計費。它和Qwen-UI-Agent不是同一個產品版本,卻把商業路徑寫得很直白。
開源小杯引流,雲端大杯變現。
今年3月,Qwen負責人林俊暘離職時,外界最擔心的是Qwen的開源路線會不會終結。吳泳銘隨後在內部信中明確表示,阿里會繼續堅持開源策略,由周靖人繼續帶領通義實驗室。周靖人的名字也出現在MAI-UI技術報告的作者名單裏。
雖然人走了,雖然用法變了,但是開源路線還是留下了。
過去,Qwen開源主要是為了把開發者聚到自己的模型周圍;到了手機Agent這件事上,開源還有一個更具體的用途:誰拿着這項能力去和手機廠商談獨家合作,阿里就把一個能試、能改、能比較的版本擺到桌上。
它不需要立刻取代對手。手機廠商已經有了第二個技術參照。
這是談判工具
對手機廠商來說,MAI-UI的2B、8B權重還遠遠不等於一台豆包手機。
模型之外,它們還要解決系統權限、真機數據、App適配、安全策略、賬號體系和售後責任。AI在演示裏點錯一次菜單,只算模型失敗;裝進幾百萬台手機後點錯一次支付,廠商要接客服電話。
但用戶的選擇已經變了。
過去,一家不想從零訓練GUI Agent的廠商,可以和字節合作,把豆包請進系統。現在它還可以下載MAI-UI做原型,自己積累數據、適配系統,再決定更強的能力向誰採購。它未必真的使用阿里的開源模型,卻多了一個可以拿來比較價格和條件的技術參照。
阿里要的,就是這份獨佔性的稀釋。
7月13日,階躍星辰又發布了Step AOS和樣機STEPX Neo,並公布支付寶、美團、攜程、京東等首批生態合作伙伴。不同公司的產品名字各不相同,動作卻越來越像:模型公司都想越過單個App,成為跨品牌、跨服務的中間層。
手機廠商掌握系統權限,超級App掌握交易、社交關係和數據,模型公司掌握理解與執行能力。三方都想讓Agent聽自己的,又都不願意替別人的錯誤買單。最後能跑起來的,大概率是混着來:長尾App先讓AI看螢幕,高頻和敏感動作走MCP或A2A,付款、發帖、改權限時再把手機交還給人。
字節絕不會因此而退場。有與中興共同調系統的經驗,也有豆包和抖音帶來的用戶與產品閉環。到目前為止,也沒有公開證據顯示榮耀、OPPO、vivo或小米會如何選擇。但顯然,手機廠商的AI上游環境發生了一些微妙的變化。
接下來幾個月,如果Qwen真的釋放旗艦權重,或者有一家主流手機廠商公開採用MAI-UI,阿里的開源路線纔算從GitHub走進手機生意。反過來,如果豆包拿到微信、淘寶、支付寶等頭部應用的結構化接口,把數十萬台備貨變成穩定產品,字節先交的學費也可能變成先發經驗。