GPT Image 2.5來了,OpenAI開始抄Banana的作業

字母榜
09/09

GPT Image 2.5凌晨突發,把改圖能力端了出來。

局部編輯、連續編輯、多輪一致性乃至圖片上直接標註修改,OpenAI這次把「無需抽卡,擁抱多輪修改」當成了主菜。

但問題是,這菜多少有點沒新意——同樣的東西,NanoBanana一年前就已經玩過了。

NanoBanana一代就已經把連續編輯做成了核心能力;第一代發布四個月後,谷歌連可視化圈選編輯的產品交互都做了;到大香蕉(Pro)那裏,谷歌已經把這條路往前走到了相機、燈光、構圖和多主體控制;二代香蕉又把Pro的核心能力壓到了Flash的速度。

OpenAI也算是補了NanoBanana的課,但顯然還沒畢業。

修改效果更好

拋開「新不新」這個問題,GPT Image 2.5這次的升級幅度其實不算小。

OpenAI自己把重點寫得很明確:更精確的編輯、更穩定的多輪一致性,以及更快的生成速度。

相比Images 2.0,新模型最高可以降低50%的生成延遲,同時改善參考圖主體保真度、自然光照和紋理表現。

但在官方文檔裏被OpenAI反覆強調的,還是「編輯」。

首先是Precision Editing(精確編輯)。

之前的Image 2.0雖然也能改,但往往改得不夠精準,只想動一個局部,整張圖卻可能跟着大變樣,圖片主體的位置甚至都會發生偏移。

GPT Image 2.5試圖把這種「牽一髮而動全身」壓下去,OpenAI稱,新模型可以只修改用戶指定的元素,同時儘可能保持主體、構圖、背景乃至品牌視覺不變。即使面對更復雜的主體和背景,也可以單獨替換商品、文案或者局部元素。

更重要的是Multi-turn Editing Consistency(多輪編輯一致性)

簡單來說,就是一張圖改完第一輪之後,可以直接接着改第二輪、第三輪;此前已經做好的修改儘量保留下來,新一輪修改繼續建立在上一輪結果之上,而不是每次重新理解、重新生成。

OpenAI專門強調了一個過去很麻煩的問題:圖片質量不應該隨着編輯輪數增加而一路劣化。

體現在gif圖裏,就是圖不停改,但不再亂動,看起來更穩定。

GPT Image 2.5這次把API分成兩個版本:偏速度的Flare(閃光)和偏最高質量的Sunburst(翻譯過來是「從雲隙射下的陽光」,只看名字的話,應該有更強的光影效果和更高的審美);要我說,OpenAI最近和有什麼起名癖似的,盡整些花裏胡哨的。

在Arena最新公布的結果裏,Sunburst和Flare直接包攬了文生圖、單圖編輯和多圖編輯三個競技場的第一、第二名。加上Image 2,前三已被GPT Image包圓。

不過需要區分的是,Arena這裏測的是「多圖輸入編輯」,並不是OpenAI官方強調的「多輪圖像編輯」。

更值得注意的是它們相對GPT Image 2的提升幅度。

Sunburst在文生圖上提高了40分,單圖編輯提高59分,多圖編輯則直接提高了81分;Flare分別提高18、30和47分。

至少在大模型盲測競技場上,Image 2.5這次最明顯的提升,集中在對已有圖片的編輯能力上,尤其是同時處理多張參考圖的複雜編輯任務。

在API側,Flare被OpenAI定義為默認模型,相比GPT Image 2在獲得更高質量的同時,延遲降低50%;Sunburst則犧牲一些速度,換取更精細的控制,主要面向廣告素材、商品圖等場景。

定價方面,OpenAI最新價格頁顯示,GPT Image 2.5 Flare和Sunburst的圖像輸入都是8美元/百萬token、圖像輸出30美元/百萬token、文本輸入5美元/百萬token,和GPT Image 2一毛一樣。

有意思的是,Flare和Sunburst一個主打速度,一個主打質量,但API賬單暫時看不出區別,合理懷疑OpenAI又出bug了。

還有什麼變化

相比Midjourney更容易讓人想到「把一張圖片做得更有風格」,OpenAI更喜歡把文字、圖片、佈局和信息揉在一起,直接生成一個視覺成品。

比如海報、商品素材、信息圖、人物照片、品牌視覺,以及各種帶有大量文字和排版的設計——Image 2.5在這方面和Image 2一脈相承。

但和Image 2更強調「一次生成就能直接拿來用」不同,Image 2.5這次把大量展示空間留給了改圖,即一張已經生成好的圖,還能不能繼續往下改。

OpenAI稱,新模型把人物放進新的場景、風格和構圖之後,更容易保留原有主體的辨識度,光線和紋理也會更自然。

除了模型本身,OpenAI這次還補充了兩個「新功能」。

一個是Sketch(草圖),在移動端輸入@Sketch之後,用戶可以直接隨手畫出自己的想法,再讓GPT Image根據草圖繼續生成。

能畫出來,就不用費勁描述。

不過這並不是什麼新玩法,Nano Banana能做,Adobe Firefly能做,國內的騰訊混元、通義萬相、Seedream也早已支持線稿、塗鴉或者輔助線控制生成。

OpenAI這次只是把這套已經很成熟的交互搬到了GPT裏。

另一個功能則更像是在鼓勵大家「抄作業」,OpenAI把它叫作Pass your best ideas along。

現在分享一張ChatGPT生成的圖片時,可以順手把Prompt一起帶出去,別人拿到後可以換上自己的照片和細節直接復刻。

然而,Gemini早就可以把包含Prompt和生成圖片的完整對話分享出去,別人甚至可以直接接着這段對話繼續生成;Nano Banana後來還在Google Messages裏做了Remix,讓好友圍繞同一張圖片來回接力修改。

OpenAI還有得學呢……

網友怎麼說

雖然前面在吐槽OpenAI「補課」,但到了真正上手的時候,還是得承認一件事:GPT Image 2.5確實是一款很強的生圖模型。

發布之後,社群很快玩出了新花樣。

目前傳播最廣的玩法,是用Image 2.5做定格動畫。

開發者Charlie Guo拿GPT Image 2.5連續生成了一組畫面,再把它們串成動畫。這條帖子發布後瀏覽量迅速破萬,並被多名OpenAI員工轉發。

更進一步,還有人開始直接從草圖生成動畫素材。

比如下面這位網友,先隨手畫出一個拿着球棒的小猴子草圖,再讓GPT Image 2.5生成一整組動作連續的序列幀,最後拼成GIF動畫。整個過程只需寥寥幾筆,模型就能擴展成一個完整的12幀的gif動畫。

做動畫之外,還有一批人盯上了用Image 2.5生成透明底素材。

開發者Konstantine專門測試了Sunburst生成透明背景圖的能力,認為它現在輸出的透明底素材已經非常漂亮,並直接點名遊戲開發者和設計師可能會拿它來做東西。

有了透明底,人物立繪、遊戲道具、UI圖標、商品素材,就可以直接往網頁、遊戲或者設計稿裏塞。

還有人開始暴力測試它的複雜指令理解。

Reddit上一名用戶使用了一個近乎故意找茬的Prompt:要求一張圖同時出現四種畫風、五條項鍊、14根手指、三個瞳孔的鴿子眼睛,以及15世紀莫桑比克叢林和未來工廠。

結果……當然沒有全部實現,但他的評價是:「不完美,但仍然比之前任何一次都好。」

一些更日常的變化也開始被用戶注意到。

有人對比Image 2和2.5後認為,新模型的人物表情沒那麼僵,皮膚質感更自然;有人覺得畫面透視、反射和構圖明顯更合理;還有人拿Image 2和Image 2.5用同一套提示詞做了漫畫,2.5的分鏡更活,角色表情更誇張,鏡頭遠近和場景細節也會跟着劇情變化。相比之下,Image 2更像把一組漂亮插畫拼在一起。

Image 2(左),Image 2.5(右)

對於真正把AI圖片放進工作流的人,感受可能更加直接。

一名正在用ChatGPT給遊戲製作房間素材的用戶說,Image 2最大的問題之一就是連續編輯兩三次之後,圖片往往已經劣化到不能用了,實際工作時基本等於必須第一輪就抽中滿意結果。

換到2.5之後,他的評價是「Big improvement」,反覆修改造成的畫質衰減明顯少了。

當然,Image 2.5也沒有突然把所有老毛病一起治好,變成一個全能的完美生圖模型。

目前也已經有人繼續提到幾個老問題::手偶爾還是會畫壞;Image 2時代就有人吐槽的棋盤格/高頻噪聲沒有徹底消失;一些畫面仍然會出現顆粒、像素化或者過度銳化。也有做AI商品攝影的用戶認為,如果要求嚴格還原產品本身,NanoBanana 2和Pro目前依然更可靠。

包括上面提到的遊戲製作房間素材的用戶,也表示他「原以為自己可以放棄使用Gemini了」,但「ChatGPT和Grok中的過多微細節處理實在太過激進了」。

甚至在最基礎的指令遵循上,社群評價也並不是一邊倒。有用戶認為儘管2.5的文字、細節和構圖更好了,但複雜指令偶爾還是會被模型「理解成另一個意思」。

GPT Image 2.5沒有重新發明AI生圖,也沒有在每一個維度上把Nano Banana、Seedream們甩在身後。

但「別人早就有」與「它做得不夠好」,顯然是兩碼事。GPT Image 2本來就很強,2.5更像是在把過去明顯的短板——編輯精度、多輪一致性和可持續修改——補得更完整了。

至少,對於ChatGPT龐大的用戶群來說,現在用GPT生圖可以少抽幾次卡了。

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10