上周,OpenAI 剛剛發佈 GPT-6 Astra。我還沒從那股震撼裡緩過來,今天早上,ChatGPT 的圖片生成又更新了。
這次是 ChatGPT Images 2.5。GPT Image 2 已經那麼強了,我很難想像它還能更新什麼。越想越興奮,乾脆連夜開始測試。
上一代 ChatGPT Images 2.0 是今年 4 月 21 日發佈的。那次升級,加強了對現實世界資訊的理解、指令執行,以及密集文字和複雜細節的生成;同時帶來了 Thinking 模式,讓它能在生圖過程中結合推理和工具,搜尋資訊、規劃結果,還能根據一條提示生成多張圖片。
當時我的感覺就是:AI 生圖這場仗,在我這裡已經打完了。強得離譜。從那以後,我的圖片就一直交給 GPT Image 2 來生成,公眾號的封面、插圖,也都用它。
這次的 2.5 在 2.0 的基礎上,重點加強了主體一致性和多輪編輯,同時改善細節、複雜佈局和生成速度;工具上新增了Sketch 草圖、創作範本、圖片評論和提示詞分享。我最關心的,就是照片改完還像不像原來的人,以及這些設計、修圖功能到底好不好用。
01. 模型升級:主體更穩,修改更可控
光照、紋理、複雜佈局這些提升,先看官方介紹。這次我沒有逐項做新舊模型對照。我最想驗證的是:拿一張參考照片來改,最後還像不像原來的人?
換衣服、換背景,再換個髮型
先從一個簡單的要求開始。我給它一張參考照片,提示詞只有一句:
把服裝換成運動裝。
臥槽,它把衣服、褲子換了,連鞋子和襪子都一起配好了。運動服和襪子上還出現了耐克的標誌。我沒有指定品牌,這也是它自己補出來的細節。
我更在意的是臉。就這張結果看,人物給我的感覺還是原來的樣子,至少我沒有一眼看出明顯的失真。
接著,我讓它把背景換成上海城市街頭,再換個髮型和頭髮顏色。兩次結果放在一起看:
這幾輪下來,人物整體形象保留得讓我挺滿意。不過,逐張看也能發現,姿態和背景細節會跟著有些變化,還不能說除了指定的地方,其他部分就完全不動。
其實我還測了很多,受限於篇幅,圖片就不一一放進來了。
再拿我自己的頭像照測一次
拿自己的照片測,才是我心目中最地獄式的測試。別人像不像,有時看不準;自己被改得不對勁,很容易就能感覺出來。
以前我幾乎不敢讓 AI 改自己的照片,就是怕失真。這次我拿出了一張騎馬的頭像照。
原圖裡,馬的腿沒有拍全。我希望它把馬的下半身補出來,還要讓馬跑起來,同時儘量保留我的樣子。
這張出來,我特地把臉放大看了。以我自己的感覺,幾乎看不出明顯的變化。你們也可以對著原圖看看。
但繼續改,就碰到邊界了。
我又讓它把我的動作改成雙手握韁繩,再換一頭黃毛。
這一張,我就覺得明顯沒那麼像自己了。原照片裡,手和墨鏡遮住了一部分臉;把動作改掉以後,它得補出原來沒露出來的部分,結果就容易偏。
所以,想改自己的照片,尤其要動到臉和姿態時,我會儘量給一張清楚、遮擋少的參考圖。這次能保留到什麼程度,成功和沒那麼成功的結果都放在這裡了。
再放一個 OpenAI 官方的例子:把三張人物照片合成一張聚會合照。大家可以對照看看,三個人各自的形象保留得怎麼樣。
02. 創作工具升級:從草圖到修圖、分享
這部分的變化,我覺得做公眾號配圖、海報和產品圖的人會特別有感。除了用文字描述,現在還可以直接畫、用範本起稿,或者在圖片上點出要改的地方。
Sketch:先畫個草圖,讓它接著畫
除了直接打字,這次還可以在 ChatGPT 裡畫草圖。
按官方說明,在輸入框裡輸入 @Sketch,就能呼叫草圖功能。我打開後看到的是這樣的畫布:
可以調畫筆大小、換顏色,也可以加入文字和形狀,畫錯了就用橡皮擦掉。
我畫了這麼一個小人,然後讓它按草圖重新畫成更精緻的插畫。
我這畫工,大家也看到了。最後出來的小人,頭髮、裙子、笑臉都有了,還加上了顏色和紋理。想說一個大致的形狀時,現在可以直接畫給它看。
範本:先把海報做出來
範本也是這次新增的入口。我選了海報範本,提示詞會自動出現在輸入框裡,可以修改,也可以附上自己的參考圖片。
我上傳了一張照片,沒改範本裡的提示詞,直接提交。
這一次,它沒有立刻出圖,先問了主題、必須出現的文字、尺寸和風格。我回覆:做時尚雜誌封面,文字讓它幫我寫,比例 3:4,採用 Vogue / Editorial 的感覺。
然後得到這張圖。
這個質量確實讓我驚喜。頭髮、衣服的紋理,連同中英文排版,放在這張封面裡看起來很協調。
局部編輯:圈出來改,點一下加評論
打開生成的圖片,就能看到編輯工具:標註、評論、移除背景、擦除、調整尺寸。
我先試了標註。把上面的標題圈出來,再輸入想替換的文字。
這裡有意使用了變體拼寫“VOUGE”,圖片也按提示詞保留了這個寫法。圖中是測試用的雜誌風格設計,非雜誌官方封面。
再試評論。在眼睛附近點一下,寫上“加一副墨鏡”,提交。
墨鏡加上了,前一輪改過的標題也保留著。把這張和初版放在一起看,人物、衣服和版面的整體感覺仍然接得上。這是我今天覺得多輪編輯好用的地方:可以繼續改下去,不用每次重新做一張。
這種一致性,真的是強得離譜。它解決了我一直以來的一個痛點:以前改圖,總是改著改著就跟前面不像了,好不容易做出來的效果又丟了,真的讓人惱火。
調整畫幅:從豎版到橫版,重新排一遍
工具列裡還有移除背景。這次我更想講的是調整尺寸,因為我經常要把圖片用到不同平台,3:4、9:16、16:9,各有各的要求。
以前改畫幅是件很麻煩的事。簡單裁一下,人物可能被切掉,文字也可能放不下。要讓它在新的比例裡看著舒服,往往得重新排版。
我把剛才那張 3:4 的豎版海報,改成了 16:9 的橫版。
這一步超出我的預期。人物縮小了,畫面向兩邊展開,標題和左右的文字也重新安排了位置。前面加的墨鏡還在。
對我這種經常做封面、配圖的人來說,這個功能太實用了。一張已經做好的圖,換個畫幅還能繼續用,省掉的是重新擺人物、重新放文字的工夫。
分享:把提示詞也帶上
原來生成好的圖片就能分享,這次多了“分享提示範本”。
我點進去,複製連結,打開後能看到圖片、提示詞,以及“加入圖像試試”的按鈕。
我這裡做的是改圖,所以分享出去的也是改圖提示詞,頁面上顯示的是“將寬高比設為 16:9”。別人可以加入自己的圖片,試試同樣的修改。
我看到這裡,還是會想到那些圍繞提示詞範本做生意的產品。這樣的入口直接放進 ChatGPT,它們得重新想想,自己還能提供什麼。
03. 速度更快,在那裡能用?
最後說速度。官方的說法是,相比 Images 2.0,生成延遲最多降低 50%。
我自己的體感也確實非常快。以前尤其做測試的時候,總要等前一張圖出來,才能進入下一步,一輪輪等下來挺磨人。這次等待明顯短了很多,有些圖感覺幾乎一轉眼就出來了。連續改圖的時候,這種差別特別明顯。
按發佈公告,Images 2.5 正在向 ChatGPT、ChatGPT Work 和 Codex 的各檔使用者推出,覆蓋桌面、移動端和網頁。我今天早上打開 ChatGPT,已經看到了更新提示。
開發者還可以通過 API 使用兩款模型:GPT-Image-2.5 Flare 側重質量、編輯和速度的平衡;GPT-Image-2.5 Sunburst 追求更精細的控制,但生成時間更長。下面放上官方價格表,供需要接入 API 的朋友參考。
04. 實測中遇到的幾個問題
前面說了不少好用的地方,但這一輪測下來,也碰到了幾個讓人卡住的問題。
換件衣服,也可能被攔下來
測試第一個模特的時候,我輸入了一句“換成晚禮服”,結果沒等來圖片,反而收到一條提示:生成的圖片可能違反了針對潛在欺詐或詐騙活動的防範措施。
這讓我有點摸不著頭腦。只是想換件衣服,怎麼就跟欺詐、詐騙扯上關係了?以前用的時候,我印象裡很少碰到這種情況。這次是不是風控更嚴格了?目前還不好下結論,也可能是這一次觸發了誤判,但它確實打斷了正常的改圖過程。
想回頭改前面的圖,它卻改了後面的圖
另一個問題出在多輪對話裡。順著上一張圖繼續改,整體還挺順;但中間換過別的圖,再想回頭修改前面那張,就容易混亂。
比如下面這次,我引用的是前面那張模特圖,要求“戴上墨鏡”。結果它卻給後面那張騎馬照裡的人加上了墨鏡。
也就是說,在我這次的測試裡,它似乎更容易沿著最近一張圖往下改。即使我已經指定了前面的圖片,它還是可能找錯對象。一個對話裡交替處理幾張圖的時候,這個問題就挺煩人的。
生成快了,但還是得一張張等
還有一點:這次在 ChatGPT 裡測試,我沒法同時發起多張圖的生成,得等前一張完成,才能開始下一張。
前面說它快,是指單次生成的等待明顯縮短了。但如果要連續測試很多提示詞,或者手頭有幾張圖都想改,還是得排著來。速度提升緩解了等待,並行這件事,在我這次使用的介面裡還沒能實現。
05. 最後說幾句
用完這一輪,我越來越覺得,AI 生圖已經成熟到了一個很高的程度。至少對我每天做的公眾號封面、插圖和海報來說,它已經是一個可以長期放進工作裡的工具了。
2.0 的出圖能力讓我願意一直用它,2.5 則把後續那些瑣碎的修改接了起來:人物要保留,標題要換,畫幅要適配,改了幾次之後,前面的效果還得在。能把這些事做順,才會讓人放心把日常工作交給它。
當然,它還會出錯,我那張改了動作的騎馬照就沒那麼像自己。但整體上,我現在考慮得更多的是這張圖該怎麼設計、那裡還可以改,而不是擔心一動手,前面做好的東西就全變了。
這也是我覺得這次升級有份量的地方。一張好看的圖,已經越來越容易得到;而當它能順著你的想法,一步步改到能用,AI 生圖才算真正走進了日常創作。對我來說,這個變化已經發生了。 (AI范兒)
