從“會生成”到“精準修改”,OpenAI 把 AI 生圖做得更像工具了

現在的 OpenAI,算是把流量玩明白了。

9 月 9 日凌晨,他們宣佈通過使用 OpenAI 的下一代模型,讓將近一萬個 Agent 協同工作,解決了困擾科學界近 90 年,並被列為千禧年七大難題之一的維納爾斯托克斯方程。

這個消息一出,立即震撼了科學界、科技界,引起眾多討論,賺足了眼球。

緊接著,OpenAI 宣佈他們最新的生圖模型 ChatGPT Image-2.5 上線。

關於 AI 解決維納爾斯托克斯方程這事,科學界、科技界後續會有更多有意思的觀點,老狐還要學習吸收一下,咱們後續再聊。

這裡先介紹最新發佈的 ChatGPT Image-2.5,也許它將會對你的工作產生更大幫助。

Image-2.5 在多個方面得到了升級,相比於 ChatGPT Image-2.0,Image-2.5 能夠呈現更自然的光照和更豐富的紋理,也能夠更好地保留參照物中的主體,如果大家生成圖片時有上傳參考圖片,就會懂得這個功能的含金量。

在 Image-2.5 上,OpenAI 還增加了“Sketch” 這項重磅功能,使用者可以直接在畫板中繪製自己想要的草圖,提供給 Image-2.5 參考。

此外,Image-2.5 還引入了範本功能,使用者可以參考範本的提示詞,更加輕鬆地完成圖像創作;生成的圖片,使用者可以直接編輯,在圖片上註釋,做出更精準的調整,用於生成圖片的提示詞,也支援分享。

而且 Image-2.5 在多輪編輯一致性方面也有了提升,經常用大模型做圖的就知道,你本來是想修改圖片的A 處,其他不變,但生成的新圖大模型卻把 B 處、C 處都改了,而 Image-2.5 正是針對這一痛點,進行了改變,提升了多輪編輯的一致性。

比如下面這組動圖,就是由OpenAI 官方的視訊素材製作而來,由 Image-2.5 多張生成圖片合成,畫面只有蠟燭依次點燃,沒有其他地方修改。

因此,如果你要製作定格動畫,Image-2.5 是一個更好的工具。

以上都是 OpenAI 官方的描述,實際體驗如何呢,我們進行了一個實測。

我們用Sketch 功能,簡單畫了一張上面科技狐的logo,然後讓 Image-2.5 以這個畫面作為主體,生成一個有立體感的科技狐公眾號封面,並且在圖裡面要體現由 Image-2.5 生成的元素,背景是寫實風格。

下圖就是生成的結果。

可以見到,在光影效果方面,Image-2.5 可以呈現出非常自然的效果,折角處的反光,背光處的反射都符合真實物理世界規律,立體的字型會有一種黑色塑料的質感,包括桌面的木質紋理也比較豐富。

我們還可以在這張照片基礎上進行進一步修改,包括在圖上標註、評論、移除背景、擦除等等。

不知道大傢伙覺得如何,Image-2.0 本身就非常強大,Image-2.5 不管是畫質表現確實更好,還提供了更多的實用工具。

當然了,老狐這個繪畫技術還有待提高,我們可以借用網上大量博主的測試,看看 Image-2.5 的表現如何。

比如 Sketch 功能,博主先是在繪畫板上畫了一個可愛的雲朵形象,再提出了更多的細節要求,結果如下圖。

對於有一定繪畫基礎的使用者來說,簡單畫個範本,Image-2.5 就可以生成一個理想的圖片,這確實要更加便捷。

也有網友展示了一件換衣功能,在換掉衣服後,髮型、臉、皮膚、姿勢、手和周圍的環境都沒有發生變化。

出色的多輪編輯一致性,除了能製作定格動畫,還可以用於服裝行業,幫助品牌或電商快速展示服飾,模特只需要拍攝固定的姿勢,所有服裝都能應用上。

也有很多博主把 Image-2.5 跟 Image-2.0 生圖拿來做了對比。

在下面這張圖片裡,Image-2.5 的衣服質感更真實,背景的燈帶更合乎真實物理邏輯,而 Image-2.0的燈帶是交錯的,沒有人會這樣建造建築。

在下面這一組人物對比圖裡,同樣如此,Image-2.5 生成的圖片,也要比 Image-2.0 細節更豐富,更重要的是 AI 味沒有那麼濃。

*Image-2.5
*Image-2.0

從這些場景來看,Image-2.5 都要比 Image-2.0 表現更好,足以見得圖片生成模型的進步,但也有不少博主在實測中發現翻車了。

比如在下面這組圖片坐在鏡子前面理髮的場景中,不管是 Image-2.0 還是 Image-2.5 都翻車了,前者的樣張,理髮師正對著鏡子,但是鏡子裡的理髮師露出背面,這不合理。

而 Image-2.5 更不合理,理髮師和顧客們都是背對著的。

由此可見,在一些需要理解物理規律的場景下,生圖模型還是容易翻車。

此外,一些經典的生圖模型會產生的問題,有博主在嘗試時也出現了,比如下面這張圖。

但不可否認的是相比上一代 Image-2.0,Image-2.5 有了提升。不過在使用時,給老狐印象更深的還是工具的提升,以及在特定場景的功能最佳化。

新增 Sketch 的功能,還有支援對圖片進行更精準地修改,這不是模型能力的提升,而是周邊工具的最佳化,但顯著改善了使用體驗。

而像多輪編輯一致性這種能力,也可以想像對定格動畫創作者來說是有顯著幫助的,服飾從業者也能從中受益。

從某種程度上來說,如今的 AI,模型性能提升對使用者的感知可能不太明顯,但如果能圍繞模型開發更好用的工具,並且讓工具有用武之地,這對使用者體驗的改善十分明顯,作用不比模型能力提升來的少。

汽車的發動機固然重要,但怎麼造好輪子,怎麼做好內飾,也是成功的關鍵因素。 (科技狐)