昨天,OpenAI正式發佈了GPT-5.6。
同時還把ChatGPT和Codex合併到了一起,發佈了ChatGPT Work、Sites等等一系列新功能。
昨天我還特意寫了一篇文章講這個,主要是給朋友們介紹了這次的更新到底更新了啥。
看發佈會上的內容,他們的新模型跑分確實高,上面的演示Demo也確實挺強的。
但是最後還是得自己實測了才知道,這玩意兒到底是不是真的強,是不是真的能幫我們把活兒給幹好。
所以我從昨天就開始實測了一下這次發佈的GPT-5.6 Sol,到現在也算是實測了整整一天多的時間。
跑了一些案例,也拿它最佳化了一下我原來用Codex做出來的項目。
比如復刻了一下發佈會上的鵜鶘騎自行車那個案例,最終幫我做成了一個可以線上操作的3D互動網頁。
也讓它直接幫我建構了一個新的項目,這兩天颱風巴威不是即將登陸了嘛。
所以讓它開發了一個巴威颱風智能檢測中心小工具,並且接入了真實即時資料。
我還把之前用Codex開發的公眾號復盤台交給它,讓它檢查功能和介面上還有那些問題。
它自己找出了十幾個之前一直沒發現的問題,附上了問題截圖,然後又花了14分鐘,全部修完並完成驗證。
這些實測案例跑完,我發現這次OpenAI更新的GPT-5.6確實有點猛。
從看懂截圖和視訊,到開發、上線、審查、修復和驗證,它已經可以把一整條任務鏈路完整跑下來,而且做的很不錯。
所有任務我用的都是GPT-5.6 Sol,推理強度選擇了“高”,奢侈的體驗了一把先進生產力的感覺。
如果你最近也打算上手Codex,或者也想看看這次的GPT-5.6到底強不強,可以看看這篇實測文章,能給你一些參考和思路。
01
20分鐘
復刻發佈會上的鵜鶘騎自行車
先來看看第一個實測案例吧。
這次GPT-5.6發佈會上,有一個演示讓我印象特別的深,就是讓一隻鵜鶘騎著自行車的案例。
老朋友應該知道,很多新模型發佈的時候,我也會習慣性用新模型來開發一個鵜鶘騎自行車的案例。
比如下面這些是之前用ZCode+GLM 5.2和Codex+GPT 5.5做的鵜鶘騎自行車實測案例。
因為這個玩法其實是一名開發者大佬Simon Willison推出的玩法,就是用生成一張鵜鶘騎自行車的SVG案例,來測試各大新模型的空間理解和程式碼生成能力。
而這次OpenAI居然也拿這個例子來作為直播發佈會上的案例演示了。
而且我看發佈會上的效果確實挺好,鵜鶘真的坐在車上騎,使用者可以拖動鏡頭觀察,還能在三輪車和自行車之間切換。
所以我就想著直接復刻一下,看看是不是真的能復現出這種效果,因為看演示確實挺炸裂的。
不過我沒有他們原始程式碼,也沒有3D模型,更沒有他們的具體提示詞,只有發佈會上的一張演示截圖以及我錄製下來的一小段互動視訊。
所以我先把這個截圖和互動視訊直接丟給了GPT,讓它幫我寫一段提示詞,因為我自己寫的話可能就寫不出那麼完整的需求描述了。
拿到提示詞之後,我就把截圖和互動視訊丟給了它,並且把GPT給我的提示詞也複製給它了。
提示詞也沒有說很複雜,其實就是讓它根據我提供的參考視訊和截圖,來復刻一個類似的互動式3D網頁。
主角是一個叫做shuige的鵜鶘騎手,它可以騎三輪貨運車,也可以切換成山地自行車。
然後頁面結構、留白、材質和互動邏輯這些,直接參考給它的截圖和視訊就行。
除此之外,我是呼叫了它們這次新出的站點功能和外掛sites來搭建這個鵜鶘騎自行車的3D互動網頁的。
任務發出去之後,它自己就開始幹活了。
建項目、寫程式碼、製作3D模型、調整頁面佈局、增加互動功能,整個過程我完全沒有插手。
大約20分鐘之後,它告訴我項目已經完成,並且直接給了一個可以線上訪問的網頁。
整體效果很好了,就是有一些瑕疵,比如鵜鶘騎車的時候踏板是反反向蹬的,所以讓它修改了一下。
5分鐘後,它就修改好了,全程我就讓它改了這一次,完成度比我預期的高很多。
打開頁面之後,就能看到一個叫做shuige的鵜鶘騎手,戴著帽子,真的瞪著它的三輪車往前衝的效果。
左邊還會展示騎手、物種、載具、軸距、座高、踏頻和速度等等資料。
而且可以切換成山地自行車,點選切換以後,鵜鶘的姿勢、車輛結構、輪胎數量和對應參數都會一起變化。
頁面還支援直接拖動查看。
你可以從不同角度觀察鵜鶘和車輛,也可以一鍵切換到側檢視、正檢視、後檢視和三分之四視角。
它甚至還做了自動旋轉功能。
底部有一個踏頻滑塊,拖動滑塊以後,鵜鶘的踩踏速度會發生變化,右上角的即時速度也會同步更新。
背景配色也準備了三套,可以直接點選切換。
整個頁面從3D模型、互動邏輯到視覺風格,完成度都非常高。雖然跟發佈會上演示的還是有差距,但是出來的效果確實已經很像了。
大家可以直接看看視訊效果。
而且因為我使用了Sites功能,這個項目開發完成之後,已經自動發佈上線了。
以前AI幫我們生成一個網頁,通常只能在本地打開。
想發給別人體驗,還得自己買伺服器、配置環境或者找一個平台部署。現在這些事情,ChatGPT順手就給你做了。
任務完成以後,它直接生成一個網站連結,點選就能打開。
不過網站默認是私密狀態。
其他人打開連結以後,會看到一個“Continue with ChatGPT”的登錄頁面,需要使用你自己的ChatGPT帳號授權才能訪問。
想公開分享也很簡單。
點選項目旁邊的分享按鈕,把存取權從僅自己可見,修改成網際網路上的任何人。
然後再複製連結發出去,別人就可以直接線上體驗了。
從一張截圖、一段視訊,到一個可以線上操作、公開分享的3D網站,整體還是比較流暢的。
02
23分鐘
做出一個颱風智能監測中心
第一個案例多少帶了一點復刻的性質,畢竟我給了它截圖和視訊,可以作為視覺參考。
所以第二個案例,我想把難度再往上拉一點。
這次不提供參考頁面,直接讓它從零開發一個完整的資料監測後台。
項目名稱叫做BAVI EYE|巴威颱風智能監測中心。因為這兩天颱風巴威不是馬上要登陸了嘛,搞一個這樣的工具給自己看看也確實還可以。
所以,這必然是一個面向大屏展示的颱風即時監測和應急指揮後台。
需要包含即時監測、颱風路徑、三維地圖、風險研判、城市風險排行、氣象圖表以及即時預警資訊流等等內容。
當然,我自己寫這種提示詞肯定還是容易缺少專業性的,特別是一些技術性的要求說明。
所以我直接一上來就把自己降級成是一個純小白,讓它幫我給codex擬寫一段指令提示詞。
也就40秒時間,它就給了我一大段提示詞,直接複製下來丟給Codex就行。
這個任務的複雜度明顯比第一個更高,裡面包含地圖、圖表、動畫、資料面板、軌跡演示和大量資訊佈局。
它在後台幹了23分鐘左右,最終直接給了我一個完整的線上項目。
打開以後,整個頁面確實挺震撼的。
左邊是颱風的即時監測資料。包括颱風等級、最大風速、中心氣壓、移動速度、距離陸地距離和未來72小時的資料變化圖。
中間是一張可以旋轉、縮放的三維地圖。上面展示了颱風當前位置、歷史軌跡、預測軌跡以及不同城市的風險評分。
右邊則是風險研判、城市風險排行和即時預警資訊流。
底部還有一條完整的時間軸,可以播放颱風從歷史位置到未來預測位置的變化過程。
整體的視覺效果很像那種真正放在應急指揮中心大屏上的系統。
而且地圖可以拖動,軌跡可以播放,時間軸可以調整播放速度,各種圖表和風險資料也會動態變化。
不過中途我有讓它改成真實資料,最開始它是給了一段演示資料的,所以就想著嘗試讓它改成真實資料看看。
結果7分鐘後,它真就接入了氣象局的即時資料,而且系統會每10分鐘自動刷新一次。
同時,它還把之前的演示JSON和演示資料回退邏輯全部刪除了。
至於頁面中的城市風險排名,它也專門進行了說明。這些排名屬於系統根據真實氣象資料計算出來的模型研判,會明確標註,不會冒充官方預警。
這個細節我覺得還是挺牛逼的。
因為很多AI生成的資料大屏,最大的問題就是看起來很專業,結果裡面的資料全是編的。
但這次,它會根據我隨口的一句話,開始主動區分公開資料、模型計算結果和官方預警。
至少在交付邏輯上,比普通的演示Demo就認真了很多。
我也錄製了一段完整的操作視訊,大家可以感受一下。
從頁面效果來看,這已經不太像一個隨手生成的網頁了。
它更像是一個可以繼續完善,甚至能夠拿去做真實項目原型的系統。
而且這個案例同樣使用了Sites。所以開發完成以後,它已經自動發佈成了一個線上網站,我不需要自己處理任何部署上線的問題。
23分鐘,從一句需求變成一個線上運行的資料監測後台。
放在以前,你可能需要前端、後端、設計師和資料工程師一起配合。結果現在呢?
一個人加一個Agent,已經可以完整跑出來了。而且這個人,只需要負責提需求和最後的驗收就好了,其它的,全部交給Agent搞定。
03
修復和最佳化已有舊項目
前面兩個案例,主要測試的是GPT-5.6從零開發項目的能力。
後面我又想看看它處理舊項目的能力怎麼樣。
所以我把之前用Codex陸陸續續開發了個把月的一個公眾號復盤台交給了它。
這是一個相對完整的資料後台,已經有登錄頁、文章總表、趨勢分析、分類分析、AI復盤、資料匯入和模型配置等等功能。
我沒有告訴它具體要改那裡。
只是讓它檢查一下,這個工具在功能和介面上,還有沒有可以繼續最佳化的地方。
結果它自己打開項目,把各個頁面和不同尺寸的介面全部檢查了一遍。
最後給我列出了一份完整的審查結果。
其中最嚴重的一個問題,是在1280像素寬度下,登錄頁右側的表單被裁切了,提交按鈕甚至都無法完整的顯示。
這個問題其實挺大的。意味著使用者在部分筆記型電腦或者窄屏窗口下打開網站,可能連登錄都完成不了。
但因為我平時使用的螢幕比較寬,之前一直沒有發現,還有其它一些問題。
最關鍵的是,它不只給了一段文字建議。
它還把登錄頁、首頁、文章總表等問題頁面全部截了圖,直接告訴我具體那裡有問題。
看到這些問題之後,我直接問它能不能幫我把上面這些問題全部修復和解決?
結果它直接就開始自己修改了。大概14分鐘後,它就告訴我已經全部完成了。
害,真的是人狠話不多,需求丟給它,它直接就能開干。
把全部要最佳化的地方都最佳化了,而且還給我把修復後的介面截圖也丟給我了,生怕我看不懂啊。
更讓我覺得殘暴的是,這哥們在交付之前還自己驗證了一遍。
它跑了ESLint和TypeScript的檢查,反正咱也看不懂。還說執行了38項自動化測試,結果是38/38全部通過。
看著就相當的專業。
它先檢查項目,自己發現問題,然後給出截圖和修改建議。我確認以後,它再進入程式碼完成修復。
修完以後繼續運行測試,確認沒有引入新問題,最後才告訴我任務已經完成。
以前用AI寫程式碼,很多時候是你發現一個問題,再讓它修改一個問題,賊繁瑣。
現在直接讓它自個去看下完整的項目,像一個相對有經驗的產品經理、測試工程師和開發工程師一樣,把整套流程跑一下並且自主修復。
這就真的很牛掰了啊,因為在真實工作裡頭,從零開發一個項目只是其中一部分。
更多時間其實花在了檢查、修改、適配、測試和持續最佳化上。很顯然,GPT-5.6幹這些活已經遊刃有餘了。
不過有一說一啊,能力確實強,但額度消耗也是真的快!!!
前面三個任務,我全程使用的都是GPT-5.6 Sol,推理強度選擇的是高。
模型的能力確實沒得說,但額度消耗也是真的快,基本上跑一個半個多小時的複雜開發任務,5小時使用額度就有可能給你直接用完了。
不過我這是一個Plus帳號哈,如果你是Pro的話,應該會耐造很多。
當然,我這裡測試的都是程式碼開發、3D網頁、資料後台和舊項目審查。而且推理強度選擇了高。
這種任務本身就比較重,消耗速度肯定會比普通聊天、寫作總結和普通辦公任務會快很多。
好在這次OpenAI似乎也知道新模型比較耗額度,所以一個勁的給使用者贈送速率限制重設機會。
24小時內重設兩次,說實話,比隔壁的Claude可大方多了。
經常就是一打開Codex,你就會發現,欸,好傢伙,又給重設機會了,而且是30天內有效。
相當於是給你額外送的加油包,一個月內,想什麼時候使用就什麼時候用,真爽。
我這裡目前一共還攢了3次完整的重設機會。點選使用重設,5小時和每周的額度就會一起恢復。
所以這兩天已經拿到GPT-5.6的朋友,真的可以先拿它去處理一些難度比較高的任務。
特別是那些你之前用其他模型反覆修改,依舊很難做好的項目。
直接把完整資料、截圖、視訊和項目檔案交給它,讓GPT-5.6 Sol開高推理跑一次。
AI圈一直有個老梗。新模型剛上線的時候先抓緊體驗,把額度用滿,搞不准後面就降智了,後面會不會調整模型策略、速度和額度,誰也說不準。
這次OpenAI還送了重設機會,更應該先把額度用到刀刃上。
簡單的寫作、摘要和日常任務,沒有必要每次都使用Sol高推理。真正複雜的項目,再把最強模型拉出來幹活。
這樣會更划算一些。
總之,實測下來,模型能力確實有了很強的提升,接下來,繼續嘗試用它整一些更有意思,更有價值的小工具。 (水哥AIGC)
