服都服了,又是那家模型搞匿名啊,大過節的擱這兒殺出來沖榜?!
說的就是你,Space Bunny。
一個沒留神,它在短短幾天裡經歷了突然出現->突然熱度飆升->突然幹到OpenRouter、OpenCode雙榜呼叫日榜第一->突然討論熱度也飆升。
掃了一眼,推特和Reddit上目前的整體風向是這樣的:
有說unbelievable的(be like@CoderGeeta)。
不少使用者反饋輸出效果不錯(be like@Fei2411)。
還有誇速度快,“打敗了Astra”的(be like@marcthecreatorr)。
真的嗎?
我不信。
所以在迷人又珍貴的中秋假期最後一天,我做了一個違背祖宗的決定——管他是誰家的匿名模型,先測了再說吧。
猜它是誰幹嘛,快開蹬啊
先跟大家說一聲,我是從OpenRouter上拿的API,接到了DeepSeek Harness(為公平起見我用了之前我沒用過的DSH,慚愧)裡面,給Space Bunny隨便取了個名字叫“tuerye”。
昨晚上和今天上午都在使勁蹬,然後隨機抽取,最後放了4個case在這篇稿子裡。
可能附帶一些我自己的個人主觀彈幕,但主要還是為了呈現。
歡迎大家給自己的判斷。
我這個人吧有點執念,這個世界上的匿名模型,管他大王小王,通通都要給我拉來測coding能力。
最近最火的除了Astra操控Blender,還有的就是3D玩法了。
那就上強度吧,我讓它“用Three.js建構一個詳細的立方體風格天壇,包含互動式細節”。
任務一開始跑我就擱旁邊看《花少2》8小時版本去了……大概一個多小時不到兩個小時吧,想起來看了一眼居然就跑完了,比我預想中快很多。
我給編輯部幾位同事看了下,滿足“互動”這個條件就不說了,它自己加了些我壓根兒沒提的細節,比如底部控制條裡還有夜、黎明、正午三個時刻和雨、煙的天氣開關;晝夜還會自行循環,一天約3.5分鐘,時辰文字也隨時間從子時走到亥時。
反正總體而言大家都覺得Space Bunny的初戰效果比較令人滿意。
而且說出來都丟臉,做完了我才想起來DSH它,沒!長!眼!睛!
所以評分方面再給這兔子加一顆星,表達我的歉意。。。
OK,展示第二個任務,給咱做一個蘋果系統的、更適合中國寶寶體質的鬧鐘。
這個功能其實iOS 27說是有了,但身在中秋假期在這兒為愛測評的我,腦子裡啪一下就冒出了這個需求。
Space Bunny耗時共22分鐘46秒。
做出來的鬧鐘,響鈴時的介面是這樣的,霸佔整個Mac的螢幕。
很霸道但也很簡潔:
一輪跑出來介面是這樣的:
按理說一輪就夠用,但我還是又讓它加個每個月到底鬧鈴響不響的功能,起床時間也調到7:23。
我們早八人是這樣的,能多睡一分鐘就儘量多睡一分鐘。。。
這任務吧實用性比較強,咱們主要來看看readme裡面它記錄的思考。
iOS的硬性限制它也考慮到了:
但你們要不要看下我在這裡看到了什麼。。。
這是什麼。。。
暈倒了我已經。
怕自己貼截圖的時候再次暈倒,所以趕緊來看第三個Coding任務吧,讓Space Bunny做個App。
“做一個mac app,把dsh當前的思考像字幕一樣打在螢幕上。”
好消息是這玩意兒做起來就很快,可能不到5分鐘?
我在飛書頁面寫這篇稿子呢,非常短的時間裡螢幕上就冒出來了個這個,給我嚇一跳。
壞消息是這次它自己腦補的細節就沒有天壇那個豐富,初次交差的版本確實一直在顯示DSH的腦回路,但窗口不能拖動挪動,也沒有關掉和最小化。
這個位置一度擋住了我和DSH的對話方塊,我沉默許久,終於想起來可以給窗口縮小咯(可能是還沉浸在中秋尾聲,今天測試的諸多環節我好像都失了智,好在Space Bunny智商還挺線上的)。
但我還是無能地勃然小怒了一下:
不到15分鐘,且是在我開了多個任務同時跑的前提下,它給改好了。
現在就是隨便挪,任意挪,想咋挪就咋挪。
而且沒有思考的時候它會變得小小只。
我覺得海星?還不錯!
不過也有兩個問題。
一個是它自己說的,“合成滑鼠事件在這個環境裡會被系統丟掉一部分,所以「拖動是否與指針1:1同步」我沒法在無頭環境裡斷言——我改成了直接跟指針的螢幕位移(兩端都是AppKit坐標,不存在符號翻轉),你手動拖一下最準。”
另外就是拖動的時候會像小星星一樣一閃一閃的?
這個不是啥大問題,應該就是因為即時顯示腦回路所以窗口忽大忽小的,我又在拿滑鼠拖曳,兩套操作有點打架。
回頭再互動一輪簡單打磨下就好了。
講真最近測的好幾個模型都這樣,首輪出來總會有些小細節有bug,肯定是沒有Astra這種驚豔你一跳又一跳的feel,但拿來幹活跑跑程式碼肯定是沒問題的。
也就是首輪結果出來過後自己要再手動提點小建議,一般一輪就能解決。
如果要增加新功能就再互動再跑。
Reddit上有老哥跟我體感是一樣的:
我測試過程中幾乎沒有出現一輪解決不了的問題。
只有一次,跑了個“給GitHub某倉庫的文章列表增加cursor分頁和標籤組合篩選,補全測試且保持舊介面可用”的任務,看到它聲稱“全部檢查通過”,隨後又說明lint仍有33個錯誤,有點bug。
但這個問題一說也馬上就改了,我還讓codex幫我審了一遍,人家也說沒問題。
前前後後測了十幾個coding任務都給我測累了,於是我的魔爪又伸向了多模態。
問Space Bunny(寫到這裡我腦子裡有一瞬間無理由飄過“這兔子不會是Grok吧”):
這個機器人幹嘛呢?
中間流程太複雜了,直接上最終結果:
講道理這個任務不知道為什麼快取命中有點低?
我看了下,除了這個任務其餘的快取命率中都在95%以上⬇️
太空玉兔,你是O/A/G/Z/M/K…家的嗎?
講真,我是測完過後才開始認真去看開發者們分享的一手體感的。
好的壞的評價都有,初步目測是好評偏多。
什麼說Space Bunny是個工具狂人啊:
速度快啊:
(好,原來大家都用GPT-6審程式碼,本菜狗放心了)
別慌,當然不可能全網好評!
也有說它思考得太多——這和第一個測試中它給的天壇的結果比prompt豐富得多對應上了。
但也要和大家李濤一下,速度快、最終結果ok,還能給出更多的資訊量……
那麼思考太多到底算好算壞呢?
Anyway。
如果你有自己的體會也歡迎分享在評論區,我們會在第一時間把留言放出來。
好,最後還是俗氣地來到傳統習俗——猜廠商——環節。
雖然說,現在每個月都有新匿名模型,已經快成模型發佈固定伴侶了……
但因為使用體感沒有拉胯,猜一猜也行吧!我看網友們的猜測都五花八門的。
有網友說,因為聲音聽起來和GPT的很像,所以OpenAI你別藏著掖著了,直接亮相吧小寶貝:
居然還看到有人跟我前面一樣,從名字裡的“space”來粗暴猜測,說Bunny同學就是Grok的船新版本。
xswl,謝謝兄弟姐妹告訴我這麼神經的人不只有我一個。
然後國內頭部模型們幾乎都被猜了,猜Kimi的、GLM的、HY的、MiniMax的都有。
還有人覺得是Meta接下來會發佈的Muse Spark。
先不說猜得對不對的,但猜想小扎看到這個猜測一定很欣慰,我們Meta也是真的靠Muse重新上桌了嗚嗚嗚。
放幾個月前,這種表現不錯的匿名模型,誰會把Meta的模型拿出來說啊喂!
最後的最後,我俗氣地和大家感慨一下,比起認領兔子更值得關注的應該是Space Bunny這麼快在呼叫榜登頂的實質原因。
現在日常幹活,除了搞演算法的朋友們,大家的大模型挑選標準都趨向經濟適用。
吾日三省吾身:這模型快不?准不?貴不?
正因如此,幾乎所有的Flash高速模型就成了處理高頻任務的主力工具。
就目前的資訊而言,Space Bunny大機率也是想這樣走花路的,不過,具體定價還是要等廠商認領公佈咱們才知道了╮(╯▽╰)╭ (量子位)
