又快又能打!匿名模型玉兔模型殺上雙榜第一,Coding實測全記錄

RexAA
•
AI速讀
匿名 AI 模型 Space Bunny 近日突然在 OpenRouter 與 OpenCode 榜單奪冠,引發業界關注。實測顯示,該模型在複雜 Coding 任務(如 Three.js 互動建模與 macOS 應用開發)中表現出極高的速度與邏輯能力,雖首輪結果偶有小 bug,但經修正後效果理想。其多模態視訊理解能力亦獲得肯定。目前社群對其開發者猜測分歧,涵蓋 OpenAI、xAI、Meta 及國內頭部模型廠商。此次事件反映出 AI 產業正由追求極致性能轉向追求「快、準、便宜」的經濟適用型高速模型趨勢。

服都服了,又是那家模型搞匿名啊,大過節的擱這兒殺出來沖榜?!

說的就是你,Space Bunny。

一個沒留神,它在短短幾天裡經歷了突然出現->突然熱度飆升->突然幹到OpenRouter、OpenCode雙榜呼叫日榜第一->突然討論熱度也飆升。

掃了一眼,推特和Reddit上目前的整體風向是這樣的:

有說unbelievable的(be like@CoderGeeta)。

不少使用者反饋輸出效果不錯(be like@Fei2411)。

還有誇速度快,“打敗了Astra”的(be like@marcthecreatorr)。

真的嗎?

我不信。

所以在迷人又珍貴的中秋假期最後一天,我做了一個違背祖宗的決定——管他是誰家的匿名模型,先測了再說吧。

猜它是誰幹嘛,快開蹬啊

先跟大家說一聲,我是從OpenRouter上拿的API,接到了DeepSeek Harness(為公平起見我用了之前我沒用過的DSH,慚愧)裡面,給Space Bunny隨便取了個名字叫“tuerye”。

昨晚上和今天上午都在使勁蹬,然後隨機抽取,最後放了4個case在這篇稿子裡。

可能附帶一些我自己的個人主觀彈幕,但主要還是為了呈現。

歡迎大家給自己的判斷。

我這個人吧有點執念,這個世界上的匿名模型,管他大王小王,通通都要給我拉來測coding能力。

最近最火的除了Astra操控Blender,還有的就是3D玩法了。

那就上強度吧,我讓它“用Three.js建構一個詳細的立方體風格天壇,包含互動式細節”。

任務一開始跑我就擱旁邊看《花少2》8小時版本去了……大概一個多小時不到兩個小時吧,想起來看了一眼居然就跑完了,比我預想中快很多。

我給編輯部幾位同事看了下,滿足“互動”這個條件就不說了,它自己加了些我壓根兒沒提的細節,比如底部控制條裡還有夜、黎明、正午三個時刻和雨、煙的天氣開關;晝夜還會自行循環,一天約3.5分鐘,時辰文字也隨時間從子時走到亥時。

反正總體而言大家都覺得Space Bunny的初戰效果比較令人滿意。

而且說出來都丟臉,做完了我才想起來DSH它,沒!長!眼!睛!

所以評分方面再給這兔子加一顆星,表達我的歉意。。。

OK,展示第二個任務,給咱做一個蘋果系統的、更適合中國寶寶體質的鬧鐘。

這個功能其實iOS 27說是有了,但身在中秋假期在這兒為愛測評的我,腦子裡啪一下就冒出了這個需求。

Space Bunny耗時共22分鐘46秒。

做出來的鬧鐘,響鈴時的介面是這樣的,霸佔整個Mac的螢幕。

很霸道但也很簡潔:

一輪跑出來介面是這樣的:

按理說一輪就夠用,但我還是又讓它加個每個月到底鬧鈴響不響的功能,起床時間也調到7:23。

我們早八人是這樣的,能多睡一分鐘就儘量多睡一分鐘。。。

這任務吧實用性比較強,咱們主要來看看readme裡面它記錄的思考。

iOS的硬性限制它也考慮到了:

但你們要不要看下我在這裡看到了什麼。。。

這是什麼。。。

暈倒了我已經。

怕自己貼截圖的時候再次暈倒,所以趕緊來看第三個Coding任務吧,讓Space Bunny做個App。

“做一個mac app,把dsh當前的思考像字幕一樣打在螢幕上。”

好消息是這玩意兒做起來就很快,可能不到5分鐘?

我在飛書頁面寫這篇稿子呢,非常短的時間裡螢幕上就冒出來了個這個,給我嚇一跳。

壞消息是這次它自己腦補的細節就沒有天壇那個豐富,初次交差的版本確實一直在顯示DSH的腦回路,但窗口不能拖動挪動,也沒有關掉和最小化。

這個位置一度擋住了我和DSH的對話方塊,我沉默許久,終於想起來可以給窗口縮小咯(可能是還沉浸在中秋尾聲,今天測試的諸多環節我好像都失了智,好在Space Bunny智商還挺線上的)。

但我還是無能地勃然小怒了一下:

不到15分鐘,且是在我開了多個任務同時跑的前提下,它給改好了。

現在就是隨便挪,任意挪,想咋挪就咋挪。

而且沒有思考的時候它會變得小小只。


我覺得海星?還不錯!

不過也有兩個問題。

一個是它自己說的,“合成滑鼠事件在這個環境裡會被系統丟掉一部分,所以「拖動是否與指針1:1同步」我沒法在無頭環境裡斷言——我改成了直接跟指針的螢幕位移(兩端都是AppKit坐標,不存在符號翻轉),你手動拖一下最準。”

另外就是拖動的時候會像小星星一樣一閃一閃的?

這個不是啥大問題,應該就是因為即時顯示腦回路所以窗口忽大忽小的,我又在拿滑鼠拖曳,兩套操作有點打架。

回頭再互動一輪簡單打磨下就好了。

講真最近測的好幾個模型都這樣,首輪出來總會有些小細節有bug,肯定是沒有Astra這種驚豔你一跳又一跳的feel,但拿來幹活跑跑程式碼肯定是沒問題的。

也就是首輪結果出來過後自己要再手動提點小建議,一般一輪就能解決。

如果要增加新功能就再互動再跑。

Reddit上有老哥跟我體感是一樣的:

我測試過程中幾乎沒有出現一輪解決不了的問題。

只有一次,跑了個“給GitHub某倉庫的文章列表增加cursor分頁和標籤組合篩選,補全測試且保持舊介面可用”的任務,看到它聲稱“全部檢查通過”,隨後又說明lint仍有33個錯誤,有點bug。

但這個問題一說也馬上就改了,我還讓codex幫我審了一遍,人家也說沒問題。

前前後後測了十幾個coding任務都給我測累了,於是我的魔爪又伸向了多模態。

問Space Bunny(寫到這裡我腦子裡有一瞬間無理由飄過“這兔子不會是Grok吧”):

這個機器人幹嘛呢?

中間流程太複雜了,直接上最終結果:

講道理這個任務不知道為什麼快取命中有點低?

我看了下,除了這個任務其餘的快取命率中都在95%以上⬇️

太空玉兔,你是O/A/G/Z/M/K…家的嗎?

講真,我是測完過後才開始認真去看開發者們分享的一手體感的。

好的壞的評價都有,初步目測是好評偏多。

什麼說Space Bunny是個工具狂人啊:

速度快啊:

(好,原來大家都用GPT-6審程式碼,本菜狗放心了)

別慌,當然不可能全網好評!

也有說它思考得太多——這和第一個測試中它給的天壇的結果比prompt豐富得多對應上了。

但也要和大家李濤一下,速度快、最終結果ok,還能給出更多的資訊量……

那麼思考太多到底算好算壞呢?

Anyway。

如果你有自己的體會也歡迎分享在評論區,我們會在第一時間把留言放出來。

好,最後還是俗氣地來到傳統習俗——猜廠商——環節。

雖然說,現在每個月都有新匿名模型,已經快成模型發佈固定伴侶了……

但因為使用體感沒有拉胯,猜一猜也行吧!我看網友們的猜測都五花八門的。

有網友說,因為聲音聽起來和GPT的很像,所以OpenAI你別藏著掖著了,直接亮相吧小寶貝:

居然還看到有人跟我前面一樣,從名字裡的“space”來粗暴猜測,說Bunny同學就是Grok的船新版本。

xswl,謝謝兄弟姐妹告訴我這麼神經的人不只有我一個。

然後國內頭部模型們幾乎都被猜了,猜Kimi的、GLM的、HY的、MiniMax的都有。

還有人覺得是Meta接下來會發佈的Muse Spark。

先不說猜得對不對的,但猜想小扎看到這個猜測一定很欣慰,我們Meta也是真的靠Muse重新上桌了嗚嗚嗚。

放幾個月前,這種表現不錯的匿名模型,誰會把Meta的模型拿出來說啊喂!

最後的最後,我俗氣地和大家感慨一下,比起認領兔子更值得關注的應該是Space Bunny這麼快在呼叫榜登頂的實質原因。

現在日常幹活,除了搞演算法的朋友們,大家的大模型挑選標準都趨向經濟適用。

吾日三省吾身:這模型快不?准不?貴不?

正因如此,幾乎所有的Flash高速模型就成了處理高頻任務的主力工具。

就目前的資訊而言,Space Bunny大機率也是想這樣走花路的,不過,具體定價還是要等廠商認領公佈咱們才知道了╮(╯▽╰)╭ (量子位)