登入
關鍵字
#Claude 3.7
官方認證
RexAA
2025/05/30
•
這一夜,中國AI徹底翻身了:DeepSeek R1讓全世界刮目相看 | 深度評測
這一張圖,改變了中國的歷史!01 程式碼生成能力:一次成功,完勝Claude 3.7先說程式碼層面的表現。熟悉我的朋友都知道,黃叔之前寫過一本AI程式設計藍皮書,裡面有大量的實戰案例,基本都是用Claude 3.5、3.7跑出來的。即使是一些相對簡單的案例,比如:- 給老外起中文名的AI網頁- 善思flomo瀏覽器外掛用Windsurf+Claude 3.5的組合,往往都需要偵錯幾次,出現各種小bug才能最終搞定。但是!新DeepSeek R1直接一次成功!我測試了給川普起中文名的功能,R1居然給出了"推特神獸"、"川普大帝"這樣的神翻譯,簡直笑死我了!還有flomo瀏覽器外掛,R1也是一次性生成成功,而且可以直接一鍵同步到flomo,完全沒有任何問題:正當我準備繼續測試更多功能的時候,晚上10點多,API就掛了...看來大家都在瘋狂測試啊!當然,R1也不是完美無缺當然,黃叔必須得說一句,新R1在Coding能力的全面性上還是有欠缺的,體現在:客觀地說,新R1在程式設計能力的全面性上還是有些不足:1. 思考過程太冗長:R1需要很長的thinking過程來彌補推理能力,導致響應速度比較慢:2. 缺少多模態能力:不能像Claude那樣通過截圖來描述程式碼錯誤,偵錯起來比較麻煩但即便如此,新R1在程式碼生成方面已經穩穩站在了Claude 3.7和Claude 4之間的水平!02 前端設計審美:已達Claude 4水準這裡第一張圖我們先不說明那個是Claude4.0生成的,那個是Deepseek R1生成的,大家可以看一下兩份設計圖,能否像之前Claude3.7對比其他模型那樣一眼完成識別。揭曉答案:繼續,我測試更多的UI介面設計:大家可以自行對比!在雜誌風格卡片的測試中,我用自己的文章《2個月漲粉10000+,多篇文章閱讀過萬!黃叔是如何在AI浪潮中找到清晰方向的?》作為素材。有趣的是,新R1甚至在某些方面略勝一籌!比如我在提示詞中明確要求使用偏棕色的背景色,R1嚴格按照要求執行,而Claude 4雖然設計質量很高,但在提示詞遵從度上有些偏差。就像老闆給員工佈置任務,員工完成得很好,但和老闆想要的不太一樣——這種情況我在開發其他產品時也遇到過。當然這種情況還是少數,更多情況下可以很好的完成要求,就像下面這樣:這兩個卡片是用我另一篇文章《我用了一個月Dia瀏覽器,已經徹底拋棄了Chrome!》生成的,左側卡片在提示詞的雜誌感要求方面更強一些,右側卡片在提示詞要求的其他細節如背景元素等方面略勝一籌。繼續換個風格看一下,這次我們用日本平面設計風格:特別值得一提的是,在測試日本平面設計風格時,我只是簡單地在提示詞中寫了"日本平面設計風格":DeepSeek R1在推理過程中,竟然先詳細分析了"日本平面設計風格到底是什麼風格",然後才輸出設計稿!這種自主學習和推理的能力,真的讓人刮目相看。下面是一個美漫風格的卡片:這兩張卡片對比下來左側的明顯更符合美漫風格,設計質量也更好,這裡不知道是不是因為Claude 4的訓練資料更多的是英文資料所以對美漫風理解更深刻?有懂的朋友歡迎留言確認一下是否有這方面的影響。最後是一張二次元科幻風的卡片對比:這個案例Claude4.0在顏色搭配和光影效果上做的更好一些,新R1相對簡單了一些,使用單色還是比較難體現出科幻的氛圍和光影感。經過和一位設計師朋友的深度討論,我們得出了一個重要結論:頂級AI模型的前端設計能力,已經進入了需要專業設計師才能區分質量差異的階段!對於我這樣的非設計師來說,第一感覺就是"差不多"、"都挺好",已經很難評價Claude 4和新DeepSeek R1的輸出質量了。再結合新R1在功能程式碼上的巨大進步,這真的要出大事了!頂級模型的前端設計能力,已經進入了一個需要專業設計師去區分設計質量的階段!再結合新R1在功能程式碼上的進步,真的出大事了!03 為什麼說這改變了中國的歷史?從多個評測案例來看,新DeepSeek R1確實接近Claude 4的水平。這一點我和歸藏以及其他朋友交流後,大家都比較認同。退一步說,即使只是達到Claude 3.7的水平,這也已經超級牛逼了!國產AI的歷史性突破黃叔一直有個觀點:今年國內大模型在程式設計能力上會追平Claude 3.5的水準。如果真的實現了,那意味著:- 無需魔法:國內使用者可以直接使用- 價格低廉:成本優勢明顯- 本土化服務:更適合中國使用者需求這樣的組合,一定會引爆國內AI市場!因為程式設計的價值實在太大了!真沒想到,還沒到6月份,甚至是在輝達發財報的前夜,中國之光DeepSeek就用一個"小"更新,直接擊穿了所有人的預期!這種感覺就像是:你以為自己在追趕,結果一不小心就超車了!寫在最後哎,這個世界變化真的太快了!再保守就要錯過更多機會了。 (AI產品黃叔)
科技
#中國AI
#DeepSeek R1
#Claude 3.7
讚
留言
分享
官方認證
RexAA
2025/05/07
•
Gemini 2.5 Pro強勢更新並霸榜,Claude 3.7首次遭遇全方位碾壓!
Gemini 2.5 Pro 更新來了,這次的Claude 3.7被打得毫無還手之力!這兩天AI界最引人注目的新聞莫過於Google DeepMind推出的最新模型Gemini 2.5 Pro在LMArena各大排行榜全面登頂了!而且,這不僅僅是簡單的一兩個領域的領先,而是首次實現了文字、視覺、Web開發全方位霸榜,Claude 3.7甚至首次在WebDev Arena上失守。Gemini 2.5 Pro霸榜之路,勢不可擋!根據LMArena(@lmarena_ai)的消息,Gemini 2.5 Pro橫掃多個AI競技場:文字領域(程式碼生成、風格控制、創意寫作等)穩居第一;視覺能力碾壓其他選手,領先幅度高達70分;Web開發能力首次超越Claude 3.7,躍居榜首!這也是史上第一次有單一模型在文字、視覺和Web開發領域實現如此全面的統治。從LMArena公佈的資料來看,Gemini 2.5 Pro的表現不僅贏得了榜單,更贏得了社區使用者的高度認可。Google DeepMind的新大招:編碼能力再升級Google DeepMind官方發推表示,他們推出的Gemini 2.5 Pro(I/O版)在編碼能力上做了重大升級:你可以用一個提示詞建構更豐富的網頁應用、遊戲、模擬環境等等。他們還展示了通過@GeminiApp如何從自然界的圖片中快速生成對應的程式碼,展示了模型令人驚豔的創造力:不僅如此,Gemini 2.5 Pro在WebDev Arena中首次超過Claude 3.7,這個榜單主要測試模型建構吸引人的網頁應用的能力。Google官方也在推特中強調了這一突破:此外,這個版本還顯著提升了程式碼轉換、編輯能力和開發複雜智能體的表現。開發者們現在可以在Google AI Studio、Vertex AI以及Gemini App中使用這個強大的新工具。為什麼新版Gemini 2.5 Pro如此厲害?Gemini 2.5 Pro能有如此表現,並非偶然。官方表示,此次更新主要針對使用者在實際編碼中的痛點做了針對性的最佳化,例如:顯著減少呼叫工具的失敗率;增強了多模態推理能力;改進了視訊理解能力,在VideoMME基準測試中取得了高達84.8%的表現;全新升級的UI介面建構能力,讓Web應用更美觀、功能更強大。Google DeepMind CEO Michael Truell還特別強調了其內部觀察:「新版Gemini 2.5 Pro顯著降低了呼叫工具的失敗率,極大提高了實際編碼場景中的效率。」創造力的新天地Google發佈的官方部落格中表示,Gemini 2.5 Pro已通過Google AI Studio和Vertex AI全面向開發者開放,使用者可以在Gemini App中體驗各種豐富的功能,如Canvas功能。部落格地址:https://blog.google/products/gemini/gemini-2-5-pro-updates/TheQuickTechGuy(@GoogleDeepMind) 表示對Gemini 2.5 Pro能力的認可:「將自然圖片轉化為程式碼,這種創意真是太棒了!期待它在更複雜的Web應用和模擬環境中的表現。」而Andrew Hoskins(@NeuralNinjas)也對Gemini 2.5 Pro給出了很高的評價,同時好奇下一次能否有競爭對手@Grok出來挑戰一下:「Google DeepMind 🔥恭喜!不知道@grok能不能下一次奪回冠軍?」一些質疑和看法但並非所有人都盲目樂觀,比如Vladimir Goncharov提出了一些嚴肅的質疑,他表示新版本在幾個測試中反而有退步,比如:HLE測試:18.8 → 17.8 🔴GPQA:84.0 → 83.0 🔴SimpleQA:52.9 → 50.8 🔴雖然有一些指標有提升,比如LiveCodeBench和Aider,但整體上表現不如預期,他認為Gemini 2.5 Pro實際表現更像是Gemini 2.4。Gemini 2.5 Pro全面領跑儘管存在一些質疑,但Gemini 2.5 Pro此次的表現足以證明,它在文字、視覺和Web開發領域的綜合能力已經登頂,目前看來,短期內難有對手。這個最新版本甚至提前在Google I/O大會之前發佈,也引發了許多使用者對大會將有更多驚喜的期待。此外Google DeepMind首席科學家Jeff Dean還指出,Gemini 2.5 Pro的更新修復了03-25初始版本中人們注意到的功能呼叫問題:Gemini 2.5 Pro,AI領域的全新標竿,喊話Anthropic 將全面取代Claude 3.7成為當下最炙手可熱的模型:不服來戰!(AGI Hunt)
科技
#Gemini 2.5 Pro
#Claude 3.7
讚
留言
分享
官方認證
RexAA
2025/02/25
•
劍指OpenAI,Anthropic推出全球首個“混合推理模型”,最新估值615億美元
2月25日消息,美國當地時間週一, 由OpenAI前員工創辦的人工智慧公司Anthropic突發連招。在技術方面,Anthropic宣布推出全球首個「混合推理」AI模型,向OpenAI、DeepSeek等對手發起挑戰。在營運方面,該公司表示即將完成35億美元融資,估值達615億美元。 全球首款「混合推理」AI模型 Anthropic此次發布的新模型名為Claude 3.7 Sonnet,它賦予了用戶前所未有的控制權,讓他們可以決定AI在生成回答前花費多少時間進行「思考」。同時,Anthropic也推出了AI程式助理Claude Code。這些措施標誌著Anthropic正大舉進軍企業AI市場,或將徹底改變企業建置軟體和自動化工作的方式。 Claude 3.7 Sonnet引入了「思考模式」切換功能,讓使用者可以根據任務複雜度優化AI的回應時間。 Anthropic研究產品管理負責人Dianne Penn表示:“我們認為推理是AI的核心組成部分,而不是需要額外付費才能使用的功能。就像人類一樣,AI應該既能快速響應,又能進行複雜思考。對於簡單問題,它應該立即給出答案;但對於復雜的任務,它則需要更多的處理時間。”
科技
#Anthropic
#混合推理模型
#OpenAI
讚
留言
分享
官方認證
RexAA
2025/02/25
•
全全球首個混合推理模式降世!程式設計師集體過年,最強AI程式秒全場,多平台火速接入
今天,Anthropic重磅發布首個混合推理模型-Claude 3.7 Sonnet 。這個模型在編碼和前端Web開發方面表現突出,使用者既可以讓模型給出即時答案,也可以給出經過深思熟慮的答案。 可切換兩種思考模式,精準把控思考時間。 Anthropic也推出了代理程式編碼工具Claude Code,可以搜尋和讀取程式碼、編輯檔案、編寫和執行測試、提交和推送程式碼到GitHub以及使用命令列工具。在早期測試中,Claude Code可以一次完成通常需要45分鐘手動操作的工作。 目前,Claude 3.7 Sonnet已經在全平台上線,包括亞馬遜雲端服務Bedrock平台、Google雲,而要想要擴展思考模式,除免費版外其他都可以用。在標準和擴展思維模式下,Claude 3.7 Sonnet的價格與先前產品相同:每百萬輸入tokens收費3美元,每百萬輸出tokens收費15美元——其中包括思考tokens。
科技
#Anthropic
#Claude 3.7
#Claude
讚
留言
分享