登入
關鍵字
#Claude Opus 4.6
官方認證
北風窗
2026/04/26
•
DeepSeek V4,一個王炸!
DeepSeek V4,終於亮相了。就在2026年4月24日,AI圈的平靜被一封發佈稿打破。沒有任何預熱,沒有發佈會,深度求索團隊在官網和社交媒體上同步宣佈:全新系列模型DeepSeek-V4 預覽版正式上線並開源,即日起登錄官網或App即可體驗。這是一次略顯突然的發佈。就在幾天前,矽谷還在熱議OpenAI的GPT-5.5和Anthropic的Claude Opus 4.6,全球AI領域的競爭早已呈現“萬類霜天競自由”的氣象。站在另一個維度來看,此刻距離DeepSeek上一次讓全球AI行業震動,已經過去了近16個月。時間撥回到2025年初。R1發佈當天,行業迅速沸騰,中國AI團隊用不到600萬美元的算力成本訓練出能與GPT-4正面競爭的模型,輝達股價應聲暴跌。那一周,DeepSeek同時登頂中美App Store下載榜首,“中國AI奇蹟”的敘事鋪天蓋地。在這近16個月的時間裡,智譜和MiniMax先後登陸資本市場,市值一度衝破3000億元;豆包、Qwen密集發佈新版本,頻頻登頂各類榜單;Anthropic推出Claude 4系列,OpenAI迭代至GPT-5.5,而DeepSeek在V3之後長達近16個月的時間裡,只推出了幾個跑分變化不大的中間版本,外界關於“DeepSeek是否後繼乏力”的猜測此起彼伏。近16個月的時間裡,整個行業都在等待一個答案:DeepSeek究竟是曇花一現,還是一條可持續的技術路線?終於,答案來了。DeepSeek V4,有那些亮點?客觀上講,DeepSeek V4的發佈略顯樸素,沒有任何預熱,也沒有發佈會。並且,在DeepSeek官方的稿件裡面,似乎也沒有太多“炸裂”元素。DeepSeek官方在技術報告中坦誠地寫道,V4的能力水平仍落後GPT-5.4和Gemini-3.1-Pro,“發展軌跡大約滯後前沿閉源模型3至6個月”。在國內AI發佈稿裡,這種主動承認差距的寫法相當罕見。但真正值得關注的不在於跑分是否登頂,而在於V4解決了一個困擾大模型行業多年的根本問題:長上下文的成本困境。眾所周知,傳統Transformer架構有一個致命的擴展難題——注意力機制的計算量隨上下文長度呈平方級增長。上下文翻倍,計算量翻四倍。這意味著,把上下文從128K擴展到100萬token,理論上計算量會增長約60倍。這也是為什麼長期以來,百萬字上下文要麼是Google Gemini的獨家王牌,要麼是實驗室裡的漂亮數字,太貴了,用不起。V4給出的解法是一種全新的混合注意力架構。通俗地解釋,就像你在讀一本1000頁的書時找某個觀點的關聯內容。笨辦法是把目標頁和其他999頁逐一比對,工作量隨頁數翻倍而變成四倍。聰明的辦法是:先粗略判斷那些頁面可能相關(稀疏選擇),再把相關頁面壓縮成摘要(token壓縮),兩步疊加上後,工作量增長曲線被大幅壓平。這正是V4的核心創新:CSA(壓縮稀疏注意力)和HCA(高度壓縮注意力)的混合架構。在1M上下文設定下,V4-Pro的單token推理算力只有上一代V3.2的27%,KV快取僅需10%;更經濟的V4-Flash版本則將這兩個數字分別壓到了10%和7%。換句話說,上下文長度擴大了近8倍,但推理成本反而下降了。再回到模型本身來看,V4一口氣發佈兩個版本:DeepSeek-V4-Pro 總參數1.6兆、每次推理啟動49B;DeepSeek-V4-Flash 總參數284B、啟動13B。兩者均原生支援100萬token上下文。理解這兩個數字需要先理解MoE(混合專家)架構。簡單講,V4內部有大量“專家”子網路,每次處理資訊時只啟動其中一小部分。總參數決定知識容量,啟動參數決定推理成本。這就像一家公司有1600個身懷絕技的員工,但每個項目只調49人上陣,可以按需靈活組合。在能力評估上,DeepSeek的措辭相當克制。發佈稿明確表示:V4-Pro的Agent能力優於Sonnet 4.5,交付質量接近Opus 4.6非思考模式,但仍與後者思考模式存在差距。在內部85名開發者和研究人員的調研中,超過九成認為V4-Pro已可作為首選或接近首選的程式設計模型。能力的分佈是不均勻的。在數學、STEM、競賽型程式碼等推理密集型任務上,V4-Pro超越所有已知開源模型,比肩頂級閉源產品;在Codeforces人類選手排行榜上,V4-Pro-Max位列第23名;但在世界知識方面——事實性資訊的覆蓋廣度,僅稍遜於Gemini-Pro-3.1。這個差距來自資料:Google擁有搜尋引擎索引和更大規模網頁抓取的結構性優勢,不是演算法可以短期彌補的。V4-Flash則定位為明確的性價比之選。很多人看到Pro和Flash兩個檔位,第一反應是“Flash就是降配版”,但實際並非如此。V4-Flash的推理能力與Pro接近,世界知識稍遜,而在Think Max模式下,性能可以大幅追近Pro:LiveCodeBench Flash Max達到91.6,Codeforces Flash Max Rating達到3052,與Pro Max的差距已相當有限。DeepSeek的底層突破V4在Agent能力上的提升幅度引人注目。但這一點需要更細緻的理解。Agent任務的核心約束一直是上下文管理:任務鏈越長,需要維護的狀態越多,有限的上下文窗口很快就成為瓶頸。V4的1M窗口意味著,Agent可以在更長的操作鏈裡保持狀態連貫,處理更大規模的程式碼庫,跨越更多文件進行推理。不只是模型變聰明了,底層條件也變了。V4專門針對 Claude Code、OpenClaw、OpenCode、CodeBuddy等主流Agent產品做了適配最佳化。後訓練階段,Agent是作為與數學、程式碼並列的獨立方向單獨訓練的;工具呼叫格式從JSON換成了帶特殊token的XML結構以降低錯誤率;跨輪次的推理痕跡在工具呼叫場景下完整保留,不再每輪清空。另外,DeepSeek還搭建了一套名為DSec的沙箱平台,單叢集可並行管理數十萬個沙箱實例,專門用來支撐Agent強化學習訓練和評測。這些細節指向同一個方向:V4不是在做“更強的聊天機器人”,而是在做“能幹活的作業系統”。另外,V4最核心的技術改動,是在注意力層。傳統Transformer的注意力機制,每個token要和前面所有token逐一計算相似度。上下文從10萬拉到100萬,計算量增長的不是10倍,而是100倍。V4的做法是把注意力拆成兩種,交替疊用:一種是CSA(壓縮稀疏注意力),先把每若干token的KV快取合併成摘要,再讓每個query只在這些摘要裡挑選最相關的top-k條去算注意力——相當於既壓縮了“要看的內容”,又只挑“值得看的”去算;另一種是HCA(高壓縮注意力),用更激進的壓縮率把更長區間的token合併為一條,但保持稠密注意力。兩種機制交替疊加,再加上一個滑動窗口分支處理“離得近的token之間的細節依賴”,形成了一套粗粒度與細粒度、稀疏與稠密的組合拳。而除了注意力層,V4還在殘差連接和最佳化器上動了刀。傳統殘差連接被升級為mHC(流形約束超連接),通過數學約束讓深層網路的訊號傳播更穩定;大部分模組的最佳化器從AdamW換成了Muon,通過迭代正交化梯度矩陣來加速收斂。這是DeepSeek第一次同時動Transformer的注意力、殘差、最佳化器這三處核心結構。後訓練方法同樣換了範式。V3.2用的是“混合RL”,一次性最佳化多個目標。V4則換成了“分化再統一”的兩步走:先針對數學、程式碼、Agent等不同領域獨立訓練專家模型,每個專家都在自己的賽道上跑到最優;再用一種叫On-Policy Distillation的方法,把十多個領域專家“蒸餾”回一個統一的學生模型——學生自己生成回答,針對每個回答匹配最懂這個問題的專家的輸出分佈,通過logit級對齊把能力吸收進來。用通俗的話說,把一堆尖子生蒸餾成一個通才。這套流程的工程難度在於:同時載入十多個兆參數級的教師模型做線上推理幾乎不可能。DeepSeek的做法是把所有教師權重統一解除安裝到分佈式儲存,只快取每個教師最後一層的hidden state,訓練時按教師索引排序樣本,保證任意時刻GPU視訊記憶體裡只駐留一個teacherhead。從2025年初到今天,V3.1、V3.2那些“沒什麼亮點”的中間版本,當時看似乎是在原地踏步。現在回頭看,DSA稀疏注意力的種子、TileLang替代CUDA的嘗試、Engram架構的早期驗證,都是在那時悄悄種下的,V3.2正是V4的地基。DeepSeek V4,對國產晶片價值幾何?如果說技術架構的革新是V4的“明線”,那麼對國產晶片產業鏈的重塑,則是這次發佈最容易被低估的“暗線”。要理解這條暗線的份量,需要先理解過去兩年AI競爭的核心邏輯。大模型發展至今,行業的共識是:訓練看算力,推理看視訊記憶體。在訓練階段,誰能買到更多高端GPU,誰能堆出更大叢集,誰就更有機會做出更強的基礎模型。輝達憑藉H100/A100系列GPU和CUDA生態,在這個階段建立了看似難以踰越的護城河。但大模型做出來之後,真正決定商業化速度和產業滲透深度的,是推理。尤其是以OpenClaw、Hermes為代表的Agent應用爆發後,推理的成本結構發生了根本性變化。Agent任務的特點是上下文越來越長、記憶越來越深、工具呼叫越來越頻繁。在這個場景下,GPU的視訊記憶體會被KV快取撐爆,大模型的推理質量急劇下降。推理的第一個瓶頸,不是算力不夠,是“記憶”和“計算”在搶同一塊視訊記憶體。這正是國產晶片最大的短板所在。受限於先進製程,國產GPU在算力峰值上尚可追趕,但在視訊記憶體容量和頻寬上與輝達存在代際差距。輝達最新一代Rubin GPU搭載288GB HBM4記憶體,而國產晶片如昇騰910B的視訊記憶體容量為64GB。如果按照傳統架構跑長上下文推理,這個差距幾乎是致命的。DeepSeek V4的解題思路,不是硬拚硬體,而是從架構層面重構了“記憶”和“計算”的關係。這涉及兩個關鍵創新:其一,CSA/HCA混合注意力機制大幅壓縮了KV快取佔用,1M上下文下,V4-Pro的KV快取僅為V3.2的10%,V4-Flash更是壓到7%。其二,據公開論文推測,V4採用的Engram架構把模型裡那些“死記硬背”的靜態知識抽出來放入獨立的記憶體表,推理時CPU負責“查字典”檢索知識,GPU只負責“想邏輯”計算推理,兩者完全重疊執行。當GPU在算上一個詞的邏輯時,CPU已經把下一個詞所需的知識搬到了門口。延遲被這種平行架構徹底掩蓋。結果是什麼?一個原本需要80GB視訊記憶體才能跑的長上下文推理任務,在Engram架構下可能只需要8GB視訊記憶體。輝達引以為傲的HBM視訊記憶體稀缺性,在這套架構面前被大幅削弱。國產晶片那64GB的視訊記憶體容量,突然變得夠用了。這解釋了為什麼黃仁勳會在近期訪談中做出一個意味深長的假設。他說,如果DeepSeek新模型在華為平台上首發,“這一天對美國來說將是一個可怕的結果,因為這意味著AI模型被最佳化為在中國AI硬體上表現最佳,而這些模型擴散到全球之後,就會推動中國技術成為世界標準。”而DeepSeek恰恰這麼做了。V4這次沒有按行業慣例給輝達早期測試權限,而是把提前適配的機會獨家開放給了華為昇騰和寒武紀。目標是實現從CUDA生態到華為CANN框架的整體遷移。V4技術報告第3.1節將華為昇騰NPU與輝達GPU並列寫進硬體驗證清單——這是DeepSeek官方第一次這樣做。V4的MoE專家權重和稀疏注意力索引器採用FP4精度,而FP4恰好是華為昇騰950PR晶片的原生支援精度。這不是巧合,這是一條被悄悄鋪了很久的路。產業鏈的傳導效應已經顯現。據有關媒體報導,阿里巴巴、字節跳動和騰訊等科技巨頭已提前下單華為新一代AI晶片,訂單規模達數十萬顆。在華為之外,寒武紀在軟硬一體生態中已完成對V4全系列的Day 0適配,適配程式碼開源至GitHub社區。沐曦股份預期2026年將扭虧為盈,有望成為繼寒武紀之後另一家盈利的國產GPU廠商。當DeepSeek用兆參數等級的模型驗證了國產晶片可以承載頂級大模型的推理,整個生態的底氣就變了。並且,從更宏觀的視角看,這件事改變的不僅是晶片選型,更是AI產業鏈的利潤分配邏輯。過去兩年,輝達憑藉GPU壟斷攫取了AI爆發期最豐厚的利潤,其資料中心業務毛利率長期維持在70%以上。而當一家開源模型的架構創新能夠進一步降低視訊記憶體需求,能夠跑通國產晶片並實現推理成本的大幅下降,輝達的定價權就不再是鐵板一塊。儘管短期內輝達在高端訓練GPU和CUDA生態上的優勢仍難替代,但推理市場,這個遠比訓練更廣闊、更具持續性的市場的遊戲規則正在被改寫。這就是DeepSeek“曲線救國”的邏輯:不是在單卡性能上硬碰硬,而是用系統級最佳化、軟硬協同和架構創新,重新定義了競爭維度。正如一位GPU企業人士所說,國內廠商都是戴著“鐐銬”與輝達同台競技。而V4證明了一件事:戴著鐐銬也可以起舞,甚至能跳出一支讓對方緊張的舞。結語:梁文鋒的安靜“棋局”V4發佈稿結尾,DeepSeek引了一句荀子:“不誘於譽,不恐於誹,率道而行,端然正己。”這句話放在DeepSeek一路走來的故事語境裡,意味深長。過去一年多,DeepSeek在外界的敘事裡經歷了過山車般的起伏。2025年初V3和R1爆火後,媒體將其捧上神壇,“中國AI奇蹟”的敘事鋪天蓋地。隨後一年多,當Anthropic、OpenAI密集發佈新模型,而DeepSeek只推出幾個跑分變化不大的中間版本時,關於“後繼乏力”的質疑又此起彼伏。在這個崇尚競爭和結果說話的行業裡,掌聲和噓聲都來得極快。而梁文鋒似乎始終活在自己的節奏裡。在DeepSeek內部,梁文鋒更多扮演著一個導師的角色:組織研發、協調資源,也做具體研究,在共同成果上署名為通訊作者。他幾乎把所有時間投入選定的少數事情上,不做融資、不參加團建、很少和成員聚餐。DeepSeek至今保持著一些在全球AI圈都極其罕見的習慣:不打卡、沒有明確的績效考核,平日裡多數員工會在下午六七點離開公司。在梁文鋒看來,一個人每天能高品質工作的時間很難超過6到8小時,加班疲勞下的昏庸判斷反而會浪費寶貴的算力資源。接近過梁文鋒的人曾評價:“他是一個特別抗噪音的人。”這種抗噪音的能力,解釋了DeepSeek為何沒有在R1爆火後乘勝追擊放大招,而是沿著自己選定的方向繼續深耕效率最佳化、架構改進和一些“非主流”探索。梁文鋒認同的AGI目標有兩層含義:一是基於國產生態來做大模型,他曾提出過“能不能用現存的一部分算力,就實現現在所有的智能”的假設;二是做“原創式創新”,做一些大廠或其它創業公司不會去試、不願去試的方向。這或許也能解釋V4為何選擇在這個時間點發佈。不急不躁,按自己的節奏出牌,在技術成熟度、生態適配和成本重構都到位的節點,一擊中的。也就在V4發佈後,一個容易被忽略的細節值得被重新提起:截至2026年4月,史丹佛大學HAI實驗室發佈的年度《AI指數報告》顯示,中美大模型性能差距已縮小至2.7%,基本實現技術追平。這個數字的背後,是兩種截然不同的路徑。美國走的是“算力堆疊+商業驅動”的路,用全球最強的GPU、最充裕的資本、最激進的商業化來推動模型能力不斷突破;中國走的是另一條路,一條在算力受限、晶片被卡的條件下,只能靠架構創新和系統最佳化來“戴著鐐銬起舞”的路。DeepSeek V4的每一項創新背後都能嗅到一個共同的動機:如何在更少的視訊記憶體、更低的算力、更受限的硬體條件下,榨出更多的智能。可以說,DeepSeek V4不是終點,甚至不是一次高潮。它是一個訊號,一個在算力受限的逆風局裡,依然可以用原創架構打開新空間的訊號;一個頂級開源模型不再必須繫結在輝達晶片上的訊號;一個沒有融資、不卷加班、按自己節奏前行的團隊,依然能站在第一梯隊的訊號。“不誘於譽,不恐於誹,率道而行,端然正己。” (正和島)
科技
#DeepSeek V4
#GPT-5.5
#Claude Opus 4.6
讚
留言
分享
官方認證
RexAA
2026/03/28
•
最強Claude意外洩露!完勝Opus 4.6,代號「卡皮巴拉」,奧特曼又要睡不著了
就在剛剛,Anthropic 洩露了一個從未公開過的新模型。沒有小道消息鋪墊,沒有「知情人士透露」的前戲,Anthropic 自己的 CMS 資料庫忘了關權限,近 3000 份內部檔案直接躺在公網上,被《Fortune》記者翻了個底朝天。劍橋大學網路安全研究員 Alexandre Pauwels 受邀驗證了這批材料的真實性和規模。Anthropic 發言人隨後向《Fortune》確認:模型確實存在。🔗 https://m1astra-mythos.pages.dev/這個模型叫 Claude Mythos,內部代號 Capybara(卡皮巴拉)。它跳過了 Opus 升級版的劇本,跳過了 Sonnet 換皮的套路,直接開闢了一個凌駕於 Opus 之上的全新第四層級。Anthropic 自己在草稿裡的原話:「Mythos 是一個全新層級模型的名字,比我們的 Opus 模型更大、更智能。在此之前,Opus 一直是我們最強大的模型。」如果你覺得 Claude Opus 4.6 已經夠猛了,那 Mythos 就是 Anthropic 在說:那只是熱身。Opus 之上,到底強了多少Anthropic 現有產品線是三層結構:Haiku 最輕最快,適合輕量任務;Sonnet 居中,性價比之選;Opus 最大最強,重型推理擔當。這個框架從 Claude 3 時代延續至今,行業裡幾乎所有人都默認 Opus 就是 Anthropic 的天花板。Mythos 把這個天花板掀了。洩露的草稿博文顯示,與當前最強的 Claude Opus 4.6 相比,Mythos 在多個核心領域取得了「顯著更高的分數」。至少覆蓋了三大方向:軟體程式設計。 這是當前 AI 模型競爭最白熱化的戰場。Claude Opus 4.6 本身已經是公認的程式設計最強模型之一,而 Mythos 在程式設計基準上進一步拉開了差距。對於每天用 Claude 寫程式碼的開發者來說,這意味著一個量級的躍升,不是小數點後面的微調。學術推理。 數學、科學、邏輯推理,這些考驗模型「深度思考」能力的硬骨頭,Mythos 同樣顯著領先。草稿中特意把「學術推理」作為獨立測試維度單獨拎出來講,說明 Anthropic 對這個方向的突破底氣很足。網路安全。 這是最炸裂的部分。草稿博文中有一段話,措辭之重,在 Anthropic 歷來的官方敘事中極為罕見:儘管 Mythos 目前在網路安全能力上遠超任何其他 AI 模型,但它預示著即將到來的一波浪潮,屆時模型將能以遠超防禦者努力的速度來利用漏洞。注意用詞:不是「領先」,不是「優於」,是「遠超」。而且這是洩露出來的內部評估,不是市場部寫的宣傳稿,用詞份量完全不同。Anthropic 發言人在確認 Mythos 存在時,用了兩個定性:「質的飛躍」 和 「迄今為止最強大的模型」。過去兩年,AI 模型的競爭一直在同一個量級上貼身肉搏。GPT 系列、Gemini、Claude、Llama,各項基準你追我趕,差距用個位數百分比來量。而 Mythos 暗示的已經不是追趕了,是變道超車。這大概就是為什麼,每次 Anthropic 有大動作,社交媒體上總有人第一時間 @Sam Altman:睡了嗎?太強了怎麼辦?Anthropic 的答案是:先把解藥發出去一家以「安全第一」立身的 AI 公司,在自己內部文件裡承認造出了一個可能讓攻擊者碾壓防禦者的東西。這種坦率在行業裡幾乎沒有先例。於是 Anthropic 做了一個罕見的決定:Mythos 的第一批使用者,不是開發者,不是企業客戶,而是網路安全防禦機構。邏輯很簡單:如果這個模型的攻擊能力確實如內部評估所言,那在放給所有人之前,得先讓守門的人拿到同樣的武器。毒藥還沒散出去,解藥先到位。這在 AI 行業的發佈史上幾乎沒有先例。OpenAI 發 GPT-4 的時候做過紅隊測試,Google 發 Gemini 做過安全審查,但沒有那家公司把「安全防禦者優先使用」寫進正式的發佈路線圖裡。Anthropic 這麼做,要麼是真的被自己造出來的東西嚇到了,要麼是在用一種極其高明的方式給 Mythos 的能力背書。又或者兩者兼有。與此同時,Mythos 的運行成本是另一個現實問題。草稿坦承「服務成本非常昂貴」,需要大幅最佳化效率才會考慮面向大眾。翻譯一下:這只卡皮巴拉目前是實驗室裡的珍稀品種,想讓它走進千家萬戶的聊天窗口,Anthropic 還得先把飼養成本打下來。但訊號已經出去了。當競爭對手還在為 Opus 等級的模型絞盡腦汁時,Anthropic 已經在討論 Opus 之上的東西該怎麼安全地放出來了。兩家公司,撞上同一隻卡皮巴拉每個大模型都有內部代號。GPT-4 叫過 Arrakis,Google 用寶石命名。而 Anthropic 給有史以來最強模型取的代號,是一隻卡皮巴拉,就是那個在網際網路上以「呆萌臉 + 跟誰都能和平共處」聞名的 meme 之王。怎麼實錘的?洩露的部落格有兩個版本。V1 通篇用「Mythos」,V2 把每一個「Mythos」都替換成了「Capybara」,連文中每處引用都做了對應修改。說明這個模型在 Anthropic 內部相當長時間裡就叫「卡皮巴拉」,「Mythos」是後來包裝出來的發佈名。但 AI 圈最知名的卡皮巴拉 IP 早就有主了。阿里通義千問 Qwen 的吉祥物就是卡皮巴拉,社區裡到處是卡皮巴拉頭像和周邊,品牌認知度拉滿。所以當 Mythos 的代號被曝光,社交媒體直接炸了。而全場最佳來自千問前技術負責人林俊暘親自現身評論區,只留了一句:「capybara? seriously?」兩家爭奪 AI 王座的公司,不約而同看上了同一隻呆頭呆腦的大囓齒目。2026 年 AI 圈最有喜劇張力的一幕,大概就是這了。最低級的配置錯誤扒了底褲最後聊聊這次洩露本身,因為它的荒誕程度值得單獨說。Anthropic 把原因歸結為「外部 CMS 工具中的人工配置錯誤」,同時特意強調跟 Claude、Cowork 或任何 AI 工具無關。後半句的急切耐人尋味:最近多家科技公司因 AI 生成程式碼引發技術事故頻頻上新聞,而 Anthropic 恰恰是那個最高調宣傳用 Claude Code 自動化內部流程的公司。「不是 AI 干的」,他們顯然覺得有必要把這句話說清楚。技術本質很簡單。劍橋研究員指出,CMS 系統中上傳的所有資產默認公開,除非手動設為私密。Anthropic 忘了點那個開關。和 AWS S3 儲存桶忘關權限一個性質的低級失誤,有充分文件記錄,完全可以預防。一家正在造有史以來最強網路安全 AI 的公司,被最基礎的權限配置疏忽扒了個精光。你很難想出比這更諷刺的劇本。同一批檔案裡還藏著一場閉門 CEO 峰會的細節:計畫在英國一處 18 世紀鄉間莊園酒店舉辦,Anthropic CEO Dario Amodei 將出席,對像是歐洲大型企業掌門人。一場精心策劃的高端商務社交,就這樣和產品草稿一起被晾在了陽光下。Anthropic 發言人的回應是:「這些只是考慮發佈的早期草稿,不涉及核心基礎設施、AI 系統、客戶資料或安全架構。」技術上沒錯。但當你的「早期草稿」裡白紙黑字寫著這個模型可能引發「AI 驅動的漏洞利用浪潮」,這就已經不是一次普通的內容洩露了。洩露本身的戲劇性是其次,關鍵在於它無意間撕開了一個行業一直在迴避的問題:當模型強大到連造它的人都需要先給自己買保險,我們到底該興奮還是該緊張?過去兩年,AI 公司的發佈節奏像軍備競賽,每家都在說自己更快更強更安全。但 Mythos 的洩露文件裡,罕見地出現了一種不同的語氣:「我們造出了一個自己都需要小心對待的東西」。有人會說,這不過是 Anthropic 的另一種行銷,用「太強了所以要謹慎」來製造稀缺感。也許吧。但如果你讀過那些草稿原文就會發現,那種措辭的份量不像是市場部能寫出來的。當一家公司在內部文件裡承認自己的產品「預示著一波 AI 驅動的漏洞利用浪潮」,這要麼是史上最大膽的行銷,要麼就是真話。而這一切,只是因為有人忘了在 CMS 後台點一個「設為私密」的按鈕。 (APPSO)
科技
#Claude
#Opus 4.6
#卡皮巴拉
讚
留言
分享
官方認證
RexAA
2026/03/27
•
剛剛,Anthropic王炸Claude洩露!全面碾壓Opus 4.6引爆全網
【新智元導讀】Opus之後,絕密Claude爆出!就在剛剛,頂配Claude Mythos全網洩露,被稱為有史以來「最強模型」,程式設計、推理全面超越。Anthropic一不小心,洩露了王炸!剛剛,《財富》獨家爆出——由於一次罕見的「人為配置」錯誤,最強大模型「Claude Mythos」絕密細節公之於眾。Claude Mythos代號「Capybara」,代表最高「層級」,是一款具有劃時代意義的全新模型。它不僅在程式設計、推理上,全面碾壓最強Claude Opus 4.6,更具備了強大的「網路攻擊」與「防禦能力」。參數規模或達10T內部測試顯示,Mythos將會帶來前所未有的安全風險。Anthropic至今按兵不動,是因為深知這頭「猛獸」一旦出籠,後果將無法預料。一時間,全網瞬間炸了!更多關於Mythos的爆料徹底刷屏。甚至,據傳未來幾周,Anthropic將通過Claude API對外開放Mythos。頂配Claude Mythos首次洩出全網炸鍋這件事的起因,讓人啼笑皆非。幾天前,網路安全公司LayerX Security和劍橋大學研究人員發現,Anthropic用於發佈官博的內容管理系統(CMS),因外部工具配置失誤結果導致——3000份原本應保密的內部檔案,暴露在公開可訪問的資料庫中。今天,《財富》意外檢索到了一篇博文草稿,爆出了Claude Mythos(Capybara)全新模型完成了訓練。而且, Anthropic至今未發,因為內部評估後太危險!眾所周知,Claude模型一共有三種杯型:Opus、Sonnet和Haiku。Capybara的定位是,一個比最強大的Opus體量更大、更智能,但也更昂貴的全新「頂配等級」。在官方撤下之前,網友M1及時將原文做了一個存檔。草稿部落格中,每一句話的含金量極高——與我們之前最好的模型Claude Opus 4.6相比,Capybara在軟體編碼、學術推理,以及網路安全等各項測試中的得分大幅提升。Claude Mythos是一款遠超以往、我們迄今開發過的最強大的AI模型。Claude 4.6 Opus的實力已無需贅言,但Mythos的出現,才是真正意義上的「終結者」。這種等級的跨越,遠比參數的增長更令人震撼。Anthropic自己都怕了,不敢放出!不過,Claude Mythos的極致性能,也帶來了極致的危險。Anthropic在草稿部落格中警示,新模型將會帶來巨大的「網路安全」風險。在網路攻擊上,Mythos遙遙領先於全球任何一款模型。因此,它極有可能被駭客用於發起大規模、破壞力極強的網路攻擊。其手段將遠遠超出防禦人員的應對能力。換句話說,Anthropic擔心駭客會利用Mythos發起大規模的網路攻擊,所以至今不敢發佈。部落格草稿中表示,正是因為存在這種風險,該模型發佈計畫的重點才會放在網路防禦者身上。我們將率先向相關機構開放搶先體驗權,讓他們能夠搶佔先機,在即將到來的一波由AI驅動的漏洞利用浪潮中,率先提高自家程式碼庫的穩健性。更多爆料:獨家高管閉門會除了新模型,洩露的PDF檔案還意外曝光了Anthropic的一項絕密商務行程:Dario Amodei即將前往英國一處18世紀莊園改造的豪華酒店,舉辦一場僅限受邀者參加的頂級CEO閉門峰會。這場針對歐洲最具影響力商業領袖的聚會,將潛在的巨頭客戶展示「Claude尚未發佈的神秘能力」。對此此次洩露,Anthropic承認,使用的一個外部CMS工具出了問題,導致草稿內容被曝光。洩露的許多檔案似乎是過去部落格文章用剩或廢棄的素材,比如圖片、橫幅和 logo。然而,有幾份檔案顯然是私密或內部文件。例如,其中一份檔案的標題就是在描述某位員工的「育兒假」。目前,Anthropic已緊急封鎖了該資料檢索通道,並承認了這場由「人為錯誤」引發的公關災難。 (新智元)
科技
#Anthropic
#Claude
#Opus 4.6
讚
留言
分享
官方認證
RexAA
2026/02/21
•
Google殺瘋了Gemini 3 推理模式封神,碾壓 GPT-5.2,科研工程界迎終極神器
2026 年 AI 科研賽道再迎王炸!Google官宣 Gemini 3 Deep Think 推理模式重磅升級,劍指科學研究與工程落地的複雜難題,多項基準測試成績直接刷新全球紀錄,不僅碾壓 GPT-5.2、Claude Opus 4.6 等競品,更達到世界頂尖程式設計師、奧賽金牌級水平。更重磅的是,Google首次開放該模式 API 早期訪問,科研人和工程師的效率天花板,直接被重新定義!實測封神!全維度霸榜,多項成績碾壓主流大模型此次升級的 Gemini 3 Deep Think,最硬核的底氣就是實打實的測試成績,在數學、物理、程式設計、抽象推理等全維度高難度基準測試中,實現全面霸榜,無工具加持下的表現堪稱驚豔。在抽象推理核心測試 ARC-AGI-2 中,它拿下 84.6% 的超高正確率,遠超 Claude Opus 4.6 的 68.8% 和 GPT-5.2 的 52.9%,成績直接斷層領先。“終極人類考試” 中,48.4% 的得分也甩開 Claude 的 40.0%、GPT-5.2 的 34.5%,盡顯高階推理實力。程式設計領域更是直接封神,Codeforces 競賽程式設計基準中斬獲 3455 的 Elo 評分,遠超 Gemini 3 原版的 2512 和 Claude 的 2352,達到世界頂尖程式設計師水準。而在 2025 年國際奧賽中,數學、物理、化學理論測試均拿下金牌級成績,物理更是達到 87.7% 的正確率,把 GPT-5.2 的 70.5% 遠遠甩在身後。就連多模態理解、凝聚態物理理論等偏門高難領域,它也表現亮眼,MMMU-Pro 測試 81.5% 正確率、CMT-Benchmark 50.5% 得分,均大幅領先主流競品,真正實現了 “文理通吃、科工全能”。直擊痛點!專為科研工程而生,破解真實場景難題Google此次升級並非單純的參數堆砌,而是精準瞄準科研和工程場景的核心痛點 —— 真實工作中資料雜亂、問題邊界模糊、需要長鏈路邏輯推理,而 Deep Think 就是為解決這些問題量身打造。它摒棄了大模型常見的 “表面化推理”,擁有更深度的邏輯鏈分析能力,能處理科研中複雜的因果推導、工程裡精密的流程最佳化。Google已展示其實際應用價值:協助數學家快速發現論文中的邏輯漏洞,從繁雜的公式推導中定位問題;助力工程師最佳化半導體晶體生長工藝,通過多維度資料分析找到工藝提升的關鍵節點。不同於普通大模型只能做 “輔助性文案工作”,Deep Think 能真正深度參與科研和工程的核心環節,從理論分析到實際落地,提供可落地、可驗證的解決方案,讓 AI 從 “工具” 變成真正的 “科研夥伴”。重磅開放!API 解鎖,兩類使用者率先嘗鮮在成績亮眼、應用落地的雙重加持下,Google此次也邁出了關鍵一步 —— 打破封閉,首次開放 Gemini 3 Deep Think 的使用權限,讓頂尖 AI 能力走出實驗室,真正服務於科研和產業界。目前該模式已面向Google AI Ultra 訂閱使用者全面開放,這類使用者可直接體驗全功能的深度推理能力。更值得關注的是,Google首次通過Gemini API,向部分研究人員、工程師及企業提供早期存取權,這意味著相關從業者可將該模型接入自有系統、科研平台,實現定製化的深度應用。從以往的 “專屬封閉” 到如今的 “有限開放”,Google的這一動作,也讓全球科研和工程界看到了頂尖 AI 技術普惠的可能,未來無論是高校的基礎研究,還是企業的工程落地,都有望借助這一工具實現效率躍升。行業震動!AI 科研工具迎來新拐點,競爭再升級Gemini 3 Deep Think 的升級與開放,不僅讓科研人和工程師迎來 “效率神器”,更在全球 AI 行業引發連鎖震動,讓大模型的競爭從 “通用能力比拚” 轉向 “專業場景深耕”。此前,主流大模型更多聚焦於通用對話、內容生成,在專業科研工程領域的表現始終差強人意,而Google此次精準卡位高難度專業場景,用實打實的成績證明了大模型在硬核領域的落地價值。這也給其他 AI 廠商指明了方向:單純的參數競賽已無意義,能解決真實專業問題的模型,才擁有真正的核心競爭力。對於科研和工程界而言,這一升級更是一場效率革命 —— 以往需要團隊數天甚至數月的邏輯推導、工藝最佳化、程式碼編寫,如今借助 Deep Think 可能幾小時就能完成,大大縮短了研究和開發周期。而隨著 API 的逐步開放,未來還將催生更多基於該模型的專業工具,推動科研和工程領域的智能化升級。從全維度霸榜的測試成績,到直擊痛點的場景落地,再到打破封閉的 API 開放,Google Gemini 3 Deep Think 的此次升級,每一步都踩在了 AI 行業的核心發展點上。它不僅展現了Google在大模型領域的技術領先,更讓我們看到了 AI 賦能硬核科研、推動產業升級的無限可能。隨著頂尖 AI 技術的逐步普惠,科研和工程的智能化時代,已然加速到來! (硬核科技喵)
科技
#Google
#Gemini 3
#GPT-5.2
讚
留言
分享
官方認證
RexAA
2026/02/06
•
Claude Opus 4.6殺死程式設計比賽!挖出500個day0漏洞,生成k線成交量分佈,還有PPT直出
凌晨突襲,Opus 4.6多場景性能領先GPT-5.2。智東西2月6日報導,今天凌晨,Anthropic正式發佈旗艦模型Claude Opus 4.6,是Anthropic首款開啟100萬token上下文窗口測試功能的旗艦級模型。Opus 4.6具備更縝密的規劃能力,能維持更長時間的智能體任務執行,可以在龐大程式碼庫中穩定運行,並能夠進行自我糾錯。在基準測試中,Opus 4.6在智能體程式設計評估Terminal-Bench 2.0中獲得最高分,於綜合性多學科推理測試Humanity's Last Exam中也坐穩了第一名的寶座。針對金融、法律等經濟價值領域的GDPval-AA評估中,Opus 4.6也是第一,並較第二名的GPT-5.2拉開約144個Elo分差,較前代版本Claude Opus 4.5提升了190分。就在Opus 4.6發佈後幾分鐘,OpenAI把GPT-5.3-Codex也搬了出來“正面硬剛”。截至台北時間2月6日11點,X平台上有關“Claude VS Codex”的話題下已有4.1萬條討論。Varick Agent的CEO“vas”發帖稱:“Claude 4.6 Opus僅用一次呼叫就重構了我的整個程式碼庫。25次工具呼叫,新增3000多行程式碼,建立了12個全新檔案。它模組化了所有內容,拆解了單體架構,理順了混亂的邏輯。結果沒一個能運行,但重構後的程式碼,實在是美得驚人。”有網友展示出他用Opus 4.6一次性做出的k線成交量分佈表。評論區紛紛感嘆:這要是真的,那一切都結束了。在話題討論中,有不少網友都自發測評了Opus 4.6與GPT-5.3 Codex這兩款模型,還曬出了測試Agent在複雜現實世界任務中的表現的Terminal-Bench,結果顯示GPT-5.3 Codex比Opus 4.6領先了11.9%。在網友的測評中,在程式設計方面GPT-5.3 Codex獲得的好評似乎更多。有網友發出對比:“Opus 4.6有100萬上下文+企業/知識工作+發現500個零日漏洞+Claude程式碼中的Agent叢集-基準測試成績不如Codex 5.3;而gpt-5.3-codex有程式碼基準測試勝出+速度更快+任務中轉向,但上下文窗口不到Opus的一半。”還有網友放出了更直觀的性能對比圖:價格上,在200K上下文以內(包括200K),Opus 4.6輸入每百萬token的價格為5美元(約合人民幣34.69元),輸出每百萬token的價格為25美元(約合人民幣173.45元);超過200K上下文,Opus 4.6輸入每百萬token的價格為10美元(約合人民幣69.38元),輸出每百萬token的價格為37.5美元(約合人民幣260.18元)。此外,Anthropic還將向Pro與Max使用者限時贈送價值50美元(約合人民幣346.9元)的額外使用額度,不適用於Team版、企業版及API/控制台使用者。使用額外額度的使用者需同時滿足以下兩個條件:1、已於2026年2月4日(太平洋時間)晚11:59前開通Pro或Max訂閱;2、在2026年2月16日(太平洋時間)晚11:59前啟用額外用量功能。Claude Opus 4.6即日起在claude.ai官網、API介面及所有主流雲平台同步上線。開發者可通過Claude API呼叫claude-opus-4-6模型。01. “大海撈針”測試得分76% 緩解“上下文衰減”問題在多語言程式設計測試SWE-bench Multilingual中,Opus 4.6的成績較Opus 4.5提升1.6分;在網路安全漏洞復現測試CyberGym中,Opus 4.6獲得66.6分,較Opus 4.5提升15.6分,是Sonnet 4.5分數的兩倍多。Opus 4.6在長文字連貫性測試Vending-Bench 2中以 8017.59 的分數大幅領先,在計算生物學BioPipelineBench測試中也以53.1分的成績位居第一。Opus 4.6在從海量文件中檢索相關資訊方面能力較上一代有所提升。這一優勢延伸至長上下文任務,它能在處理數十萬token時更穩定地保持和追蹤資訊,減少資訊漂移,並能捕捉到可能遺漏的深層細節。Anthropic團隊在部落格中稱,使用者常抱怨AI模型存在“上下文衰減”問題——即對話超過一定token數量後性能會下降。對此,研究團隊對Opus 4.6進行了MRCR v2的“8針-100萬”變體測試,這是類似於一種在浩瀚文字中檢索隱藏資訊的“大海撈針”式基準測試。在這個測試中Opus 4.6得分達76%,而Sonnet 4.5僅得18.5%。Opus 4.6的綜合基準測試如下圖所示。總而言之,Opus 4.6在長上下文中尋找資訊更精準,吸收資訊後的推理能力更強。02. 行為失范率極低 新增六類網路安全探測工具智能水平的飛躍並未以犧牲安全性為代價。在Anthropic的自動化行為審計中,Opus 4.6的行為失范率極低,行為失范包括欺騙、奉承、助長使用者妄想以及配合濫用等情形。其安全對齊程度與前代旗艦模型,即迄今為止對齊度最高的Claude Opus 4.5保持同等水準。值得注意的是,Opus 4.6在所有近期Claude模型中展現出最低的過度拒絕率,即模型未能回應良性查詢的情況。在部落格中,Anthropic團隊透露,針對Opus 4.6,他們開展了迄今最全面的安全評估體系,首次應用多項全新測試方法並對既有評估方案進行升級。Anthropic團隊新增了使用者福祉評估、更複雜的危險請求拒答能力測試,並更新了模型隱蔽執行有害行為的評估標準。同時,其運用可解釋性科學的新方法進行實驗,開始探究模型特定行為背後的成因,以期發現標準測試可能遺漏的問題。針對Opus 4.6在特定領域可能被危險利用的突出能力,研究團隊同步部署了新的防護機制。尤其鑑於該模型顯著增強的網路安全能力,他們開發了6種新型網路安全探測工具以幫助追蹤不同形式的潛在濫用行為。同時,Anthropic也在加速推進Opus 4.6在網路防禦領域的應用,通過其協助發現並修復開放原始碼軟體漏洞。他們認為網路防禦者利用Claude這類AI模型來平衡攻防態勢至關重要。網路安全領域發展迅速,Anthropic將根據對潛在威脅的認知持續調整和更新防護措施,近期其可能啟動即時干預機制以阻斷濫用行為。03. API新增自適應思考功能 Claude Code現可多智能體平行通過API介面,開發者們還可以獲取到更精細的模型算力控制方案,並為長期運行的智能體任務帶來更高靈活性。具體新增以下功能:1、自適應思考:此前開發者僅能在啟用或停用深度思考模式間二選一。現在通過自適應思考功能,Claude可自主判斷何時需要深度推理。在默認算力等級(高)下,模型會在必要時啟動深度思考,開發者也可通過調整算力等級來改變其觸發頻率。2、算力調控:現提供四個可調節的算力等級:低、中、高(默認)、極致。3、上下文壓縮(測試版):長程對話與智能體任務常觸及上下文窗口限制。當對話接近可配置閾值時,上下文壓縮功能將自動總結並替換早期對話內容,使Claude能夠執行更長任務而不受限制。4、100萬token上下文(測試版):當提示內容超過20萬token時,將適用高級定價。5、128k輸出token:Opus 4.6支援最高128k token的輸出長度,使Claude能完整處理需要大規模輸出的任務,無需拆分為多次請求。6、美國境內推理:對於需要在美國境內運行的工作負載,可選擇美國專屬推理服務,定價為標準token費用的1.1倍。在Claude與Claude Code平台,Anthropic新增了多項功能:Claude Code中新增智能體團隊的研究預覽功能。現在使用者可以啟動多個平行工作的智能體,它們將自主協同配合,特別適用於程式碼庫審查這類可拆分為獨立、重讀取的子任務。在與常用辦公工具的協作體驗方面,Claude Excel整合版現在能夠處理長時程與高難度任務,支援先規劃後執行、自主解析非結構化資料並推斷正確格式,還能單次完成多步驟修改。Excel整合版還能搭配PowerPoint整合版使用,使用者可先在Excel中處理並結構化資料,再通過PowerPoint實現可視化呈現。PowerPoint整合功能現已面向Max、Team及企業版使用者開放研究預覽。04. 放手兩千次會話 智能體團隊“煉”出十萬行C編譯器Anthropic官方還給出了一個開發者使用平行Claude智能體團隊建構C語言編譯器的案例。在這個案例中,開發者指派Opus 4.6率領智能體團隊建構一個C語言編譯器,隨後便基本放手任其運行,僅用兩周,就完成了一個小團隊一個月的工作。在為期兩周、近2000次Claude Code會話中,Opus 4.6消耗了20億個輸入token並生成1.4億個輸出token,總成本略低於2萬美元(約合人民幣13.88萬元),這個成本僅相當於開發者個人獨立完成所需投入的零頭。最終Opus 4.6做出了一個有著10萬行程式碼規模的編譯器,並且是淨室實現,即開發全程Claude無網路存取權,僅依賴Rust標準庫。這個編譯器能在x86、ARM和RISC-V架構上建構可啟動的Linux 6.9核心,還能編譯QEMU、FFmpeg、SQLite、PostgreSQL、Redis等大型項目。該編譯器在包括GCC torture測試套件在內的大多數編譯器測試中達到99%通過率,甚至通過了編譯器、作業系統等底層技術的 “終極測試”:成功編譯並運行第一人稱射擊遊戲《Doom》。經過多輪實踐,開發者總結出了協調多個Claude高效協作的四大核心方法:1、改進測試框架:在項目後期,Claude每次實現新功能時都會頻繁破壞現有功能。為此開發者建構了持續整合流水線,實施更嚴格的檢查機制,讓Claude能更好地測試自身工作,確保新提交不會破壞現有程式碼。2、站在Claude的視角設計適配環境:每個智能體都啟動於無上下文的新容器中,會花費大量時間自我定位,尤其在大型項目中。甚至在運行測試前,為幫助Claude自助,開發者需要在說明中要求維護詳細的README文件和進度檔案,並需頻繁更新當前狀態。3、簡化平行機制:當存在多個獨立失敗的測試時,平行化輕而易舉,但當智能體開始編譯Linux核心時卻陷入困境。與包含數百個獨立測試的套件不同,編譯Linux核心是單項巨型任務,所有智能體都會遇到相同的bug,修復後卻互相覆蓋修改,運行16個智能體也不行,因為它們都卡在解決同一問題上。為此,開發者編寫了新測試框架,將GCC作為線上驗證編譯器進行比對。這讓每個智能體都能平行工作,在不同檔案中修復不同bug,直至Claude的編譯器最終能編譯所有檔案。4、多元智能體角色分工:LLM編寫的程式碼常重複實現現有功能,因此開發者指派了一個智能體專門合併發現的重複程式碼。另一個負責最佳化編譯器本身的性能,第三個則專攻輸出高效的編譯程式碼,還讓一個智能體以Rust開發者視角批判項目設計並進行結構性改進,另設智能體專注文件工作。開發者稱,該成果已經逼近Opus的能力邊界,但仍有需要提升的方面:1、16位x86編譯器缺失:缺乏從真實模式啟動Linux必需的16位x86編譯器,該環節需呼叫GCC(x86_32和x86_64編譯器為自主實現);2、彙編器與連結器不完善:這兩部分是Claude最後開始自動化的模組,目前仍存在較多缺陷。演示視訊中使用的是GCC彙編器與連結器;3、相容性未達全替代標準:雖能成功建構眾多項目,但尚不能完全替代真實編譯器;4、程式碼生成效率偏低:即使啟用所有最佳化選項,其輸出程式碼效率仍低於停用最佳化的GCC;5、Rust程式碼質量有限:程式碼質量尚可,但遠未達到專業Rust程式設計師的水準。05. 結語:Anthropic在安全性上下了狠功夫Opus 4.6在長上下文理解、複雜推理與智能體協作等方面的性能提升,為企業級高密度、長周期任務提供了新的解決方案。同時,在Anthropic的部落格中,他們用了很大篇幅來寫新模型的安全性。Anthropic通過增強安全評估體系與部署主動防護機制,展現出對AI風險治理的前置性投入。 (智東西)
科技
#Anthropic
#Claude Opus 4.6
#規劃能力
讚
留言
分享