4小時、118個回答、74億美元融資。梁文鋒把DeepSeek的家底全攤開了。但最值得讀的不是融資數字,是他的思考方式。
昨天,騰訊科技發佈了DeepSeek創始人梁文鋒在投資者交流會上的4小時發言實錄,118條,資訊密度極高。
同一天,DeepSeek V4正式版開始灰度測試,"驗貨口訣"是靠思維鏈的第一人稱來分辨模型版本。
再往前推一周,Kimi K3發佈,美股AI類股三天蒸發4700億美元——這是繼2025年1月DeepSeek R1引發輝達單日暴跌16.86%之後,中國AI第二次讓華爾街"地震"。
從"中國AI落後兩三年"到"差距可能只剩兩三個月",這一切的起點,是一群被梁文鋒稱為"非常平凡的人"。
"我們就是一群非常平凡的人"
梁文鋒在第6條說了這樣一段話:
> "我們並沒有什麼武器,起點又非常低,資源又非常少,我們就是一群隨機的人,本質上是一群非常平凡的人。"
這不是謙虛。
2023年DeepSeek剛成立時:沒錢——不像矽谷動輒數十億美元融資;沒卡——晶片禁令下高端GPU買不到;沒人——不是清華姚班、不是史丹佛PhD扎堆;沒名氣——在中國AI"六小虎"的格局中都不靠前。
但三年後,他們做的事:
- 2024年1月,R1發佈。純強化學習訓練出的推理模型,性能比肩OpenAI o1,成本只有後者的約2%。輝達股價單日暴跌16.86%,蒸發5888億美元。著名投資人馬克·安德森稱之為"斯普特尼克時刻"。
- 2025年7月,V4正式版灰度。性能達到Opus等級,價格是對方的七分之一。Nature封面論文,梁文鋒被評為"2025十大科學人物"。
- 2026年7月,完成74億美元首輪融資,投前估值543億美元。
一個資源極其有限的團隊,怎麼做到的?
答案藏在他的思考方式裡。
第一性原理:把LLM一層層拆開看
梁文鋒在第18條說了一句被很多人掠過的話:
> "AI的發展是一個階梯。去年走的階梯是思維鏈。因為我們發現,通過思維鏈的方式,可以讓智能達到一個更高的水平。"
這句話的關鍵詞不是"思維鏈"——是"我們發現了"。
他不是在追熱點。他是在問一個更根本的問題:"這個LLM,每一層到底在消費什麼?能不能換個姿勢消費?"
把這個問題作用於LLM的不同層,就得到了DeepSeek最著名的三板斧:
第一板斧:MLA(多頭潛在注意力)——砍在注意力層
Transformer的注意力機制需要記憶體三個大矩陣(K、Q、V)。每生成一個token,都要查所有之前token的K和V。長文字 = 海量K和V要存 = 視訊記憶體爆炸。
梁文鋒問:能不能不存完整的K和V?
答:把K和V壓縮到一個低維潛在空間。視訊記憶體佔用砍到傳統架構的5%-13%。同樣是推理,DeepSeek需要的視訊記憶體只有別人的十分之一。
第二板斧:DeepSeekMoE(稀疏混合專家)——砍在架構層
Transformer的前饋網路(FFN)是參數最密集的部分。標準做法是每個token啟動全部參數——參數量越大,計算量越大。
梁文鋒問:每個token真的需要啟動所有參數嗎?
答:不需要。把FFN拆成很多個"專家",每個token只啟動最相關的一小部分。總參數可以很大——但每次推理只喚醒一小部分專家。計算量斷崖式下降。
第三板斧:R1-Zero(純RL自進化)——砍在訓練層
傳統的SFT(監督微調)需要海量人工標註資料——讓人類寫出"推理步驟",喂給模型學。貴、慢、不可擴展。
梁文鋒問:模型能不能自己學會推理,不需要人類標註每一步?
答:純強化學習。只告訴模型"答案對不對",讓它自己摸索推理過程。結果出乎所有人預料——模型自己湧現了CoT推理、自我糾錯、回溯。那個著名的"aha moment":模型推理到一半發現不對,自己回頭重來。
這三板斧,沒有一個是"發明"。MLA不是新的、MoE不是新的、RL不是新的。 DeepSeek沒有發明任何一項底層技術。
他們做的事情是:在所有人都在往前狂奔的方向上,停下來看了每一層,然後問了一個大家都沒問的問題。
這就是第一性原理。
"克制是一種戰略"
梁文鋒在第7條說:
> "你越克制,可能就越容易做成。"
第11條又說:
> "克制是一種戰略。有時候你可以捨棄一些,來換更多其他的東西。"
第79條是整場最狠的一句:
> "拿得多的人會被拿得少的人打敗。甚至你還不用真的拿得多,願景如果是拿得多的話,你就會被願景是拿得少的人給打敗。"
三句話串在一起,就是DeepSeek的戰略邏輯:
- 不追熱點:視訊生成火了不做,3D火了不做。"我們只會因為它是智能路線圖上的東西,才會去做。"
- 不搶使用者:"去年春節使用者突然很多,我們並沒有追求留使用者、變現。"
- 不追求暴利:API定價"十個月收回成本",比利潤最大化的定價低了四分之三。
- 開源最強模型:"我看不到閉源什麼好處。"
- 不樹敵:"不願意跟任何一家大廠或小廠成為對手。我希望能夠給他賦能。"
這些看起來是"不爭不搶",但梁文鋒的邏輯是反過來的:正因為AI的蛋糕足夠大,你越不去想怎麼分蛋糕,越容易把蛋糕做大。 所有精力都放在"把事情做成"上,而不是"我能拿多少"上。
結果呢?第14條:
> "我們並沒有因為我開源、因為我們的善意、因為我對其他人提供幫助,而導致我們少拿了任何東西。反而可能還有加分。這個看起來違反直覺,但它確實是這樣的。"
最被低估的一條:第46條
在118條裡,第46條很短,但我認為它是理解DeepSeek管理哲學的核心:
> "我們公司的管理是兩條線:一條從上到下,一條從下到上。從下而上,就是每個人自己想做什麼,自己做,沒有人管他,沒有KPI。"
第47條:
> "我們希望員工還有一半的時間是不被安排的,他想做什麼就做什麼。"
第48條:
> "做研究需要一個比較鬆弛的環境。你如果逼得很緊,就沒法做研究。"
第50條:
> "我在公司內的權威是建立在共識的基礎上的。不是我一個人決定所有事情。"
沒有KPI、一半時間自由探索、不加班、決策靠共識。 這不是矽谷式的"福利多",這是梁文鋒對"創新到底怎麼發生"的根本理解:創新不是逼出來的,是在鬆弛和自由中湧現的。
這也解釋了他們為什麼能做原創式創新——"中國AI和美國有一兩年差距,但真實的差距是原創和模仿之差。如果這個不改變,中國永遠只能是追隨者。"
"資料幾乎等於模型的一半"
第106條,梁文鋒說了句實在話:
> "資料應該幾乎就等於模型的一半。"
第107條:
> "高品質資料標註太貴了,中國沒有成本優勢。"
第109條:
> "現在我們公司有一半的人在標資料。有一半的核心研究員,最重要的人,有一半在標資料。"
一半的頂尖研究員在做資料標註。 這句話透露了DeepSeek對資料的真實態度:資料不是"喂給模型的原料",資料本身就是核心競爭力。
這也能反推他們的策略:為什麼MoE架構要大幅降低計算成本?因為省下來的算力要用來處理更多的資料。為什麼R1-Zero要用RL自生成推理?因為高品質推理資料的標註不是找普通標註員——是需要博士級研究員一條條寫的,中國人力成本再低在這一層也沒有優勢。與其花錢標,不如讓模型自己生成。
DeepSeek的整個技術路線,都可以從"資料是核心競爭力"這個原點推匯出來。
從DeepSeek看我們自己
讀完118條,最大的感受不是"他們好厲害"——是"他們好清醒"。
在一個所有人都在比參數、比算力、比融資額的時代,有一群人問了一個更簡單的問題:這個東西的底層原理到底是什麼?每一層在消費什麼?能不能換個姿勢?
然後他們花三年時間,一層一層地打開,一層一層地換了姿勢。結果是用OpenAI七十分之一的成本,做到了接近的水平。
梁文鋒的原話是:
> "我們只做AGI的主線。"(第25條)
> "只做一塊。AI時代會產生很多家兆等級的公司,我覺得我們是其中一家。"(第117條)
> "你越克制,可能就越容易做成。"(第7條)
這三句話,比任何技術分析都更準確地描述了DeepSeek的核心競爭力:不是技術,是思考方式。不是資源,是聚焦。不是激進,是克制。 (硅己智能)
