字節在大模型上的第一場翻身仗
2025年底,在一次模型團隊的聚餐上,Seedance模型的負責人曾妍向leader提到,她還是想試試訓一個更大尺寸的模型,至少達到200B(2000億參數)。
曾妍是字節Seed一位非常年輕的研究員,2021年校招生,研究方向始終聚焦在視訊理解與生成上。“她一直都挺有自己的技術判斷。”一位與曾妍打過交道的人告訴36氪,“而且很主動,對於相信的事情比較堅持,會想辦法爭取資源去實現。”
這個評價幾乎復現了曾妍做Seedance2.0訓練時的處境。“她想訓一個參數量更大的模型,但當時團隊內部有一些分歧,有人覺得把模型直接scale up到200B-300B的等級有點冒進了,並且整體的訓練資源也緊張,可能先訓一個100B等級的模型技更安全。”一位知情人士告訴36氪。