#WeLM
2026/07/24
•
把思考折疊進序列:WeLM 617B MoE的隱式Scaling路徑
大模型變強,過去靠兩條路。 做大——Scaling Law出現後,參數從百億推向千億,算力支出一路飆升。 想久——o1帶火思考模型,用更長的思維鏈、更多推理時間換結果。 問題是,除了Scaling參數和思維鏈之外,到底有沒有第三條路?
科技