#Scaling法則
昨天 18:06
•
OpenAI Astra核心架構爆出:大模型第三條Scaling法則誕生
除了A廠的fable5.1發佈以外,“recurrent depth”(中文常譯為“循環深度”或“循環Transformer”)技術爆火出圈。這是一個極其強大的技術但是也是LLM徹底走向黑盒危險的技術! 導火線是The Information記者Stephanie Palazzolo的爆料:OpenAI即將推出的Astra模型採用了名為“recurrent depth”的新推理方法。該技術有助於降低成本、提升性能,但會讓模型的思考過程更難被監控,從而引發AI安全與可觀測性擔憂。 OpenAI尚未公開確認架構細節。其首席科學家Jakub Pachocki隨後發帖澄清,試圖避免“因混亂報導引發不可監控競賽”,並強調當前前沿模型(包括Astra)的計算圖深度最多約為GPT-4的兩倍,鏈式思維(Chain-of-Thought, CoT)監控仍是核心研究重點。儘管如此,討論已覆蓋技術原理、效率優勢與安全風險。 很巧的是字節和清華竟然今天也上線了一篇相關論文:
科技