登入
關鍵字
#模型訓練
官方認證
北風窗
2026/09/21
•
小米「直播煉丹」火了!把大模型訓練後台全公開,一小時燒掉20萬
眾所周知,雷軍很喜歡直播。 不管是新品發佈會,還是平時和米粉聊天,都習慣一邊開播一邊聊。 有趣的是,小雷發現現在小米AI團隊負責人羅福莉,也玩起了直播。 圖源:X
港股
#小米
#大模型訓練
#羅福莉
1 則留言
讚
留言
分享
百貓爭鳴
MiMo 2.5 Pro 一直都客滿速度很慢... 只好換別家
2026/09/21
讚
回覆
官方認證
美股艾大叔
2026/09/14
•
美股半導體暗盤集體下挫,如何看待Anthropic的放緩觀點?
Anthropic CEO的觀點大家應該都看到了,主張放慢前沿 AI 的能力提升速度,讓安全測試、運行監控和第三方評估有時間跟上。這裡的“放慢”並不是停止訓練模型,而是希望模型能力的增長不要超過安全體系的承受能力。 隨後,Sam Altman 和 Elon Musk 很快表示支援,Google DeepMind 負責人 Demis Hassabis 也認為這個方向值得推進。Sam 還承諾,OpenAI 會像 Anthropic 一樣,引入具有員工級存取權的外部評估者。 但這也導致了市場的看空觀點。 為什麼Dario要發表這樣的言論?
科技
#Anthropic
#AI安全
#中美AI競爭
讚
留言
分享
官方認證
RexAA
2026/06/23
•
又一大模型發佈!號稱比肩Fable 5和Mythos
Sakana AI提出大模型訓練新思路。 智東西6月22日報導,今天,日本AI獨角獸Sakana AI發佈了Sakana Fugu系列編排器模型,包括Fugu Ultra和Fugu兩款模型。其中Fugu Ultra模型在工程、科學和推理基準測試中,性能接近或超越了Fable 5以及Mythos Preview等頂尖模型。 和傳統大語言模型不同的是,Sakana Fugu不會自己回答問題,它會呼叫世界上各種模型來完成任務。簡單來說,Sakana Fugu像一個“總指揮”,會根據任務選擇最佳的模型來處理。 Fugu在日文中是河豚的意思,從官方發佈的動畫可以看出,Sakana Fugu是要用多個“小魚”匯聚成一個“大河豚”這種美味食材。
科技
#Sakana AI
#大模型訓練
讚
留言
分享
官方認證
RexAA
2026/06/09
•
AI 產業深度報告|大模型訓練推理最佳化部署最佳實踐,助力企業 AI 規模化落地
當前,生成式 AI 正由技術探索邁向產業深度應用,大模型訓練、微調、推理、部署全流程最佳化,已成為企業實現 AI 高效落地、提升核心競爭力的關鍵支撐。IDC 發佈《大模型訓練推理最佳化部署的最佳實踐》報告,基於行業實踐與技術演進趨勢,系統梳理大模型全生命周期關鍵最佳化技術,並結合產業真實案例,為企業提供系統、可落地的技術指引。 01. 生成式 AI 落地提速,市場需求持續攀升 生成式 AI 應用正從網際網路場景向金融、製造、醫療、能源、政府與公共事業等核心行業全面滲透,由單點試點轉向規模化部署。據 IDC 調研與預測: 2026 年近半數中國企業部署的生成式 AI 應用場景將達到 10 個以上,AI 智能體成為數位化轉型核心驅動力;
科技
#AI產業
#大模型訓練
#AI規模
讚
留言
分享
官方認證
RexAA
2026/06/05
•
大模型訓練推理最佳化部署最佳實踐,助力企業 AI 規模化落地
當前,生成式 AI 正由技術探索邁向產業深度應用,大模型訓練、微調、推理、部署全流程最佳化,已成為企業實現 AI 高效落地、提升核心競爭力的關鍵支撐。IDC 發佈《大模型訓練推理最佳化部署的最佳實踐》報告,基於行業實踐與技術演進趨勢,系統梳理大模型全生命周期關鍵最佳化技術,並結合產業真實案例,為企業提供系統、可落地的技術指引。 1 生成式 AI 落地提速,市場需求持續攀升 生成式 AI 應用正從網際網路場景向金融、製造、醫療、能源、政府與公共事業等核心行業全面滲透,由單點試點轉向規模化部署。據 IDC 調研與預測: ● 2026 年近半數中國企業部署的生成式 AI 應用場景將達到 10 個以上,AI 智能體成為數位化轉型核心驅動力;
科技
#AI
#大模型
#訓練推理
讚
留言
分享
官方認證
RexAA
2026/05/03
•
深扒GPT Image 2:疑似“吞”下了GPT-4o,OpenAI沒把它當“生圖”模型訓練
GPT Image 2 憑什麼這麼強?是擴散模型又迭代了一版?是把 DiT 的參數量從 7B 擴到 20B?是訓了更多高品質資料?這些答案都對,但都不夠。以下是我們與多位從業者交流後,提煉出的幾個值得關注的技術方向,並嘗試做出更清晰的解釋。先給結論:OpenAI 很可能已經不在“純擴散模型”這條主賽道上了。他們已經把圖像生成從“美術課”調到了“語文課”——用一個能讀懂指令、能記住上下文、能理解物體關係的 LLM 主導語義規劃,至於最後一步的像素生成,可能由擴散元件或其他解碼器完成。而這個LLM,極大可能是GPT-4o。支撐這個推論的,首先是兩條直接線索。1. 模型自述2. C2PA溯源驗證C2PA 是一種內容溯源標準,相當於給每張 AI 生成的圖打上一個數字身份證。任何人拿到這張圖,都能查到它是由 GPT Image 2 生成的、生成時間是什麼、經過了那些修改。有專業人士在metadata2go.com上對image 2生成的圖片進行中繼資料提取。發現在actions_software_agent_name一欄上記錄著GPT-4o。這也能理解為什麼這次image 2的表現驚人了。圖片源於: 【深入調查:OAI最新圖像模型底層是GPT-4o - 祈星函 | 小紅書 - 你的生活興趣社區】 https://www.xiaohongshu.com/discovery/item/69ea80200000000020003800?source=webshare&xhsshare=pc_web&xsec_token=CB9e0Yo8HLTCLA1XJWh0wUnT3SogJv370RfNnvUD6YFVY=&xsec_source=pc_share單憑這兩條當然不足以拆解全部秘密。但當我們帶著“LLM 主導”的假定回頭審視它的每一項能力躍遷時,這些變化,忽然有了統一的解釋。一、圖像語義,從像素到token1.1過去兩年,AI 生圖領域有一條不成文的鄙視鏈:Midjourney 負責美學,Stable Diffusion 負責可控性,DALL·E 負責……嗯,負責被 OpenAI 發佈。但不管你站那一隊,有一件事是所有人的共識——文字是 AI 的鬼門關。你能讓 AI 畫出逆光下緬因貓毛髮的半透明質感,卻無法讓它寫對招牌上的“Coffee”六個字母。一個能理解頂級光影描述的模型,在文字上給出的結果彷彿楔形文字。這件事的荒誕與根源,就藏在擴散模型的工作原理裡。先說擴散模型為什麼寫不好字?因為它的核心是一個從噪聲中還原圖像的“雕塑家”:訓練時,向清晰照片逐步撒噪聲,直到變成純電視雪花,模型學習逆向去噪。生成時,從一片隨機噪聲開始,每步都靠 U-Net 預測並擦除噪聲,幾十步迭代後“雕”出毛髮、虹膜和光影。這個過程本質上在還原連續的、可以用機率無限逼近的紋理。毛髮可以稍微硬一點或軟一點,顏色可以偏暖 5%,無傷大雅。但文字是離散符號,不存在“像不像”,只有“是不是”。字母 A 就是 A,你不能給它加 15% 的 B 和 8% 的 C 還指望它依然是 A。擴散模型的每一步去噪都是一個微小“估計”,用在紋理上是風格,用在文字上就是 O 變 0,或是拼出 WElcOm e。最終就成了外行眼中的“楔形文字”。不僅如此,擴散模型天然缺乏跨輪編輯的穩定一致性。你讓它改一個局部,它本質上是整張圖重新畫一遍,沒改動的地方也會悄悄漂移。但GPT Image 2現在不僅能“寫對字”,還能保持“有記憶”的一致性例如:你修改一個字之後,周圍的文字會自動調整間距;當你把“咖啡”改成“紅茶”,它不只是替換那個詞,而是連帶把杯子的顏色從深棕調成了琥珀色。這說明文字在它的系統裡不是圖層標註,而是畫面語義的一部分。文字內容的改動會像語言中的主語替換一樣,連鎖驅動畫面其他元素的合理變化。GPT Image 2 與其他模型對比圖1.2它不再把圖像當圖像看,而是把圖像當語言看。這聽起來像玄學,但其實是個很具體的工程選擇。要理解這件事,得先搞明白一個概念:Tokenizer。Tokenizer 的作用是把一種東西“翻譯”成另一種東西。GPT 處理文字前,會先把“你好”這個詞切碎編號,變成一個數字 ID,比如 [11892]。這是文字 token 化。圖像能不能也這麼幹?當然能。你把一張圖切成 16×16 的網格,每個格子編個號,也是一種 token 化。但這種做法太笨重——一張 1024×1024 的圖會變成幾千個 token,LLM 還沒開始畫就先被淹死了。所以過去兩年,各家大模型公司在拼一件事:怎麼把一張圖壓成儘量少的 token,同時還不丟關鍵資訊。這事有多難呢?想像你是一個情報員,要把《蒙娜麗莎》用一封電報發出去。電報局規定你最多隻能發 256 個字。你怎麼辦?你不能說“一個女人在笑”,因為對方畫不出來;你也不能逐個像素描述,因為字數不夠。你必鬚髮明一套只有你和對方懂的密語——“52號微笑、3號背景、17號手勢”——對方收到後能八九不離十地還原出來。這就是 OpenAI 在 tokenizer 上干的 事。從 CLIP 到 DALL·E 再到 GPT-4o,他們逐漸建構了一種能夠在視覺與語言之間進行對應的語義表示體系。這意味著:圖像和文字被投影到了同一個對齊後的語義 embedding 空間。現在在 LLM 眼裡,“一隻逆光的緬因貓”這行字,和一張逆光緬因貓的照片,是同一個語義空間裡的兩套坐標。它能像理解文字一樣理解圖像,也能像生成文字一樣生成圖像。所以當你說“把第三行公司名改成團夥名”,它不是在修圖軟體裡找那個圖層,而是在改寫一段描述這個畫面的密文。改完後,解碼器再把密文翻譯回像素。這就是為什麼文字突然能寫對了。因為對 LLM 來說,寫一個W和寫一個我,沒有任何本質區別——都是它在密語系統裡調整幾個 token 的事。1.3既然 GPT Image 2 很可能把圖像變成了語義密文,那這串密文怎麼變回一張能看的圖?如果直接把 token 對應成像素,畫質必然一塌糊塗,這是自回歸模型的通病:它極度擅長決定畫什麼,卻不太擅長畫得好看——就像建築系教授徒手畫效果圖,空間關係全對,筆觸就是不及美院學生。而擴散模型正好相反,紋理光影以假亂真,卻經常不知道自己在畫啥。因此,一個高度自洽的推測浮現:讓兩款模型打配合。自回歸負責定調:根據你的 prompt 生成那幾百個語義 token,敲定畫面裡有什麼、它們的位置關係、整體構圖邏輯。這一步決定了“聽得懂”,也保證了多輪編輯時對修改對象的記憶與一致性。擴散負責潤色:拿到這串語義 token 後,不再負責理解內容,只負責填充高保真像素,把既定框架變成光影自然的成圖。這一步決定了“畫得好”。這不是理論空想。Google 發過一篇叫 Transfusion 的論文,Meta 搞過 Chameleon,走的都是類似路線。當然,這一切都是基於公開資訊和模型表現的推斷。OpenAI 有沒有在用?2026 年 4 月的媒體會上,OpenAI 拒絕回答任何關於模型架構的問題。拒絕本身就是一個訊號。如果這個假設成立,那就解釋了一切——文字寫對是因為自回歸天然懂離散符號;多輪編輯一致是因為自回歸記住了那一串 token;畫質沒崩是因為擴散在最後一關做了精細渲染。二、資料飛輪,GPT-4o 自己教自己生圖2.1但上文那個能把圖像壓成幾百個 token 的“密語系統”,到底是怎麼訓出來的?為什麼不是別的模型,偏偏是GPT-4o?答案藏在一件看起來最沒有技術含量的事裡:資料標註。在 AI 圈,資料標註長期處於鄙視鏈底端。研究員聊架構可以聊一晚上,聊資料標註三句話就冷場。但 GPT Image 2 這次的表現,甚至表明OpenAI 可能已經不需要人工標註了。而GPT-4o 本身就是全世界最強的圖像理解模型之一。你給它一張圖,它能寫出一段比真人標註師還細膩的描述。所以OpenAI 可以把過去幾年積累的幾十億張圖片,重新“過一遍水”——用 GPT-4o 生成新的、高維度的標註。但到這裡,只解決了“描述”的問題,沒解決“篩選”的問題。一個模型生成一百張圖,並不是每一張都值得拿來當下一輪訓練的教材。這裡需要一套嚴格的“質檢”機制——在機器學習裡,這叫拒絕採樣。具體來說就是,GPT-4o 先根據一段 prompt 生成一批圖像,然後根據美學偏好、指令匹配度、物理合理性等多條標準,逐張打分。批到符合條件的才“收下”,連同它為自己撰寫的詳細解析,一起塞進下一輪訓練集。批到不及格的就直接扔掉。這保證飛輪裡的資料不是在低水平循環,而是在有選擇地自我提純。上一代模型給下一代模型當老師,下一代模型再給下下代當老師。每轉一圈,對世界的理解就深一層。大家的差距也在這個過程中越來越大。這也解釋了為什麼Midjourney在畫質上能和OpenAI掰手腕,但在指令遵循和文字渲染上被拉開代差。當然,聽上去像個永動機騙局——自己教自己,那不得越教越傻?學術界確實有這個擔憂,管它叫模型崩潰:模型反覆吃自己吐出來的東西,會逐漸丟失分佈的尾部資訊,生成結果越來越單一、越來越平庸。但OpenAI在文字側已經證明:只要老師模型足夠強,並且配合拒絕採樣這樣的嚴格篩選機制,這事不但不會崩,還能加速,形成資料飛輪。2.2這個飛輪裡還有一個重要且難搞的角色——RLHF 在圖像側的質檢員。我們在文字側已經習慣了 RLHF(Reinforcement Learning from Human Feedback,基於人類反饋的強化學習):給一段文字打分,判斷它有用、有趣、符合人類偏好,這件事 GPT-4o 做得很好。但在圖像側,難度驟升。因為質檢員需要同時盯住三條線:美學偏好;指令遵循;安全過濾。三條線的標準各不相同,甚至互相衝突。一道強光影可能很“好看”,但壓暗了 prompt 裡要求的某個細節,就會被“指令遵循”扣分。一層安全濾鏡可能誤傷正常的醫學解剖圖,又得回頭調閾值。這種多維度權衡,在文字側已經跑通,但在圖像側變得前所未有的複雜。而 OpenAI 之所以能做成,很可能是因為他們把圖像側的問題全部拉回了自己最擅長的戰場:語言理解。美學偏好被轉譯成一段構圖評語,指令遵循被轉譯成一組約束條件的核對清單,安全過濾被轉譯成一套規則判例。所有判斷最終都落到了 LLM 的語義空間裡。可能這才是資料飛輪真正的底牌。不是資料多,而是從標註、篩選到打分,全鏈路都被統一到了一個理解框架裡。拒絕採樣負責海選淘汰,RLHF 負責精修調優,兩者共享一套語義標準,飛輪才轉得起來。三、工程解法,兼顧推理速度和對話整合3.1到這裡,我們聊的都是效果。接下來聊一個經常被刻意繞開的話題:推理速度。先不說審美和一致性上的飛躍,且說一個看似矛盾的現象:生圖質量躍升了一個代際,但速度並沒有明顯變慢。這本身就是一種工程奇蹟——OpenAI 是怎麼做到的?自回歸模型的運作方式是逐 token 生成——每個 token 都依賴上一個 token 的完成。擴散模型則不同,它可以在整張畫布上平行去噪,一次處理所有像素。按理論推算,如果 GPT Image 2 確實用了自回歸架構,它的推理延遲應該比純擴散模型高出一個數量級。但實際體驗是:沒有。第一條線索:Token 壓縮率可能遠超預期。 如果一張 1024×1024 的圖只需要 256 個 token 就能完整描述,對 Transformer 來說就是一次呼吸的事。這意味著 OpenAI 不僅做到了語義對齊,更在壓縮率上做到了極致,把高資訊密度濃縮到幾行字的程度。第二條線索:推理架構的深度最佳化。 混合架構中,自回歸生成的是粗粒度的語義 token,決定“畫什麼”,不負責“畫成什麼樣”。生成步驟大幅縮短,擴散模型只用在最後一小段“按圖施工”,而不是從頭噪到尾。第三條線索:投機解碼(Speculative Decoding)可能被用到了圖像側。 用一個更小的“草稿模型”快速生成候選 token,再由大模型一次性驗證,這套 LLM 推理加速經典技巧如果用在圖像 token 上,速度可以成倍提升。OpenAI 在 GPT-4 時代已把這套玩熟,移植到圖像側沒有原理障礙。所以結論是:GPT Image 2 的快,不是因為擴散模型變快了,而是因為可能它把最慢的語義規劃,從擴散模型手裡搶了過來,交給了擅長快速推理的 LLM。3.2比速度更影響體驗的,是與對話系統的整合。在傳統圖像生成工具中,例如 Midjourney 或基於 Stable Diffusion 的工作流,使用者通常通過編寫 prompt 來控制輸出結果。雖然這些工具已經支援諸如variations、inpainting和歷史記錄等功能,但整體流程仍然以“單次輸入 → 單次輸出”為主,使用者需要通過多次嘗試逐步逼近目標效果。這種過程在實踐中往往表現為反覆試錯:使用者根據結果調整 prompt,但模型對指令的理解程度並不完全透明,因此需要多輪迭代來校正偏差。相比之下,整合在對話系統中的圖像生成引入了連續上下文機制,改變了互動方式。使用者可以在多輪對話中逐步細化需求模型能夠利用對話歷史理解“當前修改”對應的對象或屬性修改請求可以以更自然語言的形式表達,而不需要一次性寫出完整 prompt例如,在多輪互動中,使用者可以先生成一個基礎場景,再逐步提出局部修改(如顏色、位置、風格)。最後,模型基於上下文生成新的結果。對話式互動還帶來另一個優勢:需求澄清能力clarification。將模糊的自然語言意圖,逐步轉化為更具體的生成條件,從而提高生成結果與使用者預期之間的一致性。結語在 GPT Image 2 出現之前,AI 生圖領域的討論框架是這樣的:“擴散模型的縮放定律還能走多遠?”“DiT 架構和 UNet 架構誰更優?”“Flow Matching 會不會取代 DDPM?”“多模態對齊的損失函數怎麼設計?”這些問題都有價值,但它們共享一個隱含前提:圖像生成是一個獨立的、需要專門架構來解決的問題。而GPT Image 2 給出的的回答是:不一定。如果我們把鏡頭再拉遠一點,GPT Image 2 的出現其實指向了一個更大的命題:世界模型。讓我們重新思考什麼是生成,以及世界。 (矽星人)
科技
#GPT
#Image 2
#GPT-4o
讚
留言
分享
官方認證
RexAA
2025/11/11
•
用 460 萬美元追上 GPT-5?Kimi 團隊首次回應一切,楊植麟也來了
上周 Kimi K2 Thinking 發佈,開源模型打敗 OpenAI 和 Anthropic,讓它社交媒體捲起不小的聲浪,網友們都在說它厲害,我們也實測了一波,在智能體、程式碼和寫作能力上確實進步明顯。剛剛 Kimi 團隊,甚至創始人楊植麟也來了,他們在 Reddit 上舉辦了一場資訊量爆炸的 AMA(有問必答)活動。Kimi 團隊三位聯創,楊植麟、周昕宇、吳育昕參與回答面對社區的犀利提問,Kimi 不僅透露了下一代模型 K3 的線索、核心技術 KDA 的細節,還毫不避諱地談論了 460 萬的成本,以及與 OpenAI 在訓練成本、產品哲學上的巨大差異。460 萬美元這個數字不是官方的數字,具體的訓練成本很難量化到多少錢K3 什麼時候來,是看奧特曼的兆美中繼資料中心什麼時候建成K3 的技術將會繼續沿用,當前效果顯著的 KDA 注意力機制視覺模型還需要我們去採集更多的資料,但目前已經在做了……我們為你整理了這場 AMA 中最值得關注的幾個核心焦點,來看看這家現在算是國產開源老大的 AI 實驗室,是如何看待他們的模型,和未來 AI 的發展。叫板 OpenAI,「我們有自己的節奏」在這場 AMA 中,火藥味最足的部分,大概就是 Kimi 團隊對 OpenAI 的隔空回應。最大的噱頭之一:K3 什麼時候來?Kimi 團隊的回答非常巧妙:「在奧特曼的兆美中繼資料中心建成之前。」很明顯這一方面是幽默,因為沒有人知道 OpenAI 到底什麼時候才能建成那個資料中心,另一方面似乎也在回應外界對於 Kimi 能用更少資源追趕 GPT-5 的讚歎。當有網友貼臉開大,直接問 Kimi 怎麼看 OpenAI 要花這麼多錢在訓練上時,Kimi 坦言:「我們也不知道,只有奧特曼自己才知道」,並強硬地補充道,「我們有自己的方式和節奏。」這種自己的節奏,首先體現在產品哲學上。當被問到是否會像 OpenAI 一樣發佈 AI 瀏覽器時,團隊直言 No:我們不需要建立另一個 chromium 包裝器(瀏覽器套殼),來建構更好的模型。他們強調,目前的工作還是專注於模型訓練,能力的體現會通過大模型助手來完成。在訓練成本和硬體上,Kimi 也展現了精打細算的一面。社區好奇 K2 的訓練成本是否真的是傳聞中的 460 萬美元,Kimi 澄清了這個數字並不精準,但表示大部分的錢都是花在研究和實驗上,很難具體量化。至於硬體,Kimi 承認他們使用的是 H800 GPU 和 Infiniband,雖然「不如美國的頂級 GPU 好,而且數量上也不佔優勢」,但他們充分利用了每一張卡。模型的個性與 AI 的垃圾味一個好的模型,不僅要有智商,還要有個性。很多使用者喜歡 Kimi K2 Instruct 的風格,認為它「比較少的諂媚,同時又像散文一樣,有洞察力且獨特」。Kimi 解釋說,這是「預訓練(提供知識)+ 後訓練(增添風味)」共同作用的結果。不同的強化學習配方(即獎勵模型的不同選擇)會得到不同的風格,而他們也會有意的把模型設計為更不諂媚。大語言模型情商評估排名,圖片來源:https://eqbench.com/creative_writing.html但與此同時,也有使用者直言 Kimi K2 Thinking 的寫作風格太「AI Slop 垃圾」,無論寫什麼話題,風格都太過於積極和正面,導致讀起來 AI 味就是很重。他還舉例子說,要 Kimi 寫一些很暴力很對抗的內容時,它還是把整體的風格往積極正面那邊去靠近。Kimi 團隊的回答非常坦誠,他們承認這是大語言模型的常見問題,也提到現階段的強化學習,就是會刻意地放大這種風格。這種使用者體感與測試資料的矛盾,也體現在對 Benchmark(跑分)的質疑上。有網友尖銳地提問,Kimi K2 Thinking 是不是專門針對 HLE 等跑分進行了訓練,才會取得如此高分?畢竟這麼高的分數,好像和他實際使用中的智能不太匹配。對此,Kimi 團隊解釋說,他們在改進自主推理方面取得了一些微小的進展,這剛好讓 K2 Thinking 在 HLE 上得分很高。但他們也坦誠了努力的方向,要進一步提升通用能力,以便在更多實際應用場景中和跑分一樣聰明。網友還說,你看馬斯克的 Grok 因為做了很多 NSFW (非工作安全) 的工作,生成圖片和視訊;Kimi 完全可以利用自己的寫作優勢,讓它完成一些 NSFW 的寫作,一定能為 Kimi 帶來很多的使用者。Kimi 只能笑而不語,說這是一個很好的建議。未來是否會支援 NSFW 內容,可能還需要找到一些年齡驗證的方法,也需要進一步做好模型的對齊工作。很明顯,現階段 Kimi 是不可能支援 NSFW。核心技術揭秘:KDA、長推理與多模態作為一家被稱為「開源先鋒實驗室」的公司,而 Reddit 本身就是也是一個非常龐大和活躍的技術社區,Kimi 也在這次的 AMA 中,分享了大量的技術細節。10 月底,Kimi 在《Kimi Linear: An Expressive, Efficient Attention Architecture》的論文,詳細介紹了一種新型混合線性注意力架構 Kimi Linear,其核心正是 Kimi Delta Attention (KDA)。KDA 演算法實現,論文連結:https://arxiv.org/pdf/2510.26692通俗來說,注意力(Attention)就是 AI 在思考時,決定應該重點關注上下文那些詞語的機制。和常見的完全注意力和線性注意力不同,KDA (Kimi Delta Attention),是一種更智能、更高效的注意力機制。在這次 AMA 活動中,Kimi 也多次提到,KDA 在長序列強化學習場景中展現了性能提升,並且 KDA 相關的想法很可能在 K3 中應用。但 Kimi 也坦言,技術是有取捨的。對大多數大模型任務來說,目前混合注意力的主要目的是節省計算成本,並不是為了更好的推理;在長輸入和長輸出任務上,完全注意力的表現依然是更好的。那麼,Kimi K2 Thinking 是如何做到超長推理鏈的呢,最多 300 個工具的思考和呼叫,還有網友認為甚至比 GPT-5 Pro 還要好?Kimi Linear 模型結構Kimi 認為這取決於訓練方式,他們傾向於使用相對更多的思考 token 以獲得最佳結果。此外,K2 Thinking 也原生支援 INT4,這也進一步加速了推理過程。我們在之前的 Kimi K2 Thinking 文章中也分享了 INT4 的量化訓練技術,這是一種高效的量化技術(INT4 QAT),Kimi 沒有訓練完再壓縮,而是在訓練過程中,就保持了低精度運算模型。這能帶來兩個巨大的優勢,一個是推理速度的提升,一個是長鏈條的推理,不會因為訓練完再進行的壓縮量化,而造成邏輯崩潰。最後,關於外界期待的視覺語言能力,Kimi 明確表示:目前正在完成這項工作。之所以先發佈純文字模型,是因為視覺語言模型的資料獲取,還有訓練,都需要非常多的時間,團隊的資源有限,只能優先選擇一個方向。生態、成本與開放的未來對於開發者和普通使用者關心的問題,Kimi 團隊也一一作答。為什麼之前能處理 1M 上下文的模型消失了?Kimi 的回答言簡意賅:「成本太高了。」而對於 256K 上下文在處理大型程式碼庫時依然不夠用的問題,團隊表示未來會計畫增加上下文長度。在 API 定價上,有開發者質疑為何按「呼叫次數」而非 token 收費。對使用 Claude Code 等其他智能體工具進行程式設計的使用者來說,基於 API 請求次數的計費方式,是最不可控且最不透明的。在傳送提示之前,使用者根本無法明確工具將發起多少次 API 呼叫,或者任務將持續多長時間。Kimi 會員計畫Kimi 解釋說,我們用 API 呼叫,是為了讓使用者更清楚的知道費用是怎麼消耗的,同時符合他們團隊的成本規劃,但他們也鬆口表示會看看是否有更好的計算方法。當有網友提到自己公司不允許使用其他聊天助手時,Kimi 藉機表達了他們的核心理念:我們擁抱開源,因為我們相信通用人工智慧應該是一個帶來團結而不是分裂的追求。而對於那個終極問題——AGI 什麼時候到來?Kimi 認為 AGI 很難定義,但人們已經開始感受到這種 AGI 的氛圍,更強大的模型也即將到來。和去年瘋狂打廣告行銷的 Kimi 不同,在這場 AMA 裡,楊植麟和團隊成員的回答;確實能讓人感受到在國產開源,逐漸佔據全球大語言模型開源市場的背景下,Kimi 也更加有底氣,更明確了自己的節奏。而這個節奏很明顯,就是在這場燒錢、甚至卷太空的 AI 競賽中,繼續走開放原始碼的路,才能推動技術往前走。 (APPSO)
科技
#OpenAI
#Anthropic
#Kimi
讚
留言
分享
官方認證
美股艾大叔
2025/10/29
•
禮來聯手輝達建製藥業最強超算和AI工廠:加速藥物研發,發現人類無法找到的分子
禮來公司攜手輝達打造由逾1000顆Blackwell Ultra GPU組成的超級電腦和AI工廠,預計明年1月上線。該系統將加速藥物研發,支援大規模AI模型訓練。禮來首席資訊和數字官Diogo Rau表示:“我們希望能夠發現僅靠人類永遠無法發現的新分子。”禮來公司與輝達宣佈合作建設製藥行業"最強大"的超級電腦和AI工廠,旨在加速整個行業的藥物開發處理程序。周二兩家公司宣佈,禮來預計於12月完成超級電腦和AI工廠的建設,並於明年1月上線運行。這套系統將由逾1000顆輝達Blackwell Ultra GPU晶片組成,通過統一高速網路連線。超級電腦將為AI工廠提供動力,後者是專門用於大規模開發、訓練和部署藥物研發AI模型的計算基礎設施。不過禮來首席資訊和數字官Diogo Rau表示,這些新工具可能短期不會為禮來及其他藥企帶來顯著回報。Rau說:我們現在討論的這些算力發現成果,真正的效益要到2030年才能看到。AI製藥仍處早期階段製藥行業利用AI加速藥物上市的努力仍處於早期階段。目前尚無使用AI設計的藥物上市,但進展體現在進入臨床試驗的AI發現藥物數量增加,以及藥企近期聚焦AI的投資和合作夥伴關係上。禮來首席AI官Thomas Fuchs表示:這台超級電腦是一種真正新穎的科學儀器,就像生物學家的巨型顯微鏡。Fuchs強調:科學家將能夠在數百萬次實驗中訓練AI模型以測試潛在藥物,大幅擴展藥物發現的範圍和複雜程度。Rau則指出,雖然尋找新藥不是這些新工具的唯一重點,但"這是最大的機會所在"。他說:我們希望能夠發現僅靠人類永遠無法發現的新分子。精準醫療目標需AI基礎設施禮來還計畫利用超級電腦縮短藥物開發周期,幫助治療效果能更快起效。該公司表示,新的科學AI代理可以支援研究人員,先進的醫學影像能讓科學家更清晰地觀察疾病進展,並幫助開發用於精準治療的生物指標。精準醫療是一種根據個體基因、環境和生活方式差異定製疾病預防和治療的方法。輝達醫療保健副總裁Kimberly Powell說:我們希望能兌現精準醫療的承諾,沒有AI基礎設施,我們永遠無法實現這一目標。所以我們正在進行所有必要的建設,我們將看到技術的起飛,禮來就是一個確切的例子。開放平台共享研發資料多個AI模型將在禮來去年9月推出的Lilly TuneLab平台上提供。這是一個AI和機器學習平台,允許生物技術公司訪問禮來基於多年專有研究訓練的藥物發現模型。這些資料價值10億美元。禮來推出該平台旨在擴大整個行業對藥物發現工具的訪問。Kimberly Powell表示:能夠幫助到這些初創公司非常有意義,否則他們可能需要幾年時間消耗資金才能達到那個階段。她還補充說,公司“很高興參與”這項工作。作為交換,生物技術公司需要貢獻部分自身研究和資料以幫助訓練AI模型。 (invest wallstreet)
科技
#禮來公司
#輝達
#超級電腦
讚
留言
分享