AI Coding成功率88%,科研僅3%?「科研是下一個Coding」,還差關鍵一環

一名頂尖實驗室的材料研究員,最無力的瞬間,從來不是想不出創新思路,而是 AI 一天推演上百種新配方,人工實驗一年測不完;

最可惜的損耗,不是實驗本身的失敗,而是隨著項目結束、人員更迭導致資料、經驗、參數未能有效存留,讓下次的研究需要重複起步、反覆試錯。

這並非是科研人員的個人難題,某種程度上摺射出當前 AI for Science(AI4S)賽道中一個值得關注的結構性矛盾。

當下,人工智慧的迭代速度加快,模型參數不斷擴容、智能體運行能力穩步提升,曾經按月交付的軟體任務,如今以天、甚至小時為單位在快速落地。

行業普遍形成一種共識:沿著現有技術路徑持續最佳化迭代,AI 的通用能力將保持穩步進階。

但一組真實的行業對比資料,也提示我們對 AI 全能進化的認知要回歸理性。

過去十八個月,AI Coding 領域暴熱,任務成功率從不足 5% 飆升至 88%,程式碼生成、自測迭代的閉環已經跑通,賽道增量空間逐步縮小。

反觀核心的原創科學研究領域,技術迭代節奏相對平緩。

主流大模型的科研任務完成率在 3% 左右,在 NatureBench 涵蓋的 90 項頂級真實科研任務,最優智能體能超越原始論文成果的比例為 17.8%。

這一冷熱不均的行業反差,清晰界定了當前 AI 的能邊界:大模型更擅長處理答案固定、反饋即時的標準化任務,面對無標準答案、問題維度模糊、驗證周期漫長的原創科研場景適配性相對有限。

AI 已熟練掌握高效編碼、標準化解題的能力,但在未知領域的自主探索、原創科研創新上,仍存在明顯短板。

上海AI實驗室主任、首席科學家周伯文認為,這種能力差距的核心,是當前大模型普遍缺失科學元認知:

它能精準呼叫海量已知知識,卻無法識別知識的邊界;

能生成看似自洽的推演結論,卻不會自主提出可證偽的科學假設;

能基於文字做機率擬合,卻無法在真實世界的反饋中修正、重構自身認知。

標準化解題與原創科研探索的核心差異,正體現在這一點。

究其本質,當前 AI 科研的核心短板,並非知識儲備不足,而是極度缺乏真實科研場景的失敗樣本與負反饋。

程式設計場景具備秒級反饋、即時證偽的迭代特性,任務對錯可快速判定;

而基礎科研試錯成本高、驗證周期可達數月,失敗類資料公開度低、有效反饋樣本稀缺。

模型訓練大多依託公開的成功論文成果,難以學習海量真實試錯背後的底層邏輯,最終形成擅長模仿復用、弱於原創突破的行業現狀。

這一現狀,進一步凸顯了 AI 科研的兩大核心瓶頸,制約著技術深度落地:

一方面,大模型可快速推演生成海量科研方案,但線下實驗驗證效率偏低、進度滯後,逐步形成方案堆積、驗證滯後的行業痛點;

另一方面,科研試錯經驗、實驗資料缺乏系統化留存管道,導致科研工作容易陷入重複試錯、低效迭代的狀態。

兩大瓶頸限制了 AI 科學研究的落地上限,讓多年來的 AI4S 技術探索,更多停留在淺層效率提升階段,難以實現科研範式的顛覆性突破。

WAIC 2026,上海 AI 實驗室發佈了「書生·端硯」科學發現平台,有望為長期存在的科研結構性矛盾提供一種新的思路與解決方案。

區別於行業內多數產品依託大模型適配科研場景、實現淺層提效的最佳化模式,「書生·端硯」以乾濕實驗閉環迭代、科研資產沉澱為核心能力,補齊 AI 科研缺失的真實場景反饋鏈路,推動 AI 科研應用從單點效率最佳化,邁向科研範式升級的全新階段。

真正的科學智能,並非簡單的文獻閱讀、資料計算,而是能夠對接真實物理世界的反饋、沉澱可復用、可迭代的科研資產,這也是 AGI4S 領域需要長期探索的核心目標。

補齊 AI 科研反饋滯後短板
打通數字推演與實體實驗鏈路

當前 AI 科研普遍存在推演高效、落地困難的痛點,核心癥結在於真實場景反饋機制的不完善。

大模型依託海量文字資料完成訓練,擅長基於存量知識開展推演生成,短時間內即可產出大量蛋白質序列、新材料配方、量子排布等科研方案。

但傳統科研驗證體系與之適配性不足:濕實驗依賴人工操作、裝置體系分散、流程繁瑣,整體通量低、周期長、成本高,一次完整的科研驗證往往需要數天甚至數月。

缺少真實實驗校驗、失敗資料修正和物理世界反饋糾錯,AI 的各類推演結果,本質上是基於文字資料的機率擬合,尚未完全實現對真實科學規律的精準探索與驗證。

行業頭部玩家也在持續探索突破:

Anthropic 最新發佈的 Claude Science,接入 60 個科學資料庫,可依託自然語言驅動多步驟科研流程;

OpenAI 推出的 GeneBench-Pro,聚焦基因組學、定量生物學真實場景,專項評測 AI Agent 處理模糊資料、完成多階段科研判斷的綜合能力。

但目前行業主流方案,大多仍侷限於(文獻)、(模型計算)的純數位化場景,尚未完全打通數字推演到物理實驗驗證的完整閉環,很難支撐高價值的原創科學研究落地。

「書生·端硯」的核心突破在於建構了「讀-算-做」一體化閉環,補齊 AI 科研最關鍵的真實場景反饋鏈路,打通了數字推演到落地實體實驗的關鍵環節。

依託專屬的具身自主實驗體系,平台打破了模擬計算與實體實驗的場景壁壘,搭建起幹濕自主迭代的閉環:AI 自主生成科研假設 → 智能體完成多維度模擬篩選 → 自動化實驗裝置承接落地測試 → 實測資料即時回流迭代。

搭配多智能體協同核驗系統,全流程無需人工跨平台搬運資料、手動適配格式,可實現自主運轉、自動糾錯。

這套運行機制,從根源改善了 AI 缺乏有效反饋迭代的短板,讓每一次模型推演都能對接真實實驗校驗,每一次推演偏差均可得到及時修正,有效改善純模型推演脫離實操場景的問題。

落地成果直觀印證了這套閉環的應用價值:

在蛋白質工程賽道,平台將傳統數天的迭代周期壓縮至分鐘級,驗證通過率提升超 3 倍,徹底告別「AI 推演、人工苦熬」的低效模式;

在量子計算領域,依託極速閉環驗證能力,創下 60 毫秒搭建 2024 原子無缺陷陣列的全球新紀錄,讓前沿理論快速落地為可復用的技術成果。

整體而言,「書生·端硯」的核心價值,並非單純提升計算效率,而是針對性解決行業普遍存在的推演產出多、落地驗證難、偏差修正慢、成果轉化弱的核心痛點,為 AI 科研植入真實世界的迭代邏輯,推動模型從標準化工具,升級為可探索未知領域的科研協作載體。

反低效內卷
沉澱科研複利資產

如果說驗證滯後製約了科研即時落地效率,那麼科研經驗的零散流失,便是影響 AI 科研長期進化的核心因素,也是大模型科學探索能力增長緩慢的深層原因。

傳統科研體系存在致命的機制短板:各類實驗參數、失敗案例、模擬程式碼、分子結構、測試資料,全部零散記憶體在個人電腦、孤立裝置、單次項目中,缺乏統一的歸檔、沉澱、復用機制。

一旦遇到團隊更迭、項目結題收尾,大量試錯經驗、核心失敗資料便容易流失浪費。

文獻資料、實驗資料的抽取和沉澱

這也造就了科研領域低效內卷的現狀:

AI 持續擬合公開的成功科研資料,卻難以觸達科研場景中佔比超 90% 的試錯資料;

前人驗證過的無效方案、踩過的技術誤區,後續研究仍會重複嘗試;

已被證偽的科研路徑,模型依舊會反覆推演。

導致科研工作僅有單次試錯成本消耗,無長期迭代收益,即便 AI 通用能力持續升級,原創科學研究成果依舊進展緩慢。

「書生·端硯」搭建的全流程科研資產結構化沉澱體系,可有效破解科研經驗流失難題,重構科研長期迭代的底層邏輯。

平台將資產沉澱機制深度融入「假設-模擬-實驗-回流」全科研鏈路。

所有公式圖表、實驗參數、運行程式碼、成敗資料、推演日誌,均會按照專業標準自動結構化歸檔、統一留存、全程留痕。

尤其是行業長期忽略的海量失敗資料、無效試錯參數,均可完整留存,補足了 AI 科研訓練中稀缺的負樣本資料。

更具價值的是,平台沉澱的科研資產並非靜態存檔資料,而是可復用、可迭代、可持續反哺模型的動態核心資源。

跨項目、跨團隊可快速檢索復現、二次呼叫,大幅減少重複試錯的無效工作;

同時,涵蓋成功與失敗的全量真實實驗資料,可持續反哺大模型迭代最佳化,穩步提升 AI 的科研判斷力與推演精準度,讓模型能夠依託真實試錯資料總結規律、探索未知。

這是一次科研底層邏輯的最佳化升級:

傳統科研模式下,實驗結束即流程收尾,失敗資料大多作廢閒置;

平台賦能下,實驗完成即資產沉澱,資料積累持續驅動科研進階。

每一次試錯、每一組資料、每一輪推演,都不再是單一科研的成本消耗,而是支撐後續創新、驅動 AI 科研能力進化的核心資產,有效幫助科研工作實現複利式增長。

「書生·端硯」並非單純升級的文獻處理大模型,而是一套完整落地「假設推演—模擬計算—實體實驗—資料回流」全鏈路的科學智能系統。

目前,平台已在蛋白質工程、量子計算、腦科學、新材料研發、半導體、地球氣象六大前沿科研領域落地應用,適配多場景原創科研需求。

AI 賦能科研的終極價值,不是替代研究員思考,而是聚焦前沿核心創新,推動AI從標準化的算力工具,進階為可探索未知、可持續迭代的科研協作夥伴。

正如周伯文所言,AI 的使命應從「加速科研自動化」邁向「以複雜科研任務牽引高階智能」。

「書生·端硯」的技術探索與落地實踐,走的正是這條路——它不是替代科學家做判斷,而是幫助科學家更快地驗證判斷、更系統地沉澱判斷,讓每一次實驗的反饋,都能成為下一次假設的起點。 (新智元)