大模型正在改變EDA

RexAA
•
AI速讀
針對半導體設計生產力缺口,本文探討 LLM 在 EDA 中的角色演進。作者定義了從「生成器」到「智能體」再到「編排器」的三層階梯,強調目前系統雖自主性提升,但仍受限於「語法陷阱」與碎片化架構。文中提出建立具備物理感知能力的「標準化編排器」,能有效整合後端物理反饋,改善 PPA 性能並提升系統級設計的正確率。未來展望指出,透過「智能實驗室」與工作流自動化,工程師將從編碼者轉型為意圖定義者,顯著降低硬體開發門檻並加速創新。

電子設計自動化(EDA)通過一代又一代工具的發展,不斷將綜合、最佳化和驗證過程自動化,從而持續提升工程設計效率。大語言模型(LLM)進一步延伸了這一發展軌跡,使設計意圖能夠直接轉換為硬體實現。在大多數EDA相關文獻中,基於LLM的解決方案通常只用於輔助彼此割裂的設計階段或單項任務,但這種劃分方式掩蓋了能力究竟如何形成、系統又如何實現規模化的根本驅動因素。

在本文中,我們提出三個具有層級遞進關係的角色,以揭示這種能力累積過程:生成器(Generator),即通過單次生成產生設計產物;智能體(Agent),即借助工具反饋進行迭代並不斷最佳化輸出;以及編排器(Orchestrator),即在不同EDA階段之間協調決策。對現有已發表系統進行梳理後可以發現,一個普遍存在的問題是所謂的“語法陷阱(syntax trap)”:模型接受訓練的目標往往是生成“看起來合理”的程式碼,而非物理上真正正確的硬體;與此同時,工具體系的碎片化以及設計上下文的丟失,又進一步掩蓋了某一階段的決策會如何影響後續設計階段。

對這三種角色的比較表明,當前方法仍難以擴展到工業級設計,因此有必要轉向一種標準化、具備物理感知能力的編排器,在整個EDA流程中連接不同工具和智能體,從而實現更加可靠、更加易用的硬體設計。


介紹

半導體行業正面臨日益擴大的生產力缺口,其背後既有全球晶片需求持續增長的推動——到2030年,全球半導體市場規模預計將超過1兆美元——也有晶片複雜度不斷提升的影響。如今的產品已經能夠整合數十億個電晶體,同時採用更加多樣化的架構,並面臨更加嚴格的物理約束,而整個開發周期卻在不斷縮短。電子設計自動化(EDA)工具的引入,旨在通過確定性的、基於物理規律的方法幫助工程師建構並最佳化設計,從而提升大規模設計執行的效率。然而,在進入EDA工具執行階段之前,將工程設計意圖轉化為正式硬體設計產物的過程仍然高度依賴人工,需要反覆迭代,並依賴數量有限、集中於少數領域且難以規模化複製的專業領域專家。因此,如何生成正確且經過最佳化的硬體實現,依然構成晶片設計生產力提升的核心瓶頸。

大語言模型(LLM)為縮小這一生產力缺口提供了一條頗具潛力的路徑:通過文字生成,將自然語言(NL)表達的設計意圖轉換為結構化的硬體設計產物。數字設計本身在很大程度上就是通過結構化文字表達的,包括硬體描述語言(HDL)程式碼、規格說明、指令碼以及約束檔案,因此,將LLM引入其中可以被視為這一技術體系的自然延伸。LLM輔助開發已經在軟體工程領域展現出明顯的生產力提升效果,例如減少人工工作量、縮短迭代周期,這意味著硬體設計同樣可能從中受益,不過硬體領域還受到昂貴且由物理規律驅動的驗證流程限制。

由此,目前逐漸形成了兩種主要架構角色:第一種是生成器(Generator),它通過一次前向推理直接根據自然語言生成設計產物,隨後由工程師自行解讀工具輸出,並人工引導下一輪設計迭代;第二種是智能體(Agent),它在固定流程中將生成過程與自動化工具反饋連接起來,從而閉合這一循環,使每一輪設計都能夠自動進行修復和最佳化。這兩類方法已經在若干特定任務中取得可量化的效果提升,包括HDL生成、EDA指令碼生成、程式碼修復、驗證 ,以及硬體資料集建構。然而,一些重要侷限依然存在,包括難以保證生成設計在物理層面真正可實現、不同EDA階段之間的推理彼此割裂,以及隨著系統自主程度和設計規模不斷提升,決策過程變得越來越不透明。

在本文中,我們提出第三種角色——具有物理感知能力的編排器(Orchestrator)——並認為它是LLM角色演進的下一個合理階段,也是針對上述侷限逐漸匯聚形成的一種解決方案。如果說生成器負責“生成”,智能體負責通過迭代不斷“修復”,那麼編排器則掌握整個設計流程本身的控制權:它能夠基於一個持續存在、跨越不同設計階段的設計狀態模型,自適應地判斷應該呼叫那些工具、以什麼順序呼叫,以及何時需要重新分配或調整工作重點;與此同時,端到端的決策來源和決策路徑,也會作為這種協調機制的一種自然屬性顯現出來。按照這一框架,當前領域中的能力提升不應僅僅被理解為模型本身能力增強的結果,更重要的是架構層面的演進——也就是LLM如何與工具以及設計上下文連接起來。因此,要解決硬體設計中的“語法陷阱”、EDA階段割裂、上下文無狀態以及可解釋性不足等當前智能體系統無法從根本上解決的問題,就需要進一步轉向標準化的編排體系。


LLM與數字設計流程之間的不匹配

圖1:LLM當前在數字EDA設計流程中的整合情況概覽。 其中,a,表示不同技術抽象層級;b,表示按順序推進的數字設計階段;c,表示LLM在各階段中承擔的角色。圖中同時標出了“語法陷阱”,即由於缺乏物理感知能力而導致LLM應用效果受限的位置。


如圖1所示,數字EDA設計流程本質上是一條分階段的轉換流水線,通過一系列不同的抽象層級,將工程設計意圖最終轉化為經過物理驗證的矽晶片實現(圖1a)。從自然語言和高層次綜合(HLS)規格,到暫存器傳輸級(RTL)硬體描述,再到門級網表、電晶體標準單元以及最終的物理互連佈局,每向上提升一個抽象層級,都會將更低層級的實現複雜性封裝到自動化工具之中,使工程師能夠以更快的速度和更大的規模表達設計意圖,並在每一次抽象層級遷移中帶來生產力的躍遷;但與此同時,工程師對於底層物理行為的可見性和控制能力也會相應下降。

圖1b進一步將上述抽象層級對應到標準EDA流程中,包括規格定義、設計輸入、功能模擬、邏輯綜合、佈局布線(P&R)以及最終簽核等階段。前端設計階段主要以語言和文字為媒介,設計意圖通常通過設計規格、HDL程式碼以及約束檔案等結構化文字進行表達,因此非常適合引入LLM輔助。目前,LLM已經在多個前端任務中展現出明顯效果,包括從自然語言生成設計規格或RTL程式碼、測試平台(testbench)編寫與斷言綜合,以及Bug總結。

相比之下,後端設計階段開始轉向由物理規律嚴格約束的表示形式和確定性演算法,例如時序收斂、布線可實現性以及設計規則符合性等,這些任務幾乎不存在允許近似處理的空間。由於複雜幾何結構本身難以通過序列化方式進行編碼,LLM實際上對複雜物理表示處於一種“不可見”的狀態。因此,目前LLM在後端EDA中的作用基本被限制在仍具有文字屬性的任務上,例如綜合與P&R工具指令碼生成、EDA日誌與時序報告解析,以及基於RTL程式碼進行功耗、性能和面積(PPA)估算。這一邊界實際上反映出一個更加根本的問題,即LLM的訓練目標與硬體設計需求之間存在錯位。

LLM主要通過“下一個Token預測”進行學習,這一訓練目標獎勵的是語言上的合理性,卻沒有任何機制能夠訓練模型理解或保證物理層面的正確性,因此形成了一種內生性的失敗模式和目標錯位,本文將其稱為“語法陷阱(syntax trap)”。在這種情況下,LLM生成的設計可能在淺層的前端評估中看起來完全有效,但一旦進入更深層次、更嚴格的物理驗證階段,就可能暴露出問題。

例如,一個Verilog模組可能能夠成功編譯並通過模擬,但其中仍可能存在細微的時序錯誤,例如錯誤使用阻塞賦值或非阻塞賦值。這類問題很難通過文字層面的評估被發現,卻可能導致最終製造出的硬體發生功能失效。由於這些錯誤有可能在後續設計階段中持續傳播而不被察覺,最終甚至可能造成晶片重新流片,不僅帶來數百萬美元的額外成本,還可能導致產品延期數月。

這一陷阱在三個層面上被量化:在語法層面上,55% 的 LLM 生成的 Verilog 適合進行自動化修復,這表明 Token(詞元)等級的合理性並不能可靠地轉化為語法上有效的硬體描述;在功能層面上,通過模擬是不夠的,有 44.2% 通過測試平台(testbench)的設計未能通過形式等價性檢查;而在物理層面上,即使是功能正確的設計,相對於人類人工最佳化的設計,也會產生 1.11–1.38 倍的面積開銷。這種錯位通過 pass@k 得到了強化——pass@k 是佔主導地位的早期指標,它將設計正確性衡量為 k 個樣本中能正確編譯或模擬的比例,從而在最佳化語法和功能合理性的同時排除了物理正確性。

“語法陷阱”之所以長期存在,主要有兩個根本原因。第一,學習真實硬體行為所需要的物理基礎資料,包括綜合結果、時序報告以及物理實現結果等,生成成本非常高,需要大量計算資源,而且其資料規模相比傳統訓練語料要少幾個數量級。即便是HDL程式碼本身也十分稀缺,由於專有IP保護以及應用場景高度多樣化,HDL在公開程式碼語料庫中的佔比甚至不足0.1%。

第二,HDL程式碼與最終物理實現結果之間的關係高度複雜,而且往往並非直接對應。即便只是很小的程式碼修改,也可能對PPA產生巨大且難以預測的影響,因此,僅通過文字本身很難推斷設計在物理層面是否真正正確。

針對這一問題,當前研究領域正在從單次生成模式,也就是“生成器(Generator)”,逐漸轉向閉環式的智能體最佳化模式,也就是“智能體(Agent)”。在這種模式下,LLM生成的設計會反覆交由EDA工具進行檢查,並依據工具反饋持續修改,直到滿足相應的質量標準。由此形成了一種“神經—符號閉環(neuro-symbolic loop)”:LLM負責生成候選設計,而EDA工具則負責對物理正確性施加強制約束。

與此同時,一些互補性的研究開始引入面向電路本身的中間表示(IR),幫助LLM獲得超越純文字的理解能力。其中包括用於提升程式碼結構分析能力的抽象語法樹(AST),以及支援訊號級物理推理的資料流圖(DFG)。例如,與其直接在文字程式碼中搜尋錯誤,通過解析後的設計語法樹追蹤發生故障的訊號,使VerilogCoder的偵錯智能體將通過率提高了超過25%。

然而,無論是智能體系統還是經過IR增強的模型,目前在很大程度上仍侷限於單個設計任務或單一設計階段(圖1c)。智能體所獲得的反饋通常只針對當前正在執行的任務,而IR更多描述的是設計結構本身,而非這些結構在後續階段可能產生的物理影響。因此,在某一個抽象層級做出的決策,往往仍然與其在其他設計階段造成的影響相互脫節。這也意味著,未來需要在整個EDA流水線中建立一種“跨層理解(cross-layer understanding)”能力——也就是將當前設計決策與後續物理結果聯絡起來,而不是像大多數現有LLM-EDA系統那樣,只聚焦於彼此孤立的單一設計階段。

圖2:LLM成熟度的發展趨勢及當前研究版圖。a,基於46篇論文建立的領域分類體系,將每篇論文對應的EDA功能、LLM方法棧以及LLM所承擔的角色關聯起來。圖中進一步從三個維度展示LLM能力的演進:b,自主性(autonomy),即智能體對工作流程的控製程度;c,可解釋性(explainability),即決策來源和決策過程的可追溯性;以及d,評估重點(evaluation focus),即所針對的設計挑戰。圖中標註的趨勢線斜率均按照各自坐標軸尺度進行了歸一化處理;具有相同排名的資料點僅為方便觀察而進行了位置偏移。 調查結果詳見補充表1,互動式圖表見:https://mattycode101.github.io/LLMs_in_Digital_EDA_Perspective/


LLM在EDA中的當前應用

為了刻畫當前侷限於單一設計階段的LLM部署範圍及其結構,圖2a對46個已發表的LLM-EDA系統進行了對應,並從其功能、方法棧以及LLM在架構中承擔的角色三個維度進行分類(完整分類體系及不同類別之間的關係見補充表1和配套的線上互動式可視化)。從功能分佈來看,“語法陷阱”的影響十分明顯:RTL生成佔據了已發表研究中的最大比例,因為這一階段恰好處於自然語言(NL)與硬體描述最為接近的位置,同時僅通過編譯或模擬就可以判斷結果是否“看起來合理”;相比之下,後端物理設計階段在相關研究中的佔比仍然非常有限。

從方法層面來看,反饋整合、任務分解,以及檢索增強生成(RAG)與上下文學習(ICL)的應用數量合計明顯高於預訓練、監督微調(SFT)或強化學習(RL)。這進一步說明,當前LLM-EDA系統能力提升的主要來源,並不是模型訓練方式本身,而是LLM如何與工具和上下文進行連接。

這一趨勢同樣體現在LLM角色分佈中:目前,智能體(Agent)的數量已經超過生成器(Generator),反映出整個領域正在從單純生成轉向與工具深度整合的迭代最佳化模式。相比之下,編排器(Orchestrator)仍然非常少見,主要出現在設計空間探索(DSE)和反饋閉環系統中,並且通常由LLM多智能體(LLM-MA)框架提供支援,即將任務拆分給多個通用LLM分別執行。

然而,這種任務分解主要提升的是平行執行能力,而非真正意義上的協調控制。不同角色通常在系統運行前就已經固定,各模組之間的互動也遵循靜態的任務交接方式,沒有任何一個元件能夠依據全域設計狀態動態調整整個工作流程 8。這不僅限制了專業化智能體的實際效果,也限制了系統建立跨層理解能力。

圖2b–d通過定性評價排名,從三個維度刻畫了所選論文的發展趨勢,從而揭示這一領域在能力演進上的結構性失衡。圖2b顯示,自主性(Autonomy)——也就是系統一旦啟動後能夠在多大程度上獨立運行——正在快速提升,按坐標軸歸一化後的增長率達到每年8.8%。

這種增長更準確地反映了模型適配方式的演進,而不是模型基礎能力本身均勻提升:從生成器層級使用ICL和RAG,到在經過領域適配的硬體語料上進行SFT,再到當前智能體前沿採用來自EDA工具反饋的獎勵訊號進行RL訓練。

強化學習是應對“語法陷阱”的一種重要嘗試。與單純依賴下一個Token預測不同,RL通過多層次獎勵訊號對模型進行最佳化,這些獎勵可以來自編譯結果、功能正確性、綜合結果以及PPA目標,從而使生成過程與真實物理結果更加一致,並在經過精心建構的基準測試中取得較強表現。

然而,由於這些獎勵通常建立在固定參考集合之上,例如黃金標準設計、testbench覆蓋率 ,或特定基準測試對應的基線,因此學習訊號仍然高度受限於既有資料分佈。這樣做雖然能夠提升模型在孤立任務中的表現,卻很難有效泛化到跨階段協調,或者建立RTL結構與物理行為之間更深層次的聯絡,因此“語法陷阱”在很大程度上依然存在。

與此同時,自主性的快速提升並沒有帶來同等幅度的可解釋性提升——這裡的可解釋性,是指追蹤系統為何做出某項決策的難易程度。圖2c顯示,可解釋性的年增長率只有5.8%。隨著自主性不斷增強,兩者之間的差距還在擴大,也就是說,系統正在做出越來越重要的設計決策,但這些決策背後的推理過程反而變得更加難以追蹤。

對於半導體行業而言,由於重新流片的成本極高,正式簽核要求每一項設計選擇與其最終物理結果之間都必須建立可驗證的關聯,因此,自主性與可解釋性之間的這種背離一直被認為是LLM在工業EDA中落地的主要障礙之一。

圖2d進一步揭示了另一個類似的問題,即評估重點(evaluation focus)——也就是基準測試主要關注那類設計屬性——其年增長率為6.9%,但總體上依然集中在功能正確性,而工業競爭力真正主要取決於PPA表現。

因此,標準生成類基準測試已經逐漸趨於飽和。在RTLLM 和VerilogEval 等核心基準測試的模組級任務中,領先系統的pass@k已經超過95% ;然而,一旦轉向更接近真實生產流程的任務,例如斷言編寫、testbench建構以及多步驟智能體設計,通過率便會下降到大約3%,最高也無法超過34% 。

當設計規模從孤立模組擴大到層級化系統時,這一問題會進一步加劇。由於LLM受到有限上下文窗口的限制,智能體層級的系統必須不斷重新建構設計上下文,而無法長期持續保存完整狀態,因此容易造成資訊丟失和錯誤。

這種缺乏持久記憶的現象被稱為“無狀態性(statelessness)”,它會破壞不同設計階段之間設計狀態的連續性。在小型基準測試中,這個問題尚且可控;但隨著模組互動、時序依賴以及實現約束不斷增加,對上下文保持和推理能力的要求也會迅速上升,系統在大型設計上的性能因此出現明顯下降。已有研究甚至報告,當設計規模超過約3,500行程式碼後,系統會出現完全失效的情況。

這些趨勢進一步表明,碎片化正在成為一種疊加式的結構性限制:大多數系統都定義了自己的工具鏈、反饋閉環以及內部表示方式,從而阻礙了跨系統復用,也限制了不同專業化LLM之間的協同。

即便目標相同——讓LLM具備對硬體設計結構的感知能力——不同研究採用的表示方式往往彼此不相容。例如,HDLxGraph將設計編碼為語法結構與DFG雙重表示,用於檢索;而CROP則使用由LLM生成摘要進一步得到的稠密向量嵌入。針對其中一種表示方式建構的方法,通常無法直接遷移到另一種體系中。

因此,目前已經出現的一些局部解決方案依然彼此孤立。例如,AutoSilicon和ACE-RTL通過跨會話保留設計知識來緩解無狀態問題;RTLSquad顯式記錄設計決策,而ChipSeek-R1則展示推理步驟,以改善可解釋性;MCP4EDA則通過類型化工具介面提升跨階段協調能力。然而,這些改進基本都是針對特定系統開發的,無法被其他系統直接復用,因此碎片化本身反過來又阻礙瞭解決方案在不同系統之間傳播。

因此,要真正彌合這些能力缺口,需要的並不是更多零散的局部修補,而是一套共享架構:具備統一介面、持久化設計狀態,以及內生的決策可追溯能力。


標準化編排器

能夠解決可解釋性、無狀態性和碎片化問題的架構,與其說是增加一個新的元件,不如說是對系統控制權進行重新組織。如圖3a–c所示,生成器、智能體和編排器實際上對應三個層層巢狀的推理範圍:從單個任務,到完整工作流,再到EDA多階段之間的整體協調。

編排器與智能體之間最關鍵的區別在於“控制權”:它能夠決定下一步應該執行什麼操作,並呼叫多個智能體分別完成被拆解後的不同任務。上一節所指出的許多侷限,本質上都源於當前系統中缺少這樣一個統一協調角色。

一旦引入這一角色,標準化介面可以減少系統碎片化,持久化設計狀態能夠緩解上下文丟失,同時系統還可以持續記錄設計決策和工具互動,從而增強決策來源的可追溯性。這些能力並不是彼此獨立、額外疊加的功能,而是通過一個可審計的協調層統一管理設計流程之後,自然而然產生的結果,也使LLM輔助EDA有機會從孤立模組進一步擴展到完整晶片設計。

由於不同層級的能力彼此相互關聯——工具反饋能夠進一步增強一個本身就很強的生成器,但無法彌補基礎生成能力本身較弱的問題——因此,只有當智能體層級系統發展到足夠成熟的階段後,編排才真正具有價值。這也解釋了為什麼這種角色轉變恰好在當前階段開始出現。

這意味著研究問題正在從“如何提高生成質量”,進一步轉向“如何實現高效協調”,而標準化則是實現這一轉變的前提。開放協議,尤其是模型上下文協議(MCP)和智能體到智能體(A2A)框架,可以使用類型化、與具體協議實現無關的介面,替代過去高度定製化的工具封裝,以及依賴自然語言解析日誌的方式。

這種變化會帶來兩方面影響:第一,系統能力改進可以在不同系統之間組合復用,而不再被鎖定在某一個封閉系統內部;第二,決策來源和執行鏈路的可追溯性會成為結構化工具呼叫自然產生的副產品,而不再需要在事後重新拼接和還原。

當這種協調層被應用到整個設計流程後,通過閉合後端反饋回路並建立跨層理解,目前已經能夠實現15–30%的時序改善,以及10–20%的面積改善。

控制權同樣為解決“語法陷阱”和評估重點偏差提供了一種架構層面的方案,即將神經—符號反饋機制從孤立的最佳化閉環擴展到整個EDA流程。確定性的EDA工具仍然負責確保設計正確性,而編排機制則保證這些工具的輸出能夠作為持續存在的設計上下文,被保留下來並不斷影響後續EDA階段中的決策。

這樣一來,在綜合或物理實現階段發現的物理後果,就可以反向影響上游的規格定義或RTL生成,而不再只是到了某些固定檢查點後才被動暴露出來。同時,系統還可以通過必要的驗證,對每一個設計階段是否允許繼續向下推進進行控制。

為了降低驗證成本並加快設計空間探索(DSE),可以引入大電路模型(LCM)作為快速物理代理,以在呼叫工具之前剔除劣質候選方案;相關的評估器在取得超過 6 倍加速比的同時,功耗預測誤差低於 2%。

圖3d–e進一步量化比較了不同LLM角色在“從規格到RTL生成”任務中的表現,並分別考察模組級和系統級設計規模。之所以選擇這一任務,是為了突出系統的可擴展性問題,因為已有研究指出,當生成的硬體程式碼超過約100–150行後,設計一致性會出現明顯下降。

由於硬體設計性能高度依賴底層模型、提示策略、基準測試以及評估方法,因此,本文並未簡單比較單一指標,而是針對每一種角色,從五個維度進行綜合彙總:前端正確性、後端PPA質量、驗證完整性、求解時間,以及單個設計的成本。具體計算方法見補充表2。

在模組級規模下,生成器和智能體系統在正確性方面已經接近人類水平,同時在求解時間上表現出顯著更高的生產效率。然而,兩者依然保留著“語法陷阱”的典型特徵:表面上的功能成功率很高,但驗證完整性相對較弱。

編排器在很大程度上能夠縮小這一差距,不過其成本大約提高到六倍。隨著設計風險不斷上升,這種額外成本也會變得越來越容易被接受。

到了系統級規模,不同方法之間的生產效率差距變得更加明顯:生成器和智能體工作流的正確率會大幅下降到20%以下,而編排器的表現則相對穩定,並開始在PPA效率方面超過人類基線。

因此,這些性能提升本質上更多來自架構演進,而不是單純依靠新一代模型能力提升。這也意味著三種範式分別適合不同角色:生成器適合用於失敗成本較低的場景,以加速設計內容生成;智能體適合承擔耗時的迭代最佳化任務;而編排器則通過保持跨階段一致性和實現經過驗證的設計收斂,負責協調系統級開發。

圖 3:巢狀 LLM 架構框架與多軸生產力評估。a,協調器層(Orchestrator Tier):人類、LLM 協調器與溯源資料庫(Provenance Database)之間的協作介面。b,代理層(Agent Tier):眾多無狀態代理/生成器由協調器提供規範(specifications),並在自訂流水線中執行這些規範。c,工具層(Tool Tier):訪問 EDA 工具以用於產物(artifacts)驗證和設計開發。d、e,跨 (d) 模組級(≤150 行程式碼)和 (e) 系統級(>200 行程式碼)設計複雜度的 Spec-to-RTL(規範到 RTL)生成的五軸生產力對比。生成器(Generator)、代理(Agent)和協調器(Orchestrator)LLM 架構相對於人類工程師基線進行了評估;繪製的結果、方法論和來源請參見補充表 2。


工業化LLM的發展展望

本文所討論的向標準化編排轉變的趨勢,正在從一種前瞻性設想逐步走向實際落地,主要EDA廠商也開始各自獨立地向這一LLM角色靠攏。Cadence的ChipStack 基於持久化的IR設計模型,將任務分派給不同的專業化工作單元;Synopsys的AgentEngineer 則將自主最佳化器納入“推理—規劃—執行—編排”的閉環之中;Siemens的Aprisa 進一步嵌入了可審計的流程內協調機制。這些系統所體現出的特徵——持久化狀態、類型化協調以及驗證門控——與學術界目前逐步收斂形成的方向高度一致。

圖4進一步展示了當這類系統實現規模化部署後可能的發展方向,其核心是“智能實驗室(Smart Lab)”(圖4a):這是一個閉環環境,由編排後的智能體負責主導實驗、接收實際測量反饋,並將經過驗證的候選設計返回給工程師,由工程師進行最終監督。

目前,這種模式的早期形態已經出現在閉環後端最佳化,以及橫跨數字、模擬和射頻領域的跨域最佳化中。下一步則可能進一步通過可重構邏輯擴展到物理原型驗證,從而開始縮小從模擬到真實矽實現之間的“Sim-to-Silicon”差距。

距離實際大規模部署最近的方向,是工作流自動化(圖4b),其重點主要集中在那些正確性訊號容易獲得、即便失敗其影響範圍也相對可控的任務上。其中,驗證成為這一前沿方向的核心,因為驗證工作大約佔工程投入的47% 。目前,閉環系統已經能夠實現87–90%的通用驗證方法學(UVM)覆蓋率,而一些工業部署案例顯示,在RTL生成、模擬和形式驗證等環節,工程投入已經實現數量級下降。例如,生成500多行RTL程式碼的時間,可以從1周縮短到1小時,同時面積還可降低28%。

隨著這些任務逐步實現自動化,工程師的角色也將從直接編寫程式碼,轉向定義設計意圖、設定目標以及監督最終簽核。這樣的效率提升並不會減少行業對專業能力的需求,相反,它會擴大工程團隊在現實條件下能夠完成的設計範圍,從而更好地應對半導體需求的指數級增長。

在上述自動化能力的基礎上,PPA驅動的設計空間探索(DSE)(圖4c)將成為另一個重要方向。在這一場景中,編排器能夠平行運行大量專業化工作單元的能力將變得至關重要:不同智能體可以同時沿著PPA空間探索不同甚至相互競爭的設計假設。

這將顯著壓縮過去需要大量人工綜合和反覆調優才能完成的最佳化周期。

因此,熟練掌握HDL開發和EDA指令碼編寫,對於高效開展硬體設計的重要性可能會逐漸降低。這會進一步降低以軟體為主的研究人員以及小型設計團隊進入硬體開發領域的門檻,並推動硬體加速能力向更高層級的軟體與應用棧延伸。

不過,這種“普及化”依然存在明顯邊界,因為先進製造仍然依賴專有的工藝設計套件(PDK)、由行業現有頭部企業掌握的大規模設計資料,以及複雜的製造基礎設施。因此,對開放生態而言,更現實的機會在於儘可能複製和補齊現有企業所掌握的資源,並在製造層之上提升互操作性、可移植性以及快速創新能力。

更高程度的自主性也不可避免地具有“雙重用途”屬性(圖4d)。能夠加速設計的生成能力,同樣會擴大系統的攻擊面,例如通過提示注入植入硬體木馬、通過雲端推理造成智慧財產權洩露,以及在缺少形式驗證的情況下,讓隱蔽的功能缺陷或側通道漏洞持續傳播。已有研究報告顯示,這類攻擊的成功率可以超過90%,而防禦檢測率僅為25–35%。

不過,帶來這些風險的編排機制本身,也可能成為解決問題的一部分。如果將其用於防禦,基於LLM的資訊流跟蹤以及系統化對抗模糊測試,可以在部署之前發現潛在的木馬位置和非法狀態;與此同時,標準化且具有門控機制的流程本身會天然保留完整的決策和操作追蹤記錄,從架構層面增強系統抵禦隱蔽篡改的能力。

隨著Chiplet和3D整合不斷增加晶片設計中的互動關係,更豐富的中間表示(IR)以及新興的世界模型,可能會進一步提升單個智能體的物理推理能力;但要真正實現可靠的晶片開發,越來越關鍵的仍然是如何在整個設計流程中協調這些能力。

圖4:編排器在數字設計中的應用場景。 系統能力以 a)智能實驗室(Smart Lab) 為核心向外擴展。智能實驗室是LLM編排器協調物理實驗或模擬實驗的中心環境。在這一環境基礎上,可以進一步實現:b)工作流自動化(Workflow Automation),在未來為整個EDA流程提供支援,使工程師的工作重點逐步轉向設計意圖設定與結果審查;c)PPA驅動的設計空間探索(DSE),利用智能體搜尋實現多目標最佳化;以及 d)自動化安全探測(Automated Security Probing),將硬體防禦性檢查與對LLM對抗性濫用風險的識別結合起來。


表1:LLM-for-EDA論文分類體系(2023–2026)。 該表按照一套固定的編碼框架,對每個系統進行人工分類,其中包括類別型維度——功能(function)、方法(method)和角色(role),以及序數型維度——自主性(autonomy)、可解釋性(explainability)和評估重點(evaluation focus)。每個維度都設定了一組封閉且明確定義的等級,每篇論文僅被分配到與其最匹配的一個等級;序數型維度按照能力由低到高劃分為1...N級,並以論文首次公開發佈的日期作為時間標記。隨後,通過對序數等級與發佈日期進行最小二乘回歸計算增長率,並按照坐標軸跨度(N)進行歸一化,最終以每年佔完整量程的百分比形式表示(autonomy 8.8%、explainability 5.8%、evaluation focus 6.9%)。


表2: 該表僅覆蓋從規格說明到RTL生成這一階段,因為這是目前最容易量化、證據也最充分的環節。按照基準測試中的模組規模,進一步劃分為元件級(≤150行程式碼)和系統級(>200行程式碼)兩個層級。表中每一個數值均為基於多個來源彙總得到的中心估計值,通過整合所引用研究的資料,在儘可能保持任務一致的同時,降低不同模型、基準測試和評價指標相互混雜所造成的影響;每個記憶體格的資料來源均在Notes欄中註明。正確性指標採用論文報告的func@1或pass@1中位數(如有);PPA採用相對於人類基線歸一化後的面積—功耗比幾何平均值的中位數;驗證完整性則定義為通過功能驗證的設計(form@k)與語法正確設計(synt@k)之間的比例;時間和成本分別對應論文報告的端到端自動化執行階段間(seconds)以及每個設計累計產生的API呼叫費用($)。

對於未公開報告的資料記憶體格,作者依據所屬層級和整體趨勢進行了估算,並標記為預測值。凡使用人類表現作為參考基線的指標,均按定義固定:correctness和verification integrity = 100%,PPA = 1.00×;而人類完成設計所需的時間和成本,則分別根據對工程師設計工作量以及工程師小時費率的估算得出。

(半導體行業觀察)