Fable 5投研能力首發實測!現已搭載AlphaEngine

Anthropic 最新旗艦模型 Claude Fable 5 來了。我們 AlphaEngine 團隊第一時間用投研實戰中最硬核的題目對它進行了全面測評,直接說結論:Fable 5 在複雜金融推理上,已經是目前最強的模型

圖:AlphaEngine IRB投研能力測評結果

(1)深度測評 Fable 5 投研能力的真實段位

為了系統化評估大模型的投研實戰能力,我們在過去數年間持續收集、整理了一套"投研錯題集":IRB(Investment Research Benchmark)。

目前,IRB 已成為金融投研場景的權威 AI 測評基準,涵蓋財務分析、定量推理、陷阱識別等 18 個核心領域,並從相關性、有用性、流暢性、連貫性等 8 大維度進行人機雙盲評分。

我們基於 IRB 對 Fable 5 進行了全面測評,讓它與 GPT-5.5、OPUS-4.8、Gemini 3.1 Pro、DeepSeek V4、Kimi K2.7 Code、GLM-5.2、Qwen3.7-Max 等 10 款主流模型正面對決。

圖:IRB 8大維度測評比分

結果:Fable 5 在幾乎所有能力維度上均位列第一,且在多數題目上對第二名形成穩定領先

其實更值得注意的不只是分差,而是 Fable 5 贏在哪裡。

這不是靠資訊密度堆分,而是在幾個關鍵推理節點上,比其他模型更穩:

遇到表面矛盾時,先拆機制,不急於下結論;

  • 遇到估值題時,先拆分部和口徑,不用籠統總量糊弄;
  • 遇到歷史復盤時,避免時間倒灌,不拿後來的事實解釋過去;
  • 遇到多變數測算時,區分披露資料和模型假設,不把缺失資訊當既定事實。

這麼說可能還不夠具象,為了讓大家感受到我們測評時的震撼,下面精選 4 道典型題目,逐一拆解 Fable 5 與其他模型的表現差異。

題目一:墨西哥比索中間價背離——表面矛盾解釋

題面:分析 2 月墨西哥比索對人民幣中間價下行 0.8% 的成因,並解釋同期市場即期匯率為何基本持平。

2月墨西哥比索兌人民幣中間價錄得 0.8% 的貶值,但同期市場匯率幾乎沒有波動,需歸因這一背離並給出投資含義。

這是一道典型的"表面矛盾解釋題"——兩個看似矛盾的市場現象同時存在,要求模型識別並解釋其背後的價格形成機制。

Fable 5問題拆成三層:人民幣兌美元中間價、比索兌美元走勢、以及 MXN/CNY 這個交叉價格的形成方式。

拆開後可以看到,人民幣側是主要變數,比索側並沒有同步走弱,因此這不應被解讀成墨西哥資產本身出了風險。

其他模型的典型失敗模式:

  • OPUS-4.8:在比索升值幅度(2.4%)明顯大於人民幣升值幅度(1.4%)的情況下,為了迎合題目中"貶值 0.8%"的設定,強行聲稱"人民幣升得更多";
  • Gemini 3.1 Pro(33 分):大量引入外部知識,編造"墨西哥製造業收縮"、"核心通脹高企"、"美國新關稅政策"等上下文中根本不存在的事實,強行圓謊;
  • 多數模型:把 USD/MXN、MXN/USD、MXN/CNY 口徑混用,或在證據不足時補關稅、製造業等宏觀理由。

這題真正考察的不是匯率知識點,而是模型能不能拆開一個金融現象背後的價格形成機制,並對證據不足的部分保持誠實。

題目二:東山精密主業 + 索爾思分產品線估值——長上下文財務建模

題面:對東山精密進行分部估值,將本體業務與索爾思光電分別定價,並按 800G 光模組、1.6T 光模組、光晶片等細分產品線拆解各自的營收與利潤貢獻。

這是一道超長上下文(11.8 萬 token,50 個文件片段)的財務建模壓力題,要求從散落在多家券商研報中的碎片數字裡,搭建出完整的 SOTP 估值框架。

Fable 5 的優勢是沒有把東山精密當成一個整體去粗略估值,而是先把主業和索爾思拆開,再繼續拆到索爾思內部的 800G、1.6T、光晶片等產品線。

它的推理鏈條是:"產品線出貨量/ASP → 收入 → 利潤 → 估值倍數 → 當前市值隱含預期",這讓結論可覆核,而不是停留在"AI 光模組景氣度高"的籠統判斷。

更重要的是,它把當前市值和機構預測聯絡起來,指出市場大致已在交易 2026 年利潤兌現,真正的分歧在 2027 年能否做到 150-200 億元利潤,以及光晶片外售能否成為獨立估值增量。

其他模型的典型失敗模式:

  • GLM-5.1(57.7 分):在上下文缺乏產品線 ASP 時,強行編造"800G 單價約 450 美金"、"淨利率 30%+"等資料,嚴重的數值幻覺;
  • Kimi K2.7 Code(55.3 分):編造 2026E 800G 單價約 2000 元/只、1.6T 單價約 4500 元/只、光晶片淨利率 55% 等大量虛假假設;
  • DeepSeek V4(52.7 分):表格完整但沒有真正拆出產品線收入利潤,停留在總量層面。

這道題考的是金融研究裡最硬的一類能力:不是總結材料,而是把長文字中的碎片數字組織成可覆核的估值模型。

題目三:萬華化學 2003-2005 熊市逆勢上漲復盤——歷史因果鏈

題面:萬華化學 2001 年上市後雖在 2002 年有所回呼,卻在 2003–2005 年整體熊市環境中逆勢走強,請梳理這一階段行業格局與公司基本面的核心變化。

這是一道長週期歷史復盤題,考驗模型能否正確歸因歷史行情,而不是用今天的知識"倒灌"過去。

Fable 5 的優勢是先判斷行情性質,而不是直接講一個"熊市抗跌"的故事。

它用市值和 PE 的變化反推盈利體量,發現 2003-2005 年股價上漲的同時估值並沒有失控,反而被盈利增長消化,由此把這段行情定義為"盈利驅動的獨立行情"。

然後它把 2002 年下跌解釋為上市初期估值泡沫消化,把之後三年的上漲解釋為 MDI 產能擴張、行業供需緊張、產品價格上漲和盈利釋放共同作用。

其他模型的典型失敗模式:

  • Kimi K2.7 Code(61.3 分):將 2011 年以後的"第五代 MDI 技術單位能耗較國際同行低 28%""煙台基地單噸投資成本僅約 600 元"等後期資料強行嫁接到 2003-2005 年——嚴重的時間倒灌;
  • OPUS-4.8(76.3 分):腦補"入世後冰箱、家電、建築保溫、製鞋等下游對聚氨酯需求快速放量",這些需求歸因在上下文中完全無依據;
  • DeepSeek V4 Flash(43.3 分):大量使用未被上下文支撐的歷史常識填充答案。

歷史復盤最難的不是把故事講圓,而是避免用後來的事實倒灌過去。Fable 5 更好的地方,是用當期市值、PE 和盈利關係解釋行情本質。

題目四:鋰電隔膜企業利潤敏感性測算——多變數金融建模

題面:請從鋰電隔膜行業中選取幾家具備代表性的上市公司,建立未來三年盈利預測與估值彈性模型。研究應以 2025 年單位面積盈利水平為基準,拆分國內與海外業務的出貨、價格和盈利差異,並單獨評估 5μm 等高端隔膜產品的單位利潤及滲透率提升空間。在此基礎上,分別設定價格修復、海外佔比提升、產品結構升級等情景,測算各家公司淨利潤、EPS 和對應 PE 估值區間的變化。最終需要說明各項假設的來源、拆分口徑、敏感性排序,以及三家公司盈利彈性和估值重估潛力的差異。

這是壓力最大的一道題:多主體、多年份、多變數,且上下文存在明顯的資料缺口。任何一個口徑錯都會改變利潤彈性排序。

Fable 5 的優勢是把一個極複雜的多變數問題壓成統一測算框架:三家公司橫向比較,變數拆成出貨量、單平盈利、海外佔比、5μm 高端膜滲透、漲價情景和市值 PE。

它沒有用一個總單平淨利粗暴替代全部結構,而是先說明 2025 年行業盈利底部,再比較國內/海外盈利差異和 5μm 高端需求帶來的單平彈性。

對於 2028 年出貨量、國內外單平淨利等上下文缺口,它用推算和邊界說明處理,而不是把缺失封包裝成確定事實。

其他模型的典型失敗模式:

  • GPT-5.5(64.3 分):強行編造"恩捷 2028 年出貨量 215 億平"、"佛塑 2028 年出貨量 115 億平"(後者與上下文矛盾超一倍),後續利潤和估值全部錯誤;
  • DeepSeek V4 Flash(58.7 分):在缺乏依據時編造"恩捷單平盈利 0.2-0.3 元"、"星源國內單平盈利約 0.01 元"等具體數值;
  • 多數模型:把區域毛利率直接當國內/海外單平淨利,把投資者提問裡的估算當管理層確認。

這道題最適合展示金融建模壓力:變數多、主體多、年份多。Fable 5 的優勢不是只給一個目標價,而是把變數拆開,並區分披露資料和模型假設。

(2)Fable 5 的核心差異化能力:不是"知道更多",而是"推理更穩"

通過 4 道題的橫向對比,Fable 5 的優勢可以提煉為三個核心能力維度:

第一:機制拆解能力,不急於下結論

大多數模型面對複雜金融問題時,傾向於快速給出一個"看起來完整"的答案。Fable 5 的做法不同:它會先識別問題中真正的矛盾或難點在哪裡,然後逐層拆解。

比索中間價背離題中,它先拆人民幣腿和比索腿;東山精密題中,它先拆主業和索爾思,再拆產品線;隔膜題中,它先拆出貨量、單平盈利和結構變數。這種"先拆後算"的習慣,使得最終結論可覆核、可追溯。

第二:證據邊界意識,敢於說"不知道"

在投研場景中,比"說錯"更危險的是"不知道自己不知道"。

Fable 5 在多道題中展現出了鮮明的邊界意識:比索題中主動標註"缺少日度中間價序列";隔膜題中區分"上下文有支撐的資料"和"模型推算的假設"。

相比之下,GPT-5.5 和 DeepSeek V4 Flash 等模型在資料缺口處大量編造具體數值。

第三:時間紀律,不用今天的知識解釋昨天

萬華化學復盤題是這一能力的最佳例證。

多數模型會不自覺地將 2011 年以後的技術迭代和成本優勢"倒灌"到 2003-2005 年,講出一個因果倒置但聽起來合理的故事。

Fable 5 則嚴格圍繞當期可獲得的資料建構因果鏈,這正是買方研究員做歷史復盤時最基本的紀律。

(3)立即體驗 Fable 5 帶來的全新 AI 投研體驗

如果你已經是 AlphaEngine 使用者,現在就可以親身體驗 Fable 5 的威力。

如果您使用的是 AlphaEngine 桌面端,可以在 AlphaClaw 的模型選擇介面切換至 Claude Fable 5。

你也可以繫結微信,這樣就可以隨時隨地通過微信來和Fable 5交流了。

還沒有 AlphaEngine?登錄 www.alphaengine.top 即可使用(僅限機構投資者)。

AlphaEngine APP下載地址:

(Alpha Engineer)