登入
關鍵字
#金牌
官方認證
小星星
2026/09/25
•
“六金王”,張展碩!
9月24日 在第二十屆亞運會游泳比賽 男子4×100米自由泳接力決賽中 由趙家悅、王浩宇、張展碩、潘展樂
體育
#亞運會
#游泳比賽
#金牌
讚
留言
分享
官方認證
小星星
2026/02/23
•
谷愛凌再奪金牌 成就冬奧會三冠王
法媒報導,在米蘭-科爾蒂納2026年冬季奧運會上,中國選手谷愛凌在自由式滑雪U型場地(halfpipe)項目中奪得金牌,這是她本屆冬奧會獲得的第三枚獎牌。中國選手谷愛凌在U型場地技巧資格賽比賽中 新華社2月22日,中國選手谷愛凌在比賽中。新華社在周日於利維尼奧舉行的決賽中,比賽跌宕起伏,選手頻頻失誤摔倒。22歲的谷愛凌在最後一輪憑藉一次完美發揮,拿下全場最高分94.75分,成功奪冠。她的中國隊隊友李方慧以93分獲得銀牌,英國選手佐伊·阿特金以92.5分摘得銅牌。2月22日,中國選手谷愛凌在女子U型場地技巧冠軍頒獎儀式上。新華社當最後一位對手的分數公佈時,谷愛凌激動落淚。這枚金牌為她的第二屆冬奧會畫上了完美句號,也成為她職業生涯的第三枚奧運金牌。早在北京冬奧會時,年僅青少年的她就曾創造歷史,成為首位在單屆冬奧會上斬獲三枚獎牌的自由式滑雪運動員(大跳台和U型場地金牌、坡面障礙技巧銀牌)。如今,她已成為冬奧會最受矚目的運動員之一——據《福布斯》統計,她在2025年是全球收入第五高的女運動員。本屆義大利冬奧會上,她再添兩枚銀牌和一枚金牌。谷愛凌自2019年起代表中國參賽。至此,她已成為冬奧會歷史上獲得獎牌最多的自由式滑雪運動員(男女合計)。 (歐時大參)
體育
#谷愛凌
#金牌
#冬季奧運
讚
留言
分享
官方認證
小小天下
2026/02/21
•
金牌夫妻誕生!王心迪摘中國第四金!妻子徐夢桃兩天前衛冕女子冠軍
台北時間2月20日晚,在米蘭冬奧會自由式滑雪男子空中技巧決賽中,中國選手王心迪一舉奪得金牌,這也是中國代表團在本屆冬奧會上第四金!值得一提的是,中國選手的妻子徐夢桃在兩天前衛冕了該項目女子冠軍,這也是冬奧會歷史上首次出現夫妻二人同時拿到金牌的壯舉。↑中國選手王心迪在比賽間隙自由式滑雪男子空中技巧被稱為“空中芭蕾”,跳台上運動員眼花繚亂的精彩動作極具觀賞性。此次決賽中,共有12名選手參與比拚,第一輪有兩跳的機會,成績最好的前6名的選手晉級,決賽第二輪一跳定勝負。中國隊憑藉預賽中的出色發揮,齊廣璞、孫佳旭、王心迪和李天馬4人全部晉級決賽,形成了集團優勢。金牌夫妻誕生!王心迪奪冠!妻子是徐夢桃台北時間2月20日晚,在米蘭冬奧會自由式滑雪男子空中技巧決賽中,中國選手王心迪一舉奪得金牌,這也是中國代表團在本屆冬奧會上第四金!值得一提的是,王心迪的妻子徐夢桃在兩天前衛冕了該項目女子冠軍,這也是冬奧會歷史上首次出現夫妻二人同時拿到金牌的壯舉。自由式滑雪男子空中技巧被稱為“空中芭蕾”,跳台上運動員眼花繚亂的精彩動作極具觀賞性。此次決賽中,共有12名選手參與比拚,第一輪有兩跳的機會,成績最好的前6名的選手晉級,決賽第二輪一跳定勝負。中國隊憑藉預賽中的出色發揮,齊廣璞、孫佳旭、王心迪和李天馬4人全部晉級決賽,形成了集團優勢。台北時間2月20日決賽拉開帷幕,第一輪第一跳,排在第五位登場的孫佳旭獲得117.26分,緊接著李天馬獲得119.91分;隨後,王心迪獲得120.36分;最倒數第二位出場的齊廣璞獲得121.68分。第二跳,孫佳旭、李天馬、王心迪、齊廣璞均未能超越自己的第一跳得分,但憑藉第一跳打下的堅實基礎,4名中國選手分別位列第3至第6名,攜手晉級決賽第二輪,排在前兩名的則是兩位來自瑞士的選手。決賽第二輪,場上氣氛異常緊張,由於該項目集動作難度、臨場應變、心理調節和運氣等多方面因素影響,是冬奧賽場上偶然性最大的項目之一,所以具備冠軍實力,並不意味著就能奪得冠軍。在一跳定勝負的決賽舞台,而且要使用難度係數最高的動作,選手的壓力可想而知。六位晉級選手依次開賽,前三位出場的孫佳旭、李天馬、王心迪都完美完成了自己最好的一跳,分別拿到123.42分、123.93分、132.60分,第四位出場的齊廣璞落地出現瑕疵,拿到81.00分退出了獎牌爭奪。第五位出場的瑞士選手落地出現失誤,僅得到99.32分,同樣無緣領獎台。最後一位出場的瑞士選手諾埃·羅特最終得到131.58分。這樣一來,王心迪以132.60分的全場最高分獲得金牌,諾埃·羅特獲得銀牌,李天馬則獲得銅牌。2月18日,米蘭冬奧會自由式滑雪女子空中技巧決賽,中國女將徐夢桃摘得金牌,成為冬奧會該項目歷史上成功衛冕冠軍的第一人。兩天之後,王心迪也在男子項目中奪冠,夫妻二人在冬奧賽場上演了一段佳話。(大河報)
體育
#米蘭冬奧會
#自由式滑雪
#中國選手
讚
留言
分享
官方認證
小小天下
2026/02/21
•
意想不到!蘇翊鳴在馬來西亞掀起冰雪運動狂潮
據報導,21歲的中國單板滑雪運動員蘇翊鳴吸引了大批馬來西亞觀眾收看米蘭-科爾蒂納冬奧會。由於馬來西亞的熱帶氣候,冬季奧運會歷來很少受到關注。Google趨勢顯示,與米蘭-科爾蒂納冬奧會滑雪賽事相關的搜尋量超過50,000次,在短短10小時內增長了1,000%。搜尋量比本菲卡隊與皇家馬德里隊之間的歐洲冠軍聯賽淘汰賽的搜尋量高出3萬次。蘇翊鳴是第一位在大空氣滑雪項目上贏得奧運會金牌的中國運動員,這項運動長期以來一直由西方運動員主導。他與日本選手平野步一起,成為首批在北京冬奧會上奪得奧運金牌的亞洲滑雪運動員之一。除了獎牌之外,蘇翊鳴的受歡迎還源於他作為Z世代偶像的吸引力。在成為奧運選手之前,他已經是一名成功的童星,出演過《智取威虎山》等電影。他從表演轉向精英體育的能力引起了擁抱非線性職業道路的一代人的共鳴。除此之外,蘇翊鳴還因其對心理健康問題的開放態度而聞名,他在2022年之後休息了一年半,以在名聲壓力後重新找到動力。他的街頭服飾風格、對嘻哈音樂的熱愛和輕鬆的性格進一步將他與青年文化聯絡起來。蘇翊鳴以衛冕奧運會冠軍的身份參加2026年米蘭-科爾蒂納奧運會。他最近在2月7日獲得銅牌,並在2月18日獲得坡面技巧賽決賽資格,重新引起了公眾的興趣。他的復出故事——從預選賽中摔倒到決賽中完成1,980度旋轉——在馬來西亞社交媒體上被廣泛分享,並在社交媒體上引起了強烈共鳴。分析人士指出,馬來西亞對中國運動員的興趣往往在重大國際體育賽事期間達到頂峰,部分原因是文化上的接近以及通過微博和抖音等平台的曝光。除此之外,韓國女運動員崔高恩(Choi Gaon)在女子U型池項目中獲得了金牌,她戰勝了美國最受歡迎的克洛伊·金(Chloe Kim),後者正在追逐連續第三屆奧運會金牌。鑑於馬來西亞長期以來對韓國流行文化的熱情,這場勝利再次引發了馬來西亞人對滑雪運動的興趣。 (APD環球觀瀾)
體育
#蘇翊鳴
#中國單板滑雪
#米蘭冬奧會
讚
留言
分享
官方認證
小星星
2026/02/11
•
“它散架了”!米蘭冬奧會獎牌問題不斷,組委會:正調查具體原因
據CCTV國際時訊:多家媒體報導,2026年米蘭冬奧會開賽以來,接連發生選手所獲獎牌出現裂紋、缺口甚至脫落、斷裂的情況。對此,本屆冬奧會首席營運官2月9日表示,組委會對出現這種情況予以高度關注,正在調查具體原因。“請輕拿輕放。”這是米蘭冬奧會金牌得主布裡齊·約翰遜的提醒,此前她和其他運動員在頒獎後僅數小時內發現獎牌出現損壞。據瞭解,包括美國高山滑雪冠軍布裡茲·約翰遜的金牌、瑞典越野滑雪選手埃芭·安德森的銀牌、德國冬季兩項選手尤斯圖斯·斯特雷洛的銅牌在內,多位選手的獎牌都出現了問題。有知情人士表示,問題可能出在獎牌的掛繩上,該掛繩配有法律要求的防勒斷結構,被設計成在受到強力拉扯時會自動鬆開,以防止佩戴者被勒住。 (封面新聞)
體育
#米蘭冬奧
#獎牌問題
#金牌
讚
留言
分享
官方認證
RexAA
2025/12/02
•
重磅!DeepSeek V3.2 特別版發佈:性能超越GPT-5,硬剛Gemini 3.0「IOI/IMO金牌」
DeepSeek-V3.2系列模型正式上線作為“為Agent建構的推理優先模型”,DeepSeek-V3.2包含兩個版本:DeepSeek-V3.2:V3.2-Exp的官方繼任者,平衡了推理能力與生成長度,性能對標GPT-5,現已上線App、Web端及APIDeepSeek-V3.2-Speciale:專攻深度推理能力的極限版本,性能超越GPT-5,比肩Gemini-3.0-Pro,目前僅通過API提供技術報告顯示,DeepSeek-V3.2-Speciale在2025年國際數學奧林匹克(IMO)、國際資訊學奧林匹克(IOI)、ICPC世界總決賽及CMO中均取得了金牌級成績官方已公開上述競賽的最終提交結果,社區可通過assets/olympiad_cases進行二次驗證技術報告:https://huggingface.co/deepseek-ai/DeepSeek-V3.2/blob/main/assets/paper.pdf以下是詳細資訊核心能力與技術突破DeepSeek-V3.2基於三大技術突破,實現了高計算效率與卓越推理、Agent性能的統一:1.DeepSeek Sparse Attention (DSA):引入高效注意力機制,大幅降低計算複雜度,並針對長上下文場景進行了最佳化2.可擴展強化學習框架:通過穩健的RL協議與後訓練(post-training)算力擴展,實現了高性能表現3.大規模Agent任務合成管線:涵蓋1800+環境及8.5萬+複雜指令這一合成管線不僅提升了模型在複雜互動環境中的遵循度和泛化能力,更讓DeepSeek-V3.2將“思考”直接整合進工具使用(Tool-Use)的模型,同時支援在思考和非思考模式下使用工具API更新與Speciale版限制DeepSeek-V3.2:API使用模式與V3.2-Exp保持一致,作為日常主力模型(Daily Driver),提供GPT-5等級的性能DeepSeek-V3.2-Speciale:該版本專為解決複雜任務設計,消耗更多Token,目前僅作為API提供,具體限制如下:臨時端點:需使用base_url="https://api.deepseek.com/v3.2_speciale_expires_on_20251215"服務期限:該端點服務至2025年12月15日 15:59 (UTC) 截止功能限制:不支援工具呼叫(Tool Calls),僅用於支援社區評估與研究。定價:與DeepSeek-V3.2保持一致聊天範本重大調整DeepSeek-V3.2不再提供Jinja格式範本,並引入了“帶工具思考”及新角色設定。Python指令碼編碼:官方提供了encoding資料夾,包含Python指令碼(encoding_dsv32.py),用於將OpenAI相容格式消息編碼為模型輸入字串及解析輸出Developer角色:範本新增developer角色,專門用於搜尋Agent場景,官方API不接受分配給該角色的消息輸出解析注意:提供的解析函數僅處理格式良好的字串,生產環境需自行增加穩健的錯誤處理機制。程式碼示例如下:import transformersfrom encoding_dsv32 import encode_messagestokenizer = transformers.AutoTokenizer.from_pretrained("deepseek-ai/DeepSeek-V3.2")messages = [ {"role": "user", "content": "hello"}, {"role": "assistant", "content": "Hello! I am DeepSeek.", "reasoning_content": "thinking..."}, {"role": "user", "content": "1+1=?"}]# 思考模式配置encode_config = dict(thinking_mode="thinking", drop_thinking=True, add_default_bos_token=True)prompt = encode_messages(messages, **encode_config)tokens = tokenizer.encode(prompt)本地部署建議模型結構與DeepSeek-V3.2-Exp相同。採樣參數:建議設定 temperature = 1.0,top_p = 0.95。Speciale版提示:本地部署Speciale版本時,同樣不支援工具呼叫功能開源與協議倉庫及模型權重均採用 MIT License 授權。 (AI寒武紀)
科技
#DeepSeek V3.2
#GPT-5
#Gemini 3.0
讚
留言
分享
官方認證
北風窗
2025/11/28
•
DeepSeekMath-V2炸場!普特南競賽接近滿分,IMO 2025金牌,專攻“自驗證”推理
DeepSeek王者歸來!剛剛發佈了DeepSeekMath-V2在IMO 2025和 CMO(中國數學奧林匹克) 2024 中,DeepSeekMath-V2均達到了金牌水平。在 Putnam(普特南數學競賽。地位:北美地區「美國和加拿大」最頂尖、最負盛名的大學本科生數學競賽) 2024 競賽中,更是隨著測試時計算量(test-time compute)的擴展,拿下了 118/120 的幾近滿分成績。這一成果表明,自驗證數學推理(Self-Verifiable Mathematical Reasoning)是一條可行的研究路徑核心要點如下為什麼需要自驗證?過去一年,大語言模型通過基於最終答案正確性的強化學習,在AIME和HMMT等定量推理競賽中取得了長足進步,甚至達到飽和但這種方法面臨根本性侷限:答案對 推理對:追求更高的答案精準率,並不能解決推理過程中的核心問題。非數值任務失效:許多數學任務(如定理證明)需要嚴謹的逐步推導,而非簡單的數值答案,無法應用基於最終答案的獎勵機制為了突破深度推理的極限,驗證數學推理的全面性和嚴謹性至關重要。特別是對於沒有已知解決方案的開放性問題,自驗證是擴展測試時計算量(scaling test-time compute)的關鍵DeepSeekMath-V2 是怎麼做的?DeepSeek團隊通過以下步驟實現自驗證數學推理:1.訓練驗證器:訓練一個精準且忠實的大模型驗證器(Verifier),專門用於定理證明。2.訓練生成器:將上述驗證器作為獎勵模型(Reward Model)來訓練證明生成器3.自我糾錯:激勵生成器在最終定稿前,主動識別並解決自身證明中的問題4.動態進化:為了在生成器變強時保持“生成-驗證”的差距,通過擴展驗證計算來自動標註難以驗證的新證明,生成訓練資料以進一步提升驗證器評測結果DeepSeekMath-V2在IMO-ProofBench(由DeepThink IMO-Gold背後的GoogleDeepMind團隊開發)展現了強大的定理證明能力:IMO 2025:達到金牌水平CMO 2024:達到金牌水平。Putnam 2024:取得118/120的超高分快速上手DeepSeekMath-V2建立在 DeepSeek-V3.2-Exp-Base 之上。如需推理支援,可參考 DeepSeek-V3.2-Exp 的 GitHub 倉庫 (AI寒武紀)
科技
#DeepSeek
#IMO
#金牌
讚
留言
分享
官方認證
北風窗
2025/11/28
•
【DeepSeek】GPT-5危了!DeepSeek開源世界首個奧數金牌AI,正面硬剛Google
沉寂許久的DeepSeek又回來了!今天,DeepSeekMath-V2重磅登場,一舉奪下IMO 2025金牌,實力媲美甚至超越了Google的IMO金牌模型,開源AI再次扳回一局。DeepSeek再次歸來!剛剛,DeepSeek重磅發佈DeepSeekMath-V2新模型,一舉奪下IMO 2025金牌。最關鍵的是,這是首款「開放原始碼的IMO金牌模型」。基於DeepSeek V3.2 Exp Base建構當前,已官宣拿下金牌的兩大模型,一款來自GoogleGemini Deep Think,另一款便來自OpenAI的內部模型。在IMO-ProofBench中,DeepSeekMath-V2展現出強大的定理證明能力:IMO 2025:破解5題(共6題),達到了金牌水平;CMO 2024(中國數學奧林匹克):達到金牌水平;Putnam 2024:得分118接近滿分(120分),超越人類參賽者最高分(90分)。不僅如此,在ProofBench-Basic上,DeepSeekMath-V2的實力碾壓Google金牌模型——Gemini Deep Think;在ProofBench-Advanced上直追Google。論文中,團隊訓練了一個基於LLM驗證器(Verifier)作為獎勵函數,並以此訓練模型以自主解決問題。而且,他們還Scaling了驗證器算力,來標註更複雜的證明,進一步最佳化了驗證器本身。這種方法非常巧妙,能有效彌合生成與驗證之間的差距。結果實證「可驗證的數學推理」,是未來一條可行的研究方向。DeepSeekMath-V2 讓「自驗證」成最強武器DeepSeekMath-V2的論文也於GitHub同步放出了。DeepSeek最新發佈的DeepSeekMath-V2帶來的核心突破就是:自驗證(Self-Verification)。這不僅讓它在最難的數學競賽中橫掃人類頂尖選手,更重要的是,它揭示了通往更高級AI的一條必經之路——學會自我反思。為什麼只看結果是不夠的在過去,訓練AI做數學題的方法很簡單:給它一道題,如果它算出的答案和標準答案一致,就給它獎勵。這在簡單的計算題(如AIME競賽)中很有效。但到了數學皇冠上的明珠——國際數學奧林匹克(IMO)這個等級,這種方法就徹底失效了。因為IMO的題目往往沒有簡單的數值答案,而是要求你寫出一段邏輯無懈可擊的證明過程。以前的AI在這裡經常是個「大忽悠」,它能胡編亂造一通看起來很專業的數學黑話,最後強行得出一個結論。雖然它可能蒙對了結果,但過程全是漏洞。DeepSeekMath-V2決定從根本上改變規則,不僅要獎勵正確的答案,更要獎勵嚴謹的「自我找茬」過程。秘密武器:左右互搏的三位一體為了實現這種「自我反思」,DeepSeek設計了一套精妙的「左右互搏」系統,就像在AI的大腦裡住了三個人:1.「做題家」(Generator,證明生成器):負責解題和寫證明。但與以往不同,它被訓練成不僅要寫答案,還要寫一段「自我評價」。它必須誠實地說:「這步我有點不確定,可能是錯的。」研究團隊巧妙設計了獎勵,帶來了下列激勵效果:誠實面對錯誤,比「硬說自己是對的」更有利。寫出真正正確的證明,並精準識別其嚴謹程度,可以獲得最高獎勵。對生成器來說,最優策略是:在最終回答前,發現並修正儘可能多的問題。2.「鐵面判官」(Verifier,證明驗證器):這是DeepSeek專門訓練的一個評分模型。它不看答案對不對,而是專門盯著證明過程挑刺。它會像閱卷老師一樣,給證明打分(0分、0.5分、1分),並指出具體的邏輯漏洞。1分:證明完整且嚴謹,所有關鍵推理步驟都有清晰、充分的論證;0.5分:整體思路正確,但在細節上存在輕微錯誤或略去部分論證;0分:存在致命邏輯錯誤或關鍵缺口,導致證明在本質上不成立。3.「判官的審計員」(Meta-Verifier,元驗證器):這是最絕的一步。因為「判官」也可能犯錯,或者為了省事偷懶瞎判。於是DeepSeek又引入了一個「元驗證」機制,專門檢查「判官」是不是在胡亂挑刺。如果「判官」指出了一個不存在的錯誤,它會被「審計員」打手板。「元驗證器」來檢查驗證器給出的分析,包括:1. 驗證器指出的問題是否真實存在於原證明中;2. 這些問題是否足以合理支撐它給出的得分,且符合原有的評分細則。用元驗證器來評估驗證器輸出分析的平均質量分數,從0.85提升到了0.96,同時保持了原有的打分精準率。在這三者的配合下,DeepSeekMath-V2甚至能做到在沒有標準答案的情況下,自己給自己出題、自己做、自己批改、自己重做。首先,證明驗證器與證明生成器之間形成了良性的「閉環」:驗證器為生成器提供獎勵訊號,從而不斷提高生成器的證明能力;隨著生成器水平提升,它會產生越來越「刁鑽」的新證明,這些證明反過來又會暴露出驗證器尚未覆蓋的薄弱點。尤其是那些「驗證器第一次嘗試沒能抓出問題」的證明樣本,對進一步訓練驗證器來說價值極高。為了高效獲取新證明的正確性標籤,研究團隊設計了自動化標籤生成流程:在最後兩輪訓練迭代中,這條全自動標註流水線已經完全替代了人工標註。後續的質量檢查表明,自動生成的標籤與人類專家的判斷高度一致。巔峰對決:DeepSeek vs Gemini在這個領域,DeepSeek並不孤單。GoogleDeepMind的Gemini Deep Think也是剛達到IMO金牌水平的頂尖選手。兩者的對比非常有意思:DeepMind像是擁有無盡資源的貴族,其實力毋庸置疑,在某些高級基準測試(如IMO-ProofBench Advanced)上依然保持領先。DeepSeek則像是半路殺出的天才少年。根據DeepSeek的論文,他們的V2模型在基礎測試集(ProofBench Basic)上已經反超了Gemini Deep Think,並且在公開的競賽題目上展現出了驚人的統治力。更重要的是,DeepSeek將這一技術路徑開源並詳細披露了訓練方法。這為全世界的AI研究者提了個醒:通往AGI的路上,自驗證可能比單純堆算力更重要。直追GoogleOpenAI,開源IMO模型贏了這一令人驚嘆的成績背後,是DeepSeekMath-V2在實驗中展現出的某種「反直覺」的進化特徵。「一次做對」的能力:全方位碾壓GPT-5和Gemini如果剝離掉所有複雜的反覆思考和驗證過程,只看模型的「第一直覺」——也就是所謂的One-Shot能力,DeepSeekMath-V2依然表現出了統治級的實力。研究團隊建構了一個包含代數、幾何、數論、組合和不等式五大類難題的內部測試集CNML(難度對標中國高中數學聯賽)。在這個競技場上,DeepSeekMath-V2與目前市面上最強的兩大推理模型——OpenAI的GPT-5-Thinking-High和GoogleDeepMind的Gemini 2.5-Pro進行了正面硬剛。結果如圖所示:DeepSeekMath-V2並不是險勝,而是完全勝利:代數:遠超GPT-5和Gemini;幾何:得分幾乎是Gemini 2.5-Pro的三倍;數論與組合:同樣穩穩佔據第一梯隊。這說明,即使不給模型「多想一會兒」的機會,它的底座能力已經極其強悍。進化的關鍵:讓模型「多想幾次」真正讓DeepSeekMath-V2與眾不同的,是它在連續修正實驗中的表現。在面對IMO候選題(Shortlist)這種等級的難題時,模型往往無法一次性寫出完美的證明。實驗顯示,如果允許模型進行「自我驗證」——即生成答案後,自己挑毛病,然後帶著問題重新生成,奇蹟就發生了:初始狀態(迭代1次):模型的平均得分為0.15。反覆思考(迭代8次):當允許模型最多進行8次「自我修正」後,證明的質量分數飆升到了0.27。更有趣的是,如果讓模型從自己生成的32個解法中挑一個最好的(Best@32),它的評分精準度極高,得分直接躍升至0.42。這證實了一個關鍵點:模型不僅能改錯,而且非常有自知之明,它清楚地知道自己那個答案是最好的。暴力美學與智慧的結晶:高算力搜尋前文提到的普特南數學競賽118分(接近滿分)的「神蹟」,並非僅靠運氣,而是得益於一種「高算力搜尋」(High-Compute Search)策略。DeepSeek團隊在實驗中採用了一種極端嚴苛的測試方式:1.海量候選:對每道題初始生成64個候選證明。2.地獄級驗證:為每一個證明生成64個獨立的驗證分析。3.優勝劣汰:只有那些能通過所有64次驗證的證明,才會被認為是「完全可信」的。正是這種「千錘百煉」的策略,讓模型解決了IMO 2025中6道題裡的5道,以及在CMO 2024中拿下金牌水平。實驗資料還揭示了一個有趣的現象:對於那些它沒做出來的題,模型通常能精準地找出自己證明中的漏洞;而對於做出來的題,則是真真切切地通過了所有考驗。這是「LLM可以被訓練成可靠的數學驗證者」這一假設的有力實證。DeepSeekMath-V2意味著什麼DeepSeekMath-V2的成功告訴我們,AI正在從「模仿人類說話」進化到「模仿人類思考」。真正的思考,往往伴隨著自我懷疑。當我們看到AI開始在輸出最終結果前,懂得停下來,對自己說一句「這看起來不太對,我再算一遍」時,那才是它真正超越工具屬性的時刻。真正的智慧,不僅在於瞬間給出答案,更在於擁有推翻自己的勇氣與能力。 (新智元)
科技
#DeepSeek
#開源AI
#IMO金牌模型
讚
留言
分享