DeepSeek今日于AI開源社區Hugging Face上發布了一個名為DeepSeek-Prover-V2-671B的新模型。

據悉,DeepSeek-Prover-V2-671B使用了更高效的safetensors文件格式,并支持多種計算精度,方便模型更快、更省資源地訓練和部署,參數達6710億,或為去年發布的Prover-V1.5數學模型升級版本。在模型架構上,該模型使用了DeepSeek-V3架構,采用MoE(混合專家)模式,具有61層Transformer層,7168維隱藏層。同時支持超長上下文,最大位置嵌入達16.38萬,使其能處理復雜的數學證明,并且采用了FP8量化,可通過量化技術減小模型大小,提高推理效率。
不過,新模型并不是R2。近半個月來,有關“DeepSeek全新模型R2即將問世”的傳聞持續發酵。除HuggingFace首席執行官Clément Delangue發布動態外,玩家@deedydas也在社交平臺貼出了所謂DeepSeek-R2大模型的詳細技術參數。
據《中國企業家》報道,過去DeepSeek創始人梁文鋒率領的AI團隊始終保持著與國際巨頭同頻的產品迭代節奏——2024年9月推出V2.5版本,12月發布V3基礎架構,次年3月即升級至V3-0324版本,形成每季度重大更新的開發范式。這種緊扣行業脈搏的研發策略,使得業界普遍預測其下一代主力模型R2或將延續“五一檔”發布傳統。
此前就有市場消息稱DeepSeek-R2將提前發布,DeepSeek官方企業咨詢賬號則在用戶群中辟謠稱R2發布為假消息。目前,DeepSeek官方尚未正式公布R2的具體日期及技術細節等,市場預期R2將于5月發布。
