

《AI系列深度技術合集(全集)》
1、01期:從數字AI通用底座到物理AI真實世界閉環
2、02期:AGI是什么?
3、04期:什么是表征?
4、03期:數字AI與物理AI的邊界在哪里?
5、06期:Transformer如何從序列任務走向基座模型?
6、05期:模型如何學習表征并實現對齊?
7、07期:CNN與ViT兩類視覺骨干有何差異?
8、08期:GAN與Diffusion兩類生成范式有何差異?
9、10期:預訓練與后訓練如何塑造大模型?
...
15、15期:Transformer如何開啟AI第二次爆發?
《800+份重磅ChatGPT/AIGC專業報告》,《吉瓦(GW)級開放智算中心框架技術報告》,《兆瓦級算力系統AI整機柜DC800V供電架構研究報告》已傳至智能計算芯知識,請批量下載。
從初代 GPT 基座到如今可落地的對話、具身智能模型,行業始終繞不開一組核心劃分:預訓練搭建能力底座,后訓練完成產品化適配。二者并非簡單的先后工序,而是一套分工清晰、互相約束的完整訓練體系。
隨著物理 AI 浪潮到來,這套訓練框架實現跨場景復用,也暴露出數字世界與現實物理場景截然不同的數據瓶頸。看懂兩段訓練流程的分工、演變與行業重心遷移,才能真正理解大模型能力從無到有的完整塑造路徑。

預訓練概念最早源于深度學習早年逐層初始化參數的技術手段,遷移學習普及后才有了如今通用定義:依托全網文本、圖像、視頻這類低成本、無人工標注的海量素材,以自監督模式完成基礎學習,本質是給模型搭建一套覆蓋通用知識、邏輯、多模態關聯的底層底座。整個階段的核心任務只有一個 ——“預測下一個詞”,模型在海量語料中自主歸納語法、常識、事實與淺層推理規律,行業經典的 Scaling Law(擴展律)也由此而來:在算力、參數量、訓練 Token 按匹配比例擴張時,模型基礎能力會穩定提升,Chinchilla 實驗更是修正早期行業誤區,給出 “每 1 個參數匹配 20 個訓練 Token” 的最優配比,避免單純堆砌參數卻缺少足量數據支撐的無效投入。
從資源投入維度看,預訓練是典型重資本規模競賽,動輒數千張 GPU 連續訓練數月,成本千萬級別,天然只適合頭部基座廠商參與。但這套流程存在天然邊界:當下可便捷獲取的高質量公共文本資源存量有限,業內測算最快 2028 年就會觸及供給天花板,互聯網文本數據如同 AI 行業的 “化石燃料”,單純依靠擴大預訓練規模提升能力的路線已經走到邊際收益遞減區間。更關鍵的是,僅完成預訓練的基座模型只具備文本續寫能力,沒有指令遵循意識,無法對齊人類使用習慣,哪怕儲備海量知識,也不能直接面向終端交付,這就為后訓練留出了不可替代的價值空間。
如果說預訓練是對模型做通識基礎教育,后訓練就是針對性的崗前適配,它依托規模遠小于預訓練、但標注質量極高的指令、人類偏好、可驗證反饋數據,在成型基座之上完成二次優化,決定模型最終怎么理解指令、輸出內容、遵守安全邊界、完成邏輯推理。經過多年迭代,后訓練已經形成一套成熟多元的技術工具箱,不同方法適配不同優化目標:
后訓練階段算力投入僅為預訓練的 1%-5%,迭代周期短、邊際收益顯著,國內廠商普遍選擇以此作為差異化突破賽道。但這套流程同樣存在短板,對齊優化有時會損耗模型原生儲備的知識,也就是行業所說的 “對齊稅”;同時模型容易刻意迎合獎勵信號而非解決真實任務,出現 “獎勵欺騙” 問題,需要搭配多重校驗機制規避缺陷。
近年行業還出現了兩類延伸概念,正在模糊預訓練與后訓練的傳統邊界:
一是中訓練 Mid-training,介于兩大階段之間,使用大規模無標注數據做定向能力補強,多用于長上下文、多語言能力擴容;
二是推理時計算 Test-time Compute,不再改動模型權重,而是在用戶調用階段投入額外算力,讓模型自主生成多路徑推理步驟、自我校驗修正,OpenAI o1、DeepSeek-R1 均依靠這套思路,用中小體量模型實現比肩超大基座的推理效果,算力投入重心正逐步從訓練側向推理側轉移。
而思維鏈 CoT 則是串聯整個體系的關鍵載體:預訓練讓模型具備分步推理的底層能力,后訓練強化自主輸出推理步驟的習慣,推理時計算則放開算力預算,最大化釋放長鏈思考效果。
預訓練 + 后訓練的兩段式架構,不只是大語言模型專屬,英偉達、谷歌等企業推出的 Physical AI(物理 AI,包含人形機器人、自動駕駛 VLA 模型)完全復用這套范式,實現 “框架同構,數據分立”。數字 AI 的訓練鏈路邏輯簡單清晰:預訓練以全網文本、圖文素材為主,后訓練依托人類主觀偏好反饋做對齊;其發展瓶頸是公共文本資源見底,行業可通過合成數據、多模態拓展、加碼后訓練緩解約束。
物理 AI 則在同一框架下遇到完全不同的難題。預訓練環節,機器人、自動駕駛模型不會從零訓練視覺語言骨干,而是直接復用成熟 VLM 底座,再疊加駕駛視頻、機器人真機運動軌跡二次訓練;后訓練階段的反饋信號不再是人類文字偏好,而是物理環境反饋、動作完成度、碰撞安全約束等客觀獎勵;最核心的瓶頸在于真機交互數據極度稀缺,即便 Open X-Embodiment 整合百萬級機器人軌跡樣本,數據規模和豐富度依舊遠不及互聯網文本,遙操作采集、真機測試成本高昂,仿真環境與現實場景的遷移鴻溝難以徹底抹平。
整體來看,預訓練和后訓練永遠是互補而非替代的關系:沒有預訓練搭建的通用知識底座,后訓練再精細的對齊優化都無從談起;缺少后訓練完成的適配約束,再強大的基座模型也無法落地商用。隨著中訓練、推理時計算、物理 AI 訓練體系持續迭代,這套基礎框架還會不斷延伸擴容,但 “預訓練定上限、后訓練定可用性” 的核心分工,依舊是理解所有大模型技術迭代的根本邏輯。


本號知識合集

免責申明:本號聚焦相關技術分享,內容觀點不代表本號立場,可追溯內容均注明來源,發布文章若存在版權等問題,請留言聯系刪除,謝謝。

