
它的本質是什么?跟大模型和前段時間很火的skills, RAG, mcp, memory 又有什么關系?

接下來我們就一次性將這些概念串起來帶大家看清楚,來一波技術祛魅。看之前,你點贊了嗎?關注了嗎?謝謝!
像chatgpt, deepseek這類大模型,本質上就是個超大文件,
gpt-4.bin, deepseek-v3.bin
它躺在磁盤上。文件里裝的就是訓練時學到的知識參數。

要讓它工作,得有個程序把它加載到內存里,對外暴露HTTP接口,
接收用戶請求,做推理,返回結果。這就是推理服務。給它配個前端網頁聊天框,就成了我們熟悉的聊天AI。

推理服務本質是個 HTTP 服務,每個請求進來,處理完就結束,本身不保存任何狀態。而且為了扛住高并發,一般會部署多個推理服務實例做負載均衡。你第一次請求可能打到機器 A,第二次請求可能打到機器 B,完全是兩個不同的進程。

但問題來了,我們在AI聊天頁面里,明顯感覺它能"記得"我們之前的對話。這是怎么做到的?
其實大模型本身什么都不記得。每次請求時,系統會把之前的聊天記錄重新拼到對話里,一起發給大模型。這些拼起來發給大模型的內容,統稱上下文。大模型看到完整上下文,自然就能接上話了。
但問題又來了,如果每次請求都把所有歷史對話發出去,上下文會超長,大模型處理不了。怎么辦呢? 我們可以分兩類管理:當前會話最近幾輪對話完整保存,這叫短期記憶。很久之前的對話提取關鍵信息壓縮成摘要,這叫長期記憶。

每次請求時,都將它們拼進對話,發給大模型。這樣大模型看起來就像有記憶一樣。
這套管理上下文的機制,就叫 Memory。

有了記憶,大模型能記住歷史對話了。但新問題又來了,大模型的訓練數據,都是從互聯網上抓的歷史公開數據,訓練完成后知識就固定了。你問它今天的新聞或公司內部文檔,它根本不可能知道。
怎么辦?給它配個外部知識庫,里面可以放最新新聞、公司內部文檔這些資料,數據量大的話,就存到數據庫里。
用戶提問時,先從數據庫里做匹配,獲得相關知識,再一起喂給大模型。大模型就能基于這些外部知識回答。這種"檢索外部知識給到大模型做回答"的方案,就是檢索增強生成,Retrieval-Augmented Generation,簡稱RAG。

但問題又來了,傳統數據庫只能做字面匹配,但"黃楓谷歷飛羽"和"韓老魔"雖然意思一樣,字面卻完全不同,匹配不到。怎么辦呢?我們可以把文本轉成向量,用向量距離衡量語義相似度。

這樣語義相近的文本就能匹配上了。所以RAG用的數據庫里存的是向量數據,這種數據庫也叫向量數據庫,比如 Milvus , 數據量不大的話,也可以用我們的老朋友PostgreSQL。

有了memory和RAG的加持,大模型能記住歷史聊天和獲取外部知識了。但新問題又來了,現在大模型只能對話和思考,就像缸中大腦,沒有手腳。怎么讓它具備操作工具的能力呢?
好辦,我們可以在對話里約定一種消息格式。外部先告訴大模型有哪些工具可用,格式像這樣:
大模型想用工具時,輸出一段特定格式JSON, 比如發郵件,里面寫清楚要發給誰和發什么。

外部收到消息后,執行發送郵件,完成后,將返回的結果再喂回給大模型。

大模型就能基于工具執行結果,生成最終回復

這種大模型和外部程序之間通過特定格式,來表達工具調用意圖的機制,被稱為 Function Calling;而外部程序根據這一意圖與工具插件交互的協議,則被稱為 Model Context Protocol,簡稱 MCP。
這個在外部負責解析JSON 并操作工具的程序叫 MCP Host,比如我們用來寫代碼的cursor, claude code。
能被調用的具體工具,就叫 MCP 插件,也就是MCP Server。MCP 插件可以部署在本地電腦,也可以在遠端服務器上。MCP Host上專門負責跟MCP server通信的組件,叫MCP Client。
比如 GitHub MCP 插件,本地MCP Host上的 MCP Client 負責接收調用請求,遠端的 MCP Server 部署在 GitHub 服務器上,真正執行 GitHub API 操作。

MCP協議和插件解決了工具調用問題,但新問題又來了,這么多插件,大模型怎么知道該按什么順序用、怎么組合用呢?
這就好比給了一個大學生一堆鉗子、扳手,他也不一定能修好車。他缺的是經驗和流程。
那好辦,我們可以寫一份"操作手冊",里面詳細說明遇到什么場景用什么工具、先做什么后做什么、有什么注意事項。這份結構化的操作指南,就叫Skills。

以排查線上事故為例,MCP 只是把「查監控、查日志、查配置、回滾版本」這些工具能力給到大模型; 而排查問題 Skills 則明確規定了先看監控判斷影響范圍 → 再查日志和配置定位模塊 → 必要時執行回滾 這一整套固定流程。

換句話說,大模型就像大腦,MCP 協議讓它有了手,mcp插件就是手上的工具;而 Skills 是操作經驗,規定在什么場景下、按什么順序、組合使用哪些工具。

大模型本來就能思考和規劃,給它加上了Memory讓它能記住歷史,加上RAG讓它能獲取外部知識,加上MCP和Skills讓它能操作工具。它們共同構成了一個在某些功能上能代替人類,自主行動完成目標的AI系統,又叫 AI Agent。它本質上就是一個智能工具人。通過提示詞設定角色, 它可以是智能客服、程序員、私人律師等各種角色, 聽從你的指令完成任務。

最近很火的OpenClaw,其實本質上就是個幫你自動操作電腦的ai agent,你能用電腦干什么,它就能干什么,比如發郵件,投簡歷,甚至做交易,所以權限安全是個大問題。客觀的說,OpenClaw做的事情并沒有技術上的突破,它跟前段時間很火的manus其實是類似的產品。只不過OpenClaw主要面向本地電腦,manus考慮到安全問題,將操作環境放在遠端虛擬機里。如果將OpenClaw部署到遠端服務器上,就有點"開源版的manus"那味道了。

安不安全是用戶該考慮的問題,OpenClaw只管開源,有一種野路子的美,所以最近火得一塌糊涂。建議大家還是理性看待,先想清楚到底有什么工作是需要它做的再說吧。
現在大家通了嗎?
好啦,如果你覺得這期視頻對你有幫助,記得轉發給你那不成器的兄弟。文字版的筆記,見評論區。
最后遺留一個問題,單個agent你了解了,那你知道多個agent是怎么互相協作的嗎?多agent都有哪些架構。
這里是小白debug,我們聚焦一切可能影響人類歷史進程的技術。
如果你感興趣,記得關注!我們下期見!