點擊上方藍字關(guān)注我,加個??標不迷路。
大家好,我是 cxuan。
DeepSeek-V4-Flash 的一經(jīng)發(fā)布屬實非常炸裂了,發(fā)布完了之后 1 - 4 個小時,明顯 DeepSeek 的響應(yīng)速度變得很慢了,我估計大家都在接入 API 測試,不過也難怪,DeepSeek-V4-Flash 正式版把 DeepSeek-V4-Pro Preview 都給秒了,Agent 能力大幅增強,香的一批,還要什么自行車。
不過 DeepSeek 除了可以接入 API ,根據(jù) Unsloth AI 的消息,本地也可以跑 DeepSeek-V4-Flash 了。
284B 總參數(shù)、13B 激活參數(shù)、1M 上下文的 DeepSeek-V4-Flash-0731,現(xiàn)在已經(jīng)有 GGUF 版本,可以通過 Unsloth Studio 或 llama.cpp 跑在自己的機器上。

圖源:Unsloth AI
是不是聽著很爽?
但我把官方配置看了一遍,發(fā)現(xiàn)這里的本地跟很多人想的有點區(qū)別。。。最低 92GB 總內(nèi)存,想跑一個比較靠譜的版本,建議從 110GB 起步。。。。
32GB、64GB 的普通電腦咱就先不折騰了。
先來信息平權(quán)一下,根據(jù) DeepSeek-V4-Flash 的正式版消息的公布,Agent 能力要比 Preview 提升很多。
官方給出了 9 項 Agent 基準測試中,它把它的前身 Flash Preview 給秒了,也把參數(shù)更大的 V4-Pro Preview 給秒了。比如 Terminal Bench 2.1 從 61.8 漲到了 82.7,DeepSWE 從 7.3 漲到了 54.4。

圖源:DeepSeek 官方
更多關(guān)于 DeepSeek 測評的內(nèi)容,可以查看查看這篇文章。
DeepSeek-V4-Flash 正式版來了!這次提升有點夸張。
DeepSeek-V4-Flash-0731 有很多量化版本,不過其實只需要記住一件事就行了:位數(shù)越低,占用越小,質(zhì)量損失也越明顯。
UD-IQ3_XXS | ||
UD-Q4_K_XL | ||
UD-Q8_K_XL |
這里的總內(nèi)存,是系統(tǒng) RAM 加顯存,或者 Mac 的統(tǒng)一內(nèi)存。
這里有個坑:文件只有 103GB,不代表 103GB 內(nèi)存就能跑。
模型加載之后,KV Cache、上下文和系統(tǒng)還得繼續(xù)占內(nèi)存。官方給的底線是 110GB,不過大家統(tǒng)一按 128GB 來算比較省事。
還有一個容易出錯的地方。
Unsloth 的原帖把 4-bit 寫成了 lossless,當前文檔已經(jīng)標得更清楚:UD-Q4_K_XL 是 near-lossless,真正無損的是 UD-Q8_K_XL。兩者只差 7GB。
所以
UD-IQ3_XXS。UD-Q8_K_XL。
圖源:Unsloth;越靠右下,模型越接近官方原始權(quán)重
不想碰一堆編譯參數(shù),那你可以直接裝 Unsloth Studio。
Mac、Linux 和 WSL 打開終端:
curl -fsSL https://unsloth.ai/install.sh | sh
unsloth studio -p 8888
Windows 用 PowerShell:
irm https://unsloth.ai/install.ps1 | iex
unsloth studio -p 8888
然后在瀏覽器打開:
http://127.0.0.1:8888
第一次啟動會讓你創(chuàng)建密碼。進入 Model hub,搜索 DeepSeek-V4-Flash-0731-GGUF,再按自己的內(nèi)存選擇量化版本,點 Download。

圖源:Unsloth;截圖里的機器是 64GB 顯存加 64GB 內(nèi)存,155GB 的 Q4 版本已經(jīng)超出容量
下載量在 100GB 到 162GB 之間,建議提前留足硬盤空間。
下載完成后直接開始,Studio 會自動帶上聊天模板和大部分推理參數(shù),右下角還能切換思考強度, Non-think、Think High 和 Think Max。

圖源:Unsloth
如果只在本機使用,啟動命令里不用加 -H 0.0.0.0。這個參數(shù)會讓同一網(wǎng)絡(luò)里的其他設(shè)備也能訪問,家里內(nèi)網(wǎng)還能接受,公網(wǎng)別這么搞。
已經(jīng)在用 llama.cpp 的人,先保證版本是最新的,然后直接從 Hugging Face 拉模型就可以了。
128GB 機器可以從 3-bit 開始:
./llama.cpp/llama-cli \
-hf unsloth/DeepSeek-V4-Flash-0731-GGUF:UD-IQ3_XXS \
--temp 1.0 \
--top-p 1.0 \
--min-p 0.0 \
--ctx-size 32768
內(nèi)存夠,想跑官方無損版,把模型名換掉:
unsloth/DeepSeek-V4-Flash-0731-GGUF:UD-Q8_K_XL
如果下載老卡住,可以先裝 huggingface_hub,手動把 3-bit 文件下到本地:
hf download unsloth/DeepSeek-V4-Flash-0731-GGUF \
--local-dir unsloth/DeepSeek-V4-Flash-0731-GGUF \
--include "*UD-IQ3_XXS*"
建議第一次只開 32K 上下文,確認模型、速度和內(nèi)存都正常,再往上加上下文。
它雖然支持 1M 上下文,但上下文越長,額外占用越大。
Unsloth 給的常規(guī)推薦參數(shù)如下:
temperature = 1.0
top_p = 1.0
min_p = 0.0
context = 32768 起步
如果拿它跑 Agent 或代碼任務(wù),把 top_p 改成 0.95。
Think High 默認開啟,日常復(fù)雜任務(wù)先用它。Think Max 需要至少 384K 上下文,內(nèi)存和等待時間都會繼續(xù)往上走,適合真有難題時再開。普通問答可以切到 Non-think,速度更快。
關(guān)閉思考模式的命令是:
--chat-template-kwargs '{"enable_thinking":false}'
需要 Think Max:
--chat-template-kwargs '{"reasoning_effort":"max"}'

圖源:Unsloth;官方示例中速度為 49.7 tok/s,具體速度取決于硬件和量化版本
所以本地跑 DeepSeek-V4-Flash 這件事確實能行。只是這個本地,暫時只能工作站和大內(nèi)存 Mac 的本地才能跑起來。。。
像我這種 32G 丐版內(nèi)存的 Mac ,再等等不知道能不能等到了。。。
如果這篇文章你覺得還不錯,謝謝你的三連,也希望可以轉(zhuǎn)發(fā)給同樣關(guān)注 AI / 科技 / 開發(fā)效率的朋友。 我是 cxuan,我們下期再見。
參考資料: