337p人体粉嫩胞高清图片,97人妻精品一区二区三区在线 ,日本少妇自慰免费完整版,99精品国产福久久久久久,久久精品国产亚洲av热一区,国产aaaaaa一级毛片,国产99久久九九精品无码,久久精品国产亚洲AV成人公司
網易首頁 > 網易號 > 正文 申請入駐

Mac 用戶本地跑大模型,這可能是目前最能打的方案

0
分享至

關于本地部署和量化,我之前寫過不少:

今天聊一套讓我眼前一亮的東西——來自同一個團隊的三件套:JANG + vMLX + MLX Studio,這可能是目前最能打的方案

它們仨是啥關系?

先別被三個名字搞暈了

如果你玩過 PC 端的 GGUF + llama.cpp + Open WebUI,這三個的關系你一眼就懂:

層次

PC 端類比

Mac 端(這套)

量化格式

GGUF

JANG

推理引擎

llama.cpp

vMLX

桌面應用

Open WebUI

MLX Studio

簡單說:JANG 把大模型壓小,vMLX 把它跑快,MLX Studio 給你一個漂亮的界面。三件套,一條龍。

JANG:MLX 的量化救星

先聊最底層的 JANG,官方管自己叫"The GGUF for MLX"

說白了,就是一種混合精度量化方案

普通量化對所有參數一刀切,但模型里的 Attention 層對精度極其敏感,切太狠直接出 NaN(無效數值),模型就廢了

JANG 的聰明之處在于:對不同層給不同精度

  • Attention 層:保留 5~8 bit(不敢動)

  • MLP 層:壓到 2~4 bit(這里水分多,使勁壓)

  • 平均額外開銷:只多 0.3 bit

效果有多猛?看這組數據——230B 參數的 MiniMax M2.5 為例:

量化方式

大小

MMLU(200 題)

JANG_2L(2bit 混合)82.5 GB74%

MLX 4-bit

119.8 GB

26.5%

MLX 3-bit

93 GB

24.5%

MLX 2-bit

68 GB

25%

MLX 在各種 bit 下都只有 25% 左右——純隨機猜測水平,模型等于報廢了。JANG 的 2bit 混合版不但活得好好的,還拿了 74%,體積反而更小。

這差距也太離譜了


更夸張的是 397B 參數的 Qwen3.5:

  • JANG_1L:112 GB,塞進 128 GB MacBook Pro,MMLU 86.5%

  • MLX 2-bit / 3-bit:NaN,直接寄

  • MLX 4-bit:需要約 280 GB,地球上沒幾臺 Mac 裝得下

397B 模型在筆記本上跑起來了——這句話放兩年前說出來怕是要被當成瘋子。


所有量化好的模型都放在 HuggingFace 的 JANGQ-AI 上,下載即用。想自己量化的話,代碼在 github.com/jjang-ai/jangq,Apache 2.0 開源。

vMLX:100K 上下文快 224 倍

有了好的量化模型,還得有個快引擎

vMLX 就是干這個的

安裝極簡:

pip install vmlx
vmlx serve mlx-community/Qwen3-8B-4bit

啟動后在本地http://0.0.0.0:8000提供 OpenAI + Anthropic 兼容 API,Claude Code、Anthropic SDK 這些客戶端都能直接接


vMLX 最硬核的賣點是它的五層緩存棧——其他 Mac 端引擎最多有一兩層,vMLX 全給你堆滿了:

  1. 前綴緩存:對話中重復的部分只算一次

  2. 分頁 KV 緩存:多個對話同時駐留,切換不驅逐

  3. KV 緩存量化:q4/q8 壓縮,節省 4~8 倍內存

  4. 持續批處理:最多 256 個并發序列

  5. 磁盤緩存:重啟后立即恢復,不用重新算

五層疊加的結果就是,首個 Token 的響應速度碾壓同類:

上下文長度

vMLX

其他引擎

快多少

2.5K

0.05s

0.49s

9.7×

10K

0.08s

6.12s

76×

100K

0.65s

131s

224×

100K 上下文,別的引擎要等兩分多鐘,vMLX 不到一秒。我第一反應是"不可能",但這是實測的 TTFT(Time to First Token),五層緩存疊加確實恐怖。

除了緩存,還有幾個值得一提的特性:

  • 推測解碼:小模型打草稿 + 大模型驗證,提速 20~90%

  • Mamba / SSM 混合架構支持:Nemotron-H 這些奇葩架構只有 vMLX 能跑

  • 20+ 內置 Agent 工具:文件讀寫、代碼搜索、Shell 執行、Git 操作、網頁搜索——全部本地運行

最后這點很有意思。vMLX 是目前唯一把 Agentic 工具內置到本地引擎里的方案,不用額外配 MCP 服務器,模型直接就能讀文件、執行命令、搜索代碼庫。這個思路比 Ollama、LM Studio 激進得多。


項目地址:github.com/jjang-ai/vmlx,Apache 2.0 開源。

MLX Studio:不碰命令行也能玩

如果你覺得命令行太折騰,MLX Studio就是給你準備的——vMLX 引擎的完整 GUI 應用,永久免費。


MLX Studio 主界面——聊天、Agent 工具、圖像生成一體化

該有的全有了:

對話:流式多輪對話、折疊式思維鏈展示(DeepSeek R1、Qwen3、GLM)、拖拽圖片做視覺分析、語音朗讀回復。

圖像生成:5 個生成模型(Flux Schnell/Dev、Z-Image Turbo、Klein 4B/9B)+ 4 個編輯模型(Qwen Image Edit、Flux Kontext、Flux Fill、Flux Klein Edit),全部本地跑,零 API 費用。

模型管理:內置 HuggingFace 瀏覽器一鍵下載、GGUF → MLX 轉換器(支持 JANG 混合精度)、菜單欄快捷切換模型。

API 集成:同時提供 OpenAI 和 Anthropic 端點,支持 Claude Code 等客戶端直接對接。原生 MCP 支持,可以掛外部工具。


老實說,從功能完整度來看,MLX Studio 比之前我試過的 oMLX 豐富不少,尤其是圖像生成和 Agent 工具這塊,oMLX 是沒有的。不過 oMLX 勝在輕量簡潔,兩者定位不太一樣。

官網:mlx.studio

總結

這三件套解決的核心問題就一個:在 Apple Silicon Mac 上把本地 AI 的體驗拉滿

  • JANG解決"裝不下"——128GB Mac 跑 397B 模型,MLX 標準量化做不到

  • vMLX解決"跑不快"——五層緩存棧,100K 上下文快 224 倍

  • MLX Studio解決"用不了"——圖文生成、語音對話、Agent 編程,一個 App 搞定

三個項目全部 Apache 2.0 開源,全部免費。

有 Mac 跑本地模型需求的朋友,真的值得試試。

制作不易,如果這篇文章覺得對你有用,可否點個關注。給我個三連擊:點贊、轉發和在看。若可以再給我加個,謝謝你看我的文章,我們下篇再見!

特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相關推薦
熱點推薦
太平天國的失敗,骨子里的原因是啥?

太平天國的失敗,骨子里的原因是啥?

無心鏡
2026-04-02 08:09:32
退休在幾月份會比較吃虧?

退休在幾月份會比較吃虧?

小虎新車推薦員
2026-04-02 19:23:23
世界公認的9本長腦子書,一生至少讀一次

世界公認的9本長腦子書,一生至少讀一次

洞見
2026-04-02 09:28:09
直播間標題被指“內涵”張雪機車,凱越機車緊急回應:從未否定雪總曾是凱越的靈魂,其離開前持股近36%

直播間標題被指“內涵”張雪機車,凱越機車緊急回應:從未否定雪總曾是凱越的靈魂,其離開前持股近36%

每日經濟新聞
2026-04-02 18:54:18
蔣經國一生有五個孩子,只剩蔣孝嚴在世,蔣萬安名字有什么含義?

蔣經國一生有五個孩子,只剩蔣孝嚴在世,蔣萬安名字有什么含義?

老范談史
2026-04-02 21:13:39
亡母再婚水落石出,國社一錘定音,輿論反撲孫女士,小姨索要回報

亡母再婚水落石出,國社一錘定音,輿論反撲孫女士,小姨索要回報

潮鹿逐夢
2026-04-01 09:33:54
“哎呦我的天吶,太墨跡了!”王濛吐槽《浪姐》直播拖沓,網友:真嘴替

“哎呦我的天吶,太墨跡了!”王濛吐槽《浪姐》直播拖沓,網友:真嘴替

動物奇奇怪怪
2026-04-03 01:57:20
甲骨文給自己開了個玩笑

甲骨文給自己開了個玩笑

智遠同學
2026-04-02 09:02:05
金莎肚子大到藏不住?車展現身被疑懷孕,聲音變粗更添實錘!

金莎肚子大到藏不住?車展現身被疑懷孕,聲音變粗更添實錘!

情感大頭說說
2026-04-03 00:10:45
中國拉瑪西亞第1人?曝14歲邊鋒加盟巴薩+進U15梯隊 董路青訓培養

中國拉瑪西亞第1人?曝14歲邊鋒加盟巴薩+進U15梯隊 董路青訓培養

我愛英超
2026-04-03 06:27:05
童瑤其實挺真實的,明明一直在健身,小腹還是沒法完全平坦

童瑤其實挺真實的,明明一直在健身,小腹還是沒法完全平坦

小光侃娛樂
2026-04-01 13:15:08
6月1日起,車管所跟普通車主沒關系了!公安部新政落地,手機辦完

6月1日起,車管所跟普通車主沒關系了!公安部新政落地,手機辦完

華庭講美食
2026-04-03 00:18:45
“85后”張磊,擬任縣(市、區)委書記!孫悉斌,已任江蘇交通控股總經理!

“85后”張磊,擬任縣(市、區)委書記!孫悉斌,已任江蘇交通控股總經理!

愛意隨風起呀
2026-04-03 05:37:31
陳光標贈張雪勞斯萊斯騎虎難下,想私了熱度太高,二手車商已盯上

陳光標贈張雪勞斯萊斯騎虎難下,想私了熱度太高,二手車商已盯上

小怪吃美食
2026-04-03 04:56:08
德黑蘭的清晨,有點不太對勁

德黑蘭的清晨,有點不太對勁

陸棄
2026-04-02 08:20:03
姆巴佩和女友近照,27歲已是超巨,身家過億,女友是火辣演員

姆巴佩和女友近照,27歲已是超巨,身家過億,女友是火辣演員

大西體育
2026-03-31 13:27:01
許家印,在恒大王國里,過足了官癮、錢癮、色癮,金蟬脫殼玩死了

許家印,在恒大王國里,過足了官癮、錢癮、色癮,金蟬脫殼玩死了

歷史偉人錄
2026-04-01 17:55:34
世界杯戰報:0-4慘敗仍不輸陣,德乒男單兩連敗,8強小莫VS松島

世界杯戰報:0-4慘敗仍不輸陣,德乒男單兩連敗,8強小莫VS松島

求球不落諦
2026-04-02 20:02:01
張雪接受贈車,計劃賣掉捐贈,陳光標兩度回應,真實目的藏不住了

張雪接受贈車,計劃賣掉捐贈,陳光標兩度回應,真實目的藏不住了

叨嘮
2026-04-02 20:08:40
你敢信嗎?太湖底下有2.3米厚的淤泥,可上面才蓋著不到1.9米的水

你敢信嗎?太湖底下有2.3米厚的淤泥,可上面才蓋著不到1.9米的水

掠影后有感
2026-04-01 20:26:07
2026-04-03 09:35:00
Ai學習的老章 incentive-icons
Ai學習的老章
Ai學習的老章
3303文章數 11122關注度
往期回顧 全部

科技要聞

戰火燒向科技公司!亞馬遜中東云計算中心遭襲

頭條要聞

被中國外交部揭底的日本極右翼分子身份披露

頭條要聞

被中國外交部揭底的日本極右翼分子身份披露

體育要聞

邵佳一的改革,從讓每個人踢舒服開始

娛樂要聞

《浪姐》人氣榜出爐!曾沛慈斷層第一

財經要聞

全球石油危機或將蔓延

汽車要聞

軸距2米7/后排能蹺腿 試駕后驅小車QQ3 EV

態度原創

本地
教育
房產
親子
公開課

本地新聞

從學徒到世界冠軍,為什么說張雪的底氣在重慶?

教育要聞

春假不“躺平”!鄉村學生專屬“安全+快樂”雙保障,解鎖春日成長新方式

房產要聞

巨無霸來了!海口城更,突然又爆大動作!

親子要聞

洗頭的舒適區,讓爸爸想出更多帶娃創意

公開課

李玫瑾:為什么性格比能力更重要?

無障礙瀏覽 進入關懷版