Mac Studio M5 Ultra(256GB)· 本地模型部署与 4×262K 推理分析

2026-09-10 · 检索链 exa · 场景:4 并发 slot × 262,144/槽(原生满格,总窗口 1M)

1平台规格:M3 Ultra → M5 Ultra(Apple 官方)

官方口径:统一内存带宽 +50%(819GB/s → 1.2TB/s);GPU AI 峰值算力 4.5×;UltraFusion 从双 die 变四 die(两颗双 die M5 Max),die 间互连 >4.4TB/s。

内存带宽(GB/s)

M5 Max 40c 作中间参照:614GB/s(ggerganov llama-bench 数据帖同款机器)

GPU AI 峰值算力(M3 Ultra = 1×)

每 GPU 核内置 Neural Accelerator;实测侧 M5 Max 40c 已用一半核数做出 2.05× 于 M3U 80c 的 pp512
M5 Ultra(2026-08-25 发布)M3 Ultra(对照)
CPU / GPU / NE36 核(12 super + 24 perf)/ 80 核(每核 Neural Accelerator)/ 32 核32 核 / 80 核 / 32 核
统一内存带宽1.2TB/s(256GB 与 512GB 同带宽)819GB/s
互连UltraFusion 四 die,>4.4TB/s,密度 +6×双 die
给模型的内存系统+桌面 10–20GB → 规划按 ~230GB同比例

2推算链条与 η 分档

decode 走带宽域,prefill 走计算域;有效带宽利用率 η 按锚点反解分档:dense 0.53–0.70,MoE 0.20–0.45(路由 / scatter-gather 开销 + 内核成熟度)。
decode 缩放(带宽域)
×1.6–1.9
1.4667 带宽 × 1.1–1.3 架构效率(M5 Max 用 0.75× 带宽做出 1.30× tg)
prefill 缩放(计算域)
×4.1 官方 4.5×
M5 Max 40c pp512 3158 vs M3U 80c 1538;M5 Pro 20c→Max 40c 已证线性核扩展
融合批处理模型
t/s ≈ η·BW / (激活 + Σ KV)
并发 decode 权重只读一次(mlx-lm PR#626 实证 bs4 聚合 ×2.4);KV 按槽累加

3长上下文的杀伤力(M3 Ultra 512GB · MLX 实测 276 组网格)

ml-explore/mlx #3209:Qwen 32B,batch=1。左:decode 随上下文衰减,128K 时所有量化档收敛(FP16 KV 读带宽占 >70%);右:prompt 处理速度随长度衰减(O(n²) 注意力)。

Qwen 32B decode(tok/s)× 量化 × 上下文

1K 时 Q2 是 F16 的 4.6×;128K 时只剩 1.7× —— 权重量化在长窗失效,KV 才是主变量

Qwen 32B prompt 处理速度(tok/s)

345 → 154 tok/s(-55%)。prefill 是计算域:量化不改 TTFT(TTFT ≈ 2·params·tokens / TFLOPS)

44×262K 内存预算(每槽原生满格,可用 ~230GB)

每槽 262,144 = Qwen 混合家族原生上限,零 YaRN;4 槽总窗口 = 1,048,576。权重 + 4 槽 KV 堆叠,红线为 230GB。gpt-oss(131K)、GLM-Air(128K)、235B(128K)窗口不够;Scout 容量勉强但每槽仅 ~4 t/s;均排除。

5Prefill:262K prompt 的 TTFT(M5 Ultra 推算)

M5U ≈ 4.1× M3U。4 个 slot 同时灌 262K(总输入恰 1M token):计算域无并行红利,总时间 ≈ 4× 单槽 TTFT(空心条)。
Qwen3-Next-80B:120K 冷启动 250s 为同级机器 GGUF 实测(#139),按 4.5× 算力折算后线性外推;混合 GDN 线性注意力在长窗占优。4 槽冷启动 wall-clock:Flash-Next ≈ 3–6 分钟,Coder-Next ≈ 5–10 分钟。

6Decode:4×262K 每槽速度(M5 Ultra 推算)

η 分档:dense 0.6 / MoE 0.30–0.45。参考线:5(勉强可读)/ 15(可用)/ 25(流畅)。误差条为 MoE η 区间。

单流 @262K vs 4 槽聚合

聚合 ≠ 单流×4:带宽被 4 份 KV 分摊;KV 越胖聚合比越接近 1

锚点校验:短上下文单流

M3 Ultra 实测(各来源)→ M5U 区间;gpt-oss 61.5 为 2025-08 早期内核(η=0.20),2026 内核应更高

7模型全景(2026-09,256GB 内全部候选)

按可部署性分档;规格均取自官方 model card / 论文(A1–A16)。
模型总参/激活注意力架构原生窗口Q4 体积4×262K定位
Qwen3-Coder-Next80B/3B36 GDN + 12 层 GA(2KV)262K48.4GB✓ ~74GBagentic coding 主力
Qwen3-Next-80B-A3B80B/3.9B12 GDN + 36 层 SWA512K级~45GB✓ ~71GB长窗 agent(#139 实测 4×250K≈1M)
Qwen3.5-122B-A10B122B/10B36 GDN + 12 层 GA(2KV)262K→1M~67GB✓ ~92GB质量档更高的全能位
Qwen3.8-Flash-Next125B+51B/6BGDN + QSA(2048 tok 预算)262K/1M~110GB✓ ~112GB速度最优主脑;运行时待验
gpt-oss-120b120B/5.1B半数层 SWA-128131K61GB(MXFP4)✕ 窗口128K 档快解(短窗单流 ~100 t/s)
GLM-4.5-Air106B/12BGQA(KV 胖)128K~60GB✕ 窗口128K 档质量位(4bit ~83GB)
Qwen3-235B-A22B235B/22BGQA(KV 胖)128K~124GB128K 档大 MoE(需 Q8 KV,172GB)
DeepSeek-V4-Flash284B/13BCSA+HCA(压缩)1M~165GB△ 待实测单开 1M 主场
Qwen3.5-397B-A17B397B/17B256K级Q3 ~165GB单开 64K 贴边
MiniMax-M3428B/23BMSA 稀疏1M~235GB贴边超限
GLM-4.6 / V4-Pro / Kimi K3355B / 1.6T / 2.8T≥200GB需 512GB+ 或多机
Qwen3.6-35B-A3B(快槽)35B/3B64K级~27GB双开搭配用烫烫短聊快槽(平台基线)
Qwen3-32B dense(对照)32B/32BGQA128K~18GB✕ KV 爆单流短窗对照(A3 网格锚点)
模型llama.cppMLX / LM Studio备注
Qwen3-Coder-Next官方 GGUF;最新版 + -fa on -sm row --no-context-shiftLM Studio 官方 4bit;mlx-lm 混合缓存 2026-08 修复,先验多轮缓存Q5_K_M/Q6_K/Q8_0 = 57/65.5/84.8GB;non-thinking
Qwen3-Next-80B--swa-full --ctx-checkpoints 128(#139 旗标)混合缓存同上;GGUF/llama.cpp 为实践路径#139:4×250K ≈ 95GB wired 实测
Qwen3.5-122B / Flash-NextFlash-Next 需 qwen4_exp 对应 PR(平台基线标注)MLX 为主路;QSA/n-gram 内核成熟度待验Flash-Next 官方 4bit ~110GB(含 51B n-gram 表)
gpt-oss-120b / GLM-Air / 235B成熟成熟128K 档限定;262K 外推无官方支持

8部署栈

多并发行为(证据)适配
llama.cpp llama-server-np N 共享上下文池,并发 decode 融合 batch;prefill 分块交错生态最全(GGUF、KV 量化、fa、spec-dec);冷启动最快;MoE 比 MLX 慢 ~1.5×
mlx-lm server真融合批处理:bs1 86 → bs4 204 t/s 聚合(PR#626,M2U+Qwen30B-A3B)MoE 首选(235B:MLX 24 vs GGUF 16 t/s);混合架构缓存 2026-04 仍损坏(#139)
vllm-metalvLLM 调度器 + 连续批处理;paged attention 需实验开关(0.6B 上 82× TTFT)要 OpenAI 兼容 API + vLLM 生态;默认路径批收益未兑现
vllm-mlx16 并发聚合 ×4.3(0.6–30B,M4 Max,论文)验证最充分的是小模型;大模型数据缺
LM Studio封装 llama.cpp/MLX,parallel slots 即 -npGUI 验收用
omlx真 batch,1→4 并发 ×1.29–1.40备选

9到货后自验(dense 与 100B 级 MoE 同 session 对测)

来源:Apple mac-studio/specs + M6/M5 Ultra 芯片稿(1.2TB/s=+50%、4.5×、UltraFusion>4.4TB/s)· ggml-org/llama.cpp #4167(M5 Max / M3 Ultra bench)· ml-explore/mlx #3209(276 组网格)· QwenLM/Qwen3.8 #139(Qwen3-Next 多槽长窗真实部署)· hardware-corner(Llama4/DeepSeek-V3 M3U)· MacStories(235B 实测)· zenn gpt_oss_bench(gpt-oss llama-bench)· siliconscore(GLM-Air)· mlx-lm PR#626 · vllm-metal README · arXiv 2601.19139 · jaesolshin 五后端对比 · Qwen3-Coder-Next 官方博客/GGUF 仓库(qwen.ai、HF Qwen/Qwen3-Coder-Next-GGUF、lmstudio-community MLX-4bit)· Qwen3.5-122B-A10B / Qwen3.8-Flash-Next 官方 model card(HF)· DeepSeek-V4 论文 arXiv 2606.19348(V4-Flash 284B/13B/1M)· Kimi K3 论文 arXiv 2607.24653(2.8T/104B)· MiniMax-M3 官方 README(428B/23B/1M)
生成于 2026-09-09 · 单文件自包含,无外部依赖 · 数据与推导细节见同目录 md 报告