可信度前提:M5 Ultra 无任何真实 LLM 基准(发售 2026-09-22,本机预购未到货)。本文全部 M5 Ultra 数字 =
实测锚点 × 缩放系数推算:decode ×1.6–1.9(带宽 1.4667× + 架构效率),prefill ×4.1(官方声明 4.5×)。
检索中 contracollective.com、llmcheck.net 于芯片发布前发布「实测」,配置与官方产品档矛盾,判为伪造弃用。
1平台规格:M3 Ultra → M5 Ultra(Apple 官方)
官方口径:统一内存带宽 +50%(819GB/s → 1.2TB/s);GPU AI 峰值算力 4.5×;UltraFusion 从双 die 变四 die(两颗双 die M5 Max),die 间互连 >4.4TB/s。
内存带宽(GB/s)
M5 Max 40c 作中间参照:614GB/s(ggerganov llama-bench 数据帖同款机器)
GPU AI 峰值算力(M3 Ultra = 1×)
每 GPU 核内置 Neural Accelerator;实测侧 M5 Max 40c 已用一半核数做出 2.05× 于 M3U 80c 的 pp512
| 项 | M5 Ultra(2026-08-25 发布) | M3 Ultra(对照) |
| CPU / GPU / NE | 36 核(12 super + 24 perf)/ 80 核(每核 Neural Accelerator)/ 32 核 | 32 核 / 80 核 / 32 核 |
| 统一内存带宽 | 1.2TB/s(256GB 与 512GB 同带宽) | 819GB/s |
| 互连 | UltraFusion 四 die,>4.4TB/s,密度 +6× | 双 die |
| 给模型的内存 | 系统+桌面 10–20GB → 规划按 ~230GB | 同比例 |
2推算链条与 η 分档
decode 走带宽域,prefill 走计算域;有效带宽利用率 η 按锚点反解分档:dense 0.53–0.70,MoE 0.20–0.45(路由 / scatter-gather 开销 + 内核成熟度)。
decode 缩放(带宽域)
×1.6–1.9
1.4667 带宽 × 1.1–1.3 架构效率(M5 Max 用 0.75× 带宽做出 1.30× tg)
prefill 缩放(计算域)
×4.1 官方 4.5×
M5 Max 40c pp512 3158 vs M3U 80c 1538;M5 Pro 20c→Max 40c 已证线性核扩展
融合批处理模型
t/s ≈ η·BW / (激活 + Σ KV)
并发 decode 权重只读一次(mlx-lm PR#626 实证 bs4 聚合 ×2.4);KV 按槽累加
3长上下文的杀伤力(M3 Ultra 512GB · MLX 实测 276 组网格)
ml-explore/mlx #3209:Qwen 32B,batch=1。左:decode 随上下文衰减,128K 时所有量化档收敛(FP16 KV 读带宽占 >70%);右:prompt 处理速度随长度衰减(O(n²) 注意力)。
Qwen 32B decode(tok/s)× 量化 × 上下文
1K 时 Q2 是 F16 的 4.6×;128K 时只剩 1.7× —— 权重量化在长窗失效,KV 才是主变量
Qwen 32B prompt 处理速度(tok/s)
345 → 154 tok/s(-55%)。prefill 是计算域:量化不改 TTFT(TTFT ≈ 2·params·tokens / TFLOPS)
44×262K 内存预算(每槽原生满格,可用 ~230GB)
每槽 262,144 = Qwen 混合家族原生上限,零 YaRN;4 槽总窗口 = 1,048,576。权重 + 4 槽 KV 堆叠,红线为 230GB。gpt-oss(131K)、GLM-Air(128K)、235B(128K)窗口不够;Scout 容量勉强但每槽仅 ~4 t/s;均排除。
5Prefill:262K prompt 的 TTFT(M5 Ultra 推算)
M5U ≈ 4.1× M3U。4 个 slot 同时灌 262K(总输入恰 1M token):计算域无并行红利,总时间 ≈ 4× 单槽 TTFT(空心条)。
6Decode:4×262K 每槽速度(M5 Ultra 推算)
η 分档:dense 0.6 / MoE 0.30–0.45。参考线:5(勉强可读)/ 15(可用)/ 25(流畅)。误差条为 MoE η 区间。
单流 @262K vs 4 槽聚合
聚合 ≠ 单流×4:带宽被 4 份 KV 分摊;KV 越胖聚合比越接近 1
锚点校验:短上下文单流
M3 Ultra 实测(各来源)→ M5U 区间;gpt-oss 61.5 为 2025-08 早期内核(η=0.20),2026 内核应更高
7模型全景(2026-09,256GB 内全部候选)
按可部署性分档;规格均取自官方 model card / 论文(A1–A16)。
| 模型 | 总参/激活 | 注意力架构 | 原生窗口 | Q4 体积 | 4×262K | 定位 |
| Qwen3-Coder-Next | 80B/3B | 36 GDN + 12 层 GA(2KV) | 262K | 48.4GB | ✓ ~74GB | agentic coding 主力 |
| Qwen3-Next-80B-A3B | 80B/3.9B | 12 GDN + 36 层 SWA | 512K级 | ~45GB | ✓ ~71GB | 长窗 agent(#139 实测 4×250K≈1M) |
| Qwen3.5-122B-A10B | 122B/10B | 36 GDN + 12 层 GA(2KV) | 262K→1M | ~67GB | ✓ ~92GB | 质量档更高的全能位 |
| Qwen3.8-Flash-Next | 125B+51B/6B | GDN + QSA(2048 tok 预算) | 262K/1M | ~110GB | ✓ ~112GB | 速度最优主脑;运行时待验 |
| gpt-oss-120b | 120B/5.1B | 半数层 SWA-128 | 131K | 61GB(MXFP4) | ✕ 窗口 | 128K 档快解(短窗单流 ~100 t/s) |
| GLM-4.5-Air | 106B/12B | GQA(KV 胖) | 128K | ~60GB | ✕ 窗口 | 128K 档质量位(4bit ~83GB) |
| Qwen3-235B-A22B | 235B/22B | GQA(KV 胖) | 128K | ~124GB | ✕ | 128K 档大 MoE(需 Q8 KV,172GB) |
| DeepSeek-V4-Flash | 284B/13B | CSA+HCA(压缩) | 1M | ~165GB | △ 待实测 | 单开 1M 主场 |
| Qwen3.5-397B-A17B | 397B/17B | — | 256K级 | Q3 ~165GB | ✕ | 单开 64K 贴边 |
| MiniMax-M3 | 428B/23B | MSA 稀疏 | 1M | ~235GB | ✕ | 贴边超限 |
| GLM-4.6 / V4-Pro / Kimi K3 | 355B / 1.6T / 2.8T | — | — | ≥200GB | ✕ | 需 512GB+ 或多机 |
| Qwen3.6-35B-A3B(快槽) | 35B/3B | — | 64K级 | ~27GB | 双开搭配用 | 烫烫短聊快槽(平台基线) |
| Qwen3-32B dense(对照) | 32B/32B | GQA | 128K | ~18GB | ✕ KV 爆 | 单流短窗对照(A3 网格锚点) |
| 模型 | llama.cpp | MLX / LM Studio | 备注 |
| Qwen3-Coder-Next | 官方 GGUF;最新版 + -fa on -sm row --no-context-shift | LM Studio 官方 4bit;mlx-lm 混合缓存 2026-08 修复,先验多轮缓存 | Q5_K_M/Q6_K/Q8_0 = 57/65.5/84.8GB;non-thinking |
| Qwen3-Next-80B | 需 --swa-full --ctx-checkpoints 128(#139 旗标) | 混合缓存同上;GGUF/llama.cpp 为实践路径 | #139:4×250K ≈ 95GB wired 实测 |
| Qwen3.5-122B / Flash-Next | Flash-Next 需 qwen4_exp 对应 PR(平台基线标注) | MLX 为主路;QSA/n-gram 内核成熟度待验 | Flash-Next 官方 4bit ~110GB(含 51B n-gram 表) |
| gpt-oss-120b / GLM-Air / 235B | 成熟 | 成熟 | 128K 档限定;262K 外推无官方支持 |
8部署栈
| 栈 | 多并发行为(证据) | 适配 |
| llama.cpp llama-server | -np N 共享上下文池,并发 decode 融合 batch;prefill 分块交错 | 生态最全(GGUF、KV 量化、fa、spec-dec);冷启动最快;MoE 比 MLX 慢 ~1.5× |
| mlx-lm server | 真融合批处理:bs1 86 → bs4 204 t/s 聚合(PR#626,M2U+Qwen30B-A3B) | MoE 首选(235B:MLX 24 vs GGUF 16 t/s);混合架构缓存 2026-04 仍损坏(#139) |
| vllm-metal | vLLM 调度器 + 连续批处理;paged attention 需实验开关(0.6B 上 82× TTFT) | 要 OpenAI 兼容 API + vLLM 生态;默认路径批收益未兑现 |
| vllm-mlx | 16 并发聚合 ×4.3(0.6–30B,M4 Max,论文) | 验证最充分的是小模型;大模型数据缺 |
| LM Studio | 封装 llama.cpp/MLX,parallel slots 即 -np | GUI 验收用 |
| omlx | 真 batch,1→4 并发 ×1.29–1.40 | 备选 |
9到货后自验(dense 与 100B 级 MoE 同 session 对测)
- dense 基线:
llama-bench -m 7B/32B -p 512,2048,131072 -n 128,512 -fa 0,1 -np 1,4,校 η 与 pp 衰减曲线
- 100B 级 MoE 同期对测:gpt-oss-120b(MXFP4)、Qwen3-Next-80B(
--swa-full --ctx-checkpoints 128)、GLM-4.5-Air 4/8bit;加 Qwen3-30B-A3B 小 MoE 对照
- 4 路并发 262K 压测:
llama-server -ngl 99 -c 1048576 -np 4 -fa on --batch-size 4096 --ubatch-size 2048,对第 5/6 节表
- MLX 侧同款压测验证 ×1.5 是否保持;混合架构先验缓存正确性再测速
- 235B Q4 +
-kv q8_0 实测;PPL/烫烫套件复核 KV 量化质量损伤
- 实测数回填本文与 md;平台基线「速度量级」节同步
来源:Apple mac-studio/specs + M6/M5 Ultra 芯片稿(1.2TB/s=+50%、4.5×、UltraFusion>4.4TB/s)·
ggml-org/llama.cpp #4167(M5 Max / M3 Ultra bench)· ml-explore/mlx #3209(276 组网格)·
QwenLM/Qwen3.8 #139(Qwen3-Next 多槽长窗真实部署)· hardware-corner(Llama4/DeepSeek-V3 M3U)·
MacStories(235B 实测)· zenn gpt_oss_bench(gpt-oss llama-bench)· siliconscore(GLM-Air)·
mlx-lm PR#626 · vllm-metal README · arXiv 2601.19139 · jaesolshin 五后端对比 ·
Qwen3-Coder-Next 官方博客/GGUF 仓库(qwen.ai、HF Qwen/Qwen3-Coder-Next-GGUF、lmstudio-community MLX-4bit)·
Qwen3.5-122B-A10B / Qwen3.8-Flash-Next 官方 model card(HF)· DeepSeek-V4 论文 arXiv 2606.19348(V4-Flash 284B/13B/1M)·
Kimi K3 论文 arXiv 2607.24653(2.8T/104B)· MiniMax-M3 官方 README(428B/23B/1M)