
通用问答 · 代码开发
GLM-5.3-Flash
支持通用问答、代码开发与智能体任务的多模态模型。多节点方案重点验证文本推理、256K 上下文与并发服务性能。
多模态理解文本、图像、视频 → 文本
01 / 模型参数
模型架构与能力
GLM-5.3-Flash 由智谱发布,采用混合专家以及稀疏、线性注意力,面向代码开发、长文本推理和智能体操作。官方模型具备图像与视频理解能力;这里的设备验证重点是文本输入、长上下文和服务并发。
- 长文档分析与问答
- 代码生成和工程任务
- 智能体工具协作
- 发布方 / 模型
- 智谱 Z.ai · GLM-5.3-Flash
- 参数规模
- 320B 总参数;18B 激活
- 架构
- 45 层 MoE;288 个路由专家,每次选 8 个,另有 1 个共享专家;混合稀疏 / 线性注意力及 mHC
- 模型上下文
- 配置上限 1,048,576 tokens;本页 MegaCube 验证至 256K
- 输入 / 输出
- 模型支持文本、图像、视频输入及文本输出;本次使用文本输入 / 输出
- 许可证
- MIT
本次性能数据不包含图像、视频任务,也不代表原生 1M 上下文已在本方案验证。
模型资料核对于 2026-09-20
02 / 部署方式
MegaCube 部署配置
- 计算设备
- 4 × MegaCube,每台 128 GB 统一内存
- 网络
- H3C S9855 · 200G RoCE
- 引擎与并行
- vLLM + Ray · TP=4
- 服务设置
- 上下文 262,144;MaxSeq=8;MTP=3;Eager
- KV 与内存
- FP8 E4M3;GPU memory utilization=0.75
准备网络
连接四台设备与 RoCE 网络,确认管理与高速链路可达。
对齐环境
各节点使用一致的 GLM-5.3-Flash 权重及推理运行环境。
启动集群
使用 Ray 组织 TP4 服务,配置 MTP3 与 FP8 E4M3 KV。
按任务接入
普通请求与极长请求分别设置并发限制,通过兼容 API 接入应用。
03 / 性能测试
MegaCube 性能测试结果
2026-08-28;256K 服务配置;17 个负载点,共 552 个有效请求。输出吞吐为整个批次的聚合输出,不等于单请求解码速度。
88.13 tok/s512/128 tokens · C8 聚合输出
552 / 552正式矩阵请求成功
262,144261,120 输入 + 1,024 输出通过
| 输入 / 输出 | 并发 | RPS | 聚合输出 tok/s | TTFT P50 / P95 | TPOT P50 / P95 | 成功率 |
|---|---|---|---|---|---|---|
| 512 / 128 | C1 | 0.2364 | 30.26 | 0.61 / 0.62 s | 28.31 / 31.36 ms | 100% |
| 512 / 128 | C2 | 0.3355 | 42.95 | 0.75 / 1.14 s | 40.47 / 43.80 ms | 100% |
| 512 / 128 | C4 | 0.4757 | 60.89 | 1.01 / 1.24 s | 58.35 / 63.98 ms | 100% |
| 512 / 128 | C8 | 0.6885 | 88.13 | 1.49 / 2.36 s | 79.78 / 88.90 ms | 100% |
| 2048 / 256 | C1 | 0.1288 | 32.98 | 1.24 / 1.30 s | 25.57 / 26.12 ms | 100% |
| 2048 / 256 | C2 | 0.1736 | 44.45 | 1.55 / 2.60 s | 38.97 / 40.14 ms | 100% |
| 2048 / 256 | C4 | 0.2346 | 60.05 | 2.79 / 4.93 s | 55.41 / 61.52 ms | 100% |
| 2048 / 256 | C8 | 0.3015 | 77.17 | 4.17 / 8.80 s | 84.29 / 109.50 ms | 100% |
| 8128 / 1024 | C1 | 0.0322 | 33.01 | 6.06 / 6.09 s | 24.46 / 24.66 ms | 100% |
| 8128 / 1024 | C2 | 0.0429 | 43.91 | 8.14 / 10.43 s | 36.23 / 38.30 ms | 100% |
| 8128 / 1024 | C4 | 0.0588 | 60.23 | 11.31 / 19.26 s | 55.20 / 60.84 ms | 100% |
| 8128 / 1024 | C8 | 0.0780 | 79.82 | 20.13 / 38.77 s | 79.42 / 90.41 ms | 100% |
| 16,384 / 1024 | C1 | 0.0271 | 27.75 | 12.50 / 12.55 s | 23.69 / 24.27 ms | 100% |
| 16,384 / 1024 | C2 | 0.0355 | 36.33 | 16.87 / 21.87 s | 37.96 / 43.20 ms | 100% |
| 16,384 / 1024 | C4 | 0.0421 | 43.14 | 20.83 / 40.53 s | 59.69 / 76.52 ms | 100% |
| 32,768 / 1024 | C1 | 0.0204 | 20.89 | 25.01 / 25.03 s | 23.47 / 23.57 ms | 100% |
| 32,768 / 1024 | C2 | 0.0255 | 26.06 | 33.41 / 43.43 s | 43.35 / 48.87 ms | 100% |
- 256K 边界单次验证 TTFT 为 232.40 s;满长请求不承诺 C4 同时驻留。
- 普通请求的低延迟数据不能代表极长文本的首次处理时间。
C1 / C4 / C8 表示 1 / 4 / 8 个并发请求。TTFT(首 token 延迟)指从提交请求到接收首个输出 token 的耗时;TPOT(每输出 token 耗时)指首个 token 之后的平均生成间隔。聚合吞吐统计全部并发请求的输出,单请求解码速率以 tok/s 表示。
规划模型部署与应用集成
根据模型规模、业务任务与并发需求,评估设备配置和推理服务。