← 全部模型

通用问答 · 代码开发

GLM-5.3-Flash

支持通用问答、代码开发与智能体任务的多模态模型。多节点方案重点验证文本推理、256K 上下文与并发服务性能。

多模态理解文本、图像、视频 → 文本
4 台 MegaCube已有实测报告

01 / 模型参数

模型架构与能力

GLM-5.3-Flash 由智谱发布,采用混合专家以及稀疏、线性注意力,面向代码开发、长文本推理和智能体操作。官方模型具备图像与视频理解能力;这里的设备验证重点是文本输入、长上下文和服务并发。

  • 长文档分析与问答
  • 代码生成和工程任务
  • 智能体工具协作
发布方 / 模型
智谱 Z.ai · GLM-5.3-Flash
参数规模
320B 总参数;18B 激活
架构
45 层 MoE;288 个路由专家,每次选 8 个,另有 1 个共享专家;混合稀疏 / 线性注意力及 mHC
模型上下文
配置上限 1,048,576 tokens;本页 MegaCube 验证至 256K
输入 / 输出
模型支持文本、图像、视频输入及文本输出;本次使用文本输入 / 输出
许可证
MIT

本次性能数据不包含图像、视频任务,也不代表原生 1M 上下文已在本方案验证。

模型资料核对于 2026-09-20

02 / 部署方式

MegaCube 部署配置

计算设备
4 × MegaCube,每台 128 GB 统一内存
网络
H3C S9855 · 200G RoCE
引擎与并行
vLLM + Ray · TP=4
服务设置
上下文 262,144;MaxSeq=8;MTP=3;Eager
KV 与内存
FP8 E4M3;GPU memory utilization=0.75
  1. 准备网络

    连接四台设备与 RoCE 网络,确认管理与高速链路可达。

  2. 对齐环境

    各节点使用一致的 GLM-5.3-Flash 权重及推理运行环境。

  3. 启动集群

    使用 Ray 组织 TP4 服务,配置 MTP3 与 FP8 E4M3 KV。

  4. 按任务接入

    普通请求与极长请求分别设置并发限制,通过兼容 API 接入应用。

03 / 性能测试

MegaCube 性能测试结果

2026-08-28;256K 服务配置;17 个负载点,共 552 个有效请求。输出吞吐为整个批次的聚合输出,不等于单请求解码速度。

88.13 tok/s512/128 tokens · C8 聚合输出
552 / 552正式矩阵请求成功
262,144261,120 输入 + 1,024 输出通过
完整负载矩阵
输入 / 输出并发RPS聚合输出 tok/sTTFT P50 / P95TPOT P50 / P95成功率
512 / 128C10.236430.260.61 / 0.62 s28.31 / 31.36 ms100%
512 / 128C20.335542.950.75 / 1.14 s40.47 / 43.80 ms100%
512 / 128C40.475760.891.01 / 1.24 s58.35 / 63.98 ms100%
512 / 128C80.688588.131.49 / 2.36 s79.78 / 88.90 ms100%
2048 / 256C10.128832.981.24 / 1.30 s25.57 / 26.12 ms100%
2048 / 256C20.173644.451.55 / 2.60 s38.97 / 40.14 ms100%
2048 / 256C40.234660.052.79 / 4.93 s55.41 / 61.52 ms100%
2048 / 256C80.301577.174.17 / 8.80 s84.29 / 109.50 ms100%
8128 / 1024C10.032233.016.06 / 6.09 s24.46 / 24.66 ms100%
8128 / 1024C20.042943.918.14 / 10.43 s36.23 / 38.30 ms100%
8128 / 1024C40.058860.2311.31 / 19.26 s55.20 / 60.84 ms100%
8128 / 1024C80.078079.8220.13 / 38.77 s79.42 / 90.41 ms100%
16,384 / 1024C10.027127.7512.50 / 12.55 s23.69 / 24.27 ms100%
16,384 / 1024C20.035536.3316.87 / 21.87 s37.96 / 43.20 ms100%
16,384 / 1024C40.042143.1420.83 / 40.53 s59.69 / 76.52 ms100%
32,768 / 1024C10.020420.8925.01 / 25.03 s23.47 / 23.57 ms100%
32,768 / 1024C20.025526.0633.41 / 43.43 s43.35 / 48.87 ms100%
  • 256K 边界单次验证 TTFT 为 232.40 s;满长请求不承诺 C4 同时驻留。
  • 普通请求的低延迟数据不能代表极长文本的首次处理时间。

C1 / C4 / C8 表示 1 / 4 / 8 个并发请求。TTFT(首 token 延迟)指从提交请求到接收首个输出 token 的耗时;TPOT(每输出 token 耗时)指首个 token 之后的平均生成间隔。聚合吞吐统计全部并发请求的输出,单请求解码速率以 tok/s 表示。

规划模型部署与应用集成

根据模型规模、业务任务与并发需求,评估设备配置和推理服务。

咨询此模型方案