← 全部模型

通用问答 · 代码开发

Qwen3.8-Flash-Next

面向通用问答、代码开发与工具调用的多模态模型。采用 FP8 权重,通过 DAC 双节点直连进行分布式推理与长上下文验证。

多模态理解文本、图像、视频 → 文本
2 台 MegaCube已有实测报告

01 / 模型参数

模型架构与能力

Qwen3.8-Flash-Next 是面向通用问答和智能体工作的多模态混合专家模型。它通过稀疏专家、混合注意力和可分层加载的嵌入组件,在每一步只调用部分计算资源;参数总量、每步激活参数和实际设备内存占用是不同概念。

  • 长文档问答与信息提取
  • 代码编写和项目修改
  • 多步骤工具协作
发布方 / 基础模型
阿里通义千问 · Qwen3.8-Flash-Next
参数组成
语言模型 125B / 激活 6B;另有 51B N-gram 嵌入与 4B MTP 组件
架构
48 层 MoE;512 个路由专家,每次选 10 个,另有 1 个共享专家;Gated DeltaNet + QSA
模型上下文
原生 262,144 tokens,可扩展至 1M;配置上限与实测长度分别列出
输入 / 输出
文本、图像、视频输入;文本与工具调用输出
主要能力
问答、复杂推理、代码开发、工具调用与多模态理解
本页权重
Qwen 官方 FP8 版本;131 个 safetensors 分片
许可证
Qwen Community License 1.0

此方案的实测以文本和长上下文为主。FP8 双机与 NVFP4 单机使用不同精度及加载方式,不能只按设备数量比较速度。

模型资料核对于 2026-09-20

02 / 部署方式

MegaCube 部署配置

计算设备
2 × MegaCube,每台 128 GB 统一内存
网络
一根 QSFP DAC 直连;管理与 API 走 RJ45
执行方式
vLLM 原生 MP · TP=2 · PP=1
服务设置
上下文 262,144;MaxSeq=8;BatchTokens=8192
加速与内存
MTP=1;Eager;GPU memory=0.85;Prefix Cache
  1. 连接设备

    用一根兼容 DAC 连接两台 Cube,确认 RDMA 与办公网络。

  2. 对齐权重与镜像

    两台保留相同 131 个权重分片并校验索引,使用同一 ARM64 镜像。

  3. 先工作节点后主节点

    先启动 node-rank 1,再启动 node-rank 0,组成 TP2 / PP1 服务。

  4. 检查接口

    检查 /health、/v1/models 和流式请求,再进行并发与长文验证。

推理设置
推理设置
核心配置交付值作用
执行后端MP · TP=2 · PP=1两节点原生张量并行
上下文 / 调度262,144 · MaxSeq8 · BatchTokens8192长上下文与并发调度
推理优化MTP · spec-tokens=1 · Eager在当前软硬件组合下优先稳定
内存 / 缓存GPU memory 0.85 · Prefix CacheKV Cache 容量 733,710 tokens
查看运行命令与配置参考

使用前按你的设备修改模型路径和服务地址,并核对上方版本与参数。

nvidia-smi
free -h
df -hT
ibdev2netdev
rdma link
docker ps

MODEL=/home/test/models/Qwen--Qwen3.8-Flash-Next-FP8/snapshots/master
find "$MODEL" -maxdepth 1 -name 'model-*.safetensors' | wc -l   # 应为 131
sha256sum "$MODEL/model.safetensors.index.json"
IMAGE=qwen38-flash-next-vllm:validated
MODEL_DIR=/home/test/models/Qwen--Qwen3.8-Flash-Next-FP8/snapshots/master
MASTER_ADDR=<HEAD-RDMA-IP>
IFACE=<RDMA-IFACE>

docker run -d --name qwen38-native-worker --entrypoint bash \
  --network host --ipc host --gpus all \
  --device /dev/infiniband:/dev/infiniband --ulimit memlock=-1 \
  -v "$MODEL_DIR:/models/target:ro" -v /home/test/qwen38-results:/results \
  -e NCCL_SOCKET_IFNAME="$IFACE" -e GLOO_SOCKET_IFNAME="$IFACE" \
  "$IMAGE" -lc "vllm serve /models/target \
    --served-model-name Qwen3.8-Flash-Next-FP8 \
    --tensor-parallel-size 2 --pipeline-parallel-size 1 \
    --nnodes 2 --master-addr $MASTER_ADDR --master-port 29501 \
    --node-rank 1 --headless --distributed-executor-backend mp \
    --enforce-eager --max-model-len 262144 --max-num-seqs 8 \
    --max-num-batched-tokens 8192 --enable-chunked-prefill \
    --enable-prefix-caching --gpu-memory-utilization 0.85 \
    --spec-method mtp --spec-tokens 1 \
    --enable-auto-tool-choice --tool-call-parser qwen3_xml \
    --no-enable-flashinfer-autotune --host 0.0.0.0 --port 8000"
IMAGE=qwen38-flash-next-vllm:validated
MODEL_DIR=/home/test/models/Qwen--Qwen3.8-Flash-Next-FP8/snapshots/master
MASTER_ADDR=<HEAD-RDMA-IP>
IFACE=<RDMA-IFACE>

docker run -d --name qwen38-native-head --entrypoint bash \
  --network host --ipc host --gpus all \
  --device /dev/infiniband:/dev/infiniband --ulimit memlock=-1 \
  -v "$MODEL_DIR:/models/target:ro" -v /home/test/qwen38-results:/results \
  -e NCCL_SOCKET_IFNAME="$IFACE" -e GLOO_SOCKET_IFNAME="$IFACE" \
  "$IMAGE" -lc "vllm serve /models/target \
    --served-model-name Qwen3.8-Flash-Next-FP8 \
    --tensor-parallel-size 2 --pipeline-parallel-size 1 \
    --nnodes 2 --master-addr $MASTER_ADDR --master-port 29501 \
    --node-rank 0 --distributed-executor-backend mp \
    --enforce-eager --max-model-len 262144 --max-num-seqs 8 \
    --max-num-batched-tokens 8192 --enable-chunked-prefill \
    --enable-prefix-caching --gpu-memory-utilization 0.85 \
    --spec-method mtp --spec-tokens 1 \
    --enable-auto-tool-choice --tool-call-parser qwen3_xml \
    --no-enable-flashinfer-autotune --host 0.0.0.0 --port 8000"
curl -f http://<HEAD-MGMT-IP>:8000/health
curl -s http://<HEAD-MGMT-IP>:8000/v1/models

# 进一步验证:非流式、流式、固定 64 Token、C4 并发、多语言请求

03 / 性能测试

MegaCube 性能测试结果

2026-08-28;两台 DAC 直连;752 个正式矩阵请求。固定输入/输出长度与并发档位见表,吞吐为聚合输出。

112.98 tok/s512/128 tokens · C8 聚合输出
0.421 s512/128 tokens · C1 TTFT P95
262,144261,888 输入 + 256 输出通过
固定 Token 性能矩阵
输入 / 输出并发RPS聚合输出 tok/sTTFT P50 / P95TPOT P50 / P95成功率
512 / 128C10.253032.380.405 / 0.421 s27.51 / 31.14 ms100%
512 / 128C20.420453.820.476 / 0.731 s32.63 / 38.93 ms100%
512 / 128C40.606577.630.529 / 0.818 s46.68 / 52.97 ms100%
512 / 128C80.8827112.980.642 / 1.868 s63.62 / 75.74 ms100%
2048 / 256C10.127432.620.895 / 1.129 s26.51 / 29.14 ms100%
2048 / 256C20.204652.370.986 / 1.698 s33.51 / 36.71 ms100%
2048 / 256C40.288173.761.659 / 2.816 s46.96 / 54.56 ms100%
2048 / 256C80.4005102.541.806 / 5.338 s67.72 / 79.93 ms100%
8128 / 1024C10.036237.100.892 / 0.903 s26.10 / 26.80 ms100%
8128 / 1024C20.058259.651.006 / 2.978 s30.93 / 34.68 ms100%
8128 / 1024C40.081483.372.910 / 6.109 s44.40 / 49.68 ms100%
8128 / 1024C80.1099112.573.235 / 5.503 s67.94 / 81.24 ms100%
16,384 / 1024C10.032933.722.709 / 3.205 s26.66 / 28.04 ms100%
16,384 / 1024C20.060061.431.137 / 1.803 s30.73 / 33.47 ms100%
16,384 / 1024C40.073274.923.526 / 12.546 s46.00 / 57.95 ms100%
16,384 / 1024C80.090592.637.968 / 23.050 s70.51 / 100.68 ms100%
32,768 / 1024C10.031832.573.550 / 3.557 s27.08 / 28.34 ms100%
32,768 / 1024C20.053754.975.647 / 6.802 s30.88 / 32.63 ms100%
32,768 / 1024C40.060361.778.084 / 19.460 s50.84 / 67.58 ms100%
32,768 / 1024C80.074376.1121.725 / 73.848 s61.27 / 117.96 ms100%
  • 262K 满长请求按 C1 使用;短输入的 C8 数据不适用于满长度并发。
  • 单机 NVFP4 与本页双机 FP8 使用不同精度和部署方式,请分别查看。

C1 / C4 / C8 表示 1 / 4 / 8 个并发请求。TTFT(首 token 延迟)指从提交请求到接收首个输出 token 的耗时;TPOT(每输出 token 耗时)指首个 token 之后的平均生成间隔。聚合吞吐统计全部并发请求的输出,单请求解码速率以 tok/s 表示。

公开评测参考

模型能力与平台性能评测

以下数据由模型或平台发布方提供,与上方 MegaCube 实测分开呈现。能力评分用于了解任务表现,tok/s 用于描述输出速度;不同模型、精度、硬件和测试协议的结果不宜直接比较。

Qwen3.8-Flash-Next 官方能力参考

评测模型
Qwen3.8-Flash-Next 基础模型;非本页双机配置复测
测试平台
来源未披露推理硬件
Qwen3.8-Flash-Next 官方能力参考 · 数据
评测项目成绩衡量内容
GPQA Diamond91.7高难度科学问答
SWE-bench Pro62.5软件工程问题解决
DeepSWE v1.158.7软件问题解决

测试条件代码评测使用 temperature=1、top_p=0.95、256K 上下文。SWE-bench Pro 使用 Claude Code 和修正任务集;DeepSWE 为 Claude Code 与 mini-SWE 框架的最佳结果。

查看原始评测 ↗

规划模型部署与应用集成

根据模型规模、业务任务与并发需求,评估设备配置和推理服务。

咨询此模型方案