← 全部模型

通用问答 · 代码开发

Qwen3.8-Flash-Next NVFP4

采用 NVFP4 量化的单机多模态推理方案,覆盖问答、代码开发与智能体任务。结合本地 NVMe 分层加载,在统一系统内存容量内运行模型。

多模态理解文本、图像、视频 → 文本
1 台 MegaCube已有实测报告

01 / 模型参数

模型架构与能力

Qwen3.8-Flash-Next 是面向通用问答和智能体工作的多模态混合专家模型。它通过稀疏专家、混合注意力和可分层加载的嵌入组件,在每一步只调用部分计算资源;参数总量、每步激活参数和实际设备内存占用是不同概念。

  • 本地问答与内容整理
  • 代码开发和调试
  • 智能体工具调用
发布方 / 基础模型
阿里通义千问 · Qwen3.8-Flash-Next
参数组成
语言模型 125B / 激活 6B;另有 51B N-gram 嵌入与 4B MTP 组件
架构
48 层 MoE;512 个路由专家,每次选 10 个,另有 1 个共享专家;Gated DeltaNet + QSA
模型上下文
原生 262,144 tokens,可扩展至 1M;配置上限与实测长度分别列出
输入 / 输出
文本、图像、视频输入;文本与工具调用输出
主要能力
问答、复杂推理、代码开发、工具调用与多模态理解
本页量化版本
NVIDIA ModelOpt:主路由专家 NVFP4,其他主体层 BF16,MTP 专家与 PLE 为 FP8
权重体积
约 123.57 GiB / 132.7 GB;并非全部同时常驻内存
许可证
NVIDIA Open Model License,并附 Qwen Community 相关条款

本页单机实测主要覆盖低并发文本与代码任务。模型公开支持视觉理解;262K 为本方案服务配置上限,尚未完成满长度压力验证。

模型资料核对于 2026-09-20

02 / 部署方式

MegaCube 部署配置

计算设备
1 × MegaCube · NVIDIA GB10 · 128 GB
引擎
vLLM 0.28.1rc1.dev388 · CUDA 13.0 · ARM64
加载方式
PLE 本地 NVMe mmap + staged gather
正式参数
TP1;MTP3;seqs=1;chunk=2048;GMU=0.80
上下文
配置上限 262,144 tokens;Thinking 关闭
  1. 准备本地存储

    下载 NVFP4 权重到高速 NVMe,PLE 分层读取需要本地磁盘配合。

  2. 固定运行版本

    使用报告指定的 vLLM 镜像及 rc2 配置,校验权重与部署包。

  3. 启动单机服务

    默认采用 C1 / MTP3,开启 Prefix Cache,保留默认 Compile / Graph。

  4. 预热与连接

    先做健康检查及代表性任务预热,再将品悟连接到模型服务。

在本地模型商店中找到此模型,下载后按卡片指引部署并启用。

模型商店当前提供 rc3 候选部署包,尚未完成该版本的设备推理验收。本页数据来自此前 rc2 配置,请按版本区分。

下载本地模型商店 →
部署参数与版本
部署参数与版本
参数C1正式推荐说明
模型nvidia/Qwen3.8-Flash-Next-NVFP4ModelOpt NVFP4检查点,约123.57GiB / 132.7GB
推理引擎vLLM 0.28.1rc1.dev388 · CUDA 13.0ARM64 / GB10环境
并行与调度TP1 · max-num-seqs=1 · max-num-batched-tokens=2048单流优先
上下文与内存max-model-len=262144 · GMU=0.80 · KV=auto262K是配置上限,不代表已完成满长度压力验证
推测解码MTP=3 · draft vocab=65536主要吞吐提升来源
PLE本地NVMe mmap + staged gather避免约50GiB PLE表完整常驻统一内存
Compile / Graph默认VLLM_COMPILE / FULL_AND_PIECEWISE优于eager,TTFT长尾优于mode0方案
MoE后端auto → FLASHINFER_CUTLASS由当前引擎自动选择
Prefix Cache默认开启Agent多轮、固定系统提示词与工具定义受益
Thinking默认关闭报告性能数据均按thinking off
查看运行命令与配置参考

使用前按你的设备修改模型路径和服务地址,并核对上方版本与参数。

python3 -m pip install -U huggingface_hub
export HF_ENDPOINT=https://hf-mirror.com

hf download nvidia/Qwen3.8-Flash-Next-NVFP4 \
  --local-dir /var/tmp/models/Qwen3.8-Flash-Next-NVFP4-nvidia
docker pull \
  vllm/vllm-openai:nightly-8a728663c1c3eeace834a95f5654fa653cc1998c

# 归档镜像摘要
# sha256:5cba4263b05c258ad4f423f10d83fb7c0da742796471c1b22207642f2733d940
tar -xzf MegaCube-Qwen3.8-Flash-Next-NVFP4-single-1.0.0-rc2.tar.gz
cd megacube-qwen38fn-single
sha256sum -c SHA256SUMS
bash megacube.sh deploy

# 后续管理
bash megacube.sh start
bash megacube.sh stop
bash megacube.sh status
bash megacube.sh logs
bash megacube.sh smoke-test
bash qwen38fn-c1-balanced.sh

until curl -fsS http://127.0.0.1:8000/health; do
  sleep 10
done
curl -s http://127.0.0.1:8000/v1/models
curl http://MODEL_SERVER_IP:8000/v1/chat/completions \
  -H 'Content-Type: application/json' \
  -d '{
    "model":"qwen3.8-flash-next",
    "messages":[{"role":"user","content":"请用C语言写一个冒泡排序算法"}],
    "temperature":0,
    "max_tokens":256,
    "stream":true,
    "chat_template_kwargs":{"enable_thinking":false}
  }'

03 / 性能测试

MegaCube 性能测试结果

2026-09-13;40 题、八类真实任务、三轮交错复测;Thinking 关闭。C1 解码数据为中位数,前缀缓存另用约 19.9K-token 公共前缀测试。

43.70 tok/sC1 · MTP3 · 解码中位数
0.30 s同组真实任务 TTFT P95
1.486 s约 19.9K 前缀稳定热缓存 TTFT 中位数
C1:MTP3 / MTP4 交错复测
配置解码P50P10TTFT P50/P95质量分MTP接受率
MTP3 · 正式推荐43.70 tok/s26.900.26 / 0.30秒0.84266.17%
MTP4 · 吞吐可选46.25 tok/s26.000.27 / 0.32秒0.86057.83%
C2:低并发聚合吞吐(tok/s)
配置聚合吞吐TTFT P95
MTP348.200.47秒
MTP451.600.53秒
公共前缀:冷启动与稳定热缓存
状态TTFT查询token命中token命中率解码tok/s
冷前缀11.579秒19,88400%28.012
首次复用/预热11.568秒19,88400%26.475
稳定热缓存11.509秒19,88417,60088.51%26.792
稳定热缓存21.483秒19,88417,60088.51%27.675
稳定热缓存31.486秒19,88417,60088.51%26.537
  • 262K 是服务配置上限,未完成满长度压力验证。
  • 首次复用仍可能未命中;缓存收益是首字等待的减少,并非逐 token 解码加速。
  • 权重文件约 133 GB 不表示所有权重同时常驻内存。

C1 / C4 / C8 表示 1 / 4 / 8 个并发请求。TTFT(首 token 延迟)指从提交请求到接收首个输出 token 的耗时;TPOT(每输出 token 耗时)指首个 token 之后的平均生成间隔。聚合吞吐统计全部并发请求的输出,单请求解码速率以 tok/s 表示。

公开评测参考

模型能力与平台性能评测

以下数据由模型或平台发布方提供,与上方 MegaCube 实测分开呈现。能力评分用于了解任务表现,tok/s 用于描述输出速度;不同模型、精度、硬件和测试协议的结果不宜直接比较。

NVIDIA NVFP4 版本能力评测

评测模型
Qwen3.8-Flash-Next-NVFP4
测试平台
NVIDIA B200 / B300;vLLM
NVIDIA NVFP4 版本能力评测 · 数据
评测项目成绩衡量内容
GPQA Diamond91.5高难度科学问答
Terminal-Bench 2.182.9终端中的多步骤任务
MMMU Pro78.3多学科多模态理解

测试条件temperature=1、top_p=0.95、最大输出预算 131,072 tokens,推理强度 xhigh。不同评测的工具框架与任务环境见来源;不是本页单机吞吐或准确率复测。

查看原始评测 ↗

规划模型部署与应用集成

根据模型规模、业务任务与并发需求,评估设备配置和推理服务。

咨询此模型方案