← 全部模型
通用问答 · 代码开发
Qwen3.8-Flash-Next NVFP4
采用 NVFP4 量化的单机多模态推理方案,覆盖问答、代码开发与智能体任务。结合本地 NVMe 分层加载,在统一系统内存容量内运行模型。
多模态理解文本、图像、视频 → 文本
1 台 MegaCube已有实测报告
Qwen3.8-Flash-Next 是面向通用问答和智能体工作的多模态混合专家模型。它通过稀疏专家、混合注意力和可分层加载的嵌入组件,在每一步只调用部分计算资源;参数总量、每步激活参数和实际设备内存占用是不同概念。
- 发布方 / 基础模型
- 阿里通义千问 · Qwen3.8-Flash-Next
- 参数组成
- 语言模型 125B / 激活 6B;另有 51B N-gram 嵌入与 4B MTP 组件
- 架构
- 48 层 MoE;512 个路由专家,每次选 10 个,另有 1 个共享专家;Gated DeltaNet + QSA
- 模型上下文
- 原生 262,144 tokens,可扩展至 1M;配置上限与实测长度分别列出
- 输入 / 输出
- 文本、图像、视频输入;文本与工具调用输出
- 主要能力
- 问答、复杂推理、代码开发、工具调用与多模态理解
- 本页量化版本
- NVIDIA ModelOpt:主路由专家 NVFP4,其他主体层 BF16,MTP 专家与 PLE 为 FP8
- 权重体积
- 约 123.57 GiB / 132.7 GB;并非全部同时常驻内存
- 许可证
- NVIDIA Open Model License,并附 Qwen Community 相关条款
本页单机实测主要覆盖低并发文本与代码任务。模型公开支持视觉理解;262K 为本方案服务配置上限,尚未完成满长度压力验证。
模型资料核对于 2026-09-20
- 计算设备
- 1 × MegaCube · NVIDIA GB10 · 128 GB
- 引擎
- vLLM 0.28.1rc1.dev388 · CUDA 13.0 · ARM64
- 加载方式
- PLE 本地 NVMe mmap + staged gather
- 正式参数
- TP1;MTP3;seqs=1;chunk=2048;GMU=0.80
- 上下文
- 配置上限 262,144 tokens;Thinking 关闭
准备本地存储
下载 NVFP4 权重到高速 NVMe,PLE 分层读取需要本地磁盘配合。
固定运行版本
使用报告指定的 vLLM 镜像及 rc2 配置,校验权重与部署包。
启动单机服务
默认采用 C1 / MTP3,开启 Prefix Cache,保留默认 Compile / Graph。
预热与连接
先做健康检查及代表性任务预热,再将品悟连接到模型服务。
在本地模型商店中找到此模型,下载后按卡片指引部署并启用。
模型商店当前提供 rc3 候选部署包,尚未完成该版本的设备推理验收。本页数据来自此前 rc2 配置,请按版本区分。
下载本地模型商店 →
规划模型部署与应用集成
根据模型规模、业务任务与并发需求,评估设备配置和推理服务。
咨询此模型方案