← 全部模型
通用问答 · 代码开发
Qwen3.8-Flash-Next
面向通用问答、代码开发与工具调用的多模态模型。采用 FP8 权重,通过 DAC 双节点直连进行分布式推理与长上下文验证。
多模态理解文本、图像、视频 → 文本
2 台 MegaCube已有实测报告
Qwen3.8-Flash-Next 是面向通用问答和智能体工作的多模态混合专家模型。它通过稀疏专家、混合注意力和可分层加载的嵌入组件,在每一步只调用部分计算资源;参数总量、每步激活参数和实际设备内存占用是不同概念。
- 长文档问答与信息提取
- 代码编写和项目修改
- 多步骤工具协作
- 发布方 / 基础模型
- 阿里通义千问 · Qwen3.8-Flash-Next
- 参数组成
- 语言模型 125B / 激活 6B;另有 51B N-gram 嵌入与 4B MTP 组件
- 架构
- 48 层 MoE;512 个路由专家,每次选 10 个,另有 1 个共享专家;Gated DeltaNet + QSA
- 模型上下文
- 原生 262,144 tokens,可扩展至 1M;配置上限与实测长度分别列出
- 输入 / 输出
- 文本、图像、视频输入;文本与工具调用输出
- 主要能力
- 问答、复杂推理、代码开发、工具调用与多模态理解
- 本页权重
- Qwen 官方 FP8 版本;131 个 safetensors 分片
- 许可证
- Qwen Community License 1.0
此方案的实测以文本和长上下文为主。FP8 双机与 NVFP4 单机使用不同精度及加载方式,不能只按设备数量比较速度。
模型资料核对于 2026-09-20
- 计算设备
- 2 × MegaCube,每台 128 GB 统一内存
- 网络
- 一根 QSFP DAC 直连;管理与 API 走 RJ45
- 执行方式
- vLLM 原生 MP · TP=2 · PP=1
- 服务设置
- 上下文 262,144;MaxSeq=8;BatchTokens=8192
- 加速与内存
- MTP=1;Eager;GPU memory=0.85;Prefix Cache
连接设备
用一根兼容 DAC 连接两台 Cube,确认 RDMA 与办公网络。
对齐权重与镜像
两台保留相同 131 个权重分片并校验索引,使用同一 ARM64 镜像。
先工作节点后主节点
先启动 node-rank 1,再启动 node-rank 0,组成 TP2 / PP1 服务。
检查接口
检查 /health、/v1/models 和流式请求,再进行并发与长文验证。
规划模型部署与应用集成
根据模型规模、业务任务与并发需求,评估设备配置和推理服务。
咨询此模型方案