← 全部模型
通用问答 · 代码开发
Qwen3.8-27B
面向通用问答、代码开发与文档理解的 27B 多模态模型。采用 RadixArk NVFP4 权重,在单台 MegaCube 上部署并验证原生多 token 预测(MTP)。
多模态理解文本、图像、视频 → 文本
1 台 MegaCube已有实测报告
Qwen3.8-27B 是通义千问的稠密多模态模型,面向日常问答、文档理解、代码开发和工具协作。它结合线性注意力与全注意力,并提供原生多 token 预测组件;同一基础模型的不同量化权重和推理引擎需要分别评估速度与内存需求。
- 发布方 / 基础模型
- 阿里通义千问 · Qwen3.8-27B
- 参数规模 / 架构
- 27B 稠密模型;64 层;Gated DeltaNet + Gated Attention 混合架构
- 模型上下文
- 原生 262,144 tokens,可扩展至 1M;扩展长度不是本页设备验证结果
- 输入 / 输出
- 文本、图像、视频输入;文本与工具调用输出
- 推理能力
- 支持思考模式、智能体工具调用与原生 MTP 多 token 预测
- 许可证
- Apache-2.0
- 本页量化版本
- RadixArk ModelOpt 混合量化:MLP / lm_head 为 NVFP4,注意力为 FP8,MTP 与视觉部分保留 BF16
公开模型支持多模态输入;本页 MegaCube 性能矩阵以文本任务为主,不把官方视觉能力视为本机视觉实测。
模型资料核对于 2026-09-20
- 计算设备
- 1 × MegaCube · NVIDIA GB10 · 128 GB
- 推理引擎
- SGLang;公开镜像 lmsysorg/sglang:v0.5.16-cu130
- 加速配置
- Native MTP steps=3 / draft tokens=4
- 缓存与上下文
- FP8 E4M3 KV;配置上限 262,144 tokens
- 内存
- 静态内存比例 0.70;模型加 MTP 驻留约 20.75 GiB
检查环境
准备 ARM64 Linux、NVIDIA 驱动、Docker 与 NVIDIA Container Toolkit。
准备模型
下载 RadixArk/Qwen3.8-27B-NVFP4,挂载到容器中的 /models/target。
启动服务
配置 NEXTN、steps=3、draft tokens=4 和 FP8 KV,启动 SGLang。
连接品悟
检查 /health 与 /v1/models,使用 qwen3.8-27b 作为模型名连接兼容 API。
规划模型部署与应用集成
根据模型规模、业务任务与并发需求,评估设备配置和推理服务。
咨询此模型方案