← 全部模型

通用问答 · 代码开发

Qwen3.8-27B

面向通用问答、代码开发与文档理解的 27B 多模态模型。采用 RadixArk NVFP4 权重,在单台 MegaCube 上部署并验证原生多 token 预测(MTP)。

多模态理解文本、图像、视频 → 文本
1 台 MegaCube已有实测报告

01 / 模型参数

模型架构与能力

Qwen3.8-27B 是通义千问的稠密多模态模型,面向日常问答、文档理解、代码开发和工具协作。它结合线性注意力与全注意力,并提供原生多 token 预测组件;同一基础模型的不同量化权重和推理引擎需要分别评估速度与内存需求。

  • 知识问答与资料整理
  • 代码生成与调试
  • 文档和图像理解
发布方 / 基础模型
阿里通义千问 · Qwen3.8-27B
参数规模 / 架构
27B 稠密模型;64 层;Gated DeltaNet + Gated Attention 混合架构
模型上下文
原生 262,144 tokens,可扩展至 1M;扩展长度不是本页设备验证结果
输入 / 输出
文本、图像、视频输入;文本与工具调用输出
推理能力
支持思考模式、智能体工具调用与原生 MTP 多 token 预测
许可证
Apache-2.0
本页量化版本
RadixArk ModelOpt 混合量化:MLP / lm_head 为 NVFP4,注意力为 FP8,MTP 与视觉部分保留 BF16

公开模型支持多模态输入;本页 MegaCube 性能矩阵以文本任务为主,不把官方视觉能力视为本机视觉实测。

模型资料核对于 2026-09-20

02 / 部署方式

MegaCube 部署配置

计算设备
1 × MegaCube · NVIDIA GB10 · 128 GB
推理引擎
SGLang;公开镜像 lmsysorg/sglang:v0.5.16-cu130
加速配置
Native MTP steps=3 / draft tokens=4
缓存与上下文
FP8 E4M3 KV;配置上限 262,144 tokens
内存
静态内存比例 0.70;模型加 MTP 驻留约 20.75 GiB
  1. 检查环境

    准备 ARM64 Linux、NVIDIA 驱动、Docker 与 NVIDIA Container Toolkit。

  2. 准备模型

    下载 RadixArk/Qwen3.8-27B-NVFP4,挂载到容器中的 /models/target。

  3. 启动服务

    配置 NEXTN、steps=3、draft tokens=4 和 FP8 KV,启动 SGLang。

  4. 连接品悟

    检查 /health 与 /v1/models,使用 qwen3.8-27b 作为模型名连接兼容 API。

在本地模型商店中找到此模型,下载后按卡片指引部署并启用。

下载本地模型商店 →
查看运行命令与配置参考

使用前按你的设备修改模型路径和服务地址,并核对上方版本与参数。

uname -m
nvidia-smi
docker version
docker compose version
docker run --rm --gpus all ubuntu:24.04 nvidia-smi
mkdir -p "$HOME/models/Qwen3.8-27B-NVFP4"
python3 -m venv "$HOME/.venvs/hf-download"
source "$HOME/.venvs/hf-download/bin/activate"
pip install -U huggingface_hub

HF_ENDPOINT=https://hf-mirror.com \
hf download RadixArk/Qwen3.8-27B-NVFP4 \
  --revision main \
  --local-dir "$HOME/models/Qwen3.8-27B-NVFP4"
# 网络下载
docker pull lmsysorg/sglang:v0.5.16-cu130

# 精确复现:在旧 Cube 导出
docker save qwen38-benchmark/sglang-dflash2:dd15fb57 \
  | zstd -T0 -3 -o qwen38-sglang-dd15fb57-arm64.tar.zst

# 在新 Cube 导入
zstd -dc qwen38-sglang-dd15fb57-arm64.tar.zst | docker load
mkdir -p "$HOME/qwen38-serving-cache/sglang" \
             "$HOME/qwen38-serving-cache/huggingface"

docker run -d \
  --name qwen38-nvfp4-mtp-api \
  --restart unless-stopped \
  --gpus all \
  --network host \
  --ipc host \
  -v "$HOME/qwen38-serving-cache/sglang:/root/.cache/sglang" \
  -v "$HOME/qwen38-serving-cache/huggingface:/root/.cache/huggingface" \
  -v "$HOME/models/Qwen3.8-27B-NVFP4:/models/target:ro" \
  lmsysorg/sglang:v0.5.16-cu130 \
  python3 -m sglang.launch_server \
  --model-path=/models/target \
  --served-model-name=qwen3.8-27b \
  --host=0.0.0.0 \
  --port=30000 \
  --context-length=262144 \
  --mem-fraction-static=0.70 \
  --kv-cache-dtype=fp8_e4m3 \
  --trust-remote-code \
  --reasoning-parser=qwen3 \
  --tool-call-parser=auto \
  --sampling-defaults=model \
  --preferred-sampling-params='{"temperature":1.0,"top_p":0.95,"top_k":20,"min_p":0.0,"presence_penalty":0.0,"repetition_penalty":1.0}' \
  --speculative-algorithm=NEXTN \
  --speculative-num-steps=3 \
  --speculative-eagle-topk=1 \
  --speculative-num-draft-tokens=4
docker logs -f qwen38-nvfp4-mtp-api
# 另开终端执行
curl -fsS http://127.0.0.1:30000/health
curl -fsS http://127.0.0.1:30000/v1/models
curl -fsS http://127.0.0.1:30000/get_model_info
curl http://<Cube-IP>:30000/v1/chat/completions \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "qwen3.8-27b",
    "messages": [
      {"role": "user", "content": "你好,请介绍一下你自己"}
    ],
    "temperature": 1.0,
    "top_p": 0.95,
    "top_k": 20,
    "max_tokens": 1024,
    "stream": true
  }'

03 / 性能测试

MegaCube 性能测试结果

2026-08-27;单台 GB10;8 类 Prompt。C1 使用 1 个种子,C4/C8 使用 3 个种子。表中吞吐采用报告的几何平均口径。

23.923 tok/sInstruct C1,几何平均输出吞吐
94.198 tok/sInstruct C8,几何平均输出吞吐
214.1 msInstruct C1,平均首字延迟
Thinking 与 Instruct 正式采样
模式并发请求数输出 Token几何平均 Output tok/s平均 TTFT平均 TPOT几何平均 P95
Thinking12417,86619.604224.5 ms50.85 ms41,741.3 ms
Thinking47254,23955.133336.6 ms59.52 ms50,679.7 ms
Thinking87254,05879.072451.4 ms69.28 ms58,565.0 ms
Instruct12417,27023.923214.1 ms42.05 ms33,293.4 ms
Instruct47251,57965.233309.4 ms49.13 ms40,643.1 ms
Instruct87251,26494.198316.4 ms57.00 ms46,867.2 ms
MTP 调度器接受数据
并发采样数平均接受长度平均接受率
13792.33244.4%
43662.34344.8%
82342.34444.8%
  • 固定长度矩阵 C8 的 177.14 tok/s 与自然输出的官方采样属于不同负载,不直接比较。
  • 更改上下文、KV 精度、MTP 或内存比例后,需要重新验证。

C1 / C4 / C8 表示 1 / 4 / 8 个并发请求。TTFT(首 token 延迟)指从提交请求到接收首个输出 token 的耗时;TPOT(每输出 token 耗时)指首个 token 之后的平均生成间隔。聚合吞吐统计全部并发请求的输出,单请求解码速率以 tok/s 表示。

公开评测参考

模型能力与平台性能评测

以下数据由模型或平台发布方提供,与上方 MegaCube 实测分开呈现。能力评分用于了解任务表现,tok/s 用于描述输出速度;不同模型、精度、硬件和测试协议的结果不宜直接比较。

RadixArk NVFP4 量化版本评测

评测模型
Qwen3.8-27B-NVFP4
测试平台
4 × NVIDIA B300 / GB300;TP=4;SGLang
RadixArk NVFP4 量化版本评测 · 数据
评测项目成绩衡量内容
GSM8K97.27%(1,283 / 1,319)数学应用题
Terminal-Bench 2.1 子集73.81%(62 / 84)终端任务完成率

测试条件GSM8K 使用完整 1,319 题、思考模式、temperature=1、top_p=0.95、top_k=20。Terminal-Bench 使用 84 个任务子集、Claude Code 2.1.228、pass@1;两项不是 MegaCube 测试。

查看原始评测 ↗

规划模型部署与应用集成

根据模型规模、业务任务与并发需求,评估设备配置和推理服务。

咨询此模型方案