← 全部模型

通用问答 · 代码开发

DeepSeek-V4.1-Flash

支持文本推理、代码开发与视觉理解的多模态模型。四节点方案通过 NVMe 按需加载 Engram 条件记忆,验证模型推理与工具调用能力。

多模态理解文本、图像 → 文本
4 台 MegaCube已有实测报告

01 / 模型参数

模型架构与能力

DeepSeek-V4.1-Flash 将混合专家骨干与 Engram 条件记忆结合,用于知识问答、代码开发、图像理解和智能体操作。模型采用编码、解码分工的 CED 架构,输入处理阶段与输出生成阶段的激活参数不同;Engram 也是独立的参数与存储组成,不能与骨干参数混为一项。

  • 复杂问答与长资料分析
  • 代码开发与工具调用
  • 图像理解和多模态推理
发布方 / 模型
DeepSeek · DeepSeek-V4.1-Flash
参数组成
骨干 552B;另有 196B Engram 条件记忆参数
激活参数
输入预填充约 8B;输出解码约 16B
架构
CED:20 层编码 + 20 层解码;384 个路由专家,每次选 6 个,另有 1 个共享专家;CSA 2.0
模型上下文
1M tokens;不代表本页四机完成满长度验证
输入 / 输出
文本、图像输入;文本与工具调用输出
本页权重与存储
保留官方混合精度;每台完整权重约 475.27 GiB;Engram 逻辑数据整模型约 188.83 GiB
许可证
MIT

本页已验证代码、图像理解和工具调用;官方基准成绩不是本机任务准确率。Engram 按需读取涉及磁盘与缓存,性能需结合下方配置理解。

模型资料核对于 2026-09-20

02 / 部署方式

MegaCube 部署配置

计算设备
4 × MegaCube,每台 128 GB 统一内存
网络与存储
200GE RoCE;每台高速 NVMe,建议 2 TB 或以上
并行与加速
TP4 · DSpark 草稿长度 5 · CUDA Graph
服务参数
上下文上限 300,000;最大执行并发 8;预填充预算 8192
应用接口
兼容 Chat Completions;支持视觉、工具与流式响应
  1. 准备四台设备

    检查 RoCE 网络和本地 NVMe,各台留出至少 700 GiB 可用空间。

  2. 下载完整权重

    从官方来源下载 DeepSeek-V4.1-Flash,四台各保存完整权重并校验。

  3. 构建并启动

    使用固定版本适配代码、vLLM 与 FlashInfer,填写网络配置后启动 TP4。

  4. 验证并接入

    测试视觉与工具协议,再将品悟连接到 deepseek-v4.1-flash 模型服务。

固定运行版本
固定运行版本
组件固定版本
适配代码fc725ecf10869c184f4347dd73336536d395753c
vLLM 源码e47aa780bccf59f59dfa2cbb18e17a10b4fe69ba
FlashInfer07869c61ba581e6d6b8ad8d142f4a6c89b707cc1
基础容器Dockerfile 中固定镜像 digest;ARM64 构建
内核构建目标 12.1a;预编译 MXFP8 与 sparse MLA 所需内核
查看运行命令与配置参考

使用前按你的设备修改模型路径和服务地址,并核对上方版本与参数。

sudo apt-get update
sudo apt-get install -y git curl rsync python3-venv rdma-core ibverbs-utils unzip
uname -m                 # 应为 aarch64
nvidia-smi               # 驱动正常识别计算设备
docker version
ip -br addr
rdma link show
ibv_devinfo
# 如系统已提供 show_gids,可据此选择 RoCE v2 IPv4 GID。
mkdir -p "$HOME/megacube-deepseek"
unzip megacube-deepseek-deploy.zip -d "$HOME/megacube-deepseek"
python3 -m venv "$HOME/.venvs/model-download"
source "$HOME/.venvs/model-download/bin/activate"
pip install modelscope
mkdir -p "$HOME/models/DeepSeek-V4.1-Flash"
modelscope download --model deepseek-ai/DeepSeek-V4.1-Flash \
  --local_dir "$HOME/models/DeepSeek-V4.1-Flash"

# 在解压的部署包目录执行;校验索引、分片长度及 Engram 容量。
python3 "$HOME/megacube-deepseek/verify-model.py" "$HOME/models/DeepSeek-V4.1-Flash"
cd "$HOME/models/DeepSeek-V4.1-Flash"
find . -type f ! -name SHA256SUMS -print0 | sort -z | \
  xargs -0 sha256sum > SHA256SUMS
for host in cube-b cube-c cube-d; do
  ssh "$host" 'mkdir -p "$HOME/models/DeepSeek-V4.1-Flash"'
  rsync -a --partial --append-verify "$HOME/models/DeepSeek-V4.1-Flash/" \
    "$host:models/DeepSeek-V4.1-Flash/"
  ssh "$host" 'cd "$HOME/models/DeepSeek-V4.1-Flash" && sha256sum -c SHA256SUMS'
done
cd "$HOME/megacube-deepseek"
bash build-image.sh
cd "$HOME/megacube-deepseek"
for host in cube-b cube-c cube-d; do
  ssh "$host" 'mkdir -p "$HOME/megacube-deepseek"'
  rsync -a --exclude='.git' spark-vllm "$host:megacube-deepseek/"
  rsync -a start-rank.sh cluster.env.example "$host:megacube-deepseek/"
  docker save megacube/deepseek-v41:release-20260913 | ssh "$host" 'docker load'
done
# 每台执行一次;应正常加载预编译的 MXFP8 和 sparse MLA 内核。
docker run --rm --gpus all --entrypoint python3 \
  megacube/deepseek-v41:release-20260913 /opt/dsv41-verify-kernels.py
# cube-d
cd "$HOME/megacube-deepseek" && bash start-rank.sh 3
# cube-c
cd "$HOME/megacube-deepseek" && bash start-rank.sh 2
# cube-b
cd "$HOME/megacube-deepseek" && bash start-rank.sh 1
# 最后在 cube-a
cd "$HOME/megacube-deepseek" && bash start-rank.sh 0
docker logs -f megacube-deepseek-v41
curl -f http://127.0.0.1:18411/health
curl -f http://127.0.0.1:18411/v1/models
curl -N http://127.0.0.1:18411/v1/chat/completions \
  -H 'Content-Type: application/json' \
  -d '{"model":"deepseek-v4.1-flash","messages":[{"role":"user","content":"请用 Python 实现合并重叠区间的函数。"}],"temperature":0,"max_tokens":256,"stream":true,"chat_template_kwargs":{"thinking":false}}'
cd "$HOME/megacube-deepseek"
python3 spark-vllm/tools/vision_tools_demo.py http://127.0.0.1:18411/v1
mkdir -p results
python3 spark-vllm/bench/v41bench.py \
  --base http://127.0.0.1:18411/v1 --model deepseek-v4.1-flash \
  --label megacube-local --out results

03 / 性能测试

MegaCube 性能测试结果

2026-09-13;4 台 MegaCube。73.43 token/s 是指定 coding 单并发用例的单流解码;并发表格为八类任务批次指标的算术平均,统计对象不同。

73.43 token/s指定 coding 用例 · C1 单流解码
140.22 token/s八类任务 · C6 平均聚合吞吐
7 / 7三项图像、四项工具用例通过
八类任务:并发平均表现
并发平均聚合吞吐(token/s)平均单流解码(token/s)平均 TTFT(秒)
C139.2744.220.389
C259.5534.420.459
C375.0928.350.435
C499.9729.410.513
C5125.9229.080.480
C6140.2227.340.493
长输入:冷预填充
实际输入 tokens冷预填充 TTFT(秒)输入处理速度(token/s)
2,9501.9971476.8
11,59214.188817.0
46,81049.145952.5
93,335146.360637.7
视觉与工具功能验证
功能本次结果
视觉与工具协议7/7 通过:三项图像用例、四项工具用例
自动工具选择及回传完成工具选择、参数生成及结果回传链路
输出乱码检查30/30 通过启发式检查;不等同于语义正确率
流式应用接入完成 pinvou Agent 的接口接入与使用验证
  • 单流解码不含首 token 等待,不能等同于端到端回答速度。
  • 30/30 乱码检查通过属于启发式检查,不代表语义正确率。
  • NVMe 按需加载的效果受到磁盘随机读取与系统页缓存影响。

C1 / C4 / C8 表示 1 / 4 / 8 个并发请求。TTFT(首 token 延迟)指从提交请求到接收首个输出 token 的耗时;TPOT(每输出 token 耗时)指首个 token 之后的平均生成间隔。聚合吞吐统计全部并发请求的输出,单请求解码速率以 tok/s 表示。

公开评测参考

模型能力与平台性能评测

以下数据由模型或平台发布方提供,与上方 MegaCube 实测分开呈现。能力评分用于了解任务表现,tok/s 用于描述输出速度;不同模型、精度、硬件和测试协议的结果不宜直接比较。

DeepSeek-V4.1-Flash 官方能力评测

评测模型
DeepSeek-V4.1-Flash Instruct
测试平台
来源未披露推理硬件
DeepSeek-V4.1-Flash 官方能力评测 · 数据
评测项目成绩衡量内容
GPQA Diamond90.9 · Pass@1高难度科学问答
Terminal-Bench 2.190.6 · Pass@1终端任务完成
DeepSWE v1.174.2 · Resolved软件问题解决率

测试条件MAX 推理强度 100、temperature=1、top_p=0.95。Terminal-Bench 使用 DeepSeek Harness Minimal;DeepSWE 使用 mini-SWE,均为 1M 上下文。各项指标和任务环境以原始评测为准。

查看原始评测 ↗

规划模型部署与应用集成

根据模型规模、业务任务与并发需求,评估设备配置和推理服务。

咨询此模型方案