← 全部模型

通用问答 · 代码开发

DeepSeek-V4-Flash-Vision-Exp

支持文本推理、代码开发与图像理解的实验性多模态模型。双节点验证覆盖文本和图像输入、并发请求与长上下文处理。

多模态理解文本、图像 → 文本
2 台 MegaCube已有实测报告

01 / 模型参数

模型架构与能力

DeepSeek-V4-Flash-Vision-Exp 在 DeepSeek-V4-Flash 语言骨干上继续训练视觉能力,用于理解图片、图表、文档,并结合文字推理和工具调用完成任务。它输出文字或工具调用,不直接生成图片;实验版本的部署兼容性应按具体权重和引擎确认。

  • 问答与代码任务
  • 图片、图表和文档理解
  • 结合视觉信息的智能体任务
发布方 / 模型
DeepSeek · DeepSeek-V4-Flash-Vision-Exp
参数规模
语言骨干 284B / 激活 13B;视觉模块另计,官方模型卡未单列完整视觉版总参数
架构
43 层 MoE;256 个路由专家,每次选 6 个,另有 1 个共享专家;附视觉编码器
模型上下文
配置上限 1,048,576 tokens;MegaCube 已验证范围见下文
输入 / 输出
文本、图像输入;文本与工具调用输出
精度与版本
官方配置含 FP4 专家及 FP8 量化;Vision-Exp 实验版
许可证
MIT

模型分析图像内容后输出文字或工具调用,不生成图片。双机实测与官方智能体评测采用不同任务和环境,成绩不混用。

模型资料核对于 2026-09-20

02 / 部署方式

MegaCube 部署配置

计算设备
2 × MegaCube,每台 128 GB 统一内存
推理环境
DSpark / vLLM;镜像 ghcr.io/anemll/dspark-vllm-gx10:0.1.1
并行
TP=2 / PP=1
服务设置
上下文 262,144;最大并发 8;BatchTokens=16384
加速与缓存
MTP=6;KV=nvfp4_ds_mla;前缀缓存与分块预填充
  1. 连接两台 Cube

    确认高速直连和管理网络,两台使用一致的权重与镜像。

  2. 配置主节点

    在启动器配置中填写节点地址、模型路径及服务参数。

  3. 统一启动

    从主节点启动双 Rank 服务,由启动器同步依赖并完成预热。

  4. 验证文本与图像

    检查 API 健康,再验证文本、图片与目标并发负载。

03 / 性能测试

MegaCube 性能测试结果

2026-09-01;16 个正式性能用例,每项先完成 10 次目标输出预热,再测量至少 180 秒。表中内存是双节点合计口径。

102.19 tok/s16K/1K tokens · C8 聚合输出
0.453 s2K/256 tokens · C1 TTFT P95
250,004冷态长输入 tokens 验证通过
完整性能矩阵
输入/输出并发RPS输入 tok/s输出 tok/sTTFT P95(s)TPOT P95(ms)E2E P95(s)MTP 接受率前缀命中率内存 GiB成功率
512/1281.201103.0425.76.45356.577.5815.16%50.00%224.44100%
512/1282.275141.0235.07.63085.6411.1313.49%50.00%224.45100%
512/1284.394201.8550.46.910118.6715.7115.23%50.00%224.49100%
512/1288.497254.5763.372.100194.1925.0814.68%50.00%224.43100%
2048/2561.182373.3446.67.45330.208.1544.86%87.50%224.50100%
2048/2562.223457.2557.16.79076.7120.1134.22%87.50%224.44100%
2048/2564.320655.6181.951.07093.2224.3937.04%87.50%224.44100%
2048/2568.364745.4793.181.940178.7746.6130.47%87.50%224.47100%
16384/10241.039635.7439.73.44046.1747.6731.13%98.44%224.46100%
16384/10242.055900.4052.02.67080.4070.2329.03%98.44%224.48100%
16384/10244.0831357.7772.091.380115.8580.0428.51%98.44%224.48100%
16384/10248.1091782.75102.192.212174.99109.5632.52%98.44%224.52100%
32768/10241.023756.6523.65.50057.0258.8011.85%99.22%224.56100%
32768/10242.0321052.0932.88.85076.6478.9910.74%99.22%224.58100%
32768/10244.0451478.2146.191.410109.53112.8411.07%99.22%224.57100%
32768/10248.0581894.1559.192.190168.52174.5012.10%99.22%224.61100%
  • 矩阵包含前缀缓存命中,不能将缓存后的 TTFT 当作全新长输入的处理速度。
  • 实验版本的功能与兼容性以本次报告范围为准。

C1 / C4 / C8 表示 1 / 4 / 8 个并发请求。TTFT(首 token 延迟)指从提交请求到接收首个输出 token 的耗时;TPOT(每输出 token 耗时)指首个 token 之后的平均生成间隔。聚合吞吐统计全部并发请求的输出,单请求解码速率以 tok/s 表示。

公开评测参考

模型能力与平台性能评测

以下数据由模型或平台发布方提供,与上方 MegaCube 实测分开呈现。能力评分用于了解任务表现,tok/s 用于描述输出速度;不同模型、精度、硬件和测试协议的结果不宜直接比较。

DeepSeek 视觉实验版官方评测

评测模型
DeepSeek-V4-Flash-Vision-Exp
测试平台
来源未披露推理硬件
DeepSeek 视觉实验版官方评测 · 数据
评测项目成绩衡量内容
Terminal-Bench 2.183.9终端操作任务
DeepSWE59.3软件工程任务
Toolathlon Verified75.9工具调用任务

测试条件文本智能体评测使用 DeepSeek Harness Minimal、最高推理强度、temperature=1、top_p=0.95。这里的分数描述任务完成能力,不描述双机响应速度。

查看原始评测 ↗

规划模型部署与应用集成

根据模型规模、业务任务与并发需求,评估设备配置和推理服务。

咨询此模型方案