← 全部模型
通用问答 · 代码开发
DeepSeek-V4-Flash-Vision-Exp
支持文本推理、代码开发与图像理解的实验性多模态模型。双节点验证覆盖文本和图像输入、并发请求与长上下文处理。
多模态理解文本、图像 → 文本
2 台 MegaCube已有实测报告
DeepSeek-V4-Flash-Vision-Exp 在 DeepSeek-V4-Flash 语言骨干上继续训练视觉能力,用于理解图片、图表、文档,并结合文字推理和工具调用完成任务。它输出文字或工具调用,不直接生成图片;实验版本的部署兼容性应按具体权重和引擎确认。
- 问答与代码任务
- 图片、图表和文档理解
- 结合视觉信息的智能体任务
- 发布方 / 模型
- DeepSeek · DeepSeek-V4-Flash-Vision-Exp
- 参数规模
- 语言骨干 284B / 激活 13B;视觉模块另计,官方模型卡未单列完整视觉版总参数
- 架构
- 43 层 MoE;256 个路由专家,每次选 6 个,另有 1 个共享专家;附视觉编码器
- 模型上下文
- 配置上限 1,048,576 tokens;MegaCube 已验证范围见下文
- 输入 / 输出
- 文本、图像输入;文本与工具调用输出
- 精度与版本
- 官方配置含 FP4 专家及 FP8 量化;Vision-Exp 实验版
- 许可证
- MIT
模型分析图像内容后输出文字或工具调用,不生成图片。双机实测与官方智能体评测采用不同任务和环境,成绩不混用。
模型资料核对于 2026-09-20
- 计算设备
- 2 × MegaCube,每台 128 GB 统一内存
- 推理环境
- DSpark / vLLM;镜像 ghcr.io/anemll/dspark-vllm-gx10:0.1.1
- 并行
- TP=2 / PP=1
- 服务设置
- 上下文 262,144;最大并发 8;BatchTokens=16384
- 加速与缓存
- MTP=6;KV=nvfp4_ds_mla;前缀缓存与分块预填充
连接两台 Cube
确认高速直连和管理网络,两台使用一致的权重与镜像。
配置主节点
在启动器配置中填写节点地址、模型路径及服务参数。
统一启动
从主节点启动双 Rank 服务,由启动器同步依赖并完成预热。
验证文本与图像
检查 API 健康,再验证文本、图片与目标并发负载。
规划模型部署与应用集成
根据模型规模、业务任务与并发需求,评估设备配置和推理服务。
咨询此模型方案