← 全部模型
通用问答 · 代码开发
DeepSeek-V4.1-Flash
支持文本推理、代码开发与视觉理解的多模态模型。四节点方案通过 NVMe 按需加载 Engram 条件记忆,验证模型推理与工具调用能力。
多模态理解文本、图像 → 文本
4 台 MegaCube已有实测报告
DeepSeek-V4.1-Flash 将混合专家骨干与 Engram 条件记忆结合,用于知识问答、代码开发、图像理解和智能体操作。模型采用编码、解码分工的 CED 架构,输入处理阶段与输出生成阶段的激活参数不同;Engram 也是独立的参数与存储组成,不能与骨干参数混为一项。
- 复杂问答与长资料分析
- 代码开发与工具调用
- 图像理解和多模态推理
- 发布方 / 模型
- DeepSeek · DeepSeek-V4.1-Flash
- 参数组成
- 骨干 552B;另有 196B Engram 条件记忆参数
- 激活参数
- 输入预填充约 8B;输出解码约 16B
- 架构
- CED:20 层编码 + 20 层解码;384 个路由专家,每次选 6 个,另有 1 个共享专家;CSA 2.0
- 模型上下文
- 1M tokens;不代表本页四机完成满长度验证
- 输入 / 输出
- 文本、图像输入;文本与工具调用输出
- 本页权重与存储
- 保留官方混合精度;每台完整权重约 475.27 GiB;Engram 逻辑数据整模型约 188.83 GiB
- 许可证
- MIT
本页已验证代码、图像理解和工具调用;官方基准成绩不是本机任务准确率。Engram 按需读取涉及磁盘与缓存,性能需结合下方配置理解。
模型资料核对于 2026-09-20
- 计算设备
- 4 × MegaCube,每台 128 GB 统一内存
- 网络与存储
- 200GE RoCE;每台高速 NVMe,建议 2 TB 或以上
- 并行与加速
- TP4 · DSpark 草稿长度 5 · CUDA Graph
- 服务参数
- 上下文上限 300,000;最大执行并发 8;预填充预算 8192
- 应用接口
- 兼容 Chat Completions;支持视觉、工具与流式响应
准备四台设备
检查 RoCE 网络和本地 NVMe,各台留出至少 700 GiB 可用空间。
下载完整权重
从官方来源下载 DeepSeek-V4.1-Flash,四台各保存完整权重并校验。
构建并启动
使用固定版本适配代码、vLLM 与 FlashInfer,填写网络配置后启动 TP4。
验证并接入
测试视觉与工具协议,再将品悟连接到 deepseek-v4.1-flash 模型服务。
规划模型部署与应用集成
根据模型规模、业务任务与并发需求,评估设备配置和推理服务。
咨询此模型方案