← 全部模型

通用问答 · 代码开发

Kimi-K3 · 2.8T 集群

面向长上下文推理、代码开发与智能体任务的多模态混合专家模型。采用 MXFP4 权重,在 16 台 MegaCube 上进行分布式推理验证。

多模态理解文本、图像、视频 → 文本
16 台 MegaCube已有实测报告

01 / 模型参数

模型架构与能力

Kimi K3 由月之暗面发布,面向需要长时间推理、多步操作和大量上下文的工作。混合专家架构只在每一步调用部分参数,结合线性注意力与稀疏注意力处理长文本;模型也可理解图像与视频,并输出文字或工具调用。

  • 长篇资料与跨文档问答
  • 代码开发、修改与排错
  • 多步骤智能体任务
发布方 / 模型
月之暗面 · Kimi-K3
参数规模
2.8T 总参数;每 token 激活约 104B
架构
93 层 MoE;896 个路由专家,每次选 16 个,另有 2 个共享专家;KDA + Gated MLA
模型上下文
原生 1,048,576 tokens;设备实际可用长度见部署与实测
输入 / 输出
文本、图像、视频输入;文本与工具调用输出
权重精度 / 体积
MXFP4 权重、MXFP8 激活;本次权重约 1.45 TB
许可证
Kimi K3 License;使用与分发须遵守模型许可证

本页 MegaCube 记录主要覆盖文本推理、长文检索和并发。模型公开支持视觉理解,不代表此配置已完成全部视觉任务验证。

模型资料核对于 2026-09-20

02 / 部署方式

MegaCube 部署配置

计算设备
16 × MegaCube,每台 128 GB 统一内存
互联
H3C S9855-40B · 双路 200G RoCE v2 · MTU 9000
推理引擎
vLLM · TP16 · DSpark 投机解码
上下文
服务配置 333,126 tokens;本次测试至 128K
应用接入
OpenAI 兼容 API
  1. 准备集群

    连接 16 台设备与 RoCE 交换网络,核对管理网络及两路高速链路。

  2. 加载权重

    校验 MXFP4 权重,按 TP16 分片运行,每台分担约 93 GB 权重。

  3. 启动推理

    以报告配置启动 vLLM 与 DSpark,确认所有计算节点加入服务。

  4. 接入应用

    检查 API、长文任务与工具调用,再将品悟或业务应用接入。

03 / 性能测试

MegaCube 性能测试结果

2026-08-27;16 台设备;234 个模型测试请求。单流测试与并发系统吞吐分开统计,短上下文并发数据不能套用至 128K 输入。

22.69 tok/s128-token 输入,单流解码
0.573 s同一短输入用例首字延迟
12 / 124K–128K 长文检索点命中
单请求:输入长度与解码表现
输入长度首字延迟解码速度
1280.573 s22.69 tok/s
1K0.727 s25.28 tok/s
32K10.903 s23.48 tok/s
128K44.216 s21.20 tok/s
短上下文:并发吞吐与首字延迟
短上下文并发系统总吞吐TTFT P95成功率建议定位
1 路21.8 tok/s0.70 s100%独享流畅
2 路32.9 tok/s0.93 s100%协作流畅
4 路42.7 tok/s1.31 s100%体验达标上限
8 路48.4 tok/s56.05 s100%队列任务
16 路54.3 tok/s104.47 s100%吞吐最优 / 批处理
  • 长文检索仅覆盖测试文本中的 12 个位置,不代表所有知识问答准确率。
  • 高并发会增加排队和首字等待;系统总吞吐不是每位用户的回答速度。

C1 / C4 / C8 表示 1 / 4 / 8 个并发请求。TTFT(首 token 延迟)指从提交请求到接收首个输出 token 的耗时;TPOT(每输出 token 耗时)指首个 token 之后的平均生成间隔。聚合吞吐统计全部并发请求的输出,单请求解码速率以 tok/s 表示。

公开评测参考

模型能力与平台性能评测

以下数据由模型或平台发布方提供,与上方 MegaCube 实测分开呈现。能力评分用于了解任务表现,tok/s 用于描述输出速度;不同模型、精度、硬件和测试协议的结果不宜直接比较。

Kimi K3 官方能力评测

评测模型
Kimi K3
测试平台
来源未披露推理硬件
Kimi K3 官方能力评测 · 数据
评测项目成绩衡量内容
GPQA Diamond93.5高难度科学问答
DeepSWE v1.167.5真实软件问题解决
Terminal-Bench 2.188.3终端中的多步骤操作

测试条件最高推理强度、temperature=1。GPQA 使用 top_p=0.95;代码与终端任务使用 Kimi Code、top_p=1。成绩受智能体框架和工具环境影响。

查看原始评测 ↗

规划模型部署与应用集成

根据模型规模、业务任务与并发需求,评估设备配置和推理服务。

咨询此模型方案