Kimi K3 官方能力评测
- 评测模型
- Kimi K3
- 测试平台
- 来源未披露推理硬件
| 评测项目 | 成绩 | 衡量内容 |
|---|---|---|
| GPQA Diamond | 93.5 | 高难度科学问答 |
| DeepSWE v1.1 | 67.5 | 真实软件问题解决 |
| Terminal-Bench 2.1 | 88.3 | 终端中的多步骤操作 |
测试条件最高推理强度、temperature=1。GPQA 使用 top_p=0.95;代码与终端任务使用 Kimi Code、top_p=1。成绩受智能体框架和工具环境影响。
查看原始评测 ↗
通用问答 · 代码开发
面向长上下文推理、代码开发与智能体任务的多模态混合专家模型。采用 MXFP4 权重,在 16 台 MegaCube 上进行分布式推理验证。
01 / 模型参数
Kimi K3 由月之暗面发布,面向需要长时间推理、多步操作和大量上下文的工作。混合专家架构只在每一步调用部分参数,结合线性注意力与稀疏注意力处理长文本;模型也可理解图像与视频,并输出文字或工具调用。
本页 MegaCube 记录主要覆盖文本推理、长文检索和并发。模型公开支持视觉理解,不代表此配置已完成全部视觉任务验证。
模型资料核对于 2026-09-20
02 / 部署方式
连接 16 台设备与 RoCE 交换网络,核对管理网络及两路高速链路。
校验 MXFP4 权重,按 TP16 分片运行,每台分担约 93 GB 权重。
以报告配置启动 vLLM 与 DSpark,确认所有计算节点加入服务。
检查 API、长文任务与工具调用,再将品悟或业务应用接入。
03 / 性能测试
2026-08-27;16 台设备;234 个模型测试请求。单流测试与并发系统吞吐分开统计,短上下文并发数据不能套用至 128K 输入。
| 输入长度 | 首字延迟 | 解码速度 |
|---|---|---|
| 128 | 0.573 s | 22.69 tok/s |
| 1K | 0.727 s | 25.28 tok/s |
| 32K | 10.903 s | 23.48 tok/s |
| 128K | 44.216 s | 21.20 tok/s |
| 短上下文并发 | 系统总吞吐 | TTFT P95 | 成功率 | 建议定位 |
|---|---|---|---|---|
| 1 路 | 21.8 tok/s | 0.70 s | 100% | 独享流畅 |
| 2 路 | 32.9 tok/s | 0.93 s | 100% | 协作流畅 |
| 4 路 | 42.7 tok/s | 1.31 s | 100% | 体验达标上限 |
| 8 路 | 48.4 tok/s | 56.05 s | 100% | 队列任务 |
| 16 路 | 54.3 tok/s | 104.47 s | 100% | 吞吐最优 / 批处理 |
C1 / C4 / C8 表示 1 / 4 / 8 个并发请求。TTFT(首 token 延迟)指从提交请求到接收首个输出 token 的耗时;TPOT(每输出 token 耗时)指首个 token 之后的平均生成间隔。聚合吞吐统计全部并发请求的输出,单请求解码速率以 tok/s 表示。
公开评测参考
以下数据由模型或平台发布方提供,与上方 MegaCube 实测分开呈现。能力评分用于了解任务表现,tok/s 用于描述输出速度;不同模型、精度、硬件和测试协议的结果不宜直接比较。
| 评测项目 | 成绩 | 衡量内容 |
|---|---|---|
| GPQA Diamond | 93.5 | 高难度科学问答 |
| DeepSWE v1.1 | 67.5 | 真实软件问题解决 |
| Terminal-Bench 2.1 | 88.3 | 终端中的多步骤操作 |
测试条件最高推理强度、temperature=1。GPQA 使用 top_p=0.95;代码与终端任务使用 Kimi Code、top_p=1。成绩受智能体框架和工具环境影响。
查看原始评测 ↗根据模型规模、业务任务与并发需求,评估设备配置和推理服务。