
通用问答 · 代码开发
Qwen3.8-27B · SGLang 0.5.19
面向问答、代码开发与智能体应用的 27B 单机推理方案。采用 Unsloth NVFP4 权重与 SGLang 0.5.19,可通过本地模型商店获取。
多模态理解文本、图像、视频 → 文本
01 / 模型介绍
模型架构与能力
Qwen3.8-27B 是通义千问的稠密多模态模型,面向日常问答、文档理解、代码开发和工具协作。它结合线性注意力与全注意力,并提供原生多 token 预测组件;同一基础模型的不同量化权重和推理引擎需要分别评估速度与内存需求。
- 发布方 / 基础模型
- 阿里通义千问 · Qwen3.8-27B
- 参数规模 / 架构
- 27B 稠密模型;64 层;Gated DeltaNet + Gated Attention 混合架构
- 模型上下文
- 原生 262,144 tokens,可扩展至 1M;实际服务长度取决于运行配置
- 输入 / 输出
- 文本、图像、视频输入;文本与工具调用输出
- 推理能力
- 支持思考模式、智能体工具调用与原生 MTP 多 token 预测
- 许可证
- Apache-2.0
- 本页量化版本
- Unsloth Dynamic V3 NVFP4 预览版;lm_head 为 FP8;SGLang 需 0.5.19 或以上
- 权重下载体积
- 约 23.4 GB;包含独立 MTP 预测组件
02 / 适用场景
应用场景
日常问答与写作
回答工作中的问题,起草文案、整理要点,并根据要求调整文字表达。
代码开发与工具调用
辅助代码编写、解释与调试,通过兼容应用连接工具处理更完整的任务。
文档内容理解
理解文字、图像和文档中的信息,辅助内容提取、摘要及问答。
规划模型部署与应用集成
根据模型规模、业务任务与并发需求,评估设备配置和推理服务。