官网查看
定制方案
- ✓
暂未采集到具体套餐,价格以官网为准
Qwen4 的开放权重预览版
Qwen3.8-Flash-Next 是 Qwen4 架构的开放权重预览版本,采用 125B 总参数、仅激活 6B 的多模态 MoE 结构,整体参数量虽大但推理效率显著提升。它引入了 QSA、门控残差(Gated Residual)、N-gram 词嵌入以及 Muon 优化器等全新设计,让开发者得以提前体验下一代 Qwen 模型的底层架构方向。
Qwen4 的开放权重预览版
Qwen3.8-Flash-Next 是 Qwen4 架构的开放权重预览版本,采用 125B 总参数、仅激活 6B 的多模态 MoE 结构,整体参数量虽大但推理效率显著提升。它引入了 QSA、门控残差(Gated Residual)、N-gram 词嵌入以及 Muon 优化器等全新设计,让开发者得以提前体验下一代 Qwen 模型的底层架构方向。
暂未采集到具体套餐,价格以官网为准
大家好!
Qwen 之前就做过一次。Qwen3-Next 让大家提前看到了后来出现在 Qwen3.5 中的架构。
Qwen3.8-Flash-Next 正在为 Qwen4 做同样的事情。
它是一个 125B 模型,但仅有 6B 激活参数,许多新设计的目标都是在提升能力的同时不让算力随之膨胀。QSA 让长上下文检索更加高效,Gated Residual 为信息提供了更多通过网络层的路径,而新的 N-gram 记忆模块则以极低的逐 token 计算开销增加了容量。
Qwen 一直在下一代正式发布之前很久,就把这些架构预览以真实可运行的模型形式推出。
而且模型权重已经 上线了 :)(附带一份 值得一读的许可证)