阿里通义千问团队正式发布 Qwen3.8-Flash。 发布公告有一组让人需要停下来看两眼的数据: 125B 总参数 + 51B N-gram Embedding,每 token 只激活 6B 参数。原生支持 262K 上下文,可通过 YaRN 扩展到 1M。相比 Qwen3.7-Plus,训练开销仅为其 1/9,编码和办公任务上却有更强能力。 这代模型在架构上有四个值得关注的变化:...