澳门永利皇宫- 永利皇宫官网- 永利皇宫娱乐城 2025
模型架构的改进也是Qwen3 性能提升的关键因素之一。官方提到,由于模型架构的改进、训练数据的增加以及更有效的训练方法,Qwen3 的 Dense 基础模型在整体性能上已经能与参数量更多的 Qwen2.5 基础模型相媲美。例如,Qwen3 的 1.7B 到 32B 的 Dense 模型分别能达到 Qwen2.5 的 3B 到 72B Base 模型的水平。对于 MoE 模型,在仅使用约 10% 激活参数的情况下,就能达到与 Qwen2.5 Dense 基础模型相似的性能,显著节省了训练和推理成本。