数据集
2 个数据集
热门分类:
Qwen3-30B-A3B-Thinking-2507 是一个基于 Transformer 的因果语言模型,采用混合专家(MoE)架构,总参数量为 30.5B,每次推理仅激活 3.3B 参数。它原生支持高达 262K 的上下文长度,在逻辑推理、数学、科学、编程等复杂推理任务上表现显著提升,同时指令遵循、工具使用、文本生成等通用能力也有明显增强。该模型默认开启深度思考模式,特别适合处理高复杂度的推理场景。
Qwen/QwQ-32B
已完整同步
QwQ-32B是Qwen系列中的推理模型,拥有32.5B参数,基于Transformer架构,支持最长131,072 tokens的上下文。它经过预训练、监督微调与强化学习,具备深度思考与推理能力,在复杂任务上表现优异,可对标业界领先的推理模型。