星空人工智能技术网

DistilQwen-ThoughtX:变长思维链推理模型,超越DeepSeek蒸馏模型

 ?作者:蔡文睿(清素)、汪诚愚(熊兮)、严俊冰(玖烛)、黄俊(临在)

前言

近年来,自然语言处理(NLP)领域以大语言模型(LLM)的出现为标志,发生了深刻变革,引领了语言理解、生成和推理任务的进步。其中,进步尤其显著的是深度推理模型的发展,如OpenAI的o1、DeepSeek-R1和QwQ-32B等,它们在数学问题、代码生成等复杂推理任务中表现突出。这些模型的成功很大程度上得益于使用思维链(Chain-of-Thought, CoT)的推理方式,能够模拟人类的渐进思考过程,将复杂问题化繁为简。然而,对于不同的推理任务,使用长思考的推理模式并不能提升模型在所有推理任务上的精度,反而容易引发“过度思考”的问题,既降低了模型响应速度,又导致推理过程中频繁出错。

为了解决这一问题,阿里云星空人工智能平台PAI团队对于思维链的特性,提出了推理冗余度(Reasoning Verbosity, RV)和认知难度(Cognitive Difficulty, CD)分数两种度量方式,并且构建了包括200万思维链的数据集OmniThought,对于OmniThought的每个思维链都进行了标注。基于RV和CD分数,我们可以根据不同的任务和模型底座要求,训练根据任务进行自适应的变长思维链推理模型。因此,基于这一新提出的OmniThought数据集,我们训练并发布了一系列具有更强推理能力、具备最佳思维链长度和难度水平的模型(DistilQwen-ThoughtX系列),这些模型的性能甚至超越借助专有数据集训练的DeepSeek-R1-Distill系列。具体效果的比较见下图。

为了便于社区用户使用DistilQwen-ThoughtX系列模型,以及蒸馏适合自身场景的推理模型,我们在EasyDistill(https://github.com/modelscope/easydistill)的框架中开源了OmniThought的全部数据,以及所有DistilQwen-ThoughtX系列模型的权重。在下文中,我们将介绍OmniThought数据集的构建流程和DistilQwen-ThoughtX系列模型的效果。