Meta研究揭示:字节模型蒸馏的新突破
  • 4076

随着大型模型的蓬勃发展,字节模型在蒸馏后展现出新潜力。Meta的研究团队与华盛顿大学合作,撰写了一篇名为《打破Token瓶颈:复兴字节模型蒸馏》的论文,提出了一个新理念——在蒸馏过程中,能否将学习单位由词元(Token)替换为字节,让学生模型直接学习以字节为基础的概率分布。研究结果表明,这一方法的确可行。

他们通过为每个Token引入结束标记,将教师模型的Token概率分布完整地转变为字节级别的表示。在以Llama 3-8B作为教师模型进行的蒸馏实验中,团队依托缩放定律进行预测,结果显示,随着训练计算量的增加,字节层面的蒸馏有望超越Token层面的蒸馏,且下游任务的平均准确率最高可以提升4个百分点。

about image

传统的蒸馏过程让学生模型学习教师模型在庞大词表上对应Token的概率分布,而字节模型则大幅缩小了可选范围。字节仅有256种基本值,这意味着每个预测位置所需的候选概率显著减少,学习基础单位也因而更加简化,最终模型的表现上限却提升了。这一转变究竟是如何实现的呢?

about image

字节蒸馏这一技术并不新鲜。大模型的能力虽强大,但其在实际应用中的显存占用、计算需求和响应速度都是不小的负担。因此,通常采用一种策略,让大模型作为教师,将所学知识进行蒸馏,以培养更小的学生模型。不同于普通的监督训练仅告知学生“下一个正确Token”,蒸馏过程还要求学生学习教师模型对于候选Token的概率分配。然而,这种方式在Token候选空间庞大时便显得极具挑战性。

以Llama 3-8B为例,其词表包括多达128256个Token。意味着每个预测位置对应数十万个候选概率。如果进行离线蒸馏,保存完整的概率分布会耗费巨资,因此在实际操作中,往往只能保留概率最高的部分,即进行top-k截断。而字节模型恰好通过压缩候选空间来解决这一难题。每个字节是由8位二进制数构成,拥有256种可能性,甚至加上少量特殊符号后,每个位置只需保存两百余种概率,因而完整的分布更容易保存。

然而,教师模型的预测是基于整个Token,而学生模型则是在字节级别进行。为了使两者相互对应,不仅需要将文本进行分割,还需相应地调整教师的概率分布。对此,论文提出了解决方案,分别命名为Marginalize-It和End-Of-Token。这两种方法的基本思路类似:将教师对不同Token的概率逐步拆解到相应字节位置。

以示例中的Tiramisu为例,可能被tokenizer切分成多个Token如T、iram、isu。当教师在预测下一个Token时,候选Token可能包括isu、isk及is。由于这些候选都以字节i开头,因此在预测第一个字节时,可以聚合所有以i开头的候选的概率。随着真实前缀变为i,继续筛选前缀匹配的候选,计算下一个字节的概率。如此重复,就可以将原本的Token分布逐步转换为字节级的训练目标。

Marginalize-It方法直接对概率进行聚合与重新归分配,但在处理长度不一致的Token时,可能会导致信息丢失,尽管其计算效率相对较高。相反,End-Of-Token方法则为Token的结束保留了明确的预测位置。具体而言,在每个Token的末尾加入一个特殊符号,这样即便在长度不同的情况下,后续的候选数量也不会悬空,有了明确的去向。

about image

通过这两种方法,各自只需一次的教师模型前向计算便可实现从Token分布到字节分布的有效转换。至此,教师模型的知识终于可以转移到字节模型上。接下来,值得关注的是,学生模型究竟能吸收多少知识。为此,研究团队设计了包含Token、普通字节、以及带有字节的模型三种表现形式的测试,且每种形式分为监督训练与蒸馏训练,合计形成六个实验组,从而能更全面地评估蒸馏效果及修改学习单位对模型训练表现的影响。